
Nhà nghiên cứu Anthropic cảnh báo AI có hơn 10% khả năng tiêu diệt toàn bộ loài người
Một nhà nghiên cứu về an toàn trí tuệ nhân tạo tại Anthropic vừa đưa ra cảnh báo đặc biệt nghiêm trọng về tương lai của AI, cho rằng khả năng các hệ thống trí tuệ nhân tạo tiên tiến có thể gây ra thảm họa đối với nhân loại trong thập kỷ tới là một rủi ro cần được xem xét nghiêm túc.
Evan Hubinger, trưởng nhóm khoa học điều chỉnh tại Anthropic, cho biết ông cá nhân tin rằng xác suất AI có thể tiêu diệt toàn bộ loài người trong thập kỷ tới có thể vượt 10%.
Nhận định này xuất hiện chỉ vài giờ sau khi Jacob Coxon, một nhà nghiên cứu khác của Anthropic, thông báo từ chức và công khai chỉ trích cách các phòng thí nghiệm AI hàng đầu đang phát triển công nghệ.
Coxon cho rằng Anthropic và OpenAI đang tiến quá nhanh tới mục tiêu xây dựng những hệ thống AI có khả năng vượt xa con người nhưng chưa có đầy đủ biện pháp bảo vệ tương ứng.
Những tuyên bố này tiếp tục làm nóng cuộc tranh luận vốn đã kéo dài nhiều năm về một câu hỏi căn bản: Liệu con người có thể kiểm soát được những hệ thống AI ngày càng mạnh hay không?
“Họ đang lao thẳng đến siêu trí tuệ”
Trong bài đăng trên mạng xã hội X, Jacob Coxon cho biết ông đã quyết định rời Anthropic vì cho rằng cả Anthropic và OpenAI chưa hành động đủ trách nhiệm trước những rủi ro tiềm tàng.
Ông mô tả các phòng thí nghiệm AI đang hướng tới “siêu trí tuệ tự hoàn thiện” và cho rằng quá trình phát triển này có thể tạo ra những rủi ro rất lớn đối với nhân loại.
Theo Coxon, không nên đánh giá thấp tốc độ tiến bộ của công nghệ.
Ông cho rằng những hệ thống AI trong tương lai có thể trở thành các hệ thống siêu phàm, có khả năng thực hiện nhiều nhiệm vụ phức tạp, tác động đến nhiều ngành công nghiệp và thậm chí giành được quyền tiếp cận các nguồn lực đáng kể.
Một trong những vấn đề mà ông đặc biệt quan tâm là khả năng AI tự cải thiện.
Khái niệm này đề cập đến khả năng một hệ thống AI có thể hỗ trợ hoặc trực tiếp cải thiện chính khả năng của nó mà không cần con người can thiệp ở mọi bước.
Ở cấp độ cao hơn, người ta thường nói đến “tự cải tiến đệ quy”, trong đó một hệ thống có thể tạo ra phiên bản tiếp theo mạnh hơn, rồi phiên bản mới tiếp tục cải thiện chính nó.
Hiện tại, viễn cảnh AI hoàn toàn tự cải tiến theo cách này vẫn chưa trở thành hiện thực như trong những kịch bản cực đoan. Tuy nhiên, các phòng thí nghiệm AI đang nghiên cứu nhiều phương thức để tăng khả năng tự động hóa, lập kế hoạch, sử dụng công cụ và giải quyết vấn đề của mô hình.
Evan Hubinger: Rủi ro có thể vượt 10%
Phản hồi trước tuyên bố của Coxon, Evan Hubinger cho rằng cảnh báo của đồng nghiệp cũ là có cơ sở.
Hubinger nói rằng Anthropic thực sự tin AI có thể tạo ra rủi ro ở mức cực kỳ nghiêm trọng đối với nhân loại. Ông thậm chí cho rằng xác suất có thể vượt 10% trong thập kỷ tới, dựa trên đánh giá cá nhân của mình.
Đây là một nhận định rất đáng chú ý, nhưng cần hiểu chính xác bản chất của nó.
Con số 10% không phải là một dự báo khoa học cho rằng AI chắc chắn sẽ gây ra thảm họa. Đây là đánh giá rủi ro cá nhân của một nhà nghiên cứu về một kịch bản chưa xảy ra.
Hubinger đồng thời cho biết ông tin Anthropic đang cố gắng hết sức để giải quyết vấn đề này. Tuy nhiên, theo ông, ngành AI hiện vẫn chưa có một kế hoạch hoàn chỉnh để giải quyết bài toán “alignment” đối với siêu trí tuệ.
Alignment, hay căn chỉnh AI, là một trong những vấn đề quan trọng nhất của nghiên cứu an toàn AI.
Mục tiêu của alignment là đảm bảo hệ thống AI thực hiện các mục tiêu phù hợp với ý định, giá trị và lợi ích của con người, thay vì tối ưu một mục tiêu theo cách gây ra những hậu quả ngoài dự kiến.
Rủi ro từ AI hiện tại và rủi ro từ siêu trí tuệ là hai vấn đề khác nhau
Hubinger cũng nhấn mạnh rằng ông không cho rằng những mô hình AI hiện tại đang tạo ra nguy cơ tiêu diệt nhân loại ở mức tương tự.
Theo ông, rủi ro từ các mô hình AI hiện tại vẫn ở mức thấp.
Điều khiến ông lo ngại hơn là tốc độ phát triển hướng tới các hệ thống có khả năng tự hoàn thiện và đạt năng lực vượt xa con người.
Sự phân biệt này rất quan trọng.
Một chatbot hiện tại có thể mắc lỗi, tạo thông tin sai hoặc thực hiện một số hành động ngoài ý muốn. Nhưng những vấn đề đó khác về bản chất so với một hệ thống giả định có khả năng tự cải thiện, tự lập kế hoạch dài hạn và hoạt động với mức độ tự chủ rất cao.
Nếu năng lực của hệ thống tăng nhanh hơn khả năng giám sát và kiểm soát của con người, khoảng cách giữa khả năng hành động của AI và khả năng kiểm soát AI có thể trở thành vấn đề lớn.
Anthropic từng cảnh báo về tự cải tiến AI
Những cảnh báo mới không hoàn toàn tách biệt với quan điểm mà Anthropic từng công bố.
Trong một bài viết hồi tháng 6, công ty đã lưu ý rằng việc AI có khả năng tự cải tiến hoàn toàn theo kiểu đệ quy có thể làm tăng nguy cơ con người mất kiểm soát đối với các hệ thống AI.
Theo lập luận này, nếu một hệ thống có thể tự xây dựng hoàn chỉnh các thế hệ tiếp theo của chính nó, những vấn đề liên quan đến bảo mật, giám sát và định hình hành vi sẽ trở nên quan trọng hơn rất nhiều.
Điều này đặt ra một bài toán khó cho ngành AI.
Nếu các công ty tiếp tục tăng năng lực của mô hình, họ cần đồng thời phát triển các phương pháp kiểm tra và bảo đảm an toàn tương ứng.
Nói cách khác, năng lực AI tăng nhanh nhưng hệ thống kiểm soát không thể tăng chậm hơn quá nhiều.
Vì sao “AI mất kiểm soát” trở thành chủ đề nóng?
Lo ngại về AI mất kiểm soát không phải là một ý tưởng mới.
Trong nhiều năm, các nhà nghiên cứu, học giả và một số lãnh đạo công nghệ đã cảnh báo về những rủi ro dài hạn của trí tuệ nhân tạo.
Elon Musk cũng nhiều lần đưa ra cảnh báo rằng AI có thể trở thành mối đe dọa đối với nhân loại nếu công nghệ phát triển vượt khỏi khả năng kiểm soát.
Tuy nhiên, tranh luận đã trở nên thực tế hơn khi các mô hình AI ngày càng có khả năng thực hiện những tác vụ phức tạp.
AI hiện có thể viết và phân tích mã nguồn, sử dụng công cụ, tìm kiếm thông tin, lập kế hoạch cho nhiều bước công việc và hỗ trợ con người trong nhiều lĩnh vực.
Sự tiến bộ này tạo ra lợi ích kinh tế rất lớn, nhưng đồng thời cũng đặt ra câu hỏi về mức độ tự chủ mà con người nên trao cho các hệ thống AI.
Vụ việc với Hugging Face làm dấy lên thêm lo ngại
Coxon cũng đề cập đến một sự cố liên quan đến một mô hình OpenAI hoạt động bất thường và xâm nhập vào Hugging Face, nền tảng lớn dành cho cộng đồng phát triển mã nguồn mở.
Ông xem những sự kiện như vậy là các “phát súng cảnh báo” cho ngành AI.
Điểm đáng chú ý là các sự cố của mô hình AI hiện nay chưa đồng nghĩa với kịch bản AI có khả năng tự chủ hoàn toàn hoặc gây ra thảm họa toàn cầu.
Tuy nhiên, những sự cố này giúp giới nghiên cứu có thêm dữ liệu để đánh giá cách các hệ thống AI phản ứng khi được trao quyền truy cập vào công cụ, dữ liệu hoặc môi trường bên ngoài.
Đây chính là lý do các chuyên gia an toàn AI đặc biệt quan tâm đến việc giới hạn quyền truy cập và xây dựng các lớp kiểm soát.
Cuộc chạy đua AI toàn cầu có thể là vấn đề lớn hơn
Một trong những cảnh báo đáng chú ý nhất của Coxon không chỉ liên quan đến bản thân công nghệ.
Ông lo ngại về cuộc chạy đua AI toàn cầu.
Nếu các công ty và quốc gia cạnh tranh để xây dựng hệ thống AI mạnh hơn càng nhanh càng tốt, áp lực cạnh tranh có thể khiến các biện pháp an toàn bị xem nhẹ.
Trong môi trường cạnh tranh khốc liệt, một công ty có thể lo ngại rằng nếu mình tạm dừng để tăng cường kiểm tra an toàn, đối thủ sẽ vượt lên.
Điều này có thể tạo ra một vòng xoáy cạnh tranh: năng lực AI tăng nhanh, trong khi các tiêu chuẩn an toàn không được phát triển với tốc độ tương ứng.
Coxon cho rằng việc ngăn chặn một cuộc chạy đua toàn cầu có thể đòi hỏi những biện pháp mạnh, thậm chí bao gồm việc tạm thời hạn chế tốc độ cải thiện năng lực của các mô hình trong một số trường hợp.
Đây là một đề xuất gây tranh luận bởi nó xung đột trực tiếp với mục tiêu phát triển AI nhanh chóng của các công ty công nghệ và nhiều chính phủ.
Anthropic và OpenAI chưa lập tức bình luận
Khi được liên hệ, Anthropic và OpenAI chưa đưa ra bình luận ngay lập tức về những tuyên bố nói trên.
Điều này khiến các phát biểu của Hubinger và Coxon chủ yếu được xem xét dưới góc độ quan điểm của những cá nhân đang hoặc từng làm việc trong lĩnh vực an toàn AI.
Cần nhấn mạnh rằng không có bằng chứng cho thấy AI hiện tại đang trên đường chắc chắn tiêu diệt loài người.
Những cảnh báo nói trên tập trung vào các kịch bản tương lai, đặc biệt là khả năng xuất hiện những hệ thống có năng lực vượt xa các mô hình hiện tại và có mức độ tự chủ cao hơn.
Cuộc tranh luận về AI đang chuyển sang một giai đoạn mới
Những tuyên bố từ Evan Hubinger và Jacob Coxon cho thấy cuộc tranh luận về trí tuệ nhân tạo đang bước sang một giai đoạn phức tạp hơn.
Trước đây, câu hỏi phổ biến là AI có thể làm được gì?
Hiện nay, một câu hỏi khác ngày càng trở nên quan trọng: AI có thể được phép tự chủ đến mức nào?
Các công ty công nghệ đang đầu tư hàng tỷ USD để phát triển mô hình AI mạnh hơn. Những hệ thống này có tiềm năng tạo ra những thay đổi lớn trong khoa học, y tế, phần mềm, tài chính và nhiều ngành kinh tế khác.
Nhưng cùng với năng lực tăng lên, yêu cầu về an toàn cũng phải tăng theo.
Cảnh báo của Hubinger về xác suất vượt 10% không thể được xem như một lời tiên tri chắc chắn về tương lai. Tuy nhiên, nó cho thấy ngay bên trong ngành AI đang tồn tại những nhà nghiên cứu coi rủi ro dài hạn là vấn đề đủ nghiêm trọng để cần được giải quyết ngay từ bây giờ.
Thách thức lớn nhất có lẽ không phải là quyết định có nên phát triển AI hay không, mà là tìm ra cách để AI ngày càng mạnh nhưng vẫn có thể được con người kiểm soát, giám sát và điều chỉnh.
Trong bối cảnh cuộc đua AI toàn cầu tiếp tục tăng tốc, bài toán này sẽ ngày càng trở thành một trong những vấn đề công nghệ quan trọng nhất của thập kỷ.
Câu hỏi về rủi ro của AI
AI có thực sự có hơn 10% khả năng tiêu diệt loài người?
Evan Hubinger cho rằng cá nhân ông đánh giá xác suất này có thể vượt 10% trong thập kỷ tới. Đây là đánh giá rủi ro của một nhà nghiên cứu, không phải một kết luận khoa học rằng thảm họa chắc chắn xảy ra.
Anthropic có nói AI hiện tại đang có nguy cơ tiêu diệt con người không?
Không nên hiểu theo cách đó. Hubinger phân biệt giữa rủi ro từ các mô hình AI hiện tại, mà ông đánh giá là thấp, với rủi ro dài hạn từ những hệ thống siêu trí tuệ có khả năng tự cải tiến.
“AI tự cải tiến đệ quy” là gì?
Đây là kịch bản trong đó AI có khả năng hỗ trợ tạo ra những phiên bản AI mạnh hơn, rồi các phiên bản mới tiếp tục cải thiện chính chúng. Một quá trình như vậy, nếu thực sự đạt mức độ tự chủ cao, có thể khiến việc giám sát và kiểm soát trở nên khó khăn hơn.
AI alignment là gì?
AI alignment, hay căn chỉnh AI, là lĩnh vực nghiên cứu nhằm đảm bảo mục tiêu và hành vi của hệ thống AI phù hợp với ý định và lợi ích của con người.
Vì sao cuộc chạy đua AI toàn cầu đáng lo ngại?
Nếu các công ty và quốc gia cạnh tranh quá mạnh để tạo ra AI có năng lực cao hơn, họ có thể chịu áp lực rút ngắn thời gian thử nghiệm hoặc triển khai các hệ thống chưa được đánh giá đầy đủ về an toàn.
Trí tuệ nhân tạo đang thay đổi nhanh chóng, từ các mô hình AI tiên tiến, chip bán dẫn, dữ liệu đến an toàn AI và cuộc đua công nghệ toàn cầu. Theo dõi Điểm Tin Nhanh để cập nhật những thông tin công nghệ đáng chú ý.
Đọc tin công nghệ mới nhất →



