
Anthropic chọn Accenture làm đơn vị đánh giá AI nội bộ đầu tiên, triển khai kế hoạch giảm tốc của Dario Amodei
Anthropic đang biến lời kêu gọi làm chậm tốc độ phát triển trí tuệ nhân tạo (AI) thành một chương trình cụ thể khi lựa chọn Accenture làm đối tác đánh giá độc lập đầu tiên được triển khai theo mô hình “đánh giá nhúng” bên trong công ty.
Theo thông báo ngày 18/9, bộ phận AI chuyên biệt Faculty của Accenture sẽ tham gia đánh giá và kiểm thử các mô hình AI tiên tiến của Anthropic, bao gồm hoạt động red-team, kiểm tra biện pháp bảo vệ và đánh giá mức độ phù hợp của mô hình với các nguyên tắc an toàn. Anthropic và Accenture mỗi bên dự kiến đầu tư ít nhất 1 tỷ USD trong 5 năm để xây dựng năng lực đánh giá trong lĩnh vực này.
Đây được xem là bước triển khai cụ thể đầu tiên sau khi CEO Anthropic Dario Amodei công bố kế hoạch ba bước nhằm “pace the frontier” – tức điều chỉnh tốc độ tiến bộ của các mô hình AI tiên tiến để có thêm thời gian phát triển các biện pháp an toàn tương ứng.
Anthropic đưa Accenture vào bên trong quy trình phát triển AI
Điểm đáng chú ý trong thỏa thuận mới không đơn thuần là thuê một công ty tư vấn bên ngoài thực hiện một cuộc kiểm toán độc lập.
Anthropic muốn triển khai mô hình được gọi là embedded evaluation, trong đó các chuyên gia đánh giá bên thứ ba làm việc bên trong công ty với mức độ tiếp cận tương tự nhân viên.
Theo Anthropic, cách tiếp cận này cho phép các chuyên gia đánh giá quan sát quá trình mô hình được xây dựng ngay từ giai đoạn đào tạo, theo dõi các quyết định liên quan đến cách mô hình được phát triển và triển khai, đồng thời trao đổi trực tiếp với nhân viên Anthropic.
Đội ngũ của Faculty, bộ phận AI chuyên biệt thuộc Accenture, sẽ tập trung vào một số nhiệm vụ chính như:
- Đánh giá các mô hình AI tiên tiến.
- Thực hiện các bài kiểm thử red-team.
- Kiểm tra các biện pháp bảo vệ của mô hình.
- Đánh giá mức độ phù hợp và an toàn của hệ thống.
- Theo dõi việc Anthropic thực hiện các cam kết về an toàn.
- Xác định những điểm mù trong quy trình phát triển AI.
- Hỗ trợ phát hiện và báo cáo các sự cố liên quan đến mô hình.
Anthropic nhấn mạnh rằng các chuyên gia đánh giá độc lập không thay thế trách nhiệm của công ty đối với an toàn sản phẩm. Thay vào đó, mục tiêu là khiến những cam kết về an toàn có thể được kiểm chứng từ bên ngoài, thay vì chỉ dựa trên đánh giá nội bộ.
Accenture và Anthropic cùng đầu tư ít nhất 2 tỷ USD
Quy mô tài chính của chương trình cũng gây chú ý.
Anthropic cho biết cả Anthropic và Accenture đều dự kiến đầu tư ít nhất 1 tỷ USD trong vòng 5 năm để xây dựng năng lực đánh giá AI.
Như vậy, tổng cam kết tối thiểu từ hai bên lên tới khoảng 2 tỷ USD trong 5 năm. Reuters cho biết chương trình này nhằm xây dựng năng lực đánh giá độc lập đối với các mô hình AI tiên tiến trong bối cảnh những lo ngại về an toàn AI ngày càng gia tăng.
Tuy nhiên, Anthropic cho biết do tính cấp bách của công việc, công ty sẽ tài trợ trực tiếp cho hoạt động của Accenture ở giai đoạn hiện tại.
Đây là một điểm đáng chú ý bởi Anthropic đồng thời thừa nhận rằng thị trường hiện chưa có một cơ chế tài trợ chung đủ lớn cho hoạt động đánh giá độc lập AI.
Về lâu dài, công ty muốn nguồn kinh phí cho hoạt động này đến từ các nguồn chung hoặc chính phủ, tương tự đề xuất trong Advanced AI Framework mà Anthropic đưa ra hồi tháng 6.
Trong thời gian chờ một cơ chế như vậy hình thành, Anthropic cho biết sẽ hợp tác với nhiều tổ chức đánh giá theo những hình thức tài trợ khác nhau.
Đây là bước đầu tiên trong kế hoạch 3 bước của Dario Amodei
Thỏa thuận với Accenture xuất hiện chỉ vài ngày sau khi Dario Amodei công bố bài viết kêu gọi ngành AI giảm tốc độ phát triển các mô hình tiên tiến.
Trong bài viết “We Must Pace the Frontier”, CEO Anthropic lập luận rằng tốc độ cải thiện năng lực AI cần được điều chỉnh để các biện pháp an toàn, kiểm soát và đánh giá có đủ thời gian theo kịp.
Amodei không đề xuất dừng hoàn toàn việc nghiên cứu hoặc huấn luyện AI. Thay vào đó, ông đưa ra một khung ba bước nhằm tạo thêm thời gian cho việc đánh giá rủi ro và xây dựng các cơ chế kiểm soát.
Bước 1: Đánh giá viên độc lập làm việc bên trong các phòng thí nghiệm AI
Đây là phần đang được Anthropic triển khai cụ thể nhất.
Các phòng thí nghiệm AI tiên tiến sẽ cho phép những đơn vị đánh giá độc lập có quyền tiếp cận tương tự nhân viên để:
- Kiểm tra các biện pháp an toàn.
- Theo dõi quy trình phát triển mô hình.
- Đánh giá hành vi của AI.
- Báo cáo sự cố.
- Kiểm tra mức độ tuân thủ các cam kết an toàn.
- Đánh giá mô hình ngay trong quá trình đào tạo và triển khai.
Anthropic hiện đã lựa chọn Accenture và cho biết đang tiếp tục trao đổi với METR cùng các đơn vị đánh giá khác.
Bước 2: Tăng cường phối hợp giữa các công ty AI
Bước thứ hai trong đề xuất của Amodei hướng tới sự phối hợp giữa các công ty AI tiên tiến tại các quốc gia dân chủ.
Mục tiêu là xây dựng các tiêu chuẩn an toàn chung và tìm kiếm cơ chế để hạn chế tình trạng các công ty liên tục chạy đua nâng cao năng lực AI mà không có đủ thời gian để kiểm tra những rủi ro đi kèm.
Theo đề xuất của Amodei, một số hình thức phối hợp có thể gặp những thách thức về pháp lý và cạnh tranh, do đó cần có sự hỗ trợ từ chính phủ.
Đây cũng là phần khó triển khai hơn nhiều so với việc một công ty tự nguyện thay đổi quy trình nội bộ.
Bước 3: Hướng tới phối hợp quốc tế
Bước thứ ba mở rộng phạm vi từ ngành công nghiệp AI sang cấp độ quốc tế.
Amodei đề xuất các chính phủ dân chủ tìm kiếm khả năng phối hợp với những quốc gia có hệ thống chính trị khác biệt, trong đó có cả những vấn đề liên quan đến khả năng kiểm chứng việc tuân thủ.
Mục tiêu cuối cùng là giảm nguy cơ cuộc đua AI diễn ra mà không có các giới hạn hoặc tiêu chuẩn an toàn tương ứng.
Đây là phần có phạm vi rộng và phức tạp nhất trong kế hoạch của Amodei, bởi nó không chỉ liên quan đến công nghệ mà còn đến cạnh tranh quốc gia, an ninh, kinh tế và khả năng hợp tác quốc tế.
Vì sao “đánh giá nhúng” được xem là khác biệt?
Các công ty AI hiện nay vốn đã sử dụng nhiều hình thức kiểm thử và đánh giá mô hình.
Tuy nhiên, mô hình đánh giá truyền thống thường diễn ra ở bên ngoài tổ chức. Một đơn vị độc lập có thể nhận một phiên bản mô hình, tiến hành kiểm thử và sau đó đưa ra báo cáo.
Anthropic cho rằng mô hình embedded evaluation có thể cung cấp một góc nhìn sâu hơn.
Khi làm việc trực tiếp trong công ty, chuyên gia đánh giá có thể quan sát:
Mô hình được xây dựng như thế nào → quyết định an toàn được đưa ra ra sao → hệ thống được kiểm thử thế nào → mô hình được triển khai thế nào → sự cố được xử lý ra sao.
Điều này có thể giúp người đánh giá phát hiện những vấn đề mà một cuộc kiểm thử chỉ dựa trên sản phẩm cuối cùng khó nhận ra.
Anthropic cho biết các chuyên gia đánh giá nhúng sẽ có quyền tiếp cận các quy trình, hệ thống và dữ liệu nội bộ ở mức tương đương với các nhóm đánh giá rủi ro bên trong công ty.
Anthropic vẫn chịu trách nhiệm cuối cùng về an toàn
Một vấn đề quan trọng được Anthropic nhấn mạnh là việc đưa bên thứ ba vào công ty không đồng nghĩa chuyển trách nhiệm an toàn sang cho bên đánh giá.
Công ty vẫn chịu trách nhiệm về an toàn của các mô hình và sản phẩm do mình phát triển.
Vai trò của Accenture là cung cấp một lớp đánh giá độc lập hơn, qua đó kiểm tra xem các quy trình an toàn có thực sự được thực hiện như cam kết hay không.
Anthropic cho rằng cơ chế này cũng có thể giúp công chúng có thêm thông tin về những lợi ích và rủi ro của AI, thay vì chỉ dựa vào những tuyên bố từ chính các phòng thí nghiệm phát triển mô hình.
Quan hệ đối tác với Accenture không độc quyền
Anthropic cũng nhấn mạnh rằng Accenture không phải đơn vị đánh giá duy nhất.
Công ty đang trao đổi với METR, một tổ chức phi lợi nhuận chuyên nghiên cứu và đánh giá khả năng của các hệ thống AI, đồng thời cho biết sẽ làm việc với nhiều tổ chức khác trong thời gian tới.
Mô hình hợp tác không độc quyền được xem là yếu tố quan trọng.
Nếu chỉ có một đơn vị duy nhất đánh giá một phòng thí nghiệm AI, phạm vi kiểm chứng có thể bị giới hạn. Ngược lại, việc có nhiều tổ chức với phương pháp và chuyên môn khác nhau có thể tạo ra nhiều lớp đánh giá.
Anthropic cho biết họ kỳ vọng các phòng thí nghiệm AI tiên tiến sẽ làm việc với nhiều tổ chức đánh giá cùng lúc và Accenture cũng có thể cung cấp dịch vụ tương tự cho những nhà phát triển AI khác.
Ngành AI đang chịu áp lực lớn hơn về vấn đề an toàn
Quyết định của Anthropic diễn ra trong bối cảnh vấn đề an toàn AI ngày càng được chú ý.
Dario Amodei cho rằng tốc độ phát triển năng lực AI đang đặt ra những câu hỏi mà các biện pháp an toàn cần có thời gian để giải quyết.
Bài viết của ông đã thu hút phản hồi từ nhiều lãnh đạo trong ngành. CEO OpenAI Sam Altman công khai đồng tình với ý tưởng về các đơn vị đánh giá độc lập có quyền tiếp cận tương tự nhân viên và cho biết OpenAI cũng sẽ thực hiện theo hướng này.
Google DeepMind và Elon Musk cũng được đưa vào cuộc tranh luận rộng hơn về cách cân bằng giữa tốc độ đổi mới và an toàn AI. Tuy nhiên, trong ngành vẫn tồn tại những quan điểm khác nhau về mức độ cần thiết của việc giảm tốc độ phát triển.
Điều này cho thấy vấn đề hiện nay không đơn giản là “phát triển AI nhanh hay chậm”, mà còn là ai sẽ đánh giá mức độ an toàn, đánh giá bằng tiêu chuẩn nào và ai có quyền tiếp cận dữ liệu cần thiết để xác minh kết quả.
Những câu hỏi về tính độc lập vẫn còn bỏ ngỏ
Dù Anthropic gọi Accenture là đối tác đánh giá độc lập, mô hình mới vẫn đặt ra nhiều câu hỏi về cách đảm bảo tính độc lập trên thực tế.
Anthropic là bên tài trợ trực tiếp cho công việc của Accenture trong giai đoạn hiện tại. Đồng thời, các chuyên gia đánh giá sẽ làm việc ngay bên trong chính công ty mà họ đang đánh giá.
Đây là một mô hình tương đối mới.
Anthropic thừa nhận rằng hiện chưa có tiêu chuẩn thống nhất về lượng thông tin mà các chuyên gia đánh giá nhúng phải được tiếp cận hoặc cách họ cần báo cáo những phát hiện của mình. Hệ thống tài trợ độc lập cho hoạt động đánh giá cũng chưa được thiết lập hoàn chỉnh.
Do đó, hiệu quả thực tế của mô hình sẽ phụ thuộc đáng kể vào quyền tiếp cận, phạm vi đánh giá, khả năng báo cáo sự cố và mức độ minh bạch của kết quả.
Anthropic đang chuẩn bị cho một mô hình giám sát AI mới?
Thông báo hợp tác với Accenture cho thấy Anthropic muốn chuyển từ việc tuyên bố cam kết an toàn sang xây dựng một cơ chế cho phép những cam kết đó được kiểm chứng.
Đây là khác biệt quan trọng.
Một công ty có thể công bố chính sách an toàn, nhưng câu hỏi tiếp theo sẽ là: ai kiểm tra việc chính sách đó có được thực hiện hay không?
Mô hình đánh giá nhúng cố gắng trả lời câu hỏi này bằng cách đưa người đánh giá vào gần hơn với quy trình phát triển thực tế.
Anthropic hiện cũng đang công bố một số dữ liệu về tốc độ phát triển AI và cho biết muốn các chuyên gia đánh giá độc lập theo dõi các chỉ số liên quan đến quá trình xây dựng mô hình.
Nếu mô hình này được mở rộng sang nhiều phòng thí nghiệm AI, nó có thể tạo ra một lớp giám sát mới nằm giữa tự kiểm soát của doanh nghiệp và quy định chính thức của chính phủ.
Thách thức lớn nhất sẽ nằm ở giai đoạn triển khai
Về lý thuyết, việc có một bên thứ ba làm việc bên trong công ty có thể tăng khả năng phát hiện sớm những vấn đề liên quan đến an toàn.
Nhưng hiệu quả thực tế sẽ phụ thuộc vào nhiều yếu tố.
Đơn vị đánh giá cần có quyền tiếp cận đủ sâu. Họ cần có khả năng xem xét những quy trình quan trọng thay vì chỉ kiểm tra sản phẩm cuối cùng. Đồng thời, cần có quy tắc rõ ràng về việc họ có thể công bố những phát hiện nào và những thông tin nào phải được bảo mật vì lý do an ninh hoặc pháp lý.
Anthropic cho biết phương pháp này vẫn đang trong quá trình hình thành và sẽ được điều chỉnh khi lĩnh vực AI trưởng thành hơn. Công ty dự kiến công bố thêm thông tin khi công việc với Accenture bắt đầu và khi có thêm các đơn vị đánh giá tham gia.
Anthropic lựa chọn Accenture làm đối tác đánh giá AI nhúng đầu tiên đánh dấu một bước chuyển từ đề xuất chính sách sang triển khai thực tế trong cuộc tranh luận về tốc độ phát triển trí tuệ nhân tạo.
Điểm đáng chú ý nhất không chỉ nằm ở khoản đầu tư tối thiểu 2 tỷ USD từ Anthropic và Accenture trong 5 năm, mà còn ở mô hình đánh giá mới: các chuyên gia độc lập sẽ làm việc bên trong phòng thí nghiệm AI và có mức độ tiếp cận gần với nhân viên nội bộ.
Động thái này là bước đầu tiên trong kế hoạch ba bước mà Dario Amodei đưa ra nhằm “pace the frontier”. Bước tiếp theo đòi hỏi sự phối hợp giữa các công ty AI, trong khi bước thứ ba mở rộng sang hợp tác quốc tế.
Tuy nhiên, mô hình đánh giá nhúng vẫn còn nhiều vấn đề cần được hoàn thiện, từ tiêu chuẩn tiếp cận dữ liệu, phương thức báo cáo cho tới cơ chế tài trợ và bảo đảm tính độc lập. Chính Anthropic cũng thừa nhận hiện chưa có một hệ thống thống nhất cho những vấn đề này.
Trong thời gian tới, hiệu quả của chương trình Accenture sẽ phụ thuộc vào cách các chuyên gia đánh giá được trao quyền, mức độ minh bạch của kết quả và khả năng mở rộng mô hình sang nhiều phòng thí nghiệm AI khác.
Nếu được triển khai đúng mục tiêu, embedded evaluation có thể trở thành một lớp kiểm chứng mới trong quá trình phát triển AI tiên tiến, bổ sung cho các biện pháp an toàn nội bộ và những quy định được xây dựng ở cấp chính sách.
Câu hỏi về Anthropic
Anthropic đã chọn công ty nào làm đơn vị đánh giá AI đầu tiên?
Anthropic đã hợp tác với Accenture, trong đó bộ phận AI chuyên biệt Faculty của Accenture sẽ dẫn dắt hoạt động đánh giá. Công việc bao gồm kiểm thử mô hình, red-team, đánh giá alignment và kiểm tra các biện pháp bảo vệ.
Anthropic và Accenture sẽ đầu tư bao nhiêu tiền?
Mỗi bên dự kiến đầu tư ít nhất 1 tỷ USD trong 5 năm, tương đương tổng cam kết tối thiểu khoảng 2 tỷ USD để xây dựng năng lực đánh giá AI.
“Embedded evaluator” nghĩa là gì?
Đây là mô hình trong đó chuyên gia đánh giá độc lập làm việc bên trong phòng thí nghiệm AI với quyền tiếp cận tương tự nhân viên. Họ có thể theo dõi quy trình phát triển mô hình, kiểm tra biện pháp an toàn, đánh giá hành vi của AI và báo cáo các sự cố.
Accenture có phải đơn vị đánh giá duy nhất của Anthropic không?
Không. Quan hệ hợp tác không độc quyền. Anthropic cho biết họ đang trao đổi với METR và các đơn vị đánh giá phi lợi nhuận hoặc bên thứ ba khác.
Dario Amodei có đề xuất dừng phát triển AI hoàn toàn không?
Không. Đề xuất của Amodei tập trung vào việc điều chỉnh tốc độ phát triển các mô hình AI tiên tiến, để các biện pháp an toàn có thêm thời gian theo kịp. Kế hoạch gồm ba hướng: đánh giá độc lập nhúng, phối hợp giữa các công ty AI tại các quốc gia dân chủ và tăng cường phối hợp quốc tế.
Cập nhật nhanh những diễn biến mới nhất của AI và công nghệ
AI đang phát triển với tốc độ nhanh, kéo theo những thay đổi lớn về công nghệ, kinh tế, doanh nghiệp và đời sống. Theo dõi Điểm Tin Nhanh để cập nhật các tin tức AI, công nghệ, tài chính và những xu hướng mới đáng chú ý.





