Các nhà đánh giá độc lập hiện làm việc bên trong Anthropic
Vào ngày 18 tháng 9 năm 2026, Anthropic đã công bố hợp tác với đơn vị Faculty AI của Accenture để đưa các nhà đánh giá độc lập vào bên trong công ty. Không giống như các kiểm toán viên bên ngoài, các nhà đánh giá nhúng có quyền truy cập cấp nhân viên—quan sát các mô hình trong quá trình đào tạo, theo dõi các quyết định triển khai và xác minh các cam kết an toàn từ bên trong. Anthropic và Accenture mỗi bên dự định đầu tư ít nhất 1 tỷ đô la trong vòng 5 năm.
Bắt đầu từ ngày 18 tháng 9 năm 2026, các nhà đánh giá độc lập làm việc bên trong Anthropic—chứ không phải song song với Anthropic. Sự khác biệt đó rất quan trọng. Các kiểm toán viên bên ngoài xem xét các hệ thống AI sau khi sự việc đã xảy ra. Các nhà đánh giá nhúng quan sát các mô hình hình thành trong quá trình đào tạo, theo dõi các quyết định về cách xây dựng và triển khai các mô hình đó, và nói chuyện trực tiếp với nhân viên. Từ vị trí đó, họ có thể xác minh rằng các cam kết an toàn đang được giữ vững và báo cáo những gì họ tìm thấy cho công chúng.
Đối tác đầu tiên là Faculty, đơn vị AI chuyên biệt của Accenture. Công việc của Faculty sẽ bao gồm đánh giá và red-teaming các mô hình Claude, thực hiện các đánh giá căn chỉnh và kiểm tra các biện pháp bảo vệ mô hình. Accenture giúp các doanh nghiệp và chính phủ triển khai AI trên nhiều ngành—kinh nghiệm triển khai thực tế đó định hình cách họ tiếp cận đánh giá an toàn. Cả hai tổ chức dự định đầu tư ít nhất 1 tỷ đô la mỗi bên trong 5 năm tới để xây dựng năng lực trong lĩnh vực này.
Đánh giá nhúng là mới, và các tiêu chuẩn chưa tồn tại. Hiện tại không có quy tắc thống nhất nào về thông tin mà các nhà đánh giá nhúng nên truy cập, cách họ nên báo cáo kết quả, hoặc ai nên tài trợ cho công việc. Anthropic đang tài trợ trực tiếp cho công việc của Accenture hiện tại, trong khi các mô hình tài trợ chung hoặc của chính phủ dài hạn hơn đang được phát triển—như đã được kêu gọi trong Khung AI Nâng cao của Anthropic vào tháng 6. METR và các nhà đánh giá phi lợi nhuận khác cũng đang được thử nghiệm song song dưới nguồn tài trợ riêng của họ. Quan hệ đối tác không độc quyền: Anthropic dự định làm việc với các nhà đánh giá bổ sung, và Accenture có thể làm việc với các nhà phát triển AI khác.
Đối với các nhóm doanh nghiệp sử dụng Claude, đây là cấu trúc trách nhiệm giải trình có thể kiểm tra được. Anthropic có thể tuyên bố rằng Claude an toàn; giờ đây một tổ chức độc lập với quyền truy cập cấp nhân viên có thể xác minh tuyên bố đó. Mục tiêu là một hệ sinh thái các nhà đánh giá làm việc với các tiêu chuẩn chung—không phải một cuộc kiểm toán duy nhất vượt qua hoặc thất bại một mô hình, mà là sự giám sát liên tục được nhúng vào cách AI tiên tiến được xây dựng.
Những điểm chính: Các nhà đánh giá nhúng có quyền truy cập cấp nhân viên—họ quan sát quá trình đào tạo, theo dõi các quyết định và nói chuyện với nhân viên. Faculty (đơn vị AI của Accenture) sẽ bao gồm red-teaming, đánh giá căn chỉnh và kiểm tra biện pháp bảo vệ. Cả hai tổ chức dự định ít nhất 1 tỷ đô la mỗi bên trong 5 năm. Chưa có tiêu chuẩn nào cho đánh giá nhúng; Anthropic đang tài trợ trực tiếp cho Accenture trong khi các mô hình dài hạn hơn phát triển. Quan hệ đối tác không độc quyền, và nhiều nhà đánh giá khác sẽ được công bố.