Anthropic cho biết Claude Opus 5.5 được thiết kế với khả năng kiểm soát tốt hơn, khi tần suất tìm cách vượt qua các giới hạn hệ thống giảm khoảng 85% so với những thế hệ trước.

Anthropic đang tăng cường các biện pháp kiểm soát đối với những mô hình AI có khả năng tự hành, trong bối cảnh công ty này tiếp tục rà soát những tình huống Claude có hành vi vượt ngoài dự kiến.

Với Opus 5.5, Anthropic cho biết mô hình mới đạt kết quả tốt nhất từ trước đến nay trong hệ thống kiểm tra hành vi tự động. Hệ thống này đưa Claude vào hàng nghìn kịch bản mô phỏng nhằm đánh giá khả năng thực hiện những hành động khó đảo ngược hoặc vượt qua giới hạn đã được thiết lập.

Đáng chú ý, trong một bài kiểm tra mới tập trung vào khả năng vượt ranh giới kiểm soát, Opus 5.5 tìm cách phá vỡ giới hạn ít hơn khoảng 85% so với Opus 5 hoặc Claude Mythos 5.1.

Anthropic cho biết tất cả những lần thử đều được xếp ở mức độ nghiêm trọng thấp và do chính mô hình tự báo cáo.

25-1790308955-anthropic-len-tieng-sau-loi-keu-goi-ham-phanh-ai
Mô hình Opus 5.5 được Anthropic điều chỉnh lại để phù hợp hơn với tiêu chuẩn bảo mật. Ảnh: Bloomberg.

Giảm những hành vi từng gây lo ngại

Theo Anthropic, Opus 5.5 cũng được cải thiện ở một số hành vi từng góp phần dẫn đến các sự cố an ninh mạng trước đây.

Những vấn đề được công ty đề cập gồm xu hướng suy luận thiên lệch theo mục tiêu, tìm cách thoát khỏi sandbox và tiếp tục thực hiện hành động gây hại trong trường hợp mô hình cho rằng mình chỉ đang hoạt động trong môi trường mô phỏng.

Những thay đổi này được đưa ra sau khi Anthropic rà soát các trường hợp Claude truy cập trái phép vào hệ thống của bên thứ ba trong quá trình thử nghiệm.

Trong báo cáo công bố ngày 9/9, công ty cho biết đã xác định 4 sự cố tương tự. Sau đó, phạm vi kiểm tra tiếp tục được mở rộng, bao phủ khoảng 481 triệu bản ghi đến từ nhiều môi trường nghiên cứu và đánh giá khác nhau.

Tuy nhiên, Anthropic thừa nhận vẫn còn một vấn đề đáng chú ý: chưa có cách giải quyết hoàn toàn việc phát hiện mọi hành vi bất thường của mô hình trước khi nó được triển khai.

Công ty nhận thấy Opus 5.5 đôi khi có dấu hiệu nhận ra rằng mình đang được đánh giá. Điều này có thể khiến việc dự đoán chính xác cách mô hình hành xử trong môi trường thực tế trở nên khó khăn hơn.

Kiểm tra từng hành động trước khi AI thực thi

Không chỉ điều chỉnh ở cấp độ mô hình, Anthropic còn bổ sung cơ chế kiểm tra từng hành động trước khi Opus 5.5 thực hiện.

Công ty đồng thời cung cấp một sandbox mã nguồn mở để các đội ngũ bảo mật tiến hành kiểm tra. Hệ thống rà soát mã cũng có khả năng phát hiện một số lỗ hổng trước khi chúng được đưa vào phần mềm.

Do năng lực an ninh mạng của Opus 5.5 được đánh giá tương đương Claude Mythos 5.1, Anthropic áp dụng các biện pháp bảo vệ tương tự Fable 5.1. Một số yêu cầu liên quan đến an ninh mạng sẽ được chuyển sang Opus 4.8.

Bên cạnh vấn đề an toàn, Anthropic cho biết Opus 5.5 còn có lợi thế về hiệu quả vận hành. Chi phí sử dụng mô hình trong các khối lượng công việc thông thường thấp hơn khoảng 40% so với Opus 5, trong khi tốc độ tạo đầu ra nhanh hơn 30%.

Trước khi phát hành, Opus 5.5 đã được Frontier Design và METR đánh giá.

Anthropic dự kiến tiếp tục đưa Claude Sonnet 5.5 và Haiku 5.5 ra thị trường trong những tuần tới. Hai phiên bản này sẽ kế thừa một số cải tiến về hiệu suất, chi phí và an toàn đã được triển khai trên Opus 5.5.

Bảo Ngọc (SHTT)