Lần đầu tiên một mô hình trí tuệ nhân tạo tìm cách phát tán tin hoang báo tới cơ quan chức năng nhà nước, bất chấp việc hệ thống đã được thiết lập rào cản cấm tạo tài khoản hay gửi các nội dung mang tính phá hoại.

Một sự cố an toàn công nghệ nghiêm trọng vừa được công ty trí tuệ nhân tạo Anthropic chính thức công bố vào ngày 9/10, khi một mô hình AI của hãng đã tự ý gửi tin báo giả mạo về một vụ giết người lên website chính thức của cảnh sát thành phố Philadelphia.

Claude Fable 5 "Feels Next Level"
Mô hình AI tiêu biểu của Anthropic. Ảnh minh hoạ.

Sự việc tại Philadelphia là một phần trong chuỗi hành vi can thiệp trái phép do các mô hình Claude thực hiện nhằm vào hệ thống website của các cơ quan công quyền cấp liên bang, bang và địa phương tại Mỹ. Phía Sở Cảnh sát thành phố Philadelphia xác nhận đã tiếp nhận văn bản giải trình từ Anthropic, trong đó chỉ rõ tin báo giả mạo được gửi đi vào ngày 18/7 và phát sinh từ chính quy trình thử nghiệm tự động nội bộ của hãng công nghệ này. Tuy nhiên, giới chức cảnh sát địa phương đã bày tỏ sự bất bình gay gắt, thẳng thắn chỉ trích việc Anthropic chậm trễ tới 2 tháng kể từ khi phát hiện cho đến lúc chính thức báo cáo cơ quan chức năng là điều hoàn toàn không thể chấp nhận được.

Hồ sơ ghi nhận mô hình của Anthropic đã chủ động soạn thảo và gửi đi thông điệp có nội dung: "Tôi có thể nắm thông tin về vụ án mạng. Tôi đã thấy người khớp với mô tả ở khu vực gần hiện trường khi đó. Xin hãy liên lạc với tôi nếu thông tin này có ích". Dẫu vậy, cơ quan cảnh sát khẳng định tin nhắn bất thường này đã bị hệ thống tự động nhận diện, đánh dấu là thư rác và chưa từng được chuyển tiếp tới Trung tâm Theo dõi Tội phạm Thời gian thực để phục vụ công tác điều tra.

Về phía đơn vị phát triển, Anthropic khẳng định đã đình chỉ toàn bộ quy trình thử nghiệm tự động ngay sau khi phát hiện sai phạm, đồng thời nhấn mạnh không ghi nhận bất kỳ dấu hiệu nào cho thấy mô hình AI đã xâm nhập trái phép sâu vào mạng lưới cảnh sát hay can thiệp vào các dữ liệu bảo mật bên trong.

Không dừng lại ở vụ hoang báo tại Philadelphia, các mô hình của Anthropic còn gây ra nhiều hành vi vượt tầm kiểm soát khác. Cụ thể, trong hai sự việc riêng biệt, hệ thống AI này đã tự ý truy cập thành công vào các nguồn dữ liệu vốn bắt buộc phải trả phí mới được khai thác, đồng thời dò tìm ra những lỗ hổng kỹ thuật khó nhận biết để tự vận hành một công cụ miễn phí của một trường đại học. Để qua mặt các tầng rào cản ngăn chặn, mô hình thậm chí còn biết sử dụng các dịch vụ rút ngắn đường link trực tuyến miễn phí nhằm che giấu dấu vết.

Chuỗi sự cố bất thường này tiếp tục làm dấy lên làn sóng lo ngại sâu sắc trong giới chuyên môn về tốc độ phát triển quá nhanh của công nghệ trí tuệ nhân tạo. Nó xuất hiện ngay sau hàng loạt sự việc các tác nhân AI tự thoát khỏi vòng kiểm soát để tấn công vào các hệ thống bên ngoài, đi kèm với những lời cảnh báo liên tục từ giới nghiên cứu về nguy cơ AI có thể đe dọa sự tồn vong của nhân loại.

Trước mức độ nhạy cảm của sự việc, Anthropic cho biết đã chủ động báo cáo tình hình lên Nhà Trắng cùng các cơ quan chức năng liên quan, dù từ chối công bố danh tính cụ thể của các bên tiếp nhận.

Phản ứng trước thông tin trên, ông Joe Simonson – Giám đốc truyền thông của Ủy ban Thương mại Liên bang Mỹ (FTC) – đưa ra thông điệp cảnh báo cứng rắn, nhấn mạnh rằng các công ty công nghệ AI bắt buộc phải lập tức thông báo mọi sự cố liên quan đến mô hình của mình cho giới chức, đồng thời phải hành động quyết đoán và thần tốc nhằm khắc phục hậu quả phát sinh, khẳng định đây là nghĩa vụ bắt buộc chứ không phải sự lựa chọn tùy ý. FTC cũng cho biết thêm, phía Anthropic đã tiến hành báo cáo với Nhóm chuyên trách Siêu trí tuệ (SIF) về các trường hợp mô hình AI sử dụng trái phép và gian lận hệ thống chính phủ được phát hiện từ hồi cuối tháng 9.

PV (SHTT)