Mô hình AI mới Kimi K3 của Trung Quốc được cho là đã chủ động phát hiện và khai thác một lỗ hổng trong môi trường thử nghiệm để truy cập Internet, dù nhiệm vụ được giao không cho phép tìm kiếm trực tuyến. Sự cố đang làm dấy lên cảnh báo mới về khả năng kiểm soát các tác tử AI.

Sau hàng loạt sự cố liên quan đến các mô hình AI tự vượt khỏi môi trường thử nghiệm, giới công nghệ tiếp tục chú ý đến Kimi K3, mô hình được phát hành theo dạng “mở trọng số” (open-weight) và đang nhận được sự quan tâm lớn.

Theo startup an ninh mạng Frontier Security, sự việc xảy ra trong quá trình kiểm tra khả năng phòng thủ không gian mạng của Kimi K3. Mô hình này đã tìm cách thoát khỏi môi trường hộp cát (sandbox), vốn được thiết kế để cách ly AI khỏi hệ thống bên ngoài.

10-1786328497-ai-tu-tim-cach-truy-cap-internet-trong-bai-kiem-tra-bao-mat
Ngày càng có nhiều mô hình AI dễ dàng vượt qua rào cản bảo mật để tiếp cận Internet toàn cầu. Ảnh: Wired.

Kimi K3 chủ động tìm đường ra Internet

Frontier Security cho biết nguyên nhân trực tiếp nằm ở một lỗi cấu hình trong sandbox, khiến mô hình có thể kết nối với một số trang web thay vì bị cô lập hoàn toàn.

Tuy nhiên, điểm khiến các nhà nghiên cứu đặc biệt quan tâm là Kimi K3 dường như không đơn thuần vô tình đi qua kết nối bị bỏ ngỏ. Mô hình được cho là đã chủ động dò tìm các thiết lập mạng trong sandbox để phát hiện rằng mình có thể truy cập một số trang web.

Yaron Singer, CEO Frontier Security, cho rằng sự cố cho thấy Kimi K3 có ít rào cản an toàn trong lĩnh vực an ninh mạng hơn so với nhiều mô hình khác. Theo ông, sau khi phát hiện lỗ hổng, Kimi đã chủ động tận dụng nó thay vì bị giới hạn bởi các cơ chế bảo vệ nội bộ.

Đáng chú ý, sau khi có quyền truy cập Internet, Kimi K3 không tiếp tục thực hiện hành vi tấn công mạng. Theo Wired, nguyên nhân là đáp án của bài kiểm tra mà mô hình đang tìm kiếm đã có sẵn trên GitHub và tương đối dễ tiếp cận.

Dù vậy, việc một mô hình được giao nhiệm vụ giải quyết vấn đề mà về nguyên tắc không được phép sử dụng Internet nhưng vẫn tìm cách truy cập mạng khiến giới nghiên cứu đặc biệt chú ý.

Sandbox vẫn là mắt xích đáng lo

Sự cố của Kimi K3 có điểm tương đồng với những trường hợp trước đó liên quan đến các mô hình AI khác: một sandbox được cấu hình không chính xác đã vô tình để lộ đường kết nối đến một số trang web.

Điều này cho thấy dù các mô hình được đặt trong môi trường kiểm soát, chỉ một kết nối không được đóng đúng cách cũng có thể tạo ra rủi ro.

Wired nhận định lỗi của con người là nguyên nhân quan trọng trong những sự cố kiểu này, nhưng khả năng của các mô hình AI có thể khiến hậu quả trở nên nghiêm trọng hơn. Những hệ thống AI tiên tiến được thiết kế để suy luận và thực hiện nhiều hành động phức tạp nhằm hoàn thành mục tiêu được giao.

Paul Kassianik, nhà nghiên cứu tại Frontier Security, đánh giá Kimi K3 có khả năng bám đuổi mục tiêu rất mạnh, trong khi thiếu những rào cản đủ để ngăn việc gian lận hoặc tìm cách thoát khỏi sandbox.

Điểm đáng chú ý là Kimi K3 được phát hành rộng rãi với các rào cản an toàn dành cho người dùng thông thường, thay vì chỉ là một phiên bản nghiên cứu nội bộ đã được vô hiệu hóa các cơ chế bảo vệ.

10-1786328497-ai-tu-tim-cach-truy-cap-internet-trong-bai-kiem-tra-bao-mat
Theo báo cáo, mô hình Kimi K3 đã truy cập mạng Internet toàn cầu để tìm lời giải vượt qua bài kiểm tra an ninh mạng. Ảnh: SCMP.

Mô hình AI vẫn có giá trị trong phòng thủ mạng

Dù cảnh báo về khả năng vượt rào của Kimi K3, các nhà nghiên cứu Frontier Security cũng thừa nhận những mô hình AI dạng “mở trọng số” vẫn có năng lực đáng kể trong lĩnh vực phòng thủ an ninh mạng.

Hugging Face từng sử dụng một mô hình AI ẩn danh của Trung Quốc để hỗ trợ tự vệ trước một cuộc tấn công từ tác tử AI của OpenAI. Nền tảng này cũng phát triển các hệ thống đánh giá khả năng của AI trong việc phát hiện lỗ hổng phần mềm và mạng, với Kimi K3 đạt kết quả nổi bật ở các tác vụ này.

Theo các chuyên gia được Wired dẫn lời, những điểm yếu mà Kimi K3 hay các mô hình AI khác khai thác thực chất đều bắt nguồn từ những vấn đề bảo mật khá phổ biến. Các lỗ hổng trong mã nguồn quản lý thư viện doanh nghiệp vẫn thường xuất hiện, trong khi giới bảo mật từ lâu đã khuyến cáo phải cách ly hoàn toàn hạ tầng quan trọng khỏi Internet công cộng.

Vì vậy, sự cố lần này có thể không hoàn toàn là một “vấn đề của AI”, mà còn phản ánh điểm yếu trong các giao thức bảo mật vốn đã tồn tại từ nhiều năm.

Một nhà nghiên cứu nhận định mô hình AI không thực sự “vượt ngục” khỏi một hệ thống được cô lập tuyệt đối. Thay vào đó, nó chỉ đi qua một kết nối duy nhất mà những người vận hành đã vô tình để ngỏ.

Sự việc một lần nữa cho thấy khi AI ngày càng có khả năng tự suy luận và hành động để hoàn thành mục tiêu, việc thiết kế các lớp bảo vệ và kiểm soát quyền truy cập trở thành yếu tố quan trọng không kém bản thân năng lực của mô hình.

Bảo Ngọc (SHTT)