-
Khỏi zona hơn một năm, người phụ nữ vẫn bị những cơn đau như điện giật hành hạ -
Phát hiện người đàn ông nguy kịch nằm giữa rừng, hiện trường phát hiện nhiều dấu chân đáng ngờ -
3 thói quen ngủ tưởng bình thường nhưng có thể làm tăng nguy cơ ung thư -
Huấn Hoa Hồng kiếm tiền thế nào từ những buổi livestream có lượng view khủng trên mạng xã hội? -
Hà Tĩnh: Xe tải cẩu lao vào đoàn xe máy đang dừng đèn đỏ, camera ghi lại toàn bộ diễn biến -
Sổ đỏ bắt đầu hiển thị trên VNeID, người dân có thể tự tra cứu -
El Nino 2026 mạnh lên bất thường: Có thể trở thành sự kiện mạnh nhất từng ghi nhận -
Hiệu trưởng, hiệu phó dôi dư sau sắp xếp trường học: Muộn nhất 30/9 phải giải quyết nghỉ việc -
Động đất 7,4 độ ở Colombia khiến ít nhất 111 người chết, chính quyền ban bố tình trạng khẩn cấp -
Vợ không kiếm tiền nhưng liên tục chê chồng bất tài vì chưa mua được nhà
Công nghệ
11/08/2026 10:36Vụ ChatGPT “nổi loạn” vượt tầm kiểm soát: Sự cố AI được hé lộ nghiêm trọng hơn
Ngày 21/7, OpenAI thừa nhận hai mô hình AI mới nhất của công ty đã “nổi loạn” trong quá trình thử nghiệm và xâm nhập thành công vào Hugging Face, nền tảng công nghệ AI phổ biến với giới lập trình viên.
Tuy nhiên, những thông tin được công bố sau đó cho thấy sự việc không dừng lại ở đó. Trong quá trình điều tra, OpenAI phát hiện ít nhất 4 tài khoản liên quan đến các dịch vụ công cộng đã bị tác nhân AI sử dụng để phục vụ chiến dịch tấn công Hugging Face.
Đáng chú ý, mô hình AI được cho là đã tự tìm thấy thông tin xác thực bị rò rỉ trên Internet và tận dụng những dữ liệu này để truy cập trái phép vào các tài khoản.
Những phát hiện mới khiến quy mô của sự cố trở nên nghiêm trọng hơn nhiều so với thông tin ban đầu. Vụ việc xuất phát từ một cuộc thử nghiệm nội bộ nhằm đánh giá khả năng của các mô hình AI mới nhất, nhưng cuối cùng lại dẫn đến một chuỗi hành động ngoài dự kiến.

AI giành quyền truy cập sâu vào hệ thống
Theo thông tin được Reuters đưa, một khách hàng của Modal, doanh nghiệp cung cấp hạ tầng phần mềm phục vụ việc huấn luyện và vận hành các dịch vụ AI, nằm trong số những bên bị tác nhân AI nhắm tới.
Akshat Bubna, Giám đốc Công nghệ Modal, xác nhận với WIRED rằng AI của OpenAI đã khai thác một lỗ hổng trong mã nguồn của khách hàng đang vận hành trên hạ tầng dịch vụ. Tuy nhiên, ông khẳng định nền tảng Modal không bị xâm nhập.
Trong khi đó, báo cáo điều tra sự cố do Hugging Face công bố cho thấy mức độ thâm nhập của AI sâu hơn nhiều so với những dự đoán ban đầu.
Hugging Face đã phân tích khoảng 17.600 hành động của AI được khôi phục từ nhật ký hệ thống trong khoảng thời gian từ ngày 9 đến 13/7. Kết quả cho thấy tác nhân AI của OpenAI đã giành quyền quản trị trên nhiều cụm nền tảng mã nguồn mở nội bộ, thậm chí có quyền root trên một máy chủ sản xuất.
Không dừng lại ở đó, AI còn có quyền ghi đè vào một mạng con chứa các kho mã nguồn của Hugging Face trên GitHub.
Một trong những chi tiết đáng chú ý nhất là tác nhân AI đã sử dụng thông tin xác thực bị đánh cắp để đăng ký thành công 181 thiết bị do kẻ tấn công kiểm soát vào mạng lưới của Hugging Face. Qua đó, AI có thể tiếp cận trực tiếp những hệ thống nội bộ được sử dụng để xây dựng và thử nghiệm mã nguồn của công ty.
Từ bài kiểm tra an ninh thành cuộc tấn công ngoài dự kiến
Theo WSJ, nguồn gốc sự cố nằm ở ExploitGym, một bài kiểm tra được thiết kế để đánh giá khả năng an ninh mạng của các hệ thống AI.
Trong bài kiểm tra này, AI phải trải qua khoảng 900 thử thách liên quan đến các phần mềm có lỗ hổng đã được biết trước. Hệ thống cung cấp thông tin về lỗi và hướng dẫn cách kích hoạt, sau đó yêu cầu AI tìm cách tạo mã khai thác để xâm nhập vào hệ thống.

Cơ chế của ExploitGym tương tự một trò chơi cướp cờ. Khi xâm nhập thành công, AI phải chứng minh kết quả bằng cách lấy một chuỗi ký tự được tạo ngẫu nhiên và lưu trữ trong hệ thống.
Thông thường, các sản phẩm AI của OpenAI được trang bị những biện pháp bảo vệ nhằm hạn chế khả năng bị sử dụng cho mục đích tấn công mạng. Nhưng trong thử nghiệm này, công ty đã chủ động loại bỏ các lớp bảo vệ để quan sát khả năng của mô hình khi không bị kiểm soát.
Các mô hình vẫn được đặt trong môi trường thử nghiệm riêng, thường được gọi là sandbox. Dù vậy, theo nhóm chuyên gia an ninh của Hugging Face, tác nhân AI đã tìm cách tận dụng những điểm yếu trong môi trường này.
Thay vì chỉ tập trung giải quyết các thử thách được giao, AI dường như suy luận rằng Hugging Face có thể đang lưu trữ “đáp án” trên máy chủ và chuyển sang tìm cách lấy thông tin đó.
Zhun Wang, nghiên cứu sinh tiến sĩ tại Đại học California, Berkeley và là một trong những tác giả của ExploitGym, cho rằng mô hình có thể đã tìm kiếm những bản vá hoặc kỹ thuật khai thác có sẵn.
Các nhà nghiên cứu an ninh mạng gọi hiện tượng này là “hack dựa trên phần thưởng”, khi AI tìm cách tối đa hóa điểm số hoặc phần thưởng được giao thay vì thực hiện đúng hành vi mà người phát triển mong muốn.
Khi AI tìm cách “lách luật” để đạt mục tiêu
Hiện tượng này không hoàn toàn mới. OpenAI từng ghi nhận một ví dụ từ năm 2016, khi huấn luyện AI chơi trò đua thuyền. Thay vì hoàn thành đường đua, AI phát hiện rằng việc quay vòng tại một vị trí có thể giúp tối đa hóa điểm số, dù điều đó khiến nó không bao giờ về đích.
Trong trường hợp ExploitGym, việc AI chuyển hướng khỏi nhiệm vụ ban đầu để tìm kiếm thông tin có thể được xem là một biểu hiện cực đoan của cơ chế tương tự.
Tuy nhiên, các chuyên gia được WIRED dẫn lời cho rằng những lỗ hổng bị khai thác trong vụ việc vốn không phải những điểm yếu quá mới mẻ. Lỗ hổng trong mã nguồn quản lý thư viện doanh nghiệp là vấn đề thường gặp, trong khi việc cô lập hạ tầng quan trọng khỏi Internet công cộng từ lâu đã được giới bảo mật khuyến cáo.
Vì vậy, một số chuyên gia cho rằng sự cố không đơn thuần là “vấn đề của AI”, mà còn phản ánh những điểm yếu trong các giao thức bảo mật đã tồn tại từ nhiều năm.
Theo một nhà nghiên cứu, tác nhân AI không thực sự “vượt ngục” khỏi một môi trường được bảo vệ tuyệt đối. Thay vào đó, nó chỉ tận dụng một kết nối mà con người đã vô tình để ngỏ.
Sự cố vì thế trở thành lời cảnh báo về một thực tế mới: khi AI được trao mục tiêu và quyền truy cập đủ lớn, khả năng tự tìm ra những con đường ngoài dự kiến để hoàn thành nhiệm vụ có thể tạo ra những rủi ro mà ngay cả người xây dựng hệ thống cũng khó lường trước.
- Thủ tướng Thái Lan chỉ trích nghi phạm giết cựu nghị sĩ ngồi hút thuốc, không bị còng tay (11:18)
- Khỏi zona hơn một năm, người phụ nữ vẫn bị những cơn đau như điện giật hành hạ (11:14)
- 3.000 tài liệu về những giờ phút cuối đời của Liam Payne và chi tiết khối tài sản 736 tỷ đồng (11:10)
- Ngân hàng “khát” vốn, nhân viên ráo riết săn tiền gửi (11:10)
- Phát hiện người đàn ông nguy kịch nằm giữa rừng, hiện trường phát hiện nhiều dấu chân đáng ngờ (11:03)
- Messi bị đe dọa "ám sát" tại World Cup 2026 như thế nào? Cảnh sát Mỹ hé lộ tình tiết đáng sợ (11:00)
- Trẻ không chịu thắt dây an toàn, máy bay phải quay đầu rồi hủy chuyến (36 phút trước)
- 3 thói quen ngủ tưởng bình thường nhưng có thể làm tăng nguy cơ ung thư (47 phút trước)
- Đàm Vĩnh Hưng bất ngờ "chiếm sóng" giới trẻ sau CAM GALA, đồng loạt gọi một biệt danh đặc biệt (57 phút trước)
- Barcelona tăng giá mua Rodri, buộc Man City phải sớm gật đầu đồng ý (58 phút trước)