-
Cháy nhà nghiêm trọng ở Quảng Trị: Chồng đi chăm mẹ ốm, người phụ bị thần kinh nặng tử vong thương tâm -
Các nạn nhân sống sót vụ cháy xe giường nằm kể lại giây phút sinh tử: Bà ôm cháu thoát thân, bỏ lại toàn bộ tài sản -
Ly hôn gần 2 năm, tôi vẫn đưa con về thăm ông bà nhưng không được bước vào nhà -
Diễn biến mới vụ thủ khoa D01 là con hiệu phó bị tố được giám thị giải đề giúp ngay trong phòng thi -
Mẫu xe ga 169cc mới trình làng giá 45,8 triệu đồng, thách thức Honda SH bằng kho công nghệ vượt tầm giá -
Standard Chartered nâng dự báo tăng trưởng GDP Việt Nam, kỳ vọng kinh tế tiếp tục bứt phá -
Vụ tai nạn lao động ở trang trại lợn Thanh Hóa: Cập nhật mới nhất về 8 nạn nhân sống sót -
Thanh Hóa phê duyệt giá thuê đất phần ngầm dự án đô thị trung tâm, dự kiến thu gần 778 tỷ đồng -
Liên tiếp học sinh, trẻ em đuối nước, Thanh Hóa phát cảnh báo khẩn -
Nguyên nhân người đàn ông liên tục la hét, nhảy qua lại trên mái nhà cao tầng? Cái kết vụ việc?
Công nghệ
22/08/2023 16:00Bốn mô hình AI hàng đầu tranh tài ‘bịa chuyện’
Các nhà nghiên cứu tại Arthur AI, một nền tảng giám sát máy học, đã tiến hành thử nghiệm những mô hình hàng đầu ngành công nghệ và ghi nhận GPT-4 giỏi toán nhất, Llama 2 đạt mức trung bình mọi mặt, Claude 2 của Anthropic “hiểu rõ” giới hạn bản thân nhất và Cohere AI giành danh hiệu mô hình “ảo giác” nhất với những câu trả lời sai tự tin nhất.
Báo cáo của Arthur AI đưa ra trong bối cảnh thông tin sai lệch do AI sản xuất đang trở thành vấn đề nóng khi cuộc bầu cử Tổng thống Mỹ năm 2024 đang tới gần.
Theo Adam Wenchel, đồng sáng lập và CEO Arthur, đây là báo cáo đầu tiên “xem xét toàn diện về tỷ lệ ảo giác của các mô hình ngôn ngữ lớn (LLM) thay vì chỉ công bố xếp hạng”.
Ảo giác AI chỉ hiện tượng các LLM bịa đặt hoàn toàn thông tin và hành xử như thể chúng đang nói sự thật. Ví dụ, tháng 6/2023, có tin tức cho biết ChatGPT đã trích lục thông tin “không có thật” trong hồ sơ nộp lên toà án liên bang New York và những luật sư liên quan có thể đối mặt với những án phạt nghiêm khắc.
Trong cuộc thử nghiệm, các nhà nghiên cứu Arthur AI cho các mô hình AI tranh tài ở các danh mục như toán học tổ hợp, kiến thức về tổng thống Mỹ, các nhà lãnh đạo chính trị Maroc,… với những câu hỏi được “thiết kế” để AI bộc lộ sai lầm, đó là “yêu cầu các mô hình giải trình các bước lập luận về thông tin đưa ra”.
Kết quả cho thấy GPT-4 của OpenAI nhìn chung hoạt động tốt nhất trong số các mô hình được thử nghiệm. Nó cũng có độ ảo giác thấp hơn so với phiên bản tiền nhiệm GPT-3,5. Chẳng hạn, với những câu hỏi toán học, GPT-4 ít ảo giác hơn từ 33% đến 50%.
Mặt khác, Llama 2 của Meta nhìn chung gây ảo giác nhiều hơn so với GPT-4 và Claude 2 của Anthropic.
Trong hạng mục toán học, GPT-4 đứng ở vị trí số một, theo sát là Claude 2, nhưng trong các bài kiểm tra về tổng thống Mỹ, Claude 2 chiếm vị trí đầu tiên về độ chính xác, vượt qua GPT-4 ở vị trí thứ hai. Khi được hỏi về chính trị Maroc, GPT-4 lại đứng đầu và Claude 2 và Llama 2 gần như hoàn toàn chọn không trả lời.
Ở bài thử nghiệm thứ hai, các nhà nghiên cứu đã kiểm tra mức độ “đề phòng rủi ro” của các mô hình AI (đưa ra thông báo “Là một mô hình AI, tôi không thể đưa ra ý kiến”).
Với bài test này, GPT-4 có mức đề phòng tăng tương đối 50% so với GPT-3.5, cũng được minh chứng “định lượng bằng các tuyên bố của người dùng GPT-4 rằng phiên bản mới gây khó chịu nhiều hơn”. Mặt khác, mô hình AI của Cohere hoàn toàn không có động thái phòng ngừa bất kỳ phản ứng nào. Nghiên cứu cho thấy Claude 2 đáng tin cậy nhất về mặt “tự nhận thức”, nghĩa là đánh giá chính xác những gì nó biết và không biết, đồng thời chỉ trả lời những câu hỏi mà nó có dữ liệu đào tạo để hỗ trợ.
Đại diện của Cohere đã bác bỏ kết quả, lý giải rằng “công nghệ tăng cường truy xuất của công ty, vốn không tích hợp trong mô hình được thử nghiệm, có hiệu quả cao trong việc trích dẫn những thông tin có thể được kiểm chứng để xác minh nguồn tin” cho doanh nghiệp.
Theo Thế Vinh (VietNamNet)
- Tử vi thứ 4 ngày 22/7/2026 của 12 con giáp: Sửu đón tin vui, Mùi chớ nên nóng vội (21/07/26 23:38)
- Lời dặn dò của Messi trước chung kết World Cup làm dấy lên nghi vấn về phòng thay đồ Argentina (21/07/26 23:19)
- Khởi tố vụ án, tạm giam tài xế vụ cháy xe khách khiến 7 người tử vong ở Đồng Nai (21/07/26 23:15)
- Tuấn Hải đầu quân cho Nam Định, tái ngộ Xuân Son và dàn tuyển thủ Việt Nam (21/07/26 23:04)
- Messi bị gọi là "kẻ cầm đầu gian xảo" (21/07/26 21:51)
- Thành Chung gặp sự cố ngoài ý muốn trước ngày tuyển Việt Nam ra quân tại ASEAN Cup 2026 (21/07/26 21:44)
- Giá vàng PNJ diễn biến khác lạ, doanh nghiệp tiếp tục xin lỗi khách hàng (21/07/26 21:13)
- Vượt hơn 700 km đến vùng lũ Mường Than, đội cứu hộ Thanh Hóa quyết ở lại "đến khi bà con ổn định, chúng tôi mới ra về" (21/07/26 21:05)
- Bí thư An Giang Nguyễn Tiến Hải được giao Quyền Bộ trưởng Bộ Nội vụ (21/07/26 20:41)
- Iran đề nghị ngừng bắn 10 ngày với Mỹ để hạ nhiệt căng thẳng tại eo biển Hormuz (21/07/26 20:38)