-
Khi nào khàn tiếng cần thăm khám? -
Công an lắp băng chuyền dài hàng trăm mét, giải cứu 45.000 con gà giữa vùng lũ ở Thanh Hóa -
Măng Bút liên tiếp rung chuyển, 7 trận động đất xuất hiện trong 24 giờ -
Giải mã nguồn thu nhập giúp Chu Thanh Huyền sống dư dả: Từ "nữ hoàng livestream" đến tham vọng kinh doanh riêng -
Thói quen buổi sáng giúp tăng cường trí nhớ, bảo vệ não bộ lâu dài -
Hôm nay, Ban kỷ luật của VFF họp xem xét xử lý vụ Tấn Sinh đá thô bạo vào chân Đình Bắc -
Xót xa cảnh cụ bà 76 tuổi bị chồng bạo hành: Đã nhập viện điều trị, hé lộ nơi nương tựa sắp tới -
Tử vi thứ 3 ngày 22/9/2026 của 12 con giáp: Mão vận trình tươi sáng, Hợi sa sút -
Tân Bí thư Quảng Trị đề nghị không tổ chức đoàn thăm hỏi, tặng hoa chúc mừng -
Khi nào người chạy bộ cần giảm cường độ tập luyện?
Công nghệ
22/07/2024 16:20Sợ hãi với AI tạo giọng nói giống hệt con người
Sản phẩm này "đỉnh" đến mức gã khổng lồ công nghệ Mỹ không có ý định tích hợp nó vào sản phẩm hoặc mở rộng quyền truy cập của công chúng, do lo ngại nguy cơ tiềm ẩn về việc sử dụng cho mục đích xấu.
Công cụ có tên VALL-E 2, giúp chuyển văn bản thành giọng nói hoặc bắt chước giọng nói chỉ dựa trên vài giây âm thanh. Hệ thống được đào tạo để nhận dạng các khái niệm mà không cần cung cấp bất kỳ ví dụ nào về các khái niệm đó.
"VALL-E 2 là robot đầu tiên đạt được "sự tương đương với con người", nghĩa là nó đáp ứng hoặc vượt qua các tiêu chuẩn về độ giống con người" - Microsoft tuyên bố.
VALL-E 2 kế thừa hệ thống VALL-E ban đầu được công bố vào tháng 1-2023.
"VALL-E 2 có thể tạo ra giọng nói chính xác, tự nhiên theo đúng giọng của người nói gốc" - các nhà phát triển tại Microsoft Research quả quyết và cho biết công cụ này có thể tổng hợp các câu phức tạp.
Sở dĩ VALL-E 2 này có khả năng "như con người" nhờ tích hợp hai tính năng chính, gồm tính năng lấy mẫu có nhận thức về sự lặp lại và mô hình mã hóa theo nhóm.
Trong đó, tính năng lấy mẫu có nhận thức về sự lặp lại giúp giải quyết được các lần lặp lại của các đơn vị ngôn ngữ nhỏ như từ hoặc thành phần của từ; ngăn chặn các vòng lặp vô hạn của âm thanh hoặc cụm từ trong quá trình giải mã.
Còn mô hình mã nhóm giúp cải thiện hiệu quả bằng cách giảm độ dài chuỗi hoặc số lượng mã thông báo riêng lẻ, mà mô hình xử lý trong một chuỗi đầu vào duy nhất. Qua đó, có thể tạo ra giọng nói và giúp quản lý những khó khăn với việc xử lý chuỗi âm thanh dài.
Các thí nghiệm được tiến hành trên các tập dữ liệu LibriSpeech và VCTK đã chỉ ra rằng VALL-E 2 vượt trội hơn các hệ thống TTS zero-shot trước đây về độ mạnh mẽ của giọng nói, độ tự nhiên và độ tương đồng của người nói.
Các nhà nghiên cứu cho rằng rằng chất lượng đầu ra của VALL-E 2 phụ thuộc vào độ dài và chất lượng của lời nói cũng như các yếu tố môi trường, như tiếng ồn xung quanh.
Các nhà nghiên cứu nhận định trong tương lai, VALL-E 2 có thể tổng hợp giọng nói, duy trì được danh tính của người nói. Hơn nữa, nó có thể được sử dụng cho mục đích học tập, giáo dục, giải trí, báo chí, nội dung tự biên soạn, tính năng trợ năng, hệ thống phản hồi bằng giọng nói tương tác, dịch thuật, chatbot…
Theo Bằng Hưng (Nld.com.vn)
- Khi nào khàn tiếng cần thăm khám? (1 giờ trước)
- Bão Dujuan hoành hành, Nhật Bản sơ tán hơn 1,6 triệu người (1 giờ trước)
- Hành trình trở thành thủ khoa Ngoại thương với điểm số gần như tuyệt đối của cựu học sinh trường Ams (1 giờ trước)
- Tình bạn 20 năm của hai cụ bà tan vỡ vì cụ ông 83 tuổi (2 giờ trước)
- Diễn viên AI bất ngờ "bắn" tiếng Quảng Đông trên sóng khiến MC đứng hình (2 giờ trước)
- Công bố kết quả xét nghiệm ADN tại phiên tòa: Con gái của Thiên An chính là con ruột ca sĩ Jack (2 giờ trước)
- Từng là “ông lớn” chiếu sáng, Điện Quang nay đối mặt bài toán lợi nhuận và công nghệ (2 giờ trước)
- KIA ra mắt SUV điện 5 chỗ đẹp xuất sắc, giá chỉ 780 triệu đồng (2 giờ trước)
- Bạch Lộc chi gần 1 tỷ đồng mua iPhone 18 Pro Max tặng toàn bộ ê-kíp (2 giờ trước)
- Vùng Vịnh tìm cách đưa dầu qua Hormuz giữa vòng phong tỏa của Iran (2 giờ trước)