Công nghệ

ElevenLabs v4 sao chép giọng bạn chỉ từ 10 giây ghi âm và nói được 90 ngôn ngữ

Susan Hill
Thêm chúng tôi trên Google

ElevenLabs vừa ra mắt Eleven v4, mô hình chuyển văn bản thành giọng nói có thể đọc to nội dung bằng tiếng cười, tiếng thở dài hoặc giọng Pháp tức giận — tùy theo yêu cầu của người viết. Tính năng nhân bản giọng nói tức thì chỉ cần một đoạn ghi âm ngắn hơn cả lời nhắn thoại; sau đó, giọng được nhân bản có thể nói hàng chục ngôn ngữ mà vẫn giữ nguyên âm sắc. Bất kỳ ai có tài khoản ElevenLabs miễn phí đều có thể sử dụng.

Với những người sáng tạo nội dung bằng âm thanh, công cụ này giúp tiết kiệm cả ngày làm việc. Người làm podcast có thể lồng tiếng một tập sang tiếng Nhật bằng chính giọng của mình; nhà phát triển game độc lập có thể tạo cách nói riêng cho từng nhân vật phụ mà không cần đặt lịch phòng thu; còn người đọc sách nói có thể chèn thẳng một khoảng ngừng hay tiếng cười vào kịch bản. Mặt trái cũng rõ ràng không kém: chỉ một tin nhắn thoại, đoạn trích từ cuộc gọi video hay vài giây trong một bài đăng công khai giờ đã đủ làm nguyên liệu để tạo bản sao giọng nói thuyết phục của một người.

Thay đổi lớn nhất nằm ở khả năng kiểm soát, còn việc nhân bản giọng nói chỉ cần vỏn vẹn 10 giây âm thanh. Các mô hình ElevenLabs trước đây đọc văn bản trôi chảy nhưng phải tự đoán sắc thái. Phiên bản 4 tiếp nhận chỉ dẫn diễn xuất viết ngay trong câu, đặt trong ngoặc vuông, chẳng hạn [cười] hoặc [nói với vẻ tức giận bằng giọng Pháp], thậm chí cả âm thanh nền như [mưa nhẹ] hay [điện thoại rung]. Công ty cho biết mô hình còn nhận biết sắc thái và nhịp điệu từ ngữ cảnh xung quanh, nhờ đó một câu thoại trong cảnh căng thẳng sẽ tự mang vẻ căng thẳng mà không cần gắn thẻ. Trong những cảnh có nhiều người nói, mỗi giọng vẫn nhất quán suốt các đoạn dài — vốn là điểm yếu của giọng đọc tổng hợp, khi giọng thường thay đổi dần trong một chương.

Theo TechCrunch, số ngôn ngữ được hỗ trợ tăng từ 70 ở phiên bản trước lên hơn 90; ElevenLabs đặc biệt nhấn mạnh những cải thiện chất lượng lớn nhất ở tiếng Nhật, tiếng Bồ Đào Nha Brazil, tiếng Quan Thoại và tiếng Quảng Đông. Giọng được nhân bản vẫn giữ bản sắc khi chuyển ngôn ngữ, vì vậy bản sao giọng của một người nói tiếng Tây Ban Nha khi đọc tiếng Đức vẫn nghe giống người đó, nhưng mang giọng Đức bản ngữ. Mô hình thứ hai, v4 Turbo, được thiết kế cho trợ lý giọng nói và nhân viên tổng đài. Mô hình bắt đầu nói sau khoảng 150 mili giây — tương đương khoảng ngừng giữa lượt lời của hai người trong cuộc trò chuyện — và có thể lên tiếng trước khi chatbot phía sau hoàn tất câu trả lời.

ElevenLabs không phải cái tên duy nhất trên thị trường này. Google, OpenAI, Cartesia, Deepgram và Fish Audio đều bán giọng nói tổng hợp cho cùng nhóm nhà phát triển. Chỉ vài giờ sau khi sản phẩm ra mắt, công ty đánh giá độc lập Artificial Analysis đã xếp v4 ở vị trí đầu bảng xếp hạng giọng nói, nơi người nghe đánh giá các mẫu ẩn danh đặt cạnh nhau. ElevenLabs cũng cho biết khoảng ba trong bốn người nghe thích v4 hơn các đối thủ trong những thử nghiệm mù — con số do chính công ty thực hiện.

Những điểm cần dè chừng bắt đầu từ con số 10 giây ấy. ElevenLabs cho biết người tải giọng lên phải có sự đồng ý của người sở hữu giọng nói; công ty vận hành một công cụ phân loại công khai có thể gắn cờ âm thanh được tạo bằng các công cụ của mình; đồng thời chặn hoàn toàn việc nhân bản giọng nói của một số nhân vật chính trị. Các biện pháp này ngăn được những hành vi lạm dụng thông thường, nhưng vẫn dựa vào sự trung thực của người tải lên; kẻ lừa đảo chỉ cần một đoạn ghi âm ngắn giọng người thân là đã có thể dựng cuộc gọi báo tin khẩn cấp giả. Gói miễn phí cũng khá hạn chế: theo phần phân tích các gói dịch vụ của Unite.AI, người dùng chỉ có khoảng 10 phút âm thanh được tạo mỗi tháng, còn các gói trả phí bắt đầu từ 6 USD/tháng.

Eleven v4 và v4 Turbo được đưa vào hoạt động ngày 28 tháng 9 trên ứng dụng dành cho nhà sáng tạo, nền tảng tác nhân và API dành cho nhà phát triển của ElevenLabs. Công ty có trụ sở tại London đã huy động 500 triệu USD từ Sequoia hồi tháng 2, với mức định giá 11 tỷ USD; TechCrunch đưa tin doanh thu quy đổi theo tốc độ thường niên của công ty đã vượt 600 triệu USD. Giám đốc điều hành Mati Staniszewski nói với TechCrunch rằng công ty đang hướng tới việc niêm yết trên thị trường chứng khoán trong những năm tới, nhưng chưa cam kết thời điểm cụ thể.

Với người sáng tạo, một giọng nói biết cười đúng lúc bằng 90 ngôn ngữ chẳng khác nào phòng thu nằm gọn trong một tab trình duyệt. Với những người khác, đó là thêm một lý do để cúp máy rồi gọi lại khi một giọng nói quen thuộc qua điện thoại yêu cầu chuyển tiền.

Thẻ: , , , , ,

Thêm chúng tôi trên Google

Thảo luận

Có 0 bình luận.