Công nghệ

Gemini 3.5 Transcribe của Google lọc giọng nói tự động trong 85 ngôn ngữ

Adrian Kessler

Gemini 3.5 Transcribe không chỉ ghi lại những gì người nói nói. Nó chuyển đổi những gì họ nói thành những gì họ muốn nói. Khì ngưởi nói tự sửa giữa câu — ‘Hẵy xếp lịch vàò thứ Ba, không, thứ Tư’ — mô hình xuất ra ‘thứ Tư’ và bỏ qua phầnn sửa. Các từ đệm biến mất. Nhiễu nền không ngăn đượcc nó. Kết quả là văn bản đượcc định dạng gọn gàng, không phải bản ghi âm thô.

Đối với bất kỳ ai ghi lạại phỏng vấn, podcast hoặc nội dung đa ngôn ngữ, sự khác biệt này là toàn bộ quy trình làm việc. Mọi công cụ chép lời trên thị trường đều xử lý ‘những gì đã đượcc nói.’ Biên tập viên con người sau đó dọn dẹp phần còn lại. Google hiện đang xây dựng biên tập viên đó vào chính mô hình.

Mô hình hỗ trợ hai đường dẫn API riêng biệt. API Live xử lý luồng hai chiều liên tục với độ trễ dưới một giây — đượcc thiết kế cho các tác nhân giọng nói thời gian thực, bot dịch vụ khách hàng và bất cứ thứ gì cần chép lời tức thời. API Interactions xử lý âm thanh đã ghi: toàn bộ cuộc họp, nhật ký cuộc gọi và phỏng vấn, trả về nhận dạng người nói cho tối đa ba người tham gia kèm dấu thời gian. Cả hai đều đạt tệ lỗi từ 4,0% trong chế độ phát trực tuyến và 2,6% trong chế độ không phát trực tuyến — đượcc đo bởi công ty đánh giá độc lập Artificial Analysis. Mô hình chuyển giọng nói thành văn bản trước đây của Google, Chirp 3, cần thêm 70% thời gian để hoàn tất bản chép.

Mặt người dùng của bản ra mắt khiêm tốn hơn. Trên Android, Gboard Rambler đã sử dụng Gemini 3.5 Transcribe để nhập liệu bằng giọng nói. Ứng dụng Gemini macOS hỗ trợ nó bằng tiếng Anh qua tính năng Speak to Window. Chrome đượcc liệt kê là sắp có, cho phép người dùng đọc chính tả vào bất kỳ trường web nào — trả lời, bài đăng, biểu mẫu — mà không cần chuyển đổi ứng dụng. Chưa có ngày cụ thể nào cho việc triển khai này đượcc xác nhận.

Các giới hạn của mô hình có ý nghĩa. Nhận dạng nhiều người nói chỉ giới hạn ở ba người tham gia; các buổi thảo luận và hội thảo với số lượng lớn hơn đòi hỏi giải pháp thay thế. Ứng dụng Rambler dành cho người tiêu dùng hiện có sẵn ở ‘các quốc gia và ngôn ngữ được chọn,’ không phải toàn bộ 85 ngôn ngữ mà mô hình hỗ trợ. Google chưa công bố giá cho API, hiện đang trong giai đoạn xem trước công khai qua Google AI Studio. Truy cập doanh nghiệp đến qua Nền tảng tác nhân doanh nghiệp Gemini, nơi giá đượcc thương lượng riêng. Đối với các nhà sáng tạo nhỏ hơn, câu hỏi về chi phí vẫn còn bỏ ngỏ.

Bối cảnh cạnh tranh cũng có liên quan. Whisper của OpenAI, vẫn là lựa chọn mặc định cho các nhà phát triển độc lập, đạt tệ lỗi từ trong khoảng 5–7% trên âm thanh tiếng Anh và yêu cầu mã xử lý hậu kỳ để loại bỏ từ đệm và định dạng. Các dịch vụ như AssemblyAI và Deepgram cung cấp phân đoạn người nói nhưng không có tính năng chỉnh sửa ngôn ngữ tự nhiên tích hợp mà Gemini 3.5 Transcribe áp dụng theo mặc định. Khoảng cách có thể đo lường đượcc, nhưng nó hoạt động thế nào trên các ngôn ngữ khó hơn trong 85 ngôn ngữ — giọng vùng, ngôn ngữ ít tài nguyên, môi trường ồn ào — sẽ cần kiểm tra độc lập để xác định.

Tính năng báo hiệu nhiều nhất về hướng đi dài hạn của Google là tích hợp Chrome. Một khi nhập liệu bằng giọng nói hoạt động trong bất kỳ trường web nào, mô hình không còn là công cụ dành cho nhà phát triển — nó là hạ tầng cho cách mọi người gõ. Thời gian triển khai cho thay đổi đó chưa đượcc xác nhận.

Thẻ: , , , , ,

Thảo luận

Có 0 bình luận.