Công nghệ

AI giọng nói của OpenAI không còn đợi lượt bạn — giá $0,05/phút

Susan Hill

Mọi AI giọng nói trên thị trường hiện nay đều yêu cầu bạn chờ trước khi nói. GPT-Live-1 của OpenAI thì không. Mô hình này, có sẵn qua API của OpenAI, nghe và nói đồng thời — xử lý các lần ngắt lời, khoảng dừng và lời nói chồng lấn giống như cách một con người làm trong cuộc gọi.

Giá là 0,05 USD mỗi phút cho lớp giọng nói — 1,50 USD cho cuộc trò chuyện 30 phút, hoặc 50 USD cho mỗi 1.000 phút trò chuyện. Các nhà phát triển trả riêng cho phần xử lý suy luận: GPT-6 Astra của riêng OpenAI hoặc bất kỳ mô hình tương thích nào xử lý các lệnh gọi công cụ và logic kinh doanh. Lớp giọng nói quản lý cơ chế hội thoại; lớp suy luận quyết định AI thực sự nói và làm gì.

Sự tách biệt đó có ý nghĩa gì trong thực tế: một bot dịch vụ khách hàng có thể nghe “khoan, thực ra tôi muốn chọn phương án kia” giữa câu và phản hồi lại, thay vì tiếp tục đọc một câu trả lời đã chuẩn bị sẵn. Một gia sư ngôn ngữ có thể bắt lỗi học viên vấp từ mà không cần chờ họ nói xong. Một hệ thống đặt chỗ có thể xử lý những cuộc gọi thực tế nơi người ta lặp lại, đổi ý và nói chồng lên nhau.

Trên Full Duplex Bench — bài đánh giá được thiết kế riêng để kiểm tra khả năng xử lý giọng nói hai chiều đồng thời — GPT-Live-1 đạt điểm cao hơn 30 điểm phần trăm so với người tiền nhiệm GPT-Realtime-2.1. Khi kết hợp với GPT-6 Astra làm phần xử lý suy luận, nó vượt qua Tau3, chuẩn đánh giá dịch vụ khách hàng kiểm tra các truy vấn phức tạp, nhiều bước mà không có khoảng nghỉ trong hội thoại.

Kiến trúc hai lớp phản ánh một lựa chọn thiết kế có chủ đích. Thời gian nói và suy luận được tính phí riêng vì chúng mở rộng theo cách khác nhau: một công ty khởi nghiệp xây dựng ứng dụng dạy kèm nhẹ trả ít hơn ở cả hai lớp so với một doanh nghiệp chạy hàng nghìn cuộc gọi dịch vụ khách hàng đồng thời trên GPT-6 Astra. Mức tối thiểu là 0,05 USD mỗi phút cho giọng nói, bất kể điều gì chạy phía sau.

Điều GPT-Live-1 không thay đổi là chất lượng của câu trả lời. Lớp giọng nói xử lý khi nào và cách AI nói — không phải những gì nó biết. Một câu trả lời tệ được nói đúng lúc vẫn là một câu trả lời tệ. Các nhà phát triển xây dựng ứng dụng dịch vụ khách hàng sẽ cần đánh giá cả hai lớp riêng biệt, và phần xử lý suy luận có thể làm tăng hóa đơn nhiều hơn chính lớp giọng nói. OpenAI cũng chưa công bố dữ liệu về cách kiến trúc full-duplex hoạt động trong môi trường băng thông thấp hoặc trên đường dây điện thoại nhiễu, nơi việc duy trì đầu vào âm thanh liên tục khó khăn hơn.

GPT-Live-1 hiện có sẵn trong API của OpenAI. Công ty chưa công bố sản phẩm hướng tới người tiêu dùng xây dựng trên mô hình này, mặc dù họ đã chỉ ra rằng các phiên bản tương lai của chế độ giọng nói ChatGPT có thể sử dụng cùng kiến trúc cơ bản. Mức giá 0,05 USD mỗi phút áp dụng khi ra mắt; OpenAI chưa công bố lộ trình thay đổi giá hoặc danh sách các mô hình suy luận bên thứ ba được phê duyệt để sử dụng với lớp giọng nói.

Thẻ: , , , , ,

Thảo luận

Có 0 bình luận.