Công nghệ

Claude Opus 5.5 ra mắt rẻ hơn 40% trong khi CEO Anthropic kêu gọi làm chậm tốc độ AI

Susan Hill
Thêm chúng tôi trên Google

Claude Opus 5.5 làm được điều mà các mô hình trước đây của Anthropic chưa từng làm: chi phí thấp hơn và vận hành nhanh hơn, trong khi vẫn ngang bằng hoặc vượt qua một hệ thống lớn hơn, đắt tiền hơn. Mô hình này xử lý lập trình tác tử, sử dụng máy tính, đọc biểu đồ và suy luận đa ngành ở những cấp độ mà, theo dữ liệu do chính Anthropic công bố, vượt Claude Fable 5.1 — mô hình có năng lực cao nhất trước đó của công ty — trên một số thước đo. Với những người dùng và nhà phát triển từng thấy Opus 5 hữu ích nhưng đắt đỏ, khoảng cách giữa những gì mô hình có thể làm và chi phí phải trả đã thay đổi đáng kể.

Chênh lệch giá là rất cụ thể. Opus 5.5 tính phí 4 USD cho mỗi triệu token đầu vào và 20 USD cho mỗi triệu token đầu ra; mức phí tương ứng của Opus 5 là 5 USD và 25 USD. Chi phí đọc từ bộ nhớ đệm giảm từ 0,50 USD xuống còn 0,20 USD cho mỗi triệu token. Anthropic cho biết các khối lượng công việc thông thường rẻ hơn khoảng 40% xét tổng thể. Tốc độ cũng đi theo cùng chiều hướng: mô hình tiêu chuẩn tạo văn bản nhanh hơn Opus 5 trên 30%. Một tùy chọn chế độ nhanh riêng biệt, có giá 8 USD cho đầu vào và 40 USD cho đầu ra trên mỗi triệu token, đạt tốc độ gấp tới 2,5 lần Opus 5 tiêu chuẩn — một thiết lập hữu ích cho các ứng dụng nhạy cảm với độ trễ.

Các số liệu hiệu năng do Anthropic công bố xếp Opus 5.5 trên Fable 5.1, Opus 5 và GPT-6 Astra ở bốn trong sáu bài đánh giá chuẩn. Trên Terminal-Bench 4.0, bài kiểm tra thực thi mã trong môi trường terminal trực tiếp, Opus 5.5 đạt 66,4% so với 55,8% của Fable 5.1. Ở Humanity’s Last Exam, một bài kiểm tra bao quát kiến thức học thuật và chuyên môn xuyên các lĩnh vực, kết quả là 67,7% so với 65,6%. OSWorld 2.0, thước đo khả năng vận hành giao diện máy tính, cho thấy tỷ lệ 81,8% so với 80,7%. Một thử nghiệm của Deloitte cho thấy Opus 5.5 ở thiết lập nỗ lực thấp nhất đã phát hiện 72% lỗi lập trình đã biết trong quá trình rà soát, so với 56% của Opus 5 ở mức nỗ lực cao. Các con số này đến từ Anthropic và những đối tác do hãng lựa chọn; biên sai số được nêu dao động từ ±1,6 đến ±5 điểm phần trăm, và chưa có xác minh độc lập từ bên thứ ba nào được công bố vào thời điểm ra mắt.

Hai lĩnh vực phá vỡ khuôn mẫu này. Trên AutomationBench, GPT-6 Astra đạt 41,4% so với 40,0% của Opus 5.5. Trên Terminal-Bench-Science, khoảng cách rộng hơn: Astra đạt 64,6%, trong khi Opus 5.5 dừng ở 58,7%. Cả hai chênh lệch đều nằm trong các biên sai số đã nêu — chúng có thể chỉ là nhiễu — nhưng cũng có thể không phải vậy. Anthropic đưa những dòng dữ liệu này vào chính bảng công bố của mình, điều mà phần lớn công ty AI không làm khi ra mắt sản phẩm. Các con số vẫn cần được xem xét độc lập trước khi có thể được coi là kết luận đã ngã ngũ.

Về an toàn, Anthropic cho biết Opus 5.5 đã được các nhóm bên ngoài, trong đó có METR, đánh giá trước khi phát hành. Trong cuộc kiểm toán hành vi nội bộ của công ty, với gần 2.000 kịch bản được thiết kế để kiểm tra liệu mô hình có cố tìm cách vượt qua các ràng buộc áp đặt lên nó hay không, Opus 5.5 được mô tả là ít có khả năng thử né tránh như vậy hơn Opus 5 tới 85%. Các mô hình mạnh hơn thường có năng lực tìm ra cách lách tốt hơn, vì thế sự cải thiện này có ý nghĩa nếu nó được duy trì. Trải nghiệm triển khai thực tế sẽ là phép thử thực sự.

Điều khiến lần ra mắt này khác thường là thời điểm của nó. Đầu tháng này, CEO Anthropic Dario Amodei đã công bố một bài luận, trong đó ông viết rằng mình đã đi đến kết luận: để xử lý đầy đủ các rủi ro AI cần phải “điều tiết tốc độ phát triển năng lực để công tác phòng ngừa rủi ro có thời gian bắt kịp”. Sam Altman của OpenAIElon Musk bày tỏ đồng tình với mối lo ngại chung này. Jensen Huang của Nvidia nói rằng khoa học nền tảng không ủng hộ quan điểm đó. Và rồi Anthropic phát hành một mô hình nhanh hơn, rẻ hơn và có năng lực cao hơn phiên bản tiền nhiệm. Một cách diễn giải là: một mô hình có các đánh giá an toàn tốt hơn và khả năng tiếp cận rộng hơn chính là điều Amodei muốn nói tới. Một cách khác là: bài luận đã nêu sự tiến bộ về năng lực là mối lo, và năng lực quả thực đã tiến bộ. Cả hai cách đọc đều cùng tồn tại trong một tập hợp sự thật, và riêng các điểm chuẩn của Anthropic không thể quyết định cách nào đúng.

Claude Opus 5.5 có mặt từ ngày 22 tháng 9 năm 2026 dưới ID mô hình API claude-opus-5-5. Mô hình hoạt động trong Claude dành cho các gói Pro, Max, Team và Enterprise, đồng thời có thể truy cập qua AWS, Google Cloud và Microsoft Azure. Anthropic đang nâng giới hạn sử dụng trên các gói thuê bao theo khung năm giờ. Sonnet 5.5 và Haiku 5.5, hai thành viên còn lại của dòng 5.5, dự kiến sẽ ra mắt trong những tuần tới; hiện chưa có giá bán hoặc ngày phát hành cụ thể nào được công bố cho cả hai.

Thẻ: , , , , ,

Thêm chúng tôi trên Google

Thảo luận

Có 0 bình luận.