Công nghệ

Chip Jalapeño cua OpenAI chay suy luan voi hieu qua 1,9 lan so voi Nvidia Blackwell tren moi watt

Adrian Kessler

OpenAI tự xây dựng chip riêng. Công ty đã trình diễn Jalapeño tại hội nghị Hot Chips vào ngày 25 tháng 8, một thiết kế silicon được phát triển hợp tác với Broadcom, xử lý các yêu cầu suy luận với tốc độ 85.448 token mỗi giây trên mỗi kilowatt. Kiến trúc Blackwell của Nvidia, tiêu chuẩn thị trường hiện tại, đạt 44.960 trên cùng chỉ số. Tỷ lệ là 1,9 lần.

Chỉ số này quan trọng vì suy luận là cách các hệ thống AI hoạt động trong sản xuất. Đào tạo diễn ra một lần; suy luận diễn ra mỗi khi ai đó gửi truy vấn đến ChatGPT, sử dụng API, hoặc tương tác với bất kỳ ứng dụng nào chạy mô hình ngôn ngữ. Chi phí suy luận ở quy mô lớn là động lực chính của kinh tế dịch vụ AI. Một con chip cắt giảm tiêu thụ năng lượng suy luận khoảng một nửa, nếu được triển khai rộng rãi, sẽ thay đổi chi phí mỗi truy vấn khi chạy mô hình.

Trên các khối lượng công việc tương tác, nơi độ trễ phản hồi là yếu tố giới hạn, lợi thế của Jalapeño còn lớn hơn. Báo cáo của SemiAnalysis về bài thuyết trình tại Hot Chips đưa ra khoảng từ 2,1 đến 4,1 lần tốt hơn Blackwell trên các điểm chuẩn đó. Khoảng dao động phản ánh sự khác biệt giữa các loại nhiệm vụ cụ thể; mức thấp hơn là so sánh bảo thủ hơn.

Con chip chỉ xử lý suy luận. Nó không chạy các khối lượng công việc đào tạo đã tạo ra các mô hình mà Jalapeño được thiết kế để chạy. Những việc đó vẫn cần phần cứng Nvidia. Broadcom sản xuất con chip theo thỏa thuận thiết kế tùy chỉnh với OpenAI chứ không bán nó như một sản phẩm thương mại. Sự sắp xếp này mang lại cho OpenAI một lớp suy luận được xây dựng có mục đích mà không yêu cầu họ phải cạnh tranh trên thị trường chip thương mại.

Lộ trình triển khai của OpenAI bị giới hạn. Triển khai quy mô nhỏ được lên kế hoạch trước cuối năm 2026; triển khai rộng hơn là mục tiêu năm 2027. Con chip vẫn đang trong giai đoạn mẫu kỹ thuật, nghĩa là phiên bản sản xuất chưa được xuất xưởng ở quy mô lớn. Các điểm chuẩn tại Hot Chips đại diện cho mục tiêu thiết kế, không phải một đợt sản xuất đã được xác minh. Khoảng cách giữa thông báo hội nghị và triển khai vận hành cho silicon tùy chỉnh thường được tính bằng năm.

Thông báo này phù hợp với xu hướng rộng hơn của các công ty AI lớn hướng tới silicon tùy chỉnh. Google đã vận hành Tensor Processing Units của riêng mình trong sản xuất suốt một thập kỷ. Amazon chạy Trainium và Inferentia trong AWS. Meta vận hành chip suy luận nội bộ của riêng mình. Sự gia nhập của OpenAI xác nhận rằng ở quy mô hàng trăm triệu người dùng hoạt động, kinh tế của việc hoàn toàn phụ thuộc vào các nhà cung cấp GPU bên ngoài trở nên khó khăn đến mức đủ để biện minh cho chi phí của một chương trình thiết kế tùy chỉnh.

Thẻ: , , , , ,

Thảo luận

Có 0 bình luận.