Công nghệ

AMD mua lại Taalas — chip AI ghi trọng số vào silicon, nhanh hơn Nvidia 48 lần

Susan Hill

AMD đang mua lại Taalas, một startup ở Toronto chuyên sản xuất chip nhúng trọng số mô hình AI một cách vĩnh viễn vào silicon thay vì tải chúng từ bộ nhớ trong quá trình suy luận. Chip HC1 của công ty này tạo ra 16,960 token mỗi giây trên mô hình Llama 3.1 8B của Meta — một con số mà AMD tuyên bố nhanh hơn 48 lần so với GPU của Nvidia và nhanh hơn 8.5 lần so với Cerebras, chuyên gia về chip suy luận.

Công nghệ đằng sau Taalas khai thác một sự kém hiệu quả về cấu trúc trong cách hoạt động suy luận AI hiện tại. Các GPU tiêu chuẩn rất linh hoạt: chúng có thể chạy bất kỳ mô hình nào, chuyển đổi giữa các tác vụ theo yêu cầu và được lập trình lại khi mô hình được cập nhật. Sự linh hoạt đó cũng là nút thắt cổ chai. Việc tải hàng tỷ trọng số mô hình từ bộ nhớ băng thông cao vào các đơn vị tính toán trong mỗi yêu cầu suy luận tạo ra độ trễ mà việc thêm nhiều GPU không thể loại bỏ.

Taalas nhúng các trọng số đó trực tiếp vào silicon của chip tại thời điểm sản xuất. Mô hình tồn tại trong phần cứng, không phải trong bộ nhớ được truy xuất mỗi yêu cầu. Các con số thông lượng mà AMD quảng cáo phản ánh lựa chọn kiến trúc đó — nhưng với một cái giá mà công ty không giấu giếm: một khi chip được sản xuất với một mô hình cụ thể được tích hợp sẵn, việc cập nhật nó đòi hỏi một quá trình tape-out silicon mới. Taalas cho biết chỉ cần thay đổi hai lớp kim loại để làm mới mô hình, giúp rút ngắn chu kỳ, nhưng những chip này không thể thích ứng ngay lập tức với phiên bản mô hình mới hơn.

Theo kế hoạch tích hợp của AMD, các chip Taalas sẽ xử lý việc tạo token — giai đoạn tốn thời gian nhất của suy luận — trong khi GPU Instinct của AMD xử lý tính toán prefill và attention ở đầu mỗi yêu cầu. Hệ thống kết hợp chạy trên nền tảng rack-scale Helios của AMD. Đối với các nhà vận hành đám mây chạy khối lượng công việc với mô hình cố định — chatbot dịch vụ khách hàng, quy trình xử lý tài liệu, dịch thuật thời gian thực — lời hứa là thông lượng trên mỗi watt rack mà các cụm GPU linh hoạt không thể sánh được với chi phí tương đương.

Liệu cách tính toán đó có tồn tại trước tốc độ làm mới mô hình của ngành công nghiệp hay không là câu hỏi trọng tâm. Các phòng thí nghiệm lớn hiện nay cập nhật mô hình sản xuất của họ khoảng sáu tháng một lần. Một chip bị khóa với Llama 3.1 8B hôm nay có thể phải bị loại bỏ khi phiên bản kế tiếp trở thành mục tiêu triển khai tiêu chuẩn. Tuyên bố làm mới hai lớp kim loại của Taalas giúp ích, nhưng một quá trình tape-out silicon vẫn mất hàng tháng để hoàn thành — một độ trễ đáng kể khi các mô hình thay đổi nhanh hơn chu kỳ phần cứng.

Thương vụ mua lại diễn ra bảy tháng sau khi Nvidia mua Groq — một cách tiếp cận khác cho cùng vấn đề tốc độ suy luận — với giá 20 tỷ đô la theo báo cáo. Các bộ xử lý tensor streaming của Groq cũng tối ưu hóa thông lượng nhưng vẫn giữ khả năng tải các mô hình khác nhau. AMD đang trả một khoản tiền không được tiết lộ nhưng được cho là nhỏ hơn cho một startup đã đặt cược ngược lại.

Đối với người mua, thương vụ mua Taalas thuộc về lộ trình hơn là danh mục sản phẩm. Chip HC2, nhắm mục tiêu các mô hình có tới 20 tỷ tham số, vẫn đang trong quá trình phát triển. Chuẩn so sánh 48x áp dụng cho HC1 trong các điều kiện cụ thể — triển khai thực tế với lưu lượng hỗn hợp và kích thước batch thay đổi sẽ cho ra kết quả khác nhau. Thương vụ dự kiến hoàn tất vào quý 4 năm 2026, chờ phê duyệt của cơ quan quản lý. HC1 đã được xuất xưởng vào tháng 2 trên tiến trình 6nm; ngày xuất xưởng và nút tiến trình mục tiêu của HC2 vẫn chưa được công bố.

Thẻ: , , , ,

Thảo luận

Có 0 bình luận.