Công nghệ

Meta ra mắt Muse Glimmer: tác nhân AI 30B tham số chạy trên GPU của bạn

Adrian Kessler

Meta vừa xây dựng một mô hình AI có 30 tỷ tham số chạy hoàn toàn trên phần cứng tiêu dùng — và phát hành mã nguồn miễn phí. Mô hình có tên Muse Glimmer không đưa tác vụ của bạn qua máy chủ của Meta. Nó thực thi cục bộ trên GPU của chính bạn, với bộ nhớ lượng tử hóa từ 18 đến 20 gigabyte, nằm gọn trong giới hạn của các dòng card đồ họa cao cấp hiện nay.

Điều này quan trọng vì thế hệ mô hình cục bộ trước đây — các biến thể 7 tỷ và 13 tỷ tham số từng làm đầy thư viện Ollama suốt hai năm qua — là những trình tạo văn bản giỏi nhưng lại là tác tử tự động kém. Chúng gặp khó với suy luận nhiều bước, các lời gọi công cụ thất bại giữa chừng, và những tác vụ đòi hỏi nhớ lại điều đã xảy ra ba bước trước. Muse Glimmer được thiết kế riêng cho các quy trình làm việc đó: viết mã, gọi hàm, quản lý lịch, sắp xếp tệp tin, và chuỗi tác vụ nhiều bước tự phục hồi khi một lời gọi công cụ bị lỗi.

Kiến trúc bên dưới là sự chưng cất từ Muse Spark, mô hình thương mại mà Meta bắt đầu bán quyền truy cập API từ tháng trước. Thông qua chưng cất logit và học tăng cường, công ty đã nén flagship đóng của mình thành một dạng vừa vặn trên GPU 24 gigabyte — RTX 5090, M5 Max của Apple, hoặc M4 Max. Giải mã suy đoán đẩy thông lượng cao hơn nữa: RTX 5090 chạy mô hình nhanh gấp 3,1 lần so với khi không có, M5 Max gấp 1,8 lần, M4 Max gấp 1,5 lần. Trong thực tế, khác biệt đó là ranh giới giữa một tác tử phản hồi nhanh nhạy và một tác tử đòi hỏi sự kiên nhẫn.

Mô hình xử lý văn bản và hình ảnh xen kẽ — ảnh chụp màn hình, tài liệu, đầu vào đa phương tiện — và hoạt động trên hơn 100 ngôn ngữ. Nó kết nối tự nhiên với các framework mà người dùng AI cục bộ đã chạy: Ollama, LM Studio, llama.cpp, MLX. Nếu bạn đã kéo mô hình từ Hugging Face và chạy trên phần cứng của mình, Muse Glimmer sẽ hòa vào quy trình đó mà không cần thêm công cụ nào.

Giấy phép là Apache 2.0, nghĩa là không có hạn chế thương mại. Cá nhân, công ty và nhà nghiên cứu có thể sử dụng mà không phải trả tiền cho Meta. Điều đó đặt nó vào một phân khúc khác với các mô hình của OpenAIAnthropic, vốn yêu cầu trả phí theo token ngay cả khi phát triển. So với Gemma4-31B của Google và Qwen3.6-27B của Alibaba — những đối thủ mã nguồn mở có quy mô gần nhất — Meta định vị Muse Glimmer là mạnh so với kích thước của nó trên các chuẩn đánh giá tác tử và mô hình ngôn ngữ tổng quát, mà không đưa ra tuyên bố cụ thể hơn về việc nó thắng ở tác vụ nào.

Ngưỡng phần cứng vẫn còn chọn lọc. Việc nhét 18 gigabyte trọng lượng mô hình vào một GPU nghe có vẻ dễ tiếp cận cho đến khi bạn tính toán GPU đó cần gì. RTX 5090 hiện có giá trên hai nghìn đô la. Máy M5 Max của Apple khởi điểm gần ba nghìn. Đây là AI cục bộ cho một nhóm thu nhập cụ thể, không phải sự thay thế cho đám mây với hầu hết người dùng. Phiên bản lượng tử hóa cũng là một phiên bản giảm độ trung thực của Muse Spark: nó kế thừa tín hiệu huấn luyện từ mô hình thương mại, nhưng không phải là mô hình thương mại. Meta vẫn tiếp tục bán quyền truy cập vào phiên bản có năng lực cao hơn.

Điều thay đổi ở bản phát hành này là tầng tác tử có năng lực của các mô hình cục bộ. Chạy một mô hình 30 tỷ tham số được huấn luyện để hoàn thành tác vụ tự động khác với chạy một mô hình trò chuyện ở cùng số tham số. Sự khác biệt nằm ở cách mô hình xử lý lỗi công cụ và chuỗi nhiều bước — không phải ở cách nó hoàn thành một câu đơn lẻ.

Trọng số có sẵn trên Hugging Face từ ngày 10 tháng 8, theo Apache 2.0. Meta đã xác nhận quan hệ đối tác tối ưu hóa cấp thiết bị với AMD, Arm, Dell, Intel và Nvidia, với các bản dựng tinh chỉnh thêm cho các cấu hình phần cứng cụ thể sẽ theo sau. Cộng đồng AI cục bộ sẽ thử thách mô hình trong vài ngày tới, như họ vẫn làm với mọi bản phát hành quan trọng — kết quả chuẩn đánh giá của cộng đồng đó sẽ cung cấp bức tranh rõ ràng hơn về vị trí thực sự của Muse Glimmer trong vòng hai tuần kể từ hôm nay.

Thẻ: , , , , ,

Thảo luận

Có 0 bình luận.