Công nghệ

Nvidia PAIR gộp GPU nhà bạn lại để chạy tác nhân AI nhanh gấp đôi — miễn phí

Susan Hill

Một công cụ miễn phí mới từ Nvidia có tên PAIR – Personal AI Router – định tuyến các tác vụ tác tử AI qua nhiều máy tính trong mạng gia đình của bạn, biến bộ sưu tập PC chơi game, máy trạm và cả Mac của bạn thành một cụm suy luận thống nhất. Ý tưởng khá đơn giản: hầu hết các máy tính nặng về AI đều nằm không phần lớn thời gian, và các khối lượng công việc AI cục bộ ngày càng được xây dựng xung quanh các tác tử sinh ra hàng chục tác vụ con độc lập cùng một lúc. PAIR kết nối các chu kỳ nhàn rỗi đó.

Phần mềm hoạt động như một proxy trong suốt trên nền Ollama và LM Studio – hai công cụ suy luận cục bộ phổ biến nhất – vì vậy các thiết lập hiện có không cần thay đổi mã. Khi được cài đặt trên mỗi máy, PAIR sử dụng mDNS – cùng giao thức mà máy in của bạn sử dụng để xuất hiện trên mạng – để tự động phát hiện các thiết bị tương thích. Một tác tử chính gửi công việc của nó như bình thường, và PAIR quyết định máy nào xử lý tác vụ con nào dựa trên các mô hình mà mỗi máy có sẵn. Không yêu cầu thiết lập giống hệt nhau trên các máy: một PC chơi game chạy Llama 3.3 và một laptop có Mistral có thể phối hợp trong cùng một công việc.

Điểm chuẩn mà Nvidia công bố làm rõ sự khác biệt: một tác vụ năm tác tử phụ mất 18 phút trên một laptop RTX Spark đơn lẻ hoàn thành trong 8 phút 48 giây trên một cụm ba thiết bị. Đó là tốc độ tăng gấp khoảng 2 lần mà không cần động đến một dòng mã hay trả tiền cho điện toán đám mây. Mức tăng tỉ lệ thuận với số lượng máy và bản chất của khối lượng công việc – các tác vụ chia thành nhiều phần song song được hưởng lợi nhiều nhất.

Quyền riêng tư là điểm bán hàng khác, và nó là điểm bền vững hơn. Mọi lời nhắc, tệp và ngữ cảnh tác tử đều ở lại trên mạng gia đình của bạn. Không có gì được định tuyến đến dịch vụ suy luận đám mây; không có khóa API, không đo lường sử dụng, và không có công ty nào nhận được các truy vấn của bạn. Đối với bất kỳ ai chạy tác tử trên các tài liệu nhạy cảm – dự thảo pháp lý, ghi chú y tế, thư từ cá nhân – sự khác biệt đó quan trọng hơn các con số điểm chuẩn.

Các lưu ý là có thật. PAIR không đảm bảo chất lượng dịch vụ: nếu máy bạn đang trông cậy đánh thức GPU của nó cho một trò chơi hoặc xuất video, PAIR phân phối lại khối lượng công việc đó cho bất cứ thứ gì khác có sẵn. Công cụ được thiết kế công khai cho các tác vụ chạy dài với thời hạn linh hoạt, không phải cho các ứng dụng mà độ trễ phải có thể dự đoán được. Nó cũng là phần mềm beta. Nvidia đang chào mời công cụ này đến những người đam mê có ít nhất một máy tương thích – card GeForce RTX dòng 20 trở lên, hoặc chip Apple M4-series – và kỳ vọng rằng họ đã biết cách sử dụng Ollama.

PAIR miễn phí, mã nguồn mở và hiện có sẵn ở dạng beta trên Windows, macOS và Linux. Nvidia chưa công bố lộ trình cho các đảm bảo QoS hoặc ngày phát hành ổn định. Ngưỡng thực tế để hưởng lợi từ nó là hai máy với phần cứng đủ mạnh, điều này loại trừ hầu hết các thiết lập một máy tính. Đối với người dùng đã chạy Ollama trên hơn một thiết bị ở nhà, rào cản gia nhập đủ thấp để biện minh cho việc dùng thử.

Thẻ: , , , , ,

Thảo luận

Có 0 bình luận.