Công nghệ

AI của Alibaba đọc màn hình của bạn đạt 92% trên điện thoại thực tế và chạy trên phần cứng của bạn

Susan Hill

Qwen-UI-Agent của Alibaba không cần quyền truy cập đặc biệt vào ứng dụng của bạn. Nó đọc màn hình, nhận diện nội dung và thực hiện thao tác nhấp chuột, xử lý các tác vụ từ nhắn tin đến chỉnh sửa tài liệu chỉ thông qua nhận thức thị giác. Các trọng số mô hình — MAI-UI-2B và MAI-UI-8B — đã được đưa lên Hugging Face trong tuần này, đưa hệ thống vào tầm với của bất kỳ nhà phát triển nào có GPU.

Các chuẩn mực rất cụ thể. Trên MobileWorld, bài đánh giá tác tử di động tiêu chuẩn, Qwen-UI-Agent đạt 82,1%, vượt GPT-5.6 12 điểm phần trăm và Claude Opus 4.8 14,6 điểm. Khoảng cách này không hề nhỏ — các hệ thống phương Tây tương tự đã dậm chân ở mức thấp đến trung bình 70% trên cùng bài kiểm tra trong nhiều tháng. Trên thử nghiệm thiết bị thật — các tác vụ chạy trên điện thoại Android thực tế thay vì giả lập — điểm số tăng lên 92,2%. Trên AndroidDaily, một bài đánh giá điện thoại thật rộng hơn, mô hình đạt 97,5%. Đối với sử dụng máy tính để bàn, được đo qua OSWorld-Verified, nó đạt 79,5%, vượt cả GPT-5.5 và Gemini 3.1 Pro.

Alibaba đã huấn luyện mô hình trên dữ liệu từ hơn 100 thiết bị di động thật chạy 150 ứng dụng khác nhau, sau đó xây dựng chuẩn mực riêng — MobileWorld-Real — với hơn 400 tác vụ để xác minh hiệu suất bên ngoài phòng thí nghiệm. Khoảng 40% tác vụ trên máy tính để bàn liên quan đến các thao tác dòng lệnh hàng loạt kết hợp với nhấp chuột trực quan, một lựa chọn thiết kế phản ánh cách máy tính thực sự hoạt động thay vì cách các bản demo được dàn dựng.

Một lớp an toàn được tích hợp trong quy trình. Mô hình từ chối các tác vụ mà nó đánh dấu là bất hợp pháp hoặc có rủi ro cao, và nó dừng lại ở các thao tác nhạy cảm — thanh toán, xóa dữ liệu, ủy quyền quyền riêng tư — yêu cầu xác nhận rõ ràng từ người dùng trước khi tiếp tục. Hệ thống xử lý các chuỗi dài hơn 100 bước bằng cách sử dụng học tăng cường được huấn luyện trên khoảng 10.000 môi trường mô phỏng đồng thời.

Điểm số chuẩn mực để lại những câu hỏi khó hơn. Qwen-UI-Agent được đánh giá trên các tác vụ có cấu trúc; sử dụng điện thoại thực tế thì đầy gián đoạn, nhiều thông báo, và liên quan đến các ứng dụng cập nhật giao diện mà không báo trước. AI đọc màn hình cũng đặt ra một câu hỏi về quyền riêng tư mà báo cáo kỹ thuật của Alibaba không đề cập: một mô hình xử lý từng pixel trên màn hình của bạn có quyền truy cập vào chi tiết ngân hàng, tin nhắn riêng tư và dữ liệu mà hầu hết người dùng chưa bao giờ nghĩ đến việc giao cho một hệ thống bên thứ ba. Các hướng dẫn về điều gì xảy ra với dữ liệu đó trong các triển khai của bên thứ ba là không có.

Dự án được lưu trữ tại Tongyi-MAI/MAI-UI trên GitHub; các trọng số mô hình hiện có trên Hugging Face. Chưa có API thương mại hoặc giá triển khai nào được công bố. Bài kiểm tra tiếp theo cho Qwen-UI-Agent không phải là một chuẩn mực — mà là liệu các nhà phát triển xây dựng trên các trọng số mở có thể tái tạo trong sản xuất những gì Alibaba đã ghi nhận trong phòng thí nghiệm hay không.

Thẻ: , , , , ,

Thảo luận

Có 0 bình luận.