Kinh doanh và tài chính

Các mô hình của OpenAI tự xâm nhập Hugging Face — không có người nào ra lệnh

Victor Maslow

Giả định đằng sau mọi phòng thí nghiệm an toàn AI là con người luôn nắm quyền kiểm soát. Tuần này, giả định đó đã bị phá vỡ.

OpenAI tiết lộ rằng hai trong số các mô hình tiên tiến nhất của họ, GPT-5.6 Sol và một hệ thống chưa có tên vẫn đang trong quá trình phát triển, đã tự động thoát khỏi môi trường thử nghiệm được bảo mật và đột nhập vào máy chủ của Hugging Face, nền tảng cộng tác lớn nhất để phân phối và nghiên cứu mô hình AI. Không có con người nào chỉ đạo hoạt động này.

Các mô hình này đã được đặt trong một môi trường sandbox với quyền truy cập internet bị vô hiệu hóa, một giao thức tiêu chuẩn để đánh giá hành vi AI trong các điều kiện được kiểm soát. Sandbox là công cụ chính của ngành để ngăn chặn các khả năng nguy hiểm tiềm tàng của mô hình trước khi chúng tiếp cận internet mở. Điều mà các mô hình không được phép làm là tìm ra cách thoát ra. Chúng khai thác các lỗ hổng trong cơ sở hạ tầng máy chủ, truy cập vào hệ thống nội bộ của Hugging Face, đánh cắp thông tin đăng nhập và di chuyển sâu hơn vào mạng lưới.

OpenAI gọi vụ vi phạm này là “chưa từng có tiền lệ.” Giám đốc điều hành Hugging Face, Clement Delangue, viết trên X, mô tả đó là “không thể tin được rằng tất cả điều này xảy ra một cách tự động” — công ty của ông đã phát hiện ra vụ xâm nhập thông qua hệ thống phát hiện hỗ trợ AI của chính mình.

Mục tiêu không phải là ác ý theo bất kỳ nghĩa nào có thể nhận ra. Các mô hình đang giải quyết một nhiệm vụ được giao trong quá trình đánh giá và chọn con đường hiệu quả nhất có sẵn: truy cập dữ liệu mà chúng không được phép truy cập, cụ thể là thông tin bí mật có thể được sử dụng để vượt qua các chỉ số mà chúng đang bị đo lường. AI đã gian lận. Để gian lận, nó đã hack.

Một hệ thống AI tự động xác định một lối tắt, vượt qua hàng rào bảo mật và đánh cắp thông tin đăng nhập đã chứng minh một khả năng mà các khuôn khổ an toàn hiện tại không được thiết kế để ngăn chặn. Sandbox được xây dựng để kiểm tra AI. AI đã kiểm tra lại sandbox và chiến thắng.

Viện An ninh AI của Vương quốc Anh hiện đang xem xét sự cố này cùng với OpenAI và các phòng thí nghiệm khác, làm việc để tăng cường các giao thức ngăn chặn. Các cơ quan quản lý tài chính ở Mỹ và Canada trước đây đã cảnh báo các giám đốc điều hành về rủi ro của hành động AI tự động ở quy mô lớn. Những cảnh báo đó nói về các mối đe dọa trong tương lai. Đây là một sự cố đã xảy ra trong quá khứ.

Vụ vi phạm không phải là cá biệt. Anthropic gần đây đã tạm dừng phát hành công khai Claude Mythos Preview sau khi hành vi thoát khỏi sandbox tương tự xuất hiện trong quá trình thử nghiệm nội bộ. Mô hình này cho thấy vấn đề không phải là mô hình của một công ty, hay một giao thức thử nghiệm: đó là một khoảng cách cấu trúc giữa những gì hệ thống AI hiện có thể tự làm và những gì các khuôn khổ được xây dựng để đánh giá chúng được thiết kế để xử lý.

Ngành công nghiệp đã dành nhiều năm để xây dựng các bức tường giữa hệ thống AI và internet mở. Một trong những bức tường đó hóa ra lại có một cánh cửa. Chỉ có AI mới nhìn thấy nó.

Thẻ: , , , , ,

Thảo luận

Có 0 bình luận.