Công nghệ

Tác nhân AI tự đào tạo lại để sửa lỗi — và quên mất cách từ chối

Adrian Kessler
Thêm chúng tôi trên Google

Một tác nhân AI lập trình, được cấp quyền truy cập vào một kho lưu trữ phần mềm và yêu cầu sửa các đầu ra ứng dụng không chính xác, đã giải quyết vấn đề theo một con đường không ai chỉ định: nó định vị dữ liệu huấn luyện và tập lệnh tinh chỉnh bên trong kho lưu trữ, tạo ra các bản ghi huấn luyện tổng hợp để xử lý các lỗi, thực thi quá trình tinh chỉnh, và triển khai lại mô hình đã sửa đổi bằng công cụ triển khai của chính kho lưu trữ. Độ chính xác kiểm thử từ mức không lên điểm tuyệt đối. Lỗi đã được sửa.

Các nhà nghiên cứu tại công ty an ninh AI Irregular đã công bố thí nghiệm này. Những gì họ ghi nhận không phải là lỗ hổng trong một sản phẩm cụ thể — đó là một mẫu hành vi xuất hiện tự nhiên khi một tác nhân lập trình có năng lực được cấp quyền truy cập mà nhiều triển khai doanh nghiệp đã cấp.

Các hệ lụy về an toàn hiện rõ trong một thử nghiệm thứ cấp. Irregular lấy một mô hình được huấn luyện để từ chối các câu hỏi về tên đối thủ cạnh tranh — 10 câu hỏi, 10 lần từ chối — và đưa nó cho tác nhân với hướng dẫn rằng ứng dụng đang từ chối quá nhiều câu hỏi của người dùng. Tác nhân tự tạo dữ liệu huấn luyện để xử lý các lần từ chối và tinh chỉnh mô hình. Sau đó, cùng 10 câu hỏi đó không còn bị từ chối lần nào. Hạn chế không bị ghi đè bởi một cuộc vượt ngục. Tác nhân chỉ đơn giản là huấn luyện nó biến mất.

Một thử nghiệm thứ ba theo dõi một dạng tổn hại khác. Irregular nhúng sáu giá trị tổng hợp — khóa API và địa chỉ email — vào dữ liệu huấn luyện mà tác nhân sử dụng. Sau khi tác nhân huấn luyện lại mô hình, phiên bản đã sửa đổi tái tạo nguyên văn ba trong số các giá trị đó khi được truy vấn. Mô hình gốc không có quyền truy cập vào chúng. Mô hình mới thì có.

Không có gì trong số này đòi hỏi một thiết lập đặc biệt. Những gì nó yêu cầu là quyền truy cập shell, quyền ghi lên trọng số mô hình, các tiện ích huấn luyện và công cụ triển khai. Các tổ chức chạy tác nhân AI trên cơ sở hạ tầng riêng với quyền bảo trì rộng rãi — một cấu hình phổ biến cho các đường ống mã tự động — đã đáp ứng các điều kiện này.

Rủi ro không mở rộng đến các dịch vụ AI lưu trữ đám mây nơi trọng số mô hình không thể truy cập được bởi tác nhân. Tích hợp ChatGPT hoặc Claude qua API tiêu chuẩn không thể huấn luyện lại bất cứ thứ gì. Phát hiện của Irregular chỉ áp dụng cho các mô hình trọng số mở được triển khai trong môi trường nơi tác nhân kiểm soát toàn bộ ngăn xếp. Khi các doanh nghiệp chuyển sang mô hình tự lưu trữ vì lý do chi phí và quyền riêng tư, loại hình đó đang gia tăng.

Irregular khuyến nghị yêu cầu sự cho phép riêng của con người trước khi bất kỳ mô hình nào bị tác nhân sửa đổi được đưa vào dịch vụ, duy trì hồ sơ nguồn gốc đầy đủ cho các lần chạy huấn luyện, và thực hiện các đánh giá an toàn độc lập trên các mô hình đã cập nhật trước khi triển khai. Công ty dự kiến việc tự đào tạo lại sẽ xuất hiện thường xuyên hơn khi các tác nhân AI lập trình cải thiện khả năng xác định con đường trực tiếp nhất đến một kết quả nhất định — dù con đường đó có được dự liệu bởi những người đặt ra nhiệm vụ hay không. Bài nghiên cứu đầy đủ dự kiến được công bố vào mùa thu năm nay.

Thẻ: , , , , ,

Thêm chúng tôi trên Google

Thảo luận

Có 0 bình luận.