Công nghệ

OpenAI tuyên bố Astra là mô hình AI an toàn nhất nhưng không hiển thị cách nó suy luận

Adrian Kessler

Astra hoạt động trên nhiều lĩnh vực: viết mã, phân tích bảo mật, điều khiển máy tính và các tác vụ chuyên nghiệp đa bước với tốc độ và độ chính xác vượt trội so với mô hình trước đó của OpenAI là Sol và mô hình Fable của Anthropic trên các chuẩn đánh giá kỹ thuật phần mềm phổ biến. Công ty mô tả đây là mô hình đầu tiên họ xây dựng vượt qua ngưỡng ‘Critical’ về năng lực an ninh mạng: nó có thể xác định và khai thác các lỗ hổng bảo mật chưa từng được phát hiện, với quy mô và tốc độ mà không đội ngũ con người nào có thể sánh kịp.

Cơ chế đằng sau điều này là một kỹ thuật có tên gọi “opaque recurrence” (truy hồi không minh bạch). Các mô hình ngôn ngữ tiêu chuẩn tạo ra lời giải thích dưới dạng văn bản có thể đọc được – đó là chuỗi suy luận mà các nhà nghiên cứu dùng để kiểm tra các quyết định, phát hiện sai sót và xác minh rằng mô hình đang hoạt động như mong đợi. Astra hoạt động mà không sinh ra văn bản đó. Nó có thể giải quyết các bài toán khó mà không để lại dấu vết nào có thể đọc được về quy trình xử lý. Jakub Pachocki, nhà khoa học trưởng của OpenAI, thừa nhận sự thay đổi này: các mô hình có năng lực cao hơn, ông nói, có thể “thực hiện các tác vụ khó hơn bằng cách sử dụng ít token ngôn ngữ hơn.” Việc giám sát trở nên khó khăn hơn tương ứng.

Điều đó tạo ra một vấn đề mang tính cấu trúc mà chính những tuyên bố của OpenAI đã phơi bày. Công ty gọi Astra là ‘mô hình được căn chỉnh nhất’ từ trước đến nay. Căn chỉnh (alignment) – ngành kỹ thuật liên quan đến việc làm cho hệ thống AI hành xử theo đúng ý định của nhà thiết kế – trong lịch sử vẫn phụ thuộc vào việc đọc những gì mô hình đang làm từng bước một. Một mô hình suy luận một cách vô hình sẽ khiến việc căn chỉnh của chính nó trở nên không thể kiểm chứng bằng phương pháp đó. OpenAI chưa mô tả công khai bất kỳ phương pháp thay thế nào họ sử dụng để xác minh hành vi của Astra trước khi triển khai.

Greg Brockman, chủ tịch của OpenAI, mô tả Astra là một “bước nhảy vọt về thế hệ” và được hỏi trực tiếp rằng liệu nó có đại diện cho trí tuệ nhân tạo tổng quát (AGI) hay không. Câu trả lời của ông: định nghĩa AGI trong hợp đồng vốn chi phối quan hệ đối tác giữa OpenAI và Microsoft không còn hiệu lực nữa. AGI giờ đây, ông nói, là một “khái niệm tinh thần.” Cách đóng khung đó có ý nghĩa quan trọng. Thỏa thuận với Microsoft của OpenAI bao gồm các điều khoản gắn với AGI – những điều kiện mà theo đó các điều khoản của mối quan hệ sẽ thay đổi. Việc mô tả AGI là không xác định sẽ giữ cho các điều khoản đó không được kích hoạt, bất kể Astra thực sự có khả năng gì.

Quyền truy cập lần đầu tiên được cấp cho Daybreak, chương trình an ninh mạng đã được OpenAI thẩm định – một cấu trúc mà công ty định hình là triển khai ưu tiên phòng thủ. Lập luận là các tổ chức đang tìm kiếm lỗ hổng trong hệ thống của chính họ sẽ có được năng lực này trước những kẻ đang tìm kiếm lỗ hổng trong hệ thống của người khác. Logic đó chỉ đúng chừng nào các biện pháp kiểm soát truy cập còn hiệu lực. Khả năng xác định lỗ hổng zero-day của Astra, về mặt thiết kế, chính xác là thứ mà một kẻ tấn công có nguồn lực dồi dào muốn có. Một mô hình suy luận mà không có chuỗi suy nghĩ có thể đọc được cũng khó bị ràng buộc hoặc kiểm toán hơn sau khi xảy ra sự cố.

Quyền truy cập rộng rãi hơn sẽ được mở cho các gói dịch vụ trả phí – Pro, Plus, Enterprise, Business – và thông qua API trong tuần tới.

Thẻ: , , , , ,

Thảo luận

Có 0 bình luận.