Công nghệ

Anthropic tiết lộ: Claude dẫn dắt 26% nghiên cứu AI của chính mình, tăng từ 0% trong 9 tháng

Adrian Kessler
Thêm chúng tôi trên Google

Một trong mỗi bốn nhiệm vụ nghiên cứu AI tại Anthropic hiện do Claude dẫn dắt. Không phải được giao cho Claude như một trợ lý, không phải được Claude xem xét sau đó — được bắt đầu từ một yêu cầu cấp cao và hoàn thành từ đầu đến cuối, với một người kiểm tra kết quả khi nó xong. Chín tháng trước, con số đó dưới một phần trăm.

Anthropic phân biệt giữa hai điều. Khi Claude dẫn dắt một nhiệm vụ, nó xử lý hầu hết công việc một cách độc lập; người giám sát kiểm tra đầu ra thay vì hướng dẫn từng bước. Đó là một loại khác với 90% tổng R&D của Anthropic trong đó Claude đóng vai trò cộng tác — con người điều khiển, Claude xử lý các phần cụ thể. Dẫn dắt là phân loại khó hơn. Nó hiện chiếm 26% tổng nghiên cứu AI mà công ty thực hiện, tính theo thời gian mà các nhà nghiên cứu lẽ ra phải dành cho các nhiệm vụ đó.

Quy mô là cụ thể. Khoảng 30.000 tác nhân Claude chạy đồng thời trên các nền tảng nội bộ của Anthropic, thực hiện công việc trên đào tạo mô hình, đánh giá, nghiên cứu khả năng giải thích và phân tích an toàn. Vào tháng 8, các tác nhân đó đã đưa ra hơn một tỷ quyết định. Hệ thống giám sát thời gian thực của Anthropic đã chặn 0,002% trong số đó — khoảng 1 trong mỗi 47.000 hành động — trước khi thực thi. Sau đó, một lớp ngoại tuyến đã gắn cờ khoảng 100.000 bản ghi mỗi tuần để xem xét, trong đó khoảng 50 được chuyển lên con người.

An toàn có một ngân sách có thể đo lường bên trong hệ thống đó. Trong một tuần duy nhất vào tháng 7, công việc dành cho việc giữ an toàn cho các tác nhân đã tiêu thụ 6% tổng sức tính toán nghiên cứu và phát triển AI, và 12% sức tính toán mà chính R&D do AI điều khiển đang sử dụng. Anthropic cho biết họ đã phân loại một cách thận trọng, loại trừ các bộ phân loại an toàn chuyên dụng khỏi số đếm, điều này cho thấy tỷ lệ thực tế còn cao hơn.

Một vấn đề nhận thức luận nằm ở trung tâm của tất cả điều này. Sự đóng góp của Claude vào nghiên cứu của Anthropic được đánh giá một phần bởi chính Claude. Một mô hình Claude đánh giá công việc của Claude; số liệu giám sát chỉ bao gồm một nền tảng nội bộ; và việc phân loại sức tính toán dựa vào các mô hình Claude lấy mẫu và dán nhãn các lần chạy của chính chúng. Không có bên thứ ba độc lập nào kiểm toán phương pháp luận. Ba con số mà Anthropic công bố là chính xác, nhưng chúng là sự chính xác tự báo cáo — điều này khác với sự chính xác đã được xác minh.

Anthropic cho biết họ sẽ bắt đầu đưa các nhà đánh giá bên ngoài vào quy trình. Chưa có tên, chưa có ngày bắt đầu và chưa có tiết lộ tương tự nào từ các phòng thí nghiệm AI khác xuất hiện. Con số 26%, với tốc độ mà nó đã thay đổi, là một bức ảnh chụp nhanh hơn là một giới hạn.

Thẻ: , , , , ,

Thêm chúng tôi trên Google

Thảo luận

Có 0 bình luận.