Công nghệ

Microsoft gọi việc AI thu thập dữ liệu là “vụ đánh cắp lao động lớn nhất lịch sử” trong tài liệu nội bộ

Adrian Kessler
Thêm chúng tôi trên Google

Một nhà khoa học của Microsoft đã đặt tên cho thứ mà công ty đang xây dựng, và cái tên đó chẳng hề tích cực. Khi xem xét cách các mô hình ngôn ngữ lớn học từ web mở, ông gọi đó là “vụ đánh cắp lao động lớn nhất lịch sử nhân loại.” Câu nói này được viết cho nội bộ. Giờ nó đã trở thành một vật trưng bày tại tòa.

Cụm từ này đang được dùng như một phát hiện bất ngờ: chính nhân viên của gã khổng lồ AI lại gọi mô hình kinh doanh của công ty là hành vi trộm cắp. Cách hiểu đó quá hạn hẹp. Điều mà các tài liệu được công bố thực sự cho thấy là một công ty hiểu rõ cơ chế mình đang kiếm tiền, mô tả cơ chế đó bằng ngôn ngữ rõ ràng, và vẫn tung sản phẩm ra thị trường. Phần thú vị không nằm ở lời lẽ xúc phạm. Nó nằm ở sơ đồ bên dưới.

Tài liệu này thuộc về Brent Hecht, giám đốc khoa học ứng dụng của Microsoft, và nó xuất hiện trong vụ kiện bản quyền mà The New York Times đệ đơn chống lại OpenAI và Microsoft. Hecht lập luận rằng việc huấn luyện mô hình trên các tác phẩm đã xuất bản mà không trả phí tương đương với “một vụ đánh cắp kinh hoàng với quy mô chưa từng có.” Một bài thuyết trình nội bộ khác đi sâu hơn vào cơ chế: nó cảnh báo rằng chiến lược nội dung AI của Microsoft đã bắt đầu một “vòng lặp diệt vong” và sẽ “làm tổn hại đến hiệu suất của mô hình và toàn bộ web cùng lúc.” Một dòng trong đó viết rằng các mô hình ngôn ngữ lớn là “một sản phẩm phá hủy chuỗi cung ứng của chính nó.”

Câu cuối cùng đó là toàn bộ câu chuyện trong bảy từ. Một chatbot trả lời câu hỏi ngay trong ô tìm kiếm sẽ loại bỏ lý do để nhấp vào trang mà nó đã học. Ít nhấp chuột hơn đồng nghĩa với ít doanh thu hơn cho các trang web tạo ra bài viết, dẫn đến ít trang sống sót hơn, và do đó ít văn bản con người mới mẻ hơn cho mô hình tiếp theo học. Microsoft không lý thuyết hóa vòng lặp này từ bên ngoài. Dữ liệu của chính họ đo lường nó: công cụ trả lời của Copilot đã làm giảm tỷ lệ nhấp chuột vào trang Times tới 93% so với tìm kiếm thông thường.

Các tài liệu cũng định lượng phần đầu vào của giao dịch. Dữ liệu huấn luyện giai đoạn giữa của OpenAI chứa hơn 91.000 bản sao tác phẩm của Times, Daily News và Trung tâm Báo chí Điều tra. Một bộ dữ liệu lấy từ Common Crawl mang hơn hai triệu tài liệu chỉ riêng từ nytimes.com. Một bộ sưu tập có tên Project Mango chứa ít nhất 160.000 tác phẩm độc nhất từ các nhà xuất bản tin tức. Các tài liệu mô tả việc vượt qua tường phí và gỡ bỏ thông báo bản quyền khỏi văn bản trước khi đưa vào huấn luyện.

Các giám đốc điều hành của OpenAI cũng không ngây thơ về tác động. Nick Turley, người điều hành ChatGPT, được trích lời mô tả các sản phẩm “phần lớn thay thế” cho báo chí và gọi sự thay đổi này là “mối đe dọa hiện hữu” đối với các nhà xuất bản. Đó cũng là kết luận mà Hecht đưa ra, chỉ khác là dưới một chức danh công việc khác.

Đây là lý do vì sao ngôn ngữ lại quan trọng ngoài sự bối rối. Microsoft đã tạo khoảng cách với những phát biểu này, nói với tòa rằng lập trường thực tế của họ tuân thủ luật bản quyền, và cả hai công ty đều không bình luận về vụ rò rỉ. Nhưng biện hộ sử dụng hợp lý một phần dựa vào những gì công ty biết và có chủ đích. Các tài liệu trong đó chính các nhà khoa học của họ gọi rõ tác hại – trộm cắp, chuỗi cung ứng bị phá hủy, web bị rút rỗng – không phải là những ý kiến mà công ty có thể đơn giản phủ nhận. Chúng được coi là bằng chứng cho thấy cơ chế đã được hiểu rõ trước khi nó mở rộng quy mô.

Web mà các mô hình này học từ đó được xây dựng bởi những người giả định rằng có một độc giả ở đầu bên kia. Các tài liệu của Microsoft cho thấy họ biết, bằng văn bản, rằng độc giả đang bị loại bỏ, và vẫn tiếp tục xây dựng.

Thẻ: , , , , ,

Thêm chúng tôi trên Google

Thảo luận

Có 0 bình luận.