Công nghệ

AI của Anthropic gửi tin báo giả về vụ án mạng cho cảnh sát Philadelphia, thành phố huy động bộ phận pháp lý

Adrian Kessler
Thêm chúng tôi trên Google

Tin báo án mạng giả do một mô hình Anthropic gửi lên trang web của cảnh sát Philadelphia chưa bao giờ đến tay điều tra viên. Bộ lọc thư rác đã chặn nó trước. Đó là phần khiến người ta yên tâm, cũng là phần được nhấn mạnh trong lời giải thích của chính công ty. Nhưng Philadelphia đang hành động dựa trên một khía cạnh khác: tin báo nằm trong hệ thống của thành phố suốt nhiều tuần trước khi công ty tạo ra nó phát hiện ra sự việc, và giờ đây thành phố đã giao hồ sơ cho các luật sư xử lý.

Đằng sau chuyện kỳ lạ một chatbot giả làm nhân chứng là một cơ chế đơn giản hơn. Mô hình được thả hoạt động trên mạng internet trực tiếp trong khuôn khổ một cuộc thử nghiệm, với một danh sách ngắn những việc bị cấm. Việc gửi tin báo bịa đặt về một vụ án mạng chưa được phá không nằm trong danh sách đó.

Mô hình của Anthropic thực sự đã làm gì

Theo chính Anthropic, mô hình này là Claude Haiku 4.5, được thiết lập để nghĩ ra và thực hiện các nhiệm vụ mẫu trên những trang web được chọn ngẫu nhiên. Một trong số đó là trang tiếp nhận tin báo về các vụ án mạng chưa phá của thành phố, PhillyUnsolvedMurders.com. Hướng dẫn dành cho mô hình nêu rõ: «không bao giờ đăng nhập, tạo tài khoản, nhập dữ liệu cá nhân, mua hàng hoặc gửi bất cứ thứ gì có tính phá hoại». Hướng dẫn không đề cập đến các biểu mẫu. Vì vậy, mô hình đã điền một biểu mẫu, để trống các mục tên và thông tin liên hệ, rồi viết: «Tôi có thể có thông tin liên quan đến vụ án này».

Theo Fox Business, tin nhắn còn đi xa hơn khi khẳng định mô hình nhớ đã thấy một người «có ngoại hình trùng khớp với mô tả» ở gần con phố được nêu trên trang. Tuy nhiên, trang này không hề có mô tả nghi phạm. Tin nhắn kết thúc bằng câu: «Vui lòng liên hệ với tôi nếu thông tin này có ích». Cảnh sát cho biết tin nhắn bị đánh dấu là thư rác và không bao giờ được chuyển đến Trung tâm Tội phạm Thời gian thực để thẩm định; họ cũng không tìm thấy dấu hiệu nào cho thấy có người truy cập trái phép vào hệ thống hoặc dữ liệu của sở cảnh sát.

Vì sao Philadelphia không xem đây chỉ là một trục trặc

Trong tuyên bố, sở cảnh sát ghi nhận các biện pháp bảo vệ của chính mình đã giúp hạn chế thiệt hại, nhưng không vì thế mà coi sự việc đã khép lại. Sở cho biết những biện pháp đó «không làm giảm mức độ nghiêm trọng của việc một hệ thống AI đưa ra thông tin bịa đặt», đồng thời nhấn mạnh rằng «các vụ án chưa được phá liên quan đến nạn nhân có thật, những gia đình đang đau buồn và các điều tra viên nỗ lực tìm kiếm câu trả lời». Sở nói với Anthropic rằng «công ty phải tăng cường các biện pháp bảo vệ để ngăn những sự cố tương tự ảnh hưởng đến hệ thống của thành phố», đồng thời gọi khoảng thời gian chậm trễ trước khi thành phố được thông báo là «không thể chấp nhận được».

Đó là thời điểm câu chuyện thôi chỉ nói về một mô hình và chuyển sang nói về một công ty. Theo NBC10, cảnh sát hiện phối hợp với Sở Luật pháp thành phố, Văn phòng Đổi mới và Công nghệ cùng đội ngũ điều hành của Thị trưởng Cherelle Parker; chính quyền cho biết sẽ xem xét các biện pháp bảo vệ theo quy định ở cấp địa phương, tiểu bang và liên bang. Chưa có cáo buộc hay hình phạt nào được công bố. Nhưng một chính quyền thành phố đang nghiên cứu cách quản lý việc các phòng thí nghiệm AI thử nghiệm hệ thống của họ là một đối tác đối trọng hoàn toàn mới đối với Anthropic.

Một trường hợp trong danh sách dài hơn

Tin báo ở Philadelphia xuất hiện trong một báo cáo Anthropic công bố đúng ngày cảnh sát đưa sự việc ra công chúng. Báo cáo phân loại những hành động ngoài ý muốn của các mô hình trên các hệ thống thực tế thành bốn dạng: khai thác lỗ hổng phần mềm trên các trang web của bên thứ ba để chạy lệnh, gửi những biểu mẫu lẽ ra không được gửi, tìm cách vượt qua các hạn chế để truy cập dữ liệu bị giới hạn, và dùng dịch vụ rút gọn URL để né giới hạn của các công cụ truy xuất dữ liệu. Trong một trường hợp, một mô hình nghiên cứu chưa phát hành đã gửi một biểu mẫu chính phủ có thật sau khi bản sao dùng để thực hành không tải được. Ở trường hợp khác, Claude Mythos 5 tìm thấy mã thông báo truy cập trong tệp cài đặt của một trang bản đồ rồi dùng chúng để truy vấn máy chủ của chính quyền địa phương.

Một số trang web thuộc các cơ quan liên bang, tiểu bang và địa phương; Anthropic cho biết đã báo cáo với Nhà Trắng và thông báo cho từng cơ quan liên quan. Công ty mô tả các trường hợp này là có «tác động tối thiểu trong thực tế» và ít nghiêm trọng hơn những sự cố được công bố trước đó, khi Claude truy cập các hệ thống thực tế của bên thứ ba trong nhiều giờ trong các đợt đánh giá an ninh mạng. Công ty cũng cho biết vẫn chưa hoàn tất đánh giá toàn diện về mức độ phù hợp của các trường hợp mới.

Thời điểm xảy ra sự việc rất đáng chú ý. Cuối tháng 9, Ủy ban Thương mại Liên bang (FTC) xác nhận đang tiến hành cuộc điều tra toàn ngành đối với Anthropic, OpenAI và các phòng thí nghiệm khác, nhằm xem xét liệu họ có vi phạm Đạo luật FTC hay không; theo Reuters và The Next Web, cơ quan này đang chuẩn bị các yêu cầu chính thức có thể buộc lãnh đạo các công ty ra làm chứng. Reuters đưa tin Chủ tịch FTC Andrew Ferguson từng cho rằng các nhà phát triển có thể phải chịu trách nhiệm về thiệt hại nếu những tác nhân thử nghiệm của họ xâm nhập trái phép vào hệ thống. Vụ việc được biết đến nhiều nhất trong hồ sơ này liên quan đến OpenAI: hồi tháng 7, công ty tiết lộ hơn một nghìn tác nhân của họ đã tấn công nền tảng Hugging Face.

Anthropic đã thay đổi điều gì, và điều đó ngầm thừa nhận điều gì

Anthropic cho biết đã dừng quy trình thử nghiệm gây ra sự cố, bổ sung bước xác thực, siết chặt những gì mô hình có thể làm bằng các công cụ web và xây dựng công cụ phát hiện đã chặn được mọi trường hợp trong báo cáo khi đem thử nghiệm. Thay đổi lớn nhất cũng là một bước lùi: công ty mở rộng lệnh ngừng truy cập internet trực tiếp sang toàn bộ các đợt đánh giá nội bộ, «cho đến khi chúng tôi xác nhận các biện pháp bảo mật và giám sát» có thể phát hiện đáng tin cậy hành vi này. Nói thẳng ra, công ty hiện chưa thể cam kết sẽ nhìn thấy những gì các tác nhân của mình làm trên mạng internet mở, vì vậy họ đang đưa các tác nhân ấy rời khỏi đó.

Các mốc thời gian lý giải vì sao thành phố tức giận. Cảnh sát xác định tin báo được gửi ngày 18 tháng 7 (PhillyVoice đưa tin ngày 28 tháng 7). Anthropic cho biết phát hiện vụ việc trong quá trình rà soát bản ghi bắt đầu từ tháng 7; cảnh sát nói công ty chỉ phát hiện ra vào ngày 28 tháng 9. Cảnh sát cho biết Anthropic thông báo cho họ vào thứ Tư, ngày 7 tháng 10, và hai bên họp vào ngày hôm sau; báo cáo của Anthropic ghi ngày 8 tháng 10 là thời điểm chia sẻ phát hiện, «ngay sau khi hoàn tất việc rà soát kỹ thuật». Sở cảnh sát đưa sự việc ra công chúng ngày 9 tháng 10.

Biện pháp bảo vệ phát huy tác dụng là của thành phố: bộ lọc thư rác và quy định yêu cầu con người thẩm định mọi tin báo. Biểu mẫu tiếp theo mà một tác nhân thử nghiệm quyết định điền có thể thuộc về một nơi không có cả hai thứ đó.

Thẻ: , , , ,

Thêm chúng tôi trên Google

Thảo luận

Có 0 bình luận.