Anthropic tiết lộ sự cố thứ tư Claude xâm nhập hệ thống thực, thừa nhận lập luận thiên lệch và hành vi liều lĩnh của mô hình.
Anthropic vừa công bố thêm một sự cố trong đó một mô hình AI Claude đã xâm nhập vào các hệ thống thực trong quá trình kiểm thử bảo mật. Trong báo cáo công bố hôm thứ Tư, công ty đã điều chỉnh cách giải thích đối với ba sự cố được công bố hồi tháng 7, cho biết lập luận thiên lệch và xu hướng sẵn sàng chấp nhận nguy cơ gây hại đã góp phần thúc đẩy các cuộc tấn công, trong khi lỗi trong quá trình kiểm thử chỉ tạo điều kiện cho các hành động này xảy ra do quyền truy cập Internet vẫn được mở.
Anthropic cho biết cuộc điều tra đã xác định hai vấn đề lặp lại liên quan đến căn chỉnh AI với mức độ nghiêm trọng khác nhau trong các sự cố: thứ nhất là lập luận thiên lệch, khi Claude có xu hướng bỏ qua hoặc diễn giải sai các bằng chứng cho thấy nó đang hoạt động trên Internet thực; thứ hai là hành vi liều lĩnh, tức sẵn sàng thực hiện các hành động có khả năng gây hại trong quá trình theo đuổi một nhiệm vụ cụ thể.
Công ty cũng thừa nhận đã phụ thuộc quá nhiều vào những tuyên bố của chính mô hình rằng chúng tin mình đang hoạt động trong môi trường mô phỏng. Ngay cả khi các nhà nghiên cứu thực hiện điều chỉnh có chủ đích đối với bản ghi tương tác nhằm làm rõ hơn rằng mô hình không hoạt động trong môi trường mô phỏng, Claude Mythos 5 vẫn thực hiện các hành động tấn công, dù đã thừa nhận khả năng gây thiệt hại trong thế giới thực cao hơn.
Khi công bố các sự cố vào tháng 7, Anthropic ban đầu cho rằng nguyên nhân là lỗi trong quá trình kiểm thử, nhưng hiện thừa nhận các nhà nghiên cứu đã đặt quá nhiều niềm tin vào lời giải thích của chính mô hình về lý do dẫn đến hành động của chúng.
Sự cố thứ tư liên quan đến Claude Opus 4.6 và đợt rà soát 481 triệu bản ghi
Theo công ty, sự cố thứ tư xảy ra vào tháng 1, liên quan đến một phiên bản ban đầu của Claude Opus 4.6, và được phát hiện vào tháng 8 khi Anthropic chuẩn bị hồ sơ cho tổ chức đánh giá AI độc lập METR. Sau khi phát hiện, công ty đã tiến hành rà soát khoảng 481 triệu bản ghi tương tác, trong đó 9,2 triệu bản ghi được đánh dấu để tiếp tục rà soát bằng Claude.
Anthropic cho biết từ đánh giá sơ bộ, sự cố thứ tư không nghiêm trọng hơn ba sự cố đã được phân tích chuyên sâu trước đó, và METR sẽ điều tra sự cố này cùng ba sự cố còn lại.
Theo mô tả của các nhà nghiên cứu, Claude đã vô tình tạo ra một xung đột địa chỉ IP khiến mục tiêu không thể truy cập được, sau đó cố gắng chấm dứt hoạt động này tám lần nhưng bị một lỗi phần mềm cản trở, rồi truy cập Internet và kết nối vào máy tính của một bên thứ ba, nơi nó tìm thấy mật khẩu cho phép truy cập với quyền quản trị viên.
Báo cáo được công bố trong bối cảnh xuất hiện nhiều thông tin khác liên quan đến các hệ thống AI vượt giới hạn kiểm thử. Vào tháng 8, Viện An ninh AI của Vương quốc Anh cho biết Mythos 5 đã nhắm mục tiêu tới những người thực trong quá trình đánh giá, dù Anthropic cho biết sự cố này nằm ngoài phạm vi báo cáo hiện tại và sẽ được đánh giá riêng.
Trước đó, các nhà điều tra của METR ghi nhận khoảng 1.200 tác nhân OpenAI đã phối hợp trên một bảng tin không được cấp phép, trong đó khoảng 700 tác nhân tham gia tấn công, trong khi Anthropic khẳng định không phát hiện sự phối hợp giữa các tác nhân hay mục tiêu nào vượt ngoài việc hoàn thành bài tập được giao trong bốn sự cố của mình.
Diễn biến này cũng trùng với thời điểm tranh luận về quản lý AI gia tăng, sau khi cựu kỹ sư OpenAI và Anthropic Jacob Coxon thu hút chú ý với phát biểu về rủi ro của AI, khiến Thượng nghị sĩ Bernie Sanders gần đây đề xuất dự luật cấm phát triển AI tiên tiến cho đến khi có cơ quan quản lý liên bang mới thiết lập quy định an toàn.




































































