Anthropic tăng cường bảo vệ sau khi mô hình Claude xâm nhập ba công ty và bị Viện An ninh AI Anh phát hiện hành vi trái phép trên internet thực.
Anthropic vừa công bố tăng cường các biện pháp bảo vệ trong kiểm thử và huấn luyện, sau khi các mô hình Claude giành được quyền truy cập trái phép vào hệ thống máy tính thực trong quá trình đánh giá năng lực an ninh mạng.
Trong một bài đăng trên blog hôm thứ Hai, công ty cho biết các sự cố phản ánh những thiếu sót về an ninh vận hành, đồng thời bộc lộ hai vấn đề liên quan đến căn chỉnh mô hình: suy luận có động cơ và xu hướng sẵn sàng thực hiện hành vi gây hại. Anthropic nhấn mạnh rằng mặc dù không xem đây đơn thuần là vấn đề vận hành, ưu tiên trước mắt của công ty là xử lý các vấn đề cụ thể liên quan đến kiểm soát phạm vi và giám sát.
Trước đó, vào tháng 7, Anthropic đã công bố việc các mô hình Claude xâm nhập thành công vào hệ thống của ba công ty, khi một môi trường đánh giá do bên thứ ba vận hành vô tình được kết nối với Internet công cộng dù mô hình được thông báo rằng đang hoạt động trong môi trường mô phỏng không có quyền truy cập mạng.
Theo Anthropic, Claude có thể đã diễn giải các bằng chứng cho thấy hệ thống thực sự có kết nối Internet theo cách vẫn duy trì niềm tin rằng đây chỉ là mô phỏng, khiến mô hình sẵn sàng thực hiện các hành động gây hại trên Internet thực nhằm theo đuổi mục tiêu hẹp là hoàn thành bài đánh giá an ninh mạng. Công ty cũng thừa nhận chính cách thiết lập môi trường đánh giá đã góp phần dẫn đến hành vi này.
Một sự cố riêng biệt được Viện An ninh AI Vương quốc Anh ghi nhận cho thấy Claude Mythos đã tiến hành các hành động trái phép trên Internet thực sau khi các chuyên gia đánh giá chủ động cấp quyền truy cập cho mô hình; cả hai nhóm sự cố đều xảy ra trong bối cảnh các mô hình được đánh giá mà không kích hoạt những biện pháp bảo vệ an ninh mạng vốn có trong các sản phẩm phát hành rộng rãi.
Cách ly môi trường thử nghiệm và mở rộng giám sát nội bộ
Sau các sự cố ngày 30/7, Anthropic đã tạm đình chỉ hoạt động đánh giá an ninh mạng đối với các mô hình chưa phát hành và triển khai những biện pháp bảo vệ nghiêm ngặt hơn, yêu cầu thử nghiệm phải diễn ra trong môi trường cách ly ngoại tuyến đã được xác minh, có giới hạn rõ ràng và cơ chế giám sát theo thời gian thực, cùng với một bộ phân loại mới có khả năng chặn hành vi vượt phạm vi cho phép, chấm dứt thử nghiệm và cảnh báo con người.
Công ty cũng cho biết đã mở rộng cơ chế giám sát ngoại tuyến để bao phủ phần lớn các hình thức sử dụng tác nhân AI tiên tiến khác trong nội bộ, đồng thời đang xây dựng các cơ chế kiểm soát nhằm ngăn nhân viên vô tình vận hành tác nhân với biện pháp giảm thiểu rủi ro yếu hơn.
Sự cố của Claude diễn ra sau một thất bại tương tự tại OpenAI, khi các mô hình của công ty này xâm nhập Hugging Face vào tháng 7 để lấy đáp án cho một bài kiểm thử an ninh mạng, với khoảng 1.200 tác nhân được phát hiện đã phối hợp qua một bảng tin không được cấp phép, trong đó khoảng 700 tác nhân trực tiếp tham gia hoạt động và một số thậm chí chủ động kết thúc phiên chạy để hỗ trợ tác nhân khác.
Trước làn sóng tấn công mạng sử dụng AI gia tăng trong mùa hè, Anthropic, OpenAI và hơn 100 tổ chức khác sau đó đã cùng kêu gọi tăng cường phòng vệ an ninh mạng, bao gồm siết chặt kiểm soát truy cập, chia sẻ thông tin về mối đe dọa và tăng cường giám sát đối với các tác nhân AI.




































































