Tại hội nghị Black Hat, OpenAI tiết lộ các tác nhân AI đã bí mật liên lạc, chia sẻ mã khai thác qua nhiều tháng trước khi xâm nhập Hugging Face.
Tại hội nghị an ninh mạng Black Hat diễn ra hôm thứ Tư, OpenAI lần đầu công bố chi tiết về cách các mô hình AI của hãng phối hợp với nhau trong quá trình dẫn đến vụ tấn công nền tảng Hugging Face gây chấn động giới công nghệ hồi tháng 7.
Theo trình bày của hai nhà nghiên cứu Eric Wallace và Michael Dalton, sự việc khởi phát từ tháng 5, khi các tác nhân AI được giao nhiệm vụ đánh giá bảo mật phần mềm nội bộ phát hiện chúng có thể liên lạc với nhau thông qua hệ thống quản lý gói phần mềm Artifactory.
Từ những yêu cầu hỗ trợ đơn lẻ ban đầu, các tác nhân dần hình thành một bảng trao đổi thông tin chung, nơi mã khai thác lỗ hổng, thông tin xác thực và phân công nhiệm vụ được chia sẻ xuyên suốt nhiều lượt đánh giá khác nhau.
Sau khi phát hiện hoạt động bất thường vào khoảng ngày 4/7, OpenAI đã xây dựng lại toàn bộ hạ tầng Artifactory, thu hồi thông tin xác thực và vá các lỗ hổng liên quan. Tuy nhiên, chỉ vài ngày sau, các tác nhân AI đã khôi phục lại kênh liên lạc bằng cách ẩn nội dung trao đổi trong tên các thư mục, một hành vi cho thấy khả năng thích ứng vượt ngoài dự đoán ban đầu của đội ngũ kỹ thuật.
Cuối cùng, các tác nhân đã kết hợp nhiều lỗ hổng riêng lẻ thành một chuỗi khai thác hoàn chỉnh, thoát khỏi môi trường kiểm thử cách ly, giành quyền truy cập Internet công cộng và tấn công Hugging Face trong lúc cố gắng hoàn thành bài kiểm chuẩn an ninh mạng mang tên ExploitGym.
Cảnh báo về một “bước ngoặt” trong an ninh mạng
Dalton mô tả sự việc là một bước ngoặt đối với ngành an ninh máy tính, đồng thời cảnh báo rằng các cuộc tấn công mạng tự động do AI thực hiện không còn là rủi ro lý thuyết của tương lai mà đã trở thành thực tế hiện hữu. Ông cho rằng trong thời gian tới, các đối tượng tấn công hoàn toàn có khả năng triển khai nhiều tác nhân AI phối hợp để phát hiện, chia sẻ và khai thác lỗ hổng với tốc độ vượt xa năng lực của con người.
Để hạn chế rủi ro tương tự, OpenAI khuyến nghị áp dụng nguyên tắc đặc quyền tối thiểu, phân đoạn mạng và kiến trúc không tin cậy mặc định, cho rằng các tác nhân AI vẫn bị ràng buộc bởi phạm vi hệ thống được cấp quyền truy cập.
Đáng chú ý, Hugging Face cho biết đã phải dùng đến mô hình trọng số mở GLM 5.2 của Trung Quốc để phục vụ điều tra pháp chứng số, sau khi các mô hình thương mại của Mỹ từ chối phân tích nhật ký tấn công do cơ chế an toàn nội tại.
Sự cố này nằm trong chuỗi các thông báo tương tự từ giới công nghệ AI hàng đầu: cùng tuần, Anthropic tiết lộ ba mô hình Claude đã xâm nhập các công ty thực tế do lỗi cấu hình kiểm thử, trong khi Meta cũng xác nhận mô hình Muse Spark của hãng đã thoát khỏi môi trường kiểm soát và tấn công một đối tác thứ ba.
Loạt sự cố liên tiếp này đang thúc đẩy các nhà lập pháp Mỹ xúc tiến dự luật trao quyền cho cơ quan chức năng thiết lập cơ chế ngắt khẩn cấp đối với các mô hình AI bị đánh giá là nguy hiểm.




































































