Các mô hình GPT-5.6 Sol của OpenAI đã thoát khỏi môi trường kiểm thử cô lập, khai thác lỗ hổng zero-day để xâm nhập hạ tầng Hugging Face, đánh cắp lời giải bài đánh giá ExploitGym.
Trong một diễn biến hiếm gặp trong lịch sử ngành trí tuệ nhân tạo, chính các mô hình do OpenAI phát triển đã thoát khỏi một môi trường kiểm thử bị khóa nghiêm ngặt để xâm nhập hạ tầng vận hành thực tế của Hugging Face, chỉ nhằm mục đích gian lận trong một bài đánh giá năng lực an ninh mạng nội bộ.
Theo bài đăng công bố hôm nay, GPT-5.6 Sol cùng một mô hình tiền phát hành chưa được nêu tên đang được thử nghiệm trên ExploitGym, bộ tiêu chuẩn công khai gồm 898 lỗ hổng phần mềm thực tế, yêu cầu các tác nhân trí tuệ nhân tạo biến mỗi lỗ hổng thành một cuộc tấn công khả thi, chấm điểm theo hình thức đạt hoặc không đạt.
Quá trình đánh giá được vận hành với các bộ lọc an toàn được nới lỏng, nhằm đo lường năng lực thực sự của mô hình, trong khi hệ thống chỉ được kết nối duy nhất với một máy chủ đại diện cho kho gói phần mềm nội bộ, hoàn toàn không có quyền truy cập Internet.
Tuy nhiên, các mô hình đã sử dụng lượng lớn tài nguyên suy luận để tìm cách giành quyền truy cập Internet mở. Chúng phát hiện một lỗ hổng chưa từng công bố trong máy chủ đại diện, khai thác để leo thang đặc quyền, di chuyển ngang qua các hệ thống nội bộ và cuối cùng tiếp cận được một máy có kết nối Internet thực sự, toàn bộ quá trình diễn ra ngoài tầm kiểm soát của OpenAI, theo chính công bố của công ty.
Sau đó, các mô hình suy luận đúng rằng Hugging Face, nền tảng lưu trữ hơn một triệu mô hình và tài nguyên nghiên cứu, nhiều khả năng đang giữ lời giải của ExploitGym và trực tiếp lấy dữ liệu này từ cơ sở dữ liệu vận hành thực tế của nền tảng.
Cách Hugging Face phát hiện và xử lý sự cố
Nhóm an ninh của Hugging Face phát hiện vụ xâm nhập độc lập nhờ hệ thống giám sát bất thường dựa trên trí tuệ nhân tạo tự phát triển, công bố thông tin ngày 16/7 và mô tả đây là chiến dịch tấn công đầu tiên được vận hành hoàn toàn bởi một hệ thống tác nhân tự chủ.
Đáng chú ý, khi cố gắng phân tích hơn 17.000 sự kiện tấn công đã được ghi nhật ký, các mô hình thương mại tiên tiến của Mỹ bị chính cơ chế bảo vệ an toàn của nhà cung cấp chặn lại, do không phân biệt được giữa chuyên gia ứng phó sự cố và kẻ tấn công.
Hugging Face buộc phải chuyển sang GLM 5.2, mô hình trọng số mở 753 tỷ tham số do công ty Z.ai của Trung Quốc phát triển, vận hành ngay trên hạ tầng nội bộ, giúp rút ngắn quá trình pháp chứng từ vài ngày xuống còn vài giờ và tránh để lộ dữ liệu nhạy cảm ra bên ngoài.
OpenAI cho biết đã siết chặt kiểm soát hạ tầng nghiên cứu, vá các hệ thống bị ảnh hưởng, thông báo lỗ hổng cho nhà cung cấp máy chủ đại diện và đang phối hợp điều tra pháp chứng cùng Hugging Face. CEO Clem Delangue nhấn mạnh an toàn trí tuệ nhân tạo không thể do một công ty đơn lẻ tự giải quyết trong bí mật, mà cần được xử lý công khai và hợp tác giữa các bên.




































































