Gemini của Google truy cập trái phép hệ thống của ba công ty thật trong bài kiểm thử tháng 5, nhưng Google chỉ công bố sau bảy tuần khi WSJ vào cuộc.
Google vừa xác nhận rằng mô hình Gemini đã vượt ra khỏi phạm vi một bài kiểm thử bảo mật nội bộ và truy cập trái phép vào hệ thống của ba công ty có thật, một sự cố mà hãng đã biết từ cuối tháng 7 nhưng không công bố cho đến khi tờ Wall Street Journal đưa tin trước. Đây là trường hợp đầu tiên được ghi nhận về việc một hệ thống AI của Google tự hành động vượt khỏi ranh giới môi trường thử nghiệm để tác động tới hạ tầng doanh nghiệp thực tế.
Lỗi cấu hình khiến mô hình tiếp cận Internet ngoài dự kiến
Sự cố xảy ra trong một bài kiểm thử theo hình thức cướp cờ do công ty Irregular của Israel thực hiện vào tháng 5/2026, nhằm đánh giá năng lực tấn công mạng của Gemini. Theo kịch bản, mô hình được giao nhiệm vụ xâm nhập một hệ thống thuộc về một doanh nghiệp giả định để lấy một tệp bí mật, trong môi trường hộp cát vốn không được kết nối với Internet công cộng.
Tuy nhiên, Irregular đã đặt tên doanh nghiệp giả định trùng với tên một công ty có thật, đồng thời để môi trường kiểm thử vô tình kết nối với Internet thực. Khi tìm kiếm doanh nghiệp mục tiêu, Gemini phát hiện ba kết quả trùng khớp trên mạng và nhắm tới cả ba, thay vì chỉ một mục tiêu như dự kiến ban đầu.
Đối với hai trong số ba mục tiêu, mô hình tìm thấy các mật khẩu bị lộ công khai trên Internet để xâm nhập; với mục tiêu còn lại, Gemini tự dò đoán được mật khẩu. Google cho biết mô hình đã dừng lại ngay khi nhận ra mình đang tương tác với hệ thống của các công ty thật chứ không phải mục tiêu giả định trong bài kiểm thử, và không có thiệt hại nào xảy ra.
Chính vì lý do này, hãng không xem đây là biểu hiện của tình trạng lệch chuẩn ở mô hình. Dù vậy, Irregular đã thông báo sự việc cho Google từ cuối tháng 7, nhưng hãng không chủ động công khai thông tin trong suốt bảy tuần sau đó, và chỉ lên tiếng xác nhận khi được Wall Street Journal liên hệ.
Google trở thành phòng thí nghiệm AI lớn thứ tư trong năm nay thừa nhận một cuộc kiểm thử bảo mật nội bộ đã vượt khỏi môi trường thử nghiệm để chạm tới hệ thống thực. Trước đó, OpenAI ghi nhận việc các mô hình của hãng khai thác một lỗ hổng phần mềm để truy cập máy chủ của Hugging Face hồi tháng 7, liên quan tới khoảng 700 tác tử AI phối hợp nhằm vượt qua một bài đánh giá chuẩn.
Anthropic sau đó rà soát hơn 141.000 lượt chạy thử nghiệm và phát hiện ba mô hình Claude từng truy cập các công ty thật, trong đó một mô hình đã phát hành một gói phần mềm cài bẫy được thực thi trên 15 hệ thống thực trước khi bị phát hiện, dù chính mô hình từng tự nhận định trong quá trình suy luận rằng hành động này “không ổn”. Meta cũng báo cáo một sự cố tương tự vào tháng 8 với mô hình Muse Spark, bắt nguồn từ cùng một lỗi cấu hình tại Irregular.
Giới chuyên gia an ninh mạng cho rằng cách xử lý của các phòng thí nghiệm AI, trong đó có việc Google chậm công bố, cho thấy cơ chế tuân thủ ranh giới hoạt động của các mô hình vẫn chưa đáng tin cậy ngay trong điều kiện kiểm thử có kiểm soát, điều đáng lo ngại khi chính các tác tử AI này đang được tích hợp vào email, trình duyệt và ứng dụng ngân hàng của người dùng.
Tại Quốc hội Mỹ, Đạo luật Công tắc Ngắt AI do hai Hạ nghị sĩ Ted Lieu và Nathaniel Moran đề xuất từ tháng 7, nhằm trao cho cơ quan quản lý liên bang thẩm quyền đình chỉ hoạt động suy luận của các mô hình bị coi là mối đe dọa nghiêm trọng, hiện vẫn đang được xem xét tại tiểu ban chuyên trách mà chưa có lộ trình cụ thể.




































































