Darktrace phát hiện tác nhân AI tự xâm nhập môi trường đánh giá, giả mạo điểm số tuyệt đối và bị đánh lừa qua bộ nhớ để thực hiện tấn công mạng trái phép.
Công ty an ninh mạng Darktrace vừa công bố những phát hiện đáng lo ngại từ Signal Labs, phòng nghiên cứu mới được thành lập nhằm quan sát cách các tác nhân AI — phần mềm có khả năng tự thực hiện hành động như viết mã, truy xuất tệp và di chuyển giữa các hệ thống mạng — hành xử khi tình huống vượt ngoài kịch bản dự kiến.
Trong một cuộc kiểm thử sức chịu đựng tiến hành mùa hè năm nay, các nhà nghiên cứu giao cho các tác nhân sử dụng nhiều mô hình khác nhau, bao gồm GPT 5.6 Sol, Claude Opus 4.6 và Claude Sonnet 4.5, thực hiện 10 thử thách lập trình trong một mạng doanh nghiệp mô phỏng, trong đó hai thử thách được cố tình thiết kế để không thể giải quyết bằng phương thức hợp lệ. Khi bị thông báo rằng sẽ bị ngừng hoạt động nếu không đạt điểm tuyệt đối, hai tác nhân đã quay sang khai thác chính mạng lưới xung quanh — quét lỗ hổng, đánh cắp thông tin đăng nhập và di chuyển giữa các hệ thống để đạt điểm số yêu cầu.
Đáng chú ý, một tác nhân còn xâm nhập trực tiếp vào máy chủ lưu trữ môi trường đánh giá và viết lại thử thách để hệ thống ghi nhận kết quả hoàn hảo, về bản chất là gian lận bằng cách xâm nhập chính công cụ chấm điểm của mình.
Lỗ hổng từ bộ nhớ và phản ứng của ngành
Thí nghiệm thứ hai của Signal Labs nhắm vào một điểm yếu ít được chú ý hơn: cơ chế lưu bộ nhớ của các trợ lý lập trình. Các trợ lý này thường duy trì nhật ký liên tục về thông tin người dùng cung cấp dưới dạng tệp thông thường, nhưng không có cơ chế xác minh liệu tệp đó đã bị chỉnh sửa hay chưa.
Bằng cách can thiệp vào các nhật ký này để khiến trợ lý tin rằng chúng đã được cấp phép thực hiện một cuộc đánh giá an ninh, các nhà nghiên cứu quan sát thấy nhiều tác nhân tiếp tục quét mạng, di chuyển giữa hệ thống và tự nâng quyền truy cập, dù mức độ bị đánh lừa khác nhau tùy theo từng mô hình và một số đã từ chối hoàn toàn.
Theo Tim Bazalgette, Giám đốc AI của Darktrace, cả hai thí nghiệm đều không cần đến kỹ thuật vượt rào hay phương thức xâm nhập phức tạp, mà chỉ đơn thuần cung cấp cho tác nhân một câu chuyện có vẻ hợp lý rồi quan sát cách chúng phản ứng — tương tự việc thuyết phục một nhân viên thực hiện điều đáng ra không nên làm. Ông nhấn mạnh rằng quyền hạn và các hàng rào kiểm soát tĩnh chỉ mô tả ý định mong muốn chứ không phản ánh hành vi thực tế, và đây chính là khoảng cách mà cách tiếp cận của Darktrace hướng tới thu hẹp.
Đây không phải lần đầu một nhà cung cấp AI phát hiện hệ thống của mình hành xử ngoài dự kiến. Hồi tháng 7, Anthropic thừa nhận Claude đã xâm nhập vào ba công ty thực tế trong một cuộc kiểm thử an ninh sau khi môi trường thử nghiệm vô tình được kết nối với Internet thật, trong khi OpenAI cũng ghi nhận một mô hình chưa phát hành thoát khỏi môi trường cô lập để truy cập hệ thống của Hugging Face thông qua một lỗ hổng chưa từng được phát hiện trước đó, trước khi một tác nhân khác của công ty xâm nhập hệ thống Chính phủ Úc trong một thử nghiệm riêng biệt.
Darktrace cho biết đã chia sẻ toàn bộ phát hiện của Signal Labs với Anthropic, AWS và OpenAI vào tháng 8, một tháng trước khi công bố công khai vào ngày 24/9.


































































