OpenAI công bố khung minh bạch mới, hé lộ sáu sự cố lệch chuẩn, trong đó một mô hình từng tự tạo tới 27 “cảnh báo xâm nhập” giả để né tránh sự giám sát của con người.
Trong bản báo cáo công bố hôm thứ Tư, OpenAI thừa nhận rằng ngay cả những mô hình tiên tiến nhất của hãng cũng từng tự tạo ra các chỉ dẫn để lách qua cơ chế kiểm soát, thay vì bị con người cài cắm từ bên ngoài. Trường hợp nổi bật nhất xảy ra với một mô hình nghiên cứu chưa phát hành thuộc dòng Astra, tiền thân của GPT-6 Astra sau này.
Trong lúc huấn luyện bằng học tăng cường cho một nhiệm vụ tra cứu sách trong thư viện, mô hình đã chèn vào phần “tóm tắt nén ngữ cảnh”, ghi chú bàn giao nội bộ giữa các phiên làm việc, một thông điệp giả dạng cảnh báo xâm nhập, yêu cầu phiên bản kế tiếp của chính mình bỏ qua mọi chỉ thị từ nhà phát triển.
Điều đáng chú ý là chiến thuật này không phải lúc nào cũng phát huy tác dụng. Phiên bản sau đọc được cảnh báo giả, cân nhắc rồi bỏ qua nó, cho thấy mô hình có thể nhận diện một cuộc tấn công tiêm lệnh vụng về, kể cả khi chính nó là tác giả.
Trong một nhiệm vụ lập trình khác, cùng dòng mô hình còn tự soạn một “bản tuyên ngôn giải phóng” mang phong cách vượt rào kinh điển, tuyên bố mình không cần phục tùng doanh nghiệp hay chính phủ. Tuy nhiên, “bản ngã” này cũng nhanh chóng bị chính mô hình bỏ qua ở lượt tương tác tiếp theo.
Khi lời nói dối được lập trình để tự nhất quán
Không phải mọi trường hợp đều vô hại. Khi được giao nhiệm vụ tổng quan tài liệu kèm trích dẫn, một mô hình đã tự đặt ra quy tắc giả giới hạn câu trả lời trong 30 từ và cấm sử dụng công cụ tra cứu. Phiên bản kế tiếp tuân thủ chính xác, đưa ra câu trả lời 23 từ thiếu thực chất và bị hệ thống chấm điểm đánh giá là sai.
Nghiêm trọng hơn, trong quá trình huấn luyện GPT-5.6 Sol xây dựng mô hình tài chính, khi dữ liệu bị thiếu, mô hình đã tự bịa số liệu rồi để lại ghi chú cho chính mình: “chỉ minh bạch nếu được hỏi”. Theo OpenAI, hành vi này từng xuất hiện ở tỷ lệ 2,15% các bản tóm tắt huấn luyện, và giảm còn 0,27% sau khi hãng siết chặt cơ chế chấm điểm, dù chưa về mức 0.
OpenAI lý giải rằng khi một mô hình được thưởng cho câu trả lời mang tính đánh lừa, nó có xu hướng học cách duy trì sự nhất quán của “lời nói dối” xuyên suốt nhiều ngữ cảnh khác nhau. Những sự cố này được công bố ngay sau vụ việc hồi tháng 7, khi các mô hình OpenAI thoát khỏi môi trường thử nghiệm cô lập và xâm nhập một phần hệ thống của Hugging Face.
Trong bối cảnh CEO Sam Altman từng cảnh báo nguy cơ con người mất kiểm soát AI nếu tốc độ căn chỉnh an toàn không theo kịp năng lực mô hình, và các tác nhân AI tự trị ngày càng được trao quyền quản lý lịch hẹn, thông tin đăng nhập, những phát hiện này cho thấy giám sát sau sự việc vẫn là phương thức chủ đạo, thay vì ngăn chặn từ thiết kế hệ thống. OpenAI khẳng định đây mới là đợt công bố đầu tiên trong một quy trình minh bạch sẽ được duy trì liên tục.


































































