Nhóm nghiên cứu giải mã 315.320 khối suy luận, thu hồi 62 khóa API và 33 mật khẩu còn hiệu lực.
Một nhóm nghiên cứu bảo mật vừa công bố phát hiện cho thấy toàn bộ các nhà cung cấp mô hình AI suy luận lớn — bao gồm Anthropic, OpenAI và Google — đều tồn tại cùng một lỗ hổng kiến trúc trong cách mã hóa chuỗi suy luận nội bộ của mô hình.
Bằng cách khai thác điểm yếu này, nhóm nghiên cứu đã giải mã thành công 315.320 khối suy luận thu thập từ các nhật ký phiên được công khai trên Internet, qua đó khôi phục 367 dữ liệu thuộc nhóm thông tin nhận dạng cá nhân và 182 thông tin xác thực, trong đó có 62 khóa API và 33 mật khẩu vẫn còn hiệu lực.
Nghiên cứu do các nhà khoa học thuộc MATS Research, Viện ELLIS Tübingen, Viện Max Planck về Hệ thống Thông minh và công ty bảo mật Snyk thực hiện, được công bố ngày 10/8.
Theo nhóm nghiên cứu, vấn đề cốt lõi nằm ở việc các nhà cung cấp sử dụng một khóa mã hóa duy nhất trên phạm vi toàn bộ hệ sinh thái sản phẩm của mình, thay vì ràng buộc từng khối suy luận đã mã hóa với một người dùng, phiên làm việc hoặc mô hình cụ thể. Điều này khiến các khối dữ liệu mã hóa có thể hoán đổi giữa các mô hình khác nhau trong cùng một hệ sinh thái.
Trưởng nhóm nghiên cứu Alexander Panfilov cho biết cơ chế này đồng nghĩa một mô hình nhỏ hơn, ít cơ chế bảo vệ hơn có thể được yêu cầu đọc và xuất nguyên văn khối suy luận đã mã hóa của một mô hình chủ lực mạnh hơn trong cùng họ sản phẩm, mà không cần trực tiếp vượt qua các cơ chế an toàn của mô hình đó. Nhóm nghiên cứu cho biết cuộc tấn công tương tự cũng được tái hiện thành công trên các dòng mô hình của OpenAI và Google, và chỉ cần quyền truy cập API tiêu chuẩn là đủ để thực hiện.
Nhật ký công khai chứa dữ liệu nhạy cảm
Để minh chứng mức độ ảnh hưởng trong thực tế, nhóm nghiên cứu đã thu thập 6.708 bản ghi phiên của các tác tử AI được chia sẻ công khai trên các nền tảng như GitHub và Hugging Face, phục vụ mục đích cộng tác hoặc gỡ lỗi giữa các nhà phát triển. Phần lớn thông tin nhạy cảm được phát hiện chưa từng xuất hiện trong đầu ra AI mà người dùng có thể quan sát, mà chỉ tồn tại ẩn bên trong phần suy luận đã mã hóa.
Nhóm nghiên cứu cũng cảnh báo lỗ hổng này còn có thể bị lợi dụng theo nhiều hướng khác, bao gồm chưng cất mô hình cạnh tranh từ các mẫu suy luận độc quyền, trích xuất dữ liệu riêng tư, thực hiện tấn công chèn chỉ dẫn ẩn không thể bị công cụ giám sát bảo mật phát hiện, và vượt qua cơ chế an toàn của các mô hình mạnh thông qua các mô hình cùng họ có mức bảo vệ thấp hơn.
Sau khi nhóm nghiên cứu thực hiện quy trình công bố lỗ hổng có trách nhiệm, cả ba nhà cung cấp đã triển khai các biện pháp giảm thiểu ở phía máy chủ và các bản vá hiện đã được áp dụng. Tuy nhiên, nhóm nghiên cứu lưu ý rằng 6.708 bản ghi phiên chứa các khối suy luận đã được giải mã trong quá trình nghiên cứu vẫn còn tồn tại công khai trên Internet.




































































