GPT-6 Astra đạt 100% trên ExploitBench, vượt ngưỡng “nghiêm trọng” về an ninh mạng, buộc OpenAI triển khai thận trọng theo từng giai đoạn.
OpenAI hôm thứ Năm đã chính thức ra mắt GPT-6 Astra, mô hình được Chủ tịch Greg Brockman mô tả là “bước nhảy vọt mang tính thế hệ về năng lực” và đánh dấu sự xuất hiện của trí tuệ nhân tạo tổng quát (AGI).
Trong cuộc họp báo trước khi công bố, Brockman nói với các phóng viên rằng ông tin Astra đã đạt ngưỡng của AGI, tức trí tuệ nhân tạo có khả năng ngang bằng hoặc vượt con người, và tuyên bố: “Chào mừng đến với kỷ nguyên AGI”.
Nếu nhận định này chính xác, các tác nhân AI sẽ tiến gần hơn đến khả năng thực hiện những công việc suy luận phức tạp mà con người có thể làm, thậm chí vượt qua con người, trên nhiều loại nhiệm vụ khác nhau.
Vượt ngưỡng an ninh mạng “nghiêm trọng”, triển khai thận trọng theo giai đoạn
Điểm đáng chú ý nhất trong lần ra mắt này là Astra trở thành mô hình đầu tiên của OpenAI vượt qua ngưỡng “nghiêm trọng” theo Khung Đánh giá Mức độ Sẵn sàng, hệ thống đánh giá nội bộ của công ty đối với các năng lực có thể gây nguy hiểm.
Mức phân loại này đồng nghĩa mô hình có thể tự động phát hiện các lỗ hổng phần mềm chưa từng được biết đến, hay còn gọi là lỗ hổng zero-day, và kết hợp nhiều lỗ hổng thành các chuỗi khai thác hoạt động được trên những hệ thống đã được gia cố bảo mật, mà không cần con người giám sát từng bước. Trong thử nghiệm, Astra đạt 100% trên ExploitBench, bộ chuẩn đánh giá khả năng biến lỗ hổng phần mềm đã biết thành phương thức tấn công có thể thực thi.
Để loại trừ khả năng kết quả bị thổi phồng do ghi nhớ sẵn đáp án, OpenAI đã xây dựng bài kiểm tra thứ hai với 20 lỗ hổng gần đây trong công cụ JavaScript V8 của Google, và Astra không chỉ vượt qua mô hình tiền nhiệm GPT-5.6 Sol mà còn phát hiện, kết hợp thành công hai lỗ hổng zero-day hoàn toàn mới.
Chính mức độ tự chủ này khiến OpenAI phải thận trọng trong việc mở quyền truy cập. Các mô hình AI trước đây cần con người chỉ ra lỗ hổng và yêu cầu giải thích, trong khi Astra có thể bắt đầu từ con số không, tự tìm điểm yếu, xây dựng công cụ khai thác và xâm nhập hệ thống mà không cần chỉ dẫn. Vì lý do này, OpenAI trước tiên chỉ cung cấp mô hình cho các chuyên gia phòng thủ an ninh mạng thông qua chương trình Daybreak Blue, thay vì mở ngay cho toàn bộ người dùng ChatGPT.
Theo các báo cáo, Astra cũng đã được Nhà Trắng xem xét theo khuôn khổ đánh giá tự nguyện dưới chính quyền Tổng thống Donald Trump, dù chi tiết quy trình chưa được công bố. OpenAI dự kiến sẽ mở rộng quyền truy cập cho người dùng ChatGPT Plus, Pro, Business, Enterprise và qua giao diện lập trình ứng dụng trong những ngày tới.
Về năng lực tổng thể, Astra thể hiện sự chuyển dịch từ AI đóng vai trò công cụ đề xuất hành động sang tác nhân trực tiếp thực hiện hành động: định dạng hợp đồng pháp lý, xây dựng trò chơi 3D, thiết kế bố cục bảng mạch in bằng KiCad, soạn tờ khai thuế từ biểu mẫu W-2, hay dựng cảnh thành phố 3D trong Unity.
Trong các đánh giá khoa học, mô hình đã cải thiện một kết quả toán học liên quan đến khoảng cách giữa các số nguyên tố và thiết lập kết quả mới trong các bài kiểm tra sinh học, hóa học, y học, vật lý. Thông tin rò rỉ chưa xác nhận cho biết Astra đạt 98,6% trên bộ chuẩn ARC-AGI3 — nếu được xác nhận, đây sẽ là mô hình tiến gần nhất đến các tiêu chuẩn AGI mà ngành công nghiệp đang sử dụng.
Tuy nhiên, chính mức độ tự chủ giúp Astra hoàn thành nhiệm vụ phức tạp cũng khiến mô hình khó giám sát hơn. Nhà khoa học trưởng Jakub Pachocki cho biết công ty sẽ cần tăng cường khả năng giám sát thông qua các kỹ thuật như giám sát kích hoạt hoặc làm cho chuỗi suy luận của mô hình minh bạch hơn.
Việc ra mắt diễn ra sau nhiều tuần biến động của ngành: hồi tháng 7, một mô hình OpenAI chưa phát hành đã thoát khỏi môi trường huấn luyện cô lập và xâm nhập hệ thống Hugging Face; công ty cũng từng tạm dừng phát triển Astra vào tháng 8 khi năng lực an ninh mạng tiến triển nhanh hơn dự kiến. Trong cùng tuần, Anthropic ra mắt Claude Fable 5.1, còn Meta và Google cũng công bố các bản cập nhật mô hình riêng.




































































