Gemini 4 Argon dẫn đầu 12/18 bài đánh giá, tỷ lệ bị tấn công chèn lệnh chỉ 0,7%, nhưng ưu tiên cấp cho nhóm phòng thủ không kèm rào chắn.
Google công bố Gemini 4 Argon vào thứ Tư, định vị đây là mô hình tiên phong dành cho lập trình, công việc văn phòng và phòng thủ an ninh mạng. Sản phẩm ra mắt một tuần sau Claude Opus 5.5 và chỉ một ngày sau GPT-6.1 Sol, cho thấy nhịp đua giữa các phòng thí nghiệm AI Mỹ chưa có dấu hiệu chậm lại.
Trong bài kiểm tra kỹ thuật phần mềm DeepSWE v1.1, Argon đạt 77,9%, nhỉnh hơn Claude Opus 5.5 (74,2%), GPT-6 Astra (74,1%) và Claude Fable 5.1 (67,4%). Gemini 3.6 Flash chỉ đạt 49% hồi tháng 7. Argon cũng có thể tạo tới 1 triệu token mỗi phản hồi, tương đương khoảng 750.000 từ, so với mức 64.000 token trước đó.
Các con số này cần được đọc thận trọng. Google tự tính điểm DeepSWE của mình, còn số liệu của đối thủ lấy từ bảng xếp hạng công khai và báo cáo của từng hãng. Theo chính bảng so sánh của Google, Argon đứng đầu 12 trong 18 bài đánh giá, hòa một bài và xếp sau ở năm bài còn lại, gồm các bài về lập trình, khoa học và điều khiển máy tính.
An ninh mạng là điểm nhấn, nhưng cũng là rủi ro lưỡng dụng
Năng lực nổi bật nhất của Argon nằm ở an ninh mạng. Trong bài đánh giá Indirect Prompt Injection của Gray Swan, các chỉ dẫn độc hại được cài vào nội dung mà tác nhân AI đọc, và tỷ lệ tấn công thành công trong 15 lần thử được ghi nhận.
Argon đạt 0,7%, thấp hơn mức 1,0% của cả Claude Opus 5.5 lẫn Claude Fable 5.1. GPT-6 Astra bị đánh lừa 8,5% số lần, còn Grok 4.6 và Kimi K3 thất bại trong hơn một nửa số trường hợp, lần lượt ở mức 51,8% và 52,7%. Với người dùng muốn giao quyền truy cập hộp thư hay giỏ hàng cho AI, đây là một trong những rủi ro then chốt.
Ở mảng tấn công thử nghiệm, Argon đạt 70,9% trong Wiz Penetration Test Benchmark, bài kiểm tra nội bộ của Google yêu cầu viết mã khai thác lỗ hổng ứng dụng web thật mà không xem mã nguồn, so với 58,2% của Gemini 3.8 Flash Cyber. Google cho biết mô hình đã giúp công ty an ninh mạng Wiz phát hiện một lỗ hổng nghiêm trọng trong phần mềm y tế được bệnh viện trên toàn thế giới sử dụng, lỗ hổng mà các mô hình tiên phong trước đó bỏ sót.
Argon sẽ được cấp cho các nhóm an ninh mạng đã qua thẩm định thông qua Fairwind Program, chương trình truy cập hạn chế triển khai từ ngày 2 tháng 9 với hơn 650 đối tác, gồm các chính phủ và đơn vị vận hành hạ tầng trọng yếu. Điểm gây chú ý là mô hình được cung cấp không kèm các rào chắn an ninh mạng, tức không áp dụng cơ chế từ chối thường ngăn AI hỗ trợ hoạt động tấn công. Lập luận của Google là bên phòng thủ cần một công cụ tư duy như kẻ tấn công để vá lỗ hổng trước tội phạm.
Vì năng lực này có thể bị lợi dụng theo cả hai hướng, hãng chọn triển khai theo giai đoạn và tham gia quy trình tự nguyện của Chính phủ Mỹ về cấp quyền truy cập trước khi phát hành. Cách làm này tương tự Claude Mythos của Anthropic, từng hỗ trợ phát hiện 271 lỗ hổng trong Firefox, và chương trình Trusted Access for Cyber của OpenAI.
Đợt ra mắt diễn ra sau mùa hè khó khăn của Google, khi hãng không phát hành Gemini 3.5 Pro như đã hứa hồi tháng 7, khiến cổ phiếu Alphabet giảm khoảng 4,4%. Phiên bản phổ thông sẽ đến sớm nhất có thể, trước hết với khách hàng API trả phí và thuê bao Google AI Ultra, theo mức giá giới thiệu 2 USD cho mỗi triệu token đầu vào và 10 USD cho mỗi triệu token đầu ra. Mức giá tiêu chuẩn sẽ là 4 USD và 20 USD.



































































