MDASH của Microsoft đạt 95,95% trên CyberGym, vượt Mythos 5 và GPT-5.6 Sol, chi phí giảm 50% so với cấu hình cũ.
Microsoft vừa chính thức phát hành mô hình chuyên biệt đầu tiên dành riêng cho lĩnh vực an ninh mạng, mang tên MAI-Cyber-1-Flash, đồng thời tích hợp mô hình này vào MDASH – hệ thống săn tìm lỗ hổng bảo mật sử dụng hơn 100 tác nhân trí tuệ nhân tạo chuyên biệt.
Theo công bố của công ty, hệ thống kết hợp này không chỉ vượt qua Mythos 5 của Anthropic và GPT-5.6 Sol của OpenAI về hiệu năng, mà chi phí vận hành còn thấp hơn tới 50% so với cấu hình MDASH tốt nhất trước đây.
Cụ thể, MDASH đạt điểm số 95,95% trên CyberGym – bộ tiêu chuẩn đánh giá yêu cầu các tác nhân AI tái tạo 1.507 lỗ hổng đã biết trong 188 dự án mã nguồn mở, sau đó được chấm điểm dựa trên tỷ lệ tái tạo thành công trong môi trường có kiểm soát.
Kết quả này giúp MDASH bỏ xa GPT-5.5 Cyber với 85,6%, Mythos 5 với 83,8%, GPT-5.6 Sol với 83,6% và Gemini 3.5 Flash Cyber với 83,2%, dù đây là con số do Microsoft tự công bố và chưa xuất hiện trên bảng xếp hạng công khai của CyberGym tại thời điểm bài viết được đăng tải.
Về mặt vận hành, MAI-Cyber-1-Flash không hoạt động đơn lẻ mà xử lý tới 90% khối lượng nhiệm vụ, trong khi 10% nhiệm vụ khó nhất được MDASH chuyển sang cho GPT-5.4 xử lý – một chi tiết quan trọng bởi chi phí tính theo token (đơn vị văn bản mà AI xử lý) phát sinh mỗi khi mô hình đọc mã nguồn hoặc tạo câu trả lời.
Đây được xem là lần đầu tiên một mô hình được Microsoft xây dựng theo hướng tối ưu chi phí lại có thể vượt qua các mô hình đa dụng hàng đầu vốn được thiết kế cho phạm vi năng lực rộng hơn nhiều.
Tổng giám đốc điều hành Satya Nadella nhận định rằng khi kết hợp với MDASH, MAI-Cyber-1-Flash mang lại hiệu năng hàng đầu thế giới với chi phí chỉ bằng một nửa so với các mô hình dẫn đầu thị trường.
Cơ chế đằng sau MDASH và cuộc đua xác thực lỗ hổng
Trong kiến trúc này, mô hình – tức MAI-Cyber-1-Flash – đảm nhiệm vai trò suy luận trên mã nguồn, còn bộ khung điều phối MDASH đóng vai trò hệ thống bao quanh, quyết định khu vực cần rà soát, phản biện các phát hiện đáng ngờ, loại bỏ kết quả trùng lặp và chứng minh một lỗi thực sự có thể bị khai thác.
Hơn 100 tác nhân chuyên biệt trong MDASH được giao nhiệm vụ kiểm toán mã nguồn, tranh luận để xác thực phát hiện và xây dựng bằng chứng khái niệm nhằm chứng minh lỗ hổng tồn tại trên thực tế.
Microsoft lập luận rằng mô hình quét định kỳ và vá lỗi chậm trễ truyền thống đang trở nên lỗi thời khi AI kéo giảm đáng kể chi phí phát hiện lỗ hổng, đồng thời khẳng định lợi thế dữ liệu an ninh tích lũy qua nhiều thập kỷ là yếu tố không thể tạo dựng nhân tạo.
Diễn biến này diễn ra trong bối cảnh giới nghiên cứu an ninh mạng liên tục tìm cách vượt qua hoặc bắt kịp năng lực của Claude Mythos kể từ khi mô hình này ra mắt, thậm chí đã tái tạo được phương pháp săn lỗ hổng tương tự bằng các mô hình công khai với chi phí dưới 30 USD mỗi lần quét.
Nhà nghiên cứu Dawid Moczadło nhận định lợi thế cạnh tranh hiện đang dịch chuyển từ khả năng tiếp cận mô hình sang năng lực xác thực kết quả, khi yếu tố khan hiếm thực sự nằm ở hệ thống có thể chứng minh phát hiện mà không làm nhà phát triển quá tải bởi cảnh báo sai.
Trước đó, GPT-5.5 Cyber từng dẫn đầu bảng xếp hạng công khai CyberGym với 85,6%, nhỉnh hơn Mythos, nhưng điểm số mới của Microsoft đã vượt xa con số này khoảng 10 điểm phần trăm.
Hiện MDASH đang được đưa vào giai đoạn thử nghiệm riêng tư thông qua Microsoft Security Exposure Management trên cổng Defender, cho phép khách hàng quét kho mã nguồn Git, xem các phát hiện xếp hạng từ mức khó xảy ra đến đã được chứng minh, và dùng giao diện dòng lệnh Defender CLI để tạo bản sửa lỗi đề xuất.
Giai đoạn này hiện giới hạn dung lượng kho mã nguồn ở khoảng 256 MB và chỉ cho phép một lượt quét đồng thời cho mỗi tenant, trong khi Project Perception được kỳ vọng sẽ mở rộng phương pháp đa tác nhân này sang giám sát mối đe dọa và khắc phục sự cố trên quy mô rộng hơn.




































































