Meta trình làng Muse Code chạy trên Muse Spark 1.2, nổi bật với khả năng phục hồi sau sự cố, nhưng vẫn kém Claude Code trên nhiều bộ tiêu chuẩn đánh giá.
Meta vừa chính thức gia nhập cuộc đua công cụ lập trình có tính tác nhân, lĩnh vực vốn đang do Anthropic và OpenAI dẫn dắt, với sự ra mắt của Muse Code phiên bản thử nghiệm.
Công cụ này hoạt động trên thiết bị đầu cuối, được vận hành bởi Muse Spark 1.2 — mô hình mới nhất của công ty, được thiết kế để đảm nhiệm các nhiệm vụ kỹ thuật phần mềm phức tạp trên những kho mã nguồn quy mô lớn, từ lập kế hoạch thay đổi, viết mã cho đến xác thực kết quả, đồng thời có khả năng điều phối nhiều tác nhân phụ hoạt động song song.
Điểm khác biệt lớn nhất của Muse Code nằm ở môi trường thực thi. Công cụ ghi lại toàn bộ các lần gọi mô hình, thao tác chạy công cụ, phê duyệt và chỉnh sửa vào một nhật ký sự kiện cục bộ, đóng vai trò là nguồn dữ liệu xác thực duy nhất, giúp tác nhân có thể tiếp tục chính xác từ vị trí đã dừng sau khi xảy ra sự cố.
Đây được xem là tính năng có giá trị đối với các tác vụ chạy trong thời gian dài, một khía cạnh mà các đối thủ cạnh tranh chưa khai thác như một lợi thế thương mại rõ rệt. Công cụ cũng tích hợp sẵn các lệnh kỹ năng như “/plan” để lập kế hoạch chờ phê duyệt, “/grill” để liên tục chất vấn kế hoạch cho đến khi đủ vững chắc, và “/goal” để hướng tới hoàn thành mục tiêu cuối cùng.
Khoảng cách hiệu năng qua các bộ tiêu chuẩn đánh giá
Trên bộ tiêu chuẩn Terminal-Bench 2.1, Muse Spark 1.2 kết hợp với Muse Code đạt 82,9%, thấp hơn mức 86,7% của Claude Code chạy trên Opus 5, nhưng nhỉnh hơn GPT-5.6 Terra trên Codex (81,8%) và Grok Build (81,6%). Khoảng cách thu hẹp hơn trên bộ tiêu chuẩn DeepSWE 1.1 đo lường năng lực lập trình có tính tác nhân, khi Muse đạt 59,3%, so với 65,0% của Opus 5 và 64,8% của Codex; còn trên bộ tiêu chuẩn nội bộ của Meta, Muse đạt 70,6%, kém Opus 5 ở mức 79,4%.
Đáng chú ý, các biểu đồ đo mức tăng tốc sau hơn 1.000 lần gọi công cụ lại cho thấy Opus 5 dẫn đầu với mức cải thiện 74-75% so với đường cơ sở, trong khi Muse Spark 1.2 chỉ đạt mức cải thiện 61-69%.
Dù vậy, Meta nhấn mạnh khả năng vận hành bền bỉ trong thời gian dài của Muse Code, minh họa bằng việc tối ưu hóa lặp lại các nhân xử lý đồ họa qua hơn 1.000 lần gọi công cụ, kéo dài tới 24 giờ trên bộ xử lý đồ họa Nvidia Hopper. Công ty cũng trình diễn khả năng đa phương thức khi Muse Code diễn giải một đoạn video MP4 mô phỏng hành trình bay xuyên căn nhà và tự động tạo ra một trang web có chức năng đặt chỗ.
Tuy nhiên, Meta bước vào cuộc đua này khá muộn, khi Codex của OpenAI đã hỗ trợ vận hành song song nhiều tác nhân trên nền tảng đám mây, còn các công cụ như Hermes hay OpenClaw đã trở thành lựa chọn thay thế với nhiều năng lực bổ sung. Lợi thế cạnh tranh của Muse Code hiện nằm ở khả năng phục hồi sau sự cố và kiến trúc tác nhân phụ, hơn là vị trí dẫn đầu trên các bộ tiêu chuẩn đánh giá then chốt.




































































