Anthropic ra mắt Claude Opus 5, vượt Fable 5 trên nhiều benchmark quan trọng, giá giữ nguyên 5 USD/triệu token đầu vào.
Claude Opus 5 chính thức được phát hành, với chi phí vận hành đối với doanh nghiệp thấp hơn so với mô hình hàng đầu của Anthropic là Claude Fable 5, sản phẩm được công ty định vị dành cho nhu cầu sử dụng hằng ngày của người dùng trả phí. Đáng chú ý hơn, Opus 5 cũng đạt kết quả tốt hơn trên nhiều bộ tiêu chuẩn đánh giá quan trọng, dù không thuộc lớp Mythos như Fable.
Để hiểu vị trí của Opus 5 trong danh mục sản phẩm, Anthropic hiện chia các mô hình thành bốn phân khúc: Haiku có tốc độ nhanh và chi phí thấp, Sonnet thuộc phân khúc trung cấp, Opus là dòng mô hình chủ lực dành cho các tác vụ nặng, còn cao hơn nữa là lớp Mythos, bao gồm Claude Fable 5 dành cho công chúng và Claude Mythos 5, phiên bản có ít hạn chế hơn chỉ được cung cấp thông qua Project Glasswing cho các nhà nghiên cứu an ninh mạng đã qua thẩm định.
Fable 5 đã trải qua giai đoạn khó khăn trong vai trò mô hình chủ lực: được phát hành ngày 9/6 nhưng bị rút khỏi thị trường toàn cầu chỉ ba ngày sau đó do lệnh kiểm soát xuất khẩu khẩn cấp của Chính phủ Mỹ, trước khi được đưa trở lại vào ngày 30/6 dưới hình thức chỉ sử dụng bằng tín dụng. Opus 5 hiện đảm nhận vị trí mà Fable 5 không thể duy trì.
Lovable, nền tảng dành cho nhà phát triển với hàng triệu người dùng, ghi nhận rằng mô hình không chỉ hoạt động tốt hơn trong các tác vụ lập trình tác tử khó nhất, tăng 22% so với Opus 4.7, mà còn ổn định hơn với mức độ biến động giữa các lần chạy thấp hơn đáng kể, theo tuyên bố của Fabian Hedin do Anthropic cung cấp.
Các bộ tiêu chuẩn đánh giá
Trên Frontier-Bench v0.1, bộ tiêu chuẩn đánh giá khả năng hoàn thành toàn bộ quy trình các tác vụ kỹ thuật phần mềm thực tế, Opus 5 đạt 43,3%, so với 33,7% của Fable 5 và 34,4% của GPT-5.6 Sol thuộc OpenAI.
Khoảng cách lớn nhất được ghi nhận trên ARC-AGI-3, bài kiểm tra năng lực giải quyết vấn đề từ các câu đố mới: Opus 5 đạt 30,2%, GPT-5.6 Sol đạt 7,8%, trong khi Fable 5 không được thử nghiệm. Trên GDPval-AA v2, bộ tiêu chuẩn đánh giá công việc tri thức theo hệ thống xếp hạng Elo, Opus 5 đạt 1.861 điểm, vượt 1.747 điểm của Fable 5 và 1.736 điểm của GPT-5.6 Sol.
Zapier thử nghiệm Opus 5 trên AutomationBench và ghi nhận mô hình hoàn thành trọn vẹn quy trình ngăn ngừa khách hàng rời bỏ dịch vụ, đạt tỷ lệ 100%, trong khi các mô hình trước đó đều không vượt qua.
Anthropic cũng định vị Opus 5 như một bước nâng cấp cho hoạt động nghiên cứu khoa học, được Ultima Genomics mô tả là hoạt động thận trọng như một nhà khoa học thực thụ khi lựa chọn đúng phép kiểm định thống kê và tự kiểm tra chéo kết quả. Tuy nhiên, pháp lý và y tế vẫn là hai lĩnh vực hiếm hoi mà Fable 5 vượt trội hơn, dù với khoảng cách rất nhỏ.
Đợt phát hành diễn ra một tuần sau khi Moonshot AI, công ty khởi nghiệp Trung Quốc được Alibaba hậu thuẫn, giới thiệu Kimi K3, mô hình trọng số mở 2,8 nghìn tỷ tham số mà các bộ tiêu chuẩn độc lập xếp ở vị trí thứ ba chung cuộc.
Opus 5 hiện được cung cấp qua API với giá 5 USD cho mỗi triệu token đầu vào và 25 USD cho mỗi triệu token đầu ra, cùng chế độ Nhanh chạy nhanh gấp 2,5 lần với giá gấp đôi mức cơ bản, đồng thời được cung cấp theo hình thức đăng ký cho mọi người dùng.




































































