Claude Opus 5.5 đạt hiệu năng tương đương Fable 5.1 nhưng giá thấp hơn 60%, dù GPT-6 Astra vẫn vượt trên hai bộ chuẩn đánh giá.
Anthropic đã phát hành Claude Opus 5.5 vào thứ Ba, mô hình đầu tiên thuộc dòng Claude 5.5 vừa được công ty công bố. Theo Anthropic, mô hình mới đạt mức hiệu năng tương đương Claude Fable 5.1, sản phẩm đầu bảng có giá cao nhất của hãng, trong phần lớn tác vụ, trong khi chi phí vận hành thấp hơn 20% so với Opus 5, mô hình mà nó thay thế, và thấp hơn tới 60% so với Fable 5.1.
Cuộc rượt đuổi hiệu năng và bài toán chi phí giữa các thế hệ mô hình
Diễn biến giá và hiệu năng của Opus 5.5 tiếp nối một chu kỳ cạnh tranh nội bộ đáng chú ý trong danh mục sản phẩm của Anthropic. Opus 5 ra mắt vào tháng 7 với mức giá thấp hơn Fable 5 và đạt điểm cao hơn trên phần lớn các bộ chuẩn đánh giá khi đó. Tuy nhiên, đến đầu tháng 9, Fable 5.1 xuất hiện và đảo ngược tình thế, vượt Opus 5 trên toàn bộ các bộ chuẩn mà Anthropic công bố.
Với Opus 5.5, công ty một lần nữa thu hẹp khoảng cách, nhưng lần này lợi thế chủ yếu đến từ giá thành hơn là điểm số hiệu năng thuần túy. Bản thân Anthropic cũng thừa nhận khoảng cách thực tế giữa Fable và Opus hẹp hơn so với những gì các bộ chuẩn thể hiện, song việc Opus 5.5 được cung cấp rộng rãi trong các gói dịch vụ cùng chi phí trên mỗi token thấp hơn khiến đây trở thành lựa chọn hợp lý đối với phần lớn người dùng Claude.
Phần lớn cải thiện năng lực của Opus 5.5 được Anthropic đo lường thông qua lập trình theo tác nhân, tức công việc do một tác nhân AI tự chủ triển khai qua nhiều bước hành động thay vì chỉ phản hồi một yêu cầu đơn lẻ. Trên Terminal-Bench 4.0, bộ chuẩn đánh giá khả năng hoàn thành nhiệm vụ chuyên môn phức tạp trong giao diện dòng lệnh, Opus 5.5 đạt 66,4%, cao hơn mức 55,8% của Fable 5.1 và 57,9% của GPT-6 Astra, mô hình đầu bảng của OpenAI.
Trên FrontierCode, bộ chuẩn đánh giá tỷ lệ các thay đổi mã nguồn do tác nhân thực hiện được chấp nhận hợp nhất trong quy trình kỹ thuật phần mềm thực tế, Opus 5.5 ghi nhận 54,4%, so với 50,3% của Fable 5.1. Trên GDPval-AA v2.1, bộ đánh giá năng lực thực hiện công việc chuyên môn trên 44 ngành nghề theo hệ thống xếp hạng Elo, Opus 5.5 đạt 1.846 điểm, vượt mức 1.735 điểm của Fable 5.1 và 1.708 điểm của chính Opus 5.
Dù vậy, Opus 5.5 không dẫn đầu trên mọi bộ chuẩn. Trên AutomationBench, bộ chuẩn do Zapier xây dựng nhằm đánh giá khả năng hoàn thành trọn vẹn quy trình nghiệp vụ mà không cần con người hỗ trợ, GPT-6 Astra đạt 41,4%, nhỉnh hơn mức 40,0% của Opus 5.5. Khoảng cách còn rõ rệt hơn trên Terminal-Bench-Science 0.1, bộ chuẩn đánh giá hoạt động nghiên cứu khoa học theo tác nhân trong môi trường dòng lệnh, khi Astra đạt 64,6% so với 58,7% của Opus 5.5.
Về giá, token đầu vào của Opus 5.5 hiện ở mức 4 USD mỗi triệu token, giảm từ 5 USD của Opus 5, trong khi token đầu ra giảm từ 25 USD xuống còn 20 USD. Đáng chú ý nhất, chi phí đọc bộ nhớ đệm, yếu tố chiếm phần lớn chi phí trong các phiên lập trình theo tác nhân kéo dài, giảm 60%, xuống còn 0,20 USD mỗi triệu token.
Do đạt năng lực tương đương lớp Mythos, phân khúc bị hạn chế truy cập nhiều nhất của Anthropic, trên hai nhóm năng lực an ninh mạng và sinh học, Opus 5.5 được triển khai với cùng cơ chế bảo vệ như Fable 5.1, trong đó phần lớn tác vụ an ninh mạng sẽ tự động được chuyển hướng sang mô hình Opus 4.8 cũ hơn.
Opus 5.5 là mô hình đầu tiên Anthropic phát hành kể từ khi Tổng giám đốc Dario Amodei công bố một bài luận kêu gọi ngành AI giảm tốc độ phát triển năng lực để theo kịp khả năng kiểm thử an toàn. Mô hình hiện đã được triển khai trên các nền tảng đám mây của Anthropic, bao gồm Amazon Web Services, Google Cloud và Microsoft Azure. Theo công ty, Sonnet 5.5 và Haiku 5.5 sẽ ra mắt trong những tuần tới, đi kèm mức giảm giá tương tự cho phần còn lại của danh mục sản phẩm.


































































