Anthropic выпустила Claude Opus 5
Anthropic представила Claude Opus 5, возможности которой «приближаются к интеллекту» флагманской Fable 5. Компания сразу открыла доступ к модели на всех платформах.
Introducing Claude Opus 5.
It's a thoughtful and proactive model that comes close to the frontier intelligence of Fable 5 at half the price. pic.twitter.com/GQWhcq2CQL
Она стала моделью по умолчанию в подписке Max, а цены остались на уровне Opus 4.8 — $5 за млн входных токенов и $25 за млн выходных.
Anthropic утверждает, что Opus 5 приблизилась к уровню Claude Fable 5 при вдвое меньших затратах на токены. В компании также заявили, что модель «стала новым эталоном» в тестах на оценку навыков программирования и интеллектуального труда, таких как Frontier-Bench и GDPval-AA, хотя в задачах кибербезопасности она по-прежнему уступает Mythos 5.
По данным Anthropic, в бенчмарке Frontier-Bench v0.1 Opus 5 более чем вдвое превзошла Opus 4.8 при меньшей стоимости на задачу. В CursorBench 3.2 отставание от пикового результата Fable 5 составило менее 0,5% при вдвое более низкой стоимости.
В тесте ARC-AGI 3 Opus 5 показала результат в три раза выше ближайшего конкурента. На платформе Zapier AutomationBench, оценивающей решение бизнес-задач, показатель успешного исполнения оказался примерно в полтора раза выше при равных финансовых затратах. В тесте OSWorld 2.0 (оценка производительности компьютера) модель превзошла лучший результат Fable 5.
В Anthropic отдельно отметили прогресс в научных задачах. По данным компании, Opus 5 обошла Opus 4.8 во всех оценках по наукам о жизни. На внутреннем бенчмарке по органической химии результат вырос на 10,2 п.п., а в задачах, связанных с белками, — на 7,7 п.п.
По словам Anthropic, Opus 5 стала самой согласованной с правилами компании моделью. В автоматизированном поведенческом аудите показатель общего несогласованного поведения составил 2,3 — это лучший результат среди последних моделей Anthropic.
Для киберзадач Anthropic ослабила ограничения по сравнению с Fable 5. Компания оценила, что вмешательства классификаторов будут срабатывать примерно на 85% реже. При этом запросы, которые системы безопасности пометят в Claude.ai, Claude Code и Claude Cowork, по умолчанию будут перенаправляться на Opus 4.8. Аналогичное переключение можно включить и в API.
Отдельно Anthropic указала, что биологические запросы, которые блокируются на Fable 5, теперь будут направляться на Opus 5, а не на Opus 4.8.
Вместе с моделью Anthropic запустила в бета-режиме два обновления: возможность менять доступные инструменты по ходу диалога без сброса кеша промпта и автоматические переключения на резервные модели в API.
Напомним, Opus 4.8 компания представила в мае, одновременно добавив в Claude Code функцию динамических рабочих процессов.
Источник: https://forklog.com/news/ai/anthropic-vypustila-claude-opus-5