Anthropic выпустила Claude Opus 5 — новую флагманскую модель, которая, по словам компании, приближается к возможностям топовой Claude Fable 5, но стоит вдвое дешевле. Это не просто «ещё одна версия» — модель заметно лучше проверяет собственную работу, доводит задачи до конца и держит фокус на длинных многошаговых проектах, где раньше модели сбивались или сдавались раньше времени.
Что изменилось и зачем это важно
Главная идея Opus 5 простая: дать почти топовый уровень интеллекта, но по цене «рабочей лошадки». Модель стала новым дефолтом в тарифе Claude Max и самой сильной моделью, доступной в Claude Pro. При этом цена осталась такой же, как у предыдущей версии — Opus 4.8, а производительность выросла кратно на многих задачах.

Важная деталь: у моделей Claude есть настройка «effort» (усилие) — она позволяет выбирать, сколько модель «думает» перед ответом. На низком усилии ответы быстрее и дешевле, на высоком — точнее и глубже. Opus 5 выигрывает на всех уровнях усилия, но особенно эффектно выглядит именно баланс: даже на минимальных настройках она обходит конкурентов по качеству.
Совет
Если ты новичок и не знаешь, с чего начать работу с моделями Claude в терминале, у нас есть бесплатный курс С чего начать путь в Claude Code — там объясняется всё по шагам.
Бенчмарки: сухие цифры
Anthropic прогнала Opus 5 через десятки тестов — от программирования до научных задач. Вот самое заметное:
| Тест | Что проверяет | Результат Opus 5 |
|---|---|---|
| Frontier-Bench v0.1 | Сложные инженерные/кодовые задачи | Обошла все модели, более чем вдвое обогнала Opus 4.8, дешевле за задачу |
| CursorBench 3.2 | Работа программиста в IDE | На максимальном усилии — в пределах 0,5% от пика Fable 5, но за половину цены |
| ARC-AGI 3 | Решение принципиально новых задач | Втрое выше результата следующей лучшей модели |
| Zapier AutomationBench | Сквозные бизнес-процессы от начала до конца | Проходимость примерно в 1,5 раза выше конкурента при той же цене за задачу |
| OSWorld 2.0 | Управление компьютером (computer use) | Обходит все модели по соотношению цена/качество, превосходит пик Fable 5 при трети её стоимости |
Модель также стала лучшей и самой экономичной на GDPval-AA v2, HLE и DeepSearchQA — тестах, которые имитируют реальную интеллектуальную работу: анализ данных, поиск информации, решение неочевидных проблем.
Отдельно выделяются научные задачи. В биологии и химии Opus 5 обошла Opus 4.8 на всех внутренних тестах: на задачах органической химии (например, восстановление структуры молекулы по данным спектроскопии) — на 10,2 процентных пункта, на задачах про белки (предсказание, как изменения в последовательности влияют на функцию) — на 7,7 процентных пункта.
Как модель ведёт себя на практике
Цифры — это одно, но интереснее конкретные истории. В одном из тестов Frontier-Bench модели дали чертёж детали и попросили написать код, который восстановит её как 3D-модель в FreeCAD — но специально не дали способа напрямую «посмотреть» на чертёж. Opus 5 сама написала пайплайн компьютерного зрения, чтобы вытащить геометрию из пикселей изображения, и восстановила деталь целиком. Ни одна конкурирующая модель не справилась с той же задачей за пять попыток.
В другом случае модели дали реальный баг в популярном open-source пакетном менеджере. Opus 5 нашла корневую причину и исправила крайний случай, который пропустил даже патч от сообщества. Конкурирующая модель тем временем исправила только симптом — и доложила, что баг решён.
Заметка
Показательный момент: инженер трейдинговой компании попросил Opus 5 собрать за одну сессию фид рыночных данных для новой биржи. Предыдущие модели не справлялись с этой задачей даже с подробным планом от человека. Opus 5 не нашла живого источника для проверки — и построила собственный тестовый стенд, чтобы убедиться, что код правильно разбирает данные биржи.
Что говорят партнёры
Ранний доступ к модели получили десятки компаний, и отзывы удивительно конкретны — с цифрами и деталями рабочих процессов:
- Devin (Scott Wu): на FrontierCode 1.1 модель приближается к уровню Fable по интеллекту при половине цены, особенно сильна в сложном дебаге.
- Cursor (Sualeh Asif): на CursorBench чуть ниже Fable 5, с похожим поведением — важно для разработчиков, которые работают в редакторе.
- Zapier (Wade Foster): модель возглавила таблицу AutomationBench без увеличения расхода токенов; прошла полный цикл предотвращения оттока клиентов на 100%, тогда как предыдущие модели не справлялись.
- Box (Ben Kus): Opus 5 обходит Opus 4.8 на 8% в целом, с ростом на 11% в анализе данных и на 17% в задачах due diligence.
- Lovable (Fabian Hedin): рост на 22% на сложных агентных задачах программирования по сравнению с Opus 4.7, плюс заметно меньше «разброса» между запусками — то есть результат стабильнее от раза к разу.
- Финансовый анализ (Richard Pham): на сложных задачах финансового моделирования — в среднем на 9 процентных пунктов выше точность, при этом на треть меньше «ходов» и вызовов инструментов и на 60% меньше времени.
- Юридическая работа (Niko Grupen): заметный рост в корпоративном праве и арбитраже, при этом на 26% меньше токенов при сохранении качества по сравнению с Opus 4.8 на максимальном режиме рассуждений.
- Трейдинг (Matt Nassr): лучший результат среди моделей Opus на внутреннем трейдинговом бенчмарке — при этом модель тратит примерно в семь раз меньше токенов на рассуждения и работает вдвое быстрее, чем Opus 4.8.
Похожие отзывы прислали команды Devin, JetBrains, Kiro, и других инструментов — общий мотив: модель не просто умнее, она рассуждает более экономно и предсказуемо.
Визуальные способности
Отдельно Anthropic показала, насколько Opus 5 прокачалась в создании интерактивной визуализации — то, что раньше требовало ручной доводки.

Модель сама построила симуляцию воздушного потока вокруг аэродинамических и не очень аэродинамических объектов — с возможностью менять параметры на лету.

А ещё Opus 5 собрала простую, но интерактивную иллюстрацию клетки с её элементами — то есть модель одинаково хорошо работает и с кодом «под капотом», и с визуальным результатом, который видит человек.
Безопасность и «характер» модели
По внутренним автоматическим проверкам поведения, Opus 5 оказалась самой согласованной («aligned») моделью Anthropic на сегодня: она лучше следует «конституции» Claude, реже ведёт себя обманно и хуже поддаётся на попытки заставить её сделать что-то плохое. По шкале общего несогласованного поведения модель набрала 2,3 балла — самый низкий (то есть лучший) показатель среди последних моделей компании.
При этом Opus 5 не сдвигает границу в рискованных двойного назначения областях — биология и кибербезопасность. В тестах вместе с частными и государственными партнёрами модель осталась позади модели Mythos 5 в обеих категориях. Интересная деталь: Opus 5 умеет находить уязвимости в коде почти на уровне Mythos 5, но заметно хуже превращает эти уязвимости в реальные эксплойты — то есть находить «дырку» она умеет, а вот эффективно ей воспользоваться — куда хуже.
Защитные меры
Классификаторы кибербезопасности Opus 5 срабатывают примерно на 85% реже, чем у Fable 5, но при этом блокируют «бинарное» сканирование уязвимостей, пентестинг и генерацию эксплойтов. Запросы, которые всё же попадают под фильтр, в Claude.ai, Claude Code и Claude Cowork по умолчанию перенаправляются на Opus 4.8.
Для легитимных исследователей и компаний, которым нужны более широкие возможности для тестирования безопасности, у Anthropic есть программа Cyber Verification Program (CVP) — участники получают доступ к версии модели с меньшим числом ограничений.
Частые вопросы
Чем Claude Opus 5 отличается от предыдущей версии Opus 4.8?
Opus 5 показывает кратно лучшие результаты на большинстве бенчмарков — от программирования до научных задач — при той же цене за использование. Она лучше проверяет собственную работу, реже ошибается и стабильнее ведёт себя от запуска к запуску.
Правда ли, что Opus 5 дешевле топовых моделей?
Да, по заявлению Anthropic, на многих задачах Opus 5 приближается к результатам топовой модели Fable 5, но стоит примерно в два раза дешевле за задачу — за счёт более эффективного использования вычислительных ресурсов.
Где можно попробовать Claude Opus 5?
Модель стала новым дефолтным движком в тарифе Claude Max и доступна как самая сильная модель в Claude Pro, а также через API и партнёрские инструменты вроде Cursor, Devin, Kiro и JetBrains IDE.
Насколько Opus 5 безопасна с точки зрения кибербезопасности?
Модель умеет находить уязвимости почти на уровне более специализированной модели Mythos 5, но заметно хуже создаёт из них реальные эксплойты. Кроме того, у неё есть встроенные классификаторы, которые блокируют пентестинг и генерацию эксплойтов, перенаправляя такие запросы на предыдущую модель.
Вывод
Claude Opus 5 — это редкий случай, когда «дешевле» не означает «слабее». Модель почти догнала топовый уровень интеллекта, стала экономичнее по токенам и заметно надёжнее в длинных многошаговых задачах — будь то отладка кода, финансовое моделирование или юридический ревью. При этом Anthropic сознательно не стала прокачивать модель в опасных областях вроде создания эксплойтов, оставив это узкоспециализированным моделям с более строгими защитами.
Если раньше выбор между «мощная и дорогая» моделью и «дешёвая, но послабее» был неизбежным компромиссом, то Opus 5 показывает, что этот разрыв можно заметно сократить. Для повседневной работы — в коде, в аналитике, в агентных сценариях — это, судя по отзывам первых пользователей, ощущается как честное повышение уровня, а не маркетинговая цифра в пресс-релизе.
Если хочешь попробовать всё это руками — начни с бесплатного курса «Claude с нуля».
Источник
По мотивам статьи Anthropic «Introducing Claude Opus 5». Пересказали по-русски для новичков.