К содержимому
Claude Code с 0:полный курс
Новости ClaudeАвтор: Михаил Кузьмицкий

Какую модель Claude выбрать: гид по Mythos, Fable, Opus, Sonnet и Haiku

Русская адаптация материала Anthropic — подготовлена с участием AI, проверена автором.

Коротко

Anthropic объясняет, чем отличаются классы моделей Claude и как выбрать подходящую под задачу — от самой мощной Fable до быстрой и дешёвой Haiku.

У Anthropic теперь несколько классов моделей Claude, и самый частый вопрос, который они слышат от разработчиков — «а какую модель брать для моей задачи?». Раньше ответ был простым: бери что есть. Сейчас линейка выросла, и выбор стал не таким очевидным. Anthropic выпустила гид, который раскладывает всё по полочкам: какие бывают модели, чем они отличаются и как принять решение без долгих экспериментов.

Ряд деревянных коробок разного размера, символизирующих классы моделей

Главный совет: начинай с самой умной модели

Если убрать все нюансы, совет Anthropic звучит просто: по умолчанию начинай с самой мощной доступной модели, а под конкретную задачу подстраивай не саму модель, а «уровень усилий» (effort level) — параметр, который регулирует, сколько модель «думает» перед ответом.

Звучит нелогично — зачем платить за дорогую модель, если можно взять дешёвую? Но на практике стоимость за задачу (а не за токен) часто оказывается ниже именно у мощных моделей, особенно на низком уровне усилий. Дело в том, что умная модель обычно решает задачу за меньшее число «раундов» и меньше времени размышляет, чтобы получить верный результат. К тому же, если начать с маленькой модели и что-то пойдёт не так, сложно понять — это модель не справилась или дело в настройке промпта и инструментов.

Конечно, если задача чувствительна к задержке или бюджету, можешь и должен протестировать модели младших классов, пока не найдёшь идеальный баланс. Некоторые команды идут и в обратную сторону: стартуют с самой дешёвой модели и поднимаются по классам, пока качество не дотянется до нужной планки. Оба подхода рабочие — Anthropic описывает их в своей документации по выбору модели.

Семейство моделей Claude

Ключевая идея, которую подчёркивает Anthropic: классы моделей не специализируются на разных областях. Никто не советует «эту модель — для финансов, а эту — для науки». Каждая модель Claude обучена одинаково хорошо работать с кодом, агентными задачами и интеллектуальной работой в целом. Разница между классами — в том, насколько сложную задачу модель способна надёжно вытянуть, и сколько это стоит по цене и скорости.

КлассДля чегоОсобенности
Mythos / FableСамые сложные задачи: код, длинные агентные цепочки, нерешённые ранее проблемыТоповые возможности во всех областях
OpusЗадачи корпоративного уровня, требующие рассужденийЛидирует в бенчмарках знаниевой работы и агентного кодинга
SonnetПовседневные задачи широкого спектраБаланс качества, цены и скорости, годится для суб-агентов
HaikuВысокочастотные нагрузкиСамая быстрая и дешёвая модель

Иллюстрация семейства моделей Claude разных классов. Источник: Anthropic

Mythos и Fable — предел возможностей

Mythos — самый мощный класс моделей Anthropic, с передовыми возможностями во всех областях. Он особенно хорош в коде, длительных агентных задачах и решении проблем, которые ИИ до этого надёжно не решал.

Интересная деталь: Mythos на самом деле выходит в двух «упаковках» одной и той же базовой модели. Claude Mythos предназначен для доверенных организаций, работающих с задачами двойного назначения в кибербезопасности и биологии, а Claude Fable — та же модель, но с дополнительными защитными механизмами, которые делают её безопасной для широкого использования. Обе версии требуют ограниченного хранения данных для безопасного применения.

Доступ к Mythos ограничен — модель доступна только организациям в рамках программы Project Glasswing. Это важно учитывать при планировании: не каждая компания и не каждая роль внутри компании получит доступ ко всем классам моделей.

Opus — мощь для интенсивных рассуждений

Opus — это класс моделей для задач корпоративного уровня, требующих интенсивных рассуждений. Модели Opus стабильно оказываются среди лидеров по ключевым отраслевым бенчмаркам: например, по GDPval-AA (оценка знаниевой работы) и Terminal-Bench 2.1 (агентный кодинг).

На первый взгляд, выбор между Opus и Fable неочевиден — оба класса отлично справляются с кодом, длинными агентными задачами и знаниевой работой. Но на реальных сценариях крупные модели вроде Fable проявляют больше «мудрости», креативности и писательских навыков, даже если бенчмарки показывают похожие цифры с Opus. Общее правило простое: если твои эвалы или внутренние тесты показывают, что Opus где-то спотыкается — переходи на Fable. Если Opus уже уверенно проходит планку качества, то его скорость и цена делают его лучшим выбором.

Sonnet и Haiku — рабочие лошадки

Sonnet — универсальный класс для повседневных задач. Он даёт баланс производительности, цены и скорости для самого широкого набора применений, включая высокочастотных суб-агентов в мультиагентных системах, где много параллельных вызовов модели.

Haiku — самый дешёвый и быстрый класс моделей Anthropic. Он создан для высокочастотных нагрузок, где задержка и стоимость критичны — например, для массовой обработки коротких запросов, где на первом месте не глубина рассуждений, а скорость ответа. Если ты только начинаешь разбираться, чем вообще отличаются модели и термины вроде «токен» или «промпт» — можешь заглянуть в словарь новичка, там всё это разложено просто.

Как выбрать модель под свою задачу

Anthropic предлагает конкретные вопросы, которые помогают определиться с выбором:

  • Насколько сложна задача? Если она обычно занимает много времени, состоит из многих шагов или ранее не решалась надёжно — нужен более мощный класс модели.
  • Какие требования к задержке? Для высокочастотных клиентских сценариев чаще всего лучшим выбором окажется Sonnet.
  • Какие есть ограничения доступа? Mythos доступен только организациям в рамках Project Glasswing, и не все классы моделей открыты всем ролям внутри компании.
  • Какая экономика на единицу задачи? Для больших объёмов производства может быть выгоднее взять модель младшего класса — особенно если эвалы показывают, что она справляется удовлетворительно. Модели по-разному тарифицируются за токен, и итоговая цена за задачу зависит от возможностей модели и выбранного уровня усилий.

Уровень усилий (effort level) тоже сильно влияет на баланс качества, скорости и цены. Модели старших классов на высоком уровне усилий дают максимально возможную производительность, а те же модели на низком уровне усилий иногда оказываются эффективнее моделей младших классов даже по деньгам.

График соотношения качества, скорости и цены при разных уровнях усилий модели. Источник: Anthropic

Совет

Прежде чем экспериментировать с промптами и настройками вручную, попробуй разобраться в основах через бесплатный курс — например, С чего начать путь в Claude Code поможет освоить базовые принципы работы с моделями и инструментами Claude.

Стратегия «советника»: объединяем силу моделей

Отдельный приём, который описывает Anthropic — «стратегия советника» (advisor strategy). Идея в том, что быстрая и дешёвая модель-исполнитель может обращаться к более умной модели, чтобы та проверила её план или оценила уже сделанную работу. Модель-советник подключается не постоянно, а только когда исполнителю нужна подсказка — и это заметно повышает качество результата без полного перехода на дорогую модель.

Пример из статьи: на бенчмарке SWE-bench Pro комбинация Sonnet 5 (исполнитель) с советником Fable 5 показывает результат в пределах 10% от результата, который дала бы чистая Fable 5 на всей задаче — но за 63% от стоимости использования Fable 5 целиком. Это отличная иллюстрация того, как разумное комбинирование моделей экономит бюджет, почти не теряя в качестве.

Схема работы стратегии советника: быстрая модель-исполнитель обращается к более мощной модели за проверкой. Источник: Anthropic

Заметка

Стратегия советника особенно полезна в мультиагентных системах, где десятки лёгких суб-агентов делают основную работу, а один мощный «наблюдатель» подключается только для проверки критичных шагов.

Роль эвалов и бенчмарков в выборе модели

Есть два основных способа проверить, достаточно ли возможностей модели для твоей задачи: стандартные бенчмарки и собственные эвалы (evaluations). Бенчмарки — это набор заранее определённых задач с известными решениями, часто заточенных под конкретную область. Они дают хороший ориентир при сравнении классов моделей и разных провайдеров.

Проблема возникает, когда речь заходит о самых мощных моделях, таких как Opus и Fable — они решают почти все вопросы в тесте, и бенчмарк «насыщается», перестаёт различать модели между собой. В таких случаях Anthropic советует тестировать модели на реальных рабочих нагрузках или собирать собственные эвалы для принятия решения. Обычно такие эвалы — это подборка задач из продакшена, включая сложные случаи, где текущие инструменты не справляются, с критериями успеха, которые определяет сама команда. Именно здесь начинают проявляться различия в возможностях и креативности между топовыми моделями — и между ними и остальным полем.

Главный вывод

Единого универсального рецепта выбора модели Claude не существует — именно поэтому Anthropic держит несколько классов моделей одновременно. Лучший способ определиться — разобраться в базовых характеристиках каждого класса и глубоко понять свою задачу, а затем построить, поддерживать и регулярно прогонять собственные эвалы. Если хочешь глубже разобраться в том, как формулировать задачи для модели и задавать ей верную «роль», посмотри пост Роль и тон: назначь Claude нужного эксперта — это отлично дополняет выбор модели правильной настройкой промпта.

Частые вопросы

Какую модель Claude выбрать по умолчанию?

Anthropic советует начинать с самой мощной доступной модели и подстраивать «уровень усилий» под задачу, а не сразу брать дешёвую модель — итоговая стоимость за задачу у мощных моделей часто оказывается ниже.

В чём разница между Claude Mythos и Claude Fable?

Это одна и та же базовая модель в двух «упаковках»: Mythos доступен только доверенным организациям для работы с чувствительными областями (кибербезопасность, биология), а Fable — та же модель с дополнительными защитными механизмами для широкой публики.

Когда выбрать Sonnet, а когда Opus?

Sonnet подходит для повседневных задач и высокочастотных сценариев, где важны скорость и цена. Opus — для задач, требующих интенсивных рассуждений корпоративного уровня, где нужна максимальная надёжность результата.

Что такое стратегия советника (advisor strategy)?

Это подход, при котором дешёвая быстрая модель выполняет основную работу, а более мощная модель подключается только для проверки плана и оценки результата — так можно получить качество почти как у топовой модели, но заметно дешевле.

Зачем нужны собственные эвалы, если есть готовые бенчмарки?

Топовые модели часто решают почти все задачи в стандартных бенчмарках, и тест перестаёт различать модели между собой. Собственные эвалы на реальных рабочих задачах точнее показывают, какая модель подходит именно тебе.

Если хочешь попробовать всё это руками — начни с бесплатного курса «Claude с нуля».

Источник

По мотивам статьи Anthropic «Claude models explained: choosing the best model for your use case». Пересказали по-русски для новичков.

Читайте также

Попробуй на практике

Бесплатные интерактивные курсы по теме — прямо в браузере, с нуля.