К содержимому
Claude Code с 0:полный курс
Новости ClaudeАвтор: Михаил Кузьмицкий

Как Cursor понял, что Claude Fable 5 готов к самым сложным задачам

Русская адаптация материала Anthropic — подготовлена с участием AI, проверена автором.

Коротко

Инженер Cursor рассказывает, как внутренний бенчмарк CursorBench и эксперимент с посадкой на Луну показали разницу между «локальным» и «глобальным» мышлением у моделей Claude.

Представь, что твоя работа — целыми днями ломать модели ИИ и смотреть, где они спотыкаются. Именно этим занимается Нейт Шмидт в Cursor: он изучает поведение моделей, разбирается, почему разработчики вдруг посреди задачи переключаются с одной модели на другую, и выносит вердикт, когда в компанию приходит новый релиз.

Ракета на поверхности Луны — символ модели, которая держит в голове всю миссию целиком

Cursor — это ИИ-агент для написания профессионального софта, который поддерживает все основные топовые модели, а не только свою. Это делает компанию редким по-настоящему нейтральным судьёй: у неё нет причин подсуживать какому-то одному вендору, зато есть прямой доступ к тому, как модели ведут себя в реальной, а не тестовой работе.

Зачем Cursor понадобился собственный бенчмарк

В какой-то момент команда Шмидта заметила странность: публичные баллы моделей на стандартных бенчмарках и реальное впечатление разработчиков от работы с ними стали расходиться. Модель могла показывать блестящие цифры — и при этом бесить пользователей в проде. Так родился CursorBench — внутренний тест, который пытается воспроизвести не «чистые» учебные задачи, а тот бардак, который разработчики реально присылают моделям.

Один из тестовых кейсов выглядит так: в модель просто вставляют стектрейс ошибки и пишут одно слово — «fix». Модели нужно самой понять намерение, найти корневую причину и проверить, что исправление действительно работает — никто не разжёвывает задачу заранее. В другом тесте пользователь сознательно называет неправильный модуль как источник проблемы — и тест смотрит, пойдёт ли модель бездумно чинить то, что ей сказали, или засомневается и проверит гипотезу сама.

Рекорд в 72,9% — и подозрения в читерстве

Когда через CursorBench прогнали Claude Fable 5, модель набрала 72,9% в режиме Max effort — новый максимум для бенчмарка и лучший результат из всех, что видела команда Cursor. Причём результат оказался настолько хорош, что в команде на секунду решили: тут что-то нечисто.

«Происходит одно из двух: либо модель действительно очень умная, либо она читерит», — говорит Шмидт. Поэтому команда полезла разбирать сами трейсы рассуждений — читать, как модель думала на самых трудных задачах, где на первый взгляд простой запрос требует понимания всей системы целиком. «Мы просто раз за разом видели, как модель вытаскивает победы там, где ни одна другая модель раньше не справлялась», — говорит он. При этом Fable 5 делала это меньшим числом операций — то есть была экономнее по токенам относительно объёма проделанной работы (о том, как вообще экономить токены в диалоге с Claude, у нас есть отдельный разбор в посте про экономный диалог с Claude).

Но публичный рекорд — это одно. Настоящую разницу Шмидт увидел не в таблице с баллами, а в собственных рабочих привычках: он перестал «раскачивать» модель перед каждой задачей — напоминать ей контекст, разжёвывать решение, проверять каждый шаг. «У меня больше нет чувства, что мне нужно вводить Fable 5 в курс мира, в котором я живу, и проблемы, которую я решаю, — говорит Шмидт. — Модель просто чувствует это из коробки».

Полёт на Луну как личный тест на интеллект

Один из любимых личных тестов Шмидта — буквально высадка на Луну. Несколько недель раньше он подключил Claude Opus к программируемому симулятору космических полётов с однострочным промптом: построй ракету и посади её на Луну — и оставил модель работать на втором мониторе 12–16 часов. Ракета запускалась, выходила на орбиту, у неё кончалось топливо; модель добавляла больше топлива — и ракета уже не могла пробить атмосферу, потому что стала слишком тяжёлой. Цикл повторялся снова и снова, без результата.

Инженер запускает космический симулятор для проверки модели на втором мониторе

Он повторил тот же чистый эксперимент с Claude Fable 5. Через несколько минут ракета взлетела, вышла на низкую орбиту и вернулась — на первый взгляд, тот же провал, что и с Opus. Но когда Шмидт прочитал стенограмму рассуждений, оказалось, что Fable 5 сознательно не пыталась долететь до Луны с первого раза: она решила сначала выполнить пробную миссию, чтобы просто выйти на орбиту и собрать телеметрию, а потом использовать эти данные для следующего полёта. Через несколько попыток двигательный шум на втором мониторе стих — на Луне стоял посадочный модуль. Весь прогон занял пару часов против двенадцати с лишним у Opus без всякого результата.

Ракета, успешно совершившая посадку на поверхности Луны

«С Opus это было локальное мышление — модель думала о том, что только что произошло и что сейчас произойдёт», — говорит Шмидт. «С Fable это глобальное мышление. Она думает про всю миссию целиком».

Локальное и глобальное мышление — в чём разница

Разница между этими двумя способами рассуждать проще, чем кажется. Локальное мышление — это когда модель реагирует на текущий шаг: получила ошибку, тут же её латает, не задумываясь, как эта заплатка скажется на системе дальше. Глобальное мышление — это когда модель сначала выстраивает план на всю задачу, собирает недостающие данные, тестирует гипотезы малыми шагами и только потом действует всерьёз.

Тип мышленияКак работаетРезультат в тесте с Луной
Локальное (Opus)Реагирует на текущее состояние, чинит симптомы по одному12–16 часов, ракета не долетела
Глобальное (Fable 5)Сначала собирает телеметрию, планирует всю миссиюПара часов, успешная посадка

Для реальной разработки это не абстракция. Именно глобальное мышление позволяет модели самой додумать, что автор багрепорта имел в виду, когда написал одно слово «fix», или усомниться в диагнозе пользователя вместо того, чтобы слепо чинить не тот модуль.

Когда доставать Fable, а когда — нет

У Шмидта появилось простое правило: если ты хорошо представляешь путь от точки A до точки B, тебе, возможно, Fable вообще не нужен — справится модель попроще и подешевле. Но если ты в точке A и вообще не знаешь, где находится B, Fable — отличный выбор. «Когда я хочу построить что-то правильно, Fable — первая модель, о которой я думаю», — говорит он.

Это правило особенно важно для команд с ограниченным бюджетом на ИИ. В Cursor этот баланс решают так: рутинные задачи отдают лёгким и быстрым моделям, а Fable 5 подключают именно там, где ограничением становится способность модели решить задачу, а не скорость. По словам Шмидта, такая комбинация — самая эффективная конфигурация, которую они когда-либо запускали.

Совет

Если тебе только предстоит выбрать между чатом, Claude Code и API для своей задачи — загляни в разбор чат, Claude Code или API — что выбрать. Логика та же: инструмент под задачу, а не наоборот.

Как это меняет работу команды

Claude Fable 5 позволил команде Шмидта вернуться к проектам, которые все давно хотели сделать, но никто не мог оправдать неделями работы — например, полноценные переписывания легаси-кода. «Это снижает энергию активации для таких задач, — говорит Шмидт. — Это позволяет нам двигаться в сторону глобального оптимума, а не локального». Похожий опыт масштабного переосмысления кодовой базы описан и в посте о том, как в Anthropic мигрируют миллионы строк кода с помощью Claude.

Изменился и стиль координации в команде. Cursor работает без лишней бюрократии, с сильной индивидуальной ответственностью и минимумом статус-встреч. Теперь перед тем, как трогать общий код, Шмидт просит агента прочитать последние коммиты коллеги и отметить возможные конфликты — так никому не нужно отвлекаться, чтобы созвониться и «сверить часы». Похожая логика делегирования сложной работы агенту описана в посте про Claude Fable 5 в Claude Cowork.

Инженер сравнивает результаты моделей на панели с графиками бенчмарка

Что дальше

Несмотря на рекорд в CursorBench и успешную высадку на Луну, Шмидт продолжает искать границы возможностей модели. Следующий эксперимент — посмотреть, как долго Fable 5 сможет самостоятельно управлять бэкенд-системой без присмотра: речь уже о запусках на дни и недели, а не на часы. Внутри Cursor команда использует модель, чтобы проактивно искать узкие места производительности и точки боли пользователей, не дожидаясь жалоб, а также строить более сложные и приближённые к реальности тестовые среды для оценки будущих моделей.

«Есть целый класс задач, о которых люди даже не задумывались, потому что они казались неподступными, — говорит Шмидт. — С Fable мне не терпится проверить эту границу». Похожий переход от «невозможно» к «просто ещё одна задача» описан и в истории про то, почему Base44 доверил Claude Fable 5 самую сложную инженерную работу.

Частые вопросы

Что такое CursorBench?

Это внутренний бенчмарк, который команда Cursor построила специально, чтобы измерять модели на реальных, хаотично сформулированных задачах разработчиков — например, стектрейс с одним словом «fix» без пояснений — а не на аккуратных учебных задачах со всеми условиями заранее.

Какой результат показал Claude Fable 5 на CursorBench?

72,9% в режиме Max effort — новый максимум для этого бенчмарка на момент теста, и лучший результат среди всех моделей, которые прогоняла команда Cursor.

Что за история с посадкой на Луну?

Нейт Шмидт подключил модель к симулятору космических полётов с одной строкой промпта — построй ракету и посади её на Луну. Claude Opus крутился 12–16 часов без результата, постоянно перегружая ракету топливом. Claude Fable 5 сначала слетала на пробную орбиту, собрала данные и уже со второй попытки успешно посадила модуль на Луну — за пару часов.

В чём разница между локальным и глобальным мышлением модели?

Локальное мышление — модель реагирует на текущий шаг, латает симптом за симптомом, без взгляда на всю картину. Глобальное — модель сразу планирует всю задачу целиком, собирает недостающие данные и действует стратегически, а не реактивно.

Когда стоит использовать более мощную и дорогую модель вроде Fable, а когда обойтись проще?

По правилу Шмидта: если ты хорошо представляешь путь от текущей точки к результату, скорее всего хватит модели попроще и подешевле. Если же ты не понимаешь, как решить задачу в принципе, — это ровно тот случай, когда нужна более «умная» модель.

История Cursor хорошо показывает, зачем вообще нужны собственные, «грязные» тесты вместо готовых бенчмарков: реальная работа никогда не выглядит как аккуратно сформулированная задача из учебника. И зачем нужна модель, которая умеет держать в голове всю миссию, а не только следующий шаг — будь то багрепорт из одного слова или ракета, летящая к Луне.

Если тебе интересно попробовать разницу между «локальным» и «глобальным» подходом на собственных задачах, начать проще с малого — например, с бесплатного курса zero2claude, где разбираются базовые принципы работы с терминалом и Claude Code.

Если хочешь попробовать всё это руками — начни с бесплатного курса «Claude с нуля».

Источник

По мотивам статьи Anthropic «Working at the frontier: How Cursor knew Claude Fable 5 was ready for the hardest 1% of problems». Пересказали по-русски для новичков.

Читайте также

Попробуй на практике

Бесплатные интерактивные курсы по теме — прямо в браузере, с нуля.