К содержимому
Claude Code с 0:полный курс
Новости ClaudeАвтор: Михаил Кузьмицкий

Cognition доверила Claude Fable 5 работать всю ночь без присмотра

Русская адаптация материала Anthropic — подготовлена с участием AI, проверена автором.

Коротко

Компания Cognition, создатель ИИ-инженера Devin, годами не доверяла моделям автономную работу дольше часа — а с Claude Fable 5 оставляет агента на всю ночь и находит утром реальный прогресс.

Cognition — молодая по силиконовым меркам компания. В начале 2024 года, когда автономные агенты только-только начинали держаться на ногах, она построила Devin — ИИ-инженера, который берёт на себя работу, до которой у обычных разработчиков просто не доходят руки: миграции кодовых баз, скопившиеся баги, фичи, которые вечно откладываются на потом.

Тёмная комната с одной горящей лампой — символ работы, продолжающейся всю ночь

Клиенты Devin — от быстрорастущих стартапов до компаний из списка Fortune 500, и планка там высокая: код, который пишет Devin, должен быть надёжным и готовым к продакшену. Одна тихо внесённая ошибка может дорого стоить дальше по цепочке. За тестирование и обучение моделей, на которых работает Devin, отвечает команда Silas Alberti, SVPของResearch в Cognition — и он застал почти каждое поколение Claude с самого начала.

Первый настоящий скачок был в 2024-м

Альберти отмечает, что первый ощутимый прорыв случился с Claude 3.6 Sonnet осенью 2024 года. Это была первая модель, которая надёжно связывала инструменты в цепочку и удерживала многошаговую задачу целиком. Когда её подключили к Devin, внутреннее использование продукта утроилось — сотрудники Cognition просто начали доверять агенту больше задач.

Именно эта история сделала команду такой скептичной. Cognition видела не раз, как модель показывает отличный результат на бенчмарке, а потом разваливается в первый же реальный рабочий день. «Нас так обжигали уже много раз», — говорит Альберти. Поэтому команда доверяет не оценкам, а собственным инженерам: самые требовательные разработчики компании прогоняют каждую новую модель через настоящий рабочий день, и критерий простой — оставили бы они этот код в проекте или нет. Как формулирует сам Альберти: «Мы не верим ни одному эвалу».

Где прежние модели упирались в потолок

При всём прогрессе оставался один явный предел — как долго агент может работать самостоятельно, прежде чем потеряет нить задачи.

«До Fable ты мог делегировать агенту задачу, и он держался на месте пару минут, максимум час, — говорит Альберти. — После этого сессия начинала расплываться». Если дать прежней модели сразу пять идей на рассмотрение, она путалась и терялась. На одной миграции базы данных предыдущая версия Opus технически завершила работу, но по пути внесла серию незаметных ошибок.

Такая же картина повторялась при разборе инцидентов. Более ранние модели предпочитали оставаться на поверхности логов, вместо того чтобы копать до нужной строки, и были обучены давать ответ в любом случае — поэтому они «уверенно называли первое правдоподобное объяснение и на этом останавливались». Инженеры быстро научились их игнорировать.

Заметка

Cognition оценивает передовые модели по серии внутренних бенчмарков, включая собственный Frontier Code — специально созданный, чтобы отсеивать код, который проходит тесты, но не выживет в реальном проекте.

Frontier Code: бенчмарк против «слоп-кода»

Иллюстрация к статье о тестировании Claude в Devin. Источник: Anthropic

Cognition сама придумала Frontier Code, потому что существующие бенчмарки постоянно вознаграждали код, который формально проходил тесты, но не пережил бы встречи с настоящей кодовой базой. Альберти называет его «антислоп»-стандартом. На самом сложном подмножестве этого бенчмарка предыдущая версия Opus набирала около 10%. Claude Fable 5 показала около 30%.

МодельРезультат на сложном подмножестве Frontier Code
Предыдущий Opus~10%
Claude Fable 5~30%

Первая реакция команды была недоверием: «Тут какая-то ошибка? Не может быть». Обычно резкий скачок бенчмарка сопровождается неделями споров, действительно ли модель лучше на практике или это просто цифры. На этот раз реальное использование совпало с оценками с первого дня. «Это был настоящий шок, честно говоря», — признаётся Альберти.

Восемь часов без единой подсказки

«Самое заметное — это горизонт, то есть как долго модель может работать самостоятельно, — говорит Альберти. — Были задачи, когда я собирался ложиться спать и говорил: окей, просто продолжай работать над этим и не останавливайся, пока я не проснусь. А утром просыпаюсь — а она работала восемь часов подряд и реально продвинулась вперёд. Я такого раньше не видел».

Такой горизонт держался благодаря тому, что Claude Fable 5 оставалась «ясной головой» даже в захламлённом контексте. Это первая модель, которая по-настоящему научилась пользоваться внутренними инструментами отладки Cognition — листала логи прямо в браузере и делала выводы, несмотря на шум. На той самой миграции, где спотыкались прошлые модели, она сначала явно сформулировала инварианты, которым будет следовать, а затем выполнила задачу в рамках этих правил. При разборе инцидентов модель определила корневую причину и честно сказала, чего именно она не знает — а это, по словам Альберти, и есть то, что реально восстанавливает доверие к агенту.

Он относит этот скачок к небольшому классу настоящих смен эпох — таких, что случаются примерно раз в год.

Почему это важно не только для Cognition

Долгая автономная работа без потери контекста и умение честно признать «я не знаю» — это ровно те качества, которые нужны для агентов, работающих с реальным кодом или инфраструктурой без постоянного присмотра человека. Похожий принцип разбирали и в истории о том, как Альберта нашла и закрыла дыры в 466 млн строк кода с Claude.

Что дальше: проактивные агенты вместо реактивных

Иллюстрация к статье о будущем автономных агентов. Источник: Anthropic

Основная ставка Cognition с самого начала была на то, что агенты должны работать в облаке часами подряд. Весь первый год существования компании модели этого просто не умели.

Альберти говорит, что Claude Fable 5 делает эту ставку по-настоящему реализуемой — и часть этого уже встроена в продукт. Devin умеет наблюдать за каналом в Slack и включаться в обсуждение проблемы без того, чтобы его отдельно упомянули, или самостоятельно следить за продакшеном и разбираться со всплесками нагрузки. Когда агент справляется с этим правильно, признаётся Альберти, это ощущается «как настоящий инженер в команде».

Он ожидает, что такой подход станет нормой для инженерных команд в целом. По его прогнозу, через год-два 90% сессий агентов будут проактивными: находят проблему, сканируют кодовую базу и сами пишут тебе с готовым решением. «Многие вещи, которые мы всегда хотели построить в компании, теперь стали возможны», — говорит Альберти.

Эта история хорошо ложится в общую логику того, как автоматизация меняет рутину разработчика — если тебе интересна тема автоматизации небольших задач своими руками, посмотри бесплатный курс zero2claude, где мы показываем, как писать первые скрипты и работать с терминалом и Claude Code с нуля.

Частые вопросы

Что такое Devin и чем он отличается от обычного чат-бота с кодом?

Devin — это автономный ИИ-инженер, построенный компанией Cognition. В отличие от чат-бота, которому нужно давать пошаговые инструкции, Devin может часами самостоятельно работать над задачей: чинить баги, проводить миграции кода, следить за продакшеном и логами без постоянного присмотра человека.

Что такое Frontier Code и почему Cognition не доверяет обычным бенчмаркам?

Frontier Code — это внутренний бенчмарк, который Cognition создала сама, потому что стандартные тесты часто хвалили код, который проходил проверки, но не выживал в реальной кодовой базе. Альберти называет его «антислоп»-стандартом: он проверяет, будет ли код действительно жить в продакшене, а не просто пройдёт формальные тесты.

Почему прежние модели Claude не могли работать долго без присмотра?

Раньше сессии агента держались от пары минут до часа, а затем модель теряла нить задачи: путалась, если ей давали сразу несколько идей на рассмотрение, или начинала вносить незаметные ошибки при выполнении сложных задач вроде миграции базы данных. Проблема была в удержании контекста на длинной дистанции, а не в разовых знаниях.

Что изменилось конкретно с Claude Fable 5?

Модель научилась держать «горизонт» внимания на порядки дольше — вплоть до восьми часов непрерывной самостоятельной работы с реальным прогрессом. Она также стала честно признавать, чего не знает, вместо того чтобы уверенно называть первое правдоподобное объяснение, и впервые по-настоящему освоила внутренние инструменты отладки Cognition.

Историю Cognition стоит запомнить не из-за конкретной компании, а из-за того, что она показывает про сам горизонт доверия к агентам. Пока модель держится на задаче минуты или час, ей можно поручить черновую работу под присмотром. Когда она держится восемь часов и честно говорит, где сомневается, — это уже совсем другой уровень делегирования, и именно это меняет то, как команды планируют свою работу.

Если хочешь попробовать всё это руками — начни с бесплатного курса «Claude с нуля».

Источник

По мотивам статьи Anthropic «Working at the frontier: How Cognition trusts Claude Fable 5 to work through the night». Пересказали по-русски для новичков.

Читайте также

Попробуй на практике

Бесплатные интерактивные курсы по теме — прямо в браузере, с нуля.