JetBrains — компания, чьи инструменты стоят на компьютерах у миллионов разработчиков: IntelliJ IDEA, PyCharm, язык Kotlin. У них больше 12,5 миллиона активных пользователей и 88 компаний из списка Fortune Global 100 среди клиентов. Когда такая компания решает, каким моделям Claude доверить работу с кодом, это не вопрос «попробовали — понравилось». Владислав Танков, CTO по агентным системам в JetBrains, рассказал Anthropic, как у них устроена оценка новых моделей, когда команда выбирает Claude Fable 5 вместо других моделей, и почему вопрос хранения данных для них — не формальность, а постоянный компромисс.
Скептиков в компании больше не осталось
Танков работает в JetBrains десять лет и говорит, что компания была среди самых первых клиентов LLM-провайдеров. Но перелом произошёл только в последний год: раньше и среди клиентов, и внутри компании были явные скептики по поводу пользы ИИ в разработке. Сейчас, по его словам, буквально каждый скептик в компании изменил своё мнение — ИИ прочно вошёл в рабочий процесс, и это уже не эксперимент, а фундаментальный сдвиг в индустрии.
Это важный контекст: JetBrains — компания инженеров для инженеров, и там принято проверять всё скептически. Если даже там признают перемену, это говорит о масштабе изменений больше, чем любая маркетинговая цифра.
Свой пайплайн оценки на закрытом коде
JetBrains — кодинговая компания, поэтому у неё есть большой пайплайн оценки моделей: наборы тестов на приватных репозиториях, включая собственный монорепозиторий. Смысл в том, чтобы проверить, действительно ли модель соответствует своим публичным бенчмаркам на реальной работе — некоторые модели специально «настроены» показывать хорошие цифры на открытых тестах, но проваливаются на настоящих задачах. На закрытом репозитории это подделать невозможно, поэтому такая проверка даёт честную картину.
Дополнительно JetBrains ведёт три отдельных лидерборда: по качеству, по стоимости за задачу и по скорости. Интересный момент: Claude Fable 5 дороже по токенам, чем предыдущие модели, но стоимость за задачу у неё в некоторых случаях ниже — особенно на сложных, долгих задачах, где модель делает меньше лишних попыток.
Зачем свой набор тестов
Публичные бенчмарки легко «подогнать» — модель может видеть похожие задачи на обучении. Приватный репозиторий с реальным кодом компании — куда более честный экзамен, потому что подготовиться к нему заранее просто нельзя.
Что показали цифры: Fable 5 против Opus 4.8
Результаты оценки получились наглядными. Claude Fable 5 показал лучший процент прохождения задач на Python в наборе тестов JetBrains — и заметно опередил предыдущую модель Opus 4.8.
| Метрика | Opus 4.8 | Claude Fable 5 |
|---|---|---|
| Pass rate на Python-задачах | 28,2% | 44,3% |
| Задачи, решённые только одной моделью (голова к голове) | 2 | 18 |
| Число шагов до решения | базовый уровень | на 22% меньше |
Разница в 16 процентных пунктов по pass rate — это не статистическая погрешность, а ощутимый скачок. В прямом сравнении «голова к голове» Claude Fable 5 решил 18 Python-задач, которые не поддались Opus 4.8, и проиграл только по 2 задачам. Причём важно не только то, запустился ли код, но и то, прошёл ли он тесты — если код выполняется, но выдаёт неправильный результат, это самый дорогой тип ошибки, потому что его труднее всего заметить. И здесь Claude Fable 5 тоже выигрывал: его код проходил тесты заметно чаще, чем у обеих версий Opus.
Отдельно интересна история про эффективность. Claude Fable 5 требовалось примерно на 22% меньше шагов, чтобы дойти до рабочего решения — то есть модель тратит меньше времени на метод проб и ошибок. При этом усилия она направляет в правильные места: на Java-задачах Opus 4.8 регулярно пытался подтягивать внешние ресурсы, которые почти никогда не помогают в окружении JetBrains, а Claude Fable 5 такого не делал вовсе и работал с тем кодом, который уже есть перед ним. Танков называет это в целом более грамотными инженерными привычками модели.
Когда выбирают Fable 5, а когда — рабочую лошадку
В JetBrains есть чёткое разделение по задачам. Opus воспринимается как надёжная рабочая лошадка: если нужно, чтобы работа была сделана уверенно и предсказуемо, идут к нему. А к Claude Fable 5 обращаются, когда нужно действительно хорошее рассуждение — когда задача почти требует партнёра, а не исполнителя, и сама команда не до конца понимает, как её решить.
Наглядный пример: один из тех-лидов JetBrains поручил модели реализовать компонент rich text editor — задачу, к которой в компании подступались несколько раз за годы и не могли довести до конца. Claude Fable 5 почти справился с ней одним заходом.
Ещё один популярный сценарий — долгие агентные эксперименты с кодом. Команда даёт агенту на Claude Fable 5 спецификации (текст плюс изображения) и просит реализовать сложные приложения в стиле IDE. Самое интересное здесь — спецификации может генерировать сам агент, основываясь на существующем приложении. Соединив эти два компонента, JetBrains получает почти «чёрный ящик»: возможность переписать приложение с одного рантайма, фреймворка или языка на другой практически без ручного вмешательства. Если тебе интересно, как агенты вообще выполняют такие многошаговые задачи и делегируют себе подзадачи, у нас есть отдельный разбор про субагентов Claude и про то, чем агент отличается от обычного чата.
Безопасность как продукт, а не заплатка
По безопасности у JetBrains чёткая позиция: компания не пытается сама сделать модель максимально «безопасной» — они ожидают, что red teaming (тестирование моделью-«злоумышленником» её собственных слабых мест) и вся остальная работа со стороны Anthropic достаточны, чтобы доверять базовой модели. Дальше JetBrains выстраивает систематический подход к внедрению: создаёт инфраструктуру и защитный слой вокруг модели и того, как она встроена в продукт (harness), а не пытается подкрутить саму модель.
Безопасность — одно из главных применений Claude Fable 5 внутри JetBrains. Команда проводит white-box тестирование собственных продуктов, то есть ищет уязвимости, имея полный доступ к внутреннему устройству системы. При этом их команда безопасности готовится к тому, что не только они сами будут запускать модель для поиска дырок — люди за пределами компании тоже будут использовать Claude Fable 5 или подобные модели, чтобы прощупывать уязвимости во всех их продуктах. Поскольку JetBrains обслуживает крупные предприятия в регулируемых индустриях, важно быть готовыми к этому заранее. По словам Танкова, Claude Fable 5 в этом смысле помогает работе, а не мешает ей.
Тонкость в том, что здесь есть постоянный баланс: чем менее агрессивен классификатор (система-фильтр, отсеивающая опасные запросы) на стороне JetBrains, тем больше уязвимостей найдёт кто-то снаружи — в том числе таких, о которых внутри компании даже не подозревали.
Баланс, а не идеал
Слишком строгий фильтр блокирует легитимную работу по поиску уязвимостей. Слишком слабый — открывает лазейку для реальных атак. JetBrains сознательно выбирает настройку, которая позволяет их команде безопасности работать так же агрессивно, как потенциальный злоумышленник.
Честный разговор про хранение данных
Отдельно Танков затронул тему data retention — того, как долго и в каком виде хранятся данные о запросах к модели. Позиция прямая: в JetBrains предпочли бы нулевое хранение данных. Но, по его словам, он не видит другого способа понять, что именно было запрошено и где классификатор мог сработать неправильно, кроме как сохранять часть данных для разбора инцидентов. Пока проверки касаются только самых серьёзных отмеченных случаев, он считает это честной сделкой — разумной ценой за доступ к передовому интеллекту, который позволяет его команде делать свою работу как можно лучше.
Это откровенно взрослый подход к теме, где обычно много маркетинговых заявлений «у нас всё безопасно по умолчанию». Здесь — прямое признание, что идеального решения нет, и выбор в пользу компромисса, а не в пользу иллюзии.
Куда движется индустрия дальше
По прогнозу Танкова, базовые модели от разработчиков LLM продолжат становиться всё более способными — это тренд, который вряд ли остановится. Но по-настоящему важным становится не сама модель, а то, что он называет «кабиной пилота» (cockpit) для разработки софта: пространство, где агенты и люди сотрудничают вместе, а люди управляют процессом разработки в целом.
Для JetBrains это большая трансформация бизнеса. Компания видит возможность построить следующее поколение продуктов вокруг всего жизненного цикла агентной разработки софта, которые и будут питать эту «кабину пилота». В этой картине разработчики получат больше кода, отправляемого в продакшн, с помощью агентов; нетехнические роли смогут играть более крупную роль в создании софта; а организации получат нужную им прозрачность и управляемость возврата инвестиций. Если тебе хочется на практике понять разницу между тем, когда задачу лучше решить скриптом, а когда — полноценным агентом, у нас есть отдельный разбор «агент или скрипт», который хорошо дополняет этот кейс.
Частые вопросы
Что такое Claude Fable 5, о котором говорит JetBrains?
Это одна из моделей семейства Claude, которую JetBrains тестировала и сравнивала с предыдущей моделью Opus 4.8 на собственных приватных наборах тестов. По итогам оценки JetBrains использует её для задач, где требуется более глубокое рассуждение, а не просто уверенное выполнение известного паттерна.
Почему JetBrains не доверяет публичным бенчмаркам моделей?
Публичные бенчмарки может быть легко «подогнать» под хороший результат — некоторые модели показывают отличные цифры на открытых тестах, но проваливаются на реальных задачах. Приватный репозиторий кода, к которому у модели точно не было доступа заранее, даёт куда более честную картину.
В чём разница между Opus и Fable 5 по подходу JetBrains?
Opus в компании воспринимают как надёжную рабочую лошадку для задач, где важна предсказуемость выполнения. К Fable 5 обращаются, когда задача требует более глубокого рассуждения — почти как к партнёру, когда сама команда не до конца понимает, как решить проблему.
Как JetBrains относится к хранению данных при работе с моделями Claude?
JetBrains предпочла бы нулевое хранение данных, но признаёт, что без сохранения части запросов невозможно расследовать случаи, где системы фильтрации сработали неправильно. Компания считает это разумным компромиссом при условии, что проверки касаются только самых серьёзных отмеченных случаев.
Кейс JetBrains хорошо показывает, что серьёзное внедрение ИИ в компанию — это не про «взяли самую мощную модель и подключили её везде». Это про построение собственной системы измерения, честный разговор о компромиссах в безопасности и данных, и понимание, что для разных задач нужны разные инструменты — рабочая лошадка для предсказуемых задач и более «рассуждающая» модель там, где не хватает готового плана.
Если хочешь попробовать всё это руками — начни с бесплатного курса «Claude с нуля».
Источник
По мотивам статьи Anthropic «Securing the frontier: How JetBrains evaluates and deploys Claude Fable 5». Пересказали по-русски для новичков.