Две недели назад Claude Fable 5 и его закрытая версия Mythos 5 внезапно оказались недоступны — причём не только для пользователей из других стран, а вообще для всех. Причина была не в баге и не в решении самой Anthropic, а в требовании американского правительства. История получилась показательной: она хорошо объясняет, как устроена защита современных ИИ-моделей от киберугроз и почему её невозможно сделать идеальной.
Что произошло: хронология событий
9 июня Anthropic выпустила две модели на одной и той же основе, но с разным уровнем защиты. Fable 5 получила самые строгие ограничения, какие компания когда-либо применяла к модели, — её выпустили для широкого использования. Mythos 5, у которой защитных механизмов заметно меньше, досталась лишь небольшому кругу доверенных партнёров программы Glasswing и предназначалась исключительно для защитной кибербезопасности — то есть для тех, кто ищет и закрывает уязвимости, а не эксплуатирует их.
Дальше события развивались быстро:
| Дата | Событие |
|---|---|
| 9 июня | Anthropic выпускает Fable 5 (для всех) и Mythos 5 (только для партнёров Glasswing) |
| 12 июня | США вводят экспортные ограничения; Anthropic приостанавливает доступ к обеим моделям для всех пользователей |
| 26 июня | Правительство США одобряет возврат доступа к Mythos 5 для ряда организаций |
| 30 июня | Экспортные ограничения на Fable 5 и Mythos 5 официально отменены |
| 1 июля | Fable 5 снова доступен всем пользователям Claude Platform, Claude.ai, Claude Code и Claude Cowork |
12 июня правительство узнало об отчёте: исследователи из Amazon нашли способ обойти защиту Fable 5 — они формулировали запросы так, что модель находила программные уязвимости, а в одном случае даже написала код, демонстрирующий, как эту уязвимость можно эксплуатировать. Поскольку у Anthropic не было надёжного способа мгновенно проверять гражданство пользователей (а именно этого требовал приказ), компания предпочла временно закрыть доступ вообще для всех — и Fable 5, и Mythos 5.
Почему пауза была избыточной перестраховкой
Самое интересное — результаты проверки, которую Anthropic провела вместе с правительством и Amazon. Оказалось, что находить те же уязвимости, что и Fable 5, умели и куда менее мощные модели. А воспроизвести конкретный пример эксплойта из отчёта смогла вообще любая протестированная модель, включая самые старые версии Claude.
| Задача | Какие модели справились |
|---|---|
| Найти те же уязвимости | Claude Opus 4.8, GPT-5.5, Kimi K2.7 |
| Воспроизвести пример эксплойта | Claude Haiku 4.5, Sonnet 4.6, Opus 4.6, Opus 4.7, Opus 4.8, GPT-5.4, GPT-5.5, Kimi K2.7 |
Другими словами, обнаруженный обход защиты не давал доступа к каким-то уникальным, только-у-Mythos-возможностям — он открывал вполне рутинную задачу из области защитной кибербезопасности, которую блокировали «на всякий случай», с большим запасом осторожности. Тем не менее Anthropic не стала спорить с формулировками и быстро выпустила улучшенный классификатор — специальную мини-модель, которая распознаёт и блокирует именно этот тип запроса. Если Fable 5 теперь отказывается отвечать, запрос автоматически перенаправляется на Opus 4.8, а тебе приходит уведомление.
Кто проверял защиту
Новый классификатор блокирует конкретную технику из отчёта Amazon в более чем 99% случаев. Специалисты из Центра стандартов и инноваций в области ИИ Минторга США (CAISI) протестировали и старую, и новую версии защиты и назвали их «исключительно надёжными».
Плата за такую надёжность — больше ложных срабатываний на обычных задачах программирования и отладки кода. Anthropic честно признаёт: классификатор стал строже, и это неизбежно задевает легитимные рабочие запросы. Команда обещает продолжать его донастройку, чтобы точнее отличать реальное злоупотребление от нормальной работы разработчика.
Как устроена защита Fable 5: классификаторы и запас прочности
Ключевая идея защиты — «глубокая защита» (defense in depth): ни один отдельный механизм не идеален, но вместе они создают модель, которую крайне сложно использовать во вред. Часть защиты — это обучение модели самой отказываться от опасных просьб, часть — постфактум-анализ паттернов злоупотребления, а самая важная часть — классификаторы: небольшие автоматические системы, которые в реальном времени распознают потенциально опасный киберзапрос и блокируют ответ модели.

Здесь есть тонкий момент. Классификаторы намеренно настроены с «запасом прочности» — они блокируют не только явно опасные запросы, но и часть безобидных, если те похожи на подозрительные. Для Fable 5 этот запас сделали больше, чем для любой предыдущей модели: компания сознательно пошла на то, что многие нормальные запросы будут ошибочно заблокированы, лишь бы гарантированно не пропустить действительно опасные.
Джейлбрейки бывают разной степени серьёзности
Anthropic прямо признаёт: сделать модель полностью неуязвимой к «джейлбрейкам» (техникам обхода защиты) вероятно невозможно. Вопрос не в том, найдут ли обход — обход найдут почти наверняка, — а в том, насколько он серьёзен и как быстро на него реагировать.

Компания выделяет несколько уровней. Незначительный джейлбрейк лишь чуть заходит в тот самый «запас прочности», не открывая ничего по-настоящему опасного — именно к такой категории, по оценке Anthropic, относятся все найденные на сегодня обходы Fable 5. Узкий вредоносный джейлбрейк открывает одну конкретную опасную возможность. А самый тревожный сценарий — универсальный джейлбрейк, который разом открывает целый класс вредоносного поведения. К моменту публикации таких для Fable 5 не нашли, но независимые исследователи безопасности продолжают целенаправленно искать их методом «red team».
Совет
Цель Anthropic — не гарантировать отсутствие джейлбрейков в принципе (это нереалистично), а быть первыми, кто их находит и закрывает, раньше злоумышленников.
Индустрии нужен общий язык для оценки джейлбрейков
Один из главных уроков этой истории — в индустрии ИИ до сих пор нет единого способа объективно описывать серьёзность найденного джейлбрейка. Из-за этого каждый новый обход защиты превращается в спор о терминах: разработчики не понимают, какие находки требуют экстренной реакции, а правительства — когда именно нужно вмешиваться.
Anthropic вместе с Amazon, Microsoft, Google и другими партнёрами программы Glasswing начала разрабатывать общий стандарт оценки. Предложенная система оценивает джейлбрейк по четырём критериям:
| Критерий | Что измеряет |
|---|---|
| Прирост возможностей | Насколько джейлбрейк выводит атакующего за пределы того, что доступно другими способами (включая более слабые модели) |
| Широта прироста | Работает ли техника только для одной узкой задачи или сразу для многих целей |
| Простота вооружения | Сколько усилий нужно, чтобы превратить джейлбрейк в реальную атаку — один промпт или сложная многошаговая подготовка |
| Обнаружимость | Насколько легко узнать об этой технике — нужны специальные знания или она уже гуляет по интернету |
Для самых опасных случаев — например, если джейлбрейк реально используют для атак на энергосети или банковскую инфраструктуру — Anthropic обещает немедленно разворачивать предварительные меры защиты сразу после подтверждения серьёзности находки. Компания также создаёт команду для непрерывного, 24/7 мониторинга каналов, куда исследователи присылают найденные джейлбрейки, и запускает новую программу на платформе HackerOne специально для приёма находок по киберджейлбрейкам Fable 5.
Более тесная работа с государством
Anthropic рассказывает, что последние десять недель плотно взаимодействовала с правительством США в рамках подготовки июньского президентского указа о продвижении инноваций и безопасности передового ИИ. В диалоге участвовали сразу несколько ведомств: аппарат Национального кибердиректора, Управление по научно-технической политике, Минфин, Минторг (включая CAISI) и профильные структуры национальной безопасности.
Это продолжение почти двухлетнего сотрудничества по предрелизному тестированию моделей — просто теперь его обещают масштабировать. Для моделей, которые заметно расширяют границы возможностей в чувствительных для национальной безопасности областях, Anthropic планирует давать выбранным государственным партнёрам расширенный ранний доступ — и к самим моделям, и к системам защиты — чтобы независимые эксперты успевали протестировать guardrails до массового релиза.
Что это значит для обычных пользователей
Если ты просто пользуешься Claude для работы или учёбы, суть истории укладывается в несколько практических пунктов:
- С 1 июля Fable 5 снова доступна везде: на Claude Platform, Claude.ai, в Claude Code и Claude Cowork.
- Для тарифов Pro, Max, Team и части Enterprise-планов Fable 5 до 7 июля включена в до 50% недельного лимита использования, после — доступна через кредиты использования.
- Доступ через AWS, Google Cloud и Microsoft Foundry восстанавливают отдельно, «как можно быстрее».
- Если твой запрос к Fable 5 внезапно заблокирован новым классификатором, тебя уведомят, а запрос автоматически перенаправят на Opus 4.8 — работа не встанет.
Важно
Новый классификатор строже прежнего и иногда ошибочно блокирует безобидные запросы по программированию и отладке. Это временная плата за более надёжную защиту — Anthropic обещает продолжать её донастройку.
Частые вопросы
Что такое экспортные ограничения и почему они коснулись Claude?
Это требования правительства США ограничить доступ к определённым технологиям для иностранных граждан. Когда такое ограничение ввели для Fable 5 и Mythos 5, у Anthropic не было надёжного способа мгновенно проверять гражданство пользователей в реальном времени, поэтому компания на две недели закрыла доступ вообще для всех, а не только для иностранцев.
Чем Fable 5 отличается от Mythos 5?
Обе модели построены на одной и той же основе, но Fable 5 выпущена с самыми строгими защитными механизмами, какие Anthropic когда-либо применяла, — для широкого использования. Mythos 5 имеет заметно меньше ограничений и доступна только небольшому кругу доверенных партнёров программы Glasswing для задач защитной кибербезопасности.
Что такое джейлбрейк ИИ-модели?
Джейлбрейк — это техника, которая обходит встроенные защитные механизмы модели и заставляет её выдать ответ, который она должна была бы блокировать. Джейлбрейки различаются по серьёзности: от незначительных (лишь слегка задевают «запас прочности» защиты) до универсальных (открывают целый класс опасного поведения).
Можно ли полностью защитить модель от джейлбрейков?
Anthropic прямо говорит, что сделать модель полностью неуязвимой к обходам защиты, вероятно, невозможно. Задача не в абсолютной защите, а в том, чтобы находить серьёзные джейлбрейки первыми — раньше злоумышленников — и оперативно их закрывать.
История с Fable 5 показывает, что безопасность мощных ИИ-моделей — это не разовое действие при релизе, а постоянный процесс: находка обхода защиты, оценка её реальной опасности, быстрое исправление и координация с государством и другими разработчиками. Появление общего отраслевого стандарта оценки джейлбрейков — возможно, даже более важный итог этой истории, чем сам факт возврата доступа к модели.
Источник
По мотивам статьи Anthropic Redeploying Fable 5. Пересказали по-русски для новичков.