К содержимому
Claude Code с 0:полный курс
Новости ClaudeАвтор: Михаил Кузьмицкий

Claude Fable 5: как Anthropic вернула модель после экспортных ограничений

Русская адаптация материала Anthropic — подготовлена с участием AI, проверена автором.

Коротко

Разбираем историю с временной приостановкой Claude Fable 5 и Mythos 5 из-за экспортных ограничений США — что произошло, как Anthropic залатала брешь и почему индустрии нужен общий стандарт оценки джейлбрейков.

Две недели назад Claude Fable 5 и его закрытая версия Mythos 5 внезапно оказались недоступны — причём не только для пользователей из других стран, а вообще для всех. Причина была не в баге и не в решении самой Anthropic, а в требовании американского правительства. История получилась показательной: она хорошо объясняет, как устроена защита современных ИИ-моделей от киберугроз и почему её невозможно сделать идеальной.

Символическая иллюстрация замка и ключа

Что произошло: хронология событий

9 июня Anthropic выпустила две модели на одной и той же основе, но с разным уровнем защиты. Fable 5 получила самые строгие ограничения, какие компания когда-либо применяла к модели, — её выпустили для широкого использования. Mythos 5, у которой защитных механизмов заметно меньше, досталась лишь небольшому кругу доверенных партнёров программы Glasswing и предназначалась исключительно для защитной кибербезопасности — то есть для тех, кто ищет и закрывает уязвимости, а не эксплуатирует их.

Дальше события развивались быстро:

ДатаСобытие
9 июняAnthropic выпускает Fable 5 (для всех) и Mythos 5 (только для партнёров Glasswing)
12 июняСША вводят экспортные ограничения; Anthropic приостанавливает доступ к обеим моделям для всех пользователей
26 июняПравительство США одобряет возврат доступа к Mythos 5 для ряда организаций
30 июняЭкспортные ограничения на Fable 5 и Mythos 5 официально отменены
1 июляFable 5 снова доступен всем пользователям Claude Platform, Claude.ai, Claude Code и Claude Cowork

12 июня правительство узнало об отчёте: исследователи из Amazon нашли способ обойти защиту Fable 5 — они формулировали запросы так, что модель находила программные уязвимости, а в одном случае даже написала код, демонстрирующий, как эту уязвимость можно эксплуатировать. Поскольку у Anthropic не было надёжного способа мгновенно проверять гражданство пользователей (а именно этого требовал приказ), компания предпочла временно закрыть доступ вообще для всех — и Fable 5, и Mythos 5.

Почему пауза была избыточной перестраховкой

Самое интересное — результаты проверки, которую Anthropic провела вместе с правительством и Amazon. Оказалось, что находить те же уязвимости, что и Fable 5, умели и куда менее мощные модели. А воспроизвести конкретный пример эксплойта из отчёта смогла вообще любая протестированная модель, включая самые старые версии Claude.

ЗадачаКакие модели справились
Найти те же уязвимостиClaude Opus 4.8, GPT-5.5, Kimi K2.7
Воспроизвести пример эксплойтаClaude Haiku 4.5, Sonnet 4.6, Opus 4.6, Opus 4.7, Opus 4.8, GPT-5.4, GPT-5.5, Kimi K2.7

Другими словами, обнаруженный обход защиты не давал доступа к каким-то уникальным, только-у-Mythos-возможностям — он открывал вполне рутинную задачу из области защитной кибербезопасности, которую блокировали «на всякий случай», с большим запасом осторожности. Тем не менее Anthropic не стала спорить с формулировками и быстро выпустила улучшенный классификатор — специальную мини-модель, которая распознаёт и блокирует именно этот тип запроса. Если Fable 5 теперь отказывается отвечать, запрос автоматически перенаправляется на Opus 4.8, а тебе приходит уведомление.

Кто проверял защиту

Новый классификатор блокирует конкретную технику из отчёта Amazon в более чем 99% случаев. Специалисты из Центра стандартов и инноваций в области ИИ Минторга США (CAISI) протестировали и старую, и новую версии защиты и назвали их «исключительно надёжными».

Плата за такую надёжность — больше ложных срабатываний на обычных задачах программирования и отладки кода. Anthropic честно признаёт: классификатор стал строже, и это неизбежно задевает легитимные рабочие запросы. Команда обещает продолжать его донастройку, чтобы точнее отличать реальное злоупотребление от нормальной работы разработчика.

Как устроена защита Fable 5: классификаторы и запас прочности

Ключевая идея защиты — «глубокая защита» (defense in depth): ни один отдельный механизм не идеален, но вместе они создают модель, которую крайне сложно использовать во вред. Часть защиты — это обучение модели самой отказываться от опасных просьб, часть — постфактум-анализ паттернов злоупотребления, а самая важная часть — классификаторы: небольшие автоматические системы, которые в реальном времени распознают потенциально опасный киберзапрос и блокируют ответ модели.

Схема работы классификаторов безопасности с запасом прочности. Источник: Anthropic

Здесь есть тонкий момент. Классификаторы намеренно настроены с «запасом прочности» — они блокируют не только явно опасные запросы, но и часть безобидных, если те похожи на подозрительные. Для Fable 5 этот запас сделали больше, чем для любой предыдущей модели: компания сознательно пошла на то, что многие нормальные запросы будут ошибочно заблокированы, лишь бы гарантированно не пропустить действительно опасные.

Джейлбрейки бывают разной степени серьёзности

Anthropic прямо признаёт: сделать модель полностью неуязвимой к «джейлбрейкам» (техникам обхода защиты) вероятно невозможно. Вопрос не в том, найдут ли обход — обход найдут почти наверняка, — а в том, насколько он серьёзен и как быстро на него реагировать.

Схема разных уровней джейлбрейков — от незначительных до универсальных. Источник: Anthropic

Компания выделяет несколько уровней. Незначительный джейлбрейк лишь чуть заходит в тот самый «запас прочности», не открывая ничего по-настоящему опасного — именно к такой категории, по оценке Anthropic, относятся все найденные на сегодня обходы Fable 5. Узкий вредоносный джейлбрейк открывает одну конкретную опасную возможность. А самый тревожный сценарий — универсальный джейлбрейк, который разом открывает целый класс вредоносного поведения. К моменту публикации таких для Fable 5 не нашли, но независимые исследователи безопасности продолжают целенаправленно искать их методом «red team».

Совет

Цель Anthropic — не гарантировать отсутствие джейлбрейков в принципе (это нереалистично), а быть первыми, кто их находит и закрывает, раньше злоумышленников.

Индустрии нужен общий язык для оценки джейлбрейков

Один из главных уроков этой истории — в индустрии ИИ до сих пор нет единого способа объективно описывать серьёзность найденного джейлбрейка. Из-за этого каждый новый обход защиты превращается в спор о терминах: разработчики не понимают, какие находки требуют экстренной реакции, а правительства — когда именно нужно вмешиваться.

Anthropic вместе с Amazon, Microsoft, Google и другими партнёрами программы Glasswing начала разрабатывать общий стандарт оценки. Предложенная система оценивает джейлбрейк по четырём критериям:

КритерийЧто измеряет
Прирост возможностейНасколько джейлбрейк выводит атакующего за пределы того, что доступно другими способами (включая более слабые модели)
Широта приростаРаботает ли техника только для одной узкой задачи или сразу для многих целей
Простота вооруженияСколько усилий нужно, чтобы превратить джейлбрейк в реальную атаку — один промпт или сложная многошаговая подготовка
ОбнаружимостьНасколько легко узнать об этой технике — нужны специальные знания или она уже гуляет по интернету

Для самых опасных случаев — например, если джейлбрейк реально используют для атак на энергосети или банковскую инфраструктуру — Anthropic обещает немедленно разворачивать предварительные меры защиты сразу после подтверждения серьёзности находки. Компания также создаёт команду для непрерывного, 24/7 мониторинга каналов, куда исследователи присылают найденные джейлбрейки, и запускает новую программу на платформе HackerOne специально для приёма находок по киберджейлбрейкам Fable 5.

Более тесная работа с государством

Anthropic рассказывает, что последние десять недель плотно взаимодействовала с правительством США в рамках подготовки июньского президентского указа о продвижении инноваций и безопасности передового ИИ. В диалоге участвовали сразу несколько ведомств: аппарат Национального кибердиректора, Управление по научно-технической политике, Минфин, Минторг (включая CAISI) и профильные структуры национальной безопасности.

Это продолжение почти двухлетнего сотрудничества по предрелизному тестированию моделей — просто теперь его обещают масштабировать. Для моделей, которые заметно расширяют границы возможностей в чувствительных для национальной безопасности областях, Anthropic планирует давать выбранным государственным партнёрам расширенный ранний доступ — и к самим моделям, и к системам защиты — чтобы независимые эксперты успевали протестировать guardrails до массового релиза.

Что это значит для обычных пользователей

Если ты просто пользуешься Claude для работы или учёбы, суть истории укладывается в несколько практических пунктов:

  • С 1 июля Fable 5 снова доступна везде: на Claude Platform, Claude.ai, в Claude Code и Claude Cowork.
  • Для тарифов Pro, Max, Team и части Enterprise-планов Fable 5 до 7 июля включена в до 50% недельного лимита использования, после — доступна через кредиты использования.
  • Доступ через AWS, Google Cloud и Microsoft Foundry восстанавливают отдельно, «как можно быстрее».
  • Если твой запрос к Fable 5 внезапно заблокирован новым классификатором, тебя уведомят, а запрос автоматически перенаправят на Opus 4.8 — работа не встанет.

Важно

Новый классификатор строже прежнего и иногда ошибочно блокирует безобидные запросы по программированию и отладке. Это временная плата за более надёжную защиту — Anthropic обещает продолжать её донастройку.

Частые вопросы

Что такое экспортные ограничения и почему они коснулись Claude?

Это требования правительства США ограничить доступ к определённым технологиям для иностранных граждан. Когда такое ограничение ввели для Fable 5 и Mythos 5, у Anthropic не было надёжного способа мгновенно проверять гражданство пользователей в реальном времени, поэтому компания на две недели закрыла доступ вообще для всех, а не только для иностранцев.

Чем Fable 5 отличается от Mythos 5?

Обе модели построены на одной и той же основе, но Fable 5 выпущена с самыми строгими защитными механизмами, какие Anthropic когда-либо применяла, — для широкого использования. Mythos 5 имеет заметно меньше ограничений и доступна только небольшому кругу доверенных партнёров программы Glasswing для задач защитной кибербезопасности.

Что такое джейлбрейк ИИ-модели?

Джейлбрейк — это техника, которая обходит встроенные защитные механизмы модели и заставляет её выдать ответ, который она должна была бы блокировать. Джейлбрейки различаются по серьёзности: от незначительных (лишь слегка задевают «запас прочности» защиты) до универсальных (открывают целый класс опасного поведения).

Можно ли полностью защитить модель от джейлбрейков?

Anthropic прямо говорит, что сделать модель полностью неуязвимой к обходам защиты, вероятно, невозможно. Задача не в абсолютной защите, а в том, чтобы находить серьёзные джейлбрейки первыми — раньше злоумышленников — и оперативно их закрывать.

История с Fable 5 показывает, что безопасность мощных ИИ-моделей — это не разовое действие при релизе, а постоянный процесс: находка обхода защиты, оценка её реальной опасности, быстрое исправление и координация с государством и другими разработчиками. Появление общего отраслевого стандарта оценки джейлбрейков — возможно, даже более важный итог этой истории, чем сам факт возврата доступа к модели.

Источник

По мотивам статьи Anthropic Redeploying Fable 5. Пересказали по-русски для новичков.

Читайте также

Попробуй на практике

Бесплатные интерактивные курсы по теме — прямо в браузере, с нуля.