# Как Anthropic снизила ложные блокировки Claude в биологии на 85%

Канонический URL: https://zero2claude.ru/blog/fable-5-biology-safeguards
Дата: 2026-08-07
Теги: claude, безопасность, новости

Anthropic обновила защитные классификаторы модели Fable 5 в области биологии — количество ложных блокировок упало почти на 85%, а по-настоящему опасные запросы остались под замком.

Представь, что ты спрашиваешь у ИИ, что означают повышенные лейкоциты в анализе крови, а он вдруг «пугается» и подсовывает тебе куда более слабую и осторожную версию себя. Именно так работал Claude Fable 5 с биологическими вопросами — до недавнего обновления. Anthropic рассказала, как переписала защитные механизмы модели и сократила число таких ложных срабатываний почти на 85%.

<Cover src="/blog/fable-5-biology-safeguards.jpg" alt="ДНК за прозрачным щитом, символ баланса пользы и риска в биологии" />

## Что такое «fallback» и почему он бесил пользователей

Когда Fable 5 только запустили, компания сразу заблокировала почти все запросы, связанные с биологией. Механизм простой: специальная система-классификатор смотрит на твой вопрос, и если тема кажется рискованной — модель автоматически переключается на менее мощную версию, Opus 5. Ты при этом даже не всегда замечаешь подмену, просто получаешь более скучный и обтекаемый ответ.

Проблема в том, что классификатор был настроен очень широко — «на всякий случай» блокировал почти любую биологическую тему, даже безобидную. Спрашиваешь про расшифровку анализа мочи, готовишься к экзамену по биологии, врач хочет разобрать клинический случай — и в ответ получаешь fallback. Anthropic честно признаёт: это было сознательным компромиссом на старте, потому что цена ошибки в другую сторону — там, где ИИ реально помогает создать что-то опасное — могла быть катастрофической.

## Биология — особый случай: польза и вред неразделимы

Главная сложность в том, что в биологии крайне трудно отличить полезное исследование от потенциально опасного — они часто выглядят почти одинаково. Классический пример из статьи: чтобы разработать живую вакцину, учёным нужно вырастить тот самый патоген, от которого вакцина должна защищать. Или возьмём препарат каптоприл для лечения гипертонии — его создали, изучая токсичные компоненты змеиного яда, которые резко снижают давление у человека.

Такая двойственность называется dual-use — технология одновременно и полезна, и потенциально опасна, и грань между этими применениями часто размыта. Anthropic ссылается на американский разведывательный доклад 2026 года (Annual Threat Assessment), где прямо говорится: развитие синтетической биологии и геномного редактирования «может привести к новым биологическим угрозам», а некоторые государства предположительно поддерживают активные программы разработки биологического и химического оружия. Именно поэтому продвинутые модели в этой области требуют особой осторожности — злоумышленник может маскировать опасный запрос под обычное исследование.

## Как устроены защитные классификаторы

В основе защиты Fable 5 — так называемые safety classifiers: небольшие автоматические ИИ-системы, которые в реальном времени анализируют, не относится ли запрос к запрещённой биологической теме и не пытается ли модель выдать опасный результат. Anthropic уже применяла похожий подход в области кибербезопасности — тема защитных классификаторов для компании не новая.

Если классификатор «срабатывает», запрос перенаправляется на Opus 5 — модель, которая не обладает таким же уровнем биологических знаний, как Fable 5, и поэтому не способна дать злоумышленнику существенное преимущество. Именно это переключение ты и видел как fallback. Настроить такой классификатор точно — задача не из простых: нужно провести чёткую границу между «допустимым» и «запрещённым», избегая при этом двух типов ошибок — ложных срабатываний (когда блокируется безобидный контент) и ложных пропусков (когда опасный запрос проходит незамеченным). Дополнительно классификатор должен быть устойчив к попыткам его обойти — так называемым джейлбрейкам.

## Что именно поменяли

Последние несколько недель команда Anthropic переписывала «конституцию» классификатора — набор правил, по которым система отличает разрешённый контент от запрещённого. Разработчики детально прописали, какие виды безобидного использования нужно явно выводить из-под блокировки. Изменения обсуждались с широким кругом экспертов — как внутри компании, так и снаружи. После этого под новую конституцию подготовили обновлённые обучающие данные, переобучили классификатор и проверили: срабатывает ли он всё ещё на действительно опасный и dual-use контент, но теперь пропускает больше безобидных и полезных запросов.

![Схема границы классификатора: слева разрешённый контент, справа заблокированный, посередине зона безопасного запаса. Источник: Anthropic](/blog/fable-5-biology-safeguards-1.jpg)

На иллюстрации хорошо видно логику работы системы. Контент делится на несколько зон: явно вредный (красная зона) и dual-use (оранжевая) всегда блокируются. Есть «зона безопасного запаса» (светло-зелёная) — контент, который почти наверняка безобиден, но всё равно блокируется из предосторожности. И есть явно безобидный контент (тёмно-зелёный), который должен проходить свободно. На старте Fable 5 граница классификатора была сдвинута сильно влево — то есть блокировалось почти всё, включая большую часть безопасной зоны. После обновления граница сдвинулась вправо: система научилась точнее различать тонкие отличия между безобидными и dual-use запросами, и теперь пропускает намного больше законных вопросов.

## Цифры: насколько стало лучше

По данным Anthropic, обновление сократило число биологических fallback'ов во всех продуктах компании примерно на 85%. Это заметно скажется и на общем количестве переключений на более слабую модель — по любым причинам, не только биологическим.

| Продукт | Снижение общего числа fallback'ов |
|---|---|
| Claude.ai | ~67% |
| Claude Cowork | ~55% |
| Claude Code | ~17% |
| Claude Platform | ~7% |

Разброс по продуктам объясняется просто: там, где пользователи чаще задают повседневные вопросы про здоровье и учёбу (Claude.ai, Cowork), эффект от смягчения биологических правил заметнее. В Claude Code и на платформе для разработчиков биологические темы поднимаются реже, поэтому и выигрыш скромнее.

<Callout type="tip">
Если тебе интересно, как вообще Claude ведёт себя с разными типами запросов и почему иногда «упрощается» на лету, посмотри бесплатный курс zero2claude — там объясняются базовые принципы работы с моделями на простом языке.
</Callout>

## Что осталось под запретом

Важно понимать: это не «открытие шлюзов». Fable 5 по-прежнему автоматически переключается на Opus 5, если запрос касается вирусологии, токсикологии или молекулярного дизайна — тех областей, которые Anthropic считает dual-use в самом чувствительном смысле. То есть для профессиональных исследований в биологии и разработки лекарств модель пока не предназначена — и это осознанное решение, а не недоработка.

Компания говорит, что видит в биологии и медицине наибольший потенциал позитивного влияния ИИ и активно инвестирует в создание «доверенных путей доступа» — механизмов, которые позволят проверенным исследователям получать более широкие возможности модели без риска массового злоупотребления. Иными словами, разрыв между «обычным пользователем» и «профессиональным биологом с доступом к передовым возможностям» будет закрываться постепенно, через отдельные программы доверенного доступа, а не через простое ослабление общих фильтров.

## Почему это важно даже не-биологам

Казалось бы, зачем тебе, если ты просто спрашиваешь про симптомы простуды, знать про все эти классификаторы и dual-use риски? Ответ простой: именно из-за таких настроек ИИ иногда «тупеет» на невинных вопросах, и понимание механики помогает не удивляться и не разочаровываться в инструменте. Если Claude вдруг даёт подозрительно обтекаемый ответ на медицинский вопрос — вероятно, сработал защитный механизм, а не модель «не умеет».

Это также хороший пример того, как выстраивается ответственная разработка ИИ в целом: не через жёсткий тотальный запрет и не через безграничную свободу, а через постоянную калибровку — сузить зону блокировки ровно настолько, чтобы не мешать пользе, но не открыть дверь для реального вреда. Похожий подход к контролю данных и запросов до того, как их увидит модель, разбирался в материале про [inference hooks в Claude Enterprise](/blog/claude-enterprise-inference-hooks) — там речь про корпоративный контекст, но принцип «проверка на входе, а не постфактум» тот же самый.

## Частые вопросы

<Faq>
<FaqItem q="Что такое fallback в Claude Fable 5?">

Это автоматическое переключение с мощной модели Fable 5 на менее продвинутую Opus 5, когда система безопасности решает, что запрос касается потенциально рискованной биологической темы. Ты получаешь ответ, но от более простой и осторожной модели.

</FaqItem>
<FaqItem q="Почему Claude иногда блокирует безобидные вопросы про здоровье?">

Классификаторы безопасности изначально настраивались очень широко, чтобы исключить любой риск в дуальных (полезных и потенциально опасных одновременно) темах биологии. Из-за этого под блокировку попадали и совершенно безобидные вопросы — например, про расшифровку анализов. Обновление снизило число таких ложных срабатываний почти на 85%.

</FaqItem>
<FaqItem q="Что значит dual-use в контексте биологии и ИИ?">

Dual-use — это технологии или знания, которые можно использовать и во благо, и во вред. Например, для создания живой вакцины нужно вырастить тот же патоген, от которого она защищает. Anthropic особенно осторожна с такими темами, потому что грань между легитимным исследованием и подготовкой к вреду часто размыта.

</FaqItem>
<FaqItem q="Может ли Claude теперь помогать с профессиональной биологической разработкой лекарств?">

Пока нет. Запросы, связанные с вирусологией, токсикологией и молекулярным дизайном, по-прежнему автоматически перенаправляются на менее мощную модель. Anthropic работает над отдельными программами доверенного доступа для профессиональных исследователей, но это отдельный, более медленный процесс.

</FaqItem>
</Faq>

## Вывод

История с обновлением защитных классификаторов Fable 5 — хороший урок о том, как на самом деле выглядит ответственная разработка ИИ на практике: не громкие заявления, а кропотливая работа над правилами, тестовыми данными и обратной связью от экспертов. Компания честно признаёт, что идеальной границы не будет — какие-то безобидные запросы всё равно попадут под блокировку из «зоны безопасного запаса», и это осознанная цена за отсутствие катастрофических ошибок в другую сторону.

Для тебя как обычного пользователя главный вывод простой: если раньше Claude часто «упрощался» на вопросах про здоровье и биологию — сейчас таких случаев должно стать заметно меньше. А для серьёзных научных и медицинских задач разработка более широкого и безопасного доступа продолжается — это не разовое обновление, а постоянный процесс калибровки.

Если хочешь попробовать всё это руками — начни с бесплатного курса [«Claude с нуля»](/learn/claude-101).

<Callout type="note" title="Источник">
По мотивам статьи Anthropic «Improving Fable 5's biology safeguards». Пересказали по-русски для новичков.
</Callout>
