К содержимому
Claude Code с 0:полный курс
Новости ClaudeАвтор: Михаил Кузьмицкий

Как Anthropic снизила ложные блокировки Claude в биологии на 85%

Русская адаптация материала Anthropic — подготовлена с участием AI, проверена автором.

Коротко

Anthropic обновила защитные классификаторы модели Fable 5 в области биологии — количество ложных блокировок упало почти на 85%, а по-настоящему опасные запросы остались под замком.

Представь, что ты спрашиваешь у ИИ, что означают повышенные лейкоциты в анализе крови, а он вдруг «пугается» и подсовывает тебе куда более слабую и осторожную версию себя. Именно так работал Claude Fable 5 с биологическими вопросами — до недавнего обновления. Anthropic рассказала, как переписала защитные механизмы модели и сократила число таких ложных срабатываний почти на 85%.

ДНК за прозрачным щитом, символ баланса пользы и риска в биологии

Что такое «fallback» и почему он бесил пользователей

Когда Fable 5 только запустили, компания сразу заблокировала почти все запросы, связанные с биологией. Механизм простой: специальная система-классификатор смотрит на твой вопрос, и если тема кажется рискованной — модель автоматически переключается на менее мощную версию, Opus 5. Ты при этом даже не всегда замечаешь подмену, просто получаешь более скучный и обтекаемый ответ.

Проблема в том, что классификатор был настроен очень широко — «на всякий случай» блокировал почти любую биологическую тему, даже безобидную. Спрашиваешь про расшифровку анализа мочи, готовишься к экзамену по биологии, врач хочет разобрать клинический случай — и в ответ получаешь fallback. Anthropic честно признаёт: это было сознательным компромиссом на старте, потому что цена ошибки в другую сторону — там, где ИИ реально помогает создать что-то опасное — могла быть катастрофической.

Биология — особый случай: польза и вред неразделимы

Главная сложность в том, что в биологии крайне трудно отличить полезное исследование от потенциально опасного — они часто выглядят почти одинаково. Классический пример из статьи: чтобы разработать живую вакцину, учёным нужно вырастить тот самый патоген, от которого вакцина должна защищать. Или возьмём препарат каптоприл для лечения гипертонии — его создали, изучая токсичные компоненты змеиного яда, которые резко снижают давление у человека.

Такая двойственность называется dual-use — технология одновременно и полезна, и потенциально опасна, и грань между этими применениями часто размыта. Anthropic ссылается на американский разведывательный доклад 2026 года (Annual Threat Assessment), где прямо говорится: развитие синтетической биологии и геномного редактирования «может привести к новым биологическим угрозам», а некоторые государства предположительно поддерживают активные программы разработки биологического и химического оружия. Именно поэтому продвинутые модели в этой области требуют особой осторожности — злоумышленник может маскировать опасный запрос под обычное исследование.

Как устроены защитные классификаторы

В основе защиты Fable 5 — так называемые safety classifiers: небольшие автоматические ИИ-системы, которые в реальном времени анализируют, не относится ли запрос к запрещённой биологической теме и не пытается ли модель выдать опасный результат. Anthropic уже применяла похожий подход в области кибербезопасности — тема защитных классификаторов для компании не новая.

Если классификатор «срабатывает», запрос перенаправляется на Opus 5 — модель, которая не обладает таким же уровнем биологических знаний, как Fable 5, и поэтому не способна дать злоумышленнику существенное преимущество. Именно это переключение ты и видел как fallback. Настроить такой классификатор точно — задача не из простых: нужно провести чёткую границу между «допустимым» и «запрещённым», избегая при этом двух типов ошибок — ложных срабатываний (когда блокируется безобидный контент) и ложных пропусков (когда опасный запрос проходит незамеченным). Дополнительно классификатор должен быть устойчив к попыткам его обойти — так называемым джейлбрейкам.

Что именно поменяли

Последние несколько недель команда Anthropic переписывала «конституцию» классификатора — набор правил, по которым система отличает разрешённый контент от запрещённого. Разработчики детально прописали, какие виды безобидного использования нужно явно выводить из-под блокировки. Изменения обсуждались с широким кругом экспертов — как внутри компании, так и снаружи. После этого под новую конституцию подготовили обновлённые обучающие данные, переобучили классификатор и проверили: срабатывает ли он всё ещё на действительно опасный и dual-use контент, но теперь пропускает больше безобидных и полезных запросов.

Схема границы классификатора: слева разрешённый контент, справа заблокированный, посередине зона безопасного запаса. Источник: Anthropic

На иллюстрации хорошо видно логику работы системы. Контент делится на несколько зон: явно вредный (красная зона) и dual-use (оранжевая) всегда блокируются. Есть «зона безопасного запаса» (светло-зелёная) — контент, который почти наверняка безобиден, но всё равно блокируется из предосторожности. И есть явно безобидный контент (тёмно-зелёный), который должен проходить свободно. На старте Fable 5 граница классификатора была сдвинута сильно влево — то есть блокировалось почти всё, включая большую часть безопасной зоны. После обновления граница сдвинулась вправо: система научилась точнее различать тонкие отличия между безобидными и dual-use запросами, и теперь пропускает намного больше законных вопросов.

Цифры: насколько стало лучше

По данным Anthropic, обновление сократило число биологических fallback'ов во всех продуктах компании примерно на 85%. Это заметно скажется и на общем количестве переключений на более слабую модель — по любым причинам, не только биологическим.

ПродуктСнижение общего числа fallback'ов
Claude.ai~67%
Claude Cowork~55%
Claude Code~17%
Claude Platform~7%

Разброс по продуктам объясняется просто: там, где пользователи чаще задают повседневные вопросы про здоровье и учёбу (Claude.ai, Cowork), эффект от смягчения биологических правил заметнее. В Claude Code и на платформе для разработчиков биологические темы поднимаются реже, поэтому и выигрыш скромнее.

Совет

Если тебе интересно, как вообще Claude ведёт себя с разными типами запросов и почему иногда «упрощается» на лету, посмотри бесплатный курс zero2claude — там объясняются базовые принципы работы с моделями на простом языке.

Что осталось под запретом

Важно понимать: это не «открытие шлюзов». Fable 5 по-прежнему автоматически переключается на Opus 5, если запрос касается вирусологии, токсикологии или молекулярного дизайна — тех областей, которые Anthropic считает dual-use в самом чувствительном смысле. То есть для профессиональных исследований в биологии и разработки лекарств модель пока не предназначена — и это осознанное решение, а не недоработка.

Компания говорит, что видит в биологии и медицине наибольший потенциал позитивного влияния ИИ и активно инвестирует в создание «доверенных путей доступа» — механизмов, которые позволят проверенным исследователям получать более широкие возможности модели без риска массового злоупотребления. Иными словами, разрыв между «обычным пользователем» и «профессиональным биологом с доступом к передовым возможностям» будет закрываться постепенно, через отдельные программы доверенного доступа, а не через простое ослабление общих фильтров.

Почему это важно даже не-биологам

Казалось бы, зачем тебе, если ты просто спрашиваешь про симптомы простуды, знать про все эти классификаторы и dual-use риски? Ответ простой: именно из-за таких настроек ИИ иногда «тупеет» на невинных вопросах, и понимание механики помогает не удивляться и не разочаровываться в инструменте. Если Claude вдруг даёт подозрительно обтекаемый ответ на медицинский вопрос — вероятно, сработал защитный механизм, а не модель «не умеет».

Это также хороший пример того, как выстраивается ответственная разработка ИИ в целом: не через жёсткий тотальный запрет и не через безграничную свободу, а через постоянную калибровку — сузить зону блокировки ровно настолько, чтобы не мешать пользе, но не открыть дверь для реального вреда. Похожий подход к контролю данных и запросов до того, как их увидит модель, разбирался в материале про inference hooks в Claude Enterprise — там речь про корпоративный контекст, но принцип «проверка на входе, а не постфактум» тот же самый.

Частые вопросы

Что такое fallback в Claude Fable 5?

Это автоматическое переключение с мощной модели Fable 5 на менее продвинутую Opus 5, когда система безопасности решает, что запрос касается потенциально рискованной биологической темы. Ты получаешь ответ, но от более простой и осторожной модели.

Почему Claude иногда блокирует безобидные вопросы про здоровье?

Классификаторы безопасности изначально настраивались очень широко, чтобы исключить любой риск в дуальных (полезных и потенциально опасных одновременно) темах биологии. Из-за этого под блокировку попадали и совершенно безобидные вопросы — например, про расшифровку анализов. Обновление снизило число таких ложных срабатываний почти на 85%.

Что значит dual-use в контексте биологии и ИИ?

Dual-use — это технологии или знания, которые можно использовать и во благо, и во вред. Например, для создания живой вакцины нужно вырастить тот же патоген, от которого она защищает. Anthropic особенно осторожна с такими темами, потому что грань между легитимным исследованием и подготовкой к вреду часто размыта.

Может ли Claude теперь помогать с профессиональной биологической разработкой лекарств?

Пока нет. Запросы, связанные с вирусологией, токсикологией и молекулярным дизайном, по-прежнему автоматически перенаправляются на менее мощную модель. Anthropic работает над отдельными программами доверенного доступа для профессиональных исследователей, но это отдельный, более медленный процесс.

Вывод

История с обновлением защитных классификаторов Fable 5 — хороший урок о том, как на самом деле выглядит ответственная разработка ИИ на практике: не громкие заявления, а кропотливая работа над правилами, тестовыми данными и обратной связью от экспертов. Компания честно признаёт, что идеальной границы не будет — какие-то безобидные запросы всё равно попадут под блокировку из «зоны безопасного запаса», и это осознанная цена за отсутствие катастрофических ошибок в другую сторону.

Для тебя как обычного пользователя главный вывод простой: если раньше Claude часто «упрощался» на вопросах про здоровье и биологию — сейчас таких случаев должно стать заметно меньше. А для серьёзных научных и медицинских задач разработка более широкого и безопасного доступа продолжается — это не разовое обновление, а постоянный процесс калибровки.

Если хочешь попробовать всё это руками — начни с бесплатного курса «Claude с нуля».

Источник

По мотивам статьи Anthropic «Improving Fable 5's biology safeguards». Пересказали по-русски для новичков.

Читайте также

Попробуй на практике

Бесплатные интерактивные курсы по теме — прямо в браузере, с нуля.