# Anthropic обновила политику ответственного масштабирования AI

Канонический URL: https://zero2claude.ru/blog/anthropic-responsible-scaling-policy-update
Дата: 2026-07-03
Теги: безопасность, claude, новости

Anthropic пересмотрела свою систему контроля рисков от мощных AI-моделей: новые пороги, гибкие правила и честный отчёт о собственных промахах.

Представь, что компания, разрабатывающая мощные AI-модели, сама пишет себе правила: когда её же продукт становится настолько способным, что нужно резко усилить защиту. Именно так работает Responsible Scaling Policy (RSP) — «политика ответственного масштабирования» — внутренний документ Anthropic, по которому компания решает, можно ли обучать и выпускать очередную модель Claude без риска катастрофических последствий. В октябре 2024 года Anthropic выпустила обновлённую версию этой политики, и в ней много конкретики, которая интересна не только специалистам по AI-безопасности.

<Cover src="/blog/anthropic-responsible-scaling-policy-update.jpg" alt="Весы с шаром, символизирующие взвешенную ответственность" />

## Зачем вообще нужна такая политика

AI-модели стремительно набирают способности — от помощи в написании кода до анализа сложных научных данных. Это открывает огромные возможности: ускорение научных открытий, прорывы в медицине, новые инструменты для образования. Но у той же монеты есть и обратная сторона — риски, которые раньше казались фантастикой, а теперь требуют серьёзного изучения.

![Рука с гусиным перо пишет документ политики](/blog/anthropic-responsible-scaling-policy-update-1.jpg)

RSP — это не про повседневные правила использования продукта (для этого у Anthropic есть отдельная Usage Policy, которая запрещает распространять дезинформацию, разжигать насилие или заниматься мошенничеством). RSP фокусируется именно на катастрофических рисках — сценариях, где ошибка может обойтись слишком дорого для всего общества. Первая версия документа появилась в сентябре 2023 года, и за год её применения компания накопила достаточно опыта, чтобы её серьёзно переработать.

## Принцип пропорциональной защиты

В основе политики — простая логика: чем опаснее потенциальные возможности модели, тем строже защита. Для этого Anthropic использует AI Safety Level Standards (ASL Standards) — систему уровней безопасности, вдохновлённую биобезопасностными уровнями (Biosafety Levels), которые применяются в лабораториях, работающих с опасными патогенами.

Шкала выглядит так:

| Уровень ASL | Что означает |
|---|---|
| ASL-1 | Базовые возможности — например, шахматный бот |
| ASL-2 | Текущий стандарт для всех моделей Anthropic, отражает лучшие практики индустрии |
| ASL-3 | Усиленная защита при достижении опасных порогов (например, помощь в создании оружия) |
| ASL-4 и выше | Экстремальные меры при риске неконтролируемого ускорения AI-разработки |

Сейчас все модели Anthropic работают по стандарту ASL-2. Но обновлённая политика чётко определяет два новых порога способностей, при достижении которых защиту нужно резко усиливать.

## Два порога, которые меняют всё

Первый — автономные AI-исследования и разработка. Если модель сможет самостоятельно вести сложные исследовательские задачи в области AI, которые обычно требуют экспертизы человека, это может непредсказуемо ускорить развитие AI настолько, что человечество не успеет отреагировать на новые риски. В этом случае требуются повышенные стандарты безопасности — потенциально ASL-4 или выше — плюс дополнительные гарантии.

Второй порог — химическое, биологическое, радиологическое и ядерное оружие (CBRN). Если модель способна реально помочь человеку с базовой технической подготовкой создать или применить такое оружие, срабатывает требование ASL-3: усиленная защита и контроль развёртывания.

Что конкретно входит в защиту ASL-3:

- Внутренний контроль доступа и более надёжная защита весов модели (тех самых файлов, в которых «зашиты» способности AI)
- Многоуровневый подход к предотвращению злоупотреблений: мониторинг в реальном времени и асинхронный мониторинг
- Протоколы быстрого реагирования на инциденты
- Тщательное red-teaming — тестирование моделью «на прочность» до выпуска, когда специальная команда пытается заставить модель нарушить правила

<Callout type="note">
Red-teaming — это когда специалисты по безопасности намеренно пытаются «взломать» модель или заставить её выдать опасный контент, чтобы найти слабые места до того, как это сделает кто-то с недобрыми намерениями.
</Callout>

## Как всё это контролируется на практике

Чтобы политика не осталась красивым текстом на бумаге, Anthropic выстроила конкретные процессы. Во-первых, это регулярные оценки способностей (capability assessments) — тесты моделей на соответствие пороговым значениям, чтобы понять, актуальны ли текущие меры защиты. Сводки прошлых оценок компания публикует открыто.

Во-вторых — оценки достаточности защиты (safeguard assessments): регулярная проверка того, насколько эффективны меры безопасности и контроля развёртывания. В-третьих — документирование и процесс принятия решений, вдохновлённый методологиями safety case, которые применяются в высоконадёжных индустриях (авиация, ядерная энергетика). И, наконец, внутреннее и внешнее наблюдение: внутренние стресс-тесты плюс независимая экспертная оценка методологии — Anthropic поделилась ею с институтами безопасности AI и рядом независимых экспертов.

## Честный разбор собственных промахов

Самое неожиданное в обновлении — не новые правила, а публичное признание ошибок. Anthropic провела первый в своей истории аудит того, насколько добросовестно она сама следовала прежней версии RSP за год. И нашла несколько промахов.

Например, один набор оценок был завершён на три дня позже запланированного срока. Была неясность в том, как и где фиксировать изменения в «плейсхолдер»-оценках (временных тестах, которые используются, пока не готовы финальные). Также в некоторых случаях команда, возможно, могла бы «выжать» из модели чуть лучший результат, применив стандартные техники — например, цепочку рассуждений (chain-of-thought) или метод best-of-N (когда модель генерирует несколько вариантов ответа и выбирается лучший).

<Callout type="tip" title="Важная оговорка">
Anthropic подчёркивает: во всех случаях риск для безопасности моделей был минимальным. Дополнительные три дня ушли на улучшение оценок, а другой набор тестов оказался даже точнее плейсхолдера. Пороги при этом всё равно не были достигнуты.
</Callout>

Из этого опыта компания сделала два вывода, которые легли в основу обновления: политике нужна большая гибкость, и нужен лучший процесс отслеживания соответствия собственным правилам. Это довольно редкий пример, когда крупная AI-компания открыто рассказывает о своих внутренних недочётах, а не просто отчитывается об успехах — похожая честность видна и в опросе о [страхах и надеждах людей насчёт AI](/blog/anthropic-public-record-opros), который Anthropic проводила отдельно.

## Кто теперь отвечает за безопасное масштабирование

Обновление сопровождается и кадровыми изменениями. Джаред Каплан (Jared Kaplan), сооснователь и Chief Science Officer Anthropic, стал новым Responsible Scaling Officer — то есть человеком, который отвечает за исполнение этой политики внутри компании. Он сменил на этом посту Сэма Маккэндлиша (Sam McCandlish), сооснователя и CTO, который курировал первый год внедрения RSP и теперь сосредоточится на своих обязанностях технического директора.

Помимо этого, Anthropic открывает новую позицию — Head of Responsible Scaling, человека, который будет координировать множество команд, вовлечённых в реализацию политики. Среди этих команд: Frontier Red Team (моделирование угроз и оценка способностей), Trust & Safety (меры защиты при развёртывании), Security and Compliance, Alignment Science (разработка мер безопасности ASL-3+ и оценка «расстыковки» модели с человеческими ценностями) и отдельная RSP Team, которая пишет саму политику.

## Пример для всей индустрии

Anthropic не скрывает, что публикует свой опыт не просто ради прозрачности, а с надеждой, что другие AI-компании будут ориентироваться на эту практику при построении собственных систем управления рисками. Год назад RSP была своего рода экспериментом — первой попыткой формализовать пороги катастрофического риска. Сейчас, после года практики и честного разбора ошибок, документ выглядит зрелее и конкретнее.

Стоит помнить: подобные политики регулирования рисков — это не что-то абстрактное, оторванное от повседневной работы с AI-инструментами. Именно благодаря таким рамкам компании вроде Anthropic решают, какие защитные механизмы встроить в модели, с которыми потом работают миллионы разработчиков — в том числе через Claude Code, о [починке багов](/blog/claude-fixes-bugs) которым мы рассказывали отдельно.

## Частые вопросы

<Faq>
<FaqItem q="Что такое Responsible Scaling Policy (RSP)?">

Это внутренняя политика Anthropic, определяющая, при каких условиях компания может обучать и выпускать AI-модели без риска катастрофических последствий. Она задаёт пороги способностей моделей и требования к защите, пропорциональные этим способностям.

</FaqItem>
<FaqItem q="Что означают уровни ASL-1, ASL-2, ASL-3?">

Это градация уровней безопасности AI (AI Safety Level Standards), вдохновлённая биобезопасностными уровнями в лабораториях. ASL-1 — базовые модели типа шахматного бота, ASL-2 — текущий стандарт для всех моделей Anthropic, ASL-3 и выше — усиленная защита для моделей с опасными способностями.

</FaqItem>
<FaqItem q="Какие два новых порога появились в обновлённой политике?">

Первый — способность модели самостоятельно вести сложные AI-исследования, требующие человеческой экспертизы. Второй — способность существенно помочь человеку с базовой технической подготовкой создать химическое, биологическое, радиологическое или ядерное оружие (CBRN).

</FaqItem>
<FaqItem q="Признавала ли Anthropic свои ошибки в применении прежней политики?">

Да, компания провела внутренний аудит и открыто рассказала о нескольких процедурных промахах за прошлый год — например, о задержке одного из наборов оценок на три дня. Все случаи, по её оценке, несли минимальный риск для безопасности.

</FaqItem>
</Faq>

Обновлённая политика Anthropic — это редкий пример того, как крупная AI-компания не просто декларирует ответственность, а выстраивает конкретную и проверяемую систему сдержек: с чёткими порогами, процедурами оценки и, что особенно важно, публичным разбором собственных ошибок. Если ты работаешь с Claude каждый день, это напоминание: за удобным интерфейсом и быстрыми ответами стоит целая инфраструктура контроля рисков, которая постоянно пересматривается и совершенствуется.

Если хочешь попробовать всё это руками — начни с бесплатного курса [«ИИ без иллюзий»](/learn/ai-critical).

<Callout type="note" title="Источник">
По мотивам статьи Anthropic Announcing our updated Responsible Scaling Policy. Пересказали по-русски для новичков.
</Callout>
