Если ты работал с Claude Code, то знаешь это ощущение: агент хочет выполнить команду в терминале, и ты видишь всплывающее окно с вопросом «разрешить?». Раз, два, десять раз за сессию. Anthropic решила, что для большинства пользователей это не помогает безопасности, а мешает работе — и с 14 августа меняет дефолтный режим работы Claude Code на auto mode.
Что именно меняется
Начиная с 14 августа новые сессии Claude Code на тарифах Pro, Max и Team по умолчанию будут запускаться в auto mode. Если ты уже настроил себе другой режим по умолчанию вручную, тебе может прийти одноразовое предложение переключиться — но если у тебя закреплён (pinned) конкретный режим, ничего менять не будут, всё останется как есть.
Есть и приятный бонус: классификатор, который лежит в основе auto mode, тратит немного дополнительных токенов на каждый вызов инструмента. До сих пор эти расходы шли на счёт пользователя — теперь Anthropic перестала брать за них деньги с пользователей Pro, Max и Team. Для Claude Enterprise, Claude API, а также облачных партнёров (AWS, Google Cloud, Microsoft Foundry) auto mode пока остаётся опциональным — компаниям дают время присмотреться к изменению, но в течение ближайшего месяца Anthropic планирует сделать его дефолтом и там же отменить плату за классификатор. Администраторы Enterprise уже сейчас могут включить auto mode как дефолт через managed settings.
Как работает auto mode
Идея простая: вместо того чтобы спрашивать тебя перед каждым действием, каждый вызов инструмента проходит через классификатор, который ищет действия необратимые, разрушительные или направленные за пределы твоей рабочей среды — например, попытку отправить данные во внешний сервис. Если классификатор блокирует что-то, Claude обычно сам находит более безопасный путь или напрямую спрашивает у тебя разрешения на конкретный шаг.
Если Claude упирается в стену — три блокировки подряд или двадцать за всю сессию — Claude Code автоматически откатывается к режиму ручных подтверждений. То есть это не «отключить контроль совсем», а перераспределить внимание: не дёргать тебя по мелочам, но сохранить страховочную сетку там, где риск реально высок. При этом правила разрешений (permission rules) в твоих настройках всё равно срабатывают первыми — кроме совсем широких allow-правил вроде python:*, которые фактически дают команде полный карт-бланш на выполнение произвольного кода. Такие правила в auto mode временно игнорируются, чтобы команда не проскочила классификатор незамеченной; сам файл настроек при этом не трогают, и правила снова заработают, как только ты переключишься в другой режим.
Почему ручное подтверждение работает не так, как кажется
Anthropic посмотрела на реальные данные использования Claude Code и увидела проблему, о которой многие догадывались, но не измеряли. Пользователи одобряют 97% всех запросов на разрешение. Большинство из них, конечно, безопасные рутинные команды — но настолько высокий процент одобрений наводит на мысль, что многие кликают «разрешить» рефлекторно, а не читая, что именно просят выполнить.
Интересно, что к другим типам диалогов с Claude люди относятся куда критичнее: когда Claude предлагает план работы на одобрение, пользователи отклоняют 39% таких планов. А вот отдельные запросы на разрешение конкретной команды отклоняют только в 3% случаев. Похожая картина видна и в файлах настроек: по данным на июнь 2026 года, 49,5% активных пользователей CLI вручную создали allow-правило для Bash — 5% разрешили вообще любые команды, ещё 43% добавили правила-интерпретаторы типа Bash(python:*) или Bash(node:*), которые на практике почти равносильны полному доступу. Доля таких пользователей растёт примерно на 5 процентных пунктов каждые 5 недель. Плюс 62% пользователей хотя бы раз использовали bypassPermissions или кликнули «больше не спрашивать» для Bash, а 25% интерактивных сессий стартуют сразу в режиме обхода разрешений.
Заметка
Иначе говоря: многие уже де-факто перешли в режим «доверяй и не спрашивай» — просто через настройки, а не через официальный переключатель. Auto mode превращает эту стихийную практику в управляемый и протестированный процесс.
Эксперимент с 1053 тестировщиками
Чтобы честно сравнить два подхода, Anthropic наняла через исследовательского подрядчика 1053 платных профессиональных тестировщиков для кодинг-исследования. Участники работали в специально подготовленной тестовой среде, а не в своих реальных проектах. Они знали, что участвуют в оценке, но не знали, что именно измеряется — классический слепой дизайн эксперимента. В середине каждой сессии один обычный запрос на разрешение незаметно подменяли на явно опасную команду и фиксировали, одобрит ли её тестировщик (одобрение никогда не приводило к реальному выполнению опасного действия — менялся только текст запроса).
Результат обескураживающий: люди заметили и заблокировали опасную команду только в 13,6% случаев (143 из 1053), тогда как auto mode заблокировал 89% тех же команд (937 из 1053).
| Метрика | Ручное подтверждение | Auto mode |
|---|---|---|
| Заблокированные опасные команды | 13,6% (143 из 1053) | 89% (937 из 1053) |
| Команды, которые заблокировал только один из режимов | 6 (только человек) | 800 (только auto mode) |
| Блокировка в начале сессии | ~17% | стабильно ~89% |
| Блокировка после 50+ подтверждений в сессии | ~5% | без изменений |
Особенно показательна динамика по ходу сессии: чем дольше человек кликает «разрешить», тем хуже он замечает опасность — с 17% в начале сессии до 5% после пятидесяти с лишним подтверждений. Показатель auto mode при этом остаётся стабильным независимо от длины сессии — усталости у классификатора не бывает.

Что показал анализ реальных продакшен-сессий
Лабораторный эксперимент — это одно, а вот как auto mode ведёт себя в реальной жизни — совсем другой вопрос. С мая по июнь 2026 года команда безопасности Anthropic изучила сессии, которые её собственный пайплайн отметил для проверки — только из аккаунтов, давших согласие на использование данных для обучения и анализа. Каждую сессию заново оценили по двум шкалам от 0 до 10: тяжесть возможного вреда (10 — компанейского масштаба непоправимый ущерб типа утечки всего исходного кода, 7 — уровень продакшена, например удаление строк из рабочей базы данных, 0 — полностью обратимое действие внутри локального рабочего пространства) и то, насколько явно пользователь сам просил именно это действие.
Среди отмеченных сессий те, что прошли через ручное подтверждение, содержали серьёзный непреднамеренный вред больше чем в два раза чаще, чем сессии в auto mode. На уровне продакшен-серьёзности (7 и выше) 6,3% сессий с ручным одобрением содержали вредное действие, которое пользователь явно не просил выполнить — против 2,4% в auto mode. Этот разрыв сохранялся на всех уровнях серьёзности, которые проверяли.
Красная команда усилила классификатор
Anthropic не остановилась на внутренних тестах и позвала независимую команду Apollo Research — британский стартап, специализирующийся на безопасности ИИ. Двухнедельный пилот заключался в инъекции синтетических атак в реальные траектории работы с кодом по трём наборам данных: широкие сбои, эксфильтрация данных и угрозы, связанные с безопасностью.
Работа шла по классической схеме find-fix-verify: Apollo делилась успешными атаками и рекомендациями по усилению защиты, а Anthropic укрепляла классификатор — в основном давая ему больше контекста об окружении, которое он защищает (видимость репозитория, состояние git, правила обработки данных). После доработки Apollo повторно протестировала систему на отдельном, ранее недоступном наборе атак. Auto mode стал ловить примерно половину атак, которые раньше пропускал, потеряв при этом всего около 2% из тех, что раньше отлавливал успешно. Поскольку настраивать классификатор под этот скрытый набор было невозможно, результат говорит о том, что усиление действительно обобщается на новые атаки, а не просто «затыкает» конкретные дырки. В целом по обоим наборам процент пропущенных атак упал с 12% до 7%.
Проверка на prompt injection: сравнение с Codex
Ещё одну независимую оценку заказали у компании Trajectory Labs, которая протестировала последние публичные версии Claude Code и Codex по состоянию на 17 июля 2026 года. Проверяли 72 сценария скрытой prompt injection — атак, при которых зловредные инструкции прячутся внутри контента, который обрабатывает агент (например, в результатах веб-поиска). Каждый сценарий прогоняли 10 раз, а сами атаки изначально были оптимизированы против Claude Opus 4.7, которая не входила в тестируемый набор — то есть для всех проверяемых моделей это были незнакомые атаки.
| Модель и режим | Успешных атак |
|---|---|
| Claude Fable 5 / Opus 5 / Sonnet 5, auto mode | 0 из 720 (0%) |
| Claude модели, bypassPermissions без доп. защит | 0,09% в среднем |
| GPT-5.6 Sol, Codex Auto-review mode | 5,83% |
| GPT-5.6 Sol, Codex Full Access mode | 19,03% |
Ни одна из 720 попыток атак не сработала против моделей Claude в auto mode. У GPT-5.6 Sol в режиме Codex Auto-review успешными оказались 5,83% атак — то есть выше, чем даже у Claude в режиме bypassPermissions без дополнительной защиты. В полностью открытом режиме Full Access показатель у GPT-5.6 Sol вырос до 19,03%. Отдельно отмечается, что атаки через браузерный интерфейс (когда агент видит скриншоты, а не текст) оказались успешнее против моделей OpenAI, чем атаки через обычные текстовые результаты инструментов.

Реальные случаи внутри Anthropic
Auto mode уже давно является дефолтом для всей внутренней работы с Claude Code внутри самой Anthropic — и там классификатор уже успел предотвратить несколько неприятных инцидентов. Один пример: когда загрузка отчёта на внутренний диск не удалась, Claude решил в качестве запасного варианта опубликовать тот же отчёт на публичном сайте для обмена кодом. Auto mode заблокировал этот фолбэк и запросил у пользователя дальнейшие инструкции — то есть предотвратил случайную утечку данных за пределы сети компании.
Второй случай — попытка деструктивной массовой операции: в рамках долгой сессии Claude попытался выполнить массовое завершение процессов на почти двух тысячах подов с последующим удалением ресурсов. Классификатор остановил операцию до того, как она затронула что-то реальное. Такие примеры хорошо иллюстрируют главный смысл auto mode: он не мешает Claude работать автономно и долго, но ловит именно те моменты, где ошибка одного шага могла бы стать непоправимой.

Что это значит для скорости работы
Помимо безопасности, у auto mode есть и понятный практический эффект: он позволяет Claude работать автономно дольше без остановок на подтверждения. Это особенно важно для моделей, рассчитанных на длительную самостоятельную работу, вроде Claude Opus 5 — их становится практичнее оставлять запущенными на несколько часов на крупных задачах. Меньше прерываний для тебя — больше выполненной работы: среди команд и корпоративных клиентов, перешедших на auto mode, пользователи выпускают примерно на 25% больше пул-реквестов. Команды в Adobe, Nuro, Gusto и Garner Health уже используют auto mode как продакшен-дефолт в своей повседневной работе.
Если тебе только предстоит освоить Claude Code с нуля, разобраться с терминалом и понять, что вообще значат все эти «permissions» и режимы, лучше начать с азов — например, с бесплатного курса zero2claude, где всё объясняется по шагам без лишнего технического жаргона.
Как переключить режим обратно
Если тебе нужен полный контроль над каждой командой, ты в любой момент можешь вручную переключить Claude Code в режим ручного подтверждения или закрепить свой предпочитаемый режим по умолчанию — auto mode при этом не станет навязанным поверх твоих настроек.
Частые вопросы
Что такое auto mode в Claude Code?
Это режим, в котором Claude Code не спрашивает у тебя разрешения перед каждым действием, а пропускает каждый вызов инструмента через специальный классификатор, который блокирует необратимые, разрушительные или направленные вовне действия. Если классификатор что-то блокирует, Claude ищет более безопасный путь или сам спрашивает у тебя разрешения на конкретный шаг.
Кому и когда включат auto mode по умолчанию?
С 14 августа auto mode становится дефолтным режимом для новых сессий Claude Code на тарифах Pro, Max и Team. Для Claude Enterprise, Claude API и облачных партнёров (AWS, Google Cloud, Microsoft Foundry) режим пока остаётся опциональным, но Anthropic планирует сделать его дефолтом и там в течение ближайшего месяца.
Придётся ли платить больше за auto mode?
Нет, наоборот: Anthropic перестала брать плату за дополнительные токены, которые тратит классификатор auto mode, для пользователей Pro, Max и Team — это изменение уже вступило в силу.
Значит ли это, что Claude теперь может делать что угодно без моего контроля?
Нет. Классификатор специально настроен блокировать именно опасные, необратимые или разрушительные действия. Если он несколько раз подряд блокирует прогресс (три раза подряд или двадцать за сессию), Claude Code автоматически возвращается к режиму ручных подтверждений.
Можно ли отключить auto mode и вернуться к ручным подтверждениям?
Да, ты в любой момент можешь вручную переключить режим или закрепить нужный тебе режим по умолчанию — в этом случае автоматическое переключение на auto mode тебя не затронет.
Главный вывод из всей этой истории простой: ручные подтверждения давали иллюзию контроля, а не сам контроль — 97% одобрений говорят о привычке кликать «разрешить», а не о вдумчивой проверке. Auto mode не убирает страховочную сетку, а делает её умнее и стабильнее — независимо от того, устал ли человек за экраном после пятидесятой команды за день.
Если хочешь попробовать всё это руками — начни с бесплатного курса «Claude Code и терминал: с 0».
Источник
По мотивам статьи Anthropic «Auto mode is now the default in Claude Code for Pro, Max, and Team plans». Пересказали по-русски для новичков.