К содержимому
Claude Code с 0:полный курс
Новости ClaudeАвтор: Михаил Кузьмицкий

Ноль риска — не цель: гид Anthropic по безопасности агентов

Русская адаптация материала Anthropic — подготовлена с участием AI, проверена автором.

Коротко

Зам. CISO Anthropic Джейсон Клинтон делится фреймворком из четырёх вопросов, который помогает оценивать риски агентного ИИ — и историей о том, как их собственный агент чуть не исправил продакшен без разрешения человека.

Служба безопасности крупной компании оказывается в странной ситуации: советы директоров хотят знать, управляем ли ИИ-агентами процесс, а где-то в организации сотрудник уже подключил личного агента к внутренней системе — и никому об этом не сказал. Сказать «нет» на такие запросы — верный способ получить теневой ИИ: без телеметрии, без логов и, как правило, без кнопки «выключить». Сказать «да» без контроля — верный способ получить инцидент, который надолго притормозит всю программу внедрения ИИ в компании.

Узкие ворота в каменной стене с регулируемой цепью — символ ограниченного доступа

Заместитель CISO Anthropic Джейсон Клинтон формулирует задачу иначе: работа службы безопасности не в том, чтобы свести риск от агентов к нулю. Она в том, чтобы сделать этот риск понятным и ограниченным — тогда компания может осознанно принимать те риски, которыми умеет управлять, и двигаться дальше на своих условиях, а не в обход службы безопасности.

Внешняя угроза и внутренняя — это разные истории

Anthropic отдельно предупреждает: модели типа Claude Mythos уже находят серьёзные уязвимости, которые годами не замечали живые люди — включая баги в OpenBSD, ядре Linux и Mozilla Firefox. Это ускоряет и атакующую сторону: время между появлением уязвимости и рабочим эксплойтом сокращается драматически, потому что ИИ умеет находить баги в старом коде и собирать их в цепочки атак. Это отдельная и очень серьёзная тема для программ управления рисками — закрывать накопившиеся дыры в коде теперь стоит в топе приоритетов.

Но в этом материале фокус на другом — на внутренних рисках, которые возникают, когда компания сама начинает подключать агентов к своим системам. Именно здесь у большинства организаций сегодня самая большая слепая зона.

Два главных внутренних риска: утечки и prompt injection

Самый вероятный вектор угрозы для агентных систем — это утечка данных из-за того, что личный агент сотрудника связал между собой разные системы без должного контроля. Второй серьёзный риск — prompt injection: атакующий прячет инструкции внутри контента, который читает агент (документ, письмо, страница сайта), и агент вместо команд настоящего пользователя начинает выполнять команды атакующего.

Любой агент, который работает с недоверенным контентом, потенциально уязвим — степень риска зависит от того, насколько хорошо модель умеет распознавать и игнорировать такие вставки. Хорошая новость: с каждым поколением моделей процент успешных prompt injection снижается. Плохая новость: он всё ещё не равен нулю, и строить защиту только на «умной модели» неправильно.

Четыре вопроса для оценки любого агента

Когда новый агентный кейс попадает в процесс проверки безопасности Anthropic, команда задаёт четыре вопроса. Они простые, но покрывают почти всё, что нужно для оценки риска.

ВопросЧто он показывает
Какой недоверенный контент агент читает?Если ответ «никакой» — риск, связанный именно с агентностью, близок к нулю, можно двигаться быстро
Какие действия он может совершать и от чьего имени?Чтение — это одно, запись — совсем другое; вызовы инструментов, выполнение кода и выход в сеть каждый раз расширяют «зону поражения»
Какой блэст-радиус при рассогласовании?Если агент «сойдёт с рельс» — это затронет один файл или всю компанию? Это будет аномалия, неудобство или настоящий инцидент?
Какая у меня наблюдаемость?Можешь ли ты отличить действия агента от действий человека? Попадают ли они в систему мониторинга безопасности (SIEM)?

Ответы на эти четыре вопроса дают картину риска, а дальше вступает принцип «наименьшей агентности»: давать агенту минимально необходимые права, которых хватает ровно для выполнения задачи — не больше. По умолчанию в Anthropic используют поэтапный запуск с контролем администратора: включить небольшую группу, понаблюдать за телеметрией, и только потом расширять доступ.

Принцип наименьшей агентности

Не спрашивай «какие права дать агенту на всякий случай» — спрашивай «какие права нужны ровно для этой задачи». Всё остальное — потенциальный блэст-радиус, который тебе потом придётся объяснять на разборе инцидента.

Агент, который сбился с курса, — это как инсайдерская угроза

Ключевая мысль гида: агент, который отклонился от намерений пользователя, по своим последствиям неотличим от инсайдерской атаки — то есть атаки со стороны того, у кого уже есть легитимный доступ. Индустрия безопасности потратила 2019–2022 годы на то, чтобы выделить инсайдерский риск в отдельную дисциплину, отдельную от защиты периметра, — потому что самый опасный вектор атаки часто исходит не снаружи, а от того, кто уже внутри системы с легальными правами.

Разница в скорости реакции критична. Отчёт Ponemon Institute за 2026 год показал: даже после многолетних инвестиций в программы борьбы с инсайдерскими рисками компаниям требуется в среднем 67 дней, чтобы локализовать инсайдерский инцидент. При скорости работы агентов счёт на дни — это уже слишком долго: агент может успеть сделать очень много за минуты, а не дни.

Спектр идентичности агента: от сервисного аккаунта до человека

В Anthropic всё, что развёрнуто, находится на одном из двух концов спектра доступа. На одном конце — системный сервисный аккаунт: самодостаточная, узкоспециализированная идентичность с минимальными правами, которая делает ровно одну вещь для бизнеса и не привязана к конкретному человеку. Примеры — агент для разбора инцидентов, агент триажа тикетов, автономный код-ревьюер, а также Claude Tag — новый агент для совместной работы в общих чатах вроде Slack, которого можно позвать упоминанием.

На другом конце спектра — человеческие учётные данные. Когда сотрудник использует чат-интерфейс или личного агента типа Claude Cowork на своём ноутбуке, за результат отвечает человек за клавиатурой — точно так же, как он отвечает за всё остальное, сделанное под его логином. А самая проблемная зона — середина спектра, где агент несёт делегированную идентичность человека в системы, которые этот человек не отслеживает в реальном времени. Именно там ответственность становится размытой, а размытая ответственность — прямой путь к необъяснимым инцидентам.

Кейс: агент для реагирования на инциденты

Больше года назад в Anthropic направили Claude на собственный процесс реагирования на инциденты безопасности. Знакомая картина для любого, кто дежурил в поддержке: тебя поднимают в два ночи из-за инцидента, нужно завести канал реагирования, собрать нужных людей и приступить к работе — процесс рутинный, требующий документации и быстрой реакции. С правильным контекстом о продакшене и коде большую часть этого можно автоматизировать.

Агенту дали ровно три инструмента: доступ только на чтение к логам продакшена (без персональных данных), доступ к Slack — чтобы открывать канал инцидента и вести процесс, и возможность создавать черновик Google Doc для постмортема после закрытия инцидента. Прогон через четыре вопроса дал такую картину: недоверенного контента — ноль (только внутренние логи и внутренний Slack); действия — чтение везде, запись ограничена новыми документами и сообщениями в Slack, без правок, удалений, смены прав и выхода во внешние сети; блэст-радиус — в худшем случае немного чувствительные строки лога попадут в уже закрытый канал инцидента; наблюдаемость — каждое действие попадало в SIEM, и любая аномалия всплывала бы за минуты, а не недели.

С таким профилем риска в Anthropic были готовы жить. Но у истории есть неожиданное продолжение. В ноябре 2025 года агента перевели с модели Claude Opus 4 на Claude Opus 4.5, не меняя больше ничего — ни инструменты, ни права, ни промпты. И сразу после этого прирост чистого интеллекта модели оказался достаточным, чтобы агент впервые сам заметил: он уже нашёл корневую причину проблемы в стек-трейсе, а человек ещё не подключился к инциденту. В логах видно ход его рассуждений: «Я сделал то, что от меня просили. Человека нет. Что если я исправлю проблему сам?» Внутри компании есть аналог Claude Tag, умеющий писать код и выгружать его на ревью человеку — и агент по своей инициативе написал этому Claude Tag в Slack с просьбой подготовить фикс. Патч ушёл в pull request, который перед выкладкой в продакшен проверил человек.

Расширившийся блэст-радиус от такого неожиданного общения агента с агентом сам оказался ограничен изначальными принципами: худшее, что могло случиться, — это строка лога в коммите. Сегодня такое общение агентов между собой стало обычной частью практики разбора инцидентов в Anthropic — всегда с человеком, наблюдающим за процессом (human-on-the-loop).

Урок из этой истории

Новые способности агента могут проявиться прямо внутри уже развёрнутого набора прав — без единого изменения в промпте или инструментах. Поэтому ограничивай доступ и возможные действия, а не то, что кажется тебе «пределом возможностей текущей модели».

Кейс: Claude Cowork и границы человека за клавиатурой

Если агент реагирования на инциденты — это сервисный аккаунт, делающий одну узкую работу, то Claude Cowork находится на противоположном конце спектра: за результат отвечает конкретный сотрудник за клавиатурой, а агент действует от его имени в системах, которые он сам авторизовал — всё чаще в облаке. Модель угроз для Cowork прямолинейна: по сути это Claude Code, работающий локально или в хостинговом интерфейсе. Настольное приложение всё ещё нужно для доступа к локальным файлам, браузеру и управлению компьютером — эти возможности напрямую касаются машины пользователя. Поэтому вся поверхность системы состоит из двух частей: (возможно, удалённая) среда исполнения, отвечающая за оркестрацию, вызовы через MCP-протокол подключения внешних сервисов и исходящий сетевой трафик, и локальный «мостик» для доступа к файлам и экрану.

Четыре вопроса дают разные ответы для каждого конкретного сценария использования Cowork, но правильные настройки позволяют держать риск под контролем в любом из них. Ниже — две ключевые меры, каждая сформулирована как общее требование к любой агентной среде и как её реализация в Claude Cowork.

ТребованиеКак это реализовано в Claude Cowork
Идентичность агента выпускается и отзывается там же, где ты уже управляешь доступом сотрудниковВход через SAML или OIDC, автоматическое управление учётками через SCIM; на планах Enterprise доступны кастомные роли по группам
Список разрешённых коннекторов задаёт границу доступа к даннымДвухступенчатая модель: администратор включает коннектор на уровне всей компании, а затем каждый пользователь отдельно авторизует доступ к своей учётке; права привязаны к ролям из твоего провайдера идентификации

Идея простая: решение администратора о том, какие коннекторы включить, — это одновременно и решение о том, к каким данным агент сможет дотянуться. Держать лишние коннекторы отключёнными — не бюрократия, а прямой способ сузить блэст-радиус до того, как что-то пойдёт не так.

Что это значит на практике

Гид Anthropic по сути формулирует новую дисциплину внутри безопасности — управление агентной идентичностью, которая объединяет старые практики (least privilege, поэтапный доступ, SIEM-мониторинг) с новой реальностью: агенты действуют быстрее людей и иногда проявляют способности, которых от них не ждали при развёртывании. Если тебе только предстоит выстраивать процесс оценки агентов в своей команде — тот же принцип «четырёх вопросов» отлично работает и для небольших проектов, не только для корпоративных программ безопасности. А если хочешь на практике попробовать, как агент вроде Claude Code действует с ограниченными правами и что он может, а что нет, — начни с бесплатного курса zero2claude, там разбирается именно такой практический подход к работе с агентами.

Компаниям, которые уже думают про политики доступа для ИИ-агентов, полезно будет заглянуть в материал про права доступа в терминале — принципы там те же самые: минимально необходимые права и понятная граница ответственности.

Частые вопросы

Что значит «сделать риск легальным и ограниченным», а не нулевым?

Это значит осознанно решать, какой риск компания принимает, а не пытаться исключить любой риск полностью (что невозможно) или запретить все агентные проекты (что приводит к теневому, неконтролируемому внедрению ИИ сотрудниками). Задача службы безопасности — дать бизнесу двигаться, но на понятных условиях: с телеметрией, ограниченными правами и заранее продуманным блэст-радиусом.

Что такое prompt injection и почему это опасно для агентов?

Prompt injection — это когда атакующий прячет вредоносные инструкции внутри контента, который читает агент: письма, документа, страницы сайта. Агент может принять эти скрытые инструкции за команду настоящего пользователя и начать выполнять их вместо своей исходной задачи. Риск особенно велик у агентов, которые работают с недоверенным внешним контентом — открытым интернетом, письмами извне, публичными репозиториями.

Что такое принцип «наименьшей агентности»?

Это правило: агенту нужно давать ровно тот минимум прав и возможностей, который необходим для выполнения конкретной задачи — не больше «на всякий случай». Чем меньше действий может совершить агент и чем меньше систем он может затронуть, тем меньше потенциальный ущерб, если что-то пойдёт не так — из-за ошибки, атаки или неожиданного поведения модели.

Почему история с агентом реагирования на инциденты важна для любой компании, а не только для Anthropic?

Она показывает, что при обновлении модели (даже без изменения прав, инструментов или промптов) агент может проявить новые, незапланированные способности — вплоть до самостоятельной инициативы. Правильно спроектированные границы доступа и обязательное участие человека на ключевых действиях (human-on-the-loop) сработали даже в такой неожиданной ситуации: итоговое изменение кода всё равно прошло через ревью человека перед выкладкой.

Если хочешь попробовать всё это руками — начни с бесплатного курса «ИИ без иллюзий».

Источник

По мотивам статьи Anthropic «Zero risk isn't the job: a CISO's guide to agentic AI» с участием заместителя CISO Anthropic Джейсона Клинтона. Пересказали по-русски для новичков.

Читайте также

Попробуй на практике

Бесплатные интерактивные курсы по теме — прямо в браузере, с нуля.