Представь: злоумышленник клонирует страницу входа в банк, рассылает ссылку через фейковый аккаунт «поддержки» в Telegram и за считаные минуты собирает пароли сотрудников. AI ускоряет весь этот процесс — атаки быстрее, а доступ, который получают хакеры, глубже. Стартап Outtake решил бороться с этим тем же оружием: флотом AI-агентов, которые сами находят, расследуют и разбирают такие сети атак.
Кто такой Outtake и с чем он борется
Outtake — платформа кибербезопасности, основанная в 2023 году Алексом Диллоном, который раньше работал в «муншот»-команде Palantir. Клиенты у компании серьёзные: ведущие AI-лаборатории, крупные хедж-фонды, федеральные агентства США. В 2025 году платформа просканировала больше 20 миллионов потенциальных кибератак, а годовая выручка выросла в 6 раз при росте клиентской базы больше чем в 10 раз.
«Если надеть шляпу злоумышленника, сейчас отличное время устраивать атаки», — говорит Диллон. AI помогает атакующим не только работать быстрее, но и получать более глубокий доступ к системам жертвы. Традиционные защитные инструменты с этим просто не успевают справляться — они устроены слишком узко.
Почему старые инструменты защиты не работают
Атака на компанию обычно идёт по предсказуемой цепочке из трёх шагов: сбор публичных данных → создание фейков-приманок → проникновение во внутренние системы. Сначала хакеры собирают открытую информацию о компании, её руководителях и сотрудниках. Потом превращают эти данные в приманку — например, поддельный сайт с фальшивой формой входа. А украденные учётные данные открывают доступ к самым чувствительным активам организации.
Проблема в том, что классические инструменты безопасности закрывают только один участок этой цепочки за раз:
| Тип инструмента | Что защищает |
|---|---|
| Threat intelligence | Мониторинг утечек публичных данных |
| Brand protection | Отслеживание имперсонаций и фейковых сайтов |
| Endpoint-защита | Охрана внутренних систем компании |
Recon Agent от Outtake устроен иначе: он расследует всю сеть за конкретной имперсонацией целиком. Вместо того чтобы просто снести клонированную страницу входа, агент собирает и классифицирует все доказательства инцидента, а затем идёт по следам — например, находит связанный фейковый аккаунт «Поддержки» в Telegram — и строит граф всей вражеской инфраструктуры. Финальный шаг — отчёт с описанием хода расследования, профилем предполагаемого злоумышленника и восстановленной хронологией атаки.
Чтобы делать всё это, агент умеет читать, писать и запускать код, а также напрямую взаимодействовать с вредоносными страницами входа — чтобы увидеть, куда на самом деле утекают украденные учётные данные. Такие расследования требуют долгой автономной работы: медианная сессия агента длится 16 минут, но регулярно растягивается на час и дольше, а самый долгий забег занял два часа непрерывной агентной работы до выдачи результата.
Четыре шага построения Recon Agent
Команда Outtake строила агента постепенно — на каждом этапе они забирали немного больше человеческой экспертизы и передавали её агенту.
| Шаг | Что делали |
|---|---|
| 1. Стань экспертом сам | Инженеры лично проводили реальные расследования и собирали экспертизу клиентов, чтобы определить, что такое «хорошее» расследование |
| 2. Прототип в Claude Code | Проверяли гипотезы: агенту нужны кодовые «мышцы» — писать и запускать код, взаимодействовать с доменами напрямую |
| 3. Продакшн-обвязка на Agent SDK | Перешли на Claude Agent SDK, чтобы получить контроль над памятью, контекстом и файловой системой без переизобретения цикла агента |
| 4. Цикл итераций на эвалах | Построили набор автоматических оценок, который позволяет безопасно вносить крупные изменения — вплоть до смены модели |
«Самое важное при построении долгоживущих агентов — понять, что такое «хорошо»? Что агент должен делать?» — говорит Джек Хэйфорд, инженерный лидер платформы агентов Outtake. — «Потому что в конечном счёте ты гарантируешь, что агент будет делать именно это каждый раз».
Первые прототипы делались на традиционных агентных фреймворках, но команда быстро поняла: Recon Agent не может быть простым исследователем — ему нужно писать код на ходу, создавать инструменты по обстоятельствам и взаимодействовать с вредоносными доменами. Именно на прототипировании в Claude Code родился ключевой принцип дизайна: жёстко ограничивать агента на уровне оркестрации («всегда делай X, Y, Z при расследовании домена»), но оставлять свободу для импровизации там, где нужна экспертная оценка.
Переход на Claude Agent SDK был логичным следующим шагом для продакшена — команда сохранила паттерны, освоенные в Claude Code, и получила более тонкий контроль над памятью и файловой системой агента, не изобретая заново цикл обработки сессий.

Файловая система и bash — вот и всё, что нужно
Один из главных выводов команды: если дать агенту файловую систему вместе с возможностью писать, читать и запускать код, он сам находит выход из тупиков. Это работает как память, которая переживает компакцию контекста.
«Передача агенту таких открытых и мощных инструментов — это огромный шаг вперёд. Мы наблюдали множество случаев, когда у агента отказывал инструмент из-за сетевого сбоя — и он сам находил обходной путь и продолжал работу», — объясняет Хэйфорд. Дело не в том, что инструмент сам по себе умный, а в том, что вокруг него построена достаточно прочная обвязка (harness), которая оставляет агенту пространство для импровизации.
Совет
Идея «дать агенту филсистему и bash» звучит просто, но именно так строятся многие серьёзные агентные системы — вместо десятков узких специализированных инструментов, каждый под свою задачу.
Промпт — это подсказка, а не закон
Одна из самых честных мыслей команды: «Когда ты строишь долгоживущих агентов, которые со временем усложняются, промпты — это просто подсказки». Когда агент делал не то, что хотелось, естественная реакция — дописать в системный промпт что-то вроде «когда происходит X, обязательно делай Y». Это может сработать вначале, но чем дольше агент работает, тем выше шанс, что любое отдельное слово из промпта будет со временем проигнорировано.
Правильный подход — заранее вынести то, что агент должен делать всегда, из промпта в саму обвязку — сделать это частью гардрейлов, а не текста инструкции. «Теперь агенту не нужно об этом думать, и у него остаётся больше контекста и внимания на то, где он реально может проявить себя», — говорит Хэйфорд. Этот принцип прекрасно сочетается с идеей из поста Как читать diff: «было/стало» без паники — чем прозрачнее и понятнее правила игры, тем меньше сюрпризов на выходе.
Эвалы нужны не только для надёжности, но и для скорости
Общепринятое мнение — эвалы (автоматизированные оценки качества) нужны как барьер надёжности. Но для долгоживущих агентов главная выгода от них — скорость. Изначально команда вручную проверяла каждый запуск агента, читая 30-минутную стенограмму его действий — и это оказалось мучительно и не масштабировалось.
«В современной разработке агентов оценка результата — самый дорогой шаг во всём цикле», — говорит Хэйфорд. Эвал — это просто структурированная, автоматизируемая версия той же ручной рефлексии: закодировав, что такое «хорошо», можно посадить другого агента в кресло судьи, чтобы он читал стенограмму и оценивал прогон. Это позволило команде выйти из цикла ручной проверки: когда Recon Agent завершает расследование и сообщает, что справился бы лучше с каким-то недостающим инструментом, отдельный кодирующий агент читает эти рекомендации, пишет новый инструмент и создаёт тестовый сценарий для проверки. Человек включается только в самом конце — посмотреть, действительно ли новый инструмент помог.
«Мы — это бутылочное горлышко, и когда ты строишь такие сложные долгоживущие агенты, очень важно, чтобы обратная связь была автоматизирована. Это намного быстрее и намного приятнее как разработчику», — резюмирует Хэйфорд.
Защита агента: блaстбокс на случай взлома
Инъекция промптов (prompt injection) — реальная угроза, особенно когда агент сам заходит на вредоносные страницы. Именно поэтому Outtake выбрала Claude в том числе за устойчивость к таким атакам. «Мы дали агенту файловую систему и bash, и мы отправляем его во враждебные среды, поэтому главной задачей было построить что-то вроде «блaстбокса», который прячет чувствительные внутренние данные от агента, не сковывая его при этом», — говорит Хэйфорд.
Подход команды исходит из предположения, что агент теоретически может быть скомпрометирован — и вся окружающая система строится так, чтобы сдержать возможный ущерб. Похожие принципы разбираются в материале Ноль риска — не цель: гид Anthropic по безопасности агентов и в статье про защиту разработки, где 80% кода пишет Claude — идея «сдерживания», а не «идеального запрета», становится стандартом для агентных систем. Сейчас Outtake идёт дальше — оценивает уровень доверия ровно в момент, когда агент обращается в интернет, и строит контрольную точку, которая проверяет: это имперсонация? Это малварь? Это попытка инъекции промпта прямо сейчас? Возможно, именно такая броня понадобится всем агентам, которые всё чаще путешествуют по враждебному интернету.
Частые вопросы
Что такое Recon Agent от Outtake?
Это автономный AI-агент, построенный на Claude Code и Claude Agent SDK, который расследует не отдельные атаки (например, фишинговый сайт), а целую сеть, стоящую за ними — связанные домены, фейковые аккаунты и инфраструктуру злоумышленников.
Почему сессии агента могут длиться часами?
Расследование сложной сети атак требует множества шагов: сбора доказательств, перехода по цепочкам связанных ресурсов, взаимодействия с вредоносными страницами. Медианная сессия занимает 16 минут, но нередко растягивается на час и дольше — самый долгий прогон длился два часа.
Почему команда сначала использовала Claude Code, а потом перешла на Agent SDK?
Claude Code дал команде быстрый способ прототипировать и проверить гипотезы о поведении агента. Когда проект перешёл в продакшен, Claude Agent SDK дал более тонкий контроль над памятью, контекстом и файловой системой — при этом все паттерны и навыки, освоенные в Claude Code, сохранились.
Зачем агенту нужна файловая система и bash, а не набор узких инструментов?
Открытые инструменты вроде файловой системы и командной строки дают агенту пространство для импровизации. Если один способ решения задачи не срабатывает (например, из-за сетевого сбоя), агент может сам найти обходной путь — при условии, что вокруг него построена достаточно надёжная обвязка (harness).
Как Outtake защищает себя от риска взлома собственного агента?
Команда предполагает, что агент теоретически может быть скомпрометирован, и строит «блaстбокс» — среду, которая сдерживает возможный ущерб, не мешая агенту работать. Дополнительно они внедряют проверку доверия в момент, когда агент выходит в интернет.
Recon Agent от Outtake — хороший пример того, как меняется подход к построению агентов: не жёсткий сценарий на все случаи жизни, а обвязка из памяти, инструментов и гардрейлов, внутри которой агент может думать сам. Чёткое понимание того, что такое «хорошо» — прежде, чем писать первую строку кода, — оказалось важнее любого фреймворка.
Если хочешь попробовать всё это руками — начни с бесплатного курса «Claude Code и терминал: с 0».
Источник
По мотивам статьи Anthropic «How Outtake built a cyber investigator on Claude». Пересказали по-русски для новичков.