Обычно проверка ИИ-моделей на безопасность выглядит так: компания выпускает модель, а внешние исследователи тестируют её со стороны — через API, без доступа к внутренним процессам. Anthropic решила пойти дальше и впустить независимых экспертов внутрь компании — буквально дать им доступ, похожий на доступ сотрудника. Партнёром в этом эксперименте стала Accenture, одна из крупнейших консалтинговых компаний мира.
Что такое «встроенная оценка» и почему это ново
Идея embedded evaluation — «встроенной оценки» — родилась из эссе CEO Anthropic «We Must Pace the Frontier» («Мы должны задавать темп фронтира»), где компания взяла на себя обязательство встраивать независимых оценщиков прямо в свою работу. Сейчас внешние проверяющие смотрят на модель снаружи: тестируют готовый продукт, изучают публичную документацию, иногда получают ограниченный ранний доступ к версии перед релизом. Встроенные оценщики получат нечто большее — они будут наблюдать за тем, как модель формируется прямо в процессе обучения, следить за решениями, которые определяют, как модель строится и выпускается, и разговаривать напрямую с сотрудниками компании.
Такой уровень доступа даёт совершенно другую картину. Оценщик со стороны видит только результат — ответы модели на тестовые запросы. Оценщик внутри видит процесс: почему было принято то или иное решение при обучении, кто и как реагировал на найденную проблему, соблюдает ли компания собственные заявленные обещания по безопасности. Это ближе к внутреннему аудиту, чем к внешней проверке, — но аудитор при этом не работает в штате компании и не подчиняется её руководству.
Кто такая Accenture в этой истории
Партнёрство будет вести Faculty — специализированное подразделение Accenture, занимающееся ИИ. В задачи входят оценка моделей и red-teaming (это когда специалисты намеренно пытаются «взломать» модель, найти способы заставить её вести себя плохо, — чтобы найти слабые места раньше злоумышленников), assessment согласованности моделей с заявленными ценностями (alignment) и проверка защитных механизмов (safeguards) — тех ограничений, которые не дают модели помогать с опасными задачами.
Accenture — не случайный выбор. Компания помогает бизнесам и правительствам по всему миру внедрять ИИ на практике, а значит хорошо понимает, как модели реально используются в разных отраслях — от финансов до здравоохранения. Anthropic рассчитывает, что этот практический опыт даст оценщикам более реалистичный взгляд на риски, а не только теоретический. Похожая логика прослеживается и в других инициативах Anthropic по работе с крупными партнёрами — например, в истории про Salesforce внутри Claude, где тоже важно было понять, как ИИ ведёт себя в реальных рабочих сценариях, а не в лаборатории.
Деньги: больше миллиарда с каждой стороны
Масштаб инвестиций впечатляет: Anthropic и Accenture планируют вложить не менее 1 миллиарда долларов каждая в развитие этого направления в течение следующих пяти лет. Это не разовый грант на исследование, а долгосрочная программа по созданию целой инфраструктуры независимой проверки — с людьми, процессами и инструментами.
| Параметр | Значение |
|---|---|
| Партнёр Anthropic | Accenture (через подразделение Faculty) |
| Минимальные инвестиции с каждой стороны | 1 млрд $ |
| Горизонт программы | 5 лет |
| Кто финансирует пилот с Accenture | Anthropic напрямую |
| Другие потенциальные партнёры по оценке | METR и другие нонпрофит-организации |
Заметка
Пока не существует единых стандартов для того, какой именно доступ должны получать встроенные оценщики и как им отчитываться о находках. Anthropic прямо признаёт: правила игры формируются на ходу.
Кто платит за независимость
Здесь возникает логичный вопрос: если Anthropic платит Accenture за проверку самой Anthropic, насколько такая оценка действительно независима? Компания сама признаёт: устоявшейся системы финансирования независимой оценки ИИ пока не существует. В своём июньском документе Advanced AI Framework Anthropic уже призывала к тому, чтобы в перспективе такая работа финансировалась из общих (pooled) или государственных источников — то есть не напрямую компанией, которую проверяют.
Поскольку ни общего фонда, ни государственной системы финансирования сегодня нет, Anthropic планирует работать с разными оценщиками на разных финансовых условиях. Партнёрство с Accenture компания финансирует напрямую — из-за важности и срочности задачи. Параллельно Anthropic ведёт переговоры с METR (некоммерческой организацией, уже известной по независимым проверкам ИИ-моделей) и другими нонпрофитами о пилотировании отдельных элементов встроенной оценки, но уже с использованием их собственного финансирования, а не денег Anthropic. Это попытка выстроить экосистему оценщиков с разными источниками денег и разной степенью финансовой независимости от проверяемой компании.
Ответственность не размывается, а становится проверяемой
Важный акцент, который Anthropic делает отдельно: появление независимых встроенных оценщиков не снимает с компании ответственность за безопасность собственных моделей. Наоборот, задача этого механизма — сделать ответственность более проверяемой извне. Раньше утверждения компании о том, что она соблюдает свои обещания по безопасности, приходилось принимать на веру. Теперь появляется третья сторона, которая физически находится внутри процесса и может подтвердить или опровергнуть эти утверждения.
Оценщики смогут не только следить за соблюдением заявленных правил, но и находить слепые зоны — то, что сама компания могла не заметить или недооценить. Они также получат возможность сообщать об инцидентах и давать публике более информированную картину того, какие у моделей реальные риски и преимущества — не через пресс-релизы, а через людей, которые видели процесс изнутри. Это перекликается с более широкой темой про то, чего ИИ пока не умеет — и почему это ок: честное признание ограничений и рисков полезнее, чем маркетинговые обещания идеальной безопасности.
Экосистема, а не эксклюзив
Anthropic специально подчёркивает: партнёрство с Accenture не эксклюзивное. Компания планирует работать с несколькими организациями-оценщиками одновременно и в ближайшие недели объявит о новых партнёрах в этой сфере. Со своей стороны Accenture тоже будет предлагать аналогичные услуги другим разработчикам ИИ, не только Anthropic.
Логика здесь простая: один оценщик — это одна точка зрения и один набор слепых зон. Anthropic ожидает, что в перспективе крупные лаборатории, работающие на фронтире ИИ, будут одновременно сотрудничать с несколькими независимыми организациями, действующими по общим стандартам. Именно наличие целой экосистемы разных проверяющих, а не одного «доверенного» партнёра, по мнению компании, даёт более надёжную картину происходящего.
Что дальше
Многие детали того, как именно будет работать встроенная оценка, ещё предстоит определить: какой конкретно доступ получат оценщики, как именно они будут документировать находки, какие каналы отчётности будут открыты для публики. Anthropic прямо говорит, что подход будет эволюционировать по мере развития всей отрасли, и обещает делиться подробностями по мере запуска работы и подключения новых оценщиков.
Компания сознательно публикует эту информацию на раннем этапе — ещё до того, как все процессы отработаны, — чтобы и пользователи, и другие разработчики ИИ могли видеть, как устроен этот процесс изнутри. Это часть более широкой тенденции, когда компании, разрабатывающие мощные модели, пытаются выстроить механизмы внешнего контроля до того, как регуляторы или общество потребуют этого принудительно.
Частые вопросы
Что такое встроенная оценка (embedded evaluation)?
Это новый формат проверки ИИ-моделей, при котором независимые эксперты получают доступ внутрь компании-разработчика — сравнимый с доступом сотрудника. Они наблюдают за обучением моделей, изучают решения по разработке и выпуску, общаются с командой напрямую, а не проверяют только готовый продукт со стороны.
Кто такая Accenture и почему именно она стала партнёром?
Accenture — крупная международная консалтинговая компания, которая помогает бизнесам и правительствам внедрять ИИ на практике. Партнёрство ведёт её специализированное подразделение по ИИ — Faculty. Anthropic рассчитывает, что практический опыт Accenture в развёртывании ИИ в разных отраслях даст более реалистичный взгляд на риски.
Разве оценка не теряет независимость, если Anthropic сама платит за неё?
Anthropic признаёт эту проблему открыто. Пока в мире нет устоявшейся системы финансирования независимой оценки ИИ, поэтому компания финансирует пилот с Accenture напрямую, а параллельно ведёт переговоры с METR и другими нонпрофитами о работе на их собственном финансировании — как альтернативном подходе.
Значит ли это, что Anthropic больше не отвечает за безопасность своих моделей?
Нет. Anthropic прямо заявляет, что ответственность за безопасность моделей остаётся полностью на компании. Задача независимых оценщиков — не снять эту ответственность, а сделать её проверяемой для внешнего мира.
Будет ли Anthropic работать только с Accenture?
Нет, партнёрство не эксклюзивное. Anthropic планирует привлекать несколько независимых организаций для оценки одновременно и уже ведёт переговоры с METR и другими нонпрофитами. Accenture, в свою очередь, будет предлагать похожие услуги и другим разработчикам ИИ.
Идея встроенной оценки звучит просто, но она меняет саму логику доверия к ИИ-компаниям: вместо «поверьте нам на слово» появляется «пусть кто-то посторонний посмотрит изнутри и подтвердит». Пока это только начало — стандартов нет, схема финансирования гибридная, а список партнёров будет расти в ближайшие недели. Но направление задано: безопасность фронтирного ИИ должна проверяться не только пресс-релизами, а живыми людьми, которые видят процесс своими глазами.
Если хочешь попробовать всё это руками — начни с бесплатного курса «ИИ без иллюзий».
Источник
По мотивам статьи Anthropic «Partnering with Accenture on embedded evaluation». Пересказали по-русски для новичков.