Скоро тексты, которые генерирует Claude, будут содержать невидимый водяной знак. Это не штамп и не приписка «сделано ИИ» — это статистический паттерн внутри самого текста, который позволяет позже проверить, была ли модель причастна к его написанию. Anthropic подробно объяснила, как это работает, и мы разберём это по-русски, без сложных терминов.
Что такое водяной знак в тексте
Языковые модели вроде Claude генерируют текст слово за словом (точнее, токен за токеном — если тебе интересно, что это такое, у нас есть отдельный разбор что такое LLM). На каждом шаге модель выбирает следующее слово из списка кандидатов. Возьмём фразу «Погода сегодня была холодной и…» — следующим словом почти наверняка не будет «сладкой», но вполне может быть «пасмурной» или «серой». Для читателя разница между этими двумя вариантами не имеет значения — смысл фразы почти не меняется. Именно такие низкоценные, равнозначные развилки модель обычно решает с помощью случайного числа.
Идея водяного знака в том, чтобы заменить источник этой случайности. Вместо обычного генератора случайных чисел модель использует секретный ключ и несколько предыдущих слов, чтобы решить, какое слово выбрать. Слова остаются такими же случайными на вид, но теперь по последовательности выбранных слов можно проверить: соответствуют ли они тем решениям, которые сделала бы модель, если бы использовала этот ключ. Если да — можно оценить вероятность, что текст написан именно Claude.
Заметка
Важно: водяной знак не заставляет модель постоянно выбирать одно и то же слово вместо другого. «Пасмурная» может встретиться в одном предложении, «серая» — в следующем, всё зависит от контекста. Знак не подталкивает модель к словам, которые она бы никогда не выбрала естественным образом.
Аналогия с Монополией и числами пи
Anthropic предлагает удобную аналогию. Представь, что играешь в Монополию, и вместо броска кубика игроки используют цифры из книги десятичных знаков числа пи — начиная, скажем, с 1 012 845-й цифры после запятой. Для игроков и для исхода партии совершенно не важно, откуда берётся случайность — из кубика или из пи. Но если после игры посмотреть на всю последовательность ходов и знать значение пи, можно вычислить, что игра, вероятно, использовала именно этот источник случайности.
Ровно так же работает водяной знак в тексте Claude. Он не меняет смысл и восприятие текста читателем, но если позже нужно проверить, вероятно ли, что текст сгенерировала модель, — знак даёт такую возможность через ключ, известный только Anthropic.
Какой конкретно метод используют
Водяной знак Claude — это версия подхода SynthID-Text, опубликованного Google DeepMind в статье в журнале Nature в 2024 году. Метод принадлежит к семейству техник, восходящих к предложению Скотта Ааронсона в 2022 году, и все они разделяют один принцип: меняется только источник случайности при выборе слов, а не сам смысл текста.
У метода есть естественные ограничения. Ключ позволяет ответить только на вопрос «какова вероятность, что этот текст частично написан Claude», но не подтверждает, что текст написан человеком, и не может определить, использовалась ли другая модель — даже если у неё свой водяной знак, ключ будет другим. Кроме того, детекция плохо работает на коротких фрагментах: чем меньше слов, тем меньше «развилок» для анализа и тем ниже уверенность. Чем длиннее текст, тем точнее оценка.
Где водяного знака почти нет
Знак опирается на равнозначные, необязательные выборы слов. Там, где выбор жёстко предопределён — правильный ответ только один, — знаку просто нет места. Anthropic приводит пример: во фразе «Самая известная работа Исаака Ньютона называлась Principia…» следующее слово почти наверняка «Mathematica», и других вариантов, по сути, нет — значит, ставить знак некуда.
| Тип текста | Насколько заметен водяной знак |
|---|---|
| Свободное творческое письмо | Сильно выражен — много равнозначных слов |
| Факты, точные названия, цифры | Слабо или отсутствует — вариантов почти нет |
| Код | В основном отсутствует — исполняемость требует точности |
| Комментарии в коде | Может быть заметен — там есть свобода формулировок |
| Лёгкая правка (проверка орфографии) | Почти не выражен — изменений слишком мало |
| Перевод текста Claude | Выражен полностью — все слова выбирает модель |
Та же логика касается редактуры человеческого текста. Если ты просишь Claude только проверить грамматику и пунктуацию, а не переписывать текст, водяной знак может «зацепиться» только за те несколько слов, что модель поменяла — и этого может быть недостаточно, чтобы детектор что-то уверенно распознал. Чем больше Claude пишет сам, тем больше решений принимает и тем больше пространства остаётся для знака. Это, кстати, хорошо иллюстрирует разницу между тем, когда стоит доверить работу модели целиком, а когда — использовать её как помощника; у нас есть отдельный разбор на эту тему: агент или скрипт.
Влияет ли знак на качество текста
Ключевой вопрос — портит ли водяной знак сам текст. Ответ Anthropic: нет, никакого практического влияния на качество, креативность или читаемость не обнаружено. В самой статье про SynthID-Text команда Google DeepMind тестировала это на живом трафике Gemini, сравнивая оценки «палец вверх / палец вниз» у пользователей, — статистически значимых различий между версией с водяным знаком и без него не нашли. В контролируемом исследовании, где люди сравнивали ответы бок к боку, разницы в качестве тоже не заметили.
Совет
Если тебе важно, чтобы Claude писал именно как человек — живо и по делу, без «ИИ-штампов», — загляни в наш разбор как писать промпты: грамотный промпт влияет на результат намного сильнее, чем факт наличия водяного знака.
Что это значит для пользователя на практике
Хорошая новость: водяной знак не добавляет лишних токенов, а значит, не делает запросы к Claude дороже и не замедляет генерацию. Он также не содержит никакой идентифицирующей информации — ни о конкретном пользователе, ни об организации, ни о чате. Раскрыть, кто именно писал промпт или в каком аккаунте шёл разговор, знак не позволяет: он говорит только о том, что текст, вероятно, создавался Claude, и ничего больше.
Проверить текст на водяной знак самостоятельно пока не получится — Anthropic обещает вскоре выпустить API для детекции, детали которого сейчас уточняются. Обойти защиту частично можно: лёгкая правка текста знак, скорее всего, не уничтожит, а полная переработка каждого слова — сможет. Правда, в этом случае справедливо спросить, можно ли всё ещё называть такой текст «сгенерированным ИИ».
Почему это делают именно сейчас
Причина внедрения — не инициатива самой Anthropic, а требование закона. С 2 августа Европейский союз обязывает провайдеров ИИ, работающих на его рынке, помечать контент, созданный искусственным интеллектом. Anthropic, наряду с другими крупными разработчиками моделей и около 190 подписантами в целом, присоединилась к Кодексу добросовестной практики ЕС по прозрачности ИИ-контента в июле 2026 года. Поскольку надёжного способа применять знак только для пользователей из ЕС пока нет, водяной знак будет включён глобально — для всех, кто использует Claude, независимо от региона.
Для моделей, выпущенных до 2 августа 2026 года, закон предусматривает переходный период, и Anthropic работает над добавлением водяного знака и для них — постепенно, в течение ближайших месяцев.
А что с картинками и файлами
Для изображений и других файлов (например, .png, .jpg, .svg) применяется другой механизм — не водяной знак, а метаданные с криптографической подписью, подтверждающие, что файл создан или обработан Claude. Это открытый отраслевой стандарт C2PA — тот же, что используют производители камер и редакторы фото, чтобы фиксировать происхождение изображения. Файл сам по себе не меняется, ничего не встраивается и не скрывается в пикселях — просто прикладывается небольшая проверяемая заметка. Anthropic планирует выпустить собственный инструмент, куда можно будет загрузить файл и проверить эту метку.
Частые вопросы
Можно ли отследить водяной знак до конкретного человека или организации?
Нет. Знак применяется к самому тексту Claude и не содержит никакой информации о пользователе, его организации или содержании чата. По ключу нельзя восстановить, кто написал запрос.
Делает ли водяной знак ответы Claude дороже или медленнее?
Нет. Знак не создаёт дополнительных токенов и практически не влияет на скорость генерации, поэтому цена использования модели не меняется.
Что именно доказывает наличие водяного знака?
Только то, что Claude вероятно был причастен к созданию текста в какой-то момент. Знак не может отличить «Claude написал это сам» от «Claude сильно отредактировал чужой текст», и не подтверждает, что текст написан человеком.
Применяется ли водяной знак к переводам, сделанным Claude?
Да. При переводе каждое слово выбирает модель, поэтому такой текст размечается полностью, в отличие, например, от лёгкой корректорской правки.
Чем это отличается от сервисов детекции ИИ-текста, вроде Pangram?
Такие сервисы не имеют доступа к ключу Anthropic и ищут косвенные «фирменные» признаки — например, характерные для ИИ обороты речи. Это принципиально другой, менее надёжный метод по сравнению с проверкой водяного знака по ключу.
Водяной знак — это скорее техническая формальность на стыке закона и инженерии, чем что-то, что должно тебя беспокоить как пользователя Claude. Текст останется таким же живым и качественным, цена и скорость не изменятся, а твоя приватность не пострадает. Единственное, что меняется, — теперь у Anthropic (и, в перспективе, у всех желающих через будущий API) появится способ достоверно проверить, был ли Claude причастен к написанию того или иного текста.
Если хочешь попробовать всё это руками — начни с бесплатного курса «Claude с нуля».
Источник
По мотивам статьи Anthropic «How Claude's text watermarking works». Пересказали по-русски для новичков.