Claude скоро начнёт добавлять невидимые водяные знаки во все текстовые ответы. Anthropic утверждает, что качество не просядет, но признаёт: система будет слегка сдвигать выбор слов.
Компания объяснила механизм в публикации о текстовых водяных знаках Claude. Повод практический: Anthropic готовит поддержку маркировки на фоне недавно принятого EU AI Act. Закон давит на разработчиков ИИ в сторону большей прозрачности, и текстовые модели тут попали в сложную зону.
С картинками всё проще: можно внедрить метку в пиксели. С текстом трюк тоньше. Если водяной знак меняет слова, возникает неприятный вопрос: кто на самом деле пишет ответ — пользовательский запрос или служебная система маркировки?
Водяной знак Claude будет работать через выбор слов
Anthropic использует версию метода SynthID-Text от Google DeepMind. Он не вставляет видимые символы и не добавляет служебные фразы. Вместо этого метод меняет источник случайности, который модель применяет при выборе следующего слова.
LLM пишет текст по одному токену. На каждом шаге модель оценивает вероятности продолжения. В фактических местах выбор обычно узкий. После «Neil» в ответе про первого человека на Луне нормальным продолжением будет «Armstrong». В задаче 2 + 2 модель почти неизбежно выберет «4».
Но в обычной фразе вариантов больше. Anthropic приводит пример с прогнозом погоды: «It’s going to be a…». Модель может колебаться между «grey» и «overcast». Оба слова подходят, оба не ломают смысл. В таких местах водяной знак и даёт тот самый лёгкий толчок.
Компания называет такие случаи низкорисковыми. Метка не должна превратить правильный ответ в ошибку. Она может поменять оттенок формулировки, комментарий в коде или слово в описании. По словам Anthropic, «для читателя ответ с водяным знаком неотличим от ответа без него».
Качество текста: обещание Anthropic и претензия Грубера
Anthropic заявляет, что внутренние тесты не нашли ухудшений в содержании, креативности и читаемости. Формулировка аккуратная: компания не говорит, что текст останется побуквенно тем же. Она говорит, что итоговый ответ не станет хуже по измеряемым параметрам.
В большой выборке эти мелкие сдвиги складываются в статистический рисунок. По нему можно распознать текст Claude. Anthropic говорит, что метка переживёт копирование, вставку и лёгкую правку. Для проверки компания готовит отдельный detection API, но он ещё не запущен.
Критика уже есть. Автор Daring Fireball Джон Грубер резко выступил против подхода Anthropic. Его претензия простая: инструмент для письма не должен жертвовать даже крупицей ясности, смысла или качества ради скрытых признаков происхождения текста.
Мы понимаем эту реакцию. Когда платишь за ИИ-помощника, хочется получить лучший возможный ответ на свой запрос. Не ответ, который ещё и решает регуляторную задачу производителя. Даже если разница между «серым» и «пасмурным» выглядит безобидно, сам принцип многих раздражит.
Есть и другая сторона. Текстовые модели и без водяных знаков выбирают слова вероятностно. Они не «думают» о ритме фразы как редактор. Они считают вероятности и иногда бросают кубик между близкими вариантами. Водяной знак просто подталкивает этот кубик в заранее полезную для детектора сторону.
Anthropic уже добавляет поддержку водяных знаков в новые и существующие модели Claude. Компания формулирует главный тезис так: «In internal testing, we’ve seen no impact of watermarking on the content, level of creativity, or readability of Claude’s text».