Claude скоро начнёт добавлять невидимые водяные знаки во все текстовые ответы. Anthropic утверждает, что качество не просядет, но признаёт: система будет слегка сдвигать выбор слов.

Компания объяснила механизм в публикации о текстовых водяных знаках Claude. Повод практический: Anthropic готовит поддержку маркировки на фоне недавно принятого EU AI Act. Закон давит на разработчиков ИИ в сторону большей прозрачности, и текстовые модели тут попали в сложную зону.

С картинками всё проще: можно внедрить метку в пиксели. С текстом трюк тоньше. Если водяной знак меняет слова, возникает неприятный вопрос: кто на самом деле пишет ответ — пользовательский запрос или служебная система маркировки?

Водяной знак Claude будет работать через выбор слов

Anthropic использует версию метода SynthID-Text от Google DeepMind. Он не вставляет видимые символы и не добавляет служебные фразы. Вместо этого метод меняет источник случайности, который модель применяет при выборе следующего слова.

Продолжение после рекламы

LLM пишет текст по одному токену. На каждом шаге модель оценивает вероятности продолжения. В фактических местах выбор обычно узкий. После «Neil» в ответе про первого человека на Луне нормальным продолжением будет «Armstrong». В задаче 2 + 2 модель почти неизбежно выберет «4».

Но в обычной фразе вариантов больше. Anthropic приводит пример с прогнозом погоды: «It’s going to be a…». Модель может колебаться между «grey» и «overcast». Оба слова подходят, оба не ломают смысл. В таких местах водяной знак и даёт тот самый лёгкий толчок.

Изображение к статье: Claude получит невидимые водяные знаки в тексте

Компания называет такие случаи низкорисковыми. Метка не должна превратить правильный ответ в ошибку. Она может поменять оттенок формулировки, комментарий в коде или слово в описании. По словам Anthropic, «для читателя ответ с водяным знаком неотличим от ответа без него».

Качество текста: обещание Anthropic и претензия Грубера

Anthropic заявляет, что внутренние тесты не нашли ухудшений в содержании, креативности и читаемости. Формулировка аккуратная: компания не говорит, что текст останется побуквенно тем же. Она говорит, что итоговый ответ не станет хуже по измеряемым параметрам.

В большой выборке эти мелкие сдвиги складываются в статистический рисунок. По нему можно распознать текст Claude. Anthropic говорит, что метка переживёт копирование, вставку и лёгкую правку. Для проверки компания готовит отдельный detection API, но он ещё не запущен.

Критика уже есть. Автор Daring Fireball Джон Грубер резко выступил против подхода Anthropic. Его претензия простая: инструмент для письма не должен жертвовать даже крупицей ясности, смысла или качества ради скрытых признаков происхождения текста.

Мы понимаем эту реакцию. Когда платишь за ИИ-помощника, хочется получить лучший возможный ответ на свой запрос. Не ответ, который ещё и решает регуляторную задачу производителя. Даже если разница между «серым» и «пасмурным» выглядит безобидно, сам принцип многих раздражит.

Есть и другая сторона. Текстовые модели и без водяных знаков выбирают слова вероятностно. Они не «думают» о ритме фразы как редактор. Они считают вероятности и иногда бросают кубик между близкими вариантами. Водяной знак просто подталкивает этот кубик в заранее полезную для детектора сторону.

Anthropic уже добавляет поддержку водяных знаков в новые и существующие модели Claude. Компания формулирует главный тезис так: «In internal testing, we’ve seen no impact of watermarking on the content, level of creativity, or readability of Claude’s text».

Продолжение после рекламы

Рейтинг: 0 / 5. Оценок: 0

Рекомендуем почитать

Оставьте комментарий

Перед оставлением комментария, пожалуйста, ознакомьтесь с правилами комментирования.