VMTech
Обсудить проект

Anthropic раскрыла механизм водяных знаков в текстах Claude

Anthropic раскрыла механизм водяных знаков в текстах Claude

Anthropic раскрыла технические детали водяных знаков для текстов, созданных Claude. Компания намерена использовать подход SynthID-Text, описанный командой Google DeepMind в 2024 году, и выпустить API для обнаружения маркировки. Мера связана с соблюдением Кодекса прозрачности EU AI Act.

Как сообщалось при объявлении инициативы, маркировка текстов моделей Claude предполагает возможность идентифицировать материалы, созданные моделями. Теперь Anthropic уточнила, в каких случаях метка сохраняется после редактирования и почему её влияние на программный код будет ограниченным.

Как формируется незаметная маркировка

Водяной знак создаётся, когда у модели есть несколько равнозначных вариантов формулировки. Например, Claude может выбрать одно из близких по смыслу слов для описания погоды. Из таких низкорисковых решений складывается паттерн, незаметный обычному читателю, но доступный для проверки тому, у кого есть ключ кодирования.

Anthropic заявляет, что маркировка не влияет на качество ответа: водяной знак не должен отличать текст для читателя от немаркированного. Компания отдельно подчёркивает различие между этим методом и сервисами выявления ИИ-текста, которые ищут характерные языковые обороты и другие статистические признаки. Проверка водяного знака опирается не на стилистические «сигналы», а на встроенный паттерн.

Что произойдёт после редактирования

Лёгкая редактура, по оценке Anthropic, вероятно, не удалит водяной знак полностью. Однако полное переписывание, при котором заменяются все слова, способно убрать маркировку. В таком случае компания предлагает отдельно оценивать, можно ли по-прежнему считать итоговый текст созданным ИИ.

Если Claude лишь вычитывал или частично редактировал человеческий текст, результат зависит от объёма и глубины правок. При небольшой правке почти все слова принадлежат автору, поэтому метке практически не к чему прикрепляться.

Почему для кода эффект будет минимальным

В программном коде свобода выбора у модели меньше: результат должен работать, а не только быть стилистически удачным. Поэтому Anthropic ожидает меньшую выраженность водяного знака. Он может появиться там, где допустим произвольный выбор терминов или слов, например в комментариях, но должен оказывать пренебрежимо малое влияние на сам код.

Anthropic также отмечает, что Claude не останется единственным чат-ботом с такой маркировкой: другие крупные разработчики моделей подписали тот же кодекс практики и будут внедрять собственные механизмы. Для бизнеса это означает, что при использовании генеративного ИИ стоит заранее учитывать проверяемость происхождения текстовых материалов и отдельно оценивать сценарии с человеческой редактурой и разработкой кода.

#anthropic#claudeai#aiwatermarks#euaiact
Открытая аналитика
На сайте 0 просмотров
мин чтения 3 15.08.2026
Instagram

Anthropic раскрыла механизм водяных знаков в текстах Claude

Открыть публикацию в Instagram ↗