Anthropic объяснила, как будет прятать «водяной знак» в текстах Claude
Маркировка будет незаметна для читателя и не потребует добавлять в текст скрытые символы. Для ее создания компания использует технологию Google DeepMind.
Маркировка будет незаметна для читателя и не потребует добавлять в текст скрытые символы. Для ее создания компания использует технологию Google DeepMind.
Маркировка будет незаметна для читателя и не потребует добавлять в текст скрытые символы. Для ее создания компания использует технологию Google DeepMind.
Anthropic рассказала, как будет маркировать тексты, созданные будущими моделями Claude. Компания внедряет «водяной знак», который позволит определить вероятность того, что Claude участвовал в написании или существенном редактировании текста. В основе механизма лежит технология SynthID-Text от Google DeepMind.
При генерации текста языковая модель последовательно выбирает следующие слова из нескольких вероятных вариантов. В некоторых случаях на смысл практически не влияет, какое именно слово будет использовано. Например, после описания погоды модель может выбрать между близкими по значению вариантами вроде «пасмурно» и «серо».
Обычно подобный выбор частично определяется случайностью. При использовании SynthID-Text источником этой случайности становится специальный ключ в сочетании с несколькими предыдущими словами. В результате в тексте формируется статистический шаблон, незаметный человеку, но доступный для проверки тому, у кого есть соответствующий ключ.
Anthropic сообщает, что технология не добавляет в текст скрытые символы, метаданные или дополнительные токены. По результатам внутренних тестов компании маркировка не повлияла на содержание, креативность и читаемость ответов. Существенного влияния на скорость генерации и стоимость использования Claude также не ожидается.
При этом механизм работает не во всех типах текста одинаково. «Водяной знак» может появиться только там, где у модели существует выбор между несколькими сопоставимыми вариантами. Если ответ требует строго определенного слова или выражения, например при передаче факта, решении математической задачи или написании части программного кода, маркировка не применяется.
Маркировка не содержит данных о конкретном пользователе, компании или диалоге с Claude. По словам разработчиков, она позволяет установить лишь вероятность того, что Claude участвовал в создании материала, но не подтверждает авторство текста и не позволяет определить, был ли он полностью сгенерирован моделью или только существенно отредактирован.
Компания также готовит API для проверки текстов на наличие такой маркировки. При этом Anthropic признает, что механизм можно ослабить редактированием: небольшие изменения, вероятно, сохранят часть сигнала, а полное переписывание текста способно удалить его.



Релоцировались? Теперь вы можете комментировать без верификации аккаунта.