Anthropic раскрыла принцип работы невидимого водяного знака, который компания внедряет в ответы Claude. Маркировка помогает определять созданные с помощью ИИ тексты, остается незаметной для пользователя и не влияет на скорость или качество генерации. Технология базируется на SynthID-Text от Google DeepMind.
Механизм работает на уровне выбора слов: когда у модели есть несколько близких по смыслу вариантов, алгоритм определяет один из них с помощью секретного ключа и контекста предыдущих слов. Благодаря этому в тексте формируется статистический шаблон, и распознать его без соответствующего ключа невозможно.
Claude не добавляет в ответы скрытые символы, специальные токены или другие дополнительные элементы. Метка не содержит сведений о пользователе и не позволяет установить создателя текста.
Чем короче текст, тем сложнее обнаружить маркировку. Ее почти не видно, когда модель обязана выбрать единственно правильный вариант – например, в точных фактических данных или программном коде. При масштабном редактировании или написании текста нейросетью метка становится заметнее.
Anthropic объясняет внедрение технологии требованиями европейского AI Act. Маркировка будет применяться по всему миру, а инструмент для её обнаружения компания планирует предоставить через отдельный API.
Комментарии