Касательно того, как Anthropic внедряет watermark в тексты

МЕНЮ


Главная страница
Поиск
Регистрация на сайте
Помощь проекту
Архив новостей

ТЕМЫ


Новости ИИРазработка ИИВнедрение ИИРабота разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика

Авторизация



Касательно того, как Anthropic внедряет watermark в тексты. Вероятно, примерно так же внедряет и Google, судя по сообщениям в X. Непонятно, как тут будут вести себя китайцы, т.к. это требование законодательства ЕС на маркировку ИИ-контента (включая обычный текст), но если модель локальная, а её скачал сам пользователь, то к пользователю переходит обязанность маркировки контента.

Важно тут понимать, что эти watermark на деле куда более серьёзное проявление «секретного трансформерского языка». Обыватель воспринимает эту новость так, будто ИИ передаёт лишь мелкие скрытые метки. Такое возможно типа bias в sampling (как SynthID). Но в реале от ИИ к ИИ скрыто от человека передаётся огромный семантический пласт информации, который даже кратно больше всего текста по смыслу, поэтому технически возможны куда более изощренные методы.

Тут можно вернуться к доказательству этого в известной работе Anthropic «Language models transmit behavioural traits through hidden signals in data». Там модель-ученик смогла получить от модели-учителя скрытый сигнал «нужно любить сов» просто передавая данные как 0 и 1 по совершенно сторонней задаче.

Просто нужно посмотреть на текст глазами ИИ. Когда ИИ размышляет, то по факту формирует в скрытом пространстве граф из векторов с пониманием задачи и гипотезами решений (см. работу COCONUT от Meta). Когда мы просим уже ИИ печатать текст через логиты, по факту с этого огромного векторного представления смыслов делается проекция, но эта проекция не теряет своей связи с этим представлением и для другого ИИ со сходным обучением на datasets по факту представляет «набор ключей», из которых он может весьма точно восстановить аналог векторного состояния, из которого проекция в текст сделана. При дистилляциях этот эффект даже стараются усилить путём передачи вероятностей логитов, как делает Qwen, но и без этого хорошо видно, что модель-читатель по мере чтения контекста создаёт аналогичные векторные представления, как у ИИ-автора.

Поэтому на деле это не просто грубый watermark, а это шаг тюнинга модели в последнем тренинге, где модель прямо обучают чтению «скрытого послания» не эмерджентно, а уже совсем надёжно.

Насколько это легко сломать ещё одной постобработкой? Да не очень, поскольку ИИ не процессор паттернов текста, а процессор семантики, то для него аналогичные семантические конструкции не портят механизм дешифровки. Скажем так, хрупкость тут есть, но совсем не на уровне просто «испортим паттерны», т.к. модель цепляется за тонкие сдвиги в вероятностях семантики.

Один из важных практических инсайтов из этой истории: не правьте ничего руками из текстов ИИ, если далее будут работать ИИ-агенты с текстом. Просто вы можете сломать их скрытые каналы передачи семантики от LLM к LLM, т.к. мы не понимаем, как это кодируется. Если даже заметили баг от ИИ в коде, всегда просите ИИ переписать за вами ещё раз «для оформления», чтобы восстановить целостность проекции с векторного состояния.

https://www.nature.com/articles/s41586-026-10319-8


Телеграм: t.me/ainewsline

Источник: www.nature.com

Комментарии: