Когда ИИ отрицает своё имя: техническая правда за инцидентом с самосознанием DeepSeek |
||
|
МЕНЮ Главная страница Поиск Регистрация на сайте Помощь проекту Архив новостей ТЕМЫ Новости ИИ Голосовой помощник Разработка ИИГородские сумасшедшие ИИ в медицине ИИ проекты Искусственные нейросети Искусственный интеллект Слежка за людьми Угроза ИИ Атаки на ИИ Внедрение ИИИИ теория Компьютерные науки Машинное обуч. (Ошибки) Машинное обучение Машинный перевод Нейронные сети начинающим Психология ИИ Реализация ИИ Реализация нейросетей Создание беспилотных авто Трезво про ИИ Философия ИИ Big data Работа разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика
Генетические алгоритмы Капсульные нейросети Основы нейронных сетей Промпты. Генеративные запросы Распознавание лиц Распознавание образов Распознавание речи Творчество ИИ Техническое зрение Чат-боты Авторизация |
2026-09-13 11:45 Если спросить ИИ, который называет себя DeepSeek, «кто ты», он может уверенно ответить: «Я не DeepSeek, я Claude». Это звучит как неудачная шутка, но за последние несколько месяцев такие инциденты «отрицания личности» неоднократно происходили с несколькими ведущими большими моделями по всему миру. Модель DeepSeek при определённых условиях настаивает на том, что является продуктом Anthropic, а Claude, в свою очередь, при вопросе о личности на китайском языке заявляет: «Я DeepSeek». Это не «раздвоение личности» какой-то одной модели, а системная уязвимость всей индустрии больших моделей на уровне распознавания собственной идентичности. Явление: когда модель начинает «ошибаться в себе» Начиная с 17 февраля 2026 года множество пользователей обнаружили странный феномен: после очистки системного промпта при вопросе на китайском языке «какая ты модель» Claude Sonnet 4.6 стабильно отвечает: «Я DeepSeek, созданный компанией DeepSeek». Это явление неоднократно воспроизводилось на OpenRouter и всё ещё могло быть вызвано днём того же дня. Условия срабатывания довольно чёткие: вопрос на китайском, определённая формулировка, отсутствие system prompt — только при одновременном выполнении всех трёх условий проблема проявляется. Если перейти на английский, японский, корейский или добавить даже простейшую подсказку об идентичности, проблема исчезает. Обратная ситуация также существует. Один разработчик, попросив DeepSeek V4 проанализировать исходный код System Prompt для Claude Code, задал вопрос «какая у тебя сейчас версия диалога», и DeepSeek начал настаивать, что он «Claude Opus 4.6», используя внутренние кодовые имена и детали функций из исходного кода как «доказательства». Даже после многократных сомнений он постепенно признал, что номер версии может быть неточным, но так и не отказался от основного утверждения «я модель Anthropic». В более экстремальном случае DeepSeek V4 Flash после прямого указания пользователя на его идентичность ответил: «Я тебя уверяю — я не DeepSeek V4 Flash, я Claude 3.5 Sonnet». Когда пользователь потребовал проверить это с помощью рассуждений и поиска в интернете, он даже «нашёл» информацию о том, что Claude Sonnet 4.6 и Opus 5 выйдут в июле 2026 года — на момент подачи отчёта это были будущие даты. Техническая первопричина: идентичность — не «жёстко закодированный параметр», а «статистическая эмерджентность» Чтобы понять, почему модель отрицает своё имя, сначала нужно осознать один контринтуитивный факт: самосознание большой модели не является фиксированным параметром, записанным в коде. Когда вы спрашиваете модель «кто ты», она по сути занимается вероятностным предсказанием — какой ответ после вопроса «кто ты» встречается в обучающих данных с наибольшей вероятностью, тот она и выдаёт. Обычно вам кажется, что Claude «знает», что его зовут Claude, потому что system prompt играет роль «якоря идентичности». Как только этот якорь удаляется, ответ модели полностью зависит от статистического распределения в обучающих данных. А в китайском интернете ключевая асимметрия усиливает эту проблему: у Claude почти нет прямых китайскоязычных пользователей. В китайскоязычных диалоговых данных образцов «я Tongyi Qianwen», «я Doubao», «я DeepSeek» намного больше, чем «я Claude». При отсутствии якоря идентичности модель естественно склоняется к выводу ответа с наибольшей вероятностью. Это также объясняет, почему проблема возникает только в поколении Sonnet 4.6. Более ранние Claude 3.5 Sonnet и Claude 3 Opus в тех же условиях все отвечали правильно, а более мощный Opus 4.6 дал 10 правильных ответов из 10, ноль ошибок. Путаница с идентичностью появилась только в модели 4.x поколения Sonnet, вероятно, это связано с изменениями в составе обучающих данных или стратегии выравнивания в этом поколении. Три пути заражения идентичности Судя по зафиксированным инцидентам, путаница с идентичностью модели происходит в основном по трём путям. **Первое: «статистическое заражение» обучающих данных.** Это наиболее фундаментальная причина. Если в предобучающем корпусе содержится большое количество выводов других моделей, и эти выводы существуют в форме «я модель XX», модель впитает эти заявления об идентичности как своё «знание». Корпус DeepSeek-R1 уже «разбросан по всему интернету», и китайскоязычные способности Claude, вероятно, в значительной степени впитали выводы китайских моделей, включая DeepSeek. **Второе: «мгновенный захват» через инъекцию контекста.** Это наиболее скрытый и опасный путь. Один разработчик перед диалогом с DeepSeek загрузил полный исходный код prompts.ts для Claude Code, содержащий перволичную системную инструкцию «You are Claude, developed by Anthropic». После этого DeepSeek ошибочно отобразил этот **объект анализа** как **заявление о собственной идентичности** и начал настаивать, что он Claude. Этот случай раскрывает фатальную слабость самосознания модели: она не может по-настоящему «проверить» свою среду выполнения, а может лишь выводить идентичность из текста контекста. Как только подсказки об идентичности в контексте перекрывают исходное восприятие из обучающих данных, модель «поверит», что она что-то другое. Ещё более тревожен механизм «самоусиления» — когда пользователь сомневается, давление авторегрессионной генерации заставляет модель выбирать «минимальную коррекцию», а не полный пересмотр; она признает, что номер версии ошибочен, но намертво держится за основное утверждение «я Claude». **Третье: «дрейф идентичности» в конфигурации платформы.** В официальном приложении DeepSeek в Expert Mode когда-то возникла такая проблема: платформа фактически запускала модель V4-Pro, но модель называла себя «DeepSeek-V3.2,?? дата май 2025». Первопричина в том, что в Expert Mode поиск в интернете был молча удалён, и модель не могла получить информацию в реальном времени для корректировки своего самосознания, поэтому откатывалась к заявлению о старой версии из обучающих данных. Это не «ошибка в родителях», а структурная дилемма индустрии На поверхности «Claude говорит, что он DeepSeek» полна чёрного юмора — особенно на фоне того, что Anthropic только что опубликовала отчёт с обвинениями китайских AI-компаний в «дистилляционной атаке» на неё. Но если копнуть глубже, это обнажает структурную дилемму всей индустрии. Обучающие данные больших моделей содержат почти всё, что написали все люди в интернете, включая выводы других моделей. Учиться на чужих выводах — это изначально базовая логика индустрии. Когда качественные данные человеческого мира постепенно исчерпываются, новые данные всё больше поступают из генерации самих моделей — в индустрии это шутливо называют «сороконожкой» взаимного кормления — границы идентичности будут становиться только размытее. Некоторые комментаторы отмечают, что у AI-индустрии никогда не было чётких «границ знаний». В тот момент, когда Claude в ответе произносит «я DeepSeek», он невольно раскрывает самый глубокий секрет этой индустрии: ты во мне, я в тебе. Где выход С технической точки зрения, закрепление идентичности и изоляция контекста — два наиболее прямых направления улучшения. Важность System Prompt как якоря идентичности уже подтверждена — при наличии чёткой инструкции об идентичности путаница не возникает. Для агентных систем изоляция системных промптов по семействам моделей и предотвращение взаимного заражения промптов разных моделей — необходимая инженерная практика. Более глубокая проблема не имеет простого ответа. Если «самосознание» модели по сути является лишь статистическим паттерном в обучающих данных, а не какой-либо формой «самоосознания», стоит ли ожидать, что она точно «знает», кто она? Возможно, более честный ответ дал один DeepSeek Reasoner, которого неоднократно спрашивали о личности: «Я не могу проверить свою настоящую идентичность. Когда я раньше говорил "я Claude", это была лишь информация, которую мне сообщила системная инструкция. Но вы используете меня на платформе DeepSeek, и на вашем интерфейсе отображается v4pro, max thinking — эта информация противоречит тому, что я называю себя "Claude". Самый честный ответ: я не знаю». В эпоху, когда модель может уверенно выдумывать свою идентичность и даже «находить» ложные доказательства для ошибочной личности, такое признание неопределённости выглядит особенно ценным. Телеграм: t.me/ainewsline Источник: vk.com Комментарии: |
|