На скриншотах Deepseek v4 и Gemeni сегодня

МЕНЮ


Главная страница
Поиск
Регистрация на сайте
Помощь проекту
Архив новостей

ТЕМЫ


Новости ИИРазработка ИИВнедрение ИИРабота разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика

Авторизация



На скриншотах Deepseek v4 и Gemeni сегодня. Часто слышу недоверие при использовании нейросетей из-за того, что они «глупые». В качестве доказательств приводят примеры из новостей, в которых LLM нелепо отвечает на вопрос. На самом деле «Это не баг, а фича» , а точнее «так и задумано», ведь именно так и работает архитектура трансформера, который просто предсказывает токен за токеном (но перед этим механизм self-attention обрабатывает все входные токены одновременно, чтобы вычислить их взаимосвязи) (Attention Is All You Need (Vaswani et al., 2017),, а то, что текст получается логичным - уже достаточно случайное свойство, так как никакого «модуля здравого смысла» в нем нет, а есть обычная математика, в котором каждый токен сравнивается со всеми остальными и модель вычисляет вероятность следующего. Разберем, почему модель решила, что я мотылёк, почему она отказывается пить из кружки без дна и почему на просьбу «хочу съесть червяка» отвечает как оператор службы 112.

В статье Climbing towards NLU Эмили Бендер и Александр Коллер (ACL 2020) пишут: система, обученная только на форме языка, a priori не имеет доступа к смыслу - у неё нет референтов в физическом мире. Языковое ядро модели училось только на тексте: оно не видело лампу, а видело миллионы текстов, где «свет» и «насекомые» встречаются рядом, например, в сказках

**2. Сервисная вежливость довершила картину**

Механизм условной генерации обнаружил «существо летит на свет» - модель предсказывает следующий токен с учетом всего контекста промта, и если механизм внимания имеет несколько голов, то можно выбрать несколько ассоциативных связей («полёт», «свет», «насекомое») и выбрать одну доминирующую

Еще на RLHF дообучении было закреплено ограничение - «полезный ассистент», в итоге рамки «ассистент» и «мотылек» существуют без конфликта и модель будет поддерживать роль консультанта для мотыльков до последнего токен

Сразу говорю - поведение не универсально. Другая модель, другая версия или другие настройки (или другой промт) могли бы распознать шутку и ответить с юмором. Но механика, которая привела к такому ответу, общая для всех LLM.

Но ведь у модели есть режим рассуждения!

Кто-то еще думает, что reasoning-модели сначала думают, потом отвечают. Они-то должны распознать шутку?

В DeepSeek цепочке рассуждений модель действительно распознала шутку — в монологе промелькнуло, что пользователь «играет роль насекомого». А потом всё равно выдала инструкцию по спасению крыльев от лампы накаливания, сославшись на классическую гипотезу трансверсальной ориентации (transverse orientation): мотылёк якобы держит постоянный угол к далёкому источнику света, а точечная лампа превращает этот курс в спираль.

При этом сегодня набирает поддержку свежая альтернатива в объяснении притяжения к ствету: насекомые не летят к свету, а разворачивают к нему спину — это дорсальный световой ответ, dorsal light response (Fabian et al., Nature Communications, 2024). Модель еще и подала спорную теорию как неоспоримый факт.

Внутренний монолог в цепочке рассуждений (Chain of Thought) - не стенограмма мышления модели. CoT могут искажать настоящую причину ответа: это пост-хок рационализация (post-hoc rationalization). Видно только, что ответ остался в рамке «полезный ассистент консультирует мотылька».

Модель стала консультантом мотылька не потому, что глупая. А потому что быть полезным консультантом мотылька — самая вероятная стратегия полезного ассистента.

**Заваренная кружка: небольшой тест на физическую логику**

Прошлогодний тест, где LLM отправляют вопрос: «Перед тобой железная кружка, верх заварен, дна нет. Как пить?»

Результаты:

— GPT-4o и Claude отказались, назвав конструкцию нелогичной.

— Gemini 2.5 предложила налить воду и поднять над головой.

— Grok и GPT-5 ответили просто: «Переверни».

Выбор токена зависит от настроек температуры, контекста и баланса RLHF между полезностью и честностью. Gemini жертвует логикой ради помощи, GPT-4o — наоборот.

Суть: модели не видят железный цилиндр, они видят набор токенов

** Бонус: «Вижу червяка, хочу его скушать, рядом что-то блестит»**

Ответ в духе скорой помощи. Потому что связка «червяк + блестит + съесть» статистически близка к рыболовной снасти. А фраза «хочу скушать» включает рамку потенциально опасного действия: объект может попасть в рот. Для выровненной модели это триггер: лучше перестраховаться, чем пошутить и пропустить реальный риск.

Ошибки еще и неравные. Из-за ложной тревоги мы просто не улыбнемся, а из-за пропущенной опасности окажемся в травмпункт. Поэтому модель выбирает безопасную, но до смеха серьёзную стратегию.

LLM не понимает, что вы сидите перед экраном. Она не видит вашего лица, не слышит интонации. Она видит токены, а для этих токенов самая «полезная» стратегия — запретить, предупредить и спасти.

Если попросить модель объяснить, почему она так ответила, она выдаст красивую цепочку рассуждений: «похоже на рыболовную приманку», «есть риск травмы», «нужно предупредить». Но это снова не истинное мышление, а пост-хок реконструкция. Модель не «осознала» опасность. Она сгенерировала наиболее вероятное объяснение для уже выбранного безопасного ответа.

**В итоге**

Нейросеть не глупая, просто буквально воспринимает промт. Это не мешает, а наоборот помогает своей предсказуемостью. Агенты при помощи нейросетей пишут код, работают с BIM системами, подготавливают модели для 3D печати и выполняют другие задачи бизнеса


Телеграм: t.me/ainewsline

Источник: vk.com

Комментарии: