Помните классические картинки-загадки, где первое увиденное якобы раскрывает ваш характер или ведущее полушарие?

МЕНЮ


Главная страница
Поиск
Регистрация на сайте
Помощь проекту
Архив новостей

ТЕМЫ


Новости ИИРазработка ИИВнедрение ИИРабота разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика

Авторизация



Помните классические картинки-загадки, где первое увиденное якобы раскрывает ваш характер или ведущее полушарие? Мы решили устроить такой же тест не человеку, а трансформеру. Взяли компактную и эффективную модель BLIP от Salesforce, которая разрезает изображение на фрагменты-патчи, превращает их в токены, а затем с помощью механизмов Self-Attention и Cross-Attention последовательно предсказывает слова описания. И вот что из этого вышло.

Начнём с простого: картинка, где явно видны деревья и корни, а альтернативный вариант — губы — возникает только из-за формы. Модель уверенно выдала «дерево с корнями», полностью совпав с человеческим восприятием. Но дальше начались расхождения. На изображении, где человек видит крокодила, нейросеть неожиданно сообщила: «сине-черный силуэт мужской головы». Похоже, она зацепилась за линию и ушла не туда — в обучающей выборке было много неоновых графических рисунков, а форма челюсти рептилии оказалась упущена. Пятна сверху и снизу она пыталась интерпретировать как другие объекты.

Ещё забавнее вышло, когда мы целенаправленно попытались обратить внимание модели на кораблик. Она его проигнорировала и выдала: «обложка книги, Книга мёртвых». Скорее всего, в датасете переизбыток обложек старых книг, а пятна на синем фоне модель восприняла как потрескавшийся рельеф. Классический же пример с силуэтом мужчины в шляпе и бородой она угадала, но вместо целостной картинки сфокусировалась только на левой стороне, а тёмно-фиолетовую ладью посчитала фоном. Приблизив изображение, чтобы «указать» на ладью, мы получили не менее интересный ответ: «силуэт мужчины с поднятыми руками». И ведь действительно, если присмотреться — что-то похожее есть.

Особенно показательной стала история с котом на лестнице. Изначально модель ответила: «кот, спускающийся по лестнице». Обрезаем часть картинки — получаем «кот, поднимающийся по лестнице». Возвращаем стены с освещением — снова спуск. Разгадка оказалась в стенах: тёмные стены слева модель ассоциирует с подвалами, куда свет попадает сверху, а светлые — с квартирами, где в конце пути могут быть окна. Поэтому тёмная стена + светлый фон = спуск, светлая стена + светлый фон = подъём. Логика железная, хоть и нечеловеческая.

Когда же мы спросили модель о цвете пресловутых кроссовок, она дипломатично ответила: «человек, держащий пару розово-зелёных ботинок», отказавшись присоединяться к какому-либо из лагерей.

Что это значит? Нейросеть практически прошла тест, но увидела не то, что видим мы. Просто изменив контекст — обрезав кадр или приблизив объект — мы заставляем её противоречить самой себе и выдавать совершенно разные ответы. Теоретически, можно улучшить предсказуемость, расширив обучающую выборку и штрафуя модель за ошибки на трансформированных изображениях. Но есть риск: в погоне за деталями она потеряет способность к абстрактному мышлению, как в примере с деревом и губами. Так чего мы на самом деле хотим от ИИ — чтобы он мыслил как человек, или достаточно того, что он просто даёт ответ?


Телеграм: t.me/ainewsline

Источник: vk.com

Комментарии: