Помните классические картинки-загадки, где первое увиденное якобы раскрывает ваш характер или ведущее полушарие? |
||
|
МЕНЮ Главная страница Поиск Регистрация на сайте Помощь проекту Архив новостей ТЕМЫ Новости ИИ Голосовой помощник Разработка ИИГородские сумасшедшие ИИ в медицине ИИ проекты Искусственные нейросети Искусственный интеллект Слежка за людьми Угроза ИИ Атаки на ИИ Внедрение ИИИИ теория Компьютерные науки Машинное обуч. (Ошибки) Машинное обучение Машинный перевод Нейронные сети начинающим Психология ИИ Реализация ИИ Реализация нейросетей Создание беспилотных авто Трезво про ИИ Философия ИИ Big data Работа разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика
Генетические алгоритмы Капсульные нейросети Основы нейронных сетей Промпты. Генеративные запросы Распознавание лиц Распознавание образов Распознавание речи Творчество ИИ Техническое зрение Чат-боты Авторизация |
2026-08-24 11:57 Помните классические картинки-загадки, где первое увиденное якобы раскрывает ваш характер или ведущее полушарие? Мы решили устроить такой же тест не человеку, а трансформеру. Взяли компактную и эффективную модель BLIP от Salesforce, которая разрезает изображение на фрагменты-патчи, превращает их в токены, а затем с помощью механизмов Self-Attention и Cross-Attention последовательно предсказывает слова описания. И вот что из этого вышло. Начнём с простого: картинка, где явно видны деревья и корни, а альтернативный вариант — губы — возникает только из-за формы. Модель уверенно выдала «дерево с корнями», полностью совпав с человеческим восприятием. Но дальше начались расхождения. На изображении, где человек видит крокодила, нейросеть неожиданно сообщила: «сине-черный силуэт мужской головы». Похоже, она зацепилась за линию и ушла не туда — в обучающей выборке было много неоновых графических рисунков, а форма челюсти рептилии оказалась упущена. Пятна сверху и снизу она пыталась интерпретировать как другие объекты. Ещё забавнее вышло, когда мы целенаправленно попытались обратить внимание модели на кораблик. Она его проигнорировала и выдала: «обложка книги, Книга мёртвых». Скорее всего, в датасете переизбыток обложек старых книг, а пятна на синем фоне модель восприняла как потрескавшийся рельеф. Классический же пример с силуэтом мужчины в шляпе и бородой она угадала, но вместо целостной картинки сфокусировалась только на левой стороне, а тёмно-фиолетовую ладью посчитала фоном. Приблизив изображение, чтобы «указать» на ладью, мы получили не менее интересный ответ: «силуэт мужчины с поднятыми руками». И ведь действительно, если присмотреться — что-то похожее есть. Особенно показательной стала история с котом на лестнице. Изначально модель ответила: «кот, спускающийся по лестнице». Обрезаем часть картинки — получаем «кот, поднимающийся по лестнице». Возвращаем стены с освещением — снова спуск. Разгадка оказалась в стенах: тёмные стены слева модель ассоциирует с подвалами, куда свет попадает сверху, а светлые — с квартирами, где в конце пути могут быть окна. Поэтому тёмная стена + светлый фон = спуск, светлая стена + светлый фон = подъём. Логика железная, хоть и нечеловеческая. Когда же мы спросили модель о цвете пресловутых кроссовок, она дипломатично ответила: «человек, держащий пару розово-зелёных ботинок», отказавшись присоединяться к какому-либо из лагерей. Что это значит? Нейросеть практически прошла тест, но увидела не то, что видим мы. Просто изменив контекст — обрезав кадр или приблизив объект — мы заставляем её противоречить самой себе и выдавать совершенно разные ответы. Теоретически, можно улучшить предсказуемость, расширив обучающую выборку и штрафуя модель за ошибки на трансформированных изображениях. Но есть риск: в погоне за деталями она потеряет способность к абстрактному мышлению, как в примере с деревом и губами. Так чего мы на самом деле хотим от ИИ — чтобы он мыслил как человек, или достаточно того, что он просто даёт ответ? Телеграм: t.me/ainewsline Источник: vk.com Комментарии: |
|