Почему нейросети сначала не умели рисовать именно руки

МЕНЮ


Главная страница
Поиск
Регистрация на сайте
Помощь проекту
Архив новостей

ТЕМЫ


Новости ИИРазработка ИИВнедрение ИИРабота разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика

Авторизация



Во-первых, руки — это очень сложная конструкция. Куча костей, суставов, связок, и всё это может гнуться десятками разных способов. Плюс пальцы могут перекрывать друг друга, менять ракурс, отбрасывать тени.

Для нейросети это как шизанутая головоломка: надо одновременно держать в консервной нейро голове кучу деталей и правильно их складывать.

Во-вторых, в данных, на которых учились первые модели, руки часто были не в фокусе. В интернете миллионы фоток — но сколько из них крупные планы именно кистей? Чаще руки где-то сбоку, в тени, в перчатках, частично закрыты.

Получается, нейросеть видела руки в основном мельком, в неудобных ракурсах и с плохой детализацией. А если ты учишься по картинкам, где руки почти не видно, то и рисовать их будешь так же — «примерно».

Ещё один момент: разметка данных (то есть когда люди вручную подписывают, где на фото рука, где пальцы) для рук — это адски трудоёмко.

Пальцы мелкие, перекрываются, ракурс меняется — и даже человеку не всегда просто аккуратно обвести каждый сустав. Поэтому датасеты с качественной разметкой рук были редкостью, а без них нейросеть не понимает, чему именно учиться.

Плюс сама математика генерации работает «от общего к частному». Сначала рисуется силуэт, потом добавляются детали. Руки — это как раз те самые мелкие детали, которые появляются в самом конце.

Если модель ещё не очень умная, она на финальном шаге просто «додумывает» недостающее по памяти, а память у неё была так себе. Отсюда и лишние пальцы, и странные изгибы — нейросеть буквально фантазировала, потому что не знала, как правильно.

И наконец, оценка качества тоже подводила. Раньше метрики (цифры, по которым понимают, хорошая картинка или нет) смотрели на общее сходство: цвета, композицию, узнаваемость. Никто не считал отдельно «сколько пальцев на руке». Поэтому модель могла получать «пятёрку» за картинку, даже если руки там были с дефектами — ведь остальное выглядело неплохо.

Сейчас ситуация сильно лучше: нейросети учатся на более качественных и размеченных датасетах, используют дополнительные подсказки (например, отдельные модели для рук) и лучше понимают анатомию.

Но если покопаться в старых работах, эти «пластилиновые» руки — прямо уродливая визитная карточка первых генеративных моделей.


Телеграм: t.me/ainewsline

Источник: vk.com

Комментарии: