Google Research попыталась объяснить, откуда у diffusion-моделей берётся «креативность»

МЕНЮ


Главная страница
Поиск
Регистрация на сайте
Помощь проекту
Архив новостей

ТЕМЫ


Новости ИИРазработка ИИВнедрение ИИРабота разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика

Авторизация



Почему генератор изображений не просто копирует обучающие примеры, а создаёт новые сцены, которых не было в датасете?

Ответ оказался математическим.

Во время обучения нейросеть не запоминает идеальную функцию удаления шума. Из-за регуляризации и особенностей градиентного обучения она усваивает её более сглаженную версию. Google называет этот эффект score smoothing.

Если бы функция была идеальной, каждый случайный шум в конце превращался бы в точную копию одного из обучающих примеров.

Но сглаживание создаёт между примерами «зоны интерполяции». Модель может остановиться не на известной точке, а между несколькими знакомыми образами и получить новый, но правдоподобный результат.

В многомерном пространстве это помогает модели восстановить скрытый data manifold - область, где находятся осмысленные изображения. Движение к этой области сохраняется быстрым, а схлопывание к конкретным обучающим картинкам ослабевает. Так появляется баланс между качеством и новизной.

То есть «творчество» diffusion-модели может быть не загадочным свойством и не случайностью.

Это побочный эффект того, что нейросеть учится не идеально и строит мосты между известными примерами.

Работа представлена на ICLR 2026, код экспериментов опубликован открыто.

https://research.google/blog/towards-demystifying-the-creativity-of-diffusion-models/


Телеграм: t.me/ainewsline

Источник: research.google

Комментарии: