Ученые Google раскрыли механизм «творчества» диффузионных моделей, которые генерируют изображения, молекулы и другой сложный контент. Понимание этого процесса важно для демистификации генеративного искусственного интеллекта.
Диффузионные модели обучаются, добавляя шум к реальным данным, например, фотографиям, до полной потери их узнаваемости. Затем модель учится шаг за шагом восстанавливать изображение из шума. Если бы модель идеально запоминала обучающие примеры, она бы действовала как инструмент поиска, а не генератор.
Вместо этого модели часто создают новые, ранее не встречавшиеся данные. Этот эффект, известный как обобщение, лежит в основе их «креативности». Исследователи сравнивают процесс шумоподавления с полем сил, направляющим частицы данных из состояния шума к осмысленным формам.
«Креативность» моделей является математическим следствием обучения нейронных сетей. В процессе тренировки нейронные сети естественным образом «сглаживают» функцию, управляющую процессом шумоподавления. Этот эффект, называемый «сглаживанием функции оценки» (score smoothing), приводит к интерполяции между обучающими точками данных, а не к их простому воспроизведению.
На конференции ICLR 2026 ученые продемонстрировали это на примере одномерного пространства. «Идеальная» функция оценки, обученная на двух точках (+1 и -1), имела бы резкий перепад, заставляя все точки сходиться к одной из исходных. Однако нейронные сети, благодаря механизмам регуляризации, учатся более гладкой версии этой функции. Это создает «зону интерполяции» между обучающими точками, позволяя генерировать новые, правдоподобные данные.
Исследователи также показали, что даже без явной регуляризации, неявные эффекты при обучении нейронных сетей градиентными алгоритмами могут приводить к такому же сглаживанию. Это открытие помогает лучше понять, как диффузионные модели достигают своей способности к генерации нового контента.