Diffusion Model Creativity
Diffusion model 的「創造力」可以理解成一個可分析的 interpolation effect,而不只是模型偶然產生新樣本。Google Research 的研究主張,neural network 學到的 score function 不是完美尖銳的訓練資料檢索器;regularization 造成的 score smoothing 讓 denoising 過程在資料點之間形成平滑區域,進而沿著隱藏的 data manifold 產生新而合理的樣本。
從 memorization 到 interpolation
Diffusion model 先把訓練資料加噪,再逐步反向 denoise。若 score function 完美重現訓練資料,噪聲粒子最後會塌縮到既有資料點,結果接近 memorization。研究用一維的 +1 與 -1 示範:理想 score function 在兩點之間有陡峭的方向切換;實際 neural network 受到 weight decay 或 gradient-based training 的 implicit regularization 影響,較難學出這種尖峰,因此學到較平滑的函數。
平滑後,中間區域的粒子流速變慢,部分粒子會停留在兩個訓練點之間的 interpolation zone。這提供一個機制層的解釋:模型不是憑空「想像」新資料,而是在學到的資料幾何結構上,保留通往 manifold 的方向,同時降低沿著 manifold 切線方向直接複製訓練點的傾向。
這和 test-time-memorization 是不同層級的問題。Test-time memorization 關心模型運行時要不要把新資訊寫入長期記憶;本研究關心生成模型如何在訓練後從既有樣本產生非記憶式的新樣本。兩者共同提醒:看到「模型記住」或「模型創造」的產品敘事時,應先分辨是記憶更新、retrieval,還是生成分布中的插值與泛化。
Quality 與 novelty 的平衡
在高維影像或分子資料中,大部分 pixel space 是無意義的噪聲,真正可辨識的資料位於低維的 data manifold。研究指出 score smoothing 的方向性效果有助於平衡品質與新穎性:朝向 manifold 的方向不應被過度平滑,否則輸出會變模糊;沿 manifold 切線方向則可以降低對訓練點的塌縮,讓模型探索原始樣本之間的空白區域。
因此,評估 diffusion model 不應只問輸出是否「像訓練資料」,也要分開檢查:
- 品質:輸出是否仍位於有意義的資料 manifold 上。
- 新穎性:輸出是否只是訓練樣本的複製,或落在合理的插值區域。
- 穩定性:改變 regularization、架構或資料分布後,quality / novelty trade-off 是否仍成立。
這個評估觀點可與 test-time-compute-evaluation 對照:後者要求把模型表現放進推論預算曲線;本概念則要求把生成品質放進 memorization、novelty 與 manifold recovery 的多維判準,而不是用單一偏好分數代表「創造力」。若生成結果要進入產品,還要像 generative-ui 一樣把模型輸出、harness 與後處理的限制分開驗證。
限制與 AI Ark 判準
這項結果是針對特定理論與實驗設定的初步工作。研究也指出,當資料分布或 neural network architecture 更複雜時,score smoothing 是否仍以相同方式運作,仍需要更多驗證;因此不能直接把「diffusion model 會插值」推成所有生成模型或所有資料集的保證。
Ponytail 判準:不要先把 creative generation 當成神祕的 agent 能力,也不要先加一套複雜的 originality detector。先用訓練樣本近鄰檢查、資料 manifold 的品質指標與人工/任務型評估,確認真正的問題是複製、模糊,還是合理的新組合;只有在重複出現的產品場景需要更嚴格的 novelty gate 時,才增加專用評測。