サウンド生成モデルとは、与えられた条件に応じて音の波形やスペクトログラムを生成する機械学習モデルを指す。条件として与えられるものはテキスト、画像、映像、既存の音などさまざまで、あらかじめ録音された音源を再生するのではなく、条件に対応する音をその場で合成する点が特徴である。生成の対象は環境音や背景音のような持続的な音から、物が落ちて割れる瞬間のような単発的な出来事の音まで幅広い。映像を条件として、その内容に合う効果音を自動的に付ける用途は、映画制作で音を後付けする工程にならって「ニューラル・フォーリー」と呼ばれる。

映像から音を生成する場合の要点は、音の質だけでなく映像との時間的な同期である。そのため多くのモデルは、映像から抽出した時間方向の特徴量を条件として与え、出来事が起きたフレームと音の立ち上がりが一致するように学習される。評価にあたっては、音そのものの忠実度、映像との同期精度、聴取したときの自然さという複数の観点が用いられ、これらはしばしば互いに競合するため、用途に応じた釣り合いを取る調整が必要になる。

リアルタイムに動作する軽量なモデルは、インスタレーションやライブ映像と組み合わせる用途で重要になる。SpecMaskGIT はスペクトログラムを効率的に生成する構造として設計されたモデルで、それを土台に映像の特徴量を受け取れるようにしたものが SpecMaskFoley である。不規則にループし続ける映像に対して、決まった音を貼り合わせるのではなく毎回その場で音を生成する構成をとると、鑑賞者は完全には制御しきれない音の生成過程に立ち会うことになり、音を聴くという経験そのものが作品の主題になりうる。