リアルタイムサウンド生成モデルとは、映像などの入力に応じて、再生に間に合う速度で音をその場から生成する機械学習モデルである。あらかじめ用意した音源を条件に合わせて選び出して鳴らすのではなく、入力の変化に応じてスペクトログラムや波形そのものを都度合成する点が、サンプル再生型の仕組みとの違いである。映像を条件とする場合は、内容を表す特徴量に加えて時間的な同期のための特徴量を与えることで、画面上の出来事と音のタイミングを一致させる。
環境音や背景音のような持続する音だけでなく、「グラスが落下して床に当たって割れる」といった瞬間的な事象にも、映像に同期したタイミングで応答できることが求められる。生成の速度と品質を両立させるため、マスク予測型の軽量な生成器が用いられることがあり、SpecMaskGIT をバックボーンとして映像特徴量の入力経路を加えた SpecMaskFoley 系のモデルがその例である。
不規則にループし続ける映像に対して、決まった音を同じように繰り返すのではなく、その都度生成した音を返す構成をとると、鑑賞者は人間には完全に制御しきれない音の生成過程に立ち会うことになり、音の知覚そのものへの問いが立ち上がる。制作にあたっては、モノレール車窓の実映像と車内で録音した環境音のペアデータを用いて学習が行われ、初期出力に見られた電子音的な不自然さや逆再生のような質感を避け、速度感や運動感を自然に捉える方向で調整が進められた。