SpecMaskFoley は、映像を入力として、その内容に合った音を時間的に同期させながら生成するサウンド生成モデルである。名称の Foley は、映画やアニメーションで画面上の動作に合わせて効果音を後付けする「フォーリー」の作業を指し、その工程を機械学習モデルで自動化する試みにあたる。
雨や雑踏のような持続的な環境音だけでなく、グラスが落下して床に当たり割れるといった瞬間的な出来事に対しても、映像に合ったタイミングで音を生成できる。この同期は、映像から抽出した時間的な同期特徴量をモデルへ入力する構造によって実現されている。映像と音のずれは人間の知覚が特に敏感に検出するため、何を鳴らすかと同じくらい、いつ鳴らすかを制御できることがこの種のモデルの要点となる。
SpecMaskFoley は論文とデモページが公開されており、リアルタイムに映像から音を生成する仕組みのベースとしても用いられている。