SpecMaskGIT は、音のスペクトログラムを対象とするマスク生成型のサウンド生成モデルである。名称は、スペクトログラム(Spec)に、画像生成で用いられるマスク生成トランスフォーマー(MaskGIT)の手法を適用したことに由来する。音を時系列に沿って一点ずつ生成するのではなく、離散トークン化したスペクトログラムの一部を隠して残りから推定し、これを数回反復して全体を埋めるため、少ない反復回数で生成が完了する。この並列的な復元手順が、高品質と軽量性を両立させ、リアルタイム生成を可能にしている。
SpecMaskGIT は、映像に同期した効果音を生成する SpecMaskFoley のバックボーンとして用いられている。SpecMaskFoley では、この土台に映像の特徴量を入力できる構造が追加され、映像の内容とタイミングに応じた音がその場で生成される。
あらかじめ録音した音を映像に合わせてループさせる従来の手法と異なり、その都度音が生成される構成では、不規則に変化し続ける映像に対しても音が追従する。鑑賞者は人間が完全には制御しきれない音の生成過程に立ち会うことになり、音の知覚そのものが問い直される。