【技術相談】テキストと参照音源から新しい音を生成できるAIモデルってないの?
Ask HN: Are there AI models for generating sounds based on a text and reference?
Ask HN: Are there AI models for generating sounds based on a text and reference?
なかなか良さそうな解決策が見つからず困っています。テキストでの指示と参照用の音源を入力して、新しいサウンドを出力してくれるような商用AIモデルは本当に存在しないのでしょうか?現在、マルチモーダル入力による画像やテキスト生成は、すでに解決済みのコモディティ化された技術です。例えば、プロンプトと参照画像を組み合わせて狙った画像を生成することは当たり前にできますよね。「百聞は一見にしかず」という言葉通りです。また、音声とテキストを入力してテキストの要約や分類を行うツールも使ってきました。しかし、どうしても「オーディオ+テキスト→オーディオ」という変換を実現するソリューションが見つかりません。今回の私のユースケースは、クリーンなサンプルが少ない音源をソースにして、新しい効果音を生成することです。これくらいなら、すぐに実現できるワークフローだと思っていたのですが、期待外れでした。ElevenLabsのSFXも試しましたが、あれはテキストからの生成に限定されており、参照音源がないため、テキストだけで音を正確に再現するのは困難です。また、Stable Audio 3も試してみましたが、結果は散々でした。この分野の技術水準は、画像生成における2016年頃で止まっているような印象を受けます。何か他に良い選択肢はないのでしょうか?それとも、これはあまり需要のない領域なのでしょうか?
テキストとオーディオを入力してオーディオを出力するモデルはたくさんあるよ。最近のアクセント変換やボイスクローニングモデルの多くはそんな形式だし。で、具体的にどんな用途で使いたいの?
的外れかもしれないけど、画像生成モデルを使ってスペクトログラム画像を加工するのってどうなのかな?それなら、入力音声をスペクトログラムに変換して、スペクトログラムとプロンプトを画像モデルに渡して、加工後のスペクトログラムを波形に戻すっていうワークアラウンドが使えそうじゃない?