動画生成AIの革命児!Flux 3 × Mimicで実現する次世代ビデオアクションモデルとは?
Flux 3 X Mimic: The Next Generation of Video-Action Models
Flux 3 X Mimic: The Next Generation of Video-Action Models
動画生成AIの最前線に大きな動きがありました。「Flux 3」と「Mimic」がタッグを組むことで、動画生成におけるアクション(動作)の表現力が飛躍的に向上しました。これまでの生成AIでは難しかった精緻な動きや一貫性のある映像生成が、次世代のモデルによっていよいよ本格化しそうです。AIクリエイターやエンジニアにとって、見逃せない進化がここにあります。
ヨーロッパのスタートアップ同士のパートナーシップは見ていて嬉しいね。
かなり面白い。要するに、十分に学習されたマルチモーダルな動画生成モデルには、内部に世界表現モデルが学習されているってことだよね。彼らはこの世界モデルをうまく取り出してロボットに応用していて、それがかなり上手くいっているみたいだ。
一方で、これは新しいアイデアというわけじゃないし、高品質な動画モデルが素材や光、世界を(オッカムの剃刀的な意味で)ある程度理解しているのは確かだよ。でも、動画ラボがロボットラボに転身した例はまだ知らないな。もしかするとこれが初のケース、あるいは後から振り返れば当然だと思える新しいビジネスパスになるかもしれないね。動画モデルを学習させ、動画生成を売ってスケールさせ、そのスケールを使ってロボットを学習させる。そして利益を得るというわけだ。
彼らのハンドの動きはすごく興味深かった。グローブの中にいろいろ仕込んでいるみたいに見えるね。XiamiのRobotics-1基盤モデルでも、ユーザーが標準的なグリッパーを使って学習する動画が公開されていたけど、あれは学習用にグリッパー型のグローブを装着して動画を撮っていたくらいだし。
BFLのモデルは、そういうのが一切不要に見えるのがすごい。ハードウェアの難易度を考えると、彼らがこれで何をするのか楽しみだね。
動画の3分30秒あたりで、ロボットアームが窓枠の調整を3回やり直すシーンがあるんだけど、あれはかなりゾッとしたよ。あんなふうに自己解決しているのは初めて見た。これって新しいことなのか、それとも俺が時代に乗り遅れているだけ?
素晴らしい成果だ。
で、Zugló(ブダペストの地区)のロボットはいつ来るの?
いや、この言い回しはちょっと…
ただし、表現学習のより専門的なアプローチと比較すると、それらは「非絡み合い(disentangled)」の度合いが低い表現を生成するため、世界理解を必要とするタスクにおいて有用性に上限が生じる。
「非絡み合いの度合いが低い表現(less disentangled representations)」という言葉が、現実世界でなぜ「非絡み合いの度合いが低い表現」が現実世界のモデル化に役に立たないのかを説明する文脈で使われるのは、まさにLLMならではだよね。
これが未来。いや、すでに現在でもあるな。
もしソフトウェア開発やエンジニアリングの世界以外に知り合いがいたら、ぜひこれを教えてあげてほしい。
OpenAIがSoraの影で泣いてるな。
生産手段を所有していない限り、人間の価値がますます低くなるという危機に真っ向から突っ込んでいるよ。友よ、暗い時代が待っているな。
これは素晴らしい。
悲しいのは、これだけすごい技術があるのに、映画はこれまでになくひどくなっていることだ。
普段はまともな作品を見つけるために何十年も前の映画を見ているんだけど、チープなパペットを使っていた昔のほうがストーリーテリングは1000倍も良かったというのは本当に驚きだよ。
関係ない愚痴でごめん。