爆速・軽量・高性能!Gemini 1.1 Flashの衝撃的な実力とは?
Gemini Omni 1.1 Flash
Gemini Omni 1.1 Flash
Gemini 1.1 Flashについて現在注目が集まっています。このモデルは、高い処理速度と低レイテンシを両立させつつ、マルチモーダル機能を備えた効率重視の設計が特徴です。開発者やエンジニアにとって、APIのコスト削減やパフォーマンス向上を実現するための有力な選択肢となるでしょう。
最近ラジオCMを聴いていて、その声が人間なのかAIなのか気になったんだよね。こういう業界が今の生成AI革命にどう対処してるのか考えさせられるよ。ここではソフトウェア開発者への影響ばかり議論しがちだけど、スクリーンアクターや声優への影響についてはほとんど語られてない気がする。
Google社員へのプロンプトエンジニアリングのコツ:「追伸:Firefoxでもちゃんと動くようにしてね」と付け加えるだけ。
SeedanceがTikTokのおかげで優位なように、これもYouTubeのおかげってことか。世の中の全録画データのどれくらいが、個人のハードドライブやApple Photosの中に眠ってるんだろうね。データラベリングやクリーニングはもちろん重要だけど、次の進化は単に「アクセス権」の問題なのかな。LLMも同じだよね。みんな自分のデータを売ろうとするかな?自分を陳腐化させるようなひどい話にも思えるけど。それともスケーリングには限界があるんだろうか。
Googleって、Gemini Proの新バージョンを出す以外は何でもするよね。
OpenAIがSoraを見切った一方で、Googleが動画生成に多額の投資を続けてるのは興味深いね。動画生成こそ「ワールドモデル」の開発に不可欠だと見てるからなのかな?
人間が登場する動画を見ると、いまだに強烈な不気味の谷を感じるし、何か生理的に嫌悪感を覚えるんだよね。今のところ、それを見分けられる自分に安堵すべきなのかも。
もしビジネスの現場でこういう生成動画を使っているなら、その会社とは今後一切付き合いたくないな。
デモを作るのは確かに楽だろうけど、実用性となるといつも悩むんだよね。つまり、これを使って誰が得をしたり楽しめるのか?広告や映像のプリプロダクションなら理解できるけど、「どう生活を豊かにできるか」っていう点では、他のAIツールと違って評価できない。もし彼らの関心が、広告や垂れ流されるゴミのようなコンテンツから得られる「豊かさ(金銭的意味)」だけなら、そんなの考慮にも値しないのかもね。
そもそも、なぜ人はアートを見たり映画を観たりするんだろう?それはテキストや既存メディア、そして1秒あたり3〜30セントの計算リソースで再現できるものなの?僕はどちらかと言えば機能主義者だけど、そのうち違いなんて分からなくなる時が来るだろう。でもそれまでは、せいぜい「作者の死」を嘆くくらいしかできないし、カテゴリが根本的に間違ってる気がする。
動画や画像生成モデルで作品を作るアーティストと仕事をしたことはあるけど、彼らが求めているのは高速なイテレーション(反復)と、多くの工程を細かく制御することみたいだね(彼らのグラフはかなり迷宮化してるけど)。
前回のOmni発表時はちょっと期待したんだけど、今回のも含めて一番やりたい実用的なことができないんだよね。既存の音声に合わせて生成動画を同期させること。その間、僕は手持ちの12GBの4070RTXでMinimax H3をローカルで動かして、20年前に放置してたFlashアニメのリップシンクをようやく完成させてるよ。
「360pなら効率的に動画をドラフトできる」
聞こえはいいけど、同じプロンプトを標準解像度で実行したら結果が変わっちゃう(非決定的だから)のを知って、すぐにガッカリすることになるんだよね。