2026年7月22日(水)掲載 2,870本日 27
HN643275

Gemma 4 12B登場!エンコーダーレスで統合された次世代マルチモーダルモデルの全貌

Gemma 4 12B: A unified, encoder-free multimodal model

rvz約2か月前

議論

11
1minimaxir約2か月前

ここの一番の目玉は「エンコーダーレス」って部分だけど、まだ完全には理解できてないな。

Vision: Gemma 4のビジョンエンコーダーを、単一の行列演算と位置エンコーディング、そして正規化から成る軽量な埋め込みモジュールに置き換えた。

これって技術的にはエンコーディングしてるよね?SigLIPみたいに専用モデルを使ってないってだけで。開発者ガイドを詳しく見ると、35Mのレイヤーは残ってるみたいだけど、これで十分な精度が出るのか気になるところ。https://developers.googleblog.com/gemma-4-12b-the-developer-guide/

RAM 16GBの一般向けノートPCでローカル実行できるほど軽量で、マシン上で強力なマルチモーダルやエージェント体験が可能になる。

これって量子化を前提にしてるよね。量子化による品質低下を考えると、ちょっと誤解を招く表現じゃないかな。

2ethanpil約2か月前

Googleがオープンモデルを公開するビジネス上のメリットって何なんだろう?もちろん、公開してくれることには感謝してるし素晴らしいと思ってる。ただ、営利企業として、この戦略が全体像にどう組み込まれているのか理解したいんだ。自社が開発した新しい技術を、競合他社が活用するのを助けているだけにならない?

単純に好感度アップやマーケティングのため?それとも、何か戦略的な要素を見落としてるのかな?

3dwa3592約2か月前

かなりいいアップデートだね。ただデモ動画がちょっと面白い。テスターがリリース内容を箇条書きにしてって頼むと、モデルは従う。その後でテスターが「この内容でメールの下書きを作って」って言うと、なんと!モデルは頼まれてもないのに箇条書きを長文に変えちゃって、さっきのいい仕事を台無しにしてるんだよね。メールで箇条書きを使わないのがマナーなのかどうかは謎だけどさ。

4djyde約2か月前

こういう小型モデルって、実際どんな用途があるの?日常生活でこの規模のモデルを使ってる人がいたら、経験談を聞かせてほしいな。

5ComputerGuru約2か月前

アーキテクチャの変更はさておき、これってGoogleのGemma4シリーズにあった(事前学習済みモデルの)4bと26bの間の大きな穴を埋めるための回答なんだろうね!

16GBのVRAMに余裕で収まって、コンテキストの分も確保できるモデルは歓迎すべきアップグレードだよ。

6senko約2か月前

Q4量子化版をllama.cppで動かして、俺の「マインスイーパー」コード生成ベンチマークで試してみた。結果は悪くないけど、手動で修正しなきゃいけない奇妙で些細な構文エラーがいくつかあった。閉じ括弧やカッコが余分に入ったり、関数定義の間をカンマで区切ろうとしたり。理由はよく分からないけど、それ以外は問題なく動作したよ。

そんな注釈付きだけど、ローカル用のコーディングモデルとしては十分な出来だと思う。出力に関して言えば、14ヶ月前にリリースされたGPT-4.1 (!!) と大体同等かな。(実際はGPT-4.1よりいいとも言えるけど、あの構文エラーがね…)

VRAM 12GBの一般向けGPUで量子化版(4-bit GGUF)を実行したら、出力速度は5t/sだった。コーディング用に対話的に使うには厳しいけど、モデルとしてはかなり優秀。

1年でここまで進歩したのは驚きだ。GPT-4.1はかつて最強のコーディングモデルだったけど、今や12Bのパラメータで同等の性能が出るんだから(このベンチマークに限った話だけど)。

テストしたモデルのリストはこちら:https://senko.net/vibecode-bench/

7petercooper約2か月前

画像認識がひどすぎる。Qwen 3.5 0.8b(そう、サイズはわずか7%)と比較テストをいくつかやったんだけど、Qwenが毎回圧勝して、Gemmaは的外れな回答を連発してた。「これはテストです」って書かれたただの画像を渡しても、6分間悩み続けた挙句に失敗したからね。Qwen 3.5 0.8bなら1秒かからず自信満々に正解を出したのに。

手元のQ6量子化版が壊れてる(あるいはLM Studioのせい)可能性もあるけど、どっちにしても0.8bの性能と比較すると絶望的だよ。

8asim約2か月前

今、私たちはクローズドループのゲームに突入している。Googleはモデルを加速させるために他者の力なんて必要ない。これこそ彼らの本業だからね。

彼らがこれほどの効率性を追求し続けていることに驚かされるし、同時に納得もできる。正直、シリコンやCPUアーキテクチャの進化と同じだ。小型化を繰り返すたびに性能は向上してきた。AIも同じで、これからもっと100倍効率的になっていくはず。どこかで限界は来るかもしれないけど、今後30年は過去30年よりも遥かに進化するだろうし、遺伝子編集で細胞や臓器を修復して寿命を延ばすような、SF映画みたいな未来が待ってるはずだ。私たちの世代を超えて、125歳まで元気に生きるのが当たり前になり、次は1000歳を目指すようになるんだろうね。

まあ、話が逸れたけど、過去30年を振り返って、これから先の30年を想像してみて。とんでもない未来になるはずだ。神のご加護がありますように。

9kristianp約2か月前

作者たちはどの程度の量子化で実行することを想定してるんだろう?16GBのRAMについて言及してるから、8bitで動かすべきなのかな?みんなq4について話してるけど、この規模のモデルをそんな低いビット数で動かして性能が出るのか疑問だ。編集:Hugging Faceの公開サイズを見ると16bit floatでベンチマークを取ってるみたいだね。https://huggingface.co/google/gemma-4-12B 。これはちょっと紛らわしい。「8bitなら16GBのノートPCで動く」と謳いつつ、リリースは16bit版なんだから。

誰かが各量子化レベルでのパープレキシティ曲線を出してくれるのを待つしかないね。

10dgacmu約2か月前

期待してたんだけど、ローカルのテスト問題、つまりコインの識別をさせてみたらガッカリした。1998年のワシントン・クォーター硬貨の写真を、「これはモーガン・シルバーダラー(1ドル銀貨)じゃない」って分からせるために10分も議論する羽目になったよ。まあ、本当にモーガン・シルバーダラーだったら良かったんだけどさ。

ブリティッシュコロンビア州の1ドル硬貨についてはクラッシュループに入っちゃったし。Q4_1でもQ8でも同じ結果だった。使い方が悪いのか、単にこのタスクが苦手なのか。

ちなみに3090でQ8を使って50 t/sくらい出たから、速度は問題ないんだけどね。