2026年7月22日(水)掲載 2,870本日 27
HN24181

Gemma 4 QATモデル登場!スマホやノートPCでも爆速動作する次世代の圧縮技術を徹底解説

Gemma 4 QAT models: Optimizing compression for mobile and laptop efficiency

theanonymousone約2か月前

議論

10
0theanonymousoneスレ主241約2か月前

Gemma 4 QATモデルがリリースされました。今回の注目ポイントは、量子化対応トレーニング(QAT)を活用することで、モバイル端末やノートPCのような限られたリソース環境でも、モデルの精度を維持しながら劇的な圧縮とパフォーマンス向上を実現している点です。エッジデバイスでの推論最適化を検討しているエンジニア必見のアップデートです。

1minimaxir約2か月前

Gemma 4 12Bをリリースして、その数日後に標準的なQ4_0 Gemma 4 12Bを出すっていうのは、ちょっとちぐはぐな感じがするな。

今回の投稿でQ4_0 Gemma 4 12Bの予想VRAM使用量が6.7GBと明記されているのはいいことだね。これなら確かにGoogleが謳っている「16GB以内で余裕」という主張に合致する。ただ、これによって「量子化版」でしかそれが実現できないっていうのが確定したわけだけど。

関連して言うと、macOS向けに新しくリリースされたGoogle Edge Galleryでは、16GBメモリのマシンですらメモリ不足でGemma 4 12Bは「非サポート」と明記されているんだ。でも、ここの予想VRAM使用量を見る限り、Q4_0のバリエーションなら間違いなく動くはずだし、Googleはそこを修正すべきだね。

2netdur約2か月前

Gemma 4 E2B Unsloth 4Qを試してみたけど、なかなか良かったよ:https://youtube.com/shorts/XLsAnz5aAAI

E4BモデルだとスマホのTPUには載りきらなくてRAMにスワップされちゃうけど、QAT版のおかげで精度も上がってるし、最高!

3satvikpendem約2か月前

Unslothのコレクション[0]と、その結果[1]も参考になるね。非量子化のBF16モデルと比べてもほぼ100%の精度を出せているみたいだし、Unslothの量子化版は記事に載ってるGoogleオリジナルのQATよりも優秀だよ。

個人的にはWeb検索と構造化JSON出力のためにUnsloth StudioとそのAPI経由で2Bモデルを使ってるんだけど、モデルをスマホに埋め込んでいてもすごくうまく動くよ。

[0] https://huggingface.co/collections/unsloth/gemma-4-qat
[1] https://unsloth.ai/docs/models/gemma-4/qat#qat-analysis

4simonw約2か月前

Macでローカルに動かしてみたよ:

uvx litert-lm run \
  --from-huggingface-repo=litert-community/gemma-4-E2B-it-litert-lm \
gemma-4-E2B-it.litertlm \
  --backend=gpu \
  --prompt="Generate an SVG of a pelican riding a bicycle"

初回実行時に3.2GBを ~/.cache/huggingface/hub/models--litert-community--gemma-4-E2B-it-litert-lm にダウンロードする感じだね。

3.2GBのモデルで音声と画像入力まで扱えるのはかなりイケてる。画像なら:

uvx litert-lm run \
  --from-huggingface-repo=litert-community/gemma-4-E2B-it-litert-lm \
gemma-4-E2B-it.litertlm \
  --backend=gpu --vision-backend gpu \
  --attachment image.jpg --prompt describe

音声なら:

uvx litert-lm run \
  --from-huggingface-repo=litert-community/gemma-4-E2B-it-litert-lm \
gemma-4-E2B-it.litertlm \
  --backend=gpu --audio-backend cpu \
  --attachment audio.wav --prompt transcribe

(ペリカンはひどい出来だったけど、3.2GBのファイルで有効なSVGを出力するってだけでも個人的には感動ものだよ:https://gist.github.com/simonw/94b318afde4b1ce5ff67d4b5d036212a

5Catloafdev約2か月前

8GBのVRAMで12Bを動かせるのはデカいな。こういう小さなローカルモデルの進化スピードには驚かされるよ。

6jbarrow約2か月前

Gemmaのエコシステムがこの1週間でどれだけ進化したか、本当に感動してる。

Gemma 12B、マルチトークン予測、そして公式の量子化モデルまでリリースされた。Googleがこの一連のリリースに本気で取り組んでるのが伝わってくるし、今後がすごく楽しみだよ!

7jhatax約2か月前

WWDC直前の金曜日だね。AppleはGoogleのモデルをベースにした「改良版Siri」を発表する予定だし(とりあえずは独占的なパートナーシップみたいだけど)。単なる偶然かもしれないけど、来週Appleが発表する内容に向けて、Googleがモデルを先行リリースしたって可能性もあるんじゃないかな。

根拠はないただの推測だけどね。

8jack_pp約2か月前

AMD Ryzen 9 8940HX、NVIDIA GeForce RTX 5060 (8 GB)、14 GB RAMのノートPCで、ollamaを使って hf.co/google/gemma-4-12B-it-qat-q4_0-gguf:Q4_0 を動かしてみたけど、驚くほど速かったよ。

9Kylejeong21約2か月前

Google Pixel Intelligenceの方がApple Intelligenceを上回るかもしれないな。