Gemma 4 QATモデル登場!スマホやノートPCでも爆速動作する次世代の圧縮技術を徹底解説
Gemma 4 QAT models: Optimizing compression for mobile and laptop efficiency
Gemma 4 QAT models: Optimizing compression for mobile and laptop efficiency
Gemma 4 QATモデルがリリースされました。今回の注目ポイントは、量子化対応トレーニング(QAT)を活用することで、モバイル端末やノートPCのような限られたリソース環境でも、モデルの精度を維持しながら劇的な圧縮とパフォーマンス向上を実現している点です。エッジデバイスでの推論最適化を検討しているエンジニア必見のアップデートです。
Gemma 4 12Bをリリースして、その数日後に標準的なQ4_0 Gemma 4 12Bを出すっていうのは、ちょっとちぐはぐな感じがするな。
今回の投稿でQ4_0 Gemma 4 12Bの予想VRAM使用量が6.7GBと明記されているのはいいことだね。これなら確かにGoogleが謳っている「16GB以内で余裕」という主張に合致する。ただ、これによって「量子化版」でしかそれが実現できないっていうのが確定したわけだけど。
関連して言うと、macOS向けに新しくリリースされたGoogle Edge Galleryでは、16GBメモリのマシンですらメモリ不足でGemma 4 12Bは「非サポート」と明記されているんだ。でも、ここの予想VRAM使用量を見る限り、Q4_0のバリエーションなら間違いなく動くはずだし、Googleはそこを修正すべきだね。
Gemma 4 E2B Unsloth 4Qを試してみたけど、なかなか良かったよ:https://youtube.com/shorts/XLsAnz5aAAI
E4BモデルだとスマホのTPUには載りきらなくてRAMにスワップされちゃうけど、QAT版のおかげで精度も上がってるし、最高!
Unslothのコレクション[0]と、その結果[1]も参考になるね。非量子化のBF16モデルと比べてもほぼ100%の精度を出せているみたいだし、Unslothの量子化版は記事に載ってるGoogleオリジナルのQATよりも優秀だよ。
個人的にはWeb検索と構造化JSON出力のためにUnsloth StudioとそのAPI経由で2Bモデルを使ってるんだけど、モデルをスマホに埋め込んでいてもすごくうまく動くよ。
[0] https://huggingface.co/collections/unsloth/gemma-4-qat
[1] https://unsloth.ai/docs/models/gemma-4/qat#qat-analysis
Macでローカルに動かしてみたよ:
uvx litert-lm run \
--from-huggingface-repo=litert-community/gemma-4-E2B-it-litert-lm \
gemma-4-E2B-it.litertlm \
--backend=gpu \
--prompt="Generate an SVG of a pelican riding a bicycle"
初回実行時に3.2GBを ~/.cache/huggingface/hub/models--litert-community--gemma-4-E2B-it-litert-lm にダウンロードする感じだね。
3.2GBのモデルで音声と画像入力まで扱えるのはかなりイケてる。画像なら:
uvx litert-lm run \
--from-huggingface-repo=litert-community/gemma-4-E2B-it-litert-lm \
gemma-4-E2B-it.litertlm \
--backend=gpu --vision-backend gpu \
--attachment image.jpg --prompt describe
音声なら:
uvx litert-lm run \
--from-huggingface-repo=litert-community/gemma-4-E2B-it-litert-lm \
gemma-4-E2B-it.litertlm \
--backend=gpu --audio-backend cpu \
--attachment audio.wav --prompt transcribe
(ペリカンはひどい出来だったけど、3.2GBのファイルで有効なSVGを出力するってだけでも個人的には感動ものだよ:https://gist.github.com/simonw/94b318afde4b1ce5ff67d4b5d036212a )
8GBのVRAMで12Bを動かせるのはデカいな。こういう小さなローカルモデルの進化スピードには驚かされるよ。
Gemmaのエコシステムがこの1週間でどれだけ進化したか、本当に感動してる。
Gemma 12B、マルチトークン予測、そして公式の量子化モデルまでリリースされた。Googleがこの一連のリリースに本気で取り組んでるのが伝わってくるし、今後がすごく楽しみだよ!
WWDC直前の金曜日だね。AppleはGoogleのモデルをベースにした「改良版Siri」を発表する予定だし(とりあえずは独占的なパートナーシップみたいだけど)。単なる偶然かもしれないけど、来週Appleが発表する内容に向けて、Googleがモデルを先行リリースしたって可能性もあるんじゃないかな。
根拠はないただの推測だけどね。
AMD Ryzen 9 8940HX、NVIDIA GeForce RTX 5060 (8 GB)、14 GB RAMのノートPCで、ollamaを使って hf.co/google/gemma-4-12B-it-qat-q4_0-gguf:Q4_0 を動かしてみたけど、驚くほど速かったよ。
Google Pixel Intelligenceの方がApple Intelligenceを上回るかもしれないな。