ついに登場!「Qwen 3.8 27B」の全貌を徹底解説
Qwen 3.8 27B
Qwen 3.8 27B
現在、Qwen 3.8 27Bに関する詳細情報が待たれています。最新のAIモデルの動向を追いかけているエンジニアの皆様、続報が入り次第、随時アップデートしていきます!
ベンチマークに嘘がないなら、Opus 4.6の能力にかなり近づいてるね。自分にとっては、AIが「もう十分使える」レベルになって、使わない理由を探すのが難しくなった転換点がそこだったんだ。
ベンチマーク向けに最適化(ベンチマクシング)している部分もあるだろうし、より大きなモデルじゃないと出せない性能もあるとは思う。
でも、Gemma 5までとは言わずとも、2028年の中頃までには、ローカルモデルでもOpus 4.6と同等、あるいは多くのケースでそれ以上の性能を常に出せるようになると確信してるよ。
Qwenが盛り上がってる中で多くの人が見落としてる気がするのは、この手のモデルが「考えすぎ」て、終わりのない「自己疑念」に陥りやすいことかな。3.8もこれまで試した限りでは変わらない感じ。
能力は高いけど、競合モデル(例えばGemma4:26b-a3bなど)なら1/10の「思考」トークンで同じかそれ以上の回答を出せて、トークン/秒もずっと速く、時間も圧倒的に短く済む。そう考えると、使う理由を見つけるのは難しいね。まあ、ユースケース次第だけど。
あと、まだあまり使ってないから無限ループの癖があるかは分からないけど、以前のモデルは確かにそうだったよ。
いつものことだけど、Jinjaテンプレートがおかしくなってるから、これ[0]を使って思考を減らすかオフにするか、ツール呼び出しを修正したりKVキャッシュのヒット率を100%にしたりしてみて。
[0] https://huggingface.co/froggeric/Qwen-Fixed-Chat-Templates (https://huggingface.co/froggeric/Qwen-Fixed-Chat-Templates)
思考の書き方が(3.6と比べて)明らかに変わったね。「We need to」から「to」や「we」を削ったり、メモ書きのような口調になったり、「the」や「and」をあちこちで省略したり、「for」を避けたりしてる。
「Need be helpful concise(簡潔かつ役に立つ必要がある)」「Need maybe not overdo(やりすぎないほうがいいかも)」「Need ask!(質問せよ!)」みたいな、ほとんど原始人レベル。
(根拠はないけど)この独特な思考パターンのせいでMTPの予測がうまくいってないんじゃないかと疑ってる。MTPの性能が悪そうなんだよね。
他の気づき:思考トレースの中でプロンプトを繰り返す小細工を使ってる。
あと、思考のプロセスが最終回答に紛れ込むのをすごく気にしてる。「desired oververbosity 9(冗長性レベル9)」なんていう新しい概念も話してて、ちょっとGPTっぽい。
コードの要望に対してものすごく徹底的に考え込んでるけど、肝心の成果が35B MoEより良くなるかは分からないな。
追加の質問をするよう指示したらちゃんとやってくれたし、合意するだけで済むデフォルトのリストも提示してくれた。
ループするような「考えすぎ」ではないと思うけど、とにかく「網羅的」すぎるんだよね。もう少しタイトな推論リソース制限でどうなるか探る必要があるな。
感心はしたけど、M1 Maxで動かすには実用的じゃないから、個人的には「35B-A3B版はいつ?」という気持ちが強い。出してくれるといいけど、なさそうかな。
私のノートPCで動かしたモデルの中で、間違いなく最高のペリカンを描いてくれたよ:https://tools.simonwillison.net/markdown-svg-renderer#url=ht... (https://tools.simonwillison.net/markdown-svg-renderer#url=https%3A%2F%2Fgist.github.com%2Fsimonw%2Ffc909bea4fecf752c7bf9bad0e9dbf2a)
自転車の形が正しいし、ペリカンのくちばしも完璧。背景もいい。何より、ペリカンが自転車の両側に足を通してるのが素晴らしい。これは滅多にないことだよ。
(チェーンはないけど、推論トレースに「すでにチェーンステーがあるからチェーンの詳細はスキップ、小さなチェーンリングがあるかも」と書いてあった)
M5 MaxのMacBook ProでLM Studioと17GBのGGUFを使って実行したんだけど、https://lmstudio.ai/models/qwen3.8 (https://lmstudio.ai/models/qwen3.8)
21分もかかって、22,276トークンの推論をして3,223トークンの出力が得られた。
(「今はベンチマークデータで学習してるんだろ」派の人へ:あれだけズルしてそうなデータで学習してても、20分もかけてタスクを考え込むのは変わらなかったよ!共有リンクで推論のトレースが見られるから確認してみて。)
比較として、OpenRouterでqwen3.8-2.4t-a95bを使って出力させたものがこれ。こっちはアニメーションもいい感じ:https://tools.simonwillison.net/markdown-svg-renderer#url=ht... (https://tools.simonwillison.net/markdown-svg-renderer#url=https%3A%2F%2Fgist.github.com%2Fsimonw%2F557016f0895b2abb4b9957caec781734)
unsloth版のQ8kxl https://huggingface.co/unsloth/Qwen3.8-27B-GGUF (https://huggingface.co/unsloth/Qwen3.8-27B-GGUF) はなぜか思考プロセスでループして暴走しちゃうんだよね(開発者に連絡しようとメアドを探したけど見当たらなくて……)。bartowski版を使ったらその問題は出なかったよ。https://huggingface.co/bartowski/Qwen3.8-27B-GGUF?show_file_... (https://huggingface.co/bartowski/Qwen3.8-27B-GGUF?show_file_info=Qwen3.8-27B-Q8_0.gguf)
llama.cppを使ってるんだけど、こんな感じの構成で。
llama-server
-m ~/somePath/Qwen3.8-27B-UD-Q8_K_XL.gguf
-np 1 --kv-unified
-fa on --no-cache-idle-slots --reasoning-preserve
--temp 0.2
--spec-type draft-mtp,ngram-mod --spec-draft-n-max 3 --spec-draft-n-min 1
--cache-type-k f16 --cache-type-v f16
--chat-template-kwargs '{"preserve_thinking": true}' \
unslothのページにある推奨パラメータをいろいろ試したけどダメだった……。
高熱でうわ言を言ってるみたいに、最後は「アーメン」とか言い出してたよ(笑)
評価すべき点は評価しないとね。Qwen 3.8 27Bは、私のプライベートなベンチマークで正しく推論できたGemma 4以来、2つ目のローカルモデルだよ。トークン数は5倍消費して、MTP有効で12分30秒かかったけど、ちゃんとやり遂げた。
Gemma 4は暗黙的に推論してたけど、Qwen 3.8はより明示的に推論してた。LagunaやMuse Glimmerは全くダメだったけど、他のタスクでは役に立つから使い分けかな。
VRAMの使用効率はGemma 4やGlimmerよりかなり悪いみたい。32Kのコンテキストで2.5GBもVRAMを食う。向こうはMTPやDFlashモデルを読み込んでも256k~768kのコンテキストを詰め込めるからね。Qwen 3.8 27Bだと、VをQ4_0に量子化しても128kすら収まらない。試行錯誤すれば、大きいコンテキストウィンドウでも使い物になる設定が見つかるかもしれないけど。
テストはまだまだ必要だな。Muse Glimmerは2倍以上速くてHugeコンテキストにも対応してたし、Gemma 4が苦戦したバグを解決できたりして悪くない結果だった。Qwenだとプロンプトだけでコンテキストがいっぱいになっちゃうし、推論で同じくらいのトークンを食うから、そのタスクを投げるのは無理そう。
32GBのカードを持ってるなら、メモリ食い虫とはいえ、それなりに優秀なモデルになるはずだよ。
すごいね。このモデルは本当に優秀だし、GLM 5.3(セキュリティ関連の作業にすごく良さそう)やDeepseekもある。あと数ヶ月もすれば、アメリカの大手企業じゃないところからFableやSolのような能力を持つモデルが出てくるはず。プログラマーとして、それだけで十分すぎるくらいだ。フロンティアモデルの知能がコモディティ化したら、OpenAIやAnthropicはどうやって生き残るんだろうね?
RTX 5090でこれを動かしてる人がいたら、推論エンジンに https://github.com/Neroued/ninfer (https://github.com/Neroued/ninfer) を使ってみて。llama.cppの標準セットアップの約2倍、138トークン/秒くらい出てるよ。