RTX 4090で爆速!Qwen 3.8 Flash Next (125B)を100T/sで動かす方法
Run Qwen 3.8 Flash Next (125B) on consumer hardware (RTX 4090) at 100T/s
Run Qwen 3.8 Flash Next (125B) on consumer hardware (RTX 4090) at 100T/s
コンシューマー向けハードウェアであるRTX 4090を使い、125Bパラメータの巨大モデル「Qwen 3.8 Flash Next」を秒間100トークン(100T/s)という驚異的な速度で実行する手法についての議論です。
試してみたけど、驚くほど上手くいったよ。自分のマシン(Nvidia 4090, 128GB DDR5, Ryzen 7950x3d)で毎秒124トークン出たから、共有しとくね。
Dwarfstarはすでに対応済みだね。比較が楽しみだけど、自分は普段使いでq4量子化版を使ってて、すごく快適だよ。
https://github.com/antirez/ds4/blob/main/docs/MODELS.md#qwen38-flash-next
ローカルモデルの素晴らしい進歩だけど、やっぱり失っているものも多いよね。2ビット量子化まで落とすと、コーダーモデルとしてのMoEエキスパートの半分が切り捨てられちゃうし。何もないよりはマシな世界線では純粋にプラスだけど、まだ道のりは長いね。
Opusみたいなモデルをローカルで動かせる日に、どんどん近づいてるね。まさに夢がある!
なんでこの手のエキスパートキャッシュって、まだllama.cppのネイティブ機能に入ってないの?わざわざ別のコードベースが必要な理由って何だろう。
4bitより下の量子化は品質が大幅に劣化する可能性があるから、ちょっと懐疑的だな。RTX Pro 6000を時給約1ドルで借りて4bit量子化を動かしてるんだけど、キャッシング込みで1時間あたり出力120万トークン、入力4000万トークンくらい出てる。難易度は高いけど範囲が明確なコーディングタスクなら、4bit量子化の品質で十分だよ。使ってる推論スタックはこれ:https://www.reddit.com/r/BlackwellPerformance/s/FrKwk3GoDK
50枚の画像を使った簡易的なビジョンベンチマークでStrataを試してみた。指定したオブジェクトの正確な座標を出力するタスクね。Strataの結果は中央誤差距離154.8ピクセル、平均168.8ピクセル。全く同じGGUFとビジョンアダプターの重みをllama.cppで動かしたら、中央誤差46.5、平均81.4だった。
比較のために、llama.cppでの他のモデルの数字を載せておくよ。
中央値/平均値
Qwen 3.5 9B BF16: 46.5 / 193.3
Qwen 3.6 35B Q4 K XL: 38.4 / 76.4
Qwen 3.5 122B Q3 K M: 32.9 / 68.6
ビジョン性能の差が、9Bモデルから35Bモデルに飛躍するくらいの大きさだね。全テストはtemp=0で実行した。
これらの結果は期待通りだったので、これ以上の追加テストはしてないよ。
RTX 6000 Proでds4のサポート作業をしてるんだけど、自分のユースケースにはすごく合ってる。ds4のQ4量子化は、今まで見た同じくらいのサイズのモデルと比べてもかなり性能がいい。
RTX 6000 Pro Workstation Edition (450W) でQ4量子化を使った結果がこれ:
Code: プリフィル 1,251 tok/s デコード 255.26 tok/s
Prose: プリフィル 1,251 tok/s デコード 198.78 tok/s
一番重要なのは、400+ tok/sで4つのストリームを同時に実行できることかな。
世界中のLLMスレッドがStrataのリンクでスパム状態になってるけど、ハネムーン期間が終わった後にどれだけの熱狂が残るかが見ものだね。自分も試してみたけど、今のところ精度の面で感動するようなものは特になかった。速いのは間違いないけどね。回答の質がそれほど重要じゃないLLMの用途もあるんだろうけど、自分にはそういう使い道がないな。人によって評価は分かれるところだろう。
自分もこれ試してるけど、今のところすごくいい感じ。RTX 4090 (24GB VRAM) 1枚に128GB DDR4 RAMという構成。110トークン/秒以上(3トークンMTP)は出てる。コンテキストは今のところ60K/260Kで運用中。結果はQwen 3.8 q5 27B(約60 TPS)と同等かそれ以上かな。結局、品質がダメならトークン/秒なんて大した意味がないのは分かってるけど、かなり期待してるし、結果は注意深く見ていくよ。
ローカルの高速なモデルを扱うのは楽しいね。プリフィルが速いし、100 TPS超えはかなり快適。