KimiとGLMを軽量・高速・安全に!大規模推論を最適化する実践テクニック
Smaller, faster, safer: running Kimi and GLM at scale
Smaller, faster, safer: running Kimi and GLM at scale
KimiやGLMといった大規模言語モデル(LLM)を大規模環境で運用する際、いかにしてモデルサイズを縮小し、推論速度を向上させ、かつ安全性を確保するかという課題は多くのエンジニアの関心事です。本稿では、これらのモデルを商用スケールで効率的に実行するための最新の最適化戦略について解説します。
「利益がどこから来るのかを正確に理解しておく価値がある。なぜなら、それは純粋なスピードではないからだ」という段落が始まった時点で、AI特有の質の低い文章を検知するセンサーが反応して読む気をなくしたよ。AIは大好きだけど、AIが書いた文章を読むのは本当にうんざりだ。
KVキャッシュの量子化について透明性を持って公開しているプロバイダーは貴重だね。一部のプロバイダーは非量子化の重みを強力に宣伝しつつ、裏でこっそり量子化を行っているんじゃないかと疑っていたんだ。KV量子化は重みの量子化よりも品質を大きく損なう可能性があるからね。ただ、検証内容はもっと詳細にしてほしかった。まず、モデルファミリーによってKV量子化に対する感度が異なる(今回はKimi K2.6しかテストされていない)。次に、FP8 KV量子化で劣化がないと主張するために使われている評価スイートには、コーディングのベンチマークが明らかに不足している。長期実行されるタスクでは、わずかなツール呼び出しエラーが積み重なって大きな問題になるからね。
Cloudflareのダッシュボードで料金を確認する ↗ なんでだよ……Cloudflareのエンドポイントを使う価値があるか見極めたかったのに、料金すら確認できないなんて。
つまりモデルを量子化しておきながら、モデルのページには警告を出さずブログ記事で触れるだけで、しかもその記事内でも飽和状態にある小さなコンテキストタスクのベンチマークを使って「差はない」と主張しているのか。コーディングエージェントはKV量子化によって深刻な悪影響を受ける可能性が高いだろうね。モデルの「ストア」ページに記載せず量子化モデルを提供するのは詐欺と言っていい。
最高のオープンソースモデルをGPUに詰め込み、何百万人もの開発者に提供するような問題に取り組みたいなら、ぜひ一緒に働こう。こういう仕事の典型的な職種名や、求められるスキルセットって何だろう?
なぜint4なのか?bitsandbytesのnf4のような、もっと優れた4ビットフォーマットが他にたくさんあるだろうに。