新モデル登場!GLM-5.3のAIベンチマーク結果を徹底分析
GLM-5.3 Artificial Analysis Benchmarks
GLM-5.3 Artificial Analysis Benchmarks
話題のLLM「GLM-5.3」における人工知能のパフォーマンス評価(ベンチマーク)の詳細についてまとめています。最新のテスト結果から、その実力を深掘りしていきましょう。
……4 Sparkクラスタを買うために、住宅ローンを二重に組めってこと?
サイズを考えればかなり印象的なスコアだけど、トークン消費がk3より多いし、独自モデルよりずっと多い。そのせいでコストパフォーマンスはk3からそれほど突き放せてないね
すでにClaude Codeをサブスクしてる場合、わざわざこれらを使う価値はあるかな?低コストっていうのは魅力だけど、乗り換えの手間を考えるとまだ踏み切れないんだよね
俺は興味のある2つの指標、つまりコスト効率とトークン効率を測れる『タスクあたりのコスト』と『タスクあたりの出力トークン数』で、スコアが近いモデルを比較するのが好きなんだ。他の人が比較の手間を省けるように、GLM-5.3が同スコア帯の他モデルやGLM-5.2とどう違うのかまとめてみたよ(精度向上とモデル追加のために編集済み):
Model Score Cost / Task Output Tokens / Task
-------------------------------------------------------------------------
GLM-5.3 (max) 59.5 $0.68 41,107
GLM-5.2 (max) 53.0 $0.56 32,200
Claude Opus 5 (high) 61.5 $1.52 21,353
GPT-5.6 Sol (max) 60.9 $1.23 16,879
Grok 4.6 (high) 60.9 $0.84 21,735
Kimi K3 (max) 59.7 $0.84 25,474
GPT-5.6 Sol (xhigh) 59.0 $0.87 11,098
Claude Opus 5 (medium) 58.6 $0.98 12,459
Qwen3.8 Max 58.1 $1.13 38,287
Qwen3.8 2.4T A95B 57.7 $0.95 32,472
Claude Opus 4.8 (max) 57.3 $1.65 33,557
GPT-5.6 Sol (high) 57.3 $0.52 7,545
Muse Spark 1.2 (xhigh) 56.8 $0.40 30,430
GPT-5.6 Terra (max) 56.6 $0.51 20,838
GPT-5.5 (xhigh) 56.3 $0.69 16,893
Gemini 3.7 Flash (high) 56.0 $0.40 36,847
リストされているベンチマークには注意したほうがいいよ。例えばSciCodeやEnterpriseOpsについてはここを見て: https://shukla.io/blog/2026-08/gym.html
エージェント指標では(Opus 5と並んで)1位タイだね。
リリース当日にGLM 5.3をテストしてみたけど、Artificial Analysisの評価は的確だね。本当に素晴らしいモデルだよ。
ただ、一番の収穫は別のところにあった。クローズドなウェイトモデルを長く使っていたせいで、推論トークンが見えることの恩恵をすっかり忘れていたんだ。
GPTやClaudeだと、意図が正しく伝わってるか、必要な情報やツールがエージェントに揃ってるか、祈るような気持ちになる。「うーん、ここではnix flakeが使えないみたいだから、グローバルにインストールしちゃダメだな」なんて思考は見えないまま、何百万トークンも浪費して、8時間かけて数百ドル無駄にしてから気づくなんてこともザラだから。GLMのようなモデルなら、問題が起きる前にその場でストップをかけられるんだ。