2026年8月19日(水)掲載 3,681本日 25
HN5822

新モデル登場!GLM-5.3のAIベンチマーク結果を徹底分析

GLM-5.3 Artificial Analysis Benchmarks

apitman約11時間前

議論

8
0apitmanスレ主58約11時間前

話題のLLM「GLM-5.3」における人工知能のパフォーマンス評価(ベンチマーク)の詳細についてまとめています。最新のテスト結果から、その実力を深掘りしていきましょう。

1colingauvin約10時間前

……4 Sparkクラスタを買うために、住宅ローンを二重に組めってこと?

2markasoftware約10時間前

サイズを考えればかなり印象的なスコアだけど、トークン消費がk3より多いし、独自モデルよりずっと多い。そのせいでコストパフォーマンスはk3からそれほど突き放せてないね

3Zaheer約10時間前

すでにClaude Codeをサブスクしてる場合、わざわざこれらを使う価値はあるかな?低コストっていうのは魅力だけど、乗り換えの手間を考えるとまだ踏み切れないんだよね

4scotttrinh約10時間前

俺は興味のある2つの指標、つまりコスト効率とトークン効率を測れる『タスクあたりのコスト』と『タスクあたりの出力トークン数』で、スコアが近いモデルを比較するのが好きなんだ。他の人が比較の手間を省けるように、GLM-5.3が同スコア帯の他モデルやGLM-5.2とどう違うのかまとめてみたよ(精度向上とモデル追加のために編集済み):

    Model                        Score    Cost / Task    Output Tokens / Task
    -------------------------------------------------------------------------
    GLM-5.3 (max)                 59.5          $0.68                  41,107
    GLM-5.2 (max)                 53.0          $0.56                  32,200
    Claude Opus 5 (high)          61.5          $1.52                  21,353
    GPT-5.6 Sol (max)             60.9          $1.23                  16,879
    Grok 4.6 (high)               60.9          $0.84                  21,735
    Kimi K3 (max)                 59.7          $0.84                  25,474
    GPT-5.6 Sol (xhigh)           59.0          $0.87                  11,098
    Claude Opus 5 (medium)        58.6          $0.98                  12,459
    Qwen3.8 Max                   58.1          $1.13                  38,287
    Qwen3.8 2.4T A95B             57.7          $0.95                  32,472
    Claude Opus 4.8 (max)         57.3          $1.65                  33,557
    GPT-5.6 Sol (high)            57.3          $0.52                   7,545
    Muse Spark 1.2 (xhigh)        56.8          $0.40                  30,430
    GPT-5.6 Terra (max)           56.6          $0.51                  20,838
    GPT-5.5 (xhigh)               56.3          $0.69                  16,893
    Gemini 3.7 Flash (high)       56.0          $0.40                  36,847

5BinRoo約10時間前

リストされているベンチマークには注意したほうがいいよ。例えばSciCodeやEnterpriseOpsについてはここを見て: https://shukla.io/blog/2026-08/gym.html

6colingauvin約10時間前

エージェント指標では(Opus 5と並んで)1位タイだね。

7glub約10時間前

リリース当日にGLM 5.3をテストしてみたけど、Artificial Analysisの評価は的確だね。本当に素晴らしいモデルだよ。

ただ、一番の収穫は別のところにあった。クローズドなウェイトモデルを長く使っていたせいで、推論トークンが見えることの恩恵をすっかり忘れていたんだ。

GPTやClaudeだと、意図が正しく伝わってるか、必要な情報やツールがエージェントに揃ってるか、祈るような気持ちになる。「うーん、ここではnix flakeが使えないみたいだから、グローバルにインストールしちゃダメだな」なんて思考は見えないまま、何百万トークンも浪費して、8時間かけて数百ドル無駄にしてから気づくなんてこともザラだから。GLMのようなモデルなら、問題が起きる前にその場でストップをかけられるんだ。