新王者誕生!Qwen3.8 MaxがAgentic Indexで堂々の総合評価1位を獲得
Qwen3.8 Max now ranked as the best overall model by agentic index
Qwen3.8 Max now ranked as the best overall model by agentic index
ついにQwen3.8 MaxがAgentic Indexにおいて、総合評価でトップにランクインしました。AIエージェントのパフォーマンス指標で最高位を記録したことは、現在のモデル競争における大きな転換点となりそうです。
https://artificialanalysis.ai/agents/coding-agents のページを見ても「Qwen」の文字が一度も出てこないのは不思議だね。彼らのインデックスのどれかで今や「ベスト」とされているのに。
Qwen 3.8 27Bにはすごくワクワクしてる。Strix Halo環境だとプリフィル(~3-400)が遅いのが残念だけど、エージェント的なタスクには本当に優秀なモデルだよ。
その評価には納得。トラブルシューティングにはめちゃくちゃ強い。QwenとKimi K3に、同じ面倒で複雑な断続的に発生するバグを追わせたことがあるんだけど、コードの理解度ではKimiが少し上だった一方で、Qwenは診断ツールを自分で構築してログデータから素晴らしい統計分析をしてくれた。Qwenの方が真実にかなり近づいてたよ。
次に出る小さいモデルのQwen 3.8リリースをすごく楽しみにしてる。ローカルで動かせるバージョンがあると最高なんだけど。
それは意外だな。
いくつかプロジェクトで試してみたけど、結構雑な印象を受けたよ。中途半端な状態で終わらせるし、明示的に指示しないと自分の作業を確認するためのテストコードを書こうとしないし、タスクの意図を誤解したりもする。
賢くてレスポンスもそこそこ速いけど、信頼性には欠けるかな。
Opus 5をベストとして扱うベンチマークなんて、自分の中では信用度ゼロだよ。実際に毎日Opus 5を使ってる人なら、何が言いたいか分かるはず。
これが、彼らが予告している小さなバージョンにも繋がるといいんだけど。自分の経験だと、Qwenのモデルは「知識は少なく、知能は高い」(この2つは強く相関するからね!)という、ツールに依存するタスクで求められる理想形に一番近い気がする。3.5 2Bですら、ツールを常に使うように指示すれば、誤った結論に飛びつかないように制御できるからね(まあ、コーディングスキル自体は期待通り酷いものだけど)。
Anthropicはちょっとどうかしてるよ。Maxアカウントに残ってた260ドルのクレジットが切れそうだったから、エージェント群を立ち上げて古いコードベースを深掘りさせてみようと思ったんだ。結果、25分もしないうちに260ドルがあっという間に溶けたよ。実装には一切手を出さず、大半は使い物にならない計画書を大量に書いただけだった。彼らがユーザーにいくら請求しようとしているのか、その現実を突きつけられた気分だ……あまりに高すぎるよ。
クリックした時は、Qwenが55.4でトップ、Opus Maxが55.3だった。スクリーンショットも撮ってある。
それから一度離れて戻ってきたら、Qwenが58.4で2位、Opus Maxが59.2で1位になってた。
両方のスクリーンショットがあるよ。グラフの上の説明文はどちらも同じだ。
Artificial Analysis Agentic Index
Artificial Analysis Intelligence Index内のエージェント能力ベンチマークの加重平均(GDPval-AA v2, ³-Banking)
一体どういうこと?数秒でスコアがこんなに変わるものなのか?
Intelligence IndexではOpusが依然として1位で、次にFable、GPT 5.6、Kimi K3、その後にQwen 3.8 maxが続いているよ。 https://artificialanalysis.ai/#intelligence
我々のリーダーボードはArena ELO、AA Intelligence index、レイテンシ、スピードを組み合わせていて、以下の順位だ。
#1 Opus 5
#2 Kimi K3
#3 Qwen3.8 Max
#4 GPT 5.6 Sol
ソース: http://pellmell.ai/leaderboard
この順位は、その瞬間にどのプロバイダーが最高のパフォーマンスを出しているかのスループットやレイテンシに基づいて頻繁に入れ替わるよ。
中国が追いついてきたというのが最大のポイントだね。SOTAモデル同士の差が縮まりすぎて、知能面で比較するのは本当に難しくなってる。結局、自分で実際に使ってみて、何が自分に合うか感覚を掴むしかない。
個人的には27Bモデルにかなり期待してる。3.6は依然としてローカル環境の王様だけど、3.8で同じように改善されれば、ローカル環境がデフォルトの選択肢として真剣に検討できるようになるはず。ずっと動かし続けられるエージェントをローカルで走らせたいんだよね。