2026年8月7日(金)掲載 3,343本日 30
HN403263

新王者誕生!Qwen3.8 MaxがAgentic Indexで堂々の総合評価1位を獲得

Qwen3.8 Max now ranked as the best overall model by agentic index

apitman約10時間前

議論

11
0apitmanスレ主403約10時間前

ついにQwen3.8 MaxがAgentic Indexにおいて、総合評価でトップにランクインしました。AIエージェントのパフォーマンス指標で最高位を記録したことは、現在のモデル競争における大きな転換点となりそうです。

1embedding-shape約10時間前

https://artificialanalysis.ai/agents/coding-agents のページを見ても「Qwen」の文字が一度も出てこないのは不思議だね。彼らのインデックスのどれかで今や「ベスト」とされているのに。

2syntaxing約10時間前

Qwen 3.8 27Bにはすごくワクワクしてる。Strix Halo環境だとプリフィル(~3-400)が遅いのが残念だけど、エージェント的なタスクには本当に優秀なモデルだよ。

3eli約9時間前

その評価には納得。トラブルシューティングにはめちゃくちゃ強い。QwenとKimi K3に、同じ面倒で複雑な断続的に発生するバグを追わせたことがあるんだけど、コードの理解度ではKimiが少し上だった一方で、Qwenは診断ツールを自分で構築してログデータから素晴らしい統計分析をしてくれた。Qwenの方が真実にかなり近づいてたよ。

次に出る小さいモデルのQwen 3.8リリースをすごく楽しみにしてる。ローカルで動かせるバージョンがあると最高なんだけど。

4SwellJoe約9時間前

それは意外だな。

いくつかプロジェクトで試してみたけど、結構雑な印象を受けたよ。中途半端な状態で終わらせるし、明示的に指示しないと自分の作業を確認するためのテストコードを書こうとしないし、タスクの意図を誤解したりもする。

賢くてレスポンスもそこそこ速いけど、信頼性には欠けるかな。

5onomojo約9時間前

Opus 5をベストとして扱うベンチマークなんて、自分の中では信用度ゼロだよ。実際に毎日Opus 5を使ってる人なら、何が言いたいか分かるはず。

6petercooper約9時間前

これが、彼らが予告している小さなバージョンにも繋がるといいんだけど。自分の経験だと、Qwenのモデルは「知識は少なく、知能は高い」(この2つは強く相関するからね!)という、ツールに依存するタスクで求められる理想形に一番近い気がする。3.5 2Bですら、ツールを常に使うように指示すれば、誤った結論に飛びつかないように制御できるからね(まあ、コーディングスキル自体は期待通り酷いものだけど)。

7theropost約9時間前

Anthropicはちょっとどうかしてるよ。Maxアカウントに残ってた260ドルのクレジットが切れそうだったから、エージェント群を立ち上げて古いコードベースを深掘りさせてみようと思ったんだ。結果、25分もしないうちに260ドルがあっという間に溶けたよ。実装には一切手を出さず、大半は使い物にならない計画書を大量に書いただけだった。彼らがユーザーにいくら請求しようとしているのか、その現実を突きつけられた気分だ……あまりに高すぎるよ。

8d2p約9時間前

クリックした時は、Qwenが55.4でトップ、Opus Maxが55.3だった。スクリーンショットも撮ってある。

それから一度離れて戻ってきたら、Qwenが58.4で2位、Opus Maxが59.2で1位になってた。

両方のスクリーンショットがあるよ。グラフの上の説明文はどちらも同じだ。

Artificial Analysis Agentic Index
Artificial Analysis Intelligence Index内のエージェント能力ベンチマークの加重平均(GDPval-AA v2, ³-Banking)

一体どういうこと?数秒でスコアがこんなに変わるものなのか?

9seizethecheese約8時間前

Intelligence IndexではOpusが依然として1位で、次にFable、GPT 5.6、Kimi K3、その後にQwen 3.8 maxが続いているよ。 https://artificialanalysis.ai/#intelligence

我々のリーダーボードはArena ELO、AA Intelligence index、レイテンシ、スピードを組み合わせていて、以下の順位だ。
#1 Opus 5
#2 Kimi K3
#3 Qwen3.8 Max
#4 GPT 5.6 Sol

ソース: http://pellmell.ai/leaderboard

この順位は、その瞬間にどのプロバイダーが最高のパフォーマンスを出しているかのスループットやレイテンシに基づいて頻繁に入れ替わるよ。

10jjcm約8時間前

中国が追いついてきたというのが最大のポイントだね。SOTAモデル同士の差が縮まりすぎて、知能面で比較するのは本当に難しくなってる。結局、自分で実際に使ってみて、何が自分に合うか感覚を掴むしかない。

個人的には27Bモデルにかなり期待してる。3.6は依然としてローカル環境の王様だけど、3.8で同じように改善されれば、ローカル環境がデフォルトの選択肢として真剣に検討できるようになるはず。ずっと動かし続けられるエージェントをローカルで走らせたいんだよね。