【徹底比較】Claude 3.5 Opusの実力は?知能・パフォーマンス・価格を完全解析
Claude Opus 5.5 Intelligence, Performance and Price Analysis (Max)
Claude Opus 5.5 Intelligence, Performance and Price Analysis (Max)
現在、大きな注目を集めているClaude 3.5 Opusについて、その知能レベル、実行速度、そしてコストパフォーマンスを多角的に分析します。現時点での最高峰モデルとして、実務の現場でどこまで通用するのかを深掘りしました。
Opus 5と比較して、高負荷時でもタスクあたりのコストが半分に抑えられてるのはかなり良いね。
今になって見てみると興味深い。リリースされる前に散々使ってたけど、正直ほとんど違いが分からなかったな。コードの品質は少し上がったかもしれないけど、それでも大したレベルじゃない。まあ、使っててイライラする回数が少し減ったくらいかな。結局はAIって感じだね。
こういう評価って、リリースから数週間後にも再実行されるの?昨日、社内のデータセットで試したところ、Solのパフォーマンスが落ちてLunaと同等レベルになってたんだ。まあ1回計測しただけだけど、ちょっと気になってるんだよね。AIプロバイダーはとにかく早く「最強」だと証明してユーザーを集めて、その後に裏切るみたいなことをやりがちだからさ。
これは「max」推論設定のページだね。xhighのページは https://artificialanalysis.ai/models/claude-opus-5-5-xhigh で、デフォルトのmedium設定は https://artificialanalysis.ai/models/claude-opus-5-5-medium だよ。
「ペリカンが自転車に乗っているSVGを生成して」というプロンプトをmax設定で試したけど、2回とも失敗したよ。どっちも推論中に128,000トークンの制限を超えちゃったんだ。
考えすぎて肝心の回答にたどり着けないなら、max設定って実質ほぼ無価値なんじゃないかって疑ってる。挑戦したときの推論トレースはここに載せてる。「Reasoning trace」を開いて見てみて:https://tools.simonwillison.net/markdown-svg-renderer?url=https%3A%2F%2Fgist.github.com%2Fsimonw%2F61fd7c3683fffce9a3ab7c43d1180024#reasoning-3
個人的には「High」が一番使い勝手良さそうだね。
https://artificialanalysis.ai/models/claude-opus-5-5-high
多くのベンチマークはHighを超えるとプラトー(頭打ち)になるし、Fableよりベンチマークスコアも良い。今のところテストしてみた感じもかなり好調だよ。
「同価格帯のモデルと比べて少し高価」だって?
それはあんたが設定した比較範囲の問題であって、モデル自体の問題じゃないでしょ。
今回こそ頼むよ。Opus 5は指示を守らないし内容もすぐ忘れるから、4.8に戻してたんだよね。やりたいことや指示を何度も繰り返し伝えなきゃいけないのが本当にストレスだった。その点で言うとOpus 5は4.8というよりHaikuみたいな感じだったよ。
今回こそ期待したい。Opus 5から4.8に戻して使ってたんだ。理由はシンプルで、4.8の方が何をしているか把握して指示に従う能力が遥かに上だから。5は問題解決の途中で迷子になって勝手に脱線するから、途中で止めてやり直す必要が頻繁にあった。安定感なら圧倒的に4.8だったね。
この『ペーシング(調整)』っていう言葉、結局は「お前ら、俺がリードしてる間に少しペースダウンしとこうぜ」っていう本音じゃないかって気がしてならないんだけど。
結局、基盤モデルってオープンウェイトのモデルと比べても微々たる差しかないのに、コストは100倍もかかるってことが改めて分かったね。技術の歴史は「十分良い」ものが「最高」なものを駆逐してきた歴史だ。大手の研究所が早急に現実的なビジネスプランを出さない限り、AIも同じ運命を辿ることになると思うよ。
99%のユースケースで「十分良い」とされるものの100倍のコストをかけて、最高のモデルを持つことに価値なんてないんだから。