ついに登場?噂の「Claude 3.5 Sonnet」v2(Sonnet 5.5)について
Sonnet 5.5
Sonnet 5.5
現時点で「Sonnet 5.5」という正式名称のモデルはリリースされていません。おそらく、最新の「Claude 3.5 Sonnet」のアップデートや、次世代モデルに関するコミュニティの期待や噂が混同されている可能性があります。引き続き公式発表に注目しましょう。
月200ドル払ってCyber Verification Programにも参加しているのに、正規のバウンティ作業でOpus 5.5やSonnet 5.5が使えないなんて。すぐに「Cyber」のフラグが立てられてしまう。
正直クソだね。彼らのセーフガードはひどいものだよ。
「Sonnet 5.5のサイバー能力はSonnet 5から大幅に向上したため、Opus 5.5と同等のセーフガードを適用して展開する。通常のソフトウェア開発におけるバグの発見や修正はこれまで通り可能だが、リスクの高いサイバーセキュリティ関連のタスクは、目に見えてSonnet 5にフォールバックされるようになる」
Anthropicのモデルに関しては、Opus 4.8でサイバー能力のピークに達したみたいだね。それ以降に出たものは全部、より劣ったモデルに格下げされるんだから。
贅沢な悩みかもしれないけど、Opus 5.5の効率を考えると、5xプランの制限で十分日々の仕事が回せてしまうんだ。一度に2~3セッション走らせてもね。だからSonnet 5.5をいつ使えばいいのか分からない。
理解の質を保とうとすると、これ以上の並行処理はあまり現実的じゃないし。純粋なWebアプリやフロントエンドのタスクなら、プロセスより結果が重視されるから違うのかもしれないけど、その辺の経験はあまりないし(これらの領域を軽視するつもりはないよ、複雑さを過小評価しているかもしれないからね)。
だから驚いたことに、今のところ自分の仕事はモデルの能力でほぼ飽和状態なんだ。ここからどうスケールアップすればいいのか分からない。もちろん、トークンを消費するために全リクエストで最大出力させることもできるけど、それじゃ意味がないだろ。それに多くのタスクにおいて、エージェント(あるいはその艦隊)を一日中自律的に走らせるような、明確な成功基準や自己検証ループを定義できないし。
結局のところ自分のスキルの問題だと分かっているけど、同じ思いをしているのは自分だけじゃないはず。少なくとも短期的には、トークン需要に限界があるんじゃないかな。AIがAGIやRSIへ向かって加速してトークンの使い道を見出さない限り、どこかで頭打ちになるような気がする。
念のため言っておくけど、AGIを疑っているわけでも知能に上限があると思っているわけでもないよ。ただ、トークンの供給が需要を上回るせいで、経済的に苦しい状況が続く可能性があるんじゃないかと思うんだ。使い道が見つからなくてね。そうなると資金調達が鈍って、学習のスケールアップで脱出速度に達せなくなるかもしれない。まあ、様子見だね。
コストパフォーマンスのチャートを見ると、ほとんどの構成でOpusより劣っているように見えるんだけど。Opus 5.5のhigh設定の方が良い結果(スコアが高くてコストが安い)が出るのに、なぜxhigh設定のSonnet 5.5を使う必要があるの?
何か良いユースケースがあるのかな? 特定の状況でLunaを使うのがずっと安くて効果的、というような話とは訳が違うよね。
Terminal-BenchでSonnet 5.5が70.6と、Opus 5.5の66.4より高いスコアを出しているのは興味深いね。おかしいと思ったから調べてみたんだ。
どうやらOpusはセーフガードの影響でトライアルの10%がフォールバックモデルで回答されていたのに対し、Sonnetは1.5%しかフォールバックされていなかったみたいだ。[1] だからこの結果をあまり真に受けるべきじゃないね。このスコア差は単にフォールバックの回数の違いで説明がつくはずだよ。
[1] Sonnet 5.5 システムカード 8.5節
多くのベンチマークでmedium以上の esforço(努力)設定だとコストが同じか、むしろ高いくらいなのに、なぜOpusよりこれを使う必要があるのか理解できない。
確かにSonnet 5より30%安いかもしれないけど、今のベンチマークだとほとんど互角だし、ものによってはOpusよりコストがかかる場合もあるみたいだし。
何か見落としているのかもしれないけど、発表内容を見ても、一般の人がこれを使おうと思う理由はあまりなさそうだ。
じゃあSonnetの方が今はFableより上ってこと? あの「リリースするには危険すぎる」と言われていたFableより? もう何がなんだか分からないよ。
ペリカン(Pelicans)。Sonnet 5.5もOpus 5.5と同じ問題を抱えているよ。「max」の思考レベルにすると128,000の思考トークンを消費(15分もかかって)し、最終的なSVGを出力しきる前に力尽きてしまったんだ。
[URL]
思考努力レベルの比較はこんな感じ:
low
入力27、出力1,623、思考トークン: 0
1.6284セント
時間: 10138ms (10秒)
medium
入力27、出力1,796、思考トークン: 0
1.7914セント
時間: 11266ms (11秒)
high
入力27、出力2,334、思考トークン: 745
2.3394セント
時間: 17376ms (17秒)
xhigh
入力27、出力5,730、思考トークン: 2535
5.7354セント
時間: 41882ms (41秒)
max(応答返ってこず)
入力27、出力128,000、思考トークン: 128000
$1.28
時間: 940617ms (15分40秒)
Lowとmediumはどちらも思考トークンを消費しなかったね。
僕が使っている中国のモデルより20倍もコストがかかるよ。もう必要ないんだよね。仕事で強制されるなら使うけど、それ以外で自腹を切ることはもうないな。
それに今の職場じゃ、Claudeは高すぎて支払ってくれないし。
Astra、Sol、Fable、Opusといったフロンティアモデルを使っているなら別だけど、そうでなければ中国のモデルを格安で使った方がマシなことが多いと思う。みんな、中国のモデルがどれほど競争力を持つようになったか分かっていないんじゃないかな。
GLMやDeepSeekがいい例だよ。LinuxやAndroidみたいに、必ずしも一つのベストなプロバイダーがあるわけじゃないんだ。自分で調べて、いくつか試して、自分の用途に合うものを選ぶ必要がある。
Anthropicが最近やたらと高価なモデルを押し出しているのは、その辺りも関係していると思う。SonnetやHaikuは素晴らしかったけど、あのレベルの知能になると、すっかり追いついてきた中国モデルと価格で競うのはどんどん難しくなっているからね。
今AnthropicやOpenAIのフロンティアモデルを使う主な理由は、知能と速度のバランスだ。中国のフロンティアモデルはハードウェアの制約もあって、まだそこには苦戦している。でも最近のGLMのリリースを見る限り、正しい方向に進んでいるのは間違いないよ。