ついに登場?Claude 3.5 Opusの噂と期待値まとめ
Claude Opus 5.5
Claude Opus 5.5
現在ネット上で囁かれている「Claude 3.5 Opus」のリリース情報について。次世代モデルの性能や、現行のSonnetからのアップデート内容に対するエンジニア界隈の期待をまとめています。
さっさとコンテンツを表示してくれ。このUIとスクロールの仕様はひどすぎる。
ほとんどの作業でClaude Fable 5.1と同等のパフォーマンスを発揮し、Opus 5よりも運用コストが40%抑えられています。
入出力トークンは100万トークンあたりそれぞれ4ドルと20ドルで、Opus 5より20%安くなっています。キャッシュ読み取り(エージェントやコーディング作業のコストの大半を占める部分)は100万トークンあたり0.20ドルで、Opus 5より60%も安いです。Opus 5.5は出力速度もOpus 5より30%以上速くなっています。
Fableより優秀で、前世代のOpusより安いとか最高じゃん。Opusをメインで使ってるから、これはかなりワクワクする!
ついに値下げか。
100万トークンあたりの料金 Claude Opus 5.5 Claude Opus 5
キャッシュ読み取り $0.20 $0.50
入力トークン $4 $5
出力トークン $20 $25
キャッシュ書き込み $5 $6.25
Opus 5はOpenRouterで最も利用料が使われていたモデルだし(https://openrouter.ai/rankings#task-spend )、世界でも一番使われているモデルだった可能性が高い。間違いなくAnthropicにとって最大の稼ぎ頭だったはず。
性能を向上させつつ値下げを余儀なくされたということは、市場の状況を物語っているし、このモデルが彼らの収益の要であることを考えると、Anthropicの将来の収益性についても色々と考えさせられるね。
Opus 5.5は生物学やサイバーセキュリティの分野でClaude Mythos 5.1に匹敵するため、Claude Fable 5.1と同様のセーフガードを適用してリリースします。認定を受けた組織は、生物学研究のためにOpus 5.5を使用する『ライフサイエンス検証プログラム』に本日より申請可能です。今後数週間で『サイバー検証プログラム』へのアクセスも拡大し、認定を受けたサイバーセキュリティの実務家が仕事でOpus 5.5を使えるようになります。
あーあ、結局どのモデルにも制限をかけていく方針みたいだね。長期的には決して良いことじゃないと思うよ。
謳っているパフォーマンス向上からして、DeepSeek 4.1の論文にあるCasual Encoder-Decoder技術を実装したんじゃないか?
このタイミングならそれを達成してこれくらいのゲインを得ることは考えられるし、あの技術が出た時に最先端のモデルはすぐに飛びつくだろうなと思っていたよ。
仕組みはこちら:https://miraflow.ai/blog/deepseek-v4-1-flash-causal-encoder-... (https://miraflow.ai/blog/deepseek-v4-1-flash-causal-encoder-decoder-explained-2026)
Claude Opus 5.5は、私たちがフロンティアのペース調整を呼びかけて以来、初めてのリリースとなります。
面白いよね。冒頭の一文で先週の「フロンティアのペース調整」をわざわざ思い出させておきながら、その後の説明では具体的な数字を挙げて、いかにペース調整なんて全くしていないかを証明しているんだから。
コミュニケーション:Opus 5.5は以前のモデルよりも自然にコミュニケーションをとります。初期テスターからは、文章がより明確で追いやすく、Opus 5で指摘されていたフィードバックが改善されているという声が上がっています。重要な情報を最初に提示し、長時間セッションでも作業パートナーとして適したスタイルになっています。あるテスターいわく「自分の書き方に似ている」とのこと。社内検証でも、仕事の内容が追いやすく確認しやすくなりました。これは実用性だけでなく安全性においてもメリットです。
これこそ一番気になっていたポイント。Claude Opus 5やFableの独特な文章スタイルで一日中作業するのが無理で、結局Astraに移行してたんだ。Astraの方がモデルとして優れているとは思わないけど、OpenAIのモデルの中で唯一許容できるレベルだったから。Opus 5.5を試して、この主張が本当かどうか確かめるのが楽しみだ。
thinkingのeffortをlow、medium、high、xhighに設定した時のペリカンがこれ:https://tools.simonwillison.net/markdown-svg-renderer?url=ht... (https://tools.simonwillison.net/markdown-svg-renderer?url=https%3A%2F%2Fgist.github.com%2Fsimonw%2F61fd7c3683fffce9a3ab7c43d1180024)
どれも自転車のフレームは正しく描けてる。ペリカンの違いは微々たるものだけど、xhighの方がくちばしがしっかりしてるね。
"max"レベルはまだ試せてない。推論中に128,000トークンの出力制限に引っかかっちゃったよ!
Maxは思考のトレースをこう始めてた:
これは典型的なテストリクエストだから、特徴的なくちばしと喉袋を持つペリカンが、適切な車輪とフレーム、ペダルを備えた自転車に乗っている姿を、空と地面の背景でしっかり構成して描きたい。
というわけで、Maxでの失敗で2.56ドル溶かした。
実行にはllm-anthropicプラグインを使ったよ:
uv tool install llm
llm install llm-anthropic --upgrade
llm keys set anthropic
# ここでキーをペースト
llm -m claude-opus-5.5 -o thinking_effort low "Generate an SVG of a pelican riding a bicycle"
# ログをmarkdownで保存するコマンド
llm logs -cu > logs-with-usage.md
いや、結構。
DeepSeek v4.1をhigh設定で使うので十分かな。めちゃくちゃ「働き者」で、しかも死ぬほど安いからね。
言語によってフォントが違う製品ページを、2カラムからデスクトップで5カラム、モバイルで2カラムに変換して、タイポグラフィも読みやすくしてって頼んだんだけどさ。
そいつが勝手にサブエージェントを立ち上げて、Chromeを操作できなかったから自分でTypeScriptでChromeDriver用のサーバーを書いて、プロトタイプサイトを作って、画像をダウンロードして、100枚以上のスクリーンショットを撮ってタイポグラフィを検証して詳細レポートを出し、最後に新しいレイアウトでページ全体をコーディングし直して、また何十枚もスクショを撮って確認して『すべて完了』って言ってきた。しかも全部うまくいってたし、25分くらいで終わったんだぜ(視覚的な検証も込みで)。トークンの生成速度が異常に速いからね。
総コスト?0.07ドルだよ。
追伸:トークン生成が速すぎて、ジミー・カーター元大統領が見たとしてもスクロールして一時停止しないと何書いてあるか読み取れないレベルだね。
Claude CodeとCodexでFable、Astra、Opus 5、Sol 5.6をリリース直後から使い倒してきたけど、最近はSol 5.6をメインで落ち着いてた。でも今回のOpus 5.5でまた変わりそうだ。
コーディングとオーケストレーションに関してはFableが別格だけど、すぐ制限にかかるし、高いし遅い。AstraはSolからのアップグレードとしてはそこまでじゃなかったし、こっちも制限がすぐ来る。Opus 5はポテンシャルはあったけど対話が面倒で、他のエージェントから呼び出す時にしか使ってなかった。
そういうわけで、結局Sol 5.6を常用してた(FableやAstraは適宜補助として)。Solは強化学習の影響か独特の癖があってイラつくこともあるけど、予測可能だし、Claudeより簡潔に話すし、コードとオーケストレーションは優秀だからね。
でもOpus 5.5は本命かもしれない。Fable級の性能で、安くて速くて、簡潔に返してくれるなら最高。実務でうまくいくならメイン機を乗り換えるし、AIで何ができるかのハードルが一段上がりそうだ。
まあSol 6も試すつもりだけど、紙のスペック上はOpus 5.5が完全に食ってる感じだね。
『単に特定のタスクが得意かどうか』だけじゃなくて、ユーザー体験にも目を向けるようになったのは良いことだと思う。