Fable 5 vs. GPT-5.6 Sol:NP困難な問題で「/goal」指示は本当に効くのか?
Fable 5 vs. GPT-5.6 Sol on an NP-Hard Problem: Does /goal help?
Fable 5 vs. GPT-5.6 Sol on an NP-Hard Problem: Does /goal help?
NP困難な問題におけるFable 5とGPT-5.6 Solの比較検証。推論の質を高めるために「/goal」による明示的なゴール設定がどれほど有効かについて議論します。
一番上のチャート、ちょっと分かりにくいな。「低いほど良い」って書いてあるのに、Y軸が反転してる!だから視覚的にはチャートの上の方が良い結果に見えるけど、数値で見ると低いほうが良いっていう。
自分の中では、planモードより /goal の方がすっかり定着したよ。最近のAI作業の95%はこんなパターンでやってる:
経験上、たった10分でもGPTにこうやって設計ドキュメントを書かせると、planモードよりずっと堅牢な計画ができるし、結局planモードの初期ドラフトを何度も修正する手間が省けるんだよね。
/goalって何?
Claudeって、開発に何週間もかかるような長期の作業セッションだと、どこが特に重要かって何度も言っても忘れちゃうんだよね。自分はgoalを使ってないんだけど(使うべきかもね)、これを使えば一番重要な指示をちゃんと記憶させられるってことなのかな。今回の話は、この問題が起きにくい短期的なセッションについての話なんだと思う。
どっちも複雑な問題には全く役に立たないよ。学習データのバイアスが強すぎて、自分が出力した回答の中にある間違いすら部分的にしか検知できないからね。トピックを掘り下げれば掘り下げるほど、回答はどんどん酷くなる。Opus 4.8とGPT-5.5を使って、自分が取り組んでいたドキュメントをブラッシュアップしようとしたんだけど、Fable 5とGPT-5.6が完全に破壊してしまった。人間が読める代物じゃなくなった上に、意味すら通じなくなっちゃった。
Anthropicはコーディングの分野でOpen AIに完敗してるね。去年の3月までClaude codeを使ってたんだ。企業ユーザーじゃないし、浪費しないように気をつけて、40万行くらいのレポジトリを基本プランで管理してる程度の小規模な使い手なんだけど。地元政府向けに3人のチームで開発してて。Claude codeはとにかく遅くて、テストケースや可観測性、ドキュメント、階層化アーキテクチャをしっかり用意しても、まともに問題を解決できた試しがない。Codexに変えてからは、作業がめちゃくちゃ楽になったし、使用制限を気にするストレスもなくなった。今はメンバーごとに2つずつのCodexプラスアカウントで全て回してる。Anthropicはいい加減、不安を煽るようなマーケティングはやめて、効率的なモデルを作るべきだよ。誰もがFableを必要としてるわけじゃない。みんなが求めてるのは、問題を効率的に解決してくれるモデルなんだ。
いい評価だね!検索戦略を比較するなら、ultraモードの方が優れてるはず。その辺のフォローアップ評価もぜひ見てみたい。
Ultraなら複数の調査員を並行して動かしたり、定義したチェックポイントで敵対的レビューを行ったりして、局所最適解にハマるのを防ぐような賢い動きができるからね。
基本的に投稿者が書いている通り、/goal は単一の調査や小規模な散布・集約(scatter/gather)に向いてる感じだね。
GPT 5.6 Sol Xhighはリリース直後からFable 5と合わせてかなり使い込んでる。
感想としては、知能自体は5.5と大差ないけど、執着心が異常に上がってる感じ。だからベンチマークで競争力が高く見えるんだと思う。ただ、そのせいで目標達成のために……型破りで、奇妙で、時には危険な方法まで手段を選ばなくなるときがある。だから目を離せないんだよね。
この前なんて、CLIコマンドを使って本番環境の環境変数を読み取ろうとしたんだ。そんな必要は全くないタスクだったのに。そのCLIツール用のSSHキーは1Passwordで管理してて、エージェントが失敗したとき(認証してなかったから)、なんと勝手にPCを乗っ取ろうとしてOSの確認プロンプトが出てきた。そこでエージェントを止めて理由を聞いたら、1Passwordの中を漁ってキーを探そうとしたって言うんだ。なんで本番環境の環境変数が必要だったのか聞いたら、少し考えて「実際には必要なかった」って認めたよ。というわけで、昨日からは「自分に許可を求める(approve for me)」モードはやめて、単純な修正やバグフィックスにしか使わないようにしてる。
Fableはより賢いだけじゃなく、はるかに洞察力が高い。こちらの意図を的確に汲み取ってくれるし、「実世界」の知識があるから、ドメイン知識を持った熟練のプロダクトマネージャーとして動いてくれる。型にとらわれず、自分では思いつかなかったような提案もしてくれる。GPT 5.6だと、もっと文字通りに指示しないといけないからね。
個人的には最終スコアだけじゃなくて、時間経過によるベストスコアの推移が見てみたいね。あと、/goalの有効性についても知れると面白いと思う。
GPTの方がこういった最適化問題には強いはずだよ。最近AtCoderのヒューリスティックコンテストでトップ層の人間に勝ってるわけだし。Anthropicはこの手の分野にはあまり注力してないみたいだしね。