2026年8月18日(火)掲載 3,656本日 24
HN293151

OpenAI史上最高!GPT-5.6 Solの「Vision性能」が革命的すぎる件

GPT 5.6 Sol is the best "vision" model OpenAI ever released

plurby約22時間前

議論

11
0plurbyスレ主293約22時間前

現在、OpenAIが公開したモデルの中で「GPT-5.6 Sol」が、最も優れたビジョン(画像認識・視覚処理)モデルであると話題になっています。その精度の高さと処理速度は、従来のモデルを凌駕するレベルです。

1weli約21時間前

あくまで個人の経験に基づく意見だけど、GPTはビジョン関連が本当に強いね。少なくとも彼らのMoEはかなり整合性が取れてる。自分の経験上、Claudeのモデルは言語処理にはすごく優れてるけど、画像を見てデザインの改善点や理由を判断させようとすると、途端に精度が落ちるんだよね。簡単なベンチマークとして、アプリの機能画面のスクリーンショットを渡して「UIの不自然なブロックを特定して、読みやすさと一貫性を改善して」と指示してみるんだけど、Solはページを構成単位に再構築して、アプリ全体のルック&フィールに基づいた素晴らしい提案をしてくれる。一方でClaudeは、一つの箇所にこだわりすぎて、残りの部分や全体のまとまりを完全に無視してしまう傾向がある。

2kzrdude約21時間前

3つ目のビジョンベンチマークの結果を見ると、Solは100%正解しているのに、正解データ側に1つエラーがあるみたいだね。単純な見落としかな。次のベンチマークでもSolは正解しているように見えるけど、なぜかバウンディングボックスが90度回転してるね。

3evrimoztamur約21時間前

提示されているペニーのサンプル画像を見ると、モデルやハーネス側でEXIFの回転情報が正しく認識されなかっただけみたいだね。コイン自体はちゃんと認識できてるけど、全体が90度回転しちゃってる。

4mv4約21時間前

皮肉なことに、「最高のビジョンモデル」を披露するために選ばれたピル(錠剤)のカウントという例題は、25年も前に作られたOpenCVのテンプレートマッチングで簡単に解けてしまうものだよ。

5HarHarVeryFunny約21時間前

「まだ明確な限界がある。Gemini 3.5 Flashの方が、高頻度の検知やカウントのベンチマークにおいては、(GPT 5.6 Solと比べて)特にコスト面で実用的な選択肢であり続ける」というまとめ方は、かなり控えめな表現に聞こえるな!実際、OCRという例外を除けば、全てのベンチマークでGemini 3.5 FlashがGPT 5.6 Solを上回っているし、そのコストも1/3なんだから。

6bearjaws約20時間前

「伝統的」なAIモデルでも既にできること(錠剤のカウントなど)にSolが使われているのを見ると笑っちゃうね。うちの薬局でもビジョンモデルを使ってるけど、ロボット制御にSolのようなモデルを組み込んでレイテンシが悪化するのは考えられないよ。おそらく25〜50倍は遅くなるだろうから。

7fpgaminer約20時間前

Gemini 3 Flashも今回の比較に入れるべきじゃないかな。少なくとも3.7は。僕のテストの多くでは、3.5と3.6はどちらもバージョン3に比べてビジョン能力が退化していたし、コストもずっと高い。3.7になってようやく3より少し良くなった感じだね。

8schopra909約20時間前

僕たちの実験では、ダントツで世界最高の動画キャプションモデルだね。1年前は全くそんなことはなかったのに。1年前にGPT 5で推論機能が導入された時は、短い動画のキャプションでもGPT-4oより性能が悪かった(実際には起きていない動作を幻覚のように生成するなど)。当時のGPT 5はFPSのサンプリングレートに対して非常に繊細だったからね。他の最先端LLM(Gemini Proなど)は、フレームサンプリングレートを上げても1秒未満の細かい変化をほとんど認識できないから、明らかに長い動画の理解に最適化されている。Solは複雑な1秒未満の動き(例:女性が突然右を向くなど)を正確にキャプションできた初めてのモデルだよ。異なるFPSサンプリングレートに対しても堅牢だから、おそらく異なるFPSでサンプリングされた動画で学習したんだろうね。

9faxmeyourcode約19時間前

記事を読んでもはっきりしないんだけど、Solに構造化データとしてバウンディングボックスの座標を出力させているのかな?個人的な経験だけど、1800年代の手書きの国勢調査データの一部を読み取るために、SolがPythonを使ってクロップ(切り抜き)やズーム、画質の強調(シャープネスや明るさの調整)をするのを見たことがある。単に座標を出力させるという点では能力のミスマッチがあるのかもしれないけど、使えるツールがあれば回答を見つける能力はずば抜けていると思う。まあ、リンゴとオレンジを比べるような話かもしれないけどね。あと、古い眼鏡を識別させようとした時は全く歯が立たなかったから、特定のビジョンタスクに関してはまだ発展途上な面もあると思う。