LLMの限界:AIは「空間」を理解できない?位置情報問題の正体
Position: LLMs Can't Jump
Position: LLMs Can't Jump
LLM(大規模言語モデル)の進化は目覚ましいものがありますが、物理的な位置関係や空間認識については、依然として大きな壁が存在します。本質的にテキスト予測モデルであるLLMは、現実世界のオブジェクトがどのように配置されているのか、あるいは「跳ぶ」という動作が空間の中で何を意味するのかを真に理解しているわけではありません。この投稿では、なぜ最新のAIでも位置関係の推論に失敗するのか、その技術的な限界と考察を深掘りします。
「コンピュータはチェスで俺を負かしたけど、キックボクシングじゃ俺には敵わなかった」っていうジョークを期待して開いたんだけどな。実際の内容は「直感の飛躍」についてで、悲しいことにジョークじゃなかった。ここでよく提案される実験の一つに、1980年か1990年までの全テキストでLLMを作って、それが自力で進化できるか試すっていうのがあるね。
理論物理学における創造的な飛躍には感覚的な経験の裏付けが必要だっていう説があるけど、それに対する明らかな反論は、人間は感覚的な裏付けがなくても抽象的な分野で創造的な飛躍ができるってことだよね。論文の最後でもそれに触れていて、「数学やコンピュータサイエンスのような抽象的な領域では、感覚的経験(E)は高次元トポロジーに基づいているか、あるいは一般性や最小性といった別の目標を持っている可能性がある」と述べている。でも、もし高度な高次元トポロジーを通じて抽象的な領域で感覚的経験が可能なら、十分に高度なLLMが物理学のような分野でそれと同等の高次元トポロジーを構築して、創造的な飛躍に使えない理由って何があるんだろう?
これってLLMそのものより、ハーネス(仕組み)や環境のせいじゃないかな。GodotやUnityのような複雑な環境でのLLMのやり取りを見てると、「飛躍」が全く起きていないという考えには疑問を感じる。環境から切り離されたLLMなんて、暗い洞窟にいる水槽の中の脳みたいなものだし。前進するためには、そこからデータをサンプリングして働きかけるための外部環境が必要なんだよ。
最近X(Twitter)で話題になった、著者Tom Zahavyによるフォローアップツイートを再掲する価値がありそう。[1]
私の論文「LLMs Can’t Jump」についての考察
論文が注目を集めているようなので、いくつか考えを共有して明確にしておきたい。
まず第一に、一部の人がこれを「DeepMindがAI科学に水を差している」とか「LLMは決して科学的発見ができないと主張している」と解釈しているようだけど、全くそうではない。
これは個人的なポジションペーパーであり、会社のAI科学に対する見解ではないし、私の立場でもない。AlphaProof(IMOメダルを獲得した初のAIシステム)のコア貢献者として、DeepMindの同僚や他の最先端ラボ、学界がLLMを使って素晴らしい発見をしており、これからもそうし続けることを身を持って知っている。この論文は「LLMは袋小路だ」なんていう類のものではない。
むしろ、この論文は私が一般相対性理論の誕生を研究するために深く掘り下げた結果だ。私は現代のAIシステムが全く同じ種類の飛躍をするには何が必要かを探りたかった。特に、物理的な直感に基づいてアインシュタインが思考実験から定式化した重要な公理である「等価原理」に焦点を当てた。私は、現代のAIシステムにそうした思考を持たせるために何が必要かを解明しようとしていたんだ。
AIにこの特定の能力を与えることが、次にやるべき最も緊急なこととは限らない。おそらく、現在のレシピを改善するだけで近い将来多くのエキサイティングな発見につながるだろう。実際、それこそが私が今取り組んでいることだ(期待を裏切ってすまない!)。もちろん私が間違っていて、単にシステムをスケーリングするだけで物理学や他の分野で新しい発明が生まれる可能性も十分にある。
とはいえ、論文を書いた昨冬の時点での私の立場はこれだし、今もそれを貫いている。この分野には、次世代のAIシステムに影響を与えるような探求すべき興味深いアイデアがいくつかあると思う。この立場について多くの興味深いフィードバックをもらえて本当に幸運だった。みんなメッセージをありがとう!
アインシュタインが特殊相対性理論を構築した理由を「マイケルソン・モーリーの実験の矛盾を解決するため」と説明するのは、歴史をあまりに単純化しすぎだね。論文からの引用がそれを物語っている。
2つの公理から、アインシュタインはローレンツ変換を導き出した...
アインシュタインが導き出したなら、「ローレンツ」って一体誰なんだ?
特殊相対性理論の基盤は電気力学とマクスウェル方程式の対称性の研究だった。アインシュタインの論文のタイトルはまさに「動いている物体の電気力学について」であり、マイケルソンとモーリーの引用なんて一度もしていないんだから。
(コーディングエージェントのような)最も収益性の高いユースケースが人間の能力の拡張に依存しているように見えるのに、なぜ皆こぞってLLMで人間を置き換えようと必死なんだろう?
LLMがエラー0%にならない限り、人間がループの中に入り続ける必要がある(たとえそれがプロセスの責任を負うためだけだとしても)だろうに。
この論文は今年4月30日のものだけど、OpenAIは5月20日に単位距離問題の反例を発表したんだよね。つまり、この論文は古くなったというより、かなり的外れな内容になっちゃったみたいだ。
これは完全に一個人の意見であって、何らかの定量的根拠に基づいているわけじゃないよね。
実際、この問いには厳密に答える方法があるはずだよ。
LLMに限界があるという先入観を補強するだけの低品質な記事が持て囃されるのを見ると、本当にイライラする。
もう手遅れかもしれないけど、以前から主張しているように、言語というのは人間の経験を根本的に損失を伴って符号化したものなんだ。「言葉にできない」と言ったり、「子供を愛している」と「アップルパイを愛している」で同じ「愛」という言葉を使っても、聞き手がその文脈で込められた深さをなんとなく理解できたりするように、言葉には限界がある。つまり、アインシュタインは自然言語ではエンコードしきれないレベルで世界をシミュレートし、実験を行っていたという考えには少し納得できる。AIはほぼ言語のみで構成されたトレーニングデータに縛られている以上、それ以上のことができるようになるんだろうか?もしAIが人間の経験の不完全な表現で学習しているとしたら、その経験を超えたシミュレーションなんてできるわけがない。3次元を超えた物体をイメージする時のように人間がうまくやれている手法を使わない限りはね。おっと、ちょっと話が逸れてしまった。
ずっと言ってきたことだけど、AIが斬新な説明的仮説を生成できないという点は、会計士や中間管理職、さらにはレジ打ちのような仕事を自動化する上での大きな障壁になっているね。