もはや無料同然?AIトークンコストの劇的低下がもたらす未来
Tokens too cheap to meter
Tokens too cheap to meter
「計量すら不要なほど安価なトークン」――かつて原子力発電に対して使われた有名なフレーズが、今のAIトークン単価の劇的な下落を象徴する言葉として再注目されています。推論コストが無視できるレベルまで下がった今、私たちはどのようなアプリケーションを構築すべきでしょうか?インフラコストの制約から解放された開発者にとって、真に価値あるプロダクトとは何かを考えるフェーズが到来しています。
NVIDIAは今後も絶好調だ
NvidiaもAnthropicやOpenAIと同じプレッシャーに晒されていると思う。Nvidiaは研究分野を支配し、おそらくトレーニング面での支配も続くだろうけど、実際のボリュームがあるのは推論(インファレンス)のほうだ。推論におけるNvidiaのリードなんてせいぜい数ヶ月、最先端の研究室がオープンソースに対して持っているリードと同じようなものだよ。NvidiaはRubin CPXを大量に売るだろうけど、その利益率がB200よりずっと低くなるのは間違いない。その市場は競争が激しすぎるからね。
この記事(OP)、洞察に満ちていて読む価値があったよ。HNで共有してくれてありがとう。
唯一、OPの分析が甘いなと感じたのはビジネスモデルの実現可能性についてだね。すべてのプレイヤーが、将来の利益がこの投資を正当化してくれるはずだと信じて、インフラに狂ったような金額を注ぎ込んでいる。彼らは、AGIレースの勝者が「虹の果てにある黄金の壺」を見つけると信じているんだ。
OPは、ビジネスモデルの実現可能性についての問いを、簡単な定性的議論とわずかなハードデータでさらっと流してしまっている。例えば、インフラに投じた1兆ドルごとに年利10%以上のリターンを得るには、そのインフラの所有者は(投資を差し引いた営業利益として)永続的に年間1000億ドル以上のフリーキャッシュフローを稼ぎ出さなきゃならない。そんなの実現可能なの?なぜ?どうやって?
OPはそういった問いをほとんど考慮していない。
トークンはツール呼び出しより安くなる
著者は、GPT-5.6 Lunaの呼び出しがgrepと比べて4〜5桁高いだけだと観察し、現在の進歩ペースならLLMの呼び出しコストがすぐにgrepより安くなると予測している。ここで「スタインの法則」を思い出すべき時だと思う。「永遠に続かないことは、いつか終わる」。この効率化の改善は永遠には続かない。LLMが指数関数的な進歩を続けてgrepを追い越すというよりは、むしろgrepのような高品質にコンパイルされたソフトウェアの呼び出しコストが下限となって、LLMがそこに漸近していく形になる可能性の方が高いと思う。(量子コンピューティングや室温超伝導のような真のブレイクスルーがない限りね。)
2025年と2026年のコスト比較にミスがあるようだ。2025年のチャートの軸は「インテリジェンス・インデックス」全体を運用するコストだけど、2026年版は「タスクあたりの加重平均コスト」になっている。
書かれている主張に反対するわけじゃないけど、コストがそんなに急激に下がっているとは思えないな。
タスクあたりの価格低下について、昨日Epoch AIがかなり深い分析を出していたよ [1]。まともな統計的分析で、より説得力があり根拠のある結論を出している。見出しのポイントはこれだ:
「ある特定のレベルのパフォーマンスにおけるコストは、そのレベルが初めて達成された直後、つまりそれが最先端(SOTA)であるときに最も速く低下する。このパターンは、我々の主要な5つのAI能力ベンチマークのうち3つで見られる。5つ平均で見ると、SOTAとしてデビューしたばかりのパフォーマンスに対して、コストは四半期で66%(年間で75倍)低下する。2年後には、価格低下は半分になり、四半期で32%(年間で4.7倍)となる。」
分析自体はもっとニュアンスがあってかなり面白い読み物だよ。
[1] https://epoch.ai/publications/the-plunging-price-of-thought
「メーターで測るには安すぎる(Too Cheap to Meter)」というフレーズ、1954年の原子力発電の公約を思い出すよ。
「子供たちが家で、メーターで測る必要もないほど安い電力を享受できる日が来ることを期待しても過言ではない…」ルイス・ストロース
https://en.wikipedia.org/wiki/Too_cheap_to_meter#Origins
奇妙なことに、僕の電気代はメーターで測られているし、高額なんだけどね。
LLMがローカルで動くことを「望んでいる」のは確かだけど、メーカーから十分な供給量のVRAMや(少なくとも)「ユニファイド」メモリが出るまでは、広く普及することはないだろう。(もちろん、政府がローカルモデルを禁止するような極端な規制変更がないという前提だけど。)だから(専門家じゃない僕の見たところ)今後数年のLLMの未来は、主にメモリのファブ(製造工場)のキャパシティがいつ、どれだけ追加されるかという細かな話に集約されると思う。LLM SaaSサービスからの将来の需要がどうなるか(あと、彼らがトラブルに見舞われた場合の既存ハードウェアの在庫がどうなるか)といった話は二の次だ。(AGI並みのブレイクスルーが起きて、近未来の最先端モデルが今日のモデルより圧倒的に価値を持つようになることはない、という前提ね。)大手メーカーにとって高利益なビジネスは、VRAMを効率的に使うLLM SaaSプロバイダーへの販売だけど、ボリュームが出るビジネスは、VRAMを非常に非効率に使う数百万台のノートPCにチップを載せることだ。メーカーは出荷キャパシティが増えるにつれて、高利益モデルから高ボリュームモデルへ移行したいはずだけど、彼らはかなり慎重なペースで進めたいようだね。中国の競合による突き上げや、データセンターからの需要低下がいい刺激になって、事態が加速するといいんだけど。
あちこちで見かけるこの「Artificial Analysis」のチャートについて文句を言わせてほしい。
「最も魅力的な象限(Most attractive quadrant)」なんて概念は完全に無意味だ。パレート曲線の要点は、曲線の上の各点が少なくとも1つの次元において他より優れていて、指標間の相対的な重要性を評価せずに比較できることにある。もし2つの指標の複合スコア(非負の重み付き和など、単調非減少関数なら何でも)を作ったとしても、そのスコアを最大化するのは常にパレートフロンティア上の点のどれかになるはずだ。
だから、記事内の2番目のチャート(最初のAAチャート)の数字だけで判断すると:
(もちろん、グラフに表されていない他の要因をスコアに含めれば、選択は変わるだろうけどね。)
あと、ラベルの配置の仕方も気に入らないし、ラベルと点を結ぶ灰色の線も控えめすぎて見づらいよ。
当時は新しかった原爆について、それがどうなるかを予見したオーウェルの言葉をいつも思い出すんだ。
「もし原爆が自転車や目覚まし時計のように安く簡単に作れるものだったら、私たちは野蛮な状態に逆戻りしていたかもしれない。しかし一方で、それは国家主権や中央集権的な警察国家の終焉を意味したかもしれない。もし現状のように戦艦を作るのと同じくらい珍しく高価な代物であれば、それは『平和なき平和』を際限なく長引かせる犠牲を払って、大規模な戦争を終わらせる可能性の方が高い。」
特に重みの公開(オープンウェイト)が進んでいる現状を見ると、AIは戦艦というよりは目覚まし時計の方に近い気がするよ。1944年の1ドルは、今の月額20ドルくらいに相当するだろうしね。
一つすごく大事なことが抜けてる。投機的デコーディング(Speculative decoding)だね。Dflash(2)やDsparkなんかを使うと、1回のフォワードパスで6〜7トークンを生成できる。(念のため補足すると、フォワードパスからの埋め込みを、次のトークンを予測する拡散モデルに入力して、元のモデルでそれを検証するっていう、とても安価な処理だよ)。おかげで、同じくらいの計算量でより多くのトークンを生成できるんだ。