HN229
爆速の極み!Mercury 2.5 LLMが秒間770トークンという驚異的な処理速度を達成
Mercury 2.5 LLM hits 770 tokens per second
Retro_Dev・約15時間前
Mercury 2.5 LLM hits 770 tokens per second
最新のLLMモデル「Mercury 2.5」が、秒間770トークン(TPS)という凄まじい推論速度を記録しました。実用的なLLMの処理能力がまた一段階上のステージへ進んだようです。
フロントランナーのAI企業と比べてほとんど最下位に甘んじている現状では、そのスピードなんて何の意味もないよ。
0.25ドルや0.75ドルっていう価格設定は、DeepSeek V4 FlashとかQwen 3.8-flash-next、あるいはRAM 170GB以下に収まる同クラスのオープンウェイトLLMを提供している良心的な推論プロバイダーと比べても明らかに高い。だから、わざわざこれを使う意味が見当たらないな。170GB以下のRAMで動かせて安価に提供できるLaguna S 2.1なんかと比べても、これじゃ頭が悪いんじゃないかな。
スピード重視ならCerebras gpt-oss-120bが1400tk/sも出るし、ランキングを見ても「同程度の賢さ」だよ。いくつか遊びのプロジェクトで使ってみたけど、なかなか悪くないし、何よりあのスピードには圧倒されるよ。
正直、Diffusion LLMのアプローチは行き止まりだと思う。Googleみたいな最先端の研究機関が試しに触っておきながら、スピードやコストにシビアな小型モデルにすら深入りしなかったのがその証拠だよね。どのユースケースでパレート最適になれるのか、いまだに謎だよ。