【爆速】ローカルLLM環境の常識が変わる!エージェント特化型の推論エンジン「Magnitude」が登場
Launch HN: Magnitude (YC S25) – Self-optimizing inference engine for agents
HNの皆さん、こんにちは。AndersとTomです。私たちは、手元のハードウェアに合わせて自動最適化を行い、限界まで高速な推論を実現するエージェント向けエンジン「Magnitude」を開発しました。Mac、Linux、Windowsを問わず、llama.cppと比較して最大2倍の速度を叩き出します。私たちは以前、4,000以上のGitHubスターと10万ダウンロードを記録したオープンソースのブラウザエージェントを開発していました。その際、ローカルLLMを快適に動かしたいと考えていましたが、既存の推論エンジンでは用途に合うものがなかったのです。現在のエンジンには、いずれもトレードオフが存在します。データセンター向けのバッチ推論重視(vLLM, SGLang)、汎用性重視でハードウェア最適化が不十分(llama.cpp, Ollama)、あるいは特定のハードウェアに特化しすぎてエンジンとしての完成度が低いもの。また、エージェント特有の「長時間のセッション」「複数同時実行」「PCでの他の作業の共存」といったニーズに対応しているものもありませんでした。Magnitudeは以下の強みでこの問題を解決します:・デバイス内コンパイルとチューニング:モデル実行前に実機でカーネルをチューニングし、ハードウェア特化型と同等の性能を実現。・主要アーキテクチャへの集中:人気のオープンウェイトモデルに対して効率的なカーネルを実装。・動的メモリ割り当て:モデルウェイトに必要な分だけを確保し、使用状況に応じてメモリを動的に解放。・ハイブリッドPaged Attention:SGLangの知見を活かし、セッション間でプレフィックスキャッシュを共有しつつメモリ配置を最適化。Rustで開発されたMagnitudeはApache 2.0ライセンスで完全オープンソースです。ベンチマーク結果(Qwen 3.6 35B A3B 4bit / 64k context)では、Mac M4 Pro環境でデコード速度が92%向上、メモリ消費量も27%削減するなど、圧倒的なパフォーマンスを示しました。デスクトップアプリとして配布しており、既存のエージェントツールと簡単に接続可能です。詳細なデモはこちらをご覧ください:https://www.youtube.com/watch?v=0qE8BWEZu7o 今後は、メモリから溢れる巨大モデルをロードするエキスパートストリーミングや、独自カーネルコンパイラの実装、マルチデバイス最適化を予定しています。ぜひ試してみて、フィードバックを頂けると嬉しいです。一日中回答していますので、コメント欄でお待ちしています!