Nvidiaの爆速AI「Nemotron 3.5 Lightning」と柔軟なモデル制御「NeMo Switchyard」がついに登場
Nvidia Nemotron 3.5 Lightning and NeMo Switchyard
Nvidia Nemotron 3.5 Lightning and NeMo Switchyard
Nvidiaから注目の新技術がリリースされました。推論速度を劇的に向上させる「Nemotron 3.5 Lightning」と、複数のモデルを動的にルーティングして最適化する「NeMo Switchyard」です。次世代のAIアプリケーション開発において、パフォーマンスと柔軟性を両立させるための重要なアップデートとなっています。
NeMo Switchyard, an open source library for smart routing
When deployed, NeMo Switchyard can intelligently direct each request to the most capable and suitable model for the job
こういうルーターって、2回目のリクエストを送るときのプロンプトキャッシュはどうやって処理してるんだ?
セッションごとにモデルを固定するのか?でもそれだと、セッションの2回目のメッセージが必ずしも最適なモデルに送られるわけじゃなくて、前回と同じモデルに送られるだけになっちゃうよね。
こっちの以前の投稿でNemotronについて24件のコメントがすでにあるよ: https://news.ycombinator.com/item?id=49257947 (https://news.ycombinator.com/item?id=49257947)
一つ提案があるんだけど:
問題:AIのせいで情報が溢れかえっている
解決策:人間はもっとミニマリストな文章スタイルを採用すべき。
例:このウェブページ全体だって、箇条書き10個で済むはず。
「RAMの終焉(ramapocalypse)」の大きな影響の一つとして、より小型で効率的なモデルへの注目がさらに高まっていると思う。個人的には、数兆パラメータのモデルは根本的に何かが欠けていると感じていて、小型で効率的なモデルへのシフトが構造的な進化を促し、将来的な飛躍につながると確信してるよ。
Artificial Analysisのグラフを見ると、突出した性能のMaxバリアント以外、Qwenシリーズのモデルを都合よく除外してるよね。どうせなら、もっと堂々と正直になってほしいな。
Nemotron 3.5 Lightningって、GPUのVRAMはどれくらい必要?q4なら16GBで動くかな?
新しい小型モデルが続々リリースされる流れは最高だね。NVIDIAのモデルがMLXを使ってApple Siliconでこんなにうまく動くなんて驚き。今朝、古い(安い)MacでOpenCodeと一緒にnemotron-3.5-lightning:30b-mlxを試したけど、動作がゆっくりなこと以外は特に問題なかったよ。