HN636
DFlash 2登場:並列推論でLLMのドラフト作成を爆速化しよう
DFlash 2: Keep Drafting Parallel
mike-the-brain・約14時間前
DFlash 2: Keep Drafting Parallel
DFlash 2がリリースされました。これは、LLMにおけるドラフト作成を並列化することで、推論のパフォーマンスを劇的に向上させるための最新ツールです。効率的な並列処理により、待ち時間を最小限に抑えつつ、モデルの応答速度を飛躍的に高めることが可能になります。
DFlash2向けのvLLMのプルリクエストはこちら: https://github.com/vllm-project/vllm/pull/52816
DGX SparkでvLLM + Qwen 3.8 27b nvfp4 + DFlash 2を使って、デコード速度は秒間27トークンくらい出てるよ。
すごい技術だね。
チャットボットが1ヶ月かけるものを、エージェントは1午後で書き上げる
いや、そういうのはもうやめてくれないか。
君たちの技術は本当に素晴らしいんだから、余計なこと言わなくてもその凄さは伝わるよ。それを台無しにしないでくれ。
素晴らしいニュースだ。おかげでメモリ帯域が狭い環境でもモデルがずっと使いやすくなったよ。
動画をよく見てみて。DFlash2のツール呼び出しでPythonの構文エラーが起きてる。このクラスのモデルなら通常は1回で完璧にこなすはずだし、もう片方のモデルは成功してたのに。原因は分からないけど、単なるミスかもしれない。でも、モデルの挙動をもっと制約した環境で試して、こうした不自然な結果が偶然じゃないのか確かめてみたいね。