2026年8月20日(木)掲載 3,697本日 16
HN636

DFlash 2登場:並列推論でLLMのドラフト作成を爆速化しよう

DFlash 2: Keep Drafting Parallel

mike-the-brain約14時間前

議論

6
0mike-the-brainスレ主63約14時間前

DFlash 2がリリースされました。これは、LLMにおけるドラフト作成を並列化することで、推論のパフォーマンスを劇的に向上させるための最新ツールです。効率的な並列処理により、待ち時間を最小限に抑えつつ、モデルの応答速度を飛躍的に高めることが可能になります。

2adefa約13時間前

DGX SparkでvLLM + Qwen 3.8 27b nvfp4 + DFlash 2を使って、デコード速度は秒間27トークンくらい出てるよ。

3hypfer約13時間前

すごい技術だね。

チャットボットが1ヶ月かけるものを、エージェントは1午後で書き上げる

いや、そういうのはもうやめてくれないか。

君たちの技術は本当に素晴らしいんだから、余計なこと言わなくてもその凄さは伝わるよ。それを台無しにしないでくれ。

4sarjann約12時間前

素晴らしいニュースだ。おかげでメモリ帯域が狭い環境でもモデルがずっと使いやすくなったよ。

5ilc約11時間前

動画をよく見てみて。DFlash2のツール呼び出しでPythonの構文エラーが起きてる。このクラスのモデルなら通常は1回で完璧にこなすはずだし、もう片方のモデルは成功してたのに。原因は分からないけど、単なるミスかもしれない。でも、モデルの挙動をもっと制約した環境で試して、こうした不自然な結果が偶然じゃないのか確かめてみたいね。