爆速・格安・高精度!OSS音声AIの常識を覆す「Nari Qwen3-TTS/ASR」が登場
Show HN: Nari Qwen3-TTS and Qwen3-ASR – High accuracy, low latency and cost
Show HN: Nari Qwen3-TTS and Qwen3-ASR – High accuracy, low latency and cost
HNの皆さん、Nari LabsのTobyです。私たちはOSSの音声モデルを「爆速」で動かすための研究開発を続けてきました。昨年、自然な対話が可能な初のOSS音声合成モデル「Dia」をリリースして以来、音声モデル界隈は驚異的な進化を遂げています。しかし、依然として市場はクローズドなモデルに支配されています。私たちはこれが推論エンジンの問題だと考えました。既存のvLLMやSGLangはマルチモーダルな推論には最適化されていません。そこで、Qwen3-TTSに特化した推論エンジンを開発し、オープンソース化しました(https://github.com/nari-labs/nari-qwen3-tts )。このエンジンは10 RPSで50ms未満のレイテンシを実現し、オープンなモデルでもより速く、安価に運用できることを証明しました。私たちは誰もが低コストかつ高品質なサービスを利用できるように懸命に取り組んでおり、その成果としてクローズドなモデルを凌駕するパフォーマンスを達成しました。業界で権威のあるCoval (YC S24) のボイスAIベンチマークでは、当社のQwen3-TTSエンドポイントがレイテンシで2位、精度(WER)では11LabsやCartesiaなどを抑えて堂々の1位を獲得。さらにコスト面でも最安値を実現しました。Qwen3-ASRについても、最低レベルのレイテンシと1位にわずか0.1%差の精度で2位につけており、価格もリスト内で2番目に安価です。これらのモデルを軽量かつ高性能に保つには、高度な推論エンジニアリングが必要でした。興味深いことに、Alibabaの公式エンドポイントよりも私たちのモデルの方が精度・速度ともに優れています。とはいえ、素晴らしいOSSモデルを公開してくれたQwenチームには敬意を表します。私たちは今後も音声技術のコモディティ化を進め、あらゆるアプリでコストを気にせず最高のTTS/STTが使える世界を目指します。現在は話者分離(ダイアライゼーション)や動画、ワールドモデル推論などにも取り組んでいます。今後の展開に期待してください!
翻訳処理中です。しばらくしてから再度お試しください。
翻訳処理中です。しばらくしてから再度お試しください。
翻訳処理中です。しばらくしてから再度お試しください。
翻訳処理中です。しばらくしてから再度お試しください。
翻訳処理中です。しばらくしてから再度お試しください。
翻訳処理中です。しばらくしてから再度お試しください。
翻訳処理中です。しばらくしてから再度お試しください。
翻訳処理中です。しばらくしてから再度お試しください。