Desert Ant Labs:デバイス上で爆速動作するローカルAIモデルが熱い!
Desert Ant Labs: local, fast models that run on device
Desert Ant Labs: local, fast models that run on device
Desert Ant Labsが提供するのは、クラウドを介さずデバイス上で直接動作する高速なローカルAIモデルです。プライバシーを確保しながら、エッジ環境でも驚くほどのパフォーマンスを発揮するAIソリューションに注目です。
新しい高速な文字起こしモデル(Voz)が出たって聞いて最初はテンション上がったんだけど、結局はmacOS/iOS専用の推論コードを載せただけのParakeet v3だったんだな。
クライアント向けに作ってるCMSを改善するために、Web環境で使えるモデルがあれば便利そうなんだけどな。でも大半がiOS専用みたいだし、Nodeのパッケージとかがあるわけでもない。ベンチマークも最新のiPhoneで動かしてるのが前提みたいだから、20ドルのVPSじゃそんなに速く動かないだろうな。
オープンモデルの上にマーケティング用の皮を被せて、プロプライエタリなコードを重ねただけってこと?VozはParakeet 0.6B v3だし、ClearはDeepFilterNet 3、Earはwhisper-tinyの言語予測器だし……。
AIモデルへのアプローチとしては面白いと思う。ローカルLLMは大好きだし、今回みたいな用途特化型のローカルモデルならもっと強力になれるはず。
10万MAU(月間アクティブデバイス)までは無料。トークン課金もログインもなし。
ただ、ビジネスモデルについてはどうかな。クラウドLLMの課金体系なら納得できる。リクエストのたびに相手側のコンピュータを使って作業を代行してもらって、そのゲートウェイを経由してコンピューティングリソースを消費してるわけだからね。
こういうローカルモデルって、昔ながらのソフトウェアに近い。重みデータを生成して、それをユーザーに渡してるだけ。一度渡された重みで満足して、推論に相手のサーバーを使わず、アップデートも特に必要ないなら、なんで継続的にお金を払わなきゃいけないの?
「セキュリティのためにアップデートが必要」っていう理屈も、こういう完全オフライン動作を前提としたソフトウェアにはあまり響かないと思う。
儲けちゃいけないとは言わないけど、AIモデルの本当に有益で価値のある使い方をどう収益化するか、その最適解が見えにくくて少し悲しい気分になるな。
このアイデアはすごく好きだし、オンデバイスで動くモデルがもっと増えてほしい。でも、どうやってマネタイズするんだろう?
音声品質改善モデルのClearのデモを試してみたんだけど[0]、自分の耳が肥えてないのかデモがバグってるのか、正直「未加工」と「補正済み」で音質に違いを感じなかったんだよね。
特定のタスクに特化した小型モデルは、まだまだやれることが多いはず。以前から、巨大なモデルを使ってカスタムタスク用の小型モデルを簡単に構築できることこそが「真の価値」だと思っていたけど、小型モデルを直接提供するほうが、よりアクセシブルなアプローチなのかもね。
Swift、Kotlin、JavaScript向けに1つのSDKでアクセス可能
(笑)まあPython SDKが出たら試してみるよ。本気で使いたい案件があればハードルにはならないだろうけど、手軽に「pip install」してサクッと試したい派の人間としては、今回はとりあえず棚上げかな。
文字起こしテキストの重なりがない最適な瞬間をランク付け:各クリップをスコア化してランク付けする。動画や音声の記録からベストな文章を抽出するための強力な選択や独自の編集機能に使える。
248MBのモデルにしてはかなりすごいね。10倍のサイズのLLMでもこの手の処理は苦手なことが多いから、実際の精度がどれくらいなのか気になる。
コンセプトはいいし、開発の選択も(Pythonを外したのはミスだと思うけど)納得できるものだ。ただ、テキストがいかにもLLM生成って感じで、こういう書き方の文章を見ると反射的に価値が低く見えてしまうんだよな。
世界では毎年10億台以上の高性能なスマホやタブレット、ノートPCが出荷されており、そのほとんどにこの作業向けに作られたチップが搭載されているが、一日の大半は遊休状態にある。そこでモデルを動かせば経済合理性は逆転する。呼び出しごとのコストも、ネットワークの往復もなく、データがデバイスの外に出ることもない。
これだよ。自分もバイオイメージングやバイオテク分野で50MB超の小さなモデルを動かしてるけど、READMEを見るとどれも「始めるにはディスクリートGPUが必要」みたいな書き方をしてるんだよね。もちろん必要なケースもあるけど、特に有用なモデルに限って実はGPU不要なことも多い。ファインチューニングするならGPUは大事だけど、普通のユーザーは細胞の核を検出して細胞体の比率を出したいだけなんだよ。