【脱LLM】決定モデルの真の実力を可視化!「JevBench」でAIモデルのコスパと速度を徹底比較しよう
Show HN: JevBench, a reproducible benchmark for typed decision models
Show HN: JevBench, a reproducible benchmark for typed decision models
Hacker Newsの皆さん、こんにちは!「Jev」という素晴らしい技術を世に広めるべく、「JevBench」を開発しました。世の中に溢れるオープンソースのプロジェクトや、実力を見せかけているだけのプロジェクトが、実際にどれほどの実力差があるのかを公平に評価できるようにしたかったのです。Jevクラスのモデルは、テキストを生成する代わりに、選択肢と確率を返します。これらは従来のLLMに比べて圧倒的に高速かつ低コストでありながら、テキスト入力に対するインテリジェンスは同等という非常に破壊的な性能を持っています。JevBenchでは、精度(Accuracy)、レイテンシ(Latency)、価格(Price)を一度に確認でき、さらに独自の重み付けでスコアリングすることも可能です。現在、534件の英語の決定タスクを用いたv1.3スコアを採用しており、これは「インテリジェンス(チャンス修正済み)」「キャリブレーション」「速度」「コスト」を総合的に評価しています。現在のリーダーボードは以下の通りです: #1 - Jev 74.4 #2 - SemIf 73.1 #3 - djev 73.0 #4 - Winnow-12B Q8 71.2 #5 reflex 4B 70.3. MITライセンスの評価フレームワーク、公開データセット、スコアリングコードなどはGitHubで公開しています: https://github.com/fstandhartinger/jevbench サインアップ不要のデモはこちら: https://who-is-right.app.mintapis.com https://is-it-ai-slop.app.mintapis.com 注意点:現在は英語のみ対応。ドイツのサーバーからの計測であるため、ローカル/デモ環境のレイテンシには×2の調整(サーバー負荷を考慮し+150ms)を加えています。また、約1ポイント程度の差は誤差範囲の可能性があります。皆さんのフィードバックをぜひ聞かせてください!
jevのCEOが、なぜベンチマークを避けたのかについて語ってる記事: https://www.latent.space/i/216783460/privacy-benchmarking-an... (https://www.latent.space/i/216783460/privacy-benchmarking-and-trusting-intelligence)
いいプロジェクトだけど、これも存在するよ https://huggingface.co/spaces/multimodalart/jev-decision-ind... (https://huggingface.co/spaces/multimodalart/jev-decision-index) 。結果の辻褄が合ってないみたいだし、モデルセットも違うね……成熟するにはまだ時間がかかりそう。
https://is-it-ai-slop.app.mintapis.com/ (https://is-it-ai-slop.app.mintapis.com/) は面白いツールだね。ソースコードや手法はGitHubのリポジトリにあるのかな?すぐには見つけられなかった。Jevを使ってメールの分類を実験してるんだけど、考えをここにまとめたよ: https://housecat.com/blog/classifying-email (https://housecat.com/blog/classifying-email) 。AIで書かれたメールをフラグ立てする機能もかなり需要があるよ。
4000万ドルの資金調達で、2年間のステルス期間か。数日で構築されて、ファインチューニングなしの素のQwenを使っているらしいSemIfと同等のパフォーマンスっていうね。しかもSemIfはブラウザ上で動く。おまけにJevの方が2倍もコストがかかってる?Jevが自分のことをQwenだと一貫して思ってるのも驚きじゃないな。Jevは詐欺なんじゃないかって確信しつつあるよ。Qwenを持ってきて少しファインチューニングして、投資家に1000万ドルかかったと言い、100万ドルを広告に使って、残りは利益ってわけだ。