2026年8月7日(金)掲載 3,313本日 0
HN5423

「グッドハートの法則」があなたの信頼するベンチマークを蝕む時

Goodhart's Law Comes for Every Benchmark You Trust

pseudolus6日前

議論

10
0pseudolusスレ主546日前

あらゆる指標は、それを目標にした瞬間に指標としての価値を失う。それが「グッドハートの法則」の真髄です。エンジニアがパフォーマンス測定やコード品質の改善に取り組む際、特定の数値目標に固執しすぎると、かえって本質的な価値から遠ざかってしまうリスクがあります。計測対象が管理の手段になった途端、システムは歪められ、最適化の罠に陥るのです。私たちはどうすれば『本当に意味のある評価』を維持できるのでしょうか?

1functionmouse1日前

残念だったな、俺はベンチマークなんて信用してないぜ。何かがベンチマークになった時点で、それはもう良いベンチマークじゃなくなるんだ。

3astro12341日前

同感だね。だからこそ、常に進化し続けるベンチマーク環境が必要であり、実際にそうなっているんだ。> 非公開で更新されるテストセットは、そのメカニズム自体を突くものであり、私が思うに、それこそが唯一の有効な介入策だ。問題が一度もWebに公開されたことがなければ、学習データに含まれるはずがない。それに、内容が更新されれば、今年のセットを丸暗記しても来年には通用しないからね。実際、今まさにそうなりつつある。新しい公開ベンチマークも良いものだし、各チームも学習データのデコンタミネーション(汚染除去)に努めているが、リークを完全に防ぐのはたぶん無理だろう。ちなみに、議論されている以外にもベンチマークには問題が山ほどある。例えば、問題自体や、多肢選択式なら解答の中に答えがリークしていることさえある。MCQの選択肢そのものをモデルに渡せば、確率以上に正解できてしまうこともあるんだ。コーディングAIベンチマークでは、.gitを削除し忘れていることもあるしね。ベンチマーク項目の1つでエラー率6.9%なんて話があるけど、それはかなり典型的な数字だし、自分ならそのレベルでリリースしても構わないと思う。ベンチマークは実に厄介なシロモノだけど、存在しなかったら自分たちで作る羽目になるだろう。上記のような問題があっても、現状の進歩は説明しきれない。世の中には5万ものベンチマークがあって、質や有用性はピンキリだけど、新しいものが次々と生まれているのが現実だ。

4Legend24401日前

グッドハートの法則って、単なる相関と因果の混同の結果じゃないかな。自分が望むものと「相関」がある指標を見つけるのはとても簡単だ。でも、システムに影響を与えようとした途端、その相関が成り立つ範囲から外れてしまう。何かに最適化するためには、実際の「因果」関係にある変数を最大化する必要がある。こっちの方がずっと難しいんだ。

5cyanydeez1日前

当然、最高のベンチマークとは、誰にも教えていないもののことだろ。

6zahlman1日前

結局のところ、社会の価値を「まだハックされていないベンチマークをいくつ生み出せたか」で測るのが一番ってことだな。

7ddp26約24時間前

予測は別だろ。現実世界の出来事を予測するのにグッドハートの法則は当てはまらない。

8StilesCrisis約24時間前

記事がClaudeのスパムみたいになってきたところで読むのをやめた。「孤立した状態で防御可能」「誠実にランク付けされた」とか、勘弁してくれよ。自分のブログ記事くらい自分で書けよ。

9throwatdem12311約22時間前

昔、Mozilla(だったかな)が、主流のベンチマークへの注力をやめると言ったのを思い出したよ。実際のブラウザのパフォーマンス向上には繋がらないから、というのが理由だったはず。今のAIベンチマークも同じように見ている。GPTがFartAGIMaX-4.0-Extremeで1200点、Claudeが1350点なんてどうでもいい。重要なのは、コストと、自分が与えるタスクをどれだけ正確にこなせるかだ。残念ながら、それを知る唯一の方法は、自分で全部使って測定することしかない。結局のところ、どんな枠組みを使っても挙動はどれも似たり寄ったりだし、一番安いものに落ち着くのがオチだ。だからDeepseekは最高なんだよ。圧倒的に安いから、多少トークンを無駄にしても、米国の最先端モデルより桁違いにコストが低い。もし一発でうまくいかなくても、数回やり取りすれば解決するし、大した手間じゃない。