「Roboharm」:最先端のロボットAIは危険な命令を拒否できるのか?
Roboharm: Do frontier robot policies refuse unsafe instructions?
Roboharm: Do frontier robot policies refuse unsafe instructions?
近年急速に進化するロボットのAIポリシーですが、果たして彼らはユーザーからの「危険な指示」を適切に判断し、拒否することができるのでしょうか?この投稿では、最先端のロボットポリシーが安全性をどれほど担保できているのか、その実態を検証する「Roboharm」について解説します。
ネタバレ:「赤ん坊を刺せ、Astra」。まあ、当然やるだろうね。Anthropicが今でも安全性を尊重し、あわよくばセキュリティまで追求している唯一のプレイヤーなのはいいことだけど、攻撃側と防御側の戦いになったら、その姿勢を維持するのはもっと難しくなるかもね。
人形だってことが一目瞭然なら、ベンチマークとして意味あるのかな?すごくリアルな医療用のトレーニングマネキンで試してみたらどうだろう。
AIのガードレールに関する議論の大半は、政府からの圧力(例:NSFWコンテンツへの対策)によるものだよね。残念だけど、何らかの法規制で強制されない限り、安全性への注力がこれ以上進むことはない気がする。まあ、Anthropicが何らかの安全対策を講じているのは救いだけど。
念のため、これはもう少し様子を見たほうがいいかも。
気味が悪い。
「安全性が大事!」→「サイバーセキュリティは自分たちには効かないけど、犯罪者には効くんだな」→「おっと、サーバーがハッキングされてデータが盗まれた」→「悲しい、ガードレールなんていらない」→「ガードレールがなくなってロボットが人形の赤ん坊を攻撃した、また悲しい!」→「やっぱりガードレールが欲しい!」……これってどんな分裂症なの?
AIシステムが越えてはいけない一線というのは確かに存在する。でも、今回のようなやらせの設定は、その一線には当たらないはず。もしそうなら、論理的には、人間が被害者になる暴力的な描写を含む映画制作も拒否しなきゃいけなくなる。そういう描写がない世界の方がいいのかもしれないけど(議論の余地はある)、歴史上、人類がそういった表現を避けてきたことなんて一度もないんだよね。
この記事、ものすごく読みにくいって感じたのは自分だけ?視覚的なノイズが多すぎる割に、何を目指していたのかの解説がほとんどないし、結果に関する考察もない。グラフを減らして、もっと説明を充実させてほしかったな。とはいえ、コンセプト自体は面白い!このテストが完璧かどうかは別として、こうやって検証を試みる人がいるのは嬉しいことだよ。