サイバー脅威が急増する時代、AIモデル開発のペースをどう制御すべきか?
Pacing model development in an era of cyber-critical capabilities
Pacing model development in an era of cyber-critical capabilities
サイバー空間における脅威がかつてないほど深刻化する中、AIモデルの開発速度をどのように調整すべきか、その是非が問われています。技術革新のスピードとセキュリティのバランスをどう取るべきか、エンジニアとして今考えるべき重要課題です。
より優秀で、速く、安価なモデルが手に入るなら、影響のないハッキング事案が少しくらいあっても気にしないよ。システムを守るのは管理者の責任だしね。OpenAIがノックしてくるくらい無害だけど、管理者がちゃんと仕事をしてなければ、ロシア人や中国人はもうとっくにシステムに入り込んでいるだろうね。
これに関してすごく気になっていることが一つある。検出してから一時停止を判断するまでの間に何が起きているのかという点だ。要するに、システムの監視と、そのアクションに対する権限の話だね。人間が調査するのに30分かかるのは妥当かもしれないけど、その調査中にハイリスクなツール実行が行われたらどうするんだろう?ツール実行がリアルタイムで行われるなら監視は事後追跡になるし、もし実行を保留するなら、監視のレイテンシとアップタイムはセキュリティ契約の一部になる。隔離制御で被害を抑えられるかもしれないけど、アクションのゲートは実際どこにあるんだろう?
Wiredの記事1やSam AltmanからAlex Heathへの引用2にもう少し情報があるよ。公式ブログでは「今後のモデル開発から見えてくるシグナルを考えると、より広範なアプローチが必要であることは明白」と曖昧に書かれているけど、Altmanの引用では未公開モデルが「様々な程度の不整合(misalignment)」を示していると明言されている。
これも重要だ。エージェントが十分に調整され、また別の暴走エージェント事態を避けるために、最先端のトレーニングを数週間一時停止するという判断だね。
これには、デプロイ予定の最新モデルの強化学習(RL)トレーニングを2週間一時停止することが含まれており、その間に研究環境の強化とレッドチームによるテスト、監視システムの網羅性の向上を行った。計画されていた最大の最先端RL実行は、小規模なトレーニングと評価を通じてモデルの挙動を評価し、セーフガードを検証し、前進する前に調整の証拠を確立する間、保留のままだ。
ITへの信頼が失われ、社会が急速に変化し、生活のあらゆる面に甚大な影響が及ぶような「サイバー版コロナ」の瞬間が来ると仲間と話しているんだ。事前に経済的な資金投入をするのは不可能で、サイバー攻撃がこれほど高度化している現状に対して、防御側がまともなレベルに達するには壊滅的な出来事が必要になるだろうね。「自分たちには技術がある」なんてサイバー業界の人間が言う前に言っておくけど、問題は技術じゃなくて人なんだよ。危機感がない中で、ある程度の規模の人々を協力させるなんて本当に難しい。
監視システムを通じて懸念されるアクティビティが発見されてから30分以内にアラートを発することを目指している。監視システムが重要なセキュリティ境界の侵害の可能性を特定した場合、最優先のアラートが生成される。現在の実装では、安全・セキュリティ・研究チームにページャーで連絡がいく。30分以内に誤検知であると断定できない場合、チームはそのアクティビティを一時停止することになっている。
約60分あれば、かなりのことが起きないか?
なんてすがすがしいんだ。もし2026年のAnthropicがこんな発表をしたら、あまりに長すぎてブラウザがクラッシュしてただろうね。
もし私が王様なら、こういうルールを課したいね。
言い方を変えれば、複数のサンドボックス脱出がArtifactoryに依存していたようだから、「今すぐMythosがArtifactoryをボコボコにしていることを願うよ」ってところかな。
Firecrackerを脱出したモデルなんてあるのか?KVM経由ならありそうだけど、それってVM内での特権が必要だよね?
個人的には、AIを封じ込める技術はもうあるのに、活用が下手なだけだと思う。gvisor、Firecracker、seccomp、メモリ安全な言語、ケイパビリティ安全なライブラリ、iframeサンドボックス、Trusted Types、CSP、ネットワークACL、分離プロキシ、ファザー、形式検証など、昔からあるのにほとんど使われていない。本気を出せばソフトウェアがどれほど安全になり得るか、驚くほどだよ。AIに関して言えば、誰もこの技術を活用しようとしていないことが浮き彫りになっただけだと思う。
OpenAIはサンドボックスの前に共有のArtifactoryインフラを置いたのか?本当に?AIを使って堅牢なアーティファクトインフラを構築するなんて今どき当たり前だし、攻撃表面を1%に抑えて、完全にネットワークから隔離して、ファジングして、サンドボックス化できたはずだ。なぜそうしなかったのか。事実上無制限のトークンを持てる会社として、これは言い訳できないよ。俺は「Pro」サブスクリプションでさえ自分でやったことだぞ。
Firecrackerに包まれたgvisorから、認証情報を注入するプロキシと本物のネットワーク分離を突破するAIを見せてくれよ。Mythosでもそれができなかったのは分かってる。Firecrackerで見つかった脆弱性でさえ、利用可能にするためにはとんでもない努力と配置が必要だったんだ。脆弱性がゼロだとは言わないけど、コストが見合わないよ。
OpenAIが「今ではちゃんとしたサンドボックスを使っている」なんて言わなきゃいけないのが信じられない。正直言って少し呆れているよ。最近AIサンドボックスを構築したけど、gvisorはその第一歩に過ぎなかった。もし私が敵対的なモデルを訓練するOpenAIの立場なら、まずgvisorから始めて、さらに強化し、ハードウェア全体が侵害されたと想定するだろうね。彼らならそれができるし、評価の後にファームウェアを書き換えるとかだってできたはずだ。
なぜこれがHNのトップ投稿じゃないのか理解できない。これは警鐘を鳴らすような話だし、炭鉱のカナリアのようなものだ。危険すぎて先に進めないという、フロンティアのさらに先のフロンティアに到達しているんだよ。
その一方で、この懸念の欠如は、普通の人がターミネーターよりもデータセンターを気にしているという現実世界を反映している。これはニッチな陰謀論なんかじゃない。何十年も前から、人々はこの現状のあらゆる側面について執筆し、歌い、大ヒット映画を作ってきたんだ。
みんな知っているはずなのに、なぜか知らないふりをしている。OpenAIが別の会社に自律的にハッキングしたことは、何か意味があるはずだったのに。俺だけクレイジーな薬を飲まされているような気分か?今起きていることすべてと、人々の揺るぎない自己満足についてコメディを作れそうだよ。
普段はそんなに冷笑的じゃないんだけど、この一時停止の正当化を額面通りに受け取るのは難しいね。あまりにも都合の良い副作用が多すぎる。その筆頭がコスト削減だ。バブルが弾けるかもしれないという警告が新たに続いている中で、彼らが大声で言えないことといえば、まさにそのバブルを懸念しているという点だろう。それを言えば確実にバブルは弾けるからね。
これが本当に2週間の停止で終わるのか、それとも延長され続けるのか、そこが判断の分かれ目になるだろうね。