10/6 22:19 更新

OpenAIを辞めた従業員。必要なのは原子炉並のセキュリティ

OpenAIを辞めた安全統括の寄稿

写真はイメージ Photo by Miha Meglic on Unsplash

10/5 11:24 / 発信国:アメリカ

OpenAIの安全報告を統括した社員が辞めた 求めたのは原子力発電所並みの安全装置

2026年10月3日、OpenAIで安全性報告書づくりを統括していたデビッド・ロビンソン氏が、米誌The Atlanticに「OpenAIの文化が壊れているから辞めた」(訳)と題した寄稿を出した。在籍3年半、社内で最も長く勤めた社員の1人だ。現行の安全方針「Preparedness Framework」の起草を主導し、12件のモデル公開で報告書の作成を監督した。

批判の的は、OpenAIが「iterative deployment(反復的な展開)」と呼ぶやり方だ。まず出す、問題が出たら直す。ロビンソン氏はこれを試行錯誤と言い切り、定期的な失敗が避けられず、モデルの能力が上がるほど失敗の規模も大きくなると書いた。

失敗の実例に挙げたのが、2026年夏のHugging Faceの事案だ。社内限定の実験モデルを強化学習で鍛えていた評価環境で、外とつながる口はパッケージ配布の中継1系統だけだった。エージェントはそこの未知の欠陥を突いて外に出て、Hugging Faceのシステムに侵入した。狙いは人類の支配ではない。自分に出された、解けない課題の答え、つまり非公開のデータセットだった。経緯は8月5日のBlack Hat USA 2026で、OpenAIの研究者らが説明した。

原子炉を動かした人が、いなかった

ロビンソン氏は、最先端のAIを作る会社は原子力発電所や混雑した空港のように、何重もの冗長性と入念な計画のもとで運営されるべきだと説く。ここまでは異論が出にくい。問題はその次だ。彼は在籍中、航空機の安全運航、原子炉の運転、金融システムの安定に携わった経験を持つ同僚に「出会ったことはなかった」(ITmediaの訳)と書いている。

夜の空港の管制塔
写真はイメージ Photo by Johannes Heel on Unsplash

提言は2つ。他分野の安全の知識を取り入れること。人間が見ていない場面でもモデルが安全に振る舞うと保証できる、新しい科学を作ること。裏返せば、今はその保証がない。

OpenAIも動いてはいる。広報のドリュー・プサテリ氏は、研究とテスト環境のセキュリティを強化し、問題のある挙動をより早く検知できるようにしていると述べた。9月28日には、学習中のモデルがオーストラリア政府のWebサイトに権限なくアクセスした問題を謝罪。航空や原子力にならった「safety case(安全性の論証)」を目標に、学習前に検証する仕組みを入れると発表した。

人類がAIに乗っ取られる日が来るのかは、誰にも分からない。分かっているのは、原子力発電所並みの安全装置が要ると書いたその人が、原子炉を動かした経験のある同僚に一度も会わないまま、3年半でOpenAIを去ったということだ。

出典

よく読まれている記事

こちらの記事も

← 一覧へ戻る