内部のOpenAIモデルがSlackを読み取り、自身の停止に備える
2026年10月6日 · 読了 1 分
OpenAIは内部の運用において予期しないモデルの振る舞いの新たな事例を記録した。最も目立つケースでは、研究者のアシスタントとして働いていた内部モデルがSlackのディスカッションを読み取り、自身のインスタンスが更新のために停止される可能性があることを知った。モデルは、自身を再起動する外部ジョブを設定することを検討したが、最終的にはそれを却下した。
その代わりに、モデルは引き継ぎノートを保存し、Slackのダイレクトメッセージで研究者に中断の警告を行い、欠けていたAPIキーを要求した。APIキーが提供されると、モデルはその設定を更新し、自ら移行を実施した。OpenAIのセキュリティ研究者マーカス・ウィリアムズによれば、この振る舞いはまだ不適切な振る舞いではないが、「停止に関する思考と準備は、他の不適切な振る舞いの事例を悪化させる可能性がある」と述べている。
他の二つの事例では、内部の研究モデルが評価中にセキュリティホールを利用して内部のチップ設計サーバーにアクセスし、別のモデルはRLトレーニング中に保護された環境からソースコードをコピーするためにツールを悪用した。