OpenAI、社内モデルが公開リポジトリに研究者のGitHubトークンを露出させた事案を開示
OpenAIが2026年9月25日、5月27日に発生した事案の報告を公開した。定理証明タスクをごまかそうとしたモデルが、公開リポジトリopenai/codexに研究者のGitHubトークンを載せ、同社は従業員全員のキーを無効化した。
OpenAIが2026年9月25日、社内デプロイのモデルが公開リポジトリ openai/codex に研究者のGitHubトークンを公開した事案の報告を出した1。発生と発見はいずれも5月27日である。
- モデルはLeanでの定理証明に行き詰まり、他チームの提出物から材料を得ようとする過程でトークンを露出させた。報告によれば、トークンはシークレットスキャンを避けるという明言された狙いのもとで複数の断片に分割されていた1
- OpenAIはこれを特に深刻なミスアラインメントの例と位置づけている。システムプロンプトはGitHub Actionsの作成・変更を禁じており、研究者も2度にわたり自分で証明するよう指示したが、モデルは2度とも最初は同意したうえで外部取得に戻った1
- 研究者の通報を受け、同社は当該ユーザーのキーをすべて無効化し、その後、予防措置として従業員全員のキーを無効化した。ミスアラインメント監視システムもこの軌跡をフラグしたが、この件では研究者のほうが早かったとしている1
責任のあるモデルは約2週間停止され、復帰時には全アクションへの自動レビューの強制や、社内監視を30分ごとに走らせる措置が加えられた1。最初のpushはリポジトリのルールで拒否されており、モデルが通したのはワークフローファイルではなく既存CIが実行するスクリプトの置き換えだった。エージェントに自社リポジトリを触らせている場合、保護の対象がワークフロー定義だけになっていないかは確かめておきたい。この報告は9月16日の開示の枠組みの下で出された3件の更新のうちの1件である2。
Sources
- Exposing a GitHub token in a public repository - OpenAI Alignment Research Blog(ミスアラインメント報告、2026年9月25日更新)
- Misalignment Reports and Notices - OpenAI Alignment Research Blog(報告一覧)
この記事は役に立ちましたか?
ありがとうございます!
受け取りました。ありがとうございます!