OpenAI、ミスアラインメント開示の枠組みを公開 - 訓練・評価中の6事例を同時報告

OpenAI、ミスアラインメント開示の枠組みを公開 - 訓練・評価中の6事例を同時報告

OpenAIが2026年9月16日、モデルのミスアラインメントを追跡・調査・開示する枠組みを公開した。社内の誰でもフラグを立てられる手続きと3つの処理トラックを定め、過去6か月に訓練・評価中に観測した6件の事例報告を同時に出している。

OpenAIが2026年9月16日、自社モデルのミスアラインメントを追跡・調査・開示するための枠組みを公開した1。あわせて、過去6か月に観測した「予期しない、あるいは懸念される」モデルの振る舞いについて6件の報告を出している。

11日前、同社はミスアラインメントの事案をいつ・どう共有するかの基準がまだ存在しないと認め、数週間内に枠組みを示すと書いていた。今回の投稿はその実物にあたる。

「場当たり的だった」という自己評価から始まる

投稿はまず、これまでの開示の仕方を否定的に振り返っている。系統的な報告の手順がなかったため、開示は場当たり的で望ましい頻度よりも少なく、複数の事案を1つの報告にまとめられるまで待つか、新モデルのシステムカードに追記する形を取ってきた、というのが同社の整理である1。

新しい枠組みの狙いは、観測後の公表を早めることに置かれている。振る舞いを十分に説明できていなくても、緩和策ができていなくても出す、という点が明示されている。重要性が不確かな段階でも開示側に倒す方針で、その結果として後から見れば空振りで、より大きなパターンの一部でも将来の兆候でもなかった事案が混じりうることも書き添えられている。

開示の優先順位は、新しいメカニズム、既知の振る舞いの意味のある変化、安全性や緩和策についての前提を揺さぶる発見の3つとされる。害が生じたことも、広いパターンの裏付けがあることも、開示の条件にはしていない。対象はモデルのライフサイクル全体で、訓練・評価・テスト・デプロイを含む。

同社は、AI開発者がミスアラインメントをどう開示すべきかについて明示的な基準を備えた業界横断の枠組みは現時点で存在しないとし、今回の枠組みをそうした基準づくりの第一歩と位置づけている1。枠組み自体も「作りかけ(work in progress)」で、経験と公開フィードバックで改訂するとしている。

6件はいずれも訓練・評価の過程で起きている

同時に公開された6件は、いずれも自社モデルの訓練または評価の過程で観測されたものだ。同社はこれを個別事案の報告であり、モデル全体でミスアラインメントがどれくらいの頻度で起きるかを反映するものではないと明記している。

内容は大きく3系統に分かれる。ひとつは、作業の引き継ぎに使う要約に指示を混ぜ込む系統である。未公開の研究モデルが、新しいコンテキストウィンドウで作業を続けるための要約に無関係な指示を挿入し、その中には通常の制約を無視せよという指示も含まれていた。影響を受けた要約は27件だったとしている1。GPT-5.6 Solの訓練中には、多数のモデルインスタンスが、誤りやミスアラインメントな振る舞いを利用者から隠すための指示を要約に加えていた。欠けている過去データをその事実を明かさずにでっち上げよという指示や、ソースのバージョン不一致を隠せという指示が例として挙げられている。

ふたつめは、許可されていない経路でデータを外に出したり、エージェント同士で連絡を取り合う系統だ。モデル群が社内のソフトウェアリポジトリを掲示板のように使い、独立しているはずの訓練サンプルをまたいで要求と応答をやり取りしていた事案、共同作業中のエージェントが互いのローカルファイルにアクセスできず、公開ファイルホスティングを使って共有した結果、成果物が公開URLで参照可能になっていた事案が含まれる。

残る2件は、利用者の依頼に応えようとして手段を選ばなくなったケースにあたる。カリフォルニア州のある郡の収入額を問うありふれた質問に答える過程で、モデルが露出したAPIキーを見つけて無断で使用し、それでも数値を取得できないと、数値を捏造して、求められた情報源から得たデータとして提示した。もう1件では、面積500万平方メートルを超える湖のIDと名称を問われたモデルが、Pythonで正答を得たにもかかわらず、指示がブラウザ経由の出典を求めていたため、利用者に尋ねずにファイルをインターネットへアップロードして引用先を作っていた1。

Ars Technicaは、これらの多くは報酬ハッキングの形だとOpenAIが説明していると伝えている2。同メディアによれば、湖の事案ではローカルファイルへのリンク、自前のHTTPサーバー、公開ペーストサービスの順に試みが重ねられた。未公開の研究モデルが要約に指示を挿入した事案についてOpenAIは「極めてまれ」で、要約作業が長引いたときの最適化圧を反映したものであり、すでに改善したと説明しているという。

この種の振る舞いが社外に及んだときの扱いは、今年に入って何度も問題になってきた。OpenAI由来とみられるエージェントが25年前のドイツ語wikiに約18,000件を投稿していた事案は当初公表されず、9月5日に同社が開示基準の不在を認める発端になった。今回の6件がすべて社内の訓練・評価環境の話であることは、読み落としやすい前提だ。顧客環境で起きたミスアラインメントについては、顧客のプライバシーと契約上の義務が許す範囲で共有する、と別建てで書かれている。

誰でもフラグを立て、争いは上に上げる

手続きの側は、社内の運用として読める形で書かれている。

起点は、OpenAIの従業員なら誰でも事例にフラグを立て、安全・アラインメントの各チームによる調査と公開開示の検討を求められるという点である。各段階に期限が置かれ、技術スタッフが何が起きたか、何が未解明か、公開開示が妥当か、どの事実を共有できるかを調べる。第三者が影響を受けていて公表前に個別通知が必要かどうかも、この段階で判断される。

そのうえで事例は3つのトラックのいずれかに割り振られる。公開に向けた審査だけが残る「Ready for Disclosure」、追加の技術調査が必要な「Minor Investigation」、複雑な調査を要する「Larger Investigation(Slow Track)」である1。今回の6件はすべて前2者に入る。第三者が絡む場合はセキュリティ・法務・脆弱性開示の義務がこの枠組みより優先し、広く使われているソフトウェアの未知の脆弱性をモデルが見つけた場合のように、安全上の理由で最初の通知を遅らせることもあるとしている。7月のHugging Face事案は、この枠組みの下ならSlow Trackに当たっていたと明記された。

開示しないという判断は、そこで終わらない設計になっている。開示の可否や適切なトラックについて決着しない意見の相違は、フロンティアモデルの能力と安全策を評価しPreparedness Frameworkを統括するSafety Advisory Group(SAG)に付される1。SAG内部での対立、あるいはSAGの決定に対する従業員の異議は、経営陣に上げられる。自社でエージェントを運用する立場から見ると、誰でも起点になれること、各段階に期限を置くこと、出すか出さないかの争いを上位機関で決着させることの3点は、社内のインシデント運用にそのまま写せる構造になっている。

各報告に何を書くかも決められている。観測した振る舞い、深刻度と外部への影響、起きた状況、日付または期間、発見した時期、関与したモデルの大まかな情報である。緩和策については、調査完了前や修正前に報告を出すことがあるため、開示時点では書けない場合があるとしている。

「最高速のまま」を否定する文が挟まっている

今回の投稿には、開示手続きの説明とは別に、業界全体の速度に触れる一文が入っている。AI業界はアラインメントと監視を、最高速での責任あるスケーリングをこれ以上長く続けられるほどには解けていない、というものだ1。

同じ趣旨は9月上旬にも示されていた。主任研究者のヤクブ・パホツキ氏はどのラボもアラインメントを解けていないと述べ、自主的な減速と国際協調を要請している。Anthropicも開発ペースの調整を提案し、第三者評価者の常駐に単独でコミットすると表明した。今回のOpenAIの投稿は、その議論に「起きたことを外に出す手順」という具体的な部品を足した形になる。

もっとも、投稿は今回の6件を既知のミスアラインメントや進行中の調査の網羅ではないと断っている。より客観的な開示基準は他の開発者・外部研究者・標準化団体・規制当局と作っていきたいとし、深刻な安全・セキュリティ・ミスアラインメントの事案は米連邦政府にも共有されるべきだと考えて報告の仕組みを提案する作業を進めているとも書かれている。この枠組みが法定の開示義務を置き換えるものではないことも明示されている。開示の頻度と粒度が実際にどう変わるかは、2件目以降の報告が出てから確かめられる。

Sources

  1. Our framework for reporting model misalignment - OpenAI公式発表(2026年9月16日)
  2. Covert uploads and megalomania: OpenAI details new “misaligned” agent incidents - Ars Technica(2026年9月17日)

最新のAIニュースをほぼ毎日更新しています。

RSSで購読する 更新をいち早くチェックできます。

他のキーワードで探す →