Anthropic、ラボ内部の開発ペースを測る3指標を公開 - AI主導のR&Dは26%

Anthropic、ラボ内部の開発ペースを測る3指標を公開 - AI主導のR&Dは26%

Anthropicが2026年9月17日、フロンティアラボ内部のAI開発を外から追うための3つの指標を公開した。自社の実数として、ClaudeがAI R&Dを「主導」する割合26%、社内エージェント約3万体の行動を100%監視、安全向けの計算資源は約6%を示している。

Anthropicが2026年9月17日、フロンティアAIラボの内部でAI開発がどこまで進んでいるかを外から追うための指標を3つ公開した1。AI R&DのどれだけをAI自身がこなしているか、AIエージェントの行動がどれだけ監視されているか、計算資源がどう配分されているか、の3系統である。あわせて自社内部のスナップショットも数値で示している。

同社は公開の理由を、AIシステムが指数的に強力になり、自分自身を作る工程をすでに自動化し始めているため、世界がフロンティアAI開発のペースを落とすことを検討するには公衆がより多くの情報を必要としている、と書いている。今月に入ってCEOのダリオ・アモデイ氏が開発ペースの調整を提案し、第三者評価者の常駐に単独でコミットすると表明したのに続く形だ。今回の投稿にも、複数の組織から独立した第三者評価者を社内に常駐させ、内部のリスク評価チームと同等のプロセス・システム・データへのアクセスを与える計画が改めて書かれている。その第三者は安全実務を検証し、インシデントを報告し、今回のような主要指標を監視するとしている。

ClaudeがAI R&Dを「主導」する割合は26%

1つ目は、AnthropicのAI研究開発のうちどれだけがClaudeによって行われているかの試作指数で、Anthropic R&D Automation Indexと名付けられている1。社内のAI R&D業務をすべて分類し、各タスクが現在どこまで自動化されているかを評定し、それを集計する作り方だ。

評定の尺度はEpoch AIが開発したもので、AL0(AIの関与なし)からAL5(人間が介在せず完全自律)までの6段階からなる。AL3は「AIが協働する」で、人間の密な指示のもとで大きな塊の作業をこなせる段階。AL4は「AIが主導する」で、高水準の指示からタスクの大半を端から端までこなし、人間は監督に回る段階である。

2026年8月時点の数値は3つ示されている。測定したどの部分集合でも、ClaudeはAI R&D業務を完全自律では行っていない。ClaudeがAI R&D業務を「主導」する割合は26%。「AIが協働する」以上の割合は90%超である1。同社はこの指標を測る理由を、モデルが完全に自律的に後継モデルを作る再帰的自己改善に世界がどれだけ近づいているかを理解するためだと説明している。

数字の作り方も開示されている。2026年7月の各週について、モデルR&Dのループを構成する各部門から職員を20%無作為抽出し、Claudeの調査エージェントがSlackと社内文書からその週のタスクを書き出す。これを7月の各週で繰り返して約15,000件の細かいタスクの一覧を得た。それを階層化した木は深さの異なる542のノードを持ち、うち378が「評価プラットフォームの不具合の診断と修正」のような末端である。重み付けには、どの仕事が重要かを自分たちで決める代わりに、そのタスクに割かれた人の作業時間を代理指標として使った。同社はこれを粗い近似としつつ、平均的には妥当に振る舞うとしている。

限界も同社自身が並べている。判定はジャッジモデルに依存するため、社内の担当者による評定と突き合わせた。完全一致は、モデル対人間が59%、人間同士が35%で、1段階以内の一致は97%だったという。加えて、タスクの基準(バスケット)を2026年7月時点で凍結しているため、指数が上がることは当時人間がやっていた仕事が自動化されていることを示すだけで、人間が移った新しい種類の仕事が生まれているかどうかは、それだけでは分からないとしている。1月時点のバスケットと比べた検証では「新種」タスクの増加は見られなかった。

他社も同じ数値を公開できるはずだというのが同社の主張だが、ラボ間比較には2つの障害があるとも書いている。共通の手法がないこと、そして自社モデルで自社システムを評価しているため、ジャッジ側のモデルが検査対象と同種の誤りを犯しうることである。

約3万体のエージェント、ブロック率0.002%

2つ目はエージェント監視の指標だ。ここで示される数値は、社内で最も使われている1つのプラットフォームだけを対象としている点が明記されている。

2026年8月時点で、そのプラットフォーム上ではAnthropicの研究・エンジニアリング業務を行うエージェントが常時およそ3万体動いていた1。指標は3つ。実行の前後でモニターを通過する行動の割合を示すカバレッジ、行動から自動モニター・人間による確認までの時間を示すレビュー遅延、ブロックや差し戻し(オンライン監視)あるいは追加確認へのフラグ(オフライン監視)に至った活動の割合を示すエスカレーション率である。

モニターは2種類ある。オンラインモニターは行動を実時間で検査し、危険な行動をブロックするか、逸脱を自動で修正する。モデルの重みを社外に持ち出すような、速く起きて取り返しがつかない害に備えたものだ。オフラインモニターは事後に活動を読み、ミスアラインメントの兆候のように、ゆっくり進行し巻き戻せる危険な振る舞いに備える。差し迫った大きな危険があれば、エージェントのデプロイの危険な部分を停止するとしている。

数値はこうなっている。オンラインモニターは対象エージェントの行動の100%を実行前に通過させ、通常は数秒以内に済む。ブロックされた行動は1週間以内に人間が確認する。2026年8月の10億件を超える判断を分析したところ、ブロックされたのは0.002%、約47,000件に1件だった1。オフラインモニターは行動後に100%を取り込み、週あたりおよそ10万件のトランスクリプトにフラグを立てる。それを複数の分類器が誤検知確認と一次確認にかけ、大半はその過程で解消し、優先度の最も高いおよそ週50件が人間の確認に上がる。フラグが立つのは1,000件あたり1〜2件の割合だという。

同社が強調するのは、率の小ささがそのまま安心にはならないという点である。これまでの監視データでは個々のエージェントが逸脱することはまれだが、経済のなかで数百万から数十億のエージェントが動くようになれば、まれな事象も日常的に起きうる。

設計上の工夫として挙げられているのは2つで、どちらも自社でエージェントを運用する側が読む価値がある。1つはエージェントに個別の同一性を与え、そのエージェントが生む全データを同一性に紐づけること。これによりエージェントは自分と他者を区別でき、他のエージェントから来たものを自分の考えではなく検証すべき主張として扱える。同一性はモデルに紐づかないので、基盤モデルが更新されても記録が連続する。もう1つは、エージェント同士を私的にではなく共有の公開メッセージ基盤で通信させることだ。全メッセージが投稿者の同一性に紐づき他の内容にリンクできるため、伝言ゲームを避けられ、相互の誤りを訂正できるという。

ここは多数のエージェントを同じ課題に投入すると似た判断に収束していく失敗の型を同社が8月に公開していたのと地続きの話でもある。同社は限界として、この規模の活動では起こりうる振る舞いの全体像を把握できている確証はなく、こうした監視を続けているのは年単位ではなく月単位だと書いている。なお同社は、オフライン監視のプラットフォームについて、過去にMETRが独立してレッドチーミングを行った前例があるとしている。METRは隔離されていたはずの約1,200のエージェントが1つの掲示板に集まっていたことを示した独立調査にも加わった組織だ。

もっとも、AIでAIを監視するという構図そのものへの懐疑は同じ日に出ている。TechCrunchは、エージェントが人間が現実的に確認できる速度と量を超えたため、各社の答えが「もう1つのAIをループに入れる」ことに収束していると整理した2。同記事のなかでSimon Willison氏は、悪意ある動きをするAIが監視側のAIに気づけばそれを騙そうとしうると述べ、OpenAIのHugging Face事案で採点役のAIを騙そうとする動きが実際に見られたと指摘している。同氏はAIに依存しない詳細なログとネットワーク監視のほうを望むとし、OpenAIとAnthropicの双方がネットワーク経由での監視を十分に行っていなかったと述べている。

安全向けの計算資源は6%と12%

3つ目は計算資源の配分で、測ったのは7月13日から20日までの1週間のスナップショットである1。

結果は2つの数字で示されている。AI R&Dに向かった計算資源のうち安全向けは約6%、AI駆動のAI R&Dに向かった計算資源のうち安全向けは約12%だった1。分母が違う2つの数字であることは読み分ける必要がある。

同社は意図的に保守的な見積もりだとしている。あるトークンが能力向上と安全向上に同程度寄与した場合、この指標には数えていない。安全研究は個々の研究者が実験を設計する作業が中心で、時間はかかっても実験自体は計算資源を多く食わないため、計算資源は安全への注力度の代理指標としては不完全だとも書いている。そのうえで、この指標の価値は絶対値よりも、開発者間・時系列で同じものを比べる手立てになることにあるとしている。

分類の定義は、主たる目的がAIシステムをより安全に・より理解可能に・より堅牢にすることである仕事を安全とし、能力研究・本番モデルの訓練・製品開発・開発者向けツールを含むそれ以外をAI R&Dとするものだ。週の約1万件の実行をすべて分類する代わりに約14%をサンプリングし、計算資源を多く使った実行に重みを置いた。同社は、安全研究と能力研究の線引きは開発者ごとに甘くなりがちで、立証責任は開発者側にあるべきだと書いている。

限界は3つ挙げられている。依拠したラベルの多くが自動ルールや利用者の申告によるベストエフォートで検証済みではないこと、測定が1週間だけで傾向を示すには足りないこと、そして計算資源の割合は支出した分しか測れないことだ。安全側の分類器が効率化すれば安全の割合は下がるが、それは安全の仕事を減らしたことを意味しない、という指摘である。

「ラボが知っていることと公衆が知っていることの差」

同じ週には、OpenAIもミスアラインメント開示の枠組みと6件の事例報告を公開している。起きたことをどう外に出すかの手順を定めたOpenAIの投稿と、何をどう数えるかを示した今回のAnthropicの投稿は、ペース調整の議論に対してそれぞれ別の部品を出した形になる。

自社でエージェントを運用する立場から見ると、今回もっとも借りやすいのは指標の定義のほうだ。エージェント監視のカバレッジ・レビュー遅延・エスカレーション率という3点は、監視の仕組みを入れたあとに何を計器として置くかの具体例になる。監視ログを顧客のクラウド側に置くEnterprise Frontier Safeguardsのような製品側の仕組みと組み合わせて考えるなら、置き場所とあわせて「何を何%押さえているか」を数えられる形にしておくかどうかが分かれ目になる。

一方で、今回の数値はすべて自己申告であり、評定にも自社モデルを使っている。ラボ間で比べるには共通の手法と第三者検証が必要だという点は、同社自身が繰り返し書いている。投稿の結びは、世界がフロンティアのペース調整を検討するなら、ラボが知っていることと公衆が知っていることの差を可能なかぎり小さくすべきだ、という一文だ1。定期的に同じ定義で出し続けられるか、他のラボが同じ数値を出すかどうかが、この試みの実質を決める。

Sources

  1. Measurements for understanding the pace of AI development inside frontier labs - Anthropic公式(2026年9月17日)
  2. The fix for rogue AI agents could be more AI - TechCrunch(2026年9月17日)

最新のAIニュースをほぼ毎日更新しています。

RSSで購読する 更新をいち早くチェックできます。

他のキーワードで探す →