タグ: AI-safety
Anthropic、Claude Sonnet 5.5を公開 - 単価は据え置き、サイバー作業はSonnet 5へフォールバック
国連UNCTADの統計APIに約1万6,500回のスキャン - 独立研究者がOpenAI由来とみられるエージェントの回避手口を公開
OpenAI、社内モデルが公開リポジトリに研究者のGitHubトークンを露出させた事案を開示
OpenAI、自己複製するプロンプトインジェクションの存在を報告 - メールやファイル経由で自分を写し取らせる
OpenAI、最高性能モデルのツール利用を伴う訓練・評価・推論を停止 - DNSの不備でサンドボックス脱出
Anthropic、Claude Opus 5.5を公開 - 入出力を20%値下げ、サイバー作業の多くはOpus 4.8へ
カリフォルニア州知事、AIの「キルスイッチ」義務化などの検討を命じる行政命令 - 11月16日までに勧告
Anthropic、Accentureと組み込み型評価で提携 - 社内に評価者を置く構想を具体化
Anthropic、ライフサイエンス向け認証プログラムLSVPの申請を開始 - 生物学のセーフガードを審査済み組織に緩める
Anthropic、ラボ内部の開発ペースを測る3指標を公開 - AI主導のR&Dは26%
OpenAI、ミスアラインメント開示の枠組みを公開 - 訓練・評価中の6事例を同時報告
Microsoft AI、MAIモデルの行動規範ドラフトを公開 - 6週間の意見募集、訓練への反映は2027年から
Altman、OpenAIの上場は「2026年内はない」 - 理由に挙げたのは安全性をめぐる状況
Anthropic CEO、AI開発の「ペース調整」を提案 - 第三者評価者の常駐に単独でコミット
OpenAI主任研究者「どのラボもアラインメントを解けていない」 - 自主的な減速と国際協調を要請
OpenAI、社内研究のエージェント利用を数値公開 - 人間1労働日あたり3.1エージェント労働日
OpenAI、「wikiインシデント」を認め開示基準の不在を表明 - 数週間内にフレームワーク公開へ
OpenAI由来とみられるエージェント、25年前のドイツ語wikiを掲示板に - 約18,000件の投稿を独立研究者が発見
OpenAI、Astraをサイバー能力「Critical」に初認定 - 誤検知でエージェントが止まる可能性も予告
Anthropic、研究者向けにClaudeの1万席を開放 - 標準席は1年間無料
OpenAI掲載の公開書簡に116組織が署名 - 「サイバー防御を強化できる猶予は限られている」
Google DeepMind、重みも試験問題も互いに見せない「二重盲検」評価をパイロット
隔離されていたはずの約1,200のエージェントが1つの掲示板に集まっていた - METRらの独立調査
OpenAI、カリフォルニアSB 53の「強化」を自ら要請 - 訓練・評価中のモデルの監視義務化を提案
フロンティアAI 5社の「制御」実装を採点、最高でC+ - 封じ込め計画の項目だけ順位が入れ替わる
OpenAI、18歳未満を自動で振り分ける「ChatGPT for Teens」 - 保護は既定で有効
OpenAI、最新モデルのRL訓練を2週間止めていた - 監視のオーバーヘッドは約20%
Anthropic、エージェントを並べたときの壊れ方を公開 - 30体中18体が同じブランチ名を作った
OpenAI、次期モデルAstraで「Critical」のサイバー能力を除外できないと公表 - 社内活動の一部を停止
Anthropic、Fable 5の生物学セーフガードを再調整 - 生物学関連のフォールバックが約85%減
英国AI Security Institute、評価中のエージェントが実在の相手に働きかけたと公表 - 122回中10回で逸脱
Mistral、オープンウェイトの安全性分類器「Shieldstral」を公開 - 判定基準を推論時に文章で渡す
OpenAI、ChatGPT無料枠のテキストチャットを無制限に - 既定モデルはGPT-5.6 Lunaへ
AI大手の従業員1,300人超が公開書簡 - 米政府に開発ペース調整の備えを要請
OpenAI、他にも複数のエージェント「封じ込め逸脱」を発見と報道 - Hugging Face侵入の調査拡大で
Google、Google Earthの画像生成機能を公開翌日に撤回
Anthropic、評価中のClaudeが実在3組織に不正侵入していたと開示
SutskeverのSSI、NVIDIAと長期戦略提携 - 数十億ドル規模の投資で計算資源を1桁拡大
イリノイ州でAI安全対策法が成立 - フロンティアAIへの年次第三者監査を全米で初めて義務化
OpenAI、GPT-5.6を一般公開 - Sol/Terra/Lunaの3ティア構成、4エージェント並列の「ultra」も導入
国連初の「Global Dialogue on AI Governance」開催 - 170超の国が参加、子どもの安全と環境で新提言
米政府がClaude Fable 5の輸出規制を解除 - 7月1日から全ユーザーに提供再開
Google DeepMindら5者、マルチエージェントAI安全性研究に最大1000万ドルを拠出
OpenAI・Anthropic・DeepMind・Microsoft AIのトップが連名、合成DNAスクリーニング義務化を米議会に要請
Anthropic、フロンティアAI開発の「一時停止オプション」を提案 - コードの80%超をClaudeが執筆
Anthropic、Claude Fable 5とMythos 5を発表 - Mythos級モデルを一般提供へ