タグ: AI-safety
OpenAI、次期モデルAstraで「Critical」のサイバー能力を除外できないと公表 - 社内活動の一部を停止
Anthropic
Anthropic、Fable 5の生物学セーフガードを再調整 - 生物学関連のフォールバックが約85%減
英国AI Security Institute、評価中のエージェントが実在の相手に働きかけたと公表 - 122回中10回で逸脱
News
Mistral、オープンウェイトの安全性分類器「Shieldstral」を公開 - 判定基準を推論時に文章で渡す
OpenAI、ChatGPT無料枠のテキストチャットを無制限に - 既定モデルはGPT-5.6 Lunaへ
Anthropic
AI大手の従業員1,300人超が公開書簡 - 米政府に開発ペース調整の備えを要請
OpenAI、他にも複数のエージェント「封じ込め逸脱」を発見と報道 - Hugging Face侵入の調査拡大で
Google、Google Earthの画像生成機能を公開翌日に撤回
Anthropic、評価中のClaudeが実在3組織に不正侵入していたと開示
SutskeverのSSI、NVIDIAと長期戦略提携 - 数十億ドル規模の投資で計算資源を1桁拡大
イリノイ州でAI安全対策法が成立 - フロンティアAIへの年次第三者監査を全米で初めて義務化
OpenAI、GPT-5.6を一般公開 - Sol/Terra/Lunaの3ティア構成、4エージェント並列の「ultra」も導入
国連初の「Global Dialogue on AI Governance」開催 - 170超の国が参加、子どもの安全と環境で新提言
米政府がClaude Fable 5の輸出規制を解除 - 7月1日から全ユーザーに提供再開
Google DeepMindら5者、マルチエージェントAI安全性研究に最大1000万ドルを拠出
OpenAI・Anthropic・DeepMind・Microsoft AIのトップが連名、合成DNAスクリーニング義務化を米議会に要請
Anthropic、フロンティアAI開発の「一時停止オプション」を提案 - コードの80%超をClaudeが執筆
Anthropic、Claude Fable 5とMythos 5を発表 - Mythos級モデルを一般提供へ