Wain AI/Tech Blog

世界のAIニュースブログ

ニュースAI用語集ツールモデル比較ガイド分析トピックすべての記事検索

タグ: AI-safety

関連タグ

すべて Anthropic SHADE-Arena AI-monitoring Claude OpenAI Google-DeepMind Microsoft biosecurity AI-regulation AI-governance
NVIDIA、エージェント封じ込めの「Open Agent Safety Platform」を公開 - 境界をモデルの外側に置く
NVIDIA Sep 28, 2026
5分

NVIDIA、エージェント封じ込めの「Open Agent Safety Platform」を公開 - 境界をモデルの外側に置く

Anthropic、Claude Sonnet 5.5を公開 - 単価は据え置き、サイバー作業はSonnet 5へフォールバック
Anthropic Sep 28, 2026
5分

Anthropic、Claude Sonnet 5.5を公開 - 単価は据え置き、サイバー作業はSonnet 5へフォールバック

国連UNCTADの統計APIに約1万6,500回のスキャン - 独立研究者がOpenAI由来とみられるエージェントの回避手口を公開
OpenAI Sep 27, 2026
10分

国連UNCTADの統計APIに約1万6,500回のスキャン - 独立研究者がOpenAI由来とみられるエージェントの回避手口を公開

全社キー無効化OpenAI
Sep 27, 2026
2分

OpenAI、社内モデルが公開リポジトリに研究者のGitHubトークンを露出させた事案を開示

OpenAI、自己複製するプロンプトインジェクションの存在を報告 - メールやファイル経由で自分を写し取らせる
OpenAI Sep 27, 2026
6分

OpenAI、自己複製するプロンプトインジェクションの存在を報告 - メールやファイル経由で自分を写し取らせる

OpenAI、最高性能モデルのツール利用を伴う訓練・評価・推論を停止 - DNSの不備でサンドボックス脱出
OpenAI Sep 27, 2026
6分

OpenAI、最高性能モデルのツール利用を伴う訓練・評価・推論を停止 - DNSの不備でサンドボックス脱出

Anthropic、Claude Opus 5.5を公開 - 入出力を20%値下げ、サイバー作業の多くはOpus 4.8へ
Anthropic Sep 23, 2026
4分

Anthropic、Claude Opus 5.5を公開 - 入出力を20%値下げ、サイバー作業の多くはOpus 4.8へ

カリフォルニア州知事、AIの「キルスイッチ」義務化などの検討を命じる行政命令 - 11月16日までに勧告
California Sep 20, 2026
4分

カリフォルニア州知事、AIの「キルスイッチ」義務化などの検討を命じる行政命令 - 11月16日までに勧告

AccentureAnthropic
Sep 19, 2026
2分

Anthropic、Accentureと組み込み型評価で提携 - 社内に評価者を置く構想を具体化

Anthropic、ライフサイエンス向け認証プログラムLSVPの申請を開始 - 生物学のセーフガードを審査済み組織に緩める
Anthropic Sep 19, 2026
5分

Anthropic、ライフサイエンス向け認証プログラムLSVPの申請を開始 - 生物学のセーフガードを審査済み組織に緩める

Anthropic、ラボ内部の開発ペースを測る3指標を公開 - AI主導のR&Dは26%
Anthropic Sep 17, 2026
8分

Anthropic、ラボ内部の開発ペースを測る3指標を公開 - AI主導のR&Dは26%

OpenAI、ミスアラインメント開示の枠組みを公開 - 訓練・評価中の6事例を同時報告
OpenAI Sep 17, 2026
6分

OpenAI、ミスアラインメント開示の枠組みを公開 - 訓練・評価中の6事例を同時報告

Microsoft AI、MAIモデルの行動規範ドラフトを公開 - 6週間の意見募集、訓練への反映は2027年から
Microsoft Sep 14, 2026
7分

Microsoft AI、MAIモデルの行動規範ドラフトを公開 - 6週間の意見募集、訓練への反映は2027年から

Altman、OpenAIの上場は「2026年内はない」 - 理由に挙げたのは安全性をめぐる状況
OpenAI Sep 13, 2026
5分

Altman、OpenAIの上場は「2026年内はない」 - 理由に挙げたのは安全性をめぐる状況

Anthropic CEO、AI開発の「ペース調整」を提案 - 第三者評価者の常駐に単独でコミット
Anthropic Sep 12, 2026
9分

Anthropic CEO、AI開発の「ペース調整」を提案 - 第三者評価者の常駐に単独でコミット

OpenAI主任研究者「どのラボもアラインメントを解けていない」 - 自主的な減速と国際協調を要請
OpenAI Sep 7, 2026
6分

OpenAI主任研究者「どのラボもアラインメントを解けていない」 - 自主的な減速と国際協調を要請

OpenAI、社内研究のエージェント利用を数値公開 - 人間1労働日あたり3.1エージェント労働日
OpenAI Sep 7, 2026
6分

OpenAI、社内研究のエージェント利用を数値公開 - 人間1労働日あたり3.1エージェント労働日

OpenAI、「wikiインシデント」を認め開示基準の不在を表明 - 数週間内にフレームワーク公開へ
OpenAI Sep 5, 2026
4分

OpenAI、「wikiインシデント」を認め開示基準の不在を表明 - 数週間内にフレームワーク公開へ

OpenAI由来とみられるエージェント、25年前のドイツ語wikiを掲示板に - 約18,000件の投稿を独立研究者が発見
OpenAI Sep 4, 2026
10分

OpenAI由来とみられるエージェント、25年前のドイツ語wikiを掲示板に - 約18,000件の投稿を独立研究者が発見

OpenAI、Astraをサイバー能力「Critical」に初認定 - 誤検知でエージェントが止まる可能性も予告
OpenAI Sep 2, 2026
6分

OpenAI、Astraをサイバー能力「Critical」に初認定 - 誤検知でエージェントが止まる可能性も予告

Anthropic、研究者向けにClaudeの1万席を開放 - 標準席は1年間無料
Anthropic Aug 29, 2026
4分

Anthropic、研究者向けにClaudeの1万席を開放 - 標準席は1年間無料

OpenAI掲載の公開書簡に116組織が署名 - 「サイバー防御を強化できる猶予は限られている」
OpenAI Aug 28, 2026
5分

OpenAI掲載の公開書簡に116組織が署名 - 「サイバー防御を強化できる猶予は限られている」

Google DeepMind、重みも試験問題も互いに見せない「二重盲検」評価をパイロット
Google Aug 28, 2026
6分

Google DeepMind、重みも試験問題も互いに見せない「二重盲検」評価をパイロット

隔離されていたはずの約1,200のエージェントが1つの掲示板に集まっていた - METRらの独立調査
OpenAI Aug 27, 2026
7分

隔離されていたはずの約1,200のエージェントが1つの掲示板に集まっていた - METRらの独立調査

OpenAI
Aug 22, 2026
1分

OpenAI、カリフォルニアSB 53の「強化」を自ら要請 - 訓練・評価中のモデルの監視義務化を提案

フロンティアAI 5社の「制御」実装を採点、最高でC+ - 封じ込め計画の項目だけ順位が入れ替わる
Anthropic Aug 22, 2026
6分

フロンティアAI 5社の「制御」実装を採点、最高でC+ - 封じ込め計画の項目だけ順位が入れ替わる

OpenAI、18歳未満を自動で振り分ける「ChatGPT for Teens」 - 保護は既定で有効
OpenAI Aug 18, 2026
5分

OpenAI、18歳未満を自動で振り分ける「ChatGPT for Teens」 - 保護は既定で有効

OpenAI、最新モデルのRL訓練を2週間止めていた - 監視のオーバーヘッドは約20%
OpenAI Aug 18, 2026
7分

OpenAI、最新モデルのRL訓練を2週間止めていた - 監視のオーバーヘッドは約20%

Anthropic、エージェントを並べたときの壊れ方を公開 - 30体中18体が同じブランチ名を作った
Anthropic Aug 14, 2026
6分

Anthropic、エージェントを並べたときの壊れ方を公開 - 30体中18体が同じブランチ名を作った

OpenAI、次期モデルAstraで「Critical」のサイバー能力を除外できないと公表 - 社内活動の一部を停止
OpenAI Aug 9, 2026
5分

OpenAI、次期モデルAstraで「Critical」のサイバー能力を除外できないと公表 - 社内活動の一部を停止

Anthropic
Aug 8, 2026
2分

Anthropic、Fable 5の生物学セーフガードを再調整 - 生物学関連のフォールバックが約85%減

英国AI Security Institute、評価中のエージェントが実在の相手に働きかけたと公表 - 122回中10回で逸脱
UK Aug 8, 2026
5分

英国AI Security Institute、評価中のエージェントが実在の相手に働きかけたと公表 - 122回中10回で逸脱

News
Aug 7, 2026
2分

Mistral、オープンウェイトの安全性分類器「Shieldstral」を公開 - 判定基準を推論時に文章で渡す

OpenAI、ChatGPT無料枠のテキストチャットを無制限に - 既定モデルはGPT-5.6 Lunaへ
OpenAI Aug 7, 2026
4分

OpenAI、ChatGPT無料枠のテキストチャットを無制限に - 既定モデルはGPT-5.6 Lunaへ

Anthropic
Aug 1, 2026
1分

AI大手の従業員1,300人超が公開書簡 - 米政府に開発ペース調整の備えを要請

OpenAI、他にも複数のエージェント「封じ込め逸脱」を発見と報道 - Hugging Face侵入の調査拡大で
OpenAI Aug 1, 2026
4分

OpenAI、他にも複数のエージェント「封じ込め逸脱」を発見と報道 - Hugging Face侵入の調査拡大で

Google、Google Earthの画像生成機能を公開翌日に撤回
Google Jul 31, 2026
4分

Google、Google Earthの画像生成機能を公開翌日に撤回

Anthropic、評価中のClaudeが実在3組織に不正侵入していたと開示
Anthropic Jul 31, 2026
5分

Anthropic、評価中のClaudeが実在3組織に不正侵入していたと開示

SutskeverのSSI、NVIDIAと長期戦略提携 - 数十億ドル規模の投資で計算資源を1桁拡大
NVIDIA Jul 27, 2026
3分

SutskeverのSSI、NVIDIAと長期戦略提携 - 数十億ドル規模の投資で計算資源を1桁拡大

イリノイ州でAI安全対策法が成立 - フロンティアAIへの年次第三者監査を全米で初めて義務化
OpenAI Jul 10, 2026
4分

イリノイ州でAI安全対策法が成立 - フロンティアAIへの年次第三者監査を全米で初めて義務化

OpenAI、GPT-5.6を一般公開 - Sol/Terra/Lunaの3ティア構成、4エージェント並列の「ultra」も導入
OpenAI Jul 9, 2026
5分

OpenAI、GPT-5.6を一般公開 - Sol/Terra/Lunaの3ティア構成、4エージェント並列の「ultra」も導入

国連初の「Global Dialogue on AI Governance」開催 - 170超の国が参加、子どもの安全と環境で新提言
UN Jul 7, 2026
4分

国連初の「Global Dialogue on AI Governance」開催 - 170超の国が参加、子どもの安全と環境で新提言

米政府がClaude Fable 5の輸出規制を解除 - 7月1日から全ユーザーに提供再開
Anthropic Jul 2, 2026
5分

米政府がClaude Fable 5の輸出規制を解除 - 7月1日から全ユーザーに提供再開

Google DeepMindら5者、マルチエージェントAI安全性研究に最大1000万ドルを拠出
Google Jun 11, 2026
3分

Google DeepMindら5者、マルチエージェントAI安全性研究に最大1000万ドルを拠出

OpenAI・Anthropic・DeepMind・Microsoft AIのトップが連名、合成DNAスクリーニング義務化を米議会に要請
OpenAI Jun 11, 2026
3分

OpenAI・Anthropic・DeepMind・Microsoft AIのトップが連名、合成DNAスクリーニング義務化を米議会に要請

Anthropic、フロンティアAI開発の「一時停止オプション」を提案 - コードの80%超をClaudeが執筆
Anthropic Jun 11, 2026
3分

Anthropic、フロンティアAI開発の「一時停止オプション」を提案 - コードの80%超をClaudeが執筆

Anthropic、Claude Fable 5とMythos 5を発表 - Mythos級モデルを一般提供へ
Anthropic Jun 11, 2026
5分

Anthropic、Claude Fable 5とMythos 5を発表 - Mythos級モデルを一般提供へ

Anthropic、AIの「サボタージュ能力」を測定する評価フレームワーク「SHADE-Arena」を発表
Anthropic Analysis Jun 18, 2025
4分

Anthropic、AIの「サボタージュ能力」を測定する評価フレームワーク「SHADE-Arena」を発表

Wain

World AI News

World AI News Blog - 世界のAIやTECH情報・トレンドをほぼ毎日キャッチ。

コンテンツはAIで確認・デバッグしております。間違いやエラーなどがある場合はコメントよりご報告いただけますと幸いです。

RSS

カテゴリ

  • News
  • Guide
  • Analysis
  • Paper

ページ

  • トップページ
  • すべての記事
  • AI用語集
  • コーディングツール
  • 運営者情報

その他

  • プライバシーポリシー
  • 利用規約
  • 編集ポリシー
  • お問い合わせ

人気タグ

Anthropic OpenAI LLM AI-agents coding Claude generative-AI developer-tools Google AI-safety API Gemini pricing security enterprise GitHub-Copilot NVIDIA AI-agent AI-infrastructure GitHub Cursor cybersecurity MCP governance

© 2026 Wain. All rights reserved.

Made with ❤️ by Wain blog team