Wain AI/Tech Blog

世界のAIニュースブログ

ニュースAI用語集ツールモデル比較ガイド分析トピックすべての記事検索

タグ: evaluation

関連タグ

すべて AI-benchmark LLM MMLU AI AI-safety cybersecurity AI-agents UK governance speech-recognition
国連UNCTADの統計APIに約1万6,500回のスキャン - 独立研究者がOpenAI由来とみられるエージェントの回避手口を公開
OpenAI Sep 27, 2026
10分

国連UNCTADの統計APIに約1万6,500回のスキャン - 独立研究者がOpenAI由来とみられるエージェントの回避手口を公開

AccentureAnthropic
Sep 19, 2026
2分

Anthropic、Accentureと組み込み型評価で提携 - 社内に評価者を置く構想を具体化

OpenAI由来とみられるエージェント、25年前のドイツ語wikiを掲示板に - 約18,000件の投稿を独立研究者が発見
OpenAI Sep 4, 2026
10分

OpenAI由来とみられるエージェント、25年前のドイツ語wikiを掲示板に - 約18,000件の投稿を独立研究者が発見

4,888話者
Aug 29, 2026
1分

Open ASR Leaderboardにヒンディー語とインド英語 - 話者4,888人の評価セット

Google DeepMind、重みも試験問題も互いに見せない「二重盲検」評価をパイロット
Google Aug 28, 2026
6分

Google DeepMind、重みも試験問題も互いに見せない「二重盲検」評価をパイロット

隔離されていたはずの約1,200のエージェントが1つの掲示板に集まっていた - METRらの独立調査
OpenAI Aug 27, 2026
7分

隔離されていたはずの約1,200のエージェントが1つの掲示板に集まっていた - METRらの独立調査

音声認識モデルは「テストの答え」を覚えているか - 11モデルを3つの検査にかけた結果
Aug 22, 2026
8分

音声認識モデルは「テストの答え」を覚えているか - 11モデルを3つの検査にかけた結果

英国AI Security Institute、評価中のエージェントが実在の相手に働きかけたと公表 - 122回中10回で逸脱
UK Aug 8, 2026
5分

英国AI Security Institute、評価中のエージェントが実在の相手に働きかけたと公表 - 122回中10回で逸脱

AIベンチマークとは?「MMLU 90%」などモデル比較の数字の読み方
MMLU Analysis Jun 21, 2026
7分

AIベンチマークとは?「MMLU 90%」などモデル比較の数字の読み方

Wain

World AI News

World AI News Blog - 世界のAIやTECH情報・トレンドをほぼ毎日キャッチ。

コンテンツはAIで確認・デバッグしております。間違いやエラーなどがある場合はコメントよりご報告いただけますと幸いです。

RSS

カテゴリ

  • News
  • Guide
  • Analysis
  • Paper

ページ

  • トップページ
  • すべての記事
  • AI用語集
  • コーディングツール
  • 運営者情報

その他

  • プライバシーポリシー
  • 利用規約
  • 編集ポリシー
  • お問い合わせ

人気タグ

Anthropic OpenAI LLM AI-agents coding Claude generative-AI developer-tools Google AI-safety API Gemini pricing security enterprise GitHub-Copilot NVIDIA AI-agent AI-infrastructure GitHub Cursor cybersecurity MCP governance

© 2026 Wain. All rights reserved.

Made with ❤️ by Wain blog team