AIベンチマークとは?「MMLU 90%」などモデル比較の数字の読み方
新しいAIモデルの発表につきものの「MMLU」「GPQA」「SWE-bench」といったベンチマークスコア。これらが何を測り、どこまで信じてよいのかを、代表的なベンチマークの中身と、飽和・データ汚染という落とし穴とともに、意思決定者向けに解説します。
世界のAIニュースブログ
AIを理解するうえで欠かせない概念や用語を、非専門家向けにやさしく解説した記事をまとめています。 基礎から順に読むと学びやすい構成にしていますが、気になる言葉から読み進めてもかまいません。
33件の用語解説
新しいAIモデルの発表につきものの「MMLU」「GPQA」「SWE-bench」といったベンチマークスコア。これらが何を測り、どこまで信じてよいのかを、代表的なベンチマークの中身と、飽和・データ汚染という落とし穴とともに、意思決定者向けに解説します。
機械学習の3大パラダイム——正解を教わる教師あり学習、データの構造を自分で見つける教師なし学習、試行錯誤と報酬で学ぶ強化学習——の違いと使い分けを、分類・回帰・クラスタリング・AlphaGoなどの具体例と比較表で非専門家向けに解説します。
AI・機械学習・ディープラーニングの違いを非専門家向けに解説。3つは「AI ⊃ 機械学習 ⊃ ディープラーニング」という入れ子の関係にあります。それぞれの意味、機械学習とディープラーニングを分ける「特徴量」の考え方、生成AIやLLMがどこに位置するかを、Natureのディープラーニング論文などをもとに整理します。
LLMの「7B」「70B」「405B」という数字=パラメータ数とは何かを、スケーリング則の論文や技術解説をもとに解説。Bが10億を意味すること、多いほど賢い傾向とその限界、動かすのに必要なメモリ・GPUとのトレードオフ、量子化で軽くする考え方までを非専門家向けに整理します。
ChatGPTやClaudeの中身である「LLM(大規模言語モデル)」とは何か。大量のテキストから言葉を学び、1トークンずつ文章を生成する仕組み、Transformerという転換点、事前学習からファインチューニング・RLHFへの流れ、できることと限界を、公式ドキュメントをもとに解説します。
LLMの料金表や制限値に必ず登場する「トークン」とは何か。AIが文章をどう分解して処理するのか、なぜ日本語は英語よりトークンを多く消費しやすいのか、料金・コンテキストウィンドウ・レート制限との関係を公式ドキュメントをもとに解説します。
生成AIが事実と異なる内容を自信ありげに答える「ハルシネーション」。なぜ起きるのかをOpenAIの研究論文とAnthropic公式ドキュメントをもとに整理し、利用者がプロンプトでできる対策と、RAGなど開発側の対策を非専門家向けに解説します。
LLMが一度に扱えるテキスト量「コンテキストウィンドウ」をAnthropicとGoogleの公式ドキュメントをもとに解説。トークンの目安、大きいほど良いとは限らない理由(context rot)、上限との付き合い方まで非専門家向けに整理します。
ChatGPTやClaudeのAPIに必ず出てくる「temperature」「top-p」とは何か。AIが確率分布から次の単語を選ぶサンプリングの仕組みを、貪欲法・温度・top-k・top-p(核サンプリング)まで、図表を使って非専門家向けに解説します。
AIが「学習する」とは、具体的には何をしているのか。ニューラルネットワークが重みを調整する仕組みを、損失関数・勾配降下法(山下りの比喩)・誤差逆伝播(バックプロパゲーション)という3つの道具立てから、図表を使って非専門家向けに解説します。
なぜAIはモデルとデータと計算量を増やすほど賢くなるのか。損失が冪乗則で下がる「スケーリング則」を、Kaplan(2020)とChinchilla(2022)の対立、そして「創発的能力」をめぐる論争まで、非専門家向けに図表で解説します。
過学習(オーバーフィッティング)とは何か。AIが訓練データに合わせすぎて新しいデータに対応できなくなる現象を、過少適合との違い、バイアス-バリアンスのトレードオフ、訓練/検証/テスト分割、正則化・早期終了・ドロップアウトといった対策、そして大規模モデルで観測される二重降下まで、図表で解説します。
GAN(敵対的生成ネットワーク)とは何か。生成器と識別器という2つのAIを「贋金作りと警察」のように競わせて学習させる仕組みを、ミニマックスゲーム・モード崩壊・ディープフェイクへの応用、そして現在主流の拡散モデルとの違いまで、非専門家向けに図表で解説します。
ニューラルネットワークとは何か。ニューロン・重み・活性化関数・層という構成要素から、誤差逆伝播と勾配降下による学習の仕組み、パーセプトロンの限界と復活の歴史まで、生成AIの土台にある技術を非専門家向けに図表で解説します。
ゼロショット学習・フューショット学習とは何か。AIを再学習させず、プロンプトに例を0個や数個見せるだけで新しいタスクをこなさせる「文脈内学習(In-Context Learning)」の仕組みを、OpenAIのGPT-3論文をもとに非専門家向けに解説。ファインチューニングとの使い分けも整理します。
思考の連鎖(Chain-of-Thought)とは何か。答えだけでなく途中の考えをAIに書かせると、複雑な推論の正答率が大きく上がる仕組みを、GoogleのCoT論文や「Let's think step by step」のゼロショットCoT研究をもとに非専門家向けに解説。推論モデルやプロンプトエンジニアリングとの関係も整理します。
MoE(Mixture of Experts)とは何か。総パラメータが巨大なのに推論が速いという、現代の大規模AIを支えるアーキテクチャを、原論文や技術解説をもとに解説。全体を毎回使う密モデルとの違い、ルーターが専門家を選ぶ仕組み、MixtralやGemini等の採用例を非専門家向けに整理します。
RLHF(人間のフィードバックによる強化学習)とは何か。事前学習しただけのLLMを、人間にとって有用で自然な応答を返すAIに仕上げる仕組みを、OpenAIのInstructGPT論文などをもとに解説。ChatGPTやClaudeが自然に感じられる理由と、AIの安全性との関係を非専門家向けに整理します。
巨大なAIモデルをスマホやエッジ機器でも動かせるよう小さく速くする「軽量化」。代表的な手法である知識蒸留(教師から生徒へ)と量子化(数値の精度を落とす)の違いと使い分けを、Hintonの原論文や解説をもとに非専門家向けに整理します。
OpenAIのo3やClaudeの拡張思考、Gemini Deep Thinkなど、答える前にじっくり考える「推論モデル」とは何か。起点となったChain-of-Thought(思考の連鎖)、思考にトークンを割り当てる仕組み、得意なことと速度・コストのトレードオフを、論文や公式情報をもとに非専門家向けに解説します。
Stable DiffusionやMidjourneyなど画像生成AIの多くが採用する「拡散モデル」とは何か。画像にノイズを加え、それを段階的に取り除いて絵を生み出す仕組み、GANやVAEとの違い、活用例を、DDPM論文や解説をもとに非専門家向けに解説します。
画像を見せて質問したり音声で会話したり、AIが文字以外も扱えるようになった背景にある「マルチモーダルAI」とは何か。複数の種類のデータをまとめて扱う仕組み、シングルモーダルとの違い、活用事例を、AnthropicやGoogleの公式情報をもとに非専門家向けに解説します。
RAGやベクトル検索の土台にある「エンベディング(埋め込み)」とは何か。文章や画像を数値ベクトルに変換し、意味の近さを距離で表す仕組み、ベクトルデータベースやRAGとの関係を、Microsoft・Anthropicの公式ドキュメントをもとに非専門家向けに解説します。
ChatGPTのGPTやGoogleのBERT、現代の生成AIに共通する基盤「Transformer」とは何か。2017年の論文「Attention Is All You Need」が提案した自己注意機構(Self-Attention)と並列処理の仕組み、それがLLMの大規模化を可能にした理由を、非専門家向けに解説します。
学習済みAIを自社用に育てる「ファインチューニング」とは何か。事前学習済みモデルを追加データで再学習する仕組み、RAGとの違い(知識を焼き付ける vs 実行時に参照させる)、コストや更新頻度を踏まえた使い分けを、公式ドキュメントをもとに解説します。
プロンプトインジェクションとは何か。開発者の指示と外部から来た指示をLLMが区別できないという根本原因、直接型と間接型の違い、ジェイルブレイクとの区別、1ドルで車を売らされたチャットボットなどの実例、そしてOWASPが挙げる対策と「完全な防御は難しい」現実を、AI導入を考える経営者の視点で解説します。
ベクトルデータベースとは何か。キーワードの一致ではなく「意味の近さ」でデータを探す仕組みを、埋め込み・類似度検索・近似最近傍探索(ANN)の観点から解説。RAGの検索を支える中核コンポーネントとしての役割を、Elasticの公式ガイドなどをもとに非専門家向けに整理します。
Function Calling(Tool Use)とは何か。文章を作るだけのLLMが、天気APIや社内システムといった外部ツールを呼び出して「行動」できるようになる仕組みを、Anthropicの公式ドキュメントなどをもとに解説。AIエージェントやMCPの土台となる考え方を非専門家向けに整理します。
サーバー不要で、Webブラウザの中だけでLLMを動かす「WebLLM」とは何か。WebGPUとWebAssemblyを使った仕組み、OpenAI互換API、プライバシーやオフラインといった利点を、公式論文やリポジトリをもとに非専門家向けに解説します。
生成AIから望ましい答えを引き出すための「プロンプトエンジニアリング」とは何か。明確な指示・例示・役割付与・構造化といった基本テクニックから、思考の連鎖やプロンプトチェーンまで、Anthropicの公式ガイドをもとに非専門家向けに解説します。
AIアプリケーションと外部システムをつなぐオープン標準「MCP(Model Context Protocol)」。なぜ必要とされ、どんな仕組みで動くのかを、公式ドキュメントをもとにホスト・クライアント・サーバーの構成と3つのプリミティブから非専門家向けに解説します。
RAG(検索拡張生成)の定義と仕組みをAWS公式解説と原論文をもとに整理。生成AIが誤った情報を答えてしまう課題をどう補うのか、ベクトルデータベースを使った4つのステップと導入のメリットを非専門家向けに解説します。
AIエージェントの定義と仕組みを一次情報をもとに整理。生成AIチャットやワークフロー型自動化との違い、マルチエージェントの性能とコスト、ビジネス導入時の原則を非専門家向けに解説します。