サマリ
「生成AI導入の95%は測定可能な損益計算書(P&L)への効果を生んでいない」。2025年夏、MIT Project NANDA のレポート「The GenAI Divide: State of AI in Business 2025」から切り出されたこの数字は、株式市場の話題から経営会議の資料まで、あらゆる場所で引用されました。多くの場合、「生成AIはやはり使えない」という結論の根拠として、です。
本レポートでは、この26ページの原典を最初から最後まで読み直します。結論を先に言えば、「95%」は生成AIそのものの失敗率ではありません。原典は、エグゼクティブサマリーの「95%の組織がゼロリターン」、続く「統合型AIパイロットの5%が数百万ドル規模の価値を創出」、導入ファネルの「タスク特化型ツールの5%が本番到達」という、分母の異なる表現を併記しています。開示されたサンプル構成から、これらを単一の精密な失敗率として再現することはできません。
一方、同じレポートの中で、ChatGPT のような汎用の大規模言語モデル(LLM)ツールは約40%の組織が導入済みと報告されています。調査対象企業の9割超では、従業員が個人の生成AIツールを常用していました。原典が問題視している中心は、企業が公式に進めるカスタム/タスク特化型AIの取り組みが、持続的な生産性またはP&L効果を伴う本番導入まで到達しにくいことです。
さらに原典には、引用側がほぼ触れない「Research Limitations(調査の限界)」が繰り返し明記されています。数字は当事者の申告ベースで「方向性として正確」にとどまること、成功の定義が組織ごとに異なりうること、観察期間6カ月では長期の成功を取りこぼしうること。私たちは、この数字を「使えない証拠」としてでも「気にする必要のない数字」としてでもなく、「導入の何が失敗しやすいか」を教えてくれる構造分析として読むべきだと見ています。

論文の整理:MIT NANDA レポートとは何か
まず出自を確認します。MIT NANDA のレポートによると、著者は Aditya Challapally、Chris Pease、Ramesh Raskar、Pradyumna Chari の4名で、2025年7月に公表されました。NANDA(Networked Agents And Decentralized Architecture)は、AIエージェントの相互運用インフラを研究する MIT 発のプロジェクトです。
重要なのは、表紙の次のページに 「Preliminary Findings from AI Implementation Research(AI実装研究からの速報的知見)」 と明記されていることです。査読を経た学術論文ではなく、進行中の調査の中間報告という位置づけです。調査設計は次のとおりです(いずれも同レポートの記載)。
| 項目 | 内容 |
|---|---|
| 調査期間 | 2025年1月〜6月 |
| 手法1 | 公開されたAI導入事例300超の体系的レビュー |
| 手法2 | 52組織の代表者への構造化インタビュー |
| 手法3 | 4つの業界カンファレンスで収集した経営幹部153名への調査 |
| 効果の測定 | パイロット後6カ月時点のROIを申告ベースで評価 |
速報値を支える3つの調査材料
MIT NANDA レポートは、単一の無作為抽出調査ではなく、異なる3つの材料を組み合わせています。
- 公開事例300超公開されたAI導入事例を体系的にレビューしました。
- 52組織企業関係者へ構造化インタビューを行いました。
- 経営幹部153名4つの業界カンファレンスで回答を集めました。
3つの材料は市場全体の失敗確率ではなく、導入が停滞する構造を読むための調査として扱います。
つまりこれは、全企業を代表する無作為抽出調査ではなく、インタビューとカンファレンス来場者調査を柱とする定性寄りの研究です。それが悪いわけではありません。ただ、「95%」という精密に見える数字の土台がこの設計であることは、引用する前に知っておくべき前提です。
論文の整理:「95%」は何の95%か
エグゼクティブサマリーの原文はこうです。「企業による300〜400億ドルの生成AI投資にもかかわらず、95%の組織はゼロリターンにとどまっている」「統合型AIパイロットのうち数百万ドル規模の価値を引き出せているのはわずか5%で、大多数は測定可能なP&L効果のないまま停滞している」(MIT NANDA レポート、訳は筆者)。
この「95%」の中身を、同じレポートの導入ファネルのデータで分解すると、構図がはっきりします。
| 段階 | 汎用LLMツール(ChatGPT等) | カスタム/タスク特化型AI |
|---|---|---|
| 検討・調査した | 80% | 60% |
| パイロットに進んだ | 50% | 20% |
| 導入済み/本番到達 | 40% | 5% |
原典は、この右列の直後に「企業向けAIソリューションの95%失敗率」と書いています。しかし、図が示すのはカスタム/タスク特化型生成AIツールの本番到達が5%という申告ベースの割合で、カテゴリ別サンプル数は開示されていません。一方、左列——ChatGPT や Copilot のような汎用ツール——は、同じ調査で約40%が導入済みとされています。「生成AI全体の95%が失敗」と「調査サンプル内でタスク特化型ツールの本番到達が5%」は、異なる主張です。
もうひとつ見落とされがちな定義があります。MIT NANDA レポートは「導入成功」を 「利用者または経営幹部が、顕著かつ持続的な生産性および/またはP&Lへの効果があったと述べたもの」 と定義しています(原文の Research Note より)。客観的な財務データの検証ではなく、当事者の申告と評価が判定基準です。「測定可能なP&L効果」という言葉の硬さに比べて、測定の実体はずっと柔らかいのです。
母集団の定義も確認しておきます。同レポートの「エンタープライズ」は年商1億ドル超の企業と定義されており、この層はパイロットの数では先行しながら、パイロットから本格展開への転換率が最も低いと報告されています。一方、調査は中堅・中小企業にも言及し、付録では企業規模別のサンプル構成を十分に開示していません。したがって、95%を特定規模の企業にそのまま当てはめ、自社の失敗確率として扱うことはできません。
さらに同レポートは、公式導入の停滞と対照的な事実も報告しています。公式にLLMサブスクリプションを購入した企業は40%にとどまる一方、調査対象企業の9割超で、従業員が個人のAIツール(ChatGPT や Claude の個人アカウント等)を日常業務に使っていた——いわゆる「シャドーAIエコノミー」です。レポート自身が「AIはすでに仕事を変えつつある。ただし公式チャネルを通じてではない」と書いています。「95%失敗」を「現場で生成AIが使われていない」と読むのは、原典の記述と正反対です。
レポートが自ら退ける「5つの神話」
見出しの独り歩きを防ぐうえで最も有用なのは、MIT NANDA レポート自身が「企業における生成AIの5つの神話」として、よくある通説を一つずつ退けている箇所です。要約すると次のとおりです。
- 「AIは数年で多くの仕事を奪う」 → 調査では生成AI起因のレイオフは限定的で、すでにAIの影響が大きい業界に集中。今後3〜5年の採用水準について経営幹部のコンセンサスはない
- 「生成AIはビジネスを変革している」 → 利用の広がり(adoption)は高いが変革(transformation)はまれ。ワークフローに本格統合できた企業は5%にとどまり、9セクター中7つで構造変化は見られない
- 「大企業は新技術の導入に消極的だ」 → むしろ極めて積極的で、90%がAIソリューションの購入を真剣に検討済み
- 「最大の障壁はモデル品質・法務・データ・リスクだ」 → 実際の障壁は、ツールが学習せず、業務フローにうまく組み込めないこと
- 「先進企業は自社でツールを内製している」 → 内製は外部調達の2倍の頻度で失敗している
つまり原典は、「生成AIは使えない」どころか、「使われ方はすでに広がっているのに、公式の導入プロジェクトだけが変革に届いていない」という非対称を主題にしたレポートです。95%という数字だけを切り出すと、この主題が丸ごと落ちます。
論文の整理:レポート自身が明記する調査の限界
このレポートの誠実な点は、限界の申告が本文中に繰り返し埋め込まれていることです。引用時に切り落とされてきたのは、まさにこの部分です。
- 「これらの数字は、公式な企業報告ではなく個別インタビューに基づく、方向性として正確なもの(directionally accurate)である。サンプルサイズはカテゴリごとに異なり、成功の定義は組織ごとに異なりうる」(導入ファネルの図表に付された Research Limitations)
- サンプルの偏り:付録の「Research Methodology and Limitations」には、サンプルが全ての企業セグメント・地域を代表しない可能性、AI導入の課題を語ることに応じた組織に固有の選択バイアスがありうることが明記されています
- 観察期間の短さ:効果測定はパイロット後6カ月。「複雑なエンタープライズシステムでは6カ月の観察期間は『導入成功』の評価に不十分で、長期実装の成功率を過小評価している可能性がある」と、レポート自身が認めています
- 相関と因果の区別:外部パートナー活用が内製より成功率が高いという知見にも、「この差は実装アプローチではなく組織能力の差を反映している可能性があり、相関は必ずしも因果を証明しない」という Important Limitation が付されています
細部には速報版らしい粗さもあります。たとえば構造変化が見られたセクター数は、エグゼクティブサマリーでは「8セクター中2つ」、本文では「9セクター中2つ」と表記が揺れています。生成AI予算の営業・マーケティング偏重も、要約では約50%、本文の調査記述では約70%と幅があります。誤りと断ずるほどのものではありませんが、小数点以下まで信頼するタイプの数字ではないことは、レポート自身の体裁が教えてくれます。
論文の整理:残り5%の企業は何をしていたか
「95%」の裏側、つまり測定可能な効果まで到達した5%の側の記述は、引用ではほとんど流通しませんでした。しかしレポートの後半は、まるごとこの分析に充てられています。MIT NANDA レポートが挙げる成功側の共通項は次のとおりです。
- 買う、そして共同開発する:インタビューサンプルでは、外部パートナーとの協働によるカスタムツールは約67%が本番定着に至った一方、完全内製は約33%にとどまりました。パイロットが本番展開に至る割合は外部協働が内製の約2倍、従業員の利用率もほぼ2倍と報告されています
- AIベンダーをSaaSではなく業務委託(BPO)のように扱う:成功した買い手は、自社の業務プロセスとデータへの深いカスタマイズを要求し、モデルのベンチマークではなく業務成果でツールを評価し、初期の失敗を織り込んで「共進化」する前提でベンダーと組んでいました
- ユースケースを現場から吸い上げる:成功事例の多くは、中央のAI推進組織ではなく、すでに ChatGPT や Claude を使いこなしている現場のパワーユーザー(レポートの言葉では「prosumer」)を起点にしていました
- スピードの差:中堅企業のトップ層はパイロットから本格導入まで平均90日。年商1億ドル超のエンタープライズは9カ月以上を要していました
効果が出た場所についても、具体的なレンジが示されています。
| 領域 | MIT NANDA レポートが報告する効果の例 |
|---|---|
| フロントオフィス | リード選別の速度40%向上、AIによるフォローアップ経由の顧客維持率10%改善 |
| バックオフィス | 業務委託(BPO)契約の解消で年200万〜1,000万ドルの削減、外部クリエイティブ・コンテンツ費用30%削減 |
注目すべきは、これらの効果が大規模な人員削減を伴わずに得られていることです。レポートによれば、ROIの源泉は社内の雇用ではなく、外部支出——BPO契約、外注エージェンシー費、外部コンサル費——の削減に集中していました。雇用への影響が出始めているのは、すでに効果を出している企業のカスタマーサポート・事務処理といった、もともと外部化されていた定型領域に限られます(同レポートでは該当業務の5〜20%と幹部が申告)。予算の大半が営業・マーケティングに向かう一方で、実際のリターンは地味なバックオフィスに眠っている。この「投資と効果のねじれ」も、95%の見出しの陰に隠れた主要な知見です。
論文の整理:RAND の「80%」は別系統の数字
「AIプロジェクトの約8割は失敗する」という、似た構図の数字もよく併記されます。出どころは RAND Corporation が2024年8月に公表したレポート「The Root Causes of Failure for Artificial Intelligence Projects and How They Can Succeed」です。原典に当たると、ここにも重要な但し書きがあります。
RAND のレポートの原文は 「By some estimates, more than 80 percent of AI projects fail(一部の推計では、AIプロジェクトの80%超が失敗する——AIを伴わないITプロジェクトの2倍の失敗率である)」 です。つまりこの80%は、RAND 自身の測定値ではなく、出典を付して引用された他者の推計です。RAND の研究の本体は数字の測定ではなく、経験5年以上のデータサイエンティスト・エンジニア65名へのインタビューから失敗の根本原因を抽出した定性分析です。挙げられた5大要因は次のとおりです。
- 解くべき問題の誤解・伝達不全(最も頻度が高い要因):誤った指標に最適化されたモデルや、業務の文脈に合わないモデルが展開される
- 訓練データの不足:有効なモデルを訓練するのに必要なデータを組織が持っていない
- 問題解決より技術の追求を優先:実際の課題ではなく「最新・最先端」を使うこと自体が目的化する
- インフラの不足:データ管理と完成モデルの展開を支える基盤への投資が足りない
- AIには難しすぎる問題への適用:どれほど高度なモデルでも自動化できない課題は存在する
一目で分かるとおり、5つのうち技術そのものの限界は最後の1つだけで、残り4つは問題設定・データ・組織の問題です。
| 観点 | MIT NANDA「95%」 | RAND「80%超」 |
|---|---|---|
| 対象 | 企業のカスタム/タスク特化型生成AIパイロット | AIプロジェクト全般(生成AIに限らない) |
| 「失敗」の定義 | 本番導入+持続的な生産性および/またはP&L効果に至らない(申告ベース、原典内でも表現が揺れる) | プロジェクトとしての失敗(引用元推計に依存) |
| 数字の性格 | 自前調査の速報値(52組織+153名+公開事例) | 他者推計の引用(RANDの本体は65名への定性調査) |
| 公表 | 2025年7月 | 2024年8月 |
対象も定義も数字の性格も異なるため、「MITが95%、RANDも80%と言っている。だいたい9割は失敗するのが相場だ」という足し合わせはできません。ただし両者は、失敗の原因が技術よりも組織側にあるという診断では一致しています。この一致のほうが、数字そのものよりずっと実務的な価値があります。
岡崎の分析
このレポートが世界中で引用された2025年夏以降、経営者との会話で「MITが、生成AIの95%は失敗すると言っているらしいですね」という切り出しを何度も聞きました。投資を止める理由を探している会社ほど、この数字は都合よく響きます。しかし原典を読むと、これは「やらない理由」には使えない数字です。同じレポートでは、調査対象企業の9割超で従業員による個人ツールの常用が報告され、汎用ツールは約40%が導入済みとされています。原典が問題視しているのは、生成AI全体ではなく、公式な導入プロジェクトを持続的な業務成果へつなげる難しさです。
数字が独り歩きした構造も、この1本から学べることが多いと私たちは見ています。「95%」「MIT」「300〜400億ドル」という3つの要素は、それぞれ「精密さ」「権威」「規模」を演出します。しかし分解すると、95%は申告ベースの速報値、MITの名は査読論文ではなく研究プロジェクトの中間報告、投資額は市場全体の推計です。個々の要素に嘘はなくても、組み合わさって流通する過程で「MITが厳密に測定した生成AIの失敗率」という、原典のどこにも書かれていない像が出来上がりました。センセーショナルな数字は、たいていこの経路で生まれます。
一方で、このレポートを「雑な調査」と切り捨てるのも適切ではないと考えています。むしろ価値の中心は、前段で整理した「残り5%」の構造分析にあります。レポートが成功側の共通項として挙げたのは、外部と組むか、業務成果で評価するか、現場起点で課題を選ぶかという、いずれも技術以前の組織的な選択でした。ただし、これらは自己申告サンプルで観察された相関であり、成功の原因とまでは断定できません。そして効果が出た領域は、目立つ営業・マーケティングより、BPO費用の削減など地味なバックオフィスに集中しています。これは私たちが中小企業の導入支援の現場で見てきた実感——最初に定着するのは派手なユースケースではなく、毎週発生する文書業務——と一致します。派手な数字の裏で、レポートが伝えていたのは「成功は導入方法と組織条件に左右される」という、ずっと実務的なメッセージだったと私たちは見ています。
もうひとつ、日本の読者にとっての含意があります。このレポートは企業規模別の内訳を十分に開示しておらず、失敗の主因として挙げるのは「学習しないツール」「業務フローに合わない過剰設計」——つまりカスタムAI導入の失敗学です。汎用ツールを小さく業務に定着させる段階にいる日本の中小企業にとって、「95%」を自社の失敗確率として扱う根拠はありません。まずは同レポートで40%が導入済みとされた汎用ツール側を、自社の業務成果で小さく評価する余地があります。
提言 — どう付き合っていくか
衝撃的な数字に出会ったとき、そして「95%」を意思決定に使いたくなったときの判断軸を、本レポートの検証過程から抽出します。
- 「何の・何%か」を原典で確認してから引用する。 「生成AI導入の95%が失敗」と「カスタムAIツールの本番定着率が5%」では、導かれる打ち手が正反対になります。見出しではなく、原典の定義文(今回なら Research Note と Research Limitations)まで遡ってから社内資料に載せてください
- 数字より「失敗の構造」を輸入する。 MIT NANDA と RAND は、数字の系統は別でも「失敗の主因は技術ではなく、問題設定と組織側にある」という診断で一致しています。自社に持ち帰るべきは95%でも80%でもなく、「解く業務を現場起点で特定したか」「モデル性能ではなく業務成果で評価しているか」というチェック項目です
- 「導入プロジェクトの成功率」と「現場の活用度」を分けて測る。 シャドーAIが9割超の企業に広がっているというMIT NANDA の知見は、公式プロジェクトが止まっていても現場は先に進んでいることを示します。自社でも、公式導入の進捗とは別に「個人利用の実態」を把握することが、次に定着する業務を見つける最短ルートです
- 速報値・申告ベースの数字は「方向」だけ受け取る。 「directionally accurate(方向性として正確)」と自己申告している数字を、小数点付きの精度で経営会議に持ち込まない。方向(カスタム開発は定着が難しい、バックオフィスにROIが眠っている)は使い、精度(95という数字そのもの)には体重をかけない
- チェックリスト化するなら3問。 衝撃数字に出会ったら、(1)母集団は誰か(自社と似ているか)、(2)「失敗/成功」の定義は何か(誰がどう判定したか)、(3)原典に調査の限界の記載はあるか(あれば数字より先にそこを読む)。この3問を通らない数字は、意思決定の材料から外すことを推奨します
本レポートは公開データのみに基づく分析です。引用した数値の定義・調査設計・調査の限界の詳細は、末尾の出典から一次情報をご確認ください。
出典・参照データ
本レポートの分析は以下の一次情報に基づいています。統計・数値の詳細は各出典をご確認ください。
- The GenAI Divide: State of AI in Business 2025(Preliminary Findings)MIT Project NANDA
2025年7月公表。旧MIT NANDA公式PDFは現在概要ページへ転送されるため、2025年8月18日のInternet Archive保存版を参照。「95%の組織」「統合型パイロットの5%」「タスク特化型ツールの本番到達5%」という分母表現の揺れ、調査手法、Research Limitationsを引用
- The Root Causes of Failure for Artificial Intelligence Projects and How They Can Succeed: Avoiding the Anti-Patterns of AIRAND Corporation
「8割超が失敗」が出典付き推計の引用(By some estimates)であること、データサイエンティスト65名へのインタビューという手法、失敗の5大要因を引用

