PAPER REPORTS / RESEARCH

論文レポート

論文・研究成果を一次情報として、生成AIの技術動向と実務への示唆を分析するレポートです。

  • AIは数週間規模の開発タスクを完遂できるか — METRの時間軸(time horizon)研究とMirrorCode初期結果から読む「委任範囲」の動き

    MirrorCodeの4月初期結果では、Claude Opus 4.6が約16,000行のgotreeを再実装し、2,001テスト中2,000件に合格。6〜7月の完全版では25対象・最強モデル56%へ拡張され、Opus 4.7がgotreeを14時間・251ドルで再実装しました。初期値と完全版を分け、AIへ任せる条件を整理します。

    分析
    岡崎 太
    公開日
    出典数
    出典 7件
  • 論文レポートAIエージェント

    エージェントは「チームメイト」になれるか — 652タスクで観測された「協調の呪い」、CooperBench を読む

    StanfordとSAP LabsのCooperBenchは、652の協調コーディングタスクで、2体のエージェントが1体より低い成功率になる「協調の呪い」を観測しました。SoloとCoopの比較、46タスクの人数拡張実験、失敗トレース分析を分けて読み、人間が設計すべき分担・計画・統合ゲートを整理します。

    分析
    岡崎 太
    公開日
    出典数
    出典 2件
  • 論文レポートAIエージェント

    コンサル・銀行・弁護士の実務タスクでAIエージェントはどこまでできるか — APEX-Agents が示す「任せられる粒度」の現在地

    投資銀行アナリスト・経営コンサルタント・企業弁護士の実務経験者が作った480の長時間クロスアプリタスクで、8種のAIエージェントを評価したベンチマーク APEX-Agents(Mercor、2026年1月公開)を読み解きます。一発成功率は論文の評価時点で最高24.0%。この数字を「仕事が代替されるか」ではなく「どの粒度なら任せられるか」の地図として読み、業務の切り出し方に落とし込みます。

    分析
    岡崎 太
    公開日
    出典数
    出典 3件
  • 論文レポートAIエージェント

    AIエージェントは実際「何に」使われているのか — 17.7万MCPツールの実証分析が示す「語られる未来」と「作られている現在」

    AIエージェントは営業も人事も変えると語られますが、公開MCPツールの実測データは別の姿を示します。17万7,436件を分析した英AIセキュリティ研究所の論文をもとに、公開ツールの67%がソフトウェア開発向けという現在地と、環境を直接変更する「アクション型」へのシフトを読み解き、自社のエージェント導入領域の選び方に落とし込みます。

    分析
    岡崎 太
    公開日
    出典数
    出典 3件
  • 自己申告とRCTはなぜずれるのか — METR調査の「価値1.4〜2倍」と熟練OSS開発者の「完了時間19%増」

    METRの349名調査では、AIツールによる仕事の価値変化は自己申告で中央値1.4〜2倍。しかしMETR自身が「この数字には懐疑的になる理由がある」と注記しています。同じMETRのRCTでは、経験豊富なOSS開発者はAI利用で19%遅くなったのに「20%速くなった」と体感していました。体感と実測の乖離という研究の系譜を追い、体感ROIだけで意思決定する危うさと実測の設計方法に着地させます。

    分析
    岡崎 太
    公開日
    出典数
    出典 3件
  • 「生成AI導入の95%はP&L効果なし」をどう読むか — MIT NANDAレポートの定義・調査の限界・残り5%の構造

    「生成AI導入の95%は測定可能なP&L効果を生んでいない」——2025年夏に世界中で引用されたMIT Project NANDAのレポートを、原典に当たって検証します。95%が何の95%なのか、調査の母集団と「成功」の定義、レポート自身が明記する調査の限界を整理し、センセーショナルな数字に出会ったときの判断軸と「残り5%は何が違うのか」の構造分析に着地します。

    分析
    岡崎 太
    公開日
    出典数
    出典 2件