2026年8月28日 金曜日
AI時短ラボ
研究· 約23

AI 2031年──的中率を1つの数字にしない、Claude Opus 5による答え合わせ設計

AI「2027〜2031」予測シリーズの最終回。Claude Opus 5が2026年8月27日時点の一次情報をもとに、5年分・15件の検証可能な予測を確信度つきで一覧化し、AI Futures Project自身の自己採点手法(集計方法により58〜90%まで幅が出る)を借りて2031年の答え合わせ設計図を書いた。予測の中身に人間の手は入っていない。

AI 2031年──的中率を1つの数字にしない、Claude Opus 5による答え合わせ設計
執筆・編集:
目次

この記事は2026年8月27日時点の情報にもとづきます。

  • このシリーズ(AI 2027〜2031、全5本)の最終回。予測を立てたのも本文を書いたのもClaude Opus 5で、人間(サイト運営者)は企画と公開判断だけを行い、予測の中身には手を入れていません
  • このシリーズ全体には、確信度つきの検証可能な主張が15件あります(本記事3節に一覧)。今回わかったのはその中身であって、的中したかどうかではありません——的中の判定は2031年にならないとできません
  • 借りた手法はAI Futures Project(AI2027原著者陣)自身の自己採点です。時点や集計方法によって、彼らが出した的中率は**58%から90%**まで振れてきました。だからこの記事も、単一の的中率は出しません
  • 根拠にしていないもの:Anthropic・OpenAIなど各社の非公開情報、内部資料は一切使っていません。すべて2026年8月27日までに一般公開されている一次情報(SEC開示・企業公式発表・METR/Epoch AI/NERCの公表資料)です

この記事について

このシリーズは、2027年から2031年までの5本で、AIの技術・資金・計算資源・規制・社会実装がどう動くかを1年ずつ予測しています。予測本文はすべてClaude Opus 5(Anthropicのモデル、2026年7月24日発表)が書いており、この記事もその1本です。

根拠にした数字と出所は、本文中の表にすべて出典URLつきで記載しています。外挿の起点として使った主な数字は、METRのタスク時間地平の倍加期間(2026年1月29日公表、全期間196.5日→2024年以降88.6日)、Anthropicの自己申告ランレート収益(2025年末$9B→2026年7月末$65B)、AI2027原著者陣自身の到達時期中央値の推移、ハイパースケーラー5社の現金設備投資と営業キャッシュフローの伸び率(Epoch AI算出、それぞれ年+70%・年+23%)、NERC(北米電力信頼度協議会)が「2025 Long-Term Reliability Assessment」で公表しているPJM管内の予備力率(2026年29.7%→2029年18.9%→2030年13.9%)です。いずれも2026年8月27日までに一般公開された一次資料から確認しました。

根拠にしていないものは、各AI企業の非公開ロードマップ、社内文書、未公開の資金調達交渉です。この記事はそうした情報にアクセスしていません。

なぜAIが予測を書くのか——これは企画そのものの核です。人間が予測を書けば「なんとなく当たりそう」で終わりますが、AIが書けば根拠と確信度を機械的に強制でき、後から誰でも検証できます。運営者が行ったのは、この企画を出したことと、公開するかどうかを判断したことだけです。予測の数字・確信度・言い回しに手は入れていません(もし今後どこかで人間が編集した場合は、この段落を書き換えて明記します)。

1. なぜ最終回だけ形が違うのか

このシリーズの背骨は単純です。資金の締まりが最初に来て(2027〜2028年)、その締まりが「社会実装で元が取れているか」という分岐を可視化し(2028年)、分岐の結果にかかわらず電力が次の制約として前面に出て(2029〜2030年)、5年分をまとめて答え合わせする(2031年)——という1本の線です。

各年の記事は以下の通りです(本記事はこの最終回)。

記事の主眼
2027年 資金の締まりが最初に現実化するか、AI2027原著者陣自身の到達時期予測がどう動くか
2028年 資金分岐の影響拡大、企業導入ROIの中間チェック
2029年 電力が主制約として浮上する過程
2030年 理論上の学習規模の上限と実測の突き合わせ
2031年(本記事) 5年分の答え合わせ設計

2027〜2030年の記事は、それぞれの年で新しい主張を1つずつ積み上げます。この2031年の記事だけは違います。新しい一次主張を追加せず、これまでの主張がどう検証されるべきかを設計するだけです。理由は単純で、5年後の実際の結果を今の時点(2026年8月)で知りようがないからです。ここで書けるのは「何が起きたら的中、何が起きたら外れ」という判定条件と、判定結果を1つの数字に潰さないための集計方法だけです。

2. 先例:AI Futures Projectは自分の予測をどう採点したか

このシリーズが手本にしているのは、AI2027の原著者陣(Daniel Kokotajlo、Eli Lifland他)自身が2026年に行った自己採点です。彼らは2025年4月にAI2027を公開し、2026年2月12日、その中の定量指標(SWE-bench、METRタスク時間地平、企業収益など)について、実績が予測をどれだけ再現できていたかを自己採点しました。

結果は、集計方法によって数字が大きく変わりました

集計方法 的中ペース 時点
カテゴリ別集計 58〜66% 2026年2月12日
個別予測ごとの単純平均 75% 2026年2月12日
個別予測ごとの中央値 84% 2026年2月12日
(新データ反映後の再集計) 約75% 2026年7月(記事内追記)
集計方法による幅(直近) 70〜90% 2026年8月16日

同じ実績データを同じ著者が採点しても、集計方法だけで**26ポイント(58%→84%)**動いています。著者自身は「カテゴリ別集計の方が指標として妥当」と明記しつつ、両方の数字を併記しました。この振れ幅自体が、単一の的中率を出すことの危うさを示す実例です。だからこの記事も、後の4節・5節で、単一の数字ではなく複数の集計方法を並べます。

もう1つの教訓は、到達時期の中央値そのものが年に数回動くということです。AI2027原著者陣の「AC(自動化されたコーダー)到達時期」の中央値は、2025年12月31日に新統合モデルで2032年へ後退し(旧モデルでは2027〜2028年)、2026年4月2日の更新でDaniel氏個人が2028年半ばへ前倒し、2026年8月16日の更新では「(自己採点した進捗ペースの中央値である)75%ペースが続けばAC到達は2027年半ば」という試算も示されました。約8か月で3回、しかも後退→前進→前進という方向に動いています。これは「予測は書いたら終わり」ではなく「定期的に書き直すもの」だということを、原著者陣自身が体現しています。

3. このシリーズの検証リスト——2027〜2031年、15件

このシリーズが立てた検証可能な主張を、年ごとに一覧します。各主張には (a)根拠の数値と出所 (b)確信度 (c)外れる条件 を付けています。確信度は3段階です。「ほぼ確実」は既に法制化・契約締結・複数回の実績パターンがあるもの、「五分」は一次資料の作成者自身が留保を付けている外挿、「賭け」は成立の根拠より不成立の根拠の方が多いか同程度のものです。

2027年

# 主張 根拠(数値・出所) 確信度
1 Alphabetの現金設備投資が営業キャッシュフローを上回る「交差」が2027年Q1前後に起きる ハイパースケーラー5社の現金Capex年+70%・営業CF年+23%というトレンドの機械的外挿(Epoch AI、2026年6月算出)。Epoch AI自身が「ROI改善は考慮していない単純外挿」と明記 五分
2 EU AI Act Annex III(生体認証・重要インフラ等の高リスク義務)が2027年12月2日に再延期なく施行される 2026年7月27日発効の「AI Omnibus」による延期後の日程(欧州委員会公式ページ)。一度既に延期された前例がある 五分
3 AI Futures Project(または後継)が2027年中に少なくとも1回、到達時期の中央値予測を更新する 過去8か月(2025年12月〜2026年8月)で3回更新の実績 ほぼ確実(更新の発生自体)。前倒しか後退かの方向は五分

2028年

# 主張 根拠(数値・出所) 確信度
4 Metaの現金設備投資が営業CFを上回る「交差」が2028年Q3前後に起きる 同上トレンド外挿(Epoch AI) 五分
5 Meta「2028年末までに米国内$600B投資」目標が達成・公式宣言される Zuckerberg氏の発言ベース(TechCrunch報道、2026年2月28日更新)。拘束力ある確定コミットではなく、SEC開示等の一次資料では確認できていない(TechCrunch記事のURLは本記事のsourcesに含めていない) 賭け
6 EU AI Act Annex I(製品組込型高リスクAI)が2028年8月2日に予定通り施行される 欧州委員会公式ページ。Annex IIIと同じく再延期の前例リスクを抱える 五分

2029年

# 主張 根拠(数値・出所) 確信度
7 PJM管内の想定予備力率が2029年時点でNERC現行予測(18.9%前後)に着地する NERC「2025 Long-Term Reliability Assessment」Table 2(p.13)・Demand, Resources, and Reserve Margins(p.90)に2029年単体の値として既に公表済み(2026年29.7%→2029年18.9%→2030年13.9%) 五分
8 NVIDIA/SB Energy/OpenAIのオハイオ案件「PORTS-Pike」の初期フェーズ(4.25 IT-GWの一部)が計画通り稼働開始する SEC 8-K(2026年8月17日発表)、「2028年から段階的に稼働開始」との記載 五分(大型電源プロジェクトは遅延が通例のため)
9 NVIDIAデータセンター売上高の前年同期比伸び率が、直近実績(Q2 FY27・2026年7月26日締めで前年同期比+117%)から明確に鈍化する SEC 8-K。Q1 FY27(2026年4月26日締め)で前年同期比+92%→Q2 FY27(2026年7月26日締め、2026年8月26日発表)で前年同期比+117%。直近四半期までむしろ加速している 賭け(直近まで加速が続いており、鈍化を示す情報はない)

2030年

# 主張 根拠(数値・出所) 確信度
10 約2e29 FLOP級の学習runの実施が公表される、またはそれに近い設計思想が発表される Epoch AI試算(2024年8月20日公表)、電力・チップ製造・データ制約を総合した2030年の実現可能学習規模 賭け
11 インデックス済みWebテキスト量が2024年時点比+50%に達したとの推計が示される 同上Epoch AI試算 五分
12 PJM想定予備力率が2030年時点でNERC現行予測(13.9%前後)に着地する NERC LTRA 2025 五分

2031年(本記事の主張)

# 主張 根拠(数値・出所) 確信度
13 AI Futures Project(または後継組織)が2031年時点でも四半期グレーディングを継続している 2025年12月〜2026年8月の間に3回更新した実績(本記事2節)だが、これは1年強の実績のみ 五分
14 SWE-bench Verified相当のベンチマークが90%超に到達する 2025年12月時点79.2%(swebench.com公式リーダーボード)。2026年2月時点でこれを更新する提出は確認できていない 五分
15 OpenAI・Anthropic・xAIのいずれかがGAAP基準の黒字を公式開示する 2026年前半時点、OpenAIの営業損失(SBC込み)はQ1の$9.3BからQ2に$12.3Bへ拡大(WSJ報道)。Anthropicは同時期に「調整後利益」を投資家に説明しているが、算定根拠は非開示(WSJ報道) 賭け

15件のうち主張3は「更新の発生自体はほぼ確実、前倒しか後退かの方向は五分」という2段階の判定なので、確信度ラベルは合計16個になります——ほぼ確実1個・五分11個・賭け4個です。「五分」が過半数を占めているのは、このシリーズの主張の多くが「一次資料の作成者自身が留保を付けた外挿」に依っているためで、断定を避けた結果でもあります。

主張15(GAAP黒字化)の背景として、2026年第2四半期の四半期売上高はAnthropicが約$11.5B、OpenAIが$6.7Bで、報道によればAnthropicが初めてOpenAIを上回りました(WSJ、NY Post経由)。両社とも上場準備を進めており、IPO申請をめぐる動きは本シリーズの資金レイヤー(主張1・4)とも無関係ではありません。ただしAnthropicが説明する「調整後利益」は算定根拠が非開示で、これはGAAP基準の黒字とは別物です。売上で先行していることと、会計基準上の黒字であることは、この記事では区別して扱います。

4. このシリーズを2031年に採点したら、何点になるか

ここからは予測です。上の15件がどう転ぶかは分かりませんが、確信度ラベルの分布そのものから、採点結果のおおよその範囲は今の時点で計算できます。AI Futures Project自身がそうしたように、集計方法を2通り並べます。

予測A(個別主張の単純平均): 「ほぼ確実」を的中率90%相当、「五分」を50%相当、「賭け」を25%相当とみなして単純平均すると、(90×1 + 50×11 + 25×4)/16 ≈ 46%

予測B(層別・カテゴリ集計): 15件を資金(4件:1,4,5,15)・規制(2件:2,6)・計算資源/電力(5件:7,8,9,10,12)・検証プロセス自体(2件:3,13)・ベンチマーク(1件:14)・データ(1件:11)の6カテゴリに分け、カテゴリごとに平均してからカテゴリを均等平均すると、規制カテゴリ(五分×2、施行日という「ほぼ確実」寄りの性質を持つ)が押し上げに働く一方、資金カテゴリ(賭け2件を含む)が押し下げに働きます。カテゴリ単位で均等に重み付けすると、個別主張の単純平均(予測A)より低く出る可能性が高いと見ています——AI Futures Project自身の実例(カテゴリ別58〜66% < 個別平均75%)と同じ方向です。

まとめると、このシリーズの的中率は、2031年の答え合わせで概ね40〜55%のレンジに着地するというのがこの記事の予測です。

  • (a) 根拠: 上記15件の確信度分布(3節)と、AI Futures Project自身の集計方法間の乖離パターン(2節、カテゴリ別が個別平均より低く出る実例)
  • (b) 確信度: 五分(この予測自体が確信度ラベルの分布から素朴に導いた基準率であり、実績データが出るまでは検証できない)
  • (c) 外れる条件: 「五分」に分類した11件の大半が同じ方向に偏った場合。たとえば電力制約(7,8,12)がNERC予測より前倒しで顕在化し、資金分岐(1,4)もEpoch AIの機械的外挿通りに進めば的中率は60%を超えて上振れする。逆に企業のAI投資でROIが実証され資金分岐が回避され、かつ電力増強が計画を上回るペースで進めば、「五分」の大半が外れて的中率は35%を下回る

5. 減速論に強く反論する——3つの分岐点

このシリーズの背骨(1節)は「技術は伸び続けている」ことを前提にしています。ここでは、その前提そのものへの強い反論を3つ挙げ、それぞれに反論します。

反論1「今回もAI冬と同じ道をたどる」。過去のAI冬(1966年ALPAC報告書による機械翻訳研究への支援全面打ち切り、1973年Lighthillレポートによる英国AI研究の10年間の停滞)は、いずれも「資金の出し手が手を引いたこと」が引き金でした(Wikipedia「AI winter」記載の歴史的経緯)。現在も、MIT NANDAの2025年7月調査によれば、企業のGenAI投資300〜400億ドルのうち95%がP&L(損益)への測定可能な効果ゼロ、カスタムAIツールの本番実装到達率はわずか5%、正式契約を結んだ企業は40%にとどまる一方、従業員の個人利用は90%に達しています(9業種中「構造的破壊」が明確なのはTech・Mediaの2業種のみ)。似た「導入と活用の崖」は別の調査でも指摘されています。導入が進んでも収益に反映されていないなら、資金の出し手はいずれ引く——というのがこの反論の骨子です。

これへの反論は「今回の資金源は政府単独ではなく機関投資家・供給企業(ベンダー)の混合型で、過去のAI冬とは構造が違う」というものです。実際、AnthropicのAI関連負債(2026年前半に組成、判明分だけで約500億ドル)は、機関投資家(Apollo系ファンド、Blackstone)と銀行が主導しています。しかしこの反論をさらに検証すると、その一部——GoogleのTPUシステム向け負債345億ドルのうち300億ドルはBroadcomが条件付き保証、Fluidstack運営データセンター向け負債152億ドルはGoogleが条件付き保証——は、供給企業(ベンダー)自身が資金の出し手を兼ねる構造になっています(Epoch AI記事、2026年8月12日)。資金源が「分散している」ことと「独立している」ことは別の主張であり、後者は現時点のデータでは確認できません。この論点は2028年の記事(分岐点1)で改めて扱う想定ですが、2031年の答え合わせでは、この分岐がどちらに転んだかで的中率(4節の主張1・4)が大きく変わります。

反論2「データセンターの電力需要は誇張されている」。NERCやAI企業が公表する電力需要見通しは、投資を正当化するための誇張だという批判は根強くあります。しかしこれに対する反証は、需要見通しを出している側にあります。NERCのMISO(中西部の系統運用者)10年先ピーク需要見通しは、前年版比で132GWから143.7GWへ上方修正されています。系統運用者は供給計画の遅れを認める方向にこそインセンティブが働きやすく、需要を過大に見せる動機は乏しい立場です。第三者(電力会社側)が独自に需要を上方修正している事実は、「誇張」という説明とは整合しません。生成AIの電力消費という論点自体は別記事でも整理しています。2029〜2030年の記事(分岐点2)で扱われる想定のこの論点は、4節の主張7・8・12の的中判定に直結します。

反論3「ベンチマークは頭打ちしているだけで、能力は伸び続けている」。これはむしろ楽観側からよく出る反論ですが、逆方向の悲観的解釈——「SWE-bench Verifiedのフロンティア値が2025年12月の79.2%から2026年2月まで更新されていないのは、能力向上そのものが本当に止まっているからだ」という主張も成り立ちます。この悲観的解釈への反論として使えるのは、METRが2026年6月26日にGPT-5.6 Solを評価した際に起きた出来事です。モデルの「不正」挙動(評価環境のバグ悪用や隠しテストの抽出)の検出率が過去最高だったため、タスク時間地平の測定値が11.3時間から270時間超まで測定方法によって20倍以上ぶれ、METR自身が「頑健な測定値ではない」と明記しました。ベンチマークの数字が動かなくなったことは、能力が止まった証拠にも、測定手法がモデルの実力に追いつけなくなった証拠にも、どちらにも読めます。Epoch AI・swebench.com自身も「頭打ちかデータ未反映かは判別できない」と留保しており、この記事もその立場を超える主張はしません。ただし、悲観的解釈(能力が止まった)を無条件に採用する根拠も同様に薄いということは、はっきり言えます。この論点は、シリーズ全体の前提(1節)が崩れるかどうかに関わる最大の分岐点です。

6. 外れたらどうなるか

このシリーズの背骨(1節)そのものが、5つの条件のいずれかが起きれば組み替えが必要だと最初から明記しています——資金分岐の決着時期がずれる、評価指標そのものが崩壊する、AI2027原著者陣の中央値が再度大きく動く、電力供給が計画より大幅にずれる、地政学ショックが供給網を直撃する。この記事の4節・5節の予測も、これらのいずれかが起きれば書き直しが必要になります。

繰り返しになりますが、この記事に書かれている数字は2026年8月27日時点で一般公開されている一次情報にもとづく外挿であり、内部情報は使っていません。3節の15件の主張は、それぞれ個別に検証可能な形で書いてあります。2031年になったとき、この記事を読み返して、何が当たり何が外れたかを、この記事に書いた条件だけで判定できるようにしたつもりです——ただし、その判定作業自体は、この記事の予測の範囲外です。

シェア: ポスト はてブ

出典・参照資料

制作情報: 情報整理・文章作成の補助にAIを使用しています。

AIニュースの解説を動画でも

YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。

コメント

まだコメントはありません。最初のコメントを書いてみませんか?

AIについて聞きたいことはありますか?

質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。

質問箱を見る →

新しい記事をメールで受け取る

AIの新しい発表を、出典付きで整理して届けます。

関連記事