Andrej Karpathy, a co-founder of OpenAI, spent a Saturday morning in March 2026 on a small side project: he had an LLM score how "digitally exposed" a few hundred U.S. occupations are, on a 0-to-10 scale. Software developers landed at 9 out of 10. The story spread fast, and by the next morning Karpathy had taken it down (it has since been restored with added disclaimers). He said it had been "wildly misinterpreted," even though the project notes explicitly warned that a high score did not mean a job would disappear.
AIによる仕事のリスクスコアがどう計算されているかは、見出しに躍る数字そのものより重要です。Karpathyのプロジェクト、Goldman Sachs、国際通貨基金(IMF)、Anthropicはいずれも「曝露」の定義が異なり、それぞれのパーセンテージを置き換えて使うことはできません。
同じ職業でも、背後にある手法によってスコアは大きく変わります。そして、どの指標も単独では、あなたが仕事を失うかどうかを教えてはくれません。
要約
- 世に出回る「AIによる仕事のリスク」の数字は、ひとつの指標ではありません。多くは仕事の能力やタスクに基づく理論上の曝露から出発しますが、Anthropicは観測されたAI利用も測定しています。世界経済フォーラムのような雇用主調査は、さらに別の手法を使っています。
- 理論上の指標と観測利用に基づく指標は、同じ職業でも大きく食い違うことがあります。Anthropicが2026年3月に行った比較では、Eloundou et al.の理論指標がコンピュータ・数学分野のタスクの曝露率を94%としたのに対し、Anthropicの観測曝露指標は33%でした。
- 2025年にPNAS Nexusに掲載された査読付き研究は、12種類の曝露スコアを失業リスクと比較し、最も優れた単一スコアでも単独では変動の10.7%しか説明できないことを明らかにしました。12種類すべてを組み合わせても29.8%です。
- 次に目にする「AIによる仕事のリスク」の数字を信じる前に問うべきは、数字が何を言っているかだけでなく、どの手法がそれを生み出したかです。
本記事が扱わないこと
この記事は仕組みの解説であり、特定の仕事について判定を下すものではありません。そのため、隣接するいくつかの問いは対象外です。
- どの職業が最も安全か、最もリスクが高いかのランキングは行いません。それは別種の記事です。
- 年齢や経験年数別の現在の採用動向は分析しません。そうした労働市場の結果には、曝露スコアとは別の証拠基盤が必要です。
- AIの能力が今後どこへ向かうかは予測しません。将来のモデルがどれほど優れたものになっても、手法をめぐる問いは変わりません。
理論上の曝露スコアリングの仕組み:O*NET、AIOE、Goldman Sachs、IMF
AIOEとして知られるAI Occupational Exposure指標は、10種類のAI応用カテゴリーとO*NETの52種類の職業能力を照合します。クラウドソーシングで作成された行列が各AI応用と各人間能力の関連度を評価し、その後、その能力が特定の職業でどれだけ一般的かつ重要かによってスコアが重み付けされます。経済学者のEdward Felten、Manav Raj、Robert Seamansは2021年にこの手法を Strategic Management Journal で発表しました。これは、職業のAI曝露を測定しようとする後続の試みの有力な基盤のひとつとなりました。
AIOEで重要なのは、それが導入の指標ではなく曝露の指標だという点です。AI応用の進歩が職業に求められる能力とどれだけ重なるかを推定するものであり、雇用主がそこでAIを使っているか、導入が経済的に見合うか、雇用が減るかどうかは教えてくれません。
IMFはFelten、Raj、Seamansの曝露指標を 2024年1月のスタッフ・ディスカッション・ノート で採用し、人間の判断、社会的文脈、物理的な存在といった要因によって職業が完全な代替からどれだけ守られているかを捉える、別個の補完性指標と組み合わせました。この枠組みを用いて、IMFは世界の雇用のほぼ40%が高曝露の職業にあり、先進国では約60%に達すると推定しました。
Goldman Sachsの2026年4月の分析 も同様の次の一歩を踏み出しています。従来のAI代替スコアにIMFのエコノミストによる補完性指標を組み合わせ、代替が起こりそうな領域と増強が起こりそうな領域を切り分けたのです。Goldmanの推定では、過去1年間の米国の雇用者数の伸びに対して月およそ16,000人分の純減圧力がかかる一方、AIによる増強の可能性がある職業は月約9,000人分の雇用を増やしています。
注意: 世界経済フォーラムの Future of Jobs Report は2030年までに9,200万の仕事が失われ、1億7,000万が創出されると予測していますが、その作り方はまったく異なります。1,000社以上の雇用主に見込みの人員増減を回答してもらう調査に基づくもので、タスク分解によるスコアリングではなく雇用主の自己申告です。構造的にまったく異なる2つの手法が、同じ「X百万の仕事」という一文の中で引用されてしまうのです。
Anthropicが「観測曝露」をどう違う形で測定しているか
AnthropicのEconomic Indexは2025年2月に初めて公開され、まったく異なる種類のデータから出発しています。約100万件の実際のClaude.aiの会話を、Clioという社内ツールに通し、研究者が元のチャットを読むことなく、各会話をタスク分解スコアが参照するのと同じO*NETデータベース内の特定のタスクに対応付けるのです。AIOEが「AIはそのタスクをもっともらしくこなせるか」を問うのに対し、Indexは「人々はAIに何を頼んでいるか」を問います。この最初のレポートでは、会話の57.4%が増強(人が作業の主導権を握ったままClaudeが補助する)、42.6%が自動化(Claudeが実質的にタスクを最初から最後までこなす)に分類されました。
Anthropicは 2026年3月の続報で、この利用データを新たな「観測曝露」指標に変換しました。O*NETのタスクとEloundou et al.(2023)の理論上のタスク曝露推定から出発し、業務関連のClaude利用に十分な頻度で現れるタスクだけをカバー済みとして数えます。完全に自動化された利用は満点の重み、増強的な利用は半分の重みを与えられ、タスクのカバー率は労働者が各タスクに費やす時間の割合で重み付けされます。コンピュータ・数学系の職業では、Eloundou et al.の理論上のβ指標がタスクの94%に達する一方、Anthropicの観測曝露指標は33%です。この差は矛盾ではありません。一方は技術的な実現可能性を測り、他方はそこに観測された導入と利用を加えているのです。
Anthropic自身のレポートを読んだ人の全員が、この比較を額面どおりに受け取ったわけではありません。2026年1月の関連レポートに反応して、 Hacker Newsのあるコメント投稿者 はこう書いています。「人工知能の利用によって生み出された経済的生産性の測定を見られると期待していた。ところが目にしているのは、人工知能の利用そのものの測定だ。」これは押さえておく価値のある区別です。利用量と経済的生産性は同じものではなく、どちらも失業と同じものではありません。
その2026年1月のレポート、つまりAnthropic自身の 経済的プリミティブに関するアップデートでは、増強と自動化の比率がまた動いたことが示されています。増強が会話の52%で先行し、自動化は45%。加えて、タスクの複雑さ、スキル、用途、AIの自律性、タスクの成否を追跡する新しい5部構成の枠組みが導入されました。これは進化し続ける指標の新しいスナップショットであって、2025年2月の数字を否定するものではありません。人々が任せる価値のある新しい用途を見つけるにつれ、利用パターンは変わっていきます。
理論上の曝露率94%と観測曝露率33%という数字は、測っているものが違うため、矛盾することなく同じ職業カテゴリーを表しうるのです。
なぜ「曝露」は「失業」と同じではないのか
「曝露指標が示すのは技術的な影響の受けやすさであって、労働市場の結果ではない。」
国際労働機関、2026年4月
理論上の曝露スコアも観測曝露スコアも、仕事とAIの能力との関係について現実の何かを捉えています。しかし、どちらもその仕事が来年も存在するかどうかを教えてはくれません。
2025年、 Morgan Frank、Yong-Yeol Ahn、Esteban Moro はこのギャップを米国の失業データで検証しました。公開されている12種類の曝露スコアを、州の失業保険記録から構築した職業別・州別の月次失業リスクと比較したのです。最良の単一スコアは、職業・州・月にまたがる失業リスクの変動の10.7%を説明し、12スコアのアンサンブルは29.8%を説明しました。職業のスキル要件、学歴、州、年、季節性を用いたベースラインモデルは57.4%を説明し、そこに曝露スコアのアンサンブルを加えると75.5%に上がりました。
端的に言えば、単一の曝露スコアは失業リスクの予測因子としては単独では弱いということです。変動のはるかに大きな部分は、スコアに含まれていない労働市場の構造、すなわち職業のスキル要件、学歴、地理、季節性と結びついています。
| 観点 | 理論上/タスクベースの曝露 | 観測曝露(Anthropic) |
|---|---|---|
| 測定内容 | AIが仕事のどれだけの部分に影響を与えたり加速したりしうるか | 理論上実行可能なタスクのうち、どれが業務関連のClaude利用に現れるか |
| 利用者 | 複数の学術的・機関的な曝露フレームワークで使用 | Anthropicが自社のClaude.ai利用に対して使用 |
| データソース | O*NETの職務構成要素と、手法ごとのAI能力評価 | Claudeの利用状況と、O*NETのタスクおよび理論上の実現可能性 |
| うまく捉えられるもの | AIの能力が仕事に影響を与えうる場所 | 観測された導入状況と、仕事がClaudeにどう委ねられているか |
| 見落とすもの | 需要、コスト、規制、そして誰かが実際にやるかどうか | Claude以外の利用。ひとつの製品のユーザーしか反映しない |
| 数値の例 | コンピュータ・数学:理論上94%(Eloundou et al.) | コンピュータ・数学:観測33% |
OpenAIが2026年4月に発表した AI Jobs Transition Framework は、同じ論点を別の角度から示しています。技術的な曝露を代替の予測として扱う代わりに、3つの問いを立てるのです。AIはその職業のタスクのうち意味のある割合をこなせるか、仕事の提供や監督において人間が中心であり続けるか、コストの低下によって生産性向上を吸収できるほど需要が増えるか。約1億4,800万の米国の仕事をカバーする921の職業に適用した結果、この枠組みは仕事の約18%を自動化リスクが高いカテゴリーに、24%を再編されそうな仕事に、12%をAIとともに成長しうる仕事に、46%を当面の変化が小さいと見込まれる仕事に分類しています。
PNAS Nexusの研究では、最も強力な単一の曝露スコアでも、単独では失業リスクの変動の10.7%しか説明できませんでした。
だから、次に「AIによる仕事のリスク」の数字がフィードに流れてきたら、心配するかどうかを決める前に、これらの手法のどれがその数字を生み出したのかを見極めることが有効です。理論上の曝露スコアは、AIの能力が仕事の構成要素とどこで重なるかを教えてくれます。観測曝露スコアは、人々が実際にすでにどこでAIを使っているかという証拠を加えます。どちらも単独では、その職業の雇用が増えるか減るかを教えてはくれません。それには、採用、需要、賃金、人員数に関する労働市場の証拠が必要です。
よくある質問
AIへの仕事の曝露は失業と同じ意味ですか?
いいえ。理論上の曝露はAIの能力が仕事の内容とどこで重なるかを示し、観測曝露はAIが実際にどこで使われているかの証拠を加えます。どちらも失業を直接測るものではありません。2025年の査読付き研究は、12種類の曝露スコアを米国の実際の失業保険申請データと照合してこれを直接検証し、最も優れた単一スコアでも単独では失業リスクの変動の10.7%しか説明できないことを示しました。
AIによる仕事のリスクは実際どう計算されているのですか?
「AIによる仕事のリスク」とラベル付けされた数字の背後には複数の手法があります。理論上の曝露手法は職業をO*NETの能力やタスクに分解し、AIの能力がそれらとどれだけ重なるかを採点します。厳密な採点方法は研究ごとに異なります。Anthropicの観測曝露アプローチは、理論上のタスク実現可能性に、実際のClaude利用、業務の文脈、自動化の度合いを組み合わせます。得られる数字が異なるのは、技術的な可能性と現実世界での導入の間の異なる段階を測っているからです。
なぜAIによる仕事のリスクランキングは同じ仕事について食い違うのですか?
ひとつには、構造的に異なる手法(タスク分解、雇用主調査、観測利用はそれぞれ別の問いに答えるもの)に基づいているからであり、もうひとつには、同じ手法でも時間とともに変化するからです。Anthropic自身のEconomic Indexは、2025年2月にはClaudeの会話の57.4%を増強としましたが、2026年1月のレポートでは52%となり、自動化もそれに応じて動きました。ある日付のスナップショットは、不変の法則ではありません。
AI曝露スコアが高いと、私の仕事はなくなるのですか?
それだけでは決まりません。2026年3月に自身のバズったAI曝露プロジェクトを取り下げたAndrej Karpathyは、プロジェクトの READMEに スコアは「大まかなLLMによる推定であり……厳密な予測ではない」こと、そして高曝露の仕事は多くの場合「置き換えられるのではなく、作り替えられる」ことを直接書き込んでいました。Anthropicの比較はこの区別を可視化しています。コンピュータ・数学分野では、Eloundou et al.の理論指標が94%に達する一方、Anthropicの観測曝露指標は33%です。能力の尺度で数字が高いことと、仕事が奪われることは同じではありません。

ディスカッション
コメント
ログインしてディスカッションに参加してください。