メインコンテンツへスキップ
50% off 全プラン対象、期間限定。月額 $2.48/mo
17 min left
AIと機械学習

プライバシー保護機械学習とは何か

B 著者 Bruce 17 分で読めます
Abstract illustration of privacy-preserving machine learning, with a model trained across sealed data sources

あるチームが、外部 API を呼ぶ代わりに自社サーバーで言語モデルを動かすことにする。動機はプライバシーだ。機微なデータを社内に留め、第三者には決して渡さない。この判断は筋が通っており、そこで得られる統制も本物だが、同時に不完全でもある。private なレコードで学習したモデルは、特定の人物のレコードが学習データに含まれていたかどうかを漏らすよう仕向けられる。生データを一切運ばない連合学習の更新も、それを生んだ画像へと逆算されうる。大規模モデルは学習内容の断片を記憶し、そのまま出力してしまうことがある。データは手元に留まったのに、モデルは漏らしたのだ。

この隔たり、つまり「プライベートに感じられる」ことと「証明可能にプライベートである」ことのあいだの差を扱うのが、プライバシー保護機械学習だ。標準的な機械学習のパイプラインは、学習基盤が生データにアクセスできることを前提とする。それはプライバシー規制、データ主権の要件、そしてデータセットをそもそも共有しない取引先と衝突する。プライバシー保護機械学習は、その衝突を解く技術の総称である。

有用な区別は、データの移動を減らす技術、出力が明かしうる範囲に上限を設ける技術、そして計算中もデータを秘匿し続ける技術のあいだにある。セルフホスティングはこれらの統制を置き換えるものではなく、その隣に並ぶものだ。

短いバージョン

  • プライバシー保護機械学習(PPML)は単一の手法ではなく、包括的なカテゴリである。 本稿は主要な四つのアプローチ、すなわち連合学習、差分プライバシー、準同型暗号、秘密計算(secure multi-party computation)を扱う。信頼実行環境をはじめ、ほかのプライバシー強化アーキテクチャも PPML システムに登場しうる。
  • 連合学習だけでは、形式的なプライバシー保証は得られない。 生データは発生源に留まるが、共有される勾配更新は学習レコードへ逆算できてしまう場合がある。差分プライバシーは、形式的な漏洩上限を加える一般的な手段だ。
  • 差分プライバシーの強さは、ふつう epsilon で要約される。 この保証は delta、保護される単位、そしてプライバシー会計の手法にも左右される。パラメータが緩い形式的保証は、書類上は保証でも、実務では演出にすぎない。
  • 準同型暗号は実用可能であり、そして遅い。 暗号化されたままのデータ上で計算することは実際に可能だが、オーバーヘッドのために今日では、より単純なモデル、遅延を許容できる推論、実験的なファインチューニングの工程に限られる。大規模モデルの通常の学習や完全な事前学習には向かない。
  • モデルを自前でホストすることはデータの所在地管理であって、PPML ではない。 自分が管理するインフラにデータを置くことは、誰がそこに到達できるかを定める。モデル自身が何を明かしうるかは定めない。

範囲についての注記。本稿は概念の解説であって、実装ガイドではない。ライブラリの導入、epsilon の選び方、規制対応、プライベートな LLM のファインチューニングを詳しくは扱わない。ここでの目的は地図を示すことだ。曲がり角ごとの案内は、専用の実装ガイドの仕事である。

プライバシー保護機械学習はどのようにデータを守るのか

The four main privacy-preserving machine learning techniques side by side: federated learning keeping data local, differential privacy limiting individual influence with calibrated noise, secure multi-party computation splitting private inputs into shares, and homomorphic encryption computing on ciphertext

プライバシー保護機械学習とは、モデルの学習、推論、共同分析を通じて情報の露出を減らす、制限する、あるいは形式的に上限を設ける手法群の総称である。本稿は主要な四つのアプローチ、連合学習、差分プライバシー、準同型暗号、秘密計算を扱う。これらは異なる脅威モデルのもとで異なる資産を守るのだから、互換の保証として扱ってはならない。

問題は単純だ。標準的な ML パイプラインは、学習プロセスが生のレコードにアクセスできることを前提にしている。ところがプライバシー規制、データ主権の要件、取引先との合意が、まさにそのアクセスを妨げることが多い。四つの系統はこの制約にそれぞれ違う答えを出す。データを計算のもとへ運ぶのではなく計算をデータのもとへ運ぶ(連合学習)、出力が特定個人について明かす量が減るよう調整済みのノイズを加える(差分プライバシー)、暗号化されたままのデータ上で計算する(準同型暗号)、あるいは複数の当事者が互いに生の入力を見せずに結果を共同で計算する(秘密計算)。

その根底にあるリスクは、次の資料にはっきり書かれている。 Google の責任ある AI に関するガイダンス。機械学習モデルは、触れたデータの一部を覚え込み、あるいは明かしてしまうことがある。プライバシーの取り組みは、その周囲に歯止めを設けるために存在する。PPML はこのリスクに応えるものであり、単なる匿名化とは異なる。その理由は次節で具体的になる。

匿名化ではなぜ足りないのか

匿名化されたデータでも再識別はされうる。データセットから氏名や明白な識別子を取り除けば、目に見える露出は減る。だが、そのデータを外部の情報と突き合わせられる時点で、プライバシーは保証されない。k-anonymity のような非識別化手法が繰り返し抱える弱点がこれだ。特定の前提のもとで識別可能性を下げることはできても、差分プライバシーや暗号技術による PPML 手法が与えるような形式的保証は与えられない。

この実務上の区別は、「匿名化したから大丈夫」と言われた経験のある人すべてにとって重要だ。匿名化とは、特定の文脈と脅威モデルのもとでのデータセットに関する主張にすぎない。リンケージ攻撃は暗号を破る必要も、アクセス制御を回避する必要もない。必要なのは、あなたのデータと重なるもう一つのデータセットだけだ。この点を正面から述べているのが、次の資料である。 NIST の非識別化ガイダンスそこでは、非識別化されたデータであっても、補助的なデータセットと突き合わせれば再識別されうると指摘されている。

差分プライバシーは、通常の非識別化にはできないことを与える。定められたプライバシー単位と脅威モデルのもとで、ある個人のデータが公開結果にどれだけ影響しうるかに数学的な上限を置くのだ。準同型暗号と SMPC は別種の暗号学的な機密性を与え、連合学習は主としてデータが処理される場所を変える。これらの保証は互いに関連しているが、同一ではない。

連合学習はどう動くのか、そしてなぜそれだけでは足りないのか

Three training architectures compared: centralized training where raw data moves to the server, federated training where data stays local but model updates can still leak information, and protected federation where differential privacy and secure aggregation are added to the federated updates

連合学習では、グローバルモデルがローカルの端末やサーバーへ配られ、そこにあるデータで学習し、中央にはパラメータの更新だけを返す。生データは決して動かない。これは本当に有用な方式であり、大規模に本番運用されている。そして、それ自体はプライバシー保証ではない。

その仕組みは、データをモデルへ運ぶのではなく、モデルをデータへ運ぶというものだ。 Google の Gboard での展開 は、30 を超える端末内の言語モデルを 7 言語以上・15 か国以上で動かし、電話から一切出ていかないテキストで学習させている。これは連合学習が謳い文句どおりに働いている例だ。あなたが打った内容を Google が集めることなく、キーボードは賢くなる。

問題は、更新の中に何が乗って運ばれるかだ。勾配はそれを生んだデータについての情報を含んでおり、その情報は復元されうる。Zhu、Liu、Han がそれを示したのが次の論文である。 Deep Leakage from Gradients (NeurIPS 2019)。共有されたモデル更新から非公開の学習サンプルを復元する勾配反転攻撃を示し、実験では画像をピクセル単位で正確に、テキストをトークン単位で一致させて復元してみせた。連合学習はデータの移動を減らした。漏洩リスクをなくしはしなかった。

参加そのものが明かしうる範囲に上限を設けたいなら、差分プライバシーがよく足される。セキュアアグリゲーションは別のリスクに対処するもので、個々のクライアントの更新を集約サーバーから隠す。Gboard は連合だけに頼らず、連合学習と形式的な差分プライバシーを組み合わせている。

注意: 連合学習は、生データが発生源に留まるという理由で「プライベート」と説明されることが多い。この説明は誤解を招く。追加の保護がなければ、連合学習の更新は学習レコードを再構成できるだけの手がかりを運びうる。DP-FL は連合だけに頼るのではなく、形式的な差分プライバシー保証を加える。連合それ自体はデータの扱い方の選択であって、プライバシーの証明ではない。

差分プライバシーとは何か、そして epsilon は実際に何を制御するのか

差分プライバシーとは、プライバシー単位を一つ足したり引いたりしたときに、分析結果がどれだけ変わりうるかに上限を置く数学的定義である。多くの機構は、調整済みのランダム性を加えることでこの保証を実現する。epsilon は目に見える一つのパラメータにすぎず、意味のある保証は、プライバシー単位、DP の方式や delta のような追加パラメータ、さらに合成、会計、実装の細部にも左右される。

epsilon をプライバシー予算として説明しているのが、次の資料だ。 NVIDIA の用語集。値が小さいほどプライバシーは強くなるがノイズは増え、値が大きいほど精度は保たれるが保証は弱くなる。深層学習の訓練で差分プライバシーを適用する一般的な手段が DP-SGD、すなわち差分プライバシー確率的勾配降下法だ。サンプルごとの勾配を有界な大きさにクリップし、調整済みのガウスノイズを加えてから集約する。クリップは、ある一つの事例がモデルに与えうる影響を抑える。ノイズは、それでも残る影響を覆い隠す。

この予算は消費されていく。その仕組みを説明しているのが、次の資料だ。 Tumult Analytics のプライバシー予算に関するドキュメント。保護されたデータセットへのクエリは、そのたびにプライバシー予算の一部を消費する。その消費がどう積み上がるかは差分プライバシーの標準的な理論であり、次の書に示されている。 Dwork と Roth の The Algorithmic Foundations of Differential Privacy。基本合成のもとでは、それぞれパラメータ epsilon の k 回のクエリは合計で k 掛ける epsilon のプライバシー損失になり、高度合成定理はより厳しい上限を与える。無制限に問い合わせられるわけではない。与えられるのは予算であり、それを使っていくのだ。

したがって、その保証が実務で意味を持つかどうかを決めるのはパラメータの選び方だ。査読を経た 機械学習におけるプライバシー手法への批判 論考は、数学的な枠づけが「客観性の上塗り」を与え、それがプロジェクトの体裁を取り繕うのに使われうると論じる。プライバシーのパラメータを十分に緩く設定すれば、保証はほぼ無意味になりうる。それでもチームは差分プライバシーを満たしたと主張できる。保証は本物だ。その実務上の強さは、設計上の選択である。

注意: 差分プライバシーの保証が意味を持つのは、プライバシーのパラメータと、それが守る単位を知っているときだけだ。epsilon が極端に大きい、delta が緩い、会計が不明瞭、そのいずれでも、技術的には正しい保証が実務上ほとんど守ってくれないものになりうる。「このシステムは差分プライバシーを使っています」という一文は、それだけではほとんど何も語らない。意味を担うのは、プライバシーのパラメータ、それが何を対象に測られたか、そしてどう合成されるかだ。具体的な導入例がそれを実感させる。Google は自社の Provably Private Insights について、ユーザー単位の epsilon を 1 と報告しているが、それは一つの導入が一つのユースケースのために選んだ値であって、書き写すための数字ではない。

準同型暗号は、復号しないままのデータをどう計算するのか

完全準同型暗号(FHE)は、暗号化されたままのデータ上でサーバーが直接計算を実行し、データの所有者だけが復号できる暗号化された結果を返すことを可能にする。サーバーは平文を一度も見ずに仕事を終える。この分野で最も強力なプライバシー技術の一つだが、引き換えになるのは性能だ。

分かりやすい比喩は、手袋の付いた施錠済みのグローブボックスだ。作業者は中に手を入れて内容物を操作できるが、箱を開けることも中身を取り出すこともない。鍵を持っているのはデータの所有者だけだ。計算は封をされた中身に対して行われ、箱を開けて結果を読めるのは所有者だけである。FHE が数学的にやっているのはこれだ。暗号文の上で演算し、その出力を復号すると、平文で計算した場合と同じ答えになるようにする。

難点はコストだ。 Concrete ML(Zama 提供)は、利用者が暗号のプリミティブを直接扱わずに、scikit-learn や PyTorch のモデルを FHE 対応の等価物へ変換する。v1.9 のリリースは 2025 年 4 月 10 日だった。ただしプロジェクト自身のベンチマークがそのオーバーヘッドを示している。CIFAR10 の画像分類ネットワークは、FHE のもとで 1 枚あたりおよそ 4 分かかる。遅延を許容できる一部の推論、より単純なモデル、実験的な暗号化ファインチューニングであれば、これで構わない。それでも、大規模モデルの完全な事前学習や通常の大規模学習ワークロードへの現実的な道ではない。今日の FHE は狭い用途のための精密機器であって、汎用のプライバシー層ではない。

機械学習における秘密計算(SMPC)とは何か

秘密計算(SMPC)は、複数の当事者が各自の私的な入力を合わせた上で関数を共同計算しながら、どの当事者も他者の生データを見ないことを可能にする。各当事者の入力は秘密のままで、明らかになるのは合意した結果だけだ。SMPC は秘密分散、ガーブル回路、紛失通信、およびそれらの組み合わせといった技術で構築できる。秘密分散型のプロトコルでは、私的な値をシェアに分割し、単独のシェアからは入力が分からないようにする。ガーブル回路型のプロトコルは仕組みが異なり、計算そのものを符号化して、当事者が私的入力を明かさずに評価できるようにする。

自然なユースケースは組織をまたいだ共同作業だ。複数の病院が患者データを合わせてモデルを学習させたいが、どの病院も法的に記録を他院へ渡せない。SMPC を使えば、データを一箇所に集めたかのように共同モデルを計算でき、各病院の記録はその病院内に封じられたままになる。SMPC のオーバーヘッドは、プロトコル、セキュリティモデル、ネットワーク状況、当事者の数、評価される関数に大きく左右される。通信量の多いプロトコルも多いため、性能は差分プライバシーや FHE と一般論で順位づけするのではなく、その具体的な共同作業に対して測るべきだ。医療分野の機械学習におけるまさにこのパターンを扱っているのが、次の資料である。 WIREs Computational Statistics に 2025 年に掲載されたサーベイ論文.

機械学習モデルは学習データを漏らしうるのか

漏らしうる。学習済みモデルが学習データを明かす経路はいくつもある。メンバーシップ推論は特定のレコードが学習集合にあったかどうかを暴き、モデル反転や勾配漏洩はレコードを再構成しうる。そして大規模言語モデルは学習データの断片を記憶し、そのまま出力しうる。これらは仮定の話ではない。実証済みの攻撃であり、上に挙げた技術が存在する理由そのものだ。

土台となる成果はメンバーシップ推論だ。Shokri らは次の論文で Membership Inference Attacks Against Machine Learning Models (IEEE S&P 2017)、モデルの予測のふるまいを観測する攻撃者が、ある特定のレコードが学習集合に含まれていたかどうかを判定できることを示した。学習集合が「特定の診断を受けた患者たち」になった瞬間、この話は抽象的でなくなる。そこでは所属していたという事実こそが機微な情報だからだ。モデル反転や先に触れた勾配漏洩攻撃は、これを「そのレコードはあったか」から「そのレコードを再構成せよ」へと押し進める。

最前線は大規模言語モデルであり、旧来の PPML の枠組みが最もなじまない領域でもある。 LLM が学習データを出力してしまう問題 の研究は、大規模モデルが学習コーパスの一部を記憶し、プロンプトによってそれを再現させられること、そして抽出攻撃が逐語およびそれに近い学習データを復元できることを記録している。DP-SGD はプライベートなファインチューニングに適用できるが、大規模モデルの規模では精度と計算のコストが厳しい。それも一因となって、 Apple の 2026 年 PPML ワークショップ は基盤モデルとプライバシーだけで一つのトラックを丸ごと組んだ。ロジスティック回帰の分類器できれいに効く防御が、数十億パラメータのモデルへただで移植できるわけではない。

PPML とセルフホストの AI:ローカル推論で得られるもの、得られないもの

モデルを自前でホストすれば、データは自分が管理するインフラに留まる。それはアクセス制御とデータ所在地の観点では本物の利得だ。データは第三者へ渡らず、それが動く機械に誰が触れられるかを自分で決められる。だが、それはプライバシー保護機械学習ではない。ローカル推論はそれだけでは、モデルに対するメンバーシップ推論を何ら防がないし、モデルが記憶した内容を明かすことも止めない。

この二つは問題の別々の半分を解いており、両者を混同するのはこの分野でよくある誤りだ。データの所在地管理が定めるのは、誰がデータに到達できるかという境界の問題であり、その答えはバイト列がどこにあるか、部屋の鍵を誰が持っているかにある。PPML が定めるのは、モデル自身が何を明かしうるかという情報漏洩の問題であり、その答えが上に挙げた四つの技術だ。自分のサーバーでモデルを動かすことは、第一の問いには強い答えであり、第二の問いにはまったく答えになっていない。

そもそもモデルを自分で動かすべきかどうかを検討しているなら、その判断のコスト面はそれ自体が別の分析になる。以下を参照してほしい。 オープンウェイトLLMのセルフホスト vs. API:本当のコスト計算.

Linuxプランを見る

root権限、NVMe、AMD EPYCのパワーを備えたLinux VPSで開発を。

Linuxプランを見る

プラットフォームやインフラのエンジニアにとって、運用上の読み方はこうだ。「自社サーバーで動いている」という事実は、データ所在地やアクセス制御の要件の一部は満たしうるが、それ自体はモデルが何を明かしうるかを縛らない。モデルやその出力がいつか共有されれば、チーム間であれ、取引先とであれ、製品の中であれ、ハードウェアの周囲に築いた境界はモデルについてドアの外まで出ていかない。保証を実際に動かす設計上の選択は PPML 側にある。公開する出力への差分プライバシー、集約できない拠点にまたがる学習のための DP-FL、自社インフラにさえデータを晒せない場面での暗号ベースの計算だ。Google の Provably Private Insights が示唆に富むのは、まさに単一の対策に頼らず、差分プライバシー、信頼実行環境、機密連合分析といった複数の統制を組み合わせている点にある。所在地の管理は本物のアーキテクチャの一部だ。その全部ではない。

どの PPML 技術をいつ使うべきか

選び方の論理は流行ではなく制約に従う。データを集約できないなら連合学習を使う。モデルが何を明かすかに形式的な保証が要るなら差分プライバシーを使う。決して復号しないデータの上で計算しなければならず、遅延が許されるなら準同型暗号を使う。複数の当事者が入力を共有せずに共同で計算しなければならないなら秘密計算を使う。

これらの技術は組み合わせもできる。DP-FL が最も分かりやすい例だ。問題を一つの技術に押し込めるのではなく、システムに必要な保証に応じて対策を選べばいい。

トレードオフを一覧で示す。

技術プライバシー保証計算オーバーヘッド生データはどこで処理されるかLLM 学習への適合性
連合学習DP なしでは無し各クライアント側部分的
差分プライバシー(DP-SGD)形式的、epsilon と delta で決まる低〜中導入形態による可能、ただし精度と計算のコストを伴う
準同型暗号(FHE)形式的な機密性非常に高い計算サーバー上で暗号化されたまま実験的なファインチューニングのみ、大規模モデルの本格学習は不可
秘密計算(SMPC)形式的な機密性プロトコル依存、多くは通信量が律速各当事者が自分の入力を保持部分的

以上の位置づけは、次の資料に基づく。 2026 年 3 月の IoT 向け PPML サーベイ加えて、Zama の Concrete ML のベンチマーク、および再識別に関する文献にも依拠している。

この表はあくまで出発点だ。現実のシステムは複数の技術を組み合わせることが多い。拠点をまたぐ学習の問題で、なおかつ形式的なプライバシー保証も必要なら、それはたいてい DP-FL の問題であって、連合学習か差分プライバシーかの二者択一ではない。判断をより厳密に構造化したい読者は、次の資料を通読するとよい。 開発者向けの構造化された意思決定支援フレームワーク これは 2024 年末に公開されたものだ。

ツールについて。TensorFlow Federated は連合学習と分散データ上の計算のためのオープンソースのフレームワークを提供する。TensorFlow Privacy は差分プライバシー学習のユーティリティを、Google の Differential Privacy ライブラリは差分プライバシーの統計と集計を、そして Concrete ML は FHE の経路を提供する。PySyft は現在、より広くプライバシー保護のリモートデータサイエンスに軸足を置いており、計算は所有者の手元にあるデータに対して実行され、承認された結果だけが共有される。名前と役割はこのとおりだ。セットアップは専用の実装ガイドの領分であって、ここではない。繰り返し得られる教訓は、数学が正しくても実装は失敗しうるということだ。保証が意味を持つのは、システムが正しい脅威モデルを軸に設計され、プライバシーのパラメータが守るべきリスクに見合っているときだけである。

よくある質問

PPML とは何の略か

プライバシー保護機械学習とは、機械学習の過程で情報の露出を減らす、制限する、あるいは形式的に上限を設ける手法群の総称である。主要なアプローチには連合学習、差分プライバシー、準同型暗号、秘密計算があるが、守る対象も、与える保証の種類も互いに異なる。

連合学習だけでプライバシーは守れるのか

守れない。連合学習は生データを発生源に留めるが、共有されるパラメータ更新は勾配反転攻撃によって学習レコードへ逆算されうる。それ単体では、形式的なプライバシー保証は一切与えない。差分プライバシーを加えれば形式的な漏洩上限が付き、通常 DP-FL と呼ばれる組み合わせになる。

差分プライバシーの epsilon はどの値にすべきか

普遍的な値は存在しない。epsilon はプライバシーと精度のトレードオフにおける主要なパラメータの一つで、値が小さいほど概してプライバシーは強くノイズは多く、値が大きいほど概してプライバシーは弱くノイズは少ない。適切な設定は、データの機微さと、受け入れられるリスクによって決まる。ある epsilon 値を「安全」にしてくれる普遍的な閾値はない。epsilon は、プライバシー単位、DP の方式や delta などの追加パラメータ、合成の方法、そしてシステムの脅威モデルと合わせて評価すること。

PPML と匿名化はどう違うのか

匿名化はデータセットから識別子を取り除くことだが、匿名化されたレコードでも、他の出所の補助データと突き合わせれば再識別されうる。PPML の一部の技術は、通常の匿名化にはない形式的な保証を与える。差分プライバシーは、ある個人のデータが公開結果へ与える影響に上限を置ける。FHE と SMPC は、これとは別の形の暗号学的な機密性を提供する。

機械学習モデルから学習データを抽出できるのか

できる。メンバーシップ推論攻撃は特定のレコードが学習集合にあったかを暴き、モデル反転や勾配漏洩はレコードを再構成しうる。そして大規模言語モデルは学習データを記憶し、そのまま出力しうる。いずれもセキュリティ分野の文献に記録された実証済みの攻撃であり、仮想のリスクではない。

モデルを自前でホストすればデータのプライバシーは保証されるのか

保証されない。セルフホストはデータを自分が管理するインフラに留める。それはアクセス制御とデータ所在地の管理であり、誰がデータに到達できるかを統べるうえでは本物の利得だ。だがそれはプライバシー保護機械学習ではなく、メンバーシップ推論も記憶に由来する漏洩も止めない。PPML の技術とは相性が良いが、その代わりにはならない。

プライバシー保護機械学習に使えるオープンソースのツールは何か

PPML のそれぞれの領域をカバーするオープンソースのツールがいくつかある。TensorFlow Federated は連合学習と分散データ上の計算をサポートし、TensorFlow Privacy は差分プライバシー学習のユーティリティを提供し、Concrete ML は FHE による機械学習をカバーする。PySyft は現在、プライバシー保護のリモートデータサイエンスに焦点を当てており、計算は所有者が管理するデータに対して実行され、承認された結果だけが共有される。

共有

ブログの他の記事

読み進める。

デプロイの準備はできましたか? 月額2.48ドルから。

2008年から独立運営のクラウド。AMD EPYC、NVMe、40 Gbps。14日間返金保証。