難解なイェンセンの不等式を完全解剖!機械学習と統計を貫く本質
データサイエンスや人工知能(AI)の基盤数理、さらには難関の数学オリンピックや統計検定1級に至るまで、数学的思考の要として君臨し続けるのが「イェンセンの不等式(Jensen's inequality)」です。1906年にデンマークの数学者ヨハン・イェンセン(Johan Jensen)によって定式化されたこの不等式は、一見すると抽象的でとっつきにくく感じられるものの、その背後には極めて明快で美しい幾何学的直感が広がっています。
現在、大規模言語モデル(LLM)や生成AIの深層学習アルゴリズムを根本から理解する上でも、情報量やエントロピーの議論を支えるこの不等式の把握は避けて通れません。抽象的な数式がなぜ成立し、いかにして現代の最先端技術や実戦問題へ結びついているのか。その骨格と実用的な価値を、現場のリアルな視点から徹底的に解き明かします。
📌 【この記事の重要ポイントまとめ】
- 要点1:イェンセンの不等式の本質は「凸関数のグラフ上にある2点を結ぶ弦は、常に弧の上側にある」という単純明快な幾何学的性質に集約される。
- 要点2:相加相乗平均の証明から情報理論のKLダイバージェンス非負性、機械学習のEMアルゴリズム(ELBO導出)まで、応用範囲は極めて広範である。
- 要点3:厳密な証明手法(接線法・数学的帰納法)と「等号成立条件」を完全に把握することで、統計検定1級や数理モデル構築の実務における論理の破綻を防ぐことができる。
なぜイェンセンの不等式は成り立つのか?凸関数の直感的イメージと決定的な理由
数式だけを眺めていると難解な暗号のように映るイェンセンの不等式ですが、その核にある原理は驚くほどシンプルです。理解の第一歩は、凸関数と凹関数の定義を視覚的に捉え直すことにあります。
実数区間上で定義された関数 $f(x)$ において、任意の2点 $A(x_1, f(x_1))$ と $B(x_2, f(x_2))$ を結ぶ線分(弦)を考えます。この線分が、常にグラフの曲線よりも上側(または一致する位置)にあるとき、その関数を「下に凸(凸関数)」と呼びます。逆に、線分が常にグラフの下側にある場合は「上に凸(凹関数)」です。2階微分が可能な関数であれば、$f''(x) \ge 0$ が成り立つ区間では下に凸となります。
イェンセンの不等式の直感的な意味を掴む鍵は「重心(加重平均)」の挙動です。例えば、お椀のような形状をした放物線 $f(x) = x^2$ の内側に、異なる重さの質点を複数置いた場面を想像してみてください。質点同士を結んでできる図形の重心は、必ずお椀の底面(曲線上)よりも高い位置、あるいは同じ高さに浮き上がります。
これを数式で表したものが、離散型における基本形です。重み(確率) $p_i \ge 0$($\sum_{i=1}^n p_i = 1$)に対して、次式が成立します。
$f\left( \sum_{i=1}^n p_i x_i \right) \le \sum_{i=1}^n p_i f(x_i)$
左辺は「入力値の加重平均を関数に入れた値(重心の入力に対する関数の高さ)」を指し、右辺は「各点における関数の値の加重平均(重心そのものの高さ)」を表しています。さらに確率論の言葉で一般化すれば、確率変数と期待値の不等式として知られる極めて洗練された形へと昇華されます。
$f(E[X]) \le E[f(X)]$ ($f$ が下に凸な関数の場合)
「期待値の関数値は、関数値の期待値以下である」――この簡潔な一行こそが、統計学や機械学習で無数に出現する不等式操作の原点となっているのです。

【厳密解説】イェンセンの不等式の証明と等号成立条件のメカニズム
直感的なイメージを把握した後は、数学的な裏付けを確認することが実務・試験対策の双方で不可欠です。イェンセンの不等式の証明には主に「接線(支持超平面)を用いる方法」と「数学的帰納法による方法」の2通りが存在します。ここでは最も美しく汎用性の高い接線法のアプローチを整理します。
接線を用いたエレガントな証明(1次元連続の場合)
$f(x)$ が凸関数であるとき、そのグラフ上の任意の点 $c$ において、関数は常に接線(微分不可能な点においては支持直線)の上側に位置するという決定的な幾何学的性質を持っています。点 $(c, f(c))$ における接線の傾きを $a$ と置くと、すべての $x$ において次の不等式が成り立ちます。
$f(x) \ge f(c) + a(x - c)$
ここで、確率変数 $X$ を考え、その期待値を $c = E[X]$ と定めます。上の式に $x = X$ を代入すると次のようになります。
$f(X) \ge f(E[X]) + a(X - E[X])$
この両辺の期待値をとると、期待値の線形性から $E[a(X - E[X])] = a(E[X] - E[X]) = 0$ となり、右辺の第2項が綺麗に消失します。結果として導かれるのが以下の関係です。
$E[f(X)] \ge f(E[X])$
わずか数行の変形ですが、凸関数の「接線が曲線を下から支える」という性質が期待値の線形性と完璧に噛み合っていることが分かります。
見落とし厳禁の「等号成立条件の解説」
証明問題や記述試験で最も減点対象となりやすいのが等号成立条件の解説です。等号 $f(E[X]) = E[f(X)]$ が成り立つのは、以下のいずれかの条件を満たす場合に限られます。
- 関数 $f(x)$ が線形関数(1次関数 $f(x) = ax + b$)である場合:グラフ自体が直線であるため、凸不等式は常に等号で成立します。
- $f(x)$ が狭義の凸関数(真に曲がっている)場合:確率変数 $X$ が定数であること、すなわち確率1で $X = E[X]$(分散が0)となる場合に限られます。離散的な重み付けで言えば、すべての標本値 $x_i$ が同一値であるか、あるいは1つの点に重みが集中している状態を意味します。
定番から難関まで|イェンセンの不等式の例題と解法
不等式の威力を最も手軽に実感できる典型例が、高校数学で習う相加相乗平均の証明です。一般に多変数の相加相乗平均の不等式は数学的帰納法を用いると複雑になりがちですが、イェンセンの不等式を経由すると極めて自然に導出できます。
正の実数 $x_1, x_2, \dots, x_n$ に対して、以下を示せ。
$\frac{x_1 + x_2 + \dots + x_n}{n} \ge \sqrt[n]{x_1 x_2 \dots x_n}$
【解法の手順】
関数 $f(t) = -\log t$($t > 0$)を定義します。2階微分を計算すると $f''(t) = \frac{1}{t^2} > 0$ となり、$t > 0$ において $f(t)$ は狭義の凸関数です。
各重みを均等に $p_i = \frac{1}{n}$ と定めてイェンセンの不等式を適用します。
$-\log\left( \frac{1}{n}\sum_{i=1}^n x_i \right) \le \frac{1}{n}\sum_{i=1}^n (-\log x_i)$
右辺に対数の性質を適用すると、$\frac{1}{n}\sum_{i=1}^n (-\log x_i) = -\frac{1}{n}\log\left(\prod_{i=1}^n x_i\right) = -\log\left(\sqrt[n]{\prod_{i=1}^n x_i}\right)$ と変形できます。両辺に $-1$ を乗じて対数を外せば、不等号の向きが反転し、目標の不等式が得られます。
等号成立条件は、$f(t) = -\log t$ が狭義凸関数であることから、すべての変数が一致する $x_1 = x_2 = \dots = x_n$ のときとなります。このように、イェンセンの不等式の例題と解法を一度体感すると、凸関数という枠組みが持つ抽象化の威力が鮮明になります。

他不等式との体系的比較|ヘルダーの不等式との違いと使い分け
解析学や数理統計において、イェンセンの不等式と並んで頻出する各種不等式との関係性を整理しておくことは、解法選択の迷いを断ち切る上で極めて効果的です。特に初学者が混同しやすいヘルダーの不等式との違いを含め、以下の比較表に体系化しました。
| 不等式の名称 | 適用条件・対象 | 主要な数式表現 | 使い分けと編集部の評価 |
|---|---|---|---|
| イェンセンの不等式 | 凸関数(または凹関数)と確率分布・加重平均 | $f(E[X]) \le E[f(X)]$ | 1つの確率変数に対する関数の凸性を利用して期待値の外出し・内入れを行う際に必須。 |
| ヘルダーの不等式 | $L^p$ 空間の2つの関数積、共役指数 $\frac{1}{p} + \frac{1}{q} = 1$ | $E[|XY|] \le (E[|X|^p])^{1/p}(E[|Y|^q])^{1/q}$ | 2つの異なる変数の「積の期待値」を評価する際に使用。実はヘルダー自体もイェンセンから導出可能。 |
| コーシー・シュワルツの不等式 | 内積空間の元、または $p=q=2$ のヘルダーの特殊形 | $(E[XY])^2 \le E[X^2]E[Y^2]$ | 相関係数の絶対値が1以下である証明など、2乗ノルムに基づく直交性・幾何構造の評価に最適。 |
| マルコフの不等式 | 非負の確率変数と任意定数 $a > 0$ | $P(X \ge a) \le \frac{E[X]}{a}$ | 確率分布の裾野(テイル確率)の上界を大雑把に抑え込む際に用いる。チェビシェフの基礎。 |
実務上の指針として、「関数の非線形変換と期待値の順序を入れ替えたい場合はイェンセン」、「複数の確率変数が掛け合わされた期待値を分離して上界を作りたい場合はヘルダー」という明確な境界線を引いておくことが重要です。
【2026年最新】機械学習と情報理論の深層|EMアルゴリズムから拡散モデル・VAEまで
現代のテクノロジー領域において、イェンセンの不等式は単なる理論上の道具にとどまらず、深層生成モデルやベイズ推定の心臓部として稼働しています。
機械学習とEMアルゴリズム・ELBO(証拠下界)の導出
観測データ $X$ の背後に潜在変数 $Z$ が潜んでいる混合ガウスモデル(GMM)やトピックモデルの推定において、最頻出の手法が機械学習とEMアルゴリズムです。不完全データの対数尤度 $\log P(X|\theta)$ を直接最大化することは、潜在変数に関する積分(または総和)が対数の中に閉じ込められているため極めて困難です。
そこで、任意の潜在変数の事後分布 $q(Z)$ を導入し、イェンセンの不等式を適用します。対数関数 $\log(\cdot)$ は上に凸(凹関数)であるため、不等号の向きが反転して以下の下界が得られます。
$\log P(X|\theta) = \log \sum_Z q(Z) \frac{P(X, Z|\theta)}{q(Z)} \ge \sum_Z q(Z) \log \frac{P(X, Z|\theta)}{q(Z)}$
この右辺こそが、現代の変分オートエンコーダ(VAE)や拡散モデル(Diffusion Models)の損失関数設計の土台となる変分下界(ELBO: Evidence Lower Bound)です。イェンセンの不等式によって「計算不能な尤度関数の代わりに、最大化可能な下界を最適化する」というパラダイムが成立しています。
情報理論とKLダイバージェンスの非負性証明
2つの確率分布 $P$ と $Q$ の差異を測る尺度である情報理論とKLダイバージェンス(カルバック・ライブラー情報量 $D_{\mathrm{KL}}(P \parallel Q)$)が、常に0以上になるという基本定理(ギブスの不等式)も、イェンセンの不等式から直接導かれます。
$D_{\mathrm{KL}}(P \parallel Q) = \sum_x P(x) \log \frac{P(x)}{Q(x)} = - \sum_x P(x) \log \frac{Q(x)}{P(x)}$
ここで $f(t) = -\log t$ を凸関数とみなしてイェンセンの不等式を適用すると、右辺は $-\log\left(\sum_x P(x) \frac{Q(x)}{P(x)}\right) = -\log\left(\sum_x Q(x)\right) = -\log(1) = 0$ 以上となります。等号成立は $P(x) = Q(x)$ がすべての $x$ で成り立つ場合に限られます。AIモデルがデータを忠実に再現できているかを評価する情報幾何的尺度は、まさにこの定理を支柱として成立しています。

【実態検証】学習者が直面する「3つの壁」と現場のリアルな証言
数理系コミュニティ(統計検定対策グループ、難関大院試対策掲示板、技術SNSのデータサイエンティスト界隈)の議論を調査すると、イェンセンの不等式の習得過程でつまずく学習者には明確な共通項が存在します。
壁1:凸・凹による「不等号逆転」のケアレスミス
「試験本番で対数関数 $\log(x)$ に適用する際、凹関数であることを見落として不等号を逆向きにしてしまい、大問を丸ごと落とした」という証言は毎年後を絶ちません。特に対数は情報理論・機械学習で最も頻出するため、$f(x) = x^2$(下に凸)のイメージに引きずられると命取りになります。
壁2:数学オリンピックの不等式問題における「変数の均等化」の罠
競技数学の現場では、数学オリンピックの不等式問題を解く強力なツールとしてイェンセンの不等式が重宝されます。しかし、受験者からは「関数が局所的にしか凸でない区間を見落として適用し、採点でゼロ点になった」「対称式だからと安易にイェンセンを使ったが、境界値で最大値を取る変則パターンに対応できなかった」という失敗談が多数報告されています。
壁3:統計検定1級の対策と解説における「十分統計量とラオ・ブラックウェルの定理」
統計検定1級の対策と解説の文脈において、不偏推定量からより分散の小さい一様最小分散不偏推定量(UMVUE)を構成する「ラオ・ブラックウェルの定理」の証明でイェンセンの不等式が使われます。学習者の声を集めると、「条件付き期待値の凸不等式という二重の抽象概念が重なり、直感的な数式展開が追えなくなる」というハードルが顕著に現れています。
一般に知られていない盲点とネットの誤解|失敗を防ぐ判定ルール
ネット上の簡易的な解説記事やQ&Aサイトにおいて、頻繁に散見される誤解が「凸関数であればどんな変域でもイェンセンの不等式が無条件に使える」という思い込みです。
実際には、関数が全実数で凸であるケースは稀であり、多くの場合は「正の実数」「区間 $(0, 1)$」といった特定の定義域に限定されています。期待値 $E[X]$ や確率変数 $X$ の台(取り得る値の範囲)が、その関数の凸区間に完全に収まっていることを確認せずに不等式を適用すると、深刻な論理破綻を招きます。
【プロの結論】確実にマスターできる学習者と挫折する学習者の決定的な違い
イェンセンの不等式を自在に使いこなせるようになる学習者には、明確な学習手順の共通点があります。
- 挫折する人の特徴:「$f(E[X]) \le E[f(X)]$」という記号配列だけを丸暗記し、凸性の確認や等号成立条件の検証を省いていきなり問題演習に突入する。
- 成功する人のアプローチ:まず放物線や接線の図をノートの端に描き、2階微分の符号を確認した上で、「今扱っている関数が下側にあるか、上側にあるか」を視覚的にセルフチェックする習慣を徹底している。
【イェンセンの不等式】に関するよくある質問(FAQ)
Q1:関数が「上に凸(凹関数)」の場合は不等号の向きはどうなりますか?
A1:不等号の向きが完全に逆転します。すなわち、$f$ が凹関数のとき $f(E[X]) \ge E[f(X)]$ が成り立ちます。対数関数 $f(x) = \log x$ のように、多くの情報量尺度は凹関数であるため、この逆転形を用いる場面が非常に多く見られます。
Q2:ヘルダーの不等式やコーシー・シュワルツの不等式との実践的な使い分けは?
A2:評価対象が「1つの確率変数に関数を適用した期待値」であればイェンセンの不等式を選択します。一方、「2つの異なる確率変数の積 $E[XY]$」の上界を抑えたい場合はヘルダーの不等式(特に2乗ノルムであればコーシー・シュワルツ)を選択するのが定石です。
Q3:統計検定1級や大学院入試の記述で減点されないための必須記載事項は?
A3:解答を作成する際、①対象関数の2階微分等を明記して凸性(凹性)を明示すること、②変数の取り得る範囲が関数の定義域内にあること、③「等号成立は $X$ が定数(確率1)のときに限る」といった等号成立条件を正確に言及することの3点を漏れなく記述することが不可欠です。
まとめ:数式の背景を掴み論理的思考の武器にする
デンマークの技術者・数学者であったヨハン・イェンセンが1世紀以上前に提唱した不等式は、幾何学的な「弦と曲線の位置関係」という素朴な発想から出発しながら、今日では大規模言語モデルや高度な統計推論を根底で支える不滅の定理となりました。
単に公式として暗記するのではなく、グラフの傾きや重心の動きといった直感的なイメージを手に入れ、厳密な適用条件を押さえること。これによって、難関試験の難問突破から最先端AIアルゴリズムの論文読解に至るまで、揺るぎない数理的思考の足場を築くことができます。まずは1本の接線を引き、自らの手で式を一行ずつ展開してみることから、その本質を体得してください。 (出典: イェンセン の 不等式(Yahoo!ニュース))