欢迎光临
我们一直在努力

高维统计学讲义——第二章《2.1.2 次高斯随机变量和Hoeffding界(二)》

性质 2.5 Hoeffding届

这段内容介绍了次高斯性质的线性可加性,并给出了著名的 Hoeffding 不等式(Hoeffding bound)。


一、次高斯的线性运算封闭性

核心结论: 正如高斯性在独立随机变量相加时保持(独立高斯之和仍为高斯),次高斯性也保持。

具体来说,如果 X1X_1X1X2X_2X2 独立,且分别具有次高斯参数 σ1\\sigma_1σ1σ2\\sigma_2σ2,那么:

X1+X2X_1 + X_2X1+X2 是次高斯的,参数为 σ12+σ22\\sqrt{\\sigma_1^2 + \\sigma_2^2}σ12+σ22

直观理解: 这个结论其实是在说“方差可以相加”。对于独立高斯变量,X1+X2X_1 + X_2X1+X2 的方差就是 σ12+σ22\\sigma_1^2 + \\sigma_2^2σ12+σ22(注意:在次高斯定义里,参数 σ\\sigmaσ 本质上扮演标准差的角色)。所以次高斯参数在独立求和时也是按平方和开根号的方式叠加,与高斯的行为完全一致。
这是 Exercise 2.13 的内容,我们来完整证明一下。


命题:设 X1X_1X1X2X_2X2 相互独立,分别具有次高斯参数 σ1\\sigma_1σ1σ2\\sigma_2σ2(均值分别为 μ1,μ2\\mu_1, \\mu_2μ1,μ2)。则 X1+X2X_1 + X_2X1+X2 是次高斯的,参数为:

σ=σ12+σ22\\sigma = \\sqrt{\\sigma_1^2 + \\sigma_2^2}σ=σ12+σ22

证明

要证明 X1+X2X_1 + X_2X1+X2 是次高斯的,需要证明对所有 λ∈R\\lambda \\in \\mathbb{R}λR

E[eλ[(X1+X2)−(μ1+μ2)]]≤e(σ12+σ22)λ22\\mathbb{E}\\left[ e^{\\lambda[(X_1 + X_2) – (\\mu_1 + \\mu_2)]} \\right] \\le e^{\\frac{(\\sigma_1^2 + \\sigma_2^2)\\lambda^2}{2}}E[eλ[(X1+X2)(μ1+μ2)]]e2(σ12+σ22)λ2

第二步:利用独立性拆分期望

因为 X1X_1X1X2X_2X2 独立,所以 eλ(X1−μ1)e^{\\lambda(X_1 – \\mu_1)}eλ(X1μ1)eλ(X2−μ2)e^{\\lambda(X_2 – \\mu_2)}eλ(X2μ2) 也独立。独立随机变量乘积的期望等于期望的乘积:

E[eλ[(X1+X2)−(μ1+μ2)]]=E[eλ(X1−μ1)⋅eλ(X2−μ2)]\\mathbb{E}\\left[ e^{\\lambda[(X_1 + X_2) – (\\mu_1 + \\mu_2)]} \\right] = \\mathbb{E}\\left[ e^{\\lambda(X_1 – \\mu_1)} \\cdot e^{\\lambda(X_2 – \\mu_2)} \\right]E[eλ[(X1+X2)(μ1+μ2)]]=E[eλ(X1μ1)eλ(X2μ2)]

=E[eλ(X1−μ1)]⋅E[eλ(X2−μ2)]= \\mathbb{E}\\left[ e^{\\lambda(X_1 – \\mu_1)} \\right] \\cdot \\mathbb{E}\\left[ e^{\\lambda(X_2 – \\mu_2)} \\right]=E[eλ(X1μ1)]E[eλ(X2μ2)]

第三步:代入各自的次高斯条件

X1X_1X1 次高斯(参数 σ1\\sigma_1σ1):

E[eλ(X1−μ1)]≤eσ12λ22\\mathbb{E}\\left[ e^{\\lambda(X_1 – \\mu_1)} \\right] \\le e^{\\frac{\\sigma_1^2 \\lambda^2}{2}}E[eλ(X1μ1)]e2σ12λ2

X2X_2X2 次高斯(参数 σ2\\sigma_2σ2):

E[eλ(X2−μ2)]≤eσ22λ22\\mathbb{E}\\left[ e^{\\lambda(X_2 – \\mu_2)} \\right] \\le e^{\\frac{\\sigma_2^2 \\lambda^2}{2}}E[eλ(X2μ2)]e2σ22λ2

第四步:相乘

E[eλ[(X1+X2)−(μ1+μ2)]]≤eσ12λ22⋅eσ22λ22=e(σ12+σ22)λ22\\mathbb{E}\\left[ e^{\\lambda[(X_1 + X_2) – (\\mu_1 + \\mu_2)]} \\right] \\le e^{\\frac{\\sigma_1^2 \\lambda^2}{2}} \\cdot e^{\\frac{\\sigma_2^2 \\lambda^2}{2}} = e^{\\frac{(\\sigma_1^2 + \\sigma_2^2)\\lambda^2}{2}}E[eλ[(X1+X2)(μ1+μ2)]]e2σ12λ2e2σ22λ2=e2(σ12+σ22)λ2

第五步:对照次高斯的定义

Definition 2.2 要求的是 E[eλ(X−μ)]≤eσ2λ22\\mathbb{E}[e^{\\lambda(X – \\mu)}] \\le e^{\\frac{\\sigma^2 \\lambda^2}{2}}E[eλ(Xμ)]e2σ2λ2。对比上式:

σ2λ22=(σ12+σ22)λ22⇒σ2=σ12+σ22\\frac{\\sigma^2 \\lambda^2}{2} = \\frac{(\\sigma_1^2 + \\sigma_2^2)\\lambda^2}{2} \\quad \\Rightarrow \\quad \\sigma^2 = \\sigma_1^2 + \\sigma_2^22σ2λ2=2(σ12+σ22)λ2σ2=σ12+σ22

所以 σ=σ12+σ22\\sigma = \\sqrt{\\sigma_1^2 + \\sigma_2^2}σ=σ12+σ22


推广到 nnn 个变量,完全相同的方法,只是期望拆成 nnn 项相乘:

E[eλ∑i=1n(Xi−μi)]=∏i=1nE[eλ(Xi−μi)]≤∏i=1neσi2λ22=eλ22∑i=1nσi2\\mathbb{E}\\left[ e^{\\lambda \\sum_{i=1}^n (X_i – \\mu_i)} \\right] = \\prod_{i=1}^n \\mathbb{E}\\left[ e^{\\lambda(X_i – \\mu_i)} \\right] \\le \\prod_{i=1}^n e^{\\frac{\\sigma_i^2 \\lambda^2}{2}} = e^{\\frac{\\lambda^2}{2}\\sum_{i=1}^n \\sigma_i^2}E[eλi=1n(Xiμi)]=i=1nE[eλ(Xiμi)]i=1ne2σi2λ2=e2λ2i=1nσi2

这就是 Proposition 2.5 中 ∑i=1nσi2\\sum_{i=1}^n \\sigma_i^2i=1nσi2 的由来,也是 Hoeffding 不等式分母里那个平方和的根源。


二、Proposition 2.5:Hoeffding 不等式

前提条件:

  • X1,…,XnX_1, \\dots, X_nX1,,Xn 相互独立
  • 每个 XiX_iXi 的均值为 μi=E[Xi]\\mu_i = \\mathbb{E}[X_i]μi=E[Xi]
  • 每个 XiX_iXi 是次高斯的,参数为 σi\\sigma_iσi

结论: 对任意 t≥0t \\ge 0t0

P[∑i=1n(Xi−μi)≥t]≤exp⁡(−t22∑i=1nσi2)(2.10)\\mathbb{P}\\left[ \\sum_{i=1}^n (X_i – \\mu_i) \\ge t \\right] \\le \\exp\\left( -\\frac{t^2}{2\\sum_{i=1}^n \\sigma_i^2} \\right)\\tag{2.10}P[i=1n(Xiμi)t]exp(2i=1nσi2t2)(2.10)


三、推导思路(使用上面两个事实)

第一步:中心化和求和。
Y=∑i=1n(Xi−μi)=∑i=1nXi−∑i=1nμiY = \\sum_{i=1}^n (X_i – \\mu_i) = \\sum_{i=1}^n X_i – \\sum_{i=1}^n \\mu_iY=i=1n(Xiμi)=i=1nXii=1nμi。这是一个零均值随机变量。

第二步:使用次高斯的线性可加性。
由“独立次高斯之和仍是次高斯”的结论,YYY 是次高斯的,且其参数为:

σY=∑i=1nσi2\\sigma_Y = \\sqrt{\\sum_{i=1}^n \\sigma_i^2}σY=i=1nσi2

第三步:代入基本次高斯尾界 (2.7)。
由 Definition 2.2 的推论(式 2.7),对一个均值 0、次高斯参数 σY\\sigma_YσY 的随机变量 YYY,有:

P[Y≥t]≤e−t22σY2\\mathbb{P}[Y \\ge t] \\le e^{-\\frac{t^2}{2\\sigma_Y^2}}P[Yt]e2σY2t2

σY2=∑i=1nσi2\\sigma_Y^2 = \\sum_{i=1}^n \\sigma_i^2σY2=i=1nσi2 代入:

P[Y≥t]≤exp⁡(−t22∑i=1nσi2)\\mathbb{P}[Y \\ge t] \\le \\exp\\left( -\\frac{t^2}{2\\sum_{i=1}^n \\sigma_i^2} \\right)P[Yt]exp(2i=1nσi2t2)

这就是式 (2.10)。


四、Hoeffding 不等式的常见形式(有界情形)

特殊化: 如果每个 Xi∈[a,b]X_i \\in [a, b]Xi[a,b] 几乎必然,由 Exercise 2.4 我们知道 XiX_iXi 的次高斯参数至多为:

σi=b−a2\\sigma_i = \\frac{b – a}{2}σi=2ba

代入 (2.10):
分母 ∑i=1nσi2=n⋅(b−a)24\\sum_{i=1}^n \\sigma_i^2 = n \\cdot \\frac{(b-a)^2}{4}i=1nσi2=n4(ba)2,于是:

P[∑i=1n(Xi−μi)≥t]≤exp⁡(−t22⋅n⋅(b−a)24)=e−2t2n(b−a)2(2.11)\\mathbb{P}\\left[ \\sum_{i=1}^n (X_i – \\mu_i) \\ge t \\right] \\le \\exp\\left( -\\frac{t^2}{2 \\cdot n \\cdot \\frac{(b-a)^2}{4}} \\right) = e^{-\\frac{2t^2}{n(b-a)^2}}\\tag{2.11}P[i=1n(Xiμi)t]exp(2n4(ba)2t2)=en(ba)22t2(2.11)

这就是式 (2.11),教科书中最常见的 Hoeffding 不等式形式。


核心直觉: Hoeffding 不等式告诉我们,独立有界随机变量之和的偏差概率,随 t2t^2t2 以指数速度衰减,衰减速率与样本量 nnn 和区间长度 (b−a)2(b-a)^2(ba)2 成反比。nnn 越大、区间越窄,集中效果越强。它不需要知道每个变量的具体分布,只需知道它们的取值范围,非常通用。

定理2.6 次高斯的等价形式

这段内容是次高斯变量理论的核心总结。Theorem 2.6 告诉我们:对于零均值随机变量,"是次高斯"这件事可以从四个完全不同的角度来刻画,而且它们是等价的。这四个角度分别对应 MGF、尾部概率、矩的增长速度、以及对 MGF 的参数化处理。(XXX 是零均值随机变量,即 E[X]=0\\mathbb{E}[X] = 0E[X]=0。)


(I) MGF 增长被高斯型控制

存在常数 σ≥0\\sigma \\ge 0σ0,使得对所有 λ∈R\\lambda \\in \\mathbb{R}λR

E[eλX]≤eλ2σ22(2.12a)\\mathbb{E}[e^{\\lambda X}] \\le e^{\\frac{\\lambda^2 \\sigma^2}{2}}\\tag{2.12a}E[eλX]e2λ2σ2(2.12a)

含义: 这正是 Definition 2.2 的定义(因为零均值,所以 X−μ=XX – \\mu = XXμ=X)。这是次高斯性的原始定义,也是最直接的判据。

直观: MGF 被一个"高斯型"的指数函数控制,说明尾部衰减不慢于高斯。


(II) 尾部概率被高斯随机变量控制

存在常数 c≥0c \\ge 0c0 和高斯随机变量 Z∼N(0,τ2)Z \\sim \\mathcal{N}(0, \\tau^2)ZN(0,τ2),使得对所有 s≥0s \\ge 0s0

P[∣X∣≥s]≤c P[∣Z∣≥s](2.12b)\\mathbb{P}[|X| \\ge s] \\le c \\, \\mathbb{P}[|Z| \\ge s]\\tag{2.12b}P[Xs]cP[Zs](2.12b)

含义: XXX 的尾部概率(在常数倍意义下)被某个高斯变量的尾部概率控制。

直观: 这是最直观的"次高斯性"——尾比高斯轻或至少不比高斯重(差一个常数)。这也解释了为什么叫"次(sub)高斯":它是"高斯之下"的。

为什么 (I) 能推出 (II): 由 (I) 对 XXX−X-XX 分别应用 Chernoff 界,得到 P[∣X∣≥s]≤2e−s22σ2\\mathbb{P}[|X| \\ge s] \\le 2e^{-\\frac{s^2}{2\\sigma^2}}P[Xs]2e2σ2s2,而高斯尾部满足 P[∣Z∣≥s]≥Ce−s22τ2\\mathbb{P}[|Z| \\ge s] \\ge C e^{-\\frac{s^2}{2\\tau^2}}P[Zs]Ce2τ2s2(对充分大的 τ\\tauτ),所以两者可互相控制。


(III) 矩的增长被高斯型控制

存在常数 θ≥0\\theta \\ge 0θ0,使得对所有 k=1,2,…k = 1, 2, \\dotsk=1,2,

E[X2k]≤(2k)!2kk!θ2k(2.12c)\\mathbb{E}[X^{2k}] \\le \\frac{(2k)!}{2^k k!} \\theta^{2k}\\tag{2.12c}E[X2k]2kk!(2k)!θ2k(2.12c)

含义: 偶数阶矩(奇阶矩因为零均值+对称控制而类似处理)的增长速度被一个特定系数的 θ2k\\theta^{2k}θ2k 控制。

关键观察: (2k)!2kk!=(2k−1)!!=1⋅3⋅5⋯(2k−1)\\frac{(2k)!}{2^k k!} = (2k-1)!! = 1 \\cdot 3 \\cdot 5 \\cdots (2k-1)2kk!(2k)!=(2k1)!!=135(2k1),而标准高斯 N(0,θ2)\\mathcal{N}(0, \\theta^2)N(0,θ2)2k2k2k 阶矩恰好是:

E[Z2k]=(2k−1)!!⋅θ2k=(2k)!2kk!θ2k\\mathbb{E}[Z^{2k}] = (2k-1)!! \\cdot \\theta^{2k} = \\frac{(2k)!}{2^k k!} \\theta^{2k}E[Z2k]=(2k1)!!θ2k=2kk!(2k)!θ2k

所以 (III) 说的是:XXX 的偶数阶矩不超过对应高斯变量的偶数阶矩。

直观: 矩的增长是次高斯的另一个等价刻画。第 kkk 阶矩越大,尾部越重。这个条件意味着尾不比高斯重。


(IV) MGF 的一种"最优"参数化形式

存在常数 σ≥0\\sigma \\ge 0σ0,使得对所有 λ∈[0,1)\\lambda \\in [0, 1)λ[0,1)

E[eλX22σ2]≤11−λ(2.12d)\\mathbb{E}\\left[ e^{\\frac{\\lambda X^2}{2\\sigma^2}} \\right] \\le \\frac{1}{\\sqrt{1 – \\lambda}}\\tag{2.12d}E[e2σ2λX2]1λ1(2.12d)

含义: 这是对 ecX2e^{cX^2}ecX2 型函数的期望的控制,而不是对 eλXe^{\\lambda X}eλX 的控制。

直观: 这个条件等价于 X2X^2X2 具有某种"亚指数(sub-exponential)"型的 MGF 控制。11−λ\\frac{1}{\\sqrt{1-\\lambda}}1λ1 是自由度为 1 的卡方分布(即标准高斯平方)的 MGF。所以 (IV) 说的是:X2X^2X2 的 MGF 不超过标准高斯平方的 MGF。

为什么它等价于次高斯: 由 (I),对 XXX 应用切比雪夫型技巧,可以推出 (IV);反过来,由 (IV) 通过泰勒展开也能推出 (III) 和 (I)。这个形式在很多高维概率的证明中(例如 Bernstein 型不等式)非常有用。


四条等价的逻辑关系

它们的等价性可以这样理解:

(I) ⇔\\Leftrightarrow (III): MGF 的泰勒展开系数就是各阶矩。eλ2σ2/2=∑k(σ2/2)kλ2kk!e^{\\lambda^2\\sigma^2/2} = \\sum_k \\frac{(\\sigma^2/2)^k \\lambda^{2k}}{k!}eλ2σ2/2=kk!(σ2/2)kλ2k,而 E[eλX]=∑kλ2kE[X2k](2k)!\\mathbb{E}[e^{\\lambda X}] = \\sum_k \\frac{\\lambda^{2k} \\mathbb{E}[X^{2k}]}{(2k)!}E[eλX]=k(2k)!λ2kE[X2k]。逐项比较就得到 E[X2k]≤(2k)!2kk!σ2k\\mathbb{E}[X^{2k}] \\le \\frac{(2k)!}{2^k k!}\\sigma^{2k}E[X2k]2kk!(2k)!σ2k

(I) ⇔\\Leftrightarrow (II): 通过 Chernoff 界((I) ⇒\\Rightarrow (II))和高斯尾部下界((II) ⇒\\Rightarrow (I) 的方向需要用积分估计)。

(I) ⇔\\Leftrightarrow (IV): 两者都是对 MGF 的控制,只是参数化方式不同。可以通过变量替换和积分变换互相转换。


Theorem 2.6 给次高斯性提供了四个可互换使用的工具箱:

刻画形式常用场景
(I) MGF E[eλX]≤eσ2λ2/2\\mathbb{E}[e^{\\lambda X}] \\le e^{\\sigma^2\\lambda^2/2}E[eλX]eσ2λ2/2 推导尾界、Chernoff 方法
(II) 尾部 P[∣X∣≥s]≤c P[∣Z∣≥s]\\mathbb{P}[|X| \\ge s] \\le c\\,\\mathbb{P}[|Z| \\ge s]P[Xs]cP[Zs] 直观理解、比较
(III) 矩 E[X2k]≤(2k)!2kk!θ2k\\mathbb{E}[X^{2k}] \\le \\frac{(2k)!}{2^k k!}\\theta^{2k}E[X2k]2kk!(2k)!θ2k 矩方法、组合应用
(IV) 二次型 MGF E[eλX2/2σ2]≤11−λ\\mathbb{E}[e^{\\lambda X^2/2\\sigma^2}] \\le \\frac{1}{\\sqrt{1-\\lambda}}E[eλX2/2σ2]1λ1 高维集中、Bernstein 不等式

这四个刻画说明:次高斯性不是某个孤立的定义,而是一个在多处自然出现的"稳健"性质——无论你从 MGF、尾部、矩还是二次型 MGF 出发,都会到达同一个概念。这也是为什么次高斯成为高维概率和统计学习理论中最核心的假设之一。

赞(0)
未经允许不得转载:171主机测评 » 高维统计学讲义——第二章《2.1.2 次高斯随机变量和Hoeffding界(二)》
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址