协方差cov计算公式推导|协方差公式推导举例

协方差cov计算公式推导:从砖头到高楼的数学脚手架

深入解析协方差公式推导全过程,结合真实案例、几何直观与统计本质,助你彻底掌握这一统计学核心工具——不是背公式,而是理解“为什么这样设计”。

什么是协方差cov计算公式推导

把一堆数塞进数学公式里,实际上就像把一堆散乱的砖头强行拼成一座楼。协方差(Covariance)就是那根起核心功能的脚手架,它负责告诉你砖块 A 和砖块 B 之间是搭得紧还是松。

要是它们搭得越紧,协方差就越高;搭得松、就连反过来拉扯,那数值就变负了。这就好比两个人一起跑步,你迈大步他迈小步,跑得越远,他们之间的距离拉得就越长,协方差自然负数;要是你俩步调一致,那数值就是正的,意味着趋势同向。

?

正向协方差

当变量x上升时y也上升,或x下降时y也下降——两者呈现同向变动趋势。

?

负向协方差

当变量x上升时y反而下降——两者呈现反向变动趋势,即“此消彼长”。
例如:温度↑ → 暖气用量↓

协方差

变量间无明显线性关系。注意:零协方差 ≠ 独立!可能存在非线性关系(如抛物线关系)。

关键洞见:协方差衡量的是两个变量“共同变化”的程度,但它本身没有单位可比性——正如我们无法直接比较“5度·公斤”和“10元·小时”的大小。这正是引出后续“标准差归一化”与“相关系数”的关键动因。

个真实生活类比

先不说那些高高在上的理论,咱们直接上手算一算。假设你有两组数据,一组是气温,一组是冰淇淋销量。

这种负号实际上挺有意思的,它不是单纯表示“大数乘小数”,而是表示这两个方向在“打架”——一个在推,一个在拉,形成反向合力。

协方差cov计算公式推导:从定义到本质

那到底如何推导呢?实际上能够从几何直觉启动想。协方差本质上是所有数据点都在二维坐标系里,它们分布在一条斜线上时,这个斜线的“陡峭程度”要么是“倾斜方向”。

要是斜线是往右上去的,说明两个变量同向变化,协方差为正;要是斜线是往左下去的,它们反向变化,协方差为负;垂直要么水平线,那就归零。

总体协方差定义式:

Cov(X, Y) = E[(X − μx)(Y − μy)] = E[XY] − E[X]E[Y]

在样本场景中,我们无法获取总体均值 μx, μy,只能用样本均值 x̄, ȳ 估计,因此推导出:

样本协方差(有偏估计,除以 n):

cov(X, Y) = 1/n Σi=1n (xi − x̄)(yi − ȳ)

而更常用于统计推断的是无偏估计(贝塞尔校正),即除以 n−1

样本协方差(无偏估计,除以 n−1):

sxy = 1/(n−1) Σi=1n (xi − x̄)(yi − ȳ)

推导中的关键拆解:交叉项为何抵消?

展开核心项 (xi − x̄)(yi − ȳ)

(xi − x̄)(yi − ȳ) = xiyi − xiȳ − x̄yi + x̄ȳ

对所有样本求和后除以 n

1/n Σ(xiyi − xiȳ − x̄yi + x̄ȳ) = 1/nΣxiyi − ȳ1/nΣxi − x̄1/nΣyi + x̄ȳ

注意到:
1/nΣxi = x̄,1/nΣyi = ȳ
所以中间两项变为:− ȳx̄ − x̄ȳ + x̄ȳ = − x̄ȳ

最终得:

cov(X, Y) = 1/n Σxiyi − x̄ȳ

这一整坨复杂的计算,本质上就是在算一组数据的“重心”——即两个变量联合分布的中心偏移程度。你看到的协方差公式 (1/n)Σ(xi−x̄)(yi−ȳ),实际上就是直接把这个重心的偏移量计算出来,然后求和。

为什么不是直接用 Σ(xi−x̄)(yi−ȳ)?
因为原始乘积和会随样本量增大而无限放大,无法横向比较不同规模数据集的协变程度。除以 n 是为了“归一化”,使其具备可比性。

协方差公式推导举例:从理论到实践

为了更具体地展示,咱们手里只有一组样本,记作 (x1, y1), (x2, y2), ..., (xn, yn)。在数学上,这看起来像是一个线性方程的截距 b。而协方差就是那一个斜率参数,拍板了 yx 的敏感度。

第一组数据:完美线性关系

数据点:(1, 2), (2, 3), (3, 4)

计算步骤:

  • = (1+2+3)/3 = 2;ȳ = (2+3+4)/3 = 3
  • 偏差乘积:
    (1−2)(2−3) = (−1)(−1) = +1
    (2−2)(3−3) = (0)(0) = 0
    (3−2)(4−3) = (1)(1) = +1
  • 协方差(除以 n)= (1 + 0 + 1)/3 = 2/3 ≈ 0.667
  • 协方差(无偏)= (1 + 0 + 1)/(3−1) = 1

结论:正协方差,且数值较大——说明两个变量高度同步增长。

第二组数据:扰动增强

数据点:(1, 2.1), (2, 3.2), (3, 4.3)

对比第一组:每个点的 y 值都增加了 0.1、0.2、0.3——即整体“上抬”且斜率略增。

计算:

  • = 2;ȳ = (2.1+3.2+4.3)/3 = 3.2
  • 偏差乘积:
    (1−2)(2.1−3.2) = (−1)(−1.1) = +1.1
    (2−2)(3.2−3.2) = 0
    (3−2)(4.3−3.2) = (1)(1.1) = +1.1
  • 协方差(除以 n)= (1.1 + 0 + 1.1)/3 = 2.2/3 ≈ 0.733
  • 协方差(无偏)= 2.2/2 = 1.1

结论:协方差比第一组更大——说明当 x 增添时,y 不仅增添,并且增添的幅度更“陡峭”,线性趋势更强。

第三组数据:非线性干扰

数据点:(1, 1), (2, 5), (3, 4)

看似乱了节奏:从 (1,1)→(2,5) 上升剧烈,但 (2,5)→(3,4) 反而下降。

计算:

  • = 2;ȳ = (1+5+4)/3 = 3.333...
  • 偏差乘积:
    (1−2)(1−3.333) = (−1)(−2.333) = +2.333
    (2−2)(5−3.333) = 0
    (3−2)(4−3.333) = (1)(0.667) = +0.667
  • 协方差(除以 n)= (2.333 + 0 + 0.667)/3 = 1.0
  • 协方差(无偏)= 3/2 = 1.5

⚠️ 注意:尽管数据呈现“先升后降”的非线性,协方差仍为正!这说明——
协方差只捕捉线性趋势,无法识别非线性关系。

协方差的不变性:平移不改变协方差

要是这两个数据组实际上是彻底一样的,只是数字偏移了一下,那它们的协方差就会相等。

例如:
原数据:(1,2), (2,3), (3,4) → cov = 1(无偏)
平移后:(101,102), (102,103), (103,104) → cov 仍为 1

反之,要是第二组里的点有点乱,比如改成 (1, 1), (2, 5), (3, 4),这时候斜率就变平要么变负了,协方差自然会变负要么变小。

几何与物理直觉:协方差是“推力”,不是“速度”

这里有个挺直观的比喻:协方差就像是一个“推力”。
要是你有两个弹簧,一个是压缩的,一个是拉伸的(反向),它们之间形成的相互功本事是排斥的,这就是负协方差。
要是你俩都压缩要么都拉伸,那就是同向的,形成的是正协方差。

劲度系数 × 距离 = 推力
协方差 = √Var(X) × √Var(Y) × cosθ = σxσyρxy
其中 ρxy 就是后来引入的“相关系数”,即单位化后的协方差。

这个推力的大小取决于两个维度:
1. 各自方差大小:弹簧的劲度系数——方差越大,个体波动越剧烈;
2. 方向一致性:cosθ——衡量两个变量变动方向的夹角余弦。

种极端情形

年:协方差概念的雏形

弗朗西斯·高尔顿(Francis Galton)在研究遗传性状时,首次提出“共同变异”的思想,为协方差奠定思想基础。

年:主成分分析(PCA)诞生

卡尔·皮尔逊(Karl Pearson)在推导PCA时,明确使用协方差矩阵描述多维变量的线性关系结构。

年代:现代统计学框架确立

罗纳德·费希尔(Ronald Fisher)引入“贝塞尔校正”,明确区分总体与样本协方差,推动无偏估计成为主流。

年代后:大数据时代的协方差应用

在机器学习中,协方差矩阵成为特征降维(如PCA)、风险建模(金融)、自然语言处理(词向量相关性)的核心工具。

常见误区辨析:协方差cov计算公式推导易错点

❌ 误区一:协方差为0 = 变量独立

反例:设 X ~ Uniform(−1,1),Y = X²。
显然 Y 完全由 X 决定,但 Cov(X,Y) = 0!
原因:分布对称,正负偏移相互抵消。

❌ 误区二:协方差大 = 关系强

单位不统一时无法比较:
Cov(身高, 体重) = 8.5 kg·cm
Cov(温度, 冰淇淋销量) = 120 度·个
无法直接说哪个“更强”。必须用相关系数 ρ。

❌ 误区三:协方差是距离

协方差不是距离度量!它不满足:
• 非负性(可为负)
• 对称性(Cov(X,Y)=Cov(Y,X),但非“距离”)
• 三角不等式
它是内积空间中的“角度+长度”组合。

为什么样本协方差除以 n−1

这个 n−1 是如何回事?这叫贝塞尔校正,是为了让计算出的方差无偏估计。在样本估计总体参数时,我们总希望算出来的结果比真值更准、更诚实,而不是出于偷懒多算了一次。

但在简单的协方差推导里,这个 n−1 实际上是个“坑”。如果你不把它归一化掉,你会拿到的是总体协方差,而不是样本协方差。样本协方差需要除以 n−1,才能拿到一个无偏的估计量。

这一点在严谨的统计推导里挺关键,但在一些快速估算或者特定场景下,除以 n 也是可以的,只是精度会低一点点。

实操建议:
• 小样本(n < 50)→ 用 n−1(无偏)
• 大样本(n > 1000)→ nn−1 差异可忽略
• 机器学习中(如协方差矩阵估计)→ 优先使用 n−1
◆ 最新
方程公式求根公式-一元二次方程根缩量选股公式-缩量选股公式数学方程式公式法-数学公式解法四格魔方公式教程-四格魔方公式教程公路路基土石方计算公式-公路路基土石方公式圆台公式体积公式-圆台体积计算公式方程根求解公式-方程根求解公式偿债备付率计算公式-偿债备付率计算公式万娘娘万能口语公式-万能口语公式万娘娘油价计算公式口诀-油价计算口诀写论文怎么引用公式-论文公式引用指南找次品的规律公式-找次品规律公式银行固定利息计算公式-银行固定利息计算公式数值计算平方根法公式-数值计算平方根法公式资金流指标公式-资金流指标公式赵轩趋势稳赢选股公式-赵轩趋势稳赢公式成本公式和利润公式-成本与利润计算公式椭圆公式推导-椭圆公式简化女生公式头像唯美加拿大28算大小公式-加拿大 28 大小计算微分方程特征公式-微分方程特征公式excel 乘法公式快捷键-Excel 乘法公式速记excel变异系数函数公式-EXCEL 变异系数公式明天会涨停公式-明日涨停速算公式纯利润的计算公式-纯利润计算公式库存出入库明细表公式-库存出入库明细表公式小学数学公式大全100例-小学数学公式一百例期限公式-期限计算公式mt4摇钱树指标公式-MT4 摇钱树指标高中几何图形公式大全-高中几何公式汇总牛顿第三运动定律公式-牛顿第三定律公式利率和费率计算公式-利率费率计算平均速度的公式高一-平均速度公式高一圆的重量公式-圆面积,重量快算生产日报表的公式-生产日报表计算公式阳2高选股公式-阳 2 高选股公式身体指数bmi的标准计算公式-BMI 计算公式标准二元一次方程解的公式-二元一次方程解法导数除法公式的单调性-导数除法公式单调性分析税前经营利润公式-税前经营利润公式大机构仓位指标公式-机构仓位动态公式彩箱计算公式-彩箱计算公式公式相声商演门票-商演门票公式相声传动比计算公式-传动比计算公式扇形面积计算公式高中-扇形面积公式高中扇形周长或面积公式-扇形周长面积公式物理摩擦力的公式-物理摩擦力计算公式功率公式表-功率公式表打折销售问题公式-打折销售公式问题股票补仓计算公式-股票补仓计算公式mathtype公式对齐-数学公式自动对齐营销费效计算公式-营销费效计算公式方锥形体积公式-方锥体积计算公式边际效用公式计算方法-边际效用计算方法不定积分的计算公式-不定积分计算公式标准差方差的计算公式-标准差方差计算公式误差传递公式运用-误差传递公式应用魔方还原教程万能公式-魔方还原万能公式分分彩打法公式-分彩公式大全分享线性代数公式-线性代数核心公式毛利占比怎么计算公式-毛利占比计算公式存款加权平均利率公式-存款加权平均利率公式分部积分公式的证明-分部积分公式证明破解平码三中三公式表-三公式表平码破解精准抄底公式-精准抄底计算公式uit推导公式-除法推导公式现值指数计算公式-现值指数计算公式快递运费计算求和公式-快递运费求和公式长期负债总额计算公式-长期负债总额计算公式乙烯价格计算公式-乙烯价格计算公式税费计算公式完整版-税费计算公式完整版主力资金公式指标-主力资金公式指标柱体体积公式是多少-柱体体积计算公式数学销售公式-数学销售公式电路基础公式总结-电路公式基础总结净资产利润率公式-净资产利润率公式双色球一等奖计算公式-双色球一等奖公式世界时间换算公式-世界时间换算公式高中物理必修一公式大全-高中物理必修一公式汇总椭圆形水罐容积计算公式-椭圆水罐容积公式capital公式-资本计算公式主力买卖指标公式-主力买卖指标公式黑马必抓指标公式-黑马必抓指标公式不锈钢圆钢的重量计算公式表-不锈钢圆钢重量计算表公式excel公式编辑器-Excel 公式编辑器拆分excel单元格内容公式百分之几怎么计算公式-百分之几计算公式标准离差公式-标准离差计算公式魔方教程公式口诀简单动态市盈率指标显示公式-动态市盈率显示公式计算排卵期的公式-计算排卵期公式经纬度格式转换公式-经纬度转换计算公式两阳夹一阴公式立方根公式大全讲解-立方根公式详解拓展扩张因子公式-扩张因子公式热功率计算公式是什么-热功率计算公式扇形面积公式弧长公式-扇形与弧长公式向量基本定理公式香港精准三肖中特公式-香港精准三肖中特公式
瑞秋资讯
蜀ICP备2026006976号-18