资讯动态

Steve Brunton | Probability Bootcamp | 笔记 | 第三部分:高级概率 | Lecture 27 | 联合概率分布:边缘密度与条件密度

发布时间:2026/8/10 11:20:47 来源:尧图企业网站定制
目录前言1. 引言2. 定义边缘密度3. 练习计算边缘分布4. 联合分布中的条件概率5. 结语结语参考前言学习 Steven Brunton 讲授的概率与统计入门概述视频本篇文章记录第二十七讲联合概率分布边缘密度与条件密度记录下个人学习笔记和大家一起分享交流videohttps://www.youtube.com/playlist?listPLMrJAkhIeNNR3sNYvfgiKgcStwuPSts9V1. 引言在上节课中我们介绍了两个随机变量X XX和Y YY之间的联合概率分布概念本质上我们可以定义X XX与Y YY同时发生的概率P ( x , y ) P ( X x , Y y ) P(x,y)P(Xx,Yy)P(x,y)P(Xx,Yy)这类似于我们之前讨论的X XX与Y YY同时发生的概率这是从条件概率中推导出来的这一概念将帮助我们利用联合分布来计算条件密度和所谓的边缘密度因此这些是必须掌握的重要概念。我之所以特别喜欢本科高年级的概率统计课程是因为它能让你真正运用微积分因此微积分是处理概率这类函数的强大工具边缘密度与条件密度本质上是通过对联合分布进行巧妙的微积分运算而得到的这与先前讨论的条件概率概念密切相关这些概念正是我们推导贝叶斯定理等理论的基础工具。我们已经知道存在这样的联合分布在x xx和y yy轴上呈二维对称的高斯分布其中每个随机变量X XX和Y YY本身都服从高斯分布。之前我曾提到过若对这个二维高斯概率密度函数中的X XX变量进行积分平均就会得到Y YY的高斯分布同理对Y YY变量的积分平均则会得到X XX的高斯分布。2. 定义边缘密度现在我将对此进行形式化表述这些被称为边缘密度函数。对于连续型随机变量X XX和Y YY其概率密度函数由二元函数f ( x , y ) f(x,y)f(x,y)给出通过对该函数在任意二维区域上进行双重积分即可计算随机变量( X , Y ) (X,Y)(X,Y)落在该区域的概率。边缘边际密度的定义如下我们常在经济学和统计学中听到 “边际” 这个概念边缘密度本质上允许我通过f ( x , y ) f(x,y)f(x,y)这个联合概率密度函数推导出关于X XX和Y YY各自的概率密度函数。通过联合概率密度函数我能够对Y YY变量进行积分平均从而得到仅关于X XX的概率密度函数因此我可以得到仅关于变量X XX的边缘密度函数f X ( x ) f_X(x)fX​(x)f X ( x ) ∫ − ∞ ∞ f ( x , y ) d y f_X(x) \int_{- \infty}^{\infty} f(x,y)dyfX​(x)∫−∞∞​f(x,y)dy这正是通过对联合分布中的Y YY变量进行积分所得到的结果简单来说我想知道忽略Y YY的具体取值X XX本身的分布是怎样的Y YY可以取所有这些可能的值我将对Y YY方向上所有可能事件的概率进行积分从而消除Y YY这个变量这就是边缘化。这个定义确实非常简单明了本质上就是通过对变量Y YY进行积分从而得到仅与变量X XX相关的函数。同样地大致来说我们记得全概率定律的核心思想是所有可能情况的总概率必须等于 1。随机变量Y YY必须取到其可能取值范围中的某个值因此当我将所有可能的Y YY值进行积分时最终得到的就是X XX的概率分布这相当于对Y YY所有可能取值进行了加权平均。同理我们也可以对变量Y YY进行同样的操作这很简单我们可以构建关于Y YY的边缘密度函数f Y ( y ) ∫ − ∞ ∞ f ( x , y ) d x f_Y(y) \int_{- \infty}^{\infty} f(x,y)dxfY​(y)∫−∞∞​f(x,y)dx方法完全类似只是这次我们需要对变量X XX进行积分消元。对于离散型随机变量这些概念同样适用但当前讨论的是连续型情形对于离散型随机变量其处理思路与连续型情形基本一致。因此对于伯努利随机变量或泊松随机变量我们可以采用相同的处理方式若已知联合概率分布P ( x , y ) P(x,y)P(x,y)就能推导出仅关于x xx的概率分布即通过边缘化得到P ( x ) P(x)P(x)的具体表达式P X ( x ) ∑ y P ( X x , Y y ) P_X(x) \sum_y P(Xx,Yy)PX​(x)y∑​P(Xx,Yy)我将对这个联合分布P ( X x , Y y ) P(Xx,Yy)P(Xx,Yy)进行处理通过对所有Y YY的取值进行求和来消除Y YY变量.接下来我将对y yy变量所有可能的取值状态进行概率求和通过这种边缘化操作最终得到仅与X XX相关的概率分布函数。这就是边缘密度函数的核心概念本质上是一种直接定义的概率运算当我们掌握联合分布时可以通过对其中一个变量进行边缘化处理从而得到仅关于X XX的概率分布。3. 练习计算边缘分布现在需要验证这个函数是否满足概率密度函数的定义条件若从− ∞ -\infty−∞到 ∞ \infty∞对该函数积分结果必须等于 1请务必确认这些函数确实符合概率密度函数的定义并确保你能双向理解 — 既能查阅二维高斯分布的公式进行正向推导也能从结果反推验证其性质我理解的表达式是f ( x , y ) 1 2 π exp ⁡ ( − x 2 y 2 2 ) f(x, y) \frac{1}{2\pi} \exp\left( -\frac{x^2 y^2}{2} \right)f(x,y)2π1​exp(−2x2y2​)这个函数可以轻松转换为极坐标形式f ( r , θ ) f(r, \theta)f(r,θ)现在请你通过具体练习在边缘密度与这个概率分布之间进行双向推导请先确认这样的推导是合理的确保你能熟练运用这些概念之后可以尝试用更简单的分布来练习。4. 联合分布中的条件概率OK最后还有一点需要说明之前我们讨论过一个非常重要的概念 — 条件概率因此贝叶斯定理以及逆向统计的核心都建立在条件概率之上也就是在已知Y YY发生的情况下推求X XX的概率或者反过来进行推理接下来我将通过联合分布的形式来展示这一关系。接下来我用离散型随机变量来说明概率关系首先考虑当随机变量Y YY取特定值时X XX取某个值的概率根据联合概率分布当Y YY取特定值时X XX的条件概率可表示为P ( X x ∣ Y y ) P ( X x , Y y ) P ( Y y ) P(X x \mid Y y) \frac{P(X x, Y y)}{P(Y y)}P(Xx∣Yy)P(Yy)P(Xx,Yy)​其中分母P ( Y ) P(Y)P(Y)是通过对X XX的所有可能取值求和得到的边缘概率相信你已经理解了建议你回顾前几讲关于条件概率与贝叶斯定理的内容并准备一张白纸进行推导练习。条件概率的基本公式是P ( X ∣ Y ) P ( X , Y ) P ( Y ) P(X \mid Y) \frac{P(X,Y)}{P(Y)}P(X∣Y)P(Y)P(X,Y)​其中P ( X , Y ) P(X,Y)P(X,Y)表示事件X XX与Y YY同时发生的联合概率P ( Y ) P(Y)P(Y)是事件Y YY发生的边缘概率这与我们之前学习的条件概率公式完全一致。现在使用概率分布函数进行表述使表达更加规范化这是一个关于X XX和Y YY所有取值的函数具有更广泛的适用性。同样地我们也可以在连续时间域中实现这一操作对于连续型随机变量给定X x XxXx时Y YY的条件概率分布就等于联合概率密度函数除以X XX的边缘密度f Y ∣ X ( y ∣ x ) f X , Y ( x , y ) f X ( x ) f_{Y \mid X}(y \mid x) \frac{f_{X,Y}(x, y)}{f_X(x)}fY∣X​(y∣x)fX​(x)fX,Y​(x,y)​同样地我们可以这样理解这实际上相当于X XX和Y YY的联合概率除以X XX的概率这与我们之前在条件概率中的处理方式非常相似现在我们正在定义这些条件密度函数。5. 结语这些内容并不复杂虽然信息量较大但相信都是实用知识通过离散型与连续型联合概率密度函数既可推导边缘密度通过对其中一个变量积分实现也能建立条件密度即在已知另一变量存在时该变量的概率分布假设该变量取某个特定值这实质上是在基于先前列出的条件概率构建概率分布。结语本讲为 L26 的联合分布框架装配了两个核心运算接口边缘化marginalization与条件化conditioning。边缘化是对 “无关变量” 的消除—f X ( x ) ∫ − ∞ ∞ f ( x , y ) d y f_X(x) \int_{-\infty}^{\infty} f(x,y)dyfX​(x)∫−∞∞​f(x,y)dy连续或P X ( x ) ∑ y P ( x , y ) P_X(x) \sum_y P(x,y)PX​(x)∑y​P(x,y)离散—本质上是全概率定律在联合分布上的直接应用Y YY必须取某值将所有可能的Y YY加权求和/积分后剩下的就是X XX的 “净” 分布。这与物理学中对多体系统做 “粗粒化” 处理的精神一脉相承。条件密度f Y ∣ X ( y ∣ x ) f ( x , y ) / f X ( x ) f_{Y|X}(y|x) f(x,y) / f_X(x)fY∣X​(y∣x)f(x,y)/fX​(x)则是贝叶斯统计的运算核心—它将联合分布 “切片” 后再归一化回答了 “在已知X XX的前提下Y YY服从什么分布” 这一问题。与 L4 的离散条件概率P ( A ∣ B ) P ( A ∩ B ) / P ( B ) P(A|B) P(A \cap B)/P(B)P(A∣B)P(A∩B)/P(B)相比本讲完成了从事件到随机变量的概念升维条件不再仅是 “给定某个事件发生”而是 “给定随机变量取某值”密度函数的比值自然承接了这一角色的连续化推广。从联合 → 边缘 → 条件的三角关系来看三者构成一个信息守恒的闭环(1) 联合包含全部信息(2) 边缘化丢失关联结构积分/求和抹去了变量间的依赖细节(3) 条件化则是在固定一维后保留另一维的分布结构。这一三角将成为后续协方差、相关系数和多元高斯分布推导的运算基础—边缘化求期望条件化做预测联合分布则是所有运算的源头 。参考https://www.youtube.com/playlist?listPLMrJAkhIeNNR3sNYvfgiKgcStwuPSts9V

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价