资讯详情

条件期望、全期望公式与重复独立试验:数值笔试概率题核心拆解

📅 2026/10/1 3:57:14 | 华诺云谱 👁 阅读
条件期望、全期望公式与重复独立试验:数值笔试概率题核心拆解
“数值笔试”这四个字参加过算法岗、数据分析岗笔试的朋友应该都不陌生。概率统计这一块翻来覆去就那几板斧但大多数人丢分并不是因为题目偏而是倒在了条件期望、全期望公式、重复独立试验这类“基础到不能再基础”的知识上。公式背得滚瓜烂熟真到做题时状态设不对、条件划分不全、几何分布第几个定义没看清各种细节失误全冒出来了。这篇就专门把这三块内容串起来讲清楚它们到底是什么、为什么总绑定出现、笔试里怎么考、有哪些坑。我会把推导过程、典型例题、易错点都拆开揉碎配合我在笔试和面试中实际踩过的坑一起说尽量让你看完就能上手做题。1. 为什么这三个知识点在数值笔试里“绑定出现”1.1 一条完整的技术链定义、工具与场景很多同学复习时喜欢把条件期望、全期望、重复独立试验当成三个独立章节去背这是最大的误区。实际上它们是一条完整的技术链条件期望是核心定义全期望公式是计算工具重复独立试验则是经典的出题场景。笔试题目很少单独问“请写出条件期望的定义”而是给你一个具体过程——抛硬币、抽卡、排队、故障发生、网络请求到达——让你求某个随机量的期望或概率。这时候十有八九要先用条件期望做“切分”再用全期望公式做“合并”而重复独立试验保证了切分后每一小块可以用二项分布、几何分布这类现成模型去算。举个例子你就明白。假设你不停地掷一枚公平骰子直到出现6为止设X为掷骰子的总次数。这道题如果你知道几何分布的结论直接写E[X] 1/p 6一秒出答案。但如果我把题目改一改你先掷一次骰子得到一个点数N然后掷一枚公平硬币N次设Y为正面次数问E[Y]是多少。这时候就不能靠一个分布结论秒杀了你得拆两步走先固定N n则Y|N n服从二项分布Bin(n, 1/2)所以E[Y|N n] n/2再利用全期望公式E[Y] E[E[Y|N]] E[N/2] 3.5/2 1.75。这就是条件期望和全期望的典型组合用法。理解了这个“绑定关系”你看概率题时就不会再东一榔头西一棒槌而是自然地想这个随机过程能不能先按某个变量分类再对每一类分别处理。1.2 从一道热身题看三者的联动再把上面这道热身题往深推一步看看重复独立试验是怎么掺和进来的。N是骰子点数取值范围1到6每个值概率1/6N确定后我们独立地抛N次公平硬币。这里的“独立”非常重要正是因为每次抛硬币互不影响、成功概率恒为1/2Y|N n才是一个标准的二项分布。如果改成无放回抽球情况就完全不同了——每次抽取之间不再独立二项分布的结论不能直接用超几何分布就要上场。所以你看一个题里其实藏了三层信息条件期望负责“在给定N时求局部期望”全期望负责“把N的不确定性平均回去”重复独立试验则负责“确保局部那块儿可以用最简单的分布描述”。面试官喜欢把这三个点放在同一道题里一箭三雕地考查你对基础概念的掌握程度。如果这三者之间的关系没打通遇到稍微绕一点的题就很容易卡壳。2. 条件期望先把它当成随机变量而不是一个数2.1 离散与连续两种定义本质都是“重加权”条件期望的教材定义并不复杂。离散情形下若X和Y都是离散随机变量在给定Y y的条件下X的条件期望是E[X|Y y] Σ x · P(X x | Y y)连续情形下则换成条件密度E[X|Y y] ∫ x · f_{X|Y}(x|y) dx形式不同本质一样已知Y的信息后对X做一次加权平均。这里的权重不是X自己的概率而是“在Y y这个新信息下”的后验条件概率或条件密度。我当年第一次学的时候觉得这很简单不过就是把P(Xx)换成了P(Xx|Yy)能有什么花头后来做题才发现真正的难点根本不在“给定y怎么算”而在“没给定y时怎么办”。这才是笔试的坑所在。2.2 真正卡住多数人的点E[X|Y] 是 Y 的函数先看两组符号很多人就是因为没分清它们才翻车E[X|Y y]一个具体的数。Y已经取定值y条件期望算出来是常数。E[X|Y]一个随机变量。Y本身是随机的所以这个条件期望会随着Y的取值变化而变化。用生活场景类比一下。假设你要预测奶茶店明天的销量X而你关注的变量是明天的天气Y。如果明天确定为晴天你预测销量300杯如果明天确定为雨天你预测销量150杯。这时候E[X|Y 晴天] 300E[X|Y 雨天] 150都是确定的数。但如果天气还没定晴天、雨天各有一半概率那么你的预测值本身也就是一个随机变量——一半概率是300一半概率是150。这个“预测值的随机性”正是E[X|Y]的含义。笔试里常出现的写法是E[E[X|Y]]外层的期望就是对那个“随Y变化的预测值”再取平均。回到奶茶店的例子E[E[X|Y]] 0.5×300 0.5×150 225正好等于明天的平均销量。这背后就是后面要讲的全期望公式。先记住一句话遇到E[X|Y]把它当随机变量处理不要下意识地当成常数很多错误都能避免。2.3 笔试高频性质清单哪些可以直接用条件期望有一些性质在笔试解题时非常顺手列出来给你参考线性性E[aX1 bX2 | Y] aE[X1 | Y] bE[X2 | Y]。条件期望对线性组合仍然保持线性这在拆解复杂随机变量时很有用。若X与Y独立则E[X|Y] E[X]。给定Y不会带来任何关于X的信息平均结果回到无条件期望。若X是Y的函数即X h(Y)则E[h(Y) | Y] h(Y)。在已知Y的条件下h(Y)不再随机条件期望等于它自身。提因子性质E[Y·Z | Y] Y · E[Z | Y]。这里Y在条件中已知可以当作常数提到期望号外面。全期望公式E[X] E[E[X|Y]]。这个是后面章节的重点。提因子性质我想多说一句很多人在这一步栽跟头。比如要算E[Y·X]且Y与X不独立时有人直接写E[Y·X] E[Y]·E[X]这就错了。正确思路是先用迭代期望E[Y·X] E[E[Y·X | Y]] E[Y·E[X|Y]]。先把Y当作条件中的已知量提出来再对外层取期望。这个操作在推导条件方差公式时尤其常见。3. 全期望公式把难算的期望拆成好算的条件期望3.1 推导与“完备互斥”的使用前提全期望公式的离散形式是这样的设事件组A1, A2, ..., An是样本空间的一个划分也就是这些事件互不重叠、合起来覆盖所有可能情况且每个事件的概率都大于0那么对任意随机变量X有E[X] Σ E[X | Ai] · P(Ai)它为什么成立证明其实不长。根据条件期望的定义E[X | Ai] · P(Ai) Σ_x x · P(X x | Ai) · P(Ai) Σ_x x · P(X x, Ai)对所有i求和左边正好是Σ E[X|Ai]P(Ai)右边变成Σ_i Σ_x x · P(X x, Ai) Σ_x x · Σ_i P(X x, Ai) Σ_x x · P(X x) E[X]连续情形类似只是把对i的求和换成对Y的积分E[X] ∫ E[X | Y y] · f_Y(y) dy这个公式本身不难背难的是用对。使用前提有两个关键点第一A1到An必须互斥不能有重叠否则同一块概率会被重复计算第二必须完备也就是所有Ai的并集要覆盖整个样本空间不能漏掉某种情况。我带过不少人复盘笔试题发现他们算错的原因往往不是公式记错了而是条件事件没分全——比如题目里明明有“其他情况”这几个字结果写答案时把那一支漏掉了。3.2 随机个随机变量的和一类大题的通用解法全期望公式在笔试里最经典的应用是求“随机个随机变量的和”的期望与方差。设N是一个非负整数随机变量X1, X2, ...是一串独立同分布的随机变量均值都是μ、方差都是σ²并且N与这串X相互独立。考虑总和S_N X1 X2 ... X_N这个模型能套很多场景每天的订单量是N每笔订单金额是Xi求一天总营业额某时段到达的请求数是N每个请求耗时是Xi求总耗时一个家庭有N个孩子每个孩子的身高是Xi求总身高。求期望时先固定NS_N就是N个独立同分布变量的和条件期望为E[S_N | N] Nμ。再用全期望E[S_N] E[E[S_N | N]] E[Nμ] μE[N]结果很漂亮总和的期望等于“平均个数”乘以“单体均值”。这里的直觉是N本身是随机的但通过全期望公式把它“平均掉”之后结论依然简洁。求方差稍微复杂一点要用条件方差公式这也是全期望公式的自然推广Var(S_N) E[Var(S_N | N)] Var(E[S_N | N])固定N n时S_N n个独立同分布变量之和方差是nσ²所以E[Var(S_N|N)] σ²E[N]而E[S_N|N] Nμ这部分方差是Var(Nμ) μ²Var(N)。合起来Var(S_N) σ²E[N] μ²Var(N)这个结论笔试可以直接用建议记牢。推导过程也要能随时写出来因为面试官很可能让你现场推一遍条件方差公式。3.3 条件方差公式期望玩熟之后必须附带掌握条件方差公式本身值得单独说一下。要证明它可以从定义出发。对任意随机变量Y和ZVar(Y) E[Y²] - (E[Y])²利用全期望公式展开两项E[Y²] E[E[Y² | Z]]E[Y] E[E[Y | Z]]把第二个式子代回Var(Y)的定义Var(Y) E[E[Y² | Z]] - (E[E[Y | Z]])²关键一步来了把第一项里的条件方差拆出来。条件方差的定义是Var(Y | Z) E[Y² | Z] - (E[Y | Z])²所以E[Y² | Z] Var(Y | Z) (E[Y | Z])²代入后Var(Y) E[Var(Y | Z) (E[Y | Z])²] - (E[E[Y | Z]])² E[Var(Y | Z)] E[(E[Y | Z])²] - (E[E[Y | Z]])²最后两项合在一起正好就是E[Y|Z]这个随机变量的方差Var(E[Y | Z]) E[(E[Y | Z])²] - (E[E[Y | Z]])²因此得到Var(Y) E[Var(Y | Z)] Var(E[Y | Z])这个公式的口诀可以记成“期望的方差加方差的期望”总方差 组内方差的平均 组间均值的方差。笔试里遇到分层数据、混合模型、随机和的方差都能用它。我见过不少候选人会背公式但一让解释每一项的含义就支支吾吾所以建议你理解上面这个推导过程而不是只背结论。4. 重复独立试验伯努利序列与三大分布4.1 二项、几何、负二项一张表理清参数重复独立试验指的是每次试验只有“成功”和“失败”两种结果各次成功概率p固定不变并且试验之间相互独立。这样一个伯努利试验序列可以派生出几个笔试高频分布。我把它们放在一张表里对比分布描述的问题概率质量函数期望方差二项分布 B(n, p)n次试验中的成功次数C(n,k) p^k (1-p)^(n-k)npnp(1-p)几何分布 Ge(p)试验次数型首次成功出现时的试验次数(1-p)^(k-1) p1/p(1-p)/p²几何分布 Ge(p)失败次数型首次成功前失败的次数(1-p)^k p(1-p)/p(1-p)/p²负二项分布 NB(r, p)第r次成功出现时的试验次数C(k-1, r-1) p^r (1-p)^(k-r)r/pr(1-p)/p²注意几何分布有两个版本这是笔试重灾区。有的教材定义X为“首次成功的试验次数”取值范围1, 2, 3...有的定义Y为“首次成功前的失败次数”取值范围0, 1, 2...。前者期望是1/p后者期望是(1-p)/p。刷题时第一件事就是看清楚题目里统计的到底是“试验次数”还是“失败次数”一字之差结果差的不是一点点。负二项分布可以看作几何分布的推广几何分布等的是第1次成功负二项分布等的是第r次成功。它的概率质量函数为什么有个组合数C(k-1, r-1)因为第k次试验必须是成功的那一次前面的k-1次里要有r-1次成功且它们的位置任意排列。4.2 用条件期望推导几何分布的期望几何分布的期望用全期望方法推是最直观的比硬记结果有用得多。设X是首次成功所需的试验次数每次成功概率为p。我们观察第一次试验的结果来分类第一次就成功概率p此时X 1第一次失败概率1-p此时已经消耗了1次试验而且因为每次试验独立失败后的状态和从头开始完全一样剩余需要等待的次数仍然服从与X相同的分布。写成等式E[X] p × 1 (1-p) × (1 E[X])这里第二个分支为什么是1 E[X]因为已经做了1次失败的试验之后还要再等一个“全新的几何等待时间”两者相加。整理一下E[X] p (1-p) (1-p)E[X] 1 (1-p)E[X]移项得到pE[X] 1即E[X] 1/p这个过程本质上用到了几何分布的“无记忆性”前面失败多少次都不会让“下一次成功还要等多久”的期望变小。这和排队时“已经等了10分钟还要再等多久”是同一回事——如果服务时间服从几何分布已等待的时间不会提供任何额外的信息。另外补充一个很常用的公式非负整数随机变量的期望可以写成E[X] Σ_{k≥0} P(X k)用它推几何分布也很快P(X k) (1-p)^k所以E[X] Σ_{k≥0} (1-p)^k 1/p。这个“长尾求和”公式本身也是笔试常客记下来不吃亏。4.3 “连出两次正面”的递推状态法一个很有代表性的题目是连续抛一枚公平硬币直到出现连续两次正面为止求抛掷次数的期望。很多人的第一反应是设E为所求期望然后直接想“第一次正面、第二次反面……”的情况结果越列越乱。正确做法是先设状态。定义E0当前还没有积累任何连续正面时距离达成目标还需要抛的期望次数E1当前已经连续抛出了1次正面时距离达成目标还需要抛的期望次数。从E0开始抛一次硬币。如果是反面概率1/2状态仍然是E0但是已经消耗了1次如果是正面概率1/2状态变成E1也消耗了1次。所以E0 1 (1/2)E0 (1/2)E1从E1开始再抛一次。如果是反面概率1/2连续的正面记录断了状态退回E0同时消耗1次如果是正面概率1/2连续两次正面达成游戏结束消耗1次。所以E1 1 (1/2) × 0 (1/2)E0 1 (1/2)E0联立解得E0 1 0.5E0 0.5E1 0.5E0 1 0.5E1 E0 2 E1代入E1的表达式E0 2 1 0.5E0 0.5E0 3 E0 6所以期望抛掷次数是6。E1 1 3 4意思是已经连出一次正面后平均还要再抛4次。这个答案和直觉比较吻合毕竟“连出两次正面”比单等一个正面期望2次难得多。这道题的启发是遇到“等待某个模式出现”的问题不要试图直接数所有路径而是根据当前状态设变量用条件期望列出方程。状态定义的好坏直接决定计算量这也是全期望公式在更复杂场景下的核心用法。5. 三道高频例题完整拆解从读题到落笔5.1 库存模型的补货决策划分条件直接用题目背景某仓库每天的需求量X服从均值为50的泊松分布。当一天需求量超过60时管理员会在第二天启动紧急补货流程启动补货的情况下第二天需求的均值降为40不补货的情况下第二天需求的均值仍为50。求第二天需求的期望。思路很直接先构造条件和划分。设A表示事件“第一天需求超过60”则A的补集是“第一天需求不超过60”。根据全期望公式E[第二天需求] E[第二天需求 | A] × P(A) E[第二天需求 | A^c] × P(A^c)题干已经给了条件期望E[第二天需求 | A] 40E[第二天需求 | A^c] 50。所以只剩P(A)需要算。X ~ Pois(50)求P(X 60)。这一步需要一点计算功底。直接手算泊松概率不现实笔试里通常用正态近似泊松分布Pois(λ)在λ较大时近似正态分布N(λ, λ)。这里λ 50标准差约√50 ≈ 7.07。P(X 60) ≈ P(Z (60.5 - 50) / 7.07) ≈ P(Z 1.485) ≈ 0.069这里用了连续性校正把60改成60.5让近似更准。于是E[第二天需求] 40 × 0.069 50 × 0.931 ≈ 49.31这道题其实不难但很能考查你是否清楚“全期望公式里的划分到底是什么”。如果把A和A^c的概率算错了或者漏了A^c这一支结果就会跑偏。另外提醒一句题目中“第二天需求均值变为40”是一种简化假设真实场景中补货的影响可能更复杂但笔试阶段就按给定条件来不要过度发挥。5.2 分支过程的期望递推从个体到群体分支过程是概率论里非常经典的一个模型也是数值笔试里“全期望公式递推”的典型考题。题目通常这样出一个群体中每个个体独立地产生后代每个个体后代数K的分布为P(K k) p_k均值μ方差σ²。设Z0 1Zn为第n代个体总数求E[Zn]。先从Z1说起。Z1 K也就是单个个体产生的后代数所以E[Z1] μ。从第n-1代到第n代每个个体都独立地产生后代因此可以把Zn写成Zn Σ_{i1}^{Z_{n-1}} K_i其中K_i是第n-1代第i个个体产生的后代数与分布K独立同分布。这里出现了一个“随机个随机变量求和”的结构用全期望公式E[Zn] E[E[Zn | Z_{n-1}]]给定Z_{n-1}时Zn是Z_{n-1}个独立同分布变量之和条件期望为Z_{n-1} × μ于是E[Zn] E[Z_{n-1} × μ] μ E[Z_{n-1}]这就得到了一个递推关系E[Zn] μ E[Z_{n-1}]。从E[Z1] μ开始一步步推E[Z2] μ × μ μ² E[Z3] μ × μ² μ³所以E[Zn] μ^n结果简洁得让人意外——只要知道每个个体的平均后代数μ第n代的期望规模就是μ的n次方。这个模型套到很多场景都成立一条信息的转发链上平均每个用户转发μ次第n层转发的期望人数就是μ^n一个流行病传播模型里每个感染者平均传染μ个人第n代感染人数的期望就是μ^n。如果想更近一步求Zn的方差可以用条件方差公式递推Var(Zn) E[Var(Zn | Z_{n-1})] Var(E[Zn | Z_{n-1}]) E[Z_{n-1} σ²] Var(Z_{n-1} μ) σ²E[Z_{n-1}] μ²Var(Z_{n-1})这个递推同样可以从n 1开始算但笔试里考到分支过程方差的比例明显低于期望所以优先把期望的推导吃透。5.3 轮流掷骰子先到6者胜递推方程解决无限过程最后一道例题换个场景。甲乙两人轮流掷一颗均匀骰子甲先掷谁先掷出6谁获胜。求甲获胜的概率。这题可以用条件期望和全概率的思想直接列递推方程。设p为甲最终获胜的概率。甲的第一次掷骰分为两种情况甲直接掷出6概率1/6甲立刻获胜甲没有掷出6概率5/6。此时轮到乙掷如果乙直接掷出6概率1/6甲失败如果乙也没有掷出6概率5/6此时两人都白白浪费了一轮游戏回到甲先掷的初始状态甲获胜的条件概率仍然是p。写成方程p 1/6 (5/6) × (5/6) × p这里第二个分支为什么只乘一个p因为“甲没掷出6”和“乙没掷出6”同时发生概率是(5/6)²之后游戏状态完全重置为“甲先手”甲获胜的条件概率回到p。解方程p × (1 - 25/36) 1/6 p × (11/36) 1/6 p 6/11答案约等于0.545。甲先手优势体现在哪里优势就是那个多出来的1/36概率项。你也可以用无穷级数验证甲获胜概率 1/6 (5/6)²×1/6 (5/6)^4×1/6 ...首项1/6、公比25/36的等比级数求和得到(1/6)/(1 - 25/36) 6/11两种方法结果一致。这道题示范了一个重要技巧遇到“谁先达到某个状态谁赢”的无限过程不用傻傻地列无穷级数而是利用过程的状态重置特性设一个目标概率然后列递推方程一步搞定。6. 常见错误与排查清单6.1 把条件期望算成常数丢掉外层期望这是我见过最多的一类错误。题目让你求E[X]你条件期望写得很好E[X|Y] 某个关于Y的表达式结果一激动直接把这个表达式当成最终答案交上去了。正确做法是只要外层的期望符号还在就一定要再对Y求一次平均。比如E[X|Y] Y²题目里Y服从均匀分布那么E[X] E[Y²]还需要继续算积分或求和而不是停在Y²。自己检查时有个小技巧最终答案里不应该残留任何随机变量。如果最后结果里还有X、Y、N这种字母带着随机性说明外层期望还没取干净。6.2 条件事件不完备就套全期望全期望公式的划分需要“互斥且完备”。互斥意味着事件之间不能交叉完备意味着所有事件合起来要覆盖全部情况。笔试里最常见的翻车点就是漏掉“否则”那一支。题目说“如果天气晴朗销量期望是300如果下雨销量期望是150”很多人直接算0.5×300 0.5×150却忽略了还有阴天、下雪、台风等没列出来的情况。如果题干确实只有两种天气且概率之和为1那没问题但只要有第三种可能划分就不完备。看到“其他”“否则”“剩余情况”这些词时要条件反射地检查自己列的划分是否把它们都覆盖进去了。宁可多写一支“剩余情况”也不要少算。6.3 忽略“独立”条件套错分布二项分布、几何分布都建立在“各次试验独立”的假设上。如果题目是无放回抽样各次抽取之间不独立这时候成功次数的分布是超几何分布期望虽然仍可用线性期望算出n×M/N但方差不能套二项分布的np(1-p)。我在一次模拟面试中遇到过候选人把无放回抽球直接当二项分布算看起来步骤很顺实际上模型从一开始就是错的。所以拿到题目先确认“每次试验的成功概率是否恒定”“各次之间是否独立”这两点不满足分布结论一律不能直接套。6.4 笔试时间分配与草稿习惯数值笔试的时间通常比较紧概率大题如果5分钟内没有思路容易越陷越深。我个人的习惯是遇到期望类题目先在草稿纸上画一个“条件树”——把条件事件按互斥完备的要求列成几条分支每条分支上标注概率和对应的条件期望最后合并。这样整个问题的结构一目了然不容易漏情况也不容易在中间步骤迷路。如果是几何分布、负二项分布这类等待问题先确认题目统计的是“试验次数”还是“失败次数”再决定用哪个版本的概率质量函数。审题多花10秒比算完发现结果差了1再回头改要快得多。这些知识点看着基础却是笔试里最容易因为“会而不对”丢分的部分。我自己也经历过好几次公式全对但因为状态设错、划分不全最后结果和正确答案差一点点。后来总结出一件事概率期望题的核心不是背公式而是把一个随机过程拆成几个“已知信息层级”然后逐层求期望。条件期望是切分工具全期望公式是合并工具重复独立试验则是“切分之后每块都长得一样”的便捷条件。复习时与其刷一堆偏题怪题不如把今天这几道典型题反复做透。最后再分享一个个人经验笔试遇到不会的期望题优先想“能不能先给定某个变量再对另一个变量求期望”这个思路往往能在一分钟内打开突破口。
📝

华诺云谱内容团队

资深建站顾问 · 行业研究员

10年+企业数字化服务经验,专注智能建站、SEO优化与品牌营销,持续输出建站技巧、行业洞察与营销干货,已帮助5000+企业实现数字化增长。

你可能需要的服务

订阅华诺云谱资讯周报

每周一封,精选建站技巧、SEO与营销干货,直达邮箱。已有 8,000+ 企业主订阅,助你少走弯路。

↑