A/B测试与统计学面试全攻略:从假设检验到置信区间
场景回放面试官把简历放在桌角抬起头问“产品经理跑过来说新版详情页的转化率比旧版高了0.5%想全量上线你觉得这个结论可不可信”这个问题看起来简单但背后牵出来的是一整套A/B测试和统计学的知识链条。A/B测试在数据分析、数据科学、商业分析这些岗位的面试里几乎是必考题而统计学决定了你能不能从一组实验数据里得出站得住脚的结论。我结合这些年自己面试候选人和被面试的经验把A/B测试和统计学这块的面试题系统拆一遍覆盖假设检验、样本量计算、显著性分析、置信区间、常见面试连环追问尽量还原面试官真正想听的回答思路。这篇内容主要适合三类人正在准备数据分析面试的人平时会用A/B测试但理论基础不太扎实的从业者以及想系统补一下统计学短板的产品或运营同学。里面的公式不会堆太多我会把每个概念先翻译成人话再给可以直接套用的计算方法和面试回答模板。1. A/B测试面试的第一关先搞懂业务场景到底在问什么1.1 面试官问A/B测试其实是在考察你的完整分析闭环很多候选人一听到“A/B测试”就条件反射开始背流程定义指标、确定分组、跑实验、看显著性。这个回答方向没错但分拿不高。面试官真正想看的是你能不能从业务问题出发走完一个完整的数据分析闭环业务目标拆解、指标口径定义、实验设计、数据采集、统计分析、最终业务决策。我面试别人的时候如果候选人直接跳到“P值小于0.05就显著”我会立刻追问一句那如果这个业务场景根本不适合做A/B测试呢所以第一个要建立的思维是A/B测试不是万能工具。它是用来验证因果关系的但前提是你有足够的流量、指标可以被稳定测量、实验单元能够随机分配。在回答任何A/B测试设计题之前先花三十秒把业务场景、实验单元、核心指标说清楚这个开场基本就赢了一半。一个比较稳妥的回答框架是先还原业务目标这个实验要解决什么问题提升什么商业指标再定义核心指标和辅助指标主指标用来决策辅助指标用来排查异常和发现副作用接着确定实验单元和分组粒度用户、设备、账号还是行为然后算样本量和实验时长最后说明分析方法和决策标准。这套框架的好处是让面试官看到你不是只会套模板而是真的有从业务到统计再到决策的全局观。1.2 高频业务场景题指标口径与实验单元是重灾区A/B测试面试里最容易翻车的两个人是“指标口径”和“实验单元”。先说实验单元。常见的有user_id、device_id、cookie、账号甚至订单。它们之间最大的区别在于“独立性”。假设你要给一个App做新功能测试想让一部分用户体验新版界面一部分用户保留旧版。如果按cookie来分同一个用户换个设备就可能被分到两个组里这就会导致实验组和对照组之间产生交叉污染。正确的做法是优先使用企业标识或用户唯一标识这个在电商、内容、金融等行业里基本默认按用户维度来做实验。再说指标口径。以点击率为例是点击PV除以曝光PV还是点击用户数除以曝光用户数前者反映行为层面的反应强度后者反映用户层面的渗透率。大多数实验用用户级指标做核心判断更合理因为实验单元是用户如果指标还是事件级会引入同一用户的多个样本点导致样本不独立最后显著性检验会失真。举个具体例子某电商App想优化商品详情页的购买转化率核心指标是“下单用户数/进入详情页用户数”实验单元是user_id。如果我们错误地统计成“下单订单数/详情页UV”一方面重复购买用户会放大实验组效果另一方面订单数和用户数之间的关系会藕断丝连检验的独立性假设就破了。面试时主动把这种细节讲出来会明显加分因为它是实际业务里最常踩的坑。1.3 如何优雅地回答“这个实验值不值得做”面试官有一个高频追问如果业务方没有从0到1做实验的需求你还会不会支持他用A/B测试这个问题背后问的是ROI思维。在回答时可以从实验成本、机会成本、流量成本三个角度来拆。实验成本包括开发埋点、排期、数据回刷、分析师时间机会成本是实验期间不能上线其他策略可能错失增长窗口流量成本是样本量不够甚至要全量投放才能出结果时实验就失去了意义。当你把这些成本摆出来再问“这个实验值不值得做”你的答案就已经不是简单“做”或“不做”而是一个基于投入产出的判断。这里可以用一个比较经典的判断框架来回答先明确期望提升也就是最小可检测效应(MDE)再估算要达到统计学显著需要的样本量结合DAU和可分配流量算出运行时长最后对比实验期间的业务风险和收益预期。如果实验要用三周才能跑出结果但业务活动窗口只有十天那这个实验设计本身就需要调整而不是硬着头皮上。2. 统计学基础假设检验的核心逻辑2.1 先理解原假设与备择假设的“无罪推定”假设检验是A/B测试的底层地基其中原假设(H0)和备择假设(H1)的设定又最重要。很多人背过定义但没有真正理解为什么这么设。用法律系统来类比就很好懂在法庭上默认被告是无罪的控方需要拿出足够证据才能推翻这个假定。这里的“无罪推定”就是原假设“有罪”就是备择假设。你不能证明一个人无罪只能说证据不足以证明他有罪。放到A/B测试里原假设通常是“新版本和旧版本没有差异”也就是新版转化率等于旧版转化率备择假设是“新版本和旧版本有差异”也就是新版转化率不等于旧版转化率。我们收集数据计算P值如果P值足够小就说明在“没有差异”的前提下出现当前这种结果的可能性太低于是拒绝原假设认为差异显著。这个设定背后有个很关键的点我们永远无法证明原假设为真只能拒绝原假设或者不拒绝原假设。如果你想证明“新版更好”其实你是在收集证据去拒绝“新版没有更好”这个假设。面试中主动说出这层逻辑比单纯背“拒绝H0接受H1”要更显功力。2.2 P值的含义以及为什么它常常被误解P值大概是统计学里被误解最多的概念。我几乎每次面试都会问一句“P值等于0.03是什么意思”能完全答对的人不到三分之一。最常见的错误答案是“H0为假的概率是3%”或者“我做错决定的概率是3%”。这两个都不对。正确的理解是在原假设为真的前提下观察到当前样本这么极端甚至更极端的概率是3%。注意这里的前提是假设H0为真讨论的是数据出现的概率不是H0为假的概率。用一个生活化的类比来说假设你的朋友没有超能力只是瞎猜硬币正反面那么他连续猜中十次正面的概率大约是0.1%。现在他真的连续猜中了十次那你要么相信他运气逆天要么更倾向于怀疑他真有超能力。P值就是那个“运气逆天”的概率当它足够小我们就选择怀疑原假设。在面试里你可以用一个简洁的公式流P值 在H0为真时观测到至少这么极端结果的概率。同时补一句“P值不是效应大小所以P值小不代表效果好”这句话能防止面试官觉得你概念不清。2.3 犯两类错误怎么权衡alpha与beta假设检验有两条“犯罪路径”第一类错误是把没有差异的结果判成有差异第二类错误是把真实存在的差异漏掉了。第一类错误用alpha控制通常设定为0.05意思是“我允许有5%的概率误判”第二类错误用beta控制统计功效等于1减去beta代表“当真实差异确实存在时我能正确检出的概率”行业惯例是要求0.8或者更高。面试里经常出现这样的追问如果样别量不够两组差异看起来不显著能说明新版本一定没用吗这时候就要用第二类错误来回答样本量不足时检验功效很低即便真实存在差异也可能检不出来。不做功效分析就下“无效结论”这是很大的统计风险。alpha和beta之间的权衡关系也很重要。如果业务上很怕误上线一个没用的功能那就要把alpha设严一点如果更怕漏掉一个有用的功能那就得提高功效、增加样本量。面试时能主动提到“换一个业务场景我会调整这两者的优先级”会让你显得很有实战判断力。3. A/B测试实验设计样本量、运行时长与最小可检测效应3.1 样本量计算从效应量到均值/比例检验样本量计算几乎是A/B测试面试的必问题。它背后的逻辑是如果你的实验组和对照组真有一个真实差异你需要足够多的样本才能把“信号”从“噪声”里稳定地捞出来。对于比例类指标比如转化率每组所需样本量可以用下面的公式估算n ((Z_{1-alpha/2} Z_{1-beta})^2 * (p1 * (1-p1) p2 * (1-p2))) / (p1 - p2)^2其中p1是基线转化率p2是实验组的预期转化率alpha通常取0.05beta通常取0.2。我们直接用Python这个公式写出来import math from scipy import stats def calc_sample_size(p1, p2, alpha0.05, power0.8): z_alpha stats.norm.ppf(1 - alpha / 2) z_beta stats.norm.ppf(power) delta p1 - p2 n math.ceil( ((z_alpha z_beta) ** 2) * (p1 * (1 - p1) p2 * (1 - p2)) / (delta ** 2) ) return n # 例子基线转化率10%期望提升到12%也就是绝对提升2个百分点 print(calc_sample_size(0.10, 0.12))跑出来的每组样本量大约在3800多。这个数量级和用在线样本量计算器得到的结果是一致的。实际业务中我们通常会在此基础上再放大10%到20%因为要考虑用户流失、埋点缺失、数据清洗等损耗。如果是均值类指标比如人均访问时长、客单价样本量公式会用到方差。处理思路其实差不多只要把比例中的p*(1-p)替换成方差估计值就行。面试时多被追问的就是“方差从哪里来”你可以回答用历史数据或AA实验的方差来估计这是比较标准的做法。3.2 运行时长怎么定不仅有样本量还要考虑新奇效应样本量算出3800并不意味着实验跑一天就够了。A/B测试的运行时长由两个约束条件同时决定一是样本量约束二是时间效应约束。样本量约束比较好理解每天可进入实验的用户数有限假设日活跃用户是10万实验组和对照组各分50%那么每天大约有5万用户体验新版、5万用户体验旧版。如果需要3800人一组理论上第一天就够了。但事情没这么简单因为用户行为存在“新奇效应”。新奇效应是指新版本刚上线时用户因为新鲜感而点击率虚高几周后效果回落到真实水平。如果你只跑两天就下结论很可能把一个短期效应当成长期效果上线后立刻被打脸。所以在面试里我建议的回答是先算理论需要几天再结合业务周期设置最短运行时长一般不少于7天覆盖一个完整的自然周如果有周期性特征比如电商要覆盖周末和工作日对比最好跑14天甚至更长。另外运行期间要尽量避免其他策略并行造成混淆。如果刚好赶上大促、节假日、内容热点流量和用户行为都会异常实验结果容易失真。遇到这种情况可以考虑顺延实验期或者在分析时用分层对比做一定程度的修正。3.3 埋点与分组保证随机化的几种做法分组随机化是A/B测试的灵魂。如果分组有偏后面所有统计检验都不成立。面试常问的问题是你会怎么把用户随机分到实验组和对照组最稳妥的方法是哈希分桶把user_id经过MD5或SHA256后取模把用户映射到0到99的分桶里再指定某几个分桶为实验组。这样做的好处是同一个用户永远进入同一个桶实验可复现也方便后续做多实验的冲突隔离。A/B测试需要保证的另一个关键点是分组的稳定性。有些候选人会说用device_id分组但用户可能换设备、清cookie、重装App这种情况下分组会漂移。所以核心逻辑是“以业务可稳定追溯的用户身份作为分组键”。在金融风控这类场景里用户身份、设备、IP可能是不同维度你甚至需要先定义“哪个身份适合作为实验单元”这个比直接套公式更见功力。面试官还可能追问如果用户本身做过实验导致他的行为被污染了怎么办这时候可以考虑在分析时剔除曾参加过同类型实验的用户或者直接用分层随机化让每组的新老用户比例保持一致。很多时候业务上的异常才是面试官真正想考察的点数据分析不能只会算数还要能感知数据的“脏”和“偏”。4. 结果分析阶段显著性检验与置信区间实战4.1 t检验与z检验的选择A/B测试中比较两组均值或转化率时最常用的是t检验和z检验。面试里喜欢问“什么时候用t检验什么时候用z检验”但这种问法往往是一个陷阱因为实际业务里两者在大样本下结果几乎一样。从理论出发z检验适用于总体方差已知且样本量足够大的场景t检验适用于总体方差未知、需要用样本方差估计总体的场景。实际业务中我们几乎永远不知道总体方差所以更稳妥的说法是用t检验而不是z检验。许多统计软件默认输出的也是t检验结果比如SciPy里的ttest_ind。具体到代码非常简洁from scipy import stats # 实验组和对照组的人均价值或人均时长 group_a [float(x) for x in range(1, 101)] group_b [float(x * 1.2) for x in range(1, 101)] t_stat, p_value stats.ttest_ind(group_a, group_b) print(ft统计量: {t_stat:.4f}, P值: {p_value:.4f})这段代码里我特意用了两组长度只有100的数据因为小样本下t检验更容易看出效果。如果样本量很大t分布会趋近正态分布t检验和z检验的差异会很小。所以在面试中完整回答应该是先讲理论适用条件再点出实际分析中的简化处理最后说明工具选择对结论影响不大但是假设条件的检验不能省。需要注意使用t检验前最好看一下两组方差是否接近。如果方差异常大可以使用Welch t检验只需要把参数equal_var设为False。面试时主动提到不等方差问题说明你处理过真实数据而不是只会下载现成模板。4.2 卡方检验用于比率类指标A/B测试中的转化率对比还有一种常见写法是卡方检验。它本质上是比较实际频数和期望频数之间的偏离程度。两组用户分别点击和未点击的数据可以整理成一张2×2列联表然后计算卡方统计量。举个例子实验组有9800人没点击、200人点击对照组有9600人没点击、400人点击。用Python做卡方检验from scipy.stats import chi2_contingency table [[9800, 200], [9600, 400]] chi2, p_value, dof, expected chi2_contingency(table) print(f卡方统计量: {chi2:.4f}, P值: {p_value:.6f})这个P值会远小于0.05说明两组点击率差异非常显著。从直觉上也很容易理解实验组点击率200/10000约2%对照组400/10000约4%差异确实很大。面试时讲卡方检验重点不是说“我会调用这个函数”而是解释卡方检验背后的逻辑计算每个单元格的期望频数比如总点击次数已定如果两组真实点击率相同两个组的点击量应该按照各自的样本量按比例分配然后把实际频数和期望频数的差异累计起来得到卡方统计量。这个统计量服从卡方分布自由度在2×2表里是1再根据卡方分布算出P值。这个解释能直接击中南向面试官的心因为它说明你理解检验的构造逻辑而不是单纯记API。更进阶的回答是补充一句当样本量很大时双比例z检验和卡方检验在数学上是等价的。4.3 置信区间怎么解读如何避免常见误读显著性检验只告诉你“有没有差异”置信区间还告诉你“差异大概有多大”。这个信息在实际业务里非常关键因为一个P值小于0.05的结果如果提升幅度只有0.01个百分点业务上大概率不值得投入。置信区间的准确定义是如果我们重复做很多次实验每次构造一个95%置信区间那么大约95%的区间都能覆盖真实的总体参数。这句话说起来拗口很多人容易误解成“真实参数有95%的概率落在区间内”但从频率学派的角度来看参数是固定值不是随机变量是区间在随机变动。在面试里直接用这句话来防杠特别有效。然后补一句业务解读置信区间越窄说明我们对效应量的估计越精确区间越宽说明样本噪声越大。如果置信区间下限很低但上限很高这样的实验结果即使显著也说明不确定性很大不建议全量上线。用Python可以这样构造均值差的置信区间import numpy as np from scipy import stats a np.random.normal(100, 15, 500) b np.random.normal(103, 15, 500) mean_diff b.mean() - a.mean() se np.sqrt(a.var(ddof1) / len(a) b.var(ddof1) / len(b)) ci_low mean_diff - 1.96 * se ci_high mean_diff 1.96 * se print(f均值差: {mean_diff:.2f}, 95%置信区间: [{ci_low:.2f}, {ci_high:.2f}])这里的1.96就是标准正态分布在95%置信水平下的临界值。面试现场如果能手写这段代码基本可以用“实战型数据分析师”来定义你了。4.4 多重比较与peeking问题实验分析里最隐形的坑是“偷看数据”统计上叫peeking。产品经理每天打开实时看板第三天看到P值小于0.05就开始庆祝然后把这个结论当最终结论。问题在于你反复在不同时间点看P值其实是在做多次检验每一次都有5%的假阳性风险多次累积下来整体犯错的概率会远高于5%。我在实际业务里碰到过很多次这种场景。最典型的是“实验刚跑两天PM发消息说效果显著”。这时候我通常会先按住节奏查一下当前样本量和预定的最小样本量差多少如果还差得很远那这个“显著”基本不靠谱。因为在样本量不足时得到的显著结果往往是被高估的效应量也就是所谓的“假阳性膨胀”。面试中遇到这个问题可以分三步回答第一和业务方约定好决策周期在达到最小样本量之前不看P值第二如果确实需要滚动监测使用序贯检验或者alpha spending策略而不是普通P值第三多指标同时看时做多重比较校正比如Bonferroni校正或者用FDR(错误发现率)来控制整体风险。这部分能讲清楚说明你已经不是会跑实验而是会管理实验这两者的差距在面试里非常大。5. 面试中的统计学细节题中心极限定理、分布与检验方法5.1 中心极限定理为什么是A/B测试的基石中心极限定理是大样本推断的基石也是A/B测试里很多近似方法能成立的原因。它说的是无论原始总体是什么分布只要样本量足够大样本均值的抽样分布都会近似正态。转化率这类数据本质上来自伯努利分布取值只有0和1分布形态长得非常不“正态”。但如果我们一次取几百上千个用户的转化结果来计算平均值这个平均值的分布会非常接近正态分布。这就意味着即使数据本身不是正态的我们也可以放心地用z检验、t检验以及基于正态分布的置信区间公式来做推断。招聘面试时经常问“样本量多少才算足够大”。教科书上的经验值是n≥30但实际数据要复杂得多。如果说是高度偏态的数据比如用户活跃天数呈长尾分布、绝大多数人活跃很少而少数人天天刷那么30个样本根本不够100个都未必够。所以回答时我会带一句要看分布的偏态程度至少要让抽样分布看起来够“滑”必要时可以画直方图或做正态性检验。5.2 正态分布、二项分布、泊松分布怎么选面试官可能会用一些看似基础的问题来考你对分布的敏感度。比如用户点击率、用户页面访问次数、用户单日下单金额分别适合用什么分布点击率是典型的二项分布因为你把每次曝光看作一次独立试验结果为点击或不点击成功概率就是点击率。当曝光次数足够大时二项分布可以用正态分布近似这也是A/B测试里用比例检验不必纠结于“数据不服从正态”的原因。访问次数、客服消息数、用户主动行为次数这类计数数据更常用泊松分布。泊松分布描述的是在一个固定时间或空间窗口内稀有事件发生次数的分布。比如一小时内客服消息量理论上没有上限但均值不高形状右偏尾部很长。用户单日下单金额是连续型右偏数据你最好不要拿它硬套正态分布。这类数据在实验里如果作为核心指标通常是取对数后再比较或者用基于秩的非参数检验。面试的时候把“分布决定检验方法”这条线索串起来会显得你有建模感而不是只懂复制代码。5.3 参数检验与非参数检验的使用边界经典面试题“如果数据严重偏态而且有大量异常值你还能用t检验比较两组均值吗”这是一个很阴险的问题。因为从理论上说如果样本量很大中心极限定理能帮我们兜底t检验仍然近似有效。但异常值对均值的影响很大可能让均值这个统计量本身失去业务意义这时候就算检验显著结论也不可靠。更稳妥的做法是先看业务逻辑。如果异常值是由错误埋点或不计成本的特殊用户造成的应该做数据清洗如果异常值本身就是业务的一部分比如大额订单那么直接删掉会反而会损失真实信息。可以考虑用中位数做比较结合Mann-Whitney U检验这种非参数方法。非参数检验不依赖正态性和方差齐性假设用的是秩次而不是原始值对异常值稳健得多。缺点也很明显它把数值大小转换为顺序会丢失一些信息检验功效通常比参数检验低一些。面试中把这两点讲出来就说明你真正理解了它们各自的优劣。5.4 常见统计学概念快查表面试前把下面的概念快速过一遍很有用。我整理成一张速查表方便你在最后冲刺阶段回顾。概念一句话理解面试常见误区原假设H0默认没有差异需要证据推翻把H0当成“需要被证明为真”备择假设H1我们真正想发现的结果和H0混淆显著性水平alpha允许犯第一类错误的概率误以为是“结论正确的概率”P值H0为真时出现当前数据的概率误以为是“H0为假的概率”第二类错误beta真实差异被漏掉的概率忽略它导致“不显著无差异”的错误结论统计功效1-beta能正确检出真实差异的概率样本量不足时功效其实很低置信区间重复实验中约95%覆盖真值误以为是“真值落在区间的概率”MDE期望能检出的最小差异没有定义就盲目算样本量中心极限定理大样本下抽样均值近似正态误以为“原始数据本身必须是正态”面试前如果时间紧张只背这张表就把大部分统计概念题的基本盘稳住了。6. 模拟面试复盘高频问题与经典回答思路6.1 “设计一个A/B测试”怎么答这类题目是综合题面试官给一个业务场景让你从0到1设计一个A/B测试。拿到题先不要着急算把逻辑顺顺清楚比较重要。我会用一套固定模板来控制回答节奏第一步明确实验目标。用一句话说清楚要验证什么比如“新版首页是否提升次日留存”。第二步定义指标。主指标取次日留存率辅助指标取人均浏览时长、崩溃率、关键路径转化率。第三步确定实验单元。这里用user_id做随机分桶按哈希取模保证稳定。第四步计算样本量。基线次日留存率按历史数据来比如40%MDE设为2个百分点。用比例检验样本量公式估算每组人数。第五步确定运行时长。按DAU和可分配流量算理论天数再叠加7天周期约束最后取较大值。第六步实验前做一次AA测试确认分组无差异。第七步实验结束后先看主指标显著性再看辅助指标是否异常最后按分群维度做探索分析。这套回答的节奏感很重要能覆盖大部分面试官考察点。如果面试官中间插话追问某个细节就顺着他的问题展开。6.2 “如果结果不显著怎么办”怎么答面试官特别喜欢问“结果不显著这个新功能还要不要上”。这个问题没有标准答案但回答思路能看出你的统计功底。多数人直接说“不显著就是没效果”这个回答在统计上是不成立的因为不显著只表示“没有足够证据拒绝无差异假设”并不是“证明无差异”。正确的处理路径是先检查数据质量比如埋点是否完整、实验组是否有异常流量、是否存在用户泄漏然后看置信区间如果区间上限可能包含一个有业务价值的效应量说明样本量不足不能下结论再做分层分析看不同新老用户、不同端口、不同地区是否存在显著差异。不过要提醒一句分层分析会引入多重比较风险所以要合理控制后继续看主指标。最后落地到决策上如果主指标不显著但辅助指标显著恶化或改善也要谨慎考虑。比如转化率没变、但崩溃率大增这种实验是不能上线的。用这种结构回答问题面试官会觉得你做过真实业务而不是只会套统计学概念。6.3 “如何判断实验是否有效”怎么答很多候选人把“有效”等同于“P值显著”这个认知过于简化。我自己的判断框架是三层统计显著、业务显著、可解释。统计显著就是P值是否小于设定的alpha或者置信区间是否包含零。业务显著是看效应量是否达到业务方预先设定的MDE比如转化率提升了0.02个百分点P值确实显著但商业价值微乎其微。可解释是看这个差异是否符合业务逻辑有没有一种合理的因果解释如果没有解释只是凑出来的噪声那再显著也要打问号。举个例子某一次我们跑实验实验组点击率显著上升但客单价显著下降。如果只看点击率就上线会直接打脸。综合三层判断的话它就不是一个成功的实验因为用户的注意力被吸引到低客单商品上了。面试时把这个例子讲出来面试官至少能记住你可不只是个“P值战士”。6.4 现场手撕统计题的经验有些公司会在面试里直接给你一个小数据集让你现场判断两组差异是否显著。这种题通常可以用Python在电脑上跑也可以在白板上手写公式。如果是白板手写把基本公式记熟就好两组均值差的Z统计量 均值差 / 标准误。标准误等于两组标准差的平方除以各自样本量再加总后开根号。比例检验类似只是标准误用p*(1-p)来表示。如果是对着电脑做我最常用的工具是Python的scipy.stats和statsmodels。用一行ttest_ind就能出结果但不要只输出P值就结束建议把均值差、置信区间、样本量都列出来这样才能看出结论的稳定性。如果不熟悉Python用Excel里的T.TEST函数、F.TEST函数也能完成大部分判断很多传统行业的数据分析师用Excel做A/B测试分析也完全够用。现场手撕题还有一个隐藏考点你的数据清理能力。直接给你的数据往往有空值、重复值、异常值先快速清洗再跑检验这个过程能体现你的真实工作状态比统计公式本身更被面试官看重。我自己的体会是A/B测试和统计学的面试题越到后面越考验“能不能把统计语言翻译成业务决策”。面试官列一堆问题表面在问公式和概念实际都在问一件事拿到实验数据你敢不敢拍板上线我刚带团队的时候也曾经被一个不显著的结果困住后来发现是样本量不足和偷看数据导致的假象。所以如果你正在准备面试我建议别只刷题选一个自己经手过的真实项目把从指标定义、实验设计、数据分析到上线决策的完整链路盘一遍这个动作比刷一百道面试题都值。