AI需要一张脸,数据科学需要一条曲线
半个世纪前美国数学家赫尔曼·切尔诺夫把复杂的多维数据画成了一张人脸即将多维变量映射为面部特征比如用眼睛大小代表血压嘴角弧度代表胆固醇这样便实现了高维数据的可视化人们可以更直观地理解数据所代表的意义。面对如今百万维度的数据如何在极其复杂的空间中捕捉真实信号并为性能日益强大却陷入“黑箱”的AI提供科学解释有学者认为答案又重新指向切尔诺夫脸所蕴含的几何思想——几何不仅意味着数据的可视化也同样可能是需要被估计的信号本身。而实现这一跨越的方法正是“流形拟合”。本文收录于前沿追踪万象纷纭而理有其形。得其形者乃得其真。几何非观象之器实为万象之信。流形拟合于众数之中求其形于噪声之外见其真。2026年7月美国数学家、统计学家赫尔曼·切尔诺夫Herman Chernoff1923—2026[注释1]去世享年103岁。在Harvard Data Science Review随后发表的一篇专栏中[1]创刊主编孟晓犁教授从参加切尔诺夫的葬礼写起回顾了切尔诺夫半个多世纪前提出的数据可视化方法——切尔诺夫脸Chernoff faces。文章将切尔诺夫脸与同期出版的暑期特刊Shaping Data Science:A Geometric Perspective联系起来并针对我为此撰写的导论文章[12]提出了一个颇有挑战意味的观点人工智能应该更多地使用切尔诺夫脸而数据科学应该更多地进行流形拟合manifold fitting。[注释1]赫尔曼·切尔诺夫美国知名数学家和统计学家曾任教于斯坦福大学、麻省理工学院和哈佛大学等高校在序贯分析、实验设计和大样本理论等领域作出了重要贡献——“切尔诺夫界”和“切尔诺夫脸”均以其姓氏来命名。这两项观点乍看之下似乎属于两个完全不同的时代。切尔诺夫脸是20世纪70年代的统计图形流形拟合则是今天仍在发展的高维统计方法。但实际上它们指向同一个问题当数据越来越复杂时我们究竟怎样才能看见其中真正的信号这里所说的“看见”包含三个相互连接的步骤把数据变为图几何结构的过程中其中的几何结构本身可能就是信号流形拟合负责从带有噪声的高维观测中估测这种信号人工智能则应在估计出的几何信号的基础之上进行可以解释的合理预测与推理。众所周知几何学早已有关于描述形状、曲率和局部结构的成熟语言统计学和机器学习也已谈论“流形”manifold二十多年但长期以来人们更多关心的是如何借助流形的假设进行降维和寻找低维表示而较少把那个潜在的几何结构本身作为需要从数据中估计的信号。换言之“数据具有几何结构”与“几何结构本身就是信号”之间还有重要的一步。流形拟合正是走出关键性的这一步更进一步的是让AI在估计出的几何信号之上进行科学预测、推理和解释。至于为什么这与通常所说的流形学习有所不同后面会具体谈到。纵观过去的历史长河把几何结构本身作为值得寻找的对象并不是一个陌生的观念。过去半个世纪丘成桐等几何学家的重要工作不断表明几何可以超越传统的学科边界从微分几何和偏微分方程到广义相对论和数学物理对隐藏几何结构的寻找一次又一次连接起原本看似不同的问题。一个典型例子就是卡拉比–丘流形它源于纯粹的几何问题后来却成为弦理论紧致化中的核心几何结构并进一步进入超对称黑洞、黑洞吸引子以及黑洞微观结构等基础物理问题的研究当中。于我而言这种跨越数学与物理的传统也构成了“几何即信号”这一想法的重要思想背景。如果几何能够揭示数学和物理世界中隐藏的规律那么面对复杂数据我们是否也可以把几何本身看成需要寻找、估计和理解的信号这种视角也使我越来越相信真正值得追问的问题往往先于学科边界而存在——统计学、几何和人工智能之间的界线不应成为提出问题的限制。一张脸如何承载高维数据切尔诺夫脸究竟是什么呢其实很容易理解。假设有两组医学数据每一组都包含十几个变量包括年龄、血压、胆固醇、血糖、心率以及一些不那么熟悉的生物标志物。它们整齐地排列在表格中每一行代表一个人而每一列代表一个指标。如果是非专业人士大概很难直接从表中迅速判断哪些人是相似的谁又是与众不同的。但换个角度思考如果把每一行数据变成一张脸又会如何呢譬如我们可以让眼睛的大小代表血压嘴角的弧度代表胆固醇脸的宽度代表血糖眉毛的倾斜程度代表心率……如此这般原本抽象的一串数字就变成了一张可以整体观察的面孔好不生动更有趣的点在于有些脸看起来相似有些脸则立即显得与众不同。1973年正在斯坦福大学任教的切尔诺夫在《美国统计学会会刊》发表了一篇只有八页的论文标题为“用人脸以图形方式表示k维空间中的点”[2]。当时交互式计算机图形尚未普及多变量数据主要还是以表格和静态图形呈现。如何同时比较许多个体和多个变量是统计学一直以来面对的一个现实难题。切尔诺夫提出可以把每一个高维观测变成一张脸眼睛、眉毛、鼻子、嘴巴和脸形分别表示不同变量。许多张脸排列在一起就像把一张数据表变成一群人。这样观察者不必逐列比较数字也可能迅速发现其中的群体、变化和异常的个体。这项设计借助了我们对人脸的敏锐感知。比较两张脸时我们通常不必逐一测量眼睛的长度、鼻子的宽度和嘴角的角度也能很快判断它们是否相似。我们既会注意五官各自的样子也会感受到它们的比例和搭配所形成的整体面貌。切尔诺夫脸正是利用这一点把多个变量转化为同一张脸上的不同特征让我们通过观察面孔直观地察觉一组数据与另一组数据之间的相似和差异。切尔诺夫脸的价值不只在于“脸”切尔诺夫脸当然不是一种完美的数据可视化方法。把哪个变量分配给嘴巴哪个变量分配给鼻子本身具有一定的任意性且人对不同面部特征的敏感程度也不相同。我们日常往往更容易注意到眼睛和嘴角的变化反而容易忽略鼻子宽度或耳朵大小的细微差别。面部表情还可能带来不必要的情绪判断尽管这些情绪含义与原始数据毫无关系。因此切尔诺夫脸未必比普通统计图形更准确也不适合所有分析任务。但它包含了一个相当有趣的思想高维数据可以被理解为一个整体形态。它同时提醒我们数据的表达方式会影响我们对数据的理解。数字的排列、变量之间的相对关系以及多个特征共同形成的形态都可能改变我们看到的模式。因此在这个意义上“AI应该使用更多切尔诺夫脸”并不是代表今天所有的AI系统都应该重新采用一种20世纪70年代的统计图形。它反映的是一种更广泛的原则AI不仅应当能够处理高维信息也应当考虑怎样把复杂信息重新组织成人可以感知、比较和质疑的形式。机器不仅需要给出答案还需要让人有机会看见答案所依据的结构。苍蝇为什么围成了一个甜甜圈现在假设有一张照片桌上放着一个甜甜圈许多苍蝇聚集在它的周围一个昆虫识别算法找出了照片中每只苍蝇的位置。删除原始照片后我们看到的只剩下一组二维坐标点其特殊性在于这些点并不是随机分布的而是围成了一个圆环。图1基于文献[1]中的示例由AI生成如果只看坐标我们可能会认为这些数据具有一个近似圆环的低维几何结构。我们可以测量圆环的半径估计它的中心或者用一条封闭曲线概括苍蝇的位置。但如果重新看一眼原始照片我们立即就会明白苍蝇之所以围成一个圆环是因为桌上放着一个甜甜圈。从另一个角度看甜甜圈的形状并不只是帮助我们展示苍蝇集中在哪里它还传达了一个与问题本身有关的信息为什么苍蝇会以这种方式聚集。当然这个例子中仅凭一个圆环形状并不能严格证明什么因果关系几何结构不会自动取代科学实验和因果推断。但它可以提示我们数据中可能存在一个尚未被直接观察的组织机制并引导我们在合适的时机提出下一步问题。我们能够直接看见甜甜圈是因为这就是一张二维照片来自现实的三维世界。对于高维数据我们却没有这样的感官能力。如果苍蝇的位置不是由两个坐标而是由数千个变量描述如果那个“甜甜圈”不是一个平面圆环而是隐藏在高维空间中的弯曲结构我们自然无法看清整幅图像。这个时候我们就需要数学和统计学帮助我们恢复那只看不见的“甜甜圈”这正是“几何是信号”的含义——几何不仅仅告诉我们数据点在哪里集中还包括了流形的形状、弯曲、边界、分支以及不同部分之间的连接关系都可能与产生数据的机制有关。从直线、曲线到流形流形一词来自19世纪的几何学。1854年黎曼在著名的就职演讲中提出可以不依赖人们熟悉的三维空间研究具有任意维数和内在几何的空间。此后流形逐渐成为现代几何学的基本对象。一条弯曲的线可以看作一维流形。一张卷起来的纸存在于三维空间中但纸张本身仍然是二维的。与之类似一组看起来极其复杂的高维数据也可能主要沿着少数几个方向变化。传统统计学经常用一条直线概括变量之间的关系例如主成分分析principal component analysisPCA试图寻找一条直线或一个低维平面解释高维数据中最主要的变化方向。显然现实数据未必沿着直线变化。1989年Trevor Hastie和Werner Stuetzle提出主曲线principal curve让一条光滑曲线穿过高维数据云的中心把主成分分析中的直线推广为由数据决定的非线性曲线[3]。这项工作说明统计学中的“拟合”不必局限于直线和预先设定的函数形式数据自身也可以提示一条弯曲的中心结构。到21世纪初Isomap[4]、局部线性嵌入locally linear embeddingLLE[5]等流形学习manifold learning方法相继出现引发了关注并且推动了一个影响深远的观念高维数据可能依附在一个低维流形附近分析这类数据的关键之一是寻找适当的低维表示。例如一张图片可能包含上百万个像素一个像素对应一个维度因此这张图可以被看作百万维空间中的一个点同一个物体在不同图片中的变化可能主要来自旋转、平移、光照和观察角度等少数因素。因此虽然像素空间维数极高这些图片依附的内在结构却可能低得多。流形学习的主要目标是寻找描述这种结构的低维坐标或表示流形拟合则进一步要求在原来的高维空间中恢复流形本身。一种低维表示可以把两个群体分开也可以生成一张漂亮的二维图却不一定告诉我们原始流形位于哪里、怎样弯曲、局部切空间朝向何方、是否存在边界以及估计结果距离真实结构究竟有多远。于是沿着主曲线开启的另一条道路统计学家开始追问如果数据本身位于一个已知的弯曲空间中能否在这个空间内部寻找概括主要变化的曲线2014年我在瑞士洛桑联邦理工学院工作期间与合作者提出了principal flow主曲线流[6]。它可以被理解为一条位于黎曼流形上的主曲线从一个代表数据中心的位置出发沿着局部变化最大的方向在流形上延伸。回到新加坡后这项工作又发展为principal sub-manifolds主子流形[7]。我与合作者把一维的principal flow推广为更高维的子流形不再只用一条曲线概括数据而是在流形内部寻找一个能够捕捉主要变化方向的低维几何对象。从principal curve到principal flow再到principal sub-manifolds几何对象从欧氏空间中的曲线发展为流形上的曲线和更高维子流形。不过这些方法有一个共同前提承载数据的流形及其几何是已知的。换言之我们已经拥有一张几何地图要做的是在地图上找出最能概括数据变化的曲线或子流形。由此我们也可以看到后来流形拟合所面对的核心挑战如果这张地图本身不可见潜在流形又未知观测还受到噪声污染此时我们能否从数据中把整个流形估计出来流形拟合估计数据中的几何信号假如一条弯曲的丝带悬浮在房间里许多细小的雪花落在丝带附近。我们只能看到雪花却看不到丝带本身。从统计学的角度看丝带的形状就是需要估计的信号散落在周围的雪花则同时包含信号与噪声。降维的目标通常是找到一种方式把这些雪花排列在一张平面图上使相近的点尽量保持相近。流形拟合的任务是从这些带有噪声的观测中恢复潜在的几何结构。那条看不见的丝带究竟在哪里它向哪个方向延伸在哪里发生弯曲它是否存在边界每片雪花偏离丝带的程度究竟有多大这与回归分析有某种相似之处。回归分析是从散乱的数据点中拟合一条直线或曲线流形拟合则试图在高维空间中拟合一条曲线、一个曲面或者维数更高、形状更复杂的几何对象从而得到流形在高维空间中的位置、局部切空间、弯曲程度、边界以及不同部分之间的连接关系。这些几何量都可能成为后续科学分析、预测和推理所使用的信号。到2010年代研究开始更系统地从“寻找低维表示”走向“重建潜在流形”。2018年数学家查尔斯·费夫曼Charles Fefferman[注释2]及其合作者研究了这样一个问题[8]如果高维数据来自一个低维光滑流形同时受到少量高斯噪声污染我们能否构造出一个在几何意义上接近真实结构的新流形[注释2]查尔斯·费夫曼美国数学家,普林斯顿大学教授,因数学分析的工作于1978年获得菲尔兹奖。这一变化十分关键因为研究目标不再只是把数据投影到一张二维图上而是要在原来的高维空间中恢复产生数据的几何对象并且从数学上说明恢复结果与真实流形之间究竟相差多远。但在真实数据中噪声往往不能被假设为严格限制在某个固定范围内。以常见的高斯噪声为例绝大多数观测虽然集中在一定范围之内但从概率模型上说噪声仍然可能取到任意大的值这就是所谓的无界噪声unbounded noise。需要注意的是这里所说的“无界”并不意味着每一个观测都带有极大的误差而是说不能事先为所有噪声规定一个绝不会超出的上限。2019年我与合作者在arXiv公布了论文Manifold Fitting under Unbounded Noise系统研究无界噪声条件下的流形拟合问题该论文经过进一步发展于2025年正式发表于《机器学习研究杂志》Journal of Machine Learning Research[9]。无界噪声是一个需要攻坚的难题许多已有方法直接在带有噪声的样本点上估计局部切空间。但是当样本点已经偏离真实流形时在这些点上得到的局部方向可能变得模糊由此拼接出来的流形也会积累误差。这项工作的一个关键思想是在原始噪声样本点上估计切空间的同时设法在样本投影到潜在流形的位置附近估计局部切空间再利用这些局部几何信息构造流形估计量。这项工作在无界噪声条件下给出了高概率的理论收敛保证并用豪斯多夫距离Hausdorff distance控制估计流形与真实流形之间的误差同时研究了估计流形的光滑性。它使流形拟合从一个主要依赖理想化噪声条件的几何重建问题进一步成为一个能够处理常见随机噪声模型的统计估计问题流形是需要恢复的几何信号噪声具有概率分布估计结果不仅要形成一个流形还必须带有可以量化的误差保证。在这一基础上我们与丘成桐合作的论文Manifold Fitting[10]提出了一种两步映射方法在原始高维空间中直接构造平滑的流形估计量。这项工作的目标不仅是得到一个低维表示还要保证最终得到的对象本身确实是一个光滑流形并从理论上控制估计流形与真实流形之间的几何误差。这一要求体现了几何与统计学在流形拟合中的不同关切几何学关心恢复出来的对象是否真正具有流形结构是否保持了维数、光滑性和局部方向统计学则关心在有限样本和随机噪声下这种结构能否被可靠估计估计误差如何随着样本量和噪声强度变化。而流形拟合正好位于两者的交界处——它既不能满足于一张看起来合理的低维图也不能只给出一个抽象存在的几何对象。它需要从真实数据出发构造一个可以计算的流形估计量同时为这个估计量提供统计和几何保证。随后我们又与丘成桐合作把神经网络引入流形拟合利用循环生成对抗网络CycleGAN学习高维数据与低维表示之间的映射再回到原始高维空间中重建潜在流形论文发表于《美国国家科学院院刊》[11]。这项工作说明人工智能与流形拟合并不是相互替代的神经网络可以成为估计几何信号的计算工具。经过流形拟合得到的几何结构又可以进而成为AI进一步进行分类、预测和推理的基础。这里的关键在于算法最终恢复了什么而不是是否使用神经网络。如果模型只产生一组难以解释的潜在坐标我们仍然不知道它学到了怎样的形状如果它能够恢复一个可以描述、检验并量化误差的流形那么AI所学习的表示才有可能转化为明确的几何信号。由此流形拟合的发展形成了一条逐渐清晰的路线从寻找低维坐标到重建潜在流形从较理想的噪声假设到处理无界随机噪声再到利用两步映射和现代神经网络构造兼具几何结构、统计保证与计算可行性的流形估计量。几何可能就是科学发现的对象看到这里或许有人会有疑问为什么我们要如此费力去估计数据背后的形状因为在许多科学问题中几何本身就是我们希望寻找的科学信号。以单细胞数据为例。一个细胞可以通过上万个基因的表达水平来描述因此每个细胞都可以作为高维空间中的一个点。但细胞不会在这个空间中任意变化它们受到细胞类型、发育阶段、疾病状态和生物调控机制的限制可能集中在某些低维结构附近。如果细胞正经历连续的分化过程那么它们可能就沿着某些轨迹变化这些轨迹还可能出现分支意味着细胞走向不同的命运如果疾病改变了细胞状态数据的局部形状、曲率或相对位置也可能发生变化。在这里轨迹、分支和局部弯曲并不只是可视化效果它们可能分别对应细胞状态的连续变化、不同的发育命运或者疾病带来的异常变化。在我与合作者发表于《美国国家科学院院刊》的单细胞研究中[13]我们提出了单细胞流形拟合分析框架scAMF并在来自不同测序平台、物种和器官的25个公开单细胞RNA测序数据集上进行了比较。研究表明流形拟合可以改善高维基因表达数据的空间分布增强同类细胞之间的邻域一致性从而提高细胞聚类效果和数据可视化的清晰度。这类研究关心的不只是“把细胞分成几类”还包括细胞状态怎样连续变化不同群体怎样连接罕见细胞出现在哪里以及哪些细胞偏离了正常的几何结构。类似的问题也出现在医学数据中。比如一个病人未必因为某项指标极端异常而表现出风险真正重要的可能是多个指标之间的组合关系发生了改变。单独看每个数值似乎都处在正常范围但是如果放在一起就会发现这个人却可能偏离正常人群形成的整体结构。在另一项研究中我与合作者把流形拟合用于英国生物样本库212,853名参与者的251项核磁共振代谢生物标志物[14]。研究首先把这些指标划分为七个代谢类别再分别拟合相应的低维流形其中三个流形能够把人群区分为具有不同代谢特征和疾病风险的亚群相关疾病涉及代谢紊乱、心血管疾病和自身免疫性疾病。综上所述这两项研究足以说明高维生物医学数据中的科学信息存在于多个变量共同形成的几何结构中。这里的几何就是信号本身。流形拟合也不仅是一种画图方法而是对这种信号进行估计。先估计信号再让AI进行预测和推理进一步地如果几何结构是信号流形拟合负责估计这种信号那么人工智能应当在其中扮演什么角色目前许多AI系统采用端到端的方式工作。模型直接接受高维原始数据通过大量参数完成分类或预测。例如输入一张图片模型输出图片中的物体类别输入一组医学指标模型输出某种疾病风险。只要预测准确这种方法就可能非常有效。但对于科学研究和医学决策来说只有一个预测结果往往还不够。作为严谨的科研人员我们希望知道这个结果建立在什么结构之上哪些变化被模型认为是正常的哪些变化构成异常模型的判断能否对应到一个可以被科学家、医生或使用者正确且高效理解的对象对于以科学发现而不只是预测准确率为目标的AI一条更理想的路径是首先从高维观测中估计几何信号然后让AI在这些已经被估计和描述的信号之上进行预测与推理。这意味着AI除了接收原始像素、基因表达或生物标志物的信息原则上它还可以使用流形拟合得到的结构信息从而帮助预测甚至解释预测。理想情况下一个医学AI系统不仅可以告诉我们某位病人的风险较高还可以进一步说明这位病人是否偏离了正常人群形成的流形偏离主要发生在哪些生物指标共同决定的方向上以及这种偏离接近哪一种疾病状态。类似地在单细胞研究中AI不仅可以判断一个细胞属于哪一类还可能根据估计出的细胞状态流形判断这个细胞位于哪一条变化轨迹上、正在朝哪个方向发展以及它是否代表一种罕见或过渡状态。这时AI的推理就不必完全隐藏在一个难以观察的潜在空间中而可以建立在能够描述和检验的几何对象之上由此形成一条相对完整与清晰的分析链条高维观测→流形拟合→几何信号→AI预测与推理→人可以理解的解释。切尔诺夫脸所代表的思想可以再次出现在这条链条的最后部分机器不仅要利用几何结构作出判断还要把判断所依据的结构转化成人可以整体感知、比较和质疑的形式。可解释性必须建立在可靠的估计之上当然并不是所有高维数据都位于一个光滑、低维的流形附近。真实数据可能具有分支、交叉、尖点和边界几个不同流形可能彼此相交数据的内在维数也可能随着位置而改变。更复杂的情况下一个数据集可能由多个性质不同的几何结构共同组成。当噪声太大、样本太少或采样极不均匀时我们也未必能够可靠地恢复潜在流形。因此“数据具有流形结构”不应成为一种不加检验的信念。真正的统计问题是要客观去判断什么样的几何模型适合这些数据这种结构是否可以识别需要多少样本才能恢复噪声会造成多大影响当真实结构包含分支、交叉或不同维数的部分时现有理论又应当怎样扩展尤其重要的是如果流形拟合没有可靠地估计出几何信号那么建立在它之上的AI解释也可能是不可靠的。可解释性不能只来自一个听起来直观的几何故事。它必须建立在可以检验的信号估计之上。流形估计本身的不确定性也应当传递到后续预测和推理之中。否则我们只是用一个几何黑箱替换了原来的神经网络黑箱。因此几何直觉需要统计推断的约束AI推理也需要可靠的几何估计作为基础。让机器发现的形状重新变得可见如今AI发展迅速已经可以处理人类无法逐一阅读的数字、识别图片、分析基因等甚至也可以生成并不存在的脸。然而计算能力的增长并没有自动解决理解的问题。机器可以找到一种有效表示却未必告诉我们它发现了什么形状。也就是说它可以给出一个准确答案却未必让人看见答案赖以成立的结构这里有一个明显的缺失。因此让AI多拥有一些“切尔诺夫脸”即是要求它思考如何把复杂表示和预测依据转化成人可以整体感知、比较和质疑的形式。让数据科学多进行一些“流形拟合”也不是要求所有数据都服从同一个几何模型而是提醒我们数据背后的形状不是分析结束后的装饰它可能就是需要估计的信号。半个世纪前切尔诺夫把数字变成了一张脸。今天我们拥有了更强大的机器却仍然面对几个最基础的问题数据中真正的信号是什么我们怎样估计它机器又能否在这些估计出的信号之上进行人可以理解的预测和推理答案或许可以始于一张脸延伸为一条曲线几何是信号流形拟合估计信号而真正可解释的AI应当尽可能在这些估计出的信号之上进行预测与推理。原文链接AI需要一张脸数据科学需要一条曲线-虎嗅网我的专辑《人工智能生命体 新启点》CSDN平台https://blog.csdn.net/2501_91883294/article/details/147616608?sharetypeblogdetailshareId147616608sharereferAPPsharesource2501_91883294sharefromlink