动物基因组非CG甲基化:从神经调控到疾病标志物前沿解析
做表观遗传学这行绕不开一个老话题DNA甲基化。过去十年大家盯着CpG位点上的mCG不放测序芯片满天飞好像CG之外的甲基化就不是回事。直到这几年一项项研究把非CG甲基化从冷板凳上拉了出来——尤其是在动物基因组里它不但存在而且在神经系统的地位高得吓人。我最近仔细啃完一篇发在遗传学顶刊IF 29上的深度综述主题正好是动物基因组中的非CG甲基化从神经功能到基因调控前沿越读越觉得这方向值得专门写一篇长文拆一拆。这篇博文适合刚入门的表观遗传学学生、做神经科学研究的人也适合想搞清楚WGBS数据里那些mCH位点到底有什么生物学意义的生信朋友。1. 先搞清楚CG甲基化与非CG甲基化到底差在哪DNA甲基化指的是在DNA甲基转移酶催化下S-腺苷甲硫氨酸SAM作为甲基供体把甲基加到胞嘧啶第5位碳原子上生成5-甲基胞嘧啶5mC。这里的关键是什么上下文如果胞嘧啶后面紧跟鸟嘌呤CpG二核苷酸叫CG甲基化mCG如果是CHG或CHHH代表腺嘌呤A、胞嘧啶C或胸腺嘧啶T就叫非CG甲基化mCH。看起来只是碱基上下文不同但背后的写入机制、功能逻辑和进化分布却完全不同。在植物里mCHG和mCHH是整个甲基化体系的主力由DRM2、CMT3等酶催化与RNA导向的DNA甲基化通路紧密相连负责抵御转座子入侵、维持基因沉默。但在动物里长期以来主流观点是非CG甲基化基本不存在很多经典教科书甚至直接忽略它。为什么会这样早期研究用的甲基化检测手段比如甲基化敏感的限制性内切酶消化法主要针对CG-rich区域加上早期全基因组测序数据深度不够mCH位点信号弱很容易被当成技术噪声滤掉。所以不是不存在是没看见。真正让局面改观的是全基因组亚硫酸盐测序WGBS的普及。我印象很深大约2011年前后的一篇里程碑式工作把人的前脑神经元拿来做了全基因组甲基化测序结果让整个领域大跌眼镜神经元里将近一半的甲基化胞嘧啶居然落在mCH位点上而不是mCG。这个比例听起来很夸张但在那篇工作的数据里就是事实。也就是说在神经元基因组里非CG甲基化不是边角料而是半壁江山。同一时期胚胎干细胞里的mCH也被系统鉴定人们开始意识到动物基因组里的非CG甲基化是有组织特异性的、动态变化的、功能可期的表观修饰。1.1 非CG甲基化的化学本质与分类从化学本质上看mCH和mCG都是5mC区别只在于序列上下文。但在实际分析中这种区分非常重要因为不同上下文的甲基化位点在基因组上的分布完全不同mCG倾向于集中在CpG岛、启动子和基因体mCH则更分散在基因体、基因间区、重复元件区域都能看到。分析时如果不做上下文分类只是笼统统计非CpG甲基化很容易把不同机制控制下的信号混在一起得出似是而非的结论。按照序列上下文非CG甲基化可以细分为mCHG和mCHH两类。mCHG在植物中非常丰富但在哺乳动物中的含量极低mCHH是动物非CG甲基化的主要形式。还有一个容易混淆的点CHH里的H如果是C那就是mCCGH如果是T就是mCTGH如果是A就是mCAG。不同三联体位点的甲基化水平也有差异在数据解读时值得分开看。1.2 为什么早期研究长期视而不见回顾这段科研史我觉得有两点值得后来的研究者警惕。第一技术窗口决定认知边界。早期甲基化检测技术要么依赖限制酶要么聚焦在CpG岛芯片上天然过滤掉了非CG位点即使做了全基因组测序如果深度不够mCH的低信号也会被阈值切掉。第二模型系统的选择偏差。果蝇、线虫这些经典模式动物基因组里CG甲基化本来就很少它们的甲基化体系与哺乳动物差异极大过去用这些模型得出的动物没有非CG甲基化的印象并不适用于哺乳动物。所以如果你现在看到某些综述里写非CG甲基化主要存在于植物和真菌先别急着点头要补一句限定在哺乳动物神经元和胚胎干细胞里它同样是不可忽视的修饰类型。2. 为什么偏偏是大脑非CG甲基化的组织特异性先别急着兴奋。非CG甲基化在动物里并不是普遍均匀分布的。它在一类细胞里尤其突出——有丝分裂后的神经元post-mitotic neurons而在绝大多数其他组织里依然很低。这种偏科本身就是重要线索说明它在神经系统的建立和维持中可能扮演某种独特角色。2.1 神经元里的mCH分布与基因组特征在人的前脑神经元中mCH主要富集在基因体区域尤其在大基因上。有几点特征非常鲜明mCH与基因表达呈负相关基因体上的mCH水平越高该基因的表达水平往往越低。这与mCG在基因体上的经典模式不太一样——mCG在基因体中部与表达呈正相关常见解释是转录延伸过程与甲基化维持存在协同而mCH的负相关提示它更贴近转录抑制功能。mCH位点在进化保守区域显著富集这些区域往往包含神经功能相关基因。换句话说进化压力在帮我们选中这些位点暗示它们不是随机噪声。与启动子mCG的经典模式不同mCH在转录起始位点附近一般不高但在基因内部和基因间区广泛存在尤其在那些缺乏CpG岛的大基因里明显富集。我自己分析过一批人脑前额叶皮层的WGBS数据把基因按长度和表达量分层后发现mCH在长基因、中等表达基因里的信号最强。这让我形成一种直觉mCH可能专门服务于那些需要精细调节但不需要完全关闭的神经基因。2.2 发育动态从胚胎干细胞到神经元胚胎干细胞中能检测到一定水平的mCH尤其在小鼠ESC里mCH大多依赖DNMT3A和DNMT3B催化并在分化后发生剧烈改变。而在人脑中mCH的累积是一个持续过程从胎儿期到成年再到老年神经元mCH水平持续上升直到晚年。这与mCG在特定启动子上的相对稳定形成了鲜明对比。为什么会这样一个关键背景是神经元是有丝分裂后细胞不再复制DNA。DNA复制会稀释甲基化修饰所以分裂旺盛的细胞很难把非CG甲基化累积到很高水平而神经元不走这条路修饰可以被长期保留甚至可以一边累积一边维持稳定。这就像你在一面墙上贴便签如果墙皮每几天就翻新一次便签很难积累但如果墙一直不换便签就会越贴越多。mCH在神经元里就是那面老墙上不断增加的便签。2.3 人和小鼠的巨大差异做小鼠实验的朋友要特别注意非CG甲基化在物种间的差异非常大。在人类前脑神经元中mCH几乎占所有甲基化胞嘧啶的一半但在小鼠神经元里这个比例低得多。为什么会这样综述里提到一个很有说服力的视角小鼠基因组的CpG密度更高分散的mCG可以部分补偿mCH的功能而人类基因组中散在的CpG较少于是自然选择启用了非CG甲基化来承担类似功能——稳定基因体的转录抑制防止转座子意外激活维持神经元这种长寿命细胞的状态稳定。这也提醒我们不要想当然地拿小鼠数据去外推人类非CG甲基化的规律反过来也一样。做跨物种比较时建议各自测定、各自建模再寻找保守特征。如果后续想基于小鼠模型研究人脑mCH的功能至少要先确认目标区域在两种物种中的mCH状态是否可比。3. 写、读、擦非CG甲基化的核心机制拆解任何表观修饰要理解它的功能必须看清三个环节谁把它写上去writer、谁把它读出来reader、谁能把它抹掉eraser。非CG甲基化在这三个环节上都有自己的特殊性。3.1 写入酶DNMT3A是绝对主力催化非CG甲基化写入的主要是DNA甲基转移酶DNMT3ADNMT3B也有一定活性但作用范围更有限。DNMT3A有一个有趣的特征在体外它催化mCH的效率并不算高但在体内神经元中却能做到大规模、持续性的mCH沉积。可能的原因有两个第一神经元不复制DNMT3A的活性不需要被DNA复制冲淡修饰可以逐步累积第二DNMT3A可以被组蛋白修饰H3K36me2/3导航到基因体区域那里的染色质环境有利于非CG位点的持续甲基化。这里有一个我特别想强调的细节DNMT3A的PWWP结构域负责识别H3K36me3一旦这个结构域发生突变DNMT3A在基因体上的定位就会紊乱mCH水平随之下降。这解释了很多临床样本里DNMT3A突变与神经发育异常共存的表型。你的课题如果涉及DNMT3A突变建议把mCH水平作为一个关键的下游读数而不是只看mCG。3.2 读取器MBD家族与MeCP2仅仅写下还不够——决定功能的是谁能识别这个修饰并产生下游效应。MBD蛋白家族MBD1-4和MeCP2是典型的甲基化读取器。过去在体外结合实验里大家普遍认为MBD家族主要识别mCG对mCH结合力弱。但近年的研究表明MeCP2对mCH的亲和力甚至可能高于对mCG的亲和力这个发现直接改写了我们对MeCP2功能的认识——毕竟MeCP2突变是Rett综合征的主因而Rett综合征恰恰是严重的神经发育障碍。这就把非CG甲基化和神经疾病在分子机制上串起来了。从功能角度看MeCP2结合mCH后可以招募转录抑制复合物帮助维持长基因的转录稳态。考虑到神经元中mCH的规模巨大MeCP2的工作负载在神经元里必然远超其他细胞类型所以MeCP2突变在神经系统中造成的影响也格外严重。这个逻辑链条是我读这篇综述时觉得收获最大的地方之一。3.3 擦除路径TET酶与氧化中间产物擦除方面TET酶TET1/2/3可以把5mC逐步氧化为5hmC、5fC、5caC随后通过复制依赖的稀释或碱基切除修复BER实现主动去甲基化。神经元中5hmC水平很高特别是在基因体和活性增强子区域提示活跃的写入-擦除动态平衡在神经元基因调控中普遍存在。非CG位点上的5hmC也被检测到这说明mCH并不是静态刻死的修饰它也处于动态调节之中。这对实验设计有一个直接启发如果只做常规WGBS5mC和5hmC的信号是混在一起的没办法区分写入和氧化修饰的贡献。如果课题核心是动态调控建议补做oxBS-seq或者EM-seq的差异处理版本单独看5hmC在mCH位点上的变化往往能找到比总5mC更清晰的生物学信号。3.4 与组蛋白修饰的协同还有一点不能忽略非CG甲基化与组蛋白修饰的对话。比如H3K36me3富集区域常伴随较高的mCH因为DNMT3A通过PWWP结构域与H3K36me3结合被招募到基因体。反过来mCH位点在染色质开放性ATAC-seq信号较低的区域富集与异染色质或沉默染色质状态吻合。这种组蛋白引导写入、甲基化反馈维持染色质状态的回路是神经基因表达稳定的重要保障。在数据整合分析时我建议把H3K36me3的ChIP-seq、ATAC-seq和WGBS放在同一个样本体系里看不要各做各的、最后硬凑结论。因为非CG甲基化功能高度依赖染色质环境只有分层关联才能看出真正的调控回路。4. 功能落地从基因调控到疾病线索谈机制不谈功能就是空中楼阁。非CG甲基化在动物基因组中到底干了什么综述归纳了几个维度基因表达调控、转座子抑制、基因组稳定性以及神经疾病的病理参与。4.1 基因表达调控像音量旋钮而不是开关mCH在基因体的沉积与表达呈负相关它更像一个音量旋钮——抑制过高的转录水平而不是把基因彻底关闭。这跟启动子CpG岛上的mCG那种开关式效应有本质区别。举个例子一个在神经元中高度表达的基因其基因体上的mCH水平通常较低而那些被沉默的发育基因或转座子附近mCH水平则明显偏高。这个音量旋钮模型可以解释一个现象为什么神经元中那么多长基因表达了但表达量并不极端高。神经系统需要大量长基因参与突触功能、离子通道的精密调控如果它们的表达不加约束可能会造成兴奋性失衡。mCH提供了一种可累积的、长时程的抑制层让基因表达维持在一个够用但不过量的区间。4.2 转座子抑制转座子元件是基因组的寄生虫不抑制就会产生基因组不稳定。在神经元中许多古老的转座子元件如LINE1、SINE等位于异染色质区域mCH在这些区域的富集与它们的沉默相关。特别是那些位于基因内含子中的转座子如果被激活可能通过产生嵌合转录本干扰正常基因表达。所以mCH可以视为神经系统里一道额外的安全锁。一个值得注意的技术细节是转座子区域的多序列比对问题会让mCH定量产生偏差。重复序列在短读长测序中难以唯一比对很多mCH信号其实被丢掉了。如果课题涉及转座子区域的mCH建议在比对时保留多比对比对multi-mapping reads并做专门的重叠群定量或者改用长读长甲基化测序技术否则会严重低估这些区域的甲基化水平。4.3 疾病线索从Rett综合征到神经退行性疾病这点是我阅读综述时最有感触的部分。首先MECP2突变导致的Rett综合征本身就嵌入了这个机制链条——MeCP2结合mCH而mCH水平在神经元中巨量存在所以MeCP2功能异常的影响范围远超过去基于mCG的模型。其次阿尔茨海默病、精神分裂症、双相情感障碍等疾病的甲基化研究中都观察到mCH位点的异常改变尤其是那些与突触功能、离子通道相关的基因。需要强调目前大多还停留在关联层面因果验证仍依赖细胞模型和动物模型。但已经有一个很有希望的方向利用神经元特异性mCH作为细胞来源标志物。因为mCH在神经元中远远高于其他细胞如果在外周血或脑脊液的游离DNA中检测到高水平的非CG甲基化信号就可以推断这些DNA来自神经元这为神经退行性疾病的早筛提供了一种全新的思路。5. 实验怎么做得准方法与数据分析要点非CG甲基化研究对技术与数据的要求比mCG要苛刻得多。这里有几点实操经验都是我踩过的坑换来的。5.1 测序方法选型首选依然是WGBS它给出单碱基分辨率。但要注意文库转化效率、测序深度都直接影响mCH的检出。因为基因组中mCH位点是分散的单个位点的覆盖度如果低于10x很多低甲基化位点根本检不出来。我自己一般要求全基因组平均测序深度至少20-30x而且要在细胞系或纯化后的神经元群体上做别拿组织块直接做——组织里的细胞类型混杂会严重稀释神经元特异性信号。酶法转化测序EM-seq也是一个越来越常用的选择相比亚硫酸盐处理DNA损伤小、片段完整性好、对微量样本更友好而且可以同时检出5mC和5hmC。缺点是成本偏高、对流程优化要求高。如果样本量稀缺比如只有几万个神经元EM-seq是比WGBS更稳妥的方案。5.2 数据分析建模与质控数据分析上有几个关键参数要盯住比对率、重亚硫酸盐转化率用λDNA或未甲基化的PhiX做对照、CpG和非CpG位点的甲基化率分布。转化率低于98%的数据我一般直接废掉。mCH分析要用专门的碱基上下文分类工具比如Bismark的non-CpG模式、CGmapTools按CHG和CHH分开统计别笼统写成non-CpG否则后面想还原细节会非常痛苦。还要注意mCH很低或很高的样本甲基化率分布往往有批次效应。不同批次样本混在一起比较时建议做批次校正再用PCA看聚类趋势。我见过不止一个项目第一批次和第二批次样本之间mCH差异显著最后发现是文库批次批次效应不是生物学差异。这个坑一旦踩进去轻则多花两个月补实验重则整批数据推倒重来。5.3 常见问题排查速查表常见问题可能原因排查与解决建议mCH整体水平异常偏低转化率过高或测序深度不足检查转化对照提高深度至30x以上mCH与mCG趋势矛盾细胞类型混杂做纯细胞群加单细胞验证批次间复现性差文库批次效应、样本量小统一文库流程增加生物学重复至少n4-5信号富集异常比对错误或参考基因组版本不一用同一参考版本检查比对质量与重复率转座子区域mCH估算偏低多比对reads被丢弃保留multi-mapping reads做重叠群定量这里再补充一个经验分析mCH时建议先按染色体、按GC含量、按基因注释特征做分层质控确认信号分布符合预期再进入下游差异分析。别一上来就全基因组跑差异因为非CG甲基化的差异信号通常比mCG弱不做分层质控很容易被无关变量干扰。6. 前沿方向单细胞、疾病标志物与跨物种视野综述的前沿部分同样信息量很大。非CG甲基化未来的几个增长点我判断在以下三个方面。6.1 单细胞层面的非CG甲基化单细胞甲基化测序技术如scBS-seq、scCOOL-seq等近几年有了很大进展已经可以在单神经元水平看到mCH的异质性。这种分辨率能回答群体测序回答不了的问题比如同一脑区里不同神经元亚型的mCH景观差异有多大以及单个神经元中mCH与转录组的关系。我们的初步经验是单细胞甲基化数据的覆盖度很低mCH分析要特别谨慎建议只在覆盖度足够高的位点子集上做推断别把稀疏位点的缺失当成甲基化缺失。6.2 疾病标志物与液体活检疾病标志物方面cfDNA甲基化检测已经在肿瘤早筛上大放异彩非CG甲基化能否进入液体活检菜单目前的结论是谨慎乐观。因为非CG甲基化具有极强的细胞类型特异性主要存在于神经元如果在外周血cfDNA中稳定检测到mCH信号它可能成为神经精神类疾病的组织来源溯源标记。当然这个方向还很新需要大样本队列验证关键难点是cfDNA中神经元DNA占比通常很低对检测灵敏度要求极高。6.3 跨物种比较与进化视角跨物种视野上越来越多研究表明非CG甲基化的水平与物种的CpG密度、寿命、脑容量等特征存在关联。这是值得长期布局的方向因为比较基因组学的方法可以反过来推断非CG甲基化的功能约束哪些mCH位点在多个物种中保守保守位点富集在什么功能类别这些位点的变异是否与疾病相关这类分析门槛不高但信息量很大很适合作为一篇独立方法学文章。我在实际处理跨物种数据时发现不同物种参考基因组质量差异巨大比对参数、CG上下文注释流程甚至版本差异都会带来系统性偏差。建议先在统一流程下完成各物种的mCH定量再做保守性分析不要在不同流程的结果之间直接比较。个人体会我做甲基化数据分析这些年最大的感受是一个修饰重不重要往往取决于你有没有合适的工具去看见它。CG甲基化之所以被研究得最透很大程度上是因为早期技术刚好看得见它。非CG甲基化在动物基因组里被重新发现与其说是一场观念革命不如说是检测技术升级带来的必然结果。所以如果你手上正好有一批WGBS或EM-seq数据别只盯着mCG看——顺手把mCH、mCHH的分布拉出来按基因体、转座子、保守区域分层看一看。那些以前被当成背景噪声的位点说不定才是解开你生物学问题的那把钥匙。对于准备进入这个方向的团队我建议先从神经组织或神经元样本入手因为那里的mCH信号最强、生物学意义最明确也最容易做出让人信服的结果。等技术流程跑通了再向胚胎发育、生殖细胞、疾病队列等方向扩展路会越走越宽。