前言:
我们每个人的基因一半来自爸爸,一半来自妈妈,但市面上基因检测的 “打分标尺”,居然一直是一套单一、残缺的人造参考基因组。
过去十几年,用来评判测序准不准的 GIAB 基准由于技术限制,缺失了 15.3% 的基因组序列,包括全套性染色体、大量癌症、眼病相关重复致病基因,这导致很多遗传病根本没法精准校验。同时这种拿一套固定参考基因组对比,只统计两者差异位点的方法也存在先天偏见。

为解决这个痛点,端粒到端粒(T2T)联盟提出全新思路:不用外来参考,直接拿这个人一整套父母双份完整基因当标准答案,也就是 T2T 基因组基准。完整二倍基因组最本源的基因信息,不管是单点突变、父母基因分型、大片段结构变异,都能全域精准打分。
2026年8月6日,来自 GIAB、T2T、人类泛基因组联盟多国联合团队在CELL上发表论文,新基因组基准实现了 46 条染色体从头到尾无缝拼接,仅核糖体 DNA 重复序列内部仍存在缺口;经多平台交叉校验,99.4%序列未检出任何错误,各项指标碾压过去所有评判标准。
01 T2T-HG002 v1.1 近乎完美的二倍基因组基准
研究团队选用的 HG002 是基因圈家喻户晓的 “标准人” 样本,属于阿什肯纳兹犹太一家三口里的儿子,十几年前由个人基因组计划采集,现在全球所有测序实验室、仪器厂商测机器准不准,都会用它当对照。
为拼出 HG002 一整套爸妈分开的完整基因组,研究整合 PacBio、纳米孔超长测序数据,搭配父母样本区分父、母两套单倍型,分三轮人工校正打磨,最终推出 T2T-HG002 v1.1 组装。
整套 60 亿碱基二倍基因组里99.35%完全找不到组装错误,对比旧 GIAB 评判标准,新版本多出 701.4Mb 常染色体序列与全套性染色体,很多癌症相关重复基因完全不在评测范围内。比如 16 号染色体上的 DUSP22 致癌插入,只存在母亲那套基因里,旧标准完全看不到这个致病片段,而 T2T-HG002 v1.1 新基准完整捕捉到这类单条染色体特有变异。

过往基准(左)与新基准(右)对比
02 父源、母源个性化基因组注释
科研团队先用 Liftoff 工具分别给 T2T-HG002 来自母亲、父亲两套独立染色体做全套基因注释,再搭配 LiftOn 和 miniprot 软件,依托标准 MANE 蛋白转录本比对,补全很多常规注释流程容易漏掉的重复基因。
母源染色体(含X)一共注释出59323个基因,父源染色体(含Y)有57741个,分为编码蛋白、非编码 RNA、无功能假基因三大类。
同一人的父母基因组差异十分明显,团队专门统计了两类关键基因区别:
发生突变、无法合成完整蛋白的 “破损基因”:母源有129个,父源121个,大多集中在重复片段区域,比如15号染色体和精神疾病相关的 CHRFAM7A 基因,父本携带致病小缺失;
仅单套染色体存在的特有基因:13个只出现在母源、12个仅存在于父源,像肿瘤风险相关解毒基因、保护眼底的 CFHR 基因,都呈现父母拷贝不对称的特点。
这些天然个体差异,是单一参考基因组完全无法捕捉到的。

HG002 的完整二倍体基因组
03 市面上测序设备谁更准?研究团队实测对比
团队用新基准评测当下四款主流临床测序平台:
短读 Illumina 碱基颠换(Tv)错误多,易漏掉复杂结构变异;
PacBio/ONT 长读能解析重复基因,但单核苷酸插入(Ins)、缺失(Del)误差更高;
Element 平台在短串联重复致病位点准确度最优。
同时证实,单纯基于参考构建的基因序列,会丢失 2%-7% 临床关键序列,无法满足罕见病诊断需求;而从头(De novo)二倍组装的测序数据准确度,比常规变异检测高出一个数量级,更适合疑难病例分析。

四大测序平台替换错误对比
结语
总的来说,这篇 Cell 工作做出了一套完整、分父母两套的人类基因 “标准答案”,补上了过去缺失的大片难检测基因区域,注释出大量父母特异性疾病相关基因;同时横向评测所有主流测序、组装、变异流程,量化各类技术短板,为后续算法开发、测序方案优化提供统一评判标尺。
未来能让遗传病、肿瘤的基因检测变得更全面、精准,真正推动个性化基因组医学落地。