cfDNA 甲基化泛癌早期筛查模型Methylation-based Multi-Cancer Early Detection · 学术演示系统 v1.0
文献实测 参数外推 教学示意

cfDNA 甲基化泛癌早期筛查模型 · 全链条学术演示

本系统以「分子机制 → 实验技术路线 → 算法建模 → 性能验证 → 方法学局限 → 与现行指南的关系」六段式结构, 完整呈现一个基于血浆游离 DNA(cell-free DNA, cfDNA)甲基化图谱的多癌种早期检测(Multi-Cancer Early Detection, MCED)模型。 全部关键论断标注证据等级与参考文献编号(上标引用),全部数值标注数据溯源类别, 并按 STARD 2015 / TRIPOD+AI / PROBAST 报告规范披露方法学局限。
适用场景:学术汇报 · 科室宣讲 · 研究合作洽谈 目标读者:临床医生 · 转化医学研究者 · IVD 研发 演示模型:cfMe-Pan v0.9 参考文献 —
⚠ 使用声明(建议在任何演示场合首先呈现)

1. 本系统是方法学教学与学术沟通工具,不是医疗器械、不是诊断报告、不构成任何临床决策依据。 其中的「cfMe-Pan v0.9」是为演示而构造的参考模型,并非任何已上市或在研商业产品。

2. 数值分三类并逐一标注:文献实测取自同行评议文献并附上标引用; 参数外推以文献工作点为锚、经双正态 ROC 模型外推,用于展示阈值权衡的形状而非精确性能; 教学示意为合成数据,仅用于说明方法学概念。

3. 截至本版本,尚无任何泛癌种血液甲基化检测被证明可降低癌症死亡率,亦无国内外主流指南推荐其用于无症状人群的常规筛查; 唯一以人群结局为终点的大型随机对照试验(NHS-Galleri)结果尚未公布。MCED 不能替代任何已获推荐的单癌种筛查。

1

概览与模型卡(Model Card / TRIPOD 式结构化披露)

在展示任何性能数字之前,先明确「这个模型是什么、为谁设计、用什么数据训练、在什么人群验证、不适用于谁」。这是 TRIPOD 与 PROBAST 对预测模型报告的基本要求

1.1 关键性能一览(文献锚点)

特异性 Specificity 实测
99.5%
95%CI 99.0–99.8
总体敏感性(全分期 · 50+ 癌种)实测
51.5%
95%CI 49.6–53.3
Ⅰ 期敏感性 实测
16.8%
Ⅱ 40.4 / Ⅲ 77.0 / Ⅳ 90.1
组织起源预测准确率 TOO 实测
88.7%
95%CI 87.0–90.2
前瞻性筛查 PPV(PATHFINDER)实测
38.0%
95%CI 28.8–48.3 · n=6 662
前瞻性筛查 NPV 实测
98.6%
阳性率 1.4%
症状人群 PPV(SYMPLIFY)实测
75.5%
患病率 ≈6.7% · n=5 461
癌症特异死亡率获益 实测
尚无证据
RCT 进行中
解读:同一支检测的三个 PPV 为何相差两倍以上

PPV 不是检测的固有属性,而是检测特性 × 人群患病率的函数。同一支敏感性 / 特异性不变的检测,在症状人群(患病率 ≈6.7%)中 PPV 可达 75.5%, 在无症状 50 岁以上人群(确诊率 ≈0.5–1.4%)中降至 38.0%,若用于 40 岁以下低患病率人群则会跌至个位数。 「把症状人群数据用于宣传筛查价值」是本领域最常见的证据误用,属于 STARD 明确要求披露的人群谱偏倚。§5.4 提供可交互计算器量化这一效应。

1.2 模型卡(cfMe-Pan v0.9 · 演示用)

条目内容溯源
预期用途在无症状成人中检出存在癌症信号(二分类),并对阳性者预测组织起源(TOO,多分类),用于引导后续确诊路径。不用于确诊、分期、疗效监测、复发监测或遗传易感评估。设定
目标人群50–79 岁、无癌症相关症状、5 年内无恶性肿瘤治疗史、非妊娠、无活动性造血系统疾病者。与 PATHFINDER 入组框架一致对齐
明确不适用① 有可疑症状者(应走诊断通道而非筛查);② 近期输血 / 造血干细胞移植;③ 活动性感染或自身免疫病急性期;④ 已知高负荷克隆性造血(CHIP);⑤ 妊娠或产后 3 个月内;⑥ 实体器官移植受者。设定
输入外周血 10 mL × 2(cfDNA 稳定管);提取 cfDNA ≥10 ng;靶向甲基化捕获测序(105 量级 CpG / 数千 DMR)+ 片段长度与末端基序特征。设定
输出① 癌症信号:检出 / 未检出(二分类,阈值预先锁定);② 若检出,给出 TOO 首选与次选预测及概率。不输出连续风险评分,以避免被误读为"癌症概率"。设定
阈值策略训练阶段将特异性锁定为 99.5%(每 1 000 名无癌者约 5 例假阳性),阈值在锁定验证集揭盲前固定,验证阶段不再调整。对齐
训练 / 验证数据演示参数锚定于 CCGA 系列:子研究 1(三种技术路线正面比较)、子研究 3(独立锁定验证,n=4 077;癌 2 823 / 非癌 1 254);前瞻性性能锚定 PATHFINDER(n=6 662)与 SYMPLIFY(n=5 461)实测
参考标准阳性者:组织病理学确诊;阴性者:仅以随访期内未确诊癌症作为替代(不完整参考标准,见 §7.2)。实测
性能小结见 §1.1 与 §5;核心弱点:Ⅰ 期敏感性仅 16.8%,约 5/6 的 Ⅰ 期癌症被漏检实测
公平性 / 亚组PATHFINDER 入组以白人、高教育、高收入人群为主;亚洲人群及不同癌谱(中国食管癌、肝癌、胃癌高发)下的性能未经验证,不可直接外推实测
算法治理锁定算法(locked algorithm):版本冻结、变更须重新验证;不采用在线自适应学习。设定
已知失效模式低脱落肿瘤(部分早期前列腺癌、甲状腺癌、肾癌、脑肿瘤)敏感性极低;CHIP、炎症、良性病变、妊娠可致假阳性;ctDNA 分数 <0.01% 时在采样层面不可检出实测
表 1-1 演示模型卡。TRIPOD+AI 要求预测模型报告涵盖用途、人群、预测因子、结局、样本量、缺失数据、模型构建、性能、公平性与可及性等条目

1.3 证据等级与推荐强度标注体系

诊断性研究证据等级(改编自 Oxford CEBM)

I
同类前瞻性研究的系统评价 / 随机对照试验(以人群结局为终点)
II
连续入组的前瞻性队列,参考标准一致并采用盲法(意向筛查人群)
III
病例对照设计、非连续入组、或参考标准不一致的研究
IV
机制研究、体外 / 建模研究、专家意见、病例系列

GRADE 证据质量(针对"某一结局"而非"某项研究")

GRADE 的关键要求:证据质量须按结局分别评定。同一支检测,"能检出癌症信号"的证据质量可为中等,而"能降低癌症死亡率"的证据质量则为极低。

检出癌症信号(分析 / 临床效度)
预测组织起源(TOO)
提高早期(Ⅰ–Ⅱ 期)检出比例
降低晚期癌症发病率(分期迁移)极低
降低癌症特异死亡率极低 · 无直接证据
降低全因死亡率极低 · 无直接证据
贯穿全系统的核心命题

「能检出」≠「早期能检出」≠「早检出能改变结局」。这三级跳跃分别对应分析效度(analytic validity)、临床效度(clinical validity)与临床效用(clinical utility)——即 ACCE 框架。 目前 cfDNA 甲基化 MCED 在前两级已积累相当证据,在第三级基本为空白。§8.3 以矩阵形式量化这一证据缺口。

2

分子机制:cfDNA 甲基化为何能承载"癌症信号 + 组织起源"双重信息

早筛检测的性能上限由生物学决定,而非算法。理解 cfDNA 释放动力学、甲基化改变的时序与空间特异性,才能理解为什么 Ⅰ 期敏感性只有 16.8% 而 Ⅳ 期可达 90%。

2.1 cfDNA 的来源、丰度与动力学:信号的"分母"问题

血浆 cfDNA 主要来自凋亡 / 坏死细胞经核小体消化后的释放产物,主峰长度约 167 bp(核小体缠绕 147 bp 加连接区),并呈约 10 bp 周期性阶梯IV。 健康人血浆 cfDNA 浓度约 1–10 ng/mL(约 300–3 000 个单倍体基因组当量 / mL),半衰期仅 16 分钟至 2.5 小时,因此 cfDNA 是一份近实时的全身细胞死亡快照

甲基化去卷积研究表明,健康人 cfDNA 绝大部分来自造血系统III。这一背景构成早筛的根本困难:

健康人 cfDNA 组织来源占比对早筛的含义
中性粒细胞≈32%造血来源合计 ≈55–65%:① 构成主要背景噪声;② CHIP 克隆的异常改变会伪装成"肿瘤信号"
淋巴细胞≈12%
单核细胞≈4%
巨核细胞 / 红系祖细胞≈4%
血管内皮细胞≈9%与炎症、心血管事件相关的波动来源
肝细胞≈1%脂肪肝 / 肝炎时显著升高 → 假阳性风险
其他实体组织合计<10%早期肿瘤信号须在此微弱层次中被识别
表 2-1 依据全人类细胞类型甲基化图谱的血浆去卷积结果(近似值)文献实测

信噪比的量级估算

设血浆 cfDNA 为 10 ng/mL(≈3 000 GE/mL),提取 4 mL 血浆得 ≈12 000 GE。若某 Ⅰ 期实体瘤的 ctDNA 分数为 0.01%:

目标分子数 ≈ 12 000 × 0.000 1 = 1.2 个 肿瘤来源基因组当量

这意味着:在单个 CpG 位点上,肿瘤信号可能只有 0–2 条 reads。任何单位点判读都不可能稳定;只有把成百上千个共变位点联合建模(并优先使用同一条 read 内多个 CpG 的共甲基化模式),才能把独立噪声压低到可用水平。这正是甲基化优于点突变的数学根源,也是 §4.1 特征工程的出发点

不可逾越的采样下限

基于肿瘤脱落速率的数学建模显示,直径 <1 cm 的肿瘤在 10 mL 血中可能连一个 ctDNA 拷贝都不存在;提高测序深度无法突破这一采样极限,只能靠增加血量或提高采样频率IV。这是"越早越好"这一直觉的硬约束。

2.2 肿瘤甲基化改变:早发生、高密度、组织特异

① CpG 岛启动子超甲基化

抑癌基因(CDKN2AMLH1BRCA1RASSF1ASEPT9 等)启动子 CpG 岛获得 5mC → 转录沉默。属肿瘤发生的早期事件,在癌前病变阶段即可出现IV

② 全基因组低甲基化

部分甲基化域(PMD)、重复序列、LINE-1 等广泛去甲基化,累及数十至数百 Mb,是信号总量最大的改变类型,适合 cfMeDIP-seq 与低深度全基因组策略捕获III

③ 组织身份被保留

肿瘤在获得异常甲基化的同时,保留大量来源组织的正常甲基化印记。这使同一份数据既能判断"有癌",又能判断"来自何处"——TOO 预测的生物学基础III

为什么甲基化优于体细胞突变(同一批样本的正面比较)

CCGA 子研究 1 在同一批样本上直接比较了靶向测序(突变)、全基因组测序(拷贝数)与全基因组亚硫酸氢盐测序(甲基化)三条路线, 结论是甲基化路线在敏感性与特异性上均最优,因而被选为后续开发方向III;后续对多类 cfDNA 特征(甲基化、片段组、拷贝数、突变、蛋白)的系统评估亦支持甲基化为单一最强特征类。机制层面有四点原因:

  1. 信息密度:人基因组约 2 800 万个 CpG,肿瘤中改变的 CpG 可达数十万至数百万个;而单个肿瘤的驱动突变通常仅数十个。每个 cfDNA 分子可携带多个信息位点,等效于把"稀有事件计数"转化为"模式识别"。
  2. 共变结构:DMR 内相邻 CpG 高度共甲基化,可在单条 read 内部联合判读(甲基化单倍型 / methylation haplotype),把误判概率从"每位点 10⁻³"量级压到"每分子 10⁻⁶"量级
  3. 克隆性造血干扰更可控:CHIP 导致的高频白细胞来源突变是突变法假阳性主要来源,需配对白细胞测序过滤III;甲基化法虽同受造血背景影响,但其组织特异模式可在去卷积层面被识别与扣除。
  4. 可定位:突变几乎不含组织信息(TP53 突变可来自任何癌种),而甲基化天然编码组织身份。

交互 · 差异甲基化区域(DMR)图谱

点击任一色块查看该 DMR 的注释。行 = DMR,列 = 样本组;颜色 = β 值(蓝 0 =去甲基化,红 1 =高甲基化)。

DMR × 样本组 甲基化矩阵 教学示意:基因 / 方向真实,数值合成

β 值Δβ(vs 白细胞)
DMR 注释

点击矩阵中任一色块,查看基因、CpG 数目、改变方向、组织特异性与代表文献。

2.3 片段组学:与甲基化正交的第二维信号

ctDNA 的片段长度分布较非肿瘤 cfDNA 系统性偏短(主峰左移约 10–30 bp,<150 bp 比例升高),并具特征性末端基序与"锯齿状末端"III。 该维度与甲基化近似正交,可在同一份测序数据中"免费"获得,是提升低肿瘤负荷敏感性的重要补充。

交互 · 片段长度分布与体外富集模拟 教学示意:双峰混合模型

临床情境:Ⅰ 期常 <0.1%;Ⅳ 期可达 1–10%
窄窗提升肿瘤分数但降低总分子数——存在明确权衡
纵轴为相对密度。灰色 = 非肿瘤 cfDNA(主峰 167 bp);红色 = ctDNA(主峰 ≈145 bp,分布更宽);阴影 = 当前选择窗口。
窗口内 ctDNA 富集倍数
富集后 / 富集前 肿瘤分数比
窗口内肿瘤分数
size selection 之后
保留的肿瘤分子绝对量
相对无富集时的比例
方法学提示

片段选择提高的是相对肿瘤分数,但绝对肿瘤分子数只会减少。当肿瘤分子数已接近个位数(§2.1),富集收益可能被泊松采样噪声抵消甚至反转。是否做体外 / 生信富集必须由 LoD 实验数据判定,不能靠直觉

2.4 生物学噪声:假阳性与假阴性的机制清单

干扰因素机制主要影响证据
假阳性方向
克隆性造血(CHIP)年龄相关造血克隆携带异常表观 / 基因组改变,随血细胞更新持续入血;70 岁以上检出率可达 10–20%特异性下降,与年龄强相关II
年龄相关甲基化漂移表观遗传时钟效应使部分 CpG 岛随年龄渐进性甲基化,方向与肿瘤信号一致老年人群假阳性升高IV
炎症 / 感染 / 自身免疫组织损伤致特定器官 cfDNA 释放激增,去卷积被"点亮"TOO 误判;假阳性III
良性增生与癌前病变结肠腺瘤、Barrett 食管、肝硬化等已具部分甲基化改变"真阳性但非癌",引发过度检查III
妊娠 / 近期输血 / 移植引入外源基因组与胎盘特异甲基化模式模式紊乱,须列为禁忌IV
剧烈运动 / 创伤 / 手术肌肉、内皮来源 cfDNA 短时激增(可达数十倍)建议采血前 24–48 h 规避IV
假阴性方向
低脱落表型增殖 / 凋亡指数低、血供差、被基质包裹(部分前列腺癌、甲状腺癌、肾癌)癌种间敏感性差异达数倍III
解剖屏障中枢神经系统肿瘤受血脑屏障限制,血浆 ctDNA 极低脑肿瘤基本不可检出III
肿瘤体积过小脱落速率 × 体积 < 采样检出下限(§2.1 采样极限)Ⅰ 期敏感性低的主因IV
背景 cfDNA 稀释肥胖、剧烈运动、溶血导致正常 cfDNA 背景升高 → 肿瘤分数被稀释BMI 高者敏感性可能下降IV
表 2-2 生物学干扰清单。该表应作为任何 MCED 检测知情同意与结果解读的组成部分:假阴性不排除癌症,假阳性不等于癌症。
3

实验技术路线:从静脉穿刺到甲基化矩阵的 9 个环节与质控阈值

早筛检测的失败大多不在算法,而在分析前变量(pre-analytical variables)。本节逐环节给出操作要点、失效模式与可量化的质控阈值。点击任一环节展开细节。

为什么把湿实验放在算法之前讲

ctDNA 分数在早期癌中常低至 0.01–0.1%(§2.1)。任何一步分析前误差都会以数量级方式压倒模型的判别能力:采血后延迟离心 6 小时可使白细胞裂解释放的基因组 DNA 增加数倍,从而把肿瘤分数稀释一个数量级——这是无法用任何算法补救的。CLSI 对分子诊断的分析性能验证(LoD、精密度、干扰、稳定性)提出了明确的实验设计要求

1
血样采集 分析前关键环节
外周静脉血 10 mL × 2;K₂EDTA 管或 cfDNA 专用稳定管;避免溶血与 gDNA 污染。

操作要点:21G 及以上针头,弃去前 2 mL(减少穿刺损伤细胞),轻柔颠倒混匀 8–10 次,室温直立保存;禁止气动传送、剧烈震荡、冷冻全血。

管型选择的权衡:K₂EDTA 管成本低但要求 ≤4–6 h 内完成血浆分离;含固定剂的 cfDNA 稳定管可在室温维持 3–7 天,代价是部分平台上 cfDNA 提取效率与片段完整性略有差异,更换管型属于分析前变量变更,必须重新做桥接验证

失效模式:溶血(血浆呈红色)→ 白细胞 gDNA 大量释放 → 长片段污染、肿瘤分数被稀释;采血前 24–48 h 剧烈运动 → 肌肉来源 cfDNA 激增(假阳性风险,见表 2-2)。

采血至离心间隔(EDTA)≤ 4 h(最长 6 h)
血浆外观无肉眼可见溶血
采血量≥ 8 mL 全血 / 管
2
双次离心分离血浆
1 600 × g / 10 min(4 ℃)→ 转移血浆 → 16 000 × g / 10 min 去除残余细胞与碎片。

第一次离心后吸取血浆时须距白膜层 ≥5 mm,宁可少取。第二次高速离心去除血小板与细胞碎片(血小板亦含线粒体 DNA,可干扰下游定量)。分装为 1–2 mL/管后 −80 ℃ 保存。

冻融次数是被普遍低估的误差源:每次冻融都会造成 cfDNA 片段化与损失,建议 ≤2 次,并在验证研究中把冻融次数作为协变量记录(TRIPOD 要求披露缺失与预处理细节)。

血浆产率≈ 40–45% 全血体积
允许冻融次数≤ 2
保存温度−80 ℃
3
cfDNA 提取与定量
磁珠法 / 硅胶膜柱法,输入血浆 4–8 mL;产率通常 5–30 ng;须评估片段分布。

关键指标是"短片段回收率":不同提取试剂盒对 <100 bp 片段的回收差异显著,而 ctDNA 恰恰富集于短片段(§2.3),因此提取方法的选择会直接改变检测敏感性。试剂盒变更须重做 LoD 验证。

gDNA 污染判定:片段分析(Bioanalyzer / TapeStation)应见 167 bp 主峰与 ~330 bp 次峰;若出现 >1 000 bp 高分子量峰且占比 >10%,提示白细胞裂解,该样本应判为不合格而非"勉强上机"。

cfDNA 总量≥ 10 ng(目标 20 ng)
167 bp 主峰存在且为主峰
高分子量 gDNA 占比< 10%
定量方法荧光定量 / dPCR(非 A260/280)
4
甲基化信息的转化:三条互斥路线 技术选型分水岭
亚硫酸氢盐转化 / 酶法转化(EM-seq)/ TET 辅助的碱基修饰(TAPS)。
路线原理优点缺点证据
亚硫酸氢盐
(bisulfite)
未甲基化 C 脱氨为 U(读作 T),5mC 保持为 C金标准,参考数据最丰富强烈降解 DNA(可损失 >80–90%),对低输入 cfDNA 极不友好;序列复杂度降低致比对困难IV
酶法 EM-seqTET2 氧化保护 5mC,APOBEC3A 脱氨未修饰 C非变性、DNA 损伤小,皮克级输入可行;覆盖更均一、GC 偏倚更小酶批次差异需严格管控;成本较高III
TAPS直接检测 5mC / 5hmC 的碱基级转化,不破坏未修饰 C保留序列复杂度,同时读取 5mC 与 5hmC生态与参考数据较少;生信流程需自建IV
表 3-1 甲基化转化路线比较。对 cfDNA 早筛而言,转化步骤的 DNA 保全率直接决定可用分子数,因而直接决定 LoD——这是酶法路线在低输入场景快速取代亚硫酸氢盐的核心原因。

转化率质控必须用外源对照:掺入完全非甲基化的 λ 噬菌体 DNA(测非 CpG C→T 转化率)与完全甲基化的 pUC19 DNA(测假转化率)。

非甲基化对照转化率≥ 99.5%
甲基化对照保留率≥ 98%
转化后 DNA 回收记录并设下限
5
文库构建与 UMI 标记
转化前接头连接(保留双链信息与分子标签);UMI 用于去重与降低背景错误。

接头连接的时序很关键:「转化前连接」可保留原始双链配对关系,使同一原始分子的正负链可互为验证,把单链错误压低 1–2 个数量级;「转化后连接」流程简单但丧失双链一致性校验能力。在 0.01% 量级的信号面前,双链一致性往往是特异性的最后一道防线(与突变检测中 duplex sequencing 的逻辑相同)。

PCR 循环数应最小化以降低偏倚与重复;须记录每个样本的文库产率、插入片段分布、去重后有效分子数(这是 LoD 的真实分母)。

UMI 家族大小中位数≥ 2(目标 3–5)
PCR 循环数尽可能低并固定
去重后有效分子数报告为独立 QC 指标
6
目标区域富集:三种策略的取舍
靶向捕获(数千 DMR)/ cfMeDIP-seq(5mC 免疫富集)/ 低深度全基因组亚硫酸氢盐测序。
  • 靶向甲基化捕获:探针覆盖预先筛定的数千个 DMR(105 量级 CpG)。深度高、成本可控,是目前临床级 MCED 的主流;代价是面板一旦锁定就无法回溯新标记,且面板筛选阶段的数据泄漏风险高(见 §4.4)。
  • cfMeDIP-seq:用抗 5mC 抗体富集甲基化片段,无需转化、输入量低(纳克级),特别适合捕获全基因组低甲基化 / 超甲基化的整体格局III;代价是不提供碱基分辨率、抗体批次效应显著。
  • WGBS / 低深度全基因组:信息最全、可回溯,适合发现阶段;成本与数据量在筛查规模下难以承受。
捕获在靶率≥ 50–60%
覆盖均一性(≥0.2×均值位点比例)≥ 95%
探针间变异(CV)批次内 < 15%
7
测序
PE150;靶向路线目标去重后深度数百 ×;同批次须含阴性对照与参考样本。

每个批次必须包含:① 无模板对照(检测污染);② 已知甲基化水平的参考标准品(监控系统漂移);③ 掺入型阳性对照(低肿瘤分数细胞系混合,验证 LoD 稳定性)。这些对照的趋势图(Levey-Jennings)应纳入日常质量管理,而非仅在验证阶段使用

Q30 比例≥ 85%
去重后平均深度(靶向)≥ 300×
无模板对照信号低于判定阈值
8
生物信息处理
接头修剪 → 三字母 / 四字母比对 → UMI 去重 → 甲基化 calling → read 级甲基化模式矩阵。

转化后序列复杂度下降(C→T),需专用比对器(bwa-meth / Bismark / BSBolt 类)并处理非对称链。输出两个层次的数据:

  1. 位点层:每个 CpG 的甲基化比例 β = M/(M+U),用于区域均值与经典统计;
  2. 分子层:每条 read 覆盖的 CpG 甲基化串(如 1101110),用于甲基化单倍型 / epiallele 分析——这是低肿瘤分数下敏感性的主要来源
比对率≥ 80%
重复率(去重前)记录并设上限
背景甲基化错误率≤ 0.1% / CpG
样本互污(index hopping)≤ 0.5%
9
分析性能验证(IVD 视角)常被学术演示忽略
LoD、精密度、分析特异性、干扰、稳定性、携带污染——临床效度之前的必要门槛。
验证项目设计要点可接受标准(示例)
检出下限 LoD细胞系 / 患者样本梯度稀释,≥3 批次 × ≥20 重复,用 probit 拟合 95% 检出浓度ctDNA 分数 0.05%(含 20 ng 输入)
精密度重复性(同批)与中间精密度(跨日 / 跨操作者 / 跨试剂批),≥20 天设计评分 CV ≤ 10%;定性一致率 ≥ 95%
分析特异性非癌样本大样本量测试(决定 99.5% 特异性的置信度,见 §5.6 样本量计算器)特异性 ≥ 99.0%(下限)
干扰物质血红蛋白、胆红素、甘油三酯、常用药物;以及 gDNA 污染梯度偏差 < 判定阈值的 1/3
稳定性全血室温 / 4 ℃ 各时间点;血浆 −80 ℃ 长期;提取后 cfDNA与基线一致率 ≥ 95%
携带污染高肿瘤分数样本与阴性样本交替上机阴性样本不出现假阳性
表 3-2 分析性能验证清单(示例阈值 教学示意,实际须依产品声称与法规要求设定)学术报告若只呈现 AUC 而不呈现 LoD 与精密度,则该模型的可重复性无从判断。
分析前变量核对清单(可直接用于研究方案与稽查)

① 管型与批号;② 采血至离心时间;③ 离心参数;④ 血浆体积与外观;⑤ 冻融次数;⑥ 提取试剂盒批号与洗脱体积;⑦ cfDNA 总量与片段分布;⑧ 转化试剂批号与对照转化率;⑨ 文库批次与测序运行 ID;⑩ 受试者采血前 48 h 的运动 / 感染 / 手术史。 以上每一项都应在数据库中作为字段存在,否则批次效应无法被诊断,更无法被校正——而"用批次校正方法处理与结局相关的批次"本身就是一种数据泄漏(§4.4)。

4

算法建模:特征工程、两阶段架构、阈值锁定与防泄漏验证设计

在 p ≫ n(特征数远超样本数)且患病率极低的场景中,验证设计的严谨性比模型选择更决定成败。本节按 TRIPOD+AI 的条目顺序展开

4.1 特征工程:从 β 值到甲基化单倍型

特征类别定义与计算优势 / 局限证据
位点 β 值β = M/(M+U);常做 logit(M 值)变换以稳定方差简单、可解释;但在肿瘤分数 0.01% 时 Δβ 仅 10⁻⁴ 量级,被测序噪声完全淹没IV
DMR 区域均值区域内所有 CpG 的加权平均甲基化降噪、降维;但把"少数分子完全异常"与"多数分子轻度异常"混为一谈,损失关键信息III
甲基化单倍型 / MHL统计单条 read 上连续 CpG 的共甲基化模式(如全甲基化 read 的比例、甲基化单倍型负荷)把"位点噪声"变成"分子证据",是低丰度检测的核心特征;要求 read 长度覆盖足够 CpG 密度III
异常 epiallele 计数直接计数"完全异常甲基化模式"的分子数(近似泊松计数)可给出分子级不确定度,天然适配极低分数场景;对测序错误敏感,需 UMI / 双链支持III
组织去卷积分数以参考甲基化图谱做非负最小二乘 / 概率模型,估计各组织贡献比例TOO 预测的主特征,可解释性强;受参考图谱完备性限制(罕见组织缺失即无法定位)III
片段组学特征片段长度分布、末端基序频率、优先末端位置、片段化熵与甲基化近似正交,可提升低负荷敏感性;受分析前变量(冻融、提取)影响大III
拷贝数 / 非整倍体由脱靶 reads 估计臂级拷贝数变化成本近乎为零的附加特征;早期肿瘤中信号弱III
表 4-1 特征类别。多类特征的系统比较显示甲基化为单一最强特征类,联合其他特征可获边际提升III

4.2 两阶段架构:先"有没有",再"在哪里"

阶段一 · 癌症信号检测

二分类。输入全部甲基化 + 片段组特征;输出单一评分,与预先锁定的阈值比较。

  • 基学习器:弹性网 logistic 回归(可解释基线)、梯度提升树、read 级矩阵上的 CNN
  • 集成:交叉验证外的 stacking,避免用同一折数据既训练基模型又训练元模型
  • 阈值:在训练集固定特异性 = 99.5%,锁定后不再改动
阶段二 · 组织起源(TOO)

仅对阶段一阳性者运行的多分类(约 15–25 个组织类),输出首选 + 次选预测及概率。

  • 主特征:组织特异 DMR 的去卷积分数
  • 输出两个候选而非一个,是为了匹配"影像 + 内镜"两条平行确诊路径的临床现实
  • 报告须同时给出 top-1 与 top-2 准确率;仅报 top-2 会高估定位能力
为什么必须"两阶段"而不是"一个多分类模型"

若直接做「无癌 + 20 种癌」的 21 分类,则整体特异性由所有癌类阈值共同决定,难以把无癌人群的假阳性率精确控制在 0.5%。筛查场景中特异性是硬约束(§5.4 将展示 1% 的特异性差异如何使假阳性人数翻倍),因此把"是否有癌"独立成一个可精确控制阈值的二分类问题,是筛查产品的必然架构选择。

4.3 类别不平衡与阈值锁定:筛查建模的特殊性

在患病率 ≈1% 的人群中,若以准确率为优化目标,"全部判为阴性"即可获得 99% 的准确率——准确率在筛查场景中是无意义指标。正确做法是:

  1. 固定特异性、优化敏感性(而非优化 AUC)。AUC 是全阈值区间的平均表现,而筛查只使用极高特异性端的一个点;AUC 高的模型在 99.5% 特异性处未必更好
  2. 用"部分 AUC(pAUC)"或"固定 FPR 下的敏感性"作为模型选择指标,与最终用途一致。
  3. 阈值必须在锁定验证集揭盲前确定。在验证集上挑选阈值再报告该阈值下的性能,是最常见且最严重的乐观偏倚来源之一(PROBAST 分析域高风险条目)。

4.4 防泄漏的验证设计(本节为方法学核心)

✗ 常见的六种数据泄漏

  1. 特征选择泄漏:在全数据上做差异甲基化筛选,再做交叉验证 → 敏感性被显著高估(在 p≫n 下可虚增数个百分点至十几个百分点)。
  2. 批次校正泄漏:用包含结局信息的全数据做 ComBat / 分位数归一化。
  3. 阈值泄漏:在验证集上选择使性能最优的阈值。
  4. 样本重复泄漏:同一受试者的多个时间点样本被分入训练与验证集两侧。
  5. 批次-结局混杂:癌症样本与对照样本在不同时间 / 不同中心处理 → 模型学到"批次"而非"癌"。
  6. 超参数泄漏:用同一折数据既调参又评估(须用嵌套交叉验证)。

✓ 应采用的设计

  1. 嵌套交叉验证:外层评估、内层调参;所有预处理(含特征选择、归一化)在外层训练折内部完成。
  2. 独立锁定验证集:预先定义、单次揭盲、结果无论好坏均报告(CCGA 子研究 3 的设计逻辑)。
  3. 批次随机化:癌 / 非癌样本在板位、批次、测序 run 上交错排列,并将批次作为随机效应建模。
  4. 按受试者分组划分(GroupKFold),而非按样本。
  5. 前瞻性意向筛查队列:这是从证据等级 III 跃升到 II 的唯一途径(PATHFINDER)。
  6. 外部时空验证:不同中心、不同年份、不同人群癌谱。
为什么"病例对照 AUC 0.95"往往不能兑现为"筛查可用"

病例对照设计中,癌症样本多来自已确诊、症状明确、肿瘤负荷较大的患者,而对照多为健康志愿者——两组在肿瘤负荷谱、年龄、合并症、采样流程上系统性不同。这构成 STARD 明确列举的谱偏倚(spectrum bias)与人为的病例混合。 其后果是可预测的:从病例对照到前瞻性筛查,敏感性通常明显下降,PPV 因患病率骤降而下降更剧烈。本系统 §5.3 用同一模型的两套曲线并列展示这一落差。

4.5 校准:被诊断模型研究普遍忽视的一环

判别(discrimination, AUC)回答"能否排序",校准(calibration)回答"预测概率是否等于真实风险"。校准不良的模型即使 AUC 很高,也会在临床决策中造成系统性误判——这是预测模型研究的"阿喀琉斯之踵"IV

校准截距(calibration-in-the-large)≈ 0 · 校准斜率 ≈ 1 · Brier 分数 = E[(p̂ − y)²](越小越好)

交互 · 校准曲线(含 Wilson 置信区间)

校准良好 系统性高估风险 斜率 < 1(过拟合典型形态)
横轴 = 模型预测概率十分位均值;纵轴 = 该组实际观察发生率;误差线为 Wilson 95% CI;虚线 = 理想对角线。教学示意

本演示模型为何"不输出连续概率"

在患病率 ≈1% 的人群中,校准评估本身极其困难:要在预测概率 0.5–0.9 的区间获得可用精度的观察发生率,需要极大样本量;而分层十分位在低患病率下每组事件数常为单位数,Wilson 区间宽到无法判读。

因此本演示模型(如同现有商业 MCED)只输出二分类结论。这是诚实的设计:与其给出一个校准无法验证的"癌症概率 62%",不如给出"检出癌症信号"并配合明确的 PPV 区间沟通(§6.2 沟通脚本)。

推论

任何 MCED 报告若向患者呈现"您的患癌概率为 X%",都应被要求出示该概率的校准验证数据(校准曲线、截距、斜率与样本量)。缺失即为过度声称。

4.6 样本量:为什么"验证 99.5% 特异性"如此昂贵

预测模型开发的最小样本量应基于目标精度而非经验法则(如 EPV=10)来推算。对筛查检测而言,最苛刻的约束来自特异性的置信区间宽度

n ≈ z²·p(1−p) / d² (p = 目标特异性,d = 期望的 95%CI 半宽)

交互 · 样本量 / 精度计算器 解析计算

所需无癌受试者数
Wald 近似(正态)
Wilson 校正后建议样本量
极端比例下更稳健
对应需入组的总人数
= 无癌数 / (1 − 患病率)
结论

4.7 可解释性与算法治理

可解释性

SHAP / 排列重要性可定位贡献最大的 DMR;组织去卷积输出本身即为"人类可读"的中间表示。但须警告:解释不等于因果,一个高贡献 DMR 可能只是批次或年龄的代理变量。

漂移监控

试剂批次、测序平台版本、人群构成变化都会造成分布漂移。应持续监控:阳性率、评分分布、TOO 分布、QC 指标趋势。阳性率异常升高首先应怀疑技术漂移而非疾病谱变化。

版本治理

锁定算法、版本号、变更控制、再验证触发条件(面板变更 / 试剂变更 / 模型重训)须写入质量体系文件。TRIPOD+AI 要求披露模型可获取性与版本信息

5

性能验证:判别力、分期依赖性、人群依赖性与净获益

本节所有交互计算均基于公开的文献工作点可核查的数学公式。凡超出文献报告点的取值,一律标注 参数外推并说明所用模型。

本节使用的外推模型(透明披露)

为展示"阈值移动如何改变敏感性",本系统采用双正态(binormal)ROC 模型:设无癌者评分 ~ N(0,1),癌症患者评分 ~ N(μ, σ²)。给定特异性 s,阈值 t = Φ⁻¹(s),则敏感性 = Φ((μ − t)/σ)。 取 σ = 1.8(反映癌症人群信号高度异质:早期低脱落者与晚期高脱落者混合),并用 CCGA 子研究 3 的工作点(特异性 99.5% 时敏感性 51.5%)反解 μ。分期曲线以同一 σ 分别锚定 Ⅰ/Ⅱ/Ⅲ/Ⅳ 期的报告敏感性。

该模型的用途与边界:它能正确呈现"高特异性区间敏感性对阈值极其敏感"这一定性规律与量级,但不应被引用为任何产品在非报告工作点上的性能。真实 ROC 未必服从双正态假设,尤其在极端尾部。

5.1 交互 · ROC 曲线与工作点选择

对应每 1 000 名无癌者的假阳性数:5.0
全分期合并Ⅰ 期 Ⅱ 期Ⅲ 期Ⅳ 期
全分期Ⅰ 期 Ⅱ 期Ⅲ 期Ⅳ 期 文献报告工作点
◆ 实心方块 = CCGA 子研究 3 报告的工作点(特异性 99.5%)实测;曲线其余部分为双正态外推外推。注意横轴为 1−特异性,刻意采用 0–10% 的放大区间——筛查只在最左侧极窄区域内运行。
当前工作点敏感性(全分期)
Ⅰ 期敏感性
早期检出能力的真实写照
Ⅱ 期敏感性
Ⅲ 期敏感性
Ⅳ 期敏感性
AUC(双正态模型隐含)
全分期 / Ⅰ 期:
请注意这个权衡的陡峭程度

5.2 分期依赖性:早筛检测最重要的一张图

柱 = 各分期敏感性(当前工作点,外推);深色横线 + 误差线 = CCGA 子研究 3 报告值及其 Wilson 95% CI(实测,按报告的分期样本量近似计算)。
必须向临床同事明确说明的一点

该检测的敏感性与肿瘤负荷高度相关,而非与"是否早期"相关。Ⅰ 期 16.8% 与 Ⅳ 期 90.1% 的巨大落差意味着:MCED 检出的癌症会系统性偏向进展较快、脱落较多、体积较大的肿瘤。 这带来两个方向相反的后果:① 好消息——它更可能捕获侵袭性强的癌症,理论上更接近"有临床意义的早诊";② 坏消息——它对最有希望通过早诊治愈的微小病灶最不敏感,因此"提高早期检出比例"这一目标并不自动成立。§7.3 讨论由此产生的长度偏倚(length bias)。

5.3 癌种依赖性与组织起源(TOO)预测

各癌种敏感性梯度(当前工作点)。教学示意:癌种相对高低次序依据文献报告的一致趋势构建(高脱落:肝 / 胰 / 食管 / 卵巢 / 淋巴系统;低脱落:甲状腺 / 前列腺 / 肾 / 子宫)具体数值为合成值,不得引用为任何产品性能

TOO 性能与临床价值

TOO top-1 准确率
88.7%
95%CI 87.0–90.2
TOO 提供预测的比例
≈96%
少数阳性无法定位

TOO 的真实临床价值在于压缩确诊路径:无 TOO 时,一个"泛癌阳性"结果可能触发全身 PET-CT + 多学科会诊 + 多项内镜;有 TOO 时可优先针对 1–2 个器官系统。PATHFINDER 中,阳性者的诊断解决中位时间为 79 天(确诊癌者 57 天,最终未发现癌者 162 天)II

注意这个"162 天"

最终未发现癌症者的诊断排查中位时间长于确诊癌症者,且部分受试者接受了侵入性检查。这就是假阳性的真实代价:不是一次抽血,而是数月的不确定、多次影像与内镜、以及相应的并发症与心理负担。

5.4 交互 · 人群患病率决定一切:PPV / NPV 计算器

40–49 岁一般人群 ≈0.15% 50–79 岁一般人群 ≈1.0% PATHFINDER 实测确诊率 ≈0.5% 重度吸烟高危 ≈2.5% SYMPLIFY 症状人群 ≈6.7%
敏感性由双正态模型同步给出:51.5%

每 100 000 名受筛者的结局分解(2×2 表)

实际有癌实际无癌合计
检测阳性
检测阴性
合计100 000
由文献工作点 + 患病率经贝叶斯公式解析计算解析计算。TP 真阳性 / FP 假阳性 / FN 假阴性(漏诊)/ TN 真阴性。
PPV 与 1−NPV 随患病率变化(对数横轴)。竖线 = 当前患病率。PPV 曲线在低患病率区间的陡降是筛查场景的本质特征。
阳性预测值 PPV
Wilson 95%CI
阴性预测值 NPV
阳性似然比 LR+
与患病率无关,反映检测本身
阴性似然比 LR−
越接近 0 排除能力越强
每检出 1 例癌需筛查人数 NNS
Number Needed to Screen
每检出 1 例癌产生的假阳性数
直接对应下游检查负担
漏诊人数 / 10 万
阴性结果绝不等于无癌
后验优势变化(阳性)
验前优势 × LR+
自动生成的解读句(可直接用于医患沟通)

把特异性从 99.5% 降到 99.0% 会发生什么?请亲手拖动滑块

在患病率 1% 的人群中,特异性由 99.5% → 99.0%(听起来只差 0.5 个百分点)会使每 10 万人的假阳性从约 495 例增至约 990 例,即下游不必要检查翻倍;而敏感性仅提升数个百分点。 这就是为什么筛查产品把特异性锁定在 99.5% 而不是 99.0%,也是为什么"提高敏感性"在筛查场景中往往不是正确的优化方向。

为什么模型在"患病率 1%"下算出的 PPV(≈51%)高于 PATHFINDER 实测的 38%?

这是一道值得在汇报中主动讲清的题,涉及三个独立因素:

  1. 实际特异性不同:PATHFINDER 观察到的特异性为 99.1%(而非预锁定目标 99.5%)。把上方滑块拖到 99.10% 即可看到 PPV 明显下降——0.4 个百分点的特异性差异对 PPV 的影响远大于直觉
  2. 实际患病率不同:PATHFINDER 中经确诊的癌症仅约 0.5%(35 / 6 662),低于 50–79 岁人群年化全癌发病率的粗略估计。请点击"PATHFINDER 实测确诊率 ≈0.5%"预设。
  3. 敏感性来源不同:51.5% 来自病例对照验证集,存在谱偏倚(§4.4);前瞻性筛查人群的真实敏感性预期更低,因为其中的癌症以早期、低负荷者为主。

教学结论:任何"计算得到的 PPV"都必须同时声明所用的敏感性来源、特异性取值与患病率假设,三者缺一即不可解读。

5.5 决策曲线分析(DCA):净获益视角

敏感性 / 特异性不能直接回答"该不该用"。DCA 引入阈值概率 pt(临床上愿意为发现 1 例癌症而接受的最大"无谓检查数"的倒数关系),计算净获益IV

净获益 = TPR·π − FPR·(1−π)·[pt/(1−pt)] (π = 患病率)
横轴 = 阈值概率 pt;纵轴 = 净获益。绿 = 使用该检测;灰 = 全部人群直接做确诊性检查("全筛");黑虚线 = 不筛查(净获益 = 0)。解析计算

如何读这张图

  • 只要绿线高于 0 与灰线,在该阈值概率下使用检测优于两种极端策略。
  • pt 的临床含义:pt=5% 表示"愿意为找到 1 例癌症而接受 19 例不必要的确诊性检查"。侵入性越低、危害越小的确诊手段,可接受的 pt 越低。
  • 关键洞察:在患病率 1% 时,"全筛"策略(对所有人做 PET-CT / 内镜)的净获益在 pt 略大于患病率后即变为负值——这正是需要一个高特异性分流检测的原因
  • 局限:DCA 假设"检出即获益",未纳入过度诊断的危害。若相当比例的检出属于永不致病的惰性病变,则真实净获益低于图示
当前设置下的判读

5.6 报告性能时必须同时给出的六项信息

① 研究设计

病例对照 / 前瞻性队列 / RCT;连续入组与否;是否为意向筛查人群。

② 参考标准

阳性与阴性各如何确认;阴性随访时长;有无验证偏倚(仅阳性者被彻查)。

③ 人群构成

年龄、性别、癌谱、分期分布、合并症;癌 / 非癌两组的可比性。

④ 工作点与阈值来源

阈值是预先锁定还是事后选择;报告点的特异性与置信区间。

⑤ 置信区间与样本量

所有比例须附 CI;分期 / 癌种亚组须给出各组 n(小样本亚组的点估计不可解读)。

⑥ 临床效用证据层级

是检出率、分期迁移,还是死亡率?三者不可互相替代(§8.3)。

6

临床决策路径、结果沟通与四个虚拟病例

一份 MCED 报告真正的临床风险,往往不在检测本身,而在结果被如何解读与如何行动。本节给出诊断路径、沟通脚本与四个覆盖典型情形的虚拟病例。

6.1 阳性结果的诊断路径(TOO 引导)

A
第一步 · 复核与情境评估(不要立刻开全套影像)

① 复核检测前置条件:近期感染 / 手术 / 输血 / 妊娠 / 剧烈运动?既往恶性肿瘤史?② 复核报告质控是否合格;③ 完成完整病史、体格检查与基础实验室(含血常规——异常血象提示需评估 CHIP 或血液系统疾病);④ 核查并补齐所有已获指南推荐的常规筛查(结直肠、乳腺、宫颈、肺)——它们的证据等级高于 MCED。

B
第二步 · 依 TOO 首选 / 次选预测启动定向检查
TOO 预测首选定向检查补充
胸部低剂量 / 增强 CT必要时 PET-CT、支气管镜 / 穿刺
结直肠 / 上消化道结肠镜 / 胃镜腹部增强 CT 或 MRI
肝 / 胆 / 胰上腹增强 MRI(含 MRCP)或增强 CTAFP / CA19-9;超声内镜
卵巢 / 子宫经阴道超声 + 盆腔 MRICA125 / HE4;妇科专科评估
淋巴 / 造血系统血常规 + 外周血涂片 + LDH;颈胸腹盆 CT血液科评估;必要时骨髓 / 淋巴结活检
头颈耳鼻喉专科内镜 + 颈部增强 CT / MRI
无 TOO 预测 / 两候选相互矛盾全身 PET-CT + MDT 讨论按性别 / 年龄补齐常规筛查;避免无节制"撒网式"检查
表 6-1 TOO 引导的定向检查路径(依据现行诊断常规构建的示例流程,非任何指南推荐)。检查选择须结合本地可及性、辐射剂量与患者意愿。
C
第三步 · 若定向检查阴性:明确的"停止规则"是必需的

没有停止规则的诊断路径是假阳性危害的主要放大器。建议预先约定:完成一轮结构化评估(TOO 定向 + 常规筛查补齐 + 血液系统评估)后若仍无发现,则转为定期临床随访(如 6–12 个月复查症状与必要影像), 而进入无限升级的检查循环。须向患者明确说明:假阳性可源于 CHIP、炎症、良性病变或技术因素(表 2-2),且 PATHFINDER 中最终未发现癌症者的排查中位时间达 162 天

6.2 结果沟通脚本(可直接用于门诊与科室培训)

阳性("检出癌症信号")

「这项检查在您的血液中发现了可能来自肿瘤的 DNA 信号。它不是癌症诊断。在与您条件相近的人群中,出现这个结果的人里大约有 38% 最终确诊癌症,也就是说相当一部分人最终并没有癌症。 因此下一步是按提示的可能来源部位做针对性检查。我们会预先约定检查范围与结束时点,避免无止境的检查。」

要点:给出具体 PPV 数字;明确"不是诊断";预设停止规则;同时安排心理支持。
(上句中的百分数与 §5.4 的患病率 / 特异性设置实时联动——请在演示时先在 §5.4 选定与本院实际相符的人群,再回到此处朗读,数字自动更新。)

阴性("未检出癌症信号")

「这次没有发现肿瘤信号,这是好消息,但它不能排除癌症。这项检查对早期、体积很小的肿瘤敏感度较低——早期癌症中大约只有不到两成能被它发现。 所以您原本该做的肠镜、乳腺、宫颈和肺部筛查一项都不能省,出现新症状也要及时就诊。」

要点:明确"不排除";反复强调不可替代常规筛查(这是 MCED 最重要的现实危害——虚假安心导致既有筛查依从性下降)。

知情同意必须包含的六项内容

① 该检测尚未被证明可降低癌症死亡率;② 阴性不排除癌症,且不可替代任何指南推荐的筛查;③ 阳性者中相当比例最终未发现癌症,并可能经历数月检查(中位 162 天); ④ 可能发现无需治疗的惰性病变(过度诊断);⑤ 可能提示血液系统异常(CHIP)等意外发现;⑥ 费用、隐私与数据使用安排。

6.3 四个虚拟病例(覆盖真阳性 / 假阳性 / 假阴性 / 意外发现)

病例 1 · 真阳性且 TOO 正确理想情形62 岁女性 · 无症状 · 体检
基线62 岁女性,既往体健,吸烟 30 包年,末次 LDCT 为 3 年前(阴性)。参加研究性 MCED 检测。
检测结果检出癌症信号;TOO 首选「肺」(概率 0.71),次选「头颈」(0.12)。
第一步复核无近期感染 / 手术;血常规正常;确认其结直肠癌与宫颈癌筛查均已按指南完成。
定向检查(第 9 天)胸部增强 CT:右上叶 15 mm 实性结节,伴轻度纵隔淋巴结显示。PET-CT:结节高代谢,无远处转移。
确诊与处理(第 31 天)胸腔镜楔形切除 + 淋巴结采样:浸润性腺癌,pT1bN0M0(ⅠA2 期)。未行辅助治疗,进入随访。
教学要点

① 这类情形是 MCED 的目标场景,但请注意该患者本身就符合 LDCT 筛查条件——LDCT 已有 RCT 支持的死亡率获益并被推荐I,而 MCED 没有。 正确的表述是"MCED 促成了本应通过 LDCT 完成的早诊",而非"MCED 优于 LDCT"。② 单个成功病例不能作为效用证据——这正是需要 RCT 的原因。

病例 2 · 假阳性(CHIP 相关)最常见的困境71 岁男性 · 无症状
基线71 岁男性,高血压,因"想全面查一下"自费接受 MCED。
检测结果检出癌症信号;TOO 无法给出预测(各组织概率均 <0.3)。
第一步(第 5 天)血常规:轻度大红细胞性贫血,MCV 101 fL;LDH 正常。体检与病史无定位线索。
结构化评估(第 12–60 天)全身 PET-CT:无异常高代谢灶。胃镜、结肠镜:仅见胃体轻度萎缩性胃炎、2 枚 5 mm 结肠管状腺瘤(已切)。腹盆增强 MRI 阴性。
血液科评估骨髓形态与二代测序:DNMT3A 克隆(VAF 14%),符合不明潜能的克隆性造血(CHIP),未达 MDS 诊断标准。
结局(第 168 天)按预定停止规则终止排查,转入血液科年度随访 + 常规癌症筛查。患者经历约 5.5 个月焦虑、2 次内镜、1 次 PET-CT(有效剂量约 10–15 mSv 量级)与自费支出。
教学要点

无 TOO 预测的阳性结果应把 CHIP 与血液系统疾病放在鉴别诊断前列;② 假阳性的代价是可量化的(时间、辐射、费用、心理),必须在知情同意中提前说明; ③ 预设停止规则使危害有界;④ 顺带发现的结肠腺瘤属于"附带获益",但不能用来事后为一次假阳性辩护——那是典型的结果导向偏倚。

病例 3 · 假阴性(Ⅰ 期胰腺癌)最危险的误读58 岁男性
检测(第 0 天)58 岁男性,家族中一位一级亲属患胰腺癌。MCED:未检出癌症信号。患者理解为"没有癌症",遂推迟原计划的胃肠专科咨询。
第 5 个月出现上腹隐痛与体重下降 4 kg,自认为"检查过没问题",未就诊。
第 9 个月因梗阻性黄疸就诊。腹部增强 MRI + EUS-FNA:胰头腺癌,影像分期为可切除但已侵及血管边界(borderline resectable)。
教学要点

① 在当前工作点,Ⅰ 期敏感性仅 16.8%——阴性结果的信息量在早期癌中很小;② 虚假安心(false reassurance)是 MCED 目前最被低估的危害:它可能延迟对症状的评估,从而抵消早筛的理论获益; ③ 报告与沟通中必须明确"未检出"而非"阴性 / 正常";④ 有症状者不适用筛查逻辑,应直接进入诊断通道(这也是 SYMPLIFY 与 PATHFINDER 必须分开解读的原因)。

病例 4 · 过度诊断的可能情形最难沟通66 岁女性
检测66 岁女性,慢性肾病 3 期。MCED 检出癌症信号,TOO 首选「肾」。
定向检查腹部增强 MRI:左肾 2.2 cm 强化实性病灶,影像符合小肾癌(cT1a)。
MDT 讨论争议点:① 该大小的肾癌相当比例生长缓慢、转移风险低;② 患者肾功能储备有限,手术有加重 CKD 甚至透析风险;③ 主动监测(active surveillance)为可选方案。
决策经充分告知,患者选择主动监测 + 每 6 个月影像随访。24 个月内病灶增长 2 mm。
教学要点

① 这是真阳性,却可能是过度诊断——即发现了一个在其自然寿命内不会造成症状或死亡的病变IV; ② 过度诊断的比例无法在个体层面判定,只能通过 RCT 的长期随访在人群层面估计,这是 MCED 效用评价必须依赖 RCT 的关键理由; ③ 决策必须纳入竞争风险(此例为 CKD);④ "多发现一个癌"在统计上会同时提高检出率与生存率(领先时间偏倚 + 长度偏倚),但可能完全不改变死亡率——见 §7.3。

7

方法学局限:偏倚分类学、不可解决的问题与可缓解的问题

本节按 STARD / PROBAST 的偏倚域组织,并明确区分「可通过更好设计缓解」与「原理上无法在观察性研究中解决」的两类局限。

7.1 偏倚分类学总表

偏倚 / 局限在 MCED 研究中的具体表现影响方向可否缓解
A. 受试者选择域
谱偏倚
spectrum bias
病例来自已确诊、肿瘤负荷较大的患者;对照为健康志愿者。两组在分期、症状、合并症上系统不同敏感性高估可:前瞻性意向筛查队列
自选择偏倚PATHFINDER 参与者以高教育、高收入、白人为主外推性受限部分:分层抽样
癌谱不匹配训练队列以西方癌谱为主;中国食管癌、肝癌、胃癌占比显著更高方向不可预测可:本地队列重验证
B. 指标检测域
阈值事后选择在验证集上挑选最优阈值后报告该点性能性能高估可:预先锁定阈值
分析前变量差异癌与非癌样本采集于不同中心 / 时期 / 流程可造成虚假信号可:随机化 + 盲法处理
数据泄漏特征选择 / 归一化 / 批次校正在全数据上完成(§4.4)性能高估可:嵌套 CV
C. 参考标准域
不完整参考标准阴性者不做全身影像证实,仅以随访期内未确诊为准;随访期内未发现的癌被错分为真阴性特异性高估、敏感性高估部分:延长随访
验证偏倚
work-up bias
仅阳性者接受彻底检查(DETECT-A 类设计中尤为突出PPV 高估部分:随机抽样彻查阴性者
随访时长不足12 个月随访无法识别缓慢生长的病变,也无法评估过度诊断过度诊断被隐藏难:需 >10 年随访
D. 结局解读域(最关键)
领先时间偏倚
lead-time bias
提前诊断自动延长"从诊断到死亡"的时间,即使死亡日期完全未变生存率虚假改善仅 RCT 可排除
长度偏倚
length bias
筛查优先捕获生长缓慢、在体内停留久的病变预后虚假改善仅 RCT 可排除
过度诊断发现永不致病的病变,患者接受本不需要的治疗危害被系统性低估仅长期 RCT 可量化
替代终点谬误以"检出率""分期分布"替代死亡率作为获益证据结论不成立须以死亡率为终点
表 7-1 偏倚分类学。D 组四项是本领域最本质的局限:它们无法通过增大样本量、改进算法或延长观察性随访解决,只能由随机对照试验解决。

7.2 不完整参考标准:一个具体的数字推演

设 10 万名受筛者,真实 1 年癌症发病率 1%(1 000 例),其中 约 300 例在采血时已存在但当年未被任何手段确诊(亚临床、未被发现)。研究通常将这 300 例中检测阴性者判为"真阴性"。

处理方式被计入的"无癌"人数报告特异性解释
随访 12 个月(常规做法)99 00099.50%亚临床癌中的假阴性被错分为真阴性 → 分母被"净化"
假设随访 5 年后回溯校正98 700≈99.4–99.5%特异性变化不大(因分母巨大),但敏感性会明显下降:亚临床癌进入分子后多为阴性
教学示意推演。要点:不完整参考标准对特异性影响有限,对敏感性影响显著——因为敏感性的分母(真癌数)小得多,增加 300 例难检出的亚临床癌足以拉低整体敏感性数个百分点。这解释了为何前瞻性研究中的敏感性通常低于病例对照研究。

7.3 为什么"生存率提高"不能证明筛查有效:三张图的思想实验

① 领先时间偏倚

某患者若 65 岁经症状确诊、68 岁死亡,5 年生存率 = 0%。若筛查使其 62 岁被诊断、仍然 68 岁死亡,则 5 年生存率 = 100%。 生存率从 0 变成 100%,而患者一天都没有多活。任何以"筛查组 5 年生存率更高"为卖点的宣传都应立即被质疑

② 长度偏倚

筛查像一张在时间轴上撒下的网:停留时间长(生长慢)的病变更容易被网住。因此筛查检出的癌症在生物学上系统性地更"温和",其预后本就更好——与治疗是否更早无关。

③ 过度诊断

若筛查发现了大量永不致病的病变,则分母中加入了大量"必然存活"者,生存率必然上升、癌症发病率上升,而死亡率毫无变化。这是"筛查越积极、数据越漂亮、人群获益为零"的经典陷阱

因此,唯一可接受的效用终点是

癌症特异死亡率(首选)与全因死亡率(更稳健),以及作为中间终点的「晚期(Ⅲ–Ⅳ 期)癌症发病率下降」——后者是 NHS-Galleri 试验采用的主要终点,因为它对领先时间偏倚免疫(分期迁移不受诊断时点的算术影响),且样本量需求远低于死亡率终点I但请注意:即使分期迁移被证实,也仍需死亡率数据才能确认获益——乳腺癌与前列腺癌筛查史上都出现过"分期迁移明显、死亡率获益有限"的情形。

7.4 建模与统计层面的具体局限(本演示模型自陈)

本系统外推模型的局限

  • 双正态假设在 ROC 极端尾部(特异性 >99%)缺乏经验支持,而筛查恰恰只用这一段
  • σ = 1.8 为人为设定,改变 σ 会显著改变外推曲线形状(可自行验证:σ 越大,低特异性端敏感性提升越平缓);
  • 分期曲线共用同一 σ,实际上各分期的信号异质度不同;
  • 癌种敏感性为合成值,仅保留相对次序;
  • PPV / NPV 计算假设检测特性在不同人群中恒定——这一假设在实践中经常不成立(谱偏倚)。

真实研究中同样存在的统计局限

  • 亚组点估计不可靠:单个癌种 / 单个分期的样本量常仅数十例,CI 极宽,不应用于产品声称;
  • 多重比较:数十个癌种 × 四个分期 = 上百个亚组比较,未校正即报告"某癌种敏感性达 90%"属选择性报告;
  • 校准无法在低患病率下有效验证(§4.5);
  • 竞争风险:老年人群中非癌死亡的竞争风险会稀释筛查获益,需在建模中显式处理;
  • 缺失数据:QC 不合格样本若与疾病状态相关(如晚期患者 cfDNA 更多、更易合格),删除即引入偏倚。
8

与现行筛查体系的关系:定位、指南立场、监管现状与证据缺口

本节回答科室宣讲与合作洽谈中最常被追问的问题:「这个东西现在能不能用?和肠镜、LDCT 是什么关系?国内外指南怎么说?」

8.1 MCED 与已获推荐的单癌种筛查:证据等级的量级差异

筛查手段目标癌种死亡率获益的直接证据代表性推荐证据
低剂量 CT(LDCT)肺癌(高危吸烟者):多项 RCT 显示肺癌死亡率下降USPSTF B 级(50–80 岁 / 20 包年 / 现吸或戒烟 <15 年)I
结肠镜 / FIT / 多靶点粪便 DNA结直肠癌:RCT 与长期队列显示死亡率与发病率下降USPSTF A 级(50–75 岁)、B 级(45–49 岁);中国指南推荐 FIT / 结肠镜 / 多靶点 FIT-DNAI
钼靶 X 线乳腺癌:RCT 荟萃显示死亡率下降(幅度与过度诊断仍有争议)USPSTF BI
HPV 检测 / 细胞学宫颈癌:发病率与死亡率均显著下降USPSTF AI
AFP + 腹部超声肝癌(高危:HBV / HCV / 肝硬化)部分:队列与部分 RCT 支持国内外肝癌指南推荐高危人群每 6 个月监测II
PSA前列腺癌有争议:获益小、过度诊断显著USPSTF C 级(55–69 岁个体化决策)I
cfDNA 甲基化 MCED泛癌种(含无筛查手段的癌种):尚无任何 RCT 报告死亡率或分期迁移结果无任何主流指南推荐用于常规筛查IIIII
血液 cfDNA 结直肠癌筛查(单癌种)结直肠癌已有大型前瞻性研究报告诊断准确性;对进展期腺癌敏感性低可作为不愿接受其他方式者的次选;不优于结肠镜或 FITII
表 8-1 证据等级对照。核心信息:MCED 与已获推荐筛查之间的差距不是"效果差一点",而是"证据层级相差一整级"——前者尚无以人群结局为终点的 RCT 结果,后者有。

8.2 主要机构与监管立场(截至本版本编制时)

专业机构立场

  • USPSTF:未对 MCED 作出推荐;其现有推荐仅覆盖上述单癌种筛查
  • NCCN / ASCO 类机构:立场一致——MCED 不应用于常规临床筛查,仅建议在临床试验框架内使用;同时强调不得因 MCED 结果而减少既有筛查。
  • 中国:结直肠癌筛查指南推荐 FIT / 结肠镜 / 多靶点 FIT-DNA;ctDNA 相关共识普遍认为血液泛癌筛查证据不足,不推荐用于无症状人群常规筛查
  • 国家级研究布局:美国 NCI 已启动 MCED 可行性研究(Vanguard 类研究),目的正是为将来的大型 RCT 奠定基础——这本身即是"证据尚不充分"的官方确认。

监管与支付现状

  • 泛癌种血液甲基化检测:目前主要以实验室自建检测(LDT / CLIA)形式提供,未获 FDA 上市前批准用于人群筛查;已获"突破性设备"认定不等于获批。
  • 单癌种血液检测:已有血液 cfDNA 结直肠癌筛查检测获 FDA 批准;更早的 SEPT9 甲基化检测亦曾获批,但敏感性 / 特异性均不及 FIT。
  • 中国 NMPA:已有单癌种产品(粪便 FIT-DNA、肝癌相关甲基化标记)获三类证;泛癌种血液甲基化检测尚无获批用于无症状人群筛查的适应证
  • 支付:美国 Medicare 覆盖 MCED 需专门立法授权(相关法案仍在推进);中国基本医保未覆盖。费用与可及性是健康公平的重要考量
合作洽谈时的诚实表述模板

「我们的检测在分析效度(LoD、精密度、重复性)与临床效度(病例对照 + 前瞻性队列的敏感性 / 特异性)上已有数据; 在临床效用(能否降低死亡率、能否改变分期分布)上,全行业目前都没有完成的证据,我们的定位是在研究框架内积累这一层证据。」 —— 这个表述既准确、又不损害项目价值,且能立即建立与临床专家的信任。反之,把病例对照数据表述为"临床验证通过"会在专业听众面前迅速失分。

8.3 证据缺口矩阵(ACCE 框架)

证据层级关键问题当前状态补齐所需研究GRADE
分析效度检测能否稳定、可重复地测出目标信号?基本具备:LoD、精密度、干扰、稳定性可通过实验建立(§3.9)方法学比对、多中心重复性研究
临床效度
诊断准确性
阳性 / 阴性与"是否患癌"的关联有多强?已有相当证据:病例对照+ 前瞻性队列;但 Ⅰ 期敏感性低、人群外推性有限多癌谱、多种族前瞻性队列;本地人群重验证
临床效用
结局改善
使用它能否让人活得更久 / 更好?基本空白:无 RCT 结局数据;建模研究提示可能获益但依赖强假设大型 RCT(NHS-Galleri 等),主要终点为晚期发病率 / 死亡率极低
危害评估假阳性、过度诊断、虚假安心的净危害有多大?严重不足:假阳性下游负担有初步数据(中位 162 天);过度诊断比例完全未知RCT 长期随访 + 系统性危害登记极低
卫生经济与公平成本效果如何?是否会扩大健康不平等?仅有建模研究,对敏感性、依从性、下游成本的假设高度敏感基于 RCT 实测参数的经济学评价;可及性研究极低
伦理与法律意外发现(CHIP)、心理影响、保险歧视、数据治理如何处理?框架初步:需前置的知情同意与结果返回政策(§6.2)伦理研究 + 政策制定
表 8-2 ACCE 框架下的证据缺口矩阵本表建议作为任何 MCED 学术汇报的收尾幻灯片:它诚实、结构清晰,并自然指向"我们应该做什么研究"。

8.4 合理定位建议:MCED 应当放在什么位置

✓ 合理用途

  • 临床试验 / 注册研究框架内使用,并系统采集结局与危害数据;
  • 作为无筛查手段癌种(胰腺、卵巢、食管、肝、胆道)的探索性补充;
  • 已完成全部指南推荐筛查的人群中作为额外选项,并充分知情同意;
  • 症状人群的诊断分流研究(与筛查用途严格区分)

✗ 不合理用途

  • 替代结肠镜 / LDCT / 钼靶 / HPV 筛查;
  • 向公众宣传为"一次抽血查全身癌症";
  • 用于低患病率人群(如 40 岁以下健康人群)——PPV 会跌至个位数;
  • 以"5 年生存率提高"作为效果证据(§7.3);
  • 无停止规则的阳性后检查升级。

◇ 值得推进的研究方向

  • 富集高危人群(年龄 + 吸烟 + 家族史 + 代谢/病毒因素)以提升验前概率,从而提升 PPV;
  • 纵向多次采样(利用个体基线,检测"信号轨迹"而非单点阈值)以突破单次采样极限
  • 面向中国癌谱重建面板(食管、胃、肝、鼻咽)并本地前瞻验证
  • 与影像 / 蛋白标志物的联合分流策略与成本效果评价
9

报告规范自评:STARD 2015 与 TRIPOD+AI 核对表

下表为本演示系统自身对照报告规范的自评结果。已满足部分满足未满足(演示系统固有限制)

9.1 STARD 2015 关键条目

9.2 TRIPOD+AI 关键条目

如何使用这两张表

研究设计阶段逐条填写,可提前发现设计缺陷(尤其是参考标准、阈值锁定、样本量三项);在论文投稿阶段作为附件提交;在阅读他人 MCED 文献时逐条核查,可快速判定其结论的可信度。 同时建议用 PROBAST 评估偏倚风险的四个域(受试者、预测因子、结局、分析)——本领域绝大多数发表研究在分析域为高风险。

10

参考文献

正文首次引用顺序自动编号(Vancouver 风格)。点击任一条目可高亮;点击正文上标可跳转至此。

    引用核查提示

    本演示系统为教学用途整理文献信息,在正式学术场合使用前请自行核对卷期页码与最新版本(指南与共识类文献版本更新频繁;监管状态随时间变化)。凡本系统标注为 教学示意 的数值均无文献来源,不可引用。

    cfDNA 甲基化泛癌早期筛查模型 · 学术演示系统 v1.0 | 演示模型 cfMe-Pan v0.9(非真实产品)
    本文件为单页离线 HTML 应用,无外部依赖、无网络请求、无数据上传;所有交互计算在本地浏览器内完成。
    本系统不是医疗器械,不用于疾病诊断或治疗决策。数值分为「文献实测 / 参数外推 / 教学示意」三类并逐一标注;方法学局限见 §7,与指南的关系见 §8。
    建议演示顺序:§1 模型卡 → §2 机制 → §3 技术路线 → §4 建模 → §5 性能(现场拖动患病率滑块)→ §6 病例 → §7 局限 → §8 指南与证据缺口。