cfDNA 甲基化泛癌早期筛查模型 · 全链条学术演示
⚠ 使用声明(建议在任何演示场合首先呈现)
1. 本系统是方法学教学与学术沟通工具,不是医疗器械、不是诊断报告、不构成任何临床决策依据。 其中的「cfMe-Pan v0.9」是为演示而构造的参考模型,并非任何已上市或在研商业产品。
2. 数值分三类并逐一标注:文献实测取自同行评议文献并附上标引用; 参数外推以文献工作点为锚、经双正态 ROC 模型外推,用于展示阈值权衡的形状而非精确性能; 教学示意为合成数据,仅用于说明方法学概念。
3. 截至本版本,尚无任何泛癌种血液甲基化检测被证明可降低癌症死亡率,亦无国内外主流指南推荐其用于无症状人群的常规筛查; 唯一以人群结局为终点的大型随机对照试验(NHS-Galleri)结果尚未公布。MCED 不能替代任何已获推荐的单癌种筛查。
概览与模型卡(Model Card / TRIPOD 式结构化披露)
在展示任何性能数字之前,先明确「这个模型是什么、为谁设计、用什么数据训练、在什么人群验证、不适用于谁」。这是 TRIPOD 与 PROBAST 对预测模型报告的基本要求。
1.1 关键性能一览(文献锚点)
解读:同一支检测的三个 PPV 为何相差两倍以上
PPV 不是检测的固有属性,而是检测特性 × 人群患病率的函数。同一支敏感性 / 特异性不变的检测,在症状人群(患病率 ≈6.7%)中 PPV 可达 75.5%, 在无症状 50 岁以上人群(确诊率 ≈0.5–1.4%)中降至 38.0%,若用于 40 岁以下低患病率人群则会跌至个位数。 「把症状人群数据用于宣传筛查价值」是本领域最常见的证据误用,属于 STARD 明确要求披露的人群谱偏倚。§5.4 提供可交互计算器量化这一效应。
1.2 模型卡(cfMe-Pan v0.9 · 演示用)
| 条目 | 内容 | 溯源 |
|---|---|---|
| 预期用途 | 在无症状成人中检出存在癌症信号(二分类),并对阳性者预测组织起源(TOO,多分类),用于引导后续确诊路径。不用于确诊、分期、疗效监测、复发监测或遗传易感评估。 | 设定 |
| 目标人群 | 50–79 岁、无癌症相关症状、5 年内无恶性肿瘤治疗史、非妊娠、无活动性造血系统疾病者。与 PATHFINDER 入组框架一致 | 对齐 |
| 明确不适用 | ① 有可疑症状者(应走诊断通道而非筛查);② 近期输血 / 造血干细胞移植;③ 活动性感染或自身免疫病急性期;④ 已知高负荷克隆性造血(CHIP);⑤ 妊娠或产后 3 个月内;⑥ 实体器官移植受者。 | 设定 |
| 输入 | 外周血 10 mL × 2(cfDNA 稳定管);提取 cfDNA ≥10 ng;靶向甲基化捕获测序(105 量级 CpG / 数千 DMR)+ 片段长度与末端基序特征。 | 设定 |
| 输出 | ① 癌症信号:检出 / 未检出(二分类,阈值预先锁定);② 若检出,给出 TOO 首选与次选预测及概率。不输出连续风险评分,以避免被误读为"癌症概率"。 | 设定 |
| 阈值策略 | 训练阶段将特异性锁定为 99.5%(每 1 000 名无癌者约 5 例假阳性),阈值在锁定验证集揭盲前固定,验证阶段不再调整。 | 对齐 |
| 训练 / 验证数据 | 演示参数锚定于 CCGA 系列:子研究 1(三种技术路线正面比较)、子研究 3(独立锁定验证,n=4 077;癌 2 823 / 非癌 1 254);前瞻性性能锚定 PATHFINDER(n=6 662)与 SYMPLIFY(n=5 461)。 | 实测 |
| 参考标准 | 阳性者:组织病理学确诊;阴性者:仅以随访期内未确诊癌症作为替代(不完整参考标准,见 §7.2)。 | 实测 |
| 性能小结 | 见 §1.1 与 §5;核心弱点:Ⅰ 期敏感性仅 16.8%,约 5/6 的 Ⅰ 期癌症被漏检。 | 实测 |
| 公平性 / 亚组 | PATHFINDER 入组以白人、高教育、高收入人群为主;亚洲人群及不同癌谱(中国食管癌、肝癌、胃癌高发)下的性能未经验证,不可直接外推。 | 实测 |
| 算法治理 | 锁定算法(locked algorithm):版本冻结、变更须重新验证;不采用在线自适应学习。 | 设定 |
| 已知失效模式 | 低脱落肿瘤(部分早期前列腺癌、甲状腺癌、肾癌、脑肿瘤)敏感性极低;CHIP、炎症、良性病变、妊娠可致假阳性;ctDNA 分数 <0.01% 时在采样层面不可检出。 | 实测 |
1.3 证据等级与推荐强度标注体系
诊断性研究证据等级(改编自 Oxford CEBM)
GRADE 证据质量(针对"某一结局"而非"某项研究")
GRADE 的关键要求:证据质量须按结局分别评定。同一支检测,"能检出癌症信号"的证据质量可为中等,而"能降低癌症死亡率"的证据质量则为极低。
| 检出癌症信号(分析 / 临床效度) | 中 |
| 预测组织起源(TOO) | 中 |
| 提高早期(Ⅰ–Ⅱ 期)检出比例 | 低 |
| 降低晚期癌症发病率(分期迁移) | 极低 |
| 降低癌症特异死亡率 | 极低 · 无直接证据 |
| 降低全因死亡率 | 极低 · 无直接证据 |
贯穿全系统的核心命题
「能检出」≠「早期能检出」≠「早检出能改变结局」。这三级跳跃分别对应分析效度(analytic validity)、临床效度(clinical validity)与临床效用(clinical utility)——即 ACCE 框架。 目前 cfDNA 甲基化 MCED 在前两级已积累相当证据,在第三级基本为空白。§8.3 以矩阵形式量化这一证据缺口。
分子机制:cfDNA 甲基化为何能承载"癌症信号 + 组织起源"双重信息
早筛检测的性能上限由生物学决定,而非算法。理解 cfDNA 释放动力学、甲基化改变的时序与空间特异性,才能理解为什么 Ⅰ 期敏感性只有 16.8% 而 Ⅳ 期可达 90%。
2.1 cfDNA 的来源、丰度与动力学:信号的"分母"问题
血浆 cfDNA 主要来自凋亡 / 坏死细胞经核小体消化后的释放产物,主峰长度约 167 bp(核小体缠绕 147 bp 加连接区),并呈约 10 bp 周期性阶梯IV。 健康人血浆 cfDNA 浓度约 1–10 ng/mL(约 300–3 000 个单倍体基因组当量 / mL),半衰期仅 16 分钟至 2.5 小时,因此 cfDNA 是一份近实时的全身细胞死亡快照。
甲基化去卷积研究表明,健康人 cfDNA 绝大部分来自造血系统III。这一背景构成早筛的根本困难:
| 健康人 cfDNA 组织来源 | 占比 | 对早筛的含义 |
|---|---|---|
| 中性粒细胞 | ≈32% | 造血来源合计 ≈55–65%:① 构成主要背景噪声;② CHIP 克隆的异常改变会伪装成"肿瘤信号" |
| 淋巴细胞 | ≈12% | |
| 单核细胞 | ≈4% | |
| 巨核细胞 / 红系祖细胞 | ≈4% | |
| 血管内皮细胞 | ≈9% | 与炎症、心血管事件相关的波动来源 |
| 肝细胞 | ≈1% | 脂肪肝 / 肝炎时显著升高 → 假阳性风险 |
| 其他实体组织合计 | <10% | 早期肿瘤信号须在此微弱层次中被识别 |
信噪比的量级估算
设血浆 cfDNA 为 10 ng/mL(≈3 000 GE/mL),提取 4 mL 血浆得 ≈12 000 GE。若某 Ⅰ 期实体瘤的 ctDNA 分数为 0.01%:
这意味着:在单个 CpG 位点上,肿瘤信号可能只有 0–2 条 reads。任何单位点判读都不可能稳定;只有把成百上千个共变位点联合建模(并优先使用同一条 read 内多个 CpG 的共甲基化模式),才能把独立噪声压低到可用水平。这正是甲基化优于点突变的数学根源,也是 §4.1 特征工程的出发点。
不可逾越的采样下限
基于肿瘤脱落速率的数学建模显示,直径 <1 cm 的肿瘤在 10 mL 血中可能连一个 ctDNA 拷贝都不存在;提高测序深度无法突破这一采样极限,只能靠增加血量或提高采样频率IV。这是"越早越好"这一直觉的硬约束。
2.2 肿瘤甲基化改变:早发生、高密度、组织特异
① CpG 岛启动子超甲基化
抑癌基因(CDKN2A、MLH1、BRCA1、RASSF1A、SEPT9 等)启动子 CpG 岛获得 5mC → 转录沉默。属肿瘤发生的早期事件,在癌前病变阶段即可出现IV。
② 全基因组低甲基化
部分甲基化域(PMD)、重复序列、LINE-1 等广泛去甲基化,累及数十至数百 Mb,是信号总量最大的改变类型,适合 cfMeDIP-seq 与低深度全基因组策略捕获III。
③ 组织身份被保留
肿瘤在获得异常甲基化的同时,保留大量来源组织的正常甲基化印记。这使同一份数据既能判断"有癌",又能判断"来自何处"——TOO 预测的生物学基础III。
为什么甲基化优于体细胞突变(同一批样本的正面比较)
CCGA 子研究 1 在同一批样本上直接比较了靶向测序(突变)、全基因组测序(拷贝数)与全基因组亚硫酸氢盐测序(甲基化)三条路线, 结论是甲基化路线在敏感性与特异性上均最优,因而被选为后续开发方向III;后续对多类 cfDNA 特征(甲基化、片段组、拷贝数、突变、蛋白)的系统评估亦支持甲基化为单一最强特征类。机制层面有四点原因:
- 信息密度:人基因组约 2 800 万个 CpG,肿瘤中改变的 CpG 可达数十万至数百万个;而单个肿瘤的驱动突变通常仅数十个。每个 cfDNA 分子可携带多个信息位点,等效于把"稀有事件计数"转化为"模式识别"。
- 共变结构:DMR 内相邻 CpG 高度共甲基化,可在单条 read 内部联合判读(甲基化单倍型 / methylation haplotype),把误判概率从"每位点 10⁻³"量级压到"每分子 10⁻⁶"量级。
- 克隆性造血干扰更可控:CHIP 导致的高频白细胞来源突变是突变法假阳性主要来源,需配对白细胞测序过滤III;甲基化法虽同受造血背景影响,但其组织特异模式可在去卷积层面被识别与扣除。
- 可定位:突变几乎不含组织信息(TP53 突变可来自任何癌种),而甲基化天然编码组织身份。
交互 · 差异甲基化区域(DMR)图谱
点击任一色块查看该 DMR 的注释。行 = DMR,列 = 样本组;颜色 = β 值(蓝 0 =去甲基化,红 1 =高甲基化)。
DMR × 样本组 甲基化矩阵 教学示意:基因 / 方向真实,数值合成
DMR 注释
点击矩阵中任一色块,查看基因、CpG 数目、改变方向、组织特异性与代表文献。
2.3 片段组学:与甲基化正交的第二维信号
ctDNA 的片段长度分布较非肿瘤 cfDNA 系统性偏短(主峰左移约 10–30 bp,<150 bp 比例升高),并具特征性末端基序与"锯齿状末端"III。 该维度与甲基化近似正交,可在同一份测序数据中"免费"获得,是提升低肿瘤负荷敏感性的重要补充。
交互 · 片段长度分布与体外富集模拟 教学示意:双峰混合模型
方法学提示
片段选择提高的是相对肿瘤分数,但绝对肿瘤分子数只会减少。当肿瘤分子数已接近个位数(§2.1),富集收益可能被泊松采样噪声抵消甚至反转。是否做体外 / 生信富集必须由 LoD 实验数据判定,不能靠直觉。
2.4 生物学噪声:假阳性与假阴性的机制清单
| 干扰因素 | 机制 | 主要影响 | 证据 |
|---|---|---|---|
| 假阳性方向 | |||
| 克隆性造血(CHIP) | 年龄相关造血克隆携带异常表观 / 基因组改变,随血细胞更新持续入血;70 岁以上检出率可达 10–20% | 特异性下降,与年龄强相关 | II |
| 年龄相关甲基化漂移 | 表观遗传时钟效应使部分 CpG 岛随年龄渐进性甲基化,方向与肿瘤信号一致 | 老年人群假阳性升高 | IV |
| 炎症 / 感染 / 自身免疫 | 组织损伤致特定器官 cfDNA 释放激增,去卷积被"点亮" | TOO 误判;假阳性 | III |
| 良性增生与癌前病变 | 结肠腺瘤、Barrett 食管、肝硬化等已具部分甲基化改变 | "真阳性但非癌",引发过度检查 | III |
| 妊娠 / 近期输血 / 移植 | 引入外源基因组与胎盘特异甲基化模式 | 模式紊乱,须列为禁忌 | IV |
| 剧烈运动 / 创伤 / 手术 | 肌肉、内皮来源 cfDNA 短时激增(可达数十倍) | 建议采血前 24–48 h 规避 | IV |
| 假阴性方向 | |||
| 低脱落表型 | 增殖 / 凋亡指数低、血供差、被基质包裹(部分前列腺癌、甲状腺癌、肾癌) | 癌种间敏感性差异达数倍 | III |
| 解剖屏障 | 中枢神经系统肿瘤受血脑屏障限制,血浆 ctDNA 极低 | 脑肿瘤基本不可检出 | III |
| 肿瘤体积过小 | 脱落速率 × 体积 < 采样检出下限(§2.1 采样极限) | Ⅰ 期敏感性低的主因 | IV |
| 背景 cfDNA 稀释 | 肥胖、剧烈运动、溶血导致正常 cfDNA 背景升高 → 肿瘤分数被稀释 | BMI 高者敏感性可能下降 | IV |
实验技术路线:从静脉穿刺到甲基化矩阵的 9 个环节与质控阈值
早筛检测的失败大多不在算法,而在分析前变量(pre-analytical variables)。本节逐环节给出操作要点、失效模式与可量化的质控阈值。点击任一环节展开细节。
为什么把湿实验放在算法之前讲
ctDNA 分数在早期癌中常低至 0.01–0.1%(§2.1)。任何一步分析前误差都会以数量级方式压倒模型的判别能力:采血后延迟离心 6 小时可使白细胞裂解释放的基因组 DNA 增加数倍,从而把肿瘤分数稀释一个数量级——这是无法用任何算法补救的。CLSI 对分子诊断的分析性能验证(LoD、精密度、干扰、稳定性)提出了明确的实验设计要求。
血样采集 分析前关键环节
操作要点:21G 及以上针头,弃去前 2 mL(减少穿刺损伤细胞),轻柔颠倒混匀 8–10 次,室温直立保存;禁止气动传送、剧烈震荡、冷冻全血。
管型选择的权衡:K₂EDTA 管成本低但要求 ≤4–6 h 内完成血浆分离;含固定剂的 cfDNA 稳定管可在室温维持 3–7 天,代价是部分平台上 cfDNA 提取效率与片段完整性略有差异,更换管型属于分析前变量变更,必须重新做桥接验证。
失效模式:溶血(血浆呈红色)→ 白细胞 gDNA 大量释放 → 长片段污染、肿瘤分数被稀释;采血前 24–48 h 剧烈运动 → 肌肉来源 cfDNA 激增(假阳性风险,见表 2-2)。
双次离心分离血浆
第一次离心后吸取血浆时须距白膜层 ≥5 mm,宁可少取。第二次高速离心去除血小板与细胞碎片(血小板亦含线粒体 DNA,可干扰下游定量)。分装为 1–2 mL/管后 −80 ℃ 保存。
冻融次数是被普遍低估的误差源:每次冻融都会造成 cfDNA 片段化与损失,建议 ≤2 次,并在验证研究中把冻融次数作为协变量记录(TRIPOD 要求披露缺失与预处理细节)。
cfDNA 提取与定量
关键指标是"短片段回收率":不同提取试剂盒对 <100 bp 片段的回收差异显著,而 ctDNA 恰恰富集于短片段(§2.3),因此提取方法的选择会直接改变检测敏感性。试剂盒变更须重做 LoD 验证。
gDNA 污染判定:片段分析(Bioanalyzer / TapeStation)应见 167 bp 主峰与 ~330 bp 次峰;若出现 >1 000 bp 高分子量峰且占比 >10%,提示白细胞裂解,该样本应判为不合格而非"勉强上机"。
甲基化信息的转化:三条互斥路线 技术选型分水岭
| 路线 | 原理 | 优点 | 缺点 | 证据 |
|---|---|---|---|---|
| 亚硫酸氢盐 (bisulfite) | 未甲基化 C 脱氨为 U(读作 T),5mC 保持为 C | 金标准,参考数据最丰富 | 强烈降解 DNA(可损失 >80–90%),对低输入 cfDNA 极不友好;序列复杂度降低致比对困难 | IV |
| 酶法 EM-seq | TET2 氧化保护 5mC,APOBEC3A 脱氨未修饰 C | 非变性、DNA 损伤小,皮克级输入可行;覆盖更均一、GC 偏倚更小 | 酶批次差异需严格管控;成本较高 | III |
| TAPS | 直接检测 5mC / 5hmC 的碱基级转化,不破坏未修饰 C | 保留序列复杂度,同时读取 5mC 与 5hmC | 生态与参考数据较少;生信流程需自建 | IV |
转化率质控必须用外源对照:掺入完全非甲基化的 λ 噬菌体 DNA(测非 CpG C→T 转化率)与完全甲基化的 pUC19 DNA(测假转化率)。
文库构建与 UMI 标记
接头连接的时序很关键:「转化前连接」可保留原始双链配对关系,使同一原始分子的正负链可互为验证,把单链错误压低 1–2 个数量级;「转化后连接」流程简单但丧失双链一致性校验能力。在 0.01% 量级的信号面前,双链一致性往往是特异性的最后一道防线(与突变检测中 duplex sequencing 的逻辑相同)。
PCR 循环数应最小化以降低偏倚与重复;须记录每个样本的文库产率、插入片段分布、去重后有效分子数(这是 LoD 的真实分母)。
目标区域富集:三种策略的取舍
- 靶向甲基化捕获:探针覆盖预先筛定的数千个 DMR(105 量级 CpG)。深度高、成本可控,是目前临床级 MCED 的主流;代价是面板一旦锁定就无法回溯新标记,且面板筛选阶段的数据泄漏风险高(见 §4.4)。
- cfMeDIP-seq:用抗 5mC 抗体富集甲基化片段,无需转化、输入量低(纳克级),特别适合捕获全基因组低甲基化 / 超甲基化的整体格局III;代价是不提供碱基分辨率、抗体批次效应显著。
- WGBS / 低深度全基因组:信息最全、可回溯,适合发现阶段;成本与数据量在筛查规模下难以承受。
测序
每个批次必须包含:① 无模板对照(检测污染);② 已知甲基化水平的参考标准品(监控系统漂移);③ 掺入型阳性对照(低肿瘤分数细胞系混合,验证 LoD 稳定性)。这些对照的趋势图(Levey-Jennings)应纳入日常质量管理,而非仅在验证阶段使用。
生物信息处理
转化后序列复杂度下降(C→T),需专用比对器(bwa-meth / Bismark / BSBolt 类)并处理非对称链。输出两个层次的数据:
- 位点层:每个 CpG 的甲基化比例 β = M/(M+U),用于区域均值与经典统计;
- 分子层:每条 read 覆盖的 CpG 甲基化串(如
1101110),用于甲基化单倍型 / epiallele 分析——这是低肿瘤分数下敏感性的主要来源。
分析性能验证(IVD 视角)常被学术演示忽略
| 验证项目 | 设计要点 | 可接受标准(示例) |
|---|---|---|
| 检出下限 LoD | 细胞系 / 患者样本梯度稀释,≥3 批次 × ≥20 重复,用 probit 拟合 95% 检出浓度 | ctDNA 分数 0.05%(含 20 ng 输入) |
| 精密度 | 重复性(同批)与中间精密度(跨日 / 跨操作者 / 跨试剂批),≥20 天设计 | 评分 CV ≤ 10%;定性一致率 ≥ 95% |
| 分析特异性 | 非癌样本大样本量测试(决定 99.5% 特异性的置信度,见 §5.6 样本量计算器) | 特异性 ≥ 99.0%(下限) |
| 干扰物质 | 血红蛋白、胆红素、甘油三酯、常用药物;以及 gDNA 污染梯度 | 偏差 < 判定阈值的 1/3 |
| 稳定性 | 全血室温 / 4 ℃ 各时间点;血浆 −80 ℃ 长期;提取后 cfDNA | 与基线一致率 ≥ 95% |
| 携带污染 | 高肿瘤分数样本与阴性样本交替上机 | 阴性样本不出现假阳性 |
分析前变量核对清单(可直接用于研究方案与稽查)
① 管型与批号;② 采血至离心时间;③ 离心参数;④ 血浆体积与外观;⑤ 冻融次数;⑥ 提取试剂盒批号与洗脱体积;⑦ cfDNA 总量与片段分布;⑧ 转化试剂批号与对照转化率;⑨ 文库批次与测序运行 ID;⑩ 受试者采血前 48 h 的运动 / 感染 / 手术史。 以上每一项都应在数据库中作为字段存在,否则批次效应无法被诊断,更无法被校正——而"用批次校正方法处理与结局相关的批次"本身就是一种数据泄漏(§4.4)。
算法建模:特征工程、两阶段架构、阈值锁定与防泄漏验证设计
在 p ≫ n(特征数远超样本数)且患病率极低的场景中,验证设计的严谨性比模型选择更决定成败。本节按 TRIPOD+AI 的条目顺序展开。
4.1 特征工程:从 β 值到甲基化单倍型
| 特征类别 | 定义与计算 | 优势 / 局限 | 证据 |
|---|---|---|---|
| 位点 β 值 | β = M/(M+U);常做 logit(M 值)变换以稳定方差 | 简单、可解释;但在肿瘤分数 0.01% 时 Δβ 仅 10⁻⁴ 量级,被测序噪声完全淹没 | IV |
| DMR 区域均值 | 区域内所有 CpG 的加权平均甲基化 | 降噪、降维;但把"少数分子完全异常"与"多数分子轻度异常"混为一谈,损失关键信息 | III |
| 甲基化单倍型 / MHL | 统计单条 read 上连续 CpG 的共甲基化模式(如全甲基化 read 的比例、甲基化单倍型负荷) | 把"位点噪声"变成"分子证据",是低丰度检测的核心特征;要求 read 长度覆盖足够 CpG 密度 | III |
| 异常 epiallele 计数 | 直接计数"完全异常甲基化模式"的分子数(近似泊松计数) | 可给出分子级不确定度,天然适配极低分数场景;对测序错误敏感,需 UMI / 双链支持 | III |
| 组织去卷积分数 | 以参考甲基化图谱做非负最小二乘 / 概率模型,估计各组织贡献比例 | TOO 预测的主特征,可解释性强;受参考图谱完备性限制(罕见组织缺失即无法定位) | III |
| 片段组学特征 | 片段长度分布、末端基序频率、优先末端位置、片段化熵 | 与甲基化近似正交,可提升低负荷敏感性;受分析前变量(冻融、提取)影响大 | III |
| 拷贝数 / 非整倍体 | 由脱靶 reads 估计臂级拷贝数变化 | 成本近乎为零的附加特征;早期肿瘤中信号弱 | III |
4.2 两阶段架构:先"有没有",再"在哪里"
二分类。输入全部甲基化 + 片段组特征;输出单一评分,与预先锁定的阈值比较。
- 基学习器:弹性网 logistic 回归(可解释基线)、梯度提升树、read 级矩阵上的 CNN
- 集成:交叉验证外的 stacking,避免用同一折数据既训练基模型又训练元模型
- 阈值:在训练集固定特异性 = 99.5%,锁定后不再改动
仅对阶段一阳性者运行的多分类(约 15–25 个组织类),输出首选 + 次选预测及概率。
- 主特征:组织特异 DMR 的去卷积分数
- 输出两个候选而非一个,是为了匹配"影像 + 内镜"两条平行确诊路径的临床现实
- 报告须同时给出 top-1 与 top-2 准确率;仅报 top-2 会高估定位能力
为什么必须"两阶段"而不是"一个多分类模型"
若直接做「无癌 + 20 种癌」的 21 分类,则整体特异性由所有癌类阈值共同决定,难以把无癌人群的假阳性率精确控制在 0.5%。筛查场景中特异性是硬约束(§5.4 将展示 1% 的特异性差异如何使假阳性人数翻倍),因此把"是否有癌"独立成一个可精确控制阈值的二分类问题,是筛查产品的必然架构选择。
4.3 类别不平衡与阈值锁定:筛查建模的特殊性
在患病率 ≈1% 的人群中,若以准确率为优化目标,"全部判为阴性"即可获得 99% 的准确率——准确率在筛查场景中是无意义指标。正确做法是:
- 固定特异性、优化敏感性(而非优化 AUC)。AUC 是全阈值区间的平均表现,而筛查只使用极高特异性端的一个点;AUC 高的模型在 99.5% 特异性处未必更好。
- 用"部分 AUC(pAUC)"或"固定 FPR 下的敏感性"作为模型选择指标,与最终用途一致。
- 阈值必须在锁定验证集揭盲前确定。在验证集上挑选阈值再报告该阈值下的性能,是最常见且最严重的乐观偏倚来源之一(PROBAST 分析域高风险条目)。
4.4 防泄漏的验证设计(本节为方法学核心)
✗ 常见的六种数据泄漏
- 特征选择泄漏:在全数据上做差异甲基化筛选,再做交叉验证 → 敏感性被显著高估(在 p≫n 下可虚增数个百分点至十几个百分点)。
- 批次校正泄漏:用包含结局信息的全数据做 ComBat / 分位数归一化。
- 阈值泄漏:在验证集上选择使性能最优的阈值。
- 样本重复泄漏:同一受试者的多个时间点样本被分入训练与验证集两侧。
- 批次-结局混杂:癌症样本与对照样本在不同时间 / 不同中心处理 → 模型学到"批次"而非"癌"。
- 超参数泄漏:用同一折数据既调参又评估(须用嵌套交叉验证)。
✓ 应采用的设计
- 嵌套交叉验证:外层评估、内层调参;所有预处理(含特征选择、归一化)在外层训练折内部完成。
- 独立锁定验证集:预先定义、单次揭盲、结果无论好坏均报告(CCGA 子研究 3 的设计逻辑)。
- 批次随机化:癌 / 非癌样本在板位、批次、测序 run 上交错排列,并将批次作为随机效应建模。
- 按受试者分组划分(GroupKFold),而非按样本。
- 前瞻性意向筛查队列:这是从证据等级 III 跃升到 II 的唯一途径(PATHFINDER)。
- 外部时空验证:不同中心、不同年份、不同人群癌谱。
为什么"病例对照 AUC 0.95"往往不能兑现为"筛查可用"
病例对照设计中,癌症样本多来自已确诊、症状明确、肿瘤负荷较大的患者,而对照多为健康志愿者——两组在肿瘤负荷谱、年龄、合并症、采样流程上系统性不同。这构成 STARD 明确列举的谱偏倚(spectrum bias)与人为的病例混合。 其后果是可预测的:从病例对照到前瞻性筛查,敏感性通常明显下降,PPV 因患病率骤降而下降更剧烈。本系统 §5.3 用同一模型的两套曲线并列展示这一落差。
4.5 校准:被诊断模型研究普遍忽视的一环
判别(discrimination, AUC)回答"能否排序",校准(calibration)回答"预测概率是否等于真实风险"。校准不良的模型即使 AUC 很高,也会在临床决策中造成系统性误判——这是预测模型研究的"阿喀琉斯之踵"IV。
交互 · 校准曲线(含 Wilson 置信区间)
本演示模型为何"不输出连续概率"
在患病率 ≈1% 的人群中,校准评估本身极其困难:要在预测概率 0.5–0.9 的区间获得可用精度的观察发生率,需要极大样本量;而分层十分位在低患病率下每组事件数常为单位数,Wilson 区间宽到无法判读。
因此本演示模型(如同现有商业 MCED)只输出二分类结论。这是诚实的设计:与其给出一个校准无法验证的"癌症概率 62%",不如给出"检出癌症信号"并配合明确的 PPV 区间沟通(§6.2 沟通脚本)。
推论
任何 MCED 报告若向患者呈现"您的患癌概率为 X%",都应被要求出示该概率的校准验证数据(校准曲线、截距、斜率与样本量)。缺失即为过度声称。
4.6 样本量:为什么"验证 99.5% 特异性"如此昂贵
预测模型开发的最小样本量应基于目标精度而非经验法则(如 EPV=10)来推算。对筛查检测而言,最苛刻的约束来自特异性的置信区间宽度:
交互 · 样本量 / 精度计算器 解析计算
结论
—
4.7 可解释性与算法治理
可解释性
SHAP / 排列重要性可定位贡献最大的 DMR;组织去卷积输出本身即为"人类可读"的中间表示。但须警告:解释不等于因果,一个高贡献 DMR 可能只是批次或年龄的代理变量。
漂移监控
试剂批次、测序平台版本、人群构成变化都会造成分布漂移。应持续监控:阳性率、评分分布、TOO 分布、QC 指标趋势。阳性率异常升高首先应怀疑技术漂移而非疾病谱变化。
版本治理
锁定算法、版本号、变更控制、再验证触发条件(面板变更 / 试剂变更 / 模型重训)须写入质量体系文件。TRIPOD+AI 要求披露模型可获取性与版本信息。
性能验证:判别力、分期依赖性、人群依赖性与净获益
本节所有交互计算均基于公开的文献工作点与可核查的数学公式。凡超出文献报告点的取值,一律标注 参数外推并说明所用模型。
本节使用的外推模型(透明披露)
为展示"阈值移动如何改变敏感性",本系统采用双正态(binormal)ROC 模型:设无癌者评分 ~ N(0,1),癌症患者评分 ~ N(μ, σ²)。给定特异性 s,阈值 t = Φ⁻¹(s),则敏感性 = Φ((μ − t)/σ)。 取 σ = 1.8(反映癌症人群信号高度异质:早期低脱落者与晚期高脱落者混合),并用 CCGA 子研究 3 的工作点(特异性 99.5% 时敏感性 51.5%)反解 μ。分期曲线以同一 σ 分别锚定 Ⅰ/Ⅱ/Ⅲ/Ⅳ 期的报告敏感性。
该模型的用途与边界:它能正确呈现"高特异性区间敏感性对阈值极其敏感"这一定性规律与量级,但不应被引用为任何产品在非报告工作点上的性能。真实 ROC 未必服从双正态假设,尤其在极端尾部。
5.1 交互 · ROC 曲线与工作点选择
请注意这个权衡的陡峭程度
—
5.2 分期依赖性:早筛检测最重要的一张图
必须向临床同事明确说明的一点
该检测的敏感性与肿瘤负荷高度相关,而非与"是否早期"相关。Ⅰ 期 16.8% 与 Ⅳ 期 90.1% 的巨大落差意味着:MCED 检出的癌症会系统性偏向进展较快、脱落较多、体积较大的肿瘤。 这带来两个方向相反的后果:① 好消息——它更可能捕获侵袭性强的癌症,理论上更接近"有临床意义的早诊";② 坏消息——它对最有希望通过早诊治愈的微小病灶最不敏感,因此"提高早期检出比例"这一目标并不自动成立。§7.3 讨论由此产生的长度偏倚(length bias)。
5.3 癌种依赖性与组织起源(TOO)预测
TOO 性能与临床价值
TOO 的真实临床价值在于压缩确诊路径:无 TOO 时,一个"泛癌阳性"结果可能触发全身 PET-CT + 多学科会诊 + 多项内镜;有 TOO 时可优先针对 1–2 个器官系统。PATHFINDER 中,阳性者的诊断解决中位时间为 79 天(确诊癌者 57 天,最终未发现癌者 162 天)II。
注意这个"162 天"
最终未发现癌症者的诊断排查中位时间长于确诊癌症者,且部分受试者接受了侵入性检查。这就是假阳性的真实代价:不是一次抽血,而是数月的不确定、多次影像与内镜、以及相应的并发症与心理负担。
5.4 交互 · 人群患病率决定一切:PPV / NPV 计算器
每 100 000 名受筛者的结局分解(2×2 表)
| 实际有癌 | 实际无癌 | 合计 | |
|---|---|---|---|
| 检测阳性 | — | — | — |
| 检测阴性 | — | — | — |
| 合计 | — | — | 100 000 |
自动生成的解读句(可直接用于医患沟通)
—
把特异性从 99.5% 降到 99.0% 会发生什么?请亲手拖动滑块
在患病率 1% 的人群中,特异性由 99.5% → 99.0%(听起来只差 0.5 个百分点)会使每 10 万人的假阳性从约 495 例增至约 990 例,即下游不必要检查翻倍;而敏感性仅提升数个百分点。 这就是为什么筛查产品把特异性锁定在 99.5% 而不是 99.0%,也是为什么"提高敏感性"在筛查场景中往往不是正确的优化方向。
为什么模型在"患病率 1%"下算出的 PPV(≈51%)高于 PATHFINDER 实测的 38%?
这是一道值得在汇报中主动讲清的题,涉及三个独立因素:
- 实际特异性不同:PATHFINDER 观察到的特异性为 99.1%(而非预锁定目标 99.5%)。把上方滑块拖到 99.10% 即可看到 PPV 明显下降——0.4 个百分点的特异性差异对 PPV 的影响远大于直觉。
- 实际患病率不同:PATHFINDER 中经确诊的癌症仅约 0.5%(35 / 6 662),低于 50–79 岁人群年化全癌发病率的粗略估计。请点击"PATHFINDER 实测确诊率 ≈0.5%"预设。
- 敏感性来源不同:51.5% 来自病例对照验证集,存在谱偏倚(§4.4);前瞻性筛查人群的真实敏感性预期更低,因为其中的癌症以早期、低负荷者为主。
教学结论:任何"计算得到的 PPV"都必须同时声明所用的敏感性来源、特异性取值与患病率假设,三者缺一即不可解读。
5.5 决策曲线分析(DCA):净获益视角
敏感性 / 特异性不能直接回答"该不该用"。DCA 引入阈值概率 pt(临床上愿意为发现 1 例癌症而接受的最大"无谓检查数"的倒数关系),计算净获益IV:
如何读这张图
- 只要绿线高于 0 与灰线,在该阈值概率下使用检测优于两种极端策略。
- pt 的临床含义:pt=5% 表示"愿意为找到 1 例癌症而接受 19 例不必要的确诊性检查"。侵入性越低、危害越小的确诊手段,可接受的 pt 越低。
- 关键洞察:在患病率 1% 时,"全筛"策略(对所有人做 PET-CT / 内镜)的净获益在 pt 略大于患病率后即变为负值——这正是需要一个高特异性分流检测的原因。
- 局限:DCA 假设"检出即获益",未纳入过度诊断的危害。若相当比例的检出属于永不致病的惰性病变,则真实净获益低于图示。
当前设置下的判读
—
5.6 报告性能时必须同时给出的六项信息
① 研究设计
病例对照 / 前瞻性队列 / RCT;连续入组与否;是否为意向筛查人群。
② 参考标准
阳性与阴性各如何确认;阴性随访时长;有无验证偏倚(仅阳性者被彻查)。
③ 人群构成
年龄、性别、癌谱、分期分布、合并症;癌 / 非癌两组的可比性。
④ 工作点与阈值来源
阈值是预先锁定还是事后选择;报告点的特异性与置信区间。
⑤ 置信区间与样本量
所有比例须附 CI;分期 / 癌种亚组须给出各组 n(小样本亚组的点估计不可解读)。
⑥ 临床效用证据层级
是检出率、分期迁移,还是死亡率?三者不可互相替代(§8.3)。
临床决策路径、结果沟通与四个虚拟病例
一份 MCED 报告真正的临床风险,往往不在检测本身,而在结果被如何解读与如何行动。本节给出诊断路径、沟通脚本与四个覆盖典型情形的虚拟病例。
6.1 阳性结果的诊断路径(TOO 引导)
第一步 · 复核与情境评估(不要立刻开全套影像)
① 复核检测前置条件:近期感染 / 手术 / 输血 / 妊娠 / 剧烈运动?既往恶性肿瘤史?② 复核报告质控是否合格;③ 完成完整病史、体格检查与基础实验室(含血常规——异常血象提示需评估 CHIP 或血液系统疾病);④ 核查并补齐所有已获指南推荐的常规筛查(结直肠、乳腺、宫颈、肺)——它们的证据等级高于 MCED。
第二步 · 依 TOO 首选 / 次选预测启动定向检查
| TOO 预测 | 首选定向检查 | 补充 |
|---|---|---|
| 肺 | 胸部低剂量 / 增强 CT | 必要时 PET-CT、支气管镜 / 穿刺 |
| 结直肠 / 上消化道 | 结肠镜 / 胃镜 | 腹部增强 CT 或 MRI |
| 肝 / 胆 / 胰 | 上腹增强 MRI(含 MRCP)或增强 CT | AFP / CA19-9;超声内镜 |
| 卵巢 / 子宫 | 经阴道超声 + 盆腔 MRI | CA125 / HE4;妇科专科评估 |
| 淋巴 / 造血系统 | 血常规 + 外周血涂片 + LDH;颈胸腹盆 CT | 血液科评估;必要时骨髓 / 淋巴结活检 |
| 头颈 | 耳鼻喉专科内镜 + 颈部增强 CT / MRI | — |
| 无 TOO 预测 / 两候选相互矛盾 | 全身 PET-CT + MDT 讨论 | 按性别 / 年龄补齐常规筛查;避免无节制"撒网式"检查 |
第三步 · 若定向检查阴性:明确的"停止规则"是必需的
没有停止规则的诊断路径是假阳性危害的主要放大器。建议预先约定:完成一轮结构化评估(TOO 定向 + 常规筛查补齐 + 血液系统评估)后若仍无发现,则转为定期临床随访(如 6–12 个月复查症状与必要影像), 而不进入无限升级的检查循环。须向患者明确说明:假阳性可源于 CHIP、炎症、良性病变或技术因素(表 2-2),且 PATHFINDER 中最终未发现癌症者的排查中位时间达 162 天。
6.2 结果沟通脚本(可直接用于门诊与科室培训)
阳性("检出癌症信号")
「这项检查在您的血液中发现了可能来自肿瘤的 DNA 信号。它不是癌症诊断。在与您条件相近的人群中,出现这个结果的人里大约有 38% 最终确诊癌症,也就是说相当一部分人最终并没有癌症。 因此下一步是按提示的可能来源部位做针对性检查。我们会预先约定检查范围与结束时点,避免无止境的检查。」
要点:给出具体 PPV 数字;明确"不是诊断";预设停止规则;同时安排心理支持。
(上句中的百分数与 §5.4 的患病率 / 特异性设置实时联动——请在演示时先在 §5.4 选定与本院实际相符的人群,再回到此处朗读,数字自动更新。)
阴性("未检出癌症信号")
「这次没有发现肿瘤信号,这是好消息,但它不能排除癌症。这项检查对早期、体积很小的肿瘤敏感度较低——早期癌症中大约只有不到两成能被它发现。 所以您原本该做的肠镜、乳腺、宫颈和肺部筛查一项都不能省,出现新症状也要及时就诊。」
要点:明确"不排除";反复强调不可替代常规筛查(这是 MCED 最重要的现实危害——虚假安心导致既有筛查依从性下降)。
知情同意必须包含的六项内容
① 该检测尚未被证明可降低癌症死亡率;② 阴性不排除癌症,且不可替代任何指南推荐的筛查;③ 阳性者中相当比例最终未发现癌症,并可能经历数月检查(中位 162 天); ④ 可能发现无需治疗的惰性病变(过度诊断);⑤ 可能提示血液系统异常(CHIP)等意外发现;⑥ 费用、隐私与数据使用安排。
6.3 四个虚拟病例(覆盖真阳性 / 假阳性 / 假阴性 / 意外发现)
教学要点
① 这类情形是 MCED 的目标场景,但请注意该患者本身就符合 LDCT 筛查条件——LDCT 已有 RCT 支持的死亡率获益并被推荐I,而 MCED 没有。 正确的表述是"MCED 促成了本应通过 LDCT 完成的早诊",而非"MCED 优于 LDCT"。② 单个成功病例不能作为效用证据——这正是需要 RCT 的原因。
教学要点
① 无 TOO 预测的阳性结果应把 CHIP 与血液系统疾病放在鉴别诊断前列;② 假阳性的代价是可量化的(时间、辐射、费用、心理),必须在知情同意中提前说明; ③ 预设停止规则使危害有界;④ 顺带发现的结肠腺瘤属于"附带获益",但不能用来事后为一次假阳性辩护——那是典型的结果导向偏倚。
教学要点
① 在当前工作点,Ⅰ 期敏感性仅 16.8%——阴性结果的信息量在早期癌中很小;② 虚假安心(false reassurance)是 MCED 目前最被低估的危害:它可能延迟对症状的评估,从而抵消早筛的理论获益; ③ 报告与沟通中必须明确"未检出"而非"阴性 / 正常";④ 有症状者不适用筛查逻辑,应直接进入诊断通道(这也是 SYMPLIFY 与 PATHFINDER 必须分开解读的原因)。
教学要点
① 这是真阳性,却可能是过度诊断——即发现了一个在其自然寿命内不会造成症状或死亡的病变IV; ② 过度诊断的比例无法在个体层面判定,只能通过 RCT 的长期随访在人群层面估计,这是 MCED 效用评价必须依赖 RCT 的关键理由; ③ 决策必须纳入竞争风险(此例为 CKD);④ "多发现一个癌"在统计上会同时提高检出率与生存率(领先时间偏倚 + 长度偏倚),但可能完全不改变死亡率——见 §7.3。
方法学局限:偏倚分类学、不可解决的问题与可缓解的问题
本节按 STARD / PROBAST 的偏倚域组织,并明确区分「可通过更好设计缓解」与「原理上无法在观察性研究中解决」的两类局限。
7.1 偏倚分类学总表
| 偏倚 / 局限 | 在 MCED 研究中的具体表现 | 影响方向 | 可否缓解 |
|---|---|---|---|
| A. 受试者选择域 | |||
| 谱偏倚 spectrum bias | 病例来自已确诊、肿瘤负荷较大的患者;对照为健康志愿者。两组在分期、症状、合并症上系统不同 | 敏感性高估 | 可:前瞻性意向筛查队列 |
| 自选择偏倚 | PATHFINDER 参与者以高教育、高收入、白人为主 | 外推性受限 | 部分:分层抽样 |
| 癌谱不匹配 | 训练队列以西方癌谱为主;中国食管癌、肝癌、胃癌占比显著更高 | 方向不可预测 | 可:本地队列重验证 |
| B. 指标检测域 | |||
| 阈值事后选择 | 在验证集上挑选最优阈值后报告该点性能 | 性能高估 | 可:预先锁定阈值 |
| 分析前变量差异 | 癌与非癌样本采集于不同中心 / 时期 / 流程 | 可造成虚假信号 | 可:随机化 + 盲法处理 |
| 数据泄漏 | 特征选择 / 归一化 / 批次校正在全数据上完成(§4.4) | 性能高估 | 可:嵌套 CV |
| C. 参考标准域 | |||
| 不完整参考标准 | 阴性者不做全身影像证实,仅以随访期内未确诊为准;随访期内未发现的癌被错分为真阴性 | 特异性高估、敏感性高估 | 部分:延长随访 |
| 验证偏倚 work-up bias | 仅阳性者接受彻底检查(DETECT-A 类设计中尤为突出) | PPV 高估 | 部分:随机抽样彻查阴性者 |
| 随访时长不足 | 12 个月随访无法识别缓慢生长的病变,也无法评估过度诊断 | 过度诊断被隐藏 | 难:需 >10 年随访 |
| D. 结局解读域(最关键) | |||
| 领先时间偏倚 lead-time bias | 提前诊断自动延长"从诊断到死亡"的时间,即使死亡日期完全未变 | 生存率虚假改善 | 仅 RCT 可排除 |
| 长度偏倚 length bias | 筛查优先捕获生长缓慢、在体内停留久的病变 | 预后虚假改善 | 仅 RCT 可排除 |
| 过度诊断 | 发现永不致病的病变,患者接受本不需要的治疗 | 危害被系统性低估 | 仅长期 RCT 可量化 |
| 替代终点谬误 | 以"检出率""分期分布"替代死亡率作为获益证据 | 结论不成立 | 须以死亡率为终点 |
7.2 不完整参考标准:一个具体的数字推演
设 10 万名受筛者,真实 1 年癌症发病率 1%(1 000 例),其中 约 300 例在采血时已存在但当年未被任何手段确诊(亚临床、未被发现)。研究通常将这 300 例中检测阴性者判为"真阴性"。
| 处理方式 | 被计入的"无癌"人数 | 报告特异性 | 解释 |
|---|---|---|---|
| 随访 12 个月(常规做法) | 99 000 | 99.50% | 亚临床癌中的假阴性被错分为真阴性 → 分母被"净化" |
| 假设随访 5 年后回溯校正 | 98 700 | ≈99.4–99.5% | 特异性变化不大(因分母巨大),但敏感性会明显下降:亚临床癌进入分子后多为阴性 |
7.3 为什么"生存率提高"不能证明筛查有效:三张图的思想实验
① 领先时间偏倚
某患者若 65 岁经症状确诊、68 岁死亡,5 年生存率 = 0%。若筛查使其 62 岁被诊断、仍然 68 岁死亡,则 5 年生存率 = 100%。 生存率从 0 变成 100%,而患者一天都没有多活。任何以"筛查组 5 年生存率更高"为卖点的宣传都应立即被质疑。
② 长度偏倚
筛查像一张在时间轴上撒下的网:停留时间长(生长慢)的病变更容易被网住。因此筛查检出的癌症在生物学上系统性地更"温和",其预后本就更好——与治疗是否更早无关。
③ 过度诊断
若筛查发现了大量永不致病的病变,则分母中加入了大量"必然存活"者,生存率必然上升、癌症发病率上升,而死亡率毫无变化。这是"筛查越积极、数据越漂亮、人群获益为零"的经典陷阱。
因此,唯一可接受的效用终点是
癌症特异死亡率(首选)与全因死亡率(更稳健),以及作为中间终点的「晚期(Ⅲ–Ⅳ 期)癌症发病率下降」——后者是 NHS-Galleri 试验采用的主要终点,因为它对领先时间偏倚免疫(分期迁移不受诊断时点的算术影响),且样本量需求远低于死亡率终点I。 但请注意:即使分期迁移被证实,也仍需死亡率数据才能确认获益——乳腺癌与前列腺癌筛查史上都出现过"分期迁移明显、死亡率获益有限"的情形。
7.4 建模与统计层面的具体局限(本演示模型自陈)
本系统外推模型的局限
- 双正态假设在 ROC 极端尾部(特异性 >99%)缺乏经验支持,而筛查恰恰只用这一段;
- σ = 1.8 为人为设定,改变 σ 会显著改变外推曲线形状(可自行验证:σ 越大,低特异性端敏感性提升越平缓);
- 分期曲线共用同一 σ,实际上各分期的信号异质度不同;
- 癌种敏感性为合成值,仅保留相对次序;
- PPV / NPV 计算假设检测特性在不同人群中恒定——这一假设在实践中经常不成立(谱偏倚)。
真实研究中同样存在的统计局限
- 亚组点估计不可靠:单个癌种 / 单个分期的样本量常仅数十例,CI 极宽,不应用于产品声称;
- 多重比较:数十个癌种 × 四个分期 = 上百个亚组比较,未校正即报告"某癌种敏感性达 90%"属选择性报告;
- 校准无法在低患病率下有效验证(§4.5);
- 竞争风险:老年人群中非癌死亡的竞争风险会稀释筛查获益,需在建模中显式处理;
- 缺失数据:QC 不合格样本若与疾病状态相关(如晚期患者 cfDNA 更多、更易合格),删除即引入偏倚。
与现行筛查体系的关系:定位、指南立场、监管现状与证据缺口
本节回答科室宣讲与合作洽谈中最常被追问的问题:「这个东西现在能不能用?和肠镜、LDCT 是什么关系?国内外指南怎么说?」
8.1 MCED 与已获推荐的单癌种筛查:证据等级的量级差异
| 筛查手段 | 目标癌种 | 死亡率获益的直接证据 | 代表性推荐 | 证据 |
|---|---|---|---|---|
| 低剂量 CT(LDCT) | 肺癌(高危吸烟者) | 有:多项 RCT 显示肺癌死亡率下降 | USPSTF B 级(50–80 岁 / 20 包年 / 现吸或戒烟 <15 年) | I |
| 结肠镜 / FIT / 多靶点粪便 DNA | 结直肠癌 | 有:RCT 与长期队列显示死亡率与发病率下降 | USPSTF A 级(50–75 岁)、B 级(45–49 岁);中国指南推荐 FIT / 结肠镜 / 多靶点 FIT-DNA | I |
| 钼靶 X 线 | 乳腺癌 | 有:RCT 荟萃显示死亡率下降(幅度与过度诊断仍有争议) | USPSTF B 级 | I |
| HPV 检测 / 细胞学 | 宫颈癌 | 有:发病率与死亡率均显著下降 | USPSTF A 级 | I |
| AFP + 腹部超声 | 肝癌(高危:HBV / HCV / 肝硬化) | 部分:队列与部分 RCT 支持 | 国内外肝癌指南推荐高危人群每 6 个月监测 | II |
| PSA | 前列腺癌 | 有争议:获益小、过度诊断显著 | USPSTF C 级(55–69 岁个体化决策) | I |
| cfDNA 甲基化 MCED | 泛癌种(含无筛查手段的癌种) | 无:尚无任何 RCT 报告死亡率或分期迁移结果 | 无任何主流指南推荐用于常规筛查 | III→II |
| 血液 cfDNA 结直肠癌筛查(单癌种) | 结直肠癌 | 已有大型前瞻性研究报告诊断准确性;对进展期腺癌敏感性低 | 可作为不愿接受其他方式者的次选;不优于结肠镜或 FIT | II |
8.2 主要机构与监管立场(截至本版本编制时)
专业机构立场
- USPSTF:未对 MCED 作出推荐;其现有推荐仅覆盖上述单癌种筛查。
- NCCN / ASCO 类机构:立场一致——MCED 不应用于常规临床筛查,仅建议在临床试验框架内使用;同时强调不得因 MCED 结果而减少既有筛查。
- 中国:结直肠癌筛查指南推荐 FIT / 结肠镜 / 多靶点 FIT-DNA;ctDNA 相关共识普遍认为血液泛癌筛查证据不足,不推荐用于无症状人群常规筛查。
- 国家级研究布局:美国 NCI 已启动 MCED 可行性研究(Vanguard 类研究),目的正是为将来的大型 RCT 奠定基础——这本身即是"证据尚不充分"的官方确认。
监管与支付现状
- 泛癌种血液甲基化检测:目前主要以实验室自建检测(LDT / CLIA)形式提供,未获 FDA 上市前批准用于人群筛查;已获"突破性设备"认定不等于获批。
- 单癌种血液检测:已有血液 cfDNA 结直肠癌筛查检测获 FDA 批准;更早的 SEPT9 甲基化检测亦曾获批,但敏感性 / 特异性均不及 FIT。
- 中国 NMPA:已有单癌种产品(粪便 FIT-DNA、肝癌相关甲基化标记)获三类证;泛癌种血液甲基化检测尚无获批用于无症状人群筛查的适应证。
- 支付:美国 Medicare 覆盖 MCED 需专门立法授权(相关法案仍在推进);中国基本医保未覆盖。费用与可及性是健康公平的重要考量。
合作洽谈时的诚实表述模板
「我们的检测在分析效度(LoD、精密度、重复性)与临床效度(病例对照 + 前瞻性队列的敏感性 / 特异性)上已有数据; 在临床效用(能否降低死亡率、能否改变分期分布)上,全行业目前都没有完成的证据,我们的定位是在研究框架内积累这一层证据。」 —— 这个表述既准确、又不损害项目价值,且能立即建立与临床专家的信任。反之,把病例对照数据表述为"临床验证通过"会在专业听众面前迅速失分。
8.3 证据缺口矩阵(ACCE 框架)
| 证据层级 | 关键问题 | 当前状态 | 补齐所需研究 | GRADE |
|---|---|---|---|---|
| 分析效度 | 检测能否稳定、可重复地测出目标信号? | 基本具备:LoD、精密度、干扰、稳定性可通过实验建立(§3.9) | 方法学比对、多中心重复性研究 | 中 |
| 临床效度 诊断准确性 | 阳性 / 阴性与"是否患癌"的关联有多强? | 已有相当证据:病例对照+ 前瞻性队列;但 Ⅰ 期敏感性低、人群外推性有限 | 多癌谱、多种族前瞻性队列;本地人群重验证 | 中 |
| 临床效用 结局改善 | 使用它能否让人活得更久 / 更好? | 基本空白:无 RCT 结局数据;建模研究提示可能获益但依赖强假设 | 大型 RCT(NHS-Galleri 等),主要终点为晚期发病率 / 死亡率 | 极低 |
| 危害评估 | 假阳性、过度诊断、虚假安心的净危害有多大? | 严重不足:假阳性下游负担有初步数据(中位 162 天);过度诊断比例完全未知 | RCT 长期随访 + 系统性危害登记 | 极低 |
| 卫生经济与公平 | 成本效果如何?是否会扩大健康不平等? | 仅有建模研究,对敏感性、依从性、下游成本的假设高度敏感 | 基于 RCT 实测参数的经济学评价;可及性研究 | 极低 |
| 伦理与法律 | 意外发现(CHIP)、心理影响、保险歧视、数据治理如何处理? | 框架初步:需前置的知情同意与结果返回政策(§6.2) | 伦理研究 + 政策制定 | 低 |
8.4 合理定位建议:MCED 应当放在什么位置
✓ 合理用途
- 临床试验 / 注册研究框架内使用,并系统采集结局与危害数据;
- 作为无筛查手段癌种(胰腺、卵巢、食管、肝、胆道)的探索性补充;
- 在已完成全部指南推荐筛查的人群中作为额外选项,并充分知情同意;
- 症状人群的诊断分流研究(与筛查用途严格区分)。
✗ 不合理用途
- 替代结肠镜 / LDCT / 钼靶 / HPV 筛查;
- 向公众宣传为"一次抽血查全身癌症";
- 用于低患病率人群(如 40 岁以下健康人群)——PPV 会跌至个位数;
- 以"5 年生存率提高"作为效果证据(§7.3);
- 无停止规则的阳性后检查升级。
◇ 值得推进的研究方向
- 富集高危人群(年龄 + 吸烟 + 家族史 + 代谢/病毒因素)以提升验前概率,从而提升 PPV;
- 纵向多次采样(利用个体基线,检测"信号轨迹"而非单点阈值)以突破单次采样极限;
- 面向中国癌谱重建面板(食管、胃、肝、鼻咽)并本地前瞻验证;
- 与影像 / 蛋白标志物的联合分流策略与成本效果评价。
报告规范自评:STARD 2015 与 TRIPOD+AI 核对表
下表为本演示系统自身对照报告规范的自评结果。已满足/部分满足/未满足(演示系统固有限制)
9.1 STARD 2015 关键条目
9.2 TRIPOD+AI 关键条目
如何使用这两张表
在研究设计阶段逐条填写,可提前发现设计缺陷(尤其是参考标准、阈值锁定、样本量三项);在论文投稿阶段作为附件提交;在阅读他人 MCED 文献时逐条核查,可快速判定其结论的可信度。 同时建议用 PROBAST 评估偏倚风险的四个域(受试者、预测因子、结局、分析)——本领域绝大多数发表研究在分析域为高风险。
参考文献
按正文首次引用顺序自动编号(Vancouver 风格)。点击任一条目可高亮;点击正文上标可跳转至此。
引用核查提示
本演示系统为教学用途整理文献信息,在正式学术场合使用前请自行核对卷期页码与最新版本(指南与共识类文献版本更新频繁;监管状态随时间变化)。凡本系统标注为 教学示意 的数值均无文献来源,不可引用。
本文件为单页离线 HTML 应用,无外部依赖、无网络请求、无数据上传;所有交互计算在本地浏览器内完成。
本系统不是医疗器械,不用于疾病诊断或治疗决策。数值分为「文献实测 / 参数外推 / 教学示意」三类并逐一标注;方法学局限见 §7,与指南的关系见 §8。
建议演示顺序:§1 模型卡 → §2 机制 → §3 技术路线 → §4 建模 → §5 性能(现场拖动患病率滑块)→ §6 病例 → §7 局限 → §8 指南与证据缺口。