Methodological Demonstration · 方法学演示

本演示系统完整呈现一个泛癌种早筛模型的证据链条:分子机制 → 实验技术路线 → 算法建模 → 性能验证 → 方法学局限 → 与现行指南的关系。 性能呈现口径参照 STARD 2015 与 TRIPOD 报告规范: 每一项性能数字均同时标注队列类型(回顾性 / 前瞻性)与样本量

关于本文档的性质:本文档为科研演示,非注册临床试验数据,未经任何药监机构审评。 第 5、7、8 区块中的评分分布、置信区间、模拟队列与模拟报告全部为模拟数据; 第 2、6、9、10 区块中的流行病学与已发表研究数值按原文口径引用并标注文献编号。 本文档不得用于产品宣称、诊疗决策或患者沟通。

本演示回答什么

一个 MCED 模型的性能数字应当如何被解读:AUC 0.9581 意味着什么、不意味着什么; 为什么同一个模型在筛查人群中的 PPV 可以低到个位数;为什么「灵敏度高」不等于「有临床获益」。

本演示不回避什么

行业 I 期灵敏度瓶颈(Galleri CCGA3 I 期 16.8%)、低脱落癌种的生物学上限、 PATHFINDER 中 62% 阳性为假阳性、以及 NHS-Galleri 14.2 万人 RCT 主要终点未达成

证据标签体系

02

研究背景与临床需求

Epidemiological rationale

中国癌症负担的核心矛盾并非发病率本身,而是确诊分期分布:在发病率与美国相近或更低的若干癌种上, 中国的生存率差距主要由「确诊时已属晚期」的比例差异所解释。 这决定了早筛技术的价值命题不是「发现更多癌症」,而是「把确诊分期分布左移」。

筛查覆盖缺口 指南/RCT

现行指南推荐的单癌种筛查手段仅覆盖少数癌种(肺、结直肠、乳腺、宫颈、肝、胃、食管、前列腺等)。 约 70% 的新发癌症没有任何标准筛查手段,这些「未筛查癌种」合计贡献约 2/3 的癌症死亡。 这是多癌种早期检测(MCED, multi-cancer early detection)被提出的直接动因。

但缺口的存在不等于技术已可填补 指南/RCT

临床需求的迫切性常被用来论证技术的成熟度,这是一种论证跳跃。第 6 区块给出性能上界, 第 9 区块给出为什么这些性能尚不足以支撑一般风险人群初筛的结论

03

分子机制:癌症表观基因组与 cfDNA 生物学

Mechanistic schematic

甲基化早筛的科学前提由两条独立的生物学事实拼接而成:(i)癌细胞的 DNA 甲基化图谱与正常细胞存在系统性、可重复的差异, 且该差异出现在形态学改变之前(ii)肿瘤细胞的 DNA 会以片段形式进入循环血, 与造血来源的背景 cfDNA 混合。第一条决定了可区分性,第二条决定了可及性—— 而后者的量级,正是早期灵敏度的天花板。

点击上图中带下划线的标注,或下方任一机制条目,查看该机制的专业解说与文献依据。

3.1 癌症表观基因组的两个方向性改变

3.2 cfDNA 生物学参数

3.3 采样瓶颈:为什么 I 期灵敏度不可能很高

量级直觉 机制/基础研究

若某样本肿瘤分数为 0.022%,则在 10 000 个 cfDNA 分子中平均仅约 2 个来自肿瘤。 任何单点特征(单个 CpG、单个突变)在此浓度下都不可能稳定区分信号与噪声—— 这解释了为什么本模型采用完整高甲基化单倍型(fHMH)这类「多位点联合、单分子级」的特征形式(见第 5 区块)。

推论:提升早期灵敏度的可行方向依次为 —— 增加采血量与分子回收率 > 增加正交特征(片段组学)> 优化分类器。

3.4 主要干扰因素与甲基化标志物的相对优势

04

技术路线与实验流程

Pre-analytical SOP & wet-lab pipeline

在低肿瘤分数场景下,分析前变异(pre-analytical variability)常大于算法差异。 溶血、离心延迟、反复冻融都会引入白细胞基因组 DNA,把本已 ~0.02% 的肿瘤分数进一步稀释, 直接表现为假阴性。因此 SOP 的每一条时限都是灵敏度约束,而非管理规定。

4.1 样本前处理 SOP 时间线(点击每步查看质控要点)

注:标注为「演示建议」的条目为本演示补充的一般性实验室良好实践,不属于任务书给定参数; 其余参数(采血量、混匀次数、离心条件与时限、分装规格、储运温度)为给定 SOP 参数。

4.2 实验室与湿实验流程

1ng
最低 DNA 投入量
低于此量不建议进入建库;投入量不足时文库复杂度不可恢复
≥99%
转化率要求(EM-seq / 亚硫酸氢盐)
转化不完全会把未甲基化 C 误读为甲基化,系统性抬高信号
4–6mL
10 mL 全血可获血浆量
血浆体积直接决定可获得的 cfDNA 分子总数(采样上限)
05

算法与建模

Feature engineering · classifier · threshold

5.1 分析流程

建模数据 病例-对照

公开数据库二次利用属回顾性设计:样本已按「已确诊癌症 / 已知健康」分组, 癌症样本的分期与肿瘤负荷分布不代表筛查人群。这一点是理解第 6 区块所有数字的前提

阈值设定逻辑

阈值定义(特异性优先)

总分阈值 0.99 定义为健康人群评分的第 95 百分位,即特异性被预先设定为 95%, 灵敏度是该设定下的结果(87%)而非优化目标。

方法学要点:筛查场景中特异性直接决定假阳性绝对数与 PPV。95% 特异性意味着每 100 名健康受检者产生 5 例假阳性—— 在 P = 0.5% 的人群中,这会把 PPV 压到个位数(第 7 区块工具 A 可实测)。

5.2 评分分布与「阈值—敏感性/特异性」权衡

Figure 5.1 · 健康与癌症样本的总分分布(演示模拟)及阈值权衡
拖动阈值实时联动:特异性、灵敏度、ROC 工作点(Figure 1)与 PPV/NPV(第 7 区块工具 C)。
Figure 5.1|横轴为模型输出总分(0–2 量表,≥2.0 归入末档),纵轴为该组内样本占比(%)。 数据性质:本图为演示模拟分布——采用双正态模型,其参数由三条给定约束反解得到, 使图形与本演示报告的三个关键数字严格自洽:Sp(0.99) = 95%、Se(0.99) = 87%、AUC = 0.9581 (健康组 μ=0.661, σ=0.200;癌症组 μ=1.458, σ=0.415)。 口径说明:真实评分分布通常右偏且随分期分层,本图不代表实测直方图,仅用于演示阈值移动对 Se/Sp 的权衡关系。 病例-对照 机制/基础研究
06

模型性能验证

Figures 1–5 · 学术图表规范

阅读本区块前必须明确的三件事

  1. 队列类型决定数字的含义。回顾性病例-对照的灵敏度与前瞻性筛查队列的灵敏度不是同一个量,不可直接比较。
  2. 特异性设定不同则灵敏度不可比。本模型在 Sp 95% 下报告 Se 87%;Galleri 在 Sp 99.5% 下报告 Se 51.5%。把两个数字并列而不说明特异性是误导。
  3. 本模型性能全部来自回顾性公开样本(n = 18 752),尚无前瞻性筛查队列数据,因此下述数字应视为性能上界
Figure 1 · ROC 曲线与跨研究工作点对照
Figure 1|本模型受试者工作特征(ROC)曲线,AUC = 0.9581;样本量 n = 18 752(公开数据库回顾性验证,病例-对照设计)。 实心方点为出厂工作点(特异性 95% → 灵敏度 87%),随第 5 区块阈值滑块实时移动。 空心菱形为行业对照坐标:Galleri CCGA3(独立验证集,特异性 99.5%、总灵敏度 51.5%)—— 注意该点位于本模型 ROC 曲线之下并不意味着模型更优:两者的癌种谱、分期分布、对照人群与验证设计均不同, 且 Galleri 数值来自独立验证集,本模型曲线来自与训练同源的公开样本回顾性验证。 口径说明:ROC 曲线由与 Figure 5.1 同一双正态模型生成,以保证 AUC 与工作点自洽;曲线形状为演示重构,非逐样本实测曲线。 病例-对照
Figure 2 · 分癌种灵敏度森林图(95% CI)
Figure 2|各癌种在出厂工作点(Sp 95%)下的灵敏度点估计与 95% 置信区间(Wilson 得分区间)。 口径说明(重要):灵敏度点估计为给定值;各癌种样本量除肝癌(402 例血浆)外均为「演示估算」假设值, 因此误差棒宽度仅示意「样本量越小、区间越宽」的统计学规律,不可作为该癌种精度证据引用分组:蓝色为高敏组,红色为低敏组。图注:低敏癌种(甲状腺癌 33%、睾丸癌 17%、嗜铬细胞瘤 10%) 与 ctDNA 脱落量低的已知规律一致——脑、肾、甲状腺、前列腺等解剖学低脱落部位肿瘤的血浆 ctDNA 检出率系统性偏低病例-对照
Table 1|分癌种灵敏度三线表(与 Figure 2 同源)。CI = 置信区间;n 列标注数据来源性质。
Figure 3 · 分期灵敏度:行业基准与本模型专项队列
Figure 3|灵敏度随分期递增。Galleri CCGA3(病例-对照独立验证):I 期 16.8%、II 期 40.4%、III 期 77%、IV 期 90.1%本模型肝癌专项队列(402 例血浆,回顾性):BCLC A 期 88%D 期 94.5%口径说明:BCLC A/D 为肝癌专用分期系统,与 TNM I/IV 期不能直接等同,并列仅示意方向一致性; 单癌种专项队列(尤其是肝癌这类高脱落、且常伴肝炎/肝硬化背景的癌种)灵敏度显著高于泛癌种平均水平,不可外推至泛癌场景。 结论:「分期越早、灵敏度越低」是全行业共性约束,源于早期病灶 ctDNA 释放量的生物学下限,而非单一算法差异。 病例-对照

Figure 4 · 多模型横向对比(三线表)

Figure 4 / Table 2|代表性 MCED 与单癌种血检研究的性能横向对比。每行同时标注队列类型与样本量(STARD 2015 要求)

表下固定注释(不可省略)

Figure 5 · 特异性—灵敏度坐标:回顾性 vs 前瞻性
Figure 5|将 Figure 4 各研究投影至「特异性—总灵敏度」平面。圆点 = 回顾性/病例-对照设计,三角 = 前瞻性队列。 读图要点:MERCURY 的两个点(验证集 97.8%/87.4% → 金陵前瞻队列 98.1%/53.8%)来自同一模型, 特异性几乎不变而灵敏度下降约 34 个百分点,是「回顾性设计高估灵敏度」的单研究内部证据口径说明:CancerSEEK 原文特异性口径为「> 99%」,本图取 99.0% 作图;各研究癌种谱与分期分布不可比,坐标位置不构成优劣排序。 病例-对照 前瞻队列 企业/会议数据
07

交互验证工具

Bayesian PPV · simulated cohort · threshold explorer

本区块的目的不是演示模型有多好,而是让观众亲手验证筛查统计学的三条硬约束: (i)PPV 由患病率主导,而非由灵敏度主导;(ii)在低患病率人群中,特异性每损失 0.5 个百分点, 假阳性绝对数的增加就足以压垮阳性确诊路径;(iii)阈值不能同时优化 Se 与 Sp。 所有输出均为模拟数据。

TOOL A

贝叶斯 PPV / NPV 计算器

模拟数据 · 不构成任何产品性能声明
对数刻度 0.05% – 2.00%(筛查场景常见区间);预设按钮可载入 10% 的有症状人群作为对照
注意特异性刻度:90% → 99.9% 的区间内,PPV 会变化一个数量级
阳性预测值(贝叶斯)
阴性预测值
似然比(与患病率无关,故可跨人群迁移)

1 000 人方阵可视化

TOOL B

模拟筛查队列

模拟数据 · 用于估算筛查项目的假阳性负担
1 万 – 100 万(对数刻度)
Table 3|2 × 2 混淆矩阵(模拟数据,按输入参数与四舍五入计算)。
每检出 1 例癌症所需筛查人数(NNS, number needed to screen)
TOOL C

阈值—工作点探索器

与第 5 区块 Figure 5.1 及 Figure 1 双向联动
拖动即同步更新:Figure 5.1 阈值线、Figure 1 工作点、下方 PPV/NPV
跳转到评分分布图 ↑

数学关系:Se(t)=1−Φ((t−μ₁)/σ₁)Sp(t)=Φ((t−μ₀)/σ₀), 双正态模型下 AUC=Φ((μ₁−μ₀)/√(σ₀²+σ₁²)) 与阈值无关—— 这正是「AUC 高」不能保证「任一工作点可用」的原因。

Table 4|典型阈值下的工作点对照(演示模拟模型计算值)。
08

模拟检测报告(专业版)

Report template · 3 scenarios

报告是模型与临床的唯一接口。以下模板演示三种典型情形:阴性阳性质控不合格。 设计要点在于:质控区先于结果区(质控不合格时结果区不得出图)、结论区必须写明「非临床诊断」、 页脚固定声明必须包含不覆盖癌种假阴性/假阳性说明。

注:报告中受检者信息、样本编号、日期、质控数值、总分与 z-score 全部为模拟数据; 质控项中「cfDNA 投入量 ≥ 1 ng」「转化率 ≥ 99%」为给定规格,覆盖深度 / 文库复杂度 / Q30 阈值为演示假设。 4 个标志物区域以 M1–M4 占位,不披露基因身份,以避免虚构基因名称。

09

方法学局限与阴性证据

Academic integrity section

本区块不可省略

一个早筛模型演示如果只展示 AUC 与灵敏度,就是把替代终点当作临床价值。 以下 6 条为本模型与本领域当前的真实边界,其中第 2 条是全领域最重要的阴性证据

    9.1 三大筛查偏倚示意

    ① 领先时间偏倚
    Lead-time bias
    生物学起病 时间 → 常规确诊 确诊 D 生存期 筛查检出 检出 S 「更长」的生存期 死亡(时间不变) lead time

    提前诊断把「测量起点」左移,生存期在统计上被延长,而死亡时间未推迟。任何以「筛查组 5 年生存率更高」为依据的获益宣称,都必须先排除本偏倚。

    ② 病程长短偏倚
    Length(-time)bias
    筛查时点 时间 → 惰性 / 慢速 ✓ 易被捕获 中速 ✓ 可能捕获 侵袭 / 快速 ✗ 常被漏过(间隔癌)

    肿瘤在「可检出但无症状」窗口中停留越久,越容易被某一次筛查捕获。筛查因而系统性富集预后本就更好的惰性肿瘤,而侵袭性肿瘤更多表现为间隔癌。

    ③ 过度诊断
    Overdiagnosis
    肿瘤负荷 时间 → 出现症状 / 致死阈值 筛查可检出阈值 ① 进展型 ② 缓慢型 ③ 静止型 ④ 消退型

    轨迹 ②③④ 终生不会越过症状阈值,却可能被筛查检出并接受治疗——获得「癌症患者」身份与治疗伤害,却无任何生存获益。检出能力越强,过度诊断风险越高。

    示意图依据:Welch HG, Black WC. Overdiagnosis in cancer. JNCI 2010。 三幅图为概念示意,非实测数据。

    10

    与现行指南和共识的关系

    Guidelines · regulatory status · clinical pathway

    10.1 2025 年液体活检联合筛查专家共识

    10.2 监管现状(截至 2026 年)

    Table 5|泛癌种早筛产品的监管状态。单癌种血检的获批不等于泛癌种检测获批,二者的适用声明范围完全不同。

    口径说明:Guardant Shield 与 Freenome 的获批适应证为单癌种(结直肠癌)筛查; GRAIL 已就 Galleri 提交 PMA,FDA 咨询委员会定于 2026 年 9 月审评企业/会议数据。 本条为监管进程信息,随时间变化,引用前请核实最新公告。

    10.3 阳性结果后的临床路径建议

    路径设计的三个必答问题 前瞻队列

    1. 谁负责闭环?阳性结果必须有指定的随访责任人与时限,否则受检者将在多科室间自行游走。
    2. 检查强度如何限定?无定位信息时应避免无节制全身影像;DETECT-A 与 PATHFINDER 均显示阳性后检查负担是主要成本项
    3. 如何解除标签?必须事先定义「多长时间、何种检查阴性后判为假阳性并终止随访」,否则受检者将长期承担「疑似癌症」身份。
    11

    参考文献

    编号与正文上标一致 · 点击条目展开摘要
    0 条。标注「待核」者为本演示未能确认的卷期或作者信息,已如实标出,未做任何虚构补全。

      文献校订说明(学术诚信)

      任务书中 THUNDER(燃石 OverC)研究原列为「Jamshidi A, et al. Ann Oncol 2023」。经核对,THUNDER 的发表为 Gao Q, Lin YP, Li BS, et al. Ann Oncol 2023;34(6):486-495;Jamshidi A 等(Cancer Cell 2022)为 GRAIL 的另一项 方法学比较研究。本演示按「文献准确性优先于原始清单」的原则更正,并在条目内保留校订记录。 另有 2 条(《常见恶性肿瘤联合筛查共识》卷期、MERCURY 作者列表)本演示无法确认,已标注「待核」而非填充虚构信息。