首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >Nat. Commun. | 计算病理学视觉基础模型与病理基础模型的基准评测

Nat. Commun. | 计算病理学视觉基础模型与病理基础模型的基准评测

作者头像
DrugAI
发布2026-07-24 20:10:11
发布2026-07-24 20:10:11
390
举报

DRUGONE

近年来,基础模型推动了计算病理学的发展,大量视觉基础模型和病理专用基础模型不断涌现,并被应用于肿瘤分类、分子分型、预后预测和生物标志物发现等任务。然而,不同模型在跨组织、跨数据集以及跨临床任务中的泛化能力仍缺乏系统比较,也尚不清楚病理专用模型是否真正优于通用视觉模型。研究人员构建了一项目前规模最大的计算病理学基础模型基准评测,对32个基础模型进行了统一比较,包括通用视觉模型、通用视觉-语言模型、病理视觉模型以及病理视觉-语言模型四大类别。研究共覆盖41项下游任务、53个数据集以及超过17500张全切片图像,涉及TCGA、CPTAC、多个公开挑战数据集以及多个院外独立测试数据集。结果显示,病理视觉模型整体保持最稳定、最优异的性能,在多数任务中均位于前列,但不同模型之间差距通常较小,并不存在绝对优势模型。模型规模和预训练数据规模并不能稳定预测最终性能,而融合多个基础模型能够进一步提高整体泛化能力。这项工作建立了目前最系统的病理基础模型评测体系,为未来病理人工智能模型选择、优化及临床部署提供了重要参考。

病理诊断是肿瘤精准医学的重要基础,通过观察组织切片形态,病理医生能够完成肿瘤分类、分级、分期以及治疗相关生物标志物评估。然而,随着数字病理的发展,大量高分辨率全切片图像需要分析,传统人工阅片逐渐成为限制诊断效率的重要瓶颈。计算病理学利用人工智能自动分析病理切片,不仅能够提高工作效率,还能够挖掘肉眼难以识别的组织学特征,为疾病诊断、分子分型、疗效预测和预后评估提供新的工具。

近年来,自监督学习的发展催生了大量基础模型。与传统监督学习不同,自监督学习能够利用海量未标注病理图像学习通用表示,再迁移到具体任务,因此极大降低了病理标注成本。目前已经出现UNI、Virchow、Prov-GigaPath、H-optimus、Phikon等多种病理基础模型,同时也有CLIP、DINOv2、iBOT等通用视觉模型被广泛应用于病理分析。此外,结合病理图像和文本训练的病理视觉-语言模型也不断出现,例如CONCH、PLIP和TITAN等。

然而,目前各种模型通常仅在有限数据集上进行验证,不同论文采用的数据、任务及评价指标各不相同,因此难以直接比较不同模型的真实性能。另一方面,许多病理基础模型使用TCGA等公开数据进行预训练,其在真正独立数据集上的泛化能力仍存在疑问。因此,研究人员希望建立统一评测体系,对各种基础模型进行全面、公平、标准化比较,从而回答病理基础模型是否真正优于通用视觉模型、模型规模是否决定性能以及如何进一步提高模型泛化能力等关键问题。

方法

研究人员构建了统一的PathBench评测框架,对32种基础模型进行标准化比较。所有模型均采用相同的数据预处理流程,将病理全切片图像切分为固定大小图像块,通过冻结基础模型参数,仅利用线性分类器完成下游任务,从而保证不同模型比较公平一致。整个评测覆盖四类模型,包括病理视觉模型、病理视觉-语言模型、通用视觉模型以及通用视觉-语言模型。测试数据包括TCGA、CPTAC、多个公开挑战数据集以及来自Stanford等机构的独立外部数据,共包含41项分类任务,涉及脑癌、乳腺癌、肺癌、前列腺癌、膀胱癌、肾癌以及泛癌种分析,同时涵盖组织学分类、分子分型、通路预测、肿瘤分级和基因表达亚型等多个方向。所有模型均采用统一评价指标,包括AUROC、AUPRC、敏感性、特异性和平衡准确率,并进一步分析模型规模、预训练数据规模以及模型融合策略对性能的影响。

结果

病理视觉基础模型整体表现最优,并保持稳定领先

首先,研究人员重点比较了16种病理视觉基础模型在41项任务中的整体表现。综合TCGA数据集分析发现,Virchow2、Prov-GigaPath、H-optimus-0、UNI和UNI2始终位于所有模型前列。其中Virchow2整体排名最高,在多数任务中均取得最佳或接近最佳性能。

进一步分析独立数据集,包括CPTAC、多个外部测试集及院外数据后,这种优势仍然保持,但不同模型之间排名出现一定变化。例如UNI在独立数据集中的排名有所提高,而部分TCGA表现优异的模型在外部数据中的优势有所减弱。这说明基础模型不仅需要关注训练数据上的性能,更需要重视跨数据集泛化能力。

值得注意的是,统计分析发现,这些排名靠前模型之间的大多数性能差异并未达到显著水平,说明目前病理基础模型整体已经进入性能接近阶段,不再存在明显领先所有任务的单一模型,而更多体现为不同模型在不同任务上的各自优势。

图1: 32种基础模型统一评测流程及病理视觉基础模型整体性能比较。

不同组织和不同任务体现出明显模型专长

进一步分析不同癌种后发现,各模型均表现出一定组织特异性。

Prov-GigaPath在胶质瘤、膀胱癌及乳腺癌相关任务中表现突出;Virchow2在前列腺癌、结直肠癌及肺癌任务中保持领先;UNI则在脑肿瘤和肺癌分型方面具有较高准确率;H-optimus-0在泛癌分析任务中表现更加稳定。

说明虽然总体性能接近,但不同模型在不同组织来源病理图像上的表示能力仍存在明显差异,没有任何模型能够覆盖所有癌种优势。

Slide级任务与Patch级任务表现存在差异

研究进一步比较了Slide级预测和Patch级预测。在Slide级任务中,排名靠前模型之间差异很小,各模型表现十分接近;而在Patch级公开挑战数据集中,不同模型之间差异开始扩大,Virchow2取得最高平均性能,并与部分模型形成统计学差异。

研究认为,Patch级任务更加直接考察基础模型学习到的视觉表示,而Slide级预测还受到多实例聚合策略影响,因此不同评测方式可能导致模型排名发生变化。

图2: 病理视觉基础模型在Slide级和Patch级任务中的泛化性能比较。

病理视觉基础模型优于病理视觉-语言模型,并与通用视觉模型竞争力相当

研究人员进一步比较了四类基础模型,包括病理视觉模型(Path-VM)、病理视觉-语言模型(Path-VLM)、通用视觉模型(VM)以及通用视觉-语言模型(VLM),希望明确病理专用预训练是否真正带来性能优势。

结果显示,在TCGA、CPTAC以及多数公开评测任务中,病理视觉模型始终保持最稳定的整体表现,在排行榜前列几乎均由Virchow2、UNI、Prov-GigaPath、H-optimus-0等模型占据。相比之下,病理视觉-语言模型整体表现略逊一筹,仅在少数肺癌及公开挑战任务中,CONCH、TITAN等模型取得较好成绩。

另一方面,研究发现病理视觉模型虽然整体排名略高于通用视觉模型,但统计分析并未发现两者存在稳定且显著的性能差异。这说明经过大规模自然图像训练的DINO、DINOv2、iBOT等通用视觉基础模型,同样能够学习到具有较强迁移能力的视觉表示,在部分病理任务中甚至能够达到接近病理专用模型的性能。例如iBOT和DINO在肺癌组织分类、脑肿瘤分型以及部分公开挑战赛中均取得了较高排名。

研究人员认为,目前病理视觉模型最大的优势更多体现在稳定性和跨任务一致性,而不是绝对性能优势。相比之下,视觉-语言模型由于同时需要兼顾图像与文本对齐,其视觉编码能力受到一定影响,再加上病理图文配对数据规模仍远小于自然图文数据,因此整体性能尚未超过纯视觉模型。

图3: 病理视觉模型、病理视觉-语言模型及通用视觉模型综合性能比较。

模型规模和预训练数据规模并不能决定最终性能

随着基础模型不断扩大规模,人们普遍认为更大的模型和更多的数据能够带来更好的性能。为验证这一观点,研究人员分别分析了模型参数规模和预训练数据规模对最终表现的影响。

结果发现,在TCGA部分任务中,从ViT-Small升级到ViT-Large确实能够带来一定性能提升,尤其是在多分类任务中更加明显。然而,在CPTAC以及院外独立数据集上,这种优势明显减弱,继续扩大模型规模几乎无法获得持续收益。尤其从ViT-Base继续扩大到ViT-Large以后,大多数任务已经进入性能平台期。

类似现象同样出现在预训练数据规模分析中。当预训练数据由小规模增加到中等规模时,模型性能能够明显提升;但继续增加至百万级全切片图像后,性能改善已经十分有限,在多个独立数据集上几乎观察不到统计学优势。

这一结果说明,基础模型性能并不是简单由参数数量或数据规模决定。数据来源、组织类型组成、自监督训练策略以及病理图像质量等因素,同样会显著影响模型最终泛化能力。因此,未来病理基础模型的发展方向不仅是继续扩大规模,更重要的是提高训练数据多样性和优化预训练策略。

图4: 模型规模与预训练数据规模对病理基础模型性能影响分析。

多模型融合进一步提升泛化能力

由于不同模型在不同癌种上各具优势,研究人员进一步尝试利用模型融合提高整体性能。

他们选取Virchow2、UNI、UNI2、Prov-GigaPath以及H-optimus-0五个表现最好的病理视觉模型,通过决策层融合策略,对多个模型预测结果进行综合。

结果显示,在TCGA全部19项任务中,融合模型取得最高总体平衡准确率,整体性能略高于Virchow2等单一模型;在独立数据集上,融合模型虽然未始终排名第一,但依然保持稳定领先,体现出更好的跨数据集泛化能力。

进一步分析不同组织来源后发现,不同模型具有明显互补优势。例如Virchow2更适合结直肠癌和前列腺癌分析,Prov-GigaPath在乳腺癌和膀胱癌任务中优势明显,UNI则更加擅长脑肿瘤分析,而CONCH在肺癌相关任务中表现突出。融合模型能够综合这些优势,因此在泛癌分析和乳腺癌等多个组织中取得最稳定表现。

与此同时,研究人员还比较了不同任务类型,包括组织学分类、分子标志物预测、基因表达亚型预测及信号通路预测。结果发现,没有任何单一模型能够在所有任务中持续领先,而融合模型能够有效降低不同任务之间性能波动,提高整体可靠性。

图5: 多模型融合提升病理基础模型跨组织和跨任务泛化能力。

讨论

本研究构建了目前计算病理学领域规模最大的基础模型基准评测体系,对32种视觉基础模型进行了统一、公平和系统比较,为病理人工智能模型的发展提供了重要参考。

研究最大的发现之一是,病理视觉基础模型整体表现最稳定,但其优势更多体现在跨任务一致性,而不是绝对性能领先。Virchow2、UNI、Prov-GigaPath、H-optimus-0等模型虽然长期位居排行榜前列,但彼此之间性能差距通常较小,而且优势具有明显任务依赖性。这意味着未来不存在能够适用于所有病理任务的“万能模型”,不同组织和不同疾病仍需要针对性的模型优化。

研究还表明,当前广泛采用的“更大模型、更大数据”策略已经逐渐进入收益递减阶段。模型参数继续增加以及预训练数据进一步扩展,并不能保证泛化能力持续提高。相比模型规模,训练数据组成、多组织覆盖程度、数据质量以及自监督学习策略可能对最终性能具有更加重要的影响。

另一个值得关注的结论是,病理视觉-语言模型尚未充分发挥优势。虽然这类模型具有图文联合学习能力,并在部分任务中表现突出,但由于病理图文配对数据仍较少,加之多模态训练可能削弱视觉特征学习,因此整体性能仍落后于纯视觉模型。随着未来更多高质量病理图文数据积累,多模态基础模型仍具有较大发展潜力。

此外,研究证明模型融合是一条值得关注的发展方向。不同基础模型具有互补优势,通过融合多个模型,可以获得更加稳定、更具泛化能力的预测结果,为未来临床部署提供了新的解决方案。

总体而言,本研究不仅建立了目前计算病理学最全面的基础模型评测框架,还系统回答了病理专用模型是否优于通用视觉模型、模型规模是否决定性能以及模型融合是否能够提升泛化能力等重要问题。研究结果表明,未来计算病理学的发展重点将逐渐从单纯追求更大的基础模型,转向提高跨机构泛化能力、多模态融合能力以及更加符合真实临床应用场景的模型设计,为精准医学和数字病理的临床应用奠定基础。

整理 | DrugOne团队

参考资料

Bareja, R., Carrillo-Perez, F., Zheng, Y. et al. A benchmark study of vision and pathology foundation models for computational pathology. Nat Commun (2026).

https://doi.org/10.1038/s41467-026-76004-6

内容为【DrugOne】公众号原创|转载请注明来源

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-07-24,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 DrugOne 微信公众号,前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体同步曝光计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档