撰文丨王聪
编辑丨王多鱼
排版丨水成文
2024 年 12 月 12 日,Charlotte Bunne等人在Cell期刊发表了题为:How to build the virtual cell with artificial intelligence: Priorities and opportunities 的展望文章,提出了人工智能虚拟细胞(AI Virtual Cell,简称为AIVC)概念,并为 AIVC 的构建提供了一个愿景,阐述了构建 AIVC 的机遇和挑战【1】。
这篇文章掀起了如今的虚拟细胞(Virtual Cell)热潮。能够预测细胞在不同尺度和生物学情境下的行为的虚拟细胞模型,正迅速成为药物发现领域的新前沿。
2026 年 8 月 5 日,Charlotte Bunne在Nature期刊发表了题为:The Virtual Tissues foundation model resolves spatial proteomics across scales 的研究论文。
该研究开发了一个面向空间蛋白质组学的通用基础模型——“虚拟组织”(Virtual Tissues,简称为VirTues),VirTues 能够用于从单个细胞到整个组织切片乃至患者临床结局等多尺度的生物学研究。这项研究是更大规模的“虚拟患者”项目的一部分,有望彻底改变我们对癌症的理解和治疗方式。
肿瘤不仅仅由其中的癌细胞构成。免疫细胞、血管及其他周围组织也会影响癌症的生长方式及其对治疗的响应。即使两个肿瘤含有相同的细胞类型,由于这些细胞的排列方式不同,它们对同一疗法的响应也可能大相径庭。空间蛋白质组学能够以分子层面的细节捕捉这种组织结构,但由此产生的数据包含大量不同的变量,难以解读,也难以在不同研究之间进行比较。
为应对上述挑战,Charlotte Bunne领导的 AI 分子医学团队开发了一个用于组织生物学的基础模型——“虚拟组织”(VirTues)。该模型通过学习来自不同研究和癌症类型的蛋白质组空间数据,能够用于从单个细胞到整个组织切片乃至患者临床结局等多尺度的生物学研究。
Charlotte Bunne
对于癌症研究而言,仅仅指导肿瘤中存在哪些细胞只是问题的一部分,还需要进一步了解它们的位置以及它们之间的相互作用方式。而要在大量癌症患者中解答这些问题,既是一个生物学难题,也是一个计算难题。
近年来,在癌症领域,通过组织分析产生的数据量呈指数级增长,计算建模是将这些成果转化为临床环境中可操作方案的关键工具。
组织数据可以回答许多不同的生物学和临床问题,但大多数计算模型一次只能针对单一问题进行设计。而VirTues则借鉴了语言模型的逻辑——它不是为单一预定义任务而训练,而是进行广泛训练;它不学习词语之间的关系,而是学习蛋白质、细胞及其空间环境之间的关系,从而构建出可应用于不同分析的共享表征。
VirTues的核心训练集包括 15 个成像质谱队列,3102 名患者,146 种蛋白标记;扩展训练集横跨 4 种成像技术,32 个临床队列,5100 多名患者,239 种蛋白标记。这种大规模、多样化的训练数据,赋予了 VirTues 强大的泛化能力——它不仅在训练过的技术平台上表现出色,在面对从未见过的成像技术时,依然能保持竞争力。
研究团队表示,VirTues具有高度灵活性,能够将不同数据集整合到一个图谱中,以相同的方式分析来自不同研究的组织,并快速验证不同患者群体中的发现。作为一种分析工具,VirTues能够处理实验室原本需要不同方法才能回答的问题,研究人员可以利用它来比较患者群体,确定哪些空间模式能够区分他们,并发现与疾病进展和治疗反应相关的空间生物标志物。问题在变化,但底层模型保持不变。
VirTues的核心创新在于三大“独门绝技”:
1、“蛋白身份证”系统,每个蛋白都有自己独特的氨基酸序列,VirTues利用蛋白质语言模型ESM-2为每一个检测的蛋白生成独特的“数字身份证”。这样一来,即使不同实验用了完全不同的抗体组合,模型也能理解这些蛋白之间的“亲戚关系”。
2、“分而治之”的注意力机制,传统Transformer架构在处理高维数据时会“算到崩溃”,VirTues巧妙地将注意力分为两个维度——标记注意力(同一位置的蛋白之间如何相互影响);空间注意力(同一种蛋白在不同位置如何分布)。这种“分工协作”使得计算效率提升了数十倍,能够轻松处理上百个通道的数据。
3、“由小到大”的多尺度表征,从单个像素到单个细胞,再到细胞群落,最后到整个组织,VirTues能自动提取不同层次的生物学特征,就像从看一棵树到看整片森林。
VirTues能做什么?该研究展示了四个应用方向——
1、无中生有的“虚拟染色”,即使某个蛋白从未被实际测量过,VirTues也能根据其他已知蛋白的信息,精准预测它的表达模式。在三阴性乳腺癌样本中,VirTues 重建的蛋白表达与真实测量的相关性高达 0.8 以上。这意味着未来或许可以用少量抗体就能推断出全套蛋白图谱,大幅降低实验成本。
2、跨数据集的“火眼金睛”,在不同实验室、不同技术平台产生的数据上,VirTues都能准确识别细胞类型。在零样本(完全没有见过目标数据集的情况下)测试中,其细胞分类性能依然出色,甚至在罕见细胞类型的识别上超越了专门为此设计的工具。
3、比医生更准的“预后预测”,在三阴性乳腺癌这一最难治疗的乳腺癌亚型中,VirTues仅凭治疗前的活检样本,就能以 82.3% 的准确率预测患者对抗 PD-L1 单抗免疫治疗的响应——这比现有最好的方法高出 5 个百分点,比传统临床指标高出 26%-32%。更令人振奋的是,VirTues 发现的生物标志物还能在独立队列中有效区分高风险和低风险患者,其预测能力超越了目前临床使用的所有分层方案。
4、帮助寻找相似病例,在临床实践中,如果医生遇到一位疑难病例,可以在数据库中找到与其组织特征最相似的历史病例,参考其治疗过程和结局。VirTues 将每份组织的空间结构编码成一个“数字指纹”,实现了基于组织相似性的精准检索,为临床决策提供了全新工具。
更重要的是,这项研究是一个为期五年的更大项目的一部分,该项目名为——虚拟患者实验室:AI驱动的模拟与诊断助力精准肿瘤学(Virtual Patient Labs: AI-Driven Simulation and Diagnostics for Precision Oncology),该项目旨在基于个人自身数据建立一个可运行的生物学计算模型,其细节程度足以供临床医生用于预测疾病进展趋势以及判断哪种治疗方案可能有效。VirTues为该项目提供组织层面的数据,将与常规病理信息、基因数据、临床资料及其他患者记录相结合。
更广泛地说,VirTues将多通道组织成像重新定义为跨队列的组织状态共享表征,有助于推动空间蛋白质组学从孤立研究转向系统性、图谱规模的诊断与预后分析以及生物标志物发现。如果说单细胞测序让我们看到了细胞的“基因清单”,那么VirTues这样的空间蛋白质组基础模型,则能够帮助我们看清了这些细胞如何在三维空间中“排兵布阵”,这也有助于推动癌症研究进入了一个全新时代——每一张组织切片都蕴藏着足以指导精准治疗的丰富信息,只待 AI 来解锁。
论文链接:
https://www.cell.com/cell/fulltext/S0092-8674(24)01332-1
https://www.nature.com/articles/s41586-026-10884-y

