生物模型

scVision:斯坦福把单细胞转录组变成图片,视觉基础模型零样本碾压语言模型

2026年7月19日5 次阅读
scVision:斯坦福把单细胞转录组变成"图片",视觉基础模型零样本碾压语言模型

scVision:斯坦福把单细胞转录组变成"图片",视觉基础模型零样本碾压语言模型

斯坦福大学 Islam Lab 最新发布的 scVision,用一个看似简单的思路颠覆了单细胞基础模型的范式:不再把细胞当成"一段文字",而是把它画成"一张图片"。7200 万人类细胞预训练、冻结编码器零样本推理,在全部 6 个独立测试集上,scVision 的细胞类型注释准确率超越了所有现有单细胞基础模型和经典方法。

换一种方式"看"细胞

过去三年,单细胞基础模型几乎清一色走了语言模型路线——scGPT、Geneformer、scBERT 等都是把基因当成 token,把细胞当成"一句话"来处理。这条路的代价很明确:基因之间的空间关系被丢弃了,基因表达的连续幅度被离散化了。不管模型参数再怎么堆,这种结构性信息的丢失都补不回来。

scVision 的核心创新在于换了一种表示方式。它用最优传输(optimal transport)算法,把约 11000 个信息基因放在一张共享的 pan-tissue 地图上,让那些倾向于共表达的基因成为空间邻居。任何一个细胞的基因表达数据投射到这张地图上后,转录组就变成了一张固定尺寸的连续图像——基因程序变成了局部纹理,细胞身份变成了全局模式。

三步走,一个冻结编码器

scVision 的工作流程分为三步:

第一步:基因地图布局。 通过最优传输计算,为所有基因分配固定的空间坐标。这个布局是跨组织、跨细胞类型共享的,一旦确定就不再改变。

第二步:掩码图像建模预训练。 使用 ViT-Base 编码器,在 7200 万个人类细胞上做掩码图像建模(Masked Image Modeling)。不需要任何标签,模型通过预测被遮蔽的图像块来学习细胞表示。

第三步:冻结编码器零样本推理。 预训练完成后,编码器完全冻结,不针对任何下游任务做微调。直接用这个编码器提取的特征做细胞类型注释、多研究整合、基因程序推断等任务。

效果:不是多一点,是全面领先

在 6 个完全独立的 held-out 人类细胞图谱上,scVision 的零样本细胞类型注释准确率全面领先——超越了 scGPT、Geneformer 等现有基础模型,也超过了 Seurat、scANVI 等经典基线。

更值得关注的是几个效率指标:

  • 标签效率:比经典方法少用 50 倍以上的标注数据就能达到同等或更好效果
  • 推理速度:比 token 类基础模型快 37 到 300 倍——因为图像表示是固定尺寸的,不需要像 token 模型那样处理可变长度序列
  • 整合能力:在多研究整合任务上与 scVI 持平,但不需要任何批次标签,同时保留了最多的生物结构信息

一个关键实验揭示了这个模型的本质:当研究者打乱基因在地图上的空间位置(但保持网络结构不变),准确率的下降幅度甚至比直接去掉视觉 Transformer 还要大。这说明真正携带信号的是基因的生物学空间布局,而不是网络本身——表示方式的选择比模型架构更重要。

基因程序也能无监督发现

除了细胞类型注释,scVision 在无监督基因程序推断上也表现优异。它不需要任何先验知识,就能从冻结编码器的特征中恢复出已知的功能基因模块。这为探索性分析提供了新的可能性:当你面对一个不熟悉的组织或疾病数据集时,scVision 可以直接告诉你"这些细胞属于什么类型"以及"哪些基因在协同工作",无需标注、无需微调。

对谁有用?

  • 单细胞研究者:需要快速注释新数据集细胞类型,或跨研究整合数据
  • 药物发现团队:需要在大规模单细胞数据中识别疾病相关细胞状态
  • 计算生物学方法开发者:视觉范式为单细胞表示学习开辟了全新的设计空间

局限与展望

目前 scVision 仅在人类细胞上预训练和验证,跨物种迁移能力尚未验证。作为 arXiv 预印本,模型和代码的公开程度还有待确认。此外,冻结编码器虽然保证了通用性,但在某些需要极致性能的特定任务上,可能不如经过微调的专用模型。

不过,scVision 最大的贡献或许不是某个数字上的提升,而是证明了一个观点:在单细胞生物学里,怎么"看"数据,比用多大的模型更重要。当计算机视觉领域已经积累了数十年的成熟方法,把它们搬到生物学上只需要一个更好的表示——而 scVision 找到了这个表示。

参考来源

评论

0 条已公开
登录注册后可以参与评论。

正在加载评论...