scVision:斯坦福把单细胞转录组变成图片,视觉基础模型零样本碾压语言模型
scVision:斯坦福把单细胞转录组变成"图片",视觉基础模型零样本碾压语言模型
斯坦福大学 Islam Lab 最新发布的 scVision,用一个看似简单的思路颠覆了单细胞基础模型的范式:不再把细胞当成"一段文字",而是把它画成"一张图片"。7200 万人类细胞预训练、冻结编码器零样本推理,在全部 6 个独立测试集上,scVision 的细胞类型注释准确率超越了所有现有单细胞基础模型和经典方法。
换一种方式"看"细胞
过去三年,单细胞基础模型几乎清一色走了语言模型路线——scGPT、Geneformer、scBERT 等都是把基因当成 token,把细胞当成"一句话"来处理。这条路的代价很明确:基因之间的空间关系被丢弃了,基因表达的连续幅度被离散化了。不管模型参数再怎么堆,这种结构性信息的丢失都补不回来。
scVision 的核心创新在于换了一种表示方式。它用最优传输(optimal transport)算法,把约 11000 个信息基因放在一张共享的 pan-tissue 地图上,让那些倾向于共表达的基因成为空间邻居。任何一个细胞的基因表达数据投射到这张地图上后,转录组就变成了一张固定尺寸的连续图像——基因程序变成了局部纹理,细胞身份变成了全局模式。
三步走,一个冻结编码器
scVision 的工作流程分为三步:
第一步:基因地图布局。 通过最优传输计算,为所有基因分配固定的空间坐标。这个布局是跨组织、跨细胞类型共享的,一旦确定就不再改变。
第二步:掩码图像建模预训练。 使用 ViT-Base 编码器,在 7200 万个人类细胞上做掩码图像建模(Masked Image Modeling)。不需要任何标签,模型通过预测被遮蔽的图像块来学习细胞表示。
第三步:冻结编码器零样本推理。 预训练完成后,编码器完全冻结,不针对任何下游任务做微调。直接用这个编码器提取的特征做细胞类型注释、多研究整合、基因程序推断等任务。
效果:不是多一点,是全面领先
在 6 个完全独立的 held-out 人类细胞图谱上,scVision 的零样本细胞类型注释准确率全面领先——超越了 scGPT、Geneformer 等现有基础模型,也超过了 Seurat、scANVI 等经典基线。
更值得关注的是几个效率指标:
- 标签效率:比经典方法少用 50 倍以上的标注数据就能达到同等或更好效果
- 推理速度:比 token 类基础模型快 37 到 300 倍——因为图像表示是固定尺寸的,不需要像 token 模型那样处理可变长度序列
- 整合能力:在多研究整合任务上与 scVI 持平,但不需要任何批次标签,同时保留了最多的生物结构信息
一个关键实验揭示了这个模型的本质:当研究者打乱基因在地图上的空间位置(但保持网络结构不变),准确率的下降幅度甚至比直接去掉视觉 Transformer 还要大。这说明真正携带信号的是基因的生物学空间布局,而不是网络本身——表示方式的选择比模型架构更重要。
基因程序也能无监督发现
除了细胞类型注释,scVision 在无监督基因程序推断上也表现优异。它不需要任何先验知识,就能从冻结编码器的特征中恢复出已知的功能基因模块。这为探索性分析提供了新的可能性:当你面对一个不熟悉的组织或疾病数据集时,scVision 可以直接告诉你"这些细胞属于什么类型"以及"哪些基因在协同工作",无需标注、无需微调。
对谁有用?
- 单细胞研究者:需要快速注释新数据集细胞类型,或跨研究整合数据
- 药物发现团队:需要在大规模单细胞数据中识别疾病相关细胞状态
- 计算生物学方法开发者:视觉范式为单细胞表示学习开辟了全新的设计空间
局限与展望
目前 scVision 仅在人类细胞上预训练和验证,跨物种迁移能力尚未验证。作为 arXiv 预印本,模型和代码的公开程度还有待确认。此外,冻结编码器虽然保证了通用性,但在某些需要极致性能的特定任务上,可能不如经过微调的专用模型。
不过,scVision 最大的贡献或许不是某个数字上的提升,而是证明了一个观点:在单细胞生物学里,怎么"看"数据,比用多大的模型更重要。当计算机视觉领域已经积累了数十年的成熟方法,把它们搬到生物学上只需要一个更好的表示——而 scVision 找到了这个表示。