打印
在国家自然科学基金青年科学基金(A类)项目(批准号:62225209)资助下,中南大学李敏教授团队联合腾讯生命科学实验室,在人工智能驱动的细胞扰动建模领域取得进展。成果以“UniPert-G2CP从分子表征到表型建模连接遗传和化学筛选(UniPert-G2CP Bridges Genetic and Chemical Screens from Molecular Representation to Phenotype Modeling)”为题,于2026年8月6日发表于《细胞》(Cell)期刊,论文链接:https://www.sciencedirect.com/science/article/pii/S0092867426006549。

图 UniPert-G2CP框架连接遗传与化学扰动建模,加速计算模拟药物筛选
近年来,随着大规模生物数据持续积累和人工智能基础模型快速发展,构建能够模拟并预测细胞在不同分子干预下响应的“虚拟细胞”,已成为人工智能与生命科学交叉融合的重要前沿方向。实验药物筛选受限于庞大的化学空间、较高的实验成本和有限的筛选通量,难以实现对候选化合物的全面覆盖。与此同时,遗传扰动与化学扰动跨越不同的分子尺度和生物学层次,基因、蛋白质等生物大分子与小分子化合物在表征方式和数据来源上存在显著差异;不同细胞背景产生的异质性响应,进一步增加了从分子干预到表型变化的建模难度。相比之下,遗传筛选能够大规模、系统地揭示基因扰动与细胞表型之间的关系。因此,如何连接遗传与化学筛选,并准确模拟不同细胞背景下的药物响应,是虚拟细胞研究面临的重要挑战。
针对这些问题,研究团队提出由UniPert和G2CP组成的两阶段深度学习框架(图)。UniPert融合蛋白质序列、小分子结构、序列比对、图神经网络及化合物—靶标相互作用等信息,通过对比学习将遗传扰动因子与化学扰动因子映射到统一且具有生物学解释性的分子表征空间,从扰动“原因”层面连接两类筛选(图A)。G2CP进一步采用“遗传扰动预训练—化学扰动微调”策略,先从大规模基因扰动数据中学习细胞背景和响应规律,再利用有限的化学扰动数据完成跨域迁移,从扰动“结果”层面提升未见化合物的表型预测能力(图B)。
研究团队在多个大规模遗传—化学双域筛选数据上进行了系统验证。结果表明,在药物表型预测任务中,UniPert-G2CP利用遗传筛选弥补化学筛选数据不足;在仅使用20%化学训练数据时,完整遗传预训练使五种细胞背景下的总体预测相关性提升375.4%(图C)。在此基础上,研究团队构建了虚拟多细胞系扰动“因—果”联合表征空间(图D)。该空间不仅能支持研究不足分子的功能注释、未见遗传与化学扰动的表型预测,还能进一步刻画不同细胞背景下的药物响应异质性以及解析药物作用机制与耐药机制(图E)。
该研究突破了遗传筛选与化学筛选长期相对割裂的数据建模和分析模式,形成了从多模态分子表征到跨域表型迁移的统一建模路径,为更加高效、准确、稳健且可解释地模拟细胞扰动响应提供了新方法,并为人工智能虚拟细胞构建和人工智能驱动的精准医学研究提供了新的计算方法和开放资源。