清华AIR联合水木分子开源BioMedGPT-Mol 化学AI迎新突破

2026年3月18日,清华大学智能产业研究院(AIR)联合生物医药大模型企业水木分子,正式开源化学分子通用基座模型BioMedGPT-Mol。该模型具备通用分子表征能力,可覆盖药物筛选、属性预测、分子生成等多个下游研发场景,是国产大模型从通用对话向专业领域深耕的标志性成果,将为全球药物研发降本提效提供底层技术支撑。

一款创新药的平均研发周期超过10年、研发成本高达20亿美元,始终是制约生物医药产业创新的核心痛点。而过去数年,大量针对单一任务开发的碎片化AI算法,因为泛化能力不足、适用场景有限,始终未能成为研发端的通用生产力工具。

清华大学智能产业研究院(AIR)长期聚焦AI技术的产业落地应用,此前已经在自动驾驶、智慧医疗等多个交叉领域推出了多个可落地的技术成果;而水木分子作为国内最早布局生物医药大模型的创新企业之一,已经在分子预训练、药物靶点预测等方向积累了近百项技术专利。

双方此次选择将BioMedGPT-Mol完全开源,正是希望打破生物医药AI领域的技术壁垒,为全球科研人员、药企研发团队提供统一的高质量底层基座,避免重复造轮子的资源浪费。

不同于市面上大多针对单一任务训练的化学AI工具,BioMedGPT-Mol本质是具备通用表征能力的大语言模型:它可以像理解自然语言一样识别分子结构、化学键、物理化学特性等核心信息,无需针对性的大规模微调,即可在多个下游任务中表现出远超传统算法的泛化能力。

据公开测试数据,目前该模型已经在12个公开的药物研发标准测试集上取得了SOTA(最优)表现,尤其在难成药靶点的分子筛选、全新功能分子生成等此前AI难以覆盖的场景中,准确率较传统算法提升了47%以上。

此前生物医药领域的AI应用长期处于“各自为战”的状态:不同药企、不同研发团队使用的算法底座不统一,研发结果难以复现、数据无法互通,极大限制了AI技术的落地效率。

BioMedGPT-Mol的开源,有望成为化学AI领域的通用基础设施:研发人员基于统一基座开发的应用,其结果具备可对比性,可推动整个药物研发流程的智能化、标准化,预计可将早期药物筛选的周期从数月压缩至数周,研发成本降低60%以上。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。