
哈佛大学团队提出PG - LLM基准测试:通用语言模型在蛋白突变筛选有价值,但难替代专业工具
万万没想到,哈佛大学和Capable的研究团队提出了一项依托ProteinGym数据集构建的PG - LLM基准测试,并首次在统一评价维度中同时测评了13款通用语言模型和95种专业蛋白质预测工具。
还记得第一次与ChatGPT、豆包聊天时所感受到的震撼吗?依托通用语言模型搭建的它们似乎无所不知,不仅能诗善对、通晓时事,还可以作画、写信、编代码……种种能力让人直呼神奇。然而对于这样一个在文化、艺术、科学等全领域似乎「无所不能」的智慧助手,越来越多的科学家心中出现了一个疑问:通用语言模型在知识壁垒高筑的专业领域究竟能有何表现?
以蛋白质工程而言,当前通用语言模型凭借在生物知识和推理基准测试中的性能提升,已经越来越频繁的在蛋白质设计流程中亮相,然而科学家对于其评估蛋白突变效应的能力目前却尚无明确的认识。虽然一些技术报告已经展示了部分通用语言模型的测评效果,如Anthropic系统技术报告中提及的ProteinGym - Hard评测,评估了Claude系列模型。但这些研究仍存诸多问题,比如模型群体单一,缺乏横向对比验证等等。
针对于此,来自哈佛大学和Capable的研究团队提出了一项依托ProteinGym数据集构建的PG - LLM基准测试,并首次在统一评价维度中同时测评了13款通用语言模型和95种专业蛋白质预测工具。通过PG - LLM基准测试验证,科学家首次明确了通用语言模型确实能做蛋白突变筛选,具有高度的实用价值,且性能已优于至少半数的成熟专业预测工具。该基准的提出,或许将为蛋白质工程领域的新兴工具提供强有力的背书,同时也为蛋白质设计提供全新的思路。
相关成果以「PG - LLM: Benchmarking General - Purpose Language Models for Protein Variant Ranking」为题,发表预印本于bioRxiv。研究亮点如下:
- 搭建首个面向通用语言模型的蛋白突变排序标准化评测基准PG - LLM;
- 开展大规模跨模型对照实验,清晰划定通用语言模型与专业蛋白预测模型的性能边界;
- 提供多维度实验视角,揭示两类模型底层机制差异,为潜在的融合方案提供依据。
论文地址:https://www.proteingymllm.com/paper
ProteinGym数据集为基底,覆盖217组实验测定数据
PG - LLM依托当前蛋白质突变预测领域通用标准化基准数据集ProteinGym构建。本研究采用完整的ProteinGym v1.3版本深度突变扫描数据集,覆盖186种不同蛋白质、共计217组实验测定数据,其中148组为仅单位点突变实验测定,另外69组为多位点复合突变实验测定。
为保障测试公平性,研究采用分层抽样策略构建突变候选集合。所有突变按照实测功能值从小到大进行排序,均等划分为10个区间,再从各区间抽取近似等量突变样本,以此确保候选集均衡涵盖低、中、高不同功能水平的样本,防止样本集中在单一区间造成测试偏差。与此同时,为消除随机采样带来的偶然性结果误差,研究针对每组实验构建三套互相独立的候选突变子集,称之为draws。最终模型性能得分取三次评测结果的平均值。
本研究设置了三种候选集规模,每组分别包含10、50、100个突变,榜单结论主要基于规模为50个突变的候选集得出。为保证实验统一性和公平性,所有实验得分沿用ProteinGym的嵌套宏聚合规则的设定,即实测分值越高,代表突变后的蛋白功能表现优异。
首个面向通用语言模型的蛋白突变排序标准化评测基准
PG - LLM基准测试是一套专为测评通用语言模型蛋白突变排序能力而搭建的标准化基准测试工具集。该框架内设计公平统一的工作流程,以实现零样本突变排序任务。具体来说,每次任务仅对模型输入蛋白序列和实验检测方案描述,在全程不提供多序列对比(MSA)或蛋白质三维结构信息等情况下,强制使其自主对输入的50条打乱顺序的突变蛋白按照功能良莠进行排序。
为系统评估通用语言模型在蛋白质突变排序任务上的群体表现,避免单一模型带来的片面结论,同时量化通用语言模型所处性能段位并明确其能力边界,本次研究一次性纳入两大类评估对象从横向和纵向全维度进行验证,一类是通用语言模型,另一类是专业蛋白质预测模型。
在输入条件和评估规则方面,基于两类模型不同的工作原理,研究针对专业预测模型采用与通用语言模型刻意不对等的输入条件,不同于后者更为严苛的输入条件,前者可使用原生配套输入,包括MSA或蛋白质三维结构信息等。评估规则则采用与通用语言模型相同的指标进行聚合评估,得分指标以斯皮尔曼等级相关系数进行表示,ρ = 1代表排序完全一致,ρ = 0代表不存在单调等级相关性。
具体而言,通用语言模型包含了Claude Opus 5、GPT系列、Gemini系列、GLM - 5.2和Kimi K3等在内共计13款当前主流模型。而95款专业蛋白质预测模型中,则是包含了当前蛋白质突变领域的先进预测工具VenusREM,这个由天鹜科技AI Lab技术科学家谭扬牵头研发的检索增强型开源蛋白语言模型,可专门用于零样本单位点突变效应预测,在本次研究中作为专业领域模型中的佼佼者,表现优于Claude Opus 5。
此前,VenusREM已在哈佛医学院团队构建的蛋白质突变效应评测基准ProteinGym上取得了领先的零样本预测性能,超过了Meta、BioMap、Microsoft等团队开发的代表性模型。VenusREM模型及相关代码已全面开源,在Hugging Face平台近30天下载量超过4,000次,自发布以来累计下载量已超过25万次。
为了便于开发者快速上手VenusREM这一先进模型 ,HyperAI官网(hyper.ai)的教程板块已上线「VenusREM:基于检索增强的蛋白质突变效应预测」,已完成环境配置,可低门槛部署。 在线运行:https://hyper.ai/cn/notebooks/venusrem - retrieval - enhanced - protein - mutation - effect - prediction VenusREM开源地址:https://github.com/ai4protein/VenusREM
跨模型、多维度对照试验,揭示两类模型底层机制差异
本研究核心结论基于规模为50的候选集得出,结果显示,Claude Opus 5以斯皮尔曼相关系数ρ = 0.406登顶通用语言模型榜单,GPT - 5.6 Sol紧随其后,ρ = 0.402。不过这一结果也并非绝对,当对比两款都能跑完的实验时,GPT - 5.6 Sol的表现反而更加优异,譬如在180个共享评估指标中, GPT - 5.6 Sol得分以0.409对0.400实现反超。
更具有说明意义的是与垂类模型进行对比,Claude Opus 5也可达到中位数水平。具体来看,其表现超过了全部95种方法中的49种,其中包括46种纯序列方法中的41种,和49种使用MSA或结构等复合方法中的8种。表现在得分上,其得分高于纯序列方法中位数ρ = 0.374,接近于专用蛋白大模型ESM2 - 650M的0.411,不过仍大幅落后于VenusREM的0.523。
为进一步验证提升推理阶段计算资源是否可以改善通用语言模型能力,研究人员执行了更进一步的验证。结果显示,给模型开放更长思考、输出更多推理文字,所有GPT、Claude和Gemini模型的排名准确率均会上涨,但当到达一定程度后性能增益也会逐步收束,始终无法追上专用蛋白预测模型。
不过资源增加并非全部向好,增加候选集合规模的做法却会使通用语言模型得到适得其反的作用,例如候选规模从10增加到100时,在178个共享指标中,GPT - 5.6 Sol的得分反而由0.423下降至0.375,其他通用语言模型的性能下降同样无法避免。与之形成鲜明对比的是,ESM2 - 150M、ESM2 - 650M和VenusREM这些垂类模型几乎不受影响。
除此外,纯序列预测工具在进化对比信息充足的蛋白上的表现也更好,而通用大模型的准确率几乎不受对比深度影响。例如13款通用语言模型与46种纯序列方法的对照实验中,在180项检测中显示,在低深度和高深度蛋白质之间,13款通用语言模型的聚合结果基本没有变化,低、中、高深度组调整后的性能分别为0.313、0.301和0.311,高低深度之间的差值仅为 - 0.002。反观纯序列方法的平均值则逐步从低深度时的0.309上升至中深度的0.380和高深度的0.411,高低差值为 + 0.102,且46种方法中45种的点估计显示高深度性能优于低深度。
最后,研究进一步对训练数据污染是否影响模型预测准确率进行了验证,结果显示,能认出原始文献的推理过程与没认出的相比,排名准确度并无稳定提升,甚至部分模型认出后的分数更低。
潜在融合方案为蛋白质设计领域的工具运用提供新思路
总的来说,本研究一系列的结果,可靠展示了通用语言模型在预测蛋白突变排序上的能力,从其性能超越多款经典序列预测工具来看确有实用价值;但同时也证实了其与领先专业预测方法之间尚存在难以企及的差距,还无法对专业蛋白预测方法进行完全替代。不过「术业有专攻」,无论是通用语言模型还是专业预测模型,在面对专业领域任务时,都并非只能二者择其一,如何协调工作同样是重要课题。
值得关注的是, 在本研究的primary leaderboard中,Spearman相关系数遥遥领先的VenusREM,是由一位00后博士生主导研发的 ——天鹜科技AI Lab技术科学家谭扬现为上海交通大学 & 上海创智学院2025级联培博士生。作为一个面向蛋白质突变效应预测与蛋白质工程的多模态预训练模型,VenusREM的核心目标是联合利用蛋白质的氨基酸序列、三维结构和同源进化信息,更准确地评估候选突变对蛋白质活性、稳定性、结合能力等功能性质的潜在影响。
与仅依赖单一序列信息的传统蛋白质语言模型不同,VenusREM将氨基酸序列编码为序列词元,并将每个残基周围的局部三维空间环境离散化为结构词元,再通过解耦多头交叉注意力联合建模序列上下文、局部结构特征以及残基间的相对位置关系。如此一来,模型不仅能够理解某个氨基酸在序列中的前后依赖,还能够识别序列上相距较远、但在三维空间中彼此接近的残基相互作用。 在此基础上,VenusREM进一步引入检索增强模块,从蛋白质数据库中搜索与目标蛋白相关的同源序列,并通过多序列比对提取各个位点的进化保守性和氨基酸替换偏好。模型将序列—结构联合表征与同源进化信息进行加权融合,在无需目标蛋白实验标注或额外训练的零样本条件下,通过比较突变型与野生型氨基酸在相应位点的预测得分,为单点及多点突变计算适应度分数并实现候选突变排序。
随后, 谭扬博士基于VenusREM在公司内牵头完成了对话式蛋白质研发智能体MatwingsVenus™的开发与落地。MatwingsVenus™最大的亮点也在于真正实现了「聊天做研发」,不用深耕代码,不用搭建复杂模型,仅像日常聊天一样下达指令,AI就能独立完成蛋白质的设计、预测与全流程验证。就在上个月,这一「AI科学家」成果还在2026世界人工智能大会上大放异彩,与阿里、百度等行业巨头并肩斩获大会「镇馆之宝」的殊荣,成为大会唯一入选的科学智能产品。
正如谭扬在面对采访时所言,通用语言模型与垂类模型各有优劣,前者「博学」而缺乏对专业领域的认知深度,后者具备对底层科研数据的深刻认识但也缺乏思考和推理能力,用通用语言模型负责读懂复杂的实验要求,从而实现Human - in - the - loop(人机回环),结合垂类模型利用进化信息或结构信息进行精准打分,或许能实现更优的效果。

295

被折叠的 条评论
为什么被折叠?



