大模型正在进入科研评审流程。
它可以快速概括论文内容,检查格式和引用,识别方法描述中的缺口,推荐潜在审稿人,甚至生成一份结构完整的评审意见。对于投稿量不断增加的期刊和会议来说,这些能力确实能够减少重复劳动,缩短等待时间。
但科研评审并不只是找错题,也不是一场摘要比赛。它更重要的作用,是判断一个尚未被广泛接受的想法是否值得被认真对待。
当大模型越来越多地参与评审,科研界需要面对的核心问题不是“能不能提高效率”,而是:在提高效率的同时,如何保护那些暂时不符合主流、表达不够成熟、却可能具有真正价值的少数意见。
一、评审不是把论文压缩成摘要
大模型非常擅长总结一篇论文。它能够提取研究问题、方法、数据和结论,并把复杂内容整理成清晰的结构。
但一篇论文真正重要的地方,未必都能被摘要准确表达。
有些研究的价值不在于立即得到漂亮结果,而在于提出一个新的问题;有些方法在当前数据上表现一般,却可能为未来研究提供不同路径;还有些论文看起来不够成熟,但它试图挑战一个被长期默认的前提。
如果评审流程过度依赖模型生成的概括,研究就可能被压缩成几个熟悉的标签。模型更容易识别已经被大量讨论过的研究模式,却不一定能理解一个新概念为什么值得被保留。
科研评审的难点,不是把内容讲清楚,而是判断内容中哪些部分值得继续探索。
二、表达流畅可能掩盖判断不足
模型生成的文本通常结构完整、语气客观、逻辑顺畅。这会给评审带来一种新的偏差:语言质量被误认为研究质量。
一篇论证普通的论文,如果经过模型润色,可能显得十分严谨;一篇观点新颖但表达粗糙的论文,却可能因为语言不够标准而显得不够可信。
当审稿人也使用模型辅助撰写意见时,评审文本还可能出现进一步的同质化。不同审稿人使用相似的表达、相似的评价维度和相似的风险判断,最终形成一批看起来专业、实际上缺乏独立思考的报告。
科研中的重要分歧,往往并不体现在语言上。它可能来自对问题的不同理解、对证据权重的不同判断,或对未来发展方向的不同想象。
如果所有评审意见都被模型整理成整齐的格式,分歧可能变得更容易阅读,却更难被真正看见。
三、自动筛选会放大历史偏好
期刊和会议可能利用大模型进行初步筛选,判断论文主题是否匹配、方法是否完整、引用是否充分,甚至预测论文是否值得进入下一轮评审。
这种方式能够提高处理效率,但模型通常会从历史数据中学习。
如果过去被接受的论文更集中在某些机构、语言、研究主题或方法体系,模型就可能把这些特征误认为“高质量研究”的信号。它未必有意排斥其他方向,却会在统计上更偏好熟悉的样式。
这种偏差尤其容易影响跨学科研究和来自非主流研究群体的论文。它们可能使用不同的术语,引用不同的知识传统,或提出尚未形成共识的问题。模型面对这些内容时,可能更容易给出“相关性不足”“方法不够成熟”或“贡献不够明确”的判断。
问题在于,这些评价听起来合理,却很难追溯到底是基于论文自身的缺陷,还是基于过去样本的惯性。
四、引用检查不能替代证据核验
大模型可以帮助审稿人快速发现引用格式问题、文献之间的关联和某些可能缺失的研究。
但它也可能误读文献、混淆研究结论,甚至把不存在的内容表达得非常确定。
更复杂的是,模型生成的负面评价往往比正面评价更容易影响结果。一句“已有研究表明该方法缺乏创新”,如果没有准确的文献依据,就可能让作者陷入难以申辩的境地。
因此,任何涉及事实判断的评审意见,都应当能够回到具体证据:是哪篇论文、哪组数据、哪一步方法、哪一个实验结果支持这个判断。
不能因为一段话听起来专业,就把核验责任交给模型。科研评审中的错误,不只是文字错误,它可能改变一项研究能否被公开讨论的机会。
五、科研进步需要保留“尚未被证明”的空间
科学共识很重要,但科学进步并不总是从共识内部发生。
很多真正有影响力的研究,在早期都可能显得不完整、难以验证,甚至与主流结论相冲突。如果评审系统只奖励与历史论文相似的结构和结论,它会提高平均质量,却可能降低突破性研究出现的概率。
这并不是说所有标新立异的观点都值得发表,也不是降低证据标准,而是要区分“证据不足”和“方向陌生”。
对于高风险但可能具有高价值的研究,可以设置不同于常规论文的评审路径。例如要求作者更清楚地说明假设、限制和后续验证方案,同时邀请具备不同背景的评审人进行独立判断。
模型可以帮助识别逻辑缺口,却不应独自决定一个想法是否值得被继续观察。
六、人类评审人的职责会发生变化
大模型参与评审后,人类审稿人的工作重点不应只是修改措辞和整理结构,而应更多承担三类责任。
第一,判断研究问题是否真正重要,而不仅是论文是否写得完整。
第二,区分技术缺陷、证据不足和表达问题,避免把可修正的问题直接等同于研究没有价值。
第三,对最终评价承担明确责任,不能用“系统分析显示”替代自己的专业判断。
高质量评审可以使用模型完成资料整理、格式检查和初步问题清单,但最终意见必须包含审稿人自己能够解释的判断。
如果审稿人无法说明为何接受或拒绝一篇论文,那么模型只是让一个没有形成的判断看起来更加完整。
七、评审流程需要留下可追溯记录
期刊和会议如果允许使用大模型,就需要明确它能参与哪些环节。
模型可以帮助检查格式、整理公开文献和发现明显的统计问题,但不应作为唯一依据决定论文录用、拒稿或学术不端。
评审系统还应记录模型参与的范围、使用的版本、生成过的关键建议,以及最终哪些建议被采纳。作者有权知道评审意见中是否包含模型生成的内容,也应当能够对事实错误提出申诉。
对于尚未公开的论文,保密性同样重要。未经授权的稿件不能被随意输入不清楚数据用途的服务中。评审效率不能以研究内容泄露为代价。
一个成熟的流程,不是让模型隐藏在人类意见背后,而是让每个参与者都能说明自己做了什么、依据是什么、哪里仍然不确定。
八、不能只用“更快”评价评审系统
如果期刊只考核评审速度,大模型很容易被用来批量生成格式标准但内容空泛的意见。
真正应该关注的,是评审是否指出了关键问题,是否帮助作者改进研究,是否准确理解了论文,是否在研究发表后仍然经得起检验。
有些评审意见很短,却准确抓住了最重要的漏洞;有些意见篇幅很长,却只是把常见模板重新排列。大模型能够快速增加文字数量,却不能自动增加判断价值。
未来的评审评价,应当同时考虑意见的准确性、具体性、独立性和对研究的实际帮助。只有这样,技术才不会把科研评审变成一条追求吞吐量的流水线。
结语
大模型可以让科研评审更快,却不能替科研共同体决定什么值得被相信、什么值得被继续追问。
它适合处理重复、明确、可验证的工作,也适合帮助审稿人扩大阅读范围、整理证据和发现遗漏。但对于研究的原创性、潜在价值和长期意义,仍然需要人类承担判断责任。
科研最需要保护的,不是所有观点都得到认可,而是有价值的不同意见不会因为不够熟悉、不够流畅或不符合历史样本而过早消失。
真正成熟的智能评审系统,不会只追求更快地筛选论文,而会努力让证据更清楚、分歧更可见、少数意见也有被认真讨论的机会。