|
|
2023年的一天,如果你把一篇论文丢给市面上任何一个顶尖大模型,让它写一份审稿意见,你多半会得到一份看起来相当专业的文档,有优点,有缺点,有几个问题,格式工整。
但你可能不知道一件事:这些看起来一本正经的评审意见里,经常藏着编造的参考文献。
模型会煞有介事地告诉你"某某学者在2022年的研究中指出……",然后附上一个根本不存在的论文编号。这不是偶尔翻车,而是这类模型的通病,业内管这个现象叫幻觉。
**这就是为什么一群来自上海人工智能实验室、清华、人大、北交大的研究者决定做一件听起来简单但做起来极难的事:训练两个专门的AI,一个叫InternReviewer,专门写审稿意见,一个叫InternAdvocate,专门写作者对审稿意见的回复。**
而这两个AI最与众不同的地方,不是它们写得多好看,而是它们被逼着不能撒谎。
审稿这件事,为什么突然变得紧迫
先说说背景。这几年计算机领域顶会的投稿量暴涨到什么程度?NeurIPS、ICLR这类会议每年收到的论文动辄数万篇,审稿人根本看不过来,疲惫感和敷衍感就这样蔓延开。于是有人想到,能不能让AI来分担一部分审稿工作。
想法很好,但现实很骨感。目前做AI审稿的思路大体分两派。
一派叫训练无关方法,说白了就是拿GPT-5、Gemini这类强大的闭源模型,写一套提示词让它去扮演审稿人。这条路的问题是,这些模型压根没针对学术审稿这件事做过专门优化,写出来的东西容易流于表面,业内人士管这种审稿意见叫"讨好式评审",翻来覆去就是那几句"优点是创新性强,缺点是实验不够全面",看起来面面俱到,实际上什么有价值的信息都没给。
**另一派叫训练相关方法,试图用监督微调或者强化学习去真正训练一个审稿模型,但这条路同样卡在一个地方:怎么给模型一个靠谱的奖励信号。**
*监督微调*:一种训练方式,让模型直接模仿人类写的示范文本,学到的是表面风格而非深层逻辑。
如果用"让另一个大模型来打分评判"这种办法(业内叫LLM-as-a-Judge),研究团队发现这个办法本身就不靠谱。他们做了个小实验:把同一对审稿意见喂给评判模型两次,只是调换了两篇稿子出现的先后顺序,结果模型的偏好胜率从60%直接跳到35%。换句话说,评判结果很大程度上取决于谁先出场,而不是内容谁更好。用这种不稳定的信号去训练模型,就像用一把会自己变形的尺子去量东西,量出来的数字毫无意义。
这就是这篇论文要解决的核心矛盾:怎么给一个写审稿意见的AI,一个不会撒谎、不会被操纵、能真正反映质量的打分标准。
一份特殊的数据集:从OpenReview上扒下18万多组真实审稿对话
要训练模型,先得有数据。
研究团队从OpenReview平台上系统抓取了ICLR(2013到2025年)、NeurIPS(2021到2024年)、ICML(2025年)这些顶会的论文和对应的审稿、作者回复记录,一共整理出18万4857组"论文-审稿-回复"三元组。
*OpenReview*:一个公开的学术论文评审平台,很多顶级会议的审稿全过程都能在上面查到。
有意思的是,他们故意把最终的评分砍掉了。理由很实在:一篇论文的最终得分,往往是经过讨论阶段反复拉扯之后的结果,很可能和最初那份审稿意见的判断已经脱节了。如果拿最终分数去反推第一轮审稿的好坏,等于是在用作弊的答案去训练模型做题,看起来分数对了,逻辑其实是错的。
拿到原始PDF之后,团队用了一个叫MinerU的工具把论文转成结构清晰的markdown文本,保留了章节层级,这样模型读论文的时候能更好地理解逻辑脉络。同时严格按照会议惯例做了双盲处理,把作者姓名、机构、致谢全部抹掉,只留8到9页的正文,参考文献和附录都砍了,理由是大部分会议规则也不强制要求审稿人细读附录。
**这里有个细节值得琢磨:给InternReviewer的输入只有匿名论文本身,追求的是不受任何先入为主印象干扰的原创判断;而给InternAdvocate的输入是论文加上一份具体的审稿意见,因为作者回复本身就是针对具体质疑的回应,不能脱离语境。**
这就好比让两个人去判断一件事,一个只看事实本身做独立判断,另一个则是在别人已经提出质疑之后去回应,两种角色天然需要不同的信息输入,硬套一个模板反而会让判断变得混乱。
核心难题:怎么让AI在写审稿意见时不撒谎
这篇论文最硬核的部分,是它设计的这套奖励机制。
模型训练用的是强化学习,具体来说是把审稿和回复这两件事都建模成一个决策过程:模型每一步要么去搜索文献,要么去生成文字,最终目标是拿到尽可能高的累积奖励。
*强化学习*:一种让模型通过试错和反馈信号来自我优化的训练方式,模型做出一个动作后会得到奖励或惩罚,逐渐学会怎样的动作能拿到更高奖励。
问题来了,这个奖励信号从哪来?团队设计了四个模块化的分量,加起来构成总奖励。
第一个是语义对齐奖励。团队没有用BLEU这种统计词语重合度的老指标,理由很直接:一篇审稿意见如果把"不充分"换成"不足够",意思完全一样,但BLEU会因为字面不同而给低分;反过来,一篇观点完全相反的审稿意见,如果碰巧用了差不多的词汇,BLEU反而会给高分。这种指标根本抓不住语义层面的东西。
于是他们改用一个叫POLAR-7B的奖励模型来打分,这个模型走的是判别式路线,专门衡量生成内容和人类专家审稿之间的语义贴合程度,而不是简单的词语匹配。
第二个是格式合规奖励,检查审稿意见是不是包含了摘要、优点、缺点、问题、参考文献这几个固定板块,长度是不是落在2000到10000字符这个专家级审稿的合理区间内,太短说明模型偷懒,太长说明啰嗦。
第三个是工具使用奖励,这是防止模型偷懒不查文献的机制。系统规定,一次对话里工具调用次数是2次说明完全没搜索,直接扣1分;4到6次是理想区间,给满分1分;超出这个范围也要扣分,因为无休止地反复搜索同样是在浪费资源、逃避真正下结论。
第四个也是最关键的一个,叫引用可信度奖励,这个机制才是真正堵住幻觉漏洞的地方。
这套机制分两层。第一层叫内部一致性检查,看看正文里标注的引用编号是不是和文末参考文献列表完全对得上,有没有重复条目,编号是不是按顺序来的,还检查引用密度是不是异常(比如引用和信息来源的比例超过3.5就要扣分)。
第二层才是真正的杀手锏,叫外部锚定检查。系统会把模型最终引用的每一条参考文献,拿去和它在这次对话过程中真实调用搜索工具、真实检索到的文献记录做比对。只有当标题和arXiv编号完全匹配上工具返回的真实记录,这条引用才算数。**只要有任何一条引用是编出来的,也就是查无此文,整个这次生成的所有奖励直接扣1分,零容忍,没有商量余地。**
这个设计有多狠?打个比方,这就像一个学生写论文时引用了十篇参考文献,只要监考老师发现其中哪怕一篇是他编的假期刊、假论文,那么这十篇引用全部作废,这篇论文直接判零分,无论其他九篇引用有多真实。如果不这样设计会怎样?大概率的结果是,模型会学到一种取巧策略,真真假假混着写,反正大部分是真的能拿分,个别编造的也不会被单独揪出来惩罚,那幻觉问题永远解决不了。零容忍机制逼着模型把"每一条引用都必须查得到"内化成一种绝对纪律,而不是概率游戏。
为什么要自己建一个本地文献检索系统
光设计出这套引用验证机制还不够,因为验证机制要工作,前提是模型必须能实时去查文献。而这里藏着一个纯工程但极其现实的难题:调用外部API去搜论文,太慢了。
团队测过,直接调用arXiv官方接口做检索,平均每次请求要6.707秒,下载PDF的速度也只有每秒100到300KB。这在强化学习训练里是致命的,因为一次训练要跑成千上万次这样的检索调用,网速和接口限流随时可能让整个训练管线卡死甚至崩溃。
**于是他们干脆自己搭了一个本地的Elasticsearch索引,收录了59万3092篇计算机领域的arXiv论文,检索延迟压到了0.014秒每次请求,比在线方案快了将近500倍。**
*Elasticsearch*:一种高性能的全文搜索和索引数据库,常用于需要快速检索大量文本的系统。
这就好比你平时查资料,如果每次都要打电话去图书馆问工作人员帮你翻书架找书,一来一回可能要等几分钟;但如果图书馆提前把所有书的目录和摘要整理成一个可以瞬间检索的电子系统摆在你桌上,你伸手就能查到。对于需要反复高频检索的强化学习训练来说,这不是锦上添花,而是能不能训练下去的生死线。
为了让这个本地索引既快又准,团队还做了一层信息压缩,把每篇论文切成8000字左右的语义片段,用一个大模型生成密集的技术摘要,再把这些摘要浓缩成一份"全局快照",转换成向量存进索引里。这样既保证了检索速度,又不会丢失关键的技术信息。
还有一个更巧妙的设计,叫时间感知的约束检索。系统会根据每个会议的截稿日期,给审稿人角色设定一个"只能看到截稿前120天已发表文献"的时间限制,给作者回复角色设定"可以看到截稿后90天内的文献"这样一个相对宽松的窗口。
这个不对称的时间窗口设计其实很讲道理。真实审稿人在评审时确实只能看到投稿前的既有文献,而作者在写反驳意见时,往往会引用审稿期间新出的相关工作来回应"这个方法是不是已经过时了"这类质疑,两种角色本来就活在不同的时间语境里,系统必须精确复刻这种真实场景,否则训练出来的模型会带着"未来知识泄露"这种作弊嫌疑。
GSPO:为什么不能用普通的强化学习算法
选用什么优化算法来更新模型参数,也是一个技术决策,背后有它自己的道理。
团队用的是一种叫GSPO(Group Sequence Policy Optimization)的算法,而不是更常见的GRPO。
*GSPO*:一种在句子整体层面而不是单个词层面进行策略优化的强化学习算法,专门针对混合专家模型设计。
原因和模型架构有关。InternReviewer和InternAdvocate用的底座是一个30B参数的混合专家模型(MoE),这类模型内部有很多专家子网络,每次推理时系统会动态选择激活哪些专家。如果用传统的逐词优化方式,哪怕是很小的参数调整,也可能导致专家路由的分配方式发生剧烈且不可逆的变化,最终引发所谓的"训练推理不匹配",模型直接崩掉。
GSPO把优化目标从单个词的层面提升到整个句子序列的层面,通过一种带长度归一化的重要性采样比率来做梯度裁剪和更新,相当于把优化的"步子"迈得更稳,不会因为个别词的微小扰动就把整个专家路由体系搅乱。
训练过程中,各项能力是怎么长出来的
团队记录了训练过程中每个奖励分量随时间的变化曲线,这一段其实读起来相当有意思,因为它揭示了模型学习不同能力的先后顺序。
格式合规和工具使用这两项,几乎是训练一开始就迅速拉满了,前100步就基本饱和到接近满分。这不难理解,遵守固定的输出格式、按规定次数调用搜索工具,本质上是一种规则性很强的表层行为,模型的底座本来就有不错的指令遵循能力,稍加引导就能学会。
引用一致性也是类似的情况,从初始的负分状态在前100步内跳升到接近0.8分,然后趋于稳定,说明这种"编号对得上、格式规范"的规则型行为学起来也不算太难。
**但幻觉抑制这一项完全不同,它的提升曲线是缓慢而持续的,几乎贯穿了整个训练过程的700到800步。**
这个现象背后的原因值得琢磨。判断一条引用是不是真的存在于检索记录里,这不是一个可以靠模式匹配走捷径的任务,模型必须真正学会一种深层的知识关联能力,也就是把生成的每一条论述和它实际检索到的证据严格对应起来,这种能力没法速成,只能靠持续的试错慢慢磨出来。
反映语义质量的POLAR得分同样呈现出缓慢爬升、没有饱和迹象的曲线,说明即便在结构合规已经学会之后,模型依然在持续打磨论证的深度和批判的针对性,这个过程比学会格式规范要艰难得多。
如果拿一个更贴近生活的场景来说,这就像教一个新员工做汇报,学会PPT的排版模板、按时提交文件这类硬性要求,可能一周就能规范起来;但要学会真正抓住问题核心、说出有见地的分析,这种判断力的培养往往需要几个月甚至更长时间的反复历练。如果不区分这两类能力、用同一种训练强度去逼迫模型,很可能会出现格式学会了但深度判断始终原地踏步的局面,甚至因为奖励信号混杂而互相干扰。
实验结果:闭源大模型全线翻车
数据说话最有说服力。团队拿InternReviewer和InternAdvocate去对比Claude Sonnet 4.5、Gemini 3.1 Pro Preview、GPT-5.2这三个闭源顶尖模型,以及它们训练所依据的底座模型Qwen3-30B-A3B-Thinking。
**在最关键的引用真实性和幻觉抑制这两项指标上,几乎所有闭源模型的得分都是深度负数。**
Qwen3-30B-A3B底座模型在审稿任务上的引用得分是负0.9283,是所有模型里最差的,这说明即便一个模型本身的推理能力很强,也完全不代表它会老老实实地引用真实文献。Claude Sonnet 4.5在反驳任务上的幻觉得分是负0.8951,同样惨不忍睹。相比之下,InternReviewer和InternAdvocate在这两项上分别拿到0.7920、0.8560(审稿任务)和0.7620、0.8620(反驳任务),领先第二名超过1.5个绝对分。
工具使用行为上也有明显分野。GPT-5.2在两个任务上的工具得分都是负数,团队分析这是因为它有一种系统性倾向,喜欢无节制地反复搜索,偏离了"搜索一次然后综合总结"的预期节奏。而InternReviewer和InternAdvocate在这一项上都拿到了满分1.0000,说明强化学习训练确实培养出了一种有节制、有目的性的检索习惯。
有意思的是,在传统的BLEU和ROUGE这类词语重合度指标上,训练前的底座模型Qwen3-30B居然能和GPT-5.2打个平手,甚至反超。这恰恰印证了前面说过的道理,这些老指标衡量的是表面词汇相似度,跟内容的真正质量没有必然关系,团队也正是因为看穿了这一点,才把它们降级为次要的参考指标,而不是选模型的主要依据。
人类评审员怎么看
光有自动化指标还不够有说服力,团队又请了真人评审员做了一场盲测,让他们在一篇论文的两份审稿意见(或者两份反驳意见)之间选一个更好的,其中一份来自人类真实评审员,另一份来自各个AI模型。
结果显示,InternReviewer在审稿任务上的胜率是85%,也就是说人类评审员在85%的对比中,认为InternReviewer写的审稿意见比真人写的还要好。GPT-5.2表现更猛,拿到了90%的胜率,但Claude Sonnet 4.5只有45%,Gemini 3.1 Pro Preview仅有25%,都低于50%这个"和人类打平"的基准线。
在反驳任务上,InternAdvocate拿到了全场最高的80%胜率,明显高于GPT-5.2的55%。
值得一提的是,InternReviewer相较于它的底座模型Qwen3-30B-A3B,胜率从80%提升到85%,InternAdvocate相较于底座模型从70%提升到80%。**这个提升幅度证明了强化学习训练这一步不是白做的,确实带来了实打实的、能被人类感知到的质量提升。**
写在后面
读完这篇论文,让我印象最深的不是那两个模型本身,而是团队反复强调的一件事:不要相信任何一个"让AI给AI打分"的评价体系。
他们专门做了个小实验来证明LLM-as-a-Judge这套评价方法有多不靠谱,光是调换一下两篇待比较文本出现的先后顺序,胜率就能从60%跳到35%,这个波动幅度在统计意义上说明这套评价体系根本没法用来指导任何严肃的决策,包括模型训练本身。这提醒我一件更大的事:现在大量的AI能力评测报告,可能都建立在这种摇摇欲坠的地基上。
另一个让我反复咀嚼的细节是零容忍的引用惩罚机制。这个设计其实隐含了一种价值判断,学术圈的诚信,容不得"绝大部分是真的、个别是编的"这种妥协。这套机制没有试图去衡量幻觉的严重程度,而是直接说,只要有一个假的,全盘扣分。这种近乎苛刻的设计思路,或许比任何精巧的技术方案都更值得被其他领域借鉴,比如医疗AI、法律AI这些同样不能容忍半点编造的场景。
论文最后也坦诚地留了几个没解决的问题,比如现在的检索工具还只局限于arXiv,覆盖不到Google Scholar这类更广泛的文献库;论文里数学公式密集、图表又多的那种长文档,现有的解析工具还是会吃力。而更有想象空间的一条路,是让审稿人和作者这两个AI角色在对抗式的互动里共同进化,而不是各自训练、互不相干。
如果审稿人AI和作者AI真的能像两个较真的学者那样反复拉锯,会不会有一天,人类审稿人反而要向AI的评审意见学习怎么把批评写得又准又狠?
Q&A
Q1:InternReviewer和InternAdvocate是什么?
A:它们是上海人工智能实验室等团队训练的两个专门化AI agent,InternReviewer负责给学术论文写审稿意见,InternAdvocate负责代替作者写反驳回复,都是通过强化学习训练出来的。
Q2:这套系统怎么解决AI写审稿意见时编造参考文献的问题?
A:系统会把模型最终引用的每条文献,和它在对话过程中真实检索到的文献记录做比对,只要有一条引用查无此文,整个生成结果直接扣1分,采用零容忍机制彻底堵死幻觉引用。
Q3:为什么不用另一个大模型来给审稿意见打分?
A:团队实验发现这种LLM-as-a-Judge方法很不稳定,仅仅调换两份待比较文本出现的顺序,胜率就能从60%跳到35%,说明评判结果受位置偏差影响严重,不适合作为可靠的训练信号。 |
|