asd5102449 发表于 昨天 21:58

AI自动写综述做到什么程度了?浙大、上交提出DAS,1小时生成面向发表的Acad ...




随着学术文献数量持续增长,高质量学术综述已经成为研究者快速进入陌生领域、梳理研究脉络和追踪最新进展的重要入口。但真正写好一篇综述并不容易:它通常需要阅读大量文献、持续跟进领域动态,并投入大量专家时间。
大模型的出现,让这件事开始有了新的可能。近年来,Deep Research 和自动 Survey Generation 系统已经能够完成论文检索、资料整理、分析与长文本生成,甚至快速产出数万字的 Research Report。
但如果真正对照一篇高质量的 Academic Survey,问题就复杂得多。
论文该怎么组织?Taxonomy 怎么划分?不同论文应该放到哪些 Section?一个 Claim 到底应该由哪些 Citation 支撑?写完之后,References、Cross-reference、Figure、Table 和最终 PDF 又是否真的可靠?
这些问题,并不是简单拉长上下文、生成更多文字、引用更多论文就能解决的。现有 Deep Research 和自动 Survey Generation 系统,很多时候仍主要围绕 “检索 — 分析 — 写作” 展开,最终结果也更接近一份 Research Report,而不是一篇结构完整、组织严谨的 Academic Survey。
针对这些问题,浙江大学、上海交通大学团队及其合作者提出 Deep Academic Survey(DAS),尝试让 AI 在 1 小时内自动完成一篇面向发表的 Academic Survey。
不同于传统的「检索 — 写作」流水线,DAS 采用 Stateful Agentic Framework,将整个过程重新定义为 Stateful Agentic Closed-Loop Manuscript Construction。



图 1|现有 Deep Research 和自动综述生成系统与 DAS 对比图
在 DAS-Bench 的 30 个 Survey Topic 上,DAS 从Citation、Taxonomy、Discourse 和 Manuscript Reliability四个核心维度进行评测,最终平均得分达到4.34,完整参与 30 个 Topic 的最强基线为4.03。在专家匿名评测中,DAS 相比 Naive RAG 在27/30个 Topic 上更受偏好,相比 AutoSurvey 则在19/21个共享 CS Topic 上更受偏好。
目前,项目网站已经直接开放了220 篇 DAS 自动生成的热门方向 Survey,完整结果和不同方法的对比都可以在线查看。





[*]论文链接:https://arxiv.org/abs/2608.18034
[*]项目地址:https://zhikaixu24.github.io/projects/DAS/
[*]代码链接:https://github.com/ZhikaiXu24/DAS
[*]数据地址:https://huggingface.co/datasets/ZhikaiXu24/DAS-2M

面对近 200 万篇论文,
DAS 先解决的不是「写」,而是「读懂」
DAS 的后续检索、组织和写作,都建立在一个底层文献基础设施之上 ——DAS-2M Literature Metadata Lake。
团队对2020 年 1 月以来近 200 万篇 arXiv 论文进行全文解析,并利用 LLM 提取面向 Survey Writing 的结构化 Metadata,包括方法、数据集、实验结果、创新点和局限性等信息,目前DAS-2M 已完整开源至 Hugging Face。相比只依赖 Title 和 Abstract,这相当于提前对大规模论文进行更细粒度的「预理解」:一篇论文只需解析一次,便可以被不同 Survey Topic 重复利用;同时,DAS-2M 也是一个持续动态更新的 Literature Metadata Lake,随着新的 arXiv 论文发布,系统会通过同一套解析与 Metadata 提取流程不断补充最新文献,使 DAS 在生成新的 Survey 时能够持续跟进领域进展。
在此基础上,DAS 建立 lexical 和 semantic 索引。用户输入 Topic 后,系统先从 DAS-2M 中检索出全局候选文献,再基于这些候选论文构建Candidate-Grounded Taxonomy,并通过Reverse Paper-to-Section Routing判断每篇论文应该支持哪些 Section。
这样,DAS 后续的 Taxonomy、Paper Assignment、Paragraph Planning 和 Citation Planning,都不再建立在零散检索结果上,而是共享同一套可复用的文献表示和候选集合。
从组织到写作,
DAS 如何形成 Agentic Closed Loop?
DAS 的核心并不是简单串联多个 Agent,而是维护一个持续更新的Manuscript State:候选文献决定 Taxonomy,Taxonomy 和 Routing 进一步约束写作,而 Review 发现的问题又可以重新激活对应的 Writing State。整个 Survey 的构建过程因此不再是一次性的流水线,而是一个可以持续更新和回退的Stateful Agentic Process。



图 2|DAS 整体框架。
在真正生成正文之前,DAS 还会继续进行分层规划:Taxonomy → Paragraph Plan → Writing Points → Claim → Citation Group。
也就是说,Citation 并不是正文写完之后再补,而是在 Claim-Level Planning 阶段就确定「什么 Claim 应该由哪些论文支撑」,再据此完成 Paragraph Drafting。
写完也并不意味着结束。Semantic Reviewer 会检查章节目标、论述逻辑和 Citation Support;如果发现问题,系统会根据问题范围执行Direct Edit、Paragraph Replan 或 Section Replan,并再次进入 Review。与此同时,Deterministic Validation 负责检查 Citation Identifier、Cross-reference、LaTeX 和 Compilation 等确定性约束,由此形成:Generation → Review → Repair → Re-evaluation的闭环。
最终,通过 Review 的内容才会进入 Manuscript Finalization,由系统进一步完成 Figure、Table、Bibliography、Cross-reference 和 LaTeX Assembly,并编译得到完整 Survey PDF。
这也是 DAS 所强调的「面向发表」:目标不只是写出一篇足够长的文本,而是尽可能保证从文献组织、Claim/Citation Planning,一直到 References、图表和最终 Manuscript 的一致性与可靠性。
效果到底怎么样?
220 篇完整 Survey 已经可以直接查看
当然,对于一个 Survey Generation 系统,只看 Benchmark 分数还不够,最后还是要看真正生成出来的论文。
目前 DAS 官网已经开放了220 篇热门研究方向的完整 Survey,同时还提供 Codex、GPT Deep Research、AutoSurvey、InteractiveSurvey 等方法的生成结果,可以直接横向比较。论文中的定性比较也显示,不同系统在 Citation Stacking、粗粒度 Attribution、重复结构以及 Figure 与正文耦合等方面存在明显差异。



图 3|Codex、GPT Deep Research、AutoSurvey、InteractiveSurvey 与 DAS 的完整 Survey 定性比较。



图 4|DAS 官网目前已经开放 220 篇热门 Topic 的完整生成结果。
生成效果究竟怎么样,与其只看一个 Benchmark 分数,不如直接打开一篇看看。


[*]项目地址:https://zhikaixu24.github.io/projects/DAS/#manuscripts

AI 距离真正「写完一篇 Survey」,还有多远?


当然,面向发表并不意味着可以直接替代研究者完成最终投稿。DAS 生成的 Survey 仍需要人工核验;与此同时,Academic Survey Evaluation 本身也仍是一个开放问题,不同 Judge 在细粒度评价上依然可能存在差异。论文中的 Cross-Judge Evaluation 也观察到了这一现象。
随着 DAS-2M 持续更新,未来还可以进一步探索动态文献追踪、人机协同修改,以及可维护、可持续更新的 Agentic Academic Survey Construction。
DAS 希望探索的最终问题并不是「AI 能不能一次写出一篇很长的文章」,而是:
面对不断增长的学术文献,AI 能否通过可追溯、可修正的 Stateful Agentic Closed Loop,帮助研究者更快进入陌生领域,并持续组织和理解不断演化的学术知识?
作者介绍
论文共同第一作者为浙江大学 APRIL 实验室博士生徐志凯、薛竹村,通讯作者为浙江大学百人计划研究员张江宁。
页: [1]
查看完整版本: AI自动写综述做到什么程度了?浙大、上交提出DAS,1小时生成面向发表的Acad ...

SCI期刊发表辅导