文献综述不是按时间排列的论文列表。它是一种关于文献模式的论证:研究者在哪些地方达成一致,方法在哪里不同,哪些发现相互冲突,哪些局限反复出现,以及你的工作回应了什么空白。
主题,是你从“我读了很多论文”走向“我理解这个领域正在做什么”的方式。没有主题,综述会变成逐篇论文导览。有了主题,它才会成为综合。
Webster 和 Watson 关于文献综述的经典指导认为,综述应以概念为中心,而不是以作者为中心,因为概念应决定组织框架,而不是按文章摘要顺序排列。这正是这个工作流背后的核心思想。你不是在为了储存而整理论文,而是在搭建论证结构。

为什么按时间总结会失败
按时间总结很容易写,因为顺序已经被决定了。最早的论文在前,最新的论文在后,写作者可以避免选择结构。
问题是,时间顺序常常隐藏意义。它告诉读者什么先发生,而不是告诉读者什么重要。它可能展示一个主题的历史,但不能解释该领域当前的形状。
按主题组织更强,因为它按智识功能来分组论文:
- 用来研究问题的方法。
- 被考察的人群或语境。
- 被测试的理论或机制。
- 相互一致或冲突的发现。
- 反复出现的测量、数据集或模型。
- 不断出现的局限。
- 能支撑下一项研究的空白。
时间顺序在主题内部仍然可能重要。例如,方法部分可以讨论工具如何随时间演化。但时间顺序应该服务论证,而不是替代论证。
从综述问题开始
主题应来自综述问题,而不是来自参考文献管理器里最先出现的标签。
在给论文编码前,用一句话写出问题。然后写下这篇综述需要解释什么。例如:
这篇综述解释 AI 辅助标题和摘要筛选如何在系统综述工作流中被评估。
这个问题会提示可能主题:评估方法、筛选阶段、人工监督、主动学习、报告方式,以及漏掉研究的风险。另一个问题会创造另一组主题。
不要从工具名称、作者名称或期刊名称开始,除非它们本身就是问题的核心。大多数文献综述需要的是想法类别,而不是品牌类别或来源文件夹。
如果问题仍然不稳定,先处理范围。Google Scholar 之外的 AI 学术搜索可以帮助你在开始组织论文前发现词汇和相邻概念。
创建第一轮编码
编码是给论文、笔记或发现分配短标签。这些标签帮助你看到来源集合中的重复想法。
好的第一轮编码应具体到有用:
- active learning screening
- title and abstract prioritization
- non-native English detector bias
- citation hallucination
- human reviewer disagreement
- data extraction errors
- AI disclosure policy
弱编码太模糊:
- important
- AI
- good paper
- maybe useful
- background
模糊编码当下感觉省事,但之后会制造工作。像 “important” 这样的标签不会告诉你论文为什么重要。像 “human reviewer disagreement” 这样的编码则会指向一个段落。
第一轮可以慷慨地使用编码。早期编码不是最终提纲,而是帮助你发现反复出现的材料。
建立综合矩阵
综合矩阵把论文放在行里,把主题放在列里。它帮助你比较来源,而不是逐篇总结来源。
写作中心常常教授综合矩阵,因为它迫使研究者进行比较。Florida International University 写作中心将 synthesis matrix 描述为一种图表,帮助研究者围绕某个问题整理和分类论点,用于文献综述组织。Johns Hopkins Libraries 说明,synthesis matrix 可以帮助记录每个来源的要点,并在综合过程中记录来源之间的关系。
一个有用矩阵可以包括:
| 列 | 捕捉什么 |
|---|---|
| Citation | 论文或来源记录。 |
| Research question | 论文试图回答什么。 |
| Method | 研究如何处理问题。 |
| Data or sample | 论文使用什么证据。 |
| Main finding | 论文贡献了什么。 |
| Limitation | 什么削弱或限制了发现。 |
| Theme | 它支持综述中的哪一部分。 |
| Use in my review | 这篇论文为什么对你的论证重要。 |
最后一列通常最有价值。它迫使你把每篇论文连接到自己的综述,而不是让论文停留在独立摘要中。
如果矩阵包含方法、结局、局限和证据笔记,它也可以成为从研究论文中提取数据的起点。区别在于目的:综合矩阵帮助你写出论证,而提取表保存必须对照来源检查的字段。
按功能整理主题
不是所有主题都做同一件事。有些主题解释领域知道什么。有些解释领域如何研究问题。有些解释为什么领域仍然不确定。
有用的主题类型包括:
- 背景主题:定义问题和关键概念。
- 方法主题:比较研究如何设计。
- 证据主题:分组支持或挑战论断的发现。
- 争议主题:显示分歧或竞争性解释。
- 局限主题:识别反复出现的弱点。
- 空白主题:为你的研究贡献铺垫。
一篇强综述通常会结合几种主题类型。方法较重的综述可能需要方法主题。理论综述可能需要争议主题。政策综述可能需要证据和局限主题。
不要强迫每篇论文只属于一个主题。一篇强论文可能先出现在方法讨论中,后来又出现在证据讨论中。关键是避免重复同一个摘要。每次出现都应服务不同目的。
把 AI 当作第二读者
AI 可以帮助聚类摘要、建议标签、比较笔记或识别重复概念。当你面对太多论文而卡住时,它很有用。
适合用 AI 做:
- 从摘要或笔记中建议可能聚类。
- 识别论文集合中的重复术语。
- 把你的编码和另一种可能结构进行比较。
- 把综合矩阵转成提纲想法。
- 询问哪些论文似乎存在分歧。
不适合用 AI 做:
- 在没有阅读的情况下决定最终主题。
- 总结你没有打开过的论文。
- 创造听起来整齐但不符合证据的主题。
- 添加你无法验证的引用。
- 替代你对领域的解释。
最好的工作流是迭代式的。先创建自己的第一轮编码。让 AI 提供一种替代分组。比较两者。用自己的语言重命名、合并或删除主题。然后人工检查重要论文。
如果你以这种方式为稿件使用 AI,保留一条简短记录说明它的角色。如何向期刊披露 AI 使用可以帮助判断它是否需要写进声明。
把主题转成提纲
主题不是最终综述。它们是提纲的原材料。
一个有用提纲通常从宽到窄:
- 定义问题和范围。
- 解释领域普遍同意什么。
- 比较方法或路径。
- 讨论相互冲突的发现。
- 识别反复出现的局限。
- 展示你的工作回应的空白。
不要为每篇论文创建一个章节。为每个想法创建一个章节。在每个章节中比较论文。
弱段落会这样写:
Smith 研究了这个主题。Chen 也研究了同一主题。Patel 也研究了类似主题。
更强的段落会这样写:
在近期研究中,最主要的分歧在于如何衡量相关性。Smith 将相关性视为评审者一致性,而 Chen 评估排序效率,Patel 则关注漏掉研究的风险。
第二个版本用论文解释模式。这才是综合。
一旦提纲以这种方式建立,起草会容易得多。更快写完文献综述中的流程,在主题结构已经清楚、每个章节都有已知来源集合时效果最好。
测试一个主题是否足够强
主题应该为自己赢得位置。如果太窄,它会变成论文摘要。如果太宽,它会变得空泛。
用这些问题测试每个主题:
- 这个主题是否回答了综述问题的一部分?
- 它是否包含不止一个来源?
- 我能否解释这些来源如何相关?
- 它是否揭示一致、分歧、方法差异或局限?
- 删除这个主题是否会削弱综述?
如果主题没通过这些测试,就合并、重命名,或移到背景笔记中。
主题名称也应使用清楚语言。“Screening automation evaluation” 有用。“Theme A” 没用。“Interesting papers” 是储存文件夹,不是章节标题。
让引用验证贴近主题工作
主题整理可能造成引用漂移。你可能把一个论断从一个章节移到另一个章节,却忘记哪篇论文支持它。你也可能让 AI 建议一种分组,把来源和错误论断配在一起。
起草前检查:
- 哪篇论文支持每个论断?
- 论文的哪个部分支持它?
- 引用是否真实,元数据是否正确?
- 这篇论文是否真的属于这个主题,还是只是看起来相关?
- 是否有某个来源被过度用于支持太多论断?
这就是为什么主题表应包含 “use in my review” 列。它把论文和论证绑在一起。为了引用安全,最终草稿前使用如何验证 AI 生成的引用。
WisPaper 适合放在哪一步
WisPaper 帮助研究者使用 AI 搜索和筛选学术论文。它的搜索工作区支持 Deep Search、Scholar Agent 和 Inspiration Discovery,论文卡片会显示来源标签、摘要和预览图,方便用户在决定阅读前先快速判断结果。
WisPaper 也允许用户建立论文库,并基于该库提问。论文可以上传,也可以从搜索结果中加入,然后用于针对个人文献库的问答。




