[2026 深度展望] Vibe Researching:当 AI Agent 狼真的来了,社会科学家会被取代吗?
Vibe Researching as Wolf Coming: Can AI Agents with Skills Replace or Augment Social Scientists?
总结
问题
方法
结果
要点
摘要
本文探讨了 AI Agent(人工智能智能体)在社会科学研究中的角色转变,提出了“Vibe Researching”(氛围感研究)概念。作者通过开发包含 21 项专业技能的工具 scholar-skill,展示了 AI 如何从简单的交互助手演变为能够自主执行从文献综述到论文提交全流程的科研引擎。
TL;DR
本文正式提出了 Vibe Researching(氛围感研究) 的概念。不同于以往的 Chatbot,新一代 AI Agent 拥有持久化状态、工具调用和跨阶段推理能力。作者通过 scholar-skill 系统证明,AI 已经可以承包从文献检索、因果识别到模拟同行评审的 21 项科研技能。本文的核心贡献在于提出了一个认知任务框架:人类的阵地不在于某个具体的研究阶段,而在于那些无法被编码的隐性知识(Tacit Knowledge)。
背景定位:从自动化到 Agentic AI
社会科学研究工具的演进经历了四个浪潮:
- 计算自动化 (1970s-90s): SPSS, Stata 替代了手工计算。
- 数据采集自动化 (2000s): 网络爬虫和 API。
- 文本分析自动化 (2010s): NLP 和主题模型。
- 推理自动化 (2024+): 这就是我们当前的坐标——AI 开始处理多步推理和论证构建。
正如 Andrej Karpathy 提出的 "Vibe Coding",社会科学也进入了 "Vibe Researching" 时代:只要描述你的想法,AI 就能跑通整个 Pipeline。

核心系统:Scholar-Skill 拆解
作者开发的 scholar-skill 是基于 Claude Code 的插件,它将科研流程拆解为 21 个 specialist 技能。其震撼之处在于:
- 大规模文献合成:直接访问 20,000+ 文献库,3 分钟内生成符合期刊引用密度的文献综述。
- 因果识别支架:自动构建因果路径图(DAG),从 OLS 到合成控制法中选择策略并生成 R/Stata 代码。
- 资产驱动写作:基于 127 篇顶刊论文的知识图谱,模仿修辞结构而非简单拼凑。
- 同行评审模拟:派生出“方法专家”、“理论专家”和“资深编辑”三个 Agent 预判 Major Revision 的风险。
深度洞察:委托边界是“认知”而非“顺序”
这是本文最精彩的论点。作者认为,我们不能说“数据清洗交给 AI,理论思考留给人”,因为每个阶段内部都存在可 delegate(委托)和不可 delegate 的部分。

- Type C (Execution): 高度可编码,低隐性知识(如跑回归、画图),全面交给 AI。
- Type A (Formulation): 低可编码,极高隐性知识(如识别现有框架的不足、跨学科灵感),AI 只能辅助。
- 危急地带 (Type D/B): AI 生成的草稿看起来很完美,但缺乏对学术圈“潜规则”或特定领域微小政治气候的理解,极易产生“脆弱的增强”。
| 任务 | 可编码性 | 隐性知识 | 建议 |
|---|---|---|---|
| 文献合成 | 高 | 低 | 委派 |
| 理论生成 | 低 | 极高 | 严禁委派 |
| 领域判断 | 无 | 极大 | 严禁委派 |
实验与局限:AI 的天花板
- 优势:速度与覆盖面。AI 不会有疲劳或选择性偏差(Availability Bias)。
- 劣势:缺乏元知识(Metaknowledge)。AI 知道文献里写了什么,但不知道学术界集体共识中什么才是“有趣的”或“真正重要的”。
- 原创性危机:AI 是卓越的理论“阐述者”(Articulator),但它只会重组现有框架,无法产生像 Granovetter 那样改变范式的理论跃迁。
深度总结:负责任的 Vibe Researching
作者提出了五项原则,我愿将其称为“AI 时代的学者宣言”:
- 披露 (Disclose):在方法论部分明确哪些章节由 AI 初拟。
- 验证 (Verify):你签名的错误就是你的错。
- 保持技能 (Maintain Skills):如果你不练手,你就失去了评估 AI 输出是否正确的能力。
- 保护原创性:问题意识必须来源于人类的想象力。
- 设计公平性:防止 AI 引起学术资源的进一步分层(AI Productivity Premium)。
结语:狼已经进屋了。与其讨论它是否会取代我们,不如思考如何利用这种“氛围感”去拓宽研究的广度,同时死死守住那块名为“人类判断”的阵地。
