[arXiv 2024] 迈向专家投资团队:基于细粒度任务的多智能体 LLM 交易系统
Toward Expert Investment Teams:A Multi-Agent LLM System with Fine-Grained Trading Tasks
本文提出了一个模仿专业投资团队工作流的多智能体 LLM 交易框架,核心创新在于将投资分析从模糊的角色指令细化为“细粒度任务(Fine-grained Tasks)”。在日股 TOPIX 100 市场的回测中,该系统显著提升了风险调整收益(Sharpe Ratio),实现了超越市场基线的 SOTA 性能。
TL;DR
本文挑战了目前 AI 投资界“给个角色就能分析”的传统思路,提出了一种**基于细粒度任务分解(Fine-grained Task Decomposition)**的多智能体框架。通过将专业投资银行的 SOP 嵌入 LLM 提示词,该系统在日股 TOPIX 100 市场回测中展现了极强的风险收益捕获能力。
背景定位:这是从“生成式 AI 原型”向“工业级金融应用”跨越的关键一步,重点在于提示词工程中的特征工程(Feature Engineering within Prompt Design)。
1. 痛点:为什么“粗粒度”指令在金融领域会失效?
目前大多数 AI 交易系统仅告诉 LLM:“你是一个分析师,请看这些股价数据并给出建议”。这会导致两个致命问题:
- 性能崩塌:面对海量的原始数字,LLM 容易陷入推理迷失(Reasoning loss),甚至直接忽略关键的非线性趋势。
- 解释性缺失:黑盒化的输出让基金经理无法溯源——由于指令太模糊,AI 给出的结论往往也是“股价可能会涨”这种不知所云的废话。
2. 核心机制:三层级多智能体架构
作者构建了一个严密的层级化决策体系,灵感来源于顶级对冲基金的投研流程:

- Level 1 (Specialists):技术分析师(计算 MACD/RSI/Z-score)、量化分析师(拆解 ROE/P/E 变动)、定性扫描仪(解析 10-K 文本)及新闻挖掘机。
- Level 2 (Aggregators):Sector Agent(负责行业内对标,消除 Beta 偏误)和 Macro Agent(判断市场风险敞口)。
- Level 3 (Execution):Portfolio Manager(最终拍板,整合自上而下与自下而上的信号)。
关键 Insight:细粒度任务要求智能体输出具体的语义标签(如:Momentum, Soundness)。实验发现,这些专业术语能更有效地在层级间传递价值信号。
3. 实验验证:细粒度 vs. 粗粒度的降维打击
通过对日本 TOPIX 100 成分股进行 27 个月的严格回测(严格控制知识截断点,规避 Look-ahead Bias),研究得出以下结论:
3.1 收益能力的本质提升
如下图所示,无论投资组合规模(N)如何变化,粉色(细粒度)的 Sharpe Ratio 始终显著高于蓝色(粗粒度)。

3.2 谁是真正的功臣?(消融实验)
研究发现,**Technical Agent(技术分析智能体)**在细粒度模式下贡献最大。有趣的是,如果不给 LLM 预计算好的技术指标(如 RoC, Bollinger Band),而是直接扔给它原始股价图表,它的表现会一落千丈。这证明了:LLM 的强项在于理解逻辑,而非心算复杂的数学指标。
4. 文本分析:AI 真的读懂了市场吗?
作者通过 Log-odds Ratio 分析发现:
- 细粒度 Agent 倾向于使用 Volatility, Momentum, Profitability 等专业术语。
- 粗粒度 Agent 则只会说 Price, Upward, EPS 等浮于表面的词汇。
余弦相似度分析进一步证实,细粒度设置下,底层技术信号能更精准地“顺着电梯”爬升到顶层决策者(PM)那里,极大减少了信息稀释。
5. 深度洞察与总结
Takeaway
金融领域的 LLM 应用不应追求“端到端全自动”,而应追求“逻辑嵌入”。
- 特征工程依然重要:不要指望模型能直接从原始序列中悟出 MACD 的奥秘,预计算好指标并以自然语言喂给模型是目前的最佳实践。
- 层级结构提供透明度:每一步决策都有迹可循,满足了合规和风险管理的刚需。
局限性
- 市场局限:目前的成功主要在日股市场验证,美股等高效率市场的超额收益空间尚需观察。
- 时间窗口:由于 GPT-4o 的 Knowledge Cutoff,回测窗口较短,尚未经历完整的牛熊周期。
结论:这篇工作证明了,当我们将金融专家的 SOP 转化为 AI 的“细粒度任务”时,LLM 能够展现出甚至不仅限于“助手”的专家级决策潜力。
