AI 投研系统 / DEEPSIGHT RESEARCH
投研 Agent 真正稀缺的不是更多数据,而是可靠反馈
候选文本和合成数据可以快速增加,真正稀缺的是谁定义质量、如何发现长尾错误,以及反馈是否连接到真实研究任务。
先给判断
“我们有大量高质量数据”是 AI 公司最常见、也最难验证的表述之一。
高质量并不是数据自带的标签。一个样本是否有价值,取决于目标、时点、任务、验证方式和错误成本。可以无限生成候选文本,却不能让候选自己决定什么是真、什么重要、什么足以进入结论。
对于投研 Agent,真正稀缺的不是更多文本,而是可靠反馈:
- 谁定义一份研究做得好不好;
- 哪些错误可以由工具发现;
- 哪些判断必须由专家裁决;
- 反馈是否覆盖长尾风险;
- 修改结果能否进入下一次任务。
合成数据解决的是候选供给
模型可以生成问题、答案、研究计划、反方观点和报告草稿。这能显著扩大训练与测试样本,也能降低基础标注成本。
但合成数据存在一个根本限制:模型不能凭空创造它没有接触过的外部真值。
如果验证器可靠,合成数据可以帮助搜索更好的候选;如果验证器只奖励流畅、格式或表面一致,系统可能更快放大已有偏差。
因此,应把合成数据理解为候选生成器,而不是自己的事实来源。
投研反馈至少有四个层级
1. 形式反馈
检查文件是否完整、格式是否正确、引用是否存在、数字是否能计算。这一层最容易自动化。
2. 事实反馈
检查主张是否被原始来源支持,实体、时间、币种和分母是否一致。这一层需要检索、定位和确定性工具共同工作。
3. 判断反馈
检查证据是否足以支持商业解释,反例是否被遗漏,推导是否越过了事实边界。这一层通常需要领域 rubric 和专家审核。
4. 结果反馈
观察研究是否真正改善了投委会、尽调、风险识别或经营决策。反馈最有价值,也最慢、最容易受到外部变量干扰。
只优化前两层,可以减少低级错误;要形成专业能力,还必须让后两层以某种方式进入系统。
为什么“专家标注”也可能失真
专家时间稀缺,但更大的问题是专家之间也会分歧。
不同机构的投资策略、风险偏好和决策权限不同。某个结论对成长基金有价值,不一定适合产业资本;一份报告适合早期筛选,不一定满足正式尽调。
可靠反馈系统需要保存:
- 反馈来自谁;
- 反馈发生在什么任务和阶段;
- 修改针对事实、推导还是表达;
- 结论适用于哪些机构与时间;
- 是否存在尚未解决的分歧。
把所有专家修改压成一个统一“正确答案”,反而会丢失最有价值的条件。
专家的角色会改变,而不是消失
Constitutional AI 等工作说明,人类可以把部分逐条反馈上移为原则、rubric 和审计机制。
在投研系统中,专家可以从重复修改每一段文字,逐步转向:
- 定义来源和证据资格;
- 设计报告与判断 rubric;
- 审查冲突和长尾错误;
- 标记哪些修改应成为通用规则;
- 处理验证器无法覆盖的例外;
- 决定什么可以自动发布。
这不是取消人工,而是把人工放在最能改变结果的位置。
反馈如何成为组织资产
一次修改只有在被记录、归因和复用后,才可能让系统长期变好。
例如,研究员发现某类公司经常混用“签约金额”和“确认收入”。如果修改只留在最终文档中,下次任务仍会重复犯错;如果系统保存了错误类型、适用场景、检查规则和反例,它就能变成新的质量门。
因此,投研 Agent 的数据飞轮不应只是“积累更多报告”,而应是:
真实任务 → 候选研究 → 专家修改 → 错误归因 → 规则或评估更新 → 新任务验证
缺少错误归因和新任务验证,所谓飞轮可能只是文本堆积。
采购或评估时应继续追问
- “高质量数据”由谁、按照什么标准定义;
- 是否有独立真值或真实任务做校准;
- 反馈覆盖的是格式、事实还是商业判断;
- 模型能否通过表面技巧骗过评估器;
- 长尾失败由谁发现并进入下一轮;
- 专家修改是否被版本化和可追溯;
- 指标是否与审核负担和最终任务价值连接。
研究起点与边界
本文派生自对“高质量数据还是可靠反馈更稀缺”这一技术命题的独立研究。原始人物文字稿仅用于发现问题。数学、代码和形式系统中可自动验证的成功,不能直接证明金融研究已经拥有同等廉价的真值。