← 返回研究与洞察

AI 投研系统 / DEEPSIGHT RESEARCH

为什么更强的模型仍不等于可靠投研?

模型能力会持续进步,但开放世界事实、来源资格、数字口径和责任边界不会因此自动消失。可靠投研来自完整系统,而不是一次更流畅的生成。

先给判断

更强的模型会让投研系统更快、更广,也能显著减少低级错误。但它不会自动解决四个问题:

  1. 模型是否获得了完成这次研究所需的最新事实;
  2. 找到的来源是否有资格支持当前主张;
  3. 数字、时间和比较口径是否一致;
  4. 在证据不足或后果重大时,谁决定停止和升级。

这些问题不是“模型还不够聪明”的同义词,而是开放世界研究本身的结构。

因此,可靠投研不能建立在“下一代模型会把所有错误消除”的假设上。更稳妥的产品路线,是让模型进步成为系统收益,同时把事实、验证和责任留在模型之外可观察的位置。

模型进步解决什么

Post-training、检索增强、测试时计算和更好的工具使用,已经在多个任务上改善事实性、推理和拒答能力。

这些进步会直接帮助投研:

  • 更准确地理解长材料;
  • 更快发现公司、行业和政策线索;
  • 更好地形成候选解释和反方问题;
  • 在结构化任务中减少格式与计算错误;
  • 更诚实地表达部分不确定性。

否认这些进步同样不严谨。问题不在于模型是否会变强,而在于“变强”能否推出“可以独立承担研究责任”。

开放世界不会被一次训练冻结

投研关心的事实持续变化:公司融资、产品状态、政策、价格、客户关系和竞争格局都具有时点。

模型参数只能保存训练时获得的一部分世界。即使模型拥有检索,它仍可能:

  • 没找到最关键的一手来源;
  • 找到已经过期或被转述的材料;
  • 把公司宣传当作独立事实;
  • 将不同时间、币种或统计分母混在一起;
  • 在来源互相冲突时选择了更流畅的一方。

检索增加了信息通道,但不会自动完成来源资格判断。RAGTruth 等研究也说明,检索增强输出仍可能出现不受来源支持或与来源冲突的内容。

“回答更少”也可能制造虚假的可靠

一个系统可以通过频繁拒答降低错误,也可以通过只回答容易问题获得漂亮准确率。

因此,可靠性必须和覆盖率同时报告:

  • 系统回答了多少问题;
  • 哪些问题被拒绝;
  • 错误集中在哪里;
  • 拒答是否错过了本来可以完成的任务;
  • 高风险主张是否有更严格的证据门。

没有覆盖率的“零错误”,可能只是系统停止工作;没有风险分层的高覆盖率,也可能把最危险的错误藏在平均分里。

Scaling 也不是一条单一曲线

讨论模型是否“足够强”时,至少要分开四件事:

  • 训练损失是否继续下降;
  • benchmark 能力是否继续提升;
  • 真实任务成功率是否稳定提高;
  • 每单位任务的经济回报是否改善。

这些曲线不会在同一位置一起停止,也不会永远保持同样斜率。更大模型可能提高候选质量,却同时增加延迟、成本和验证负担。

对于机构产品,真正相关的不是参数规模,而是:

在给定材料、时点、风险和预算下,系统能否稳定形成可审查的交付。

可靠投研需要五层共同工作

1. 模型

理解问题、生成研究计划、形成候选主张和反方解释。

2. 信息

提供内部授权材料、实时公开事实、结构化数据和可执行计算。

3. 验证

检查引用是否支持主张,数字是否可复算,时间和分母是否一致,反例是否被保留。

4. 选择性发布

证据不足、来源冲突或超出权限时,不把候选文本自动升级为结论。

5. 人的责任

在价值判断、重大风险和验证器覆盖不到的位置,保留修改、否决和最终承诺权。

这五层的价值在于可替换。模型继续进步时,系统可以获得更好的候选结果,而不必放弃已经建立的来源、验证和责任结构。

什么时候可以追求“局部零错误”

在范围明确、真值源固定、验证过程可靠并允许拒答的任务中,局部强保证是可行的。例如:

  • 从固定文件提取确定字段;
  • 对可执行公式和数据进行计算;
  • 检查引用是否指向给定来源;
  • 验证报告是否满足结构与披露规则。

这些保证来自“模型生成候选,系统验证后发布”,不是来自裸模型再也不会生成错误文本。

对机构采购意味着什么

评价一个 AI 投研产品,不应只比较“同一个问题谁写得更像报告”,还应继续问:

  • 这次研究实际使用了哪些材料和来源;
  • 哪些主张经过验证,哪些仍是推导或判断;
  • 失败、冲突和未知是否可见;
  • 模型更换后,项目记录和质量门是否仍然存在;
  • 最终进入投委会或经营决策前,谁拥有否决权。

更强模型是重要生产力,但可靠投研的边界由系统共同决定。

研究起点与边界

本文派生自对公开流传技术观点的独立核验。相关非官方文字稿只用于发现“幻觉能否被解决”“Scaling 是否见顶”等研究问题,不作为人物逐字证词或技术事实真源。本文结论以论文、官方披露和可复核的系统边界为基础。

来源与派生关系

本文为面向 DeepSight 官网重新编辑的公开研究版本。原始研究真源位于wechat-research-lab仓库的articles/16-can-model-hallucinations-be-fully-solved.md; articles/19-has-ai-scaling-hit-a-wall.md,派生基线为769a37e37b34b1337d60662f5422c03a2966289f