← 全部日志
2026-07-16

186 份文档里的 11 个错误

我们让 AI 读完团队多年积累的策略文档。它做的第一件事不是写新策略,而是找出 11 处写错的规则,其中 5 处照着实现会开反方向的单,或者让一个过滤条件永远成立。

几年下来,团队积累了 186 份交易策略文档:171 份 Word,15 份表格。它们记录的是交易员的经验:什么时候进场,什么时候离场,什么情况下不该动。

这些文档一直在被使用,也一直在被修改。但从来没有人把它们从头到尾完整地读过一遍。

2026 年 7 月,我们让 AI 做了这件事。

第一件事:找错

我们给 AI 的任务不是”根据这些文档写一个新策略”,而是:逐份精读,找出那些照着写成代码就会出错的地方。

然后,每一处都回到原文,找到确切的原句,逐条核实。最后留下的是 11 处确认无误的错误:

  • 5 处高严重度。 照着实现,要么会开反方向的单,要么会让某个过滤条件几乎永远成立。比如,有一份文档里,做多的开仓条件被写成了空头的均线排列;另一份的做空段落里,写着”将多单全平”;还有一处,一个过滤条件漏掉了一个负号,结果这个条件在绝大多数时间都成立,形同虚设。
  • 6 处中低严重度。 阈值写错、引用错位、条件编号重复、只写了多头一侧而漏了空头一侧。

这些错误大多有一个共同的来源:先写好做多的一段,再复制一份改成做空,其中一处忘了改。人读的时候,会凭理解自动纠正过来;但机器不会。

第二件事:统一语言

找错的过程中,我们发现一个更大的问题:同一个词,在不同文档里意思不一样。

于是有了一份术语定义库,规定一条原则:源码优先于文档。术语上的分歧不由 AI 决定,而是整理成一张决策清单,逐项由人拍板。

第三件事:让经验接受检验

术语统一之后,才能谈验证。我们建了一个因子验证台,按交易终端的口径把指标在 Python 里重新实现,逐值对齐,然后用几条铁律去检验:不许用到未来的数据,样本不能重叠,必须计入交易成本。

结果之一,是一个不太好听的结论:我们最依赖的一个指标,单独使用时,在 7 个品种上都没有找到显著的统计优势。

我们把这个结论也写了下来。它没有让这个指标失去价值,而是说清楚了它的边界:它需要和别的条件一起用,而且要知道什么时候不该用它。

一个被漏掉多年的数字

通读 186 份文档之后,还有一个发现:文档里记录过回撤的次数、最大浮亏、最大持仓,全部是回撤的深度。没有任何一份文档,测量过回撤的时长

而真正让人坚持不下去的,往往不是跌了多少,而是要熬多久。没有被测量的东西,就不可能被管理。从那以后,回撤持续了多长时间,成了我们每一个策略都必须报告的指标。

回头看

这件事让我们确信了一个顺序:先让经验变得可以检验,再决定要不要交给机器执行。

如果一开始就让 AI 根据这些文档直接写策略,它会把那 11 个错误原封不动地写进代码,而且写得又快又整齐。