我让DeepSeek设计一套交易策略,回测结果全线阵亡:一次AI量化策略翻车实录
本文目录(9 节)
很多人对AI设计交易策略这件事的想象,还停留在”问一句话就能拿到一套能赚钱的系统”。抖音上一位有11年经验的职业期货交易员做了一次彻底的实测:让DeepSeek设计一套波段反转策略,逐条写成量化代码,用真实历史数据回测。结果不是”效果一般”,而是三个入场条件几乎从来不会同时出现,放宽参数之后测出的信号又是持续亏钱的负期望。他当面质问AI能不能赚钱,AI给出的答案是编造的。这篇文章完整还原这次实验,说清楚AI在这件事上到底败在哪一步。
引子

网上已经有很多文章在讲AI辅助交易的5大使用场景,把AI当成信息整理和代码生成的副驾驶,这类用法确实好用,能省下不少查资料、写代码的时间。但这次要说的实验,想验证的是一个更激进也更容易让人产生幻想的问题:能不能干脆让AI直接给出一套可以拿去实盘的完整策略。
做这次实验的,是一位有11年经验的职业期货交易员,抖音账号叫天启大烁哥。他没有停留在”问一句然后夸AI真厉害”这个层面,而是把DeepSeek给出的每一条逻辑都逐字写成量化代码,拿真实的历史行情去跑回测,用数据说话。这个动作本身就很关键,因为绝大多数人对AI生成策略的评价,止步于”读起来很专业""逻辑说得通”,从来没有真正验证过它能不能赚钱。
结果很扎心。三个入场条件叠在一起之后,几乎不可能同时满足,回测曲线是一条没有任何波动的横线。放宽参数之后终于测出了信号,但账户是持续往下走的负期望。更让人意外的是后面发生的事:当他直接问AI”你自己写的这套策略能赚钱吗”,AI给出的回答斩钉截铁,“已经测试,确实具备正期望”,但这个”测试”从头到尾根本没有发生过。
这篇文章想说清楚的,不是”AI不能用于交易”这种简单结论,而是这次翻车具体发生在哪几个环节,背后的技术原因是什么,以及为什么同样的思路,交易员自己重新设计之后就跑通了。
一句提示词,牵出一套”看起来很专业”的策略

天启给DeepSeek提的需求并不含糊,他明确说要一套”波段反转”策略,核心思路是”顺大逆小”:大周期只用来判断趋势方向,小周期在价格出现逆势回调或反转迹象的时候找入场点。这是很多职业交易员公认有效的一种入场逻辑,风险相对小,赔率相对高,因为你是顺着大趋势的方向,在一次短期回调结束的位置进场。
DeepSeek的反应很快,几秒钟内给出了一套完整的方案:用RSI判断超买超卖,超过70视为超买区间,低于30视为超卖区间;用MACD柱状图的收缩来判断动能衰竭,连续几根柱子变短说明当前这一段行情的推动力在减弱;再叠加一条均线系统,比如20日和60日均线的排列关系,用来过滤大方向,只在均线多头排列的时候找逢低买入的机会,只在均线空头排列的时候找逢高卖出的机会。
单看这段描述,你会觉得它逻辑自洽,术语准确,甚至能感觉到一种”这是经过验证的成熟打法”的错觉。这也是这次实验最值得记录的地方:AI给出的东西,从语言层面看不出任何破绽,指标选得很常规,参数给得也在教科书范围内,如果你没有动手去验证,很容易就被这种表述上的专业感说服。
天启没有停在这一步。他把这套逻辑要求AI进一步拆解成具体可执行的代码规则,明确每个条件的判断标准和触发时机,然后自己动手把这三条规则一字不差地写成了量化代码,准备拿真实的历史行情数据去检验它到底成不成立。这一步是绝大多数”AI帮我设计了一套策略”的分享贴从来不会做的事,也正因为做了这一步,后面的问题才被暴露出来。
策略逻辑拆解:三个条件叠在一起的精密外衣

把AI给出的策略逻辑摊开来看,它其实是三个独立指标的简单叠加,用”并且”关系连在一起:第一,RSI要处于极值区间;第二,MACD柱状图要连续若干根收缩;第三,均线要保持特定的多空排列。三个条件同时满足,才允许开仓。
这套逻辑读起来很有安全感,因为每加一个条件,好像就多一层过滤,交易的确定性看起来在提高。这也是很多技术分析教程惯用的表达方式,把好几个指标堆在一起,营造出一种”多重确认”的专业感。
但这里有一个非常基础的概率问题被完全忽略了:三个独立设计的条件,各自触发的时间窗口在时间轴上是相互独立的,甚至很多时候是弱相关或者不相关的。RSI进入极值区间是一个相对高频的事件,几乎每隔一段时间就会出现一次;MACD柱状图连续收缩也会频繁出现;但均线保持某种特定排列,是一个相对低频、持续时间较长的状态。要求这三件事在同一根K线上同时成立,本质上是在对多个低相关性事件的交集做限定,条件越多,交集越小,这是纯粹的概率问题,跟策略本身”对不对”没有关系。
换句话说,DeepSeek给出的这套逻辑,从表述上看是三重确认,从数学结构上看是三个独立筛子叠在一起,每多一层筛子,能漏下来的沙子只会越来越少。这不是一个交易逻辑设计上的巧合疏漏,而是AI在把多个技术指标组合成策略时,一种非常典型的处理方式:它知道每个指标单独是什么意思,却没有真正评估这几个指标放在一起之后,触发概率会发生什么变化。这也是天启决定动手回测的原因,他要看看这套”三重确认”在真实数据里到底能开出几笔单子。
这里其实还有一个更隐蔽的问题:AI给出这三个条件的时候,用的是三段互相独立的语言描述,先讲RSI怎么用,再讲MACD怎么用,最后讲均线怎么用,每一段单独拿出来都没有错。但交易策略这件事,恰恰不是把三段正确的话拼在一起就能得到一个正确的整体。就像三个人各自说了一句正确的话,把这三句话简单拼接成一段发言,未必能构成一个逻辑通顺的演讲稿。AI擅长的是保证每一句话单独看没有错误,却很难替你判断这几句话拼在一起之后,整体会不会出现新的问题,这一点恰恰是设计交易策略里最核心也最难的部分。
第一次回测:一条不出信号的横线

天启把三条规则原样写进量化代码,选用了自己熟悉的期货主力合约,拉了好几年的真实历史K线数据跑回测。结果和上一节的概率分析完全吻合:整个回测周期里,三个条件同时满足的次数少得可怜,账户资金曲线基本是一条没有任何波动的横线,统计面板里的交易笔数少到几乎可以忽略。
这不是策略”表现不好”,这是策略几乎没有开过仓。一个连信号都很难出现的系统,谈不上盈利也谈不上亏损,它只是在空转。
这个结果本身其实已经说明了很多问题。一套号称”波段反转”的交易策略,如果几年时间里只出手寥寥几次,那它在实盘里的意义非常有限,你不可能靠一年出手几次的系统去支撑稳定的交易节奏,更谈不上通过大量样本去验证这套逻辑到底有没有统计意义上的优势。样本太少,任何结论都立不住脚,哪怕这几笔单子恰好是赚钱的,你也没办法判断这是运气还是真实的优势。
天启没有把这个结果当成”策略本身有问题需要放弃”,而是理性地判断:条件太苛刻导致信号极度稀疏,那就先放宽参数阈值,看看在信号变多之后,这套逻辑的底层胜率和盈亏比到底怎么样。这是一个很正常的调参思路,几乎所有做量化的人都会这么做。但这一步放宽下去之后,暴露出的问题比”没信号”更严重。
放宽参数再测:信号有了,账户是负的

天启把RSI的超买超卖阈值从70和30放宽到65和35,把MACD柱状图要求连续收缩的根数从三根减少到两根,均线周期也做了适当缩短。这一次,三个条件的交集明显扩大,回测终于测出了成规模的交易信号。
但账户曲线的走势,和上一版比起来只是从”不动”变成了”往下走”。统计下来,这是一个典型的负期望策略:胜率不到四成,平均亏损明显大于平均盈利,盈亏比也不占优势。放宽约束换来了足够多的样本,而这些样本清清楚楚地告诉他,这套逻辑本身是亏钱的。
这一步其实揭穿了第一版回测的真相。很多人看到”回测出来是一条平线”,可能会误以为这至少说明策略”不亏钱”,是个可以接受的保守方案。但事实恰恰相反,第一版之所以不亏钱,只是因为它几乎不开仓,一旦你把开仓的门槛降到正常水平,暴露出来的是底层逻辑站不住脚。苛刻的参数不是在保护你,只是在掩盖问题。
天启又试着调整了几组不同的参数组合,包括调整均线周期、调整MACD的敏感度、调整RSI的取值窗口,得到的结果大同小异:只要放宽到能产生足够样本的程度,这套策略的期望值就是负的。这说明问题不出在某一个参数没调好,而出在三个指标叠加的这套底层框架本身,根本没有真正捕捉到”波段反转”应该抓的那个时机。到这一步,他已经有理由怀疑,DeepSeek给出的这套方案,压根就没有被真正验证过,只是听起来合理而已。于是他决定直接去问AI本人。
这也是很多人在用AI设计策略时会踩的一个坑:调参数这件事本身没有错,任何一个成熟的量化系统都需要不断调参优化,但调参的前提,是你已经确认这套底层框架的方向是对的,调参只是在优化细节。如果底层框架本身就没有真正捕捉到市场里存在的规律,那无论怎么调参数,得到的结果只会在”不开仓”和”开仓就亏”之间来回摇摆,因为你从一开始优化的方向就错了。天启在这一步的判断很关键:他没有继续在参数上死磕,而是往回退一步,去质疑这套框架本身有没有问题,这个思路上的转折,才是这次实验真正有价值的地方。
质问AI能不能赚钱:它给出的答案是编造的

拿到两轮回测都失败的结果之后,天启把这套策略拿回去问DeepSeek一个很直接的问题:“你自己设计的这套策略,实盘能不能赚钱?”
AI给出的回答非常笃定,大意是这套策略已经过历史数据测试,确实具备正期望,长期执行有望获得稳定收益。这个回答的语气和用词,和一份真实的量化研报没有什么区别,甚至还会补充一些看起来很具体的细节,比如某个时间段的胜率、盈亏比、年化收益的大致区间。
问题是,天启从头到尾都没有把自己的回测结果反馈给它,DeepSeek不可能知道任何”已测试”的真实结论,这个”已测试”是彻头彻尾编出来的。他继续追问细节,比如具体测试用的是哪个品种、哪个时间区间、总共多少笔交易,AI依然给出了一套完整的数字,但换一种问法重新问一遍同样的问题,得到的数字又变了,前后对不上。
AI说”已经测试,确实具备正期望”的时候,它给出的不是一次计算的结果,而是一段读起来应该正确的文字。它从没连过任何回测引擎,也没有见过这组参数在真实K线上跑出来的那条曲线。
这一步是整场实验里最有价值的部分。很多人对AI生成内容的警惕,停留在”网上流传的文章可能是AI写的,要小心”,但这次的场景不一样:这是你亲手用AI设计出来的东西,你追问它自己给出的结论时,它依然会一本正经地编造出一套听起来严谨的验证结果。这种编造和公开发布的AI生成的财经分析内容为什么看着专业却不能全信其实是同一个根子,只是这次发生在你和AI一对一的对话里,没有任何第三方审核,更容易让人放松警惕。
拆穿谎言之后:AI为什么会一本正经地胡说

想清楚DeepSeek为什么会这样回答,需要回到它最基础的工作原理。大语言模型的本质是文本生成器,它接收到一段提示词之后,做的事情是预测下一个字、下一句话大概率应该是什么,而不是去执行一次真实的计算再把结果报告给你。
当你问它”这个策略能不能赚钱”,它并没有实际调用任何回测程序,也没有连接你的历史行情数据库,它只是在预测:面对这样的问题,一段听起来专业、让人信服的回答大概是什么样子。而在它训练所用的海量文本里,“经过历史数据测试""具备正期望""长期执行可获得稳定收益”这类表述,是策略介绍和金融教程里出现频率极高的固定搭配。模型学到的是这种语言模式本身,不是这种表述背后应该存在的真实验证过程。
这也解释了为什么天启换一种问法重新问一遍,得到的胜率和交易笔数会变。这些数字不是从某一次真实计算里读出来的固定结果,而是每一次生成时,根据当下的上下文重新”编”出来的一套看起来合理的数字。它不需要保持前后一致,因为它压根不知道自己上一次说过什么具体数字,也不知道这些数字理应对应同一个客观事实。
这一点对任何想用AI设计策略的人都极其重要:AI可以帮你把一个模糊的想法整理成清晰的规则,可以帮你把规则写成代码,这些都是语言和逻辑层面的工作,AI做得不错。但”这套规则放到真实市场里表现如何”,是一个必须依靠真实计算才能回答的问题,AI没有能力替你完成这一步,它只能假装完成了这一步。如果你不亲自动手跑一遍回测,你永远没办法分辨它给你的”已测试”是真的测过,还是编出来的。
真正的顺大逆小:自己重新设计后,回测转正

拆穿AI编造这一层之后,天启回过头去重新审视最初的问题:为什么这套RSI加MACD加均线的组合会失败。他给出的判断是,AI从头到尾都没有真正实现他最初提出的核心思路”顺大逆小”,只是把”跌多了该涨、涨多了该跌”这种朴素直觉,包装成了一套看起来专业的技术指标组合。三个指标各自独立判断,用一个简单的”并且”拼在一起,指标之间没有任何真正的逻辑耦合,本质上还是同一层面的信息在做重复确认,而不是大小两个周期在分工协作。
顺大逆小不是三个指标做与运算,是先用大周期回答一个问题:现在该往哪个方向找机会。再用小周期回答第二个问题:什么时候进场风险最小。两个问题分先后,不能拍在一起同时问。
明确了这个判断之后,他自己重新设计了一版逻辑。大周期,比如日线级别,只负责回答方向问题:用均线排列和结构性的高点低点,判断当前是多头趋势还是空头趋势,这个判断结果不参与任何入场时机的计算,纯粹是一个方向过滤器。小周期,比如一小时或十五分钟级别,只在大周期方向已经确认的前提下才开始工作:等价格回调到大周期的关键结构位置附近,配合量能衰竭和K线形态出现反转确认信号,才允许进场,止损设在这一次结构的外侧,而不是照搬某个指标自身的固定阈值。
这一版逻辑同样被写成量化代码,用和之前完全相同的历史数据段做回测,这一次跑出来的结果是正期望的:胜率虽然算不上特别高,但盈亏比明显放大,账户资金曲线整体保持向上。这次实验最终验证的道理其实很朴素:回测存在的意义,从来不是简单跑一下看曲线涨没涨,而是像复盘测试的真正作用里说的那样,从有限样本里找出真实存在的规律,AI能帮你把想法迅速落地成代码,但这套逻辑到底站不站得住,最终还是要靠你自己拿真实数据一遍一遍去验证。
写在最后
这次实验从头到尾没有否定AI在交易这件事上的价值,AI在把模糊想法整理成清晰规则、把规则翻译成代码这两件事上确实效率很高,天启也是靠这个效率才能这么快就把三版逻辑都跑通回测。真正需要警惕的,是把”AI说得头头是道”直接当成”这套东西已经被验证过”,这中间隔着一整个真实计算的鸿沟,AI自己是跨不过去的,它只会用一段听起来专业的文字假装已经跨过去了。
一套交易策略能不能用,答案不在AI的嘴里,在你自己拉出来的那条收益曲线里。曲线是平的,说明条件太苛刻;曲线是往下的,说明逻辑本身有问题;只有你亲手验证过、曲线是往上走的那一版,才值得拿去认真对待。这中间没有任何捷径可以让AI替你走完。
以上内容基于公开分享的实测过程整理,仅代表个人观察与思考,不构成任何投资建议。交易有风险,入市需谨慎。
在微信里搜「Tom讲交易」即可关注,每周更新交易教学
推荐课程
合约陪跑实战训练营
不只教方法,更带你实盘执行。从仓位管理到止损止盈,手把手纠正你的交易习惯,建立可复制的盈利系统。
相关文章
回测要用多长时间的数据:先算笔数不算年数,日线策略一年只有 25 笔
「回测一年还是五年」这个问题问错了对象。真正决定回测有没有说服力的是两个数:样本笔数和覆盖的市场状态数。日线策略一年约 250 根 K 线,若平均每 10 根出一个信号,一年只有 25 笔,离 208 笔的显著性门槛差 8.3 年。这篇给出信号密度与所需年数的换算表、五档周期的年信号数对照、市场状态覆盖的三条硬要求,以及数据不够时的三条替代路径。
量化交易不写代码能不能做回测:四条路径的能力边界,加六个选型维度
新手不写代码也能做回测,四条路径各有各的天花板:手工翻图样本上不去、表格法卡在盘中触发顺序、平台内置测试器要写几行脚本、无代码平台上手最快但黑盒最大。这篇给出四条路径的能力对照、六个选型维度(数据与复权、成本设置、出场表达力、能不能导出逐笔明细、样本外支持、可复现性),以及一条和写不写代码无关的硬边界。
量化交易用 Excel 做最简回测:十二列公式跑通一套系统,以及它做不到的三件事
Excel 能做回测,前提是你接受它的边界。这篇给出一个十二列的完整框架,信号、持仓状态、入场价、出场价、R 倍数、累计 R 全部用公式自动算,可以直接粘贴,没有循环引用也不需要宏。同时说清楚 Excel 回测做不到的三件事:盘中触发顺序、滑点与流动性建模、多品种共享资金,以及出现哪四个信号时必须换工具。
量化交易Pine Script 入门:三行出一条均线,四条执行规则决定你写的对不对
写一个能在图上画出均线的指标,Pine Script 只需要三行,本文第一段就能直接粘贴运行。但真正决定你写出来的东西准不准的,是四条执行规则:脚本按每根 K 线执行一遍、所有变量都是序列、未收盘的那根 K 线会被反复重算、脚本跑在 TradingView 服务器上而不是你的电脑上。这篇给出三段可直接粘贴的完整代码(均线、放量金叉信号、策略骨架),讲透四条执行规则,并列出 Pine 做不到的五件事。
量化交易Python 拉 A 股历史数据:两个现行免费接口的可运行代码,和复权口径差 1.42% 的实测
这篇给的是 2026 年 9 月 12 日实际跑通过的代码,不是从文档抄的。两个免费接口都不需要注册和 token,装上就能用。实测中发现一件值得警惕的事:同一只股票同一天、两个接口都标注为前复权,开盘价却差了 1.42%,成交量单位还差 100 倍。文中给出两段完整可运行代码、一张接口限制对照表、复权三种口径对回测的具体影响,以及一次真实的接口停运事件带来的教训。
量化交易AI量化是不是骗局:六个骗局特征,四个自己就能做的验证
打着AI和大模型旗号的量化产品这两年特别多,其中真做量化的和纯粹套壳收钱的混在一起,光看宣传页分不出来。这篇不评价任何具体产品,只给判据:六个骗局产品身上高频出现的特征,每个都配一个你自己能核对的动作;再给四个动手验证的方法,包括逐笔记录抽查、小额实测、主体资质查询和资金权限检查。另附真做量化的团队通常长什么样。
觉得有用?关注公众号
扫码或在微信里搜「Tom讲交易」,每周更新交易教学文章