前两天刷推,又看到有人在聊DeepSeek。
这次不是聊R1的推理能力,也不是聊它把OpenAI按在地上摩擦的价格,而是聊一个特别底层特别不起眼的细节。
有人在贴DeepSeek V3论文里的一段话,大意是他们为了优化GPU,用了定制的PTX指令,自动调整通信块大小,减少L2缓存占用。
我第一反应是???
PTX?
不是哥们,PTX这玩意是英伟达GPU的底层指令集,比CUDA还要往下一层,接近汇编那种。正常做AI大模型的工程师,谁碰这个啊。CUDA它不香吗,库都给你备齐了,写起来跟玩似的。
去碰PTX,意味着你把英伟达花十年搭起来的那套生态全扔了,自己从砖头开始砌。
这事一般人干不出来。
我当时就琢磨,一个成立才一年多的大模型公司,哪来这帮子愿意在PTX层抠性能的疯子?
然后我就顺着这条线往下挖。
挖出来一个我之前没认真想过的东西。
DeepSeek的母公司,是幻方量化。
对,就是那个做量化投资的幻方。我之前也知道这层关系,但说实话一直没当回事,觉得就是个金主爸爸出钱、AI团队出技术的常见剧本。直到我把PTX这个细节和幻方的工程传统摆在一起看,才突然反应过来——
这俩根本不是什么”应用”关系。
是同一拨人,把同一套手艺,从量化交易那张牌桌,直接搬到了AI大模型这张牌桌上。
怎么说呢,我给你捋一下。
幻方量化2015年成立,创始人梁文锋,浙大出来的。这哥们2008年读研的时候就跟同学搞全自动量化交易了,赚到了第一桶金。你看公开资料会发现,幻方从第一天起就把自己定义成”完全依靠AI来做投资的对冲基金”,不是嘴上说说,是真的All in。
2016年,幻方第一个由深度学习算法生成的股票仓位上线实盘,用GPU算。2017年底,几乎所有的量化策略都跑在AI模型上。2019年,他们搞了个”萤火一号”超算集群,11000张高端显卡,每秒1.84亿亿次浮点运算。2021年又砸10个亿搞”萤火二号”,约一万张A100。
你想想这个时间点。
2021年,ChatGPT还没出来,A100还没变成硬通货,大部分人对”囤显卡”这事毫无概念。幻方已经把一万张A100堆在那儿了,每天光闲时算力就有4.2万GPU时。
这帮人不是在追AI风口,他们就是风口本身。
好,铺垫完了,回到我真正想跟你聊的那个点。

我顺着PTX这条线,把DeepSeek和幻方在技术上到底是怎么”同频共振”的,拆成了几块。拆完我整个人有点懵,因为这种技术基因的传承,比我以为的深得多。
我一块一块给你看。
第一块,算力和工程优化。
这事最直观。量化交易和大模型训练,说到底都在干同一件事,就是榨干硬件的每一滴性能。幻方早年为了在毫秒级的时间里做出交易决策,干过什么?给FPGA硬件做深度定制,在C语言里嵌汇编,就为了把调度效率再往上抠一点点。
你品品这个画面。
一个量化工程师,蹲在C代码里,一行一行往里塞汇编,就为了让下单的速度快那么几个微秒。这种偏执狂,你把他扔到大模型团队,他干的第一件事是什么?
绕过CUDA,去写PTX。
因为CUDA对他来说太”高级”了,太隔靴搔痒了。他要的是直接把手伸进硬件里,去拨弄那些寄存器、去调线程束、去重新划分SM。DeepSeek V3论文里那个细节,把132个流处理器多核里专门划出20个用来做服务器间通信,这种操作就是典型的”量化工程师手艺”,把硬件当成可以随便拆解重组的零件。
我看到有高校教授解读说,这种PTX级别的优化,维护难度极高,正常大模型公司不会去碰。但DeepSeek碰了,因为他们团队里本来就有这帮人。这帮人不是为AI学的这套手艺,是为量化学的,十年前就在干了。
这是第一块。算力底座和工程手艺的直接迁移。

第二块,多因子选股和动态特征工程。
这块稍微绕一点,但我尽量说人话。
量化的核心玩法之一叫多因子选股。简单讲就是,你建一个超级大的因子库,里面有价量因子(比如均线突破、动量)、基本面因子(比如ROIC、现金流质量)、另类因子(比如大宗交易溢价率),然后用这些因子去给股票打分,挑出该买哪些。
问题来了,因子不是一成不变的。牛市里好使的因子,熊里可能就废了。流动性好的时候管用的,流动性差的时候可能把你坑死。传统做法是定期人工调权重,但人调不过来,而且容易过拟合——就是模型把历史数据背得太熟,一遇到新情况就抓瞎。
幻方怎么搞的?他们用了一个双层LSTM网络,根据市场波动率、流动性这些宏观变量,动态调整因子权重。再配上在线学习和增量学习,模型一边跑一边学,不用停下来重训。
你发现没有,这个逻辑跟DeepSeek-R1的核心思路是一脉相承的。
R1的强化学习也好,动态推理也好,骨子里都是同一件事——别让模型僵在某个静态状态里,让它跟着环境走。
我有时候觉得,量化交易这件事,天然就是AI的练兵场。因为它给你的反馈太密集了,市场每天都在打你的脸,你的模型今天不行明天就被套,逼着你必须把”动态适应”这件事做到极致。在那种环境里磨出来的人,去做大模型,对”模型怎么跟世界互动”这件事的理解,是会比一直待在实验室里的人深一层的。
这是第二块。思维方式的传承。

第三块,多模态数据处理。
这块我觉得最有意思。
量化一直有个老大难问题,就是非结构化数据用不上。你想想,传统量化模型吃的是什么?行情数据、财务报表,全是表格,整整齐齐。但市场真正有用的信息,一大半都不是表格。
研报里那句”我们对下半年保持谨慎乐观”,这句话到底该给多少权重?社交媒体上突然炸开的一片恐慌情绪,怎么量化?一份财报里那张现金流图,怎么喂给模型?
这些事,传统量化搞不定,只能干瞪眼。
然后DeepSeek来了。
NLP能实时解析研报和新闻,计算机视觉能读财报图表,图神经网络能挖企业供应链、股东关系这些隐性关联,提前捕捉政策转向或者企业流动性风险的信号。
我看到这一段的时候,第一反应是,这哪是什么”AI赋能量化”啊,这是幻方憋了十年的那口气,终于找到了出口。
他们一直知道非结构化数据里有金矿,但手里没那把铲子。DeepSeek就是那把铲子。
而且你注意,这不是单向的。DeepSeek的多模态能力,是在幻方十年攒下的金融数据场景里被锤出来的。你拿通用数据训一个多模态模型,和拿十年高频金融数据训,出来的东西不是一个物种。场景反哺技术,技术再反哺场景,这个飞轮转起来,外人很难插进来。
这是第三块。数据场景和AI能力的双向喂养。

第四块,强化学习和风控。
这块是压轴的,也是最让我觉得”卧槽还能这么玩”的。
量化交易里有两个特别头疼的事,一个叫滑点,一个叫黑天鹅。
滑点好理解,你想10块钱买,结果成交在10块2,那2分钱就是滑点。一笔没事,一天几万笔下来,能吃掉你一大块利润。黑天鹅更狠,就是那种理论上不该发生、但偏偏发生了的极端事件,比如2020年原油宝那种,模型在历史数据里从来没见过,一遇到就懵。
DeepSeek怎么搞的?
滑点这块,用强化学习动态优化下单策略。模型盯着订单簿深度这种微观结构信号,预测对手方下一步要干嘛,然后决定是撤单、是分批、还是换交易所路由。等于说下单这件事,从”按规则执行”变成了”跟市场博弈”。
黑天鹅这块更骚。他们用对抗生成网络,GAN,专门生成各种极端的、历史上从来没出现过的黑天鹅事件数据,拿这些数据去做压力测试。再配上蒙特卡洛模拟和极值理论,整个风控框架从”出了事再补救”变成了”没出事先演练”。
我看到这个的时候,是真的愣了一下。
因为GAN生成黑天鹅这个思路,太量化了,太”幻方”了。一般AI公司谁会想到用生成模型去造灾难数据?只有那种天天被市场毒打、做梦都在想”明天会不会出事”的人,才会把AI往这个方向用。
这是第四块。强化学习把交易执行和风控从静态推向动态。

好,四块拆完了。
我给你捋一下我自己的感受。
我一开始以为,DeepSeek和幻方就是简单的”金主+技术团队”组合,一个出钱一个出力。但真把技术细节摊开看,你会发现根本不是这么回事。
这是一拨人,带着一套在量化战场上淬炼了十年的手艺,转过头来做AI大模型。算力底座是同一套,工程审美是同一套,对”动态适应”的理解是同一套,连用AI造灾难数据这种骚操作,都是同一套思维方式的不同投影。
我后来想到一个词,叫同频共振。
不是谁应用了谁,是两个东西本来就在同一个频率上,所以才能共振。幻方量化的算法优化、算力支撑、底层硬件调度经验,直接成了DeepSeek的底座;DeepSeek的多模态、动态特征工程、强化学习,又反过来推着幻方的策略往前走,从传统多因子往AI驱动的端到端策略演进。
技术壁垒不是单点突破,是三维协同。

聊到这我突然想起个事。
我之前一直没想明白一个问题:为什么DeepSeek能在硬件受限的条件下,用2048张H800,两个月训出6710亿参数的MoE模型,效率比顶尖AI公司高出10倍?
很多人把这归功于某个单点技术突破,MoE架构啦、MLA啦、混合精度啦。
我现在觉得不是。
或者说,不全是。
你把一个在量化交易里被逼着写了十年汇编、把FPGA当亲儿子调、为了几个微秒能跟硬件死磕的团队,扔到AI大模型这个赛道上,他们会怎么干?
他们不会去堆算力,因为他们家底就那么点。
他们会去做一件事——把硬件榨干。
这跟OpenAI那种”我有的是卡、我用算力换性能”的思路,是两种完全不同的工程哲学。前者是工匠,后者是富豪。DeepSeek的效率优势,不是某个trick带来的,是这帮人的工程基因决定的。他们在量化那个绞肉机里待了十年,早就练就了一身”用最少的资源干最大的事”的本事,到了AI这边,不过是换个战场继续打。
我有时候觉得,量化交易和大模型训练,表面是两个行业,底层是同一头怪兽的两只爪子。都在跟不确定性搏斗,都在榨硬件,都在让模型适应一个不断变脸的世界。幻方和DeepSeek,与其说是两家公司,不如说是同一群人,在两个不同的牌桌上,打着同一副牌。

说到这,我想再多嘴一句关于”过拟合”和”黑天鹅”这两个量化最头疼的问题。
因为我觉得这俩词,其实不只是量化的问题,是所有用AI的人迟早都要面对的问题。
过拟合,说白了就是模型把过去背得太熟,对新情况抓瞎。你用AI写文案,写出来的东西越来越像它训练集里那些爆款,没新意了,这就是过拟合。你用AI做决策,决策越来越保守,越来越像历史均值,这也是过拟合。
黑天鹅更不用说了。AI训练数据里没有的东西,它就处理不了。一个没见过的极端情况砸过来,模型当场宕机。
幻方和DeepSeek这套组合拳给我的启发是,过拟合的解法不是更努力地训练,是让模型”动”起来,跟着环境走,在线学,增量学。黑天鹅的解法不是祈祷它别来,是主动用GAN造一堆假黑天鹅,提前演练,让模型在没出事的时候就见过灾难。
这两个思路,我觉得放到任何用AI的场景里都成立。
你做内容的,可以让AI跟着热点增量学,别让它僵在某个风格里。你做产品的,可以让AI提前演练各种极端用户行为,别等上线了才发现它处理不了奇葩case。
工具给你了,思路也给你了,具体怎么用,得你自己去试。
我自己还没完全跑通,但想想就觉得兴奋。

最后回到开头那个PTX的细节。
我那天刷到那段论文的时候,只觉得”这帮人挺硬核的”。但顺着这条线挖下来,把幻方和DeepSeek的技术基因摆在一起看,我才反应过来,那不是硬核,那是手艺。
是十年量化战场上磨出来的、刻在骨子里的、对硬件的偏执。
这种偏执,你没法靠砸钱买,没法靠招人速成,只能靠时间熬。梁文锋2008年就在搞全自动量化了,这帮人在这个坑里蹲了快二十年。DeepSeek今天的效率优势,不是天上掉下来的,是这二十年攒出来的利息。
所以下次你再看到DeepSeek又搞出什么”低成本高效率”的突破,别只盯着那个技术本身看。
往背后看一层。
你会看到一群被量化交易毒打了十年的人,把那身伤疤,变成了AI时代最值钱的工程基因。
大时代啊,朋友们。
/ 注意,本项目仅在 SyncMein 的500人小群分享。
/ 谢谢你看完了我的文章,我们下次再见吧。
/ 作者:明察
/ 投稿或爆料,请联系邮箱:mingcha@gqmg.com










暂无评论内容