故事是这样的。
前阵子DeepSeek-V3的技术报告里,有个数字把我看愣了。
557.6万美元。
这是DeepSeek-V3整个训练的成本,预训练加上下文扩展加后训练,全算上。我第一次看到这个数字的时候,脑子里第一反应是???,第二反应是去翻Llama 3.1 405B的账本,人家预训练花了差不多5800万美元。
一个量级。
你敢信???
当时整个AI圈都在讨论这件事,各种阴谋论都出来了,有人说DeepSeek藏了卡,有人说数据有问题,有人说这是营销话术。我一开始也半信半疑,觉得这数字太漂亮了,漂亮到不像真的。
后来我把那份技术报告翻来覆去看了好几遍,又去扒了DeepSeek背后那家公司——幻方量化的底子,我才慢慢想明白一件事。
这个数字是真的。但它便宜的原因,跟大多数人想的不一样。
大家都在算卡数,算GPU型号,算租赁价格,好像训练大模型就是去云厂商那儿租一堆H800,然后烧就完了。但DeepSeek不是这么干的。它背后有一整套东西,一套从2020年就开始攒的算力基础设施,一套软硬件一体化设计的体系。
这套东西的名字,叫萤火。

我跟你说,知道DeepSeek的人很多,知道幻方量化的人也不少,但知道萤火集群的人,真的不多。
很多朋友可能不知道,DeepSeek不是从零起步的。它的前身是幻方量化内部的AI团队,2023年5月才独立出来成立了深度求索。而在独立之前,幻方已经为这个团队烧了好几年的算力了。
幻方量化这家公司挺有意思,它是一个量化基金,说白了就是用AI来做股票交易的。2015年成立,创始人叫梁文锋,浙大人工智能专业出来的。这哥们儿从读书的时候就信一件事,AI一定会改变世界。2008年那会儿,这话说出来没人信。
但他真就靠着这个信念,把幻方做成了千亿规模的量化基金,业内叫”量化四大天王”之一。
一个做量化基金的,怎么就做出了DeepSeek呢。
这事儿得从2019年说起。
那一年,幻方的量化业务做到了百亿规模,但梁文锋发现一个问题,模型越来越复杂,单机训练扛不住了,算力瓶颈卡得他难受。一般量化基金遇到这个问题,要么租云算力,要么买几台服务器凑合用。但梁文锋选了第三条路,自己建超算集群。
2020年,萤火一号投用。投资近2个亿,搭载1100块高端显卡,算力18.4 PFLOPS。这个数字啥概念呢,相当于4万台个人电脑的算力加一块儿。
但这只是开胃菜。
2021年,萤火二号来了。投资10个亿,约1万张英伟达A100。
一万张A100啊朋友们。
你想想看,2021年那会儿,ChatGPT还没出来,绝大多数互联网大厂都还没反应过来AI这波浪潮要来。而一个量化基金,已经悄没声地囤了一万张A100。
据《财经十一人》那篇报道说,国内拥有超过1万枚GPU的企业不超过5家。幻方是其中之一,而且是里面唯一一个非互联网大厂的。
这不是运气,是远见。
梁文锋后来接受采访的时候说过一句话,我印象特别深。他说,对行内人来说,2012年AlexNet带来的冲击已经引领了一个新的时代,2020年OpenAI发布GPT-3之后,方向很清楚,需要大量算力。但即便2021年我们投入建设萤火二号时,大部分人还是无法理解。
大部分人还是无法理解。
这句话听着有点孤独。

回到主线。
光有卡其实不算啥,有钱谁都能买。萤火真正厉害的地方,在于它不是一堆卡的简单堆叠,而是一套软硬件一体化设计的体系。
啥叫软硬件一体化设计?
坦率的讲,一开始我也不太理解这个词儿。后来我想明白了,就是硬件、网络、存储、软件,全栈自研,互相配合,每一层都为其他层量身定制。
这事儿在AI行业其实挺罕见的。大多数公司训练大模型,硬件买英伟达的整机,软件用PyTorch加NCCL,存储买商业方案,网络用标准InfiniBand。各管各的,凑一块儿能用就行。
但幻方不这么干。
硬件层面,萤火二号的1万张A100,全是PCIe版本的,不是那种带NVLink的DGX整机。为啥?便宜。DGX整机贵得要死,PCIe版本的A100性价比高得多。但代价是,PCIe版本没有NVLink那种高速GPU互联,多机通信效率会差。
那怎么办呢。
软件来补。
这就是软硬件一体化设计的精髓所在,硬件上省下来的钱和性能缺口,用软件层的自研工具给补回来,甚至补得更好。
幻方自研了一整套软件栈,我给你一个个捋。
先说3FS,全称Fire-Flyer File System,萤火文件系统。这玩意儿是干嘛的呢,简单讲就是一个专门为AI训练设计的高速存储系统。
为啥需要专门的存储系统?
你想想,万卡训练的时候,1万个GPU同时要读数据,那个IO压力是天文数字。普通存储系统根本扛不住,数据供不上,GPU就得等着,等着就是烧钱。
3FS专门为AI训练的随机数据访问模式做了优化。2025年2月DeepSeek开源周最后一天,3FS开源了。开源之后大家才发现,这东西在180节点集群里能跑到6.6 TiB/s的聚合读取吞吐量。
6.6 TiB/s。
这个数字我念了好几遍才有点感觉。就是你一秒钟可以读6600多GB的数据。
我看到有存储领域的专家评价说,3FS单节点40 GB/s的读带宽基本上把网络性能压满了,达到了国际一线品牌产品的性能指标。但更牛的是,幻方在InfiniBand网络大规模集群组网时解决了拥塞问题,这一点非常了不起。
说真的,这个3FS开源的时候,我估计不少存储厂商的工程师当晚没睡好。

再说HFReduce。
这个是幻方自研的多机通信框架,专门为萤火的硬件定制的。它的作用是替代PyTorch里的DistributedDataParallel,用CPU来做梯度加法,而不是调用NCCL在GPU之间传梯度。
为啥这么设计?因为萤火用的是PCIe版本的A100,没有NVLink,GPU之间直接通信效率不高。那就换个思路,用CPU来干这个活儿。
效果呢,BERT-Large在100节点下训练速度提升20%。而且不需要专用硬件,纯软件方案。
这思路我觉得特别妙。别人都在想怎么让GPU之间通信更快,幻方反其道而行之,干脆绕开GPU通信这个瓶颈,用CPU来干。这就是软硬件一体化设计的好处,你知道自己的硬件长啥样,就能针对性地想出这种骚操作。
然后是hfai.nn,高性能深度学习算子库。
这个就更有意思了。幻方把PyTorch里一些常用的算子重新写了一遍,针对萤火集群的特点做了优化。LSTM算子快20%到6倍,Attention算子快30%,LayerNorm快80%。
你可能觉得,快30%快80%有啥了不起的。但你想想,训练一个大模型要跑几十天,每个算子快30%,叠起来就是天文的节省。而且这些算子是底层的东西,上层模型代码一行都不用改,换个import就能用。
这种活儿,脏活累活,没人愿意干,但效果实打实。
接着是HaiScale,轻量级高性能并行训练工具库。模型训练速度提升50%到100%。
最后是HAI-Platform,集群调度与管理平台。这个才是萤火的大管家。
HAI-Platform最牛逼的一个数据是,集群平均占用率96%以上,GPU使用率85%。
96%的占用率。
你知道这意味着什么吗。大多数公司的GPU集群,占用率能到60%就算不错了,很多甚至更低。一堆卡买回来,大部分时间在那儿闲置,烧着电费放着光。
但萤火的卡,几乎每时每刻都在跑任务。
怎么做到的呢,幻方搞了一套叫”任务级分时调度”的东西。灵感来自Linux操作系统的CPU任务调度。简单说就是,把显卡资源在时间轴上切片,合理分配给每一个训练任务。用户不用关心有没有算力资源,写好代码提交上去就行,调度器自动找空闲的算力把任务跑起来。
2022年全年,萤火集群运行了135万个任务,共计5674万GPU时。其中用于科研支持的闲时算力高达1533万GPU时,占比27%。
我给你算笔账。按当时A100云服务市场价估算,仅这1533万GPU时的科研算力投入,就相当于每年约2个亿人民币。
2个亿。每年。白给科研用。
这不是什么公益项目,这是幻方在自己的量化业务空闲时段,把算力拿出来给AI研究用。一鱼两吃。

说到这里,我突然想起一件事。
DeepSeek独立之前,幻方还给它投了30个亿自有资金。首期30亿,全是自己的钱,没拿外部融资。
你想想这个画面。一个量化基金,自己掏30亿,建了一个万卡超算,养了一个AI研究团队,然后让他们去搞AGI。
这事儿搁谁身上都得说一句,疯了吧。
但梁文锋就是这么干的。
我有时候觉得,这个世界上真正能做成大事的人,身上都有一种不太理性的执念。梁文锋从2008年就信AI会改变世界,那时候这话说出来跟神经病差不多。然后他信了17年,信到了2025年,信到了DeepSeek震动全球。
17年。
你想想你自己,上一次对一件事持续相信17年是什么时候。
我反正是想不起来。
回到萤火这套体系上。
我之所以花这么长篇幅聊这个,是因为我觉得萤火代表了一种很特别的思路。在AI行业,大家都在追逐最新的模型、最大的参数、最炫的能力,但很少有人愿意沉下心去搞基础设施。
基础设施这东西,不性感,不出名,做了也没人鼓掌。3FS在开源之前,外面几乎没人知道幻方自研了一套这么牛的文件系统。HFReduce、hfai.nn这些东西,更是默默无闻。
但正是这些不起眼的东西,撑起了DeepSeek那557万美元的训练成本。
没有萤火的96%占用率,GPU闲置浪费的钱就够再训一个V3了。没有3FS的6.6 TiB/s吞吐量,数据加载就是瓶颈,训练速度得慢一大截。没有HFReduce绕开NVLink的短板,PCIe版本的A100根本跑不出这个效率。
每一层省下来的钱,叠在一起,就是那个让全世界震惊的数字。
这事儿让我想起一个历史类比。
1880年代,电力开始在美国普及。当时很多工厂主花大价钱买了发电机和电动机,装在自己工厂里。但装完之后,很多人发现生产效率并没有显著提升。
为啥呢,因为他们只是用电动机替代了蒸汽机,但整个工厂的布局、流程、管理方式都没有变。电只是被当成了一个更方便的动力源,而不是一个能重塑生产方式的新东西。
那些真正吃到电力红利的人,是那些想明白了电力到底意味着什么的人。他们重新设计工厂,把传动轴拆掉,让每一台机器都独立用电,流水线因此诞生,生产效率翻了十倍几十倍。
AI也是一样。
现在这个阶段,其实就挺像1880年。大多数人把AI当成一个更方便的工具,买个API调一调,生成个文案写个代码,就完事了。但真正能吃到AI红利的,是那些愿意从底层重新思考的人。
幻方就是。
他们不是买一堆卡然后跑模型这么简单,他们是从硬件、网络、存储、软件,每一层都重新设计,让这套基础设施为AI训练这件事量身打造。
这就是软硬件一体化设计的真正含义。不是省钱,是重新想一遍。

写到这里,我得坦诚一件事。
我自己并没有用过萤火集群,hfai那套工具我也只是看了文档和论文,没有亲手跑过。所以上面这些判断,是基于公开资料和我的理解推出来的,可能有不准的地方。
但有一点我是确定的。
DeepSeek那557万美元的训练成本,不是天上掉下来的便宜,也不是什么营销话术。它背后是一套积累了五六年的基础设施体系,是一个量化基金从2020年就开始的长期投入,是一群人愿意干脏活累活把每一层都打磨到极致的结果。
这个世界上没有便宜的奇迹,只有被低估的苦功。
萤火一号到萤火二号,2亿到10亿,1100块卡到1万块卡。这条路走了五年。
五年磨一剑,然后一夜之间震动全球。
很多人说DeepSeek是横空出世的黑马,但我看完这些资料之后,我觉得不是。没有什么横空出世,只有厚积薄发。萤火这套体系,就是那个”厚积”。
最后想说一个细节。
DeepSeek开源周的时候,他们开源了3FS,也提到了HAI-Platform的调度理念。这些原本是幻方压箱底的东西,是量化基金的护城河,是花了几年时间踩了无数坑才打磨出来的基础设施。
他们全开源了。
梁文锋说过一句话,被别人追随我们的创新,是一件让人很有成就感的事。开源更像是一种文化行为,通过贡献开源,我们能赢得尊重。
我看到这句话的时候,沉默了一会儿。
在这个所有人都在卷模型、卷参数、卷融资的时代,有一家公司选择把自己最底层的基础设施开源出来,给全世界用。
这不是大方,这是一种姿态。
一种,我做得起,我也给得起的姿态。
大时代啊,朋友们。
/ 注意,本项目仅在 SyncMein 的500人小群分享。
/ 谢谢你看完了我的文章,我们下次再见吧。
/ 作者:明察
/ 投稿或爆料,请联系邮箱:mingcha@gqmg.com










暂无评论内容