萤火超级计算集群:支持DeepSeek万卡级GPU算力与软硬件一体化训练方案

故事是这样的。

前阵子DeepSeek-V3的技术报告里,有个数字把我看愣了。

557.6万美元。

这是DeepSeek-V3整个训练的成本,预训练加上下文扩展加后训练,全算上。我第一次看到这个数字的时候,脑子里第一反应是???,第二反应是去翻Llama 3.1 405B的账本,人家预训练花了差不多5800万美元。

一个量级。

你敢信???

当时整个AI圈都在讨论这件事,各种阴谋论都出来了,有人说DeepSeek藏了卡,有人说数据有问题,有人说这是营销话术。我一开始也半信半疑,觉得这数字太漂亮了,漂亮到不像真的。

后来我把那份技术报告翻来覆去看了好几遍,又去扒了DeepSeek背后那家公司——幻方量化的底子,我才慢慢想明白一件事。

这个数字是真的。但它便宜的原因,跟大多数人想的不一样。

大家都在算卡数,算GPU型号,算租赁价格,好像训练大模型就是去云厂商那儿租一堆H800,然后烧就完了。但DeepSeek不是这么干的。它背后有一整套东西,一套从2020年就开始攒的算力基础设施,一套软硬件一体化设计的体系。

这套东西的名字,叫萤火。

萤火

我跟你说,知道DeepSeek的人很多,知道幻方量化的人也不少,但知道萤火集群的人,真的不多。

很多朋友可能不知道,DeepSeek不是从零起步的。它的前身是幻方量化内部的AI团队,2023年5月才独立出来成立了深度求索。而在独立之前,幻方已经为这个团队烧了好几年的算力了。

幻方量化这家公司挺有意思,它是一个量化基金,说白了就是用AI来做股票交易的。2015年成立,创始人叫梁文锋,浙大人工智能专业出来的。这哥们儿从读书的时候就信一件事,AI一定会改变世界。2008年那会儿,这话说出来没人信。

但他真就靠着这个信念,把幻方做成了千亿规模的量化基金,业内叫”量化四大天王”之一。

一个做量化基金的,怎么就做出了DeepSeek呢。

这事儿得从2019年说起。

那一年,幻方的量化业务做到了百亿规模,但梁文锋发现一个问题,模型越来越复杂,单机训练扛不住了,算力瓶颈卡得他难受。一般量化基金遇到这个问题,要么租云算力,要么买几台服务器凑合用。但梁文锋选了第三条路,自己建超算集群。

2020年,萤火一号投用。投资近2个亿,搭载1100块高端显卡,算力18.4 PFLOPS。这个数字啥概念呢,相当于4万台个人电脑的算力加一块儿。

但这只是开胃菜。

2021年,萤火二号来了。投资10个亿,约1万张英伟达A100。

一万张A100啊朋友们。

你想想看,2021年那会儿,ChatGPT还没出来,绝大多数互联网大厂都还没反应过来AI这波浪潮要来。而一个量化基金,已经悄没声地囤了一万张A100。

据《财经十一人》那篇报道说,国内拥有超过1万枚GPU的企业不超过5家。幻方是其中之一,而且是里面唯一一个非互联网大厂的。

这不是运气,是远见。

梁文锋后来接受采访的时候说过一句话,我印象特别深。他说,对行内人来说,2012年AlexNet带来的冲击已经引领了一个新的时代,2020年OpenAI发布GPT-3之后,方向很清楚,需要大量算力。但即便2021年我们投入建设萤火二号时,大部分人还是无法理解。

大部分人还是无法理解。

这句话听着有点孤独。

一万张

回到主线。

光有卡其实不算啥,有钱谁都能买。萤火真正厉害的地方,在于它不是一堆卡的简单堆叠,而是一套软硬件一体化设计的体系。

啥叫软硬件一体化设计?

坦率的讲,一开始我也不太理解这个词儿。后来我想明白了,就是硬件、网络、存储、软件,全栈自研,互相配合,每一层都为其他层量身定制。

这事儿在AI行业其实挺罕见的。大多数公司训练大模型,硬件买英伟达的整机,软件用PyTorch加NCCL,存储买商业方案,网络用标准InfiniBand。各管各的,凑一块儿能用就行。

但幻方不这么干。

硬件层面,萤火二号的1万张A100,全是PCIe版本的,不是那种带NVLink的DGX整机。为啥?便宜。DGX整机贵得要死,PCIe版本的A100性价比高得多。但代价是,PCIe版本没有NVLink那种高速GPU互联,多机通信效率会差。

那怎么办呢。

软件来补。

这就是软硬件一体化设计的精髓所在,硬件上省下来的钱和性能缺口,用软件层的自研工具给补回来,甚至补得更好。

幻方自研了一整套软件栈,我给你一个个捋。

先说3FS,全称Fire-Flyer File System,萤火文件系统。这玩意儿是干嘛的呢,简单讲就是一个专门为AI训练设计的高速存储系统。

为啥需要专门的存储系统?

你想想,万卡训练的时候,1万个GPU同时要读数据,那个IO压力是天文数字。普通存储系统根本扛不住,数据供不上,GPU就得等着,等着就是烧钱。

3FS专门为AI训练的随机数据访问模式做了优化。2025年2月DeepSeek开源周最后一天,3FS开源了。开源之后大家才发现,这东西在180节点集群里能跑到6.6 TiB/s的聚合读取吞吐量。

6.6 TiB/s。

这个数字我念了好几遍才有点感觉。就是你一秒钟可以读6600多GB的数据。

我看到有存储领域的专家评价说,3FS单节点40 GB/s的读带宽基本上把网络性能压满了,达到了国际一线品牌产品的性能指标。但更牛的是,幻方在InfiniBand网络大规模集群组网时解决了拥塞问题,这一点非常了不起。

说真的,这个3FS开源的时候,我估计不少存储厂商的工程师当晚没睡好。

3FS,6.6 TiB/s

再说HFReduce。

这个是幻方自研的多机通信框架,专门为萤火的硬件定制的。它的作用是替代PyTorch里的DistributedDataParallel,用CPU来做梯度加法,而不是调用NCCL在GPU之间传梯度。

为啥这么设计?因为萤火用的是PCIe版本的A100,没有NVLink,GPU之间直接通信效率不高。那就换个思路,用CPU来干这个活儿。

效果呢,BERT-Large在100节点下训练速度提升20%。而且不需要专用硬件,纯软件方案。

这思路我觉得特别妙。别人都在想怎么让GPU之间通信更快,幻方反其道而行之,干脆绕开GPU通信这个瓶颈,用CPU来干。这就是软硬件一体化设计的好处,你知道自己的硬件长啥样,就能针对性地想出这种骚操作。

然后是hfai.nn,高性能深度学习算子库。

这个就更有意思了。幻方把PyTorch里一些常用的算子重新写了一遍,针对萤火集群的特点做了优化。LSTM算子快20%到6倍,Attention算子快30%,LayerNorm快80%。

你可能觉得,快30%快80%有啥了不起的。但你想想,训练一个大模型要跑几十天,每个算子快30%,叠起来就是天文的节省。而且这些算子是底层的东西,上层模型代码一行都不用改,换个import就能用。

这种活儿,脏活累活,没人愿意干,但效果实打实。

接着是HaiScale,轻量级高性能并行训练工具库。模型训练速度提升50%到100%。

最后是HAI-Platform,集群调度与管理平台。这个才是萤火的大管家。

HAI-Platform最牛逼的一个数据是,集群平均占用率96%以上,GPU使用率85%。

96%的占用率。

你知道这意味着什么吗。大多数公司的GPU集群,占用率能到60%就算不错了,很多甚至更低。一堆卡买回来,大部分时间在那儿闲置,烧着电费放着光。

但萤火的卡,几乎每时每刻都在跑任务。

怎么做到的呢,幻方搞了一套叫”任务级分时调度”的东西。灵感来自Linux操作系统的CPU任务调度。简单说就是,把显卡资源在时间轴上切片,合理分配给每一个训练任务。用户不用关心有没有算力资源,写好代码提交上去就行,调度器自动找空闲的算力把任务跑起来。

2022年全年,萤火集群运行了135万个任务,共计5674万GPU时。其中用于科研支持的闲时算力高达1533万GPU时,占比27%。

我给你算笔账。按当时A100云服务市场价估算,仅这1533万GPU时的科研算力投入,就相当于每年约2个亿人民币。

2个亿。每年。白给科研用。

这不是什么公益项目,这是幻方在自己的量化业务空闲时段,把算力拿出来给AI研究用。一鱼两吃。

96%占用率

说到这里,我突然想起一件事。

DeepSeek独立之前,幻方还给它投了30个亿自有资金。首期30亿,全是自己的钱,没拿外部融资。

你想想这个画面。一个量化基金,自己掏30亿,建了一个万卡超算,养了一个AI研究团队,然后让他们去搞AGI。

这事儿搁谁身上都得说一句,疯了吧。

但梁文锋就是这么干的。

我有时候觉得,这个世界上真正能做成大事的人,身上都有一种不太理性的执念。梁文锋从2008年就信AI会改变世界,那时候这话说出来跟神经病差不多。然后他信了17年,信到了2025年,信到了DeepSeek震动全球。

17年。

你想想你自己,上一次对一件事持续相信17年是什么时候。

我反正是想不起来。

回到萤火这套体系上。

我之所以花这么长篇幅聊这个,是因为我觉得萤火代表了一种很特别的思路。在AI行业,大家都在追逐最新的模型、最大的参数、最炫的能力,但很少有人愿意沉下心去搞基础设施。

基础设施这东西,不性感,不出名,做了也没人鼓掌。3FS在开源之前,外面几乎没人知道幻方自研了一套这么牛的文件系统。HFReduce、hfai.nn这些东西,更是默默无闻。

但正是这些不起眼的东西,撑起了DeepSeek那557万美元的训练成本。

没有萤火的96%占用率,GPU闲置浪费的钱就够再训一个V3了。没有3FS的6.6 TiB/s吞吐量,数据加载就是瓶颈,训练速度得慢一大截。没有HFReduce绕开NVLink的短板,PCIe版本的A100根本跑不出这个效率。

每一层省下来的钱,叠在一起,就是那个让全世界震惊的数字。

这事儿让我想起一个历史类比。

1880年代,电力开始在美国普及。当时很多工厂主花大价钱买了发电机和电动机,装在自己工厂里。但装完之后,很多人发现生产效率并没有显著提升。

为啥呢,因为他们只是用电动机替代了蒸汽机,但整个工厂的布局、流程、管理方式都没有变。电只是被当成了一个更方便的动力源,而不是一个能重塑生产方式的新东西。

那些真正吃到电力红利的人,是那些想明白了电力到底意味着什么的人。他们重新设计工厂,把传动轴拆掉,让每一台机器都独立用电,流水线因此诞生,生产效率翻了十倍几十倍。

AI也是一样。

现在这个阶段,其实就挺像1880年。大多数人把AI当成一个更方便的工具,买个API调一调,生成个文案写个代码,就完事了。但真正能吃到AI红利的,是那些愿意从底层重新思考的人。

幻方就是。

他们不是买一堆卡然后跑模型这么简单,他们是从硬件、网络、存储、软件,每一层都重新设计,让这套基础设施为AI训练这件事量身打造。

这就是软硬件一体化设计的真正含义。不是省钱,是重新想一遍。

1880

写到这里,我得坦诚一件事。

我自己并没有用过萤火集群,hfai那套工具我也只是看了文档和论文,没有亲手跑过。所以上面这些判断,是基于公开资料和我的理解推出来的,可能有不准的地方。

但有一点我是确定的。

DeepSeek那557万美元的训练成本,不是天上掉下来的便宜,也不是什么营销话术。它背后是一套积累了五六年的基础设施体系,是一个量化基金从2020年就开始的长期投入,是一群人愿意干脏活累活把每一层都打磨到极致的结果。

这个世界上没有便宜的奇迹,只有被低估的苦功。

萤火一号到萤火二号,2亿到10亿,1100块卡到1万块卡。这条路走了五年。

五年磨一剑,然后一夜之间震动全球。

很多人说DeepSeek是横空出世的黑马,但我看完这些资料之后,我觉得不是。没有什么横空出世,只有厚积薄发。萤火这套体系,就是那个”厚积”。

最后想说一个细节。

DeepSeek开源周的时候,他们开源了3FS,也提到了HAI-Platform的调度理念。这些原本是幻方压箱底的东西,是量化基金的护城河,是花了几年时间踩了无数坑才打磨出来的基础设施。

他们全开源了。

梁文锋说过一句话,被别人追随我们的创新,是一件让人很有成就感的事。开源更像是一种文化行为,通过贡献开源,我们能赢得尊重。

我看到这句话的时候,沉默了一会儿。

在这个所有人都在卷模型、卷参数、卷融资的时代,有一家公司选择把自己最底层的基础设施开源出来,给全世界用。

这不是大方,这是一种姿态。

一种,我做得起,我也给得起的姿态。

大时代啊,朋友们。

/ 注意,本项目仅在 SyncMein 的500人小群分享。
/ 谢谢你看完了我的文章,我们下次再见吧。
/ 作者:明察
/ 投稿或爆料,请联系邮箱:mingcha@gqmg.com


© 版权声明
THE END
喜欢就支持一下吧
点赞11 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容