内页banner>

联系方式

当前位置: 首页 > 资讯动态

资讯动态Projects

联系我们Contact Us

球友会官网 - 足球篮球赛事资讯平台

电话:13594780383

联系人:周经理

邮箱:laborious@icloud.com

网址:qyh-sitecn.com

地址:铜仁市旁踏港33号

AI自己榨干算力!让Kimi K3自己写「超级算子」,推理快了3倍

2026-10-02
962次

新智元报道 大模型提速,原来还有这条路! 上一周,vLLM原班人马创办的Inferact,开源了一套TPU Megakernels(巨型算子)。 他们把Kimi K3的92个MoE层一层不落地写进同一个程序,扔到16颗谷歌TPU v7上跑: 开着投机解码,单用户输出速度达到709 tokens/s;同样16块英伟达GB200,用vLLM跑,是452 tokens/s。 关掉投机解码,在1到8的并发下,它也都是GB200的1.4到2倍。 最扎心的是,按纸面参数,TPU v7的显存带宽(7380GB/s)还比GB200(8000GB/s)低一截。 硬件没占到便宜,赢在了写法上。 还有个彩蛋,这套巨型算子从零编译只要不到90秒。以前在TPU上编译一个同量级的大模型,动辄半小时起步。 同一周,国内也传来进展。 在AICC2026上,浪潮信息发布元脑SD200 Ultra超节点AI服务器,用128芯的本土AI芯片,单机跑起同一个K3,Token生成时延压到5.85毫秒。 他们的招数叫「 超级算子 」。 一个用谷歌TPU,一个用本土AI芯片,同一周、同一个模型,都在拆算子之间的那堵墙。 更有意思的是,浪潮信息的 超级算子 ,有一大块是让K3自己写的。 大模型吐字慢 到底卡在哪儿 很多人以为大模型吐字慢是算力不够。其实芯片大部分时间闲着,在等数据。 模型每生成一个token,都要把用到的参数从显存(HBM)里搬一遍。算得再快,货没到也只能干等。 所以推理速度的天花板,很多时候由显存带宽说了算。 很多时候,麻烦出在「算子」上。算子可以理解成一个个小程序,做一次矩阵乘、做一次归一化,各管一摊。 传统推理框架里,生成一个token要依次启动一长串算子,每个都走一遍「搬数据—计算—写回去」。 据统计,K3单步推理要调用数千次算子。 打个比方,这就像坐老式绿皮火车从北京到广州,一路几百个小站,每站都要停车、卸货、装货、再启动,两天两夜才到。 车停着的那几分钟,铁轨是空的。换到芯片上,就是显存带宽在算子切换的空档里被白白浪费。 一个空档不起眼,几千个攒起来,就是理论速度和实际速度之间那道大坑。 英伟达这些年也在补坑,CUDA Graphs、PDL这些技术能让车停得短一点。可站还在,车就得停。 那就把站撤了,改高铁,一站直达。这就是算子融合。 整个模型,就是一个算子 Inferact的做法最狠:既然边界是浪费的源头,那就一个边界都不留。 92层全装进一个kernel,程序按层号自己判断这一层该走KDA还是MLA(K3用的两种注意力机制)。 所有层都在同一个程序里,上一层还在算,下一层的权重就已经在搬运的路上了。等轮到它,货早就码在芯片手边。 这招能成,得感谢TPU的一个设计。 TPU v7每个核心自带64MiB的片上高速内存(VMEM),数据搬进来放多久、什么时候腾地方,全由程序说了算。 GPU的片上内存要分给一百多个计算单元,每个单元只摊到两百多KB,想提前囤货都没地方放。 TPU给了一个大仓库,还把钥匙交给了写程序的人。 至于编译为什么快得离谱,Inferact的解释很实在: 原来编译器每次都要在成百上千个操作里反复摸索怎么排顺序、怎么重叠,现在这些活儿,工程师一次性手工做完了。 注意这个「手工」一词,四位作者都是顶尖的推理工程师,写这样一个巨型算子,门槛高得吓人。 Inferact在博文里也留了一句:以后会有更多这样的kernel,由编程智能体(coding agent)来写。 写算子这门手艺 AI正在接手 这句话可不是客套。 9月14日,DeepSeek的算子工程师刘胜与发了一篇长文,跟自己「手写算子的时光」告别。 他给DeepSeek V4.1写过主注意力算子,是真正在一线拧螺丝的人。他在文中预计,半年到一年内,AI写的算子就会追上甚至超过他。 一年前,他的AI助手还只能帮忙找bug;现在已经能自己读CUDA、PTX、SASS这些底层代码,动手调优。 他还写了一句很扎心的话:自己算子写得越好,新模型训练和推理就越快,他被替代得也越快。 大洋彼岸也在跑同一条路。今年4月,Cursor和英伟达合作,用一套多智能体系统优化了235个CUDA算子,三周跑下来,平均提速38%。 为什么偏偏是算子最先被AI接手? 因为它有标准答案:结果对不对,一跑就知道;快了多少,秒表说了算。 AI可以没日没夜地写、测、改,人熬不过它。 浪潮信息,已经把这件事用在了K3身上。 让K3优化K3,系统级破局 面对同样的Kimi K3,国内的浪潮信息也在做算子融合,同时把优化延伸到整个超节点系统。 两家的共同点很明确:把细粒度的小算子融合成大算子,减少启动和数据搬运的开销。 区别就在于粒度。Inferact把整个解码过程融合成一个算子;浪潮信息的粒度相对较小,围绕KDA、Gat

about image

球友会官网 - 足球篮球赛事资讯平台

电话:13594780383

联系人:周经理

邮箱:laborious@icloud.com

网址:qyh-sitecn.com

地址:铜仁市旁踏港33号

在线留言

  • 体验移动端

    体验移动端

  • 联系客服

    联系客服