硅谷扔出“巨内核”,中国团队祭出“超级算子”,万亿参数模型效率战打响!

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
硅谷扔出“巨内核”,中国团队祭出“超级算子”,万亿参数模型效率战打响!
9002点击    2026-10-01 13:15

AI开始优化AI,形成循环加速。


2.8万亿参数的大模型,究竟要怎么跑快?


近日,海内外团队盯上了全球最大参数量的开源模型——Kimi K3。K3凭借2.8万亿总参数、104B激活参数,刷新了开源模型的性能上限。但普通的AI服务器难以承载这么大参数量的模型,Kimi官方推荐64卡甚至更大规模的AI服务器才能装得下。有业内人士表示,一般未经优化的超节点跑Kimi K3,初始性能可能仅在10 tokens/s左右。


硅谷扔出“巨内核”,中国团队祭出“超级算子”,万亿参数模型效率战打响!


面对如何让2.8万亿参数的Kimi K3跑得更快这一难题,国内外团队几乎同时交出了答卷。


9月21日,浪潮信息在AICC 2026发布元脑SD200 Ultra超节点AI服务器,通过紧耦合128芯本土AI芯片,单机承载2.8万亿参数Kimi K3,Token生成时延首破5.85毫秒。


硅谷扔出“巨内核”,中国团队祭出“超级算子”,万亿参数模型效率战打响!


9月23日,海外TPU推理优化团队Inferact开源tpu-megakernels,用16颗谷歌TPU v7芯片把整个K3装进一个kernel(内核),配合DSpark投机解码,低并发Decode(解码)吞吐达到709 tokens/s。


硅谷扔出“巨内核”,中国团队祭出“超级算子”,万亿参数模型效率战打响!


一个用本土芯片做商业化超节点,一个用Google TPU做开源推理项目,指向了同一个技术思路:打破算子边界,把大模型推理的计算过程融合到极致。


大模型推理的竞争,正从模型算法层,深入到系统软件、芯片互联和内存管理层。


万亿MoE太难跑


海内外团队同时盯上算子融合


万亿参数大模型推理为什么慢?


很多人以为是算力不够,而实际瓶颈更在于数据搬运和内存带宽。


据知名半导体行研机构SemiAnalysis分析,K3一次前向计算的HBM带宽需求约1.5TB,896个专家需要分布到多张芯片上,每次前向还会触发超过120次All-to-All通信。即便芯片具备强大算力,数据传输跟不上节奏,大量计算能力也会被白白闲置。


对于Decode(解码)阶段而言,问题尤其明显。每生成一个Token,模型都需要持续读取大量权重。vLLM、TensorRT-LLM等传统推理框架往往需要启动大量Kernel,每个Kernel完成自己的加载、计算和写回,然后再启动下一个Kernel。


于是,计算之间出现了大量细小的“空泡”。这些碎片化空泡累积起来,就是实际速度与理论峰值之间的鸿沟。


既然kernel边界是浪费来源,那是否可以尝试消灭边界?


Inferact的思路是整个模型就是“一个kernel”。其megakernel方案使用Google Pallas,把K3的92个MoE层放进一个Pallas调用,在一个Kernel内部完成整个解码过程。当前层计算时,下一层权重就可以通过异步DMA提前从HBM搬运到片上VMEM。


这套打法成立的关键是TPU v7的架构特性。每个TensorCore自带64 MiB VMEM,数据进入VMEM后,其生命周期可以由程序显式控制。于是,Kernel作者可以主动安排哪些权重提前搬运,哪些激活继续驻留,哪些数据在使用结束后立即释放。换句话说,Inferact做的是把整个模型看成一个连续的数据流。


硅谷扔出“巨内核”,中国团队祭出“超级算子”,万亿参数模型效率战打响!


浪潮信息没有把整个模型彻底压成一个Kernel。


团队把众多基础算子融合成超级算子,用系统级紧耦合架构榨取整体效率。针对K3推理特点,他们把KDA、Gated MLA、MoE中众多基础算子融合为计算与通信协同执行的大算子,算子数量降低10倍,模型推理性能提升3倍以上。


硅谷扔出“巨内核”,中国团队祭出“超级算子”,万亿参数模型效率战打响!


具体来看,第一步是把小算子“焊成”大算子,减少中间停靠。按片上存储容量划分数据块,让前一步的结果直接留在寄存器或片上缓存中供后一步使用,减少kernel launch次数,也避免中间结果反复写入和读取HBM。


第二步,把通信和计算融合,让数据传输和计算同步进行。超级算子按照Tile(数据块)组织流水线,通过异步搬运和多缓冲机制,让下一块数据预取、当前数据计算和上一块结果写回同时进行。跨芯片通信也按照Tile推进,把通信延迟尽可能藏到计算过程里。


可以看到,前者把整个Decode过程放进一个megakernel,后者把大量细粒度算子融合成超级算子。


它们共同指向的,是传统“一个Op(算子)对应一个Kernel”的计算方式正在松动。


用K3优化K3:


让AI参与超级算子优化


超级算子能够减少推理过程中的数据搬运与等待,但其设计和优化本身也是一项复杂的工程。数据如何复用、计算与通信如何衔接、不同阶段如何形成流水,都需要结合具体模型和硬件条件进行设计与验证。


这些工作需要大量人工投入。能否让AI参与其中,提高超级算子的生成与优化效率?


为此,浪潮信息在元脑SD200 Ultra适配Kimi K3的过程中引入“超级算子智能体”,让Kimi K3参与自身的推理优化。针对K3的推理特点,智能体生成通算融合、Tile级流水的超级算子,推动计算、通信与数据搬运协同执行。


硅谷扔出“巨内核”,中国团队祭出“超级算子”,万亿参数模型效率战打响!


浪潮信息首席AI战略官刘军在采访中打了个比方:过去大模型推理由数百个算子串联执行,如同绿皮火车途经数百个小站,反复启停装卸数据,整体效率低下;而超级算子就像一站直达的高铁,省去中间停靠开销。


刘军谈道,以往行业清楚这套模式的短板,但人工算子优化调度的工作量巨大。如今Agent带来解法,浪潮信息采用“用K3优化K3”的思路,依托超节点系统架构,由AI智能体自动生成超级算子,再经由模型校验迭代,性能较此前再度提升50%,形成循环加速。


可以看到,模型已经不只是被优化的对象,也开始成为优化基础设施的工具。这可能会成为下一代推理优化的重要范式。


芯片一张牌,系统一张牌:


超节点打的是系统战


Agent时代,Token消耗增长数百万倍。据Gartner 2026年3月报告,一个Agent工作流每任务消耗的Token量是标准聊天机器人的5到30倍;高盛预测,到2030年全球Token消耗量将较2026年增长24倍,达到每月约120000万亿Token。


硅谷扔出“巨内核”,中国团队祭出“超级算子”,万亿参数模型效率战打响!


需求侧爆发,算力供给如何接住?


这里可以看到两个典型困境。


第一个是Kimi K3代表的“向上”。模型越来越大,推理能力越来越强,长上下文、复杂推理、多Agent协同越来越多,单机越来越难承载,算力系统需要不断突破模型能力上限。


第二个是DeepSeek代表的“向广”。当越来越多用户开始调用低成本模型,Token需求会迅速扩张。模型本身可能已经足够便宜,但如果算力供给跟不上,低价Token就很难持续。


浪潮信息的回答是Capability AI Compute(能力型智算)加Capacity AI Compute(容量型智算),两条线齐头并进。


向上,SD200 Ultra用5.85ms/token、单用户170 tokens/s,让前沿模型跑得起、跑得快。向广,HC2000多元算力机组用DirectCom 2.0极速架构,Prefill、Decode、FFN按负载匹配多元芯片,同等投资Token产能提升10倍。


硅谷扔出“巨内核”,中国团队祭出“超级算子”,万亿参数模型效率战打响!


中国玩家的护城河在哪里?


单看芯片,其与NVIDIA仍有差距,单卡算力、生态、工具链都有明显短板。但到了超节点层面,靠系统级创新可以追平甚至超越单卡更强但系统松散的方案。


以浪潮信息SD200 Ultra为例,其用3D Hyper Mesh架构紧耦合128芯本土AI芯片,提供8TB统一编址显存和64TB内存,通信时延低至0.69微秒。通过对称内存技术,首次在基于本土AI芯片的超节点上实现GPU显存直连,AllReduce通信时间降低3.5倍。


刘军谈道,超节点最基本的特征是显存要统一寻址,这一点做到了,才能把这么大的模型放进去,否则就只能叫节点集群,还是需要把模型拆分成若干段。


总的来说,芯片是一张牌,系统工程则是另一张牌。


当芯片之间能够形成更紧密的连接,内存能够形成统一空间,通信可以藏进计算过程,算子又可以由AI持续优化,单芯片性能之外的系统红利就开始释放。对于本土算力而言,这条路径尤其重要。


结语:万亿模型推理需求爆发


效率革命才刚刚开始


AI算力竞争,正从造出更快的芯片变为把现有芯片组织到极致。Inferact用16颗TPU证明一个kernel可以装下2.8万亿参数;浪潮信息用128颗本土芯片证明系统级紧耦合加超级算子,可以让本土算力跑进第一梯队。


两条路线,一个方向。大模型推理的效率革命,才刚刚开始。对中国AI产业,这个方向的特殊意义在于,在芯片工艺受限的约束下,系统级创新是确定性最高的追赶路径。浪潮信息迈出的这一步,值得被更多人看见。


文章来自于微信公众号 “智东西”,作者 “智东西”

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
AI工作流

【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!

项目地址:https://github.com/coze-dev/coze-studio


【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。

项目地址:https://github.com/n8n-io/n8n

在线使用:https://n8n.io/(付费)


【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。

项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file



【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。

项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file

在线使用:https://vectorvein.ai/(付费)

3
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md