欢迎登陆中企经济网
   

新人限时福利

1.5台6000D跑赢一台B300!——不止 “能跑起来”:Meta-Infer 软件优化解锁长尾硬件推理性能
2026-09-25 20:47:46 来源: 浏览:20次

随着大模型对算力需求持续攀升,GPU 卡的采购成本、供给约束持续加剧。AI 推理的竞争正在悄然发生转向:不再单纯比拼 “谁能够买到性能最顶级的硬件”,而是转向 “谁可以把手中已有的算力资源用得更值”。很多GPU卡,开源框架能够完成模型加载、权重下载、服务拉起,实现 “能跑起来”,但实际压测性能往往远低于官方宣传水平。模型本身没有缺陷,硬件也可正常工作,性能损失的核心,来自模型框架与硬件之间存在的性能鸿沟。

这类GPU卡没有高速卡间互联,同时不在主流开源框架官方验证矩阵中。直接使用社区默认部署方案,会出现算子自动回退至低效通用实现、集合通信沿用 NVLink 硬件的调优参数、显存与并行配置沿用其他硬件默认值等一系列问题。硬件本身具备的算力潜力,被软件层的适配短板所禁锢。

是石科技(METASTONE)是一家定位为“独立第三方全栈算力运营商”的科技企业。 不绑定任何特定大模型厂商,致力于为客户提供涵盖硬件、组网、调度、优化与运营的一站式全栈算力交付服务。凭借源自国家级计算中心的丰富经验,公司确保了算力集群高达99.95%以上的安全稳定运行(SLA)。目前,是石科技已纳管超过20000P的算力资源,运营10多个智算中心,拥有2个国家级超算中心。团队成员曾荣获3项戈登·贝尔奖,具备深厚的超大规模集群全栈技术服务实力等。

是石科技自研Meta-Infer 高效推理引擎,是面向异构加速芯片的企业级高性能大模型推理引擎,尝试通过纯软件优化手段弥合这道硬件-框架之间的缝隙,在不改动模型结构、不修改任务语义的前提下,充分挖掘GPU卡架构硬件的推理能力,为行业提供一种可能性:依靠软件优化,成本更低的GPU卡,有机会在部分推理业务指标上,逼近原本需要更高端 GPU 才能实现的服务能力。

Meta-Infer 高效推理引擎整套优化逻辑分为两大关键阶段:算模协同,释放被硬件差异屏蔽的高性能路径;通算重构,打通瓶颈,充分榨干硬件资源;最终沉淀为Meta-Infer 高效推理引擎的四项核心能力:内核补齐、算子优化与通信重构、并行与容量调优、缓存复用。

  1. 内核补齐:

主流推理框架内置了大量高性能算子,但对于不在官方验证清单的长尾硬件,框架不会报错,只会静默绕开加速路径,降级运行低效通用逻辑。很多高性能内核并非缺失,只是元数据、页尺寸、硬件内核适配不匹配,导致无法被触发执行。Meta-Infer 高效推理引擎通过内核补齐完成适配修复:对齐硬件与框架之间的元数据定义,修正页尺寸配置,解锁原生高性能算子路径;替换不适配硬件的老旧计算内核,切换为面向目标硬件深度调优的实现;扩大通信快路径的生效阈值,让更多规模的通信任务避开慢速回退逻辑。

1png.png

以 DeepSeek-V4.1Flash 为例,在 8 张 PCIe-Only 显卡环境的社区 Day0 基线版本中,输入吞吐仅 1932 tok/s。经过算模协同阶段的修复适配,补齐 sparse-MLA Prefill 快路径,替换 FP8 稠密 GEMM 慢内核,扩大 PCIe-IPC 通信快路径覆盖范围,吞吐直接提升至 5850 tok/s。这一阶段的提升,并不是创造全新算法,而是把硬件与框架本就具备、却被适配问题锁住的性能释放出来。

2.png

3.png

同样的思路也复现在 DeepSeek-V4-Flash、GLM5.3 等模型上:修正注意力头补齐的冗余计算,对 KV 缓存标记逻辑做向量化加速,适配硬件特性重构算子拆分逻辑,拓展 CUDA 计算图覆盖范围,让更多请求批次可以进入加速图执行。仅仅完成算模协同,多款模型就拿到 20%-33% 不等的吞吐增益。

完成硬件适配、解锁加速路径之后,性能瓶颈会进一步转移到通信开销、并行调度、显存分配、重复计算等环节。PCIe-Only 架构卡间通信带宽远低于 NVLink,如果直接套用面向高速互联硬件的默认策略,GPU 会大量时间等待通信完成,算力资源被闲置浪费。

  1. 算子优化与通信重构:

依托算子优化与通信重构,Meta-Infer 高效推理引擎对注意力、投影等关键算子做算子融合,压缩单步计算耗时;将计算任务和集合通信做时间重叠掩盖,把统计类计算嵌入通信间隙并行执行;改写集合通信逻辑适配 PCIe 带宽特性,降低消息传输带来的等待开销。

  1. 并行与容量调优:

在此基础上开展并行与容量调优,放弃框架全局固化的并行参数,针对 Prefill 预填充、Decode 生成不同运行阶段差异化配置张量并行、上下文并行策略;结合硬件显存特性,动态调整静态显存占比、KV 缓存容量参数,规避显存溢出与算子回退;面向不同业务负载,灵活匹配流水线、张量并行的组合形态,让高并发短请求、超长上下文请求都可以拿到最优执行配置。

  1. 缓存复用:

面向长文本、视频生成场景,缓存复用能力提供风险感知的缓存复用机制,根据实时生成状态动态判断缓存复用与刷新时机,在不牺牲输出质量的前提下削减重复计算与显存读写。

在 DeepSeek-V4.1-Flash 的实践中,完成算模协同之后,经过通算重构的全套调优:注意力算子融合、合理裁剪投机解码草稿长度、计算通信重叠、区分 Prefill/Decode 并行策略、重新调校显存容量参数,输入吞吐从 5850 tok/s 进一步提升至 13274 tok/s,整体实现6.87 倍吞吐提升,并且支持 1M 超长上下文。

这套方法论具备通用性,覆盖文本大模型、长上下文、视频生成多类任务:

DeepSeek-V4-Flash:经过全套优化输入吞吐从 14546 tok/s 提升至 22584 tok/s,提升 1.55 倍;

GLM5.3:输入吞吐自 3236.78 tok/s 提升至 6222.72 tok/s,提升 1.92 倍;P95 首 Token 时延从 141.6 秒下降至 46.6 秒,上下文支持上限从 27 万 Token 拓展到 105 万 Token;

在相同并发点配对比较下,B300 的输入吞吐约为这台 8 卡整机的 4.9–5.6 倍(DeepSeek-V4-Flash,B300 侧按 SGLang cookbook 推荐参数配置,C8 输入 33,937 / C256 60,486 tok/s),GLM-5.3 ¹ 上这一比值为 3.5–4.7 倍(B300 侧 C8 输入 16,384 / C64 23,503 tok/s)。

MiniMax H3 视频生成模型:依托稀疏注意力、自研风险感知缓存复用、Turbo LoRA 多手段组合,15 秒参考图生视频端到端生成速度提升 2.48 倍,峰值显存与原始稠密基线保持持平。

4.png

单机 8 卡整机配置,文生视频最高吞吐达到基线的 5.33 倍,参考图生视频达到基线的4.98倍,在不明显损失画质的前提下大幅缩短视频生成耗时。

5.png

把这组整机吞吐放到顶级 GPU 的同一把标尺上,差距比直觉更小:在统一整机口径下(单机 8 卡、5 秒 / 768P / 16:9),文生视频 296 条/时、参考图生视频 131 条/时,对应 B300 的 439 条/时、225 条/时,分别约为其 67% 和 58%(B300 侧按 SGLang cookbook 推荐参数配置,取 16 实例、每实例 Inflight=1 的最优档;其中文生视频对照的是 B300 的 FL2VA 结果)。

如果进一步按整机吞吐折算,在几乎无损的 Ours Cache 方案下,约 2.6 台 6000D 可对应 1 台 B300 的文生视频吞吐,参考图生视频约为 2.9 台;在 Ours Cache + LoRA 方案下,这一比例进一步缩小到约 1.5 台 和 1.7 台。

硬件本身没有变化,性能差距的缩小主要来自软件栈、缓存策略与模型优化方式的组合。

 

国产GPU卡:同一套方法论同样成立

Meta-Infer 高效推理引擎在国产 GPU 上完成了验证。国产 GPU 往往也不在主流框架的官方验证矩阵内,因此需要针对具体硬件重新梳理执行路径。例如,注意力模块需要显式启用面向该平台优化的 NSA 稀疏注意力实现,避免回退到低效路径;Shared Expert 融合等默认面向 NVIDIA/AMD 平台的特性则需要关闭,以绕开不适配实现。通信策略也需要根据推理阶段分别配置,Prefill 采用偏吞吐优化的 DeepEP normal 模式,Decode 采用偏时延优化的 low_latency 模式,并将 Shared Expert 与 Routed Expert 拆分到两条 stream 中并行提交,以进一步与集合通信重叠。

其中,仅将 Shared Expert 与 Routed Expert 改为并行提交,就在 35 组同配置配对测试中带来了 11.26% 的吞吐提升。这说明对于国产算力而言,“能跑起来”同样只是第一步。通过针对执行路径、通信模式和并行策略进行系统适配,仍可以进一步释放硬件的实际推理性能,使其更接近规模化生产服务所需的性能水平。

长尾硬件的新思路:“能跑起来” 不是终点

全部优化工作均收敛在Meta-Infer 高效推理引擎内部,全程无需改动模型权重与模型结构,不改变原有业务任务语义。

对于开源社区大量不在官方验证矩阵内的长尾硬件,行业过往现状往往是:新模型发布,权重可以下载、服务可以拉起,做到 “能跑起来”,工作就宣告结束。但这套实践证明,“能跑” 和 “可用、可规模化对外提供生产服务” 之间,还存在巨大的软件优化空间。

硬件供给存在约束、高端算力成本居高不下的大背景下,Meta-Infer 高效推理引擎代表了一条新路线——不必一味追逐最顶级硬件,通过内核补齐、算子通信重构、并行容量调优、缓存复用这套软件体系,充分挖掘现有 PCIe 架构硬件与国产加速卡的潜力。

这为大模型推理业务带来一种值得关注的可能性:借助深度软件优化,成本更友好的 PCIe GPU,有机会在部分推理业务指标上向更高端硬件的服务能力靠拢。硬件的上限由芯片决定,但硬件能实际发挥出多少能力,则由软件决定。

¹ 无损 NVFP4 量化版本:模型权重以 NVFP4 部署,保持既有模型计算定义,未引入额外精度损失。

Tags:1.5 6000D B300 不止 能跑 起来 Meta-Infer 软件 化解 硬件 推理 性能 发布者:Anita
【打印】 【繁体】【投稿】【收藏】 【推荐】【举报】【评论】 【关闭】 【返回顶部】
上一篇:良心揭露柿饼市场惊天骗局!亲赴产地,发现富平柿饼真相! 下一篇:神州控股科捷发布人机共舞5.0“擎..
热门推荐

推荐文章

图片主题

热门文章

最新文章

相关文章