欢迎登陆中企经济网
   

新人限时福利

中国移动新一代大模型异构混合推理系统亮相2026算力大会
2026-09-12 14:31:31 来源: 浏览:24

——国产GPU+类脑芯片架构创新,为AI推理提供自主可控新底座

2026中国算力大会“算力首创首发发布会”专场上,由移动云公司联合中国电子科技南湖研究院、北京灵汐科技、上海天数智芯、清华大学、北京大学共同打造的国内首个国产GPU+类脑芯片大模型异构混合推理系统正式发布。该系统通过全栈架构创新,让国产芯片也能高效支撑大模型推理,为国内大模型、多智能体应用提供一条自主可控的新算力路径。

 

大模型推理进入爆发期,传统架构遭遇双重瓶颈

随着人工智能产业重心从模型训练转向规模化推理服务,推理算力已经成为支撑Token工厂、AI智能体、文生视频等业务的新型数字基础设施。大模型并发服务对吞吐量、能耗成本提出极高要求,传统单一GPU推理架构越来越吃力。一方面,数据频繁搬运会带来“内存墙”和“功耗墙”;另一方面,国内先进芯片制程供给受限,单纯靠硬件工艺升级提升算力,空间有限。行业需要跳出“只追先进制程”的思路,从系统架构层面寻找新解法。

国产GPU与类脑芯片分工,混合推理技术实现突破

项目团队从系统架构创新入手,首次将国产通用GPU与类脑芯片深度融合,打造对标英伟达下一代国际先进异构推理方案的国产化系统。创新实现Transformer模型PD/AF分离推理模式:将Attention(注意力)计算与FFN(前馈网络)模块拆分,由不同特性的国产芯片分工处理。Attention计算交由国产GPU承载,FFN模块交由类脑芯片处理,充分发挥类脑芯片存算一体、片上大容量SRAM的架构优势,突破传统GPU推理的固有瓶颈。

同时,团队自研模型编译器、高速互联协议和统一推理引擎,实现两类算力的任务拆解、协同调度、结果聚合,真正实现两种架构算力优势互补。项目已在Deepseek V4 Flash 大模型上完成完整调优验证,相较同类国产GPU算力集群,推理输出和能效均提升1倍以上、业务运营成本降低40%以上。

这意味着,依托国内成熟工艺的国产芯片,通过系统架构创新,可以实现对标国际下一代推理架构的业务能力,为大模型推理国产化落地提供可复制的技术范式。

 

产学研协同共建,面向多场景推进落地开放

该成果是产学研用协同创新的典型实践,整合运营商、芯片企业、科研院所、高校多方力量,打通从底层芯片适配、推理引擎开发到业务场景验证的完整链条。后续团队将持续迭代异构推理系统,面向Token工厂、AI代码开发、文生视频、多智能体协同、智能制造、金融通信安全等场景开展落地验证,并计划将核心异构推理框架逐步开放,赋能国内GPU、类脑芯片厂商及算力运营商,带动国产算力产业链整体发展。

本次异构混合推理系统在中国算力大会首发,为智能体时代的AI推理提供国产化全新算力底座。以架构创新弥补工艺约束,这一方案也为国内AI算力自主发展提供重要的创新参考方向。

Tags: 发布者:Anita
打印繁体】【投稿】【收藏】 【推荐】【举报】【评论】 【关闭】 【返回顶部
上一篇良心揭露柿饼市场惊天骗局!亲赴产地,发现富平柿饼真相! 下一篇从服贸会看生物经济 “新质生产力..
热门推荐

推荐文章

图片主题

热门文章

最新文章

相关文章