无问芯穹发布Agentic Infra战略:跨越计算规模将扩展至十万卡级

摘要

7月24日,无问芯穹首次公布Agentic Infra“前店后厂一中心”战略布局,涵盖算力集散中心、Token工厂和AI生产力商店三大核心产品体系。该体系立足基础设施,通过跨域算力聚合技术(超远距离、多数据中心、混合云)实现资源高效调度,已部署超37,000P算力,覆盖16种芯片。针对强化学习场景,系统优化跨域通信效率3-4倍,实现训练连续一周0中断。联合创始人夏立雪表示,未来将把跨域计算资源支撑规模扩展至十万卡级以上,支撑下一代Agentic AI在线进化。

战略发布:Agentic Infra三大核心产品体系

7月24日下午消息,无问芯穹首次公布Agentic Infra的“前店后厂一中心”战略布局,涵盖三大核心技术与产品服务体系:一是“算力集散中心”,即Agentic Infra自主式基础设施平台;二是“Token工厂”,即Agentic MaaS大模型服务平台;三是“AI生产力商店”,即Agentic Infra行业解决方案。该体系立足基础设施,向下汇聚能源和芯片,向上支撑模型和应用,不仅可极致提升底层资源向AI生产力转化的规模和效率,更具备Agentic AI时代的AI原生能力——用基础设施智能体蜂群赋能资源规模扩展、提效Token生产,并支持Agentic AI的持续进化。

跨域算力聚合实践:三种场景验证

算力集散中心能够把散落的、异构的算力资源统一汇聚、弹性调度、按需分发,为模型与应用层筑牢充足、稳定、可扩展的算力底座。该系统已通过三大类跨域算力聚合训练实践的生产级考验:第一,超远距离聚合。无问芯穹联合中国电信,完成国内首例超4000公里距离的大模型跨域混训,在新疆哈密与广东深圳两地集群间实现联合训练性能提升165%。第二,多数据中心聚合。打通4个不同代际、不同型号的GPU集群,联合训练近百亿参数大模型,四集群协同性能提升41%,有效盘活了不同批次的存量异构算力。第三,混合云算力聚合。实现本地私有集群与公有云算力的安全互通混训,整体性能提升68%,帮助企业客户解决本地算力不足、云上资源却闲置的错配痛点。

系统部署规模与技术优势

目前,这套跨域训练系统已在全国部署触达超37,000P算力、覆盖16种主流芯片,盘活了广域分散的异质算力,使之成为Agentic AI时代的最坚实底座。针对跨域强化学习场景,无问芯穹从网络、平台到框架做一体化深度优化,打通分散的异构集群,实现全局资源一盘棋调度。通过优化计算通信重叠技术,让跨域通信效率直接提升3-4倍,实现通信开销100%全掩盖;同时搭建了故障无感的训练机制,实现了跨域强化学习训练连续一周0中断稳定运行。

未来展望:扩展至十万卡级

无问芯穹联合创始人兼CEO夏立雪表示,伴随着大规模跨集群强化学习训练技术的持续成熟突破,无问芯穹还将持续深耕并行策略、通信融合、智能算子、极致容错等核心技术,“未来,我们能够将跨域计算资源的支撑规模,持续拓展至十万卡级以上,支撑下一代Agentic AI的在线进化”。

欢迎关注ZZZ新闻资讯网,指尖轻点,瞬间洞悉世间万象。
返回首页