发布时间:2026-08-04 09:21 来源:新吴区人民政府 选择阅读字号:[ 大 中 小 ]
2026年7月,美国旧金山Moscone中心,AMD Advancing AI 2026全球开发者大会现场,近千名开发者正在同步进行智能体AI、多模态应用、生成式AI、GPU编程和AI应用开发实操。让人想不到的是,他们使用的全部算力,并非来自美国本地机房,而是来自一万公里外无锡高新区企业构建的一座智算机房,它就是新威智算千卡集群。
半年前的2025年12月26日,全球首个基于AMD Radeon的开源生态智算中心——新威智算中心在位于无锡高新区的无锡(国家)软件园点亮,一期建成5000张AMD Radeon PRO W7900D GPU。当时人们并不太清楚这个算力中心有什么作用。半年后,它用一场硬核的跨国实战证明了自己。
跨四道坎,达成硬指标
跨国送算力,听着新鲜,做起来全是难题。大会Workshop面向全球开发者,网络环境参差不齐,卡顿、掉线都会被现场“抓包”。技术团队锁定了四道必须跨过去的坎——跨洋不能卡:全球各地同时接入,网络延迟要低到人眼看不出停顿;千卡随要随到:1024张GPU动态分配,多个任务同时跑不能“打架”;模型秒级下载:开发者直连Hugging Face、Docker Hub上的大模型,跨国下载不能等;出故障分钟级恢复:主集群要是出故障,备集群得立马顶上。
这些硬指标怎么达成?靠的是一套扎实的算力“家底”和极限备战。新威智算构建了一套高可靠的“算力堡垒”:128节点的双集群架构,配合25G RoCE无损网络、2PB全闪存储,以及基于K8s深度调优的调度系统。
反复演练,换来零故障
大会开幕前三天,团队进入最后冲刺——四轮极限压测、五次全盘故障演练。调度有延迟?连夜调参数,最终实现GPU秒级响应。跨国拉模型卡顿?搭建本地缓存仓库,主流大模型下载提速到20秒以内。存储有瓶颈?反复调整,写入带宽稳定突破200Gbps。容灾切换?练到2分钟内完成故障恢复。
7月22日至23日,大会举行的两天时间里,母公司云工场科技和新威智算技术团队24小时轮值,交出的最终成绩单相当硬核:累计完成1159次开发环境启动,覆盖超过900名活跃开发者,核心服务可用性100%,全程零故障、零中断。
扎根无锡,服务全世界
新威智算的千卡集群并非第一次“出征”。在此之前,它已支撑过全球ASC超算竞赛、AI DevMaster、Lablab Hackathon等10多项国际活动,服务过超5000名注册开发者。
“这套算力能这么快跑起来,离不开无锡高新区的产业土壤。”作为全球首个AMD ROCm开源生态智算中心,它的落地本身就是无锡高新区与全球半导体巨头深度合作的重要成果。据介绍,新威智算中心依托AMD ROCm开源体系,面向人工智能推理、AI Agent、科学计算、图形渲染等多类场景,提供高效、灵活的算力服务。无锡高新区近年来全力推进“All in AI”,为这类算力基础设施的应用提供了丰富的场景。
新威智算总经理季黎俊在智算中心点亮时就说过:“我们希望证明开源生态同样可以支撑起高性能、高可靠的AI生产力。”这场横跨太平洋的算力实战,给出了响亮的回答。
来源:无锡日报