一、曙光8000是什么?

2026年7月10日,中科曙光在光合组织2026智能计算应用大会上宣布:中国首个全国产十万卡AI超集群——曙光8000(登峰)正式落成,并同步接入国家超算互联网。7月17日WAIC 2026开幕首日,曙光8000真机迎来全球首展,获评大会"镇馆之宝"

这是中国AI算力基础设施从万卡级迈向十万卡级的历史性跨越。在此之前,全球十万卡以上规模的AI超集群仅有美国Meta、xAI等少数企业部署,且全部基于英伟达GPU。曙光8000是全球首个采用全链路全国产化方案实现的十万卡AI超集群。

核心数据:
规模:十万卡(全球首个全国产)
上线:7月9日正式上线,7月10日宣布落成
首周运行:日均15万+作业,峰值单日50万+作业
应用适配:近千项超智融合应用,300+项核心优化
WAIC荣誉:镇馆之宝

二、为什么"十万卡"不是简单的数量叠加

很多人对"十万卡"的第一反应是:不就是多装了些GPU吗?实际上,从万卡到十万卡,远不是"加更多服务器"这么简单。

1. 互连瓶颈是十万卡集群最核心的技术挑战。万卡集群中,GPU之间的数据通信延迟还可以控制在毫秒级。但十万卡规模下,数据需要在10万个计算节点之间高速流转,任何互连瓶颈都会导致训练效率急剧下降。这就像城市交通——10辆车可以随便跑,但10万辆车同时出行就必须有高速公路网和智能调度系统。

2. 存储瓶颈同样严峻。大模型训练需要持续吞吐海量训练数据,十万卡规模下的数据读写带宽需求是万卡集群的10倍以上。如果没有高效的分布式存储系统,GPU会长时间处于"等数据"的饥饿状态。

3. 散热与能效挑战巨大。十万卡集群的功耗可达数兆瓦级,传统风冷散热完全无法支撑。必须采用液冷等新型散热方案,否则芯片会在高温下频繁降频甚至损坏。

4. 智能调度是十万卡集群"能用好"的关键。不同任务对计算精度、内存带宽、互连延迟的需求完全不同。如果调度系统不够智能,十万卡集群很可能只发挥了万卡集群的效率。

三、曙光8000的技术架构解析

3.1 超智融合:告别"分区隔离"模式

传统超集群采用分区隔离方式:科学计算专区用FP64高精度、AI训练专区用FP16低精度,两类任务各占一部分硬件、互不干扰。但这种方式导致硬件利用率低——科学计算区空闲时AI训练区也无法借用其算力。

曙光8000采用超智融合技术路线,原生支持FP64到INT8全精度计算。同一硬件平台可以同时承载科学计算与AI训练推理两类负载,根据任务需求动态调配精度模式。这意味着:

- 科学计算(天气预报、量子模拟、天文计算)需要FP64 → 不需要专用硬件区
- 大模型训练需要FP16/BF16 → 同一套硬件,切换精度即可
- AI推理需要INT8 → 同样一套硬件,按需降精度
- 工业仿真需要混合精度 → 一台机器同时处理多种精度

超智融合的核心价值是硬件利用率最大化——不再有"这个区空着那个区排队"的资源浪费。

3.2 scaleFabric:自研十万卡互连网络

曙光8000采用自研scaleFabric类IB原生RDMA高速互连技术实现十万卡规模稳定互连。RDMA(Remote Direct Memory Access)允许GPU直接读写远端GPU的内存,无需经过CPU中转,大幅降低数据传输延迟。

scaleFabric的关键技术特点:

- 类IB架构:参考InfiniBand的设计理念,但完全自研实现,不依赖国外IB网络设备
- 原生RDMA:从硬件层面直接支持RDMA,而非软件模拟,延迟和吞吐量接近IB水平
- 400G无损高速:单链路带宽400Gbps,支持无损传输(不丢包),这对大规模分布式训练至关重要
- 十万卡稳定互连:在十万卡规模下维持稳定低延迟,这是全球公认最困难的互连挑战

scaleFabric的发布时间(2026年3月)远早于曙光8000落成,说明中科曙光在互连网络上的布局至少提前了半年以上。这个时间差暗示:十万卡集群的核心技术难点不在芯片本身,而在互连网络

3.3 全链路国产化:芯片到服务的七层闭环

曙光8000的"全国产"不是简单的"用国产GPU代替英伟达GPU",而是实现了从芯片到服务的七层全链路自研

层级国产方案替代对象
芯片海光等国产GPU英伟达H100/B200
计算自研高密度机柜(密度提升20倍)传统服务器堆叠
存储ParaStor分布式存储国外并行文件系统
网络scaleFabric RDMA互连英伟达InfiniBand
散热浸没式相变液冷 + 国产冷媒传统风冷
应用近千项超智融合应用适配-
服务Gridview超大集群管控 + 超算互联网接入-

其中最值得关注的是浸没式相变液冷技术。传统数据中心风冷散热功率密度上限约5kW/机柜,而曙光8000的高密度机柜功耗可达MW级(兆瓦级,即1000kW+),风冷完全无法应对。浸没式相变液冷将整个机柜浸泡在专用冷却液中,通过液体的相变(蒸发→冷凝循环)带走热量,散热效率比风冷提升数十倍。采用国产冷媒和全年自然冷却进一步降低了散热能耗。

四、首周满载:数据验证"用得好"

曙光8000上线首周即实现满载运行,日均处理作业数突破15万个,单日峰值超过50万个。这个数据远超预期。

为什么"满载"比"建得成"更重要?

1. 证明国产算力不是摆设。过去国产超算最大的质疑不是"能不能建",而是"建了有没有人用"。曙光8000上线一周就被挤爆,说明国产算力的需求是真实且旺盛的。
2. 证明调度系统能撑住十万卡规模。日均15万作业意味着调度系统每天要处理15万次任务分配、资源回收、数据搬迁。如果调度系统不行,十万卡集群只会是"有算力但没人能用"。
3. 证明应用生态已经成熟。曙光8000已完成近千项应用适配,覆盖大模型训练、高通量推理、科学计算等20余个科研和产业领域,超过70项应用实现万卡规模扩展。这不是"能跑几个demo",而是真正的产业化应用。

五、曙光8000的应用场景

曙光8000覆盖的应用领域远超单纯的"AI训练",这正是超智融合架构的价值:

1. 大模型训练与推理——万卡级规模的大模型训练是曙光8000最核心的场景。Kimi K3、DeepSeek V3等国产大模型的训练都需要万卡以上算力支撑。
2. 科学计算——天气预报、量子计算模拟、天文数据处理、新材料研发等FP64高精度科学计算场景。
3. 工业仿真——汽车碰撞仿真、飞行器设计、半导体工艺模拟等混合精度工业应用。
4. 机器人与具身智能——机器人运动控制、多模态感知训练等新兴场景。
5. 创新药研发——分子动力学模拟、药物靶点筛选等生物医学计算。

超智融合架构的意义在于:一套硬件服务多种场景,不再需要为每个场景单独建设专用集群。这对国家超算互联网的运营效率至关重要。

六、曙光8000对行业的深远影响

6.1 对国产算力产业链的影响

曙光8000的"全链路国产化"证明了一个关键事实:国产AI算力不再需要依赖英伟达。从芯片(海光)到网络(scaleFabric)到存储(ParaStor)到散热(浸没式液冷),每一层都有成熟的国产替代方案。

这个证明对产业链的影响是深远的:

- 国产GPU厂商(海光、沐曦、摩尔线程、燧原)获得了大规模真实部署验证,不再是"实验室产品"
- 国产互连网络(scaleFabric)证明了在十万卡规模下可以替代InfiniBand,打破了英伟达在网络层的垄断
- 国产液冷方案证明了MW级散热可行,为下一代更大规模集群铺平道路

6.2 对国家算力战略的影响

曙光8000已接入国家超算互联网全国一体化算力网,这意味着:

- 全国科研机构和企业可以通过超算互联网按需调用曙光8000的算力
- 算力不再是少数大公司的私有资源,而是公共基础设施
- 国家可以统一调度算力资源,避免"有算力闲置、缺算力排队"的浪费

这个模式与美国Meta/xAI的"私有十万卡集群"模式截然不同。美国的十万卡算力集中在大公司内部,而中国的十万卡算力通过超算互联网面向全社会开放。这可能是中美算力基础设施的根本差异。

6.3 对全球AI竞争格局的影响

曙光8000与Kimi K3在同一天(7月17日WAIC开幕日)亮相,形成了有趣的叙事对照:

- Kimi K3证明了中国开源模型在性能上可以超越美国闭源模型
- 曙光8000证明了中国算力基础设施在规模上可以与美国对齐,且采用完全不同的国产化路线

两者叠加,正在构建一个新的叙事:中国AI不仅在模型层追赶,在算力层同样可以自主。当模型和算力都不需要依赖美国时,AI产业的底层逻辑将发生根本性变化。

七、曙光8000的局限与挑战

客观来看,曙光8000面临以下挑战:

1. 单卡性能仍落后于英伟达旗舰。海光GPU的单卡算力(FP16/BF16训练性能)仍低于英伟达H100/B200。十万卡集群的总算力取决于单卡性能和互连效率的乘积——互连可以自研,但单卡性能差距仍然存在。
2. 软件生态成熟度。英伟达的CUDA生态已有十多年积累,国产GPU的软件栈(海光的DTK、沐曦的MXMACA等)仍在追赶。开发者从CUDA迁移到国产平台需要适配成本。
3. 从十万卡到百万卡的扩展性。十万卡已经验证,但美国xAI正在规划二十万卡乃至百万卡集群。曙光8000的scaleFabric能否在更大规模下保持稳定,还需要持续验证。
4. 商业可持续性。曙光8000首周满载是好事,但长期来看,能否持续吸引足够多的用户、实现商业闭环,才是决定其能否持续迭代的关键。

八、总结:国产算力的里程碑

曙光8000的落成和满载运行,标志着中国AI算力基础设施完成了三步跨越:

第一步:从"依赖进口"到"全链路国产"。芯片、网络、存储、散热、管控,每一层都有自主可控的替代方案。
第二步:从"万卡级"到"十万卡级"。规模不再是瓶颈,互连和调度才是核心技术难点。
第三步:从"建得成"到"用得好"。首周满载、日均15万作业、千项应用适配,证明国产算力不是摆设。

曙光8000不是一个终点,而是国产算力从"追赶者"走向"成熟方案"的起点。当万卡集群已经可以稳定服务千项应用时,十万卡集群的未来想象空间是:支撑下一代万亿参数大模型训练、赋能全国科研机构按需调用算力、让AI算力真正成为像电力一样的基础设施。

这一天可能不会太远。