
算力、GPU、AI服务器详解
算力不是单一数字
一份内部培训课件里的智算中心选型真相
一份 50 页的内部培训资料和一份英伟达速查表,把智算中心最核心的选型逻辑摊开了讲。
它不是给销售看的 PPT,而是给一线工程师和采购决策者看的"避坑手册"。
核心判断
算力不是单一数字,而是精度、稠密/稀疏、互联带宽、功耗和场景的组合决策。脱离使用场景谈 TFLOPS,只会买到"看起来很大"的算力。
内部培训资料《算力、GPU、AI服务器详解》、英伟达速查表【文末附资源下载地址】




01
市场规模滚烫,但口径必须分清
中国智算市场 776亿 → 23930亿
在"智算中心"“新基建”"东数西算"等政策推动下,算力已经成为新的基础设施。
中国智算市场规模从 2020 年的 776 亿元,增长到 2023 年的 5097 亿元,预计 2028 年达到 23930 亿元,CAGR 33.9%。中国智能算力规模从 2020 年的 75 EFlops/年,预计增长到 2027 年的 1117.4 EFlops/年,CAGR 46.3%。
但市场越热,口径越要冷静。

信通院把算力分为基础算力(CPU)、智能算力(GPU/FPGA/ASIC 等)和超算算力(HPC)。AI 场景通常默认 FP16,超算默认 FP64,部分统计会统一换算为 FP32。不同口径下的数字不能直接比较。
更隐蔽的是精度。FP16、FP32、FP64、TF32、BF16 的位数和偏移量不同,直接决定了同等 TFLOPS 背后的实际有效算力。培训资料用 IEEE 754 标准把 FP32 的转换过程拆到了二进制位——不是为了炫技,而是为了说明: marketing 的 TFLOPS 和 engineering 的 TFLOPS,可能是两个数。
02
芯片选型没有通解
GPU、FPGA、ASIC 与国产路线
AI 芯片按定制化程度可以分为四条路线。
GPU 通用性最强,适合大规模并行计算,设计和制造工艺成熟,是当前大模型训练的主流。FPGA 半定制化,可通过编译灵活配置架构,平均性能较高、功耗较低,但编程门槛高、量产单价高。ASIC 全定制化,量产后成本最低、能效最高,但研发周期长、前期投入大、算法固化后难以迭代。类脑芯片功耗低、认知能力强,但技术成熟度最差。

英伟达把 GPU 按应用场景分为三类:GeForce 消费卡面向游戏,Quadro 专业卡面向设计和虚拟化,Tesla/Ampere/Hopper 企业级卡面向深度学习和高性能计算。
在 AI 训练场景,A100 FP16 稠密算力约 312 TFLOPS,H100 约 989 TFLOPS。国产芯片也在快速追赶:华为昇腾 910B 约 376T,天数智芯天垓 150 约 190T,沐曦曦云 C500 约 375T。
但单卡算力只是起点,不是终点。
03
服务器形态决定训练上限
PCIe 机型 vs NVLink/SXM 机型
同样是 8 卡 GPU 服务器,形态不同,训练能力天差地别。
PCIe 机型是常规服务器,GPU 通过 PCIe 链路通信。PCIe 5.0 x16 双向带宽约 128GB/s。对于大模型训练,卡间通信带宽是瓶颈,PCIe 机型通常只能满足推理或微调。
NVLink 机型(也叫 SXM 机型)在服务器内部通过 NVLink 链路互联。H100 每个 GPU 有 18 条 NVLink,双向带宽达 900GB/s,是 PCIe 的 7-10 倍。这才是大模型训练的标配。

NVLink 机型的核心是英伟达 HGX 模组。HGX H100 把 8 张 H100 SXM 加上 NVSwitch 整合成一个逻辑上的"大 GPU",整机通常 6U 或 8U。DGX H100 是英伟达官方整机,DGX POD 是以 DGX 为核心的集群方案,DGX GH200 则是由 Grace Hopper 超级芯片驱动的超级计算机。
到了 NVL72,英伟达把 72 块 B200 通过 9 个 NVLink Switch 互联为一个逻辑 GPU。每个 B200 有 18 个 NVLink Port,72×18=1296 个 Port;每个 Switch Tray 有 2 颗 NVLink Switch 芯片,每颗 72 个接口,共 144 个接口;1296÷144=9,正好用 9 台 Switch 实现全互联。
这个设计已经不叫"服务器",叫"单机柜算力单元"。
04
智算中心是系统工程
网络、存储、液冷与调度
智算中心不是简单堆 GPU。它至少包括四层:基础设施层(计算、存储、网络、IDC)、平台管理层(算力调度、池化、运管)、大模型开发平台层(框架、训练、推理、优化)、行业应用层。
千卡、万卡级别的超大规模组网,对网络提出四个要求:200-400Gb 超高带宽、2-5μs 超低时延及抖动、冗余设计保证稳定性、自动部署和诊断。

主流网络方案有三条:InfiniBand 高性能低延迟但成本高;RoCE 高吞吐低延迟、性价比高;以太网通用性强、适用性广。不同场景要选不同网络。
同时,单机柜功耗从 6-10kW 的推理型,到 10-60kW 的训练型,再到液冷整机柜,散热和供电已经成为智算中心选址和设计的核心变量。
落地步骤:3个选型动作
先定场景再定精度
训练看 FP16 稠密算力和 NVLink 带宽,推理看延迟、功耗和成本
区分营销算力与工程算力
同一张卡有标准算力、Tensor Core 加速算力、稀疏矩阵加速算力三个数值,合同要写明口径
把互联带宽纳入核心指标
大模型训练必须选 NVLink/SXM 机型,PCIe 机型只适合做推理或微调
算力中心建设正在从"堆卡"走向"系统工程"。
单卡 TFLOPS 决定你能跑什么模型,互联带宽决定你能跑多大规模,网络、存储、液冷和调度决定你能跑得多稳定。

这份 50 页的培训资料最值钱的地方,不是某一张表的数字,而是反复强调的口径意识:同样的"1P 算力",在不同精度、不同互联、不同场景下,完全是两回事。
你的算力采购清单里,有没有"互联带宽"这一项? 当所有人都盯着 TFLOPS 的时候,真正决定项目成败的,往往是那些被混用的口径和被忽略的工程细节。


点击下载PDF版本
更多内容,可访问
往期推荐