
GPU & Systems
GPU 与整机
面向技术、采购和项目团队解析 NVIDIA GPU、GPU 服务器、Jetson、AI 工作站与整机平台的定位、规格边界、部署条件和适用场景。
栏目文章
NVIDIA GPU、GPU 服务器、Jetson、工作站与整机产品解析
H100 与 H200 GPU 服务器怎么选:显存、互联与网络条件
比较 NVIDIA H100 与 H200 在显存需求、服务器平台、GPU 互联、网络、供电散热和软件基线方面的选型条件。
阅读全文
Jetson、AI 工作站与 GPU 服务器:开发和生产环境如何分工
从边缘部署、交互式开发、集中训练和生产推理四类业务出发,说明 Jetson、AI 工作站与 GPU 服务器的能力边界和协同方式。
阅读全文常见问题
围绕训练、推理、服务器形态与边缘部署,补充常见选型判断。
训练 GPU 和推理 GPU 能否直接按算力高低选择?
不能。至少需要同时比较业务精度、显存容量与带宽、卡间通信、时延或吞吐目标、服务器供电散热以及驱动和框架支持,峰值算力只是一项参考。
MGX 是一种 GPU 接口或单一服务器型号吗?
不是。MGX 是模块化服务器参考架构,具体 GPU、CPU、网络、存储、供电和散热能力取决于服务器厂商最终产品及其认证配置。
Jetson 可以直接替代 GPU 服务器吗?
通常不能直接替代。Jetson 面向边缘推理和设备侧处理,GPU 服务器面向集中训练、共享推理和规模化资源管理,两者更适合形成训练中心与边缘部署的协同关系。
H200 是否在所有训练和推理任务中都比 H100 更合适?
不是。H200 更大的显存和更高的显存带宽对容量或带宽受限任务更有价值;计算、网络、存储或软件先成为瓶颈时,应通过代表性作业测试后再决定升级范围。
网卡和 GPU 在同一个 NUMA 节点就一定能获得最优 GPUDirect RDMA 性能吗?
不一定。同一 NUMA 只是重要条件之一,还要检查 PCIe 根端口、交换路径、链路宽度、IOMMU/ACS、驱动支持、设备绑定和网络侧配置。
开启 MIG 后是否应该把所有 GPU 都切成最小实例?
不应该。实例颗粒度应由模型显存、计算需求、并发和变化频率决定,并为框架开销和突发留余量;部分任务仍可能需要大实例或整卡。
L40S 可以同时作为 AI 推理卡和图形工作站 GPU 吗?
它具备覆盖 AI、图形和视频的产品能力,但具体服务器、驱动、应用和授权路径不同。应按目标业务分别验证,不把一种场景的可用性直接外推到另一种。
HGX 和 MGX 是可以直接采购并上架的统一服务器型号吗?
不是统一整机型号。它们是 NVIDIA 平台或参考架构,通常由服务器厂商集成为具体产品;采购和兼容性结论必须绑定最终整机料号。
机柜总功率大于 GPU 服务器额定功率就可以直接上架吗?
不能。还要核对电压与插头、A/B 路容量、单路故障、PDU、电源线、局部散热、机柜尺寸承重、维护空间和网络出线。
GPU 利用率长期偏低是否可以直接判断 GPU 性能不足?
不能。还要结合作业队列、CPU、存储、网络、通信占比、温度和降频原因判断;利用率低也可能是数据等待、网络拥塞或调度配置造成。