RoCE 网络 PFC 异常怎么做恢复测试:拥塞扩散、队列和业务回归
说明 RoCE 网络如何设计 PFC 异常与拥塞恢复测试,关联队列、ECN、暂停帧、丢包、RDMA 和 NCCL 业务结果。

RoCE 网络在正常负载下表现稳定,不代表面对持续拥塞、错误优先级或异常端点时仍能控制影响。PFC 暂停可能沿路径扩散,端口始终保持 Up,但多个作业的尾部时延和吞吐已经明显变化。
RoCE PFC 异常恢复测试的目标不是制造最大暂停帧数量,而是验证拥塞能否被发现、限制并恢复,同时确认 RDMA 和 NCCL 业务回到基线。测试必须在隔离环境和明确停止条件下执行。
测试前固定无损网络基线
记录交换机与主机的优先级映射、PFC、ECN、队列、MTU、路由、NIC 参数和软件版本,并用正常负载保存暂停帧、拥塞标记、丢包、RDMA 与 NCCL 结果。
基线不稳定时不要直接做故障注入。否则无法判断异常来自测试动作,还是原有配置和物理链路。
故障场景从可控拥塞开始
选择单端点、单队列或受控流量形成瓶颈,逐步提高负载,观察暂停帧和 ECN 是否出现在预期端口与优先级。不要一开始就在全网制造无界流量。
后续可加入错误优先级映射、单路径热点或端点处理能力下降,但每次只引入一个变量,并设置流量、时间和温度停止阈值。
同时观察交换机、主机和作业
交换侧关注队列深度、PFC 收发、ECN、丢包和端口利用,主机侧关注 NIC 计数、重传与 CPU/GPU 拓扑,业务侧记录带宽、尾部时延、NCCL 和训练步时。
只有暂停帧增加不能说明配置错误,也不能说明恢复有效。关键是影响范围是否符合设计,以及无关业务是否被拖慢。
恢复过程比告警出现更重要
停止异常流量后,记录队列清空、暂停帧消退、端点恢复和业务回到基线所需时间。若需要人工清端口或重启设备,必须明确原因和操作风险。
重复执行确认结果一致,并覆盖单链路切换或路径变化后的恢复。一次偶然恢复不能作为生产能力证明。
把结果转成配置与告警门槛
根据测试确定哪些端口、优先级和速率触发告警,负责人如何定位,以及何时限流、隔离端点或回退配置。告警门槛应能区分正常微突发与持续异常。
变更 PFC/ECN、网卡固件、交换系统或拓扑后复用同一测试。没有业务回归的无损参数调整,不应直接推广到生产。
测试保护措施要先于故障注入
执行前限定交换端口、测试节点、优先级和最大持续时间,确认管理网络不经过同一故障路径。实时监控队列、温度和无关业务,一旦越过停止阈值立即撤销流量。
测试结束后不仅恢复配置,还要核对缓存、会话、路由和监控计数是否回到预期状态。保留自动清理与人工处置步骤,防止残余拥塞影响下一轮结果。