为什么分布式训练出现吞吐量下降时,GPU利用率和队列等待时间仍然正常?
文章指出这可能是链路级重传导致单个rank停滞,在同步集合通信(如NCCL all-reduce)中其他rank阻塞,形成级联故障,需要全栈可观测性来发现灰故障。
(翻译)如何为NVIDIA AI工厂选择全栈可观测性

AI infrastructure spans multiple layers, from compute and networking to storage, orchestration, and applications. When performance degrades…
本文介绍NVIDIA AI工厂的全栈可观测性选型方法。作者提出先枚举平台、GPU、网络、集群等故障域,再将组件映射到DCGM、NVSM、UFM、NetQ等遥测工具,以最少工具覆盖关键告警。文章以InfiniBand集群为例,演示如何用IPMI、DCGM、NVSM、UFM和BCM构建面向SLO的告警集,并统一到Prometheus/Grafana排障看板,避免告警疲劳。
文章指出这可能是链路级重传导致单个rank停滞,在同步集合通信(如NCCL all-reduce)中其他rank阻塞,形成级联故障,需要全栈可观测性来发现灰故障。
先枚举故障域,再根据组件到遥测源的决策框架选择最小工具集,例如GPU用DCGM、InfiniBand用UFM、集群用BCM,并统一到Prometheus/Grafana。
号称人类造的最后一个 AI 要来了,刷屏全网的 RSI 是什么58秒出杯,能拉花的咖啡机器人,在全球70国卖出600万杯英国殖民之前的澳大利亚原居民人口约 222 万
当年救了臭氧层的功臣,现在变成了永久性污染物
129亿美元卖身英伟达之后,是时候重新理解Hugging Face了
Stella:“显化”想要的人生,60天35万美元月收入
从”边卖边补”到”准备好再卖”:产品商品化的四步闭环
华为坤灵升级“4+10+N”场景化方案,发布“经纬计划”和50个样板点
美股太贵 该加仓新兴市场吗?FAST 发现极短周期、最轻双中子星系统
「沃什时代」首次加息要来了?华尔街算好了三种剧本
王强宇履新百望:从发票SaaS工具,到财税垂直大模型,再到企业的Palantir基元律动与无问芯穹达成战略合作,推进高质量Token供给与应用
金色Web3.0日报 | 黄仁勋批驳「AI末日论」主题演讲:破界·量子计算迈向产业深水区——量子计算的下一公里|36氪2026产业未来大会
OpenAI 总裁:AGI 已经发生
Grayscale:比特币能否优化私募市场投资组合?
早报|iOS27正式推送/比亚迪高管:燃油车在中国没有未来/iPhone 18 Pro渠道降价900元,苹果称不干预PS2 Fat 使用的安全芯片在时隔 26 年被破解
渣打给ARB十美元目标价靠什么?
自主团队被捧过头了?Simon Rohrer 直言:你们交付的根本不是产品被英伟达点名的杭州团队,补上了AI for Science的「最后一公里」产品已批量进入全球头部Tier 1产线,「知来具身」要为工业场景打造“开箱即用”的泛化机器人
HTTP 新增 QUERY 方法:有人叫好,也有人质疑“这不就是 GET?”
当黄仁勋和Dario遇上休谟:火鸡、台球与AI末日论
CLARITY折戟 多方博弈撕裂行业预期 市场怎么看?
百度做了一堆AI产品,却没有一个能代表百度?
电商对账的设计逻辑:四层核对,逐层下钻
当AI能解千禧难题,再次证明答案不再是门槛
Robinhood的财富效应