System Status · status.gpuli.com
服务状态
四座机房的计算、网络与存储组件状态,每 60 秒由独立于生产网络的探测节点(东京、新加坡、法兰克福、洛杉矶)更新。事件与计划维护会同步推送到 Telegram 频道与 RSS。
机房组件
DFW-1达拉斯 · 德州2021 年启用 · 2,412 GPU · 4 × 100G 出口
运行正常IAD-1阿什本 · 弗吉尼亚2022 年 8 月启用 · 1,926 GPU · 2 × 100G 出口
运行正常LAS-1拉斯维加斯 · 内华达2023 年 10 月启用 · 1,603 GPU · 2 × 100G 出口
运行正常ORD-1芝加哥 · 伊利诺伊2025 年 9 月启用 · 906 GPU · 2 × 100G 出口
运行正常PLATFORM平台服务与机房无关的全局组件
运行正常计划维护
提前 72 小时公告,每机房每月不超过 4 小时,窗口内的中断不计入 SLA。
-
2026-09-14 02:00 – 04:00 UTC北京时间 10:00 – 12:00 · 距今 12 天
IAD-1 网络核心升级即将进行IAD-1
更换两台核心交换机为 400G 平台并升级上游互联。预计出现 2 次各不超过 5 分钟的公网中断,实例不重启,内网与存储不受影响。跨机房快照复制在窗口内暂停。
-
2026-09-28 03:00 – 05:00 UTC北京时间 11:00 – 13:00 · 距今 26 天
ORD-1 H200 节点 BMC 固件滚动更新已排期ORD-1
逐台更新 40 台 HGX H200 节点的 BMC 固件(修复 2026-06-12 事件的根因补丁的后续版本)。滚动进行,每台需重启一次约 8 分钟,受影响用户会在 72 小时前收到各自的具体时间。
-
2026-08-10 02:00 – 03:10 UTC已完成 · 实际用时 1 小时 10 分
DFW-1 冷却系统年检已完成DFW-1
CRAC 机组轮流停机检修,机房温度维持在 24°C 以内,无实例受影响。
-
2026-07-06 03:00 – 03:40 UTC已完成 · 实际用时 40 分
控制台数据库主从切换已完成PLATFORM
控制台与 API 只读约 6 分钟,实例运行不受影响。
事件历史
2024 年 3 月以来的全部事件,时间为 UTC。每起事件在解决后 7 天内补充根因与后续措施。
存储卷池延迟升高
影响 2 h 11 min已解决- 已解决2026-08-19 17:03
延迟稳定在 0.5 ms 以下已超过 1 小时,事件关闭。全程实例未停机,按 SLA 定义不构成停机,未发放补偿。
- 监控中2026-08-19 15:35
故障盘已隔离,纠删组重建限速至 200 MB/s,卷池写入延迟回落至 1.1 ms。
- 已定位2026-08-19 15:20
一块 NVMe 出现大量可纠正错误,触发的纠删组重建占满了存储后端带宽。
- 调查中2026-08-19 14:52
监控显示 DFW-1 存储卷池写入延迟由 0.4 ms 升至 12 ms,多名用户报告训练 checkpoint 写入变慢。实例系统盘与 S3 不受影响。
USDT-TRC20 入账延迟
影响 1 h 35 min已解决- 已解决2026-08-02 07:45
节点追上链头,所有滞留交易已入账,共 213 笔充值受影响,无一笔丢失。因入账延迟导致自动续费失败的 6 个实例已由我们手动续费并免除本次续费的间隔损失。
- 已定位2026-08-02 06:40
Tron 网络拥堵期间我们的两台全节点区块同步落后约 40 个区块。已切换到备用节点并提高同步线程数。
- 调查中2026-08-02 06:10
多名用户报告 TRC20 充值链上已确认但余额未更新,延迟 10–25 分钟。其他链正常。
上游 BGP 前缀被错误撤回
中断 38 min已解决- 已解决2026-07-23 10:40
上游运营商确认为其路由器配置推送错误。中断 38 分钟,影响 LAS-1 约 60% 实例的公网可达性(内网与存储正常)。SLA 补偿已于 07-25 自动发放至全部受影响实例,按 3 倍停机时长计算。
- 监控中2026-07-23 09:52
已通过另一家上游重新公告前缀,全球路由收敛,从亚洲探测点恢复可达。
- 已定位2026-07-23 09:31
上游运营商之一错误撤回了我们的一个 /22 前缀公告,仅经由该上游到达的流量被丢弃。
- 调查中2026-07-23 09:14
东京与新加坡探测点报告 LAS-1 部分 IP 段不可达,法兰克福探测点正常。
H200 节点 NVLink 带宽下降
影响 1 天 15 h已解决- 已解决2026-06-13 18:00
全部 40 台 HGX H200 节点已回滚固件,all-reduce 带宽恢复至基准值。每台节点重启约 8 分钟,重启期间按 SLA 以 3 倍时长发放补偿。
- 监控中2026-06-12 06:40
开始滚动回滚,需重启节点,逐台与用户通过工单协调时间;未运行任务的空闲节点优先处理。
- 已定位2026-06-12 05:12
上一批 BMC 固件将 NVSwitch 电源策略默认设为节能模式,导致 NVLink 带宽下降约 35%。单卡性能不受影响。
- 调查中2026-06-12 02:30
多名用户报告 8 卡 H200 整机的 NCCL all-reduce 带宽较上周下降约 35%。
上游光缆中断
中断 2 h 41 min已解决- 已解决2025-11-06 22:04
被挖断的线路修复完成,双上游恢复。中断 2 小时 41 分,IAD-1 全部实例公网不可达。SLA 补偿已自动发放至全部 IAD-1 实例,按 3 倍停机时长计算,合计 ₮14,206。
- 监控中2025-11-06 20:55
另一条处于维护中的上游线路提前恢复,流量恢复,正在观察丢包率。
- 已定位2025-11-06 19:40
两条上游线路中的一条因市政施工被挖断;另一条恰好处于上游运营商的计划维护窗口内。允许两条线路的维护与风险窗口重叠,是我们的排期失误。
- 调查中2025-11-06 19:23
四个探测点同时报告 IAD-1 全部公网连接中断,机房内网与存储正常。
冷却机组故障导致部分节点降频
影响 2 h 35 min已解决- 已解决2025-08-14 23:50
备用机组接管,进风温度恢复至 22°C,GPU 频率恢复正常。约 180 台实例经历 2.5 小时的性能下降(GPU 时钟降至约 70%),未停机。虽不构成 SLA 停机,仍对受影响实例发放相当于 1 天租金的补偿。
- 已定位2025-08-14 21:30
C 排机柜对应的一台 CRAC 机组压缩机故障,备用机组切换延迟。
- 调查中2025-08-14 21:15
DFW-1 C 排机柜进风温度升至 31°C,节点触发 GPU 自动降频保护。
电力切换测试导致 PDU 跳闸
中断 12 min已解决- 已解决2024-11-20 08:19
约 40 台节点断电重启,中断 12 分钟。虽然发生在已公告的计划维护窗口内,但断电超出了公告的「无中断预期」范围,因此按 SLA 3 倍时长发放补偿。
- 调查中2024-11-20 08:07
UPS 到发电机切换时一路 PDU 跳闸,B 排部分机柜失电。
- 维护开始2024-11-20 08:00
按计划执行 UPS 到发电机的切换测试。
ToR 交换机固件缺陷导致间歇性丢包
影响 20 h已解决- 已解决2024-03-16 09:00
固件更新后丢包消失。累计约 20 小时 2–5% 的间歇性丢包,实例未停机;对提交工单的用户按实际影响时长发放补偿。
- 监控中2024-03-16 04:00
在维护窗口内对 6 台受影响的 ToR 交换机更新固件,每台切换约 30 秒。
- 已定位2024-03-15 16:20
某型号 ToR 交换机固件在特定 LACP 状态下丢帧,厂商已提供修复版本。
- 调查中2024-03-15 13:00
DFW-1 部分用户报告 SSH 会话间歇断开,探测点测得丢包率 2–5%。
2024 年 3 月之前的事件记录(2021-06 至 2024-02,共 11 起)已归档,可向 [email protected] 索取。
订阅状态通知
事件开始、状态变化、解决与计划维护公告都会在 60 秒内推送。
邮件订阅
已登录用户的注册邮箱默认接收与自己实例所在机房相关的事件;这里可以订阅全部机房。
状态页 API:GET https://api.gpuli.com/v2/status,无需认证,返回各组件当前状态与进行中的事件,每 60 秒更新。
本页最后更新: · 价格与库存以 GPU 租用价格 页为准