首页/服务状态

System Status · status.gpuli.com

服务状态

四座机房的计算、网络与存储组件状态,每 60 秒由独立于生产网络的探测节点(东京、新加坡、法兰克福、洛杉矶)更新。事件与计划维护会同步推送到 Telegram 频道与 RSS。

全部系统正常4 座机房 · 12 个组件 · 3 项平台服务,均无已知问题
最近检查 2026-09-02 08:14:32 UTC
探测周期 60 秒 · 4 个海外探测点 · 当前无进行中事件
近 12 个月可用性
99.95%
2025-09 至 2026-08,全部实例加权
近 90 天可用性
99.97%
1 次中断 · 3 次性能下降
本月可用性
100%
2026-09-01 起,无事件
2026 年事件数
4
其中 1 起触发 SLA 补偿
在线 GPU
6,847
DFW 2,412 · IAD 1,926 · LAS 1,603 · ORD 906
Components · 90 days

机房组件

2026-06-05 → 2026-09-02 · 悬停色块查看当天状态

DFW-1达拉斯 · 德州2021 年启用 · 2,412 GPU · 4 × 100G 出口

运行正常
计算节点H200 / H100 / MI300X / 4090 · 486 台
90 天前今天
100.00% · 90 天
网络边缘路由 · 上游 3 家 · 公网 IPv4
90 天前今天
100.00% · 90 天
存储存储卷池 · S3 dfw1 · 快照
90 天前今天
99.94% · 90 天

IAD-1阿什本 · 弗吉尼亚2022 年 8 月启用 · 1,926 GPU · 2 × 100G 出口

运行正常
计算节点H100 / A100 / L40S / A40 · 412 台
90 天前今天
100.00% · 90 天
网络边缘路由 · 上游 3 家(2026-03 起)
90 天前今天
100.00% · 90 天
存储存储卷池 · S3 iad1 · 快照
90 天前今天
100.00% · 90 天

LAS-1拉斯维加斯 · 内华达2023 年 10 月启用 · 1,603 GPU · 2 × 100G 出口

运行正常
计算节点A100 / 4090 / A6000 / 3090 · 358 台
90 天前今天
100.00% · 90 天
网络边缘路由 · 上游 2 家
90 天前今天
99.97% · 90 天
存储存储卷池 · S3 las1 · 快照
90 天前今天
100.00% · 90 天

ORD-1芝加哥 · 伊利诺伊2025 年 9 月启用 · 906 GPU · 2 × 100G 出口

运行正常
计算节点H200 / 5090 / L4 · 156 台
90 天前今天
99.96% · 90 天
B200 计算节点8 台 HGX B200(64 卡)· 2026-09-01 起投产
2026-09-01 投产今天
100.00% · 投产以来
网络边缘路由 · 上游 2 家 · IB 400G 交换
90 天前今天
100.00% · 90 天
存储存储卷池 · S3 ord1 · 快照
90 天前今天
100.00% · 90 天

PLATFORM平台服务与机房无关的全局组件

运行正常
控制台与 APIconsole.gpuli.com · api.gpuli.com/v2
90 天前今天
100.00% · 90 天
钱包与充值8 条链的节点与入账服务
90 天前今天
99.91% · 90 天
Jupyter 代理*.jup.gpuli.com 边缘节点
90 天前今天
100.00% · 90 天
正常性能下降(未停机,通常不触发 SLA)服务中断(计入 SLA)可用性按当月全部实例分钟数加权计算
Scheduled Maintenance

计划维护

提前 72 小时公告,每机房每月不超过 4 小时,窗口内的中断不计入 SLA。

  • 2026-09-14 02:00 – 04:00 UTC北京时间 10:00 – 12:00 · 距今 12 天
    IAD-1 网络核心升级即将进行IAD-1

    更换两台核心交换机为 400G 平台并升级上游互联。预计出现 2 次各不超过 5 分钟的公网中断,实例不重启,内网与存储不受影响。跨机房快照复制在窗口内暂停。

  • 2026-09-28 03:00 – 05:00 UTC北京时间 11:00 – 13:00 · 距今 26 天
    ORD-1 H200 节点 BMC 固件滚动更新已排期ORD-1

    逐台更新 40 台 HGX H200 节点的 BMC 固件(修复 2026-06-12 事件的根因补丁的后续版本)。滚动进行,每台需重启一次约 8 分钟,受影响用户会在 72 小时前收到各自的具体时间。

  • 2026-08-10 02:00 – 03:10 UTC已完成 · 实际用时 1 小时 10 分
    DFW-1 冷却系统年检已完成DFW-1

    CRAC 机组轮流停机检修,机房温度维持在 24°C 以内,无实例受影响。

  • 2026-07-06 03:00 – 03:40 UTC已完成 · 实际用时 40 分
    控制台数据库主从切换已完成PLATFORM

    控制台与 API 只读约 6 分钟,实例运行不受影响。

Incident History

事件历史

2024 年 3 月以来的全部事件,时间为 UTC。每起事件在解决后 7 天内补充根因与后续措施。

共 8 起 · 平均恢复时间 1 小时 26 分
2026
DFW-1 · 存储

存储卷池延迟升高

影响 2 h 11 min已解决
  • 已解决2026-08-19 17:03

    延迟稳定在 0.5 ms 以下已超过 1 小时,事件关闭。全程实例未停机,按 SLA 定义不构成停机,未发放补偿。

  • 监控中2026-08-19 15:35

    故障盘已隔离,纠删组重建限速至 200 MB/s,卷池写入延迟回落至 1.1 ms。

  • 已定位2026-08-19 15:20

    一块 NVMe 出现大量可纠正错误,触发的纠删组重建占满了存储后端带宽。

  • 调查中2026-08-19 14:52

    监控显示 DFW-1 存储卷池写入延迟由 0.4 ms 升至 12 ms,多名用户报告训练 checkpoint 写入变慢。实例系统盘与 S3 不受影响。

后续措施:重建限速改为默认策略;对同批次 NVMe 增加 SMART 可纠正错误阈值告警。
平台 · 钱包

USDT-TRC20 入账延迟

影响 1 h 35 min已解决
  • 已解决2026-08-02 07:45

    节点追上链头,所有滞留交易已入账,共 213 笔充值受影响,无一笔丢失。因入账延迟导致自动续费失败的 6 个实例已由我们手动续费并免除本次续费的间隔损失。

  • 已定位2026-08-02 06:40

    Tron 网络拥堵期间我们的两台全节点区块同步落后约 40 个区块。已切换到备用节点并提高同步线程数。

  • 调查中2026-08-02 06:10

    多名用户报告 TRC20 充值链上已确认但余额未更新,延迟 10–25 分钟。其他链正常。

后续措施:增加第三台 Tron 全节点;节点落后超过 10 个区块时自动切换并告警。
LAS-1 · 网络

上游 BGP 前缀被错误撤回

中断 38 min已解决
  • 已解决2026-07-23 10:40

    上游运营商确认为其路由器配置推送错误。中断 38 分钟,影响 LAS-1 约 60% 实例的公网可达性(内网与存储正常)。SLA 补偿已于 07-25 自动发放至全部受影响实例,按 3 倍停机时长计算。

  • 监控中2026-07-23 09:52

    已通过另一家上游重新公告前缀,全球路由收敛,从亚洲探测点恢复可达。

  • 已定位2026-07-23 09:31

    上游运营商之一错误撤回了我们的一个 /22 前缀公告,仅经由该上游到达的流量被丢弃。

  • 调查中2026-07-23 09:14

    东京与新加坡探测点报告 LAS-1 部分 IP 段不可达,法兰克福探测点正常。

后续措施:LAS-1 第三家上游已于 2026-08 签约,预计 2026-10 上线;所有前缀已启用 RPKI ROA。
ORD-1 · 计算

H200 节点 NVLink 带宽下降

影响 1 天 15 h已解决
  • 已解决2026-06-13 18:00

    全部 40 台 HGX H200 节点已回滚固件,all-reduce 带宽恢复至基准值。每台节点重启约 8 分钟,重启期间按 SLA 以 3 倍时长发放补偿。

  • 监控中2026-06-12 06:40

    开始滚动回滚,需重启节点,逐台与用户通过工单协调时间;未运行任务的空闲节点优先处理。

  • 已定位2026-06-12 05:12

    上一批 BMC 固件将 NVSwitch 电源策略默认设为节能模式,导致 NVLink 带宽下降约 35%。单卡性能不受影响。

  • 调查中2026-06-12 02:30

    多名用户报告 8 卡 H200 整机的 NCCL all-reduce 带宽较上周下降约 35%。

后续措施:固件更新前增加 NCCL 基准测试作为验收步骤;2026-09-28 计划维护将部署修复后的固件版本。
2025
IAD-1 · 网络

上游光缆中断

中断 2 h 41 min已解决
  • 已解决2025-11-06 22:04

    被挖断的线路修复完成,双上游恢复。中断 2 小时 41 分,IAD-1 全部实例公网不可达。SLA 补偿已自动发放至全部 IAD-1 实例,按 3 倍停机时长计算,合计 ₮14,206。

  • 监控中2025-11-06 20:55

    另一条处于维护中的上游线路提前恢复,流量恢复,正在观察丢包率。

  • 已定位2025-11-06 19:40

    两条上游线路中的一条因市政施工被挖断;另一条恰好处于上游运营商的计划维护窗口内。允许两条线路的维护与风险窗口重叠,是我们的排期失误。

  • 调查中2025-11-06 19:23

    四个探测点同时报告 IAD-1 全部公网连接中断,机房内网与存储正常。

后续措施:禁止任何机房的两条上游同时进入维护或风险窗口;IAD-1 第三条上游已于 2026-03 上线。
DFW-1 · 计算

冷却机组故障导致部分节点降频

影响 2 h 35 min已解决
  • 已解决2025-08-14 23:50

    备用机组接管,进风温度恢复至 22°C,GPU 频率恢复正常。约 180 台实例经历 2.5 小时的性能下降(GPU 时钟降至约 70%),未停机。虽不构成 SLA 停机,仍对受影响实例发放相当于 1 天租金的补偿。

  • 已定位2025-08-14 21:30

    C 排机柜对应的一台 CRAC 机组压缩机故障,备用机组切换延迟。

  • 调查中2025-08-14 21:15

    DFW-1 C 排机柜进风温度升至 31°C,节点触发 GPU 自动降频保护。

后续措施:CRAC 切换改为自动触发;机柜进风温度告警阈值由 30°C 下调至 27°C。
2024
LAS-1 · 计算

电力切换测试导致 PDU 跳闸

中断 12 min已解决
  • 已解决2024-11-20 08:19

    约 40 台节点断电重启,中断 12 分钟。虽然发生在已公告的计划维护窗口内,但断电超出了公告的「无中断预期」范围,因此按 SLA 3 倍时长发放补偿。

  • 调查中2024-11-20 08:07

    UPS 到发电机切换时一路 PDU 跳闸,B 排部分机柜失电。

  • 维护开始2024-11-20 08:00

    按计划执行 UPS 到发电机的切换测试。

后续措施:更换该路 PDU 断路器;此后电力测试前先在空载机柜上预演。
DFW-1 · 网络

ToR 交换机固件缺陷导致间歇性丢包

影响 20 h已解决
  • 已解决2024-03-16 09:00

    固件更新后丢包消失。累计约 20 小时 2–5% 的间歇性丢包,实例未停机;对提交工单的用户按实际影响时长发放补偿。

  • 监控中2024-03-16 04:00

    在维护窗口内对 6 台受影响的 ToR 交换机更新固件,每台切换约 30 秒。

  • 已定位2024-03-15 16:20

    某型号 ToR 交换机固件在特定 LACP 状态下丢帧,厂商已提供修复版本。

  • 调查中2024-03-15 13:00

    DFW-1 部分用户报告 SSH 会话间歇断开,探测点测得丢包率 2–5%。

后续措施:ToR 交换机固件纳入季度评估;新增按机柜维度的丢包率探测。

2024 年 3 月之前的事件记录(2021-06 至 2024-02,共 11 起)已归档,可向 [email protected] 索取。

Subscribe

订阅状态通知

事件开始、状态变化、解决与计划维护公告都会在 60 秒内推送。

Telegram 频道

只发状态通知,不发广告,2023-10 开通至今共 41 条消息。

@gpuli_status

加入频道

RSS / Atom

适合接入自己的告警系统或 RSS 阅读器,包含事件全文与维护公告。

status.gpuli.com/feed

打开 Feed

邮件订阅

已登录用户的注册邮箱默认接收与自己实例所在机房相关的事件;这里可以订阅全部机房。

状态页 API:GET https://api.gpuli.com/v2/status,无需认证,返回各组件当前状态与进行中的事件,每 60 秒更新。

本页最后更新: · 价格与库存以 GPU 租用价格 页为准

Telegram
Telegram 客服@gpuli_cn7×24 小时在线
工单