Solyx AI Grid:面向地理分布式GPU集群的硬件遥测感知路由——多站点LLM推理实证研究
2026/7/24 22:01:46 网站建设 项目流程

大家读完觉得有帮助记得关注和点赞!!!

摘要

随着GPU部署分散在地理上隔离的站点,单集群LLM推理路由的底层假设以可测量且可预测的方式失效。现有方案——包括集群内路由器(NVIDIA Dynamo、vLLM Router)、学术研究跨区域负载均衡器(SkyWalker)和异构放置求解器(Helix)——要么局限于单个数据中心边界内,要么假设副本同构,要么缺乏实时硬件遥测。我们提出了对Solyx AI地理分布式推理矩阵(“Solyx AI Grid”)的双阶段实证研究,这是一个跨站点推理路由控制平面,通过包含10种信号的加权压力评分器,将GPU硬件遥测(DCGM)、vLLM应用指标和实时网络信号(RTT、抖动)整合进针对地理分布式GPU集群的逐请求放置决策中。第一阶段(2026年4月)在美国三个数据中心的六块NVIDIA H100和H200 SXM GPU上部署,采用三种集群配置:同构、硬件异构和能力错配。第二阶段(2026年5月)在美国三个数据中心的九块NVIDIA RTX PRO 6000 Blackwell SE GPU上部署,在一个216单元的SLO矩阵上测试了八类LLM工作负载。在两阶段实验中,Solyx AI Grid均表现出:在同构H100集群上降低27.9%的P99尾延迟;在完全由实时遥测驱动的异构集群中实现134:1的流量向健康端点集中;将能力错配泄漏率降至0.43%,而轮询调度(Round-Robin)为32.11%、最少请求(Least-Request)为28.71%,从而获得99.57%的长提示词成功率(轮询调度为67.89%,最少请求为71.29%);在所有八类工作负载的第二级SLO下实现1.56–1.75倍的吞吐量;故障转移P99延迟为1,247毫秒,而轮询调度为4,226毫秒;在WAN抖动下降低27.8%的P95首令牌时间(TTFT);在DCGM导出器实时故障时保持99.90%的成功率。在所有配置下,控制平面的路由更新开销均为0.2毫秒。我们进一步发现,DCGM硬件信号平均比应用层SLO违规提前11.2秒发出预警,从而能在对用户造成延迟影响前主动排空流量。据我们所知,这是首个结合DCGM硬件遥测、vLLM应用指标和主动WAN RTT/抖动信号的真实物理多站点LLM推理路由公开实证研究。我们刻画了多站点推理特有的三种故障模式,并表明硬件遥测感知路由能以具体、可衡量的改进应对每一种模式。

1 引言

大语言模型(LLM)部署的推理层经历了快速的架构演变。早期生产系统依赖于简单负载均衡器背后的同构GPU单集群,而GPU采购的经济性迫使现实发生改变:许多运营商现在拥有或租赁分布在多个地理位置分散站点的算力,这些站点具有不同的硬件代际、变化的站点间网络条件,且在推理引擎之上没有协调层。

这种碎片化催生了一类现有系统无法解决的路由问题。集群内路由器如NVIDIA Dynamo [1] 和 vLLM Router [2] 在单个数据中心边界内运行,无法观测远程站点的状况。跨区域负载均衡器如SkyWalker [3] 将路由扩展到区域层面,但假设副本同构且不消费硬件遥测。异构放置求解器如Helix [4] 通过最大流混合整数规划(MILP)联合优化模型放置和调度,但运行在静态拓扑上,并非为跨地理隔离站点的连续逐请求决策而设计。值得注意的是,即使是生产中最常用的主动负载均衡策略——最少请求,在能力错配条件下也会失效:失败的请求返回很快,降低了飞行中计数,从而主动将更多流量吸引到已损坏的端点。

缺失的是一个位于推理引擎之上、跨越站点边界、并纳入对路由质量至关重要的硬件和网络信号的控制平面。没有这一层,多站点GPU集群会表现出一组特征性的故障模式:能力错配泄漏、网络抖动下的尾延迟放大,以及故障转移期间的冷启动级联。

本文介绍了对跨站点推理路由控制平面Solyx AI Grid的双阶段实证研究。我们的贡献如下:

  • 多站点推理规模特有故障模式的分类:能力错配泄漏、网络抖动诱发的尾延迟,以及故障转移期间的冷启动级联。

  • 一种10信号硬件遥测感知路由架构的描述:将GPU硬件指标(DCGM)、vLLM应用指标和实时网络信号(RTT、抖动)整合进逐请求放置决策。

  • 来自两个独立阶段的实证结果:六块GPU跨美国三个数据中心(H100/H200 SXM,2026年4月)和九块GPU跨美国三个数据中心(RTX PRO 6000 Blackwell SE,2026年5月),覆盖八类工作负载的216单元SLO矩阵、七个不同的评估阶段以及所有三种已识别的故障模式。

  • 一项新颖的实证发现:DCGM硬件遥测信号平均比应用层SLO违规提前11.2秒,使得能在对用户造成延迟影响前主动排空流量。据我们所知,这是首个在真实物理多站点基础设施上量化此领先时间的公开研究。

  • 对Solyx相比最少请求无 measurable 优势的边界条件的诚实刻画,以及当前研究的明确局限性。

2 背景与动机

2.1 多站点推理部署的现实

超大规模云厂商拥有足够的集中容量,可在单个数据中心结构内运行推理。对于中型GPU云运营商、主权AI提供商和企业平台团队而言,采购现实则不同。GPU供应限制、电力基础设施限制以及跨地域的延迟目标,导致部署分散在多个物理隔离的站点——每个站点运行独立的推理引擎实例——且没有共享的协调层。在此模式下,每个站点都是一个孤岛:请求被路由到本地推理副本,而不知晓其他地方的状况。当一个站点饱和时,请求排队或失败,而非重定向到另一个站点的可用容量。

2.2 标准路由策略为何在多站点规模下失效

轮询调度(Round-Robin)​ 对GPU无感知:它均匀分发请求,无法看见GPU状态、队列深度、能力约束或网络条件。在同构集群上,当连续请求落到某个正在处理慢速生成的副本时,会产生队列堆积导致的尾延迟尖峰。在异构集群上,它将H200与受限的H100同等对待。在能力错配下,它会无限期地将三分之一流量发送到已损坏的端点。

最少请求(Least-Request)​ 在大多数条件下优于轮询调度,但并未解决能力错配故障模式。因为失败的请求立即返回HTTP 400,损坏端点的飞行中计数会迅速下降,因此负载感知启发式会将其视为轻负载,并继续将流量导向它。理论风险在于这种反馈循环会将流量集中在故障端点上;在我们的第二阶段评估中,这种影响没有最坏情况那么严重,但仍使最少请求几乎与轮询调度一样暴露:在相同条件下,其泄漏率为28.71%,接近轮询调度的32.11%,而Solyx仅为0.43%。关键在于,仅靠负载感知——没有错误率信号——无法解决能力错配问题。

2.3 多站点规模下的故障模式

能力错配泄漏。副本可能通过/health健康检查,但由于max_model_len约束、数据类型不匹配、vLLM版本偏差或CUDA驱动不兼容而拒绝部分请求。这些条件在滚动升级期间、混合模型变体的集群中或不同时间配置的节点间很常见。标准健康检查对此类故障视而不见。

抖动下的尾延迟放大。跨站点路由引入了WAN路径变异性,这是集群内系统未设计处理的。TTFT的下限受限于网络往返时间;网关与推理副本间路径上的抖动直接推高P95和P99延迟。没有网络信号感知的路由决策会将请求分发到高抖动路径,无论路径质量如何。

故障转移期间的冷启动级联。当副本故障时,被重定向的请求可能到达另一个尚未预热站点的副本。如果没有生命周期状态感知,故障转移目标会在其加载阶段接收请求,级联导致性能下降,直到副本达到就绪服务状态。

3 相关工作

3.1 集群内推理路由

NVIDIA Dynamo [1] 是一个开源分布式推理框架,包含KV缓存感知路由器和SLO规划器,用于多节点部署。vLLM Router [2] 于2025年12月发布,通过Kubernetes或裸金属集群内的一致性哈希提供KV缓存感知路由。两者都假设副本间网络同构,且不包含硬件遥测。SGLang的路由器和llm-d [5] 同样在单集群内运行。Kubernetes Gateway API推理扩展 [6] 提供网关级路由,但范围限于单个Kubernetes集群。

3.2 跨区域负载均衡

SkyWalker (Xia et al., 2025) [3] 是最接近的学术先前工作,代表了迄今为止对跨区域推理路由问题最严格的公开刻画。它是一个研究原型——而非可部署系统——构建在SkyServe研究服务框架之上,源自Sky Computing小组。SkyWalker通过昼夜负载变化下的跨区域流量卸载解决了区域本地配置的成本低效问题,提供了KV缓存局部性保持路由(一致性哈希、多区域前缀树),并报告相比区域本地基线实现了1.12–2.06倍的吞吐量提升和1.74–6.30倍的延迟降低,成本降低25%。由于SkyWalker是学术原型,其评估是在模拟多区域工作负载而非物理硬件上进行的。我们的工作在另外三个方面有所不同:SkyWalker假设副本同构,没有GPU级硬件状态感知;它不将RTT或抖动作为连续路由输入;并且未在具有真实WAN路径的真实多站点部署上验证。我们将SkyWalker视为系统研究界已认识到跨站点路由问题重要性的证据,并将我们的贡献定位为在该问题类别上基于物理多站点基础设施的首次实证验证。

3.3 异构放置

Helix (Mei et al., ASPLOS 2025) [4] 将有向加权图上的最大流问题形式化用于异构集群上的LLM服务,使用MILP联合优化模型放置和请求调度。在24–42个GPU节点集群上评估,Helix实现了最高3.3倍的吞吐量和最高66%的提示延迟降低。Helix是一个离线放置优化器,而非在线逐请求路由器,运行在单个固定拓扑集群上,并非为连续的跨站点路由决策而设计。HexGen [7] 和 HexGen-2 [8] 使用连接集群内的非对称分区解决去中心化异构环境中的生成式推理。

3.4 应用层与模型选择路由

另一类平行工作涉及在不同LLM模型间路由——根据难度或质量标准选择最具成本效益的模型来处理查询。这包括混合路由 (Ding et al., 2024)、级联调查 (Moslem & Way, 2026) [9] 和基于RL的模型路由器。这类问题不同于基础设施放置路由:模型选择路由器决定调用哪个模型;基础设施路由器决定在哪个硬件副本上执行给定的推理请求。

4 系统架构

4.1 设计目标

Solyx AI Grid 设计为在推理引擎之上运行而无需修改它们,在请求时刻使用持续刷新的信号做出路由决策,处理健康检查系统不可见的副本生命周期转换,在单个遥测源故障时优雅降级,并将网络路径质量作为首要路由输入。数据平面是未修改的Envoy;Solyx生成标准的xDS端点权重配置,这意味着现有Envoy部署可以采用Solyx而无需更改其请求处理层。

4.2 10信号分类法

v3评分器整合了来自三个来源的十种信号(四种应用、四种硬件、两种网络)。

  • vLLM应用指标(通过Prometheus每秒抓取):队列深度、直方图桶中的P95 TTFT、错误率、KV缓存填充百分比。

  • GPU硬件遥测(通过DCGM以亚秒级节奏收集):GPU利用率、VRAM利用率、SM/张量核心流水线占用率、内存带宽利用率。

  • 网络路径信号(通过主动健康检查测量):从网关到每个副本的每端点RTT和抖动。

    每个单元代理(每个GPU一个)在本地聚合这些信号,并通过gRPC流式心跳以500毫秒的节奏将它们推送到控制平面。

相对于第一阶段的8信号评分器,v3评分器新增了两种网络信号——RTT和抖动。网络感知放置评估(第6.8节)分离了它们的贡献:在诱导WAN抖动下,比较仅使用GPU的Solyx(8信号)与10信号Solyx,仅网络信号就带来了额外的27.8%的P95 TTFT降低,证实了这些信号提供了超越硬件和应用指标的实质性路由价值。

4.3 压力评分与权重投射

在请求时刻,Solyx AI Grid 通过加权归一化结合当前信号值,为每个候选副本计算一个综合压力分数。每个信号被归一化到 [0,1],值越高表示压力越大。综合分数被反转并投射为整数端点权重,通过xDS推送到Envoy。评分循环连续运行;当分数增量超过滞后阈值时触发xDS推送,在为期八天的第二阶段实验窗口中,稳态节奏为1 Hz,共推送了超过50,000个xDS快照。

4.4 副本生命周期状态机与优雅降级

每个被追踪的副本被分配一个生命周期状态:加载中就绪排空中故障终止。只有就绪副本才有资格接收实时流量。工作器故障通过心跳TTL过期检测:当单元代理停止发送心跳时,控制平面在500毫秒(一个心跳间隔)内将端点标记为故障并将其权重置零。这就是相比Envoy默认的3次1秒健康检查轮询实现3.2倍更快故障转移恢复的机制。Envoy在控制平面中断期间保留最后一次已知良好的xDS快照,确保路由新鲜度优雅降级而非流量丢弃。当DCGM导出器在负载中故障时,控制平面升起一个回退标志,评分器继续使用剩余的仅vLLM信号;无需操作员干预,也不会丢弃流量。

5 实验设置

5.1 第一阶段:异构集群(2026年4月)

第一阶段在美国三个数据中心部署六块GPU,Solyx控制平面和Envoy网关位于美国东部的中立网关节点。在相同的底层拓扑上评估了三种集群配置。

  • 同构:六块NVIDIA H100 SXM 80GB,所有max_model_len=4096

  • 硬件异构:Pod A升级为两块NVIDIA H200 SXM(144GB VRAM),Pod B保留两块H100 SXM,Pod C保留两块H100 SXM但限制max_model_len=1024

  • 能力错配:在相同硬件上以20 RPS评估以加压错配条件。

    所有配置均服务Llama 3.1 70B AWQ INT4。比较了三种路由策略:轮询调度(RR)、最少请求(LR)和Solyx AI Grid(8信号v2评分器)。

5.2 第二阶段:多阶段Blackwell SE评估(2026年5月)

第二阶段在美国三个数据中心部署九块NVIDIA RTX PRO 6000 Blackwell SE GPU(96GB GDDR7,PCIe Gen5):solyx-prod-east(美国东北1)、solyx-prod-central(美国宾夕法尼亚1)、solyx-prod-west(美国北卡罗来纳2),每站点三块GPU。所有站点间流量均穿越公共互联网WAN路径。每个Pod运行一个DCGM导出器和三个以500毫秒节奏发送心跳的单元代理。所有九块GPU均服务Llama 3.1 70B AWQ INT4,使用vLLM 0.6.6.post1,启用前缀缓存和分块预填充,采用awq_marlin量化。第二阶段包括校准加上在八天内(2026年5月6日至14日)的七个评估阶段:SLO吞吐量矩阵、硬件遥测领先时间压力测试、破坏性故障转移、突发和对抗性工作负载、能力错配、遥测故障回退以及网络感知放置,使用GuideLLM作为负载驱动器,测量每请求的流式TTFT。比较了三种路由策略:RR、LR和Solyx AI Grid(10信号v3评分器)。

5.3 工作负载类别(第二阶段)

定义了八类工作负载,涵盖生产LLM流量的结构基元:

  • baseline_mixed(512±200 token提示词,128 token输出——标准聊天/问答)

  • rapid_shift(1024 token提示词,会话内形状变化)

  • code_heavy(1024±512 token提示词,192 token输出——类似Copilot的解码密集型)

  • adversarial_spike(10 RPS稳态,每30秒加50个请求的突发)

  • multiturn(2048×8 增长的轮次,16K有效上下文)

  • rag_multidoc(4000±800 token提示词,带检索文档)

  • long_context(8000±1500 token提示词)

  • very_long(16000±3000 token提示词,文档摘要)

5.4 SLO矩阵方法论

对于每个(类别、模式、SLO)单元,二分查找驱动器找到最高的可持续RPS,满足P95 TTFT ≤ SLO 且成功率 ≥ 0.95。每个二分步骤提交45秒的恒定速率流量,包含30秒预热和15秒冷却;冷却窗口不计入分子和分母。每类三个SLO等级 × 三种路由模式 × 三个副本 = 每类27个单元,总共216个单元。所有SLO等级均满足统计完整性标准(每个单元 ≥ 500个样本)。

6 结果

6.1 校准基线

在主评估前,每种路由模式在baseline_mixed、10 RPS下运行60秒校准。Solyx在首次校准运行中就取得了最低的TTFT P95,证明压力感知评分能立即将流量导向具有最多KV缓存余量和最低RTT的计算单元,无需任何预热期。

表1:校准结果(baseline_mixed,10 RPS,60秒)。Solyx在首次运行的所有延迟百分位上均领先。

模式

成功率

TTFT P50

TTFT P95

TTFT P99

E2E P95

Solyx (10信号)

100.00%

306.5 ms

609.6 ms

742.9 ms

5,340 ms

最少请求

100.00%

348.7 ms

628.1 ms

814.7 ms

5,809 ms

轮询调度

99.75%

352.5 ms

649.5 ms

853.1 ms

5,810 ms

6.2 跨工作负载类别的SLO吞吐量

在第二级SLO下,所有八类工作负载中,Solyx实现了轮询调度可持续RPS的1.56–1.75倍。实验的接受标准要求Solyx在八类中至少赢得四类;Solyx赢得了全部八类。最少请求稳定地介于轮询调度和Solyx之间,验证了硬件遥测和网络信号提供了超越单纯应用层负载感知的路由价值。

表2:第二级SLO下的SLO吞吐量矩阵(三个副本的中位数)。可持续RPS = 满足P95 TTFT ≤ SLO 且成功率 ≥ 0.95 的最高RPS。

工作负载类别

SLO (ms)

Solyx

LR

RR

Solyx/RR

baseline_mixed

1,500

20

17

12

1.67×

rapid_shift

1,500

18

15

11

1.64×

code_heavy

3,000

16

14

10

1.60×

adversarial_spike

3,000

28

24

17

1.65×

multiturn

3,500

14

12

9

1.56×

rag_multidoc

3,000

22

19

13

1.69×

long_context

3,000

12

10

7

1.71×

very_long

7,000

7

6

4

1.75×

6.3 硬件遥测领先时间

第二阶段的一个关键发现是GPU硬件遥测信号能预见应用层SLO违规。我们独立地在九个计算单元中的每一个上注入热应力(通过pure-torch matmul进行GPU燃烧)和PCIe争用(stress-ng),并测量在TTFT P95越过SLO阈值前多少秒,Solyx压力分数越过了预配置的警报阈值。这个领先时间代表了Solyx可以在用户感受到延迟影响之前,将流量从性能下降的单元中排空的时间窗口。

表3:硬件遥测领先时间结果。硬件遥测信号平均比SLO违规提前11.2秒越过压力警报阈值。未发生SLO违规,因为Solyx在领先时间窗口内排空了流量。

应力类型

单元数

领先范围 (秒)

平均领先 (秒)

SLO违规

热应力 (GPU燃烧)

6 (东+中)

11.5–13.1

12.3

0/6

PCIe争用

3 (西)

8.7–9.2

8.9

0/3

所有单元合计

9

8.7–13.1

11.2

0/9

在所有九个应力事件中均未发生SLO违规,因为Solyx在领先时间窗口内将流量重新路由远离了每个性能下降的单元。这一发现具有直接的运维意义:GPU硬件退化——热节流、PCIe争用、ECC错误——可通过DCGM硬件信号在大约11秒前被检测到,早于它在TTFT或队列深度等应用指标中显现。纯应用层的监控栈没有预先警告;而硬件遥测感知的控制平面可以采取主动行动。

6.4 故障转移恢复

我们通过持续10 RPS负载下向一个vLLM进程发送SIGKILL来测量破坏性故障转移,并记录每种路由模式重新路由飞行中流量的速度。Solyx通过单元代理心跳陈旧性而非主动健康检查轮询来检测故障:当单元静默时,Solyx在一个500毫秒的心跳间隔内将其降级,而Envoy的默认配置需要三个连续的1秒健康检查间隔才能移除端点。

表4:破坏性故障转移结果(10 RPS下对一个vLLM进程发送SIGKILL)。Solyx的P99重路由速度比轮询调度快3.2倍,并保持最高的杀进程后成功率。

模式

重路由 P50

重路由 P95

重路由 P99

杀进程后成功率

Solyx

287 ms

891 ms

1,247 ms

99.76%

最少请求

412 ms

1,538 ms

2,104 ms

98.81%

轮询调度

689 ms

2,871 ms

4,226 ms

94.12%

最少请求虽然比轮询调度快,但其P99延迟仍是Solyx的1.6倍以上,因为它只对飞行中请求计数做出反应,而非对底层的活跃性信号。心跳陈旧性机制是Solyx能将故障转移影响限制在杀死瞬间飞行中请求上的架构原因,从而实现了99.76%的杀进程后成功率,而轮询调度仅为94.12%。

6.5 突发和对抗性工作负载

adversarial_spike工作负载(10 RPS稳态,每30秒加50个请求的突发)下,Solyx的队列深度感知评分能在亚秒内检测到突发并将其引导至负载最轻的单元。轮询调度的均匀分配会使接收到第一批突发请求的Pod过载。

表5:adversarial_spike结果。路由反应陈旧性测量从突发开始到路由权重调整的P95时间。

模式

可持续 RPS

突发成功率

反应 P95

Solyx

28

99.43%

482 ms

最少请求

24

95.21%

1,247 ms

轮询调度

17

81.27%

2,381 ms

6.6 能力错配

一个单元(cell-west-2)配置为max_model_len=1024,而其他八个单元运行在max_model_len=131072,在10 RPS负载下。两类工作负载驱动长提示词:baseline_mixed(30%的提示词超过1024 token)和long_context(100%超过1024 token)。我们将泄漏率定义为被路由到受限单元并因此被HTTP 400拒绝的长提示词请求(超过受限单元上下文限制的请求)的比例。Solyx的错误率信号检测到受限单元上的高失败率并自动降低其权重,无需预先配置识别哪个单元受限。

表6:能力错配结果。泄漏率是被路由到受限单元并被拒绝(HTTP 400)的长提示词请求的比例。最少请求28.71%的泄漏率接近轮询调度的32.11%,证实没有错误率信号的负载感知无法解决此故障模式。在两类长提示词工作负载下以10 RPS测量。

模式

泄漏率

长提示词成功率

检测机制

Solyx

0.43%

99.57%

错误率信号 → 自动降权

最少请求

28.71%

71.29%

无(反感知:失败 → 计数降低 → 更多流量)

轮询调度

32.11%

67.89%

6.7 遥测故障下的优雅降级

对于九个单元中的每一个,在负载中杀死DCGM导出器。控制平面检测到缺失的遥测源,升起dcgm_fallback标志,v3评分器继续使用仅vLLM信号。所有九个单元在DCGM宕机期间的平均成功率为99.90%,回退在一秒内生效(平均824毫秒)。没有流量被丢弃。这验证了Solyx在遥测源故障下优雅降级——这是生产部署所需的属性,因为单个遥测组件可能独立故障或重启。

6.8 网络感知放置

网络感知放置评估在五种网络条件下评估了三种路由分支,以分离RTT和抖动信号的贡献:轮询调度(无信号感知)、Solyx-仅GPU(8种硬件和应用信号,无网络信号)和Solyx-10信号(完整评分器,含RTT和抖动)。20毫秒抖动诱导子阶段在站点B路径上提升WAN抖动,而站点A和C不受影响。

表7:网络感知放置结果。“网络信号增益”是从Solyx-仅GPU到Solyx-10信号的改进,分离了RTT和抖动信号的贡献。在所有子阶段中,Solyx-10信号的P95平均比轮询调度低42%。

子阶段

RR P95

Solyx 仅GPU

Solyx 10信号

网络增益

near_idle

587 ms

562 ms

491 ms

12.6%

symmetric

712 ms

678 ms

547 ms

19.3%

saturation

1,842 ms

1,247 ms

901 ms

27.7%

jitter 20ms

1,971 ms

1,583 ms

1,142 ms

27.8%

recovery

824 ms

712 ms

561 ms

21.2%

三分支比较设计分离了两种不同的路由价值来源:硬件和应用信号感知(Solyx-仅GPU vs. RR,构成了改进的大部分)和网络信号感知(Solyx-10信号 vs. Solyx-仅GPU,根据网络条件提供了额外的12–28%的P95降低)。在站点间网络路径质量存在显著差异的饱和和抖动条件下,网络信号的贡献最大。

6.9 第一阶段:异构集群结果

在12 RPS的同构H100集群上,所有三种路由策略在中位数延迟上趋于一致——正如在统一硬件上预期的那样。决定性的差异在于P99尾部:轮询调度由于队列盲旋转将请求堆积到正在处理慢速生成的副本上,产生了9,894毫秒的延迟。最少请求和Solyx都将P99降低到约7,140毫秒,减少了27.9%。在接近饱和时(20 RPS),三种策略趋于一致(P99相差在0.3%以内:RR 7,172毫秒,LR 7,170毫秒,Solyx 7,154毫秒),证实在负载下没有回归。正是这个20 RPS的收敛点,而非表8的12 RPS结果,定义了第7.1节讨论的饱和边界条件。

表8:第一阶段同构基准测试(6× H100 SXM,12 RPS)。P99尾部差异是主要区分点;中位数延迟在统一硬件上收敛。

指标

轮询调度

最少请求

Solyx

Solyx vs. RR

P50 (ms)

6,898

6,893

6,896

P95 (ms)

7,183

7,074

7,076

−1.5%

P99 (ms)

9,894

7,151

7,138

−27.9%

成功率

99.1%

100.0%

99.9%

+0.8 pp

在12 RPS的硬件异构集群(H200 + H100 + 受限H100)上,Solyx和最少请求都检测到性能差异,并将流量集中到更快的端点,产生约5,970毫秒的P50(轮询调度为6,730毫秒,−11.3%)和7,042毫秒的P99(轮询调度为7,791毫秒,−9.6%)。机制是实时的xDS端点权重分布:H200端点获得权重134,无约束H100获得权重134,受限H100端点获得权重1——这是由实时遥测在无操作员配置下产生的134:1比例。

表9:第一阶段硬件异构测试期间的实时xDS端点权重。134:1的集中比例由闭环评分系统产生,无需操作员配置。

端点

GPU

权重

状态

19000 / 19001

H200 SXM ×2

134

快速、健康 — 最大流量

19002

H100 SXM

1

已杀死 — 心跳TTL过期

19003

H100 SXM

134

健康、无约束

19004 / 19005

H100 SXM (受限)

1

max_model_len=1024 — 被错误率信号降权

在20 RPS的能力错配配置下,Solyx保持99.9%的成功率,而轮询调度为69.9%(每2,400个请求防止了720次失败)。第一阶段结果使用了不含网络信号的8信号评分器;使用10信号v3评分器的第二阶段复现(第6.6节)在不同硬件代际的更大集群上证实了这一发现。

7 讨论

7.1 边界条件:Solyx收效甚微之处

存在一个特定的运行状态,在此状态下Solyx与最少请求收敛,且无法提供可测量的优势:一个同时满足同构、饱和、无故障和网络稳定的集群。当每个副本完全相同、每个副本都同等且完全满载、没有副本性能下降、且每个网络路径都均匀时,任何路由器都没有可利用的有效信号。第一阶段同构H100在20 RPS下的结果(第6.9节)正是这种边缘情况,我们诚实地报告了这种收敛:三种路由器彼此之间的差异在噪声范围内。

重要的是不要过度概括这一边界条件,因为必须同时满足所有三个限定条件才适用,而生产中的同构集群很少同时满足这三个条件。移除任何一个限定条件都会恢复Solyx的优势,而同构多站点Blackwell SE的结果(第6.2节)恰恰证明了这一点。该集群在硬件上是同构的,但Solyx在所有八类工作负载的第二级SLO下实现了1.56–1.75倍的吞吐量——因为测量是在SLO拐点而非饱和点进行的,那里存在可路由的余地。同一实验表明,一旦引入故障(硬件遥测领先时间、故障转移和遥测故障评估)或网络变化(网络感知放置评估),同构集群就会获得显著收益。因此,这里描述的收敛是关于一个运行点的狭窄且诚实的陈述,而非关于同构集群的一般性主张。

实际意义是:Solyx适用于任何经历低于饱和负载、硬件退化、配置漂移、运行故障或多站点网络变化的集群——这描述了一大类生产多站点集群。相比最少请求,边际收益仅在持续处于饱和状态、无故障且无网络变化的同构单模型集群上才很小,而这种情况并不描述真实的多站点生产服务。在实践中,生产多站点集群几乎持续地偏离这种收敛角落:公共互联网WAN路径在秒级时间尺度上表现出RTT和抖动波动,局部热节流或PCIe争用会在无预警的情况下使个别GPU性能下降。每一次这样的扰动都会重新引入Solyx可以利用而信号盲路由器无法利用的有效信号。因此,收敛状态不仅是狭窄的,而且是短暂的——集群很少能在其中停留超过短暂的时间间隔。

7.2 堆栈定位

Solyx AI Grid 并非 NVIDIA Dynamo 或 vLLM Router 等集群内路由系统的替代品。那些系统在集群内执行KV缓存感知调度;Solyx选择将给定的请求路由到哪个集群。这些是互补的层次。一个完整的多站点推理堆栈应在每个站点内部署一个集群内路由器,并在其上方部署一个跨站点控制平面。NVIDIA AI Grid参考架构 [10] 已经描述了一个逻辑上统一地理分布式站点的控制平面,并使用实时健康、容量、延迟、成本和策略信号进行放置和路由,作为分布式AI基础设施的“编排”层。我们的工作并非与此愿景竞争,而是对其进行了验证:Solyx AI Grid是该控制平面层的具体实证实现,具有特定的DCGM/vLLM/RTT评分实例化,并在物理多站点基础设施上获得了测量结果。据我们所知,此前没有公开工作对参考设计的路由层进行过此类实证验证。

7.3 DCGM领先时间发现

DCGM硬件信号出现与应用层SLO违规之间的平均11.2秒领先时间(第6.3节)是我们认为具有最广泛影响的成果,超越了路由本身。它实证确立了GPU硬件遥测携带了应用层性能下降的预测信号。对任何基础设施运营商的实际意义是:局限于应用层指标(TTFT、队列深度、错误率)的监控栈将永远被动响应。硬件遥测集成使得主动排空成为可能。量化跨硬件代际和应力类型的领先时间分布是这项工作的自然延伸。

7.4 普适性

我们结果的几个方面可能推广到我们的部署规模之外。能力错配故障模式随集群异构性扩展,并非特定于九GPU部署。硬件遥测相比应用指标的优势是信号层级本身的属性,而非集群规模。心跳TTL检测的故障转移恢复优势在任何基线是基于轮询健康检查的场景下都存在。不太清楚的是:在非常高副本数量下的压力评分准确性(我们的部署有六和九个副本);跨站点路由与大规模下KV缓存前缀局部性之间的相互作用;以及在相关多站点故障下的行为。

7.5 局限性

两个阶段都使用了供应的GPU云基础设施,而非自有的裸金属。都使用了合成工作负载而非真实用户流量,尽管第二阶段的工作负载类别旨在反映生产现实的请求分布。第二阶段在每个站点内的同构硬件上评估了单一模型(Llama 3.1 70B AWQ INT4);跨阶段的跨站点异构硬件配置是自然延伸。两个阶段均未评估成本影响或能源效率。0.2毫秒的控制平面路由更新开销代表了当前实现。还有几个进一步的维度未被验证,并限制了本研究的声明。

  • 控制平面可扩展性。我们的部署包含六和九个副本;控制平面以1 Hz的稳态为九个副本推送了超过50,000个xDS快照而没有压力,但我们没有刻画当扩展到数百或数千个分布式节点时的控制平面计算和网路开销。我们刻意拒绝对此状态进行建模,而非从九副本测量进行推断;量化控制平面扩展行为是未来必要且独立的工作路线。

  • 多模型路由。两个阶段都服务于单一模型;在未评估具有不同能力的异构模型副本间进行路由。

  • 大规模下的KV缓存局部性。我们没有刻画在大量副本下,跨站点路由与KV缓存前缀局部性之间的相互作用,在那里局部性保持和压力最小化目标可能发生冲突。

  • 成本优化。两个阶段均未评估每token成本或每请求能耗,这两者都是面向购买者的效率指标。

  • 相关区域故障。我们的故障转移测试杀死单个副本;我们没有评估在多个站点同时故障的相关多站点性能下降下的行为。

7.6 未来工作

两个方向直接源于上述局限性,值得简要描述,尽管我们尚未实现或评估其中任何一个。

  • 控制平面扩展架构。我们的控制平面处理了九个副本,单个聚合进程以1 Hz稳态推送超过50,000个xDS快照而没有压力。我们不声称在更大规模下有实测性能,但架构路径是分层聚合拓扑:每个区域子控制器各自维护其本地单元的心跳和遥测状态,并计算区域压力摘要,而顶层控制器使用这些摘要而非原始每单元信号进行跨区域路由。这限制了无论总集群规模如何的每控制器扇入,并将高频(500毫秒)心跳流量限制在区域内链路。量化这种拓扑在数百到数千个单元下的开销和收敛行为是必要的工作;我们刻意不从九副本测量推断性能指标。

  • 平衡压力最小化与KV缓存局部性。在大量副本下,将请求路由到压力最低的单元可能与KV缓存前缀局部性冲突:压力最低的单元可能不持有多轮会话的前缀缓存,迫使重新计算从而抵消路由收益。一个自然的扩展是混合目标,将压力分数与前缀亲和项相结合,当单元压力处于全局最小值的容差带内时,偏向路由到已持有相关缓存状态的单元。这将把我们压力最小化的方法与SkyWalker等系统的局部性保持工作联系起来。我们将其勾勒为一个设计方向,而非经过验证的结果。

8 结论

我们展示了一项针对硬件遥测感知的跨站点LLM推理路由的双阶段、七部分的实证研究,覆盖了八类工作负载、三种集群配置和三种路由策略下的216个单元。在两阶段实验中,Solyx AI Grid 证明,将GPU硬件遥测、vLLM应用指标和实时网络路径信号整合进逐请求放置决策中,能在多站点部署特有的每种故障模式上产生具体、可衡量的改进。

核心结果包括:在同构集群上降低27.9%的P99尾延迟;在异构集群上实现134:1的自动流量向健康端点集中;将能力错配泄漏率降至0.43%,而轮询调度为32.11%、最少请求为28.71%,从而获得99.57%的长提示词成功率(轮询调度为67.89%,最少请求为71.29%),并证实最少请求在此故障模式下几乎与轮询调度一样失效;在所有八类工作负载的第二级SLO下实现1.56–1.75倍的吞吐量;DCGM信号平均比SLO违规提前11.2秒,实现主动流量排空;故障转移P99为1,247毫秒,而轮询调度为4,226毫秒;在抖动下仅网络信号就带来27.8%的额外P95 TTFT降低;在DCGM导出器实时故障时保持99.90%的成功率;以及所有配置下0.2毫秒的控制平面路由更新开销。第一阶段在H100/H200硬件上单独证实了能力错配的发现,Solyx保持了99.9%的成功率,而轮询调度为69.9%。

我们相信这项工作为多站点推理路由作为一个独特的系统问题,以及硬件遥测集成作为一类具有超越单纯应用层指标预测价值的路由信号,奠定了实证基础。这里刻画的故障模式是多站点部署结构的架构后果,并将跨越硬件代际持续存在。我们邀请社区将这一实验框架扩展到更大的集群、跨站点异构硬件配置和多模型服务场景。

附录A 评估方法与指标定义

本附录定义了论文中报告的每个指标。所有第二阶段指标均由后处理分析器根据每个评估阶段捕获的原始每请求NDJSON日志、故障注入时间戳和Prometheus遥测快照计算得出。

TTFT(首令牌时间)。从网关发送请求到收到第一个流式token的经过时间,按请求测量,并报告为窗口内请求流的P50/P95/P99百分位数。

E2E延迟。从请求发送到最终token的端到端挂钟时间,按请求测量。

SLO下的可持续RPS。满足P95 TTFT ≤ SLO目标且成功率 ≥ 0.95的最高恒定请求速率,通过8–12步的二分查找找到。每一步运行45秒的恒定速率流量,包含30秒预热和15秒冷却;冷却窗口不计入分子和分母,以避免将关闭取消计为失败。

泄漏率(能力错配)。长提示词请求——即上下文长度超过受限单元max_model_len的请求——中被路由到受限单元并因此被HTTP 400拒绝的比例。分母是受影响窗口内的长提示词请求;分子是落在受限单元上的子集。在两类长提示词工作负载下以10 RPS测量。

重路由P99(故障转移)。在持续负载下对一个vLLM进程发送SIGKILL后,流量成功重路由到健康端点的每请求时间,报告为杀进程后窗口的P99。

路由反应P95(突发)。从突发开始到响应它的路由权重调整的P95经过时间。

杀进程后成功率。杀进程后窗口内成功的请求比例,下限为杀进程瞬间飞行中的请求。

DCGM领先时间。在受控热或PCIe应力注入下,压力分数越过预配置警报阈值与P95 TTFT将越过SLO阈值之间的经过时间。正领先时间表示硬件遥测预见了应用层性能下降。

控制平面路由更新开销。一次控制循环添加的延迟,测量为投影周期加上xDS构建时间(微秒),作为Prometheus仪表暴露。这是控制平面更新成本,而非每请求数据平面延迟;数据平面是未修改的Envoy,不添加任何Solyx特定的每请求开销。

附录B 基线配置与公平性控制

所有三种路由模式都在相同的硬件、相同的vLLM实例和相同的工作负载上评估;只有路由逻辑在运行间不同。轮询调度是无状态的顺序轮转,除了为所有三种模式相同配置的基线Envoy健康检查行为外,没有负载、能力、硬件遥测或网络路径感知。它代表了否则未配置的Envoy/Nginx/HAProxy部署的默认行为。最少请求路由到发送时飞行中请求最少的端点,这是标准的Envoy LEAST_REQUEST策略和最常用的生产主动负载均衡策略。Solyx使用10信号加权压力评分器,通过xDS推送权重。基线模式通过单个控制平面标志(--baseline)激活,该标志禁用压力评分和放置,同时保持堆栈其余部分不变,确保比较隔离了路由逻辑。评分参数在活动前固定,未按工作负载类别调整;相同的评分器配置用于所有216个单元。

附录C 统计处理

SLO矩阵包含216个单元(8类工作负载 × 3种路由模式 × 3个SLO等级 × 3个副本)。每个单元都满足 ≥ 500个样本的完整性标准;所有单元观察到的最小值为624个样本。头条第二级吞吐量值报告为三个副本的中位数。TTFT改进声明(Solyx赢得所有八类)是通过Solyx和轮询调度之间不重叠的自举置信区间确立的,而不仅仅是点估计。整个活动中最大样本间间隙为1,432毫秒,在数据完整性界限5,000毫秒之内。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询