STR-Agent:一种用于 LEO 卫星网络中 QoS 感知路由的 LLM 驱动智能体
大家读完觉得有帮助记得关注和点赞摘要LEO 卫星网络具有动态拓扑、时变链路和多样化服务需求这使得传统路由方案难以支持细粒度的服务质量QoS保障。现有研究主要在网络状态上以预定义目标优化路由但很少解决将非结构化自然语言服务请求转化为自适应路由决策这一实际挑战。为弥合这一差距我们提出 STR-Agent一种用于 LEO 卫星网络中 QoS 感知路由的 LLM 驱动框架。STR-Agent 的关键创新在于将意图感知、基于工具的执行、经验积累和基于反思的策略自适应统一在单一智能体架构中。具体而言感知模块将自然语言请求转换为结构化路由语义而反思模块根据实时拥塞条件和历史路由结果动态调整服务到路由策略的映射而不是依赖固定路由目标。此外我们开发了一个专用感知模型并构建了一个面向 LEO 服务理解的领域特定监督微调数据集。在 Walker–Delta 星座中的仿真结果表明STR-Agent 显著优于传统基线与 DQ-Dijkstra 相比端到端延迟降低高达 60%监督微调后平均意图理解准确率从 45.4% 提高到 92.45%反思模块在 600 Mbps 下进一步降低延迟 120 ms。这些结果展示了 LLM 驱动智能体架构在未来 LEO 卫星网络中实现服务感知和自适应 QoS 路由的潜力。索引词 LEO 卫星网络、STR-Agent、大语言模型I 引言随着低地球轨道LEO卫星星座的大规模部署LEO 系统正在成为全球通信的关键基础设施 [1]。与中地球轨道MEO和对地静止地球轨道GEO卫星相比它们提供更优的部署灵活性、增强的频谱效率和更低的链路损耗 [2]。因此许多 LEO 计划旨在部署数万颗卫星并将其与地面蜂窝网络集成以实现无缝全球连接 [3]。然而LEO 网络本质上是动态的具有高节点移动性和快速变化的星间及星地链路 [4]这与相对静态的地面网络根本不同。因此地面路由机制通常无法适应拓扑演化和链路变化导致路径失配、转发效率下降和服务质量不稳定 [5]。因此具有实时网络感知和自适应决策能力的路由策略至关重要。人工智能的最新进展已将 LEO 路由从传统静态方法转向数据驱动、基于学习的方法 [6]。重点已从基于固定规则的路径选择转向学习网络状态、预测链路动态和优化路由决策 [7]。特别是基于强化学习的路由算法在动态环境中提供更强的适应性 [8]。然而LEO 网络中现有基于学习的路由方法仍面临两个重要局限。第一其优化目标通常在训练期间预定义且固定难以在异构服务间灵活平衡延迟、吞吐量、负载均衡和可靠性 [9]。随着地面和卫星网络日益集成用户应用呈现越来越大的多样性不同服务施加不同的 QoS 要求 [10]。第二大多数方法将路由优化与服务理解解耦假设服务类型、优先级或 QoS 要求是结构化输入而用户需求通常以自然语言表达。现有方法可以优化预定义目标但无法解释服务意图、提取关键约束并将其转化为 QoS 感知的路由动作 [11, 12]。这一局限在地面–卫星集成网络中更为明显因为细粒度 QoS 保障既需要路径优化也需要准确的服务理解。因此关键挑战是在统一框架内桥接自然语言服务语义和 QoS 感知路由动作。为解决该问题我们将 LEO 网络中的 QoS 感知路由表述为闭环意图到路由问题其中自然语言请求被转换为结构化服务语义然后根据网络拥塞和历史路由结果映射到自适应路由策略。基于此我们提出 LLM 驱动的卫星任务感知路由智能体STR-Agent将感知、执行、经验缓冲区和反思集成到统一的感知–执行–反思框架中用于服务理解、路由、经验总结和策略细化。为提高 LEO 路由场景中的领域理解我们进一步构建了面向服务请求理解的领域特定数据集并开发了专用感知模型。主要贡献总结如下• 我们提出 STR-Agent一种用于 LEO 卫星网络的闭环意图到路由框架通过协调的感知、执行、经验缓冲和反思将自然语言服务请求转换为结构化路由语义并进一步转换为 QoS 感知路由动作。• 我们提出一种自适应服务到算法映射机制利用当前拥塞概况和总结的路由经验动态地为不同服务类型分配路由策略而不是依赖固定路由目标。• 我们构建了一个面向 LEO 服务请求理解的领域特定监督微调数据集并通过意图理解和路由实验验证感知与反思模块对 QoS 感知路由性能的贡献。图 1 展示了 STR-Agent 工作流。给定自然语言服务请求STR-Agent 识别服务意图并通过工具执行和反思驱动策略调整执行多跳路由。图 1STR-Agent 在 LEO 卫星网络中用于 QoS 感知路由的工作流。II 系统模型我们考虑用于全球宽带服务的 Walker–Delta 低地球轨道LEO巨型星座。网络被建模为时变图并在星间链路ISL上进行分组转发。星座、链路、延迟和面向 QoS 的路由目标定义如下。II-A 星座模型星座记为 (N_p, N_m, F)其中 N_p 是轨道面数量N_m 是每面卫星数量F 是相位因子。卫星总数为 N N_p N_m。每颗卫星在高度 H 运行轨道半径 r R_e H其中 R_e 是地球半径。在时间 t网络表示为 G(t) (V, E(t))其中 V 和 E(t) 分别表示卫星集和活动 ISL 集。每颗卫星维持四条链路包括同一轨道面内的两条轨内链路和到相邻轨道面的两条轨间链路形成规则网格拓扑。II-B 链路模型对于任意活动链路 (i, j) ∈ E(t)令 p_i(t), p_j(t) ∈ ℝ³ 表示卫星 i 和 j 的位置。星间距离为 d_ij(t) ‖p_i(t) − p_j(t)‖₂。假设自由空间传播路径损耗为其中 f_c 是载波频率c 是光速。接收功率为 P_{r,ij}(t) P_t G_t G_r / L_ij(t)其中 P_t、G_t 和 G_r 分别表示发射功率以及发射和接收天线增益。由于实际星间链路采用固定调制编码方案我们使用基于 E_b/N_0 的模型近似可达传输速率 [13]其中 E_b/N_0 是所需的每比特能量与噪声谱密度比k_B 是玻尔兹曼常数T_s 是系统噪声温度。II-C 延迟模型对于在时间 t 通过链路 (i, j) 传输的大小为 L_p 的分组传播、传输和排队延迟分别为 τ_ij^prop(t) d_ij(t)/cτ_ij^tx(t) L_p / R_ij(t)以及 τ_ij^que(t) L_p Q_ij(t) / R_ij(t)其中 Q_ij(t) 表示卫星 i 上转发到卫星 j 的分组的队列长度。总单跳延迟为图 2所提出的卫星任务感知路由智能体STR-Agent架构。II-D 面向 QoS 的路由目标基于上述模型QoS 感知路由在时变图 G(t) 上执行。对于服务请求 r_k感知模块提取结构化语义并识别服务类型 b_k ∈ {ℬ_delay, ℬ_bw, ℬ_hop}。路由模块随后输出端到端路径STR-Agent 不优化固定的全局指标而是采用依赖服务的目标其中 Π_k(t) 是请求 r_k 的可行路径集J( | b_k, G(t)) 是服务自适应路径成本。对于延迟敏感服务目标是最小化累积延迟即 J_delay() ∑{(i,j)∈} τ_ij(t)。对于带宽敏感服务目标是避免拥塞或高度不平衡区域可写为 J_bw() ∑{(i,j)∈} σ({Q_n(t) : n ∈ (i)})其中 (i) 表示节点 i 的邻居集σ(·) 表示队列长度的标准差。对于尽力而为服务目标是降低路由复杂度和转发开销由跳数近似 J_hop() || − 1。该表述为第 III 节的路由工具提供建模基础路由策略不由固定目标决定而由根据推断服务类型选择的服务自适应成本决定。III 卫星任务感知路由智能体我们提出卫星任务感知路由智能体STR-Agent一种用于 LEO 卫星网络中 QoS 感知路由的 LLM 驱动框架。如图 2 所示STR-Agent 由四个模块组成用于意图解析的感知、用于基于工具的路由构造的执行、用于结果统计的经验缓冲区以及用于自适应策略选择的反思。它们共同形成从自然语言请求到自适应多跳转发的闭环。III-A 感知模块给定自然语言请求 r_k感知模块输出其中 (φ, λ) 表示纬度和经度b_k 表示推断的服务类型。该任务包含两个耦合子任务地理实体提取和服务类型分类。服务类型 b_k 取自 {ℬ_delay, ℬ_bw, ℬ_hop}分别对应延迟敏感、带宽敏感和尽力而为服务。典型输出为{src_lat:51.5°N,src_lon:0.13°W,dst_lat:31.2°N,dst_lon:121.5°E,service_type:delay_sensitive}.这种结构化表示提供下游路由所需的地理端点和服务语义。服务类型预测错误可能导致执行模块调用不合适的路由策略因此意图理解准确率直接影响下游 QoS。III-B 执行模块给定 P(r_k)执行模块首先将源和目标坐标映射到接入卫星对然后通过外部工具调用执行路由。STR-Agent 采用逐跳转发每一步查询当前拥塞概况从反思模块获取服务到算法映射选择路由工具并计算下一跳。这使其能够在线适应时变拥塞。执行模块使用五种工具• 卫星接入工具将地面坐标 (φ, λ) 映射到仰角最高的可见接入卫星• 网络状态工具返回当前拥塞概况其中 Q̄(t) 是平均队列长度Q_90(t) 是第 90 百分位队列长度N_hot(t) 是队列长度超过预设阈值的卫星数量• 延迟敏感路由工具 B_delsy• 带宽敏感路由工具 B_bw• 尽力而为路由工具 B_hop。三种路由算法均基于 Dijkstra 最短路径DSP方法边权根据服务类型变化。权重定义如下。对于延迟敏感流量边权为这偏好低传播和传输延迟。对于带宽敏感流量边权为其中 (i) 表示节点 i 的邻居集Q_n 是邻居 n 的队列长度σ(·) 表示标准差。该指标鼓励通过队列状态更均衡的区域路由从而缓解带宽密集型流量的队列堆积。对于尽力而为流量边权为这退化为最小跳路由。III-C 经验缓冲区经验缓冲区存储并总结跳级路由结果。每一跳后STR-Agent 记录其中 b_h 是服务类型a_h ∈ {ℬ_delay, ℬ_bw, ℬ_hop} 是所选路由工具ℓ_h 是决策时的拥塞水平Q_h^dec 和 Q_h^arr 是转发和到达时观察到的队列长度τ_h 是实现的单跳延迟。为保留拥塞依赖性这些记录被聚合为其中 τ̄_{b,a,ℓ} 表示平均延迟Q̄_{b,a,ℓ}^dec 和 Q̄_{b,a,ℓ}^arr 表示平均队列长度N_{b,a,ℓ} 是样本数。每一跳贡献一条记录摘要在每个请求或时间窗口后以滚动方式更新使近期观测主导策略调整。III-D 反思模块反思模块将当前网络状态和积累经验映射为服务到算法映射其中 a_b(t) 是服务类型 b 的路由工具。正常情况下每种服务类型使用其默认路由工具。当平均卫星队列长度至少为 5或至少 50 颗卫星队列长度超过 5 时反思模块认为网络严重拥塞。然后使用最近反思窗口中的历史跳级记录如果同时存在延迟敏感和带宽敏感记录且带宽敏感记录具有更低的平均每跳延迟则将延迟敏感流量临时切换到 ℬ_bw否则保留默认延迟敏感工具。带宽敏感和尽力而为流量继续分别使用 ℬ_bw 和 ℬ_hop。IV 模型微调为增强 STR-Agent 的感知模块我们微调一个领域特定模型用于将自然语言服务请求映射到结构化路由语义重点在地理实体提取和服务类型识别。IV-A 数据集构建我们构建了一个面向 LEO 卫星网络的监督微调数据集。卫星通信服务被分为三个面向 QoS 的类别即延迟敏感、带宽敏感和尽力而为。对于每个类别参照 3GPP TR 22.822 [14] 选择 14 个代表性场景覆盖紧急通信、数据回传和大规模 IoT 服务等典型 LEO 应用。地理空间由 49 个全球城市实例化从中采样源–目的地对以形成现实服务请求。所有样本由 Qwen2.5-7B 从场景描述和城市对生成采用结构化 {instruction, input, output} 格式。输入是包含上下游位置和场景上下文的自然语言请求输出给出对应的源和目标坐标及服务类型。训练集包含 30,000 个样本每类 10,000 个测试集包含 3,000 个样本每类 1,000 个。IV-B 监督微调我们使用 LoRA 微调 Qwen2.5-7B使模型适应将自然语言服务请求映射到结构化路由语义。这使感知模块能够准确解释多样服务意图并为执行和反思模块提供可靠输入从而实现精确的、面向路由的决策。(a) 平均端到端延迟(b) 平均每跳队列长度(c) 平均每跳排队延迟(d) 平均跳数图 3(a) 不同数据速率下的平均端到端延迟(b) 平均每跳队列长度(c) 平均每跳排队延迟(d) 平均跳数。V 实验在本节中我们通过 Walker–Delta LEO 星座中的仿真评估 STR-Agent。V-A 仿真设置星座配置为 (N_p, N_m, F) (72, 22, 39)对应 1584 颗卫星高度 550 km。载波频率为 23.28 GHz信道带宽为 2 GHz发射 EIRP 为 35 dBW接收机品质因数 G_r/T_s 6.8 dB/K调制方案为 8-PSK目标 BER 为 10^{−7}。LoRA 秩为 8缩放因子为 16dropout 率为 0.05学习率为 2×10^{−4}批量大小为 64训练轮数为 3。服务请求遵循第 IV-A 节的数据集构建。性能按不同服务类型分别评估以反映 QoS 差异化路由行为。路由期间STR-Agent 执行逐跳转发每一步查询当前拥塞概况并相应选择路由工具。表I 意图理解准确率 (%)模型延迟敏感带宽敏感尽力而为平均基础模型78.0249.98.2745.4基于提示的模型82.4186.4973.3280.74基于微调(SFT)的模型97.795.4584.292.45V-B 意图理解评估我们首先在自然语言服务请求上评估感知模块。指标是意图理解准确率定义为源、目的地和服务类型全部正确识别的请求比例。测试集按第 IV-A 节生成。我们比较三种模型基础模型即原始 Qwen2.5-7B基于提示的模型使用任务特定提示以及基于 SFT 的模型按第 IV-B 节微调。如表 I 所示基础模型平均准确率仅为 45.4%表明领域特定解析能力有限。提示将平均准确率提高到 80.74%监督微调进一步将其提高到 92.45%。尽力而为请求始终比其他两类更难。在基础模型中其准确率仅为 8.27%远低于延迟敏感和带宽敏感情况主要因为其语义线索较弱更容易与其他场景混淆。这些结果直接影响下游路由因为错误分类的服务类型会导致不合适的路由工具选择从而解释基础、基于提示和基于 SFT 模型之间的路由差距。V-C 路由性能评估我们在变化流量条件下评估路由性能流量到达建模为泊松过程。数据速率范围为 90 到 270 Mbps覆盖低到高负载条件每次仿真持续 T 10,000 ms。性能按不同服务类型分别评估以反映 QoS 差异化路由行为。我们比较以下方法• DQ-Dijkstra边权结合延迟和队列长度的 DSP平衡延迟和拥塞。• QSMR [15]一种联合考虑传播延迟和剩余链路容量的多路由算法。• STR-Agent (Base)基础模型 STR-Agent。• STR-Agent (Prompt)基于提示的 STR-Agent。• STR-Agent (SFT)基于 SFT 的 STR-Agent。我们使用对应不同服务类型的四个指标延迟敏感流量的平均端到端延迟带宽密集型流量的平均每跳队列长度和每跳排队延迟反映方法的负载均衡能力以及尽力而为流量的平均跳数评估路由简单性和效率。图 3(a) 显示 STR-Agent (SFT) 在整个负载范围内始终实现最低延迟。在 270 Mbps 时它将延迟从 QSMR 的 696.01 ms 降至 260.11 ms而 STR-Agent (Prompt) 从 180 Mbps 起也超过 DQ-Dijkstra 和 QSMR。图 3(b) 和 图 3(c) 显示尽管 DQ-Dijkstra 和 QSMR 在低负载下表现更好但随着负载增加STR-Agent (SFT) 优于基线并且在 270 Mbps 时与 DQ-Dijkstra 相比将平均每跳队列长度从 1.06 降至 0.71每跳排队延迟从 5.22 ms 降至 2.50 ms表明在拥塞条件下具有更强的负载均衡。图 3(d) 显示 STR-Agent (SFT) 在中高负载下实现最小跳数在 270 Mbps 时从 QSMR 的 53.03 降至 25.94。总体而言在三个智能体变体中STR-Agent (SFT) 表现最好STR-Agent (Prompt) 次之STR-Agent (Base) 性能最弱表明更准确的服务理解导致更好的路由策略选择并减少路由策略失配尤其是在中高流量负载下。V-D 反思模块评估图 4延迟敏感流量中反思模块平均延迟的消融研究。我们进一步在高负载条件下评估反思模块比较 STR-Agent SFT (Full) 和 STR-Agent SFT (No Reflect)提供负载建模为泊松过程范围为 350 到 600 Mbps。在后一种设置中每种服务类型始终使用其默认路由工具。图 4 显示反思模块主要在中高负载条件下改善延迟。在 350–400 Mbps 时两种配置的延迟几乎相同表明轻度拥塞下收益有限。随着负载增加差距变得更加明显在 600 Mbps 时平均延迟从 1320 ms 降至 1200 ms。总体而言STR-Agent SFT (Full) 始终实现更低延迟且随着拥塞加剧收益增加。反思模块使 STR-Agent 能够基于历史经验和实时拥塞调整路由避免过载路径这证实了其在高负载条件下对延迟敏感任务的重要性。VI 结论本工作表明LEO 卫星网络中的 QoS 感知路由可以通过 STR-Agent 有效解决这是一种闭环卫星任务感知路由智能体将感知、执行、经验缓冲和反思统一在 QoS 感知控制框架中。STR-Agent 不依赖固定路由目标而是使路由决策适应异构服务需求和变化的拥塞条件。实验结果表明与传统基线相比在延迟和负载均衡性能方面有显著提升。总体而言STR-Agent 为未来 LEO 卫星网络中的自适应和服务感知路由提供了实用方向。未来工作将研究人工标注请求、基于学习的基线和运行时开销。