公司动态
用于RIS辅助大规模物联网系统在线资源分配的帕累托感知分层强化学习
大家读完觉得有帮助记得关注和点赞摘要随着5G和新兴6G网络的快速发展可重构智能表面RIS已成为增强无线通信场景的关键技术。然而优化RIS辅助的多用户系统通常会引入高维物理层变量和非凸的帕累托最优速率集这对实时应用带来了严峻的计算挑战。为克服这些限制本文提出了一种降维的分层强化学习RL框架称为帕累托感知自编码器辅助RLPAAERL以优化RIS辅助物联网IoT网络中的在线资源分配。我们的方法首先用严格代表帕累托最优前沿的低维权重向量替代高维连续RIS波束赋形变量从理论上避免了在凸和非凸速率区域上的几何信息损失。为进一步缓解密集网络中的维度灾难集成了一个自编码器架构来执行二次数据驱动压缩阶段将优先级空间映射到高度紧凑的连续潜在动作空间。在包括多用户移动边缘计算MEC网络在内的实际通信场景中进行的广泛仿真表明与现有最先进的基准相比所提出的PAAERL框架大幅减少了离线训练时间加速了在线策略收敛并显著降低了整体网络成本突显了其在下一代智能物联网环境中卓越的可扩展性和实际可行性。索引词 可重构智能表面强化学习帕累托优化空间聚合物联网I. 引言在下一代B5G和新兴6G无线网络愿景的驱动下物联网IoT正朝着大规模、泛在连接和普适智能的范式转变[1]。为满足现代应用场景如超可靠低延迟通信URLLC[2]和高吞吐量边缘处理的严格服务质量QoS需求移动边缘计算MEC[3]和无人机UAV[4]的集成已成为一种有前景的架构。MEC服务器通过任务卸载缓解了资源受限IoT设备的计算负担而UAV则提供了高度灵活的动态部署以提供空中覆盖[5]。然而这些协作网络的性能仍从根本上受到高频衰落信道固有的严重路径损耗、不可预测的阻塞和多用户干扰的限制。为缓解这些电磁障碍可重构智能表面RIS作为一项革命性技术吸引了广泛关注它能够将无线传播环境从被动的、随机的介质转变为主动的、软件可编程的实体[6]。通过动态调整大规模低成本无源超表面元件的相移和反射幅度RIS可以智能地重塑信道实现并在基站BS和移动用户MU之间建立稳健、有效的视距LoS链路[7]。尽管具有这些范式转变性的优势但BS端主动波束赋形变量和RIS端无源反射变量的联合优化带来了巨大的数学难题。传统的优化框架——如交替优化AO[8]和逐次凸逼近SCA[9]——本质上是迭代的并且随着RIS元件和IoT设备数量的增加而扩展性变差。在单个信道相干时间内解决这些高维、紧耦合的非凸问题会带来难以承受的计算延迟使得传统的模型驱动范式在高动态IoT环境中无法进行实时的在线部署。为优化多目标或多用户网络刻画可实现速率区域的帕累托最优边界是基础。现有文献中最常用的方法是线性标量化技术即加权和速率最大化问题[10]。通过为不同用户分配固定或动态的优先级权重高维资源配置被有效地映射到帕累托前沿上。在速率区域为凸的假设下通过支撑超平面顺序调整优先级轮廓可以描绘出可行速率空间的整个上边界。然而由于严重的多用户干扰、收发器硬件限制和非线性级联信道链路实际RIS辅助多用户网络的真实可实现速率区域本质上是非凸的。先前的工作[11, 12]已指出在非凸速率空间中线性加权和速率最大化仅作为外部近似。因此通过传统加权和速率公式操控优先级权重不可避免地会经历信息损失无法捕获或达到位于边界“凹陷”或非凸部分的帕累托最优解区间。为绕过在线优化的计算开销强化学习RL已成为实时资源管理的强大范例[13]。RL智能体通过与无线环境的持续交互学习近优控制策略将繁重的计算负担转移到离线阶段并通过神经网络推理在线快速执行决策[14]。文献[15]提出了一个双延迟深度确定性策略梯度TD3框架用于在现实、非理想RIS幅度损伤下优化联合主动/被动波束赋形和有限块长分配以满足工业自动化中URLLC的严格要求。尽管如此将标准的连续RL算法如深度确定性策略梯度DDPG、软演员-评论家SAC、TD3或近端策略优化PPO直接应用于RIS系统会遭遇严重的动作空间爆炸[16]。一个标准的RIS配置向量包含数百个连续幅度和相位控制变量导致极其庞大的探索空间。在未压缩的高维动作空间下RL智能体通常收敛缓慢、梯度不稳定甚至完全无法发现有意义的奖励路径。虽然一些现有工作尝试离散化动作空间或使用多智能体RLMARL来拆分变量负载[17]但它们常常破坏了主动波束赋形和无源反射之间的耦合物理特性导致系统性能下降。I-A 动机与贡献与上述研究不同本文旨在弥合RIS场景中模型驱动几何最优性与数据驱动学习效率之间的差距。我们先前的工作[18, 19, 20]对RIS场景中的类似优化问题做出了一些贡献。我们不是强迫RL智能体直接学习RIS组件的原始物理参数这会引发灾难性的动作空间爆炸也不是依赖在非凸域中遭受信息损失的常规加权和速率轮廓[21]而是引入了一个定向最大-最小缩放优化问题。通过从低尺度权重向量到精确帕累托最优集的、基于方向的、双射映射构建我们在没有任何理论信息损失的情况下降低了搜索维度。为进一步加速高动态IoT环境中的在线执行我们将此几何映射与数据驱动的自编码器AE架构[22]无缝耦合。我们提出了一种帕累托感知自编码器辅助RLPAAERL算法用于解决RIS辅助大规模物联网系统中的在线资源分配问题。AE将权重空间压缩到超低维潜在表示中迫使DRL智能体在高度紧凑的动作空间中运行而伴随的解码器则高效地重构目标优先级向量。这种混合模型加数据压缩策略为复杂的RIS辅助IoT系统中的实时在线优化实现了一种高效的分层决策架构。I-B 符号说明在本文中小写字母x、粗体小写字母x和粗体大写字母X分别表示标量、向量和矩阵。|x|是标量x的绝对值。x*是标量x的复共轭。条件期望{x|y}表示给定条件y下随机变量x的期望值关于x给定y的条件分布计算。||x||是向量x的2-范数。此外X^T、X^H和|X|分别是矩阵X的转置、共轭转置和行列式。diag(x)是一个以向量x为对角线的方阵。符号(⋅)表示算法计算复杂度的渐近上界。本文中的其他主要符号总结在表I中。II. 系统模型如图1所示我们考虑一个RIS辅助的多用户无线通信系统其中每个MU连接到一个单独的BS。此系统模型中RIS的部署旨在通过动态调整反射信号的幅度和相移来提高无线通信信道的质量从而提高资源利用率、减少干扰并增强信号强度。表 I参数符号参数符号k, mMU 和 RIS 元件索引K, MMU 数量和 RIS 元件数量t, ΔT时隙索引和时隙长度fₖMU 处的发射波束赋形向量Hₖ从 MU 到 BS 的 CSIG_Re从 RIS 到 BS 的 CSIH_Re,k从 MU 到 RIS 的 CSIσ²噪声方差对角 RIS 相移矩阵θₘ, βₘRIS 元件的相位和幅度Rₖ可达数据速率 (bit/s/Hz)ℛ可达速率区域a, sRL 的动作和状态rRL 的奖励图 1 上行 RIS 辅助物联网系统的无线通信模型。II-A 信道模型我们考虑一个系统其中发射信号x被一个M元件的RIS反射到接收器y。接收信号建模为其中h_m和g_m是第一和第二链路信道系数θ_m和β_m分别代表RIS相位和幅度η是方差为σ²的噪声。如图1所示我们考虑多个MU分别连接到单个BS的上行无线通信模型并忽略小区间干扰。在RIS辅助的多用户无线通信系统中每个MU有N_MU根天线而BS有N_BS根天线。系统控制器可以通过设计RIS的反射相移来提高能量和频谱效率RIS由M个反射元件组成。连接到BS的K个MU需要计算卸载。从第k个MU发送到BS的无线信号sₖ由下式给出其中fₖ表示第k个MU用于向BS发送符号向量的发射波束赋形向量xₖ表示从第k个MU发送到BS的符号。因此在BS处接收到的信号可以写成其中 diag{β₁e^{jθ₁}, β₂e^{jθ₂}, …, β_Me^{jθ_M}}表示RIS相移和幅度的对角矩阵{θₘ, βₘ}是RIS第m个反射元件的相移和幅度[23]n是方差为σ²的噪声向量。如图1所示MU-BS链路、RIS-BS链路和MU-RIS链路的CSI分别为Hₖ、G_Re和H_Re,k。MU表现出准静态特性而完美CSI随时间隙t变化。每个时隙具有固定持续时间ΔT当前时隙内发生的所有事件在下一个时隙处理。因此这里的三个CSI参数Hₖ、G_Re和H_Re,k可以写成Hₖ(t)、G_Re(t)和HRe,k(t)。为简化表达引入H̄ₖ(t)在式(3)中当我们关注从第k个MU到BS的发射信号时y(t)可以分解为接收信号、额外干扰和附加噪声。因此不同的分量如式(5)所示II-B 优化目标首要目标是在特定问题中为MU k最小化可达数据速率Rₖ和其他优化变量的成本函数f_obj定义如下其中Q表示特定问题中的其他优化变量 {f, β, θ, Q}代表所有优化变量f {f₁, f₂, …, fₖ}代表所有波束赋形向量R [R₁, R₂, …, R_K]^T 是可达速率向量Pₖ^max是MU k的最大传输能量。III. 提出的分层决策算法III-A 通过帕累托优化降维在所考虑的RIS辅助IoT上行网络中系统性能由应用特定变量Q例如资源分配或任务卸载参数和可达速率向量R [R₁, R₂, …, R_K]^T 表征后者是发射波束赋形向量f {f₁, f₂, …, fₖ}、RIS相移向量θ [θ₁, θ₂, …, θ_M]^T 和RIS幅度向量β [β₁, β₂, …, β_M]^T 的函数。所有优化变量 {f, β, θ, Q}的可行集受功率预算、RIS硬件限制其中0≤βₘ≤1且0≤θₘ2π、QoS和其他特定要求的约束。系统的可达速率区域定义为可以同时达到的所有速率向量的集合其中γₖ表示用户k的信干噪比SINR无论底层目标函数无论是涉及延迟最小化、能量效率还是和速率最大化的非凸性或复杂性如何任何高效的工作点都必须位于ℛ的帕累托边界上。形式上速率向量R是帕累托最优的如果不存在其他可行的R ∈ ℛ使得对所有k有Rₖ ≥ Rₖ且至少对某个j有Rⱼ Rⱼ*。关注帕累托边界的理由有两方面资源效率ℛ内部的任何点都是严格次优的因为至少可以通过重新配置{f, β, θ}来提高一个用户的速率而不损害其他用户。统一表示通过刻画帕累托前沿我们将物理层资源交互由RIS和波束赋形控制与高层策略或效用函数解耦。因此对{f, β, θ, Q}的高维优化可以等价地简化为寻找一个权重向量ω或优先级轮廓映射到帕累托边界上的特定点。这种降维对于在线IoT优化至关重要能够在以复杂变量耦合为特征的环境中实现实时决策。标准RIS优化需要求解波束赋形向量fₖ、RIS相位θₘ和幅度βₘ。我们建议使用与帕累托最优解集相对应的权重向量ω而不是直接优化这些变量。ω的维度远低于原始RIS变量。III-B 加权和速率优化虽然加权和速率优化很成熟但它需要在时隙t求解一个传统的最大加权和速率问题其中ωₖ是BS处第k个MU的权重。显然给定一组{ωₖ, ∀k}可以求解出一组{fₖ, βₘ, θₘ, ∀k, m}。我们可以使用式(6)计算{Rₖ, ∀k}。通过求解P2我们获得了一组从{ωₖ, ∀k}到{Rₖ, ∀k}的映射。对于任何给定的ω此线性标量化的解产生一个速率向量R(ω)理论上保证位于帕累托边界上。然而为了证明在分层决策框架中用低尺度权重向量ω替代高维变量{f, β, θ, Q}是合理的由ω生成的所有点的集合必须覆盖整个帕累托前沿。我们认为当可达速率区域ℛ是凸集时最大化加权和速率是帕累托边界的充分表征。具体来说根据支撑超平面定理对于凸集ℛ上边界上的任何点R存在一个具有非负法向量ω的支撑超平面使得ω^T R≥ ω^T R 对所有R ∈ ℛ成立。这意味着每个帕累托最优点都可以通过求解具有相应权重轮廓的加权和速率问题来恢复。在此背景下权重向量ω充当了RIS配置的充分统计量捕获了达到任何最优资源分配状态所需的所有自由度。虽然RIS辅助IoT系统的干扰受限性质通常导致非凸速率区域但可以通过如时间共享等策略实现ℛ的凸包。在此类条件下从ω到ℛ的映射确保了对操作相关的帕累托区域的完全覆盖从而验证了所提出的降维方法。III-C 向非凸速率区域和定向映射的推广虽然理论上可以通过时间共享策略确保可达速率区域ℛ的凸性但这种方法在RIS辅助IoT系统中遇到了重大的实际障碍。具体来说在单个传输帧内频繁重新配置RIS相移和幅度会给控制链路带来过高的开销并可能超过硬件开关速率限制。因此在准静态时隙内由于RIS反射系数与多用户干扰之间的复杂耦合速率区域ℛ通常是非凸的。在此类非凸场景中传统的加权和速率最大化可能无法捕获位于帕累托边界“凹陷”或非凸部分的点。为规避此限制并确保在不依赖凸性假设的情况下全面刻画帕累托集我们提出了一种基于定向映射的替代优化框架。我们观察到对于任何高维帕累托最优点R从坐标原点出发穿过R的射线是唯一的。这意味着帕累托最优点集与正象限中的方向向量集之间存在一一对应关系。通过利用这一几何性质我们可以使用归一化权重向量ω来参数化整个帕累托前沿ω现在代表射线的斜率而不是加权和速率问题中支撑超平面的法线。为找到与特定方向ω相关的唯一帕累托最优点我们制定了以下优化问题在此公式中R_s充当缩放因子沿方向{ω₁^P^T, ω₂^P^T, …, ω_K^P^T}推动速率向量直到达到可行区域ℛ的边界。与加权和速率方法不同这种最大-最小缩放方法保证无论区域是凸还是非凸都能达到帕累托边界上的任何点。这种变换有效地将最优RIS配置的搜索空间从高维物理变量降低到低尺度方向权重空间为我们的分层RL决策算法提供了坚实的理论基础。III-D 问题转化与求解方法问题P3是一个非凸优化问题原因如下首先由于多用户干扰和有效信道中优化变量的乘积可达速率Rₖ是波束赋形向量f {f₁, f₂, …, fₖ}和RIS参数{β, θ}的非凸函数。其次f的恒定功率约束和θ的相移约束定义了非凸可行集。为应对这些挑战我们观察到对于固定的{f, β, θ}目标R_s是线性约束的而对于固定的R_s问题简化为一个可行性检查。利用此结构我们提出了一个双层求解框架。III-D1 外层R_s的二分搜索由于可达速率受系统物理容量限制最优R_s*可以通过在区间[0, R_max]上进行二分搜索高效找到。III-D2 内层可行性子问题对于给定的候选R_s R̄_s我们求解一个可行性问题以确定是否存在满足所有约束的配置{f, β, θ}因此可行性子问题可以简化为其中Γₖ 2^{ωₖ^P^T R_s} - 1 是一个常数。可行性子问题P4a本质上是非凸的主要有两个因素主动波束赋形向量f与无源RIS反射系数嵌入在H̄中之间的强耦合以及信干噪比SINR约束中下界二次项的非凸性。首先我们松弛P4a的可行性问题其中dₖ是约束(14a)的松弛因子。为将P5转化为易处理的形式我们使用交替优化AO框架解耦变量并通过逐次凸逼近SCA凸化约束。此外令v [v₁, …, v_M]^T ∈ ℂ^{M×1} 表示RIS反射向量其中vₘ βₘ e^{j θₘ}。III-D3 主动波束赋形优化固定RIS系数对于在第n次迭代给定的RIS配置v^(n)有效信道H̄ₖ是固定的。P5中的SINR约束可以表示为此约束仍然是非凸的因为左侧是形成下界的凸二次函数。为解决此问题我们利用一阶泰勒展开构造全局线性下估计器来应用SCA技术。对于任何给定的局部点fₖ^(n)信号功率受限于通过用其凸代理ℒ(fₖ, fₖ^(n))替换非凸项并将严格的等式功率约束松弛为已知在最优处紧的凸不等式波束赋形优化子问题变为问题P5a是一个标准的凸二次约束问题QCP可以通过内点法使用如CVX等求解器最优求解。III-D4 RIS配置优化固定波束赋形接下来我们在固定波束赋形向量{fₖ, ∀k}的情况下优化RIS反射向量ṽ。用户k的接收信号功率可以重新公式化以分离ṽ其中v_i^是v_i的复共轭a_{k,i,j}是常数复标量且a_{k,i,j} a_{k,j,i}^。信道增益可以重写为其中对应的半正定矩阵因此关于ṽ的SINR约束公式为与波束赋形子问题类似左侧引入了非凸性。应用SCA我们围绕前一次迭代ṽ^(n)定义一阶下界RIS元件的物理限制要求对于m1,…,M|vₘ|≤1且v{M1}1。因此RIS子问题由下式给出这是一个凸的二次约束二次规划QCQP问题。P4的整体可行性通过交替求解P5a和P5b来确定。由于SCA下界保证目标值非递减且有界AO过程保证收敛到可行性问题的驻点。通过迭代更新R_s并求解相应的可行性子问题算法沿着射线ω^P^T收敛到帕累托最优边界点。这种方法确保了高维资源分配被唯一且最优地映射到低尺度权重空间促进了动态IoT环境中的实时执行。这种方法保证了无论区域凸性如何都没有理论上的信息损失。基于上述分析我们建立了一个确定性映射ℱ: ω^P^T → R其中R表示通过为给定方向ω^P^T求解问题P3获得的唯一帕累托最优速率向量。由于定向映射ℱ在可达速率区域ℛ的整个帕累托前沿上是满射的它确保了RIS辅助IoT系统的每个高效工作点都可以由低维权重向量ω^P^T唯一表示。这种几何对应关系促进了系统优化策略的重大范式转变。具体来说我们可以用低尺度权重向量ω^P^T作为主要决策变量来替代高维且紧耦合的物理层变量包括波束赋形向量f、RIS相移θ和反射幅度β。至关重要的是从优化角度来看这种降维是信息无损的。鉴于任何有物理意义的目标函数例如最小化系统延迟、最大化能量效率或总速率通常都是各个用户速率Rₖ的非递减函数此类目标的全局最优解在数学上被保证位于帕累托边界上。因此通过在低维空间ω^P^T中搜索而不是在原始高维变量空间中搜索我们可以达到全局最优同时大幅降低搜索空间复杂度。这种转换为我们分层决策框架提供了理论基础其中高层RL智能体可以专注于优化权重轮廓ω^P^T而低层物理配置则由定向映射ℱ高效处理。在RL框架中动作空间为a {ω^P^T, Q}其中Q代表特定问题中的其他优化变量。状态空间由信道状态信息Hₖ, G_Re, H_Re,k和特定问题中的其他状态信息S组成奖励函数为时隙t目标P1中目标的负值r -f_obj(R, Q)。因此使用RL的帕累托感知分层决策算法PARL如算法1所示。算法1 用于在线RIS辅助IoT系统的基于PPO智能体的帕累托感知分层决策算法0: 输入回合数上限每回合步数上限学习因子。0: 输入RL策略π_PPO(s, a)。1: 动作空间a {ω^P^T, Q}。2: 状态空间s {Hₖ, G_Re, H_Re,k, S, ∀k}。3: 为每个s和a初始化随机策略π_PPO(s, a)。4: repeat5: 用随机可行动作初始化a(0)。6: 用a(0)和系统设置初始化s(0)。7: t 0。8: repeat9: 使用PPO方法根据当前策略π_PPO和当前状态s(t)选择下一个动作a(t1)。10: 通过求解P3执行下一个动作a(t1)11: 设置R_s^min 0并找到当P4无可行解时的R_s^max。12: repeat13: R_s (R_s^min R_s^max) / 214: if P4有可行解 then15: R_s^min R_s16: else17: R_s^max R_s18: end if19: until R_s^max - R_s^min ε, ε 是精度要求。20: 用a(t1)更新下一个状态s(t1)。21: 从{a(t1), s(t1)}观察奖励r(t1)。22: 将{a(t1), s(t1), r(t1)}存储到轨迹缓冲器中。使用收集的轨迹批次通过PPO更新RL策略网络。23: t t 1。24: until 达到每回合步数上限。25: 清空轨迹缓冲器。26: until 达到回合数上限或收敛。III-E 使用自编码器的动作空间二次压缩虽然前一节提出的基于方向的优先级映射ℱ: ω^P^T → R*有效地将主动波束赋形和无源反射系数的高维物理空间折叠为K维优先级向量但在K很大的大规模IoT网络中直接在ω^P^T上部署RL可能仍然存在挑战。此外用户分布的空间相关性和重复出现的环境动态通常会在优先级向量空间中引入统计冗余。为利用这些潜在的统计规律并为RL智能体实现超低维动作表示我们引入了一个利用自编码器AE的数据驱动二次压缩框架如图2所示。图 2 自编码器的结构。与模型驱动的几何投影不同AE架构完全是数据驱动的依赖于从最优配置轮廓中提取低维连续流形。因此二次压缩框架需要一个专用的离线预训练阶段。我们首先在一组多样化的随机信道实现和变化的网络状态上执行主定向映射算法。通过迭代执行R_s的二分搜索并求解凸可行性子问题P5a和P5b我们积累了一个全面的离线数据集_train { {ω^P^T, Q}^(1), {ω^P^T, Q}^(2), …, {ω^P^T, Q}^(N_sa) }。每个条目代表一个优化的、严格位于帕累托边界上的KK_Q维目标优先级轮廓其中K_Q是Q的维度。预训练数据集随后用于优化一个由编码器和解码器组成的对称深度神经网络结构。编码器 (ℰ_φ)以优化的、未压缩的优先级向量W {ω^P^T, Q} ∈ ℝ^{KK_Q} 作为输入。通过一系列由权重和偏置φ参数化的全连接层将其投影到超低维瓶颈层产生潜在连续码向量z ∈ ℝ^{d×1}其中d KK_Q。此潜在向量z充当由高层RL策略网络直接探索的紧凑、高效动作空间。解码器 (_ψ)负责反转压缩操作以保持物理一致性。由权重ψ参数化的解码器接收来自瓶颈层的潜在表示z并将其映射回原始维度生成重建的优先级向量Ŵ {ω̂^P^T, Q̂} ∈ ℝ^{KK_Q}。网络参数{φ, ψ}通过反向传播最小化均方误差MSE重建损失进行离线联合优化其中N_sa表示数据集的大小。一旦离线训练收敛冻结的解码器网络将作为RL策略与物理层优化模块之间的中间转换层直接嵌入在线执行循环中。在线混合决策管道精确的级联机制如下宏观决策生成在每个时隙tDRL智能体观察低维网络状态空间并从其压缩动作空间输出一个连续潜在动作向量z(t)。数据驱动解压缩潜在码z(t)被即时馈入前馈解码器网络_ψ后者输出重建的优先级轮廓{ω̂^P^T(t), Q̂(t)}。模型驱动投影为使系统免受神经重建噪声的影响{ω̂^P^T(t), Q̂(t)}被直接传递给模型驱动的可行性循环。系统通过上述算法求解内层问题P4。通过顺序链接自编码器的统计降维与定向最大-最小问题的精确几何映射该框架创建了一个抵御维度灾难的稳健“防火墙”。RL智能体受益于在优化的连续动作空间(z)中的快速训练收敛而物理层约束被保证满足严格的帕累托最优性条件如果AE能用少量参数完美替代原始参数则没有信息损失。如果AE不能完美替代参数它只会导致少量的性能损失。算法2 帕累托感知自编码器辅助RLPAAERL算法0: 输入回合数上限每回合步数上限学习因子。0: 输入RL策略π_PPO(s, a)。1: 动作空间a {z}。2: 状态空间s {Hₖ, G_Re, H_Re,k, S, ∀k}。3: 为每个s和a初始化随机策略π_PPO(s, a)。4: repeat5: 用随机可行动作初始化a(0)。6: 用a(0)和系统设置初始化s(0)。7: t 0。8: repeat9: 使用PPO方法根据当前策略π_PPO和当前状态s(t)选择下一个动作a(t1)。10: 使用AE从z(t1)中获得原始参数{ω^P^T, Q}(t1)。11: 通过求解P3执行下一个动作a(t1)。12: 用a(t1)更新下一个状态s(t1)。13: 从{a(t1), s(t1)}观察奖励r(t1)。14: 将{a(t1), s(t1), r(t1)}存储到轨迹缓冲器中。使用收集的轨迹批次通过PPO更新RL策略网络。15: t t 1。16: until 达到每回合步数上限。17: 清空轨迹缓冲器。18: until 达到回合数上限或收敛。III-F 复杂度PAAERL算法的离线训练复杂度主要由数据驱动神经网络反向传播与模型驱动几何投影循环之间的同步决定。PAAERL算法的总渐近训练复杂度可以表示为其中N_I表示总训练迭代次数N_B表示每次迭代执行的梯度更新次数N_RL是单次训练步骤所需的浮点运算次数(N_PA)是二分搜索和求解P4的复杂度。其复杂度由下式给出其中log₂(ε₀/ε)表示二分搜索达到精度容差ε所需的最大二分步数(N_P4)表示对K个MU求解子问题P4所需的复杂度。在大多数RL设置中所需迭代次数N_I通常与未压缩的状态-动作乘积N_state ⋅ N_action呈多项式比例。然而通过将数据驱动自编码器的结构压缩与问题P3的精确边界投影级联PAAERL大幅削减了所需的探索量。IV. 仿真与应用前几节建立的理论框架具有系统无关性使其适用于包含RIS的广泛多用户通信场景。原则上任何作为用户可达速率单调函数的优化目标都可以在此低尺度分层结构内高效求解。为展示所提方法的通用性和可扩展性我们考虑将其应用于RIS辅助的MEC系统作为一个代表性案例研究。在典型的RIS辅助MEC环境中多个MU生成计算密集型任务这些任务可以在本地处理也可以通过RIS增强的上行链路卸载到边缘服务器。此类系统中的优化问题要复杂得多因为它涉及通信资源波束赋形向量f和RIS系数{θ, β}与次级计算资源本地CPU频率和边缘服务器调度的联合分配。在动态操作场景中新的计算任务根据任务到达过程在每个时隙随机到达。每个MU处的累积任务形成一个本地缓冲队列。每个MU被分配一个由联合波束赋形参数f、θ和β确定的可达上行传输速率。MU以分配的上行速率将数据从任务缓冲队列传输到边缘服务器同时以单独的CPU处理速率并发执行本地计算。主要目标是最小化在时隙t结合了空间平均延迟D̄(t)和能耗Ē(t)的累积加权成本。K个活跃MU的空间平均延迟表示为其中Dₖ(t)表示第k个MU在时隙t经历的任务执行延迟。同时Ē(t)捕获总能量开销包括每个MU的本地CPU计算能耗和服务器消耗的边缘计算能耗。联合动态优化问题公式如下其中T是总时隙数λ∈[0,1)是时间折扣因子ξ₁, ξ₂≥0是分别优先考虑延迟和能量指标的设计权重参数。此外cₖ^MU(t)表示第k个MU受本地计算容量约束cₖ^MU,max限制的本地计算处理速率bit/sc(t)表示边缘服务器分配的总处理速率受其峰值计算容量约束c_max限制。由于问题在预定的有限时间范围内运行选择接近1的折扣因子λ确保了长期优化稳定性同时保持收敛。为了通过RL求解问题P6我们通过将在时隙t的即时奖励函数定义为最大化累积期望奖励[ ∑_{t1}^T λ^{t-1} r(t) ] 直接对应于最小化P6中的原始目标函数。基于类似动态原理构建的详细排队模型和MEC系统公式可以在相关研究工作[24, 25, 26]中找到。通过采用所提出的分层决策算法高层RL智能体的任务是在低维的速率比例空间ω^P^T和高级卸载策略中导航而不是处理RIS元件的微观调整。由于延迟和能量消耗直接由可达到的上行速率Rₖ决定对于任何给定的卸载决策最优资源配置仍然必须位于速率区域的帕累托边界上。因此RL智能体可以有效地将物理层协调委托给P3映射确保对于任何选定的策略RIS和波束赋形参数始终处于其帕累托最优状态。这种关注点分离不仅稳定了RL智能体在动态IoT环境中的学习过程而且确保系统以显著降低的计算开销达到成本函数的理论下界。此框架可以进一步扩展到其他新兴架构包括STAR-RIS和UAV中继网络其中高维耦合是一个持续存在的瓶颈。为验证所提出的帕累托感知自编码器辅助RLPAAERL框架的有效性、收敛特性和资源分配性能我们为多用户RIS辅助网络建立了一个全面的仿真环境。为了进行公平和严格的性能评估我们将PAAERL与五种基线范式进行比较。这些基准算法根据其优化标准加权和速率 vs. 帕累托最优性和降维策略模型驱动、数据驱动或未压缩进行策略性分类详见下文RL此基线代表了现有文献中广泛使用的标准无模型、端到端数据驱动方法。在此方案中RL智能体直接观察原始信道状态信息并在没有任何先验空间压缩的情况下输出高维物理层配置参数。WSRRL加权和速率辅助RL算法采用传统的模型驱动压缩方法。DRL智能体不是直接探索物理变量空间而是输出优先级权重向量ω。然后低级优化求解器基于这些权重最大化传统的加权和速率目标函数以确定f、θ和β。PARL帕累托感知RL算法代表了所提框架的一个消融版本它隔离了模型驱动层。它专门采用第三节中开发的定向最大-最小缩放优化问题P3将K维权重向量ω^P^T直接映射到真实的帕累托最优前沿。AERL自编码器辅助RL基线采用纯数据驱动的动作嵌入范式。它不采用任何通信理论或几何优化模型。相反离线预训练的自编码器将原始的、高维的物理变量f、β、θ直接压缩成一个紧凑的连续潜在码z。DRL智能体完全在此无约束潜在空间内执行其探索和策略更新解码器将z映射回物理层参数。此基准用于对比纯黑盒AI降维方法与我们的混合模型加数据压缩管道。WSRAERL加权和速率自编码器辅助RL算法是一种混合基准它结合了传统线性标量化和神经网络压缩。在此方案中框架首先将资源配置空间映射到K维优先级权重向量ω然后使用数据驱动的自编码器将其压缩为低维潜在表示。DRL智能体输出一个压缩动作该动作被解码为ω并通过传统加权和速率优化求解器进行评估。IV-A 性能比较在本节中我们评估所提出的PAAERL框架与基线算法的性能。主要关注指标是在高度动态、干扰受限的RIS辅助MEC环境下多用户任务执行延迟和设备能耗的加权组合所定义的总系统成本。仿真设置如表II所示。表 II仿真设置参数值参数值频率2.4GHz带宽1MHzM64K10噪声3.16×10⁻¹¹智能体类型PPO层128 神经元激活函数ReLU最小批量128折扣因子0.995裁剪因子0.2回放记忆10000ΔT2sGPURTX4080IV-A1 收敛速度比较图 3 我们提出的PAAERL与基准的收敛行为。图3展示了不同资源管理策略下总系统成本随训练迭代次数的变化。RL基线表现出最差的性能并且在观察到的时间线内未能显示出稳定的收敛迹象。这种行为直接证实了动作空间爆炸的严重性。在没有压缩的情况下原始波束赋形向量和大规模RIS元件的高维连续域迫使智能体进行各向同性的、盲目的探索使其极不可能发现协作奖励路径。相比之下嵌入数据驱动动作缩减的算法如AERL、WSRAERL和所提出的PAAERL在0到150次迭代的早期训练阶段表现出陡峭的学习曲线。通过利用深度自编码器将策略映射到超低维潜在连续码z上智能体规避了维度灾难。平滑的梯度更新显著稳定了训练轨迹使得策略网络能够快速分离出高效的宏观决策。与帕累托感知框架相比WSRRL和WSRAERL的稳态成本饱和在显著更高的平台。这种差异凸显了线性标量化在干扰受限通信链路中的数学局限性。由于在紧耦合的多用户干扰和非凸RIS相位约束下真实可达速率区域是非凸的传统的加权和速率公式只能描绘外部凸包。它系统地跳过了真实速率区域凹陷的内边界导致关键几何信息丢失并迫使网络进入次优资源配置。PARL和所提出的PAAERL都收敛到最低的系统成本边界。这验证了我们提出的定向最大-最小缩放优化问题P3的有效性。通过将权重向量沿干净的双射方向射线投影到帕累托最优前沿我们的方法在凸和非凸速率空间中都能捕获最优工作点而不会损失最优性。IV-A2 不同用户数对PAAERL和基准的影响图 4 我们提出的PAAERL和基准的总成本 vs. 用户数。从图4可以看出所有考虑框架的总网络成本都随着用户数K的增加而增加这是任务卸载量增加和聚合多用户干扰加剧的直接结果。特别是传统RL基线表现出灾难性的性能退化其网络成本随着K的增加而急剧加速。这一趋势突显了未压缩RL在密集网络中的致命缺陷。因为主动波束赋形向量f和无源RIS配置参数的维度与用户数高度相关扩展K会触发动作空间维度的复合爆炸。传统的模型驱动压缩基准即WSRRL和WSRAERL实现了比传统RL更低的网络成本但随着网络规模的扩大它们相对于所提出的PAAERL的性能差距持续扩大。在K较小的稀疏网络中多用户干扰相对温和使得可达速率区域的非凸“凹陷”区域不太明显。因此传统的加权和速率边界跟踪保持接近最优。然而随着K的扩大主动收发器波束与无源RIS反射之间的相互耦合会引发严重的同信道干扰导致真实可达速率区域变得高度非凸。所提出的PAAERL框架在整个用户范围内始终优于所有其他基准范式保持最低的网络成本并显示出非常有利的亚线性增长曲线。虽然PARL通过定向最大-最小缩放问题P3成功保留了最优边界信息但其执行效率在K值较高时面临瓶颈因为策略网络仍必须直接操控一个K维优先级向量ω^P^T。IV-A3 不同RIS元件数对PAAERL和基准的影响图 5 我们提出的PAAERL和基准的总成本 vs. RIS元件数。为评估无源波束赋形能力对系统权衡的影响我们分析了在不同RIS反射元件数M下的网络成本。图5展示了总系统成本作为M的函数揭示了未压缩无模型搜索范式与动作空间缩减框架之间有趣的差异。传统RL方案在整个M范围内保持最高的网络成本其次是AERL基线。对于传统RL将M扩展到256会立即触发物理层变量域的爆炸导致严重的梯度稀释。智能体被迫进行盲目探索产生高度次优的波束赋形和相位配置无法最小化执行成本。对于AERL尽管数据驱动的自编码器成功地将无约束动作空间压缩为低维码但它完全在没有通信理论或几何优化边界的情况下运行。因此当M变大时解码器内的神经重建误差变得更加明显导致AERL比模型辅助算法陷入明显更高的成本平台。配备次级神经网络压缩的框架——即我们提出的PAAERL和混合WSRAERL基线——稳定在一个中等成本层级。这种行为代表了一个小的结构性权衡虽然深度自编码器实现了异常快速的策略收敛并将智能体与大型用户变量解耦但在潜在空间映射z→ω^P^T过程中引入的统计近似引入了细微的重建方差。这些方差阻止了智能体在高度复杂的信道条件下提取绝对最低的数学成本。相反未嵌入的基准PARL和WSRRL它们将优先级权重向量直接传递给内层凸优化求解器而没有任何神经瓶颈近似实现了最低的总系统成本。IV-A4 算法效率比较图 6 我们提出的PAAERL和基准的训练时间 vs. 用户数。如图6所示传统RL基线在所有用户密度下都需要最高的训练时间。这种过度的耗时是动作空间爆炸的直接产物。在未压缩场景中扩展用户数需要神经网络为多用户主动波束赋形和多元件RIS相位配置输出指数级更大的矩阵变量。与原始RL相比基准WSRRL、PARL和WSRAERL带来了显著的训练时间减少但随着K从4扩展到16它们仍表现出陡峭的上升增长曲线。这种上升趋势突显了在执行循环中传统迭代优化子问题所带来的计算瓶颈。在WSRRL和PARL等框架中高层策略输出一个K维权重轮廓。因此随着用户数量增长RL动作空间的维度成比例地扩展。所提出的PAAERL框架在整个用户范围内始终保持着最短的训练时间展示了异常平坦的执行曲线且与K呈亚线性扩展。这种卓越的计算效率归功于我们级联的双重压缩架构。通过将数据驱动自编码器与模型驱动定向映射级联高层RL策略完全与网络的原始物理维度隔离。策略网络完全在一个稳定的、低维的潜在连续码空间z内运行。这种解耦保证了即使在密集用户部署中梯度探索速度也能保持稳健。V. 结论本文提出了一种新颖的基于分层RL的优化框架称为PAAERL用于在RIS辅助的多用户IoT网络中实现实时的在线资源分配。为系统性地打破由高维主动和被动波束赋形配置引发的维度灾难我们引入了一种级联的双重压缩架构。具体来说该框架首先通过定向最大-最小缩放问题公式将高维物理层参数映射到低尺度权重空间。这个模型驱动层在数学上保证了跨凸和非凸速率区域的严格帕累托最优性且没有任何理论几何信息损失。为进一步减轻密集用户部署中的探索开销无缝集成了一种数据驱动的深度自编码器来执行二次动作空间缩减将优先级轮廓嵌入到一个高度紧凑的潜在表示中。在实际多用户MEC网络条件下的广泛仿真证实我们提出的PAAERL方法显著优于传统的无模型RL和经典的加权和速率优化基线。对于未来的工作将此双压缩架构扩展到适应高动态移动性模型例如用于空中RIS或UAV平台的机器学习驱动轨迹设计是一个有前景且影响深远的研究方向。