CN113364495A

Multi-unmanned aerial vehicle track and intelligent reflecting surface shift joint optimization method and system

Abstract

The invention discloses a combined optimization method and system for the trajectory of multiple drones and the phase shift of an intelligent reflective surface, and establishes a wireless communication system model based on the assistance of multiple drones and the intelligent reflective surface. The smart reflector reflects to the base station, determines the channel model in the wireless communication system model and the energy consumption model of the UAV and the smart reflector, calculates the energy efficiency of the wireless communication system model; uses the K-mean clustering algorithm to cluster ground users , Using the priority experience playback MATD3 method to determine the position of the drone in each cluster, the drone and the intelligent reflecting surface assist the user communicating with the base station, the activated reflecting element of the intelligent reflecting surface and the phase of the activated reflecting element Shift, complete the joint optimization of the multi-UAV trajectory and the phase shift of the intelligent reflecting surface. The invention solves the problems of high communication delay and high power consumption in the existing offline optimization method.

CN113364495A, drawing sheet 1
Sheet 1 of 5

Term

14.7 yearsto projected expiry

Projected expiry 25 May 2041, counted from filing; an application has no term until it is granted.

  1. Priority and filed
  2. Published
  3. Today
  4. Projected expiry

10 claims: 2 independent, 8 dependent

  1. 1
    L一种多无人机轨迹和智能反射面相移联合优化方法,其特征在于,包括以下步骤: S1、建立基于多无人机和智能反射面辅助的无线通信系统模型,用户发送的信号由安 装在无人机上的智能反射面反射到基站,确定无线通信系统模型中的信道模型以及无人机 和智能反射面的能量消耗模型,计算无线通信系统模型的能量效率; S2、基于步骤S1确定的信道模型以及无人机和智能反射面的能量消耗模型,利用K-均 值聚类算法将地面用户分簇,将能量效率作为优化目标,然后利用优先级经验回放MATD3方 法确定每个簇中无人机的位置,由无人机和智能反射面辅助与基站进行通信的用户,智能 反射面被激活的反射元件及被激活反射元件的相移,完成多无人机轨迹和智能反射面相移 的联合优化。
  2. 2
    根据权利要求1所述的方法,其特征在于,步骤S1中,基于多无人机和智能反射面辅 助的无线通信系统模型具体为:随机分布的用户数量为U,用户U被划分为K个区域,每个区 域内的用户数量为限,%+…+Uk+,・,+uK = U,智能反射面和无人机的数量为K,每个安装有智 能反射面的无人机服务一个区域中的用户;搭载在无人机上的智能反射面通过一个集成控 制器调整Μ个反射元件的相移;基站同时接收经过所有智能反射面反射的信号;基站的天线 数量为Ν,智能反射面的反射元件数为Μ,用户为单天线;基站的坐标为(xbs,y BS , ZbJ ,智能反 射面P的坐标为(X叫,,必啊,z吗),用户q的坐标为卜吗,歹啊/啊),一个区域中只有一个用户 发送信号,每一个用户发送的信号通过服务本区域的智能反射面反射到基站,并通过服务 其他区域的智能反射面反射到基站,同时参与通信的用户和智能反射面的数量都为K;智能 反射面的每一个反射元件独立调整入射信号的相移,同时保持幅度不变,智能反射面P的相 移矩阵是一个对角阵® p = diag (vj,对角线上的元素勺…煮外,…,屋“),(^表示 智能反射面P第m个反射元件的相移;智能反射面的被激活反射元件矩阵是一个对角阵Δ ρ = diag(uj ,对角线上的元素%= (δ。],…,6pm,・,6pM),总表示智能反射面P的第m个反射元 件是否激活。
  3. 3
    根据权利要求1所述的方法,其特征在于,步骤S1中,用户发送的信号通过无人机智 能反射面反射到基站分决策阶段、飞行阶段和信息传输阶段,决策阶段:无人机选择与哪个 用户进行通信,并选择进行信息传输的位置,智能反射面选择被激活的反射元件及其相移;飞行阶段:无人机以速度ν沿直线飞向在决策阶段中选择的信息传输位置;信息传输阶段: 无人机到达规定的位置之后悬停,在决策阶段中被选中的用户向智能反射面发送信号,智 能反射面的激活反射元件以对应的相位偏移将用户发送过来的信号反射到基站。
  4. 4
    根据权利要求1所述的方法,其特征在于,步骤S1中,将用户和智能反射面之间、智能 反射面和基站之间的信道建模为莱斯信道,从用户q到智能反射面P的信道Gpq为; 其中,Ρ表示参考距离d0=lm处的路径损耗,占是路径损耗指数,8是莱斯衰落因子,d1是 用户q和智能反射面P之间的欧几里得距离,Gpq是非视距传播分量,是阵列响应矢量,如 表示信号从用户q到智能反射面P的到达角的余弦值,人表示载波的波长,d表示天线间距; 从智能反射面P到基站的信道Fp为:其中,d2表示智能反射面p和基站之间的欧几里得距离,Fp是非视距传播分量, Fp,和%(%>3)是阵列响应矢量; 基站的接收信号y为: K K K K 丫小Σ贴十”“十Σ 2?:@心43十〃 q=l,q力jt p=l q=\ 7 q^-k p=l 其中,S为发送信号矩阵,Η为信道矩阵,hk是矩阵Η的第k列,Sk是矩阵S的第k行,η表示基 站端的加性白高斯噪声,方差为。2的循环对称复高斯变量; 将其他用户的干扰视为噪声,第k个用户的信干噪比SINRk为: SWR* =-----L-^i------------以Σ身小心户」+帆” 第k个用户的信息传输速率Rk为: %=log 1 K w.y F^&&G. 1t 乙1ρ Ρ Ρ Ρ» ____ 吗Σ £睁4G凶+|帆” 夕=1 其中,K为同时与基站进行通信的用户的数量,Wk为迫零检测滤波矩阵的第k行,gT为智 能反射面P与基站之间的信道矩阵的共辗转置,⑻p为智能反射面P的相移矩阵,*为智能反 射面P的被激活反射元件矩阵,Gpq为用户q和智能反射面p之间的信道,Gpk为用户k和智能反 射面P之间的信道,。2为噪声的方差。
  5. 5
    根据权利要求1所述的方法,其特征在于,步骤S1中,能量效率EE。为传输的数据量除 以无人机P和智能反射面P消耗的总能量,具体为: G EE =------p F +尸 其中,3强为无人机飞到指定位置消耗的能量,Gp为用户p经过无人机p和智能反射面p 辅助,向基站传输的数据量,£叫为智能反射面P消耗的能量,品明为无人机P的推进功率, T为无人机飞到指定位置需要的时间。
  6. 6
    根据权利要求1所述的方法,其特征在于,步骤S2中,使用K均值聚类算法对用户进行 分簇,具体为: 指定一个K值,从所有用户中随机抽取K个用户作为初始的聚类中心,然后计算其余的 所有用户与这K个初始聚类中心之间的距离,将距离聚类中心最近的用户划分到对应聚类 中心所属的簇,对于每个新形成的簇,聚类中心通过计算簇中用户的平均值得到,如果所有 簇的聚类中心与上一次计算得到的结果完全相同,聚类准则函数已收敛,所有用户划分到 正确的簇中。
  7. 7
    根据权利要求1所述的方法,其特征在于,步骤S2中,利用优先级经验回放MATD3方法 确定每个簇中无人机的位置,与基站进行通信的用户的位置,智能反射面被激活的反射元 件以及被激活元件的相移,完成多无人机轨迹和智能反射面相移的联合优化具体为: 将基于多无人机和智能反射面辅助的无线通信系统中无人机轨迹和智能反射面相移 的优化问题建模成一个马尔可夫博弈,每个安装有智能反射面的无人机作为一个智能体, 第k个智能体观测当前的环境状态基于策略网选择一个行为行为作用于环境后获得 奖励口,然后环境将以转移概率P (s'J Sq% ,…,a》转移到新的状态s';在每个时刻内,第k个智能体观测上一时刻无人机k的位置,以及第k个簇中与基站进行 通信的用户的位置作为状态训练策略网络的参数为。『将状态Sk作为输入,输出当前时 刻第k个无人机的位置,第k个簇中与基站进行通信的被激活用户向量,第k个智能反射面的 被激活元件向量以及相移向量作为行为ad第一训练价值网络和第二训练价值网络的参数 分别为3kl和3k2,两个训练价值网络将各个智能体观测到的联合状态S=(S],S2,・,Sk)和 采取的联合行为a=61/2,···,a/作为输入,分别输出联合状态-行为价值函数Qki(s,a「 a 2 , ··· ,a K , ω^)和(s ,a x ,a 2 , ··· ,a K , ω k2 ),目标策略网络将下一个状态s'作为输入,输出 下一个行为a、,用软更新的方式根据训练策略网络的参数9k更新目标策略网络的参数9'k, 第一目标价值网络和第二目标价值网络输入下一个状态-行为对(s' ,a'),分别输出 Q*j(s , q ,《;··,生和Q'k2(s' ,a'],a'2,,,a‘K, ω 用软更新的方式根据第一训练价 值网络的参数ω η和第二训练价值网络的参数ω女?更新第一目标价值网络的参数ω %和第 二目标价值网络的参数3^2; 将(s,a「a2,…,a『ri,r2,…作为智能体的一条经验存放在经验存储器中,当经 验存储器达到最大存储容量时,使用优先级经验回放的方法从中抽样小批量经验进行训 练,更新策略网络的参数和价值网络的参数。
  8. 8
    根据权利要求7所述的方法,其特征在于,每个无人机观测到的状态包括两个部分, 分别是上一时刻无人机k (k= {1,2,…,Κ})的位置 , G拼取 — {“切匕,必山匕’马以匕} ‘以及在第k簇 中,由第k个无人机和智能反射面辅助与基站进行通信的用户的位置, ={芯3%3%£},状态Sk的维度为六维;行为ak包括以下四个部分: i :当前时刻第k个无人机的位置=v k ,y^AV t ' z vav k }; ii:当前时刻在第k个簇中与基站进行通信的被激活用户向量Z; ={八虞,其中 的每一个元素表示相对应的用户是否激活,取值为0表示相对应的用户不激活,取值为1表 示激活,并且向量Z;中的元素应满足彳+或+…+品=1,表示在任一时亥。,一个簇中只有 一个被激活的用户; iii:当前时刻第k个智能反射面的被激活元件向量& ={凡号,…,α},其中的每一个 元素表示相对应的反射元件是否被激活,取值为。表示相对应的反射元件不激活,取值为1 表示激活,向量田中的元素应满足+6+…+端KM,表示每个智能反射面被激活的 元件数量应该在1〜Μ之间; iv:当前时刻智能反射面的相移向量式={见处…,氏},其中的每一个元素表示相对 应的反射元件的相移,1 <焉 < 乃; 4={α**, z;, &, } 奖励定义为能量效率EEk,q (s k ,a k ) =EE k o
  9. 9
    根据权利要求7所述的方法,其特征在于,使用策略梯度法更新第k个智能体的训练 策略网络的参数9 k为: ]F j ©)=万 X ▽4 &(s',w 4,…,<%)1d=w)▽ 4 徇⑸) 其中,J (%)是策略目标函数,F表示小批量抽样的大小,▽表示梯度算符,%是第k个智 能体学习到的策略,s/为利用优先级经验回放方法抽样的第j条经验中第k个智能体的状 态,片为第j条经验中第k个智能体的行为; 第k个智能体的训练价值网络1的参数3 1d 和训练价值网络2的参数3k2通过神经网络的 梯度反向传播来更新,损失函数分别为: ]F 履”1 =方 Σ 叼(丁 arg etQl -应(s', α:, Η,…,3 % )『 ]F 双2 =万X吗(丁argetQ; -Q k ^ J Μ:,必…,欧,你2)了 其中,Wj为重要性抽样权重,Targ eQ表示目标Q值; 目标策略网络的参数9'k,目标价值网络1的参数a %和目标价值网络2的参数a %分 别使用软更新的方式进行更新: 工一叫+口⑹叱 1d 3 k2+(「ak2 其中,a表示更新系数。
  10. 10
    一种多无人机轨迹和智能反射面相移联合优化系统,其特征在于,包括: 能量模块,建立基于多无人机和智能反射面辅助的无线通信系统模型,用户发送的信 号由安装在无人机上的智能反射面反射到基站,确定无线通信系统模型中的信道模型以及 无人机和智能反射面的能量消耗模型,计算无线通信系统模型的能量效率EE。; 优化模块,基于能量模块确定的信道模型以及无人机和智能反射面的能量消耗模型, 利用K-均值聚类算法将地面用户分簇,将能量效率作为优化目标,然后利用优先级经验回 放MATD3方法确定每个簇中无人机的位置,由无人机和智能反射面辅助与基站进行通信的 用户,智能反射面被激活的反射元件及被激活反射元件的相移,完成多无人机轨迹和智能 反射面相移的联合优化。
Independent claims10