国内刊号:51-1267/TN
国际刊号:1001-893X
发布日期:
作者:刘兴鑫,李君,李正权
单位:(1.南京信息工程大学 电子与信息工程学院,南京 210044;2.无锡学院 电子信息工程学院,江苏 无锡 214105;3.江南大学 轻工过程先进控制教育部重点实验室,江苏 无锡 214122;4.北京邮电大学 网络与交换技术国家重点实验室,北京 100876)
关键词:SWIPT-D2D;资源分配;深度强化学习;联合优化;
基金:未来网络科研基金项目(FNSRFP-2021-YB-11)
针对信道状态信息未知SWIPT-D2D((Simultaneous Wireless Information and Power Transfer Device to Device)无线通信网络环境下设备间信号干扰以及设备能量损耗问题,提出通过使用近端策略优化(Proximal Policy Optimization,PPO)算法,在满足蜂窝用户通信质量要求的前提下同时对D2D用户的资源块、发射功率以及功率分割比三部分进行联合优化。仿真结果表明,所提算法相比于其他算法能够为D2D用户制定更好的资源分配方案,在保证蜂窝用户保持较高通信速率的同时使D2D用户获得更高的能效。同时,当环境中用户数量增加时,所提算法相比于Dueling Double DQN(Deep Q-Network)以及DQN算法,D2D能效分别平均提高了15.95%和23.59%,当通信网络规模变大时所提算法具有更强的鲁棒性。
来源:2024年第5期
《电讯技术》期刊编辑部