国内刊号:51-1267/TN
国际刊号:1001-893X
发布日期:
作者:凌耀,谢世珺,梁豪,冯姣,高伟杰
单位:(1.南京信息工程大学 电子与信息工程学院,南京 210044;2.国防科技大学第六十三研究所,南京 210007)
关键词:智能通信抗干扰;联合抗干扰决策;深度强化学习;多奖励值函数;
基金:国家自然科学基金资助项目(62201596;国防科技大学学校科研计划资助项目(ZK22-45
在动态干扰环境下的卫星通信系统中,各信道的质量和干扰功率存在差异。有限的频谱资源和复杂的干扰环境对抗干扰通信决策提出了资源分配和业务需求的挑战,即如何在避开干扰频率和优化功率的同时,实现资源的高效利用。为解决这一问题,提出了一种基于多奖励值函数的深度强化学习抗干扰算法。该算法将发送方、接收方与干扰方之间的交互建模为马尔可夫决策过程。通过优化信道切换与功率切换代价的奖励函数,引入频率切换与功率切换机制,分析相邻时隙频谱中的干扰特征,并将交互过程中采集到的干扰信号特征与信道信息结合,用于训练抗干扰策略。该策略实现了频率域与功率域的联合抗干扰决策。仿真结果表明,该算法能够有效降低系统的受干扰概率,加快算法收敛速度,并优化功率资源的利用效率。
来源:2025年第11期
《电讯技术》期刊编辑部