基于Transformer的多智能体强化学习用于结构化和非结构化空域中的间隔保障
Transformer-based Multi-agent Reinforcement Learning for Separation Assurance in Structured and Unstructured Airspaces
该研究提出了一种基于Transformer的多智能体强化学习方法,用于提升飞行器在不同空域结构中的间隔保障能力。研究结果表明,新的状态表示和训练策略能够有效减少空中碰撞风险,对eVTOL行业在复杂空域中的自主运行具有参考价值。依据来源摘要
传统基于优化的流量控制依赖于严格遵守预计算的时间表,这限制了先进空中交通(AAM)随机操作所需的灵活性。相比之下,多智能体强化学习(MARL)提供了一种去中心化、自适应的框架,能够更好地处理不确定性,这是确保飞行器间隔保障所必需的。尽管具有这一优势,当前的MARL方法往往过度拟合特定的空域结构,限制了其对新配置的适应性。为了提高泛化能力,我们将MARL问题重新表述为相对极坐标状态空间,并在多样化的交通模式和交叉角度下训练一个Transformer编码器模型。所学习的模型在解决冲突的同时,能够为飞行器提供速度建议,使其保持接近其期望的巡航速度。在我们的实验中,我们在结构化和非结构化空域中评估了编码器深度为1、2和3层的配置,并发现单一编码器配置的表现优于更深的变体,实现了接近零的空中碰撞率和比更深配置更短的间隔违规时间。此外,我们还表明,相同的配置在纯注意力设计的基线模型上表现更优。总体而言,我们的结果表明,新提出的状态表示、神经网络架构的新设计以及提出的训练策略,为结构化和非结构化空域中的飞行器间隔保障提供了一种适应性强且可扩展的去中心化解决方案。
这里展示来源摘要及其中文翻译,完整内容请阅读原文。
来源:arXiv先进空中交通研究 · arxiv.org