НАДІЙНЕ ПРИЙНЯТТЯ РІШЕНЬ РОЄМ БПЛА В УМОВАХ НЕВИЗНАЧЕНОСТІ ШЛЯХОМ ПОЄДНАННЯ БАГАТОАГЕНТНОГО НАВЧАННЯ З ПІДКРІПЛЕННЯМ ТА ГІБРИДНИХ АВТОМАТІВ
Автор є членом редколегії видання, тому не брав участі у рецензуванні та прийнятті рішення щодо публікації цієї статті
DOI:
https://doi.org/10.17721/AIT.2025.2.05Ключові слова:
багатоагентне навчання з підкріпленням; рій БПЛА; гібридні автомати; невизначені середовища; радіоелектронна боротьба; Multi-Agent Deep Deterministic Policy Gradient; автономне прийняття рішень.Анотація
Стаття представлена у форматі OnlineFirst, що передбачає дострокове розміщення матеріалів на сайті журналу перед їх остаточним друком в паперовому вигляді.
Стаття пройшла процедуру рецензування та прийнята до друку.
Стаття доступна для пошуку та цитування за її DOI, яке надалі залишається незмінним. Після того, як випуск буде надруковано в типографії, нове цитування можна робити, використовуючи інформацію про номер тому і номер сторінки, використовуючи те саме посилання DOI.
Вступ. Рої безпілотних літальних апаратів (БПЛА) дедалі частіше застосовуються у складних та невизначених середовищах, зокрема в умовах радіоелектронної боротьби (РЕБ), де традиційні методи керування на основі жорстко заданих правил можуть бути недостатньо ефективними. В повязаних роботах застосовувалося багатоагентне навчання з підкріпленням (MARL), щоб дозволити БПЛА навчатися кооперативної поведінки в таких умовах, а також досліджувалося розбиття складних місій (наприклад, пошук і супровід цілі) на фази для спрощення керування. Проте підходи, що базуються виключно на навчанні, можуть бути недостатньо робастними або вимагати надмірно тривалого навчання для врахування всіх крайових випадків.
Методи. Запропонований підхід інтегрує алгоритм Multi-Agent Deep Deterministic Policy Gradient (MADDPG) із керівним гібридним автоматом, який кодує високорівневі режими поведінки. Гібридний автомат визначає дискретні режими для різних фаз місії (наприклад, розвідка або супровід цілі) та аварійних ситуацій (наприклад, ухилення під час радіоелектронного придушення), де формальні умови переходу активують зміну режимів. У межах кожного режиму агенти-БПЛА виконують безперервні керуючі дії, навчені за допомогою MADDPG із парадигмою централізованого навчання та децентралізованого виконання. Для централізованого навчання рою БПЛА розроблено симуляційне середовище на основі Gym-PyBullet-Drones, яке включає реалістичну фізичну модель і модель впливу радіоелектронної боротьби.
Результати. Експерименти в середовищі моделювання показали, що запропонований гібридний підхід RL-автомат перевершує стандартну наскрізну базову модель MADDPG за всіма протестованими умовами. Гібридний рій демонстрував стабільно вищі показники успішності виконання місії, особливо в умовах ворожого глушіння, де рівень успіху перевищував 90%, тоді як у базової моделі спостерігалося значне зниження ефективності. Криві навчання показали швидшу збіжність і вищі фінальні значення винагороди для гібридного методу, що відображає переваги структурованого навчання з урахуванням режимів. У сценаріях із динамічними цілями гібридний рій підтримував довший безперервний супровід завдяки скоординованій тактиці, тоді як базова модель часто втрачала контакт. Ці результати демонструють, що інтеграція формального автомата з багатоагентним навчанням з підкріпленням забезпечує більш надійне, ефективне та масштабоване прийняття рішень роєм БПЛА в умовах невизначеності. Отримані висновки також узгоджуються з сучасними дослідженнями, які показують, що поділ місій на фази та навчання спеціалізованих для режимів стратегій може суттєво підвищити продуктивність порівняно з монолітними політиками.
Висновки. Запропонована гібридна модель демонструє, що поєднання перемикання режимів на основі формальних автоматів із глибинним навчанням з підкріпленням може забезпечити більш надійне та ефективне прийняття рішень для роїв БПЛА в умовах невизначеного та ворожого середовища. Дискретне керування режимами вводить предметно-орієнтовані знання (наприклад, коли змінювати завдання або переходити в безпечний режим), що спрямовує процес навчання та забезпечує дотримання обмежень безпеки, тоді як MADDPG оптимізує безперервне керування в межах кожного режиму. Такий гібридний підхід забезпечує кращу адаптивність до змінних загроз і умов середовища, що підтверджується стійкою роботою в умовах радіоелектронної боротьби. У подальших дослідженнях планується розширити цей підхід на більш складні сценарії із використанням гетерогенних роїв БПЛА та дослідити автоматичне виявлення режимів (наприклад, за допомогою ієрархічного навчання з підкріпленням), щоб зменшити залежність від автоматів, визначених експертами.
Завантажити
Посилання
Casau, P., Cabecinhas, D., & Silvestre, C. (2011). Autonomous transition flight for a vertical take-off and landing aircraft. In 2011 50th IEEE Conference on Decision and Control and European Control Conference (CDC-ECC) (pp. 3974–3979). IEEE. https://doi.org/10.1109/CDC.2011.6160819
Chi, P., Wei, J., Wu, K., Di, B., & Wang, Y. (2023). A bio-inspired decision-making method of UAV swarm for attack-defense confrontation via multi-agent reinforcement learning. Biomimetics, 8(2), 222. https://doi.org/10.3390/biomimetics8020222
Ekechi, C. C., Elfouly, T., Alouani, A., & Khattab, T. (2025). A survey on UAV control with multi-agent reinforcement learning. Drones, 9(7), 484. https://doi.org/10.3390/drones9070484
Feng, Z., Na, X., Hai, S., Sun, Q., & Shi, J. (2025). Deep reinforcement learning for UAV target search and continuous tracking in complex environments with Gaussian process regression and prior policy embedding. Electronics, 14(7), 1330. https://doi.org/10.3390/electronics14071330
Liu, M., Wei, J., & Liu, K. (2024). A two-stage target search and tracking method for UAV based on deep reinforcement learning. Drones, 8(10), 544. https://doi.org/10.3390/drones8100544
Lowe, R., Wu, Y., Tamar, A., Harb, J., Abbeel, P., & Mordatch, I. (2017). Multi-agent actor-critic for mixed cooperative-competitive environments (arXiv:1706.02275). arXiv. https://doi.org/10.48550/arXiv.1706.02275
Panerati, J., Zheng, H., Zhou, S., Xu, J., Prorok, A., & Schoellig, A. P. (2021). Learning to fly — a Gym environment with PyBullet physics for reinforcement learning of multi-agent quadcopter control (arXiv:2103.02142). arXiv. https://doi.org/10.48550/arXiv.2103.02142
Sierra-García, J. E., & Santos, M. (2021). Intelligent control of a UAV with a cable-suspended load using a neural network estimator. Expert Systems with Applications, 185, 115380. https://doi.org/10.1016/j.eswa.2021.115380
Xu, J., & Liang, G. (2025). Enhanced Q-learning and deep reinforcement learning for unmanned combat intelligence planning in adversarial environments. Scientific Reports, 15(1), 28364. https://doi.org/10.1038/s41598-025-13752-3
Zhang, K., Yang, Z., & Başar, T. (2021). Multi-agent reinforcement learning: A selective overview of theories and algorithms. In K. G. Vamvoudakis, Y. Wan, F. L. Lewis, & D. Cansever (Eds.), Handbook of reinforcement learning and control (Studies in Systems, Decision and Control, Vol. 325, pp. 321–384). Springer. https://doi.org/10.1007/978-3-030-60990-0_12
Zhao, B., Huo, M., Li, Z., Feng, W., Feng, W.-T., Yu, Z., Qi, N., & Wang, S. (2025). Graph-based multi-agent reinforcement learning for collaborative search and tracking of multiple UAVs. Chinese Journal of Aeronautics, 38(3), 103214. https://doi.org/10.1016/j.cja.2024.08.045
Завантаження
Опубліковано
Номер
Розділ
Ліцензія
Авторське право (c) 2026 Олексій БИЧКОВ, д-р техн. наук, проф., Михайло ВОЙТОВИЧ, асп. (Автор)

Ця робота ліцензується відповідно до ліцензії Creative Commons Attribution 4.0 International License.