НАДІЙНЕ ПРИЙНЯТТЯ РІШЕНЬ РОЄМ БПЛА В УМОВАХ НЕВИЗНАЧЕНОСТІ ШЛЯХОМ ПОЄДНАННЯ БАГАТОАГЕНТНОГО НАВЧАННЯ З ПІДКРІПЛЕННЯМ ТА ГІБРИДНИХ АВТОМАТІВ

Автор є членом редколегії видання, тому не брав участі у рецензуванні та прийнятті рішення щодо публікації цієї статті

Автор(и)

  • Олексій БИЧКОВ, д-р техн. наук, проф. Київський національний університет імені Тараса Шевченка, Київ, Україна Автор
  • Михайло ВОЙТОВИЧ, асп. Київський національний університет імені Тараса Шевченка, Київ, Україна Автор

DOI:

https://doi.org/10.17721/AIT.2025.2.05

Ключові слова:

багатоагентне навчання з підкріпленням; рій БПЛА; гібридні автомати; невизначені середовища; радіоелектронна боротьба; Multi-Agent Deep Deterministic Policy Gradient; автономне прийняття рішень.

Анотація

Стаття представлена у форматі OnlineFirst, що передбачає дострокове розміщення матеріалів на сайті журналу перед їх остаточним друком в паперовому вигляді.

Стаття пройшла процедуру рецензування та прийнята до друку.

Стаття доступна для пошуку та цитування за її DOI, яке надалі залишається незмінним. Після того, як випуск буде надруковано в типографії, нове цитування можна робити, використовуючи інформацію про номер тому і номер сторінки, використовуючи те саме посилання DOI.

Вступ. Рої безпілотних літальних апаратів (БПЛА) дедалі частіше застосовуються у складних та невизначених середовищах, зокрема в умовах радіоелектронної боротьби (РЕБ), де традиційні методи керування на основі жорстко заданих правил можуть бути недостатньо ефективними. В повязаних роботах застосовувалося багатоагентне навчання з підкріпленням (MARL), щоб дозволити БПЛА навчатися кооперативної поведінки в таких умовах, а також досліджувалося розбиття складних місій (наприклад, пошук і супровід цілі) на фази для спрощення керування. Проте підходи, що базуються виключно на навчанні, можуть бути недостатньо робастними або вимагати надмірно тривалого навчання для врахування всіх крайових випадків.

Методи. Запропонований підхід інтегрує алгоритм Multi-Agent Deep Deterministic Policy Gradient (MADDPG) із керівним гібридним автоматом, який кодує високорівневі режими поведінки. Гібридний автомат визначає дискретні режими для різних фаз місії (наприклад, розвідка або супровід цілі) та аварійних ситуацій (наприклад, ухилення під час радіоелектронного придушення), де формальні умови переходу активують зміну режимів. У межах кожного режиму агенти-БПЛА виконують безперервні керуючі дії, навчені за допомогою MADDPG із парадигмою централізованого навчання та децентралізованого виконання. Для централізованого навчання рою БПЛА розроблено симуляційне середовище на основі Gym-PyBullet-Drones, яке включає реалістичну фізичну модель і модель впливу радіоелектронної боротьби.

Результати. Експерименти в середовищі моделювання показали, що запропонований гібридний підхід RL-автомат перевершує стандартну наскрізну базову модель MADDPG за всіма протестованими умовами. Гібридний рій демонстрував стабільно вищі показники успішності виконання місії, особливо в умовах ворожого глушіння, де рівень успіху перевищував 90%, тоді як у базової моделі спостерігалося значне зниження ефективності. Криві навчання показали швидшу збіжність і вищі фінальні значення винагороди для гібридного методу, що відображає переваги структурованого навчання з урахуванням режимів. У сценаріях із динамічними цілями гібридний рій підтримував довший безперервний супровід завдяки скоординованій тактиці, тоді як базова модель часто втрачала контакт. Ці результати демонструють, що інтеграція формального автомата з багатоагентним навчанням з підкріпленням забезпечує більш надійне, ефективне та масштабоване прийняття рішень роєм БПЛА в умовах невизначеності. Отримані висновки також узгоджуються з сучасними дослідженнями, які показують, що поділ місій на фази та навчання спеціалізованих для режимів стратегій може суттєво підвищити продуктивність порівняно з монолітними політиками.

Висновки. Запропонована гібридна модель демонструє, що поєднання перемикання режимів на основі формальних автоматів із глибинним навчанням з підкріпленням може забезпечити більш надійне та ефективне прийняття рішень для роїв БПЛА в умовах невизначеного та ворожого середовища. Дискретне керування режимами вводить предметно-орієнтовані знання (наприклад, коли змінювати завдання або переходити в безпечний режим), що спрямовує процес навчання та забезпечує дотримання обмежень безпеки, тоді як MADDPG оптимізує безперервне керування в межах кожного режиму. Такий гібридний підхід забезпечує кращу адаптивність до змінних загроз і умов середовища, що підтверджується стійкою роботою в умовах радіоелектронної боротьби. У подальших дослідженнях планується розширити цей підхід на більш складні сценарії із використанням гетерогенних роїв БПЛА та дослідити автоматичне виявлення режимів (наприклад, за допомогою ієрархічного навчання з підкріпленням), щоб зменшити залежність від автоматів, визначених експертами.

Завантажити

Дані для завантаження поки недоступні.

Біографії авторів

  • автор Олексій БИЧКОВ, д-р техн. наук, проф., афіліація Київський національний університет імені Тараса Шевченка, Київ, Україна

    ORCID ID:0000-0002-9378-9535

  • автор Михайло ВОЙТОВИЧ, асп., афіліація Київський національний університет імені Тараса Шевченка, Київ, Україна

    ORCID ID: 0009-0003-0405-0304

Посилання

Casau, P., Cabecinhas, D., & Silvestre, C. (2011). Autonomous transition flight for a vertical take-off and landing aircraft. In 2011 50th IEEE Conference on Decision and Control and European Control Conference (CDC-ECC) (pp. 3974–3979). IEEE. https://doi.org/10.1109/CDC.2011.6160819

Chi, P., Wei, J., Wu, K., Di, B., & Wang, Y. (2023). A bio-inspired decision-making method of UAV swarm for attack-defense confrontation via multi-agent reinforcement learning. Biomimetics, 8(2), 222. https://doi.org/10.3390/biomimetics8020222

Ekechi, C. C., Elfouly, T., Alouani, A., & Khattab, T. (2025). A survey on UAV control with multi-agent reinforcement learning. Drones, 9(7), 484. https://doi.org/10.3390/drones9070484

Feng, Z., Na, X., Hai, S., Sun, Q., & Shi, J. (2025). Deep reinforcement learning for UAV target search and continuous tracking in complex environments with Gaussian process regression and prior policy embedding. Electronics, 14(7), 1330. https://doi.org/10.3390/electronics14071330

Liu, M., Wei, J., & Liu, K. (2024). A two-stage target search and tracking method for UAV based on deep reinforcement learning. Drones, 8(10), 544. https://doi.org/10.3390/drones8100544

Lowe, R., Wu, Y., Tamar, A., Harb, J., Abbeel, P., & Mordatch, I. (2017). Multi-agent actor-critic for mixed cooperative-competitive environments (arXiv:1706.02275). arXiv. https://doi.org/10.48550/arXiv.1706.02275

Panerati, J., Zheng, H., Zhou, S., Xu, J., Prorok, A., & Schoellig, A. P. (2021). Learning to fly — a Gym environment with PyBullet physics for reinforcement learning of multi-agent quadcopter control (arXiv:2103.02142). arXiv. https://doi.org/10.48550/arXiv.2103.02142

Sierra-García, J. E., & Santos, M. (2021). Intelligent control of a UAV with a cable-suspended load using a neural network estimator. Expert Systems with Applications, 185, 115380. https://doi.org/10.1016/j.eswa.2021.115380

Xu, J., & Liang, G. (2025). Enhanced Q-learning and deep reinforcement learning for unmanned combat intelligence planning in adversarial environments. Scientific Reports, 15(1), 28364. https://doi.org/10.1038/s41598-025-13752-3

Zhang, K., Yang, Z., & Başar, T. (2021). Multi-agent reinforcement learning: A selective overview of theories and algorithms. In K. G. Vamvoudakis, Y. Wan, F. L. Lewis, & D. Cansever (Eds.), Handbook of reinforcement learning and control (Studies in Systems, Decision and Control, Vol. 325, pp. 321–384). Springer. https://doi.org/10.1007/978-3-030-60990-0_12

Zhao, B., Huo, M., Li, Z., Feng, W., Feng, W.-T., Yu, Z., Qi, N., & Wang, S. (2025). Graph-based multi-agent reinforcement learning for collaborative search and tracking of multiple UAVs. Chinese Journal of Aeronautics, 38(3), 103214. https://doi.org/10.1016/j.cja.2024.08.045

Завантаження

Опубліковано

2026-05-06

Номер

Розділ

Штучний та обчислювальний інтелект

Як цитувати

НАДІЙНЕ ПРИЙНЯТТЯ РІШЕНЬ РОЄМ БПЛА В УМОВАХ НЕВИЗНАЧЕНОСТІ ШЛЯХОМ ПОЄДНАННЯ БАГАТОАГЕНТНОГО НАВЧАННЯ З ПІДКРІПЛЕННЯМ ТА ГІБРИДНИХ АВТОМАТІВ: Автор є членом редколегії видання, тому не брав участі у рецензуванні та прийнятті рішення щодо публікації цієї статті. (2026). Сучасні інформаційні технології, 1(2(5). https://doi.org/10.17721/AIT.2025.2.05

Статті цього автора (цих авторів), які найбільше читають