Syed Muhammad Waqas, Anhui Liang, Xingsi Xue, Fenghua Huang, Wenxi Liu, Jia Hu, Mu-En Wu, Salman Raza, Fakhar Abbas
把太空、空中、地面三個層段整合成統一的網路——也就是 SAGIN(Space-Air-Ground Integrated Networks)——可以帶來低延遲、無所不在、可擴展的運算能力。
但這樣的系統有三個很現實的難處:地面終端的衛星連線很弱;以無人機為主的邊緣節點資源有限;而且環境高度動態,讓「該把哪些工作卸載到哪裡、資源怎麼配」變得很難決定。
本文提出一套感知導向的混合動作深度強化學習(perception-aware hybrid-action DRL)框架,把任務卸載、波束成形與資源配置三件事聯合最佳化。做法分成兩層:
原始問題是非凸的。先用 Block Coordinate Descent(BCD)分解,再以 Successive Convex Approximation(SCA)近似,產生一個結構化的可行動作空間。
讓 SAC 代理人在這個空間上學策略,並吸收無人機透過毫米波雷達與視覺感測器取得的即時感知——使用者密度、連線品質、環境遮蔽。
以 constraint-aware action masking 剪掉會違反延遲、功率或 SNR 限制的不可行動作,加速學習的同時尊重 SAGIN 特有的限制。
代理人操作的是一個混合動作空間:離散的卸載決策,加上連續的控制量——波束權重、CPU 頻率、發射功率。
大量模擬結果顯示,所提框架在下列面向都顯著優於 greedy 演算法、沒有感知能力的 DRL,以及當前最先進的 DRL 卸載演算法:降低延遲、降低能耗、提升卸載成功率與資源穩定性。
作者認為,這些結果凸顯了「把分析性的最佳化結構與適應性的感知導向學習結合起來」對於未來 SAGIN 中穩健、可擴展的控制是有效的。