Mu-En Wu, Jia-Hao Syu, Jerry Chun-Wei Lin, Jan-Ming Ho
投資組合管理處理的是兩件事:部位大小(position sizing)與資源配置(resource allocation)。 麻煩在於,傳統與通用的投組策略都需要把「未來股價」當成模型輸入—— 而未來股價在真實世界裡根本拿不到,這使得那類方法很難落地。
作者建立了一套 PMS(Portfolio Management System,投資組合管理系統), 以強化學習為核心,分別搭配 CNN 與 RNN 兩種神經網路 (對應 PMS_CNN 與 PMS_RNN 兩個版本)。 真正的關鍵是他們提出的新獎勵函數:不是用「這筆賺多少」來獎勵模型, 而是把夏普比率(Sharpe ratio)放進獎勵裡——等於一開始就要求模型「賺得穩」而不只是「賺得多」。
用交易報酬當獎勵,模型會學成「衝很快但很晃」;改用含夏普比率的獎勵, 模型自然學會兼顧波動。實驗結果:平均報酬增加 39.0%,回檔(drawdown)降低 13.7%。
作者指出 PMS_CNN 更適合用來建構強化學習投組, 但也誠實說明它的回檔風險是 PMS_RNN 的 1.98 倍——效果更好,但要承受更大的波動。
在測試的資料集中,PMS 在 台灣 50(TW50)與傳統類股上勝過基準策略; 但作者也直接寫明:在金融類股資料集上,PMS 輸給其中一個基準策略。 整體而言,PMS 在幾乎所有資料集上都能獲利、有效,且投資風險較低。
這種「贏在哪、輸在哪都講清楚」的寫法,正是這篇論文值得一讀的地方—— 含夏普比率的新獎勵函數確實提升了表現,也確實支撐了實際選股的資源配置。
閱讀原始論文(Springer) →