← 回論文發表吳牧恩教授
白話導讀 Applied Intelligence SCI · IF 5.019 · Q1 2021

不預測股價,也能管好一個投資組合

Portfolio Management System in Equity Market Neutral using Reinforcement Learning

Mu-En Wu, Jia-Hao Syu, Jerry Chun-Wei Lin, Jan-Ming Ho

一句話:傳統投組策略都要先「預測未來股價」,但那在真實市場幾乎做不到; 這篇改用強化學習直接學「該怎麼配置部位」,並把夏普比率寫進獎勵函數—— 平均報酬提高 39.0%、回檔降低 13.7%

先問:這在解什麼問題?the problem

投資組合管理處理的是兩件事:部位大小(position sizing)資源配置(resource allocation)。 麻煩在於,傳統與通用的投組策略都需要把「未來股價」當成模型輸入—— 而未來股價在真實世界裡根本拿不到,這使得那類方法很難落地。

白話比喻:與其花力氣去算「明天天氣幾度」,不如直接學會「什麼情況下該帶幾件衣服」。 這篇論文選的是後者。

怎麼做?用強化學習+兩種神經網路the method

作者建立了一套 PMS(Portfolio Management System,投資組合管理系統), 以強化學習為核心,分別搭配 CNNRNN 兩種神經網路 (對應 PMS_CNN 與 PMS_RNN 兩個版本)。 真正的關鍵是他們提出的新獎勵函數:不是用「這筆賺多少」來獎勵模型, 而是把夏普比率(Sharpe ratio)放進獎勵裡——等於一開始就要求模型「賺得穩」而不只是「賺得多」。

市場狀態 不需預測股價 強化學習 CNN / RNN 夏普獎勵函數 獎勵「穩定地賺」 部位配置 PMS 投組
PMS 架構:略過「預測未來股價」這一步,直接以強化學習學習部位配置,並用含夏普比率的獎勵函數評價表現。

關鍵巧思:獎勵函數決定模型的性格what's new

把夏普比率寫進獎勵

用交易報酬當獎勵,模型會學成「衝很快但很晃」;改用含夏普比率的獎勵, 模型自然學會兼顧波動。實驗結果:平均報酬增加 39.0%,回檔(drawdown)降低 13.7%

CNN 與 RNN 各有取捨

作者指出 PMS_CNN 更適合用來建構強化學習投組, 但也誠實說明它的回檔風險是 PMS_RNN 的 1.98 倍——效果更好,但要承受更大的波動。

結果如何?(含作者自己指出的限制)the results

在測試的資料集中,PMS 在 台灣 50(TW50)與傳統類股上勝過基準策略; 但作者也直接寫明:在金融類股資料集上,PMS 輸給其中一個基準策略。 整體而言,PMS 在幾乎所有資料集上都能獲利、有效,且投資風險較低。

這種「贏在哪、輸在哪都講清楚」的寫法,正是這篇論文值得一讀的地方—— 含夏普比率的新獎勵函數確實提升了表現,也確實支撐了實際選股的資源配置。

閱讀原始論文(Springer) →
本頁為方便一般讀者理解的「白話導讀」,非論文原文;技術細節、實驗數據與完整結論請以正式發表版本為準。
出處:Mu-En Wu, Jia-Hao Syu, Jerry Chun-Wei Lin, Jan-Ming Ho, Portfolio Management System in Equity Market Neutral using Reinforcement Learning, Applied Intelligence, Vol. 51, pp. 8119–8131, 2021.