← 回論文發表吳牧恩教授
白話導讀 Applied Soft Computing SCI · IF 8.263 · Q1 2022/08

讓 AI 學會「你能虧多少」:把回檔限制寫進獎勵函數

Embedded Draw-down Constraint Reward Function for Deep Reinforcement Learning

Jimmy Ming-Tai Wu, Sheng-Hao Lin, Jia-Hao Syu, Mu-En Wu*

一句話:凱利公式雖然優雅,卻預設「每個投資人的風險承受度都一樣」,也沒把下檔風險算進去; 這篇把「回檔限制」直接寫進深度強化學習的獎勵函數裡, 讓 AI 在追求報酬的同時,也照顧投資人能忍受多大的虧損。

先問:這在解什麼問題?the problem

資金管理(又稱資產配置)一直是交易與投資領域的研究前沿。 自 1952 年 Markowitz 建立現代投資組合理論以來,這個題目吸引了無數學者, 而凱利準則(Kelly criterion)是其中最耀眼的成果之一—— 它給出一個優雅的解:最佳下注比例,能讓資金的對數值長期最大化。

但作者指出凱利有兩個被忽略的盲點:它忽略了每位投資人的風險承受度並不相同, 而且計算比例時沒有把下檔風險(downside risk)納入考量

白話比喻:凱利公式算出來的是「數學上最會長大的下注方式」, 但它沒問你一句——「這中間會有一段很難熬的大回檔,你撐得住嗎?」

怎麼做?把風險寫進獎勵函數the method

作者做了兩件事:第一,用機率為基礎的方法建立一個風險預測模型; 第二,調整深度強化學習的獎勵函數,讓它把下檔風險考慮進去。 換句話說——與其用一個只想著把報酬最大化的「天真獎勵函數」, 改良後的深度強化學習能把投資人的風險承受度也考慮進來

價格資料 DXY / GBP·USD / EUR·USD 風險預測模型 機率為基礎 改良獎勵函數 嵌入回檔限制 深度強化學習 考慮風險承受度
作法:先以機率方法預測風險,再把回檔限制嵌入深度強化學習的獎勵函數,取代只追求報酬的天真獎勵。

驗證與結果the results

作者說明實驗只分析單一資產的情境,並採用 DXY(美元指數)、GBP/USD、EUR/USD 作為訓練與驗證的資料集。結果顯示,對獎勵機制所做的調整帶來了值得玩味的表現: 當要求的最大回檔(MDD)大於 3% 時,達成的機率平均高於 70%

這個結果的讀法是——投資人可以先說出自己能忍受的回檔上限, 系統再回答「在這個限制下,達標的機率大概是多少」。 風險不再是事後才發現的意外,而是事前就能設定的參數。

閱讀原始論文(ScienceDirect) →
本頁為方便一般讀者理解的「白話導讀」,非論文原文;技術細節、實驗數據與完整結論請以正式發表版本為準。
出處:Jimmy Ming-Tai Wu, Sheng-Hao Lin, Jia-Hao Syu, Mu-En Wu*, Embedded Draw-down Constraint Reward Function for Deep Reinforcement Learning, Applied Soft Computing, Vol. 125, art. 109150, Aug. 2022.