Jin Wang, Chenyang Li, Yunhui Shi, Dan Wang, Mu-En Wu, Nam Ling, Baocai Yin
深度圖(depth map)記錄的是「畫面中每個點離鏡頭多遠」,是 3D 重建、AR 與機器視覺的基礎。麻煩在於:感測器拿到的深度圖解析度往往很低,細節模糊。
好消息是,同一個場景的高解析度彩色影像通常很容易取得。於是就有了「導引式深度圖超解析(Guided Depth map Super-Resolution, GDSR)」這條主流路線——用彩色影像當「嚮導」,去指引深度圖的重建。難題也在這裡:從彩色影像抽出來的導引資訊,要怎麼用才算用得夠徹底?
作者先設計了 MF(multi-scale feedback)模組,再把 MF 區塊依序串接成 MSF-Net,讓特徵在一層層傳遞中被反覆萃取與精修。
用平行的取樣層,加上跨多個時間步的回饋連結,學到不同尺度的資訊,同時減少資訊在網路傳遞中的流失。
inter-scale attention:自動挑選並融合不同尺度中「重要」的特徵,而不是一視同仁地平均。
cross-domain attention conciliation:在每個 MF 區塊之後,讓深度特徵與對應的彩色特徵互相交流。
作者在合成資料集與實拍資料集上都做了評估,大量實驗結果顯示所提方法在客觀指標與主觀畫質兩方面都達到當時的最佳水準(state-of-the-art)。