IEEE J. Biomedical & Health Informatics
2024
SCI · IF 6.7
LLM × 生醫資料整合
Biomedical Information Integration via Adaptive Large Language Model Construction
因任務挑模型、再組合:自適應 LLM 的生醫資料整合
Xingsi Xue*, Mu-En Wu , Fazlullah Khan | IEEE Journal of Biomedical and Health Informatics, 29(9): 6381–6394, Nov. 2024
一句話: 不同生醫資料庫「同一件事講法不一樣」,整合很難。這篇不押注單一模型,而是依任務自動挑選並組合多個 LLM ,把等價的生醫實體正確對齊。
先問:這在解什麼問題?the problem
整合多來源的生醫知識,對提升診斷準確度、效率與個人化治療都很關鍵。但不同資料集之間術語變異大、實體描述結構複雜——其中「生醫實體對齊 」(正確辨識並匹配不同資料集裡的等價實體)是最關鍵也最難的一步。
核心洞見:BERT 等 LLM 因具備深層情境嵌入與雙向性,很適合處理異質生醫資料;但沒有任何單一 LLM 能在所有匹配任務都最好 ——各有所長。
怎麼做?the method
Entity Alignment 以實體對齊切入 把生醫資料整合的難題,收斂到『對齊等價實體』這個關鍵步驟。
TSLLM 兩階段 LLM 建構 提出 Two-Stage LLM 框架,自適應地『挑模型、再融合』,而非單押一個。
Adaptive Fusion 因任務選模型 依不同異質匹配任務,動態選用最合適的 LLM 組合,發揮各自長處。
異質生醫資料 術語不一致 階段一:選模型 因任務挑合適 LLM 階段二:組合 融合各模型長處 實體對齊 整合後的知識 流程:異質資料 → 依任務挑 LLM → 組合融合 → 實體對齊完成整合
帶來什麼?why it matters
「與其押單一最強模型,不如因任務挑模型再組合」——這個思路讓生醫資料整合更穩健,對需要跨庫彙整的診斷輔助與個人化醫療特別有價值。
看 IEEE 原文 →