| 1. 介入情境及輸出 |
系統的輸出型態兼具「分類(Classification)」與「分析(Analysis)」兩種性質:就分類而言,系統針對輸入的腦部無顯影劑電腦斷層影像,判斷是否存在腦內出血,並於輸出序列末端附加一張整體風險分級影像,將檢查結果歸類為 Low Risk 或 High Risk;就分析而言,系統進一步在原始 DICOM 切片上標示疑似出血區域(annotated region)、並計算估算的出血總量(volume)。三項輸出資訊會打包為一組新的 DICOM series,寫回 PACS,以供後續判讀醫師查閱。 |
| 2. 介入目的 |
本系統之預期用途為透過演算法分析腦部無顯影劑電腦斷層影像,自動檢測有無腦內出血,並提供出血區域與出血總量等輔助資訊。預期的病人族群為 20 歲以上(含)之疑似腦出血患者;預期使用者為第一線處理急性腦中風案例的醫師與護理師。就臨床決策角色而言,本系統定位為「告知(Informs)」類型,亦即 AI 輸出僅作為臨床管理的參考資訊,最終的醫療診斷與決策仍由醫護人員執行,AI 結果本身不得取代醫師的專業判斷。 |
| 3. 介入的警告範圍外使用 |
系統輸出一律附帶警語:「 Note: The following is inference by AI. Please use it with caution, as it may contain inaccuracies.」提醒使用者 AI 結果可能存在偏誤,不應獨立作為診斷依據。已知不適用之情境包含下列幾類:第一,20 歲以下之病人不在訓練資料涵蓋範圍;第二,非腦部無顯影劑電腦斷層之影像(例如 MRI、有顯影劑之 CT、或腦部以外部位之 CT)皆不適用。此外,若實際使用對象的人群特性與訓練資料差異過大,應由醫院或使用單位先行進行機構獨立的性能評估後,再決定是否於該族群常規使用。 |
| 4. 介入開發詳情及輸入特徵 |
訓練與測試資料集的挑選以 20 歲以上(含)之病人為納入條件,資料來源為本院歷史影像,與系統實際部署的急診 NCCT 工作流程屬於同一臨床情境,具有良好的分布相關性。系統實際使用到的輸入特徵包含性別、年齡、以及腦部無顯影劑電腦斷層影像本身。資料來源與部署情境皆為本院急診 NCCT 影像,因此訓練資料與實際臨床部署環境在造影設備、影像參數及病人族群特性上具高度一致性。 |
| 5. 確保介入開發公平性的過程 |
為確保輸出結果的公平性,開發團隊在訓練資料組成上刻意涵蓋不同性別與年齡層,使模型具備跨次族群的通用性;於模型訓練完成後,再針對性別與年齡進行次族群(subgroup)分析,確認各次族群的準確率皆能維持於可接受範圍內。
在管理、減少或消除偏見方面,開發團隊採取了三層次的策略:首先,在資料層面平衡不同性別與年齡層的個案數,避免多數族群主導模型學習;其次,對樣本數較少的次族群調整訓練權重,讓弱勢族群的特徵能被模型充分學習;最後,若後續監控發現模型在特定次族群上出現系統性偏誤,將針對該弱勢族群進行獨立建模,以避免整體模型因少數族群資料不足而犧牲其預測公平性。 |
| 6. 外部驗證過程 |
本系統目前正在進行外部驗證中,預計在啟用申請或正式臨床部署前,完成跨院或跨資料集的獨立驗證,以強化模型在異質環境下的可信度。 |
| 7. 模型表現量化指標 |
本系統以「整體靈敏度」與「整體特異度」為主要量化指標。宣稱閾值設定為靈敏度 ≥ 0.80、特異度 ≥ 0.80;在目前的院內測試中,實測靈敏度與特異度皆達 0.81 以上,高於宣稱閾值。評估方式為以專業醫師判讀結果為 ground truth,計算模型偵測 ICH 的敏感度與特異度。相關設計與評估準則參考自文獻:Nawabi, Jawed, et al. "Cross-institutional automated multilabel segmentation for acute intracerebral hemorrhage, intraventricular hemorrhage, and perihematomal edema on CT." Radiology Advances 2.2 (2025): umaf012。 |
| 8. 介入實施和使用的持續維護 |
系統的有效性監控與公平性監控頻率皆設定為每年一次。具體監控程序為:持續蒐集系統上線後的實際個案數據,將模型應用於這些追蹤資料重新進行推論,以預設的量化指標(靈敏度與特異度閾值 80%)檢視模型表現,並長期追蹤效能的趨勢變化。截至目前為止,以現有追蹤資料計算之靈敏度與特異度均維持在 80% 以上,符合宣稱標準。 |
| 9. 更新和持續驗證或公平性評估計畫 |
模型之定期更新頻率為每年一次;當監控期間發現模型表現下降至預設閾值以下時,開發團隊會先分析原因並啟動模型優化流程。更新作業共分為三個主要階段:第一階段為資料更新,包括新訓練資料之蒐集、資料清理與標記、以及資料品質與代表性的評估;第二階段為模型再訓練,以更新後的資料集進行訓練、執行交叉驗證、並與現行版本進行效能比較;第三階段則是在確認新版本效能優於舊版、且符合宣稱指標後,將線上模型替換為更新版本,並留存版本紀錄以利後續追溯。 |