別被 AI 診斷的漂亮曲線迷惑

發佈于: 9 月 18, 2026
編輯: Nigel Trimmer

如果一台機器能夠給出疾病名稱,卻無法讓人放心依靠它找出病因,我們究竟買到了什麼?這是懸在醫療 AI 頭頂的尷尬問題:理論演示光彩奪目,臨床落地卻十分脆弱。最新研究並非否定這項技術的價值,而是向投資者、醫院與供應商揭示一個更令人不安的現實:在受控測試環境下具備診斷能力,不等於能在真實世界發揮效用。真實臨床場景裡,患者數據往往殘缺、混亂甚至存在誤導,如同變幻莫測的天氣,而非工整的幾何題。

這種陷阱並不陌生。金融領域,不少模型在市場環境變化後便失效;軍事領域,作戰計劃一經接觸實際戰況就需要調整。醫療領域同樣如此。一套系統可以在限定場景中完成精准的診斷操作,卻難以通過真實診療的考驗。市場偏愛乾淨平滑的性能曲線、打磨精良的產品演示,以及 AI 必將重塑醫療的敘事。但臨床現實並不迎合這類敘事,它青睞能夠承受各類不確定性衝擊的系統,而非僅在理想環境下表現優雅的模型。

4 月 13 日發表於《JAMA Network Open》的一項研究,使用 29 個標準化臨床病例對 21 個 AI 模型開展測試。研究顯示,當患者信息不全時,模型鑒別診斷失敗率超過 80%。而信息殘缺恰恰是臨床工作的起點,醫生極少拿到完整、規整的病歷資料。在數據完備的條件下,這批模型表現明顯改善,最終診斷失敗率降至 40% 以下,頭部模型準確率甚至超過 90%。亮眼的成績背後藏著陷阱:一台擅長在謎題幾乎解開之後報出答案的機器,還不能算作可靠的解謎者。

麻省總醫院布萊根健康體系的阿裡亞・拉奧作為該研究第一作者,清晰點明了其中差異:“當數據齊全時,這些模型很擅長給出最終診斷;但在病例初期信息匱乏的開放場景,它們會陷入困境。” 這不是一個可以忽略的小瑕疵,而是問題的核心。診斷的第一階段不是比拼誰給出最終答案更快,而是在信息不確定狀態下開展信息搜尋。這正是臨床醫生價值所在,也是脆弱 AI 模型暴露短板的場景。

這是工程領域常見誤區:把負載測試結果等同於真實使用表現。一座在實驗室靜態承重測試中合格的橋樑,不代表能夠抵禦風暴、地基沉降、疲勞損耗、結冰與持續車流的疊加考驗。同理,通過基準測試的醫療 AI,遇到相互矛盾的症狀、殘缺病史或非教科書式病例時依然可能出錯。這不是抽象層面的技術缺陷,而是發生在風險邊緣場景的失效,傷害往往由此產生。

本次 JAMA 研究納入 OpenAI、穀歌、Anthropic、xAI 與 DeepSeek 的模型。重點不在於各家排名高低,而在於警示:這並非單一廠商的問題,屬結構性短板。眾多模型共享同一弱點,說明問題不在於品牌,而在於任務本身的特性。封閉式標準化題目適合模型完成模式補全;真實醫療需要在模糊信息下做出判斷,這項能力更難規模化複製。

而證據缺口,遠比行業宣傳所呈現的更大。AuntMinnie 援引《PLOS Digital Health》的研究顯示,1357 款獲得 FDA 許可的 AI 醫療設備中,僅有 3 款(0.2%)經過死亡率、再入院率這類以患者結局為核心指標的驗證。放射學領域,1059 款獲批 AI 設備裡僅 3 款(0.3%)完成前瞻性臨床試驗。這不是微小的統計誤差,而是行業信號:大量設備拿到審批,但配套的臨床獲益證據儲備嚴重不足。

同一研究還發現,62% 的 AI 設備相關研究採用樣本量小、人群同質化的數據集,常將孕婦、兒童與非英語人群排除在外。換言之,現有證據基礎不僅單薄,覆蓋人群也存在明顯局限,而醫療恰恰需要面向多元人群。這是典型的機構性偏差:不斷優化容易量化的指標,再宣稱結果具備普適性。一份剔除疑難病例的樣本,就像一張抹去山脈的地圖,卻聲稱完整還原地貌。

設備獲批,不等於患者獲益。麻省理工重症醫學團隊的塞巴斯蒂安・阿・卡哈斯・奧爾多涅斯從另一角度闡釋:“我們本就預料證據基礎薄弱,但沒想到僅有 3 款設備完成患者結局驗證。” 他同時指出,510 (k) 審批路徑下,獲批僅代表設備與已上市產品實質等同,並不代表使用該設備能改善患者狀況。這一點很多採購方不願深究:獲批只代表產品和現有產品大體相當,不等於帶來增量收益。

這一區分至關重要。醫療領域,不能單憑軟件指標評判 “夠用”。模型或許可以減輕文書負擔、加快分診、整理信息,這些都是實實在在的價值。但如果宣稱它能夠改善診療質量,舉證責任就不能停留在工程層面的性能指標,必須轉向臨床結局。否則行業會落入現代系統最古老的誤區:把行動等同於價值。儀錶盤可以持續亮起,但底層系統可能持續過熱。

投資者尤其容易被這套敘事吸引,它自帶一種必然實現的想像:AI 技術持續進步,醫療市場體量巨大,廣闊市場靜待挖掘。這套敘事足以打動著眼未來的資本。但市場常常為簡化複雜現實的線性趨勢支付過高溢價。人腦天然傾向外推預測,因為懷疑與審慎成本更高。可概率規律會懲罰這種廉價推演。在醫療領域,錯誤雖不常發生,但後果嚴重;平均表現再好,尾部風險才是重中之重。一次充滿自信的錯誤判斷,足以抵消上百次正確建議。

所以醫療 AI 不只是軟件故事,更是治理故事。核心問題不在於模型輸出聽起來是否智能,而在於使用這套系統的機構能否量化傷害、監測模型漂移、拒絕把性能演示直接等同於臨床獲益。博弈論中,這是普通信號與可信信號的區別。任何主體都可以宣稱產品性能優異,但很少有人能在無法人為美化的真實條件下證明。

麻省理工重症數據團隊提出一套三階段證據階梯:0 期回顧性驗證;1 期至少 500 名受試者的前瞻性研究;2 期至少 2000 名受試者的多中心結局試驗。團隊同時呼籲,II 類與 III 類 AI 醫療設備的前瞻性試驗需要在 FDA 預先註冊。這並非多餘的官僚程序,而是為了防止行業在實驗室宣告勝利,便直接當作臨床可用的醫療方案。

完善的證據階梯不是反對創新,而是讓創新具備持久生命力。工程層面,設計方案需要經受荷載、疲勞與時間考驗才能獲得信任;生物層面,性狀存續依靠適配持續變化的環境;金融領域,優秀系統不是能夠預判每一次波動,而是在預測出錯時依然保持穩健。醫療 AI 也應當適用同類標準。目標不是讓模型看起來睿智,而是在模型不確定時,讓整套診療體系更加安全。

不少人會認為,技術持續迭代就能解決所有問題。或許未來可以,但市場與機構不應按照 “修復方案已經落地” 的前提進行投資。僅在完整數據輸入下才能穩定發揮的系統,依然依賴理想條件。而理想條件從來不是醫療行業的常態:患者就診時間偏晚、意識混亂、焦慮或承受劇痛;病歷記錄殘缺;症狀相互重疊;語言、年齡與就醫條件,都會影響信息採集與判斷。

正因如此,現有實證遠比行業宣傳敘事更值得重視。它證明醫療 AI 在規整、受限環境中表現強勁,但在診療初始階段很容易失效。同時也暴露驗證鏈條最關鍵環節的短板:缺少患者結局數據、樣本人群單一、缺少貼近真實診療場景的前瞻性試驗。結論不是拒絕 AI 工具,而是停止把流暢的模型輸出等同於臨床事實。醫療和資本市場同理,過早樂觀的代價,往往由最無力承受後果的人承擔。

人工智能 醫療服務