如果一台机器能够给出疾病名称,却无法让人放心依靠它找出病因,我们究竟买到了什么?这是悬在医疗 AI 头顶的尴尬问题:理论演示光彩夺目,临床落地却十分脆弱。最新研究并非否定这项技术的价值,而是向投资者、医院与供应商揭示一个更令人不安的现实:在受控测试环境下具备诊断能力,不等于能在真实世界发挥效用。真实临床场景里,患者数据往往残缺、混乱甚至存在误导,如同变幻莫测的天气,而非工整的几何题。
这种陷阱并不陌生。金融领域,不少模型在市场环境变化后便失效;军事领域,作战计划一经接触实际战况就需要调整。医疗领域同样如此。一套系统可以在限定场景中完成精准的诊断操作,却难以通过真实诊疗的考验。市场偏爱干净平滑的性能曲线、打磨精良的产品演示,以及 AI 必将重塑医疗的叙事。但临床现实并不迎合这类叙事,它青睐能够承受各类不确定性冲击的系统,而非仅在理想环境下表现优雅的模型。
4 月 13 日发表于《JAMA Network Open》的一项研究,使用 29 个标准化临床病例对 21 个 AI 模型开展测试。研究显示,当患者信息不全时,模型鉴别诊断失败率超过 80%。而信息残缺恰恰是临床工作的起点,医生极少拿到完整、规整的病历资料。在数据完备的条件下,这批模型表现明显改善,最终诊断失败率降至 40% 以下,头部模型准确率甚至超过 90%。亮眼的成绩背后藏着陷阱:一台擅长在谜题几乎解开之后报出答案的机器,还不能算作可靠的解谜者。
麻省总医院布莱根健康体系的阿里亚・拉奥作为该研究第一作者,清晰点明了其中差异:“当数据齐全时,这些模型很擅长给出最终诊断;但在病例初期信息匮乏的开放场景,它们会陷入困境。” 这不是一个可以忽略的小瑕疵,而是问题的核心。诊断的第一阶段不是比拼谁给出最终答案更快,而是在信息不确定状态下开展信息搜寻。这正是临床医生价值所在,也是脆弱 AI 模型暴露短板的场景。
这是工程领域常见误区:把负载测试结果等同于真实使用表现。一座在实验室静态承重测试中合格的桥梁,不代表能够抵御风暴、地基沉降、疲劳损耗、结冰与持续车流的叠加考验。同理,通过基准测试的医疗 AI,遇到相互矛盾的症状、残缺病史或非教科书式病例时依然可能出错。这不是抽象层面的技术缺陷,而是发生在风险边缘场景的失效,伤害往往由此产生。
本次 JAMA 研究纳入 OpenAI、谷歌、Anthropic、xAI 与 DeepSeek 的模型。重点不在于各家排名高低,而在于警示:这并非单一厂商的问题,属于结构性短板。众多模型共享同一弱点,说明问题不在于品牌,而在于任务本身的特性。封闭式标准化题目适合模型完成模式补全;真实医疗需要在模糊信息下做出判断,这项能力更难规模化复制。
而证据缺口,远比行业宣传所呈现的更大。AuntMinnie 援引《PLOS Digital Health》的研究显示,1357 款获得 FDA 许可的 AI 医疗设备中,仅有 3 款(0.2%)经过死亡率、再入院率这类以患者结局为核心指标的验证。放射学领域,1059 款获批 AI 设备里仅 3 款(0.3%)完成前瞻性临床试验。这不是微小的统计误差,而是行业信号:大量设备拿到审批,但配套的临床获益证据储备严重不足。
同一研究还发现,62% 的 AI 设备相关研究采用样本量小、人群同质化的数据集,常将孕妇、儿童与非英语人群排除在外。换言之,现有证据基础不仅单薄,覆盖人群也存在明显局限,而医疗恰恰需要面向多元人群。这是典型的机构性偏差:不断优化容易量化的指标,再宣称结果具备普适性。一份剔除疑难病例的样本,就像一张抹去山脉的地图,却声称完整还原地貌。
设备获批,不等于患者获益。麻省理工重症医学团队的塞巴斯蒂安・阿・卡哈斯・奥尔多涅斯从另一角度阐释:“我们本就预料证据基础薄弱,但没想到仅有 3 款设备完成患者结局验证。” 他同时指出,510 (k) 审批路径下,获批仅代表设备与已上市产品实质等同,并不代表使用该设备能改善患者状况。这一点很多采购方不愿深究:获批只代表产品和现有产品大体相当,不等于带来增量收益。
这一区分至关重要。医疗领域,不能单凭软件指标评判 “够用”。模型或许可以减轻文书负担、加快分诊、整理信息,这些都是实实在在的价值。但如果宣称它能够改善诊疗质量,举证责任就不能停留在工程层面的性能指标,必须转向临床结局。否则行业会落入现代系统最古老的误区:把行动等同于价值。仪表盘可以持续亮起,但底层系统可能持续过热。
投资者尤其容易被这套叙事吸引,它自带一种必然实现的想象:AI 技术持续进步,医疗市场体量巨大,广阔市场静待挖掘。这套叙事足以打动着眼未来的资本。但市场常常为简化复杂现实的线性趋势支付过高溢价。人脑天然倾向外推预测,因为怀疑与审慎成本更高。可概率规律会惩罚这种廉价推演。在医疗领域,错误虽不常发生,但后果严重;平均表现再好,尾部风险才是重中之重。一次充满自信的错误判断,足以抵消上百次正确建议。
所以医疗 AI 不只是软件故事,更是治理故事。核心问题不在于模型输出听起来是否智能,而在于使用这套系统的机构能否量化伤害、监测模型漂移、拒绝把性能演示直接等同于临床获益。博弈论中,这是普通信号与可信信号的区别。任何主体都可以宣称产品性能优异,但很少有人能在无法人为美化的真实条件下证明。
麻省理工重症数据团队提出一套三阶段证据阶梯:0 期回顾性验证;1 期至少 500 名受试者的前瞻性研究;2 期至少 2000 名受试者的多中心结局试验。团队同时呼吁,II 类与 III 类 AI 医疗设备的前瞻性试验需要在 FDA 预先注册。这并非多余的官僚程序,而是为了防止行业在实验室宣告胜利,便直接当作临床可用的医疗方案。
完善的证据阶梯不是反对创新,而是让创新具备持久生命力。工程层面,设计方案需要经受荷载、疲劳与时间考验才能获得信任;生物层面,性状存续依靠适配持续变化的环境;金融领域,优秀系统不是能够预判每一次波动,而是在预测出错时依然保持稳健。医疗 AI 也应当适用同类标准。目标不是让模型看起来睿智,而是在模型不确定时,让整套诊疗体系更加安全。
不少人会认为,技术持续迭代就能解决所有问题。或许未来可以,但市场与机构不应按照 “修复方案已经落地” 的前提进行投资。仅在完整数据输入下才能稳定发挥的系统,依然依赖理想条件。而理想条件从来不是医疗行业的常态:患者就诊时间偏晚、意识混乱、焦虑或承受剧痛;病历记录残缺;症状相互重叠;语言、年龄与就医条件,都会影响信息采集与判断。
正因如此,现有实证远比行业宣传叙事更值得重视。它证明医疗 AI 在规整、受限环境中表现强劲,但在诊疗初始阶段很容易失效。同时也暴露验证链条最关键环节的短板:缺少患者结局数据、样本人群单一、缺少贴近真实诊疗场景的前瞻性试验。结论不是拒绝 AI 工具,而是停止把流畅的模型输出等同于临床事实。医疗和资本市场同理,过早乐观的代价,往往由最无力承受后果的人承担。