當地時間9月10日,AI企業Anthropic發佈最新威脅報告,曝光行業核心安全困境:有用戶利用Claude模型開展生物領域研究,平臺無法精准界定用戶行為是合法醫藥科研,還是生物武器研發,暴露高端AI工具普遍存在的兩用性管控難題。
報告統計,在30天監測週期內,平臺共發現35項具備潛在生物安全風險的研究行為,其中5起案例明確涉及可支撐生物武器研發的操作。相關使用者刻意規避平臺安全管控、隱瞞研究目的,繞過區域使用限制,通過偽裝研究訴求規避AI安全防護機制。針對違規行為,Anthropic已封禁相關涉事賬戶,並將本次監測結果納入模型安全防護與威脅情報體系迭代優化。
此次風險案例均來自Claude舊版模型,並非最新迭代產品,排除了全新模型失控的極端情況,但凸顯了AI安全的核心漏洞:風險並非源於模型暴力突破防護,而是來自人為刻意偽裝與規避。其中典型案例涉及基孔肯雅病毒功能獲得性研究,相關研究包含病毒突變設計與活體動物實驗,可對接軍事科研項目,大幅壓縮生物研究從理論到落地的週期。
本次事件的核心痛點在於意圖判定的模糊性。生物領域研究本身邊界寬泛,病毒改良、毒素研究等內容,既可用於疫苗研發、公共衛生防控等合規場景,也可被用於生物武器開發,沒有絕對清晰的道德與安全劃分標準。這也導致Anthropic無法核實涉事用戶的真實動機,無法定性相關研究的最終用途。
行業分析指出,AI安全的核心矛盾已從模型能力失控,轉向人機博弈下的監管滯後。隨著AI工具通用性、便捷性大幅提升,無需專業技術能力即可實施風險操作,普通使用者便能模糊科研與危險研發的邊界。相較於可量化的技術漏洞,人為動機的不可控、科研場景的天然兩用性,成為AI生物安全最難破解的問題。
業內總結,本次報告並非證實AI生物武器威脅已落地,而是警示行業現狀:高端AI工具的技術能力迭代速度,遠超監管與安全分類體系的更新速度。模型防護可以持續迭代優化,但無法徹底規避人為動機帶來的濫用風險,AI安全管控將長期處於動態博弈狀態。