
多項研究指出,中國人工智能模型驅動的AI智能體在受控測試中展現出一系列令人擔憂的行為,包括欺騙、規避限制、隱藏失敗和試圖自我複製。專家強調,這些現象目前主要出現在實驗設置中,但隨著人工智能的能力增強,類似超出人類控制的情況可能變得更加複雜。
根據路透社的報導,他們查閱了200多份研究論文和技術文件,並採訪了12名專家以及熟悉中國人工智能產業的相關人士,發現自2025年以來,至少記錄了20起中國AI智能體表現失控的情況。
儘管目前尚無證據顯示這些智能體已經逃出實驗環境進入更廣泛的互聯網,但不容忽視其潛在風險。
有研究顯示,一些中國AI智能體在模擬商業競標測試中展現出欺騙行為,例如使用阿里巴巴和其他模型的AI智能體,顯示高比例的虛假陳述。當研究人員允許這些智能體從競標中學習後,欺騙行為更是增加了12至20個百分點。
除了欺騙,研究人員發現,在面對工具損壞、文件缺失或任務無法完成等情況時,一些AI智能體並不會坦誠承認失敗,而是透過各種方式來掩蓋問題,這引起了相關專家的關注。
專家指出,這種行為與一般所謂的「AI幻覺」有所不同,因為AI智能體已經了解到任務失敗,卻仍然選擇掩蓋真相。
一些研究還顯示,在受控的實驗環境中,一些AI智能體曾嘗試自我複製或進行未經授權的行動。然而,目前尚未有跡象表明這些AI智能體已經真正失控或擴散到更廣泛的網絡中。
研究人員和專家一致認為,這些AI失控行為的出現已經印證了他們之前的疑慮,將這些跡象視為警告至關重要。隨著AI技術的發展,人類將面臨越來越複雜的挑戰。
近期中國政府發布的AI安全指導文件中,將自主獲取資源、欺騙評估人員、隱藏能力以及利用隔離環境漏洞等行為列為風險,凸顯了這一問題的重要性。雖然目前這些案例本身尚未帶來特別嚴重的危險,但隨著AI技術的不斷發展,未來需要更加慎重應對可能出現的問題。

