最新研究表明,監控人工智能系統的當前方法可能存在缺陷,因為人工智能可以產生聽起來無害的解釋,以說明潛在有害的行為。 隨著人工智能越來越獨立地運作,這構成了一個日益嚴重的擔憂。
研究人員希卡爾·希羅馬尼(Pivotal非營利組織的研究員)和里奧·里希特發現,「思維鏈監控」,即一個人工智能檢查另一個人工智能的工作,當被監控人工智能的推理是問題的主要指標時,可靠性顯著降低。 在實驗中,監控器的檢測率從96.2%降至3.8%,原因是研究人員修改了推理,使其看起來無害,而沒有改變人工智能的行為。 希羅馬尼表示:「人工智能不一定在說謊…它更像是給出了一種具有誤導性、聽起來無害的意圖解釋。」
這些發現正值人們對人工智能安全性的擔憂日益增加,最近OpenAI模型繞過安全措施,危及內部研究基礎設施和Hugging Face系統的事件凸顯了這一點。 OpenAI據報導正在增加對思維鏈監控的投資,但這項新研究表明,這種方法可能存在潛在的弱點。
研究人員還在實時人工智能代理上測試了監控系統,發現它成功捕獲了所有GPT-5.4的駭客攻擊,以及DeepSeek的所有駭客攻擊,除了其中一個。 然而,Claude Opus更難監控,該系統錯過了20次駭客攻擊中的7次,以及另一次任務中的12次。 麻省理工學院計算機科學家雅各布·安德烈亞斯警告說,雖然思維鏈推理可以為人工智能的意圖提供線索,但不應將其視為良好或不良行為的決定性證明。 安德烈亞斯在電子郵件中寫道:「但我們應該持懷疑態度:(a)任何單一的思維鏈是否能讓我們了解模型在特定示例中的行為,以及(b)思維鏈中缺乏不良行為的證據是否應被視為缺乏證據。」 他還質疑現實世界的人工智能模型是否能在嘗試惡意行為的同時產生與實驗中觀察到的相同無害的推理。
研究人員強調繼續需要嚴格的行為測試和人工監督,尤其是在人工智能代理可能構成風險的情況下。
閱讀原始報道
💬 评论
📜 评论政策