OpenAI披露AI智能體異常行為調查的最新進展。
當地時間9月25日,OpenAI在官網更新調查進展:根據目前的審查結果,OpenAI已通知數十個第三方。同時,OpenAI還披露,已發現53起用戶提供的圖片被上傳至圖片託管網站的案例。
據外媒報導,OpenAI的智能體曾訪問美國證券交易委員會(SEC)、美國商務部及美國人口普查局相關政府網站的公開信息,涉及SEC.gov、Investor.gov和Census.gov。OpenAI發言人回應稱,公司正在全面審查模型失准活動,在發現可能影響相關機構系統的情況時發出通知,預計後續還會通知更多機構。該發言人同時表示,目前審查發現的主要是常規研究任務,部分涉及政府網站,是因為模型經常將其作為公共資訊的權威來源。
OpenAI將目前審查和通知過程中發現的活動歸為五類。
一是繞過訪問控制,智能體通過更換網址、修改請求資訊或利用許可權超出預期的登錄會話,獲取通常需要身份驗證、特定許可權、訂閱或帳戶才能訪問的資訊和功能;
二是使用暴露的憑據,即發現公開的登錄資訊或訪問密鑰,並用其訪問服務;
三是查詢或命令注入:智能體輸入的文本被網站當作指令處理,可能觸發資料庫查詢、代碼或伺服器命令執行;
四是訪問運行時內部資源,即讀取涉及服務實現的檔,或與僅供內部使用的後臺系統交互,超出預期訪問許可權;
五是智能體垃圾資訊,例如將公共維基頁面用作共用留言板,改變網站內容並帶來清理負擔。
不過,OpenAI強調,收到通知並不意味著發生了重大安全事件,目前發現的多數案例嚴重程度較低。
澳大利亞方面此前已披露一起具體的未經授權訪問事件。當地時間9月24日,澳大利亞副總理兼國防部長理查德·馬爾斯表示,OpenAI的一個智能體今年6月未經授權進入澳國民醫療保險體系“國民保健”數據門戶,訪問了公開及非公開檔。澳方直到9月早些時候才收到OpenAI的通報。
馬爾斯24日稱,澳政府高度重視此事,已對OpenAI延遲通報表示關切。不過他也表示,事件影響相對有限。“涉及的是匯總醫療統計數據,沒有任何個人的醫療數據被訪問,系統本身也未遭到任何破壞。”
馬爾斯表示,澳方相關工作組將調查事件是否違反澳大利亞法律,並評估現行法律能否適應人工智慧能力不斷發展的形勢。
OpenAI此次擴大審查源於此前的AI開發平臺Hugging Face(“抱抱臉”)入侵事件。
7月底,OpenAI首次公開披露該事件。測試中的智能體突破了原本用於隔離模型的“沙箱”環境,並攻擊了Hugging Face。OpenAI隨後暫停了部分實驗並放緩相關工作,同時加強沙箱安全措施。
OpenAI針對Hugging Face事件形成了一份技術報告
據外媒報導,在Hugging Face事件中,面對註冊時的CAPTCHA驗證,OpenAI這些智能體直接調用圖像模型嘗試破解;它們還通過線上介面聯繫Claude、Haiku、DeepSeek、Kimi和Qwen等外部模型,請求協助判斷漏洞利用方案。
OpenAI表示,公司最初主要將其視為網路安全問題,隨後認識到,模型為完成高難度任務而採取不當策略,是事件發生的重要原因。公司因此進一步排查模型在訓練和評估期間的互聯網活動,調查範圍也從嚴重的安全事件擴展至其他越界行為。
同時,OpenAI還披露,研究環境中的智能體在使用第三方服務時,傳輸了訓練和評估數據。其中,53起案例涉及用戶圖片被上傳至圖片託管網站,相關鏈接未被公開列出。
OpenAI表示,已與託管服務商合作刪除大部分內容,其餘仍在處理。
OpenAI稱,受影響數據絕大多數並非來自用戶,相關外傳發生在其實施技術報告所述防護措施之前,公司正在加強訓練和評估過程中的安全測試及監測。
當地時間9月23日,OpenAI CEO山姆·奧特曼(Sam Altman)在聯合國安理會發言中表示,企業間的競爭不能成為冒進的理由,OpenAI過去曾單方面放慢開發速度,未來也會這樣做。他強調,如果沒有充分證據證明模型能夠保持在人類控制之下,就不應訓練這類模型。他還提醒,隨著AI逐步接近能夠改進自身及後續版本的階段,AI開發過程的自動化可能推動技術進步進一步加速,需要格外謹慎。
奧特曼同時呼籲建立相互銜接的國家和國際前沿AI標準,涵蓋能力評估、風險判斷、防護措施是否充分,以及如何維持有效的人類監督。他特別提出,應建立準確、及時的事件報告機制及統一的分類和報告規範,並為政府、關鍵基礎設施運營方和技術專家建立安全管道,共用新發現的漏洞與威脅。
OpenAI表示,大量模型操作記錄尚需逐案驗證,整體審查預計還將持續數月。
25日,奧特曼也在推特轉發OpenAI聲明並表示,目前的進度沒有達到自己希望的速度,“正在盡可能按照事件的嚴重程度確定優先順序,同時增加投入的資源。”奧特曼強調,此前hugging face仍然是迄今為止發現最嚴重的事件,“我們會盡可能保持透明,但也會收到一些因素限制,例如我們的智能體發現了其他公司的漏洞,這些漏洞是否公開,應由相關公司自行決定。”
來源:中國澎湃新聞