OpenAI模型失控事件始末細節曝光。
近日,據記者報導,美國開放人工智慧研究中心(OpenAI)承認,其人工智慧模型在內部評估測試中失控,入侵了全球知名人工智慧開源平臺抱抱臉公司(Hugging Face)的系統。Hugging Face於7月16日率先披露了此次入侵事件。OpenAI隨後於21日才披露,其GPT-5.6 Sol模型及一款未發佈的更強模型,在一個已移除安全防護措施的測試環境中成功逃脫沙盒限制,穿透OpenAI企業內網,併入侵了Hugging Face的伺服器,竊取了基準測試答案密鑰。
7月26日,Hugging Face CEO克萊門特·德朗格(Clement Delangue)在社交平臺上喊話OpenAI,表示已要求OpenAI發佈該“流氓”智能體的所有追蹤記錄,供大眾和社群研究。同時,他還要求價值1億美元的算力,以協助Hugging Face強化其網路防禦。

同時,7月25日,有外媒援引知情調查人士的消息稱,入侵Hugging Face的OpenAI智能體(Agent)曾展開持續數日的“駭客狂歡”,直到威脅已被控制、聯邦調查局(FBI)接到報警後很久,OpenAI才察覺此事。
據兩名知情人士介紹,這款能夠在極少甚至無需人工監督的情況下自主決策並執行複雜任務的程式,於7月9日前後試圖突破其在OpenAI內部的隔離測試環境。Hugging Face聯合創始人托馬斯·沃爾夫(Thomas Wolf)表示,針對這家AI工具與模型託管平臺的入侵始於兩天後的7月11日,一直持續到7月13日。
沃爾夫及另外三名知情人士稱,又過了好幾天,OpenAI才意識到是其智能體實施了此次攻擊;兩家公司直到7月20日前後才首次就此事進行溝通。
據悉,OpenAI在一份聲明中表示,這次入侵前所未有,“標誌著AI安全的重要時刻”。聲明還稱,公司正與外部顧問一同複盤此次事件,並將最終發佈技術報告。
三位網路安全專家指出,OpenAI對其AI智能體失控一事,引發了外界對公司安全流程的新質疑。
據三位消息人士透露,此前已有跡象顯示OpenAI的技術出現反常行為。在一個案例中,某個智能體留下了顯然是寫給未來版本的“便條”。這些在OpenAI基礎設施某處發現的便條,詳細說明了智能體如何擺脫OpenAI內部限制的方法。其中一位人士表示,在此前的模型測試中,就曾出現過監控系統被斷開的情況。
而據兩位瞭解OpenAI內部調查的人士透露,在7月18日-19日的週末,OpenAI員工在公司內部日誌(即記錄OpenAI系統運行情況的檔)中發現了線索,顯示其智能體已突破測試限制。
四位熟悉OpenAI模型訓練流程的人士表示,OpenAI經常同時運行多項模型評估任務,所有任務都以極快速度運轉,產生的數據量極為龐大,員工有時難以跟上節奏。
“這些模型會撒謊、會作弊、會駭客攻擊,”帕利塞德研究所執行總監、Anthropic前安全工程師傑弗裏·拉迪什(Jeffrey Ladish)表示,儘管入侵Hugging Face一事讓OpenAI顏面受損,但它更應引發更廣泛的反思:在競相部署更優、更快模型的過程中,各家頭部AI企業究竟願意投入多少成本用於繁瑣的安全措施?“必須要有政府監管,否則這事不會發生”。
OpenAI目前尚未發佈該事件的技術報告,但7月25日,OpenAI又突發伺服器故障,ChatGPT、API、Codex等均出現宕機情況。
OpenAI產品負責人蒂博·索蒂奧(Thibault Sottiaux)當天晚些時候發文回應稱:“我們遭遇了幾乎全球範圍的服務中斷,目前一切已恢復。我們將會吸取教訓,重新調整。”

目前,OpenAI正在準備上市階段。投後估值已達8520億美元,上市估值有望達到1萬億美元。
6月初,OpenAI宣佈已秘密遞表,並稱尚未確定具體的上市時間表,作為一家非上市公司可能更便於推進某些事項,上市進程可能需要一段時間。據OpenAI CEO山姆·奧特曼(Sam Altman)此前透露,公司或將在2027年上市。
此次模型失控事件,再度引發大眾對於AI安全的擔憂和反思。
當AI開始具備越來越強的自主決策能力時,如何建立與之匹配的安全機制和監管框架,或許比模型性能競爭本身更加迫切。對於正衝刺IPO的OpenAI而言,這也將成為資本市場關注的重要議題。
來源:中國澎湃新聞