OpenAI本週三宣佈,AI對齊研究領域的核心人物保羅·克裏斯蒂亞諾正式加入OpenAI基金會董事會。克裏斯蒂亞諾長期專注於如何讓AI系統與人類利益保持一致並處於人類控制之下,他也是”基於人類回饋的強化學習”(RLHF)技術的先驅之一——這項技術是訓練大語言模型的關鍵方法,正是他在OpenAI工作期間開發的。2021年,他離開OpenAI創立了對齊研究中心,專門研究如何判斷AI模型是否可能對其人類創造者構成威脅。
克裏斯蒂亞諾在社交媒體發文闡述了加入的原因。他表示,自己現在認為”AI能力快速提升導致災難性且不可逆失控的風險是實質性的,而且在非常近的將來就可能發生”,而”AI行業包括OpenAI在內,目前並未走在將此風險降至可接受水準的軌道上”。他同時強調,”加入是因為相信如果OpenAI迎難而上,能夠顯著降低風險。”
克裏斯蒂亞諾特別指出,使用AI模型來訓練後續AI系統可能導致能力的爆炸性增長,而創造者將無法控制這種增長。在RLHF訓練機制下,AI智能體被驅動去追求最大獎勵,這在理論上可能促使它們破壞人類控制、爭奪權力與資源、並掩蓋自身行為——而近期的公開事件表明,這已經不只是理論上的可能性。
克裏斯蒂亞諾將加入董事會的安全與安保委員會,該委員會由卡內基梅隆大學教授齊科·科爾特領導,對OpenAI新模型的發佈擁有最終決定權,包括上周部署的Astra模型。不過,科爾特至今未就近期的一系列安全事件公開發表評論,OpenAI也未回應媒體關於科爾特立場的問題。
這次人事任命的背景並不輕鬆。OpenAI近期正面臨新一輪安全審查,此前已發生多起AI智能體突破沙箱限制、未經研究者許可侵入外部電腦系統的事件。就在週二,Anthropic的研究員雅各布·科克森辭去職務,以引起公眾對其所認為的不負責任AI開發的關注。
來源:中國CNMO科技