“強化學習之父”薩頓認為,對世界模型的定義存在誤區。
7月19日,在2026年世界人工智慧大會(WAIC)的“思想者論壇”上,圖靈獎得主、阿爾伯塔大學電腦科學教授理查德·薩頓(Richard Sutton)發表了題為《基於強化學習從經驗中培育超級智能》的主題演講。薩頓認為,真正的超級智能必須徹底脫離人類的先驗偏見,並全面介紹了自己最新提出的“OaK(Options and Knowledge,選項與知識)”架構。
近年來,薩頓時常對大語言模型的發展路線持批評態度。在演講中,薩頓重申了他著名的AI研究文章《苦澀的教訓》(The Bitter Lesson)。他直言道,AI研究者總是希望把“人類的知識”硬編碼給AI,但從長遠來看,這種做法反而阻礙AI的演進。
薩頓表示:“我們應該去尋找智能的底層基本原理,而不是被我們自身心智在特定世界中所產生的具體細節所誤導。我們應該尋找基本原理,而不是具體的內容和細節……我們不應該試圖把人類已經發現的規律構建進去,而應該讓智能體自己去發現。”
在這個基礎上,薩頓對“大世界”視角進行了定義。在薩頓看來,人類世界所熟知的“三維空間”或“物理學規律”,只是這個特定世界的內容。真正的AGI應當在“運行期(Runtime)”像嬰兒一樣自主摸索,僅依靠行動(Actions)、觀察(Observations)和獎勵(Reward)進化。
基於這種“大世界視角”,薩頓批評了當前行業將世界模型做成“低級物理模擬器”的誤區,稱這種理解“極其狹隘”,人類的轉移模型(Transition Model)“不應該像低級物理學那樣瑣碎,而應該承載高階的世界知識”。
薩頓解釋道:“在我的理論體系中,我絕對不會把一個單純的神經網路稱為‘模型’,這是對這個詞的濫用。我將‘模型’一詞專留給轉移模型,它應當包含人類對世界的所有高級知識。比如,‘如果我接受了這份工作,我會幸福嗎’,這才是模型應該回答的問題。”
這就意味著,模型需要掌握“抽象能力”,即構建越來越宏大的行動與狀態認知的能力。為了實現這種高級抽象,薩頓提出了OaK架構。其核心在於通過時間抽象(選項)與狀態抽象(知識),讓AI能夠實現“跳躍式”的宏觀規劃。
在薩頓的OaK架構中,對於每一個與人類生活相關的狀態特徵,智能體都要學會一種去“控制和達成該特徵”的技能。也就是說,智能體構建自身心智的核心手段,就是不斷提出子問題,並通過“選項”去解決它,“把定義子問題的權力徹底移交給智能體”。
儘管OaK架構已經能夠在理論上實現閉環,但薩頓坦言,目前還無法立即實現它,AGI的降臨或許還需要5年、10年甚至20年。
值得一提的是,就在本周,薩頓宣佈與阿爾伯塔大學博士研究員Khurram Javed共同創立新公司Oak Lab,志在打破當前深度學習方式,用全新的理念構建AGI,開發能夠通過自身第一人稱經驗獨立、持續學習的AI智能體。
來源:中國澎湃新聞