9 月 18 日消息,隨著美國《紐約時報》等新聞機構持續推進就微軟、OpenAI 之間針對訓練數據版權問題的訴訟,微軟和 OpenAI 內部一批此前被標記為機密的檔現已正式公開,其中展示了微軟和 OpenAI 內部員工對 AI 影響的擔憂。
其中,微軟應用科學部門主管 Brent Hecht 曾在內部檔中警告,將新聞內容用於 AI 訓練是“前所未有的大規模盜竊”,甚至稱其可能是“人類歷史上規模最大的勞動力盜竊”。在另一份檔中,Hecht 還質疑微軟和 OpenAI 關於 AI 訓練新聞內容屬於合理使用(Fair Use)的觀點,認為大規模抓取新聞內容的做法可能與“合理使用”的理念相悖。
同時,微軟內部檔還曾提出所謂“毀滅迴圈(doom loop)”風險,即 AI 產品不斷減少新聞網站流量和收入,最終導致新聞機構減少內容生產,而 AI 模型本身也因此失去可靠的資訊來源。
事實上,微軟內部數據似乎已經體現了這種趨勢。微軟數據顯示,部分涉訴新聞機構的點擊率下降了 83% 至 93%,另一些機構則下降了 51% 至 94%。新聞機構還援引 ChatGPT 搜索結果點擊率較低以及自身流量下降的報導,認為 AI 聊天機器人正在逐漸取代用戶直接訪問新聞網站的需求。
微軟 CEO Satya Nadella 在作證時也承認,聊天機器人能夠直接在 AI 平臺向用戶提供資訊,從而減少用戶訪問原始新聞網站的需求。他表示,這相當於聊天機器人通過直接提供資訊,“從新聞網站那裏拿走了點擊量”。
OpenAI 內部也存在類似觀點,ChatGPT 負責人 Nick Turley 曾在內部確認,使用新聞內容訓練商業 AI 產品,並讓這些產品能夠取代新聞提供商,可能會給出版商帶來“生存性威脅”。
Turley 認為,當聊天機器人已經直接提供資訊時,用戶“沒有充分理由”再點擊原始鏈接。他還在內部討論中將聊天機器人描述為“基本上具有替代性”,並認為隨著產品能力提升,這種替代關係還會進一步增強。
IT之家注意到,以《紐約時報》為首的新聞機構還指控微軟和 OpenAI 公司內部人員早已意識到 AI 產品可能輸出與訓練數據高度相似的內容。原告方表示,他們進行了多種測試,嘗試讓微軟和 OpenAI 的 AI 產品直接複現新聞文章內容,結果發現出現大段內容複現。
對此,相應新聞機構認為微軟和 OpenAI 並未充分採取措施阻止這些輸出,甚至採取了讓新聞機構更難測試 AI 模型的措施。事實上,微軟應用科學部門主管 Brent Hecht 一份內部檔稱,公司開發了一項過濾機制,可能讓訓練數據版權方“更難瞭解哪些內容被用於訓練”。
對於上述指控,微軟發言人回應稱,微軟的 AI 產品屬於具有轉換性質的合理使用,並不會取代新聞網站。微軟還表示,Hecht 的內部檔僅代表一名員工的個人觀點,並非法律分析,也不能代表微軟公司的立場。而 OpenAI 截至報導發佈時尚未回應相關置評請求。
來源:中國IT之家