24 7 月 2026

大型語言模型可以找出現實世界嗎?新指標衡量了人工智能的預測能力

大型語言模型可以找出現實世界嗎?新指標衡量了人工智能的預測能力

學分:Pixabay/CC0公共領域

在17世紀,德國天文學家約翰內斯·開普勒(Johannes Kepler)發現了運動定律,使我們能夠準確預測太陽系的行星在陽光下旋轉時將在天空中出現在哪裡。但是直到幾十年來,艾薩克·牛頓(Isaac Newton)制定了重力定律時,才理解了基本原則。

儘管它們受到開普勒定律的啟發,但它們走得更遠,並允許將相同的公式應用於所有事物,從加農炮球的路徑伸展到月球在地面上控制耳朵,或者如何將衛星從地面發射到月球或行星的地面。

當今的複雜人工智能係統已經在創建類似於開普勒預測的特定預測方面變得非常出色。但是,他們知道為什麼這些預測有效,以及來自牛頓法律等基本原則的深刻理解?

隨著世界越來越依賴這樣的AI系統,研究人員正在努力衡量他們的工作方式,以及他們對現實世界的理解的深入。

現在,信息和解決方案實驗室(封面)和哈佛大學的研究人員已經開發了一種新的方法來評估這些預測系統對他們的主題的深入了解,以及他們是否可以將知識從一個領域應用於稍有不同的知識。總的來說,目前在研究的示例中沒有太多答案。

一個 結論 在國際機器教育會議上提交(ICML 2025),上個月在溫哥華,上個月,哈佛大學郵政凱恩·瓦法(M.

這項研究的主要作者瓦法說:“人們一直在過渡到世界模型。”因此,解決他們的團隊的問題是:“是否能夠使這個基礎模型從預測到世界模型?而且我們不問他們是否可以,或者他們可以,或者他們。

“我們知道如何檢查算法是否得到很好的預測。但是我們需要這是一種檢查他是否很好地理解的方式。” Mullainatan說,彼得·德·弗洛雷斯教授的經濟學和電氣工程和計算機科學以及高級作家。 “即使是理解理解的定義也是一個問題。”

瓦法(Vafa)說:“他們倆都有在一項任務上運作良好的模型,而這本質上是在這項任務上相同的。範式。”

有助於說明這種觀點的另一個類比是與格雷戈拉·門德爾(Gregora Mendel)關於遺傳遺傳的基本定律相比,關於如何有選擇性培養培養和動物的積累知識的幾個世紀之間的差異。

他說:“在這一領域,關於使用基礎模型不僅要執行任務,而且要找出有關世界的東西的動盪很多。” “應該對其進行調整,具有世界模型,以適應任何可能的任務。”

有人在不久的將來實現這種概括的人工智能係統嗎?為了驗證這個問題,團隊考慮了在復雜級別上預測AI系統的不同示例。在系統的最簡單示例中,可以創建模擬系統的現實模型,但是由於這些示例變得更加複雜,因此這種能力很快就消失了。

該團隊開發了一種新的指標,一種測量系統如何接近實際條件的定量度量的方式。他們稱測量的歸納偏見,即是根據考慮到特定情況的大量數據而根據結論而反映現實的答案的趨勢或偏見。

他們所看的最簡單的例子是被稱為爐排模型。在一維的爐排中,只能沿線移動。 VAFA將其與連續百合之間跳躍的青蛙進行了比較。當青蛙跳或坐著時,它會導致它的工作 – 直,左側或留下來。如果他到達了排的最後一個百合,他只能留下或回去。如果某人或AI系統可以聽到電話,了解百合的數量,這是否可以找到配置?

答案是肯定的:在如此簡單的情況下,預測模型成功地恢復了“世界”。但是,即使有晶格,當您增加測量數量時,系統也無法再進行此跳躍。

張說:“例如,在兩個州或三個州的格子中,我們表明該模型確實對實際狀態具有相當好的電感斜率。” “但是,當我們增加條件的數量時,他開始與真實模型不同。”

一個更複雜的問題是可以玩奧賽羅的棋盤遊戲的系統,在該遊戲中,玩家交替將黑色或白色的碟片放在網格上。 AI模型目前可以準確預測哪些動作是允許的,但是事實證明,他們對板上作品的一般位置(包括目前被遊戲中的封鎖的人的一般位置)得出的結論很差。

然後,團隊考慮了實際使用的五個不同類別的預測模型,並且同樣,系統越複雜,與世界真實基本模型相比,越多地預測執行的製度。

Vafa說,使用了這個新的歸納偏見指標:“我們希望它將提供一種測試攤位,您可以在其中評估各種模型,各種培訓方法以及我們知道真正的世界模型是什麼的問題。”如果他在這些情況下效果很好,那麼當我們已經知道主要現實時,我們可以相信即使在我們實際上不知道真相是什麼的情況下,它的預測也是有用的。 ”他說。

人們已經在嘗試使用這些類型的預測AI系統來幫助科學發現,包括從未創建的化合物的特性或潛在的藥物化合物的特性,或者預測未知蛋白分子的折疊和性質的行為。 Vafa說:“對於更現實的問題,即使對於像主要機制之類的事情,我們發現我們似乎必須走很長一段路。”

Chang說:“基礎模型周圍有很多炒作,人們正在嘗試創建針對基於模型的領域的基金模型,基於物理學的模型,機器人模型,其他類型的域名基礎模型,人們會收集大量的數據”,並教這些模型來製作預測,然後希望他能獲得有關其他人在其他人中使用的域知識。辭職。 “

這項工作表明有很長的路要走,但也有助於展示前進的道路。 Chang說:“我們的文章建議我們可以應用指標來評估它的想法多少,以便我們提出教授基礎模型或至少評估我們當前正在培訓的模型的最佳方法。” “作為一個工程區域,當我們擁有某種指標時,人們真的很擅長優化該指標。”

更多信息:
發現了什麼基礎模型?歸納偏見揭示了世界模型。 icml.cc/virtual/2025/posster/44374

馬薩諸塞州技術研究所提供


這個故事重印為麻省理工學院新聞(web.mit.edu/newsoffice/),一個受歡迎的網站,涵蓋有關研究,創新和麻省理工學院教學的新聞。

引用:大型語言模型可以找出現實世界嗎? AI預測能力的新指標(8月20日,8月20日)於2025年8月26日從https://techxplore.com/news/2025-08-large-laguage-figure-world.html.html.html獲得

該文檔具有版權。除了出於私人研究或研究目的的一些公平交易外,如果沒有書面解決方案,就無法再現。內容僅用於信息目的。



來源連結