Openai說Chatgpt可以和人們一起完成一些工作任務
Openai試圖假設AI確實可以在工作中很有用,因為最近的一些研究表明,公司沒有得到太多的AI投資。
週二,Chatgpt-Maker發布了 報告 為44個不同的工作中的“財務有價值,實際任務”的“財務價值,實際任務”提供了一個新的參考點。該評估稱為GDPVAL,OpenAI表示,它是在證據而不是廣告活動中討論AI的AI,並監視模型如何隨著時間的推移如何改善。
它是在最近的一項MIT媒體實驗室研究的高跟鞋中,該研究發現了少於十分之一的AI飛行員項目,這些項目獲得了可衡量的利潤,並警告說,“ 95%的組織中的95%的組織在AI賭注中獲得零績效”。就在上週,哈佛商業評論的Betterup Labs和Stanford的社交媒體實驗室的研究人員指責“ Workslop”的結果鬆散。他們將Workslop定義為“ AI偽裝成一項好工作的工作內容,但缺乏實質上促進給定工作的實質”。
Openai認為,GDPVAL填補了現有參考點留下的空白,該差距通常在抽象的學術問題上測試AI模型,而不是人們在工作中所做的每日職責的類型。
GDPVAL的措施
OpenAI在宣布該報告的博客文章中寫道:“我們之所以稱這項GDPVAL評估是因為我們從國內生產總值(GDP)開始是基本的經濟指數,並從主要行業的主要職業中掌管了對GDP貢獻最大的職責。”
參考點的第一個版本涵蓋了美國GDP最大份額的所有九個行業的44個工作,包括房地產,政府,製造業和資金。在每個部門中,Openai入侵了領導更高工資和津貼的角色,重點關注所謂的知識。
為了構建測試套裝,OpenAI是由這些行業的專業人員僱用的,平均具有14年的經驗來設計現實世界職責。每個專家還創建了一個人類的工作例子。作業的示例包括起草簡短的簡短摘要,機械計劃的製作,客戶支持交流的管理或製定護理計劃。
該報告包含每個職業的30個經過全面修訂的任務,以及每個職業的五個開放原點的較小“黃金”。為了衡量績效,OpenAI使用了專家學生,來自數據集代表的相同領域的專業人員。這些專業人員盲目地將AI創建的可交付成果與工作作者製作的交付成果進行分類,並提供評論和分數。然後,他們排名最佳,比彼此的好或更糟。
發現了什麼GDPVAL
該報告發現,當今的最高AI模型已經關閉了人類專家生產的工作質量。
在GDPVAL黃金集的220次工作測試中,評估人員將七個頂級模型的可交付成果與行業中的專業人員進行了比較。
Claude Opus 4.1升至最高,獲得了47.6%的勝利,並與人類綜合職責取得了勝利。對於諸如文檔格式和滑移佈局之類的美學,它特別有力。
GPT-5高高以38.8%的勝利和平局獲得了第二名。按照說明並執行正確的計算,他的力量正是仔細的。
GPT-4O在最後一個地方,只有12.4%的勝利和利率
AI模型從計數器和租賃員工等專業中執行了特別好的任務。貨物,下載和人口普查員工;銷售經理;和軟件開發人員。
他們在工業工程師,醫學工程師,藥劑師,財務經理和視頻出版商等職業的任務中進行了更多的鬥爭。
例如,Claude Opus 4.1的勝利和利率最高,現金和租用員工(81%),其次是運輸,接收和股票員工(76%)。其分數較低的是工業工程師,電影和視頻出版商(17%)以及音頻和視頻技術人員(2%)執行的職責。
Openai還聲稱,這些模型可以比人類專家快100倍,便宜100倍的GDPPVAL職責。
儘管如此,Openai還是強調,即使AI重塑勞動力市場,它也將無法完全取代人類。正如公司所說,“大多數工作不僅僅是可以記錄的職責。”
Openai寫道:“ GDPVAL強調了AI可以處理常規職責,以便人們可以花更多的時間在創意,關鍵的工作中。”