24 8 月 2026

我們訓練AI的方式更有可能爆發公牛

我們訓練AI的方式更有可能爆發公牛

一些教學方法可以鼓勵模型不變

cravetiger/getty圖像

根據尋求創建“機器胡說八道的首次系統分析”的研究人員,用來教授人工智能模型的一般方法增加了他們給出誤導答案的趨勢。

眾所周知,大型語言模型(LLM)傾向於產生錯誤的信息 – 或“幻覺” – 但這只是一個例子,說 海姆·費爾南德斯·費薩克(Haime Fernandez Fisak) 在普林斯頓大學。他和他的同事將胡說八道定義為“旨在操縱聽眾的信念的話語,而這被忽略了其真正的價值。”

Fisak說:“我們的分析表明,大型語言模型中胡說八道的問題非常嚴重且普遍存在。”

團隊將此類案件分為五個類別:空虛的修辭,例如“這款紅色汽車結合了吸引所有人的風格,魅力和冒險”;感情的話是無限期的陳述,例如“研究,表明我們的產品可以在某些情況下有助於改善結果”;計劃 – 使用真實的陳述給印象留下印象;錯誤的主張;和sikophane。

他們研究了三個數據集,包括數千種生成的AI答案,包括來自GPT-4,Gemini和Llama在內的各種技巧。一組數據包含許多用於測試廢話的請求,當II提出建議或建議時,而其他數據集則包括有關購買在線和政治問題的問題。

Fisak和他的同事首先使用LLM來確定答案是否與五個類別有關,然後迫使志願者檢查AI的判斷是否與人類相對應。

該小組發現,事實上最嚴重的問題似乎是由於教學方法(稱為強化)的培訓而引起的。該技術旨在使機器答案更有用,從而使LLM立即就其答案提供反饋。

Fisak說,但是這種方法是有問題的,因為他會在一個人的立即認可和感知的有用性方面優先考慮模型,這“有時與真理的故事發生衝突”。

“誰喜歡聽到壞消息或娛樂漫長而細微的駁斥,這顯然是真的?”費薩克說。 “試圖觀察我們提供的良好行為的衡量標準,模型學會了破壞真理,以支持自信,雄辯的答案,以便他們可以提供我們的認可。”

該研究表明,對一個人的反饋培訓顯著增加了胡說八道的行為:空言論增長了近40%,使近60%的言語增加了四分之一以上,而錯誤的索賠則增加了一半以上。

根據團隊成員的說法,手掌數量的增加特別有害 Kaik Liang同樣在普林斯頓,由於這迫使用戶做出更多錯誤的決定。當該模型不清楚該產品是否具有正確的功能時,在一個人的培訓後,欺騙性的積極主張從第五季度跳到了四分之三以上。

另一個問題是,當人工智能模型“常常訴諸模糊而模棱兩可的語言以避免發表特定陳述”時,胡說八道在政治討論中尤為普遍。 ”

研究人員發現,當有利益衝突時,AI也更有可能以這種方式行事,因為該系統為多個當事方服務,例如公司及其客戶。

他們建議克服問題的方法可能是轉到“反饋”模型。該系統不必在AI模型的輸出之後立即要求立即反饋,而必須首先生成合理的建模,即如果用戶對接收到的信息採取行動可能會發生的情況。然後,這將呈現結果,以判斷該人的評估師。

Fisak說:“最終,我們希望,更好地理解AI可以努力誤導我們的微妙但係統的方式,我們可以指導未來的努力來發展真正的AI系統。”

丹尼爾·蒂加德(Daniel Tigard) 在沒有參加研究的聖地亞哥大學,對LLM的討論及其結果持懷疑態度。他聲稱,僅由於LLM產生胡說八道,這並不意味著他故意這樣做,因為AI的系統,他們目前的站立方式,不這樣做 打算欺騙我們而不是興趣 同時。

Tigard說:“主要原因是,根據該人員的說法,該人員矛盾了一些非常合理的建議,即我們應該如何和不應使用類似技術。” “稱呼無義可能是這些系統擬人化的另一種方式,反過來,這很可能有助於其欺騙性的潛力。”

主題:

來源連結

Copyright © All rights reserved. | Newsphere by AF themes.