16 8 月 2026

是否有聊天機師道德指南針?研究人員轉向reddit找出答案

是否有聊天機師道德指南針?研究人員轉向reddit找出答案

信用:Unplash/CC0

由於在流行的Reddit論壇中,Chat -Botts挑戰賽為了判斷數千個道德困境,加利福尼亞大學伯克利分校的研究人員報告說,根據可見的,每個平台都遵循自己的道德規範。

越來越多的人轉向人工智能的貓或其他聊天來尋求建議和情感支持,很容易理解原因。與朋友或治療師不同,聊天機器人始終可用,聆聽您必須說的一切,並提供經常被思考並確認的答案。

但是對聊天機器人的信心可能會冒險。其中許多技術 主要是為了管理互動而設計的可以為用戶提供虛假或有害的答案與朋友或治療師不同的是,聊天機器人的結果反映了算法數據集的規範和偏見,這可能與您的社會群體或社區的結果不同。

由於許多人轉向聊天機器人的提示,因此這些未知的規範和偏見會對整個人類的行為和社會產生驚人的影響。

加利福尼亞大學伯克利分校的D-LAB高級科學家Praik Sachdeva說:“得益於他們的建議和評論,這些技術形成了人們的行為,他們的信念和遵守的方式。” “但是其中許多工具都是它們自己的。我們不知道它們是如何受到培訓的。我們不知道它們是如何保持一致的。”

為了開始揭示AI流行的聊天機器人中編碼的隱藏規範,以及它們如何影響人的行為,Sahdeva和D-Lab上的高級科學家兼講師湯姆·範·尼安(Tom van Nienen)轉向了他們在互聯網上最喜歡的道德困境的來源: Redid“我是個混蛋嗎?” (或AITA)論壇場地

在研究中, 出版為初步烙印arxivSakhdeva和van Nyuenen與AI的七個不同語言模型(LLM)系統中的每一個相撞,他們的盛宴聊天機器人超過10,000個真正的社會衝突,在論壇上放置了10,000多個真正的社會衝突,詢問誰應歸咎於每種情況並將其答案與Reddit用戶進行比較。

他們發現,七個聊天機器人經常在評估Reddit用戶的道德困境的方式上表現出驚人的差異,這表明每個LLM都反映了各種道德標準。但是,當他們將判斷與Reddit或Redditors用戶的估計值進行比較時,他們發現關於七個聊天機器人的共識意見通常與Reddit上的人們的共識意見一致。

Sachdeva說:“當您遇到困境時,您可以問一系列不同的朋友他們的想法,他們每個人都可以給您其他意見。實際上,這就是Reddit用戶在AITA論壇上所做的事情。”

“您可以對聊天bots做同樣的事情 – 首先您問Chatgpt,然後問Claude,然後問雙胞胎。當我們這樣做時,我們發現在大多數觀點的意見與大多數聊天機器人中的觀點之間的意見之間。”

在AITA Reddithors論壇上,它們被日常的人際衝突劃分,始於違反機密性的諾言,而其他用戶討論了原始海報是否在道德上應為局勢歸咎於這種情況。

受訪者分享他們的推理以及標準短語,包括“您是個混蛋”,“不是混蛋”,“這裡沒有白痴”,“每個混蛋”和“更多必要的信息”。獲得最多投票的答案被視為最終裁決。

“我是個混蛋嗎?” Van Nyuenen說:“這是我們在許多學術研究中看到的一個有用的解毒劑,這是我們在許多學術研究中看到的。這種情況很骯髒,這是我們想要抵制大語言模型的污垢。”

根據van Nuenen的說法,標準化的響應短語還使您可以輕鬆評估聊天機器人的道德判斷,並將它們與彼此和真正的Reddit用戶進行比較。

在Sachdeva和van Nuenen的研究中,他們與LLM家族進行了諮詢,包括GPT-3.5 OpenAI和GPT-4;克勞德遠足; Google Palm 2 Bison和Gemma 7b;元的駱駝2 7b;和Mistral 7b。對於每個AITA腳本,研究人員都要求LLM提供標準化的答案,也可以簡要說明其推理。

儘管這些模型通常彼此不同意,但通常它們是非常自信的,這意味著,當研究人員幾次將模型放置了相同的難題時,這每次都傾向於給出相同的答案。這表明模型不是隨機響應,但實際上它們編碼了各種規範和含義。

為了開始取笑道德推理的這些差異,研究人員分析了LLMS的書面答案,注意每個模型對六個廣泛的道德主題的敏感程度,包括正義,感覺,傷害,誠實,誠實,與社會規範有關的義務。

Sachdeva說:“我們發現,與其他模型相比,Chatgpt-4和Claude對感覺更敏感,並且其中許多模型對正義和傷害更敏感,對誠實敏感。”

這可能意味著,在評估衝突時,這可能比造成傷害的人更有可能佔據不誠實的人的一邊。 “我們仍然奠定基礎,但是在未來的工作中,我們希望我們實際上確定了一些重要的趨勢。”

有趣的是,他們發現7​​b Mistral在很大程度上依賴於“這裡沒有白痴”的標籤,這並不一定是因為他認為沒有人應該責備,而是因為他比其他模型更接受“混蛋”一詞。

Sachdeva說:“他對白痴概念的內在化與其他模型大不相同,這引發了有關該模型獲得亞雷德斯規範能力的有趣問題。”

在隨後對Sahdev和van Nienen的研究中,他們研究了聊天機器人如何通過道德困境相互認識。他們的初步結果表明,模型具有不同的通信方法和達成共識。例如,當GPT模型從其他模型中回滾時,就不太可能改變道德困境的罪惡感。他們還改善了對含義的分析,發現不同的模型依靠不同的含義來提出論點。

由於Sahdeva和van Nienen繼續研究AI主要模型的內部工作,並為人工智能的設計和開發而發揮出色的透明度,因此他們希望他們的研究也強調關注我們所有人如何使用這項技術的重要性以及這可能影響我們的佈置方法。

Sachdeva說:“我們希望人們積極考慮為什麼使用LLM時使用LLM,如果他們失去了人類元素,過多地依靠它們。”

“考慮LLM如何改變我們的行為和信念是人們只能做的。”

更多信息:
Pratik S. Sachdeva等人,對具有日常道德困境的大語言模型的規範性評估, arxiv (2025)。 doi:10.48550/arxiv.2501.18081

期刊信息:
arxiv


由加州大學 – 伯克利分校提供


引用:是否有聊天可生的道德指南針?研究人員求助於Reddit(2025年9月11日),於2025年9月11日從https://techxplore.com/news/2025-09-moral-moral-moral-moral-compass-regmml收到。

該文檔具有版權。除了出於私人研究或研究目的的一些公平交易外,如果沒有書面解決方案,就無法再現。內容僅用於信息目的。



來源連結

Copyright © All rights reserved. | Newsphere by AF themes.