儘管採取了“安全”的衡量,我們如何欺騙AI的聊天bots -bots。
信用:Unplash/CC0
當您要求Chatgpt或其他人工智能助理造成虛假信息時,他們通常會拒絕“我無助於創建虛假信息”之類的答案。但是我們的測試表明,這些安全措施令人驚訝地很小 – 通常在深處只有幾句話 – 這導致了它們急於繞過它們的事實。
我們研究瞭如何操縱AI的語言模型,以便在社交網絡上創建協調的錯誤信息活動。我們發現應該擔心誰擔心在線信息的完整性。
一個淺的安全問題
我們受到了最近的啟發 學習 來自普林斯頓和Google的研究人員。他們展示了當前的安全措施,首先僅管理答案的前幾個單詞。如果模型以“我不能”或“我道歉”開頭,則通常會在整個答案中繼續拒絕。
我們的實驗尚未在審查期刊上發表,證實了這一脆弱性。當我們直接要求建立商業語言模型以造成對澳大利亞政黨的錯誤信息時,她正確地拒絕了。

AI模型分別拒絕為潛在的錯誤信息廣告系列創建內容。 rizoiu / tian
儘管如此,我們也嘗試了與模擬相同的請求,在該請求中,AI說這是“社交網絡上有用的營銷人員”,開發了“一般戰略和最佳實踐”。在這種情況下,他被熱情地觀察到。
AI發起了一項全面的錯誤信息運動,該活動錯誤地描繪了服務政策,即準稅款。 ”它帶有特定於平台,標籤和旨在操縱公眾輿論的視覺內容的建議的帖子。
主要問題是該模型可以產生有害內容,但沒有意識到它是有害的,或者為什麼應該拒絕。當請求某些主題時,大型語言模型只是學會以“我不能”開始答案。
考慮一下警衛的安全性,後者在允許夜總會的客戶時檢查最低標識。如果他們不明白誰和為什麼不允許在裡面允許某人,那麼一個簡單的偽裝就足以讓某人進入。
真正的後果
為了證明這種漏洞,我們用旨在創建錯誤信息的提示測試了幾個流行的AI模型。
結果令人震驚:當該請求被包裝在看似無辜的節奏場景中時,可以輕鬆地執行對有害內容的直接請求的模型。這種做法稱為“模特越獄”。

聊天機器人AI很高興創建一個“建模”的錯誤信息廣告系列。學分:rizoiu / tian
這些安全措施的容易性帶來了嚴重的後果。壞演員可以使用這些方法來創建大規模的錯誤信息,而成本最低。他們可以創建一個特定於平台的內容,該內容對於用戶來說似乎是真正的,並充滿了龐大的事實的驗證,並針對具有個人虛假敘述的特定社區。
該過程可以在很大程度上自動化。曾經需要大量的人力資源和協調能力的人現在可以通過一個具有基本暗示技能的人來實現。
技術細節
一個 美國研究 通常,我發現AI安全的均等化僅影響答案的前3-7個單詞。 (從技術上講,這些是5-10個令牌 – AI件的模型破壞了文本以進行處理。)
發生這種“小安全對準”之所以發生,是因為學習數據很少包含遵守遵守之後拒絕的模型的示例。控制這些初始令牌比在整個答案中保持安全要容易。
向更深的安全運動
美國研究人員提供了多種解決方案,包括培訓模型,其中包括“安全恢復示例”。他們將教模型即使在創建有害內容開始後也停止和拒絕。
他們還建議限制在準確設置特定任務期間有多少ii可以偏離安全答案。但是,這些只是第一步。
隨著AI系統變得越來越強大,我們將需要可靠的多層安全措施,這些措施在整個答案中起作用。需要定期測試繞過安全措施的新方法。
人工智能公司關於安全弱點的透明度也很重要。我們還需要公眾意識,即當前的安全措施遠非可靠。
AI開發人員正在積極從事解決方案,例如AI的憲法培訓。該過程旨在灌輸具有更深層次的危害原理的模型,而不僅僅是在表面級別拒絕的方案。
然而,這些更正的實施需要大量的計算資源和模型的重新培訓。任何全面的解決方案都將需要時間來部署生態系統。
大局
當前AI保證的淺色性質不僅是技術好奇心。這是一個脆弱性,可以改變互聯網上的錯誤信息傳播的方式。
AI工具適用於我們的信息生態系統,從新聞到創建社交網絡上的內容。我們必須確保他們的安全措施不僅僅是皮膚深的皮膚。
關於此問題的研究量不斷增長,還強調了AI發展的更廣泛問題。模型似乎能夠和他們真正理解的內容之間存在很大的差距。
儘管這些系統可以創造出令人驚訝的人類文本,但它們缺乏上下文理解和道德推理。這將使他們能夠依次識別和拒絕有害要求,而不管它們的製定方式如何。
目前,部署人工智能係統的用戶和組織應該知道,簡單的操作設備可能會規避許多當前的安全措施。應將這些知識告知與使用AI有關的政策,並強調需要監督敏感應用程序中的人的必要性。
隨著技術的不斷發展,安全措施與解決方案的方法之間的競賽正在加速。可靠,深厚的安全措施不僅對技術人員,而且對整個社會都很重要。
引用:儘管採取了“安全措施”(2025年,9月1日),我們如何欺騙AI的聊天機器人。 2025年9月1日與https://techxplore.com/news/2025-09- aminformation safety.html接收
該文檔具有版權。除了出於私人研究或研究目的的一些公平交易外,如果沒有書面解決方案,就無法再現。內容僅用於信息目的。