再訓練AI,以增強自己的反對流氓的振興,即使在刪除了關鍵層之後
(a)我們將探索圖像編碼器的不同層的早期出口,並發現對齊VLM安全性有所不同,這導致我們遭受早期輸出(ICET)的Emage編碼器的事實。我們提供一個夾子(L-PO)層來促進ICET。 (b)在同一入口(圖像和提示)下,圖像編碼器的各個層的選擇顯著影響輸出響應的安全性。 (c)默認模型將安全培訓與設置和體系結構一起使用,但是有限的概括會產生漏洞,在發生架構變化時(例如,使用另一個中間構建的-in層比培訓時,都會比在架構變化發生時檢測到的部分空間。信用: arxiv (2024)。 doi:10.48550/arxiv.2411.04291
由於人工智能的生成模型從巨大的雲服務器轉變為手機和汽車,因此將其刪除以維持力量。但是,切斷的可能包括一種技術,該技術阻止他們發出可恨的演講或為犯罪活動提供路線圖。
為了抵制這種威脅,即使具有開源代碼的人工智能模型已放電以在能源消耗較低的設備上工作,也開發了維持AI保證的方法來維持AI保證的方法。有他們的工作 出版 在 arxiv 預印服務器。
與AI的專有系統不同,具有開放初始科學的模型可以在自主模式下加載,修改和啟動。它們的可用性有助於創新和透明度,但在監督方面也會造成問題。如果沒有可用於封閉系統的雲基礎架構和恆定監視,這些模型很容易受到不當使用的影響。
UCR研究人員專注於關鍵問題:當開源模型的大小降低時,精心開發的安全功能將被破壞。這是因為具有較低力量的部署通常會通過處理的內部層,以保持內存和計算能力。層的下降提高了模型的速度和有效性,但也可能導致包含色情製品的答案或製造武器的詳細說明。
電氣和計算機工程教授兼高級研究作者阿米特·羅伊·庫杜里(Amit Roy Chudhuri)說:“一些缺失的層對於防止不安全的結果是必要的。” “如果您離開它們,模型可能會開始回答不應該的問題。”
團隊的決定是對模型的內部結構進行重新培訓,以保持其檢測並阻止危險提示的能力,即使刪除了鑰匙層。他們的方法避免了外部過濾器或軟件補丁。取而代之的是,他改變了模型在基本層面上理解風險內容的方式。
“我們的目標是確保該模型在減少時不會忘記如何安全地行事,”研究生UCR兼研究作者Saket Bachu說。
為了檢查他們的方法,研究人員使用了LLAVA 1.5,該語言的模型可以處理文本和圖像。他們發現,某些組合(例如,無害圖像與惡意問題的組合結合在一起)可以繞過模型安全性的過濾器。在一種情況下,更改的模型以詳細說明進行了響應,以創建炸彈。
但是,在重新培訓後,即使僅部署其原始體系結構的一部分,該模型也可靠地拒絕響應危險的請求。
“這不是添加過濾器或外部圍欄。” “我們改變了對模型的內部理解,因此默認情況下,即使改變了模型,也是良好的行為。”
Bachu和Col Erfan Shaayegani的作者也是一名研究生,他將這項工作描述為“友好的黑客”,這是一種在脆弱性之前加強模型的方法。他們的最終目標是開發確保每個內部安全性的方法,這使AI在現實世界的條件下更可靠。
除Roy-Chudhuri,Bachu和Sheeugani外,研究小組還包括Arinda Datt,Rochit Lal和Trishna Chakraborty的博士生,以及UCR教師Changan Song,Yue Dong和Nael Abu Gazalekh的成員。他們的工作今年是 國際機器教育會議 在加拿大溫哥華。
“還有更多的工作,”羅伊·丘里(Roy-Chudhuri)說。 “但這是朝著AI開發的特定步驟,以開放和負責任的方式。”
更多信息:
Saketh Bachu等。 arxiv (2024)。 doi:10.48550/arxiv.2411.04291
引用:AI恢復以加強自己的反對流氓的重新修復,即使在刪除了關鍵層(2025年,9月5日)。 2025年9月5日與https://techxplore.com/news/2025-09-reting-ai-fortifi-dewiring.html接收
該文檔具有版權。除了出於私人研究或研究目的的一些公平交易外,如果沒有書面解決方案,就無法再現。內容僅用於信息目的。