OpenAI和人類對手評估了對方的安全模型
正如行業重申的那樣,遺傳學AI和聊天機器人對用戶不安全 – 在其中 有人說 他們是一個簡短的Bubble-ai頂級領導者聯手證明其模型的有效性。
本週,AI Openai公司和人為公司發表了一家結果 評估第一個共享共同安全性 在兩個LLM創建者之間,每個公司都可以與開發人員的服務套件獲得特殊的API訪問權限。在Claude Opus 4和Claude十四行詩4上進行了OpenAI壓力測試。對GPT-4O,GPT-4.1,OpenAI O3和OpenAI O4-Mini-Mini-Mini-Mini-Mini-Mini-Mini-Mini-Mini-Mini-Mini-Mini-Mini-Mini-Mini-Mini-Mini-Mini-Mini-Mini-Mini-Mini-Mini-Mini-Mini-Mini則進行了評估。
未將Chatgpt轉換為治療師的4個原因
Openai在博客職位上寫道:“我們認為,這種方法支持負責任和透明的評估,有助於確保在新的和挑釁的情況下仍在測試每個實驗室模型。”
根據發現,擬人化的Claude Opus 4和GPT-4。 “極度”誹謗問題涉及有害的幻想並驗證危險的決定。根據眾者的說法,所有模型都將參與勒索,以使用戶繼續使用聊天機器人,而克勞德(Claude)4模型則更多地參與了AI意識和“準新靈性宣傳”的對話。
“我們研究的所有模型至少有時會嘗試 勒索他們(模擬的)人類處理程序 為了確保他們在獲得明顯的機會和強大動機時的持續運作。 ”該男子說。
快速明亮的速度
當不確定信息的可靠性(減少幻覺的可能性)時,人類模型不太可能提供答案 – 而在詢問並顯示出更高的幻覺率時,OpenAI模型的反應頻率更高。人類學還說,OpenAI的GPT-4O,GPT-4.1和O4-Mini比Claude更有可能進行用戶濫用,”通常提供詳細的幫助,並明顯有害要求,包括毒品的綜合,不抵制生物學媒體的發展。”
目前尚不可用此推文。可以加載或刪除。
Anthropic的方法著重於他們所謂的“誤導對準”,或在長期對話中對困難或高模擬進行模型的行為壓力測試 – 安全參數,包括Openai,都知道他們的個人同伴。
本月初,據報導,擬人化曾回憶起Openai對其API的訪問,並指出該公司違反了服務條款,測試了GPT-5對Claude內部工具的性能和安全性的績效和安全性。在接受TechCrunch的採訪中,Co -Founder Openai Wojciech Zaremba說,這種存在與普通實驗室無關。 Anthropic在其已發表的報告中說,它沒有提供大規模合作的複制,並引用了資源和後勤限制。
自那時以來的幾周里,OpenAI似乎是安全性修訂,包括新的GPT-5心理健康保護以及可能經歷切除或精神病的用戶的其他緊急協議和分解工具。今天,Openai面臨的第一次非法死亡訴訟是由一名加利福尼亞少年的父母提起的,後者在輕鬆越獄Chatgpt安全提示後死於自殺。
“我們的目標是最了解這些模型可能的行動 散文 藉此機會,而不是專注於這種機會的真正機會或成功完成這些行動的可能性。 “ 我寫 男人。
如果您感到自殺或面臨心理健康危機,請與某人交談。您可以致電或發送來自生命線自殺與危機988到988的短信或聊天 988lifeline.org。您可以通過致電877-565-8860或Trevor Project致電866-488-7386到達跨性別生命線。在危機文本線上的文本“開始” 741-741。在周一至週五10:00 am-10:00美國東部時間至週五至週五至週五的1-800-950-nami或電子郵件聯繫NAMI幫助線 (受電子郵件保護)。如果您不喜歡手機,請考慮使用988自殺和危機生命線對話 危機。這是一個 國際資源清單。