Anthropic 的 Opus 5 注重的是像徵性的效率,而不是能力的飛躍
今天,Anthropic 推出了 Opus 5,這是該模型的最新更新,該模型最近已成為編程和其他軟體開發任務等的流行選擇。
雖然這對 Opus 來說是一個值得注意的提升,但它似乎並不代表代理加密效能達到 Opus 4.5 等級的進步。
這張圖表(由 Anthropic 製作)基於 Frontier-Bench 和 DeepSWE 等各種基準測試,顯示 Opus 5 的性能與廣為人知的 Anthropic Fable 模型的編程任務能力大致相同或略領先。它在幾乎所有類型的任務上都優於 OpenAI 的競爭對手 Opus 4.8 和 GPT-5.6-Sol。
各種基準測試顯示性能經常提高,但這並不是一個巨大的飛躍,而主要的結論是,它的模型提供的東西只比《神鬼寓言》的成本低一半左右。
另外值得注意的是,Anthropic 刻意避免對 Opus 5 進行複雜的網路安全任務訓練,因此在這方面遠遠落後於《Fable》和《Mythos》。 Anthropic 聲稱在發現網路安全漏洞方面相對擅長,但由於在訓練模型時做出的決定,它「在全球範圍內明顯落後於 Mythos 5」。 剝削 “其中一個弱點。”
因此,Opus 5 並不具備《神鬼寓言》所提供的所有有爭議的保護措施,例如在發生事件時可進行 30 天審查的資料保留政策。
發布日期: 2026-07-24 22:05:00
來源連結: arstechnica.com