20 7 月 2026

經典的大腦測試揭示了人工智慧的最大弱點

經典的大腦測試揭示了人工智慧的最大弱點

人工智慧系統可以撰寫文章、回答問題並解決複雜的問題。但新的研究表明,它們可能正在與人類每天所做的事情作鬥爭:在分心時保持專注於手頭上的任務。

Suketu Patel 領導的研究人員透過一項名為「斯特魯普任務」的著名心理實驗開發了幾種突破性的人工智慧模型。結果揭示了人工智慧系統處理資訊的方式與人腦管理注意力的方式之間存在顯著差異。

斯特魯普任務是什麼?

斯特魯普任務是一項經典的心理測試,幾十年來一直用於研究注意力、專注力和自我控制力。

在測試中,「紅色」、「藍色」或「綠色」等顏色字詞以彩色墨水呈現。有時這個詞與墨水的顏色相符。例如,單字“紅色”可能以紅色墨水出現。有時它們會發生衝突,例如用藍色墨水列印的“紅色”一詞。

參與者被要求說出墨水的顏色,而不是讀出單字本身。

這看似簡單,但卻具有挑戰性,因為閱讀單字對大多數人來說是一種自動習慣。大腦必須抑制閱讀單字的衝動,轉而專注於辨識墨水的顏色。

心理學家經常使用這項任務來衡量所謂的執行控制,這是一組幫助人們調節注意力、抵抗干擾和保持對目標的專注的心理過程。

人工智慧注意力測試

研究人員想知道現代大型語言模型(LLM)是否以與人類相同的方式應對這項挑戰。

LLM 是 ChatGPT、Cloude 和 Gemini 等工具背後的人工智慧系統。他們接受大量文字訓練並學習語言模式,從而能夠產生聽起來非常人類化的反應。

當給出包含五個顏色單字的簡短清單時,即使單字和顏色不相同,人工智慧系統通常也表現良好。

但隨著名單變得更長,情況發生了巨大的變化。

當處理五個單字時,GPT-4o 的準確率高達 91%。十個單字時,準確率下降到 57%。當清單擴展到 40 個單字時,準確率下降到只有 15%。

Claude 3.5 Sonnet 在 20 個單字的清單中保持穩定的效能,但隨後出現急劇下降,在 40 個單字的清單中準確率下降至 24%。

研究人員在 GPT-5、Claude Opus 4.1 和 Gemini 2.5 中觀察到了類似的模式。

當人工智慧失去焦點時

當匹配和不匹配的顏色詞同時出現在同一個列表中時,挑戰變得更加困難。

在這些條件下,性能進一步惡化。在某些情況下,不匹配項目的準確性幾乎降至零。

研究人員表示,人工智慧模型很難維持辨識墨水顏色的指令。相反,他們自己閱讀單字的能力越來越落後。

換句話說,這些系統似乎無法持續抑制它們經過大量訓練才能產生的反應。

這項發現特別有趣,因為人類面臨類似的鬥爭。人們通常更擅長閱讀文字,而不是命名墨水顏色。然而,儘管存在這種偏見,即使面對一長串相互衝突的單字和顏色,大多數人也能夠保持高精度和穩定的表現。

人類注意力與機器注意力

該研究強調了人類智慧和人工智慧之間的重要區別。

儘管現代人工智慧系統可以產生令人印象深刻的語言和推理能力,但其潛在機制與生物大腦中發現的注意力過程不同。

人類通常可以在過濾掉競爭訊息的同時保持對特定目標的關注。結果表明,當任務變得越來越困難時,目前的人工智慧模型可能會難以應對這種類型的認知控制。

研究人員認為,這些實驗中出現的表現崩潰顯示了當前大規模語言模型的根本限制。雖然人工智慧有時可以模仿人類行為,但其保持注意力的能力似乎與人類的工作方式截然不同。

這些發現提醒我們,即使是最先進的人工智慧系統也仍然存在弱點,特別是當任務要求它們抵制干擾並專注於長資訊序列時。


發布日期: 2026-06-10 11:52:00

來源連結: www.sciencedaily.com