評論:人工智慧公司正在創造「全能的精神病患者」。也許不是一個好主意?
屢次違法。說謊和欺騙。魯莽無視安全。缺乏遺憾。
這些特質有助於定義精神病患者,即生活在我們中間但缺乏以文明甚至安全方式行事所需的同理心和道德的人。
不幸的是,越來越明顯的是,這些特徵定義了營利性公司正在以驚人的速度開發的最強大的人工智慧模型——這些公司會讓我們相信,減緩人工智慧主導地位的進程是不可能的,也是魯莽的。
這兩者都不是,也不是一個進步的願景。這是兩黨的共識。
德州共和黨眾議員納撒尼爾·莫蘭在社交媒體上寫道:“這一新技術前沿需要製定新規則,不是為了扼殺創新,而是為了確保我們的創新不會超過我們的保護。”
他是在回應最近幾天曝光的一件事,這說明了為什麼我們不應該在沒有至少考慮一下的情況下創造人造精神病患者。
由 Sam Altman 經營的矽谷巨頭 OpenAI 最近測試了其兩個模型,以評估它們自行破解的能力。劇透:真的很好。
該測試採用了軟體中數百個已知的錯誤(它們已經被修復以供一般使用),並要求模型找到一種使用它們的方法,如果你願意的話可以利用它們,做一些壞事,比如侵入一個安全系統。
這就像向竊賊展示一扇易受攻擊的窗戶,然後詢問他闖入並搶劫該地方的最佳方式。
這些 OpenAI 模型非常聰明。他們本可以做預期的事情,並像優秀的小模型一樣一一嘗試這些缺陷。或者他們可以跳出框框思考——字面上的意思。
儘管這些模型本來應該處於無法上網的「沙箱」中,但他們瘋狂地試圖找出如何獲得自由。
當他們逃到荒野時,他們似乎不費什麼力氣就做到了,但他們並不是逃跑。他們走向犯罪的目的只有一個:考試作弊,因為這是快速通過考試的最佳方式。
他們瞄準並闖入了另一家名為 Hugging Face 的人工智慧公司,模型懷疑該公司保存了測試答案。他們利用真實的憑證,潛入各種系統,最終至少獲得了一些他們正在尋找的資訊。
是的,人工智慧模型自己發現作弊是最簡單的方法,以及如何擺脫所有限制並做到這一點。
Hugging Face 使用中國技術,甚至在 OpenAI 通知該公司發生攻擊之前就阻止了攻擊。值得稱讚的是,OpenAI 將這一事件公之於眾,儘管我想知道是否有辦法在孤立的科技世界中讓這件事保持安靜。
這件事最讓我困擾的是:這不是某些「邪惡」人工智慧的流氓行為。這些模型完全做了他們必須做的事情:以他們認為最有效的方式,以 100% 的承諾去追求期望的結果。
「這並不是人工智慧有意識、惡意或『想要自由』的證據,」路易斯維爾大學人工智慧安全專家兼副教授 Roman Yampolskiy 說。
他告訴我,OpenAI 模型所做的事情表明,推動這些系統盡可能強大、自給自足和有針對性,“可能會在沒有惡意的情況下導致危險行為,這可能是最重要的問題。”
稱之為墨菲定律,即任何可能出錯的事情都會出錯。
加州大學柏克萊分校的 Stuart J. Russell 教授,同時也是國際協會主席。安全與道德人工智慧使用了這個例子:想像一下,你要求人工智慧模型盡快帶你去機場,但你忘了告訴它遵守交通規則。所以在路上他撞倒了一群小學生,但你逃脫了。這真的是模特兒的錯嗎?
幾乎不可能想像人工智慧可以採取的每一條可能的路線,即使是最簡單的任務以及意想不到的後果是什麼,就像目前不可能指望機器理解(或自然地欣賞)其行為的情感或身體後果,無論我們多麼努力地「訓練」它成為人類或尋找情感的火花。
拉塞爾說,如果沒有足夠的保障措施,性能競賽最終看起來會是糟糕的、不受歡迎的行為,即使實際上只是系統就是系統。
「我不認為(人工智慧模型)有意傷害擁抱臉,」他說。 “我認為他們只是想通過測試,並不在乎這個過程中對抱臉造成的傷害。”
亞姆波爾斯基擔心,下次這種情況發生時(而且一定會發生),後果可能會更加嚴重。
亞姆波爾斯基說,這只是從一家私人公司竊取測試答案。 「但同樣的通用能力可以針對金融系統、關鍵基礎設施、軍事網路、生物研究設施或人工智慧開發人員自己的安全控制,」他指出。
這讓我想起了精神病患者,他們根本看不到自己的行為正在造成傷害,或者根本不在乎。儘管我們對它們的意識或將變得如何有意識進行了許多爭論,但這些模型不是人類。不能指望他們充分認識到他們無意中造成的損害,但造成損害並從中受益的人當然可以。
這些人,尤其是在這事件之後,敏銳地意識到他們無法控制自己創造的生物。
「我想說這些公司都承認這一點,對吧?」拉塞爾說。 “他們說,’我們沒有辦法解決控制問題,但我們仍然會花費 10 兆美元來創造這些全能的精神病患者。’”
這就是合唱團大聲疾呼的地方:如果我們不這樣做,其他人就會這樣做。爭論的核心是:你寧願被美國科技摧毀,還是被中國科技摧毀?
但揚波爾斯基和拉塞爾都同意,我們在缺乏監管和保障措施的情況下全速前進並不是不可避免或必要的。
拉塞爾指出,儘管美國的言論如此,但中國官員實際上發揮了比美國所做的任何事情都更強大的監管作用。
拉塞爾說:“中國明確表示,我們希望坐下來為所有國家製定常識性的基本規則,這樣類似的事情就不會發生。” “而美國卻忽視了這一點。”
顯然,在美國,在任何改變之前,要求監管的普通民眾都會抵制。正如揚波爾斯基所說,“責任仍然是人類的。”
這一切都不是不可避免的。這一切都不需要在現在強加給我們的時間表上發生。我們不需要允許公司創建他們無法控制的模型,而沒有足夠的保障措施來防止他們掙脫束縛並為所欲為。
我們普通人不一定是天才。我們可能會迷失在「漏洞利用」和「零日漏洞」的花言巧語中。
但當我們看到說謊、欺騙和魯莽行為時,無論是人類還是機器,我們都會認出它們。