ARC-AGI-2的目標旨在成為人工智能模型的艱難測試Just_super/Getty圖像 當今存在的最複雜的AI模型在新的標準中得分很差,旨在衡量其在實現人工通用智能(AGI)方面的進展,而毛力量的計算能力不足以提高,因為評估師目前正在考慮啟動該模型的成本。 有許多競爭性的AGI定義,但是通常,它們轉向AI,可以執行人們可以執行的任何認知任務。為了衡量這一點,ARC獎基金先前啟動了稱為Arc-Agi-1的推理能力測試。去年12月,OpenAI宣布其O3模型讚賞該測試,這迫使一些人詢問該公司是否接近AGI的成就。 但是現在新的測試Arc-Agi-2提高了標準。很難的是,市場上沒有現代化的AI系統可以取得超出測試中100的明確指標,而每個問題在不到兩次嘗試中至少有兩個人解決。 在 博客文章 通過宣布ARC-AGI-2,ARC總裁Greg Kamradt表示,新標準必須比以前的迭代檢查各種技能。他寫道:“要打敗它,您必須既表現出高水平的適應性又表現出高效率。” ARC-AGI-2衝突與其他AI測試的不同之處在於,它著重於人工智能模型執行簡化任務的能力,例如基於過去的符號解釋示例的新圖像中的變化的複制,而不是遵守世界範圍的PHD PHD指標的能力。當前的模型在“深度訓練”中很好,該模型是通過Arc-Agi-1衡量的,但在ARC-AGI-2中似乎需要更複雜的思維和相互作用的似乎更簡單的任務中。例如,OPEAI的O3模型在ARC-AGI-1上獲得了75.7%,但ARC-AGI-2只有4%。 該標準還增加了一個新的維度來衡量AI的能力,考慮到其在解決問題上的有效性,以解決問題所需的成本來衡量。例如,儘管Arc為這項任務支付了17美元的人類Tesers,但估計O3-Low的同一工作的價格為200美元。 他說:“我認為,現在專注於平衡效率的新的Arc-Agi迭代是邁向更現實的人工智能模型評估的重要一步。” 約瑟夫帝國 在英國巴塔大學。 “這是一個跡象表明,我們正從一個僅對性能的一個維度評估測試中轉移,但也考慮到較低的計算能力。” 任何能夠傳達ARC-AGI-2的模型不僅應該非常有能力,而且還應較小且光明,帝國級表示該模型的有效性是新標準的關鍵組成部分。這可以幫助解決問題,因為AI模型變得更加精力密集 - 有時,在這種浪費程度上,成就不斷獲得結果。 但是,並不是每個人都堅信新措施是有用的。 “整個框架,因為智力的測試不是正確的框架。”...
العلوم والتكنولوجيا
讓AI為您編寫軟件?這是氛圍編碼Ronstice/Alam 想編寫軟件,但是您沒有第一線索,從哪裡開始?輸入VIBE編碼,即互聯網掃描以描述AI工具的使用,包括大型語言模型(LLMS),例如ChatGpt,即使您無法編程,也可以生成計算機代碼。 什麼是氛圍編碼,這是從哪裡來的? “ VIBE編碼主要適用於生成人工智能的使用,不僅可以幫助編碼,而且還用於為應用程序創建整個代碼。” Noah Gyansiracuse 在馬薩諸塞州Walem的Bentley大學。用戶詢問或製作基於LLM的模型,例如Chatgpt,Claude或Copilot,以生產應用程序或服務代碼,並且AI系統執行所有工作。 該術語是由經驗豐富的工程師安德烈·卡爾帕蒂(Andrei Karpati)發明的,他是特斯拉的人工智能的負責人,也是Openai的創始人 - Chatgpt的製造商。他在二月 在X上出版 關於“一種新的編碼形式,我稱為”振動編碼。 “ 卡爾帕蒂(Karpati)將其描述為“在振動中完全賦予您的地方,覆蓋指數,而忘記了代碼甚至存在”。這個詞誕生了,這個想法佔有。軟件開發人員西蒙·威利森(Simon Willison)說:“這贏得了引起許多人共鳴的那一刻,因為有很多人是非程序員開始使用LLM的人,寫代碼並從他們那裡獲得驚人的結果。” 編碼氣氛的含義是什麼? 軟件可能是一項艱鉅的任務 -...
從理論上講,量子計算機比普通機器具有優勢Quantin 量子計算機將很快能夠比經典計算機更快地解決真正有用的數學問題,即量子計算公司Quantinuum索賠。這將是這些外來機器的第一個例子,顯示了比常規設備的真正優勢。 此類問題與數學分支有關,稱為組件理論,該理論用於根據其相交點的數量和性質對節點進行分類。該概念應用於加密,物理和分子生物學。這甚至是作為導航太空飛船的方法提出的... 來源連結
智能手機可能會分散其他任務Pheleings Media/shutterstock 您是否正在分心工作,轉向智能手機,以便有些毫無意義的滾動?一種解決方案是將手機遙不可及 - 但是,不幸的是,這似乎不起作用。 他說:“人們顛倒了手機,將其隱藏在筆記本電腦下,有時您會看到一個有點宿命論,“把它扔在我身後,”他說,”他說。 Maxi Haitmeier 在倫敦經濟學院。他之前研究了手機的使用,發現人們與設備互動 大約每5分鐘。 為了看看是否有可能避免這種干擾,Heitmayer記錄了22名22至31歲的大學和辦公室工作人員的學生,照常在私人房間桌子上的筆記本電腦上工作。有一天,參與者將手機固定在手及。一秒鐘,他們將手機放在第二個桌子上1.5米,這意味著他們必須起身檢查。 Heitmeier發現,志願者平均呆了23分鐘,第一天在手機上閒逛,但是當他們的設備進一步發展時花了16分鐘。但是,他們不再在第二天工作 - 相反,參與者只是花了更多時間在筆記本電腦上進行悠閒行動,主要是在社交網絡上。 Haitmeier說:“您可以少使用手機,但是在社交網絡上滾動的所有這些滾動比您預期的時間更長,只是遷移到筆記本電腦。” “這表明,分散注意力本身不是一種設備,而是主要活動,因此,社交網絡,賭博或互聯網上的其他人。” daantje derks 在荷蘭的伊拉斯mus鹿特丹大學。 儘管如此,她指出,要測試這些最初的結果,需要在通常的工作環境中追踪人們的大量研究。...
2024年3月,這艘貨船墜入馬里蘭州巴爾的摩的弗朗西斯·斯科特橋PPI 在集裝箱船與馬里蘭州巴爾的摩的弗朗西斯·斯科特橋(Francis Scott Bridge)碰撞的一年後,該研究揭示了其他大型美國橋樑,這些大橋樑令人驚訝地容易受到對災難性船隻的類似攻擊的影響 - 他們的集體風險很高,以至於每隔幾年就會發生一次這樣的事件。 現代橋樑可以減少船舶衝突的機會,例如增加支撐支撐和增加的距離等措施... 來源連結
一個危險的想法是對乘客航空的迫害:一半在2030年代,一半是在平民客機掌舵的飛行員人數,並填補了AI的空置 - 專家,專家說,他們可以使航班的安全性要降低得多。一個飛行甲板上的船長和聯合飛行員,例如如今的Big Jets,一個飛行員行動(SPO)將只有一名飛行員和AI,以某種方式設計出來,以在聯合飛行員中發揮僵化,至關重要的作用。 航空公司聲稱,這將決定 缺乏飛行員 這對行業來說已經變得筋疲力盡。但是Spo ... 來源連結
為了節省時間,我們始終必須將時鐘安裝在最好的滴答上。直到1950年代,由天文學家建立的基於太陽在天空中的位置建立的人是最好的。當時,最可靠的時間就是這樣 格林威治的皇家天文台倫敦。 1847年,鐵路同意在整個網絡中使用GMT。因此,格林威治通過電報信號的中間時間的分佈變得絕對重要。但是,並非每個人都可以將時鐘連接或將其時鐘連接到天文台以安裝它們 - 而格林威治女士露絲·貝爾維爾(Ruth Belville)進入了。每天,雨或輻射都在進行,她分散了第二個皇家天文台的注意力,然後在倫敦旅行,以便她的客戶可以與她同步她的手錶。 主題: 來源連結
Wikipedia有AI的風險克里斯·多尼(Chris Dorni) /阿拉姆(Alam) Wikipedia是最大的知識資源之一,當時的人們聚集在一起,其中包含來自世界各地數百萬人的眾包存款,並且遇到了人工智能開發商的威脅日益增長。 經營維基百科的非營利性維基梅迪亞基金會說,自2024年1月以來,他看到了 增加50% 在網絡流量中,請求從其目錄中下載圖像和視頻。這次激增主要來自自動數據刮刀的計劃,開發人員用它們為其人工智能模型收集教育數據........... 來源連結
Zodiaq,受到細菌水下機器人的啟發阿努普是安靜的馬修 受細菌鞭毛的啟發,水下機器人可以用12個柔性手朝任何方向朝任何方向前進。它的創造者聲稱,他可以在不持久的人或野生動植物的情況下進行潛艇,好像機器人由螺旋槳控制。 游泳者很小,類似於頭髮,在許多細菌中發現的突起可以順時針或逆時針旋轉以創建發動機。他說:“(細菌)有一些東西,稱為生物引擎,旋轉這種細長的結構,而這種細長的結構會引起牽引力,這就是細菌的運動方式。” 阿努普是安靜的馬修 在阿布達比的哈里發大學... 來源連結