AI“教練”可以幫助語言模型在文本和代碼之間進行選擇以解決問題
DPO數據樣本有幾個轉:藍色正方形是中間的(非財務)轉彎,而布朗諾瓦群島則指出末端轉彎。信用: arxiv (2025)。 doi:10.48550/arxiv.2502.04350
大型語言模型(LLMS)在使用文本討論來理解文檔上下文並為其內容提供邏輯答案時,出色。但是,同一LLM通常會嘗試正確地回答最簡單的數學任務。
通常,文本討論不是在計算或算法任務上有意目的的理想方式。雖然某些LLM可以生成代碼,例如用於處理符號查詢的Python,但這些模型並不總是知道何時使用代碼,或者哪種代碼最適合使用。
LLM似乎需要教練將他們引導到最佳技術。
進入 鱈魚麻省理工學院研究人員開發的智能助手,他指示LLM在代碼之間切換並生成文本,直到他正確響應該請求為止。
CodeSteer本身是較小的LLM,自動生成一系列技巧,以迭代控制大型LLM。他考慮了每回合之後模型的當前和以前的答案,並提供有關她如何糾正或澄清該決定的建議,直到他考慮正確的答案為止。
研究人員發現,較大的LLM隨著CodeSteer的速度增加了其在符號任務中的準確性,例如乘以數字,Sudoku遊戲和塊,風格的精度增長了30%以上。它還允許不那麼複雜的模型超過具有先進推理技能的更高級模型。
這種進步可以改善解決LLM問題解決複雜問題的可能性,僅在文本推理的幫助下,這些問題尤其難以解決,例如在不確定條件下為機器人創建路線或國際供應鏈中的計劃供應。
“有一場競賽來發展每個人都可以做的最好,最好的模型,但是我們已經接受了一種補充方法。研究人員花了多年的時間在開發有效的技術和工具上,以解決許多領域的問題。我們希望LLMS選擇正確的工具和方法,並利用其他人的能力來提高其自身的能力。”
粉絲,研究的高級作者,加入 工作文件 Unchao Chen Scipirent的研究生; Aeroastro Yilun Hao研究生;伊利諾伊大學的研究生Urbana-Champaign Yueying Liu;以及MIT-IBM Watson AI Lab Yang Zhang的研究人員。該研究將在國際機器教育會議上提交。
該文檔發表在 arxiv 預印服務器。
LLM“培訓師”
詢問LLM,哪個數字是9.11或9.9,並且通常使用文本討論給出錯誤的答案。但是請他使用代碼回答相同的問題,並且可以生成和完成Python腳本以比較兩個數字,從而輕鬆解決該問題。
LLM最初經過培訓以理解和預測人類語言的人類語言,即使代碼更有效,也更有可能使用文本響應請求。儘管他們已經學會了使用薄調諧來生成代碼,但這些模型通常會生成不正確或不太有效的代碼版本。
麻省理工學院的研究人員沒有試圖重新訓練強大的LLM,例如GPT-4或Claude來改善這些機會,而是巧妙地建立了一個較小的輕型LLM,以指導文本和代碼之間的大型模型。較小模型的確切配置不會改變較大的LLM,因此沒有風險,它會破壞較大模型的其他能力。
“我們也受到人們的啟發。在運動中,教練可能並不比球隊中的明星運動員更好,但是教練仍然可以提供有用的要約來指導運動員。這種轉向方法也適用於LLM,” Chen說。
這位教練CodeSteer與更大的LLM結合使用。首先,他考慮了請求,並確定文本還是代碼是否適合此問題,哪些代碼會更好。
然後,它為較大的LLM生成提示,提供使用編碼方法或文本推理來響應請求的提示。大型模型遵循此提示回答該請求,並將結果發送回CodeSteer,後者考慮了該請求。
如果答案不正確,CodeSteer將繼續鼓勵LLM嘗試可以解決問題的不同事物,例如,在Python代碼中包含搜索算法或限制,直到答案正確為止。
陳說:“我們發現,通常,較大的LLM會嘗試變得懶惰,並使用較短的,較不效率的代碼,不會帶有正確的符號計算。我們開發了代碼器以避免這種現象。”
符號檢查評估了代碼的複雜性,並在其太簡單或無效的情況下發送CodeSter信號。研究人員還包括檢查在代碼器中的獨立運行,這鼓勵LLM生成一個計算答案的代碼,以確保其正確。
解決複雜的任務
當研究人員開發CodeSteer時,他們找不到適當的符號數據集來準確調整和檢查模型,因為許多現有標準沒有指示使用文本或代碼最好地求解某個請求。
因此,他們收集了37個複雜符號任務的案例,包括空間推理,數學,訂購和優化,還創建了自己的數據集,稱為Symbench。他們介紹了一種具有精美設置的方法,Symbench用來最大程度地提高CodeSteer性能。
在他的實驗中,代碼器超過了所有九種基本方法,它們估計,平均準確性從53.3%提高到86.4%。即使在不可見的任務和各種LLM上,它也支持類似的結果。
此外,由CodeSteer補充的一般使用模型比旨在專注於復雜推理和計劃的現代模型可以實現更高的準確性,同時需要更少的計算。
“我們的方法使用了LLM自己的功能。由於LLM的增加而有可能使用編碼,我們可以採用一種已經非常強大並進一步提高其性能的模型。”
將來,研究人員希望優化CodeSter,以加快其迭代提示過程。此外,他們研究瞭如何有效地準確配置統一模型,並有可能在文本策劃和代碼生成之間切換,而不是依靠個人助手。
“作者代表了在LLMS中使用工具的關鍵問題的優雅解決方案。這種簡單但有效的方法使現代LLM可以在不需要直接準確配置的情況下實現績效的重大改進。”
“這項研究是一項重大貢獻,有望大大改善LLM對他們目前正在與之抗爭的任務的各種目標的使用。”
Google Deepmind的高級科學家Chi Van補充說:“他們在向更大的高級模型的戰略方向傳授較小的專業模型方面的成功,這與這項工作無關。
“ AI的不同代理之間的這種智力合作為在現實世界的複雜場景中鋪平了更可靠和普遍的應用的方式。”
更多信息:
Yongchao Chen等。 arxiv (2025)。 doi:10.48550/arxiv.2502.04350
這個故事重印為麻省理工學院新聞(web.mit.edu/newsoffice/),一個受歡迎的網站,涵蓋有關研究,創新和麻省理工學院教學的新聞。
引用:AI“教練”可以幫助語言模型在文本和代碼之間進行選擇以解決問題(2025年7月17日)。 2025年7月17日收到
該文檔具有版權。除了出於私人研究或研究目的的一些公平交易外,如果沒有書面解決方案,就無法再現。內容僅用於信息目的。