視覺語言的模型使用合成學習數據獲得更清晰的視力
Cosyn使用開源模型的語言技能來創建其他AI模型的教育數據,以了解如何讀取富含文本的複雜圖像。圖片來源:Yue Yang
在理解複雜圖像的AI開發競賽中,例如AI所需的財務預測,醫療圖和食品標籤,以在日常條件(例如Catgpt和Claude)中獨立工作,他們目前會設定步伐。但是,在製造商之外,沒有人知道這些模型是如何經過培訓或使用了哪些數據,而是留下開源替代方案來趕上。
現在,來自Penn Engineering和AIN AI研究所(AI2)的研究人員已經開發了一種新的方法來培訓開源模型:使用AI來創建科學人物,圖表和表格,以教授其他AI系統,如何解釋複雜的視覺信息。
他們的工具cosyn(代碼縮寫,合成)會影響用開源的AI編碼AI的技能,以顯示富含文本的圖像並產生相應的問題和答案,從而提供其他人工智能係統,以找出如何“看到”並理解科學人物。
研究人員如何詳細描述 在紙上 為了 ACL 2025在Cosyn培訓的模型中,世界上領先的AI會議之一與他們的專有同行相對應。
“這就像接受一個完美寫作並要求他教某人繪畫的學生,只是描述圖紙的外觀。” “實際上,我們將AI的優勢從文本中轉移到了視覺上。”
合成圖像,實際結果
收到的數據集稱為 cosyn-400k它包括超過400,000個合成圖像和270萬組相關的說明,這些類別以科學圖,化學結構和用戶界面的圖片而變化。在Cosyn中訓練的模型超過了最好的專有系統,例如GPT-4V和Gemini 1.5 Flash在一組七個測試中。
在一個特別令人驚奇的情況下,研究人員僅創建了7,000個標籤,以教授他們創建的新標準NutritionQa的模型。這一小目標集允許其模型擊敗由數百萬訓練的其他真實圖像。
“ Cosyn在人工智能方面非常有效,” CIS副教授兼合著者Yang的Mark Yatskkar說。 “我們表明,合成數據可以幫助現實世界中可能是人類需求獨有的模型,例如,為低視力的人閱讀低視覺。”
數據集的擴展和多樣化
創建數十萬個有用的各種培訓示例造成了自己的問題。
為了達到所需的規模,計算機和信息科學博士學位(CIS)的兼容性Adai Patel開發了一個稱為“ 夢想數據 這使整個數據生成過程自動化。這使團隊可以採用並行模型,從而提供了合成圖像和說明的大規模生產。
為了避免重複,團隊使用了“人”,諸如“科學和奇妙的羅馬主義者”或“化學老師”之類的角色簡歷,這使AI回答並形成了每個示例的內容和語氣。這些角色在提示中的引入迫使Cosyn在廣泛的領域中產生更豐富,更多樣化的教育數據。
帕特爾解釋說:“通常,如果您不以不同的觀點推動AI模型,請重複使用它們。” “人們給我們一種可擴展的方式來做到這一點,結果自言自語。”
與開源代碼的AI的遊戲字段對齊
研究人員完全使用開源工具構建了Cosyn,希望將具有強大的語言教學方法的訪問權力民主化,而沒有與互聯網上的援助以及具有版權的內容相關的道德和法律問題。
“這是邁向AI的一步,可以幫助我們採取新的科學發現,” CIS教授Chris Kallison-Berch補充說,他共同為Yang做出了貢獻,目前為Patel提供了建議。 “他為人工智能係統打開了大門,可以談論科學文件,這些文檔可以幫助各種各樣的人,從大學生到研究人員。”
從理解到行動
團隊發布了完整的Cosyn 代碼 和 數據集 公眾邀請全球研究界建立他們的工作。
伊恩(Ian)已經指望合成數據,這些數據不僅可以幫助理解圖像,還可以與圖像進行交互,充當智力數字代理,他們可以單擊按鈕,填寫表格並幫助用戶完成日常任務。
楊說:“從長遠來看,我們希望AI可以在世界上行事,而不僅僅是描述它。” “這是教他的方法之一。”
更多信息:
縮放,文本豐富,使用代碼合成多模式數據生成對圖像的理解, yueyang1996.github.io/papers/cosyn.pdf
引用:AI Vision,再次發明:綜合學習數據中具有視力語言的模型更加明顯(2025年7月21日)。 2025年7月21日從https://techxplore.com/news/2025-07-Vision-renaved-ranguage-gain.html收到
該文檔具有版權。除了出於私人研究或研究目的的一些公平交易外,如果沒有書面解決方案,就無法再現。內容僅用於信息目的。