SLM和知識如何繪製SuperChare AI
將近一周的時間通過LLM(大語言模型)沒有大量發現。訓練和變得更聰明,那麼為什麼要與他們的妹妹(小語言模型)打交道?
對於每組開發人員來說,非常認真地提供實用的AI,一切都歸結為專注和匹配。 LLM非常適合一般,非整理任務,但是當AI在商業框架,SLM甚至支持LLM的SLM聯合會中真正有用時,它通常是最聰明的選擇。
為什麼?因為,作為 – ART引擎的頂部,使用一般的Purpose AI進行集中或算術的工作通常過多,並且會引入危險。例如,DeepSeek R1使用具有6710億個參數的“專家混合”,但通過查詢僅激活370億。
因為他知道它應該只有數十億個參數的一個子集,這些參數始終是活躍的,並且在消除問題並使用較小組件的選擇性使用時更有效,例如,在污漬中,例如一個需要一些數學皮下的用戶問題,而不是全部。
當您停止假設LLM可以做到這一切時,就很容易看到有多麼有用的結果。更聰明的方法是開發不同的SLM,用於分析業務的特定領域,例如資金,功能,物流,然後將其集中的出口餵入更通用的模型,該模型以單個凝聚力的答案組成了發現。
當您考慮一下時,這種協調模型是深人類的。我們的大腦不會同時射擊每個區域。我們激活語言,內存,發動機功能等的特定領域。這是一種明確的,連接的推理形式,反映了我們解決現實世界中問題的方式。物理學家可能會偶然發現自己的領域,而將軍可以提供更廣泛但準確的知識。同樣,認識到專業知識和運輸職責的局限性的AI系統可能會面臨比最聰明的自主LLM更複雜的問題。
SLMS V LLM
要測試SLMS案例,只需嘗試詢問有關AWS基礎架構的CHATGPT或任何通用LLM即可。由於LLM尚不清楚數字,甚至是一個基本問題,例如“我們有多少服務器?”可能會引起猜測或幻想,而不是可靠的答案。
一種更好的方法將改變一個經過訓練的SLM,以提高精確的數據庫,恢復精確的數據,然後將其轉移到LLM中以解釋自然語言的結果。對於預測,經典的統計模型通常仍然超過神經網絡 – 在這些情況下,可以使用簡短的LLM和結果來使用SLM來優化模型的參數。
SLM不僅便宜 – 它們通常在專業領域更有能力。獲取Microsoft的PHI-2,這是一種經過高質量數學和編碼數據培訓的小型模型。由於其專注的特殊現場培訓,它已經超過了其專業領域中更大的模型。
直到(如果)我們實現真正的AGI,則根本沒有模型會很棒。但是,經過特定項目訓練的SLM通常會超過將軍。給出正確的框架並提供最高的性能 – 簡單。
細節很重要。您不需要AI知道誰在1930年贏得了世界杯。您需要一個了解公司如何混合油漆,創建網絡或交付的人。該行業的重點是使AI在現實世界中有用的原因。
對於中型功能,SLM的效率要高得多。他們需要更少的GPU,消耗更少的功率並提供更好的投資(ROI)。這也使他們更容易適合較小的群體,這可以負擔得起根據他們的需求量身定制的訓練和運行模型。
最好靈活
那封閉了嗎?只需選擇一個SLM並享受保證的投資績效(企業AI;還不夠。
真正的挑戰是以可靠的,可靠的方式獲取模型中的供應鍊或任何專業數據。 LLM和SLM均基於通常經過大量訓練的建築變壓器。它們當然不適合連續更新。
為了保持SLM的親戚和準確,您仍然必須提供新鮮的環境。有圖形技術。結構良好的知識圖可以充當活著的老師,他不斷地將模型紮根於更新,可靠的信息。
這種組合,SLM和圖形知識在高階段的區域中被證明特別強大。與自主LLM相比,它提供更快,更準確,更具成本效益的出口。
除此之外,越來越多地採用了恢復(RAG),尤其是在GraphRag設置中,並且您會發生遊戲變化。隨著結構化和非結構化數據的橋接以及即將到來的框架的輸液,該體系結構使AI確實為業務做好了準備。
GraphRag還可以通過不斷恢復相關的真實信息來增強推理,而不是依靠靜態或過時的數據。結果?提起工作的最激烈,更多的上下文答案,例如簡短的簡短簡要簡短簡短簡介簡介簡介(QFS),並允許SLM更準確地工作和適應性。
簡而言之,如果我們想要真正面臨真正業務挑戰的AI系統,而不是恢復他們想听到的內容,那麼未來並不是為了構建越來越多的LLM。對於許多業務場景,SLM/GraphRag混合模型可能是Genai的實際途徑。
我們已經提到了最好的數據成像工具。
本文是Techradarpro的Insights Experts Insights Channel的一部分,我們在當今的技術行業中擁有最好,最聰明的頭腦。這裡表達的觀點是作者的觀點,不一定是Techradarpro或Future Plc的觀點。如果您有興趣貢獻,請在此處了解更多信息: https://www.techradar.com/news/submit-your-story-story-totor-to-techradar-pro