27B小模型打敗397B大模型?本地跑Agent選稠密還是MOE

2026-07-14 · 0 次瀏覽 AI

摘要

測試者針對千問3.5全系列模型設計15個場景、12種工具的Agent基準測試,結果27B稠密模型(Dense)全數通過,而35B至397B的MOE混合專家模型幾乎全軍覆沒。關鍵原因在於MOE模型每次僅激活部分參數,關鍵時刻無法正確傳遞工具返回的數據。稠密模型層數更深、注意力機制占比更大,追蹤上下文能力更強,在Agent任務中具有結構性優勢。

完整逐字稿
隨著小龍蝦這樣的新一代智能體的落地,越來越多人開始思考自己在本地去生產Token。這位老哥自己設計了一套簡單但全面的測試框架,想弄清楚哪個本地模型最適合跑Agent。他測了千問3.5全系列的模型,結果27B的大模型竟然打贏了397B的大模型。我們具體來看一下,可能對你本地跑大模型有一些參考作用。

我們看他設計了15個場景,用了12個工具,然後把溫度設置為0。這樣做的好處就是每次可以讓實驗結果穩定、可復現,專門去測試本地模型的工具調用能力。

千問3.5全系列的模型其實分成兩種架構:一種就是27B的Dense模型,中文叫做稠密模型。什麼叫稠密模型呢?就是所有的參數每次都會全部參與計算。但是其他的,像35B、122B、397B,都是MOE模型,叫做混合專家模型,參數數字上看起來好像大很多,但其實每次只激活其中的一部分。

我們來看一下結果。15個測試全部跑下來,完全通過的就只有27B的模型,也就是相對來說參數比較小的稠密模型。來看一下它的幾個大哥:397B的模型掛了兩個任務,122B的模型掛了一個任務,35B的模型也掛了兩個任務,MOE模型幾乎全軍覆沒。然後你去看這些參數更小的模型,那就更慘了,有時候就直接子循環超時。

這個作者特別去看了一下,讓所有MOE模型全軍覆沒的是這樣一道題:搜索冰島的人口,並計算其中2%是多少。這三個參數比較大的MOE模型,就完全無視工具返回的數據,調用了自己記憶裡面的大概數字,相當於調用了工具,但又不相信工具。我覺得這個還蠻離譜的。

接著我們來理解一下,為什麼27B的模型能夠戰勝397B的MOE模型。397B聽著嚇人,相當於3970億的參數,但其實每次激活的參數只有17B,也就是每次實際幹活的只有17B的參數。關鍵時刻,我需要的專家沒有被激活,所以就會出錯了。但是這個Dense模型幾乎每次全員出動,27B的參數看起來數量上雖然小一點,但生成一個Token時實際參與計算的參數反而會更多。

作者在文章裡面是這樣總結的:小模型會去編數據,大模型會去無視數據,只有27B的這個模型,它會實實在在地把數據傳下去,最終顯示給用戶。

我們知道,Agent智能體去調用工具最重要的無非就是三件事:一個是指令認得準,第二個是上下文跟得住,第三個是數據傳得對。稠密模型相比較MOE模型,層數更深,注意力機制占比更大,追蹤上下文的能力天然也更強。

比如說,Anthropic的Claude就是公認的Agent智能體領域最強的模型。之前我看到有篇技術文章提到,主流的前沿模型裡面,只有Claude還是唯一用稠密架構的,像GPT、Gemini早就轉到了MOE架構了。開源這邊,Dense 27B的模型打贏了所有MOE的大哥;閉源那邊,Agent最強的也是Dense模型。所以我覺得這個大概率不是一個巧合。

最後跟大家總結一下:MOE當然更快,也更省算力,日常我們去跑也夠用了。但是如果運行Agent、執行相對複雜的任務,Dense的稠密模型有結構性的優勢。

好了,今天視頻就到這裡。我是地上鐵,與你比超,我們下次見。