美團LongCat 2.0萬億模型:不用英偉達也能壓過GPT
摘要
美團發布開源大模型LongCat 2.0,具備1.6萬億參數、MOE架構,SWE-Bench Pro代碼基準超越GPT 5.5。最關鍵的突破在於全程使用國產算力完成預訓練,5萬餘張國產芯片穩定運行逾一個月、吃下35萬億Tokens。這不只是推理端的勝利,而是國產芯片首次真正扛起萬億模型的完整訓練流程,為「無頂級海外芯片」的自主AI路線提供了最硬的實證。
完整逐字稿
你敢信嗎?一個送外賣的公司,突然掏出一個萬億大模型,還把OpenAI幹趴下了,而且這模型一張英偉達的卡都沒用。
6月30日,美團官宣開源LongCat 2.0:1.6萬億參數、MOE架構、平均激活480億、上下文支持100萬,每個數字都是全球頂級模型的規格。更狠的是,它的SWE-Bench Pro代碼基準評分直接壓過GPT 5.5。
但真正逆天的是,它從預訓練、部署到推理,全程跑在國產算力上。注意,不是只跑推理,是訓練也跑通了。
以前國產芯片更多幹的是推理——模型訓好了,你問一句,芯片負責把答案算出來。DeepSeek V4那一波就是國產卡接住了頂級模型推理。但LongCat 2.0這次直接打進訓練場。
訓練有多難?它不是回答問題,它是把一個萬億級模型從零開始,餵數據、調參數、跑集群、扛故障。LongCat 2.0預訓練耗時一個多月,吃掉超過35萬億Tokens,5萬多張國產芯片一起跑,中間沒崩。
這才是最難的。因為在英偉達CUDA生態裡,很多路是現成的,但在國產芯片上,顯存、帶寬、工具鏈、算子、通信、容錯,全都要重新磨。
那美團憑什麼?它從2023年就開始啃國產算力,算子適配、通信優化、分布式穩定性,一塊一塊補。最後跑到什麼程度?穩態日吞吐超過1T Tokens,月均日故障率降低70%以上,訓練算力利用率提升1.5倍。這不是能跑一下,這是把國產芯片真拉進了萬億模型訓練場。
有意思的是,今年4月底LongCat 2.0匿名上線第三方模型交流平台,兩個月後,Claude Code月調用量衝到全球第二,僅次於Opus 4.8。它不是PPT,是已經被全球開發者用過的模型。
那為什麼偏偏是做外賣的美團?因為它不是只買最牛的卡,它是和國產算力一起做模型協同。它是昇騰最大的互聯網客戶之一,每年AI投入超百億,除了雲廠商,是互聯網公司裡最捨得砸錢的那一檔。
所以這次不是外賣公司跨界做模型,是國產模型和國產芯片一起把最難的一關撞開了。DeepSeek V4證明了國產卡能接住頂級模型推理,LongCat 2.0這次證明了國產芯片開始能扛萬億模型訓練。
以前大家問:沒有頂級海外芯片怎麼辦?現在答案越來越硬——自己訓、自己跑、自己把路修出來。
6月30日,美團官宣開源LongCat 2.0:1.6萬億參數、MOE架構、平均激活480億、上下文支持100萬,每個數字都是全球頂級模型的規格。更狠的是,它的SWE-Bench Pro代碼基準評分直接壓過GPT 5.5。
但真正逆天的是,它從預訓練、部署到推理,全程跑在國產算力上。注意,不是只跑推理,是訓練也跑通了。
以前國產芯片更多幹的是推理——模型訓好了,你問一句,芯片負責把答案算出來。DeepSeek V4那一波就是國產卡接住了頂級模型推理。但LongCat 2.0這次直接打進訓練場。
訓練有多難?它不是回答問題,它是把一個萬億級模型從零開始,餵數據、調參數、跑集群、扛故障。LongCat 2.0預訓練耗時一個多月,吃掉超過35萬億Tokens,5萬多張國產芯片一起跑,中間沒崩。
這才是最難的。因為在英偉達CUDA生態裡,很多路是現成的,但在國產芯片上,顯存、帶寬、工具鏈、算子、通信、容錯,全都要重新磨。
那美團憑什麼?它從2023年就開始啃國產算力,算子適配、通信優化、分布式穩定性,一塊一塊補。最後跑到什麼程度?穩態日吞吐超過1T Tokens,月均日故障率降低70%以上,訓練算力利用率提升1.5倍。這不是能跑一下,這是把國產芯片真拉進了萬億模型訓練場。
有意思的是,今年4月底LongCat 2.0匿名上線第三方模型交流平台,兩個月後,Claude Code月調用量衝到全球第二,僅次於Opus 4.8。它不是PPT,是已經被全球開發者用過的模型。
那為什麼偏偏是做外賣的美團?因為它不是只買最牛的卡,它是和國產算力一起做模型協同。它是昇騰最大的互聯網客戶之一,每年AI投入超百億,除了雲廠商,是互聯網公司裡最捨得砸錢的那一檔。
所以這次不是外賣公司跨界做模型,是國產模型和國產芯片一起把最難的一關撞開了。DeepSeek V4證明了國產卡能接住頂級模型推理,LongCat 2.0這次證明了國產芯片開始能扛萬億模型訓練。
以前大家問:沒有頂級海外芯片怎麼辦?現在答案越來越硬——自己訓、自己跑、自己把路修出來。