上下文的算力成本打到 1/20)
編者按本文由 AI 每日精選自動(dòng)整理編譯內(nèi)容基于 2026 年 8 月的公開英文技術(shù)資料翻譯與二次加工供國(guó)內(nèi)開發(fā)者快速了解前沿進(jìn)展。文末附有原始信息來(lái)源歡迎在評(píng)論區(qū)交流。MiniMax M3 深度解讀用「稀疏注意力」把百萬(wàn)上下文的算力成本打到 1/20目錄MiniMax M3 深度解讀用「稀疏注意力」把百萬(wàn)上下文的算力成本打到 1/20一、為什么這條新聞值得關(guān)注二、核心規(guī)格速覽三、稀疏注意力MSA到底解決了什么問(wèn)題3.1 標(biāo)準(zhǔn)注意力的老毛病O(n2)3.2 MSA 的關(guān)鍵思路把「看哪些 KV」和「怎么算注意力」拆開3.3 工程上的收益四、和其他主流模型的定位差異五、對(duì)國(guó)內(nèi)開發(fā)者的幾點(diǎn)實(shí)操啟示六、小結(jié)參考資料 / 信息來(lái)源一、為什么這條新聞值得關(guān)注2026 年上半年是大模型極其熱鬧的半年Anthropic 發(fā)布 Claude Sonnet 5、Google 在 I/O 上推出 Gemini 3.5、xAI 的 Grok 4.3 登頂 LMArena 排行榜、OpenAI 也罕見地開源了 GPT-oss 系列權(quán)重。但在這一堆「參數(shù)更大、榜單更高」的常規(guī)敘事里真正讓工程師眼前一亮的是來(lái)自上海的MiniMax M3。它的看點(diǎn)不在于「又刷了一個(gè)榜」而在于架構(gòu)層面的改動(dòng)M3 用自研的MiniMax Sparse AttentionMSA稀疏注意力替換掉了標(biāo)準(zhǔn) Transformer 那套 O(n2) 復(fù)雜度的注意力把處理百萬(wàn) token 長(zhǎng)上下文的每 token 計(jì)算成本壓到了傳統(tǒng)方案的約1/20同時(shí)保持了前沿水平的編程與推理能力。對(duì)做長(zhǎng)文檔、代碼庫(kù)級(jí)理解、以及 Agent 工作流的同學(xué)來(lái)說(shuō)這是一個(gè)「成本結(jié)構(gòu)」層面的變化值得認(rèn)真拆解。二、核心規(guī)格速覽維度MiniMax M3模型類型混合專家MoE 稀疏注意力總參數(shù)量約 4280 億428B每 token 激活參數(shù)約 230 億23B上下文窗口最高 100 萬(wàn)1Mtoken注意力機(jī)制MiniMax Sparse AttentionMSA塊稀疏 Lightning Indexer多模態(tài)原生多模態(tài)M3-VL 版本搭配 CLIP 風(fēng)格視覺塔定位前沿編程能力、超長(zhǎng)上下文、Agent 工作流注以上數(shù)字來(lái)自 MiniMax 官方博客及 Hugging Face 模型卡等公開資料翻譯時(shí)保留了原始口徑。一句話概括這套配置的精髓總參數(shù)很大保證能力上限但每個(gè) token 實(shí)際只激活約 23B保證推理便宜再疊加稀疏注意力保證長(zhǎng)上下文不爆炸。三招疊加才有了「前沿性能 極低成本」的組合拳。三、稀疏注意力MSA到底解決了什么問(wèn)題3.1 標(biāo)準(zhǔn)注意力的老毛病O(n2)標(biāo)準(zhǔn) Transformer 的自注意力需要讓序列里每個(gè) token 都和其他所有 token 兩兩算一遍相關(guān)性。序列長(zhǎng)度是 n計(jì)算量和顯存占用就隨 n2 增長(zhǎng)。上下文從 4K 拉到 1M是 250 倍的長(zhǎng)度但注意力的開銷大致是6 萬(wàn)倍級(jí)別的膨脹。這正是「長(zhǎng)上下文很貴、很慢」的根本原因。MiniMax 更早的 MiniMax-Text-014560 億參數(shù)、每 token 激活 45.9B就已經(jīng)在用混合的線性注意力Lightning Attention思路來(lái)對(duì)抗這個(gè)問(wèn)題M3 則把它進(jìn)一步演進(jìn)成了MSA。3.2 MSA 的關(guān)鍵思路把「看哪些 KV」和「怎么算注意力」拆開按照社區(qū)對(duì) M3 架構(gòu)圖的解讀MSA 最核心的一步是把注意力拆成兩個(gè)動(dòng)作先篩選Lightning Indexer / 預(yù)過(guò)濾階段用一個(gè)輕量的「索引器」分支快速判斷——對(duì)當(dāng)前 token 來(lái)說(shuō)歷史里的哪些 Key/Value 塊是真正值得看的。再計(jì)算塊稀疏注意力只對(duì)被選中的那一小部分 KV 塊做完整的注意力計(jì)算其余直接跳過(guò)。換句話說(shuō)模型不再「無(wú)腦地」對(duì)全序列做稠密注意力而是先用便宜的方式定位重點(diǎn)再把寶貴的算力花在刀刃上。3.3 工程上的收益根據(jù) NVIDIA 的部署博客MSA 用一個(gè)預(yù)過(guò)濾階段替換了傳統(tǒng)的二次方注意力帶來(lái)的實(shí)測(cè)收益包括連續(xù) KV cache 訪問(wèn)速度提升 4 倍以上每 token 計(jì)算成本約為原來(lái)的 1/20能夠高效支撐100 萬(wàn) token級(jí)別的上下文窗口。此外M3 的層結(jié)構(gòu)是混合的前幾層用「稠密注意力 稠密 MLP」保證基礎(chǔ)表達(dá)能力后續(xù)大部分層則采用「稀疏注意力 MoE」來(lái)省算力。MoE 部分用的是 Sigmoid 路由帶有路由偏置校正并配有一個(gè)共享專家shared expert。四、和其他主流模型的定位差異2026 年這一批新模型大致可以分成兩條路線路線一把中端模型做到接近旗艦。典型是 Anthropic 的Claude Sonnet 52026 年 6 月 30 日發(fā)布。它把原本只有 Opus 級(jí)大模型才有的自主 Agent、工具調(diào)用、瀏覽器操作能力下放到更便宜的 Sonnet 檔標(biāo)配 100 萬(wàn) token 上下文SWE-bench Verified 達(dá)到 72.7%在 Terminal-Bench 2.1 上甚至以 80.4% 反超旗艦 Opus 4.8 的 74.6%。它解決的是「性價(jià)比曲線」問(wèn)題。路線二從架構(gòu)層面改寫成本結(jié)構(gòu)。這正是MiniMax M3的路子。它不滿足于「同樣的 Transformer、把參數(shù)調(diào)便宜」而是直接換掉注意力機(jī)制本身。對(duì)于長(zhǎng)上下文、代碼庫(kù)理解、Agent 長(zhǎng)鏈路這類場(chǎng)景這種改動(dòng)的邊際收益會(huì)隨著上下文變長(zhǎng)而不斷放大。兩條路線并不沖突但對(duì)做工程落地的人來(lái)說(shuō)信號(hào)很清晰當(dāng)上下文越來(lái)越長(zhǎng)、Agent 鏈路越來(lái)越深時(shí)架構(gòu)級(jí)的效率優(yōu)化而非單純堆參數(shù)會(huì)越來(lái)越重要。五、對(duì)國(guó)內(nèi)開發(fā)者的幾點(diǎn)實(shí)操啟示長(zhǎng)上下文不再是「土豪專屬」。如果你之前因?yàn)?O(n2) 的成本而不敢把整個(gè)代碼倉(cāng)庫(kù)、整本手冊(cè)塞進(jìn)上下文稀疏注意力類模型給了你重新評(píng)估的理由??梢葬槍?duì)自己的 RAG / 長(zhǎng)文檔場(chǎng)景做一次成本對(duì)比測(cè)試。關(guān)注「每 token 激活參數(shù)」而不只是總參數(shù)。MoE 模型的總參數(shù)決定能力上限但推理成本主要由激活參數(shù)決定。M3 的 428B 總參 / 23B 激活是理解其成本優(yōu)勢(shì)的關(guān)鍵。部署生態(tài)正在跟上。vLLM、TensorRT-LLM、NVIDIA NeMo 等主流推理框架均已支持 MiniMax-M3這意味著自建推理服務(wù)的門檻在下降可以納入選型評(píng)估。多模態(tài)是默認(rèn)項(xiàng)不是附加項(xiàng)。M3-VL 原生支持視覺輸入對(duì)需要「文檔 截圖 代碼」混合理解的 Agent 場(chǎng)景很友好。六、小結(jié)MiniMax M3 這條新聞的真正價(jià)值不在于又一個(gè)「大參數(shù)、高榜單」的模型誕生而在于它把**「長(zhǎng)上下文很貴」這個(gè)行業(yè)默認(rèn)假設(shè)**給動(dòng)搖了。用「先篩選、再計(jì)算」的稀疏注意力把百萬(wàn)上下文的每 token 成本壓到 1/20這是一次從架構(gòu)底層出發(fā)的效率革命。在「堆參數(shù)」逐漸邊際遞減的當(dāng)下這類架構(gòu)級(jí)創(chuàng)新可能才是接下來(lái)最值得國(guó)內(nèi)工程師持續(xù)跟蹤的方向。參考資料 / 信息來(lái)源MiniMax 官方博客MiniMax M3: Frontier Coding, 1M Context, Native MultimodalityHugging Face 模型卡MiniMaxAI/MiniMax-M3 READMENVIDIA 開發(fā)者博客Deploy Long-Context Reasoning and Agentic Workflows with MiniMax M3社區(qū)架構(gòu)解讀Decoding M3’s Attention from a Single DiagramMiniMax-01 開源倉(cāng)庫(kù)MiniMax-AI/MiniMax-01 (GitHub)行業(yè)動(dòng)態(tài)匯總LLM News Today (August 2026)Claude Sonnet 5 參考Claude Sonnet 5 Benchmarks Explained (Vellum)本文為編譯整理技術(shù)細(xì)節(jié)以官方文檔為準(zhǔn)。如有翻譯或理解偏差歡迎在評(píng)論區(qū)指正交流。轉(zhuǎn)載請(qǐng)注明來(lái)源。#大模型#MiniMax#稀疏注意力#長(zhǎng)上下文#MoE#AI工程化