
mHCMLAMTP 是什么拆開給 Agent 用的百億 MoE【免費下載鏈接】Xing4.0-29B-A4BXing4.0-29B-A4B 是中電信人工智能科技有限公司研發(fā)的星辰語義大模型系列原 TeleChat新一代模型。模型總參數(shù)量 29B激活參數(shù)僅 4B原生支持 256K 上下文可擴展至 512K是國內(nèi)首個基于國產(chǎn)算力與國產(chǎn)框架完成訓練、面向復雜工程任務(wù)深度優(yōu)化的百億參數(shù)大模型。項目地址: https://ai.gitcode.com/XingChen-AGI/Xing4.0-29B-A4B當29B 總參數(shù)、4B 激活、原生 256K 上下文這些數(shù)字同時出現(xiàn)在一張參數(shù)表上時大多數(shù)人的第一反應(yīng)是又一個取巧的 MoE。但 Xing4.0-29B-A4B 真正值得拆解的是它在這組數(shù)字背后堆疊的三項架構(gòu)設(shè)計——mHC多頭超連接、MLA多頭潛變量注意力、MTP多 token 預測。這三者分別回答了一個 Agent 大模型最核心的三個問題深層稀疏網(wǎng)絡(luò)怎么訓練才穩(wěn)、長上下文放得下、解碼快不快。本文直接從倉庫源碼出發(fā)把這套為 Agent 而生的百億 MoE 拆開看。先看懂 A4B29B 的參數(shù)為什么每 token 只激活 4B一切從 config.json 的 MoE 字段說起n_routed_experts: 64, num_experts_per_tok: 4, n_shared_experts: 1, moe_intermediate_size: 1024, intermediate_size: 9216, first_k_dense_replace: 2, routed_scaling_factor: 2.0, topk_method: noaux_tc, scoring_func: sigmoid40 層 Transformer 中除前 2 層保留稠密 FFN中間維 9216外其余 38 層全部替換為 MoE每層 64 個路由專家中間維僅 1024 1 個共享專家每個 token 激活 top-4 個路由專家。moe_intermediate_size1024僅為稠密層 9216 的約九分之一——這正是 4B 激活參數(shù)的核心來源專家小而多稀疏激活容量靠多堆出來算力靠稀省下來。路由邏輯在 modeling_xing4_0.py 的Xing4_0TopkRouter中清晰可見sigmoid 打分 top-4 選取 權(quán)重歸一化 2.0 縮放因子并帶一個可學習的e_score_correction_bias作負載均衡補償。前 2 層稠密的設(shè)計則保證了底層特征提取的穩(wěn)定性。社區(qū)報道中反復出現(xiàn)的4-bit 量化后約 15GB 顯存、RTX 4090 可跑正是這一結(jié)構(gòu)的直接紅利權(quán)重雖大但推理時每步真正參與計算的是 4 個專家 1 個共享專家配合量化后單卡部署成為可能。MLA256K 上下文的內(nèi)存革命原生 256K、可擴展 512K這是 Xing4.0-29B-A4B 最激進的規(guī)格之一。而支撐它的是 modeling_xing4_0.py 中Xing4_0Attention完整實現(xiàn)的 MLAMulti-head Latent Attentionself.q_lora_rank config.q_lora_rank # 768 self.kv_lora_rank config.kv_lora_rank # 512 self.qk_rope_head_dim config.qk_rope_head_dim # 64 self.qk_nope_head_dim config.qk_nope_head_dim # 128 self.v_head_dim config.v_head_dim # 128 self.kv_a_proj_with_mqa nn.Linear(config.hidden_size, self.kv_lora_rank self.qk_rope_head_dim) self.kv_b_proj nn.Linear(self.kv_lora_rank, self.num_heads * (self.qk_nope_head_dim self.v_head_dim))關(guān)鍵在 KV cache 的壓縮方式每層的 key/value 不再按 32 個注意力頭完整存儲而是先用kv_a_proj_with_mqa壓進512 維的潛變量 64 維 RoPE 分量計算注意力時再由kv_b_proj從潛變量實時展開出完整的 key 與 value。緩存里只放壓縮后的潛變量等價于把傳統(tǒng) MHA 每 token 上萬維的 KV 存儲壓到約 512 32×64 維是數(shù)量級的削減——這正是 256K 上下文在消費級硬件上放得下的底層原因。num_key_value_heads32意味著這里沒有走 GQA 路線MLA 本身就是它的壓縮手段。配套的位置編碼同樣為長上下文服務(wù)rope_scaling采用 YaRN 方案從原始 4096 位置以 64 倍因子外推到 262144256K并配合yarn_get_mscale的注意力縮放校正避免外推時注意力分數(shù)失真。mHC給 40 層 × 64 專家加裝信息高速公路mHCmulti-head HyperConnection是倉庫中最獨特、也最容易被忽略的模塊。在Xing4_0Model.forward中輸入一開始就被復制成 4 條并行流hidden_states inputs_embeds.unsqueeze(2).expand(-1, -1, self.config.hc_mult, -1).contiguous()hc_mult4意味著整個 40 層網(wǎng)絡(luò)內(nèi)部并行維護4 條 hidden stream。每個Xing4_0DecoderLayer在注意力與 FFN 前后各掛一組Xing4_0HyperConnection權(quán)重名attn_hc/ffn_hc見 model.safetensors.index.json由它決定四條流如何混合pre/postsigmoid 門控分別控制流入注意力的信號與放大系數(shù)comb一個 4×4 的混合矩陣經(jīng)20 次 Sinkhorn 迭代歸一化為近似雙隨機矩陣代碼中hc_sinkhorn_iters20負責跨流的信息再分配輸入流經(jīng)collapsed (pre * streams).sum()合并后進入注意力/FFN輸出再按post * output comb * hidden_states回寫各流。相比傳統(tǒng)殘差連接mHC 把單線殘差升級為可學習的多流混合網(wǎng)絡(luò)深層網(wǎng)絡(luò)的信息不僅沿主干流動還能在四條并行流之間按 token 動態(tài)調(diào)配。對 MoE 這種40 層 × 每層 64 專家的寬深結(jié)構(gòu)而言這種顯式的信息旁路有效緩解了深層堆疊的梯度衰減與路由不穩(wěn)定問題。README 中提及的訓練吞吐相對開箱即用提升約 96%正是圍繞 mHC 的算子融合、細粒度 MoE 通信優(yōu)化等一系列昇騰側(cè)聯(lián)合優(yōu)化的結(jié)果。MTP藏在第 40 層的額外監(jiān)督與解碼加速器MTPMulti-Token Prediction在配置里只占一行num_nextn_predict_layers: 1但它的物理存在感很強——model.safetensors.index.json 里赫然出現(xiàn)了model.layers.40.*的整組權(quán)重eh_proj、enorm、hnorm、embed_tokens以及完整的mlp.experts結(jié)構(gòu)。這是一個獨立的第 40 層MTP 模塊與主干 40 層并列。而 modeling_xing4_0.py 中這一行說明了一切_keys_to_ignore_on_load_unexpected [rmodel\.layers\.40.*]即Transformers 推理路徑默認不執(zhí)行 MTP 模塊它的權(quán)重只為訓練保留。原理上MTP 層以當前 token 的 hidden state 為輸入借助相鄰 token 的 embedding 預測下一個位置之外的更多未來 token——本質(zhì)是給主干語言建模頭增加一條并行的多步預測監(jiān)督信號在訓練階段提升樣本效率與 token 級表示質(zhì)量推理階段這條旁路又可被投機解碼speculative decoding類框架利用用一次前向換來多個候選 token 的驗證顯著攤薄自回歸解碼的延遲。社區(qū)實測報道中兼容 vLLM、SGLang、KTransformers 推理的說法與這份 MTP 權(quán)重的存在互相印證。三件套如何收斂于Agent把 MLA、mHC、MTP 拼起來看會發(fā)現(xiàn)每一環(huán)都精準對應(yīng) Agent 場景的痛點MLA 解決多輪工具調(diào)用下 KV cache 的爆炸式增長mHC 保證長程推理鏈路的穩(wěn)定MTP 壓低逐 token 自回歸的開銷。而真正把它們擰在一起的是倉庫里一套完整的 Agent 協(xié)議實現(xiàn)。chat_template.jinja 定義了完整的工具調(diào)用范式tool_callparam_key/param_value的結(jié)構(gòu)化函數(shù)調(diào)用格式、tool_response/_observation的觀察回填、以及think//think推理鏈標記可通過enable_thinking開關(guān)按場景裁剪。對應(yīng)的特殊 token 在 tokenizer_config.json 中一一注冊。這份模板意味著模型在訓練時就是帶著工具在思考的而不是部署后硬套一層函數(shù)調(diào)用 JSON。評測結(jié)果也驗證了這套架構(gòu)的方向。README 的 Benchmark 表中Xing4.0-29B-A4B 在 SWE-bench Verified 拿到 75.00Gemma4-26B-A4B 為 53.00、Qwen3.6-35B-A3B 為 76.00、Terminal-Bench 2.1 拿到 57.50兩者分別為 30.00 / 51.50、Claw-Eval 76.55、DeepresearchBII 60.80——在 Agent 專項上以 4B 激活參數(shù)對飆甚至反超同量級對手。社區(qū)報道亦提到其 SuperCLUE 智能體評測得分 93.52。推理側(cè)README 給出的推薦參數(shù)也按場景區(qū)分復雜推理用 temperature 1.0coding/agent 任務(wù)降到 0.8 以壓制發(fā)散。再往外看這并非一個只能在昇騰上運行的孤島模型訓練端基于昇騰 910C 與 MindSpore/MindFormers 原生完成沐曦股份也已基于自研 MXMACA 軟件棧完成 Day 0 適配推理端兼容 vLLM、SGLang、KTransformers并對接 OpenCode、Claude Code、OpenClaw、Hermes 等 Agent 框架。一個國產(chǎn)算力訓練、多硬件部署、Agent 原生協(xié)議的閉環(huán)才是 mHCMLAMTP 這套組合的真正落點。回到標題的問題mHC、MLA、MTP 是什么它們不是營銷縮寫而是三份可逐行驗證的源碼設(shè)計——MLA 管放得下KV 壓縮mHC 管學得穩(wěn)多流超連接MTP 管跑得快多 token 預測。三者疊加在一個 29B/4B 激活的稀疏模型上最終服務(wù)的是同一個目標讓百億參數(shù)的 Agent 模型跑進消費級顯卡也跑進真實的生產(chǎn)鏈路?!久赓M下載鏈接】Xing4.0-29B-A4BXing4.0-29B-A4B 是中電信人工智能科技有限公司研發(fā)的星辰語義大模型系列原 TeleChat新一代模型。模型總參數(shù)量 29B激活參數(shù)僅 4B原生支持 256K 上下文可擴展至 512K是國內(nèi)首個基于國產(chǎn)算力與國產(chǎn)框架完成訓練、面向復雜工程任務(wù)深度優(yōu)化的百億參數(shù)大模型。項目地址: https://ai.gitcode.com/XingChen-AGI/Xing4.0-29B-A4B創(chuàng)作聲明:本文部分內(nèi)容由AI輔助生成(AIGC),僅供參考