
數據不出設備的「端側夢」Edge0 的隱私賬到底怎么算【免費下載鏈接】Edge0-35B-A3B-preview項目地址: https://ai.gitcode.com/hf_mirrors/Edge0/Edge0-35B-A3B-preview2026 年 9 月無界方舟開源了 Edge0 流式 MoE 推理框架首發(fā) 35B 與 8B 兩個預覽檔位配套的 README.md 寫著一行極具傳播力的標語Runs in phone-class memory——35B 級模型峰值活躍內存不到 3 GiB解碼 15 tok/s4-bit 量化后平均僅損失 3.9 分。隨后 Edge0-35B 登頂 Hugging Face Trending 榜社區(qū)跟進文章密集出現「3GB 內存跑 35B MoE 模型」「iPhone 也能跑 35B 大模型」。在這些技術興奮點背后藏著一個被順帶消費的敘事——本地推理 數據不出設備 隱私安全。本文不打算復述 Edge0 有多快而是把隱私當作一本賬來算本地推理到底承諾了什么、沒承諾什么SSD 流式加載與磁盤緩存引入了哪些新的風險面離線與低成本優(yōu)勢的另一面是什么以及數據不出設備這句口號里哪些是工程事實哪些只是營銷成分。「數據不出設備」這句話精確地說只承諾了一件事先看 Edge0 的工程事實。倉庫中模型文件的實際構成是四個基礎權重分片model-00001 至 model-00004-of-00004.safetensors合計約 19.5GB外加 lora_edge0_35b.safetensors約 42MB與 prerouter_edge0_35b.safetensors約 138MB兩個適配器全部與基礎權重同位存放model.safetensors.index.json 中登記的 total_size 約 20.4GB。README.md 對運行方式的描述是完整 4-bit 權重留在存儲上專家按需流式加載內存中只有活躍權重——no sharding and no upfront download of the weights into memory。也就是說推理時沒有一段用戶輸入會被拼裝進 HTTP 請求發(fā)往云端這是整個隱私敘事里最硬核、也最可驗證的一條提示詞的處理路徑完全在本地進程內完成與 Cloud API 的輸入必然出境有本質區(qū)別。但注意這句話的邊界——它承諾的是推理環(huán)節(jié)提示詞不出設備而不是設備從此不聯網。權重本身約 20GB必須先通過huggingface-cli download從遠端模型倉庫拉取到本地磁盤LoRA 與 prerouter 適配器也來自同一渠道。隱私賬的第一行就要寫清楚這是推理本地化不是全鏈路離線化。數據流的隱私核算要區(qū)分三個環(huán)節(jié)權重獲取云端→設備一次性、推理設備內、服務暴露設備→局域網/互聯網可選。Edge0 只對中間環(huán)節(jié)給出了強承諾。流式加載與磁盤緩存風險面沒有變小只是換了位置Edge0 的三板斧——SSD 專家卸載、prerouter 路由預判、Recover-LoRA——在 README.md 里有清晰的機制描述專家權重按路由結果按需從存儲流式讀取內存只保留活躍集合prerouter 是一個經過訓練的預測頭提前一步預測下一層的專家路由使讀盤與計算重疊解碼吞吐最多提升 59%Recover-LoRA 在凍結的 int4 基座上用蒸餾恢復量化損失。這三項技術解決的是內存墻本身不涉及用戶數據。但把它們放進隱私賬本會發(fā)現幾個此前少有人討論的風險面其一內存上限與 OS swap 的交界處。2.9 GiB 是短上下文下的峰值活躍內存README.md 的 Limitations 明確寫道Long contexts grow the KV cacheuse shorter contexts to keep peak memory at 3 GiB。當上下文變長、KV cache 膨脹疊加系統(tǒng)其他進程的內存競爭操作系統(tǒng)會啟動 swap。此時推理過程中的中間狀態(tài)含提示詞對應的激活與 KV 緩存可能被換入磁盤交換文件而這恰恰發(fā)生在數據不出設備最被信任的場景里——設備沒聯網但數據以另一種形式落盤了。對普通用戶這或許無害但對涉密環(huán)境這就把內存中處理悄悄變成了可能落盤而 README 的隱私敘述并未覆蓋這一層。其二磁盤上躺著的不只是權重。流式加載依賴本地存儲意味著模型文件長駐 SSD如果推理框架或宿主應用把對話歷史寫入日志或會話緩存那么模型文件 對話殘留會同時存在于磁盤。倉庫層面無法驗證運行時是否落盤日志這份鏡像只包含模型目錄不包含 edge0 運行時源碼但這恰恰是審計點開源的是模型與適配器運行時的數據留存策略需要使用者自行核驗。其三本地服務端口的暴露面。README 提供了edge0 serve --port 8085的 OpenAI 兼容 API 一鍵服務。本地推理與本地服務是兩回事一旦服務監(jiān)聽地址不限于 127.0.0.1提示詞就會以明文 HTTP 在局域網內流動此時不出設備的邊界已悄悄退到不出路由器。這是本地部署最常見的隱私泄漏姿勢也是數據不出設備敘事中最容易被誤解的工程細節(jié)。其四預取機制的隱私語義。社區(qū)實測文章提到 Edge0 還配合 N-Gram 預取與熱專家緩存來提升命中率。這類預取讀的是專家權重而非用戶內容隱私語義上是干凈的但它也讓運行時讀了磁盤的哪些區(qū)域變得不可見對安全審計而言是一個觀察盲區(qū)需要依賴運行時開源來彌合。離線可用與成本優(yōu)勢的另一面Edge0 的另一條賣點是免費、離線、低成本。社區(qū)橫評給出的數據是Mac mini M4 Pro 上峰值活躍內存 2.9 GiB、解碼 14.9–17.7 tok/s、預熱后 prefill 達 140 tok/siOS 端實測約 6.4 tok/s、峰值內存 4GB輕量檔 edge0-8b24 層、K8峰值內存壓到約 1.0 GiB解碼速度約為 35B 檔的 1.5 倍。這些數字說明用消費級設備跑大模型從實驗室變成了可交互體驗。但成本賬的另一面同樣具體存儲是硬門檻不是軟約束。35B 檔 4-bit 權重約 20GB且流式加載對存儲介質敏感——社區(qū)實測普遍強調需要 NVMe SSDSATA 與機械硬盤因帶寬不足會讓按需讀專家變成按秒卡頓。這意味著端側夢的實際成本清單里最便宜的反而不是模型而是那塊快速閃存。算力成本被轉移給電池與硬件壽命。云上按 token 計費消失后代價轉嫁為持續(xù)解碼功耗、散熱與 SSD 磨損。對手機、眼鏡、耳機這類形態(tài)6–15 tok/s 的交互體驗與待機時間的權衡是離線敘事很少展示的另一半。離線 ≠ 免維護。模型要升級、適配器要更換每一次更新都是一次新的云端下載。所謂永久免費離線在版本迭代的時間軸上并不成立。隱私敘事的營銷成分與真實邊界把上面所有條目匯總Edge0 的隱私賬可以結算成三筆入賬真實承諾推理階段提示詞不經過任何外部推理服務離線可運行意味著斷網不降級全部權重與適配器開源、可本地審計。對數據出境合規(guī)這一最現實的監(jiān)管關切本地推理確實提供了干凈的解法——數據駐留data residency在設備內成立。出賬被弱化的代價約 20GB 權重從云端拉取供應鏈環(huán)節(jié)存在模型被篡改或投毒的理論風險倉庫未提供強校驗說明運行時與適配器由廠商訓練并發(fā)布使用者需要信任其數據留存與遙測策略長上下文 內存壓力可能觸發(fā) swap 落盤serve模式的端口暴露與明文 HTTP 屬于部署層責任不寫進模型卡的隱私承諾。真正被營銷放大的部分把本地推理偷換為全面隱私是當前端側 AI 敘事的通病。事實上提示詞一旦輸入設備它的安全邊界就取決于設備本身——本地惡意軟件、共享設備的其他用戶、未加密的磁盤都能在數據不出設備的框架內合法地接觸這些數據。本地推理消除的是云端收集這一條攻擊面而不是隱私的全部它把風險從信任一個云服務商轉移成了信任自己的設備與供應鏈。這也是 Edge0 這類項目最值得肯定的一點它沒有把隱私寫成玄學而是把內存占用的物理上限做成了可測量、可復現的工程指標——3 GiB、15 tok/s、3.9 分每一個數字都在 README.md 的基準表里可查證。隱私賬的正確答案不是本地 絕對安全而是像這份 README 一樣把每一條承諾的邊界都寫清楚哪些數據在設備內、哪些數據曾經過網絡、哪些行為會把數據重新放到磁盤上。算清了這本賬端側夢才真正可信。【免費下載鏈接】Edge0-35B-A3B-preview項目地址: https://ai.gitcode.com/hf_mirrors/Edge0/Edge0-35B-A3B-preview創(chuàng)作聲明:本文部分內容由AI輔助生成(AIGC),僅供參考