率框架:從技術(shù)參數(shù)到財(cái)務(wù)模型的實(shí)戰(zhàn)指南)
1. 從算力狂熱到回報(bào)率拷問(wèn)一個(gè)投資框架的誕生背景過(guò)去兩年我身邊做投資的朋友分成了兩派。一派在2023年上半年沖進(jìn)算力租賃賽道張口閉口就是“卡就是印鈔機(jī)”另一派在2024年下半年開(kāi)始焦慮因?yàn)榘l(fā)現(xiàn)很多AI項(xiàng)目的收入曲線和算力投入曲線完全對(duì)不上。我自己從2022年底開(kāi)始系統(tǒng)性地跟蹤AI基礎(chǔ)設(shè)施投資踩過(guò)坑也吃過(guò)肉最大的體會(huì)是AI投資正在從“算力軍備競(jìng)賽”切換到“回報(bào)率驗(yàn)證”階段而市面上缺少一套能把技術(shù)參數(shù)翻譯成財(cái)務(wù)語(yǔ)言的中間框架。這個(gè)框架要解決的核心問(wèn)題很具體當(dāng)一個(gè)AI項(xiàng)目擺在你面前它說(shuō)要買(mǎi)多少?gòu)埧?、建多大集群、用多高的精度?xùn)練你怎么判斷這筆錢(qián)砸下去能不能收回來(lái)算力不是抽象概念它對(duì)應(yīng)著具體的電費(fèi)、折舊、運(yùn)維人力和機(jī)會(huì)成本。我見(jiàn)過(guò)太多BP把“算力規(guī)?!碑?dāng)成核心競(jìng)爭(zhēng)力來(lái)寫(xiě)但一問(wèn)到“每PetaFLOP-day的產(chǎn)出是多少”“推理毛利率能不能覆蓋折舊”就含糊其辭。這套框架適合三類(lèi)人一是看AI賽道的投資人需要把技術(shù)敘事拆解成可驗(yàn)證的財(cái)務(wù)模型二是AI創(chuàng)業(yè)公司的技術(shù)負(fù)責(zé)人需要向董事會(huì)解釋算力預(yù)算的合理性三是傳統(tǒng)行業(yè)里負(fù)責(zé)數(shù)字化轉(zhuǎn)型的管理者需要判斷供應(yīng)商報(bào)出的算力方案是否虛高。不管你是哪一類(lèi)核心邏輯是一致的算力是成本項(xiàng)不是收入項(xiàng)只有能轉(zhuǎn)化為可計(jì)費(fèi)產(chǎn)出的算力才有投資價(jià)值。我把它拆成四個(gè)模塊算力需求評(píng)估、算力成本結(jié)構(gòu)、回報(bào)率測(cè)算、風(fēng)險(xiǎn)排查。每個(gè)模塊都有具體的參數(shù)和計(jì)算路徑不是拍腦袋的定性判斷。下面我按實(shí)操順序展開(kāi)中間會(huì)穿插我實(shí)際做過(guò)的案例和踩過(guò)的坑。2. 算力需求評(píng)估從模型參數(shù)量到實(shí)際集群規(guī)模2.1 精度選擇如何直接影響算力賬單很多人一上來(lái)就問(wèn)“訓(xùn)練一個(gè)大模型要多少算力”這個(gè)問(wèn)題沒(méi)法直接回答因?yàn)榫雀袷經(jīng)Q定了算力需求的基數(shù)。我用一個(gè)具體例子來(lái)說(shuō)明假設(shè)你要訓(xùn)練一個(gè)130億參數(shù)的模型訓(xùn)練token量是2萬(wàn)億不同精度下的顯存占用和算力需求差異巨大。先看顯存。模型參數(shù)本身占用的顯存等于參數(shù)量乘以每個(gè)參數(shù)的字節(jié)數(shù)。FP32下每個(gè)參數(shù)4字節(jié)130億參數(shù)就是52GBFP16下每個(gè)參數(shù)2字節(jié)就是26GBINT8下每個(gè)參數(shù)1字節(jié)就是13GB。但這只是權(quán)重訓(xùn)練時(shí)還有優(yōu)化器狀態(tài)、梯度、激活值。以Adam優(yōu)化器為例FP32訓(xùn)練時(shí)優(yōu)化器狀態(tài)需要參數(shù)量乘以8字節(jié)一階矩和二階矩各4字節(jié)梯度需要參數(shù)量乘以4字節(jié)加起來(lái)每個(gè)參數(shù)額外12字節(jié)。所以130億參數(shù)在FP32下光是權(quán)重優(yōu)化器梯度就是130億乘以16字節(jié)約208GB。這還沒(méi)算激活值實(shí)際訓(xùn)練時(shí)激活值可能再占幾十到上百GB。這就是為什么現(xiàn)在主流訓(xùn)練都用混合精度前向和反向傳播用FP16或BF16優(yōu)化器更新用FP32。這樣權(quán)重和激活值用2字節(jié)優(yōu)化器狀態(tài)用4字節(jié)梯度用2字節(jié)每個(gè)參數(shù)約8字節(jié)130億參數(shù)約104GB。如果再用上ZeRO零冗余優(yōu)化器做分片把優(yōu)化器狀態(tài)和梯度切分到多張卡上單卡顯存壓力就能降到可接受范圍。INT8在訓(xùn)練中很少用因?yàn)榱炕`差會(huì)嚴(yán)重影響收斂但在推理場(chǎng)景下INT8是主流。推理時(shí)不需要優(yōu)化器狀態(tài)和梯度只需要權(quán)重和激活值。INT8推理下130億參數(shù)模型權(quán)重占13GB加上激活值和KV Cache一張24GB顯存的卡就能跑起來(lái)。FP16推理則需要26GB權(quán)重至少兩張24GB卡或者一張48GB卡。注意精度選擇不是“越高越好”而是“夠用就好”。FP64在AI訓(xùn)練中幾乎用不到那是科學(xué)計(jì)算領(lǐng)域的。FP32適合小模型或者對(duì)數(shù)值穩(wěn)定性要求極高的場(chǎng)景FP16/BF16是當(dāng)前訓(xùn)練標(biāo)配INT8/INT4是推理降本的關(guān)鍵手段。2.2 從參數(shù)量到算力需求的換算路徑顯存只是門(mén)檻真正決定訓(xùn)練時(shí)間的是浮點(diǎn)運(yùn)算次數(shù)。業(yè)界有個(gè)經(jīng)驗(yàn)公式訓(xùn)練算力需求約等于6乘以參數(shù)量乘以訓(xùn)練token數(shù)。這個(gè)6的來(lái)歷是前向傳播一次矩陣乘法是2倍參數(shù)量乘以token數(shù)乘加各算一次反向傳播是前向的兩倍所以總共約6倍。拿130億參數(shù)、2萬(wàn)億token來(lái)算6乘以130億乘以2萬(wàn)億等于1.56乘以10的24次方FLOPs。這個(gè)數(shù)字很大我們換算成更直觀的單位。一張H100的FP16算力不算稀疏性大約是989 TFLOPS也就是每秒約10的15次方次浮點(diǎn)運(yùn)算。1.56乘以10的24次方除以10的15次方得到1.56乘以10的9次方秒約等于18000天。一張卡要跑49年顯然不現(xiàn)實(shí)。所以需要集群。如果用1000張H100理想情況下18天能跑完。但實(shí)際不可能達(dá)到100%利用率通信開(kāi)銷(xiāo)、數(shù)據(jù)加載、檢查點(diǎn)保存都會(huì)吃掉時(shí)間。我實(shí)測(cè)下來(lái)大規(guī)模訓(xùn)練的有效算力利用率通常在30%到50%之間。按40%算1000張H100需要45天左右。這就是為什么大模型訓(xùn)練動(dòng)輒幾個(gè)月而且集群規(guī)模直接決定了你能在多短時(shí)間內(nèi)迭代一次。這里有個(gè)關(guān)鍵參數(shù)叫MFU模型浮點(diǎn)運(yùn)算利用率等于實(shí)際達(dá)到的FLOPs除以理論峰值FLOPs。MFU超過(guò)50%就算非常優(yōu)秀了很多團(tuán)隊(duì)只能做到30%出頭。MFU低的原因包括通信瓶頸尤其是跨節(jié)點(diǎn)All-Reduce、顯存帶寬限制、流水線氣泡、數(shù)據(jù)預(yù)處理跟不上。評(píng)估一個(gè)團(tuán)隊(duì)的訓(xùn)練能力不要只看他們有多少卡要問(wèn)他們的MFU是多少。2.3 推理場(chǎng)景的算力評(píng)估邏輯訓(xùn)練是一次性投入推理是持續(xù)性成本。推理的算力需求取決于三個(gè)變量請(qǐng)求量、每次請(qǐng)求的token數(shù)、模型大小。假設(shè)你有一個(gè)130億參數(shù)的模型每天處理100萬(wàn)次請(qǐng)求每次請(qǐng)求平均輸入500 token、輸出200 token。推理的算力消耗主要來(lái)自?xún)刹糠諴refill階段處理輸入和Decode階段逐token生成輸出。Prefill階段的計(jì)算量約等于2乘以參數(shù)量乘以輸入token數(shù)Decode階段每生成一個(gè)token需要2乘以參數(shù)量次運(yùn)算。所以每次請(qǐng)求的總FLOPs約等于2乘以130億乘以500200等于1.82乘以10的13次方FLOPs。100萬(wàn)次請(qǐng)求就是1.82乘以10的19次方FLOPs。一張H100在INT8推理下的算力約2000 TOPS每秒萬(wàn)億次操作考慮50%利用率每秒能處理10的15次方次操作。1.82乘以10的19次方除以10的15次方等于18200秒約5小時(shí)。也就是說(shuō)一張H100理論上5小時(shí)能處理完100萬(wàn)次請(qǐng)求平均每天只需要0.2張卡。但實(shí)際要考慮峰值并發(fā)不能按平均值配置通常要留3到5倍余量。實(shí)操心得推理算力評(píng)估最容易犯的錯(cuò)誤是只看平均值。我見(jiàn)過(guò)一個(gè)項(xiàng)目按日均請(qǐng)求量配了卡結(jié)果晚上流量高峰時(shí)排隊(duì)嚴(yán)重用戶(hù)體驗(yàn)崩了。正確做法是看P99峰值并發(fā)按峰值配置閑時(shí)用彈性伸縮降本。3. 算力成本結(jié)構(gòu)把技術(shù)參數(shù)翻譯成財(cái)務(wù)語(yǔ)言3.1 自建集群與租用算力的成本對(duì)比算力獲取方式主要有三種自建集群、租用云算力、混合模式。每種方式的成本結(jié)構(gòu)完全不同不能簡(jiǎn)單比單價(jià)。自建集群的成本包括硬件采購(gòu)GPU服務(wù)器、網(wǎng)絡(luò)設(shè)備、存儲(chǔ)、機(jī)房改造供電、制冷、承重、電費(fèi)、運(yùn)維人力、軟件授權(quán)、折舊。以1000張H100為例單張H100服務(wù)器含8卡市場(chǎng)價(jià)約300萬(wàn)人民幣1000張卡約125臺(tái)服務(wù)器硬件采購(gòu)約3.75億。機(jī)房改造按每千瓦1萬(wàn)元算1000張H100功耗約700千瓦加上制冷和網(wǎng)絡(luò)總功耗約1000千瓦改造費(fèi)用約1000萬(wàn)。電費(fèi)按每度0.8元、每天滿(mǎn)載20小時(shí)算每天電費(fèi)約1.6萬(wàn)一年約584萬(wàn)。運(yùn)維團(tuán)隊(duì)至少5人人均年薪50萬(wàn)一年250萬(wàn)。折舊按3年直線折舊每年約1.25億。租用云算力的成本相對(duì)簡(jiǎn)單按卡時(shí)計(jì)費(fèi)。H100的市場(chǎng)租用價(jià)格波動(dòng)很大2023年高峰期每小時(shí)30到40元2024年回落到20到25元。按每小時(shí)25元算1000張卡租一年按每天20小時(shí)有效使用約1.8億。表面看租用比自建貴但自建有大量隱性成本和資金占用。這里有個(gè)關(guān)鍵決策點(diǎn)如果你的算力利用率低于50%租用幾乎總是更劃算。因?yàn)樽越洪e置時(shí)也在折舊和耗電而租用可以隨用隨停。我?guī)鸵粋€(gè)團(tuán)隊(duì)算過(guò)賬他們訓(xùn)練任務(wù)不連續(xù)平均利用率只有35%自建三年總成本約4.5億租用同樣算力三年約3.2億租用省了1.3億。但如果利用率能到70%以上自建在第二年就開(kāi)始有成本優(yōu)勢(shì)。3.2 算力集群的架構(gòu)選擇與成本影響算力集群的架構(gòu)直接影響通信效率和成本。當(dāng)前主流架構(gòu)有三種胖樹(shù)架構(gòu)、軌道優(yōu)化架構(gòu)、蜻蜓架構(gòu)。胖樹(shù)架構(gòu)是最常見(jiàn)的核心交換機(jī)和匯聚交換機(jī)分層連接任意兩個(gè)節(jié)點(diǎn)之間的通信跳數(shù)相同。優(yōu)點(diǎn)是延遲可預(yù)測(cè)適合All-Reduce密集的訓(xùn)練任務(wù)。缺點(diǎn)是核心交換機(jī)端口數(shù)量限制了集群規(guī)模擴(kuò)展成本高。一個(gè)支持1000張卡的胖樹(shù)集群網(wǎng)絡(luò)設(shè)備成本約占總硬件成本的15%到20%。軌道優(yōu)化架構(gòu)把同一軌道內(nèi)的節(jié)點(diǎn)用高速鏈路連接跨軌道通信走上層交換機(jī)。這種架構(gòu)適合混合并行策略因?yàn)橥卉壍纼?nèi)的通信可以走高速鏈路。但軌道間通信可能成為瓶頸需要精心設(shè)計(jì)并行策略來(lái)減少跨軌道通信。蜻蜓架構(gòu)用高維超立方體拓?fù)鋽U(kuò)展性好但布線復(fù)雜對(duì)運(yùn)維要求高。我見(jiàn)過(guò)一個(gè)團(tuán)隊(duì)用蜻蜓架構(gòu)搭了2000卡集群結(jié)果因?yàn)楣饽K故障率偏高實(shí)際可用性只有85%訓(xùn)練任務(wù)經(jīng)常中斷。注意網(wǎng)絡(luò)成本容易被低估。1000卡集群的網(wǎng)絡(luò)設(shè)備交換機(jī)、光模塊、線纜成本可能占到總硬件成本的20%到30%。而且網(wǎng)絡(luò)故障是訓(xùn)練中斷的首要原因選架構(gòu)時(shí)要把可靠性和可維護(hù)性放在擴(kuò)展性前面。3.3 電力與制冷被忽視的成本大頭算力集群的電力成本包括兩部分IT設(shè)備耗電和制冷耗電。PUE電能利用效率等于總耗電除以IT設(shè)備耗電。先進(jìn)數(shù)據(jù)中心PUE可以做到1.1到1.2普通機(jī)房可能到1.5甚至更高。1000張H100的IT設(shè)備功耗約700千瓦如果PUE是1.2總功耗就是840千瓦。一年電費(fèi)按0.8元每度算約588萬(wàn)。如果PUE是1.5總功耗1050千瓦一年電費(fèi)735萬(wàn)多出147萬(wàn)。所以機(jī)房選址和制冷方案對(duì)長(zhǎng)期成本影響很大。制冷方案主要有風(fēng)冷和液冷。風(fēng)冷改造成本低但散熱效率有限適合功率密度較低的集群。液冷散熱效率高支持更高功率密度但改造成本高。冷板式液冷每千瓦改造成本約5000到8000元浸沒(méi)式液冷更高。對(duì)于1000卡以上的集群液冷通常是更優(yōu)選擇因?yàn)榭梢越档蚉UE到1.1左右長(zhǎng)期電費(fèi)節(jié)省能覆蓋改造成本。我個(gè)人的經(jīng)驗(yàn)是如果電價(jià)高于0.6元每度液冷的投資回收期通常在2年以?xún)?nèi)。如果電價(jià)低于0.4元風(fēng)冷可能更經(jīng)濟(jì)。選址時(shí)優(yōu)先考慮電價(jià)低、氣候涼爽的地區(qū)比如西北和華北部分地區(qū)。4. 回報(bào)率測(cè)算從算力投入到可計(jì)費(fèi)產(chǎn)出4.1 訓(xùn)練項(xiàng)目的回報(bào)率測(cè)算框架訓(xùn)練項(xiàng)目的回報(bào)率測(cè)算比推理復(fù)雜因?yàn)橛?xùn)練本身不直接產(chǎn)生收入它產(chǎn)出的是模型能力模型能力再通過(guò)推理服務(wù)變現(xiàn)。所以訓(xùn)練項(xiàng)目的回報(bào)率要分兩步算先算模型能力提升帶來(lái)的收入增量再算訓(xùn)練成本。假設(shè)你有一個(gè)基礎(chǔ)模型當(dāng)前在某個(gè)任務(wù)上的準(zhǔn)確率是80%你計(jì)劃用1000張H100訓(xùn)練一個(gè)月預(yù)期準(zhǔn)確率提升到85%。這個(gè)5個(gè)百分點(diǎn)的提升能帶來(lái)多少收入取決于你的商業(yè)模式。如果是API調(diào)用準(zhǔn)確率提升可能帶來(lái)調(diào)用量增長(zhǎng)如果是垂直場(chǎng)景解決方案準(zhǔn)確率提升可能帶來(lái)客單價(jià)提升或客戶(hù)留存率提升。我做過(guò)一個(gè)案例一個(gè)法律文書(shū)生成模型準(zhǔn)確率從82%提升到88%后客戶(hù)續(xù)費(fèi)率從65%提升到80%客單價(jià)從每年10萬(wàn)提升到15萬(wàn)。假設(shè)有100個(gè)客戶(hù)收入增量等于100乘以15萬(wàn)乘以80%減去10萬(wàn)乘以65%等于100乘以12萬(wàn)減去6.5萬(wàn)等于550萬(wàn)。訓(xùn)練成本按1000張H100一個(gè)月算租用成本約1000乘以25乘以24乘以30等于1800萬(wàn)。單看這個(gè)項(xiàng)目收入增量覆蓋不了訓(xùn)練成本。但這里有個(gè)關(guān)鍵模型能力提升往往有復(fù)用性。同一個(gè)模型可以服務(wù)多個(gè)場(chǎng)景收入增量要按所有場(chǎng)景匯總。而且模型能力提升后推理成本可能下降比如可以用更小的模型達(dá)到同樣效果這部分節(jié)省也要算進(jìn)去。所以訓(xùn)練項(xiàng)目的回報(bào)率測(cè)算不能只看單個(gè)場(chǎng)景要看模型能力的整體價(jià)值。4.2 推理服務(wù)的單位經(jīng)濟(jì)模型推理服務(wù)的單位經(jīng)濟(jì)模型相對(duì)清晰每千token收入減去每千token成本。收入端取決于定價(jià)策略成本端包括算力折舊或租金、電費(fèi)、網(wǎng)絡(luò)帶寬、運(yùn)維分?jǐn)?。?30億參數(shù)模型、INT8推理為例。一張H100每小時(shí)能處理約200萬(wàn)token考慮50%利用率和批處理優(yōu)化租用成本每小時(shí)25元每百萬(wàn)token算力成本約12.5元。加上電費(fèi)、網(wǎng)絡(luò)、運(yùn)維分?jǐn)偯堪偃f(wàn)token總成本約18元。如果定價(jià)是每百萬(wàn)token 30元毛利率40%。如果定價(jià)是每百萬(wàn)token 20元毛利率只有10%稍微有點(diǎn)波動(dòng)就虧損。這里的關(guān)鍵變量是批處理大小。批處理越大GPU利用率越高單位token成本越低。但批處理太大會(huì)增加延遲影響用戶(hù)體驗(yàn)。我實(shí)測(cè)下來(lái)對(duì)于交互式應(yīng)用批處理大小在8到16之間比較平衡對(duì)于離線批量處理可以開(kāi)到64甚至128。實(shí)操心得推理服務(wù)的毛利率對(duì)算力利用率極其敏感。利用率從50%提升到70%單位成本能降30%左右。所以推理服務(wù)要盡量把流量集中到少數(shù)幾張卡上而不是分散到很多卡上。我見(jiàn)過(guò)一個(gè)團(tuán)隊(duì)為了“高可用”把流量分散到10張卡上結(jié)果每張卡利用率都不到20%毛利率慘不忍睹。4.3 算力投資回報(bào)率的核心公式與參數(shù)把上面這些串起來(lái)算力投資回報(bào)率的核心公式是ROI 推理收入 模型能力增量收入 - 算力總成本 - 其他運(yùn)營(yíng)成本/ 算力總成本其中算力總成本包括硬件折舊或租金、電費(fèi)、制冷分?jǐn)?、網(wǎng)絡(luò)成本、運(yùn)維人力、軟件授權(quán)。其他運(yùn)營(yíng)成本包括數(shù)據(jù)標(biāo)注、模型評(píng)估、市場(chǎng)推廣、銷(xiāo)售人力。每個(gè)參數(shù)都需要有依據(jù)不能拍腦袋。硬件折舊按3年直線折舊殘值率5%到10%。電費(fèi)按實(shí)際PUE和當(dāng)?shù)仉妰r(jià)算。運(yùn)維人力按集群規(guī)模配通常每1000卡配5到8人。數(shù)據(jù)標(biāo)注成本按標(biāo)注量和單價(jià)算模型評(píng)估成本按評(píng)估次數(shù)和每次成本算。我建議做一個(gè)敏感性分析表把關(guān)鍵參數(shù)上下浮動(dòng)20%看ROI的變化范圍。如果ROI在悲觀情景下仍然為正這個(gè)投資就比較安全如果在樂(lè)觀情景下才為正風(fēng)險(xiǎn)就很高。參數(shù)悲觀情景基準(zhǔn)情景樂(lè)觀情景算力利用率30%50%70%每百萬(wàn)token收入20元30元40元電費(fèi)元/度1.00.80.5硬件折舊年限2年3年4年ROI-15%25%60%這張表是我實(shí)際做項(xiàng)目時(shí)用的模板每次評(píng)估新項(xiàng)目都會(huì)填一遍。如果悲觀情景下ROI為負(fù)就要慎重考慮如果基準(zhǔn)情景下ROI低于20%說(shuō)明這個(gè)項(xiàng)目抗風(fēng)險(xiǎn)能力弱。5. 常見(jiàn)問(wèn)題與排查技巧實(shí)錄5.1 算力需求評(píng)估中的典型誤判誤判一按理論峰值算算力需求忽略實(shí)際利用率。我見(jiàn)過(guò)一個(gè)BP寫(xiě)“1000張H100峰值算力989 PFLOPS訓(xùn)練130億模型只需XX天”完全沒(méi)考慮MFU。實(shí)際MFU可能只有30%訓(xùn)練時(shí)間是理論值的3倍多。評(píng)估時(shí)要問(wèn)清楚MFU假設(shè)最好要求提供歷史訓(xùn)練任務(wù)的MFU數(shù)據(jù)。誤判二把顯存需求當(dāng)成算力需求。顯存決定能不能跑起來(lái)算力決定跑多快。兩個(gè)模型可能顯存需求差不多但算力需求差幾倍。評(píng)估時(shí)要分開(kāi)算先算顯存能不能裝下再算算力需要多少卡時(shí)。誤判三忽略推理的峰值并發(fā)。按日均請(qǐng)求量配卡晚上高峰時(shí)排隊(duì)。正確做法是按P99峰值并發(fā)配卡閑時(shí)用彈性伸縮。彈性伸縮的響應(yīng)時(shí)間也要考慮如果擴(kuò)容需要5分鐘那這5分鐘內(nèi)的請(qǐng)求要么排隊(duì)要么丟棄。誤判四低估網(wǎng)絡(luò)和存儲(chǔ)成本。算力集群不只是GPU網(wǎng)絡(luò)設(shè)備和存儲(chǔ)系統(tǒng)可能占總成本的30%以上。評(píng)估時(shí)要問(wèn)清楚網(wǎng)絡(luò)架構(gòu)、存儲(chǔ)方案、帶寬需求。5.2 回報(bào)率測(cè)算中的常見(jiàn)陷阱陷阱一把收入增長(zhǎng)全部歸因于算力投入。收入增長(zhǎng)可能來(lái)自市場(chǎng)推廣、銷(xiāo)售團(tuán)隊(duì)擴(kuò)張、產(chǎn)品體驗(yàn)優(yōu)化不全是算力的功勞。做回報(bào)率測(cè)算時(shí)要?jiǎng)冸x其他因素的影響或者至少做歸因分析。陷阱二忽略競(jìng)爭(zhēng)導(dǎo)致的降價(jià)壓力。AI推理服務(wù)的價(jià)格在過(guò)去一年下降了50%以上未來(lái)可能繼續(xù)下降。測(cè)算時(shí)要考慮價(jià)格年降幅保守一點(diǎn)按每年降20%到30%算。陷阱三低估運(yùn)維復(fù)雜度和人力成本。大規(guī)模集群的運(yùn)維不是幾個(gè)腳本就能搞定的需要專(zhuān)業(yè)的SRE團(tuán)隊(duì)、監(jiān)控系統(tǒng)、故障排查流程。我見(jiàn)過(guò)一個(gè)團(tuán)隊(duì)自建了500卡集群結(jié)果因?yàn)檫\(yùn)維跟不上實(shí)際可用性只有70%算力成本變相增加了40%。陷阱四把一次性收入當(dāng)成持續(xù)性收入。有些AI項(xiàng)目是項(xiàng)目制交付收入是一次性的但算力成本是持續(xù)性的。這種項(xiàng)目的回報(bào)率測(cè)算要特別小心確保一次性收入能覆蓋整個(gè)項(xiàng)目周期的算力成本。5.3 算力投資決策的檢查清單每次評(píng)估算力投資項(xiàng)目我都會(huì)過(guò)一遍這個(gè)清單算力需求是否按實(shí)際MFU折算MFU假設(shè)是否有歷史數(shù)據(jù)支撐顯存需求是否算上了優(yōu)化器狀態(tài)、梯度、激活值是否用了混合精度和ZeRO推理算力是否按P99峰值并發(fā)配置彈性伸縮策略是否明確自建還是租用利用率是否超過(guò)50%資金成本是否算進(jìn)去了網(wǎng)絡(luò)架構(gòu)是否匹配并行策略網(wǎng)絡(luò)成本占比是否合理PUE是多少電價(jià)是多少制冷方案是否經(jīng)濟(jì)收入預(yù)測(cè)是否剝離了非算力因素是否考慮了價(jià)格年降運(yùn)維人力是否配足可用性目標(biāo)是否現(xiàn)實(shí)敏感性分析是否做了悲觀情景下ROI是否為正這個(gè)清單我用了兩年多幫我避開(kāi)了至少三個(gè)坑。有一次一個(gè)項(xiàng)目看起來(lái)回報(bào)率很高過(guò)完清單發(fā)現(xiàn)他們按100%利用率算的實(shí)際歷史利用率只有40%重算后ROI從35%降到8%果斷放棄。5.4 算力集群架構(gòu)選擇的實(shí)操建議如果你決定自建集群架構(gòu)選擇有幾個(gè)實(shí)操建議第一先確定并行策略再選架構(gòu)。數(shù)據(jù)并行、流水線并行、張量并行的通信模式不同對(duì)網(wǎng)絡(luò)的要求也不同。數(shù)據(jù)并行需要高帶寬All-Reduce流水線并行需要低延遲點(diǎn)對(duì)點(diǎn)通信張量并行需要極高帶寬和極低延遲。先確定主要用哪種并行策略再選匹配的網(wǎng)絡(luò)架構(gòu)。第二網(wǎng)絡(luò)設(shè)備不要省錢(qián)。網(wǎng)絡(luò)故障是訓(xùn)練中斷的首要原因而且排查困難。我建議網(wǎng)絡(luò)設(shè)備預(yù)算占總硬件預(yù)算的20%以上選擇成熟穩(wěn)定的品牌和型號(hào)。光模塊要買(mǎi)原廠的兼容模塊雖然便宜但故障率高。第三存儲(chǔ)系統(tǒng)要分層。訓(xùn)練數(shù)據(jù)量大全部放高速存儲(chǔ)成本太高。建議用分層存儲(chǔ)熱數(shù)據(jù)放NVMe SSD溫?cái)?shù)據(jù)放SATA SSD冷數(shù)據(jù)放HDD或?qū)ο蟠鎯?chǔ)。檢查點(diǎn)保存要快否則訓(xùn)練中斷后恢復(fù)時(shí)間長(zhǎng)。第四預(yù)留擴(kuò)展空間。機(jī)房供電、制冷、承重、網(wǎng)絡(luò)端口都要預(yù)留擴(kuò)展空間。我見(jiàn)過(guò)一個(gè)團(tuán)隊(duì)建了500卡集群想擴(kuò)展到1000卡時(shí)發(fā)現(xiàn)機(jī)房供電不夠改造花了半年錯(cuò)過(guò)了市場(chǎng)窗口。5.5 算力成本優(yōu)化的幾個(gè)實(shí)用技巧技巧一混合精度訓(xùn)練。FP16/BF16訓(xùn)練比FP32訓(xùn)練省一半顯存和算力而且收斂性通常沒(méi)問(wèn)題。BF16比FP16更穩(wěn)定推薦優(yōu)先用BF16。技巧二梯度累積。顯存不夠時(shí)可以用小batch加梯度累積模擬大batch。梯度累積步數(shù)等于目標(biāo)batch除以實(shí)際batch。這樣不增加顯存但訓(xùn)練時(shí)間會(huì)線性增加。技巧三檢查點(diǎn)優(yōu)化。檢查點(diǎn)保存頻率太高會(huì)拖慢訓(xùn)練太低則中斷后損失大。建議根據(jù)訓(xùn)練穩(wěn)定性和任務(wù)時(shí)長(zhǎng)平衡通常每幾小時(shí)保存一次。檢查點(diǎn)可以用異步保存不阻塞訓(xùn)練。技巧四推理批處理。推理時(shí)盡量批處理提高GPU利用率。但批處理大小要平衡延遲和吞吐交互式應(yīng)用批處理小一點(diǎn)離線應(yīng)用批處理大一點(diǎn)。技巧五彈性伸縮。推理服務(wù)用彈性伸縮閑時(shí)縮容降本忙時(shí)擴(kuò)容保體驗(yàn)。伸縮策略要基于實(shí)際流量模式不要拍腦袋設(shè)閾值。技巧六算力共享。如果多個(gè)團(tuán)隊(duì)共用集群可以用調(diào)度系統(tǒng)做算力共享提高整體利用率。但要做好隔離和優(yōu)先級(jí)管理避免互相影響。6. 一個(gè)完整的算力投資評(píng)估案例6.1 項(xiàng)目背景與算力需求測(cè)算去年我參與評(píng)估了一個(gè)AI客服項(xiàng)目。項(xiàng)目計(jì)劃訓(xùn)練一個(gè)70億參數(shù)的垂直領(lǐng)域模型用于替代人工客服。訓(xùn)練數(shù)據(jù)是500萬(wàn)條歷史客服對(duì)話訓(xùn)練token量約50億。推理場(chǎng)景是每天處理20萬(wàn)次用戶(hù)咨詢(xún)每次咨詢(xún)平均輸入300 token、輸出150 token。訓(xùn)練算力測(cè)算6乘以70億乘以50億等于2.1乘以10的21次方FLOPs。用100張H100訓(xùn)練理論時(shí)間等于2.1乘以10的21次方除以100乘以10的15次方等于2.1乘以10的4次方秒約5.8小時(shí)。按MFU 35%算實(shí)際約16.6小時(shí)。加上數(shù)據(jù)加載、檢查點(diǎn)、評(píng)估按2天算。租用100張H100兩天成本約100乘以25乘以24乘以2等于12萬(wàn)。推理算力測(cè)算每次請(qǐng)求FLOPs等于2乘以70億乘以300150等于6.3乘以10的12次方。20萬(wàn)次請(qǐng)求等于1.26乘以10的19次方FLOPs。一張H100 INT8推理算力2000 TOPS按50%利用率算每秒10的15次方次操作。1.26乘以10的19次方除以10的15次方等于12600秒約3.5小時(shí)??紤]峰值并發(fā)是平均值的3倍需要約10張H100。租用10張H100一個(gè)月成本約10乘以25乘以24乘以30等于18萬(wàn)。6.2 成本結(jié)構(gòu)與回報(bào)率測(cè)算訓(xùn)練成本12萬(wàn)推理成本每月18萬(wàn)。其他成本包括數(shù)據(jù)標(biāo)注和清洗約5萬(wàn)模型評(píng)估約2萬(wàn)運(yùn)維人力分?jǐn)偧s3萬(wàn)每月。首月總成本約40萬(wàn)后續(xù)每月約21萬(wàn)。收入端替代人工客服假設(shè)每個(gè)客服月薪6000元20萬(wàn)次咨詢(xún)需要約20個(gè)客服月人力成本12萬(wàn)。AI客服定價(jià)按每次咨詢(xún)0.5元算20萬(wàn)次收入10萬(wàn)。表面看AI客服收入10萬(wàn)低于人工成本12萬(wàn)但AI客服可以24小時(shí)服務(wù)且邊際成本低。如果咨詢(xún)量增長(zhǎng)到30萬(wàn)次人工需要30個(gè)客服成本18萬(wàn)AI客服收入15萬(wàn)成本增加很少。算力投資回報(bào)率首月投入40萬(wàn)后續(xù)每月收入10萬(wàn)減去成本21萬(wàn)虧損11萬(wàn)。但隨著咨詢(xún)量增長(zhǎng)和模型優(yōu)化推理成本會(huì)下降。假設(shè)6個(gè)月后咨詢(xún)量到50萬(wàn)次收入25萬(wàn)推理成本因批處理優(yōu)化降到每月25萬(wàn)其他成本5萬(wàn)月利潤(rùn)負(fù)5萬(wàn)。再優(yōu)化模型用更小的模型達(dá)到同樣效果推理成本降到15萬(wàn)月利潤(rùn)5萬(wàn)。累計(jì)12個(gè)月總投入約40萬(wàn)加11個(gè)月乘以20萬(wàn)等于260萬(wàn)總收入約12個(gè)月平均15萬(wàn)等于180萬(wàn)凈虧損80萬(wàn)。這個(gè)項(xiàng)目單看財(cái)務(wù)回報(bào)不理想但戰(zhàn)略?xún)r(jià)值在于積累垂直領(lǐng)域模型能力可以復(fù)用到其他客服場(chǎng)景數(shù)據(jù)資產(chǎn)可以用于訓(xùn)練更多模型AI客服可以提升響應(yīng)速度和一致性帶來(lái)隱性收益。所以最終決策是先小規(guī)模試點(diǎn)用租用算力驗(yàn)證效果如果效果好再擴(kuò)大。6.3 敏感性分析與決策建議對(duì)關(guān)鍵參數(shù)做敏感性分析參數(shù)悲觀基準(zhǔn)樂(lè)觀咨詢(xún)量月增長(zhǎng)5%15%30%每次咨詢(xún)定價(jià)0.3元0.5元0.8元推理成本月降幅5%10%20%12個(gè)月累計(jì)利潤(rùn)-180萬(wàn)-80萬(wàn)50萬(wàn)悲觀情景下虧損180萬(wàn)基準(zhǔn)情景虧損80萬(wàn)樂(lè)觀情景盈利50萬(wàn)。這個(gè)項(xiàng)目風(fēng)險(xiǎn)較高建議先租用算力做3個(gè)月試點(diǎn)投入控制在50萬(wàn)以?xún)?nèi)。如果3個(gè)月內(nèi)咨詢(xún)量月增長(zhǎng)超過(guò)20%且推理成本月降幅超過(guò)15%再考慮擴(kuò)大投入。這個(gè)案例的教訓(xùn)是算力投資不能只看技術(shù)可行性要看商業(yè)可行性。技術(shù)上行得通的項(xiàng)目商業(yè)上可能虧錢(qián)。評(píng)估時(shí)要算清楚賬不要被技術(shù)敘事帶偏。7. 算力投資的未來(lái)變量與應(yīng)對(duì)策略7.1 算力供給格局的變化趨勢(shì)算力供給正在從緊缺走向結(jié)構(gòu)性過(guò)剩。2023年一卡難求2024年很多算力租賃商開(kāi)始降價(jià)促銷(xiāo)。這個(gè)變化對(duì)投資決策的影響是自建集群的風(fēng)險(xiǎn)在上升租用算力的性?xún)r(jià)比在提升。因?yàn)槿绻懔┙o持續(xù)增加租用價(jià)格會(huì)繼續(xù)下降自建集群的折舊成本相對(duì)固定競(jìng)爭(zhēng)力會(huì)下降。另一個(gè)變化是推理算力需求超過(guò)訓(xùn)練算力需求。隨著大模型應(yīng)用落地推理算力占比越來(lái)越高。推理算力對(duì)集群架構(gòu)的要求和訓(xùn)練不同推理更看重低延遲和高吞吐對(duì)網(wǎng)絡(luò)帶寬要求相對(duì)低。這意味著現(xiàn)有訓(xùn)練集群可能不適合做推理需要單獨(dú)建設(shè)推理集群。應(yīng)對(duì)策略訓(xùn)練算力優(yōu)先租用保持靈活性推理算力可以根據(jù)流量穩(wěn)定性決定自建還是租用流量穩(wěn)定且規(guī)模大時(shí)自建更經(jīng)濟(jì)。7.2 模型效率提升對(duì)算力需求的影響模型效率在快速提升。同樣的任務(wù)2024年的模型可能比2023年的模型少用50%算力。MoE混合專(zhuān)家架構(gòu)、稀疏注意力、量化推理等技術(shù)都在降低算力需求。這對(duì)算力投資的影響是算力需求預(yù)測(cè)要留出效率提升的余量不能按當(dāng)前效率線性外推。我建議做算力規(guī)劃時(shí)按每年效率提升20%到30%來(lái)折算。也就是說(shuō)如果當(dāng)前需要1000張卡一年后同樣任務(wù)可能只需要700到800張卡。這個(gè)效率提升來(lái)自模型架構(gòu)優(yōu)化、推理框架優(yōu)化、硬件升級(jí)等多個(gè)方面。應(yīng)對(duì)策略算力投資要模塊化、可擴(kuò)展避免一次性大規(guī)模投入。先建小集群驗(yàn)證再根據(jù)實(shí)際需求逐步擴(kuò)展。硬件選擇上優(yōu)先考慮通用性強(qiáng)的型號(hào)避免專(zhuān)用芯片鎖定。7.3 算力投資的風(fēng)險(xiǎn)管理框架算力投資的主要風(fēng)險(xiǎn)包括技術(shù)路線變化導(dǎo)致硬件過(guò)時(shí)、算力價(jià)格下降導(dǎo)致自建集群貶值、模型效率提升導(dǎo)致算力需求下降、競(jìng)爭(zhēng)加劇導(dǎo)致推理價(jià)格下降。風(fēng)險(xiǎn)管理框架包括第一控制自建集群規(guī)模。自建集群不超過(guò)總算力需求的50%其余用租用滿(mǎn)足。這樣既保證核心任務(wù)的算力供應(yīng)又保持靈活性。第二硬件折舊年限不要超過(guò)3年。AI硬件迭代快3年后可能大幅貶值。折舊年限太長(zhǎng)會(huì)導(dǎo)致賬面利潤(rùn)虛高實(shí)際現(xiàn)金流緊張。第三收入預(yù)測(cè)要保守。推理價(jià)格年降幅按20%到30%算咨詢(xún)量增長(zhǎng)按10%到15%算。不要用樂(lè)觀情景做決策。第四保持技術(shù)跟蹤。關(guān)注模型效率、硬件性能、算力價(jià)格的變化每季度更新一次算力投資模型。第五設(shè)置止損線。如果實(shí)際利用率連續(xù)3個(gè)月低于30%或者推理毛利率連續(xù)3個(gè)月低于10%就要考慮調(diào)整策略。這套框架我用了兩年多幫我在算力投資上避開(kāi)了大坑也抓住了機(jī)會(huì)。最核心的體會(huì)是算力是手段不是目的能產(chǎn)生回報(bào)的算力才是好算力。不要被“算力規(guī)模”迷惑要盯著“算力回報(bào)率”。每次決策前把賬算清楚把風(fēng)險(xiǎn)想全面比盲目跟風(fēng)靠譜得多。最后分享一個(gè)小技巧做算力投資評(píng)估時(shí)找一個(gè)懂技術(shù)的人和一個(gè)懂財(cái)務(wù)的人一起看項(xiàng)目。技術(shù)的人看算力需求是否合理財(cái)務(wù)的人看回報(bào)率是否可行。兩個(gè)人意見(jiàn)一致時(shí)再?zèng)Q策不一致時(shí)就要深挖原因。我見(jiàn)過(guò)太多項(xiàng)目是技術(shù)的人覺(jué)得可行、財(cái)務(wù)的人覺(jué)得虧錢(qián)最后發(fā)現(xiàn)是技術(shù)的人高估了利用率或者財(cái)務(wù)的人低估了收入增長(zhǎng)。兩邊對(duì)齊了決策質(zhì)量會(huì)高很多。