據(jù)中心控制平面策略的規(guī)范化智能體生成框架)
AtumAI面向數(shù)據(jù)中心控制平面策略的規(guī)范化智能體生成框架論文arXiv編號2608.02569v1 | 發(fā)布時間2026-08-03 | 開源協(xié)議CC BY-NC-SA 4.0摘要數(shù)據(jù)中心的運行效率完全依賴控制平面即調(diào)度硬件資源的各類管理策略。但人工設(shè)計控制平面策略的難度正持續(xù)加劇軟硬件棧規(guī)模擴(kuò)張速度遠(yuǎn)超工程師的理解上限優(yōu)化空間龐大、變量高度耦合專家極易錯過性能優(yōu)化機(jī)會單套候選策略的原型驗證往往需要數(shù)月周期。現(xiàn)有開箱即用的智能體AI系統(tǒng)雖可自動化策略搜索但存在三大核心缺陷非規(guī)范化無結(jié)構(gòu)化、可檢索的問題描述硬約束無法得到強(qiáng)制保證搜索過程缺少可利用的固定結(jié)構(gòu)無遷移能力每個任務(wù)從零求解跨場景學(xué)到的經(jīng)驗無法復(fù)用非系統(tǒng)化搜索僅依靠大模型生成候選方案探索空間狹窄、存在模型偏見極易收斂到局部最優(yōu)。本文提出AtumAI框架通過智能體AI自動生成數(shù)據(jù)中心控制平面策略同時補(bǔ)齊上述三大短板。工程師僅需自然語言描述優(yōu)化目標(biāo)AtumAI即可自主完成候選策略生成、仿真測試、迭代調(diào)優(yōu)直至產(chǎn)出滿足全部約束的可用方案??蚣苡蓛纱蠛诵慕M件協(xié)同工作數(shù)據(jù)中心任務(wù)編譯器將自然語言需求編譯為可機(jī)器校驗、可檢索的形式化規(guī)約規(guī)約綁定真實業(yè)務(wù)負(fù)載與硬件平臺采集數(shù)據(jù)包含優(yōu)化目標(biāo)、決策變量、硬約束、評測方案進(jìn)化式設(shè)計迭代環(huán)基于規(guī)約開展全域搜索通過擴(kuò)散模型探索差異化策略結(jié)構(gòu)、進(jìn)化算法調(diào)參、代理模型預(yù)過濾低價值候選大幅降低高精度仿真的計算開銷。在三類完全不同的控制平面任務(wù)負(fù)載部署、資源彈性擴(kuò)縮、功耗管理上完成評測AtumAI生成的策略性能全面超越人工專家基線單套統(tǒng)一流水線可適配所有數(shù)據(jù)中心優(yōu)化場景無需針對任務(wù)定制開發(fā)?,F(xiàn)有系統(tǒng)缺失能力帶來的問題AtumAI解決方案規(guī)范化形式化描述無綁定真實負(fù)載的結(jié)構(gòu)化問題定義硬約束無法保證任務(wù)編譯器生成綁定業(yè)務(wù)/硬件的標(biāo)準(zhǔn)化可檢索中間表示IR知識遷移機(jī)制每個任務(wù)獨立開發(fā)經(jīng)驗無法復(fù)用統(tǒng)一IR共享優(yōu)化算子庫跨任務(wù)蒸餾知識可復(fù)用全域系統(tǒng)化搜索僅依賴LLM生成方案搜索范圍窄、易陷入局部最優(yōu)擴(kuò)散模型結(jié)構(gòu)探索進(jìn)化算法參數(shù)調(diào)優(yōu)代理預(yù)過濾三重搜索1 引言數(shù)據(jù)中心支撐微服務(wù)、網(wǎng)頁檢索、存儲、數(shù)據(jù)分析、大模型訓(xùn)練推理全場景業(yè)務(wù)其成本、吞吐、穩(wěn)定性完全由控制平面決定??刂破矫姘幌盗姓{(diào)度策略通過負(fù)載部署、緩存、流量路由榨取硬件算力或直接調(diào)控服務(wù)器功耗。每類策略都存在多目標(biāo)權(quán)衡服務(wù)器利用率、尾延遲、成本、功耗與硬性約束SLA服務(wù)指標(biāo)、硬件容量、功耗上限。隨著硬件異構(gòu)性、業(yè)務(wù)負(fù)載持續(xù)迭代策略的優(yōu)化空間呈組合爆炸式增長。傳統(tǒng)專家手工設(shè)計、調(diào)優(yōu)模式已跟不上業(yè)務(wù)迭代速度帶來海量資源浪費。智能體AILLM驅(qū)動多步執(zhí)行系統(tǒng)可自主理解目標(biāo)、調(diào)用工具、執(zhí)行代碼正在革新軟件工程與科學(xué)計算領(lǐng)域。本文提出智能體可大幅提升數(shù)據(jù)中心控制平面策略研發(fā)效率擴(kuò)充人類可探索的優(yōu)化空間讓工程師聚焦問題定義與結(jié)果評判而非手工調(diào)參。但直接使用通用智能體解決調(diào)度優(yōu)化存在三大致命短板無形式化規(guī)約目標(biāo)、約束隱式寫在Prompt與自定義適應(yīng)度函數(shù)中未綁定真實業(yè)務(wù)數(shù)據(jù)優(yōu)化過程缺少結(jié)構(gòu)化邊界生產(chǎn)環(huán)境極易出現(xiàn)仿真達(dá)標(biāo)但線上失效的策略無遷移復(fù)用每個任務(wù)都需要從零搭建腳手架無法復(fù)用過往調(diào)度經(jīng)驗搜索范圍受限全部候選方案由LLM生成繼承模型固有偏見僅能探索極小一片設(shè)計空間快速收斂局部最優(yōu)。本文核心工作本文設(shè)計AtumAI規(guī)范化智能體框架工程師自然語言描述需求框架全自動生成、評測、迭代驗證控制平面策略支持負(fù)載、硬件持續(xù)變化下的數(shù)據(jù)中心自演化??蚣芎诵膬纱髣?chuàng)新組件數(shù)據(jù)中心任務(wù)編譯器將需求編譯為標(biāo)準(zhǔn)化、可校驗中間表示IR實現(xiàn)問題形式化配套共享優(yōu)化算子庫實現(xiàn)跨任務(wù)知識遷移進(jìn)化式設(shè)計迭代環(huán)突破LLM單一生成局限擴(kuò)散模型探索策略結(jié)構(gòu)、進(jìn)化算法優(yōu)化參數(shù)、代理模型提前篩除劣質(zhì)方案實現(xiàn)系統(tǒng)化全域搜索。三大評測場景效果負(fù)載部署對比人工基線部署成功率提升17%調(diào)度吞吐提升8%資源彈性擴(kuò)縮資源使用成本降低24%SLA違規(guī)率僅1.3%功耗管理集群功耗下降21%業(yè)務(wù)吞吐同步提升17%。三類場景共用同一套Atum流水線無需定制改造策略設(shè)計周期從數(shù)月壓縮至數(shù)小時跨領(lǐng)域調(diào)度經(jīng)驗可完全復(fù)用。本文四大核心貢獻(xiàn)提出AtumAI框架實現(xiàn)自然語言需求到可用數(shù)據(jù)中心控制策略的全自動智能體流水線設(shè)計數(shù)據(jù)中心任務(wù)編譯器將自然語言意圖轉(zhuǎn)化綁定真實負(fù)載、硬件的可檢索、機(jī)器校驗IR規(guī)約提出進(jìn)化式設(shè)計迭代環(huán)融合擴(kuò)散結(jié)構(gòu)搜索、進(jìn)化參數(shù)調(diào)優(yōu)、代理預(yù)過濾突破LLM搜索邊界在負(fù)載部署、資源擴(kuò)縮、功耗管理三大典型數(shù)據(jù)中心任務(wù)完成全量實驗驗證框架通用性與性能優(yōu)勢。2 背景與動機(jī)2.1 數(shù)據(jù)中心控制平面控制平面是管理服務(wù)器、CPU、內(nèi)存、功耗等硬件資源的軟件集合由多套獨立策略組成每套策略包含決策變量、優(yōu)化目標(biāo)、硬約束、業(yè)務(wù)評測負(fù)載四大統(tǒng)一要素。本文全程使用三類典型策略作為示例負(fù)載部署策略Borg/Protean等集群調(diào)度器決策每個虛擬機(jī)/服務(wù)運行節(jié)點權(quán)衡服務(wù)器利用率、部署成功率、業(yè)務(wù)尾延遲、調(diào)度器自身吞吐約束為節(jié)點CPU/內(nèi)存容量、服務(wù)共存限制。傳統(tǒng)方案依賴數(shù)十年手工啟發(fā)式規(guī)則負(fù)載迭代后性能持續(xù)衰減。資源彈性擴(kuò)縮策略Autopilot自動擴(kuò)縮容系統(tǒng)動態(tài)調(diào)整服務(wù)CPU、內(nèi)存配額權(quán)衡資源開銷與流量峰值下SLA違規(guī)風(fēng)險結(jié)合時序預(yù)測、反饋控制與人工安全閾值。集群功耗管理Dynamo、Thunderbolt統(tǒng)一分配整機(jī)功耗預(yù)算通過功耗超配提升硬件利用率約束為單服務(wù)精度下限、整機(jī)功耗上限。人工策略的固有缺陷軟硬件規(guī)模持續(xù)擴(kuò)張策略優(yōu)化空間組合爆炸單套候選策略原型、仿真、上線驗證周期長達(dá)數(shù)月策略上線后隨負(fù)載、硬件迭代性能持續(xù)退化無法自適應(yīng)變化。亟需自動化方案輸入高層優(yōu)化目標(biāo)全自動生成適配當(dāng)前集群調(diào)度策略。該方案需要兩大能力將自然語言意圖轉(zhuǎn)化綁定真實集群硬件、負(fù)載的精準(zhǔn)數(shù)學(xué)規(guī)約大范圍搜索優(yōu)質(zhì)策略不局限于人類專家的啟發(fā)式思路。智能體AI為上述能力提供落地路徑。2.2 智能體系統(tǒng)與現(xiàn)有相關(guān)工作1傳統(tǒng)機(jī)器學(xué)習(xí)調(diào)度優(yōu)化LLM智能體出現(xiàn)前各類獨立ML模型被用于單一場景優(yōu)化分支預(yù)測、緩存替換、芯片布局、資源擴(kuò)縮但每個場景都需要獨立定制模型與訓(xùn)練流水線無法跨任務(wù)復(fù)用。2LLM代碼生成、軟件智能體MetaGPT、SWE-agent等多智能體框架通過測試反饋完成代碼糾錯但僅聚焦功能正確性ECO-LLM基于反模式重構(gòu)代碼僅面向狹義性能優(yōu)化無法處理多約束數(shù)據(jù)中心調(diào)度問題。3內(nèi)核/算子智能進(jìn)化框架KernelEvolve、AI CUDA Engineer等工具迭代優(yōu)化計算內(nèi)核僅單目標(biāo)性能調(diào)優(yōu)而數(shù)據(jù)中心策略存在多沖突目標(biāo)大量硬性約束無法直接復(fù)用。4LLM驅(qū)動進(jìn)化搜索AlphaEvolve、SkyDiscover通過LLM變異代碼、適應(yīng)度篩選迭代但存在兩大致命局限所有候選均由LLM生成搜索空間狹窄容易局部最優(yōu)每個新任務(wù)需要人工編寫適應(yīng)度函數(shù)、搭建仿真腳手架把自然需求轉(zhuǎn)為約束優(yōu)化的專家步驟無法自動化?,F(xiàn)有方案三大缺失無形式化綁定業(yè)務(wù)的規(guī)約、無跨任務(wù)知識遷移、僅LLM單一搜索源本文AtumAI完整補(bǔ)齊三點。3 AtumAI整體架構(gòu)AtumAI單條完整流水線自然語言需求 → 數(shù)據(jù)中心任務(wù)編譯器 → 可執(zhí)行搜索問題 → 進(jìn)化式設(shè)計迭代環(huán) → 驗證通過的最優(yōu)控制策略兩大核心模塊前端數(shù)據(jù)中心任務(wù)編譯器將非正式意圖形式化為統(tǒng)一中間表示IR實現(xiàn)知識可遷移最終輸出可執(zhí)行搜索任務(wù)后端進(jìn)化式設(shè)計迭代環(huán)系統(tǒng)化全域搜索輸出滿足全部IR約束的最優(yōu)策略迭代環(huán)輸出評測反饋回傳編譯器形成閉環(huán)持續(xù)優(yōu)化。運行示例貫穿全文案例需求在不提升延遲的前提下最小化服務(wù)資源占用資源擴(kuò)縮場景固定服務(wù)器硬件、附帶歷史流量追蹤p99延遲≤50ms硬SLA約束編譯器自動將模糊需求轉(zhuǎn)化完整形式IR規(guī)約迭代環(huán)全域搜索擴(kuò)縮控制器策略。4 數(shù)據(jù)中心任務(wù)編譯器現(xiàn)有智能體將問題定義藏在Prompt、手寫適應(yīng)度函數(shù)中目標(biāo)約束隱式表達(dá)經(jīng)驗無法復(fù)用。編譯器通過三大設(shè)計解決該問題形式化自然語言意圖轉(zhuǎn)為顯式IR規(guī)約決策變量、目標(biāo)、約束、評測方法可遷移共享優(yōu)化算子庫單任務(wù)學(xué)到的調(diào)度邏輯跨場景復(fù)用系統(tǒng)化搜索前置將IR規(guī)約轉(zhuǎn)化結(jié)構(gòu)清晰的可執(zhí)行優(yōu)化問題。編譯器三階段執(zhí)行流程意圖提升自然語言需求轉(zhuǎn)為標(biāo)準(zhǔn)化形式IR算子投射從共享庫選取適配優(yōu)化算子綁定當(dāng)前場景變量下編譯IR規(guī)約輸出完整可執(zhí)行搜索任務(wù)參數(shù)空間、生成器、代理模型、高精度仿真器。4.1 意圖提升自然語言轉(zhuǎn)形式規(guī)約輸入工程師文字需求 可選工件負(fù)載追蹤、部署配置、歷史策略輸出基礎(chǔ)未綁定IR規(guī)約分兩步執(zhí)行意圖解析智能體識別調(diào)度決策、優(yōu)化目標(biāo)、隱含硬約束規(guī)則校驗器非LLM確定性校驗規(guī)約完整性缺失信息自動反問工程師空白值從領(lǐng)域標(biāo)準(zhǔn)模板填充保證簡短需求也能生成完整規(guī)約。校驗器強(qiáng)制IR類型規(guī)范變量定義域、約束可觀測、單位統(tǒng)一拒絕非法規(guī)約。負(fù)載與硬件特征挖掘自動拉取集群真實流量、硬件上限數(shù)據(jù)綁定IR優(yōu)化搜索不再基于抽象假設(shè)全部貼合真實線上環(huán)境。4.2 中間表示IR統(tǒng)一標(biāo)準(zhǔn)規(guī)約所有數(shù)據(jù)中心調(diào)度任務(wù)共用同一份IR結(jié)構(gòu)作為編譯器與迭代環(huán)的標(biāo)準(zhǔn)接口包含六大核心字段示例如下task_type:resource scaling# 決策變量控制器可調(diào)參數(shù)decision_variables:replicas:int in[1,12]cpu_limit:float in[0.5,4.0]# CPU核心數(shù)mem_limit:float in[0.5,8.0]# 內(nèi)存GB# 優(yōu)化目標(biāo)支持多目標(biāo)優(yōu)先級objectives:minimize allocated_resources# 優(yōu)先級1.0# 硬性約束絕對不可違反constraints:p99_latency_ms \leq 50 cooldown \geq 1 interval# 評測規(guī)范evaluation:simulator autoscaling_evaluator trace mined_load(service) metrics {p99_latency,resources,slo_violation_rate}# 執(zhí)行預(yù)算策略推理時延上限execution_budget:classloose interval30s modefull# 綁定真實集群特征characterization:load profile,latency-vs-alloc curve,platform limits決策變量策略可調(diào)整參數(shù)與取值空間目標(biāo)多優(yōu)化方向優(yōu)先級不強(qiáng)制合并為單一標(biāo)量硬約束任何候選策略違反即直接淘汰評測方法固定仿真器、負(fù)載追蹤、觀測指標(biāo)保證所有方案可復(fù)現(xiàn)對比執(zhí)行預(yù)算策略在線推理最大時延約束策略復(fù)雜度特征綁定自動挖掘的集群負(fù)載、硬件數(shù)據(jù)。4.3 可遷移控制知識共享優(yōu)化算子庫形式IR描述優(yōu)化目標(biāo)但不包含實現(xiàn)調(diào)度邏輯的方法編譯器維護(hù)全局共享優(yōu)化算子庫實現(xiàn)跨任務(wù)知識遷移。算子庫結(jié)構(gòu)單個優(yōu)化算子抽象調(diào)度邏輯包含4部分適用條件、需滿足目標(biāo)、領(lǐng)域適配投射公式、歷史置信度。示例算子突發(fā)流量預(yù)警防護(hù)抽象公式壓力 f(流量趨勢, 隊列深度, SLA風(fēng)險)適配負(fù)載部署場景轉(zhuǎn)化為主機(jī)剩余容量打分公式適配資源擴(kuò)縮場景轉(zhuǎn)化為擴(kuò)容觸發(fā)壓力指標(biāo)算子篩選三步流程過濾僅保留匹配IR適用條件算子打分算子描述與IR目標(biāo)匹配度排序覆蓋貪心選擇最小算子集合完整覆蓋全部IR約束/目標(biāo)。算子投射機(jī)制抽象公式綁定當(dāng)前場景真實觀測指標(biāo)生成領(lǐng)域?qū)僬{(diào)度項同一套預(yù)警算子無需重新開發(fā)直接復(fù)用在部署、擴(kuò)縮兩類完全不同任務(wù)。Figure3抽象算子跨領(lǐng)域投射示例4.4 下編譯IR轉(zhuǎn)為可執(zhí)行搜索任務(wù)輸入IR與篩選后的優(yōu)化算子輸出四件套搜索工件參數(shù)空間所有算子閾值、變量取值范圍候選生成器基于算子庫初始化初始策略代理預(yù)評估模型低成本預(yù)測策略指標(biāo)減少高精度仿真次數(shù)高精度仿真器基于挖掘的真實負(fù)載搭建評測環(huán)境。評估棧設(shè)計代理模型編譯器根據(jù)IR指標(biāo)、負(fù)載特征自動構(gòu)建迭代過程持續(xù)重訓(xùn)練提前篩除劣質(zhì)候選仿真器擴(kuò)展IR所需觀測指標(biāo)完整復(fù)刻線上集群環(huán)境。完整編譯算法算法1輸入自然語言需求r目標(biāo)領(lǐng)域d算子庫L 1. ir Raise(r) # 意圖提升挖掘負(fù)載硬件特征 2. 標(biāo)準(zhǔn)化校驗IR空白填充領(lǐng)域模板 3. P SelectPasses(ir, L) # 篩選適配優(yōu)化算子 4. 遍歷所有算子p∈P tp Project(p, d) # 投射為領(lǐng)域?qū)俟?5. 遍歷IR所需但無匹配算子的目標(biāo) 生成安全DSL原語校驗硬件是否支持 6. prob Bind(ir, {tp}) # 綁定生成完整搜索任務(wù) 7. 根據(jù)IR執(zhí)行預(yù)算裁剪搜索規(guī)模 8. 返回可執(zhí)行搜索任務(wù)prob4.5 開放世界擴(kuò)展機(jī)制算子庫無法覆蓋全部全新調(diào)度邏輯時編譯器生成安全公式DSL原語僅基礎(chǔ)四則運算無可執(zhí)行代碼若仿真器缺少所需觀測指標(biāo)標(biāo)記能力缺口后續(xù)迭代完善。4.6 證據(jù)驅(qū)動算子庫演化每次迭代的評測結(jié)果更新算子置信度負(fù)收益算子自動降低篩選優(yōu)先級每完成一類任務(wù)新增算子入庫后續(xù)所有任務(wù)均可復(fù)用知識持續(xù)累積。5 進(jìn)化式設(shè)計迭代環(huán)編譯器輸出搜索任務(wù)后迭代環(huán)完成全域系統(tǒng)化搜索單LLM僅能探索局部空間迭代環(huán)通過結(jié)構(gòu)擴(kuò)散參數(shù)進(jìn)化雙向拓展候選范圍搭配代理預(yù)過濾降低仿真開銷。單次迭代5階段生成種子 → 結(jié)構(gòu)/參數(shù)擴(kuò)展 → 代理過濾 → 高精度仿真驗證 → 反饋迭代。Figure4迭代環(huán)五階段完整流程 5.1 Generate種子策略生成迭代首輪初始化種子LLM結(jié)合算子庫、歷史成功/失敗案例生成基礎(chǔ)可行策略不限制單一模型多條種子并行生成錯誤方案不阻塞流程。5.2 Expand雙向全域擴(kuò)展基于少量種子生成海量差異化候選分兩條擴(kuò)展路徑結(jié)構(gòu)擴(kuò)散離散擴(kuò)散模型掩碼策略局部模塊打分邏輯、安全閾值僅重生成掩碼區(qū)域保留有效邏輯約束編輯邊界僅修改指定片段避免破壞已有可行邏輯可融合多條最優(yōu)策略的優(yōu)勢結(jié)構(gòu)。實現(xiàn)層面用LLM完成掩碼重寫拒絕越界修改。參數(shù)進(jìn)化算法對同一策略結(jié)構(gòu)高斯擾動閾值、窗口、容量等數(shù)值參數(shù)搭配模擬退火局部尋優(yōu)允許臨時變差跳出局部最優(yōu)全部參數(shù)調(diào)整通過代理模型預(yù)打分不占用高精度仿真資源。Figure5種子雙向擴(kuò)展代理過濾流程5.3 Filter代理模型低成本預(yù)篩選擴(kuò)展后候選數(shù)量巨大無法全部仿真代理模型快速預(yù)測所有指標(biāo)帶置信區(qū)間基于探索感知打分篩選高價值方案。打分規(guī)則綜合預(yù)測收益、不確定性獎勵、失敗修復(fù)增益、新穎度淘汰重復(fù)劣質(zhì)方案配額制預(yù)留小眾、高不確定候選避免最優(yōu)方案被過濾。代理模型實現(xiàn)高斯過程樹集成融合回歸器輸入策略結(jié)構(gòu)特征、負(fù)載場景輸出多指標(biāo)預(yù)測每輪仿真數(shù)據(jù)增量重訓(xùn)練預(yù)測精度持續(xù)提升。5.4 評估與校驗過濾后少量候選送入全量高精度仿真覆蓋穩(wěn)態(tài)、突發(fā)、碎片多類負(fù)載場景避免策略過擬合單一流量強(qiáng)制校驗全部IR硬約束只要一項違規(guī)直接淘汰持續(xù)校驗代理預(yù)測準(zhǔn)確度防止過濾失效。5.5 反饋與迭代仿真結(jié)果生成結(jié)構(gòu)化反饋約束違規(guī)場景、最優(yōu)對比樣本反饋指導(dǎo)下一輪種子生成、擴(kuò)散掩碼選取本輪最優(yōu)/最差策略存入算子庫作為正負(fù)樣本跨任務(wù)復(fù)用經(jīng)驗。單次迭代完整算法算法2輸入搜索任務(wù)S上輪最優(yōu)父策略P代理模型M歷史反饋B算子庫L 1. seeds Generate(S, L, B) # 算子庫引導(dǎo)生成種子 2. cand Diffuse(P∪seeds) ∪ Mutate(P∪seeds) ∪ Anneal(P∪seeds) 3. pool P ∪ seeds ∪ cand 4. ranked Rank(pool, M) # 代理不確定性打分排序 5. filter Select(ranked) # 配額篩選少量候選 6. rows Simulate(filter) # 多負(fù)載高精度仿真剔除違規(guī)方案 7. M Refit(M) # 增量重訓(xùn)練代理模型 8. P ParetoParents(rows) # 帕累托最優(yōu)作為下輪父策略 9. B Failures(rows) # 記錄約束違規(guī)反饋 10. 更新算子庫存入本輪最優(yōu)/最差策略 11. 返回本輪驗證通過最優(yōu)策略6 多場景案例實驗三大獨立數(shù)據(jù)中心調(diào)度任務(wù)負(fù)載部署、資源彈性擴(kuò)縮、功耗管理每個場景人工專家基線為線上成熟調(diào)度系統(tǒng)評測指標(biāo)歸一化基線分?jǐn)?shù)1.0迭代環(huán)默認(rèn)使用Claude Opus 4.8同時測試多款LLM魯棒性。6.1 場景1虛擬機(jī)負(fù)載部署任務(wù)定義90臺服務(wù)器集群Azure真實VM流量追蹤優(yōu)化目標(biāo)最大化部署成功率、調(diào)度吞吐降低CPU熱點硬約束CPU/內(nèi)存容量、服務(wù)共存隔離基線為工業(yè)界Best-Fit裝箱調(diào)度器。評測指標(biāo)VMScore 0.5部署成功率 0.2調(diào)度吞吐 0.2 P50熱點懲罰 0.1 P99熱點懲罰實驗結(jié)果AtumAI綜合得分1.13倍基線部署成功率17%調(diào)度吞吐8%熱點負(fù)載無惡化。核心創(chuàng)新策略諧波CPU/內(nèi)存剩余容量打分預(yù)留未來部署空間拓?fù)浞纸M篩選主機(jī)大幅降低單輪調(diào)度計算開銷消融結(jié)論僅LLM僅1.01倍增加擴(kuò)散進(jìn)化至1.05完整反饋閉環(huán)提升至1.13反饋是核心增益來源更換Gemini等其他LLM依舊穩(wěn)定超越基線。Figure6 負(fù)載部署實驗曲線得分迭代、消融、LLM敏感性6.2 場景2服務(wù)資源彈性擴(kuò)縮任務(wù)定義100微服務(wù)共享30節(jié)點阿里真實多模式流量穩(wěn)態(tài)/突發(fā)/趨勢目標(biāo)最小分配資源硬約束p99延遲SLO基線為閾值式被動擴(kuò)縮控制器。指標(biāo)0.5 SLA質(zhì)量 0.5資源成本歸一化基線實驗結(jié)果綜合得分1.27倍基線資源開銷降低24%SLA違規(guī)率僅1.3%。核心創(chuàng)新策略區(qū)分?jǐn)U容/縮容預(yù)測窗口高風(fēng)險服務(wù)優(yōu)先分配資源低壓力場景縮容避免震蕩。消融純LLM 1.16擴(kuò)散進(jìn)化1.21完整反饋閉環(huán)1.27多款大模型均穩(wěn)定1.20以上魯棒性強(qiáng)。Figure7 資源擴(kuò)縮實驗圖表6.3 場景3LLM推理集群功耗管理任務(wù)定義960服務(wù)器大模型推理集群Azure線上兩周流量目標(biāo)同等功耗下提升吞吐硬約束單服務(wù)精度≥0.9基線為固定大模型高功耗調(diào)度策略。指標(biāo)0.4功耗優(yōu)化 0.3精度 0.2吞吐實驗結(jié)果綜合得分1.31倍基線功耗下降21%吞吐提升17%所有服務(wù)精度達(dá)標(biāo)。核心策略差異化模型尺寸分配低精度負(fù)載使用小模型功耗導(dǎo)向流量路由。消融僅LLM等于基線結(jié)構(gòu)擴(kuò)散提升至1.14完整迭代環(huán)1.31輕量化LLM依舊可達(dá)1.28倍。Figure8 功耗管理實驗圖表6.4 數(shù)據(jù)中心任務(wù)編譯器價值消融實驗設(shè)置6組對比僅LLM、手寫IR、IR人工提示、無知識遷移完整編譯器、單輪編譯器、完整Atum編譯器。純LLM無合法滿足約束策略得分0手寫IR僅82%-93%完整系統(tǒng)性能IR提示92%-96%關(guān)閉算子知識遷移性能下降3.6%-4%單輪編譯器不迭代優(yōu)化性能下降1.2%-3.2%結(jié)論自動挖掘負(fù)載硬件跨任務(wù)算子遷移是Atum核心收益來源僅靠LLM或人工規(guī)約無法產(chǎn)出線上可用策略。Figure9 編譯器消融柱狀圖7 結(jié)論人工設(shè)計數(shù)據(jù)中心控制平面策略難以匹配軟硬件迭代速度現(xiàn)有通用智能體存在非形式化、無遷移、搜索范圍窄三大缺陷。本文提出AtumAI數(shù)據(jù)中心任務(wù)編譯器將自然語言需求轉(zhuǎn)為綁定真實業(yè)務(wù)的形式化IR實現(xiàn)跨任務(wù)調(diào)度知識遷移進(jìn)化式設(shè)計迭代環(huán)融合擴(kuò)散結(jié)構(gòu)搜索、進(jìn)化調(diào)參、代理預(yù)過濾實現(xiàn)全域系統(tǒng)化策略搜索在負(fù)載部署、資源擴(kuò)縮、功耗管理三類典型數(shù)據(jù)中心任務(wù)驗證統(tǒng)一流水線生成策略全面超越人工專家基線將數(shù)月策略研發(fā)周期壓縮至數(shù)小時。未來可基于Atum構(gòu)建持續(xù)自適應(yīng)、全自動演化的數(shù)據(jù)中心調(diào)度系統(tǒng)。論文資源鏈接論文HTML原文https://arxiv.org/html/2608.02569v1arXiv論文PDFhttps://arxiv.org/pdf/2608.02569v1配套仿真測試工具VLMEvalKit同類數(shù)據(jù)中心評測框架文中提及實驗負(fù)載數(shù)據(jù)集Azure Public Dataset V2、阿里微服務(wù)追蹤數(shù)據(jù)集開源下載地址見參考文獻(xiàn)