容量緊急處理:從告警診斷到VMFS擴(kuò)容的完整實(shí)戰(zhàn)指南)
凌晨一點(diǎn)手機(jī)連著震了三下。打開(kāi)監(jiān)控一看vCenter里那個(gè)存儲(chǔ)告警已經(jīng)變成了紅色高亮——ESXi主機(jī)上的一個(gè)VMFS數(shù)據(jù)存儲(chǔ)容量使用率飆到了97%狀態(tài)直接掛上了“緊急”。再切到DELL存儲(chǔ)管理端一看后端存儲(chǔ)池的剩余空間也只剩不到5%。那一瞬間大家都是同一個(gè)感覺(jué)完蛋今天是別想睡了。這種“VMware ESXi DELL虛擬化存儲(chǔ)磁盤(pán)容量處于緊急狀態(tài)”的問(wèn)題我在過(guò)去十年里處理過(guò)不下二十次。有自己環(huán)境里踩雷也有幫朋友遠(yuǎn)程救火。每次情況都差不多告警郵件半夜發(fā)出來(lái)虛擬機(jī)還在跑但心里清楚這種狀態(tài)撐不了太久。一旦數(shù)據(jù)存儲(chǔ)寫(xiě)滿(mǎn)虛擬機(jī)的磁盤(pán)IO會(huì)直接凍結(jié)所有落盤(pán)操作全部掛起整個(gè)業(yè)務(wù)庫(kù)等于一次性停擺。所以這篇東西不聊理論只聊處理思路和落地操作。如果你是剛接手虛擬化環(huán)境的新人或者正在面對(duì)一臺(tái)容量爆紅的ESXi主機(jī)按我這個(gè)排查和處理順序走一遍大概率能把這顆雷拆掉。1. 先把“容量緊急”這件事拆清楚拿到告警第一反應(yīng)別急著刪文件。虛擬化存儲(chǔ)的容量問(wèn)題往往不是“某個(gè)文件太大”這么簡(jiǎn)單而是多層結(jié)構(gòu)疊加導(dǎo)致的。ESXi數(shù)據(jù)存儲(chǔ)是跑在物理存儲(chǔ)之上的一個(gè)邏輯層你的DELL存儲(chǔ)可能是MD系列、PowerVault系列或者SC系列也可以是戴爾服務(wù)器內(nèi)置的PERC陣列外加DAS存儲(chǔ)。無(wú)論哪種物理層是存儲(chǔ)池和RAID組邏輯層才是你在vCenter里看到的一個(gè)個(gè)Datastore。1.1 “緊急狀態(tài)”到底是什么意思VMware的告警閾值一般分兩檔默認(rèn)情況下數(shù)據(jù)存儲(chǔ)使用率達(dá)到85%時(shí)觸發(fā)“警告”Warning使用率達(dá)到95%或者更高時(shí)觸發(fā)“緊急”Critical。而在DELL OpenManage Storage Management或者Unisphere的管理界面里存儲(chǔ)池容量也有類(lèi)似的閾值比如池使用率超過(guò)95%會(huì)標(biāo)記為嚴(yán)重。這套告警機(jī)制本身是保護(hù)性質(zhì)的但問(wèn)題在于你不可能在告警發(fā)生的那一瞬間才去處理因?yàn)閺摹熬o急”到“徹底寫(xiě)滿(mǎn)”往往只有一個(gè)晚上的時(shí)間差。我就見(jiàn)過(guò)一臺(tái)跑著數(shù)據(jù)庫(kù)的虛擬機(jī)白天看還有3%剩余夜里一個(gè)備份任務(wù)跑起來(lái)日志唰唰漲第二天早上數(shù)據(jù)存儲(chǔ)徹底滿(mǎn)了所有Windows Server虛擬機(jī)里的系統(tǒng)日志全部報(bào)錯(cuò)數(shù)據(jù)庫(kù)進(jìn)程直接hang住。所以在動(dòng)手之前你需要先回答三個(gè)問(wèn)題告警發(fā)生的是哪一層是ESXi的數(shù)據(jù)存儲(chǔ)還是DELL存儲(chǔ)后端池告警是持續(xù)性的還是突發(fā)的持續(xù)性的多半是容量規(guī)劃問(wèn)題突發(fā)的通常是快照、日志、備份文件惹的禍。當(dāng)前業(yè)務(wù)能承受多久的停機(jī)這個(gè)決定了你是走在線(xiàn)處理流程還是需要約維護(hù)窗口停業(yè)務(wù)處理。1.2 容量爆紅的四個(gè)常見(jiàn)根因我遇到的容量緊急問(wèn)題九成以上都能歸到以下四類(lèi)快照積壓這是最大概率的元兇。虛擬機(jī)打了快照之后增量數(shù)據(jù)全部寫(xiě)在快照文件里快照越積越大原來(lái)的VMDK基礎(chǔ)盤(pán)反而成了“只讀層”。有些環(huán)境里的虛擬機(jī)開(kāi)了快照之后忘了合并一個(gè)快照跑了幾個(gè)月文件大得嚇人。日志和臨時(shí)文件膨脹Windows的C盤(pán)滿(mǎn)了會(huì)直接影響虛擬機(jī)系統(tǒng)但更隱蔽的是應(yīng)用生成的日志文件比如IIS日志、SQL Server的errorlog、Java應(yīng)用堆棧日志它們體積變大之后直接把整個(gè)Datastore吃掉。模板和ISO鏡像殘留很多運(yùn)維人員習(xí)慣把安裝鏡像、操作系統(tǒng)模板直接放在數(shù)據(jù)存儲(chǔ)里一個(gè)Windows Server ISO 5到8GB模板幾十GB幾年下來(lái)全是看不見(jiàn)的“存儲(chǔ)黑洞”。Thin Provisioning的誤判ESXi層面的精簡(jiǎn)磁盤(pán)其實(shí)際占用會(huì)隨著寫(xiě)入增長(zhǎng)而變大。如果當(dāng)初所有虛擬機(jī)都是Thick置備那空間占用在創(chuàng)建時(shí)就已經(jīng)鎖定了反倒不容易爆用了精簡(jiǎn)置備之后每臺(tái)機(jī)器都覺(jué)得自己“用的不多”但加起來(lái)可能遠(yuǎn)超物理容量。搞清楚根因處理才有方向。下面是詳細(xì)的排查和操作流程。2. 診斷三步走從vCenter到DELL存儲(chǔ)管理端處理容量問(wèn)題最忌諱的就是憑感覺(jué)。沒(méi)有查清楚問(wèn)題出在哪一層之前任何刪除操作都是拿生產(chǎn)環(huán)境冒險(xiǎn)。我常用的診斷路徑是“先看ESXi數(shù)據(jù)存儲(chǔ)再看虛擬機(jī)內(nèi)部最后查DELL后端”。2.1 第一站vCenter里的Datastore狀態(tài)用vSphere Client登錄到vCenter點(diǎn)擊存儲(chǔ)視圖按使用率排序一眼就能看到哪些數(shù)據(jù)存儲(chǔ)處于“緊急”狀態(tài)。這時(shí)候先記錄幾個(gè)關(guān)鍵數(shù)據(jù)總?cè)萘渴嵌嗌僖咽褂枚嗌偈S喽嗌龠@個(gè)數(shù)據(jù)存儲(chǔ)上跑著幾臺(tái)虛擬機(jī)然后點(diǎn)進(jìn)數(shù)據(jù)存儲(chǔ)的“文件”標(biāo)簽頁(yè)把所有文件按大小排序。這一步能幫你快速判斷是不是有某個(gè)“巨無(wú)霸”文件把空間吃了。正常情況下一個(gè)數(shù)據(jù)存儲(chǔ)里應(yīng)該只有虛擬機(jī)目錄和必要的模板文件如果看到幾十GB的vswp文件或者快照文件問(wèn)題基本就鎖定了。提示vCenter里的容量數(shù)字是按“文件占用”來(lái)統(tǒng)計(jì)的它無(wú)法反映底層存儲(chǔ)池的真實(shí)狀態(tài)。也就是說(shuō)哪怕ESXi數(shù)據(jù)存儲(chǔ)顯示有10%剩余DELL存儲(chǔ)池可能已經(jīng)快滿(mǎn)了兩者必須一起看。2.2 第二站ESXi主機(jī)命令行核實(shí)底層數(shù)字有時(shí)候vCenter界面會(huì)卡或者性能數(shù)據(jù)會(huì)延遲直接SSH登錄到ESXi主機(jī)上用命令行核實(shí)一下更靠譜。這里有幾個(gè)我必須推薦的基礎(chǔ)命令df -h這個(gè)命令可以從ESXi的視角看每個(gè)VMFS卷的使用率。再看一下數(shù)據(jù)存儲(chǔ)的文件列表ls -lh /vmfs/volumes/datastore1/如果想要找一個(gè)目錄里的大文件可以用du命令du -sh /vmfs/volumes/datastore1/*/用du排一遍那些幾十GB的快照目錄、備份目錄就全暴露出來(lái)了。還需要注意一點(diǎn)vSphere Client里顯示的使用率有時(shí)候會(huì)忽略一些系統(tǒng)預(yù)留空間但df和du是比較底層的統(tǒng)計(jì)更接近真實(shí)情況。2.3 第三站DELL存儲(chǔ)管理端查物理池ESXi數(shù)據(jù)存儲(chǔ)層面看完了再回頭看DELL的存儲(chǔ)管理界面。不同型號(hào)的DELL存儲(chǔ)操作界面不一樣MD系列用MD Storage ManagerPowerVault ME系列用PowerVault ManagerSC系列用Dell Storage Manager如果是PowerEdge服務(wù)器內(nèi)置的PERC陣列則用OpenManage Server AdministratorOMSA查看這些工具的共同作用是看清楚物理硬盤(pán)組成了幾個(gè)RAID組或存儲(chǔ)池每個(gè)池的理論容量是多少熱備盤(pán)狀態(tài)如何池實(shí)際使用率是多少。如果這里的池使用率已經(jīng)超過(guò)90%那么就算ESXi數(shù)據(jù)存儲(chǔ)還有空間物理層也已經(jīng)是“肚子快撐破”的狀態(tài)必須優(yōu)先處理。實(shí)際操作中我習(xí)慣把三層數(shù)據(jù)記錄在一張表里對(duì)比層級(jí)總?cè)萘恳咽褂檬S嗍褂寐蔞Mware數(shù)據(jù)存儲(chǔ)2.0TB1.94TB60GB97%DELL存儲(chǔ)池20TB19TB1TB95%虛擬機(jī)內(nèi)部C盤(pán)200GB198GB2GB99%哪一層最先爆掉就從哪一層開(kāi)始處理。但要注意三層往往是連動(dòng)的只有同時(shí)做清理和擴(kuò)容才能根治。3. 緊急處置實(shí)戰(zhàn)從止損到擴(kuò)容的完整流程診斷結(jié)束之后就進(jìn)入處理階段。我的處理順序固定為四步止損、清理、擴(kuò)容、恢復(fù)冗余。順序不能亂因?yàn)槿绻阆葎h文件再擴(kuò)容發(fā)現(xiàn)空間還是不夠虛擬機(jī)可能已經(jīng)因?yàn)镮O持續(xù)寫(xiě)入而出問(wèn)題了。3.1 立即止損別讓數(shù)據(jù)存儲(chǔ)徹底寫(xiě)滿(mǎn)當(dāng)數(shù)據(jù)存儲(chǔ)使用率超過(guò)95%時(shí)最先要做的事情是踩剎車(chē)。這里的“剎車(chē)”有兩層含義一是告訴所有同事暫時(shí)不要在緊急狀態(tài)的數(shù)據(jù)存儲(chǔ)上創(chuàng)建新虛擬機(jī)、做快照、復(fù)制大文件二是檢查那些正在高速寫(xiě)入日志的虛擬機(jī)必要時(shí)暫停它們的日志備份任務(wù)我在一次事故處理中就是因?yàn)闆](méi)有第一時(shí)間停止某臺(tái)SQL服務(wù)器的凌晨維護(hù)作業(yè)導(dǎo)致一個(gè)晚上時(shí)間數(shù)據(jù)存儲(chǔ)從93%直接干到100%最后虛擬機(jī)直接IO凍結(jié)。所以止損動(dòng)作一定要快哪怕只是口頭通知也比什么都不做好。如果環(huán)境里配置了vSphere High AvailabilityHA或者Storage DRS這時(shí)候也要檢查一下這些自動(dòng)化功能是否還在正常工作。數(shù)據(jù)存儲(chǔ)空間低于一定閾值時(shí)Storage DRS可能會(huì)觸發(fā)遷移操作但如果目標(biāo)數(shù)據(jù)存儲(chǔ)空間也不足遷移會(huì)失敗反而增加額外負(fù)載。3.2 空間清理實(shí)戰(zhàn)快照、日志、臨時(shí)文件逐個(gè)擊破止損之后開(kāi)始搶空間。按優(yōu)先級(jí)順序執(zhí)行第一步處理虛擬機(jī)的快照。用vSphere Client查看每臺(tái)虛擬機(jī)是否有快照。如果有先確認(rèn)這個(gè)快照是最近幾小時(shí)內(nèi)創(chuàng)建的比如升級(jí)前的備份如果是右鍵虛擬機(jī)→快照→刪除快照等待合并完成。這里的“刪除快照”不是刪除數(shù)據(jù)而是把快照的增量變化合并回原始VMDK。注意刪除快照的操作時(shí)間取決于快照文件的大小幾十GB的快照可能要等半小時(shí)以上。千萬(wàn)不能中途取消否則可能導(dǎo)致虛擬磁盤(pán)損壞。對(duì)于已經(jīng)無(wú)用的老舊快照刪除之后也要確認(rèn)空間釋放情況。我處理過(guò)一個(gè)案例快照文件顯示有120GB但刪除之后數(shù)據(jù)存儲(chǔ)只釋放了80GB剩下的空間被其他文件占著不得不再做下一步。第二步清理虛擬機(jī)內(nèi)部的大文件。如果快照清理后空間依然緊張接著做虛擬機(jī)內(nèi)部清理。通過(guò)vSphere控制臺(tái)登錄到每臺(tái)虛擬機(jī)檢查以下幾個(gè)方面Windows系統(tǒng)的C盤(pán)剩余空間清理臨時(shí)文件夾%TEMP%C:\Windows\TempWindows更新的緩存文件C:\Windows\SoftwareDistribution\Download各數(shù)據(jù)庫(kù)日志文件和歷史備份文件應(yīng)用程序日志目錄這里的常用工具是Windows自帶的“磁盤(pán)清理”或者cleanmgr也可以用PowerShell把可執(zhí)行文件、垃圾緩存一并處理。第三步清理數(shù)據(jù)存儲(chǔ)里的冗余文件。打開(kāi)vSphere的數(shù)據(jù)存儲(chǔ)瀏覽器找到那些明顯不需要的文件。常見(jiàn)的有過(guò)去的舊系統(tǒng)ISO安裝鏡像長(zhǎng)期不用的虛擬機(jī)模板備份留下的VMDK副本孤兒vswp文件即虛擬機(jī)已關(guān)閉但vswp沒(méi)被清理的殘留在刪除這些文件之前先確認(rèn)它們確實(shí)沒(méi)有業(yè)務(wù)用途。我一般會(huì)把疑似不需要的文件先移動(dòng)到一個(gè)“待刪除”文件夾觀(guān)察一周確認(rèn)沒(méi)有問(wèn)題再?gòu)氐浊謇怼?.3 擴(kuò)容操作全解VMFS在線(xiàn)擴(kuò)容和新增LUN清理只能解決“燃眉之急”如果虛擬機(jī)長(zhǎng)期增長(zhǎng)擴(kuò)容永遠(yuǎn)是終局方案。擴(kuò)容有兩個(gè)方向給現(xiàn)有數(shù)據(jù)存儲(chǔ)擴(kuò)容或者新建一個(gè)更大的數(shù)據(jù)存儲(chǔ)。方向一給現(xiàn)有VMFS數(shù)據(jù)存儲(chǔ)在線(xiàn)擴(kuò)容這個(gè)過(guò)程是在VMware層面完成的。前提是底層的DELL存儲(chǔ)還有未分配的空間并且你的LUN已經(jīng)映射到ESXi主機(jī)。操作路徑為在vSphere Client中選擇目標(biāo)ESXi主機(jī)點(diǎn)擊“存儲(chǔ)”→ 選擇要擴(kuò)容的VMFS數(shù)據(jù)存儲(chǔ)點(diǎn)擊“增加容量”Increase Capacity選擇“擴(kuò)大現(xiàn)有VMFS數(shù)據(jù)存儲(chǔ)”選擇空余的存儲(chǔ)設(shè)備或者擴(kuò)展設(shè)備設(shè)置擴(kuò)容大小點(diǎn)擊“確定”整個(gè)擴(kuò)容過(guò)程可以在線(xiàn)完成虛擬機(jī)不需要停機(jī)。擴(kuò)容完成后數(shù)據(jù)存儲(chǔ)的總?cè)萘繒?huì)立即增加。方向二新增LUN并創(chuàng)建新數(shù)據(jù)存儲(chǔ)這是更常用也更安全的做法。在DELL存儲(chǔ)管理端從存儲(chǔ)池中劃分出一個(gè)新的LUN映射給ESXi主機(jī)然后在ESXi里執(zhí)行“新建數(shù)據(jù)存儲(chǔ)”操作選擇這個(gè)新LUN并格式化為VMFS文件系統(tǒng)。創(chuàng)建完成后需要把這臺(tái)數(shù)據(jù)存儲(chǔ)上的部分虛擬機(jī)遷移過(guò)去以此平衡容量壓力。遷移方式用Storage vMotion可以在線(xiàn)遷移虛擬機(jī)不用停機(jī)。3.4 收尾調(diào)整告警閾值和存儲(chǔ)推薦處理完容量之后必做的收尾工作是調(diào)整閾值否則下次告警還會(huì)以同樣方式提醒你。VMware里可以自定義數(shù)據(jù)存儲(chǔ)的使用率告警閾值比如把“警告”調(diào)整到80%“緊急”調(diào)整到90%這是給自己留出更充足的反應(yīng)時(shí)間。另外一個(gè)重要操作是在DELL存儲(chǔ)管理端如果存儲(chǔ)池支持自動(dòng)分級(jí)或者分層存儲(chǔ)可以根據(jù)熱點(diǎn)數(shù)據(jù)情況啟用相關(guān)功能讓熱數(shù)據(jù)放到高性能盤(pán)上冷數(shù)據(jù)下沉到大容量盤(pán)上從而減少整體池容量的壓力。4. 實(shí)操中常見(jiàn)的坑與排查技巧容量處理流程寫(xiě)起來(lái)順實(shí)際操作中全是坑。下面這幾個(gè)問(wèn)題我在不同環(huán)境里反復(fù)遇到過(guò)單獨(dú)列出來(lái)給大家避雷。4.1 刪除快照之后空間沒(méi)有立即釋放最常見(jiàn)的問(wèn)題。刪除快照后vSphere界面顯示的數(shù)據(jù)存儲(chǔ)使用率可能半小時(shí)都不掉。這不一定代表沒(méi)釋放而是VMFS卷的空間統(tǒng)計(jì)有延遲。經(jīng)驗(yàn)做法是等10到15分鐘然后SSH登錄ESXi用df -h看實(shí)際空間。esxi對(duì)VMFS卷的空間管理是延遲回收的這一點(diǎn)不是故障是正常機(jī)制。如果過(guò)了很久空間確實(shí)沒(méi)有釋放需要確認(rèn)是否還有另一個(gè)快照存在或者虛擬機(jī)本身處于“已暫??煺铡钡臓顟B(tài)。另外如果虛擬機(jī)磁盤(pán)是精簡(jiǎn)置備刪除快照后還會(huì)有一個(gè)“空間重新認(rèn)領(lǐng)”的過(guò)程需要執(zhí)行esxcli storage vmfs unmap來(lái)讓底層存儲(chǔ)真正回收空間。esxcli storage vmfs unmap --volume-labeldatastore1 --reclaim-unit20484.2 明明刪掉了一個(gè)大文件但是使用率沒(méi)變化這種情況大概率是因?yàn)閯h除操作是在Windows虛擬機(jī)內(nèi)部做的而ESXi層面的VMDK文件大小并沒(méi)有變化。原因在于VMDK是虛擬磁盤(pán)文件刪除虛擬機(jī)內(nèi)部的文件只會(huì)在VMDK內(nèi)部進(jìn)行文件空洞不會(huì)自動(dòng)從VMDK釋放回?cái)?shù)據(jù)存儲(chǔ)。解決辦法是使用esxcli storage vmfs unmap命令執(zhí)行UNMAP操作讓精簡(jiǎn)置備的VMDK把未使用的塊歸還給數(shù)據(jù)存儲(chǔ)。前提是底層的DELL存儲(chǔ)支持自動(dòng)精簡(jiǎn)回收。如果不支持可以考慮定期整理比如每個(gè)季度做一次全量UNMAP。4.3 精簡(jiǎn)置備的“容量幻覺(jué)”這是一個(gè)非常隱蔽的坑。ESXi用Thin Provisioning創(chuàng)建虛擬磁盤(pán)時(shí)初始文件很小只有幾GB但它會(huì)隨著虛擬機(jī)內(nèi)部寫(xiě)入逐漸增長(zhǎng)。你把一個(gè)500GB的精簡(jiǎn)盤(pán)給了一臺(tái)虛擬機(jī)實(shí)際復(fù)制300GB數(shù)據(jù)進(jìn)去VMDK文件就增長(zhǎng)到了300GB。如果你給二十臺(tái)虛擬機(jī)都做了500GB精簡(jiǎn)盤(pán)實(shí)際每臺(tái)只用100GB那么總占用是2TB看起來(lái)不多。但由于虛擬化環(huán)境是多層共享的這2TB的占用已經(jīng)算進(jìn)了數(shù)據(jù)存儲(chǔ)容量。如果再疊加快照和系統(tǒng)日志容量爆得比誰(shuí)都快。應(yīng)對(duì)方案在新環(huán)境里盡量合理評(píng)估虛擬機(jī)真實(shí)容量需求重要數(shù)據(jù)庫(kù)用Thick置備或者Eager Zeroed Thick普通應(yīng)用用Thin置備但定期檢查增長(zhǎng)趨勢(shì)。4.4 Storage DRS閾值設(shè)置不當(dāng)引發(fā)的“假緊急”有集群環(huán)境的朋友如果開(kāi)了Storage DRS會(huì)發(fā)現(xiàn)數(shù)據(jù)存儲(chǔ)的使用率一直徘徊在85%左右但偶爾會(huì)跳到“緊急”狀態(tài)。這有可能是Storage DRS的I/O負(fù)載均衡閾值太敏感導(dǎo)致的I/O平衡建議和容量本身沒(méi)關(guān)系。檢查方法是在vSphere Client里看Storage DRS的推薦報(bào)告區(qū)分是I/O負(fù)載遷移還是空間容量遷移。I/O負(fù)載遷移只影響性能不影響可用性但如果你把I/O和空間閾值都設(shè)置得比較激進(jìn)會(huì)頻繁產(chǎn)生遷移動(dòng)作徒增壓力。4.5 擴(kuò)容后DELL存儲(chǔ)LUN映射不對(duì)給ESXi擴(kuò)容時(shí)最容易出現(xiàn)的操作失誤是在DELL存儲(chǔ)上劃分了新LUN卻沒(méi)有正確映射給ESXi主機(jī)或者映射了但主機(jī)沒(méi)重新掃描。處理方式是在vCenter里選擇對(duì)應(yīng)的ESXi主機(jī)點(diǎn)擊“存儲(chǔ)”→“重新掃描存儲(chǔ)”讓主機(jī)重新掃描所有的存儲(chǔ)適配器、存儲(chǔ)設(shè)備然后新LUN才會(huì)出現(xiàn)在可用設(shè)備列表里。DELL存儲(chǔ)上的映射一般有三種方式LUN映射到主機(jī)組、LUN映射到主機(jī)、LUN映射到端口組。如果之前已經(jīng)建好了主機(jī)組新LUN加入時(shí)記得同時(shí)加入對(duì)應(yīng)主機(jī)否則主機(jī)掃描不到設(shè)備。4.6 別忘了一個(gè)很小的點(diǎn)vSphere HA的心跳數(shù)據(jù)存儲(chǔ)如果集群開(kāi)啟了vSphere HA系統(tǒng)會(huì)選擇一個(gè)數(shù)據(jù)存儲(chǔ)存放心跳文件這個(gè)文件非常小只有幾MB不會(huì)占用太多空間。但問(wèn)題是如果這個(gè)數(shù)據(jù)存儲(chǔ)滿(mǎn)了HA可能會(huì)失去心跳觸發(fā)虛擬機(jī)在另一臺(tái)主機(jī)上重啟造成宕機(jī)。所以容量緊急時(shí)要特別留意當(dāng)前告警的數(shù)據(jù)存儲(chǔ)是否就是HA心跳所在的數(shù)據(jù)存儲(chǔ)。如果是清理時(shí)的首選遷移目標(biāo)要避開(kāi)這臺(tái)防止HA誤判。5. 關(guān)于處理優(yōu)先級(jí)的兩點(diǎn)心得處理容量緊急問(wèn)題我踩過(guò)不少坑之后總結(jié)出兩個(gè)很重要的原則寫(xiě)在這里供大家參考。第一永遠(yuǎn)先保數(shù)據(jù)再保業(yè)務(wù)。如果數(shù)據(jù)存儲(chǔ)真的滿(mǎn)了虛擬機(jī)已經(jīng)IO凍結(jié)千萬(wàn)不要強(qiáng)行做快照刪除。正確的操作是先給虛擬機(jī)關(guān)機(jī)或掛起再處理否則可能導(dǎo)致虛擬機(jī)文件系統(tǒng)損壞甚至整塊虛擬磁盤(pán)無(wú)法掛載。有一次我就遇到虛擬機(jī)在滿(mǎn)盤(pán)狀態(tài)下直接崩潰結(jié)果VMDK的文件系統(tǒng)部分區(qū)域損壞被迫用快照文件恢復(fù)整個(gè)過(guò)程折騰了四個(gè)小時(shí)。第二容量告警類(lèi)問(wèn)題能立刻處理的立刻處理不能立刻處理的也要留下一臺(tái)維護(hù)窗口。很多人看到“緊急”兩個(gè)字覺(jué)得很?chē)?yán)重但其實(shí)如果你每天都有固定的巡檢習(xí)慣這種問(wèn)題是可以避免的。我現(xiàn)在每周一都會(huì)寫(xiě)一個(gè)腳本巡檢所有數(shù)據(jù)存儲(chǔ)和DELL存儲(chǔ)池的使用率超過(guò)80%就在群里發(fā)預(yù)警。這樣發(fā)現(xiàn)問(wèn)題的時(shí)候基本不會(huì)走到“緊急”這一步。容量管理本質(zhì)上就是一層窗戶(hù)紙捅破了之后你會(huì)發(fā)現(xiàn)處理流程無(wú)非就是查、清、擴(kuò)、防四個(gè)字。真正難的是平時(shí)有沒(méi)有養(yǎng)成習(xí)慣以及告警真正來(lái)臨的時(shí)候能不能冷靜地按順序操作。希望這篇東西對(duì)你有用。