巡檢命令詳解:從基礎(chǔ)準(zhǔn)備到自動(dòng)化腳本)
簡(jiǎn)介面向H3C交換機(jī)運(yùn)維與管理場(chǎng)景這份實(shí)操型巡檢命令文檔匯總了設(shè)備日常健康檢查最常用的8類(lèi)核心命令覆蓋CPU使用率、內(nèi)存占用、設(shè)備溫度、匯總信息、風(fēng)扇與電源狀態(tài)、系統(tǒng)時(shí)間及接口狀態(tài)等關(guān)鍵監(jiān)測(cè)維度。每條命令均給出標(biāo)準(zhǔn)語(yǔ)法格式、回顯輸出示例及結(jié)果解讀能夠幫助管理員快速判斷設(shè)備運(yùn)行是否正常及時(shí)發(fā)現(xiàn)并排查潛在故障隱患。資源包僅含1個(gè)doc文檔大小約21KB輕量便于下載后隨時(shí)查閱適合網(wǎng)絡(luò)工程師、數(shù)據(jù)中心運(yùn)維人員及H3C設(shè)備管理員用于制定標(biāo)準(zhǔn)化巡檢清單或開(kāi)展例行設(shè)備檢查。目前已有588人學(xué)習(xí)下載。文檔內(nèi)容以實(shí)際設(shè)備輸出為參照對(duì)CPU近期平均使用率、內(nèi)存使用率、熱點(diǎn)溫度告警閾值、風(fēng)扇Normal/Abnormal判定等關(guān)鍵指標(biāo)逐一做了說(shuō)明讀者可直接對(duì)照自己設(shè)備的回顯信息進(jìn)行健康度評(píng)估提升日常巡檢效率與故障定位準(zhǔn)確性。1. H3C交換機(jī)巡檢命令為什么這套命令值得你背下來(lái)半夜被電話(huà)叫醒說(shuō)核心交換機(jī)端口瘋狂閃斷業(yè)務(wù)時(shí)斷時(shí)續(xù)。趕到機(jī)房接console敲命令手忙腳亂——這種場(chǎng)景里一份H3C交換機(jī)巡檢命令清單就是后悔藥。它不是拿來(lái)應(yīng)付檢查的而是幫你把CPU、內(nèi)存、端口、日志、堆疊、聚合口這些最常出問(wèn)題的位置用最短時(shí)間掃一遍留下可對(duì)比的記錄。這套巡檢思路適合機(jī)房運(yùn)維、中小企業(yè)網(wǎng)管也適合剛接手H3C設(shè)備的新人。下面從命令拆解到腳本落地把怎么用、參數(shù)怎么看、坑在哪一次講透。2. 巡檢前的基礎(chǔ)準(zhǔn)備先解決登錄方式與基線(xiàn)存檔2.1 登錄H3C設(shè)備的三種方式Console、Telnet、SSH怎么選巡檢的第一步不是敲命令是能穩(wěn)定連上設(shè)備。H3C設(shè)備常見(jiàn)三種登錄方式各有各的適用場(chǎng)景。Console口是最后手段帶外管理不依賴(lài)業(yè)務(wù)網(wǎng)絡(luò)。交換機(jī)起不來(lái)、IP配置錯(cuò)誤、SSH失效時(shí)只能靠它。但Console線(xiàn)比較嬌貴USB轉(zhuǎn)Console串口線(xiàn)的芯片兼容性是典型的“玄學(xué)”問(wèn)題——有些便宜線(xiàn)在Windows 10/11下認(rèn)不出串口驅(qū)動(dòng)裝了一堆還是沒(méi)反應(yīng)。建議手頭備一條FTDI芯片的轉(zhuǎn)接線(xiàn)別在深夜救火時(shí)掉鏈子。Telnet是明文協(xié)議在可信內(nèi)網(wǎng)里巡檢沒(méi)問(wèn)題跨公網(wǎng)或半信任網(wǎng)絡(luò)就不要用了。H3C很多老設(shè)備默認(rèn)開(kāi)Telnet登錄密碼和配置命令全部明文抓包就能看到。生產(chǎn)環(huán)境能不開(kāi)就不開(kāi)至少要限制管理網(wǎng)段訪(fǎng)問(wèn)。SSH是巡檢首選配置一次以后一直用。在H3C設(shè)備上開(kāi)啟SSH的完整步驟system-view public-key local create rsa ssh server enable local-user admin password simple Admin123 local-user admin service-type ssh local-user admin authorization-attribute user-role network-admin ssh user admin service-type all authentication-type password quit save force這段配置做了四件事生成RSA主機(jī)密鑰、開(kāi)啟SSH服務(wù)、創(chuàng)建本地用戶(hù)并授予network-admin角色、把這個(gè)用戶(hù)綁定到SSH服務(wù)。注意public-key local create rsa必須執(zhí)行否則SSH服務(wù)起不來(lái)save force一定要做否則重啟后配置丟失下次巡檢又連不上。實(shí)際登錄時(shí)我一般用SecureCRT就是網(wǎng)工常說(shuō)的CRT或Xshell。CRT里建會(huì)話(huà)時(shí)選擇SSH2、端口22認(rèn)證方式選password。有一個(gè)高頻坑H3C新版本默認(rèn)只支持SSH 2.0老版本客戶(hù)端算法不匹配會(huì)直接報(bào)No compatible algorithm。這時(shí)候優(yōu)先升級(jí)客戶(hù)端別去設(shè)備上關(guān)算法那是自降安全級(jí)別。2.2 建立巡檢基線(xiàn)第一次巡檢先存檔后面才有對(duì)比巡檢最重要的不是看絕對(duì)值是看變化量。CPU利用率30%算不算高對(duì)一臺(tái)轉(zhuǎn)發(fā)量很小的接入交換機(jī)來(lái)說(shuō)偏高對(duì)一臺(tái)跑著OSPF/BGP的核心設(shè)備來(lái)說(shuō)很輕松。所以第一次巡檢時(shí)把每臺(tái)設(shè)備的輸出完整存一份這就是基線(xiàn)。基線(xiàn)存什么我一般分三層。第一層是身份信息display version、display device、display inventory記錄設(shè)備型號(hào)、序列號(hào)、軟件版本、單板狀態(tài)。設(shè)備升級(jí)、更換備件之后這些信息必須跟著更新否則半年后翻報(bào)告不知道當(dāng)時(shí)跑的是什么版本。第二層是運(yùn)行狀態(tài)display cpu、display memory、display interface brief、display fan、display power、display temperature這是每次巡檢必看的六條。第三層是協(xié)議與業(yè)務(wù)狀態(tài)display ospf peer、display bgp peer、display stp、display vlan、display mac-address看你網(wǎng)絡(luò)里實(shí)際跑了什么就存什么。接入交換機(jī)沒(méi)跑OSPF就不用存?;€(xiàn)的存檔格式我用一個(gè)簡(jiǎn)單約定按設(shè)備IP建目錄文件名帶日期。inventory/192.168.10.1/20250610_display_cpu.txt inventory/192.168.10.1/20250610_display_interface_brief.txt inventory/192.168.10.1/20250610_logbuffer.txt不搞數(shù)據(jù)庫(kù)不搞CMDB純文本文件就夠了。后面做對(duì)比用diff拉兩個(gè)日期的文件看一眼diff inventory/192.168.10.1/20250501_display_interface_brief.txt inventory/192.168.10.1/20250610_display_interface_brief.txt有變化的地方diff會(huì)標(biāo)出來(lái)哪里變了心里有數(shù)。比如某臺(tái)接入交換機(jī)多了一個(gè)Down端口或者聚合組成員數(shù)量變了diff一眼就能看到。提示基線(xiàn)不是存一次就完事。每次變更窗口后比如加VLAN、改聚合口、升級(jí)版本都要重新抓一次相關(guān)部分的輸出把基線(xiàn)滾到最新?;€(xiàn)過(guò)期了對(duì)比就沒(méi)意義。3. 核心巡檢命令逐條拆解CPU、內(nèi)存、端口、日志一個(gè)不落3.1 CPU與內(nèi)存display cpu 和 display memory 的關(guān)鍵指標(biāo)CPU利用率是設(shè)備健康的晴雨表。H3C設(shè)備上執(zhí)行H3C display cpu Slot 1 CPU 0: CPU utilization statistics in 5 seconds: 3% CPU utilization statistics in 1 minute: 5% CPU utilization statistics in 5 minutes: 4%在單臺(tái)設(shè)備上這三行輸出很直觀(guān)。5秒瞬時(shí)值看一眼重點(diǎn)是1分鐘和5分鐘的均值。CPU持續(xù)在80%以上就要查是什么業(yè)務(wù)在吃資源。但display cpu看不到CPU占用是中斷高還是進(jìn)程高。要往下挖一層用display cpu-usage task看具體進(jìn)程占用或者用display cpu history看歷史曲線(xiàn)。有些型號(hào)還支持直接查看每個(gè)核的利用率多核設(shè)備某個(gè)單核跑滿(mǎn)是常見(jiàn)現(xiàn)象尤其是部署了ACL、NAT這類(lèi)消耗CPU的業(yè)務(wù)時(shí)。這里順便說(shuō)一句熱詞里常被問(wèn)到的“CPU和vCPU關(guān)系”。在IRF堆疊環(huán)境或者H3C的虛擬化產(chǎn)品上物理機(jī)上多個(gè)vCPU共享物理核心在虛擬交換機(jī)里敲display cpu看到的利用率并不等于它在物理宿主機(jī)上的真實(shí)占用。做容量規(guī)劃時(shí)別拿總核數(shù)直接換算先看宿主機(jī)層面分配給這臺(tái)虛擬交換機(jī)的CPU份額。巡檢時(shí)出現(xiàn)虛擬交換機(jī)CPU高要去宿主機(jī)上看真實(shí)負(fù)載別只在虛擬層找原因很容易誤判。內(nèi)存看display memoryH3C display memory Slot 1: Memory utilization statistics in 5 seconds: 25% Memory utilization statistics in 1 minute: 23% Memory utilization statistics in 5 minutes: 22%這里有個(gè)容易踩的坑H3C不同軟件版本對(duì)“已用內(nèi)存占比”的計(jì)算基數(shù)不同。老版本Comware V5的25%和新版本Comware V7的25%含義不完全一樣V7把文件緩存也算進(jìn)已用內(nèi)存??绨姹緦?duì)比時(shí)別直接比數(shù)值同一批設(shè)備同版本之間比才有意義。配套看單板狀態(tài)用display device這條命令輸出各單板、電源、風(fēng)扇的運(yùn)行狀態(tài)。巡檢時(shí)把它和display fan、display power、display temperature一起跑硬件層面就齊了。3.2 端口與鏈路display interface 輸出里的告警信號(hào)端口是故障高發(fā)區(qū)也是巡檢命令的重頭戲。先看總覽H3C display interface brief Interface Link Protocol InLoop PortType VLAN Description GE1/0/1 UP UP UP access 1 to-core GE1/0/2 DOWN DOWN DOWN access 10 office GE1/0/3 UP DOWN DOWN access 20 idle ...看Link和Protocol兩列。Link是物理層狀態(tài)Protocol是鏈路層協(xié)議狀態(tài)。物理UP、協(xié)議DOWN多半是配置問(wèn)題比如VLAN沒(méi)放通、端口被shutdown物理DOWN直接查線(xiàn)纜和光模塊。如果Description里標(biāo)注了業(yè)務(wù)信息比如to-core、to-print-server巡檢時(shí)一眼就能看出哪個(gè)端口重要選擇性地優(yōu)先處理。單端口詳細(xì)狀態(tài)用display interface GigabitEthernet1/0/1重點(diǎn)看Input/Output的錯(cuò)誤計(jì)數(shù)H3C display interface GigabitEthernet1/0/1 GigabitEthernet1/0/1 Current state: UP Line protocol state: UP Description: to-core Bandwidth: 100000 kbps ... Input: 123456 packets, 789012 bytes Input errors: CRC: 0, FCS: 0, giants: 0, runts: 0 Output: 123456 packets, 456789 bytes Output errors: collisions: 0, aborts: 0, deferred: 0CRC錯(cuò)誤持續(xù)增長(zhǎng)是物理層問(wèn)題的強(qiáng)信號(hào)——線(xiàn)纜老化、光模塊光功率下降、電磁干擾都會(huì)導(dǎo)致CRC。每次巡檢時(shí)記錄CRC數(shù)值下次對(duì)比有沒(méi)有增長(zhǎng)比只看當(dāng)前值可靠得多。光模塊狀態(tài)用display transceiver interface GigabitEthernet1/0/1Transceiver information: Transceiver type: 1000_BASE_SX_SFP Connector type: LC Wavelength: 850nm ... Diagnostic information: Temperature: 42 Celsius Voltage: 3.30 V Bias current: 6.2 mA TX power: -2.5 dBm RX power: -10.8 dBmRX power接收光功率是重點(diǎn)。不同模塊接收靈敏度不同一般-20dBm以下要警惕但最可靠的標(biāo)準(zhǔn)是看模塊本身的告警閾值——在display transceiver diagnosis里通常有高/低告警門(mén)限。TX和RX功率比剛裝機(jī)時(shí)掉3dB以上哪怕沒(méi)到閾值也要備好替換模塊。光模塊老化是不定時(shí)炸彈巡檢的意義就在于提前發(fā)現(xiàn)。3.3 日志與告警display logbuffer 與 trap 信息的篩選技巧日志是事故現(xiàn)場(chǎng)的監(jiān)控錄像。H3C設(shè)備日志默認(rèn)存在logbuffer里用display logbuffer查看H3C display logbuffer Log buffer: 512 entries, 300 used, 212 free ... %Jun 10 03:22:15 2025 IFNET/3/LINK_UPDOWN: GigabitEthernet1/0/5 changed state to DOWN.日志條目多的時(shí)候翻屏不現(xiàn)實(shí)用管道加過(guò)濾條件H3C display logbuffer | include LINK_UPDOWN H3C display logbuffer | include PPPOE|IFNETinclude后面支持正則把多個(gè)關(guān)鍵字用|隔開(kāi)一次篩完。巡檢時(shí)重點(diǎn)看兩類(lèi)一類(lèi)是LINK_UPDOWN、IFNET這類(lèi)端口狀態(tài)抖動(dòng)另一類(lèi)是AAA、SSH、LOGIN這類(lèi)登錄相關(guān)告警——如果有人深夜反復(fù)登錄失敗可能是暴力破解。Trap緩存用display trapbuffer查看。它和logbuffer內(nèi)容有重疊但更偏SNMP事件。巡檢時(shí)兩邊都看一眼重點(diǎn)看有沒(méi)有重復(fù)刷屏的告警一條端口up/down告警幾分鐘內(nèi)出現(xiàn)幾十次說(shuō)明物理鏈路在抽風(fēng)光模塊可能要報(bào)廢。display diagnostic-information是最后的兜底一條命令打包所有狀態(tài)信息輸出量大可以直接重定向到設(shè)備存儲(chǔ)里H3C display diagnostic-information diag.txt平時(shí)巡檢不必每次跑遇到疑難雜癥時(shí)配合抓包用。這份文件導(dǎo)出后發(fā)給H3C技術(shù)支持或自己留檔都是排查問(wèn)題的完整素材。4. 把巡檢命令變成腳本批量執(zhí)行與結(jié)果歸檔的落地做法4.1 用 plink 批處理跑批量巡檢的最小腳本設(shè)備數(shù)量一多一臺(tái)臺(tái)敲命令不現(xiàn)實(shí)。最輕量的做法是用plinkPuTTY自帶的命令行工具加Windows批處理不需要裝額外軟件。先準(zhǔn)備命令清單文件注意第一行必須是關(guān)分頁(yè)的命令screen-length disable temporary display version display device display cpu display memory display interface brief display logbufferscreen-length disable temporary是H3C設(shè)備關(guān)閉分頁(yè)顯示的臨時(shí)命令。不關(guān)分頁(yè)的話(huà)輸出超過(guò)一屏設(shè)備會(huì)停下來(lái)等待按鍵腳本就會(huì)卡死這是所有自動(dòng)化連網(wǎng)絡(luò)設(shè)備的第一個(gè)坑。批處理腳本echo off set HOST192.168.10.1 set USERadmin set PASSAdmin123 plink -ssh -l %USER% -pw %PASS% -batch -m commands.txt %HOST% output_%HOST%.txt-m參數(shù)讓plink逐行執(zhí)行commands.txt里的命令-batch跳過(guò)主機(jī)密鑰確認(rèn)和交互提示。如果plink版本支持-pwfile可以用它代替-pw密碼不直接暴露在命令行參數(shù)里更安全。這個(gè)腳本會(huì)把所有命令的輸出拼到一個(gè)文件里不方便按命令歸檔。改進(jìn)一下用循環(huán)逐條執(zhí)行echo off set HOST192.168.10.1 set USERadmin set PASSAdmin123 set DATE%date:~0,4%%date:~5,2%%date:~8,2% for /f %%i in (commands.txt) do ( echo %%i output_%HOST%_%DATE%.txt plink -ssh -l %USER% -pw %PASS% -batch %HOST% %%i output_%HOST%_%DATE%.txt )%date:~0,4%%date:~5,2%%date:~8,2%是拼接當(dāng)天日期的寫(xiě)法生成類(lèi)似20250610的文件名。注意for循環(huán)內(nèi)部引用變量要用%%i而不是%i這是批處理的經(jīng)典翻車(chē)點(diǎn)第一次寫(xiě)很容易錯(cuò)。4.2 用 Python 做閾值解析與結(jié)果歸檔批處理適合快速抓取要做閾值判斷和格式化報(bào)告還是Python方便。用netmiko庫(kù)連設(shè)備它能自動(dòng)處理交互和分頁(yè)from netmiko import ConnectHandler import re device { device_type: h3c, ip: 192.168.10.1, username: admin, password: Admin123, } with ConnectHandler(**device) as conn: conn.send_command(screen-length disable temporary) cpu_output conn.send_command(display cpu) mem_output conn.send_command(display memory) intf_output conn.send_command(display interface brief) cpu_match re.search(rCPU utilization statistics in 5 seconds:\s*(\d)%, cpu_output) mem_match re.search(rMemory utilization statistics in 5 seconds:\s*(\d)%, mem_output) cpu_usage int(cpu_match.group(1)) if cpu_match else -1 mem_usage int(mem_match.group(1)) if mem_match else -1 if cpu_usage 80 or mem_usage 80: print(f[WARN] {device[ip]} CPU{cpu_usage}% MEM{mem_usage}%)with ConnectHandler會(huì)自動(dòng)登錄并在退出時(shí)斷開(kāi)連接screen-length disable temporary先關(guān)分頁(yè)后面每條命令的輸出就不會(huì)被截?cái)?。正則從輸出里抽出百分比數(shù)值超過(guò)閾值打印告警。再補(bǔ)充一個(gè)統(tǒng)計(jì)DOWN端口的片段down_ports re.findall(r(\S)\sDOWN, intf_output) if down_ports: print(f[INFO] {len(down_ports)} down ports: {down_ports})這個(gè)片段批量巡檢上千臺(tái)接入交換機(jī)時(shí)很實(shí)用只把有異常的設(shè)備列出來(lái)正常的直接忽略。4.3 為什么我不推薦現(xiàn)成的“一鍵生成命令工具”有人把巡檢命令封裝成Web工具填I(lǐng)P、用戶(hù)名密碼一鍵跑完所有命令生成報(bào)告。這類(lèi)工具有個(gè)共同問(wèn)題把設(shè)備密碼交給第三方頁(yè)面命令執(zhí)行過(guò)程不可審計(jì)。出故障時(shí)拿著工具生成的報(bào)告別人問(wèn)“這條命令的輸出完整嗎中間有沒(méi)有失敗的命令”你答不上來(lái)。自己維護(hù)一套腳本雖然土但每一步都在掌控里。腳本本身就是你的巡檢知識(shí)庫(kù)加了什么命令、改了哪個(gè)參數(shù)同事接手時(shí)看腳本就懂。做運(yùn)維可控比方便重要。5. H3C巡檢避坑手冊(cè)堆疊、聚合口、日期同步與模擬器5.1 IRF堆疊巡檢display irf 的輸出怎么看H3C的堆疊叫IRF多條物理鏈路把兩臺(tái)或多臺(tái)設(shè)備虛擬成一臺(tái)邏輯設(shè)備。巡檢IRF環(huán)境第一件事是看成員是否完整H3C display irf Member Role Priority CPU MAC Description *1 Master 32 1 000c-29a0-xxxx Member 2 Standby 15 2 000c-29a1-yyyy Member*1表示當(dāng)前登錄的設(shè)備是Master帶的是本設(shè)備。巡檢要點(diǎn)成員設(shè)備里必須存在Standby角色如果全是Master沒(méi)有備說(shuō)明堆疊分裂了——這是大故障。正常情況下堆疊里的Master和Standby各司其職Standby的優(yōu)先級(jí)低于Master防止異常重啟后角色漂移。用display irf topology看拓?fù)涫欠裢暾麅蓚€(gè)成員之間堆疊鏈路應(yīng)該顯示正常。堆疊分裂是H3C網(wǎng)絡(luò)里最嚴(yán)重的故障之一成員設(shè)備之間堆疊線(xiàn)斷了每臺(tái)設(shè)備都認(rèn)為自己是Master全網(wǎng)路由被攪亂業(yè)務(wù)直接癱瘓。巡檢時(shí)發(fā)現(xiàn)成員數(shù)量少了或者拓?fù)洳煌暾R上處理不能等。5.2 聚合口“滿(mǎn)了”display link-aggregation 的邊界判斷聚合口滿(mǎn)通常有兩層意思一是成員端口數(shù)量到了上限二是流量hash不均導(dǎo)致單個(gè)成員端口打滿(mǎn)。巡檢先看聚合概要H3C display link-aggregation summary Aggregation Interface Type Oper Status Member Ports Bridge-Aggregation1 Static UP GE1/0/1 GE1/0/2重點(diǎn)看Oper Status和Member Ports。Oper Status不是UP聚合口就是壞的Member Ports比預(yù)期少先查被移除的端口為什么掉線(xiàn)。聚合口成員數(shù)量有上限不同設(shè)備平臺(tái)限制不同端口滿(mǎn)了再加不進(jìn)去業(yè)務(wù)側(cè)就會(huì)看到帶寬不夠的瓶頸。流量hash不均的問(wèn)題光看summary看不出來(lái)。用display counter rate interface看成員端口的實(shí)時(shí)流量H3C display counter rate interface GigabitEthernet1/0/1 H3C display counter rate interface GigabitEthernet1/0/2兩個(gè)成員端口一個(gè)跑滿(mǎn)一個(gè)閑置就是hash策略的問(wèn)題。常見(jiàn)原因聚合成員數(shù)不是2的冪次3條、5條這種或者業(yè)務(wù)流量源目MAC太少導(dǎo)致hash不到所有成員。解決思路是調(diào)整聚合的hash模式或者把成員數(shù)補(bǔ)到2的冪次。這個(gè)故障在熱詞里被搜成“聚合口滿(mǎn)了”實(shí)際排查路徑就是這么幾步不用急。5.3 設(shè)備時(shí)間不同步NTP配置與巡檢時(shí)間戳陷阱設(shè)備時(shí)間不準(zhǔn)是個(gè)低頻但致命的問(wèn)題。H3C S1850這類(lèi)設(shè)備默認(rèn)時(shí)間可能停在出廠(chǎng)狀態(tài)日志時(shí)間戳跟著錯(cuò)。巡檢時(shí)看logbuffer發(fā)現(xiàn)事件時(shí)間和你對(duì)不上第一反應(yīng)先看display clock。同步時(shí)間最省心的方式是NTP配置三條命令system-view ntp-service enable ntp-service unicast-server 192.168.10.254檢查同步狀態(tài)H3C display ntp-service status Clock status: synchronized Clock stratum: 3 ...關(guān)鍵看Clock status。顯示synchronized說(shuō)明已同步顯示unsynchronized說(shuō)明沒(méi)同步上檢查NTP服務(wù)器是否可達(dá)、UDP 123端口是否被防火墻攔截。熱詞里“h3c s1850 自動(dòng)同步網(wǎng)絡(luò)日期和時(shí)間”說(shuō)的就是這套NTP配置。時(shí)間不同步的巡檢陷阱在排查故障時(shí)暴露設(shè)備日志里的時(shí)間和你手表差好幾個(gè)小時(shí)拿著日志去對(duì)業(yè)務(wù)異常時(shí)間點(diǎn)怎么都對(duì)不上??鐧C(jī)房、跨時(shí)區(qū)場(chǎng)景更明顯。我的巡檢報(bào)告里會(huì)把每臺(tái)設(shè)備的時(shí)鐘偏差記下來(lái)偏差超過(guò)1分鐘的列為一類(lèi)隱患攢夠一批集中處理。5.4 模擬器與真機(jī)差異H3C模擬器設(shè)備啟動(dòng)失敗怎么排查熱詞里“h3c模擬器設(shè)備啟動(dòng)失敗”“h3c虛擬化軟件設(shè)備啟動(dòng)失敗”被搜得很多。我自己用HCLH3C Cloud Lab練巡檢命令時(shí)也踩過(guò)不少坑。常見(jiàn)失敗原因有三個(gè)。第一模擬器和VirtualBox版本沖突。HCL老版本依賴(lài)特定VirtualBox版本升級(jí)VirtualBox后設(shè)備起不來(lái)報(bào)錯(cuò)信息又很模糊。解決方式是卸載當(dāng)前VirtualBox重新安裝HCL自帶或官方文檔指定的版本。第二嵌套虛擬化沒(méi)開(kāi)。在虛擬機(jī)里跑HCL需要CPU支持并開(kāi)啟VT-x/AMD-VBIOS里沒(méi)開(kāi)的話(huà)設(shè)備啟動(dòng)直接失敗。物理機(jī)上跑則要確認(rèn)BIOS虛擬化功能是Enable。第三設(shè)備鏡像啟動(dòng)慢。HCL里的設(shè)備啟動(dòng)經(jīng)常要兩三分鐘界面看起來(lái)像卡死了實(shí)際在后臺(tái)跑。別急著關(guān)掉重開(kāi)等兩分鐘再看不遲。模擬器練的是命令流程和配置思路練不了真機(jī)的溫度和光功率——這兩項(xiàng)在模擬器里沒(méi)有對(duì)應(yīng)輸出。別在模擬器里找display temperature的輸出樣式真機(jī)上才有省得白費(fèi)功夫。6. 巡檢報(bào)告的提煉與驗(yàn)證一張表說(shuō)清設(shè)備健康度采集了命令輸出最后一步是把原始文本翻譯成能給別人看懂的結(jié)論。我習(xí)慣用一張健康度表匯總每臺(tái)設(shè)備一行檢查項(xiàng)巡檢命令良好需關(guān)注故障CPUdisplay cpu均值50%50-80%80%持續(xù)內(nèi)存display memory60%60-80%80%端口CRCdisplay interface無(wú)增長(zhǎng)單端口少量持續(xù)增長(zhǎng)光功率display transceiver在閾值內(nèi)接近閾值超閾值設(shè)備時(shí)間display clock/ntp-service statussynchronized偏差1分鐘unsynchronizedIRF堆疊display irf成員齊全缺Standby分裂鏈路聚合display link-aggregation summary成員完整UP少成員整組DOWN這張表就是巡檢報(bào)告的骨架。每臺(tái)設(shè)備按檢查項(xiàng)打勾綠色正常、黃色關(guān)注、紅色故障出問(wèn)題的設(shè)備附上關(guān)鍵輸出片段。網(wǎng)管拿這個(gè)表能直接決定要不要處理、什么時(shí)候處理不用再翻了原始輸出找結(jié)論。驗(yàn)證方法是必須做的一步腳本跑完之后抽一臺(tái)設(shè)備手動(dòng)連上去敲同一條命令對(duì)比輸出是否一致。自動(dòng)化和手動(dòng)結(jié)果不一致多半是分頁(yè)沒(méi)關(guān)、命令寫(xiě)錯(cuò)或者登錄到了錯(cuò)誤的設(shè)備——跳板機(jī)轉(zhuǎn)發(fā)配置錯(cuò)了腳本連的是A臺(tái)你以為在查B臺(tái)。這個(gè)習(xí)慣幫我抓出過(guò)一次腳本里IP寫(xiě)反的低級(jí)錯(cuò)誤從那以后每次跑完批量巡檢都抽檢一臺(tái)。我的固定節(jié)奏是每月1號(hào)和15號(hào)跑全量巡檢變更窗口后加跑一次關(guān)鍵設(shè)備。積累半年回頭看這些報(bào)告哪臺(tái)設(shè)備的CRC在緩慢增長(zhǎng)、哪臺(tái)CPU均值在悄悄爬升一目了然。這套笨辦法比任何監(jiān)控系統(tǒng)都靠譜——監(jiān)控系統(tǒng)告訴你“現(xiàn)在壞了”巡檢報(bào)告告訴你“快要壞了”。希望幫到你。本文還有配套的精品資源點(diǎn)擊獲取