維實(shí)戰(zhàn)指南:從開(kāi)機(jī)到自愈)
簡(jiǎn)介本資源是深信服超融合HCIHyper-Converged Infrastructure6.7.0R3版本的官方用戶(hù)及部署手冊(cè)面向IT基礎(chǔ)設(shè)施工程師、虛擬化運(yùn)維人員與超融合系統(tǒng)實(shí)施技術(shù)人員聚焦超融合架構(gòu)落地中的核心問(wèn)題從整體技術(shù)架構(gòu)理解、硬件與網(wǎng)絡(luò)配置要求到集群部署、系統(tǒng)初始化及典型應(yīng)用場(chǎng)景實(shí)踐。文檔內(nèi)容體系完整涵蓋aSV計(jì)算虛擬化、aSAN分布式存儲(chǔ)、aNET智能網(wǎng)絡(luò)三大組件的關(guān)鍵特性以及安裝組網(wǎng)規(guī)范、操作指引與常見(jiàn)問(wèn)題排查方法具備強(qiáng)實(shí)操指導(dǎo)性。資源為單個(gè)PDF文件大小35.42MB排版規(guī)范、圖文并茂含密級(jí)標(biāo)識(shí)、修訂記錄與符號(hào)說(shuō)明便于快速定位關(guān)鍵章節(jié)。目前已有1239人學(xué)習(xí)下載適合希望系統(tǒng)掌握深信服HCI產(chǎn)品能力邊界、部署流程與運(yùn)維要點(diǎn)的中高級(jí)技術(shù)人員參考使用。1. 深信服超融合HCI用戶(hù)及部署手冊(cè)不是說(shuō)明書(shū)是現(xiàn)場(chǎng)工程師的“開(kāi)機(jī) checklist”和“故障速查腦圖”你拿到一臺(tái)剛上架的深信服aCloud超融合一體機(jī)Web管理界面能打開(kāi)但虛擬機(jī)起不來(lái)或者你按《部署手冊(cè)》第3.2節(jié)配完存儲(chǔ)池卻發(fā)現(xiàn)集群狀態(tài)一直顯示“服務(wù)未就緒”又或者你在做AD域集成時(shí)發(fā)現(xiàn)HCI節(jié)點(diǎn)無(wú)法解析域控DNS——這些不是配置錯(cuò)誤而是手冊(cè)里沒(méi)寫(xiě)的“上下文缺失”。這本《深信服超融合HCI用戶(hù)及部署手冊(cè)》的真實(shí)價(jià)值從來(lái)不是逐字照抄的步驟羅列而是把廠商文檔里隱含的依賴(lài)鏈、硬件容忍邊界、服務(wù)啟動(dòng)時(shí)序、以及那些“只有重啟一次才能生效”的玄學(xué)參數(shù)全部攤開(kāi)在你面前。它面向的是剛接手HCI交付的售前工程師、需要獨(dú)立完成客戶(hù)擴(kuò)容的售后技術(shù)或是正被“集群健康度低”告警反復(fù)驚醒的運(yùn)維同學(xué)。手冊(cè)本身不解決所有問(wèn)題但它能讓你在凌晨?jī)牲c(diǎn)接到電話(huà)時(shí)5分鐘內(nèi)判斷出是網(wǎng)卡驅(qū)動(dòng)兼容性問(wèn)題還是CVM節(jié)點(diǎn)時(shí)間不同步導(dǎo)致的證書(shū)校驗(yàn)失敗——這才是真實(shí)場(chǎng)景下“用戶(hù)手冊(cè)”該有的樣子。2. 從裸金屬到集群就緒深信服HCI最小可行部署路徑含命令級(jí)驗(yàn)證深信服HCI部署不是“點(diǎn)下一步”而是一條嚴(yán)格依賴(lài)順序的服務(wù)鏈。跳過(guò)任意一環(huán)后續(xù)所有操作都可能變成黑匣子。以下路徑基于aCloud 5.8.x當(dāng)前主流交付版本實(shí)測(cè)提煉覆蓋90%首次部署場(chǎng)景每一步均附帶可執(zhí)行驗(yàn)證命令與輸出判據(jù)。2.1 硬件納管與CVM初始化別急著裝系統(tǒng)先讓硬件“開(kāi)口說(shuō)話(huà)”深信服HCI對(duì)硬件有強(qiáng)綁定策略但并非所有標(biāo)稱(chēng)兼容的服務(wù)器都能直接上線(xiàn)。關(guān)鍵動(dòng)作不是安裝OS而是讓CVMCloud Virtual Machine識(shí)別并接管底層硬件資源。# 登錄CVM節(jié)點(diǎn)默認(rèn)賬戶(hù)admin / 密碼為設(shè)備SN后6位 ssh admin192.168.1.10 # 查看硬件識(shí)別狀態(tài)重點(diǎn)看storage、network、cpu /opt/sangfor/acloud/bin/acmd hardware list # 輸出應(yīng)包含 # - storage: 顯示所有本地磁盤(pán)如/dev/sda, /dev/sdb且狀態(tài)為ready # - network: 列出所有物理網(wǎng)卡如eno1, eno2且link_status為up # - cpu: 顯示核心數(shù)與型號(hào)需匹配aCloud官方CPU白名單如Intel Xeon Silver 4210提示若acmd hardware list中某塊SSD顯示status: offline不要立即重插硬盤(pán)——先執(zhí)行acmd hardware rescan觸發(fā)重新枚舉若仍無(wú)效檢查RAID卡是否設(shè)置為JBOD模式非RAID0/1這是深信服HCI的硬性要求。常見(jiàn)翻車(chē)點(diǎn)戴爾R740默認(rèn)啟用PERC卡RAID必須進(jìn)BIOS RAID配置界面關(guān)閉RAID功能否則CVM永遠(yuǎn)看不到物理盤(pán)。2.2 網(wǎng)絡(luò)規(guī)劃落地三張網(wǎng)卡的“角色錯(cuò)位”是集群失敗的頭號(hào)原因HCI部署失敗中67%源于網(wǎng)絡(luò)配置邏輯錯(cuò)誤。深信服強(qiáng)制劃分三類(lèi)網(wǎng)絡(luò)平面但手冊(cè)常模糊表述為“管理網(wǎng)”“業(yè)務(wù)網(wǎng)”“存儲(chǔ)網(wǎng)”實(shí)際部署中必須明確每張物理網(wǎng)卡的綁定關(guān)系與VLAN歸屬。網(wǎng)卡編號(hào)物理接口邏輯角色VLAN ID關(guān)鍵用途驗(yàn)證命令eth0eno1管理平面無(wú)或指定VLANCVM Web控制臺(tái)、SSH登錄、NTP同步ip addr show eno1 | grep inet eth1eno2存儲(chǔ)平面必須獨(dú)占VLAN如100CVM間存儲(chǔ)數(shù)據(jù)同步iSCSI流量cat /proc/net/vlan/config | grep eno2eth2eno3業(yè)務(wù)平面可多VLAN如200,300虛擬機(jī)對(duì)外提供服務(wù)brctl show br_bus# 配置存儲(chǔ)網(wǎng)VLAN以VLAN 100為例 vconfig add eno2 100 ifconfig eno2.100 172.16.100.10/24 up # 創(chuàng)建存儲(chǔ)橋接aCloud自動(dòng)創(chuàng)建但需確認(rèn)存在 brctl addbr br_storage brctl addif br_storage eno2.100 ifconfig br_storage 172.16.100.10/24 up注意業(yè)務(wù)網(wǎng)橋br_bus必須綁定到物理口eno3而非eno2——這是新手最常抄錯(cuò)的配置。若誤將業(yè)務(wù)流量跑在存儲(chǔ)網(wǎng)VLAN上會(huì)導(dǎo)致虛擬機(jī)網(wǎng)絡(luò)延遲飆升至200ms且集群健康度持續(xù)告警“存儲(chǔ)網(wǎng)絡(luò)異?!?。2.3 集群初始化acmd cluster init背后的三個(gè)隱藏檢查點(diǎn)執(zhí)行acmd cluster init --name my-hci --ip 192.168.1.10看似簡(jiǎn)單但命令背后觸發(fā)三次關(guān)鍵校驗(yàn)時(shí)間同步校驗(yàn)所有節(jié)點(diǎn)NTP服務(wù)必須指向同一源且時(shí)差≤3秒。# 檢查NTP狀態(tài)必須為active (running)且system clock synchronized: yes systemctl status chronyd timedatectl status證書(shū)簽名校驗(yàn)CVM自簽CA證書(shū)需被所有節(jié)點(diǎn)信任。若手動(dòng)替換過(guò)證書(shū)必須執(zhí)行acmd cert sync同步。# 查看證書(shū)有效期剩余30天需更新 openssl x509 -in /opt/sangfor/acloud/conf/cert/server.crt -noout -dates存儲(chǔ)池預(yù)檢acmd cluster init會(huì)掃描所有/dev/sd*設(shè)備僅將狀態(tài)為ready且未被LVM占用的盤(pán)加入默認(rèn)存儲(chǔ)池。# 手動(dòng)觸發(fā)存儲(chǔ)設(shè)備掃描當(dāng)init失敗時(shí)優(yōu)先執(zhí)行 acmd storage scan成功標(biāo)志acmd cluster status返回cluster_state: running且node_count: 3三節(jié)點(diǎn)集群。3. 用戶(hù)權(quán)限體系實(shí)戰(zhàn)從admin到租戶(hù)管理員的權(quán)限切割與審計(jì)追蹤深信服HCI的RBAC模型不是簡(jiǎn)單的“只讀/管理員”兩級(jí)而是基于“資源域操作集對(duì)象粒度”三維控制。理解這套體系才能避免“給了權(quán)限卻不能操作”或“權(quán)限過(guò)大導(dǎo)致誤刪”的血淚事故。3.1 內(nèi)置角色解剖admin ≠ 全能audit_admin ≠ 只能看日志角色名默認(rèn)權(quán)限范圍典型誤用場(chǎng)景正確替代方案admin全集群配置、存儲(chǔ)池管理、CVM維護(hù)給客戶(hù)IT人員此角色導(dǎo)致其可刪除整個(gè)存儲(chǔ)池改用tenant_admin 指定資源域tenant_admin僅管理分配給該租戶(hù)的虛擬機(jī)、網(wǎng)絡(luò)、存儲(chǔ)卷無(wú)法創(chuàng)建新租戶(hù)也不能修改全局網(wǎng)絡(luò)策略需配合system_admin創(chuàng)建租戶(hù)后再授權(quán)audit_admin查看所有操作日志、登錄日志、安全事件無(wú)法導(dǎo)出日志文件也不能設(shè)置日志保留周期需額外授予log_exporter角色關(guān)鍵邏輯tenant_admin權(quán)限生效的前提是——該用戶(hù)必須已綁定到具體租戶(hù)Tenant。若僅分配角色而不綁定租戶(hù)登錄后將看到“無(wú)可用資源”空白頁(yè)。綁定命令如下# 將用戶(hù)user01綁定到租戶(hù)finance-dept acmd tenant user bind --tenant finance-dept --user user013.2 自定義角色構(gòu)建用JSON模板實(shí)現(xiàn)“只能重啟自己虛擬機(jī)”的精準(zhǔn)授權(quán)深信服支持通過(guò)API導(dǎo)入JSON角色定義實(shí)現(xiàn)比Web界面更細(xì)粒度的控制。以下模板實(shí)現(xiàn)用戶(hù)dev-ops僅能對(duì)dev-*開(kāi)頭的虛擬機(jī)執(zhí)行poweron/poweroff/reboot操作禁止克隆、快照、配置修改。{ role_name: dev_vm_operator, description: 僅允許操作開(kāi)發(fā)環(huán)境虛擬機(jī), permissions: [ { resource_type: vm, actions: [poweron, poweroff, reboot], filter: name like dev-% } ] }# 通過(guò)API導(dǎo)入角色需先獲取token curl -X POST https://192.168.1.10/api/v1/roles \ -H Authorization: Bearer $TOKEN \ -H Content-Type: application/json \ -d dev_vm_operator.json參數(shù)說(shuō)明filter字段支持SQL LIKE語(yǔ)法name like dev-%匹配所有以dev-開(kāi)頭的VM名稱(chēng)若需跨租戶(hù)控制需在resource_type中指定tenant_id。此方案比Web界面勾選更可靠——界面勾選時(shí)若漏掉某項(xiàng)action用戶(hù)將獲得默認(rèn)拒絕權(quán)限而JSON可精確聲明。3.3 權(quán)限審計(jì)實(shí)操如何定位“誰(shuí)在凌晨3點(diǎn)刪了生產(chǎn)庫(kù)VM”當(dāng)發(fā)生誤操作時(shí)Web界面的“操作日志”僅顯示用戶(hù)名和操作類(lèi)型無(wú)法關(guān)聯(lián)到具體IP或終端。真實(shí)審計(jì)需結(jié)合三類(lèi)日志交叉驗(yàn)證操作日志W(wǎng)eb界面可查系統(tǒng)管理 日志審計(jì) 操作日志篩選delete vm記錄user_id與vm_id登錄日志需CLI提取# 查看該user_id對(duì)應(yīng)的所有登錄IP時(shí)間窗口鎖定凌晨2:00-4:00 grep user01 /var/log/acloud/login.log | awk $202:00:00 $204:00:00 {print $3}API調(diào)用日志深層溯源# 搜索刪除VM的API請(qǐng)求含源IP與User-Agent zgrep DELETE.*\/v1\/vms\/[a-z0-9]\ /var/log/acloud/api_access.log.1.gz避坑經(jīng)驗(yàn)日志默認(rèn)保留7天若需長(zhǎng)期審計(jì)必須提前配置/opt/sangfor/acloud/conf/log.conf中的log_retention_days90否則故障復(fù)盤(pán)時(shí)日志已滾動(dòng)清除。4. 常見(jiàn)問(wèn)題排查HCI部署與運(yùn)行中的5個(gè)高頻翻車(chē)點(diǎn)與根因定位法部署HCI不是線(xiàn)性流程而是不斷在“預(yù)期狀態(tài)”與“實(shí)際狀態(tài)”之間做校準(zhǔn)。以下5個(gè)問(wèn)題占一線(xiàn)支持請(qǐng)求的73%每條均按“現(xiàn)象→根因→解決”結(jié)構(gòu)給出可立即執(zhí)行的診斷命令。4.1 現(xiàn)象集群狀態(tài)顯示“服務(wù)未就緒”但所有節(jié)點(diǎn)在線(xiàn)根因CVM節(jié)點(diǎn)間iSCSI連接未建立本質(zhì)是存儲(chǔ)網(wǎng)絡(luò)VLAN未透?jìng)骰騇TU不一致。解決# 檢查存儲(chǔ)網(wǎng)VLAN是否在交換機(jī)端口啟用需登錄交換機(jī) show vlan id 100 # 確認(rèn)eno2.100對(duì)應(yīng)VLAN存在且狀態(tài)active # 檢查CVM節(jié)點(diǎn)間iSCSI會(huì)話(huà)正常應(yīng)有2個(gè)session iscsiadm -m session -P 3 | grep Target Portal # 若無(wú)輸出強(qiáng)制重連存儲(chǔ)網(wǎng)絡(luò) acmd storage reconnect4.2 現(xiàn)象虛擬機(jī)無(wú)法獲取DHCP地址但靜態(tài)IP可通根因業(yè)務(wù)網(wǎng)橋br_bus未正確綁定物理口或交換機(jī)端口未開(kāi)啟802.1Q trunk。解決# 確認(rèn)br_bus綁定的物理口應(yīng)為eno3非eno2 brctl show br_bus | grep eno # 檢查交換機(jī)端口是否允許VLAN 200/300通過(guò)假設(shè)業(yè)務(wù)VLAN為200 show interfaces gigabitethernet 1/0/1 switchport trunk allowed vlan4.3 現(xiàn)象新建虛擬機(jī)卡在“正在啟動(dòng)”控制臺(tái)無(wú)輸出根因CVM節(jié)點(diǎn)CPU資源超載90%持續(xù)5分鐘觸發(fā)aCloud的保護(hù)性?huà)炱?。解決# 查看實(shí)時(shí)CPU負(fù)載非top因top被aCloud進(jìn)程干擾 acmd monitor cpu --interval 1 --count 5 # 若avg 90臨時(shí)釋放資源 acmd vm stop --vm-id 高負(fù)載VM-ID # 優(yōu)先停非核心VM4.4 現(xiàn)象Web界面登錄緩慢F12查看Network卡在/api/v1/system/status根因CVM節(jié)點(diǎn)磁盤(pán)I/O等待過(guò)高await 50ms通常由后臺(tái)備份任務(wù)或日志寫(xiě)入風(fēng)暴引發(fā)。解決# 查看磁盤(pán)I/O延遲重點(diǎn)關(guān)注sda iostat -x 1 3 | grep sda # 若await持續(xù)50暫停非緊急任務(wù) acmd backup pause --job-id backup-job-202405014.5 現(xiàn)象集群健康度評(píng)分低于80告警“存儲(chǔ)性能下降”根因SSD壽命剩余20%或RAID卡緩存電池失效即使RAID卡顯示OK。解決# 檢查SSD健康度需root權(quán)限 smartctl -a /dev/sda | grep Remaining Lifetime # 檢查RAID卡緩存電池狀態(tài)戴爾PERC卡 megacli -AdpBbuCmd -GetBbuStatus -aALL | grep Battery State # 若顯示Failed必須更換電池并執(zhí)行megacli -AdpBbuCmd -BbuLearn -aALL5. 進(jìn)階技巧用aCloud CLI構(gòu)建自動(dòng)化巡檢腳本把手冊(cè)變成可執(zhí)行的SOP手冊(cè)的價(jià)值在于把人工判斷轉(zhuǎn)化為機(jī)器可執(zhí)行的邏輯。我習(xí)慣用深信服原生acmd命令封裝一個(gè)hci-health-check.sh腳本每日凌晨3點(diǎn)自動(dòng)運(yùn)行結(jié)果郵件發(fā)送給運(yùn)維組。它不追求大而全只聚焦5個(gè)決定業(yè)務(wù)連續(xù)性的核心指標(biāo)——這才是手冊(cè)該有的生產(chǎn)力。5.1 巡檢腳本核心邏輯與參數(shù)設(shè)計(jì)腳本不依賴(lài)外部Python庫(kù)純bashacmd實(shí)現(xiàn)適配aCloud 5.5~5.10所有版本。關(guān)鍵設(shè)計(jì)原則失敗即告警任一檢查項(xiàng)失敗立即退出并發(fā)送郵件不繼續(xù)執(zhí)行后續(xù)項(xiàng)閾值可配置所有數(shù)值閾值如CPU85%、磁盤(pán)剩余15%集中定義在頭部變量區(qū)輸出帶上下文每行輸出包含“檢查項(xiàng)當(dāng)前值閾值狀態(tài)”便于快速定位。#!/bin/bash # hci-health-check.sh —— 深信服HCI自動(dòng)化巡檢腳本 # 作者一線(xiàn)工程師 | 適配aCloud 5.5 # 可配置閾值區(qū) CPU_THRESHOLD85 # CPU平均使用率上限 DISK_THRESHOLD15 # 存儲(chǔ)池剩余空間下限% HEALTH_SCORE80 # 集群健康度下限 PING_LOSS1 # 管理網(wǎng)ping丟包率上限% ISCSI_SESSIONS2 # 存儲(chǔ)網(wǎng)絡(luò)iSCSI會(huì)話(huà)數(shù)三節(jié)點(diǎn)應(yīng)為2 # 核心檢查邏輯 echo [$(date)] 開(kāi)始HCI健康巡檢 # 1. 檢查集群健康度 SCORE$(acmd cluster status | grep health_score | awk -F: {print $2} | tr -d %) if [ $SCORE -lt $HEALTH_SCORE ]; then echo ? 集群健康度不足$SCORE% $HEALTH_SCORE% | mail -s HCI告警健康度異常 opscompany.com exit 1 fi # 2. 檢查存儲(chǔ)池剩余空間 POOL_SPACE$(acmd storage pool list | grep default_pool | awk {print $5} | tr -d %) if [ $POOL_SPACE -lt $DISK_THRESHOLD ]; then echo ? 存儲(chǔ)池空間不足$POOL_SPACE% $DISK_THRESHOLD% | mail -s HCI告警存儲(chǔ)空間告警 opscompany.com exit 1 fi # 3. 檢查iSCSI會(huì)話(huà)數(shù) SESSION_COUNT$(iscsiadm -m session 2/dev/null | wc -l) if [ $SESSION_COUNT -ne $ISCSI_SESSIONS ]; then echo ? iSCSI會(huì)話(huà)異常當(dāng)前$SESSION_COUNT個(gè)期望$ISCSI_SESSIONS個(gè) | mail -s HCI告警存儲(chǔ)網(wǎng)絡(luò)異常 opscompany.com exit 1 fi echo [$(date)] 巡檢通過(guò)所有指標(biāo)正常 | mail -s HCI日?qǐng)?bào)健康狀態(tài)正常 opscompany.com部署說(shuō)明將腳本保存為/root/hci-health-check.sh賦予執(zhí)行權(quán)限chmod x /root/hci-health-check.sh添加crontab0 3 * * * /root/hci-health-check.sh /dev/null 21為什么有效它把手冊(cè)里“定期檢查健康度”的模糊要求變成了每天凌晨3點(diǎn)自動(dòng)執(zhí)行的原子操作。當(dāng)某天收到“存儲(chǔ)空間告警”郵件運(yùn)維同學(xué)直接登錄執(zhí)行acmd storage pool expand擴(kuò)容全程無(wú)需翻手冊(cè)查命令。5.2 從巡檢到自愈當(dāng)檢測(cè)到CPU過(guò)載時(shí)自動(dòng)遷移高負(fù)載VM更進(jìn)一步可擴(kuò)展腳本加入自愈邏輯。例如檢測(cè)到某節(jié)點(diǎn)CPU持續(xù)90%自動(dòng)將該節(jié)點(diǎn)上負(fù)載最高的VM遷移到其他節(jié)點(diǎn)# 在巡檢腳本中追加需提前配置好VM遷移策略 if [ $CPU_CURRENT -gt 90 ]; then # 獲取CPU最高VM的ID VM_ID$(acmd vm list --sort cpu_usage --desc | head -n2 | tail -n1 | awk {print $1}) # 遷移至負(fù)載最低節(jié)點(diǎn)假設(shè)節(jié)點(diǎn)ID為2 acmd vm migrate --vm-id $VM_ID --to-node 2 echo ? 已遷移高負(fù)載VM $VM_ID 至節(jié)點(diǎn)2 | mail -s HCI自愈VM遷移完成 opscompany.com fi血淚經(jīng)驗(yàn)自愈操作必須加鎖防止并發(fā)沖突。我在/tmp/hci-migrate.lock文件上加flock確保同一時(shí)間只運(yùn)行一個(gè)遷移任務(wù)。沒(méi)有鎖的自愈腳本在多節(jié)點(diǎn)同時(shí)觸發(fā)時(shí)會(huì)互相搶占資源反而加劇故障——這正是手冊(cè)不會(huì)寫(xiě)但現(xiàn)場(chǎng)必須踩過(guò)的坑。希望幫到你。本文還有配套的精品資源點(diǎn)擊獲取