動配置到性能驗(yàn)證)
先分享一個(gè)我自己的教訓(xùn)。去年做8×8陣列天線的耦合分析模型網(wǎng)格壓到兩千多萬16核的CPU跑一個(gè)頻點(diǎn)要三個(gè)多小時(shí)整個(gè)項(xiàng)目掃20個(gè)頻點(diǎn)算下來一周搭進(jìn)去。后來同事讓我試試GPU加速換了一塊RTX 4080同樣模型時(shí)域求解器開GPU單頻點(diǎn)四十分鐘出頭前后省了將近一周的排隊(duì)時(shí)間。這件事之后我把CST從選卡到驗(yàn)證的完整流程徹底捋了一遍踩了不少坑。這篇文章就是把這套流程整理出來適合用CST做天線、微波器件、SI/PI、EMC仿真的工程師和研究生也包括剛接手工作站采購、想給仿真環(huán)境升級卻又不知道怎么選顯卡的人。內(nèi)容圍繞一個(gè)核心問題展開在預(yù)算范圍內(nèi)怎么選到一塊真正能讓CST跑得動、跑得快的GPU裝好之后又怎么確認(rèn)它真的在干活而不是花了錢只當(dāng)擺件。1. CST到底怎么吃GPU先搞清楚加速原理再談選卡1.1 不同求解器對GPU的態(tài)度完全不一樣CST Studio Suite是一個(gè)多求解器平臺很多新人以為只要軟件裝好、顯卡插上所有仿真都會自動用GPU。實(shí)際情況完全不是這樣不同求解器的并行邏輯差異巨大有的模塊開了GPU能起飛有的模塊GPU基本幫不上忙。時(shí)域求解器Time Domain簡稱T是GPU加速收益最大的部分。它的底層算法基于FIT/FDTD把整個(gè)仿真空間切成大量六面體網(wǎng)格每一步要做的計(jì)算高度一致——對每個(gè)網(wǎng)格單元反復(fù)執(zhí)行相同公式天然適合GPU這種“大量簡單計(jì)算單元并行”的架構(gòu)。我實(shí)測過同一個(gè)天線項(xiàng)目CPU-only要180分鐘開GPU后大約25分鐘加速比在7倍左右。網(wǎng)格量越大這個(gè)優(yōu)勢越明顯。頻域求解器Frequency Domain簡稱F傳統(tǒng)上一直以CPU為主。直到較新的版本才開始加入GPU支持但成熟度和時(shí)域沒法比我試過用頻域求解器開GPU跑一個(gè)微帶濾波器加速不明顯某些迭代求解器設(shè)置反而更慢。所以如果你的工作流以頻域?yàn)橹鬟x卡時(shí)不用太為GPU參數(shù)糾結(jié)多核CPU和大內(nèi)存才是重點(diǎn)。本征模求解器Eigenmode和積分方程求解器I的GPU支持也有限。尤其是A類低頻求解器基本是純CPU計(jì)算顯卡再好也幫不上忙。網(wǎng)上能看到不少“CST不吃顯卡”的說法根源就在這里——不區(qū)分求解器場景拿頻域或靜磁場的體驗(yàn)來代表全局。1.2 GPU加速的瓶頸不是算力是顯存很多人選卡時(shí)只盯著核心數(shù)、頻率這些參數(shù)第一塊卡就買了顯存只有8GB的型號結(jié)果跑稍微大一點(diǎn)的模型就直接報(bào)錯(cuò)或者速度還不如CPU。原因很簡單時(shí)域求解器要把整個(gè)網(wǎng)格的狀態(tài)數(shù)據(jù)常駐在顯存里顯存不夠要么OOM顯存溢出要么自動退回CPU計(jì)算你的GPU白買了。我給一個(gè)經(jīng)驗(yàn)估算公式不一定精準(zhǔn)但方向是對的通常來說顯存需求≈網(wǎng)格單元數(shù)×(12~20)字節(jié)。具體字節(jié)數(shù)取決于計(jì)算精度、網(wǎng)格類型和監(jiān)視器數(shù)量。單精度下經(jīng)驗(yàn)值取14字節(jié)左右比較穩(wěn)開雙精度直接翻倍。按這個(gè)公式估算全網(wǎng)格量最低顯存參考推薦顯存典型場景500萬8GB12GB小型天線、簡單濾波器2000萬24GB32GB陣列天線、中等結(jié)構(gòu)5000萬64GB80GB車載/復(fù)雜環(huán)境、超表面大模型1億128GB多卡或集群全波人體、大型平臺級仿真所以選卡的核心邏輯是先用模型網(wǎng)格量倒推顯存需求再在這個(gè)前提下看核心數(shù)量和頻率。顯存決定仿真能不能跑得動核心數(shù)量決定跑多快。舍本逐末去看什么光追性能、DLSS這類游戲向參數(shù)對CST來說沒有意義。1.3 顯存帶寬和PCIe通道兩個(gè)容易被忽略的因素除了顯存容量和核心數(shù)量顯存帶寬同樣關(guān)鍵。時(shí)域求解器的計(jì)算模式是“反復(fù)讀取網(wǎng)格數(shù)據(jù)-計(jì)算-寫回”數(shù)據(jù)搬運(yùn)量極大。兩塊同樣24GB顯存的卡帶寬高30%整體仿真速度可能差20%以上。這也是為什么專業(yè)卡往往比同代游戲卡在仿真場景更有底氣專業(yè)卡的顯存帶寬普遍更高ECC校驗(yàn)也減少了長時(shí)間計(jì)算的出錯(cuò)概率。PCIe通道倒是沒有太多人重視。單卡場景下PCIe 4.0 x16基本夠用但如果你把卡插在PCIe 3.0 x8的槽位上或者主板上還有其他設(shè)備搶帶寬就能明顯感覺到數(shù)據(jù)傳輸變慢。我?guī)屯屡挪檫^一臺機(jī)器仿真速度比同配置的基準(zhǔn)機(jī)慢了近一半后來發(fā)現(xiàn)顯卡插在PCIe 3.0 x4的槽位上換成直連CPU的x16槽后馬上恢復(fù)正常。2. 顯卡怎么選先定顯存再談核心2.1 選卡三步走估算顯存、圈定預(yù)算、再挑具體型號我個(gè)人的做法是拿到一個(gè)項(xiàng)目后先建一個(gè)粗略網(wǎng)格讓CST統(tǒng)計(jì)一下大概的網(wǎng)格數(shù)。這一步不需要精確能看出數(shù)量級就行。比如天線類模型粗略網(wǎng)格在300萬到800萬之間那選12GB到16GB顯存就是穩(wěn)妥的如果是超表面陣列動輒幾千萬網(wǎng)格那就直接看24GB以上的卡。預(yù)算方面我按自己的實(shí)際經(jīng)驗(yàn)把顯卡分成了幾個(gè)檔位第一檔入門教學(xué)級。預(yù)算在2000到4000元買RTX 4060 8GB或二手RTX 3060 12GB適合學(xué)生、個(gè)人學(xué)習(xí)、小型天線和微波器件仿真。注意8GB顯存跑超過800萬網(wǎng)格就會很吃力建議入門也盡量選12GB版本。第二檔主力干活級。預(yù)算在5000到10000元RTX 4070 Super 12GB、RTX 4080 16GB是這個(gè)區(qū)間的主力。如果工作流偏時(shí)域16GB顯存能覆蓋大部分常規(guī)項(xiàng)目2000萬網(wǎng)格以內(nèi)的模型問題不大。我目前最常用的就是RTX 4080天線陣列、濾波器件、常規(guī)SI分析都夠用。第三檔大模型專業(yè)級。預(yù)算在2萬以上RTX 4090 24GB、RTX 6000 Ada 48GB、A6000都是這一檔。這個(gè)級別適合復(fù)雜的車載環(huán)境仿真、大型陣列、或者帶大量監(jiān)視器的場景。RTX 6000 Ada顯存大、帶寬高專業(yè)驅(qū)動也經(jīng)過軟件認(rèn)證但價(jià)格確實(shí)感人。如果預(yù)算有限但項(xiàng)目又特別大我更建議考慮云GPU租用。很多超大規(guī)模模型跑一次就兩三天租一臺A100 80GB來跑比買一塊專業(yè)卡劃算得多。云主機(jī)的好處是顯存夠大壞處是數(shù)據(jù)上傳下載、License管理都要額外花時(shí)間。2.2 買新卡還是二手卡驗(yàn)卡流程不能省二手卡市場很活躍很多仿真工作室會買退役的Tensor Core卡或者專業(yè)卡。但我踩過的坑不少這里必須提醒幾點(diǎn)。拿到卡后第一件事是用GPU-Z看基本信息核心代號、顯存類型、位寬、BIOS版本看看是不是改卡或者刷了BIOS的魔改卡。然后跑壓力測試。Windows下可以用FurMark跑二十分鐘觀察溫度曲線和是否花屏Linux下我習(xí)慣用gpu-burn命令行簡單直接把GPU壓到滿載git clone https://github.com/wilicc/gpu-burn cd gpu-burn make ./gpu_burn 600600代表跑600秒。這十分鐘里觀察顯存溫度、熱點(diǎn)溫度、風(fēng)扇轉(zhuǎn)速是否正常。如果中途出現(xiàn)黑屏、驅(qū)動重置、花屏基本可以斷定顯存或者供電有問題。我收過一張自稱“99新”的卡gpu-burn跑了八分鐘直接黑屏重啟后來發(fā)現(xiàn)顯存虛焊退貨了。所以壓測至少半小時(shí)別嫌麻煩。另外二手卡要特別注意散熱狀態(tài)。CST時(shí)域仿真是長時(shí)間滿載渲染卡拿來打游戲可能溫度正常但仿真滿載時(shí)熱點(diǎn)溫度長期在90度以上穩(wěn)定性就很成問題。拿到卡最好打開機(jī)箱側(cè)板看一眼散熱鰭片積灰嚴(yán)重、風(fēng)扇異響的直接排除。2.3 消費(fèi)卡和專業(yè)卡怎么權(quán)衡如果你是自己掏錢裝機(jī)我的建議是優(yōu)先考慮消費(fèi)級顯卡。RTX 4080/4090性能非常強(qiáng)價(jià)格比同顯存的專業(yè)卡便宜一大截。雖然專業(yè)卡有ECC顯存、專業(yè)驅(qū)動認(rèn)證、更強(qiáng)的雙精度浮點(diǎn)等優(yōu)勢但對大多數(shù)CST時(shí)域仿真的場景來說消費(fèi)卡的單精度性能完全夠用結(jié)果精度主要靠求解器算法控制硬件雙精度弱一點(diǎn)影響有限。不過有幾個(gè)例外如果所在團(tuán)隊(duì)有合規(guī)審核要求或者軟件廠商明確要求使用認(rèn)證顯卡才能在出問題時(shí)獲得支持那就不要省這個(gè)錢按官方認(rèn)證列表選。另外如果你的模型對數(shù)值精度極度敏感比如窄帶高Q值結(jié)構(gòu)建議至少用專業(yè)卡驗(yàn)證一次結(jié)果確認(rèn)消費(fèi)卡的單精度計(jì)算誤差在可接受范圍內(nèi)。3. 驅(qū)動與CUDA環(huán)境裝不對顯卡等于沒裝3.1 不是驅(qū)動越新越好但要滿足版本門檻CST的GPU加速依賴NVIDIA的CUDA運(yùn)行時(shí)。新版本CST通常在安裝包內(nèi)自帶所需CUDA組件所以一般流程是先裝NVIDIA顯卡驅(qū)動然后直接裝CST軟件會自動識別GPU。但很多人會在驅(qū)動上翻車。裝完CST后打開時(shí)域求解器發(fā)現(xiàn)“No CUDA-capable device found”第一反應(yīng)是顯卡壞了其實(shí)大概率是驅(qū)動版本太舊。不同版本CST對驅(qū)動版本有下限要求我建議裝好驅(qū)動后用nvidia-smi確認(rèn)一下版本和CUDA支持情況nvidia-smi輸出里會有一行“CUDA Version”這表示當(dāng)前驅(qū)動最高支持到哪個(gè)CUDA版本只要這個(gè)版本號不低于CST要求的下限就沒問題。如果太低去NVIDIA官網(wǎng)下載新版驅(qū)動注意選擇對應(yīng)操作系統(tǒng)和顯卡架構(gòu)不要用什么“一鍵更新”第三方工具。至于要不要手動安裝CUDA Toolkit一般情況下不需要。CST自帶運(yùn)行時(shí)自己額外裝一套反而可能版本沖突。只有當(dāng)你需要在同一臺機(jī)器上跑深度學(xué)習(xí)框架或者其他依賴CUDA的軟件時(shí)才需要單獨(dú)管理CUDA版本可以考慮用虛擬環(huán)境去隔離不要在系統(tǒng)層面反復(fù)切換。3.2 驅(qū)動裝上后先做一次基礎(chǔ)驗(yàn)證驅(qū)動裝完先別急著打開CST。在終端輸入nvidia-smi -l 1這個(gè)命令每秒刷新一次能看到GPU型號、顯存使用量、功耗、溫度。確認(rèn)系統(tǒng)能識別顯卡且驅(qū)動沒有報(bào)錯(cuò)。如果此時(shí)顯存占用顯示一個(gè)固定不變的值通常是圖形界面占用如果顯存占用跳來跳去說明有進(jìn)程在用GPU計(jì)算。在Windows系統(tǒng)下打開任務(wù)管理器切到“性能”標(biāo)簽頁找到GPU那一項(xiàng)能看到“3D”、“復(fù)制”、“視頻解碼”等專用引擎利用率。CST跑起來時(shí)你關(guān)注“Compute_0”和“Compute_1”的利用率指標(biāo)這才是計(jì)算負(fù)載。3.3 別忽略CPU內(nèi)存的配套這一步雖然不是顯卡本體但直接影響GPU能否正常發(fā)力。CST的前處理、網(wǎng)格生成、后處理都吃CPU內(nèi)存。如果顯存是16GB建議CPU內(nèi)存至少32GB顯存24GB的卡內(nèi)存最好64GB起。我見過有人配了RTX 4090但內(nèi)存只有16GB跑兩千萬網(wǎng)格模型時(shí)GPU顯存還沒滿內(nèi)存先爆了模擬直接失敗。另一個(gè)容易被忽略的是電源。GPU滿載瞬間功耗很高RTX 4080/4090建議電源額定功率不低于850W/1000W而且要留夠30%的余量。電源功率不足的典型表現(xiàn)是跑仿真幾分鐘后整機(jī)突然重啟或者在重負(fù)載時(shí)驅(qū)動崩潰。4. 求解器里的GPU加速設(shè)置與日志解析4.1 時(shí)域求解器的GPU開關(guān)默認(rèn)是不開的進(jìn)入時(shí)域求解器設(shè)置界面后很多版本的默認(rèn)配置是CPU并行方案需要手動把GPU選項(xiàng)打開。具體路徑大致是在“Time Domain Solver”參數(shù)面板中找到“Parallel Computing”或“GPU Acceleration”區(qū)域勾選“Use GPU(s)”然后在列表里選中要用的顯卡。勾選后建議做一次“GPU Monitoring Test”老版本CST在硬件識別正常時(shí)會有對應(yīng)測試按鈕新版本可能在“Compute”菜單下有一個(gè)“GPU Features”檢測入口。這個(gè)檢測會跑一次極小的網(wǎng)格計(jì)算驗(yàn)證GPU驅(qū)動、CUDA運(yùn)行時(shí)是否正常。設(shè)完之后求解器在日志區(qū)域會顯示類似這樣的一行Using GPU(s): NVIDIA GeForce RTX 4080如果日志里沒有出現(xiàn)這一行說明GPU沒有被實(shí)際啟用。常見原因是模型被自動判定為不適合GPU加速或者顯存不足軟件自動走了CPU路徑。4.2 頻域求解器的GPU支持新版本才逐步開放如果你用的是較新版本頻域求解器設(shè)置里也可能出現(xiàn)GPU相關(guān)的選項(xiàng)。但我的實(shí)測結(jié)論是能不開就先不開除非你的模型恰好是官方明確支持的特定求解組合。原因有兩個(gè)第一頻域求解器的核心計(jì)算是求解大型稀疏線性方程組這類算法在GPU上的實(shí)現(xiàn)效率高度依賴預(yù)處理因子和迭代策略通用性不如時(shí)域好。同一個(gè)模型迭代求解器在CPU上跑得不錯(cuò)切到GPU反而可能因?yàn)槊看蔚家罅繑?shù)據(jù)交換而變慢。第二頻域求解決定了你是做寬頻掃參還是窄帶高精度分析。如果做窄帶諧振結(jié)構(gòu)CPU多核并行加大內(nèi)存往往更穩(wěn)定。真要對頻域加速優(yōu)先看CPU平臺而不是顯卡。4.3 多GPU的配置理論性價(jià)比很高實(shí)際收益要量力而行CST時(shí)域求解器支持多節(jié)點(diǎn)分布式計(jì)算也支持單節(jié)點(diǎn)多GPU多GPU的設(shè)置在“Distributed Computing”或MPI相關(guān)面板中完成。我的實(shí)測數(shù)據(jù)顯示雙卡RTX 4080的加速比大概在1.7倍左右三卡在2.1倍左右不是線性擴(kuò)展。多GPU性能不線性的原因主要是網(wǎng)格數(shù)據(jù)在卡間同步的通信開銷以及負(fù)載均衡不完全理想。顯卡之間如果有NVLink互連還好一點(diǎn)普通PCIe互聯(lián)的多卡通信開銷更明顯。所以我的建議是先保證單卡顯存夠用再去追求多卡。如果你發(fā)現(xiàn)單卡顯存不足優(yōu)先策略是減網(wǎng)格、加對稱面、用頻域替代時(shí)域而不是無腦堆四張卡。如果確實(shí)要上多卡要注意CST的License是否包含MPI并行計(jì)算功能沒有對應(yīng)授權(quán)的話哪怕配置了多GPU也不會生效。5. 怎么驗(yàn)證GPU真的在加速三種方法交叉確認(rèn)5.1 看監(jiān)控?cái)?shù)據(jù)GPU利用率和功耗曲線開跑之后在終端輸入nvidia-smi -l 1觀察“Volatile GPU-Util”這一項(xiàng)。時(shí)域求解器穩(wěn)定運(yùn)行時(shí)GPU利用率應(yīng)該在90%以上如果只有百分之幾說明計(jì)算沒落在GPU上。同時(shí)看“Pwr Usage”滿載時(shí)功耗應(yīng)該接近該卡的典型滿載功耗比如RTX 4080約在300W左右。功耗很低但利用率很高的情況很罕見基本可以認(rèn)定沒有真正調(diào)用GPU。Windows用戶可以用任務(wù)管理器直接看“CUDA”或“Compute”引擎的占用率。如果一直顯示0%說明CST沒有用GPU。5.2 看求解日志和耗時(shí)對比不要只盯一個(gè)指標(biāo)CST的時(shí)域求解器日志里會顯示“CPU time”和“Elapsed time”。如果GPU成功參與日志里還能看到GPU名稱、占用顯存大小等信息。我把這些信息和實(shí)際耗時(shí)放在一起看實(shí)測數(shù)據(jù)模型規(guī)模CPU-only耗時(shí)開啟GPU耗時(shí)加速比約500萬網(wǎng)格35分鐘9分鐘約3.9倍約2000萬網(wǎng)格3小時(shí)20分28分鐘約7.1倍約5000萬網(wǎng)格8小時(shí)1小時(shí)左右約8倍小模型加速比不明顯因?yàn)閿?shù)據(jù)初始化、顯存分配、核函數(shù)啟動都有固定開銷。如果只有幾十萬網(wǎng)格GPU加速反而可能比CPU還慢這不是顯卡壞了是場景不適合。網(wǎng)格量越大GPU的優(yōu)勢越明顯。5.3 看結(jié)果一致性加速后的數(shù)值不能“看起來對”GPU計(jì)算結(jié)果和CPU結(jié)果理論上應(yīng)該一致但因?yàn)楦↑c(diǎn)運(yùn)算順序不同實(shí)際會存在微小數(shù)值差異。S參數(shù)曲線在毫米波頻段出現(xiàn)0.01dB級別的差距都屬于正常但如果諧振點(diǎn)頻率偏差超過設(shè)計(jì)容差就要懷疑精度問題。我的驗(yàn)證方法很簡單用CST自帶的官方示例項(xiàng)目比如波導(dǎo)濾波器或偶極子天線先在CPU-only模式跑一次再在GPU模式下跑一次對比S參數(shù)曲線。如果兩條曲線重合到肉眼不可分辨再用實(shí)際項(xiàng)目驗(yàn)證一次。注意對比遠(yuǎn)場方向圖時(shí)要把對稱面設(shè)置、監(jiān)視器參數(shù)保持一致否則差異可能來自設(shè)置不一致而不是GPU精度問題。消費(fèi)級顯卡在雙精度計(jì)算上性能被大幅砍掉如果模型需要開雙精度速度收益會明顯下降。建議對關(guān)鍵項(xiàng)目先做一次單精度與雙精度的結(jié)果對比再決定實(shí)際項(xiàng)目用哪種精度跑。6. 常見問題與避坑實(shí)錄從OOM到黑屏6.1 GPU加速開了卻沒提速先別懷疑顯卡這是被問得最多的一個(gè)問題排查順序我建議按下面這個(gè)列表來排查項(xiàng)檢查方法常見原因驅(qū)動版本是否過舊nvidia-smi看驅(qū)動版本驅(qū)動不支持CUDA版本模型是否太小看網(wǎng)格量是否小于100萬小模型GPU開銷不劃算求解器是否支持時(shí)域開GPU頻域受限算法不適合并行顯存是否不足觀察日志是否有OOM顯存不足自動回退CPUGPU利用率是否偏低nvidia-smi實(shí)時(shí)監(jiān)控設(shè)置沒保存或加速沒生效一條條排查下來大多數(shù)“沒加速”的問題都能定位到驅(qū)動或設(shè)置上。6.2 顯存不足、OOM怎么處理報(bào)錯(cuò)信息常見的包括“There is not enough memory available on the device”或“CUDA error 2: out of memory”。出現(xiàn)這個(gè)報(bào)錯(cuò)說明網(wǎng)格量超過了顯存上限。處理方式按優(yōu)先級排列降低網(wǎng)格密度在精度允許范圍內(nèi)調(diào)大網(wǎng)格步長這是最直接有效的一招利用結(jié)構(gòu)的對稱性設(shè)置對稱面可以把計(jì)算量降到原來的1/2或1/4把時(shí)域求解器換成頻域求解器頻域的內(nèi)存壓力主要在CPU端可以繞過顯存瓶頸拆分子模型、分區(qū)仿真比如先仿陣中單元再用結(jié)果合成陣列方向圖以上招都試過還不夠再考慮換大顯存卡。6.3 仿真中途黑屏、驅(qū)動崩潰、掉卡這個(gè)問題的根源往往不是CST軟件而是硬件穩(wěn)定性。先排除散熱問題打開機(jī)箱側(cè)板看GPU散熱鰭片是否干凈。再檢查電源如果滿載功耗超過電源額定功率的70%值得警惕。最后可以用MSI Afterburner把功耗墻調(diào)低到90%再跑一次gpu-burn如果不再崩潰基本鎖定是供電或散熱問題。如果之前做過顯卡超頻務(wù)必改回默認(rèn)頻率。很多游戲卡出廠頻率已經(jīng)接近極限長期滿載仿真對供電要求極高一點(diǎn)不穩(wěn)定就會觸發(fā)驅(qū)動保護(hù)。我建議仿真主機(jī)不要搞超頻穩(wěn)定壓倒一切。6.4 特定場景下的一些補(bǔ)充經(jīng)驗(yàn)天線陣列仿真優(yōu)先用對稱面加半波邊界網(wǎng)格量能壓三分之一GPU顯存壓力小很多。超表面或周期結(jié)構(gòu)模型單元數(shù)量大監(jiān)視器往往很多后處理會占大量時(shí)間此時(shí)GPU加速掃描頻點(diǎn)很有幫助但要注意監(jiān)視器數(shù)據(jù)會不會把顯存占滿。SI/PI這類以頻域?yàn)橹鞯姆治鰟e在GPU上花太多心思一臺36核以上的CPU工作站加128GB內(nèi)存比一塊頂級顯卡更好使。再補(bǔ)充一個(gè)點(diǎn)CST的宏命令可以自動化這一套驗(yàn)證流程。你可以寫一個(gè)簡單的VBA宏把同一模型分別用CPU和GPU模式跑一次再把S參數(shù)導(dǎo)出對比。新版本也支持Python腳本批量驗(yàn)證多組參數(shù)時(shí)特別好用。省下來的時(shí)間足夠喝兩杯咖啡。最后再分享一個(gè)我的固定流程。每次拿到一臺新仿真機(jī)器我都會先跑四步nvidia-smi看驅(qū)動和顯存GPU-Z看硬件參數(shù)gpu-burn壓測半小時(shí)以上再用CST官方示例跑一次CPU與GPU的精度對比。這套流程走下來機(jī)器能不能穩(wěn)定扛活心里基本有數(shù)。CST的GPU加速說復(fù)雜也復(fù)雜說簡單也簡單核心就一句話顯存決定跑不跑得動驅(qū)動設(shè)置決定GPU用沒用上精度驗(yàn)證決定算得對不對。把這三關(guān)都過了剩下的就是享受從一周到一小時(shí)的快樂。