用完整實(shí)踐)
第一次接觸PYNQ-Z2的HLS開發(fā)十有八九會(huì)被“用C寫FPGA”這個(gè)概念吸引住既想保留Python調(diào)硬件的爽快又不想回頭去寫Verilog?,F(xiàn)實(shí)也很骨感網(wǎng)上教程要么只講單個(gè)環(huán)節(jié)要么把所有步驟打散真正從零一路跑到板子亮燈、跑通數(shù)據(jù)、拿到加速比的內(nèi)容很少。這篇文章不煮雞湯也不復(fù)制官方文檔直接把我從搭建HLS流程、寫矩陣乘法加速器、集成到PYNQ、最后在Jupyter里用Python調(diào)用硬件的全過(guò)程和踩過(guò)的坑一次說(shuō)清楚。[!NOTE] 整套流程適合三類人剛?cè)胧諴YNQ-Z2不知道下一步做什么的入門者已經(jīng)會(huì)用Verilog但想提高開發(fā)效率的老手以及想評(píng)估“算法直接轉(zhuǎn)硬件”到底靠不靠譜的軟件工程師。1. 為什么PYNQ-Z2上的HLS開發(fā)值得上手板子與工具的選型思路1.1 PYNQ-Z2這塊板子的家底PYNQ-Z2的核心是Xilinx Zynq-7000 SoC具體型號(hào)是XC7Z020-1CLG400C。它內(nèi)部不是一顆單獨(dú)的FPGA而是把雙核ARM Cortex-A9處理器PS側(cè)和Artix-7架構(gòu)的可編程邏輯PL側(cè)封裝在了同一顆芯片里。這意味著跑Linux系統(tǒng)的ARM處理器和做并行計(jì)算的FPGA邏輯可以共享同一片DDR內(nèi)存通過(guò)AXI總線高速互相訪問(wèn)。PYNQ這個(gè)框架真正的價(jià)值是把PL側(cè)當(dāng)成一個(gè)“可以動(dòng)態(tài)加載的硬件庫(kù)”。PYNQ-Z2官方鏡像啟動(dòng)后直接進(jìn)入Jupyter Notebook你可以用Python加載“overlay”也就是一個(gè)已經(jīng)綜合好的比特流文件然后像調(diào)用numpy一樣調(diào)用FPGA上做好的功能模塊。這種玩法讓FPGA不再只是硬件工程師的工具也成了做嵌入式視覺(jué)、信號(hào)處理、加速算法原型驗(yàn)證的軟件工程師的實(shí)驗(yàn)臺(tái)。但這里有個(gè)隱藏邊界PYNQ本身只管加載、控制、數(shù)據(jù)搬運(yùn)管不了你如何在PL側(cè)造出一個(gè)自定義加速器。傳統(tǒng)做法是你去學(xué)一套Verilog/VHDL工作量不小HLS則把這條邊界抬高了允許你用C/C描述算法再自動(dòng)生成RTL邏輯。1.2 HLS解決什么問(wèn)題從“寫邏輯”到“寫算法”HLSHigh-Level Synthesis高層次綜合的價(jià)值用一句話概括把用C/C描述的算法轉(zhuǎn)換成可以在FPGA上運(yùn)行的寄存器傳輸級(jí)RTL電路。傳統(tǒng)FPGA開發(fā)里你要先明確每個(gè)時(shí)鐘周期、每個(gè)信號(hào)線、每個(gè)狀態(tài)機(jī)的行為HLS開發(fā)里你更多關(guān)注算法本身循環(huán)怎么流水、數(shù)組怎么并行、數(shù)據(jù)怎么搬運(yùn)這些底層細(xì)節(jié)通過(guò)綜合指令pragma來(lái)引導(dǎo)工具完成。這不是說(shuō)硬件工程師就沒(méi)用了而是節(jié)奏完全不同。用Verilog實(shí)現(xiàn)一個(gè)矩陣乘法狀態(tài)機(jī)寫半天用HLS核心循環(huán)幾十行C代碼就能表達(dá)然后通過(guò)#pragma HLS PIPELINE和#pragma HLS ARRAY_PARTITION這類指令把循環(huán)展開、流水、數(shù)組切分到BRAM/寄存器的優(yōu)化空間里。綜合工具會(huì)給你產(chǎn)生一個(gè)帶AXI接口的IP核供Vivado Block Design直接調(diào)用。HLS當(dāng)然不是萬(wàn)能的不是所有代碼都能被綜合動(dòng)態(tài)內(nèi)存分配和遞歸基本不可綜合時(shí)序約束緊、資源占用極緊的模塊手寫RTL仍然更可控。但對(duì)絕大多數(shù)“算法加速”場(chǎng)景HLS帶來(lái)的開發(fā)效率提升是實(shí)打?qū)嵉奈液竺鏁?huì)用一個(gè)完整例子驗(yàn)證。1.3 為什么選PYNQ-Z2而不是別的平臺(tái)做HLS如果你已經(jīng)有其他FPGA開發(fā)板理論上HLS流程是通用的跟著Vivado HLS/Vitis HLS走就行。但PYNQ-Z2有它不可替代的優(yōu)勢(shì)硬件驗(yàn)證環(huán)節(jié)被Python無(wú)縫接管。Vivado里生成的比特流和hwh文件放到PYNQ的overlay目錄Jupyter里三行代碼就能加載并測(cè)性能。即使你對(duì)Linux不熟也不用額外去寫驅(qū)動(dòng)和用戶態(tài)程序PYNQ把寄存器的映射和DMA緩沖區(qū)管理都封裝好了。對(duì)HLS學(xué)習(xí)來(lái)說(shuō)快速反饋非常重要。傳統(tǒng)FPGA開發(fā)中綜合、布局布線、燒寫、調(diào)試一輪下來(lái)幾十分鐘起步PYNQ-Z2上HLS仿真階段可以在PC上確認(rèn)算法板上驗(yàn)證階段Jupyter交互式執(zhí)行省下來(lái)的時(shí)間全部用在優(yōu)化算法上。這也是我勸新手從PYNQ-Z2入FPGA HLS開發(fā)的原因門檻低、反饋快、生態(tài)資源多。2. 零基礎(chǔ)起步PYNQ-Z2的HLS開發(fā)環(huán)境搭建與工程模板2.1 工具鏈準(zhǔn)備Vivado、Vivado HLS/Vitis HLS和鏡像做PYNQ-Z2 HLS開發(fā)主要涉及兩套環(huán)境開發(fā)機(jī)環(huán)境安裝Xilinx Vivado含HLS工具。早期版本叫Vivado HLS是一個(gè)獨(dú)立圖形界面2020.1之后的版本把它并入Vitis統(tǒng)一叫Vitis HLS基本功能一致。我的方案是使用Vivado 2020.1對(duì)應(yīng)Vitis HLS 2020.1和PYNQ-Z2官方v2.6/v2.7鏡像兼容性很好。板卡環(huán)境給PYNQ-Z2燒錄官方鏡像。去PYNQ官網(wǎng)下載對(duì)應(yīng)SD卡鏡像用rufus等工具寫入至少8GB的microSD卡。上電后通過(guò)網(wǎng)線連接路由瀏覽器訪問(wèn)pynq:9090或板卡IP進(jìn)入Jupyter Notebook。版本匹配是我首先想強(qiáng)調(diào)的。PYNQ官方鏡像里集成了一些pl內(nèi)核的PETALINUX驅(qū)動(dòng)不同PYNQ版本對(duì)應(yīng)不同Vivado版本。常見問(wèn)題是Vivado版本太高、生成的bitstream/hwh格式與PYNQ環(huán)境不兼容導(dǎo)致Overlay加載失敗。如果你不想折騰直接選“PYNQ v2.6 Vivado 2020.1”這個(gè)組合相對(duì)穩(wěn)定。2.2 用模板建立第一個(gè)HLS工程打開Vivado HLS點(diǎn)Create New Project項(xiàng)目名隨意工程位置不要帶中文路徑。關(guān)鍵的環(huán)節(jié)是Part Selection搜索并選擇xc7z020clg400-1也就是PYNQ-Z2的芯片型號(hào)。選錯(cuò)芯片會(huì)導(dǎo)致綜合結(jié)果和板卡資源不匹配所以這一步務(wù)必核對(duì)清楚。創(chuàng)建項(xiàng)目后Vivado HLS會(huì)生成一個(gè)頂層函數(shù)入口。新手最容易犯的錯(cuò)誤是直接從頭開始寫代碼其實(shí)可以直接用工具自帶的模板入門菜單File - New File選擇FIR、Matrix Multiplication或FFT示例先看一遍模板代碼再改成自己的算法。這些模板的接口定義和pragma寫法都是官方維護(hù)的直接拿來(lái)做試驗(yàn)省去查手冊(cè)的時(shí)間。2.3 熟悉HLS的標(biāo)準(zhǔn)開發(fā)流程在Vivado HLS/Vitis HLS里HLS開發(fā)不是一錘子買賣而是分階段反復(fù)迭代C仿真C Simulation在PC上編譯并運(yùn)行C代碼驗(yàn)證算法功能正確。這個(gè)過(guò)程不涉及硬件只是把C代碼當(dāng)普通程序跑方便在早期暴露邏輯錯(cuò)誤。C綜合C Synthesis把C代碼轉(zhuǎn)換成RTL生成Verilog/VHDL以及對(duì)應(yīng)的綜合報(bào)告時(shí)序、資源、吞吐量預(yù)估。聯(lián)合仿真C/RTL Co-Simulation把C測(cè)試平臺(tái)轉(zhuǎn)換到RTL仿真環(huán)境中運(yùn)行驗(yàn)證綜合出的硬件行為和C代碼一致。導(dǎo)出IPExport RTL把綜合結(jié)果封裝成Vivado可以調(diào)用的IP核一般選擇IP Catalog格式。我實(shí)際使用的建議是C仿真階段多寫幾個(gè)用例至少覆蓋正常輸入、邊界輸入、矩陣尺寸變化的情況C綜合報(bào)告出來(lái)后先看“Latency”延遲和“Trip Count”循環(huán)次數(shù)判斷哪些循環(huán)是性能瓶頸聯(lián)合仿真過(guò)了再導(dǎo)出否則導(dǎo)出后再改代碼一輪要額外花不少時(shí)間。2.4 一個(gè)容易忽略的問(wèn)題hwh文件是PYNQ的靈魂很多新手把bitstream燒進(jìn)板子加載Overlay時(shí)報(bào)pynqpl.Warning: No hwh file found然后就懵了。PYNQ加載一個(gè)overlay依靠的不僅是bit文件還有hwh文件硬件握手文件。hwh文件本質(zhì)是Vivado Block Design生成的硬件描述里面記錄了IP實(shí)例名、寄存器地址段、中斷號(hào)等關(guān)鍵信息。在Vivado正常生成比特流后開發(fā)機(jī)工程里可以找到project_name.gen/sources_1/bd/block_design/hw_handoff/block_design.hwh把它和.bit文件放到PYNQ板子上同一個(gè)overlay目錄并保持同名前綴比如mmult.bit和mmult.hwh配對(duì)。沒(méi)有hwhPYNQ無(wú)法知道IP掛載在哪個(gè)地址Python側(cè)也就沒(méi)法操作寄存器。這一點(diǎn)我放在環(huán)境搭建部分說(shuō)是因?yàn)樗鼪Q定了你后面幾步能不能跑通。3. 手把手寫一個(gè)矩陣乘法加速器HLS核心流程完整實(shí)操3.1 硬件接口怎么定m_axi與s_axilite的組合HLS設(shè)計(jì)IP時(shí)首先要思考的是“硬件怎么和外界通信”。矩陣乘法的場(chǎng)景是ARM側(cè)把兩個(gè)輸入矩陣放在DDR里FPGA側(cè)要從DDR讀取數(shù)據(jù)、計(jì)算、再把結(jié)果寫回DDR。最自然的接口方案是m_axi接口讓HLS生成的IP作為AXI Master直接訪問(wèn)DDR地址主動(dòng)讀A、B矩陣寫回C矩陣。s_axilite接口作為AXI Slave允許ARM通過(guò)一組控制寄存器啟動(dòng)IP、傳入矩陣數(shù)據(jù)地址、讀取狀態(tài)標(biāo)志。為什么不用AXI-StreamAXI-Stream適合流式數(shù)據(jù)比如視頻像素流。矩陣乘法需要隨機(jī)訪問(wèn)整個(gè)矩陣地址跳變明顯用AXI-Stream會(huì)讓主機(jī)端手動(dòng)切分?jǐn)?shù)據(jù)復(fù)雜度高。而m_axi像一個(gè)大水管可以按地址直接讀DDR中任意位置配合突發(fā)傳輸burst對(duì)矩陣乘法這類數(shù)據(jù)塊訪問(wèn)非常友好。頂層函數(shù)設(shè)計(jì)成void matrixmul(int *A, int *B, int *C, int size) { #pragma HLS INTERFACE m_axi portA offsetslave bundlegmem0 depth16384 #pragma HLS INTERFACE m_axi portB offsetslave bundlegmem1 depth16384 #pragma HLS INTERFACE m_axi portC offsetslave bundlegmem2 depth16384 #pragma HLS INTERFACE s_axilite portsize #pragma HLS INTERFACE s_axilite portreturn // 核心計(jì)算 }其中offsetslave表示基地址寄存器會(huì)暴露在s_axilite接口中ARM會(huì)通過(guò)寄存器來(lái)告訴IP“矩陣A的物理地址是多少”。depth用來(lái)提示工具這塊內(nèi)存的最大訪問(wèn)深度影響突發(fā)劃分建議按矩陣最大元素?cái)?shù)設(shè)置。3.2 第一版樸素矩陣乘法先驗(yàn)證功能再談性能如果只想驗(yàn)證流程可以從最直接的實(shí)現(xiàn)開始void matrixmul(int *A, int *B, int *C, int size) { #pragma HLS INTERFACE m_axi portA offsetslave bundlegmem0 #pragma HLS INTERFACE m_axi portB offsetslave bundlegmem1 #pragma HLS INTERFACE m_axi portC offsetslave bundlegmem2 #pragma HLS INTERFACE s_axilite portsize #pragma HLS INTERFACE s_axilite portreturn for (int i 0; i size; i) { for (int j 0; j size; j) { int acc 0; for (int k 0; k size; k) { acc A[i * size k] * B[k * size j]; } C[i * size j] acc; } } }這段代碼在C仿真階段完全沒(méi)問(wèn)題綜合也能通過(guò)。它的性能很差原因在于內(nèi)存訪問(wèn)模式內(nèi)層循環(huán)每讀一個(gè)數(shù)都直接訪問(wèn)DDR地址隨機(jī)性高AXI總線無(wú)法形成有效的突發(fā)傳輸大量時(shí)間浪費(fèi)在數(shù)據(jù)搬運(yùn)上。我在第一次實(shí)測(cè)時(shí)128x128的int矩陣乘法用這個(gè)版本跑硬件執(zhí)行時(shí)間能到幾百毫秒比ARM上直接用numpy還慢。這不代表HLS沒(méi)用只說(shuō)明算法映射時(shí)不能把PC上的內(nèi)存模型直接搬到FPGA上——FPGA的強(qiáng)項(xiàng)是片上存儲(chǔ)和并行計(jì)算而片上BRAM容量是有限的必須通過(guò)數(shù)據(jù)分塊讓數(shù)據(jù)盡量留在片內(nèi)。3.3 性能優(yōu)化的核心思路分塊緩存和流水線并行要做出真正能加速的版本核心思想是“分塊”把大矩陣切成適合BRAM容納的子塊先從DDR把子塊搬到片上數(shù)組計(jì)算完再搬結(jié)果回DDR。這樣整個(gè)計(jì)算過(guò)程大部分時(shí)間在片上BRAM里操作DDR只負(fù)責(zé)整塊數(shù)據(jù)的起止搬移AXI burst效率大幅提升。分塊矩陣乘法的骨架如下#define BLOCK 16 void matrixmul(int *A, int *B, int *C, int size) { #pragma HLS INTERFACE m_axi portA offsetslave bundlegmem0 depth16384 #pragma HLS INTERFACE m_axi portB offsetslave bundlegmem1 depth16384 #pragma HLS INTERFACE m_axi portC offsetslave bundlegmem2 depth16384 #pragma HLS INTERFACE s_axilite portsize #pragma HLS INTERFACE s_axilite portreturn int Ablock[BLOCK][BLOCK]; int Bblock[BLOCK][BLOCK]; #pragma HLS ARRAY_PARTITION variableAblock cyclic factor4 dim2 #pragma HLS ARRAY_PARTITION variableBblock cyclic factor4 dim1 for (int i0 0; i0 size; i0 BLOCK) { for (int j0 0; j0 size; j0 BLOCK) { int Cblock_acc[BLOCK][BLOCK] {0}; #pragma HLS ARRAY_PARTITION variableCblock_acc complete dim0 for (int k0 0; k0 size; k0 BLOCK) { // 從DDR批量搬運(yùn)Ablock和Bblock load_block(A, Ablock, i0, k0, size); load_block(B, Bblock, k0, j0, size); // 計(jì)算兩個(gè)BLOCKxBLOCK分塊的乘累加 multiply_block(Ablock, Bblock, Cblock_acc, BLOCK); } // 寫回C分塊 store_block(C, Cblock_acc, i0, j0, size); } } }這里load_block、multiply_block、store_block的內(nèi)部實(shí)現(xiàn)可以繼續(xù)優(yōu)化例如在multiply_block的最內(nèi)層循環(huán)加#pragma HLS PIPELINE II1讓乘累加每時(shí)鐘周期能啟動(dòng)一次對(duì)Ablock和Bblock做ARRAY_PARTITION把同一行的多個(gè)元素放到不同BRAM端口上實(shí)現(xiàn)多路并行讀取。當(dāng)初我從樸素版改成分塊版后128x128矩陣乘法從幾百毫秒降到了幾十毫秒量級(jí)再配合流水線和數(shù)組并行化最終可以壓到十幾毫秒甚至個(gè)位數(shù)毫秒取決于時(shí)鐘頻率和資源使用。3.4 C/RTL聯(lián)合仿真別急著導(dǎo)出IPC綜合通過(guò)后一定跑一次C/RTL聯(lián)合仿真。聯(lián)合仿真會(huì)把C測(cè)試平臺(tái)的激勵(lì)信號(hào)映射到RTL仿真器里驗(yàn)證生成的硬件邏輯和C代碼行為一致。我遇到過(guò)不止一次C仿真全對(duì)一到聯(lián)合仿真就報(bào)數(shù)據(jù)錯(cuò)誤最后定位到是頂層函數(shù)里指針參數(shù)被當(dāng)作局部緩存時(shí)綜合出的接口握手時(shí)序和testbench預(yù)期不一致。解決辦法是測(cè)試平臺(tái)里盡量用ap_vld或ap_none等接口約束控制好ap_start/rst信號(hào)或者干脆檢查m_axi的depth是否真的覆蓋了訪問(wèn)范圍depth設(shè)小了仿真時(shí)地址超出范圍也會(huì)報(bào)錯(cuò)。聯(lián)合仿真需要較長(zhǎng)時(shí)間一開始不要跑太大矩陣16x16、32x32驗(yàn)證邏輯足夠等到板上再跑128x128。這個(gè)習(xí)慣能省下大量調(diào)試時(shí)間。3.5 在Vivado里把IP接到Zynq上HLS導(dǎo)出IP后打開Vivado并創(chuàng)建Block Design按下列步驟連線添加ZYNQ7 Processing System IP運(yùn)行Block Automation按PYNQ-Z2的板級(jí)配置啟用UART、SD、USB和Ethernet。如果只是純硬件加速驗(yàn)證可以不啟用全部外設(shè)但DDR必須配好。添加導(dǎo)出的HLS IP運(yùn)行Connection Automation讓它自動(dòng)連接AXI接口。設(shè)置PL時(shí)鐘。PYNQ-Z2常見配置是FCLK_CLK0為100MHz或150MHzHLS IP的時(shí)鐘默認(rèn)會(huì)連到這個(gè)時(shí)鐘。時(shí)鐘頻率越高性能越好但時(shí)序收斂壓力也越大新手建議先100MHz跑通。地址分配。在Address Editor里給自定義IP分配地址段一般落在0x40000000~0x7FFFFFFF區(qū)域內(nèi)比如0x40000000到0x4000FFFF。如果m_axi接口無(wú)法自動(dòng)分配地址需要手動(dòng)給DDR空間賦值。生成比特流時(shí)間取決于工程復(fù)雜度。執(zhí)行Generate Bitstream后Vivado會(huì)順帶生成hwh文件。連線時(shí)有個(gè)小陷阱Zynq的PS側(cè)默認(rèn)只有S_AXI_GP0和S_AXI_GP1可以用來(lái)給PL側(cè)IP發(fā)配置信息。如果你的HLS IP用了三個(gè)m_axi接口而且需要直接訪問(wèn)DDR最好再給自定義IP連接到S_AXI_HP0或HP1否則數(shù)據(jù)通路可能全部擠在GP口上帶寬明顯不足。這個(gè)細(xì)節(jié)會(huì)直接影響性能我在后面的調(diào)優(yōu)章節(jié)再展開。4. 在PYNQ上用Python調(diào)起硬件加速?gòu)谋忍亓鞯絁upyter4.1 組織overlay文件在PYNQ板卡上新建一個(gè)工作目錄比如/home/xilinx/jupyter_notebooks/mmult/把Vivado生成的.bit和.hwh文件復(fù)制進(jìn)去并確保兩個(gè)文件的主名一致例如mmult.bitmmult.hwhJupyter里加載from pynq import Overlay overlay Overlay(mmult.bit) print(overlay)如果一切正常overlay會(huì)列出IP實(shí)例比如mmult_0。這一步如果報(bào)錯(cuò)找不到hwh先檢查兩個(gè)文件主名是否一致如果報(bào)PL版本不匹配多半是Vivado版本和PYNQ鏡像不匹配。4.2 用allocate分配物理連續(xù)內(nèi)存PYNQ里不能用普通的numpy數(shù)組直接給硬件IP傳地址。普通數(shù)組的內(nèi)存是虛擬內(nèi)存物理地址可能不連續(xù)AXI Master無(wú)法正確訪問(wèn)。正確做法是使用pynq.allocate分配物理連續(xù)且地址對(duì)齊的緩沖區(qū)from pynq import allocate import numpy as np import time N 128 A allocate(shape(N, N), dtypenp.int32) B allocate(shape(N, N), dtypenp.int32) C allocate(shape(N, N), dtypenp.int32) A[:] np.random.randint(0, 10, (N, N)).astype(np.int32) B[:] np.random.randint(0, 10, (N, N)).astype(np.int32) # 如果緩沖區(qū)是cacheable寫完后需要flush確保數(shù)據(jù)回到DDR A.flush() B.flush()allocate分配出來(lái)的緩沖區(qū)自帶device_address屬性后面會(huì)把這三個(gè)緩沖區(qū)的物理地址寫入HLS IP的寄存器。4.3 寄存器操作啟動(dòng)IP并等待完成HLS生成的s_axilite接口寄存器布局是可以預(yù)測(cè)的。對(duì)于普通HLS IP0x00地址是控制寄存器bit0寫1觸發(fā)啟動(dòng)bit1是完成標(biāo)志函數(shù)參數(shù)比如A、B、C指針和size按地址0x10、0x18、0x20、0x28順序映射。每個(gè)參數(shù)是64位地址長(zhǎng)度但低32位足夠覆蓋PYNQ-Z2的DDR物理地址空間。用Python操作寄存器的方式見下面代碼# 假設(shè)overlay.mmult_0是HLS IP實(shí)例 ip overlay.mmult_0 # 寫入三個(gè)緩沖區(qū)地址和size ip.write(0x10, A.device_address) ip.write(0x18, B.device_address) ip.write(0x20, C.device_address) ip.write(0x28, np.int32(N)) # 啟動(dòng)硬件 ip.write(0x00, 1) # 等待done標(biāo)志CTRL寄存器bit1 while (ip.read(0x00) 0x2) ! 0x2: pass # 讀取結(jié)果前如果緩沖區(qū)是cacheable需要invalidate C.invalidate() result C.copy()這段代碼基本就是所有PYNQHLS IP通用模板。如果你發(fā)現(xiàn)C矩陣值全為0最先檢查的是是否忘了寫緩沖區(qū)地址其次檢查size是否寫成了0x28位寬不對(duì)再次檢查DMA緩沖區(qū)是否flush。4.4 實(shí)測(cè)性能對(duì)比軟件和硬件到底差多少我在PYNQ-Z2上跑的128x128 int矩陣乘法時(shí)鐘100MHz軟件側(cè)直接用ARM A9上的numpy使用OpenBLAS大約40ms左右第一版樸素HLS IP反而要三百多毫秒優(yōu)化后的分塊HLS IP大約10~15ms。如果繼續(xù)優(yōu)化比如使用雙緩沖、增大分塊、提高PL時(shí)鐘到150MHz可以進(jìn)一步降到個(gè)位數(shù)毫秒。這個(gè)對(duì)比不是想強(qiáng)調(diào)硬件一定比軟件快而是想說(shuō)清楚一個(gè)道理FPGA加速的收益來(lái)自于“并行計(jì)算 數(shù)據(jù)重新調(diào)度”的組合缺一不可。如果只是把PC的循環(huán)直接翻譯成硬件很可能比CPU還慢。5. 性能調(diào)優(yōu)的關(guān)鍵路徑從200ms優(yōu)化到十幾毫秒5.1 為什么第一版HLS IP比軟件還慢很多新手在HLS第一步就跑出了“負(fù)優(yōu)化”然后就下結(jié)論說(shuō)HLS沒(méi)用。實(shí)際上第一版慢主要有兩個(gè)原因內(nèi)存訪問(wèn)沒(méi)有突發(fā)樸素版本里內(nèi)層循環(huán)逐個(gè)訪問(wèn)DDR地址AXI總線無(wú)法利用burst模式相當(dāng)于每次讀一個(gè)32位數(shù)據(jù)都需要和DDR做一次完整握手延遲極大。計(jì)算沒(méi)有并行即便內(nèi)層循環(huán)沒(méi)有流水線每個(gè)時(shí)鐘周期也只能做一次乘累加硬件資源和電腦CPU相比沒(méi)有任何優(yōu)勢(shì)。解決這兩個(gè)問(wèn)題的方向很明確先做數(shù)據(jù)分塊讓DDR訪問(wèn)變成連續(xù)的大塊數(shù)據(jù)傳輸再做循環(huán)優(yōu)化讓FPGA上的DSP48E1和BRAM真正忙碌起來(lái)。5.2 HLS優(yōu)化指令的實(shí)戰(zhàn)組合PIPELINE、UNROLL、ARRAY_PARTITIONHLS代碼的性能主要由三個(gè)基本操作決定PIPELINE讓循環(huán)體在不同迭代之間重疊執(zhí)行。最理想的是II1也就是每個(gè)時(shí)鐘周期都能處理一次循環(huán)迭代。UNROLL把循環(huán)展開用多個(gè)計(jì)算單元同時(shí)處理多個(gè)數(shù)據(jù)。展開因子越大DSP資源使用越多吞吐越高。ARRAY_PARTITION把大數(shù)組切分成多個(gè)小數(shù)組分布在多個(gè)BRAM端口上解決“同時(shí)需要讀多個(gè)數(shù)據(jù)”時(shí)的帶寬瓶頸。矩陣乘法里我常用的組合是#pragma HLS ARRAY_PARTITION variableAblock cyclic factor4 dim2 #pragma HLS ARRAY_PARTITION variableBblock cyclic factor4 dim1 #pragma HLS PIPELINE II1這樣設(shè)計(jì)后乘累加循環(huán)每周期可以同時(shí)從Ablock的不同列和Bblock的不同行讀取多個(gè)數(shù)據(jù)配合DSP資源做并行乘法。資源約束也要心里有數(shù)。XC7Z020的PL側(cè)有220個(gè)DSP48E1、140個(gè)BRAM36Kb。如果展開因子太大、數(shù)組切得太碎綜合時(shí)資源超了就會(huì)自動(dòng)降頻或瘋狂布線結(jié)果反而變慢。我的經(jīng)驗(yàn)是小矩陣如128x128用factor4或8不用追求極端展開資源利用率保持在70%以內(nèi)時(shí)序會(huì)寬松得多。5.3 dataflow與雙緩沖解決數(shù)據(jù)搬運(yùn)和計(jì)算互相等待分塊設(shè)計(jì)里還有一個(gè)隱藏瓶頸搬運(yùn)數(shù)據(jù)需要時(shí)間計(jì)算也需要時(shí)間如果搬一塊、算一塊、再搬一塊、再算一塊數(shù)據(jù)通路就是串行的。解決辦法是用#pragma HLS DATAFLOW把多個(gè)循環(huán)塊流水起來(lái)讓上一個(gè)循環(huán)還在搬運(yùn)時(shí)下一個(gè)循環(huán)已經(jīng)開始計(jì)算更進(jìn)階的是用寄存器或BRAM做雙緩沖一塊buffer在計(jì)算時(shí)另一塊buffer在接收DDR數(shù)據(jù)。DATAFLOW的坑在于不同循環(huán)之間如果有數(shù)據(jù)依賴工具會(huì)強(qiáng)制插入乒乓緩沖Ping-Pong Buffer資源占用會(huì)成倍增長(zhǎng)。我當(dāng)時(shí)調(diào)試時(shí)發(fā)現(xiàn)資源占用突然翻了一倍就是這個(gè)原因。最終我選擇手動(dòng)控制分塊循環(huán)把搬運(yùn)和計(jì)算拆到不同函數(shù)再用DATAFLOW串起來(lái)才在資源和性能之間找到平衡點(diǎn)。5.4 哪些算法適合放進(jìn)HLS加速器做了幾個(gè)HLS項(xiàng)目后我對(duì)“什么算法適合HLS加速”有了比較清晰的認(rèn)識(shí)適合計(jì)算密集、數(shù)據(jù)復(fù)用率高、有規(guī)則訪問(wèn)模式的算法矩陣乘、卷積、FIR濾波、FFT都是典型。不太適合分支邏輯復(fù)雜、依賴遞歸、數(shù)據(jù)訪問(wèn)完全隨機(jī)或需要頻繁動(dòng)態(tài)分配內(nèi)存的算法。勉強(qiáng)適合圖形圖像預(yù)處理、視頻縮放、顏色空間轉(zhuǎn)換這類流式處理但要優(yōu)先選AXI-Stream接口而不是m_axi效率會(huì)更高。如果你拿不準(zhǔn)可以先在C語(yǔ)言階段統(tǒng)計(jì)一下算法內(nèi)層循環(huán)是否存在大量乘累加訪問(wèn)數(shù)組時(shí)地址是否規(guī)律如果兩個(gè)條件都滿足HLS大概率能幫你吃下這塊硬件加速的蛋糕。6. 常見問(wèn)題與排查技巧那些文檔里不寫的坑6.1 仿真過(guò)了但板子跑掛先懷疑復(fù)位和時(shí)鐘HLS的C仿真過(guò)關(guān)不代表上板一定正常工作。最常見的情況是IP沒(méi)收到有效復(fù)位或時(shí)鐘沒(méi)起來(lái)。PYNQ-Z2的PL側(cè)時(shí)鐘由PS輸出如果Block Design里沒(méi)配置好FCLK或沒(méi)使能對(duì)應(yīng)的GP端口IP內(nèi)部狀態(tài)機(jī)可能永遠(yuǎn)停在初始狀態(tài)。排查辦法在Jupyter里寫一段循環(huán)讀取IP CTRL寄存器觀察ap_idle位是否為1。如果始終是0說(shuō)明IP根本沒(méi)有正確初始化回頭查時(shí)鐘和復(fù)位連接。另一個(gè)快速驗(yàn)證方案是在IP里加一個(gè)固定值輸出寄存器比如某個(gè)內(nèi)部計(jì)數(shù)器的低16位加載后直接讀寄存器如果讀到非零值就說(shuō)明IP在跑。6.2 burst沒(méi)有打滿帶寬上不去優(yōu)化后的HLS IP在C綜合報(bào)告里可能顯示吞吐很高但實(shí)測(cè)性能依然拉胯。問(wèn)題通常出在AXI burst效率上。打開Vivado的波形或HLS的接口報(bào)告看m_axi接口的burst長(zhǎng)度是否達(dá)到十幾以上。如果burst長(zhǎng)度總被限制在4或8說(shuō)明綜合器認(rèn)為訪問(wèn)的數(shù)據(jù)不連續(xù)或存在別名問(wèn)題。一個(gè)很實(shí)用的技巧在函數(shù)參數(shù)里給指針加__restrict限定符告訴編譯器A、B、C不會(huì)指向同一片內(nèi)存綜合器就能更大膽地安排連續(xù)讀。另外檢查depth參數(shù)是否夠大過(guò)小的depth會(huì)讓工具保守地限制突發(fā)。6.3 hwh文件缺失、地址沖突和DDR緩存一致性O(shè)verlay加載失敗的第三個(gè)高頻問(wèn)題就是hwh文件缺失或IP實(shí)例名對(duì)不上。PYNQ加載hwh后會(huì)按照實(shí)例名生成Python屬性。如果你的Block Design里IP名字叫matrixmul_0Python里就得用overlay.matrixmul_0如果名字叫mmult_0就用overlay.mmult_0。命名不統(tǒng)一雖然不影響硬件功能但代碼里找起來(lái)很痛苦建議在建工程時(shí)就有意識(shí)地統(tǒng)一命名。數(shù)據(jù)錯(cuò)亂還可能是緩存一致性問(wèn)題。PYNQ的allocate默認(rèn)分配non-cacheable內(nèi)存通常不需要手動(dòng)flush。但如果你用其他途徑分配內(nèi)存或者對(duì)一些非默認(rèn)target的緩沖區(qū)寫回和失效操作就很重要。我習(xí)慣總是調(diào)用A.flush()和C.invalidate()代價(jià)是幾個(gè)微秒換來(lái)的是調(diào)試時(shí)少掉頭發(fā)。6.4 我的個(gè)人心得版本管理、增量?jī)?yōu)化和耐心最后分享幾條我自己的實(shí)操經(jīng)驗(yàn)純屬個(gè)人習(xí)慣但效果很好。工程目錄做好版本管理。HLS代碼、Vivado工程、PYNQ overlay目錄三者分開每輪優(yōu)化都記錄基線比如“樸素版320ms”、“分塊版45ms”這樣能清晰看出改動(dòng)帶來(lái)了什么效果。優(yōu)化要增量跑。不要一次把分塊、流水線、數(shù)組切分、DATAFLOW全部堆上出問(wèn)題根本定位不了。每加一條pragma就重新綜合一次雖然慢一點(diǎn)但調(diào)試效率反而更高。對(duì)參數(shù)化代碼先在C仿真里用小矩陣比如16x16驗(yàn)證所有邊界再上板跑128x128。板上調(diào)試的成本遠(yuǎn)高于PC仿真能提前發(fā)現(xiàn)的問(wèn)題就不要留到板子上。如果你也想在PYNQ-Z2上試一把自定義硬件加速建議就從矩陣乘法這個(gè)例子開始跑通全流程再把其中的負(fù)載替換成你真正關(guān)心的算法。整套“C代碼 - HLS綜合 - Vivado集成 - PYNQ Python調(diào)用”的鏈路一旦打通后續(xù)做圖像卷積、FIR濾波、簡(jiǎn)單神經(jīng)網(wǎng)絡(luò)推理都會(huì)順很多。