數(shù)據(jù)存儲方案詳解)
做工業(yè)設(shè)備這幾年真正讓我頭疼的往往不是算法和通信協(xié)議而是最不起眼的“存數(shù)據(jù)”。之前做一個電力參數(shù)記錄模塊用MCU內(nèi)部Flash頻繁改寫參數(shù)設(shè)備運行一年半以后寫入時間越來越長最后干脆寫不進去——查了Flash的擦寫壽命只有十萬次而現(xiàn)場一天要寫幾十次不磨穿才怪。后來把存儲方案換成 Everspin 的 MR25H40CDF配合 TI 的 TM4C129XKCZAD工業(yè)現(xiàn)場的參數(shù)存儲和日志讀寫問題才算徹底解決。這篇文章就專門聊聊這套組合的完整落地過程為什么選 MRAM 而不是 Flash、硬件上怎么接、驅(qū)動怎么寫、掉電保護怎么做以及實際調(diào)試中踩過的一堆坑。1. 為什么工業(yè)現(xiàn)場的數(shù)據(jù)這么難存Flash 的壽命短板與 MRAM 的用武之地1.1 工業(yè)存儲的真實需求沒那么簡單很多人覺得“存數(shù)據(jù)”不就是往存儲器里寫字節(jié)嘛庫函數(shù)一調(diào)就完事。真到工業(yè)現(xiàn)場你就會發(fā)現(xiàn)需求遠比想象中苛刻參數(shù)要頻繁改寫。比如設(shè)備校準系數(shù)、累計運行時間、報警閾值一天可能要更新幾十次甚至上百次常年累月下來寫入次數(shù)非??捎^。斷電瞬間不能丟數(shù)據(jù)?,F(xiàn)場設(shè)備隨時可能被直接拉閘你永遠不知道下一次停電發(fā)生在哪條指令執(zhí)行到一半的時候。溫度范圍寬。配電柜、電機旁邊、戶外機箱-40℃ 到 85℃ 都不稀奇消費級存儲片基本不敢用。上電就要能快速讀回配置不能每次開機都花幾百毫秒等著擦除或初始化。這些需求疊加起來MCU 內(nèi)部 Flash 的短板就非常明顯寫入前要擦除擦除粒度是 4KB 一個扇區(qū)壽命普遍在十萬次級別而且擦寫過程耗時不可忽略。你把參數(shù)存內(nèi)部 Flash一年半載之后就會遇到我開頭說的那種情況——寫入越來越慢最后報錯。1.2 MR25H40CDF 是個什么東西MR25H40CDF 是 Everspin 的 4Mbit 串行 MRAM也就是磁阻隨機存取存儲器。它內(nèi)部的核心存儲單元是磁隧道結(jié)MTJ用磁性狀態(tài)而不是電荷來保存數(shù)據(jù)。這個原理帶來了幾個很實在的好處寫入不需要擦除直接覆蓋像 SRAM 一樣痛快。寫入耐久度極高標(biāo)稱在 10 的 16 次方次級別基本可以認為“隨便寫寫不壞”。斷電后依靠磁性狀態(tài)保持數(shù)據(jù)不需要電池數(shù)據(jù)保持年限按 20 年以上設(shè)計。抗輻射、抗電磁干擾能力比電荷存儲器件好很多很適合電機、變頻器這類電磁環(huán)境惡劣的工業(yè)場合。MR25H40CDF 的容量是 4Mbit也就是 512KB對工業(yè)配置參數(shù)加日志緩沖來說非常合適。SPI 接口支持 Mode 0 和 Mode 3工作電壓 2.7V 到 3.6V工業(yè)級溫度范圍封裝也不大。我們項目里把它當(dāng)“掉電不丟的小容量硬盤”用。1.3 和幾個常見方案對比一下我整理過一張對比表項目選型的時候反復(fù)看了很多遍方案寫入速度寫入壽命掉電保持典型容量主要麻煩內(nèi)部 Flash中等需擦除約10萬次好由MCU決定壽命短、擦寫慢、占用程序空間外部 EEPROM慢約100萬次好幾百KB以下容量小、寫慢、價格不便宜FRAM快無需擦除約10的12次方好幾十KB到幾MB大容量型號貴、選擇少SRAM電池快無限依賴電池看SRAM容量要換電池不適合免維護設(shè)備SPI NOR Flash中等需擦除約10萬次好4MB到數(shù)百MB壽命短、需要壞塊管理MRAM快無需擦除約10的16次方好256KB到幾十MB每bit成本相對高最后定 MRAM核心原因就兩個字省心。省掉了擦除邏輯、壞塊管理、磨損均衡把“寫存儲”變成“寫內(nèi)存”開發(fā)成本直接降一大截。至于成本工業(yè)設(shè)備里存儲芯片不是 BOM 大頭穩(wěn)定性和開發(fā)效率遠比那幾塊錢差價重要。2. TM4C129XKCZAD 的 SSI 資源與 MR25H40CDF 的硬件連接要點2.1 為什么控制器選 TM4C129XKCZADTM4C129XKCZAD 屬于 TI Tiva C 系列Cortex-M4F 內(nèi)核主頻 120MHz這個型號在 Tiva C 系列里屬于集成度比較高的內(nèi)部 Flash 和 SRAM 都夠用帶以太網(wǎng) MACPHY、USB、多路 UART、多路 SSI也就是 SPI。選它做工業(yè)主控有幾個實際考慮內(nèi)核帶硬件浮點單元做采集計算和算法處理不吃力。自帶以太網(wǎng) PHY后續(xù)要把設(shè)備數(shù)據(jù)傳到上位機或者云平臺不用外掛 PHY 芯片硬件設(shè)計省一大塊。外設(shè)多特別是 SSI 模塊有好幾個留給存儲、傳感器、顯示各一路互不打架。工業(yè)級溫度范圍跑現(xiàn)場環(huán)境比普通消費級 MCU 穩(wěn)。在存儲這個具體需求上我們主要用到它的 SSI 外設(shè)加上幾個普通 GPIO后面如果要做網(wǎng)絡(luò)日志上傳以太網(wǎng)通道就是現(xiàn)成的。2.2 硬件連接里最容易被忽略的引腳MR25H40CDF 的標(biāo)準 SPI 接口是 CS#、SCLK、SI、SO 四個信號外加一個 WP# 寫保護腳和一個 HOLD# 暫停腳。很多人第一次畫原理圖時只關(guān)注那四個 SPI 信號把 WP# 和 HOLD# 隨便處理后面調(diào)試就出各種奇怪問題。我整理一下我們量產(chǎn)板的連接方式MR25H40CDF 信號連接目標(biāo)處理方式CS#MCU GPIO普通 GPIO 控制低電平有效不要用 SSI 硬件 FSS 自動控制方便手動控制片選時序SCLKMCU SSI0Clk直接連接線長超過 5cm 建議串 22Ω 到 33Ω 電阻SIMCU SSI0Tx主出從入直接連接SOMCU SSI0Rx主入從出直接連接WP#MCU GPIO 或 3.3V不用寫保護功能時上拉到 3.3V使芯片處于可寫狀態(tài)要做配置區(qū)鎖定時用 GPIO 控制HOLD#3.3V 上拉必須上拉懸空時可能誤入暫停狀態(tài)導(dǎo)致讀數(shù)據(jù)錯位VDD3.3V旁邊放 100nF 去耦電容電源入口再放 10uF 電解電容GNDGND推薦在芯片下方鋪地不要只是單點連線這里重點說兩個腳。第一個是 HOLD#它在低電平時會讓芯片暫停當(dāng)前操作并忽略時鐘如果懸空周圍電磁噪聲一干擾芯片可能突然“僵住”你這邊 SPI 時鐘敲了半天它不響應(yīng)讀回來的全是垃圾數(shù)據(jù)。第二個是 WP#它低電平時啟用寫保護跟狀態(tài)寄存器里的 WPEN 位配合可以鎖定部分或全部地址區(qū)域。我們實際項目里把 WP# 接到了 GPIO平時輸出高電平允許寫入只有在“上鎖配置區(qū)”這個軟件流程里才短暫拉低。2.3 電源、地線和上電順序MR25H40CDF 的工作電壓是 2.7V 到 3.6VTM4C129 的 IO 也是 3.3V 電平兩者可以直接連不需要電平轉(zhuǎn)換。唯一要注意的是電源質(zhì)量工業(yè)現(xiàn)場如果電源紋波大SPI 高速通信時容易出隨機誤碼。我們在板子上給 MRAM 的 VDD 做了簡單濾波就近放了 100nF芯片和 MCU 的電源域之間再放一個磁珠實測紋波從 80mV 降到了 20mV 以內(nèi)錯誤率明顯下降。上電順序倒不用太糾結(jié)因為兩者共用同一個 3.3V 域。不過建議軟件里做一步保險系統(tǒng)時鐘穩(wěn)定后延時 10ms 再訪問 MRAM避免 MCU 復(fù)位期間 GPIO 出現(xiàn)毛刺把 CS# 拉了一下導(dǎo)致誤寫入。2.4 硬件焊好之后先別急著寫代碼我習(xí)慣是先上電用示波器把幾個關(guān)鍵點量一遍再開始寫驅(qū)動量 VDD 對 GND 電壓確認在 3.3V 附近穩(wěn)定。量 HOLD# 引腳確認是高電平不是懸空狀態(tài)。量 WP# 引腳確認我們初始化的 GPIO 輸出是想要的電平。手動用示波器觸發(fā)看一次 CS# 拉低再拉高的過程確認 GPIO 控制正常。這些檢查十分鐘搞定能省掉后面兩三個小時的軟件調(diào)試時間。3. MR25H40CDF 的命令集與時序它不是 Flash但操作起來像 Flash3.1 命令集總覽MR25H40CDF 的指令風(fēng)格和 SPI NOR Flash 非常相似這讓很多從 Flash 方案遷移過來的工程師上手很快。常用命令如下命令指令碼功能說明WREN0x06寫使能寫操作之前必須先發(fā)這個WRDI0x04寫禁止RDSR0x05讀狀態(tài)寄存器WRSR0x01寫狀態(tài)寄存器配置寫保護區(qū)域READ0x03普通讀支持連續(xù)讀FAST_READ0x0B高速讀帶 dummy byte大塊數(shù)據(jù)讀取時用WRITE0x02寫數(shù)據(jù)不需要擦除直接覆蓋SLEEP0xB9進入睡眠模式降低功耗WAKE0xAB喚醒退出睡眠模式注意 MRAM 寫數(shù)據(jù)和 Flash 的本質(zhì)差異Flash 寫之前要確保目標(biāo)區(qū)域已被擦除否則只能把 1 寫成 0不能把 0 寫成 1MRAM 沒有這個問題每個 bit 都可以獨立寫 0 或?qū)?1所以完全不需要“先擦除再寫”這套流程。3.2 狀態(tài)寄存器與寫保護邏輯狀態(tài)寄存器里有一個關(guān)鍵位是 WPEN它和硬件引腳 WP# 共同決定寫保護范圍。具體邏輯是WP# 為低電平時根據(jù)狀態(tài)寄存器里設(shè)置的保護位可以鎖定全部地址區(qū)域或者只鎖定頭部區(qū)域WP# 為高電平時即使?fàn)顟B(tài)寄存器設(shè)置了保護位也只會有一部分被保護。我們項目里對這個功能的用法很保守初始狀態(tài)下 WP# 拉高允許正常讀寫如果要防止現(xiàn)場誤寫就在軟件里先把關(guān)鍵參數(shù)寫完然后拉低 WP#同時把狀態(tài)寄存器的保護位設(shè)好。這樣即使程序跑飛也很難誤改配置區(qū)。這里還有一個細節(jié)MRAM 不像 Flash 有個明顯的 WIP寫忙狀態(tài)位因為寫操作幾乎瞬間完成。我從數(shù)據(jù)手冊確認了這個型號沒有需要輪詢的忙標(biāo)志所以寫完成后直接做讀回校驗就行不需要等待擦除時間。3.3 一次完整寫入動作的時序拆解不要一上來就寫代碼先把單次寫操作的時序在紙上過一遍CS# 拉低。發(fā)送 WREN0x06命令。CS# 拉高結(jié)束寫使能命令。CS# 拉低。發(fā)送 WRITE0x02命令。發(fā)送 3 字節(jié)地址MR25H40CDF 容量 512KB地址是 19 位有效按 A18~A0 放在 3 個字節(jié)里高位字節(jié)低 5 位有效其他位填 0 即可。連續(xù)發(fā)送待寫入數(shù)據(jù)字節(jié)每個字節(jié)同時會從 MISO 上收回來一個無效字節(jié)直接忽略。全部發(fā)完后 CS# 拉高寫操作完成。讀操作更簡單CS# 拉低發(fā) 0x03 命令發(fā) 3 字節(jié)地址然后連續(xù)發(fā)送 dummy 字節(jié)產(chǎn)生時鐘每個時鐘沿從 MISO 上讀回一個有效數(shù)據(jù)字節(jié)最后 CS# 拉高。關(guān)鍵提醒在 SPI 里發(fā)送和接收是同時進行的。你發(fā)一個地址字節(jié)出去的時候MISO 上同時會移出一個舊數(shù)據(jù)這個舊數(shù)據(jù)要丟到否則讀回來的第一個字節(jié)就會錯位。很多新手在這里栽跟頭讀出來第一個字節(jié)是 FF 或者上一個地址的殘留數(shù)據(jù)。4. TM4C129 SSI 驅(qū)動落地初始化、底層收發(fā)與讀寫 API 封裝4.1 SSI 外設(shè)初始化配置TM4C129 的 SSI 模塊可以配置成 SPI 主模式幀格式選 Freescale SPI位寬 8 位。我們工作時鐘設(shè)的是 16MHz在工業(yè)環(huán)境里這個速率比較保守但穩(wěn)定第一。如果現(xiàn)場干擾不大后續(xù)可以往上調(diào)。用 TivaWare 庫初始化的關(guān)鍵代碼如下#include stdint.h #include stdbool.h #include inc/hw_memmap.h #include inc/hw_ssi.h #include driverlib/sysctl.h #include driverlib/gpio.h #include driverlib/ssi.h #include driverlib/pin_map.h #define MRAM_CS_BASE GPIO_PORTA_BASE #define MRAM_CS_PIN GPIO_PIN_3 #define MRAM_WP_BASE GPIO_PORTA_BASE #define MRAM_WP_PIN GPIO_PIN_6 static void mram_gpio_init(void) { // 啟用 SSI0 和 GPIOA 時鐘 SysCtlPeripheralEnable(SYSCTL_PERIPH_SSI0); SysCtlPeripheralEnable(SYSCTL_PERIPH_GPIOA); // 配置 SSI0 引腳復(fù)用 GPIOPinConfigure(GPIO_PA2_SSI0CLK); GPIOPinConfigure(GPIO_PA4_SSI0RX); GPIOPinConfigure(GPIO_PA5_SSI0TX); GPIOPinTypeSSI(GPIO_PORTA_BASE, GPIO_PIN_2 | GPIO_PIN_4 | GPIO_PIN_5); // CS# 和 WP# 用普通 GPIO GPIOPinTypeGPIOOutput(MRAM_CS_BASE, MRAM_CS_PIN); GPIOPinTypeGPIOOutput(MRAM_WP_BASE, MRAM_WP_PIN); GPIOPinWrite(MRAM_CS_BASE, MRAM_CS_PIN, MRAM_CS_PIN); // CS# 默認拉高 GPIOPinWrite(MRAM_WP_BASE, MRAM_WP_PIN, MRAM_WP_PIN); // WP# 默認拉高允許寫入 } static void mram_ssi_init(void) { // 系統(tǒng)時鐘作為 SSI 時鐘源目標(biāo)速率 16MHzMode 0主模式8 位 SSIConfigSetExpClk(SSI0_BASE, SysCtlClockGet(), 16000000, SSI_FRF_MOTO_MODE_0, SSI_MODE_MASTER, 8); SSIEnable(SSI0_BASE); }這里有兩個細節(jié)要注意第一GPIOPinConfigure 里的引腳復(fù)用名稱要和實際選的引腳對應(yīng)不同封裝、不同 SSI 模塊的復(fù)用編號不一樣畫板前一定要在數(shù)據(jù)手冊的 pin mux 表里核對第二CS# 我堅持用 GPIO 控制而不是用 SSI 的硬件 FSS原因是 MRAM 的寫命令需要先 CS# 拉低、發(fā) 0x06、再拉高然后再拉低發(fā) 0x02這種“命令之間 CS# 必須反跳”的動作用硬件 FSS 很難做到干凈利落。4.2 底層 SPI 收發(fā)函數(shù)SPI 本質(zhì)是滿雙工所以底層只寫一個“發(fā)一字節(jié)同時收一字節(jié)”的函數(shù)static uint8_t spi_xfer(uint8_t out) { uint32_t rx; // 等待發(fā)送 FIFO 有空間 while (SSIDataPutNonBlocking(SSI0_BASE, out) 0) { } // 等待接收 FIFO 非空讀回數(shù)據(jù) while (SSIDataGetNonBlocking(SSI0_BASE, rx) 0) { } return (uint8_t)rx; }如果不想用 TivaWare 的非阻塞函數(shù)也可以用 SSIDataPut 和 SSIDataGet它們自帶阻塞邏輯。但我在實際項目里更傾向于上面這種寫法因為我可以加入超時保護防止 SPI 總線異常時程序卡死在等待循環(huán)里static bool spi_xfer_timeout(uint8_t out, uint8_t *in, uint32_t timeout_us) { uint32_t tick 0; uint32_t rx 0; bool tx_ok false; bool rx_ok false; while (tick timeout_us) { if (!tx_ok SSIDataPutNonBlocking(SSI0_BASE, out)) { tx_ok true; } if (tx_ok SSIDataGetNonBlocking(SSI0_BASE, rx)) { rx_ok true; break; } // 實際延時 1us可用 SysCtlDelay 實現(xiàn) tick; } if (rx_ok in) { *in (uint8_t)rx; } return rx_ok; }這個超時版本在量產(chǎn)設(shè)備里非常重要。SPI 總線在工業(yè)現(xiàn)場偶爾會被干擾拉死如果沒有超時保護一個 while 循環(huán)卡死整個系統(tǒng)就癱瘓了。加個超時錯誤上報看門狗還能兜底。4.3 MRAM 讀寫 API 封裝有了底層收發(fā)MRAM 的讀寫函數(shù)就非常直接了#define MRAM_SIZE (512 * 1024) // 512KB #define MRAM_READ (0x03) #define MRAM_WRITE (0x02) #define MRAM_WREN (0x06) #define MRAM_RDSR (0x05) #define MRAM_SLEEP (0xB9) #define MRAM_WAKE (0xAB) #define MRAM_CS_LOW() GPIOPinWrite(MRAM_CS_BASE, MRAM_CS_PIN, 0) #define MRAM_CS_HIGH() GPIOPinWrite(MRAM_CS_BASE, MRAM_CS_PIN, MRAM_CS_PIN) static void mram_send_addr(uint32_t addr) { spi_xfer_timeout((uint8_t)((addr 16) 0xFF), NULL, 100); spi_xfer_timeout((uint8_t)((addr 8) 0xFF), NULL, 100); spi_xfer_timeout((uint8_t)(addr 0xFF), NULL, 100); } int mram_read(uint32_t addr, uint8_t *buf, uint32_t len) { uint8_t dummy; if (buf NULL || len 0 || (addr len) MRAM_SIZE) { return -1; } MRAM_CS_LOW(); spi_xfer_timeout(MRAM_READ, dummy, 100); mram_send_addr(addr); for (uint32_t i 0; i len; i) { spi_xfer_timeout(0x00, buf[i], 100); } MRAM_CS_HIGH(); return 0; } int mram_write(uint32_t addr, const uint8_t *buf, uint32_t len) { uint8_t dummy; if (buf NULL || len 0 || (addr len) MRAM_SIZE) { return -1; } // 第一步發(fā)送寫使能 MRAM_CS_LOW(); spi_xfer_timeout(MRAM_WREN, dummy, 100); MRAM_CS_HIGH(); // 第二步發(fā)送寫命令和地址、數(shù)據(jù) MRAM_CS_LOW(); spi_xfer_timeout(MRAM_WRITE, dummy, 100); mram_send_addr(addr); for (uint32_t i 0; i len; i) { spi_xfer_timeout(buf[i], dummy, 100); } MRAM_CS_HIGH(); // 第三步讀回校驗確保關(guān)鍵數(shù)據(jù)寫對了 uint8_t check; if (mram_read(addr, check, 1) ! 0 || check ! buf[0]) { return -2; } return 0; }有人覺得寫完后讀回校驗是浪費時間但工業(yè)設(shè)備你就得這么干。MRAM 寫入可靠性確實高但 SPI 信號線的接觸不良、電源瞬態(tài)干擾、接線老化這些都會導(dǎo)致數(shù)據(jù)根本沒進去。寫后讀回只要 1 個字節(jié)就能把絕大多數(shù)傳輸錯誤抓出來。4.4 大數(shù)據(jù)塊讀寫與 DMA 優(yōu)化時機MRAM 支持連續(xù)讀、連續(xù)寫不需要按頁拆分所以日志記錄這種大批量操作很適合直接一個循環(huán)拷過去。但要注意一點如果每次都用輪詢方式一個字節(jié)一個字節(jié)地收發(fā)CPU 占用率會很高。16MHz 時鐘下一個字節(jié)大約 0.5us讀 1KB 數(shù)據(jù)就需要 512us期間 CPU 幾乎都在等 FIFO。當(dāng)單次讀寫長度超過 64 字節(jié)、或者有實時任務(wù)需要跑時就該考慮 DMA 了。TM4C129 的 uDMA 可以直接在 SSI0 和內(nèi)存之間搬運數(shù)據(jù)配置要點是選擇 SSI0 RX 和 TX 對應(yīng)的 DMA 通道。TX 通道使用內(nèi)存到外設(shè)模式RX 通道使用外設(shè)到內(nèi)存模式。傳輸完成后在 DMA 中斷里釋放信號量通知應(yīng)用層數(shù)據(jù)就緒。MRAM 讀操作需要先發(fā)命令和地址再連續(xù)產(chǎn)生時鐘收數(shù)據(jù)建議用“先手動輪詢發(fā)完命令/地址再啟動 RX DMA 接收數(shù)據(jù)正文”的方式避免 DMA 把命令字節(jié)也當(dāng)成有效數(shù)據(jù)收進來。我自己在實際項目里是輪詢和 DMA 混用的配置參數(shù)讀寫量小用輪詢加超時保護日志記錄塊動輒幾百字節(jié)用 DMA。這樣既保證代碼簡單又不占 CPU。4.5 實測速率和資源占用我們的配置是 16MHz SPI實測連續(xù)寫 512 字節(jié)耗時約 1.2ms連續(xù)讀 512 字節(jié)約 0.8ms算下來實際吞吐在 1.5MB/s 到 2MB/s 左右對工業(yè)參數(shù)和日志場景完全夠用。如果追求更高可以嘗試把 SSI 時鐘調(diào)到 20MHz 甚至 33MHz但線長和板子布局就得重新評估了。5. 掉電保護與數(shù)據(jù)完整性雙區(qū)鏡像、寫保護與上電自檢5.1 硬件寫保護與狀態(tài)寄存器鎖定MRAM 雖然不怕頻繁寫但怕“亂寫”。程序跑飛、上電瞬間 GPIO 毛刺、電源跌落時 CPU 執(zhí)行錯誤代碼都有可能往存儲區(qū)寫入臟數(shù)據(jù)。我們的防護思路是三層硬件層WP# 平時保持高電平允許正常寫進入“配置鎖定”狀態(tài)后拉低 WP#。軟件層每次寫操作前發(fā) WREN寫完成后立即返回不讓寫命令長時間掛在總線上。應(yīng)用層關(guān)鍵參數(shù)區(qū)域通過狀態(tài)寄存器設(shè)置保護位鎖定后即使誤發(fā)寫命令也不生效。這里有個容易踩的細節(jié)狀態(tài)寄存器的寫保護配置本身也需要先發(fā) WREN 才能寫。所以“鎖定”這個動作要放在所有參數(shù)寫完之后再做否則鎖了以后你想改配置還要先解鎖流程沒設(shè)計好會把自己鎖在外面。5.2 掉電檢測與數(shù)據(jù)落位順序MCU 檢測到掉電后通常只有幾毫秒到十幾毫秒的窗口時間用來保存數(shù)據(jù)。這時候你要做的是停止無關(guān)任務(wù)進入緊急保存流程。先把要保存的數(shù)據(jù)計算好、封裝成完整塊。寫存儲時先寫“數(shù)據(jù)塊頭”里面包含 magic、版本號、長度、CRC32數(shù)據(jù)塊正文跟在后面。全部寫完后再更新一個“提交標(biāo)志位”這個標(biāo)志位放在另一個地址區(qū)域。為什么要分兩步因為掉電可能發(fā)生在寫入過程的中途。如果先寫數(shù)據(jù)、最后寫提交標(biāo)志那么掉電中斷時標(biāo)志還是舊的上電后發(fā)現(xiàn)不匹配就知道上一次保存沒完成自動回滾到備份區(qū)。反過來如果先寫標(biāo)志再寫數(shù)據(jù)斷電后會出現(xiàn)“標(biāo)志新、數(shù)據(jù)舊”的錯亂狀態(tài)。5.3 雙區(qū)鏡像與回滾工業(yè)設(shè)備最怕數(shù)據(jù)半新不舊。我們采用的方案是雙區(qū)鏡像區(qū)域起始地址用途A區(qū)0x00000當(dāng)前參數(shù)區(qū)B區(qū)0x20000備份參數(shù)區(qū)日志區(qū)0x40000環(huán)形日志緩沖每次正常保存時先寫 B 區(qū)校驗通過后寫 A 區(qū)保持兩個區(qū)都有效。上電啟動時先讀 A 區(qū)檢查 magic、版本和 CRC32全部通過就直接使用。如果 A 區(qū)校驗失敗讀 B 區(qū)B 區(qū)通過則用 B 區(qū)恢復(fù) A 區(qū)。如果兩個區(qū)都校驗失敗加載出廠默認參數(shù)并上報“配置丟失”事件。這個流程代碼量不大但能把單點故障的概率降到很低。MRAM 本身可靠性已經(jīng)很高再加雙區(qū)鏡像基本可以做到“配置數(shù)據(jù)無故丟失”這件事在設(shè)備生命周期內(nèi)不發(fā)生。5.4 上電自檢流程每次上電我們在進入主循環(huán)之前會對 MRAM 做一次快速自檢讀狀態(tài)寄存器確認芯片響應(yīng)正常。讀固定區(qū)域的 magic 值確認數(shù)據(jù)布局沒有被破壞。在非關(guān)鍵區(qū)域?qū)?0x55、0xAA 再讀回確認讀寫通路正常。如果自檢失敗點亮告警燈同時通過日志記錄錯誤類型。這個自檢開銷只有幾毫秒但對現(xiàn)場維護來說價值巨大故障定位可以明確區(qū)分“MRAM 芯片壞了”還是“參數(shù)丟了”而不是籠統(tǒng)的一句“設(shè)備異?!?。5.5 RTOS 環(huán)境下的并發(fā)訪問保護如果主控跑的是 RTOS情況會更復(fù)雜一些可能有多個任務(wù)同時訪問 MRAM比如參數(shù)管理任務(wù)寫配置、日志任務(wù)寫日志、網(wǎng)絡(luò)任務(wù)讀狀態(tài)。如果不做互斥兩個寫操作交叉執(zhí)行數(shù)據(jù)塊就花了。解決辦法是給 MRAM 訪問加一把互斥鎖比如 FreeRTOS 的 Mutex所有讀寫 API 在入口處獲取鎖出口處釋放鎖。寫操作持鎖時間盡量短尤其不要在持鎖狀態(tài)下做 Flash 擦除、SD 卡寫這種慢操作。我們實際壓測時發(fā)現(xiàn)加鎖后 MRAM 吞吐基本沒掉因為每個操作本身就很快鎖競爭很少。6. 實測記錄與陷阱排查從全 FF 到 FIFO 溢出6.1 現(xiàn)象一讀回來的數(shù)據(jù)全是 0xFF這個問題在我第一次調(diào)試時出現(xiàn)過排查了一圈發(fā)現(xiàn)是 SPI 模式配錯了。MR25H40CDF 支持 Mode 0CPOL0CPHA0和 Mode 3CPOL1CPHA1而 TM4C129 的 SSI 可以配置多種幀格式。我當(dāng)時在 SSIConfigSetExpClk 里寫成了 SSI_FRF_MOTO_MODE_2等于把時鐘極性和相位搞反了芯片完全不認命令MISO 就一直保持高電平于是讀回全 FF。排查方法很簡單用示波器抓 SCLK 和 CS#對比數(shù)據(jù)手冊上的時序圖。如果發(fā)現(xiàn) SCLK 空閑電平和數(shù)據(jù)采樣沿不對馬上就能定位。這里建議初始化參數(shù)里把模式寫成宏定義方便出問題時快速切換測試。6.2 現(xiàn)象二寫入正常斷電重啟后數(shù)據(jù)丟失這個坑當(dāng)時費了不少勁。單步調(diào)試時讀寫都正常一斷電再上電之前寫的數(shù)據(jù)就沒了。后來檢查原理圖發(fā)現(xiàn) HOLD# 引腳沒有上拉懸空狀態(tài)?,F(xiàn)場環(huán)境里電磁干擾把 HOLD# 拉低了一下芯片進入暫停模式后續(xù)寫命令根本沒執(zhí)行。把 HOLD# 用 10kΩ 電阻上拉到 3.3V 之后問題再沒出現(xiàn)過。另一個可能的原因是 CS# 在 MCU 復(fù)位期間出現(xiàn)毛刺導(dǎo)致芯片誤以為收到了非法命令。我們的解決辦法是在 GPIO 初始化的第一時間就把 CS# 拉高同時在上電后延時 10ms 再訪問 MRAM。6.3 現(xiàn)象三大塊數(shù)據(jù)讀出來錯位日志記錄一次寫 512 字節(jié)讀出來發(fā)現(xiàn)前幾個字節(jié)正確中間偶爾錯位。這個問題是 SPI 輪詢時序沒處理好。發(fā)送一字節(jié)的同時會收到一字節(jié)如果發(fā)送時沒等接收 FIFO 有數(shù)據(jù)就去發(fā)下一個字節(jié)FIFO 滿了以后數(shù)據(jù)就會丟失或錯位。修法就是在 spi_xfer 里確?!懊看伟l(fā)送都伴隨一次接收”并且發(fā)送前確認 TX FIFO 有空間接收前確認 RX FIFO 非空。像我在 4.2 節(jié)里給出的超時版本本質(zhì)上就是強制發(fā)送和接收成對進行。如果數(shù)據(jù)量超過 FIFO 深度可靠的輪詢時序加上適量延時比盲目提高時鐘更有效。6.4 現(xiàn)象四高速傳輸偶發(fā)誤碼把 SSI 時鐘從 16MHz 調(diào)到 24MHz 之后偶爾出現(xiàn)整個塊 CRC 校驗失敗。分析下來是板子上 MRAM 走線過長且沒有做阻抗匹配信號振鈴導(dǎo)致采樣不穩(wěn)定。降回 16MHz 就沒問題。后來在 SCLK 和 MOSI 上各串了 22Ω 電阻再把時鐘調(diào)到 20MHz實測連續(xù)讀寫 10MB 數(shù)據(jù)無誤碼。所以我的經(jīng)驗是工業(yè)板子上的 SPI 時鐘不要盲目追高穩(wěn)定壓倒一切。16MHz 到 20MHz 這個區(qū)間對絕大多數(shù)走線合理的板子來說是比較穩(wěn)妥的。6.5 穩(wěn)定方案要點匯總做完整個項目我把這套方案的要點整理成了一張自檢表每次改版都對照檢查HOLD# 必須上拉WP# 電平初始化明確。CS# 用 GPIO 控制復(fù)位后默認拉高。SPI 模式為 Mode 0 或 Mode 3與芯片手冊一致。每個 SPI 字節(jié)發(fā)送與接收成對處理加超時保護。寫操作前發(fā) WREN完成后讀回校驗。關(guān)鍵參數(shù)采用雙區(qū)鏡像 magic 版本號 CRC32。掉電保存先寫數(shù)據(jù)后寫提交標(biāo)志啟動時按 A→B→默認 順序回滾。SSI 時鐘先保守配置量產(chǎn)布板驗證后再考慮提速。這套組合跑了幾個月覆蓋了高溫、高濕、頻繁斷電的現(xiàn)場環(huán)境沒有再出現(xiàn)存儲相關(guān)的故障。過程中最深的體會是工業(yè)存儲選型方向?qū)α吮仁裁炊贾匾?。MRAM 加一個可靠的控制器確實把“存數(shù)據(jù)”這件事變成了真正不用操心的基礎(chǔ)功能開發(fā)人員可以把精力放到業(yè)務(wù)邏輯上。