)
別只盯著640 TOPS從SA8775P到SA8797P高通真正升級的是整車計算架構(gòu)一、參數(shù)表1. SA8775P三個版本的分檔差異SA8775P版本CPU配置CPU性能GPU性能NPU稠密算力NPU稀疏算力適合的能力定位CCCC8核Kryo Gen6189K DMIPS800 GFLOPS48 INT8 TOPS96 TOPS基礎(chǔ)座艙、輕量AIBBBB8核Kryo Gen6230K DMIPS1.3 TFLOPSManhattan 3.1為127 FPS72 INT8 TOPS144 TOPS高端座艙、多屏與AIAAAA8核Kryo Gen6約230K DMIPS1.3 TFLOPSManhattan 3.1為127 FPS96 INT8 TOPS192 TOPS座艙與視覺融合內(nèi)存、ISP、視頻、顯示和高速接口基本相同主要差別集中在CPU、GPU和NPU可用性能。因此它們更像同一平臺的三個算力檔位。2. SA8775P AAAA與SA8797P的核心能力對比計算模塊SA8775P AAAASA8797P-A標(biāo)稱變化CPU8核Kryo Gen6約230K DMIPS18核Oryon560K DMIPS約2.43倍GPU峰值算力1.3 TFLOPS8.1 TFLOPS約6.23倍Manhattan 3.1127 FPS340 FPS約2.68倍Manhattan 3.0188 FPS480 FPS約2.55倍NPU結(jié)構(gòu)2×HTP v3、4×HVXHMX4×HTP v6、8×HVXHMX計算陣列擴展INT8稠密算力96 TOPS320 TOPS約3.33倍INT8稀疏算力192 TOPS640等效TOPS約3.33倍Audio/Mini DSP20 FP32 GMAC約1980 MPPS36 FP32 GMAC約4300 MPPS音頻吞吐約2.17倍內(nèi)存接口6×16位LPDDR516×16位LPDDR5X96位升級至256位原始內(nèi)存帶寬77GB/s270GB/s約3.51倍壓縮等效帶寬170GB/s以上600GB/s以上約3.53倍ISP吞吐量2.5Gpix/s3.9Gpix/s提升約56%視頻解碼4K2404K480約2倍視頻編碼4K1204K240約2倍EVA光流能力DOF 1080p30DFS 720p30SOF 1080p120DOF 1080p60DFS 720p60SOF 1080p300約22.5倍3. 顯示、通信與存儲資源變化資源類別SA8775P平臺SA8797P-A工程含義顯示輸出2×DP 4-MST、2×DP 2-MST、2×DSI4×DP 2.1 4-MST面向更多高分辨率顯示PCIe6 Lane、2個Gen4控制器16 Lane、4個Gen5控制器可擴展高速存儲、交換芯片和加速器車載以太網(wǎng)2×2.5GbESGMII2×10GbEUSXGMII支持TSN面向傳感器和中央網(wǎng)絡(luò)骨干USB2×USB 3.2 Gen2、1×USB 2.02×USB 3.2 Gen2、1×USB 2.0圖片中基本不變存儲2×UFS 3.1、2個G4 Lane、1×SD/MMC1×UFS 4.0、5個G5 Lane單接口速度提高拓?fù)浒l(fā)生變化真正的變化不是TOPS而是芯片角色從標(biāo)稱參數(shù)看SA8797P的CPU、GPU、NPU和內(nèi)存帶寬均出現(xiàn)大幅提升CPU約為SA8775P高配版本的2.43倍NPU稠密算力約為3.33倍GPU理論浮點性能超過6倍DDR原始帶寬則達到270GB/s。但SA8797P最值得關(guān)注的地方并不是某一個孤立的算力數(shù)字。它同時擴展了CPU核數(shù)、GPU、NPU、內(nèi)存位寬、ISP、視頻單元、PCIe和10GbE這說明芯片的目標(biāo)已經(jīng)從“運行多個座艙屏幕”轉(zhuǎn)向承載智能座艙、輔助駕駛、車載網(wǎng)關(guān)和部分車身功能。高通公開資料將Snapdragon Cockpit Elite和Snapdragon Ride Elite定位為面向軟件定義汽車的統(tǒng)一SoC架構(gòu)Cockpit和Ride任務(wù)可以在同一芯片上運行并通過虛擬化進行隔離。因此從SA8775P到SA8797P不是一次簡單的芯片換代而是汽車電子控制器從域融合進一步走向中央計算。背景為什么車企開始把多個域控制器合并傳統(tǒng)汽車按照功能劃分ECU儀表、娛樂、環(huán)視、ADAS、網(wǎng)關(guān)和車身控制各自擁有處理器、存儲、電源及通信接口。這種架構(gòu)便于功能獨立開發(fā)但隨著攝像頭、顯示屏和軟件功能增加ECU數(shù)量、線束重量、通信延遲和整車成本都會快速上升。域控制器解決了第一階段的問題它把同類功能合并到一個控制器中。然而座艙與ADAS仍可能重復(fù)配置SoC、DDR、PMIC、存儲和以太網(wǎng)交換設(shè)備。兩個域之間傳遞圖像或車輛狀態(tài)時還要經(jīng)歷傳感器輸入、內(nèi)存復(fù)制、網(wǎng)絡(luò)傳輸和二次處理。中央計算進一步消除這種重復(fù)攝像頭數(shù)據(jù)進入統(tǒng)一的數(shù)據(jù)通道座艙可以顯示ADAS感知結(jié)果駕駛系統(tǒng)也可以調(diào)用DMS、導(dǎo)航和車輛狀態(tài)信息。高通在Snapdragon Ride Flex白皮書中稱這種融合有助于減少BOM、降低系統(tǒng)延遲并改善數(shù)據(jù)吞吐量。代價是單個控制器承擔(dān)的任務(wù)更多。芯片不僅要“算得快”還必須證明關(guān)鍵任務(wù)不會被娛樂系統(tǒng)、AI應(yīng)用或異常流量干擾。原理CPU、GPU、NPU為什么必須同時升級中央計算不是靠一個超大CPU完成全部任務(wù)而是依賴異構(gòu)計算。CPU負(fù)責(zé)操作系統(tǒng)、虛擬機、通信服務(wù)、診斷、數(shù)據(jù)編排和規(guī)劃控制。18核Oryon的價值主要體現(xiàn)在多操作系統(tǒng)和多服務(wù)并發(fā)而不是單個Android應(yīng)用的啟動速度。GPU既要承擔(dān)多屏3D渲染也可能參與通用并行計算NPU則用于目標(biāo)檢測、Transformer、駕駛員監(jiān)控、語音及多模態(tài)模型。GPU理論算力從1.3 TFLOPS升至8.1 TFLOPS提升超過6倍但Manhattan 3.1幀率只提升約2.68倍。這并不矛盾。TFLOPS是特定精度下的理論運算峰值而實際圖形幀率還受CPU提交、紋理訪問、內(nèi)存帶寬、驅(qū)動和渲染管線限制。理論算力不能直接等于整機性能。NPU的320個稠密INT8 TOPS和640個等效稀疏TOPS也不能混用。稀疏算力成立的前提是模型滿足硬件規(guī)定的稀疏模式并且編譯器、算子和運行時能夠真正跳過無效計算。高通公開的代際目標(biāo)是CPU和GPU約提升3倍、NPU約提升12倍但其比較對象和測試條件與圖片中的數(shù)據(jù)不同不能直接進行橫向換算。問題分析270GB/s內(nèi)存帶寬可能比640 TOPS更重要內(nèi)存參數(shù)具有較強的內(nèi)部一致性。SA8775P使用6×16位LPDDR5總線寬度為96位也就是每個時鐘周期傳輸12字節(jié)。用77GB/s除以12字節(jié)可得到約6.42GT/s與LPDDR5-6400級別基本對應(yīng)。SA8797P使用16×16位LPDDR5X總線寬度達到256位即每周期32字節(jié)。270GB/s除以32字節(jié)約為8.44GT/s與LPDDR5X-8533級別接近。這說明270GB/s并非隨意放大的數(shù)字而可能來自更寬的物理總線與更高的數(shù)據(jù)速率。為什么要把內(nèi)存帶寬提升3.5倍因為攝像頭、ISP、NPU、GPU、CPU和視頻編解碼器都會訪問DDR。假設(shè)NPU算力增加而內(nèi)存帶寬保持不變推理過程中便可能出現(xiàn)計算陣列等待權(quán)重或特征圖的情況。表中的600GB/s以上屬于壓縮等效帶寬不是示波器或協(xié)議分析儀能夠直接測到的物理總線帶寬。它依賴圖像、紋理和數(shù)據(jù)是否可以壓縮因此不能直接用于最壞工況設(shè)計。工程預(yù)算應(yīng)以原始帶寬為基礎(chǔ)再根據(jù)任務(wù)并發(fā)、仲裁開銷和安全余量進行校核。工程方案10GbE、PCIe Gen5和TSN怎樣落到硬件上兩路10GbE支持中央計算平臺接收高吞吐量傳感器數(shù)據(jù)并與區(qū)域控制器、網(wǎng)關(guān)或另一顆計算SoC通信。TSN的價值不只是帶寬而是通過時間同步、流量調(diào)度和優(yōu)先級控制讓關(guān)鍵數(shù)據(jù)獲得更可預(yù)測的傳輸時延。原理圖設(shè)計時需要重點檢查SoC、以太網(wǎng)PHY或交換芯片之間的USXGMII連接方式明確參考時鐘、復(fù)位、低功耗狀態(tài)、同步時鐘和管理接口。PCB階段則要對走線阻抗、插入損耗、回波損耗、串?dāng)_、過孔殘樁及連接器進行完整預(yù)算。PCIe升級至Gen5后對材料和結(jié)構(gòu)的要求同樣提高。設(shè)計中應(yīng)避免過長的走線和不必要的層間切換必要時使用背鉆并在鏈路中預(yù)留Retimer或Redriver的評估位置。AC耦合電容、參考時鐘和復(fù)位信號也應(yīng)保留可測量條件。存儲部分不能簡單理解為“UFS 3.1升級到UFS 4.0”。圖片顯示控制器數(shù)量由兩路變成一路這可能影響雙存儲冗余、日志與系統(tǒng)盤隔離以及OTA回滾策略。硬件選型必須同時考慮速度、容量、壽命、故障隔離和啟動架構(gòu)。電源與散熱應(yīng)按照CPU、GPU、NPU、DDR和高速接口同時滿載設(shè)計而不是分別運行單項Benchmark后取最大值。驗證方法不能只跑分必須制造最壞工況第一項是電源瞬態(tài)測試。使用高帶寬示波器、低感差分探頭和電流探頭在CPU、GPU、NPU由空閑同時切換到滿載時測量SoC核心電源、DDR電源和系統(tǒng)輸入電源。測試點應(yīng)位于負(fù)載端去耦電容附近判斷標(biāo)準(zhǔn)采用芯片規(guī)定的電壓容限和瞬態(tài)持續(xù)時間。第二項是并發(fā)帶寬測試。同時運行多路攝像頭、NPU推理、多屏GPU渲染、視頻編解碼和UFS/PCIe存儲讀寫記錄DDR利用率、模型延遲、丟幀率、DMA超時和P99響應(yīng)時間。平均幀率正常不代表長尾時延滿足ADAS要求。第三項是高溫持續(xù)性能測試。在高低溫箱內(nèi)運行組合負(fù)載監(jiān)測結(jié)溫、CPU/GPU/NPU頻率及任務(wù)完成時間。判斷標(biāo)準(zhǔn)不是“不死機”而是降頻后的持續(xù)性能仍滿足系統(tǒng)實時性要求。第四項是接口一致性測試。利用高帶寬示波器、誤碼儀和協(xié)議分析儀檢查PCIe Gen5、10GbE及顯示鏈路的眼圖、抖動、BER、鏈路重訓(xùn)練次數(shù)和溫度漂移。最后進行故障注入讓Android虛擬機崩潰、制造網(wǎng)絡(luò)廣播風(fēng)暴、占滿DDR帶寬或使攝像頭反復(fù)掉線驗證儀表及ADAS關(guān)鍵任務(wù)能否繼續(xù)運行。只有通過這種測試才能證明虛擬化和安全隔離不僅存在于框圖中。結(jié)論中央計算不是“大力出奇跡”從表格可以看到SA8797P的升級具有明顯的系統(tǒng)性CPU負(fù)責(zé)多系統(tǒng)和復(fù)雜服務(wù)GPU承擔(dān)多屏及高級渲染NPU運行感知和多模態(tài)模型LPDDR5X為各計算單元供數(shù)10GbE和PCIe Gen5則負(fù)責(zé)把外部傳感器、存儲及區(qū)域控制器接入中央平臺。這也解釋了為什么只比較TOPS容易得出錯誤結(jié)論。即使NPU達到640個等效稀疏TOPS如果模型無法利用稀疏結(jié)構(gòu)、DDR發(fā)生擁塞、芯片在高溫下持續(xù)降頻最終能夠穩(wěn)定交付的性能仍可能遠(yuǎn)低于標(biāo)稱值。中央計算減少了控制器數(shù)量卻提高了單點故障的影響范圍。過去一個娛樂ECU死機可能只是中控屏黑屏未來同一控制器承載座艙、網(wǎng)關(guān)和ADAS時資源隔離、故障恢復(fù)和安全島設(shè)計就會直接影響整車安全。所以評價SA8797P這類平臺時真正應(yīng)該問的不是“它有多少TOPS”而是在最高溫度、最低輸入電壓、所有任務(wù)同時運行并且部分軟件發(fā)生故障時它還能穩(wěn)定交付多少可用算力能夠通過電源、熱、帶寬、高速接口和故障注入驗證的算力才是汽車電子項目真正可以買單的算力。