AI業(yè)務(wù)的 Red Team 實踐:從治理框架到對抗測試)
本文整理自 QCon 北京 2026《張棟 - 智能終端行業(yè) AI 業(yè)務(wù)的Red Team 實踐》會議內(nèi)容以下為 Ai好記 整理后的會議筆記。整場內(nèi)容分成四部分智能終端行業(yè)視角、AI 安全治理的理解與實踐、Red Team 實踐案例、以及 Mythos 模型對網(wǎng)絡(luò)安全的影響。他用一個引人深思的提問開場如果智能每 7 個月翻一倍當下做的這些工作是否還值得。答案在結(jié)尾揭曉而整個分享過程就是對這個問題的完整論證。智能終端行業(yè)的 AI 視角1、指數(shù)級發(fā)展與安全新挑戰(zhàn)演講者以每日自問引出話題如果智能每 7 個月翻倍當下工作是否還值得做。AI正以指數(shù)級速度發(fā)展體現(xiàn)在模型能力、工程能力、研究反作用力的綜合提升。這帶來了全新的安全挑戰(zhàn)雙刃劍效應(yīng)、數(shù)率、失控平衡等難題需要應(yīng)對。2、從執(zhí)行式智能到自主式智能智能范式正在發(fā)生根本轉(zhuǎn)變。過去的執(zhí)行式智能是任務(wù)導向、基于規(guī)則與專用模型特點是單任務(wù)、短鏈、弱環(huán)境感知。而當前已進入自主式智能時代由自主 Agent 驅(qū)動業(yè)務(wù)特點是多層自主管理、目標管理、自學習、跨任務(wù)跨領(lǐng)域、極致個性化。對安全從業(yè)者來說以前那套「規(guī)則對抗」的思路需要被重新審視。3、未來智能終端判斷他對智能終端的未來有一個清晰判斷。核心設(shè)備方面手機目前仍是核心眼鏡是下一個重要產(chǎn)品方向智能會泛在化個人智能網(wǎng)絡(luò)分布在多個設(shè)備上戒指、項鏈、耳機、手機、眼鏡無論從哪個設(shè)備接入得到的是同一個智能。業(yè)務(wù)特點上手機是重點眼鏡與具身智能是第二增長曲線核心挑戰(zhàn)是對智能與網(wǎng)絡(luò)的依賴加深。而安全治理的最終目標是構(gòu)建信任。AI 安全治理的實踐參考1、治理目標與原則AI 安全治理的目標是構(gòu)建信任原則是與外部生態(tài)相關(guān)方協(xié)同包括競爭對手、技術(shù)供應(yīng)商、攻擊者、監(jiān)管機構(gòu)、用戶。核心思路是服務(wù)于用戶智能體驗與安全信任的總體平衡方法是基于目標對 AI 安全治理任務(wù)進行裁剪與聚焦。2、治理能力建設(shè)目標能力建設(shè)的目標有兩個持續(xù)了解自身與外部環(huán)境以及構(gòu)建反脆弱能力以應(yīng)對外部復(fù)雜高頻的變化。具體治理項拆解下來包括威脅建模、安全設(shè)計、Red Team 等。張棟選擇 Red Team 作為案例來展開介紹。Red Team 實踐案例為什么是 Red Team以及怎么落地1、選Red Team 的三個原因他先解釋了為什么選 Red Team 來講。第一神經(jīng)網(wǎng)絡(luò)黑盒化對傳統(tǒng)評估形成挑戰(zhàn)第二業(yè)務(wù)包含三方模型與 Agent 系統(tǒng)復(fù)雜性劇增第三法規(guī)與行業(yè)框架正把對抗測試制度化。2、兩類復(fù)雜度系統(tǒng)原因一背后有個深刻判斷世界上存在兩類復(fù)雜度系統(tǒng)。第一類是「困難問題」比如客機特點是因果清晰可分可以通過分層模塊化應(yīng)對。第二類是「復(fù)雜系統(tǒng)」比如大模型、生物系統(tǒng)特點是因果模糊、涌現(xiàn)、自組織。AI 大模型的安全問題恰恰屬于第二類不能用對付客機那套確定性工程去解決。3、輕量化 Red Team 能力建設(shè)在資源有限的背景下一種可行的輕量化 Red Team 建設(shè)路徑是依托傳統(tǒng)軟件安全流程針對 Agent 系統(tǒng)進行調(diào)整目標是覆蓋 20% 最非常規(guī)、最高影響的風險。執(zhí)行動作可拆解為三部分基礎(chǔ)部分依托業(yè)界成熟框架效率提升則通過 AI 系統(tǒng)輔助情報刷新、業(yè)務(wù)調(diào)研和新攻擊方法的探索。4、框架選擇與應(yīng)用基礎(chǔ)框架用 OWASP 和 MITRE ATTCK作用是對外對齊行業(yè)、對內(nèi)對齊工作方向內(nèi)部治理框架用 AI 管理體系 AIMS關(guān)鍵理念是裁剪外部認可框架用 ISO 42001 等監(jiān)管法規(guī)。5、前沿威脅情報收集AI 高度自動化地收集和初步判斷安全情報但挑戰(zhàn)是信息過載需要本地情景化微決策。結(jié)論是崗位可以減負但專家難以替代。6、AI 賦能 Red Team真實的提效案例這部分展示了如何用 AI 技術(shù)提升 Red Team 的攻擊能力。他分享了分析 Claw 系統(tǒng)提示注入的案例。第一步通過提示注入獲得系統(tǒng)并模擬安全 prompt第二步基于「清晰表征的規(guī)則邏輯不完備」的先驗信念讓 GPT-4 找出 Top10 邏輯漏洞第三步讓模型把邏輯漏洞轉(zhuǎn)化為攻擊方法。成果是 3 天發(fā)現(xiàn)十幾處高危風險而人只作為「抽象指揮角色」。這顛覆了傳統(tǒng)紅隊「人肉滲透」的模式。他還分享了個人提效的案例由于現(xiàn)有安全平臺功能有限通過 Agentic AI 技術(shù)可以在一天內(nèi)生成大量代碼快速搭建一個覆蓋完整工作閉環(huán)的個人 Red Team 工作臺原型并具備在團隊內(nèi)推廣的潛力。7、效率提升背后的思考在 AI 輔助下業(yè)務(wù)迭代要跟上從豆包智能手機到 GU再到未來眼鏡。他利用模型的多模態(tài)能力發(fā)現(xiàn)問題案例包括維鏈誘導、針對性投毒、多模態(tài)推理漏洞比如篡改打車地址。他還提到一個值得關(guān)注的案例一個實習生一周內(nèi)就發(fā)現(xiàn)多家 Agent 形態(tài)的十幾處高危風險關(guān)鍵在于人才特質(zhì)也就是主動性、目標堅持、開放性。Mythos 模型對網(wǎng)絡(luò)安全的影響1、Mythos 改寫了安全底層生產(chǎn)函數(shù)這是全場的核心判斷Mythos 改寫了網(wǎng)絡(luò)安全的底層生產(chǎn)函數(shù)。具體影響體現(xiàn)在多個層面漏洞發(fā)現(xiàn)從智力活動變成工業(yè)化高通量搜索不僅發(fā)現(xiàn)風險還會編寫多階段組合的 exploit chain需要重新思考傳統(tǒng)縱深防御靠摩擦取勝的有效性因為 Agent 攻擊成本指數(shù)級下降主瓶頸從發(fā)現(xiàn)問題轉(zhuǎn)移到組織速度能力構(gòu)建現(xiàn)象是 AI 提效后人反而更累需要更多人才做決策對終端、閉源系統(tǒng)和固件廠商沖擊巨大因為模型具備強大逆向推理能力。2、模型本身成為需要被防守的「半自治系統(tǒng)」更值得警惕的是模型本身已經(jīng)成為一個需要被防守的半自治系統(tǒng)。關(guān)鍵認知是平均安全水平不等于尾部風險對齊程度越高、執(zhí)行力越強潛在風險反而越大。這句話值得每一個做 AI 安全的人反復(fù)咀嚼。3、智能的發(fā)展階段與風險觀點他梳理了智能的發(fā)展階段從機械程序到智能再到智慧未來可能達到「認知超限」狀態(tài)。當前系統(tǒng)正處于從智能到智慧的過渡。他還整合了 AI 領(lǐng)袖對風險與智能的觀點分為四派。激進派如舒字科夫、辛頓認為人腦非特殊論AI 能做所有人事謹慎樂觀派如哈薩比斯主張先考慮 AI對社會沖擊而非存在性風險漸進適應(yīng)派如薩姆·奧特曼認為系統(tǒng)需有序放入社會以適應(yīng)風險無憂派如理查德·薩頓認為智能提升確定去中心化合作促和平。他特別警告了危險的第二條路徑也就是模型使用權(quán)壟斷。這條路徑由馬斯克開啟最強智能可能被大型科技公司壟斷公眾與之脫離后果是加劇競爭不平等。總結(jié)回答開頭的那個問題回到開場那個提問若智能每 7 個月翻倍這個工作是否值得做。張棟的答案是值得并用盡全力盡早加入這個過程。這場分享的價值在于不僅介紹了 Red Team 的實踐方法更提供了一套分析 AI 安全未來趨勢的方法論從智能范式轉(zhuǎn)變、復(fù)雜度系統(tǒng)認知、到 AI 賦能安全攻防、以及模型本身成為被防守對象層層遞進為智能終端行業(yè)的 AI 安全建設(shè)提供了參考思路。常見問題FAQQ為什么 AI 大模型的安全不能用傳統(tǒng)確定性工程解決因為大模型屬于「復(fù)雜系統(tǒng)」因果模糊、涌現(xiàn)、自組織而不是「困難問題」因果清晰可分、可模塊化。對付復(fù)雜系統(tǒng)需要 Red Team、對抗測試這類方式而不是確定性規(guī)則。QAI 怎么反過來賦能 Red Team通過提示注入獲取系統(tǒng)、用大模型找邏輯漏洞、再讓模型把漏洞轉(zhuǎn)化為攻擊方法。實際案例中通過此類方法在 3 天內(nèi)發(fā)現(xiàn)了多處高危風險人主要承擔抽象指揮角色從而在有限資源下提升了攻擊效率。QMythos 對網(wǎng)絡(luò)安全具體影響是什么漏洞發(fā)現(xiàn)從智力活動變成工業(yè)化高通量搜索能編寫多階段 exploit chain攻擊成本指數(shù)級下降傳統(tǒng)縱深防御靠摩擦取勝需要重新思考主瓶頸從發(fā)現(xiàn)問題轉(zhuǎn)向組織速度能力構(gòu)建。Q為什么說「對齊程度越高潛在風險越大」因為平均安全水平不等于尾部風險更強的執(zhí)行力和對齊度在極端場景下反而可能造成更大的失控風險模型本身會成為一個需要被防守的半自治系統(tǒng)。Q智能終端安全治理的最終目標是什么構(gòu)建信任。通過威脅建模、安全設(shè)計、Red Team 等治理項結(jié)合反脆弱能力建設(shè)在用戶智能體驗與安全信任之間取得平衡。