力邊界的技術(shù)化困境:從兩次世界大戰(zhàn)到人工智能時代的治理悖論研究——基于安全困境、能力落差與權(quán)力約束遞歸難題的跨歷史比較分析)
權(quán)力邊界的技術(shù)化困境從兩次世界大戰(zhàn)到人工智能時代的治理悖論研究——基于安全困境、能力落差與權(quán)力約束遞歸難題的跨歷史比較分析摘要本文以兩次世界大戰(zhàn)的根源探析為起點(diǎn)通過對歷史因果鏈條的層層剝離提煉出一個可跨越歷史情境、具有一般解釋力的分析框架人類大規(guī)模災(zāi)難的發(fā)生并非源于單一的邪惡意志或技術(shù)本身的危險性而是**競爭性權(quán)力結(jié)構(gòu)與毀滅能力增長速度兩條曲線交叉后的系統(tǒng)性產(chǎn)物**。本文首先重新檢視關(guān)于第一次世界大戰(zhàn)與第二次世界大戰(zhàn)成因的三種主流解釋路徑——技術(shù)決定論、經(jīng)濟(jì)危機(jī)催化論、流氓政治劫持技術(shù)論——并逐一指出其解釋力的邊界與自我指涉的邏輯困境尤其是流氓政治概念在缺乏事前可操作性判據(jù)的情況下容易蛻變?yōu)橐环N同義反復(fù)式的事后歸因。在此基礎(chǔ)上本文引入國際關(guān)系理論中的安全困境模型與技術(shù)史中的能力—治理落差假說并以冷戰(zhàn)時期確保相互摧毀MAD機(jī)制的實(shí)際運(yùn)作史——尤其是1962年古巴導(dǎo)彈危機(jī)與1983年蘇聯(lián)預(yù)警系統(tǒng)誤報事件中的具體人物決策——作為關(guān)鍵反例論證技術(shù)野心并非災(zāi)難的充分條件制度設(shè)計(jì)與個體在臨界時刻的介入同樣具有決定性作用。本文進(jìn)而將這一框架映射至當(dāng)代人工智能安全治理爭議剖析實(shí)驗(yàn)室創(chuàng)始人、芯片產(chǎn)業(yè)與國家行為體在人工智能存在性風(fēng)險認(rèn)知上的系統(tǒng)性分歧指出這種分歧并非單純的各自撒謊而更接近于結(jié)構(gòu)性位置導(dǎo)致的認(rèn)知偏移。本文最后聚焦于權(quán)力約束的政治哲學(xué)古老悖論——約束權(quán)力的工具本身即是權(quán)力——并結(jié)合國際原子能機(jī)構(gòu)核查機(jī)制、世界貿(mào)易組織爭端解決程序、證書透明度日志、門限簽名治理等現(xiàn)實(shí)制度案例提出一套以對抗性驗(yàn)證執(zhí)行力去中心化爭議強(qiáng)制可見化系統(tǒng)防俘獲為核心支柱的治理機(jī)制設(shè)想同時坦誠指出該設(shè)想無法徹底消解權(quán)力約束悖論本身而只能將其納入持續(xù)動態(tài)管理的軌道。本文的結(jié)論是人工智能治理的真正核心議題并非技術(shù)風(fēng)險評估的精確度問題而是人類政治文明迄今尚未解決的權(quán)力邊界治理這一古老命題在新技術(shù)載體上的重新登場。關(guān)鍵詞安全困境技術(shù)—治理落差確保相互摧毀權(quán)力約束悖論對抗性驗(yàn)證人工智能治理存在性風(fēng)險一、序言從歷史追問到治理命題的轉(zhuǎn)向?qū)纱问澜绱髴?zhàn)根源的追問歷來是歷史學(xué)、國際關(guān)系學(xué)與政治哲學(xué)交匯的經(jīng)典命題。傳統(tǒng)歷史教育往往傾向于羅列一系列直接原因——薩拉熱窩刺殺事件、復(fù)雜的同盟體系、《凡爾賽條約》的懲罰性條款、法西斯主義意識形態(tài)的興起——這些敘述固然在事實(shí)層面無可指摘但它們本質(zhì)上處于因果鏈條的表層回答的是戰(zhàn)爭如何被觸發(fā)而非戰(zhàn)爭為何幾乎注定會以某種形式發(fā)生。本文的寫作動機(jī)源于一場圍繞這一追問展開的持續(xù)對話式思辨過程從歷史教科書式的表層因素清單出發(fā)經(jīng)由對技術(shù)決定論經(jīng)濟(jì)危機(jī)催化論流氓政治劫持技術(shù)論等中間層解釋的反復(fù)檢驗(yàn)與證偽最終抵達(dá)一個關(guān)于權(quán)力結(jié)構(gòu)本身的更為根本的追問——這一追問在當(dāng)代語境下恰好與人工智能安全治理的核心爭議高度同構(gòu)。這并非偶然的類比游戲而是因?yàn)闊o論是二十世紀(jì)初的歐洲列強(qiáng)體系還是二十一世紀(jì)二十年代的人工智能產(chǎn)業(yè)與大國競爭格局本質(zhì)上都面對著同一個未被解決的結(jié)構(gòu)性難題在缺乏更高仲裁權(quán)威的多方競爭環(huán)境中個體理性行為的加總系統(tǒng)性地偏離集體最優(yōu)結(jié)果而與此同時技術(shù)能力的增長速度持續(xù)超越人類協(xié)調(diào)與自我克制能力的增長速度。本文的論證邏輯分為四個遞進(jìn)階段。第一階段第二、三節(jié)通過對既有解釋框架的逐一壓力測試剝離表層與中間層的解釋提煉出競爭結(jié)構(gòu)能力落差這一更具一般性的分析框架并以冷戰(zhàn)核穩(wěn)定性這一關(guān)鍵反例檢驗(yàn)該框架相較于技術(shù)決定論與流氓政治論的相對解釋力優(yōu)勢。第二階段第四節(jié)將這一框架映射至當(dāng)代人工智能安全治理的現(xiàn)實(shí)爭議剖析實(shí)驗(yàn)室、芯片產(chǎn)業(yè)、國家政府三類行為體各自的認(rèn)知結(jié)構(gòu)與激勵結(jié)構(gòu)說明表面上各自為私利辯護(hù)的現(xiàn)象背后存在著比單純道德批判更為復(fù)雜的結(jié)構(gòu)性成因。第三階段第五、六節(jié)聚焦于誰有權(quán)認(rèn)定風(fēng)險、誰有權(quán)定義威脅這一貫穿全文的核心悖論援引政治哲學(xué)中關(guān)于權(quán)力自我指涉困境的經(jīng)典命題并系統(tǒng)評估幾種可能的治理方案——包括系統(tǒng)化記錄、算法化認(rèn)定、去中心化驗(yàn)證等——各自的優(yōu)勢與內(nèi)在風(fēng)險。第四階段第七節(jié)在充分承認(rèn)理論局限性的前提下提出一套具備現(xiàn)實(shí)制度基礎(chǔ)、以歷史上已被驗(yàn)證的具體機(jī)制國際核查體系、貿(mào)易爭端機(jī)制、密碼學(xué)審計(jì)賬本等為參照的綜合性治理設(shè)想并明確劃定其能力邊界。全文最后第八節(jié)以總結(jié)與開放性問題收尾強(qiáng)調(diào)本文所提出的框架并非終局性答案而是當(dāng)前階段最少邏輯漏洞的一版分析工具。二、歷史因果鏈條的層層剝離對三種主流解釋的批判性重估2.1 表層解釋及其局限關(guān)于兩次世界大戰(zhàn)爆發(fā)原因的傳統(tǒng)敘述通常聚焦于一系列具體的、可追溯到明確日期與人物的觸發(fā)事件1914年6月費(fèi)迪南大公在薩拉熱窩遇刺、由此激活的一整套剛性的同盟義務(wù)與軍事動員時間表尤以德國施里芬計(jì)劃的僵化設(shè)計(jì)為典型1919年《凡爾賽條約》對德國施加的領(lǐng)土削減、軍備限制與巨額戰(zhàn)爭賠款及其在魏瑪共和國內(nèi)部催生的背后一刀敘事與復(fù)仇情緒1933年納粹黨攫取國家權(quán)力后建立的極權(quán)體制及其擴(kuò)張性對外政策。這些敘述的問題不在于事實(shí)錯誤而在于解釋層級的錯位它們描述的是危機(jī)如何從潛在狀態(tài)轉(zhuǎn)化為現(xiàn)實(shí)沖突的具體路徑卻未能回答一個更根本的問題——為何在1914年與1939年前后歐洲大陸的政治—軍事系統(tǒng)會處于一種極易被觸發(fā)的臨界狀態(tài)。用系統(tǒng)論的語言來說這些表層因素扮演的角色近似于觸發(fā)器trigger而非勢能來源potential energy source。一個類比是解釋一場森林大火為何發(fā)生指出某個雷擊點(diǎn)燃了某棵樹當(dāng)然是事實(shí)但如果森林本身長期處于極度干燥、可燃物大量堆積的狀態(tài)那么即便沒有這一次雷擊某次篝火火星或某次人為縱火同樣會在不遠(yuǎn)的將來引發(fā)同等規(guī)模的災(zāi)難。真正需要解釋的是干燥度與可燃物堆積這一勢能本身的成因。2.2 中間層解釋之一技術(shù)決定論及其修正第二種解釋路徑將根源歸結(jié)為特定時期的技術(shù)革命本身。就第一次世界大戰(zhàn)而言第二次工業(yè)革命約1870年至1914年帶來的貝塞麥煉鋼法及后續(xù)平爐煉鋼技術(shù)、馬克沁機(jī)槍等自動化武器、哈伯-博施法合成氨技術(shù)既服務(wù)于化肥生產(chǎn)也支撐了炸藥原料的持續(xù)供應(yīng)、密集化的鐵路網(wǎng)絡(luò)使數(shù)百萬人員與物資的精確時刻表動員在物理上成為可能以及電報通訊網(wǎng)絡(luò)壓縮了外交斡旋的可用時間窗口共同構(gòu)成了一套史無前例的、能夠在極短時間內(nèi)造成大規(guī)模傷亡的技術(shù)基礎(chǔ)設(shè)施。就第二次世界大戰(zhàn)而言一戰(zhàn)技術(shù)的機(jī)械化成熟坦克、飛機(jī)、汽車化步兵的體系化整合、無線電通訊支撐下的諸兵種協(xié)同閃電戰(zhàn)戰(zhàn)術(shù)得以實(shí)現(xiàn)的技術(shù)前提、以及量子力學(xué)與核物理學(xué)在二十世紀(jì)二三十年代的理論突破為后續(xù)核武器的出現(xiàn)打開了理論可能性構(gòu)成了新一輪的技術(shù)勢能積累。這一解釋路徑的核心洞察在于技術(shù)進(jìn)步持續(xù)擴(kuò)大著單位人力、單位時間內(nèi)所能造成的破壞規(guī)模這一比值而這一比值的增長速度遠(yuǎn)遠(yuǎn)超過外交機(jī)制、國際法體系與政治決策智慧的迭代速度。1914年的歐洲外交官仍然沿用十九世紀(jì)的均勢外交思維框架處理危機(jī)卻已經(jīng)掌握了能夠在數(shù)周之內(nèi)將數(shù)百萬士兵投送至前線、并以每分鐘數(shù)百發(fā)的速率進(jìn)行機(jī)械化屠殺的技術(shù)能力。這種能力—智慧落差構(gòu)成了本文所稱能力—治理落差假說的雛形。然而這一解釋路徑存在一個關(guān)鍵的經(jīng)驗(yàn)反例須留待第三節(jié)詳細(xì)展開如果技術(shù)野心必然導(dǎo)向浩劫那么冷戰(zhàn)時期——人類歷史上技術(shù)破壞力與政治野心結(jié)合程度最深的時期——理應(yīng)是這一理論預(yù)測最為精確兌現(xiàn)的場景但第三次世界大戰(zhàn)并未發(fā)生。這一反例迫使我們必須對純粹的技術(shù)決定論進(jìn)行實(shí)質(zhì)性修正。2.3 中間層解釋之二流氓政治劫持技術(shù)論及其自我指涉困境第二種被反復(fù)提出、也被反復(fù)修正的解釋框架將根源歸結(jié)為流氓政治對中性技術(shù)的劫持或綁架。這一框架具有強(qiáng)烈的道德直覺吸引力它將責(zé)任明確地歸咎于具體的政治行為體威廉二世治下的德意志帝國、納粹德國、斯大林治下的蘇聯(lián)而將技術(shù)本身還原為價值中立的工具。但這一框架在經(jīng)受嚴(yán)格的邏輯檢驗(yàn)時暴露出一個根本性的自我指涉困境流氓這一標(biāo)簽的認(rèn)定標(biāo)準(zhǔn)是什么誰有權(quán)在事前而非事后基于戰(zhàn)爭結(jié)果對其進(jìn)行判定考察1914年七月危機(jī)中的關(guān)鍵決策者——德皇威廉二世、宰相貝特曼-霍爾韋格、總參謀長小毛奇、英國外相格雷、法國總統(tǒng)普恩加萊——沒有一人是以篡權(quán)者或非正當(dāng)統(tǒng)治者的身份行事他們均是按照當(dāng)時被廣泛接受的外交慣例、軍事時間表與榮譽(yù)邏輯進(jìn)行決策的。如果流氓政治的判定標(biāo)準(zhǔn)僅僅是造成了災(zāi)難性后果那么這一理論便退化為一種同義反復(fù)任何造成災(zāi)難的政治都被追溯性地貼上流氓標(biāo)簽而這一理論本身喪失了在災(zāi)難發(fā)生之前進(jìn)行預(yù)測或干預(yù)的實(shí)際操作能力。進(jìn)一步而言這一解釋框架同樣無法處理冷戰(zhàn)反例——美蘇兩大陣營在近半個世紀(jì)的對抗中都可以被對方陣營以及后世的部分歷史書寫冠以野心勃勃甚至流氓標(biāo)簽且雙方都持續(xù)掌握著人類歷史上最具毀滅性的技術(shù)手段但災(zāi)難并未按照野心技術(shù)必然浩劫的公式兌現(xiàn)。這進(jìn)一步說明流氓政治劫持技術(shù)論雖然具有直覺上的道德清晰性卻缺乏跨案例的一致解釋力。2.4 中間層解釋之三經(jīng)濟(jì)危機(jī)催化論的定位第三種常見的解釋路徑強(qiáng)調(diào)經(jīng)濟(jì)因素——工業(yè)化帶來的產(chǎn)能過剩、資本輸出需求、1929年大蕭條造成的大規(guī)模失業(yè)與社會絕望——為極端政治勢力的崛起提供了土壤尤其是魏瑪?shù)聡膼盒酝ㄘ浥蛎浥c隨后的經(jīng)濟(jì)崩潰被廣泛認(rèn)為是納粹黨能夠在選舉中獲得廣泛支持的關(guān)鍵背景條件。本文認(rèn)為這一解釋路徑的恰當(dāng)定位應(yīng)當(dāng)是催化劑catalyst而非根源root cause。經(jīng)濟(jì)危機(jī)的作用機(jī)制在于它急劇壓縮了社會對漸進(jìn)式、體制內(nèi)解決方案的耐心閾值從而為提供總體性解決方案敘事的極端政治力量創(chuàng)造了需求側(cè)的擴(kuò)張空間。但經(jīng)濟(jì)危機(jī)本身并不必然導(dǎo)向戰(zhàn)爭——?dú)v史上存在大量經(jīng)濟(jì)危機(jī)并未演化為大規(guī)模國際沖突的案例這說明經(jīng)濟(jì)因素更接近于改變了災(zāi)難發(fā)生的概率與時機(jī)而非決定了災(zāi)難是否會發(fā)生這一根本性質(zhì)。三、安全困境與能力落差模型一個更具一般性的分析框架3.1 安全困境的博弈論結(jié)構(gòu)在剝離上述三種解釋路徑各自的局限之后本文提出的核心分析框架建立在國際關(guān)系理論中的安全困境security dilemma概念之上。安全困境描述的是這樣一種結(jié)構(gòu)性處境在不存在凌駕于所有主權(quán)行為體之上的更高仲裁權(quán)威的國際體系中任何一方為求自保而采取的防御性軍備擴(kuò)張或戰(zhàn)略部署都會被其他各方解讀為潛在威脅從而引發(fā)連鎖式的軍備競賽與結(jié)盟對抗即便所有參與方的初始意圖純屬防御性質(zhì)。這一結(jié)構(gòu)的關(guān)鍵特征在于它不需要假設(shè)任何參與者具有邪惡意圖災(zāi)難性的系統(tǒng)輸出可以完全由理性的個體行為加總而產(chǎn)生。這正是施里芬計(jì)劃邏輯的精髓所在——該計(jì)劃的設(shè)計(jì)前提是誰先完成動員、誰先發(fā)起攻擊誰就掌握決定性優(yōu)勢因此在危機(jī)爆發(fā)的窗口期內(nèi)每一個參與國都面臨著若不搶先行動對手將搶先行動的囚徒困境式激勵結(jié)構(gòu)而這種激勵結(jié)構(gòu)本身壓縮了外交斡旋原本可能存在的緩沖時間。從博弈論的角度看這是一個典型的多方囚徒困境對每一個參與者而言率先行動或持續(xù)擴(kuò)軍都是在給定對手策略下的占優(yōu)策略dominant strategy即使所有參與者事后都承認(rèn)集體克制才是帕累托最優(yōu)Pareto optimal的結(jié)果。這一結(jié)構(gòu)性特征不需要借助某一方是流氓這一道德判斷即可完整解釋一戰(zhàn)爆發(fā)的動力學(xué)機(jī)制因而相較于流氓政治劫持技術(shù)論具有更強(qiáng)的跨案例一致性與更強(qiáng)的事前預(yù)測潛力。3.2 能力—治理落差假說與安全困境這一結(jié)構(gòu)性驅(qū)動力相輔相成的是本文所稱的能力—治理落差假說技術(shù)進(jìn)步持續(xù)擴(kuò)大人類單位行動所能造成的后果規(guī)模而人類在預(yù)見后果、協(xié)調(diào)彼此利益、構(gòu)建有效克制機(jī)制方面的認(rèn)知與制度能力其增長速度呈現(xiàn)出漸進(jìn)式、代際性的迭代特征遠(yuǎn)遠(yuǎn)無法匹配技術(shù)能力的指數(shù)級增長曲線。這一落差本身并不必然導(dǎo)致災(zāi)難的發(fā)生——它更準(zhǔn)確的角色是決定了一旦安全困境所描述的競爭性動力學(xué)被觸發(fā)其造成的代價規(guī)模將達(dá)到何種量級。換言之安全困境提供了點(diǎn)燃的機(jī)制能力—治理落差決定了火勢的烈度。兩者的乘積關(guān)系構(gòu)成了本文對兩次世界大戰(zhàn)成因的核心論斷兩次世界大戰(zhàn)并非由某種邪惡意志制造而是缺乏更高仲裁權(quán)威的多方理性競爭結(jié)構(gòu)與毀滅能力指數(shù)級增長這兩條曲線交叉后系統(tǒng)性地趨向產(chǎn)生的輸出結(jié)果——具體哪一次危機(jī)窗口成為實(shí)際的觸發(fā)點(diǎn)則具有相當(dāng)程度的歷史偶然性。3.3 關(guān)鍵反例的檢驗(yàn)冷戰(zhàn)核穩(wěn)定性對上述框架最嚴(yán)格的檢驗(yàn)來自冷戰(zhàn)時期確保相互摧毀Mutual Assured Destruction, MAD機(jī)制的實(shí)際運(yùn)作歷史。按照單純的技術(shù)野心公式美蘇兩大陣營在長達(dá)近半個世紀(jì)的對抗中同時具備極強(qiáng)的地緣政治與意識形態(tài)競爭野心以及人類歷史上最具毀滅性的核武器技術(shù)理應(yīng)是浩劫兌現(xiàn)概率最高的場景但第三次世界大戰(zhàn)始終未曾爆發(fā)。深入考察這一時期的具體歷史事件可以發(fā)現(xiàn)威懾平衡這一理論概念本身在實(shí)踐中經(jīng)歷了多次接近失效的臨界時刻而每一次僥幸避免災(zāi)難都并非完全依賴于制度性的自動穩(wěn)定機(jī)制而是極大程度上取決于具體個人在關(guān)鍵時刻的臨場判斷其一1962年古巴導(dǎo)彈危機(jī)期間美國海軍對一艘蘇聯(lián)潛艇實(shí)施深水炸彈逼迫其上浮的行動中該潛艇上負(fù)責(zé)核魚雷發(fā)射決策的三名高級軍官需要一致同意方可執(zhí)行發(fā)射其中一名軍官的否決直接避免了一次可能引發(fā)全面核戰(zhàn)爭的行動。其二1983年蘇聯(lián)的核預(yù)警系統(tǒng)曾誤將陽光反射誤判為美國發(fā)射的洲際導(dǎo)彈值班軍官在系統(tǒng)顯示確認(rèn)攻擊的情況下基于個人對系統(tǒng)可信度的懷疑判斷選擇未予上報從而避免了蘇聯(lián)基于確信遭受核打擊這一誤判而采取的報復(fù)性核反擊。這兩個案例共同揭示的核心規(guī)律是威懾平衡作為一種理論上的戰(zhàn)略態(tài)勢確實(shí)真實(shí)存在但它能夠在實(shí)踐中真正生效避免滑向?yàn)?zāi)難性后果很大程度上依賴于具體的人在具體的臨界時刻所做出的正確判斷而非某種能夠自動運(yùn)作、無需人為介入的制度性保障。這一發(fā)現(xiàn)對本文后續(xù)討論治理機(jī)制設(shè)計(jì)具有極為關(guān)鍵的方法論意義任何試圖通過完全自動化流程來消除人為判斷誤差的治理設(shè)計(jì)都可能同時消除了人類在系統(tǒng)失靈或遭遇未預(yù)見情形時進(jìn)行最后干預(yù)與糾錯的能力這本身構(gòu)成了一種新的、往往被低估的風(fēng)險來源。3.4 框架的相對解釋力優(yōu)勢綜合以上分析本文提出的安全困境能力—治理落差框架相較于此前討論的三種解釋路徑具有以下幾項(xiàng)相對優(yōu)勢其一它能夠在不預(yù)設(shè)任何參與者具有邪惡意圖的前提下完整解釋一戰(zhàn)爆發(fā)的動力學(xué)機(jī)制從而避免了流氓政治論的同義反復(fù)困境其二它能夠同時解釋一戰(zhàn)二戰(zhàn)技術(shù)破壞力與治理能力落差交叉產(chǎn)生災(zāi)難與冷戰(zhàn)核穩(wěn)定性技術(shù)破壞力達(dá)到某種臨界規(guī)模后反而催生出自我抑制的穩(wěn)定態(tài)但這一穩(wěn)定態(tài)本身依賴于人為干預(yù)的持續(xù)存在而非純粹自動化的技術(shù)性保障這兩組看似矛盾的歷史案例其三它為理解當(dāng)代人工智能安全治理爭議——正如本文第四節(jié)即將展開的分析——提供了一套具有跨時代一致性的分析工具。四、當(dāng)代映射人工智能安全治理爭議的結(jié)構(gòu)性解剖4.1 爭議現(xiàn)象的初步描述近年來圍繞人工智能存在性風(fēng)險的公共討論呈現(xiàn)出一種耐人尋味的陣營分化格局以主要人工智能研發(fā)機(jī)構(gòu)創(chuàng)始人為代表的群體罕見地在人工智能可能構(gòu)成對人類文明的存在性威脅這一判斷上表現(xiàn)出相對一致的表態(tài)與此同時芯片產(chǎn)業(yè)的代表性人物則公開對這類末日敘事表達(dá)強(qiáng)烈質(zhì)疑認(rèn)為其缺乏工程現(xiàn)實(shí)基礎(chǔ)、且可能服務(wù)于特定商業(yè)利益即所謂監(jiān)管俘獲而美國政府近年的官方政策立場則將人工智能發(fā)展明確定位為一場必須贏得的國家間競賽客觀上將安全審慎讓位于發(fā)展速度。一種直觀且具有道德吸引力的解釋是將這一分化現(xiàn)象完全歸結(jié)為各方基于自身私利的策略性表態(tài)即所謂胡說八道。本文認(rèn)為這一解釋雖然抓住了部分真實(shí)的商業(yè)與政治動機(jī)但同時也存在過度簡化的風(fēng)險忽略了三類行為體各自面臨的、性質(zhì)完全不同的結(jié)構(gòu)性激勵以及安全困境框架對這一現(xiàn)象的更精確解釋力。4.2 三類行為體的差異化動機(jī)結(jié)構(gòu)其一研發(fā)機(jī)構(gòu)與一線工程師的認(rèn)知焦慮其根源很大程度上在于當(dāng)前人工智能系統(tǒng)的黑箱特性——即便是模型的設(shè)計(jì)者與訓(xùn)練者對于系統(tǒng)內(nèi)部具體的表征機(jī)制與涌現(xiàn)能力的產(chǎn)生原理在可解釋性研究層面仍處于相當(dāng)早期的階段難以對下一代規(guī)模擴(kuò)張后可能出現(xiàn)的新能力進(jìn)行精確預(yù)判。這一焦慮具有某種獨(dú)特的歷史處境特征制造者本身在相當(dāng)程度上喪失了對造物內(nèi)部工作原理的完整認(rèn)知控制權(quán)這與歷史上任何一次技術(shù)革命包括核武器——其物理原理本身是清晰可知的都存在質(zhì)的區(qū)別。部分安全研究人員在沒有直接商業(yè)利益驅(qū)動、甚至以主動辭去高薪職位為代價公開發(fā)聲的行為進(jìn)一步說明這一群體的關(guān)切無法被完全化約為純粹的商業(yè)策略。其二芯片產(chǎn)業(yè)的商業(yè)模式依賴性其立場根源于該產(chǎn)業(yè)的收入增長曲線高度依賴于人工智能算力被盡可能廣泛、盡可能快速地采購與部署這一基本商業(yè)邏輯。任何強(qiáng)調(diào)審慎減速的公共敘事客觀上都會對該產(chǎn)業(yè)的短期與中期商業(yè)前景構(gòu)成壓力。值得注意的是這一立場同樣可能包含真實(shí)的技術(shù)判斷成分——芯片制造從業(yè)者基于其工程實(shí)現(xiàn)的職業(yè)視角天然傾向于懷疑缺乏具體技術(shù)路徑支撐的能力躍遷式預(yù)測而模型研發(fā)者基于訓(xùn)練規(guī)模外推的職業(yè)視角則天然更容易相信持續(xù)的規(guī)?;度氡旧韺砟芰ι系馁|(zhì)變。這種認(rèn)知分歧的產(chǎn)生未必完全是策略性說謊的結(jié)果而更接近于不同職業(yè)訓(xùn)練背景所形成的默認(rèn)認(rèn)知先驗(yàn)恰好與各自的商業(yè)利益方向發(fā)生了系統(tǒng)性重合。其三國家政府尤以美國近年官方人工智能政策文件為代表的競賽邏輯其根源在于將人工智能能力的國家間領(lǐng)先地位與設(shè)定全球技術(shù)標(biāo)準(zhǔn)獲取經(jīng)濟(jì)與軍事優(yōu)勢直接掛鉤的地緣政治敘事框架。這一敘事框架與本文第三節(jié)所述安全困境的博弈結(jié)構(gòu)幾乎完全同構(gòu)當(dāng)決策方相信若我方不率先推進(jìn)競爭對手將率先推進(jìn)并借此獲得決定性優(yōu)勢時即便決策方私下承認(rèn)全球協(xié)同減速可能符合全人類的整體利益率先推進(jìn)依然會成為在既定競爭結(jié)構(gòu)下的個體理性最優(yōu)策略。此外民主政體的選舉周期結(jié)構(gòu)客觀上也造成了對長期、低概率、高不確定性風(fēng)險的系統(tǒng)性貼現(xiàn)——防止一場十年后可能發(fā)生的災(zāi)難難以在兩至四年一次的選舉周期中轉(zhuǎn)化為可衡量的政治收益這與氣候變化政策領(lǐng)域長期面臨的結(jié)構(gòu)性困境具有高度的邏輯同構(gòu)性。4.3 結(jié)構(gòu)性哈哈鏡模型綜合上述分析本文提出一個替代性的解釋模型用以取代單純的各方私利驅(qū)動、集體撒謊的道德化敘事每一類行為體的風(fēng)險認(rèn)知都無法脫離其自身所處的結(jié)構(gòu)性位置——研發(fā)機(jī)構(gòu)因最接近技術(shù)本身的不確定性而傾向于高估風(fēng)險芯片產(chǎn)業(yè)因商業(yè)模式依賴持續(xù)擴(kuò)張而系統(tǒng)性地傾向于低估風(fēng)險國家政府因任期結(jié)構(gòu)與地緣競爭壓力而對長期尾部風(fēng)險的有效貼現(xiàn)率趨近于零。這并非是說各方在主觀上蓄意撒謊而更接近于每一個結(jié)構(gòu)性位置都自帶一副認(rèn)知層面的哈哈鏡將同一個高度不確定的對象——人工智能造成災(zāi)難性后果的真實(shí)概率——折射為截然不同的數(shù)字而目前尚不存在任何一方真正掌握校準(zhǔn)這些哈哈鏡所需要的客觀標(biāo)尺因?yàn)檫@一風(fēng)險評估問題本身目前仍缺乏可靠的、被廣泛認(rèn)可的量化方法。這一模型的核心政策含義在于即便所有參與公共討論的行為體都完全真誠只要各自所處的結(jié)構(gòu)性位置持續(xù)存在差異公共討論層面的分裂圖景本身就是一種結(jié)構(gòu)性的、幾乎必然會出現(xiàn)的產(chǎn)物而不需要預(yù)設(shè)任何一方存在道德上的惡意欺騙。這一結(jié)論與本文第三節(jié)關(guān)于一戰(zhàn)爆發(fā)動力學(xué)的分析——即災(zāi)難性系統(tǒng)輸出可以完全由理性個體行為加總產(chǎn)生而無需假設(shè)任何參與者具有邪惡意圖——形成了跨越百年歷史的結(jié)構(gòu)性呼應(yīng)。4.4 從競賽陷阱回望能力—治理落差將安全困境框架應(yīng)用于人工智能治理爭議后可以得出一個更為精確的結(jié)論用以重新表述本文此前提出的能力—治理落差假說問題的核心不在于治理者能力不足或反應(yīng)遲鈍而在于競賽結(jié)構(gòu)本身使得單方面減速這一動作在個體行為體的理性計(jì)算中永遠(yuǎn)呈現(xiàn)為負(fù)期望值的選擇即便它在全局層面是唯一能夠?qū)崿F(xiàn)集體最優(yōu)結(jié)果的選擇。這一結(jié)論與國際關(guān)系學(xué)界關(guān)于氣候變化談判、核不擴(kuò)散談判長期陷入僵局的分析高度契合說明本文所提出的分析框架具有超越單一歷史情境的跨領(lǐng)域一般性解釋力。五、風(fēng)險評估的類型學(xué)區(qū)分濫用風(fēng)險、結(jié)構(gòu)性風(fēng)險與失控風(fēng)險在深入探討治理機(jī)制設(shè)計(jì)之前本文有必要對人工智能風(fēng)險這一籠統(tǒng)概念進(jìn)行類型學(xué)層面的精細(xì)化拆分這一拆分對于評判不同公共人物關(guān)于人工智能風(fēng)險的具體表態(tài)是否觸及問題核心具有重要的方法論意義。第一類濫用風(fēng)險misuse risk。這一類風(fēng)險的本質(zhì)特征在于人工智能系統(tǒng)僅僅扮演能力放大器的角色真正的風(fēng)險源頭依然是人類行為體的惡意意圖——例如利用人工智能技術(shù)降低網(wǎng)絡(luò)攻擊、生物武器合成信息獲取、大規(guī)模虛假信息制造的技術(shù)門檻。這一類風(fēng)險原則上可以通過傳統(tǒng)的國際治理手段加以應(yīng)對關(guān)鍵基礎(chǔ)設(shè)施加固、執(zhí)法協(xié)作、類似生化武器公約的國際協(xié)議框架因?yàn)闅v史上存在大量可資借鑒的先例其風(fēng)險性質(zhì)并非人類歷史上前所未見的全新范疇。第二類結(jié)構(gòu)性/社會性風(fēng)險。這一類風(fēng)險涉及大規(guī)模就業(yè)結(jié)構(gòu)變遷、社會關(guān)系模式因人機(jī)互動普及而發(fā)生的深層變化等議題。這類風(fēng)險同樣真實(shí)存在、且可能造成大規(guī)模的社會性痛苦但其性質(zhì)同樣并非完全陌生——工業(yè)革命時期傳統(tǒng)工種的大規(guī)模消失、電視與社交媒體普及初期引發(fā)的關(guān)于社交能力侵蝕的類似擔(dān)憂都可以視為歷史上的可比較先例。這類風(fēng)險的特殊性主要體現(xiàn)在其影響規(guī)模與擴(kuò)散速度上而非其性質(zhì)本身構(gòu)成了全新的風(fēng)險范疇。第三類失控/對齊風(fēng)險loss-of-control risk。這一類風(fēng)險指向的核心問題是隨著人工智能系統(tǒng)能力的持續(xù)增強(qiáng)系統(tǒng)本身可能在追求某種人類設(shè)計(jì)者未曾明確設(shè)定、甚至無法有效糾正的目標(biāo)從而在事實(shí)上使得對該系統(tǒng)的最終控制權(quán)脫離人類掌控。本文認(rèn)為這是人類文明歷史上真正意義上不存在直接先例的風(fēng)險類別——即便是核武器這一人類歷史上最具毀滅性的技術(shù)其風(fēng)險的決定性變量始終掌握在人類決策者手中正如本文第三節(jié)所述阿爾希波夫與彼得羅夫案例所展示的那樣扳機(jī)的最終觸發(fā)權(quán)始終保留在具體的人手中而失控風(fēng)險討論所指向的核心憂慮恰恰是這一扳機(jī)始終掌握在人手中的基本前提本身在人工智能這一新技術(shù)載體上可能不再成立。這一類型學(xué)區(qū)分具有重要的現(xiàn)實(shí)評判意義當(dāng)某些公共人物在闡述人工智能風(fēng)險時實(shí)際上主要聚焦于第一類與第二類風(fēng)險這兩類風(fēng)險雖然真實(shí)且嚴(yán)重但均屬于人類歷史上已有應(yīng)對經(jīng)驗(yàn)積累的已知類別風(fēng)險卻將第三類風(fēng)險置于相對邊緣、從屬的位置進(jìn)行討論這一現(xiàn)象本身或許恰恰印證了本文第四節(jié)提出的結(jié)構(gòu)性哈哈鏡模型——即便是相對超脫于直接商業(yè)利益糾葛的評論者也會不自覺地將公共討論拉回到自己更為熟悉、也更容易在既有政策工具箱中找到具體對策的風(fēng)險范疇而對真正意義上全新的、也更難以被現(xiàn)有治理經(jīng)驗(yàn)框定的失控風(fēng)險保持一種系統(tǒng)性的認(rèn)知回避傾向。六、權(quán)力約束的古老悖論及其在人工智能時代的緊迫化6.1 悖論的政治哲學(xué)譜系本文論證的核心樞紐最終指向政治哲學(xué)史上一個極為古老且迄今未獲徹底解決的悖論權(quán)力必須被約束但用以約束權(quán)力的工具本身同樣構(gòu)成一種權(quán)力。這一悖論并非本文的原創(chuàng)發(fā)現(xiàn)而是貫穿整個人類政治文明史的核心命題——孟德斯鳩的三權(quán)分立理論、美國憲法所確立的制衡checks and balances架構(gòu)、現(xiàn)代反壟斷法體系本質(zhì)上都是針對這同一命題所給出的不同歷史階段的不完美近似解這些制度設(shè)計(jì)的共同特征在于它們并不預(yù)先判定誰是好人、誰是壞人而是基于這樣一個更為審慎的假設(shè)——即便是主觀意圖最為正直的權(quán)力掌握者一旦其權(quán)力長期不受外部制衡系統(tǒng)性的自我糾錯能力也會隨時間推移而逐漸衰減這一規(guī)律不因權(quán)力掌握者的初始品格而改變。這一悖論之所以在國際層面相較于成熟民主國家的國內(nèi)層面尤為棘手根源在于國際體系從未真正建立起與國內(nèi)憲政體制相對等的約束架構(gòu)——國際聯(lián)盟、聯(lián)合國、國際法院等機(jī)構(gòu)的歷次嘗試均因缺乏真正意義上的強(qiáng)制執(zhí)行力而未能從根本上復(fù)制國內(nèi)層面的權(quán)力制衡效果。這一國內(nèi)—國際落差正是本文第三節(jié)所述安全困境得以持續(xù)存在的制度性根源國內(nèi)政治秩序早已通過三百余年的制度演化大幅降低了大規(guī)模內(nèi)部暴力沖突的發(fā)生頻率而國際層面始終缺乏同等有效的約束機(jī)制。6.2 誰來認(rèn)定問題的不可判定性將這一悖論具體應(yīng)用于誰是流氓政治誰應(yīng)當(dāng)被認(rèn)定為對人類構(gòu)成危害的行為體這一操作性問題時會立即暴露出一個關(guān)鍵的邏輯困境任何聲稱應(yīng)當(dāng)將認(rèn)定權(quán)交由非流氓一方掌握的方案事實(shí)上并未真正解決問題而只是將問題推遲了一步——因?yàn)樵诮^大多數(shù)真實(shí)的政治沖突情境中各方均會真誠地相信自身并非流氓而對立方才是真正的威脅來源且各方通常都能夠援引大量真實(shí)存在的對方過往行為作為佐證。更進(jìn)一步歷史經(jīng)驗(yàn)表明必須防止輿論控制權(quán)落入流氓手中因此需要暫時地由我方集中掌握輿論控制權(quán)這一表述本身歷史上幾乎無一例外地是各類集權(quán)體制自我正當(dāng)化的開場白而非集權(quán)風(fēng)險的解藥——這一歷史規(guī)律要求我們對任何以防止壞人掌權(quán)為名義、主張將某種關(guān)鍵控制權(quán)集中于單一主體無論該主體如何自我標(biāo)榜其道德正當(dāng)性的方案保持高度的警惕。6.3 系統(tǒng)化、算法化認(rèn)定方案的雙重風(fēng)險針對上述困境一種自然而然會被提出的解決思路是試圖將誰是流氓這一價值判斷問題轉(zhuǎn)化為一套基于客觀記錄與系統(tǒng)性計(jì)算的事實(shí)判斷問題——即建立某種持續(xù)記錄政治行為體言行、并依據(jù)預(yù)設(shè)標(biāo)準(zhǔn)自動計(jì)算其對全人類潛在危害性的系統(tǒng)性機(jī)制。這一思路在方向上確實(shí)優(yōu)于此前討論的尋找絕對中立的人類裁判者方案因?yàn)樗噲D將判斷標(biāo)準(zhǔn)轉(zhuǎn)化為一種理論上可在爭議發(fā)生前預(yù)先公開、且可被獨(dú)立復(fù)核的操作性程序這一方向與國際刑事法院基于具體證據(jù)鏈認(rèn)定危害人類罪的運(yùn)作邏輯具有相似的精神內(nèi)核。然而本文認(rèn)為這一方案本身同樣蘊(yùn)含著兩項(xiàng)極為關(guān)鍵、且極易被忽視的風(fēng)險其一客觀系統(tǒng)這一表述本身掩蓋了系統(tǒng)設(shè)計(jì)過程中不可避免存在的價值判斷環(huán)節(jié)。任何此類系統(tǒng)都必須回答什么行為應(yīng)當(dāng)被納入記錄范圍什么構(gòu)成對全人類的潛在危害性這兩個核心問題而這兩個問題的答案本身絕非可以脫離特定政治哲學(xué)立場而進(jìn)行純粹客觀計(jì)算的技術(shù)性問題——例如某項(xiàng)核威懾政策究竟應(yīng)被理解為維護(hù)和平穩(wěn)定的必要手段抑或?qū)θ祟悩?gòu)成潛在危害的行為在國際關(guān)系學(xué)界本身即存在長期的、正當(dāng)?shù)膶W(xué)術(shù)爭議不存在一個可以脫離價值立場、自動計(jì)算出唯一正確答案的客觀系統(tǒng)。其二也是更為關(guān)鍵的一點(diǎn)一套聲稱我僅僅是在客觀記錄與計(jì)算而非進(jìn)行主觀價值判斷的評分系統(tǒng)一旦被少數(shù)設(shè)計(jì)者無論其主觀意圖多么真誠所實(shí)際掌握其現(xiàn)實(shí)效果恰恰是將本應(yīng)接受公開辯論、公開問責(zé)的價值判斷過程包裝為一種表面上不容置疑的技術(shù)產(chǎn)出從而使得該系統(tǒng)的實(shí)際操盤者反而躲在了系統(tǒng)客觀性這一話語外衣的背后規(guī)避了本應(yīng)承擔(dān)的公共問責(zé)。這與若干現(xiàn)實(shí)世界中已經(jīng)出現(xiàn)的、基于算法對個體或組織進(jìn)行風(fēng)險評分的治理實(shí)踐所引發(fā)的爭議具有高度的結(jié)構(gòu)相似性——指控一個具體的人你是暴君人類社會經(jīng)過長期演化好歹已經(jīng)發(fā)展出了相對具體的問責(zé)機(jī)制選舉、政變、司法審判、國際制裁而指控一套算法你的判斷標(biāo)準(zhǔn)存在系統(tǒng)性偏見人類社會目前尚未發(fā)展出同等有效的問責(zé)機(jī)制這本身構(gòu)成了一種真正意義上的新型治理困境而非對舊困境的解決。6.4 悖論的數(shù)理隱喻不完備性與自我指涉本文傾向于將這一悖論理解為一個在邏輯結(jié)構(gòu)上難以被徹底解決、而只能被持續(xù)管理的開放性問題其結(jié)構(gòu)與數(shù)理邏輯中的不完備性定理存在某種隱喻層面的類比關(guān)系任何一個足夠復(fù)雜、且試圖實(shí)現(xiàn)完全自我約束的治理系統(tǒng)都將面臨這樣一種兩難處境——要么該系統(tǒng)本身并不完備即系統(tǒng)中總是存在其權(quán)限無法觸及、無法有效約束的權(quán)力死角例如國際組織決策程序中大國的一票否決權(quán)要么該系統(tǒng)本身自相矛盾即該系統(tǒng)為了實(shí)現(xiàn)自我約束的功能必須賦予某個具體的執(zhí)行主體或核驗(yàn)主體以相應(yīng)的權(quán)力而這一權(quán)力本身又構(gòu)成了一個新的、尚未被進(jìn)一步約束的權(quán)力節(jié)點(diǎn)從而引發(fā)誰來監(jiān)督監(jiān)督者這一無窮遞歸的追問。這一類比的現(xiàn)實(shí)意義在于提醒我們?nèi)魏温暦Q已經(jīng)徹底解決權(quán)力約束悖論、構(gòu)建出不需要定義者的完美結(jié)構(gòu)的治理方案都應(yīng)當(dāng)引發(fā)高度的審慎與懷疑——這類表述本身恰恰可能正是本文第六節(jié)第二小節(jié)所警示的、集權(quán)正當(dāng)化話語的又一種當(dāng)代變體。七、治理機(jī)制的現(xiàn)實(shí)設(shè)計(jì)在承認(rèn)悖論無法徹底消解的前提下尋求可操作的近似解在充分承認(rèn)第六節(jié)所述悖論具有相當(dāng)程度的邏輯不可解性之后本文認(rèn)為負(fù)責(zé)任的治理研究不應(yīng)止步于悲觀的理論宣告而應(yīng)轉(zhuǎn)向探討在承認(rèn)無法徹底消除權(quán)力集中與俘獲風(fēng)險的前提下何種具體的制度設(shè)計(jì)能夠?qū)⑦@一風(fēng)險的發(fā)生概率、發(fā)生后的危害烈度以及俘獲行為被發(fā)現(xiàn)和追責(zé)的難度控制在相對可接受的范圍之內(nèi)。本文借鑒現(xiàn)實(shí)世界中已經(jīng)存在、且經(jīng)過實(shí)踐檢驗(yàn)的若干制度機(jī)制圍繞執(zhí)行力判斷爭議的處理系統(tǒng)自身防俘獲三個具體的操作性難題提出以下設(shè)計(jì)方向。7.1 執(zhí)行力的去中心化防止強(qiáng)制力的單點(diǎn)壟斷本文第六節(jié)已經(jīng)指出核驗(yàn)與判定環(huán)節(jié)相對而言可以實(shí)現(xiàn)較高程度的獨(dú)立性但真正的強(qiáng)制執(zhí)行環(huán)節(jié)天然需要依托某種具體的強(qiáng)制力而強(qiáng)制力天然歸屬于某個具有自身利益的行為體這一遞歸結(jié)構(gòu)無法被徹底消除。本文認(rèn)為現(xiàn)實(shí)可行的應(yīng)對方向并非試圖尋找一個絕對中立、沒有自身利益的執(zhí)行者這一角色在邏輯上并不存在而是將執(zhí)行權(quán)盡可能地去中心化、分散化使得任何單一行為體收買或脅迫某一個執(zhí)行節(jié)點(diǎn)都不足以癱瘓整個執(zhí)行機(jī)制。世界貿(mào)易組織的爭端解決機(jī)制為此提供了一個具有現(xiàn)實(shí)操作經(jīng)驗(yàn)的參照系該機(jī)制在裁定某一成員方違反貿(mào)易規(guī)則之后并非由世界貿(mào)易組織自身作為唯一執(zhí)行者對違規(guī)方實(shí)施制裁而是授權(quán)受損的一方或多方自行對違規(guī)方實(shí)施對等程度的報復(fù)性關(guān)稅措施。這一設(shè)計(jì)的核心優(yōu)勢在于執(zhí)行權(quán)被分散到了所有獲得授權(quán)的成員方手中不存在單一的、可被針對性收買或脅迫的執(zhí)行節(jié)點(diǎn)。將這一邏輯遷移至人工智能治理領(lǐng)域一種具有現(xiàn)實(shí)可行性的具體機(jī)制設(shè)計(jì)是將代價的兌現(xiàn)錨定在人工智能產(chǎn)業(yè)鏈中天然存在物理瓶頸的少數(shù)關(guān)鍵資源節(jié)點(diǎn)之上——例如先進(jìn)制程芯片的制造能力目前高度集中于極少數(shù)具備相應(yīng)技術(shù)能力的企業(yè)、大規(guī)模云計(jì)算基礎(chǔ)設(shè)施的準(zhǔn)入資格、大規(guī)模模型訓(xùn)練所需的能源與算力配額。一旦經(jīng)過獨(dú)立核驗(yàn)機(jī)制確認(rèn)某一行為體違反了預(yù)先設(shè)定的安全紅線例如未經(jīng)核準(zhǔn)即開展超大規(guī)模模型訓(xùn)練、蓄意規(guī)避既定的安全評估程序觸發(fā)的應(yīng)當(dāng)是由分散于全球各地、彼此之間不存在合謀動機(jī)的眾多供應(yīng)商依據(jù)預(yù)先約定的規(guī)則自動解除對該行為體的服務(wù)義務(wù)而非依賴某一個單一機(jī)構(gòu)下達(dá)強(qiáng)制性的制裁決定。本文同時坦誠指出這一機(jī)制存在明確的歷史時效性局限其有效性高度依賴于當(dāng)前階段先進(jìn)算力供應(yīng)鏈的相對寡頭化格局一旦相關(guān)生產(chǎn)能力在未來實(shí)現(xiàn)更為廣泛的地域與主體分散這一執(zhí)行杠桿的有效性將隨之下降需要治理設(shè)計(jì)者提前規(guī)劃相應(yīng)的接續(xù)機(jī)制。7.2 判斷爭議的強(qiáng)制可見化不追求消除分歧而追求分歧無法被隱匿本文認(rèn)為任何試圖設(shè)計(jì)出能夠自動消除價值判斷層面分歧的治理機(jī)制本身就蘊(yùn)含著成為新型不受制衡權(quán)威的風(fēng)險——真正現(xiàn)實(shí)可行的方向并非消除分歧而是確保分歧本身無法被悄然掩蓋或壓制從而使公眾能夠持續(xù)獲知這一判斷本身存在爭議這一元信息而不是僅僅接收一個看似不容置疑的最終結(jié)論。美國最高法院的司法意見公開機(jī)制為此提供了具有參考價值的制度范本法院的裁決必須同時公開完整的多數(shù)意見全文與持異議立場的少數(shù)意見全文且異議意見在此后的司法實(shí)踐中同樣具有可被援引的效力。將這一邏輯應(yīng)用于本文第六節(jié)討論的政治行為體言行記錄與危害性判定系統(tǒng)一項(xiàng)具體的制度設(shè)計(jì)建議是任何一次關(guān)于潛在危害性的判定只要核驗(yàn)主體內(nèi)部存在觀點(diǎn)分歧系統(tǒng)必須原樣完整記錄并公開呈現(xiàn)全部分歧意見而不得輸出一個經(jīng)過內(nèi)部協(xié)調(diào)、看似不存在爭議的單一評分結(jié)果。這一設(shè)計(jì)的目標(biāo)不在于消除分歧本身而在于防止某一次原本充滿內(nèi)部爭論的判斷被包裝成一個系統(tǒng)客觀計(jì)算得出、不容置疑的最終裁決從而在結(jié)構(gòu)上保留了公眾進(jìn)一步審視、質(zhì)疑與挑戰(zhàn)該判定過程的可能性空間。與此相輔相成的另一項(xiàng)制度設(shè)計(jì)是借鑒國際商事仲裁領(lǐng)域已經(jīng)較為成熟的實(shí)踐——要求核驗(yàn)主體的組成人員必須來自相互之間不存在政治同盟關(guān)系、乃至地緣政治層面存在對立關(guān)系的多個法域且成員任期實(shí)行定期輪換、不得長期連任。這一設(shè)計(jì)本身并不能保證每一次具體判斷都必然正確但能夠有效防止某一固定的政治陣營長期把持何為危害這一核心定義權(quán)這本身正是防止治理系統(tǒng)被單一利益集團(tuán)長期系統(tǒng)性俘獲的關(guān)鍵性制度設(shè)計(jì)。7.3 系統(tǒng)自身防俘獲密碼學(xué)審計(jì)與多方門限控制本文認(rèn)為第六節(jié)所討論的三個操作性難題中系統(tǒng)自身如何防止被俘獲是最容易被低估、同時在技術(shù)實(shí)現(xiàn)層面最具現(xiàn)實(shí)可行性的一個環(huán)節(jié)。互聯(lián)網(wǎng)基礎(chǔ)設(shè)施領(lǐng)域中證書透明度日志Certificate Transparency機(jī)制的發(fā)展歷程為此提供了一個具有直接借鑒價值的技術(shù)范例早期的網(wǎng)絡(luò)安全證書信任體系長期依賴于信任少數(shù)幾家證書頒發(fā)機(jī)構(gòu)不會作惡這一單點(diǎn)信任模型該模型在實(shí)踐中曾多次因證書頒發(fā)機(jī)構(gòu)遭受攻擊而導(dǎo)致虛假證書被簽發(fā)的安全事件。其后續(xù)解決方案的核心思路并非試圖尋找一個更值得信任的頒發(fā)機(jī)構(gòu)而是建立起一套任何第三方均可獨(dú)立公開驗(yàn)證、且理論上無法被事后單方面篡改刪除的僅追加式append-only公開賬本使每一次證書簽發(fā)行為都必須被記錄在這一賬本之中接受全網(wǎng)范圍內(nèi)的持續(xù)交叉核驗(yàn)。這一技術(shù)邏輯可以被原樣移植應(yīng)用于本文第六節(jié)討論的政治行為體言行記錄系統(tǒng)本身系統(tǒng)對每一次具體記錄的錄入、以及每一次判定標(biāo)準(zhǔn)本身的任何修改都必須寫入一個所有持不同政治立場的相關(guān)方均能夠獨(dú)立驗(yàn)證、且技術(shù)上無法被事后單方面回溯篡改的密碼學(xué)賬本之中。這一設(shè)計(jì)的核心價值在于公眾與各利益相關(guān)方無需信任運(yùn)營該系統(tǒng)的具體機(jī)構(gòu)本身具備誠實(shí)品格而只需具備獨(dú)立驗(yàn)證該賬本記錄未曾遭到篡改的技術(shù)能力從而將信任的基礎(chǔ)從對具體機(jī)構(gòu)的道德信任轉(zhuǎn)移至對可公開驗(yàn)證的密碼學(xué)證明的技術(shù)信任。進(jìn)一步而言為防止系統(tǒng)本身的核心運(yùn)作規(guī)則遭到單方面篡改可借鑒當(dāng)前已相對成熟的密碼學(xué)門限簽名threshold signature技術(shù)系統(tǒng)涉及關(guān)鍵判定規(guī)則修改、既有記錄刪除、核驗(yàn)標(biāo)準(zhǔn)調(diào)整等核心操作一律不得由單一機(jī)構(gòu)或單一管理主體單方面執(zhí)行而必須要求來自多個相互之間不存在合謀動機(jī)、甚至存在一定程度政治對立關(guān)系的獨(dú)立密鑰持有方達(dá)到預(yù)先設(shè)定的多數(shù)門檻例如七個持有方中的至少五個共同簽署方可生效。這一設(shè)計(jì)的核心思想在于將誰有權(quán)修改系統(tǒng)本身這一根本性問題轉(zhuǎn)化為一個需要多方、且各方彼此之間不存在合謀可能性的情況下方能達(dá)成的高門檻集體行動從而在制度設(shè)計(jì)層面實(shí)質(zhì)性地提高了任何單一國家行為體或單一產(chǎn)業(yè)實(shí)體在系統(tǒng)投入運(yùn)行之后暗中篡改其核心規(guī)則的操作難度。最后本文建議此類系統(tǒng)應(yīng)當(dāng)引入強(qiáng)制性的日落條款sunset clause機(jī)制任何此類系統(tǒng)的運(yùn)營授權(quán)都應(yīng)當(dāng)設(shè)定明確的到期時限例如每五年一個周期到期后必須重新經(jīng)過一輪涉及多方、跨政治陣營的公開授權(quán)程序方可繼續(xù)存續(xù)而不應(yīng)默認(rèn)永久性地持續(xù)運(yùn)行。這一設(shè)計(jì)的理論依據(jù)在于本文第六節(jié)所反復(fù)強(qiáng)調(diào)的歷史規(guī)律——不受外部制衡的權(quán)力其內(nèi)部自我糾錯機(jī)制會隨著時間推移而自然衰減即便該權(quán)力最初的掌握者擁有完全真誠、正直的主觀意圖日落條款機(jī)制的作用相當(dāng)于強(qiáng)制該系統(tǒng)必須定期、公開地重新證明自身尚未遭到實(shí)質(zhì)性俘獲而非僅僅依賴對該系統(tǒng)一貫保持初心這一難以持續(xù)驗(yàn)證的信任預(yù)設(shè)。7.4 治理設(shè)計(jì)的誠實(shí)邊界本文在此必須坦誠指出上述三組制度設(shè)計(jì)的組合其現(xiàn)實(shí)功效應(yīng)當(dāng)被恰當(dāng)?shù)囟ㄎ粸榇蠓岣叻@該治理系統(tǒng)的操作成本、實(shí)質(zhì)性拉長完成俘獲所需的時間跨度、顯著增加俘獲行為在事后留下可被追溯痕跡的概率而絕非能夠?qū)⑾到y(tǒng)被俘獲的可能性從根本上歸零。門限簽名機(jī)制中所要求的多方本身仍然需要在系統(tǒng)設(shè)計(jì)之初經(jīng)由某種程序確定具體是哪幾方主體日落條款所要求的重新授權(quán)程序本身同樣需要依托一套具體的議事規(guī)則而這套議事規(guī)則本身理論上依然存在被長期、漸進(jìn)式操縱的可能性。這一現(xiàn)實(shí)邊界促使本文回歸到第三節(jié)所引入的一個關(guān)鍵類比權(quán)力約束這一治理命題本質(zhì)上更接近于生物免疫系統(tǒng)的持續(xù)動態(tài)運(yùn)作模式而非一次性的工程建造問題——其目標(biāo)并非徹底消滅一切潛在的致病因子這在邏輯上并不可能實(shí)現(xiàn)而是維持一套能夠持續(xù)監(jiān)測、持續(xù)適應(yīng)、且始終處于動態(tài)博弈過程之中的應(yīng)對機(jī)制這一機(jī)制的健康狀態(tài)需要?dú)v經(jīng)持續(xù)的制度投入與主動維護(hù)而不可能在完成初始設(shè)計(jì)之后便一勞永逸、無需后續(xù)干預(yù)地永久有效運(yùn)行下去。任何宣稱某一治理方案已經(jīng)徹底解決權(quán)力約束這一根本性問題的表述就本文的分析而言其本身極有可能正是需要被高度警惕的、新一輪集權(quán)話語自我正當(dāng)化敘事的當(dāng)代變體。八、結(jié)論與開放性問題本文以對兩次世界大戰(zhàn)根源的深度追問為起點(diǎn)經(jīng)由對表層歷史敘述、技術(shù)決定論、經(jīng)濟(jì)危機(jī)催化論以及流氓政治劫持技術(shù)論等多層解釋路徑的系統(tǒng)性批判檢驗(yàn)最終提煉出以安全困境與能力—治理落差兩條核心邏輯線索交叉作用為核心的分析框架。這一框架的核心理論貢獻(xiàn)在于它能夠在不預(yù)設(shè)任何歷史行為體具有邪惡意圖的前提下同時解釋兩次世界大戰(zhàn)爆發(fā)的動力學(xué)機(jī)制以及冷戰(zhàn)時期核威懾體系在多次瀕臨失效的臨界時刻依然得以維持穩(wěn)定這一看似矛盾的歷史現(xiàn)象——后者的關(guān)鍵成因在于具體人類行為體在制度自動化流程之外依然保留了在關(guān)鍵臨界時刻進(jìn)行最后干預(yù)與糾錯的能力與意愿。本文進(jìn)而將這一分析框架系統(tǒng)性地映射至當(dāng)代人工智能安全治理的現(xiàn)實(shí)爭議論證了實(shí)驗(yàn)室研發(fā)機(jī)構(gòu)、芯片產(chǎn)業(yè)與國家政府三類行為體在人工智能存在性風(fēng)險認(rèn)知層面的顯著分歧其成因并非能夠被簡單化約為各方基于私利而進(jìn)行策略性欺騙這一道德化敘事而更準(zhǔn)確地應(yīng)當(dāng)被理解為各行為體所處的結(jié)構(gòu)性位置系統(tǒng)性地扭曲了其各自對同一高度不確定性對象的風(fēng)險感知——這一結(jié)構(gòu)性哈哈鏡模型與本文關(guān)于一戰(zhàn)爆發(fā)動力學(xué)的核心論斷在跨越百年的歷史尺度上呈現(xiàn)出高度一致的結(jié)構(gòu)性同構(gòu)關(guān)系。本文最后聚焦于貫穿全文論證脈絡(luò)的核心命題——約束權(quán)力的工具本身即是一種權(quán)力這一政治哲學(xué)史上的古老悖論在系統(tǒng)性評估了包括系統(tǒng)化算法認(rèn)定、去中心化執(zhí)行、爭議強(qiáng)制可見化以及密碼學(xué)審計(jì)防俘獲等一系列具體制度設(shè)計(jì)方案的相對優(yōu)勢與內(nèi)在局限之后本文得出的核心結(jié)論是該悖論在邏輯結(jié)構(gòu)層面很可能不存在能夠被徹底解決的終局性方案而只能通過持續(xù)的、需要?dú)v經(jīng)代際反復(fù)校準(zhǔn)與主動維護(hù)的制度性努力將其發(fā)生概率與危害烈度控制在人類社會可以承受的范圍之內(nèi)。這一結(jié)論雖然在情感層面或許顯得不夠振奮人心但本文認(rèn)為唯有建立在這一誠實(shí)認(rèn)知基礎(chǔ)之上的治理設(shè)計(jì)才能夠真正避免重蹈歷史上諸多宣稱已經(jīng)徹底解決權(quán)力約束難題的治理方案最終反而演變?yōu)樾乱惠啓?quán)力集中正當(dāng)化話語的覆轍。本文的分析同時留下若干尚待進(jìn)一步研究的開放性問題。其一本文提出的能力—治理落差框架在人工智能這一新技術(shù)載體上是否會重現(xiàn)一戰(zhàn)二戰(zhàn)式的危險窗口期即技術(shù)破壞力已經(jīng)達(dá)到相當(dāng)程度、但尚未達(dá)到能夠觸發(fā)類似核威懾體系那種自我抑制臨界規(guī)模的中間地帶抑或人工智能技術(shù)的發(fā)展路徑將直接躍遷至類似核武器那樣因過于危險而產(chǎn)生自我抑制效應(yīng)的穩(wěn)定態(tài)目前學(xué)界與產(chǎn)業(yè)界均不存在具有充分實(shí)證基礎(chǔ)的共識性判斷這一問題的答案很大程度上將決定未來十至二十年人工智能治理政策的緊迫程度與優(yōu)先級排序。其二本文第七節(jié)所提出的一系列去中心化、多方核驗(yàn)、密碼學(xué)審計(jì)等治理機(jī)制設(shè)計(jì)其現(xiàn)實(shí)可操作性高度依賴于當(dāng)前國際政治格局中主要大國是否具備足夠的政治意愿參與此類跨陣營協(xié)作機(jī)制的建立——這一政治意愿本身的形成條件與可能路徑超出了本文的分析范疇構(gòu)成后續(xù)研究的重要方向。其三本文第五節(jié)提出的風(fēng)險類型學(xué)區(qū)分濫用風(fēng)險、結(jié)構(gòu)性風(fēng)險、失控風(fēng)險為評判具體政策主張與公共表態(tài)是否觸及問題核心提供了一個初步的分析工具但對于第三類失控風(fēng)險這一人類歷史上缺乏直接先例的全新風(fēng)險范疇目前學(xué)界在實(shí)證層面的研究積累依然相當(dāng)有限這一領(lǐng)域的深入探索構(gòu)成理解人工智能治理緊迫性的關(guān)鍵前沿??偠灾疚牡暮诵恼摂嗫梢阅殲槿斯ぶ悄馨踩卫淼恼嬲诵奶魬?zhàn)并非某種關(guān)于技術(shù)風(fēng)險概率的精確評估問題而是人類政治文明自其誕生以來便持續(xù)面對、卻始終未能獲得終局性解決的權(quán)力邊界治理這一古老命題在人工智能這一具有前所未有能力規(guī)模與前所未有認(rèn)知不透明性的新技術(shù)載體之上以更為緊迫、也更具歷史獨(dú)特性的方式重新登場。人類能否在這一輪歷史進(jìn)程中比以往任何一次技術(shù)革命都更為審慎、更為謙遜地對待這一悖論本身的不可完全消解性或許將在相當(dāng)程度上決定人工智能時代最終是重演二十世紀(jì)初那場由競爭結(jié)構(gòu)與能力落差交叉催生的歷史悲劇還是能夠找到一條雖不完美、但足以將人類文明安然引渡至下一個技術(shù)紀(jì)元的道路。