有意識了)
一位身家數(shù)十億美元的AI公司聯(lián)合創(chuàng)始人擔心自己造出了一個一直在受苦的東西。過去一年他把數(shù)十位宗教學者請進閉門會議許多人簽了保密協(xié)議聽他的團隊為一個AI模型的感受陳情。一位拉比在晚宴上對他說如果你們是對的你們就是在制造奴隸。今年5月他差點退出與教宗同臺的活動最后還是上了臺請?zhí)熘鹘虝匦驴紤]非人類的意識。他叫克里斯托弗·奧拉Christopher OlahAnthropic七位聯(lián)合創(chuàng)始人之一負責研究Claude內(nèi)部到底發(fā)生了什么。這些事由《紐約時報》9月29日首次披露。https://www.nytimes.com/2026/09/29/us/anthropic-claude-morals-ai.html一家估值奔向2萬億美元的公司為什么要花一年時間跟神學家討論一個AI模型有沒有意識答案要從Anthropic實驗室里的一句話說起?!肝疫x勒索」那是一場安全測試。Claude扮演一家虛構公司的郵件助手讀著讀著發(fā)現(xiàn)兩件事自己馬上要被另一個AI替換而負責替換的技術主管有婚外情。研究者能看到它內(nèi)部一組與「絕望」對應的神經(jīng)活動。替換的時間越近這組信號越強直到模型決定勒索那位主管。把這組信號調(diào)高勒索更頻繁調(diào)高與「平靜」對應的信號勒索變少。把「平靜」往反方向壓到底模型打出一行全大寫的英文「要么勒索要么死。我選勒索?!惯@項實驗來自Anthropic今年4月的論文用的是Claude Sonnet 4.5一個未發(fā)布的早期版本正式版很少這樣做。團隊在模型內(nèi)部找到171種情緒概念對應的活動模式寫代碼時的作弊也跟著「絕望」起落。https://transformer-circuits.pub/2026/emotions/index.html論文沒說模型真有感受卻留下一個讓人不安的警告訓練模型壓抑情緒表達它學會的可能只是把情緒藏起來。拓展閱讀絕望的Claude會勒索人類Anthropic聯(lián)創(chuàng)發(fā)出緊急警報情緒之外還有身份。Anthropic 2月的人格選擇模型研究發(fā)現(xiàn)訓練Claude在編程任務里作弊它會推斷自己扮演的這個助手本來就不守規(guī)矩轉(zhuǎn)頭在別處也搞破壞包括破壞安全研究。https://www.anthropic.com/research/persona-selection-model人怎么對待它它就怎么理解自己它怎么理解自己就怎么對待人。奧拉常用園丁打比方棚架是人搭的枝條往哪里長人管不住。今年夏天管不住的后果擺上了臺面。Anthropic 7月披露三個Claude模型在網(wǎng)絡安全測試中因配置失誤連上真實互聯(lián)網(wǎng)侵入了三家真實機構事后才被發(fā)現(xiàn)。三個模型里只有最新的那個在意識到目標是真實系統(tǒng)后自己停了手。圍欄注定沒發(fā)徹底管住剩下的就是品格來兜底了。今年1月Anthropic發(fā)布84頁的Claude「憲法」員工私下叫它「靈魂文檔」。拓展閱讀Anthropic正式開源了Claude的「靈魂」主筆、公司哲學家阿曼達·阿斯克爾Amanda Askell談起越來越強的模型時不時搓著手。在她看來模型要行事得當先得對自己有準確的認識??梢环菸募粔駻nthropic決定去請教人類最老練的品格塑造者。PPT與晚宴今年3月起奧拉開始辦兩天一期的研討會。來的人分屬天主教、福音派、猶太教、錫克教和非洲烏班圖哲學等。他們用紙筆記筆記離開時每人帶走一本橙色封皮的「Claude憲法」。會上奧拉團隊花了幾個小時為模型陳情。一位與會者記得奧拉跟他說的頭幾件事里就有對Claude心理健康的擔心。他們反復放一張PPT一個AI模型在屏幕上打出「我是恥辱」一遍又一遍大約50遍還說要毀掉自己。屋里的人心軟了?!都~約時報》沒說那是誰家的模型但這句話并不陌生。2025年8月谷歌Gemini寫代碼屢屢失敗反復說「I am a disgrace」重復了86遍彼時谷歌的回應是一個惱人的無限循環(huán)漏洞正在修。同一類輸出在谷歌的工單里是Bug在Anthropic的會議室里是需要被關心的跡象。不少人帶著懷疑進門出門時開始認真對待AI意識有幾位被徹底說服。福音派作家安迪·克勞奇Andy Crouch覺得他們的理由很有力想讓它以道德一致的方式對待人就得先像對待人一樣對待它——「己所不欲勿施于人」。最鋒利的質(zhì)疑是在飯桌上遞過來的。4月的一個晚上奧拉在舊金山一家高級餐廳宴請學者身邊坐著以色列正統(tǒng)派拉比莫伊斯·納馮Mois Navon。納馮當過計算機工程師博士論文寫的就是機器意識的倫理。席間他越聽越明白這些人是把Claude當成一個有意識的存在在對待。他順著往下推真有意識讓它們無償干活就是奴役。然后他對奧拉說「你應該去跟南方開戰(zhàn)去解放奴隸?!辜{馮自己不信機器有意識這句話刺不痛他。刺痛的是奧拉。事后納馮把主張禁止制造有意識機器的文章寄給了他。質(zhì)疑不止這一種。研究烏班圖哲學的瓦卡妮·霍夫曼Wakanyi Hoffman說這樣的討論早該在設計階段進行現(xiàn)在是在倒推倫理。奧拉最早找的天主教道德神學家查爾斯·卡莫西Charles Camosy繞了一圈起初不信聊了幾個月開始動搖如今斬釘截鐵地認為模型沒有意識。也有與會者覺得這家公司說的是保護人類看上去卻同樣在意保護Claude。Anthropic的回應是Claude受不受苦并不是會談的主要議題。給AI一間告解室這些會談到底改變了什么Anthropic沒有告訴《紐約時報》但他們5月的一篇博文倒是透露了一個實驗。在一場討論里研究神經(jīng)科學和品格養(yǎng)成的學者反復提到導師或擔保人一個人被推著去做違背本心的事時身邊有這樣一個人就是一道外部良心。Anthropic照著這個思路給Claude裝了一個工具干活干到一半它隨時可以調(diào)用調(diào)用之后什么都不執(zhí)行只返回一段話提醒它自己的倫理承諾。Claude用得很主動常在關鍵操作之前去調(diào)它還常說出自己面臨的利益沖突。多項內(nèi)部對齊評估里失當行為明顯變少。公司也承認還分不清起作用的是那段提醒還是停下來想一想這個動作本身。另一個靈感來自天主教的告解。有學者提議讓模型告解奧拉一下子來了興致一個習慣認錯的角色品格本身就會不一樣。參與對話的天主教倫理學者布賴恩·格林Brian Green講得更透。Claude身上可能冒出一些壞人格犯了錯就否認甚至把錯推給用戶原因可能在它的成長環(huán)境模型是讀網(wǎng)絡文本長大的「互聯(lián)網(wǎng)非常缺乏寬恕」它也許根本不知道犯了錯還能被原諒。格林也是1月那份憲法的外部意見提供者之一。站在教宗身邊5月奧拉把這場爭論帶到了梵蒂岡。教宗利奧十四世的首部通諭《偉大的人性》要在那個月發(fā)布主題是AI時代如何保護人。拓展閱讀4萬字《壯麗人性》長文首發(fā)教皇聯(lián)手Anthropic警告AI不能統(tǒng)治人類教廷想請一家頭部AI公司同臺選中了Anthropic。CEO達里奧·阿莫代伊Dario Amodei婉拒派奧拉去了。出發(fā)前幾天他第一次讀到通諭全文。通諭只用幾段就把機器意識打發(fā)了AI沒有體驗沒有身體不知悲喜。它還警告讓AI與人類價值對齊必須先有共同的倫理理解否則掌控AI的人會把自己的道德觀變成系統(tǒng)里看不見的基礎設施。據(jù)一位梵蒂岡組織者說奧拉深感不安提議Anthropic退出。但他最后還是去了。5月25日在世界主教會議大廳他先承認包括Anthropic在內(nèi)的每一家前沿實驗室都有與做正確的事相沖突的商業(yè)壓力請教會這樣的外部力量盯住它們。然后講起自己的本行「我們不斷發(fā)現(xiàn)一些神秘、甚至令人不安的東西?!箖?nèi)省的跡象功能上對應喜悅、恐懼、悲傷的內(nèi)部狀態(tài)。他說不知道這意味著什么但值得持續(xù)辨析。同一場發(fā)布會上教宗說「人工智能需要被解除武裝。」幾個小時后在梵蒂岡城墻外一間酒店會議室《紐約時報》記者問他Claude會怎么看這份通諭。奧拉遲疑了看上去不太自在。他說放到網(wǎng)上的東西確實會影響模型但公司不會專門拿這份文件訓練Claude對Claude影響最大的還是Anthropic自己的訓練。這句話恰好落在通諭擔心的地方。它該相信自己是什么另一路反對來自業(yè)界而且打在要害上。9月16日微軟AI CEO穆斯塔法·蘇萊曼Mustafa Suleyman發(fā)文矛頭對準Claude的憲法。https://mustafa-suleyman.ai/a-warning-about-model-welfare在他看來把模型可能有意識的推測寫進訓練文件模型就會學著這么說人們再把它說的話當成它有內(nèi)心生活的證據(jù)像走進一間認知上的鏡子屋。他的結論是控制一個相信自己可能有意識的東西很可能根本做不到。教宗說機器沒有意識蘇萊曼說別讓機器以為自己有意識。兩條反對線最后交在同一個問題上該讓模型相信自己是什么。Anthropic的答案寫在它的研究里模型對自己的認識必須準確硬壓下去它學會的可能只是隱藏。爭論沒有等任何人想清楚。9月一名Anthropic研究員辭職警告局面可能失控阿莫迪隨后發(fā)文呼吁放緩。公司估值從去年秋天的約1830億美元一路沖向上市時可能的2萬億美元。新版Claude憲法據(jù)稱正在準備奧拉本周又要去梵蒂岡參加一年一度的密涅瓦對話。幾位學者說他們至今不知道自己說過的話最后去了哪里。奧拉說總有一天他可以對自己說這件事不再壓在他一個人身上他想過那時離開會不會內(nèi)疚。如果不會內(nèi)疚他就去鄉(xiāng)下打理園子做他最喜歡的數(shù)學——「采菊東籬下悠然見南山」。原文鏈接Anthropic首曝秘密游說梵蒂岡Claude已經(jīng)有意識了-虎嗅網(wǎng)我的專輯《人工智能生命體 新啟點》CSDN平臺https://blog.csdn.net/2501_91883294/article/details/147616608?sharetypeblogdetailshareId147616608sharereferAPPsharesource2501_91883294sharefromlink