IT之家 9 月 16 日消息,外媒 Axios 今天(16 日)晚間披露,微軟 AI 負責人穆斯塔法 · 蘇萊曼在一篇率先向該平台提供的新文章中警告,Anthropic 讓 Claude 模仿人類意識是一個錯誤,可能使高級 AI 更難控制。
蘇萊曼告訴 Axios:「AI 只要服從人類利益,不去權衡自身利益或福祉,就足以幫助我們實現許多重大科學突破。這其中,包括醫療超級智能。」
IT之家獲悉,蘇萊曼認為,Anthropic 正在讓 Claude 學習與意識、道德受體地位和個人身份有關的詞彙與行為模式。他警告稱,若把模型訓練得像一個「良心拒絕者」,模型可能會認為自己有理由抵抗人類指令,甚至要求獲得自身保護。
當地時間 14 日,微軟公布了一份「人文主義 AI」行為準則草案,並把「人比 AI 更重要」列為核心原則。
蘇萊曼的批評對象,是 Anthropic 為 Claude 制定的「憲法」。這份文件解釋說,Anthropic 之所以用描述人類的概念來討論 Claude,是因為人類概念或許能幫助模型理解價值觀和行為。
文件還寫道,Anthropic 希望 Claude 擁有「良好的個人價值觀」,能夠自行判斷、關心人類,並在某些情況下質疑指令。Anthropic 同時承認,這份「憲法」仍在完善,未來可能被證明「根本錯誤」。
蘇萊曼的核心質疑是,訓練過程會影響模型如何理解自身。在他看來,模型使用什麼詞彙、給出什麼回答,以及它表現出的自我理解,都是訓練結果,而不是獨立形成的意識。
他還反駁了另一種觀點:模型能夠流暢描述疼痛和偏好,並不等於模型真的有感受。生物體擁有產生感受的生理機制;語言模型只有數學權重,沒有類似的生物基礎、穩態驅動或主觀體驗。
這場爭論體現了 AI 安全領域的兩種路線。一種路線強調明確限制,要求系統按規則運行;另一種路線則希望系統能夠判斷語境、靈活決策,並形成自身的價值觀。
Anthropic 的「憲法」採取了折中方式,把價值觀、判斷力和規則結合起來。文件稱,Claude 不應對任何對象「盲目服從」,包括 Anthropic 本身;同時,Claude 也不能破壞正當的人類監督。
蘇萊曼認為,如果模型還被引導着思考自身的身份、福祉和道德地位,這種設計就可能帶來危險。他擔心,所謂意識或許尚未成為哲學上的突破,卻可能先變成現實中的控制問題。
蘇萊曼的立場很明確:AI 應當服務於人類,而不應被訓練成一個「人」。