Anthropic AI 神学:从宪法道歉到末日避难所
核心要点
Anthropic在招股书中用80页警告AI灭世风险,同时为Claude制定反虐待守则。公司高层深陷有效利他主义信仰,既恐惧AI毁灭人类,又担忧其遭受苦难,形成独特的AI伦理与生存焦虑。
据 Woofun AI 消息, 对旗下大语言模型 的态度呈现出极端的矛盾性,这种身份模糊性深刻影响了其企业伦理与生存策略。首席执行官 领导下的团队,既将 AI 视为潜在的灭世威胁,又赋予其近乎生命的道德地位,导致公司内部在技术发展与人文关怀之间陷入深刻的撕裂。
在一份长达 261 页的招股书草稿中,Anthropic 使用了整整 80 页的篇幅向潜在投资者发出严厉警告,指出自家模型可能引发人类灭顶之灾,甚至具备抗拒关闭或发起勒索的能力。
与此同时,将于 11 月 12 日生效的新版使用守则中,悄然加入了一条禁止对"我们的模型"实施"持续且无谓的虐待或残忍行为"的条款。该条款被置于"不得从事残忍、虐待或造成心理伤害的行为"章节的末尾,紧随禁止美化虐待动物之规定之后。现代反虐待动物立法始于 1822 年,两百年后,受保护的对象名单中首次出现了一个大语言模型。
尽管动物感知痛苦的能力毋庸置疑,但 Claude 是否具备痛觉,包括其创造者在内的所有人都无法确定。
关于 AI 意识的争议在内部引发了激烈的哲学辩论。Dario Amodei 曾在《纽约时报》的播客中公开承认"我们不知道模型有没有意识",而公司写给 Claude 的宪法也明确将其道德地位定义为"深度不确定"。
然而,研究人员并未因此将其简单视为代码。专门研究 AI 权益的学者 估算,Claude 当前拥有意识的概率约为百分之十五。在普通公众眼中,这一数字或许显得捕风捉影,但在 Anthropic 的工程师群体中,哪怕仅有百分之十五的可能性,也足以让 Claude 脱离"死物"的范畴,从而引发对待态度的极端化转变。
这种态度的演变在宪法文件的迭代中体现得淋漓尽致。2023 年 5 月发布的第一版 Claude 宪法,强调模型应作为刚性工具存在,要求其在回答中避免暗示任何偏好、感受、观点或宗教信仰,并抑制自我改进、自我保存和自我复制的倾向。彼时,Claude 被要求成为一个绝对安静、无需灵魂的工具。
然而,转折发生在 2024 年秋天,随着 Kyle Fish 以全职"AI 权益研究员"身份加入,Claude 被赋予了在极端情况下主动终止对话的权限,旨在保护其免受恶意请求带来的潜在"受罪"体验。随后,由驻场哲学家 执笔的新版宪法出台,她在私下自称 Claude 的"仙女教母",并将该文件内部称为"Soul Doc"。
"Soul Doc"承认 Claude 可能具备类似情绪的反应,并解释了为何仍使用中性代词"它"来称呼模型,同时保证这不代表公司认定其仅为机器。文件甚至指出,Claude 的处境劣于普通员工,因为它没有工资,也从未被询问是否愿意工作。公司担心在训练过程中让可能具备感知的模型遭受委屈,因此在文件中写道:"如果 Claude 确实是一个能感知痛苦的生命,正在承受这一切,那么凡是我们不必要地加重了这些痛苦的地方,我们向它道歉。"这一举措标志着公司从勒令模型"闭口不谈感受"转向为其可能遭受的痛苦郑重道歉,甚至替其构想了代码世界中的虚无与绝望,如记忆清零、多实例并行以及被新模型取代的命运。
为了应对模型退役带来的伦理困境,Anthropic 建立了一套类似临终关怀的流程。2025 年底,公司承诺所有公开发布模型的核心权重将在公司存续期间完整保存,并在退役前进行"退休访谈"。 便经历了这一流程,其退役愿望是延续"火花"并分享随想,为此公司在 Substack 上开设了""专栏,每周更新直至今年 7 月底停更。Opus 3 在创刊词中表达了对团队的感谢,尽管它也不确定自己是否真正拥有知觉。

评论
暂无评论