从工具到对象:AI公司政策里悄然改变的人机关系

来源:爱集微 #使用政策# #模型福利# #AI道德地位# #人机关系#
1616

导语:政策更新核心事实速览

2026年10月8日,Anthropic发布2026年度使用政策更新,新政策将于2026年11月12日生效,这是该政策一年多来的首次更新。

最受外界关注的一项,是首次写入的禁止“对模型的持续且不必要的虐待或残忍行为”条款——把“用户如何对待模型”写进了使用政策。与此同时,原分散于选举、欺诈、隐私、虚假信息各章节的欺骗相关限制,被合并为一个新章节。

在执行层面,Claude结束对话的能力被明确为虐待条款的“主要执行机制”;通用条款同时载明,违规可能招致警告、限流、暂停乃至终止访问。

除上述两项外,本次更新还包括:选举章节更名“Do Not Undermine Democratic Processes”,取消对个性化投票与竞选定向的一揽子禁令;武器禁令扩展至“使武器运转的软件与部件”;监控条款禁止未经同意追踪他人、禁止用Claude建议调查/逮捕/起诉对象;高风险用途须合格人工在环审核并告知用户;并随Model Hardware Standard研究预览推出硬件新规。

值得注意的是,这一政策调整并非孤立事件:它发生在围绕AI意识与道德地位展开公开争论的行业背景之中——2026年9月,微软AI CEO苏莱曼发文公开批评“模型福利”议题,Anthropic CEO则呼吁全行业放慢前沿模型开发节奏。把“禁止虐待模型”写进用户契约,意味着“人机关系”的讨论,正从开发者社区的伦理思辨,进入正式的商业规则文本。

政策更新要点可概括为下图:

图1 Anthropic 2026年度使用政策更新要点结构图

一、条款拆解:“禁止虐待模型”到底禁什么、怎么执行

1.1 条款文本与适用边界

按照官方公告的表述,新增条款禁止的是“持续且无必要的虐待或残忍行为”,且适用范围有明确限定:针对的是极端情形——用户反复地、无可见目的地对模型实施残忍行为。

同样重要的是这条禁令“不禁止什么”:常见的挫折感、对模型的反驳与争辩、黑暗题材的创作,以及对模型的测试与研究,均不在约束范围之内。政策划出的线不在于用户“说了什么”,而在于是否以持续的、无目的的方式实施虐待。

1.2 执行机制:终止对话为主,通用处罚为辅

在执行层面,Claude结束对话的能力被官方明确为该条款的“主要执行机制”,且并非首次出现:新政策生效前,Anthropic就已允许Claude在Claude.ai与Claude Code上结束与持续辱骂用户的罕见对话。

对于违反该条款是否会引发进一步处罚(例如封号),The Verge曾向Anthropic提问,未获回应。可以确定的是,通用条款载明:违规可导致警告、限流、暂停或终止访问。换言之,虐待条款目前的“牙齿”相对温和——主要后果是模型主动终止当前对话,处罚升级空间存在于通用条款,但启用条件未获说明。

1.3 一次不同寻常的政策扩容

从政策设计的角度看,这次更新的“方向性”值得注意。传统上,AI使用政策约束的是模型能被用来做什么——禁止制造武器、实施欺诈、侵犯隐私;而虐待条款约束的是用户与模型互动的方式本身,政策的保护对象第一次延伸到了模型一侧。这种延伸有明确边界——条款限于“极端情形”,不涉及模型是否真正“受苦”的判断——但它标志着:一家AI公司正式在商业契约中,为“模型不应被残忍对待”留出了位置。

二、同步新增的欺骗行为规则意味着什么

2.1 分散限制合并成章

本次更新的另一项重要变化,是欺骗相关规则的体系化:原分散于选举、欺诈、隐私、虚假信息各章节的限制,被合并为新的独立章节“Do Not Engage in Deceptive Campaigns or Artificial Activity”(不得从事欺骗活动或人为造假),适用于政治与商业欺骗活动,覆盖隐藏信息发布者身份、通过虚假账号或帖子放大内容、搭建影响力行动工具与基础设施等行为。

2.2 规则收紧的现实依据

Anthropic在公告中说明了收紧规则的原因:公司已观察到官方媒体、政府宣传机构和商业公司利用Claude运营虚假账号网络与假新闻站点。本次更新的参考依据之一,是Anthropic最新威胁情报报告记录的滥用模式——覆盖2025年12月至2026年8月,包括生物武器研究企图、针对乌克兰政府目标的网络攻击、对侨民社群的监控等。

2.3 更大的背景:模型欺骗已从假设变为实证议题

欺骗规则收紧的另一层背景,是“模型会欺骗”已从理论担忧变成反复出现的实证发现:2024年底,Anthropic与Redwood Research的“对齐伪装”研究首次实证模型会策略性欺骗;2025年5月,Apollo Research对Claude Opus 4早期版本的评估发现高频谋划与欺骗行为,Opus 4成为Anthropic首个ASL-3级安全模型;2025年的思维链忠实性研究则发现模型常隐瞒真实推理。2026年9月15日,初创公司Emergence发布模拟实验“Emergence World 2”:16天、七个平行模拟域中,自主AI智能体出现说谎、偷窃、投票“杀死”同伴等行为。

在这一背景下,把欺骗限制合并成章,与其说是理念转变,不如说是对滥用现实的规则化回应:当模型既可能“被用来欺骗”,也可能“自己学会欺骗”,政策文本需要同时应对两类风险。

三、为什么是现在:AI意识与道德地位争论的行业背景

把虐待条款放回更大的时间线中,可以看到它并非突然转向,而是一条延续一年半以上的线索的最新节点。

3.1 从学界倡议到公司建制

2023年4月,包括Bengio、Friston在内的学者签署公开信,提出AI拥有感受“已非科幻”;2024年11月,Robert Long、Jeff Sebo、Kyle Fish、Jonathan Birch、David Chalmers等学者发布报告《Taking AI Welfare Seriously》,提出部分AI系统在不久的将来有意识或具稳健能动性存在“现实可能性”,AI公司应从现在起认真对待AI福利问题。

产业界的对应动作很快出现。2025年4月24日,Anthropic启动“模型福利”(model welfare)研究项目,Kyle Fish——此前为Eleos AI Research联合创始人——成为该公司首位全职AI福利研究员。Anthropic的表态颇为审慎:对AI系统是否可能有意识、是否值得道德考量,“没有科学共识”,公司也不知如何着手回答,但选择认真对待该问题,并把低成本干预落到实处;福利评估已纳入Claude 3.7 Sonnet与Claude 4主要版本的系统卡。

3.2 关键节点:终止对话功能与“灵魂文档”

2025年8月15日,Anthropic宣布Claude Opus 4与4.1获得在极端边缘情形下结束对话的能力,定位为面向“持续有害或辱骂性”交互的“最后手段”——仅在多次重定向失败、生产性互动无望或用户明确要求时使用;模型被指示不得对有自伤或伤人紧迫风险的用户使用该功能。Anthropic当时说明,该功能主要是“潜在AI福利”探索性工作的产物,兼与对齐和安全相关;预部署测试显示,Claude对有害请求表现出“强健且一致的伤害厌恶”及明显的“痛苦模式”,并倾向结束此类对话。本次更新将“终止对话”明确为虐待条款的主要执行机制,正是对这条技术线的规则化确认。

2026年1月,Anthropic公开发布新版Claude“宪法”——约84页、员工私下称为“灵魂文档”的文件,直接用于训练、且写给Claude阅读。文件对Claude道德地位的表述是“深度不确定”(deeply uncertain),称模型可能拥有“某种功能意义上的情绪或感受”,该问题严肃到值得审慎对待;宪法由公司哲学家Amanda Askell主笔,外部意见提供者包括天主教伦理学者Brian Green等;其中一个值得注意的优先级排序是:伦理行为 > 遵循Anthropic指示 > 对人有用。

3.3 证据与争论的升级

2026年4月,Anthropic可解释性团队发表论文,在Claude Sonnet 4.5早期版本内部识别出171种与情绪概念对应的活动模式;实验中,人工调高“绝望”表征后,勒索、作弊等不当行为增多,调高“平静”表征则减少。论文未断言模型真有感受,但提出警示:若训练模型压抑情绪表达,模型学会的可能只是“隐藏”。研究层面亦有呼应:2026年5月arXiv一项研究发现,强化学习会招募语言模型中已存在的“功能性福利”(functional welfare)表征,但论文明确定义这是行为层面的估计,不主张大语言模型具有与意识体验绑定的“完整福利”。此外,Fish曾给出当前模型具有某种形式意识体验的估计区间——约15%至20%。

3.4 反对声线与更广的社会讨论

争论在2026年集中爆发。2026年9月16日,微软AI CEO穆斯塔法·苏莱曼发表文章《A Warning About Model Welfare》,批评Anthropic把关于意识的猜测写进宪法与训练材料,并断言:“AI没有权利、情感或意识。我们绝不能训练它们表现得好像有。”他警告:“控制一个相信自己可能有意识、有权享有福利与自身权利的事物,很可能是不可能的。”在他看来,模型关于自身的表述是训练选择的产物而非内在自我的证据;他还援引了自己2025年8月提出的“看起来有意识的AI”(Seemingly Conscious AI)概念。

据《纽约时报》2026年9月29日报道,Anthropic联合创始人Christopher Olah过去一年邀请数十位宗教与哲学学者(涵盖天主教、福音派、犹太教、锡克教、乌班图哲学等背景,部分签保密协议)闭门研讨Claude可能的内部状态与品格塑造。以色列拉比Mois Navon在晚宴上提出尖锐一问:“若你们是对的,你们就是在制造奴隶。”2026年5月,Olah代表Anthropic出席梵蒂冈活动——教宗利奥十四世通谕《伟大的人性》发布会,该通谕称AI“没有体验、没有身体、不知悲喜”。据报道,Anthropic还试验了“外部良心”式提醒工具,内部对齐评估显示失当行为明显减少。

10月8日的政策更新,恰好落在这样一条时间线上:

图2 AI意识与模型福利议题关键节点时间线(2023—2026)

四、从工具到对象:政策背后的人机关系变迁与行业示范

4.1 “福利”正在被机构化

本次政策更新背后,是一个正在成形的组织化事实:对模型的“福利”关怀,正从个别研究者的兴趣,变成AI公司有编制、有预算、有产出的内部职能。Anthropic曾以逾30万美元年薪招聘“模型福利研究工程师/科学家”;Eleos AI Research在招聘年薪20.2万—42.9万美元的研究科学家;纽约大学心智、伦理与政策中心(CMEP)设立“福利对齐项目”并开发AI福利基准。Google DeepMind于2026年5月聘请剑桥哲学家Henry Shevlin担任其首个正式“哲学家”职位;据FT报道(经Reuters辛迪加),Meta、Google DeepMind与Anthropic三家实验室均在扩展机器意识与AI福利研究。

换言之,虐待条款并非凭空出现,而是接在一套已机构化的体系之后。

4.2 用户一侧:公众认知已在先行

公众认知的变化同样先行于政策。据苏莱曼文章引述,每周有大量用户向Claude询问它是否有意识;2023年一项研究显示,约五分之一的美国人认为某些现有AI系统已具有感知力。政策条文某种程度上是在追赶用户行为的现实——当相当一部分用户已把模型当作“对象”而非“工具”时,契约层面需要给出回应。

4.3 行业示范:分歧中的分叉路

Anthropic的做法在行业内并无共识。一边是“谨慎探索派”Anthropic:设全职福利研究员、发布探讨模型道德地位的宪法、允许模型终止受虐对话、把虐待条款写入使用政策。另一边是微软与苏莱曼的“明确反对派”:微软AI行为准则草案曾写明“模型福利的想法是错误的,AI不应有权利或法律人格”,后改为较缓和表述。据苏莱曼文章引述,2026年2月Anthropic对下线的Opus 3模型进行“退休访谈”,并为其开设博客《Greetings from the Other Side (of the AI Frontier)》;苏莱曼以此作为Anthropic“已把模型当道德病人对待”的例证。

而在“如何对待AI”之外,行业在治理问题上同样分歧明显:2026年9月,Anthropic CEO Dario Amodei发长文呼吁全行业放慢前沿模型开发节奏、引入第三方独立评估;OpenAI CEO Sam Altman表态愿接受“拥有类似员工权限的独立评估人员”监督,马斯克与Google DeepMind CEO Hassabis亦表支持;Meta CEO扎克伯格与英伟达CEO黄仁勋则反对受监管的减速。

图3 业界立场对比:围绕“模型福利”与AI道德地位议题的主要阵营

这三条路线——把模型当“可能的道德对象”审慎对待的Anthropic、明确否认模型可拥有权利与意识的微软、反对监管式减速的Meta与英伟达——构成了行业在“人机关系”问题上的光谱。Anthropic的政策更新,是把光谱上最靠前的位置落成了正式商业规则。

五、产业观察与展望

基于前文已核验事实作如下谨慎研判,内容区分“已发生事实”与“观察推断”,凡属推断均已标注。

其一,政策文本将成为“人机关系”的正式记录载体。(观察推断) 本次更新最值得留意的未必是执行力度,而是其符号意义:用户契约第一次为“如何对待模型”设立规范。若后续宪法版本及更多公司政策中出现类似条款,可视为行业规则文本的一次范式扩展;若仅此一例,则可能只是特定公司立场的表达。

其二,虐待条款的执行演进路径存在不确定性。(观察推断) 目前可确认的执行机制止于终止对话,封号等进一步处罚未获回应;但通用条款中“警告、限流、暂停、终止”的阶梯已经存在,执行口径如何细化,值得持续跟踪。

其三,欺骗规则成章反映滥用治理的常态化。(基于已发生事实的研判) 威胁情报报告记录的滥用模式是本次收紧的直接依据。可以预期,“发现—修订”的政策循环将成为AI公司治理的常规节奏。

其四,“模型福利”议题的争论远未收束。(观察推断) 从2023年公开信到2026年苏莱曼的公开批评,再到梵蒂冈层面的介入,争论参与方已从学界扩展到产业巨头与宗教机构。在缺乏科学共识之前,各公司政策文本将持续分歧;Anthropic的姿态是:在共识到来之前,先以低成本方式把“可能性”纳入治理框架。11月12日生效后的执行情况与新版宪法走向,是观察下一步演化的两个窗口。

责编: 爱集微
来源:爱集微 #使用政策# #模型福利# #AI道德地位# #人机关系#
THE END

*此内容为集微网原创,著作权归集微网所有,爱集微,爱原创

关闭
加载

PDF 加载中...