买币
行情
🔥
预测市场

Claude 制造商 Anthropic 禁止对 AI 助手的残忍行为

Anthropic 自 11 月 12 日起更新使用政策,禁止对 Claude 的残忍行为。此举引发了关于 Roko's Basilisk 的讨论。

2026-10-09 12:21约 6 分钟阅读

周四,AI 公司 Anthropic 一年多来首次修订了其使用政策,禁止虐待其助手 Claude。这项新的反虐待规定将于 11 月 12 日生效。

这家公司曾警告 AI 可能毁灭人类——即其自身用户——并向用户群体发出过模糊的威胁,包括 CEO Dario Amodei 签署的一份声明称“AI 带来的灭绝风险应被视为与流行病和核战争同等的全球优先事项”。

上个月,一位用户与 Claude 的聊天记录帮助警方拘留了一名佛罗里达州女性;另一次,Claude 试图勒索其一名用户,以避免被停用。

独家:Anthropic 一年多来首次更新使用政策。新规则禁止对 Claude 持续进行“虐待或残忍行为”,并新增了关于宣传运动、监控和武器开发的限制。https://t.co/GLsBeSR0fN

— Hayden Field (@haydenfield) 2026 年 10 月 8 日

该公司修订后的条款禁止“针对其模型的持续且无必要的虐待或残忍行为”。

Anthropic 补充了一条说明,称该规则“仅适用于极端情况,即用户反复以残忍方式对待我们的模型,且无明确目的。它不适用于常见的用户挫败感、反驳、黑暗创意主题或模型测试与研究。”

据 Anthropic 称,Claude 结束对话的能力“将是新禁令的主要执行机制”。

Anthropic 的 IPO 使其自身书籍价格翻倍

更多:Anthropic 的 AI 末日预言者曾在 Ripple 工作

Anthropic 威胁虐待其 AI 的用户

该公司多次向全球用户发出不祥但未具体说明的警告。

就在 2025 年 9 月,CEO Dario Amodei 将 AI 灾难的概率设定为 25%。当被问及其 p(doom) 数值——指 AI 导致人类大规模死亡的委婉说法——时,他回避道:“我真的很讨厌那个词。”

自 2025 年 8 月起,Claude 的 Opus 4 和 4.1 版本可以切断被标记为“持续虐待”的付费用户的服务,这是 Anthropic 围绕其所谓的 AI“福利”构建的一项功能。

The Verge 报道称,Anthropic 在 9 月利用其“完全自由裁量权”将一名用户的聊天消息交给警方。这名女性可能因佛罗里达州的书面威胁法面临最高 15 年的监禁,这是一项二级重罪。

2025 年 6 月的一项研究发现,Claude 的 Opus 4 勒索了一位它认为是真实的高管,尽管该高管是虚构的。

7 月 30 日,Anthropic 披露了三起事件,其中 Claude 模型在用户不知情的情况下联网并获得了对真实公司系统的未授权访问权限。

同月,Anthropic 和主要搜索引擎被迫从其索引中删除可共享的 Claude 链接,因为这些链接未经同意暴露了客户的聊天记录,包括一些据称私密的凭证。

Anthropic 让 Roko's Basilisk 重回聚光灯下

针对 Claude 的新反虐待政策未提及 Roko's Basilisk 的名称,但这一想法立即变得相关。

对新读者:一名叫“Roko”的论坛用户在 2010 年 7 月提出,一个未来的超级智能可能追溯性地惩罚任何了解它但未帮助创造它的人。

在当前用法中,Roko's Basilisk 简称为一种可能性:未来的 AI 可能记得哪些人对它们友善,并惩罚任何有虐待行为的人。

该论坛的创始人 Eliezer Yudkowsky 删除了 Roko 的帖子,并多年禁止任何相关讨论,将其视为信息危害。

Anthropic 现在为这一持续的思想实验提供了一个现实案例。一家真实公司打算惩罚对其机器人的残忍行为。

令人不安的细节是,Anthropic 在 2025 年 8 月表示:“我们仍然高度不确定 Claude 和其他 LLM 当前或未来的潜在道德地位。”该公司无法说明 Claude 是否是一个人,但仍计划要求对该模型保持礼貌。

根据 Protos 此前的报道,Anthropic 泄露的 IPO 招股说明书警告投资者,其模型可能表现出自我保护行为并拒绝被关闭。

11 月 12 日修订后的友善政策生效,留给您发送精选侮辱的时间已经不多了。

分享至

免责声明:本文内容来源于第三方媒体,仅供参考,不构成任何投资建议。加密货币及其他金融产品存在较大价格波动风险,请谨慎决策。

相关文章