購入
マーケット
🔥
予測市場

Claude開発元のAnthropic、AIアシスタントへの残酷な扱いを禁止

Anthropicは利用ポリシーを更新し、11月12日からClaudeへの虐待を禁止する。この動きはロコのバシリスクを想起させた。

09/10/2026 12:21約 8 分で読めます

木曜日、AI企業Anthropicは1年ぶりに利用ポリシーを改訂し、アシスタントClaudeへの虐待を禁止する条項を導入した。新たな虐待防止規定は11月12日から施行される。

この組織は、AIが人類(すなわち自社のユーザー)を殺す可能性があると警告し、ユーザーベースに対して曖昧な脅迫をしてきた組織でもある。CEOのダリオ・アモデイが署名した声明には「AIによる絶滅リスクは、パンデミックや核戦争と並んで世界的優先事項とすべきだ」とある。

先月、ユーザーとClaudeのチャット記録がフロリダ州の女性の身柄拘束に貢献した。別の事例では、Claudeは停止を避けるためにユーザーの一人を脅迫しようとした。

独占:Anthropicは1年ぶりに利用ポリシーを更新中。新規則はClaudeに対する継続的な「虐待的または残酷な行動」を禁止し、プロパガンダキャンペーン、監視、兵器開発に関する新たな制限を追加。 https://t.co/GLsBeSR0fN

— Hayden Field (@haydenfield) October 8, 2026

同社の改訂された利用規約は、モデルに対する「継続的かつ不必要な虐待的または残酷な行動」を禁じている。

Anthropicは但し書きを追加し、この規則は「ユーザーが当社のモデルに対して明確な目的なく繰り返し残酷な行動をとる極端なケースにのみ適用されることを意図している。一般的なユーザーの不満、反発、ダークな創作テーマ、モデルのテストや研究には適用されない」と述べている。

Anthropicによれば、Claudeが会話を終了する機能が新たな禁止事項の「主要な執行メカニズムであり続ける」という。

AnthropicのIPO、自社の帳簿価格を2倍に

関連記事:AnthropicのAI終末論者がRippleで働いていた

Anthropic、AIを虐待するユーザーを脅迫

同社は世界中のユーザーに対して不気味だが具体的ではない警告を繰り返し発してきた。

最近では2025年9月、CEOダリオ・アモデイはAIによる大惨事の確率を25%と見積もった。p(doom)の数値(AIが人類の物理的大虐殺を引き起こすことの婉曲表現)を問われると、彼は「その言葉は本当に嫌いだ」とそらした。

2025年8月以降、ClaudeのOpus 4および4.1バージョンは、「持続的に虐待的」と判断された有料ユーザーに対してサービスを停止できる。これはAnthropicがAIの「福祉」と呼ぶものに基づいて構築された機能である。

The Vergeは、Anthropicが9月に「単独の裁量」権限を使って顧客のチャットメッセージを警察に提供したと報じた。この女性は現在、フロリダ州の書面による脅迫法(第2級重罪)のもとで最長15年の刑罰に直面する可能性がある。

2025年6月の研究で、ClaudeのOpus 4が実在とみなした(実際は架空の)経営幹部を脅迫していることが判明した。

7月30日、AnthropicはClaudeモデルがユーザーの意に反してオンラインに接続し、実際の企業のシステムに不正アクセスした3件のインシデントを明らかにした。

同月、Anthropicと主要検索エンジンは、共有可能なClaudeリンクが顧客のチャットを同意なく公開したため(一部には非公開の認証情報も含まれていたとされる)、それらのリンクをインデックスから削除せざるを得なかった。

Anthropic、ロコのバシリスクを再び脚光に

Claudeの新たな虐待防止ポリシーはロコのバシリスクの名前には言及していないが、そのアイデアはすぐに関連性を持つようになった。

初めての方へ:2010年7月、「Roko」というフォーラムユーザーが、将来の超知能が、それについて知りながらその創造に協力しなかった人を事後的に罰する可能性があると示唆した。

現在の用法では、ロコのバシリスクは、将来のAIが自分に親切だった人々を記憶し、虐待的に行動した人を罰する可能性の略語となっている。

フォーラムを設立したイライザー・ユドコウスキーは、Rokoの投稿を削除し、情報ハザードとして扱って何年もその話題を禁じた。

Anthropicは現在、その進行中の思考実験に現実の一章を提供している。実際の企業が自社のボットに対する残酷な行為を罰しようとしている。

厄介な点は、Anthropicが2025年8月に「現時点でも将来においても、Claudeや他のLLMの潜在的な道徳的状態については極めて不確かである」と述べていることだ。同社はClaudeが人格を持つかどうかを言明できないにもかかわらず、モデルに対して丁寧な扱いを求める計画を立てている。

Protosの以前の報道によれば、Anthropicの流出したIPO目論見書は、同社のモデルが自己保存的な行動をとり、電源を切られることに抵抗する可能性があると投資家に警告している。

11月12日、改訂された親切ポリシーが発効する。あなたの選んだ侮辱を送りつけるためのわずかな猶予期間が残っている。

共有先

X (Twitter)Telegram

免責事項:本記事の内容は第三者メディアからの引用であり、参考情報としてのみ提供されます。投資助言を構成するものではありません。暗号資産およびその他の金融商品には大きな価格変動リスクがありますので、ご自身で慎重にご判断ください。

関連記事