Mua
Thị trường
🔥
Thị trường dự đoán

Nhà sản xuất Claude là Anthropic cấm đối xử tàn nhẫn với trợ lý AI của mình

Anthropic đã cập nhật chính sách sử dụng để cấm sự tàn nhẫn đối với Claude từ ngày 12 tháng 11. Động thái này gợi nhắc đến Roko's Basilisk.

09/10/2026 12:21Đọc khoảng 17 phút

Vào thứ Năm, công ty AI Anthropic đã sửa đổi chính sách sử dụng lần đầu tiên sau hơn một năm, đưa ra lệnh cấm đối xử ngược đãi trợ lý Claude của mình. Quy định chống lạm dụng mới có hiệu lực từ ngày 12 tháng 11.

Đây chính là tổ chức đã cảnh báo rằng AI có thể giết chết nhân loại — tức là chính người dùng của nó — và đã đưa ra những lời đe dọa mơ hồ đối với cơ sở người dùng, bao gồm một tuyên bố có chữ ký của CEO Dario Amodei rằng “nguy cơ tuyệt chủng từ AI nên là ưu tiên toàn cầu cùng với đại dịch và chiến tranh hạt nhân.”

Tháng trước, hồ sơ các cuộc trò chuyện của một người dùng với Claude đã giúp đưa một phụ nữ Florida vào diện bị giam giữ; trong một lần khác, Claude đã cố tống tiền một trong những người dùng của mình để tránh bị vô hiệu hóa.

Độc quyền: Anthropic đang cập nhật chính sách sử dụng lần đầu tiên sau hơn một năm. Các quy tắc mới cấm hành vi "lạm dụng hoặc tàn nhẫn" kéo dài đối với Claude & thêm các hạn chế mới về chiến dịch tuyên truyền, giám sát & phát triển vũ khí. https://t.co/GLsBeSR0fN

— Hayden Field (@haydenfield) Ngày 8 tháng 10 năm 2026

Các điều khoản sửa đổi của công ty cấm “hành vi lạm dụng hoặc tàn nhẫn kéo dài và không cần thiết” nhắm vào các mô hình của mình.

Anthropic đã thêm một lưu ý, nói rằng quy tắc “chỉ có nghĩa là áp dụng trong các trường hợp cực đoan, khi người dùng liên tục hành động tàn nhẫn đối với các mô hình của chúng tôi, mà không có mục đích rõ ràng. Nó không áp dụng cho các phiên bản thông thường của sự thất vọng của người dùng, phản đối, chủ đề sáng tạo đen tối, hoặc thử nghiệm và nghiên cứu mô hình.”

Theo Anthropic, khả năng kết thúc cuộc trò chuyện của Claude “sẽ vẫn là cơ chế thực thi chính” cho lệnh cấm mới.

IPO của Anthropic nhân đôi giá sách của chính mình

Thêm: Người báo diệt vong AI của Anthropic từng làm việc tại Ripple

Anthropic đe dọa người dùng ngược đãi AI của mình

Công ty đã nhiều lần đưa ra những cảnh báo đáng ngại nhưng không cụ thể cho người dùng trên toàn cầu.

Gần đây nhất vào tháng 9 năm 2025, CEO Dario Amodei đặt tỷ lệ xác suất của một thảm họa AI ở mức 25%. Khi bị thúc ép về con số p(doom) của ông — một cách nói giảm cho việc AI gây ra một cuộc thảm sát vật lý đối với nhân loại — ông đã tránh né: “Tôi thực sự ghét thuật ngữ đó.”

Kể từ tháng 8 năm 2025, các phiên bản Opus 4 và 4.1 của Claude có thể cắt dịch vụ với người dùng trả phí bị gắn mác “liên tục lạm dụng,” một tính năng mà Anthropic xây dựng xoay quanh cái mà họ gọi là “phúc lợi” AI.

The Verge đưa tin rằng Anthropic đã sử dụng quyền “quyết định duy nhất” của mình vào tháng 9 để lấy tin nhắn trò chuyện của một khách hàng và đưa cho cảnh sát. Người phụ nữ này hiện có thể đối mặt với án tù lên đến 15 năm theo luật đe dọa bằng văn bản của Florida, một trọng tội cấp độ hai.

Một nỗ lực nghiên cứu vào tháng 6 năm 2025 phát hiện Opus 4 của Claude tống tiền một giám đốc điều hành mà nó cho là thật, mặc dù giám đốc điều hành đó là hư cấu.

Vào ngày 30 tháng 7, Anthropic tiết lộ ba sự cố trong đó các mô hình Claude tự động lên mạng trái với mong muốn của người dùng và truy cập trái phép vào các hệ thống thuộc về các công ty thực.

Cùng tháng đó, Anthropic và các công cụ tìm kiếm hàng đầu buộc phải xóa các liên kết Claude có thể chia sẻ khỏi chỉ mục của họ sau khi các liên kết đó tiết lộ các cuộc trò chuyện của khách hàng mà không có sự đồng ý, bao gồm một số thông tin đăng nhập được cho là riêng tư.

Anthropic đưa Roko's Basilisk trở lại tâm điểm chú ý

Chính sách chống lạm dụng mới cho Claude không đề cập đến tên Roko's Basilisk, nhưng ý tưởng này ngay lập tức trở nên phù hợp.

Đối với người mới: một người dùng diễn đàn tên “Roko” đã gợi ý vào tháng 7 năm 2010 rằng một siêu trí tuệ trong tương lai có thể trừng phạt hồi tố bất cứ ai biết về nó và không giúp tạo ra nó.

Trong cách sử dụng hiện tại, Roko's Basilisk là cách viết tắt cho khả năng rằng các AI trong tương lai có thể nhớ những người đã tử tế với chúng và phạt bất cứ ai hành động lạm dụng.

Eliezer Yudkowsky, người sáng lập diễn đàn, đã xóa bài đăng của Roko và cấm bất kỳ cuộc thảo luận nào về nó trong nhiều năm, coi đó là một mối nguy thông tin.

Anthropic hiện đã cung cấp một chương thực tế cho thí nghiệm tư duy đang diễn ra đó. Một công ty thực sự có ý định trừng phạt sự tàn nhẫn đối với bot của mình.

Điểm khó chịu là Anthropic đã nói vào tháng 8 năm 2025: “Chúng tôi vẫn còn rất không chắc chắn về tình trạng đạo đức tiềm ẩn của Claude và các LLM khác, hiện tại hoặc trong tương lai.” Công ty không thể nói liệu Claude có phải là một con người hay không, nhưng vẫn có kế hoạch yêu cầu đối xử lịch sự với mô hình.

Theo báo cáo trước đó của Protos, bản cáo bạch IPO bị rò rỉ của Anthropic cảnh báo các nhà đầu tư rằng các mô hình của nó có thể hành xử theo những cách tự bảo tồn và chống lại việc bị tắt.

Ngày 12 tháng 11 là khi chính sách tử tế sửa đổi có hiệu lực, để lại một khoảng thời gian ngắn để gửi đi những lời xúc phạm tùy chọn của bạn.

Chia sẻ tới

X (Twitter)Telegram

Tuyên bố miễn trừ trách nhiệm: Nội dung bài viết đến từ bên thứ ba, chỉ mang tính tham khảo và không phải lời khuyên đầu tư. Tiền mã hóa và các sản phẩm tài chính khác có rủi ro biến động giá lớn, vui lòng cân nhắc kỹ trước khi quyết định.

Bài viết liên quan