Watermark ngữ nghĩa của Anthropic: Claude sẽ cố tình chọn từ kém hơn
Kế hoạch của Anthropic nhằm đánh dấu văn bản Claude bằng cách thiên vị lựa chọn token về phía các từ 'xanh' là một sự suy giảm chất lượng đầu ra có chủ đích — và nó áp dụng cho mọi phản hồi trên 200 token, kể cả các cuộc trò chuyện riêng tư.

Anthropic thông báo rằng tất cả các mô hình Claude sẽ sớm nhúng một watermark ngữ nghĩa vào văn bản được tạo ra, tuân thủ quy định minh bạch của EU. Tài liệu hỗ trợ ban đầu tuyên bố rằng watermark sẽ "không thể nhận thấy" và sẽ không thay đổi "ý nghĩa, chất lượng hoặc khả năng đọc." Tuyên bố đó giờ đây bị phơi bày là gây hiểu lầm: cơ chế thực tế thiên vị lựa chọn token tại thời điểm suy luận, tinh vi thay đổi lựa chọn từ theo những cách có thể phát hiện về mặt thống kê.
Kỹ thuật này, như được giải thích trong bài đăng tiếp theo của Anthropic và bài luận tương tác của James Padolsey, hoạt động như một đồng xu thiên vị. Tại mỗi bước tạo token, mô hình có khả năng cao hơn một chút để chọn một từ từ danh sách "xanh" bí mật thay vì danh sách "đỏ". Các danh sách được tính toán ngay lập tức với một khóa bí mật, vì vậy không có từ vựng tĩnh nào của các từ ưa thích. Việc phát hiện yêu cầu khóa — chỉ Anthropic có thể xác minh watermark của chính mình, và không nhà cung cấp nào có thể phát hiện watermark của nhà cung cấp khác.
Chi tiết quan trọng: điều này áp dụng cho tất cả đầu ra của Claude dài hơn 200 token (~150 từ), bao gồm cả các cuộc trò chuyện riêng tư mà không ai ngoài người dùng sẽ đọc. Mô hình sẽ hy sinh độ chính xác và sự rõ ràng — dù chỉ một chút — để nhúng một tín hiệu nguồn gốc phục vụ cho việc tuân thủ quy định của Anthropic, không phải lợi ích của người dùng.
Vấn đề cốt lõi: Không có hai từ đồng nghĩa nào giống nhau
"Anh ấy lao vào cơ hội" và "Anh ấy nhảy vào cơ hội" không phải là cùng một câu. Việc lựa chọn từ chính xác quan trọng trong văn viết. Khi một mô hình bị đẩy về phía danh sách "xanh", nó có thể chọn một từ kém chính xác hơn một chút, kém tự nhiên hơn một chút, hoặc lệch tông một chút — tất cả để phục vụ một watermark mà người dùng không yêu cầu và có thể không bao giờ được hưởng lợi.
Cách trình bày của Anthropic coi đây là một sự đánh đổi vô hại, nhưng đó là một sự đánh đổi được thực hiện thay cho người dùng, mà không có sự đồng ý, vì một mục đích không cải thiện đầu ra. Đối với một công cụ vốn đã bị chỉ trích vì tạo ra văn xuôi nhạt nhẽo, chung chung, việc cố tình làm cho nó tệ hơn — dù chỉ một chút — là một bước đi sai hướng.
Góc độ quy định EU
Quy định thúc đẩy điều này, Bộ quy tắc ứng xử của EU về tính minh bạch của nội dung do AI tạo ra, là một nỗ lực quan liêu nhằm giải quyết vấn đề nguồn gốc AI. Nhưng việc thực hiện chuyển chi phí lên người dùng: chất lượng đầu ra suy giảm, mà không có lợi ích trực tiếp cho họ. Watermark là xác suất, vì vậy nó thậm chí không phải là một công cụ phát hiện đáng tin cậy cho các văn bản ngắn. Đối với một email 150 từ, tín hiệu quá yếu để có thể tự tin. Vì vậy, người dùng trả thuế chất lượng, và watermark vẫn thất bại trong mục đích của nó đối với chính những văn bản mà nó có thể quan trọng nhất.
Anthropic đang nói rằng họ sẽ làm cho đầu ra của các mô hình của họ tệ hơn, có chủ đích, vì những mục đích không mang lại lợi ích gì cho người dùng.
Thảo luận
0 bình luận
Hãy là người đầu tiên thảo luận.