Tin tức

Phân loại lưu lượng AI mới của Cloudflare: Tìm kiếm, Tác nhân, Huấn luyện — và các mặc định mới

Cloudflare giới thiệu hệ thống quản lý lưu lượng AI ba hạng mục (Tìm kiếm, Tác nhân, Huấn luyện) và sẽ chặn mặc định các bot Tác nhân và Huấn luyện trên các trang có quảng cáo từ tháng 9 năm 2026.

July 2, 2026· 4 min read· Nguồn: The Cloudflare Blog
Phân loại lưu lượng AI mới của Cloudflare: Tìm kiếm, Tác nhân, Huấn luyện — và các mặc định mới

Cloudflare đang cập nhật các kiểm soát bot AI của mình với một phân loại tinh tế hơn, chia các trình thu thập dữ liệu thành ba hạng mục hành vi: Tìm kiếm, Tác nhân và Huấn luyện. Động thái này diễn ra một năm sau khi công ty lần đầu tiên cung cấp cho chủ sở hữu trang web tùy chọn "Chặn bot AI" một cú nhấp chuột và một thị trường trả tiền cho mỗi lần thu thập. Hệ thống mới, được công bố hôm nay, áp dụng cho tất cả khách hàng của Cloudflare, bao gồm cả người dùng Gói miễn phí.

Tại sao lại thay đổi?

Cách tiếp cận tất cả hoặc không có gì cũ đối với bot AI không còn phù hợp nữa. Chủ sở hữu trang web muốn chặn các trình thu thập huấn luyện vốn hấp thụ vĩnh viễn nội dung vào mô hình, nhưng vẫn cho phép các bot tìm kiếm thúc đẩy lưu lượng giới thiệu. Họ cũng cần xử lý các tác nhân thời gian thực (như ChatGPT-User hoặc các tác nhân sử dụng trình duyệt) khác với các trình thu thập hàng loạt. Phân loại mới của Cloudflare nhằm cung cấp cho chủ sở hữu trang web mức độ chi tiết đó.

Ba hạng mục

  • Tìm kiếm: bot lập chỉ mục nội dung để trả lời các truy vấn sau này. Chủ sở hữu trang web nên mong đợi lưu lượng giới thiệu hoặc bồi thường tương ứng.
  • Tác nhân: hành vi tự động thời gian thực thay mặt cho một người — bot tìm nạp trò chuyện, tác nhân sử dụng trình duyệt. Thường có một người đang chờ ở đầu bên kia.
  • Huấn luyện: trình thu thập lấy nội dung để huấn luyện hoặc tinh chỉnh mô hình. Dữ liệu được hấp thụ vĩnh viễn vào kiến trúc của AI.

Cloudflare khuyến khích mạnh mẽ các nhà vận hành bot tách biệt các trình thu thập của họ theo mục đích, để chủ sở hữu trang web có thể quản lý quyền truy cập một cách minh bạch. Các trình thu thập đa mục đích (ví dụ: Googlebot, Applebot, BingBot) sẽ được phân loại theo tất cả các hạng mục áp dụng.

Các mặc định mới bắt đầu từ ngày 15 tháng 9 năm 2026

Đối với tất cả các tên miền mới đăng ký Cloudflare, bot Huấn luyện và Tác nhân sẽ bị chặn theo mặc định trên các trang hiển thị quảng cáo. Bot Tìm kiếm vẫn được phép theo mặc định. Lý do: các trang có quảng cáo báo hiệu rằng sự chú ý của con người là mục tiêu kiếm tiền, và bot Huấn luyện/Tác nhân can thiệp vào điều đó. Tuy nhiên, Tìm kiếm lại dẫn khách truy cập quay lại trang web.

Các trình thu thập đa mục đích kết hợp Tìm kiếm với Huấn luyện sẽ phải tuân theo quy tắc hạn chế nhất — vì vậy nếu một trang chặn Huấn luyện, Googlebot (vốn làm cả hai) sẽ bị chặn hoàn toàn. Khách hàng hiện tại có thể chọn không áp dụng các mặc định này thông qua cài đặt Bảo mật trước thời hạn.

BotBase: khả năng hiển thị cho doanh nghiệp

Khách hàng Quản lý Bot Doanh nghiệp nhận được một tính năng bảng điều khiển mới có tên BotBase — một cơ sở dữ liệu có thể tìm kiếm của tất cả các bot và tác nhân đã được xác minh, kèm theo phân loại hành vi. Nó cho phép lọc theo bot, sao chép ID phát hiện để sử dụng trong các quy tắc Bảo mật, và sau này sẽ trở thành một trung tâm điều khiển để quản lý lưu lượng tự động.

Phân loại cũng bao gồm các hành vi bổ sung như Giao dịch, Thu thập dữ liệu, Kiểm tra bảo mật, SEO, Xác minh quảng cáo, Xem trước xã hội/liên kết, Tìm nạp nguồn cấp dữ liệu, và Giám sát & Vận hành — nhưng chỉ ba hạng mục AI (Tìm kiếm, Tác nhân, Huấn luyện) là có thể cấu hình cho tất cả khách hàng hiện tại.

"Chúng tôi muốn một hệ thống phân loại có thể mở rộng và đại diện cho thế giới lưu lượng tự động khi nó phát triển."

Bản cập nhật phản ánh một xu hướng rộng hơn của ngành: AI không còn là một vectơ đe dọa đơn lẻ, và chủ sở hữu trang web cần các kiểm soát chính xác, không chỉ là một công tắc chặn tất cả.