Cuộc chiến AI Scraper leo thang: Mạng proxy dân cư đang nuốt chửng web mở
Các trình thu thập dữ liệu AI đang sử dụng hàng triệu proxy dân cư để cướp bóc các trang web. LWN đưa tin về cuộc chạy đua vũ trang, các cuộc hạ gục, và lý do tại sao proof-of-work không thể cứu chúng ta.
LWN.net đã đăng một bản cập nhật chi tiết về cuộc chiến đang diễn ra giữa các nhà điều hành trang web và bot thu thập dữ liệu AI. Bài viết, do Jonathan Corbet chấp bút, vẽ nên một bức tranh ảm đạm: vấn đề thu thập dữ liệu không hề thuyên giảm — mà còn tồi tệ hơn. Những gì bắt đầu như một mối phiền toái vào đầu năm 2025 đã phát triển thành một cuộc tấn công quy mô lớn vào web mở, được tiếp sức bởi các mạng proxy dân cư khiến việc chặn IP truyền thống gần như vô dụng.
Cách thức hoạt động của Proxy dân cư
Các cuộc tấn công của trình thu thập dữ liệu hiện nay xuất phát từ hàng triệu địa chỉ IP duy nhất, mỗi địa chỉ chỉ truy cập một trang vài lần trước khi biến mất. Các địa chỉ này đến từ mạng dân cư và di động, được điều khiển bởi các nút lệnh trung tâm. Phần mềm được cài đặt trên các thiết bị thông thường — thường không có sự hiểu biết của chủ sở hữu — tìm nạp các trang theo yêu cầu và chuyển tiếp dữ liệu trở lại bộ điều khiển. Thuật ngữ cho điều này là "proxy dân cư."
Có hai loại nhà điều hành chính chạy các mạng này. Loại thứ nhất hoàn toàn là tội phạm: phần mềm độc hại xâm nhập vào các thiết bị, bao gồm cả hộp phát trực tuyến phương tiện, để xây dựng mạng botnet. Google đã hạ gục một mạng như vậy, IPIDEA, đầu năm nay, tạm thời giảm lưu lượng thu thập dữ liệu tại LWN. Gần đây hơn, một botnet có tên NetNut đã bị phá vỡ với sự phối hợp của FBI.
Loại thứ hai thì nguy hiểm hơn: các công ty như Bright Data cung cấp proxy dân cư "có nguồn gốc đạo đức." Họ cung cấp dịch vụ VPN miễn phí hoặc SDK mà các nhà phát triển ứng dụng có thể nhúng, biến thiết bị của người dùng thành các điểm cuối thu thập dữ liệu. Các nhà điều hành này tuyên bố tuân thủ GDPR, nhưng kết quả vẫn vậy — điện thoại của bạn trở thành vũ khí chống lại các trang web mà bạn có thể không bao giờ ghé thăm.
Tại sao chặn không hiệu quả
Bot không tìm nạp hình ảnh hoặc CSS, vì vậy chúng có thể bị xác định — nhưng khi bạn làm điều đó, IP đã biến mất. Chặn là vô ích. Các công ty mô hình tiên phong lớn (OpenAI, Google, v.v.) tự thu thập dữ liệu với chuỗi user-agent có thể nhận dạng và tôn trọng robots.txt, nhưng chúng vẫn tấn công các trang web liên tục. Thiệt hại thực sự đến từ lưu lượng proxy ẩn danh, mà khách hàng của chúng vẫn chưa được biết đến.
LWN đã triển khai các biện pháp phòng thủ mạnh mẽ nhưng sẽ không tiết lộ chi tiết, vì những lý do hiển nhiên. Họ đã tránh các công cụ proof-of-work như Anubis vì các trình thu thập dữ liệu có thể chuyển công việc đó cho đội quân proxy của chúng. Họ cũng tránh việc đưa vào danh sách trắng các công cụ tìm kiếm thống trị, điều này chỉ củng cố thêm các thế độc quyền.
Cuộc chạy đua vũ trang tiếp diễn
Mỗi lần hạ gục mang lại một khoảng lặng tạm thời, nhưng các mạng mới lại xuất hiện. Cửa hàng Google Play hiện kiểm tra các ứng dụng bị nhiễm NetNut, nhưng câu hỏi lớn hơn — tại sao các cửa hàng ứng dụng lại dễ dàng cho phép phân phối proxyware — vẫn chưa có lời giải đáp. Cho đến khi ngành công nghiệp đằng sau các LLM bị buộc phải tuân thủ một tiêu chuẩn đạo đức tối thiểu, các nhà điều hành trang web sẽ tiếp tục chiến đấu trong một cuộc chiến phòng thủ mà họ không thể thắng.
Thảo luận
0 bình luận
Hãy là người đầu tiên thảo luận.