Một phần ba bài báo arXiv mới được đọc như do máy viết
Một bộ phát hiện đã hiệu chuẩn cho thấy ~32% bài báo arXiv gần đây bị gắn cờ là do AI tạo ra, với khoa học máy tính ở mức 65% và toán học gần như bằng không — nhưng những hạn chế mới là vấn đề.
Có một mục mới trong thể loại 'N% của X hiện là AI', và lần này họ đã thực sự làm bài tập về nhà. Nhóm đằng sau Unslop đã chạy một bộ phát hiện trên 12.750 bài báo arXiv, neo tỷ lệ dương tính giả vào văn bản trước ChatGPT để chỉ 0,4% bài viết thực sự của con người từ 2021–2022 kích hoạt cờ. Kết quả: khoảng một phần ba số bài báo mới nộp trong quý gần nhất được đọc như do máy viết, với khoa học máy tính dẫn đầu ở mức 65% và toán học tụt lại ở mức 0,7%.
Phương pháp, tóm tắt
Bộ phát hiện được hiệu chuẩn cho văn xuôi học thuật. Bằng cách đặt ngưỡng sao cho các bài báo trước LLM chỉ bị gắn cờ ở mức 0,4%, các tác giả đã xây dựng một đối chứng: nếu sự gia tăng là do nhiễu, thì năm 2021 và 2022 sẽ cho thấy đỉnh tương tự như năm 2026. Nhưng không phải vậy. Tỷ lệ bị gắn cờ cất cánh trong vòng vài tháng sau khi ChatGPT ra mắt và leo lên theo hai đợt, đạt ~39% vào đầu năm 2026 trước khi ổn định ở mức ~32% trong quý gần nhất.
Mỗi bài báo được chấm điểm trên toàn bộ nội dung văn bản, không chỉ phần tóm tắt, bởi vì phần tóm tắt đánh giá thấp tín hiệu — cùng một bài báo có thể đạt dưới 20% trên phần tóm tắt và trên 70% trên phần nội dung. Mẫu bao gồm mười nhóm lĩnh vực, khoảng 25 bài báo mỗi lĩnh vực mỗi tháng từ tháng 1 năm 2023 đến tháng 7 năm 2026, cộng với tám tháng đối chứng trong suốt năm 2021 và 2022.
Phân tích theo từng lĩnh vực
- Khoa học máy tính: 65% (đối chứng: 0,2%)
- Sinh học định lượng: 56,3% (đối chứng: 3,5%)
- Kỹ thuật điện & hệ thống: 51,3% (đối chứng: 1,7%)
- Kinh tế & tài chính: 47% (đối chứng: 2,5%)
- Vật lý ứng dụng: 34% (đối chứng: 1,3%)
- Thống kê: 31,3% (đối chứng: 1,8%)
- Vật chất ngưng tụ: 24% (đối chứng: 0%)
- Vật lý năng lượng cao: 14% (đối chứng: 0,5%)
- Vật lý thiên văn: 10,7% (đối chứng: 0%)
- Toán học: 0,7% (đối chứng: 0%)
Các lĩnh vực tăng nhiều nhất không phải là những lĩnh vực có mức đối chứng trước LLM cao nhất, vì vậy điểm xuất phát cao không giải thích được xu hướng.
Nơi phép đo bị phá vỡ
Các tác giả trung thực một cách đáng mừng về những hạn chế. Các mẫu đối chứng theo từng lĩnh vực nhỏ (200 bài báo mỗi lĩnh vực), vì vậy tỷ lệ dương tính giả theo từng lĩnh vực chỉ là xấp xỉ. Quan trọng hơn, điểm thấp có thể có nghĩa là mức độ áp dụng thấp hoặc một điểm mù của bộ phát hiện. Toán học là ví dụ rõ ràng nhất: các bài báo bị chi phối bởi ký hiệu và cấu trúc định lý-chứng minh để lại văn xuôi thưa thớt nằm ngoài phân phối của bộ phát hiện. Một bài báo toán học được soạn thảo với sự hỗ trợ nặng nề của mô hình có thể đạt điểm thấp đơn giản vì văn xuôi của nó không giống với dữ liệu huấn luyện. Các tác giả lưu ý rằng tỷ lệ phổ biến được báo cáo là một giới hạn dưới — phạm vi bao phủ không đầy đủ của bộ phát hiện có nghĩa là tỷ lệ thực sự ít nhất là những gì họ đo được.
Cuối cùng, một cờ không phải là tác giả. Bộ phát hiện ước tính liệu văn bản có được đọc như do máy viết ở một xác suất đã hiệu chuẩn với tỷ lệ lỗi đã biết hay không. Nó không thể tách biệt một tài liệu được chỉnh sửa nhẹ khỏi một tài liệu được tạo hoàn toàn, và một điểm số duy nhất không bao giờ là cơ sở để buộc tội một người cụ thể. Nghiên cứu báo cáo tỷ lệ phổ biến của văn bản giống máy, bao gồm cả chỉnh sửa hỗ trợ AI nặng.
Dùng thử
Bộ phát hiện miễn phí và có sẵn cho bất kỳ bài báo arXiv nào hoặc văn bản của riêng bạn. Đáng để xem nếu bạn tò mò về mức độ nghiên cứu mới nhất trong lĩnh vực của bạn có thể đã có sự hỗ trợ của AI.
Thảo luận
0 bình luận
Hãy là người đầu tiên thảo luận.