arXiv新規論文の3分の1が機械生成と判定される
調整された検出器によると、最近のarXiv論文の約32%がAI生成と判定され、コンピュータサイエンスは65%、数学はほぼゼロ——ただし限界もある。
「XのN%がAI化した」というジャンルに新たなエントリーが加わった。今回はちゃんと検証している。Unslopのチームは12,750件のarXiv論文を検出器にかけ、偽陽性率をChatGPT以前のテキストに固定。2021~2022年の真の人間執筆でフラグが立つのはわずか0.4%だ。結果:最新四半期に投稿された新規論文の約3分の1が機械生成と読め、コンピュータサイエンスが65%でトップ、数学は0.7%で最下位だった。
手法の概要
検出器は学術散文用に調整されている。閾値をLLM以前の論文でわずか0.4%しかフラグが立たないように設定することで、著者らは対照群を組み込んだ。もし上昇がアーティファクトなら、2021年と2022年も2026年と同じスパイクを示すはずだが、そうはならなかった。フラグ付きシェアはChatGPTリリースから数ヶ月以内に離陸し、2波に分かれて上昇。2026年初頭に約39%に達した後、最新四半期には約32%に落ち着いた。
各論文は要約だけでなく本文全体でスコアリングされた。要約はシグナルを過小評価するからだ——同じ論文でも要約では20%未満、本文では70%超のスコアになりうる。サンプルは10の分野グループをカバーし、2023年1月から2026年7月まで各分野・月あたり約25論文、さらに2021年と2022年の対照月8ヶ月分を含む。
分野別内訳
- コンピュータサイエンス:65%(対照群:0.2%)
- 定量生物学:56.3%(対照群:3.5%)
- 電気工学・システム:51.3%(対照群:1.7%)
- 経済学・金融:47%(対照群:2.5%)
- 応用物理学:34%(対照群:1.3%)
- 統計学:31.3%(対照群:1.8%)
- 凝縮系物理学:24%(対照群:0%)
- 高エネルギー物理学:14%(対照群:0.5%)
- 天体物理学:10.7%(対照群:0%)
- 数学:0.7%(対照群:0%)
最も上昇した分野は、LLM以前の対照群レベルが最も高かった分野ではない。つまり、出発点が高かったからという説明は成り立たない。
測定の限界
著者らは限界について率直に認めている。分野別の対照サンプルは少なく(各200論文)、分野別の偽陽性率は概算に過ぎない。さらに重要なのは、低スコアが意味するのは低い採用率か、検出器の死角のどちらかだということだ。数学が最も明確な例:記号と定理・証明構造が支配的な論文は散文が少なく、検出器の分布から外れる。モデル支援を多用して書かれた数学論文でも、散文が訓練データと似ていないために低スコアになる可能性がある。著者らは、報告された普及率は下限値であると指摘している——検出器のカバレッジが不完全なため、真のシェアは少なくとも測定値以上だ。
最後に、フラグは著者性を意味しない。検出器は、テキストが機械生成と読めるかどうかを、既知の誤差率で較正された確率で推定する。軽く編集された文書と完全に生成された文書を区別することはできず、単一のスコアで特定の個人を非難する根拠にはならない。この研究は、機械的な書き方の普及率を報告している。これにはAI支援による大幅な編集も含まれる。
試してみよう
検出器は無料で、任意のarXiv論文や自分のテキストに使用できる。自分の分野の最新研究のうちどれだけがAI支援を受けているか気になるなら、試す価値がある。
ディスカッション
0 件のコメント
最初のコメントを投稿しましょう。