ニュース

より良いAIコメント分類器の構築:30ドルのデータセットが実際にはもっと高くついた教訓

エンジニアが公開データでAIコメント分類器を再構築し、バランス精度77%を達成。コストを3倍にしたデータ収集の痛ましいミスを共有。

September 9, 2026· 1 min read
より良いAIコメント分類器の構築:30ドルのデータセットが実際にはもっと高くついた教訓

コードコメントが人間によって書かれたか、LLMによって書かれたかを検出することは、ニッチでありながらますます関連性の高い問題です。ある開発者が最近、AIコメント分類器をゼロから再構築し、今回は公開データとより堅固な基盤の上で行い、そのためにかかった詳細を共有しました。

性能数値

主要な指標は、交差検証でのバランス精度77%です。つまり、人間とロボットのコメントが同様に可能性が高い場合、分類器は77%の確率で人間対ロボットの判定を正しく行います。分類器はまた、校正された確率を出力するため、信頼度を真の正しさの可能性として読むことができます。

実際のコメントの小さな手動テストセットでは、精度は88%に跳ね上がり、実際のケースは合成トレーニングデータよりも区別しやすいことを示唆しています。混同行列は、交差検証セットでロボットコメントの真陽性率80%、人間コメントの真陰性率73%を示しています。

しかし、著者は全体的なエラー率に過度に依存することに注意を促しています。分類器が校正されているため、予測ごとの信頼度スコアを信頼できます。信頼度が80%以上のとき、偽陽性率は5%に低下します。約50%のときは、基本的に推測しています。

データ収集:詳細に悪魔が潜む

データセットは、寛容なライセンスのリポジトリを取得し、2021年のコミットをチェックアウトし、人間のコメントを抽出し、その後LLMに同じファイルの新しいコメントを生成させることで構築されました。目標は、クラス間のトークン数をバランスさせ、主題の漏洩を避けることでした。

著者は、理論上の30ドルのデータセットをはるかに高価な事業に変えたいくつかの間違いを挙げています:

  • 各LLMに異なるソースファイルを誤って使用し、主題の漏洩を引き起こした。
  • 人間のコメントが非常に少ないファイルに対してLLMコメントを生成し、再び主題を漏洩させた。
  • docstringを除去し忘れ、LLMがリポジトリのスタイルを模倣できるようにした。
  • 一部の言語でコメント構文を見逃し、汚染を残した。
  • 「main task structure」や「chIcon」のような非常に短い人間のコメントをフィルタリングせず、分類器に人間が下手に書くと教えた。
  • LLM生成に固定プロンプトを使用し、データセットの多様性を狭めた。

これらのいくつかは前処理で修正可能でしたが、他は完全な再生成が必要でした。著者は、分類器のパワーは費やした金額の対数に比例してスケールするため、収穫逓減が急速に現れると述べています。

特徴評価

すべての特徴サブセット(15特徴に対して30,000以上の分類器)で網羅的にトレーニングする代わりに、著者はガイド付きアプローチを使用しました:異なる識別タスク(人間対ロボット、Claude対Grok、GPT対Gemini)に対して個々の特徴で分類器をトレーニングし、個々のパワーで特徴をランク付けしました。

結果のグラフは、比較間の一致を示す矢印付きの特徴ランキングを示しています。bigwords(5文字を超える単語の割合)やwordlen(単語の長さの分布)のような特徴は、古典的な文体マーカーですが、単独では弱い判別器です。

著者はまた、分類されたコメントの任意の部分をクリックして、どの特徴が活性化され、どのように判定に寄与するかを確認できるインタラクティブUIを構築しました — 分類器の推論を透明にする優れたデバッグツールです。

範囲と制限

分類器はコードコメントのみでトレーニングされています。他のテキストタイプも処理できますが、精度は保証されません。著者はそのドメインを超えて約束をしません。

分類器が非常に自信があるとき(信頼度が80%以上など)、偽陽性のリスクは5%に低下します。分類器が不確かなとき(信頼度が約50%)、校正により約半分の確率で誤った判定を下します。
Manul X 編集部
交差検証と実世界テストセットでの分類器の性能
比較
指標交差検証実世界テスト
精度77%88%
適合率75%89%
再現率80%86%
感度80%86%
特異度73%89%
F1スコア77%87%