arXivでAI執筆論文をどう特定したか?そして、その測定手法が直面する限界とは
How we measured AI writing across arXiv, and where the measurement breaks
How we measured AI writing across arXiv, and where the measurement breaks
arXivに投稿される論文のうち、AIがどの程度書かれているかを我々はどうやって測定したのか。その手法の裏側と、なぜその測定が完全に正確とは言えないのか、その落とし穴について解説します。
2021年から2026年までのarXiv論文12,750本の全文をスコアリングして、どれくらいがAI製としてフラグが立てられたか、そしてchatGPTのリリース以降どれだけ増加したかを調べてみたよ。誤検知を避けるために検知器のチューニングをわざと厳しめにしていて、そのせいでchatGPT以前の検知率は0.4%程度に収めてある。
一番大きな結果としては、2026年1月の時点で約39%の論文がAI製と判定されたことかな。特にコンピュータサイエンス分野ではピーク時に65%に達した。数学は0.7%からほとんど変化しなかったけど、証明中心の数学テキストは検知器側がうまく拾えていないだけかもしれない。
結局のところ、これは検知器による統計的信号の推定であって、特定の著者がAIを使ったという証拠ではない点には注意が必要だね。「機械による執筆」には、AIを駆使した推敲が含まれている可能性もあるからね。
もしツールが新しい論文の40%をAI製と判定しつつ、ChatGPT以前の論文の20%もAI製と判定しているなら、真の問題は誰も触れていないその20%の方にあるはずだ。
自分が読んでいる論文の65%が「AI製のような特徴」を持っているなら、本人が実際にAIを使っているかどうかに関わらず、文章スタイルはAIの影響を受けてしまうはずだよ。執筆スタイルを確立しようとしている駆け出しの研究者なら、なおさらそうなりそうだな。
テキストのみを対象としたあらゆるAI検知スキームと同じように、検知の精度については懸念があるな。手法、特に3つの検知器スコアを最終的に結合するプロセスに対して懐疑的だよ。その最終ステップがバイアスを持ち込んでいないとどうやって確信できるんだろう?ソースコードが公開されていないから、正確にどう動いているのか、研究を再現するのも難しい。
自分自身の(未公開の)LLM以前の研究サンプルをいくつかアップロードしてみたけど、なぜかLLM検知スコアでかなり高い数字が出た。他の論文では、ほぼすべての文章が「機械的」として赤くハイライトされているのに、スコアには影響していないとかね。それに、LaTeX形式の有無で同じテキストでもスコアに劇的な差が出るのもおかしい。本来関係ないはずなのに。
今回の結論としては、「生成されたテキストを検知するのは難しいので、仮説を裏付けるからといって結果を鵜呑みにするのは慎重であるべき」ということに尽きるね。
--
関係ある話だけど、上の文章もAI製として高スコアが出てるんだよね。もちろん、人間の手で書いたものなんだけどさ :)
私は英語が母国語じゃないんだけど、この結果には驚かないな。私たちが書く論文のほとんどはAI検知器にフラグを立てられると思う。
それは、Xについての論文を書けってLLMに指示しているからじゃないんだ。私たちが学術的なスタイルで書くのが苦手で、アメリカのエディターがそれを求めてくるからだよ。LLMがあれば、基本的な文章でアイデアを伝えて、それを綺麗な文章に変換してもらうことができる。
段落ごとにLLMに推敲させて学術的に書き直してもらうなら、それは完全に自分の論文と言えるけど、AI生成としてフラグは立ってしまう。逆に、LLMに丸投げしても、英語が十分に上手ければ人間が書いたように見せかけることだってできるんだ。
少し天邪鬼な意見を言うと、この手の論文って非常に冗長で定型文も多いよね。9割をAIに書かせて、肝心の新規性のある内容や何が重要かの説明は手書きにする、なんてことは想像できる。
たぶん、そういうことが起こっているんじゃないかな。
どう受け止めていいのか悩むな……2011年に書いたPyHPCワークショップの論文をアップロードしたら27%機械製と出た。
2012年の博士論文も試したら40%という結果で、42%のしきい値をギリギリ下回っていたよ。
もう論文は発表していないけど……これって僕がLLMみたいに書いていたのか、それともLLMが僕から学んだということかな? :p
追記:2015年に書いたIEEE CLUSTERSの論文も試してみたら、74%がAI製という結果が出たよ :|
このアプローチの課題として、検知器が単に2022年以降の文献で多く使われるようになった言葉や専門用語を「AI」として認識しているだけ、という可能性はないだろうか?
例えば、LLMは「大規模言語モデル(large language model)」について語るのが大好きだ(そしてLLMを使って書く人も「大規模言語モデル」について書くのが大好きだ)。そのせいで、「大規模言語モデル」という言葉自体がAIらしいフレーズとしてフラグを立てられているのでは?2022年以前の文献にはほとんど存在せず、今は当たり前にあり、AI生成テキストにはより頻出する。でも、それって現代のAI生成テキストと人間が書いたテキストを区別する優れた方法とは言えないよね。
有益なコントロール群として、2023年以降でもLLM生成テキストが含まれていないと見なせる論文のコホートにおいて、arXivと比べてどれくらい低い割合が出るかを示すべきじゃないかな。
例えば、NatureやScience誌の論文も現時点で完全にLLMフリーとは言えないだろうけど、2026年までこれらをテストしてみれば、arXivの成長率よりもはるかに低いラインが見えてくるはずだよ。
企業におけるLLM活用には、現実的なゲーム理論のメカニズムが働いているよ。開発者たちは、Claude Codeをあらゆるものに投入して、表面上は優れたコードやドキュメントを大量生産している。経営層は、見たところ欠点がないのでこれを推奨している。
このコードが以前より構造的に優れているのか劣っているのかは断言できないけど、とにかく膨大な量が出ることは確かだ。そして経営層にとって、欠陥のある指標に基づけば、それこそがすべてなんだ。これが本当に良いアイデアで、認知機能の衰えに見合う価値があるのかわかるまでには数年かかるだろうね。
一日中LLMを使わない人は、そうでない人ほど生産性を出せなくなる。科学研究の世界でも出版数こそがすべてだし、同じ要素が働いていないなんてことはないだろうな。
何人かの研究者(主にコンセンサスプロトコルなどを研究している人たち)と一緒に仕事をしているんだけど、研究全般について議論していて「論文の文章と、研究の内容、どっちが好き?」って聞いてみたんだ。
彼らはほぼ全員一致で「研究内容の方が好き」と答えたよ。そりゃそうだよね、書くことが好きなら別の職業を選んでいただろうし。
なぜこの話をするかというと、研究の図表やコードを論文(少なくとも草稿)に変換してくれるLLMが使えるようになれば、質の高い研究論文が「増える」はずだからだ。というのも、研究者の中には「研究はやりたいけど、論文を書く手間が面倒だな」という心理的摩擦があったはずだからね。
別の言い方をすれば、縦軸を研究者としてのスキル、横軸を執筆の嫌い度とした2次元プロットで言うと、LLMは両方で高い値を示す人たちの可能性を「解放」して、より多くの論文を出させることになるかもしれない。
追伸:これが質の低い論文を増やすことにもつながるという意見には同意だけど、長期的にはトータルでプラスになるんじゃないかと思ってるよ。
学術環境で同じ問題に取り組んでみたけど、テキストのみを使用してAI執筆を確実に検知する方法はないという結論に至ったよ。理由は、同じ2つの入力を与えて、片方を合成(LLM)、片方を有機的(人間)と分類できる検知器なんて存在しないからだ。この状況は文単位や段落単位で簡単に起こり得る。質問として投げかけるけど、人間が書いた段落とLLMが書いた段落が完全に一致した場合、その段落をどう分類するの?学術的な設定や分野において使える単語の数や組み合わせには限界があるから、テキストだけで完璧な分類器を作ることはできないんだ。現実には明らかな「AIらしさ」はあるけど、それも時間とともに変わるし、モデルごとに特徴も異なる。だから、論文がLLM風の文章で埋め尽くされていても、それが「合成っぽく見える有機的なテキスト」なのか「有機的に見える合成テキスト」なのかを区別する手段がないんだよ。
個人的には、論文集を対象にして、LLMの導入によって執筆がどう変化したかを分析する方が興味深い。語彙、言語的特徴、スタイル埋め込み、通常の埋め込み、誤字、エラー、参考文献の変化を長期的に追跡すれば、集団レベルで学術的な執筆スタイルが変わったことは明らかだ。ただ、何がその変化を主導したのかを追跡するのはより難しいね。