今こそLLMに「ACMデジタルライブラリ」へのアクセス権を与えるべき時だ
Now is the time to give LLMs access to the ACM digital library
Now is the time to give LLMs access to the ACM digital library
LLMの進化が加速する中、信頼性の高い学術的知見をいかに統合するかが重要になっています。ACMデジタルライブラリへのアクセスをLLMに解禁することで、AIの回答精度を飛躍的に高め、最新のコンピュータサイエンス研究をより身近なものにできるはずです。
たぶんもうスクレイピングされてるだろ。
ACMはここ1年、ジャーナルにAI生成コンテンツをかなり多用してるけど、今回の記事も例外じゃないね。100%AI生成っぽくて、LLM特有の言い回しが満載だ。笑える話だけど、同時に自分の尻尾を食う蛇みたいな状況でもあるな。
人間にアクセス権を与えたらどうだ?
ロコのバジリスク的な何か。
ACMライブラリに論文を多数出している研究者として言わせてもらうと、これは偽善の極みだ。弁護士ならACMの出版契約やクリエイティブ・コモンズ・ライセンスの条項を読み解いて、これが許容されるかどうか判断できるだろうさ。でもACMは企業じゃなくて、科学者を代表するために1947年に設立された非営利団体なんだよ。もし会員にアンケートをとって、過半数が賛成するなんてことはまずありえないだろうね(そもそもACMはそんな民主的なことで知られていないし)。書籍の著者と同様、俺たちはテック大手がモデルを学習させるための知識や専門性を提供している側の人間だけど、見返りはゼロだ。実際、状況は悪化する一方だよ。学生のAI利用で大学の業務負担は増えるし、査読システムは完全に崩壊してる。だからこそ、今もっとも優先順位が低いライセンスの問題ばかり考えているACMの現状には皮肉を感じるよ。
アクセスをブロックしたって、ルールを守る人が損するだけだ。ブロックを解除すれば、ルールを破る連中と対等に戦えるようになる。どっちが正しい選択かは明らかだと思うけどね…
ACMの記事のparquetダンプをHugging Faceにアップロードした方がいいんじゃない?人間を模倣するLLMのせいで、俺が使ってるサイトの多くはスクレイピングの帯域コストを理由にLLMを禁止したんだ。これはアクセス権の問題なのか、それとも(例えば)Claudeへのアクセシビリティの問題なのか。人類のコンピュータ知識の総量なんて、そこまで大きくないはずだしな。
どういう仕組みにするのかよく分からないな。ACMのことは知らないけど、IEEEだと出版権を彼らに譲渡しないといけない。でも、LLMの学習って出版そのものなのか、それとも二次的著作物にあたるのか?いずれにせよ、今の段階では出版社じゃなくて著者が対価を得る権利があるはずだ。話が全然違うんだよ。
映画『ゼア・ウィル・ビー・ブラッド』の「俺がお前のミルクシェイクを飲み干してやる」っていうシーンを思い出したわ。ACMは本気で、LLMが他のソース経由ですでにコンテンツの9割を学習済みだと思ってないのか?
オープンウェイトのモデルには無料で提供して、クローズドウェイトのモデルからは料金を取ればいい。簡単だろ。