AIで古文書を解析したら、新種の隕石から絶滅危惧種のサイまで次々と発見!
Pointing AI at archives found a forgotten meteorite, lost rhinos, and more
Pointing AI at archives found a forgotten meteorite, lost rhinos, and more
AI技術を膨大なアーカイブデータに活用することで、これまで見過ごされてきた歴史的な隕石の痕跡や、行方不明となっていたサイの個体群が再発見されるなど、驚きの成果が上がっています。まさに宝の山をAIが掘り起こしている状況です。
こうした研究を誰でもできるようにするため、今回の調査で作成したワークフローを「Antiquity」という小さなツールキットとしてオープンソース化したよ。質問とコーディングエージェントさえあれば、誰でも同じような歴史的アーカイブ調査ができるはず。https://github.com/jessewaites/antiquity
めちゃくちゃ良いね。自分も現代の政治意見メディアを対象にした似たようなプロジェクトをやってるよ。ポッドキャストやブログ、論説記事などを細かく分解して、構造や話し手、引用、名詞を抽出してクロスリファレンスを作成してる。あえてこれを持ち出したのは、歴史的文書に対してもこれくらい重厚な前処理をやる価値があるんじゃないかと思ったから。最初はかなりコストがかかるけど、その後は現在のシステムよりもずっと安く質問に答えられるようになるはず。興味のある人たちを集めて、構造化パースの投資を共同で行うのもアリかもしれないね。あと、現代の文字起こしと歴史文書のスキャンには、スペルミスへの対応や文脈からの修正推論という共通した課題があるよね。
個人的な意見だけど、回転するサイや隕石の衝突、アニメーションするフローチャートなんて、ただの無駄な装飾でしかないよ。まるでパロディみたいに見えるし。この先もこんな調子だと、いずれ「AAAエフェクト」を多用したこういう代物も、90年代の「工事中」バナーGIFみたいな扱いになると思う。
最近の関連トピック(HNのユーザーである benbreen によるもの!)
Opus 5.5を使ってドードーの新たな目撃記録を発見する - https://news.ycombinator.com/item?id=49926917 - 2026年10月(コメント79件)
「もし自分がオランダ東インド会社の文書を一人で読もうとしたら、1ページ2分、1日8時間、週5日のペースで70年かかる。新聞を除いてもね。それが自分の自作AIラボなら、一晩12時間の実行でアーカイブ全体を処理しきれた」
これを見て、筆者自身はオランダ東インド会社について一体どれだけ学んだんだろうって疑問に思った。正直、ほとんど何も学んでないんじゃないかな。こういう作業ってジャンクフードみたいに感じてしまうんだよね。カロリーはあっても中身がないというか...
すごく面白い読み物で、本当に楽しませてもらった。文字通り、失われた知識を探求してるような感覚。素晴らしい仕事と記事だったよ。
美的センスも好きだし、ちょっとしたエフェクトも良かった(隕石と火山はいいけど、サイの回転やその周りを流れるテキストは直したほうがいいかも)。
こういうアーカイブから他に何が見つかるか気になるね。アイデアをいくつか:
(編集:整形)
これ最高だね。人類の協力や進歩を阻む大きな摩擦の一つに、言語がバラバラなジャーナルの存在があると思ってる。
あまり知られてないけど、Wikipediaでさえ言語間での記事の正規化なんて全然できてないんだよね。言語切り替えボタンは翻訳を表示してるように見えるけど、実際には全く別の百科事典コミュニティが運営していて、他の言語の記事や参考文献との相互参照なんて一切ない。英語版ではスタブ(短い記述)しかない記事が、他の言語では詳細な論文並みに充実してることもよくあるし、サイトの仕組み上それを知る術もない。
LLMなら言語を直接理解していなくても、単語の関連性を突き止めて全言語間で比較できるはず。
今回このエンジニアが見つけたように、この分野にはまだまだ手つかずの果実がたくさん転がってると思うよ。
悪いけど、彼が記録に残ってなかった火山の噴火を発見したって?それと400年前の「絶滅したドードーの新たな目撃記録」を見つけた?どうもこれらの主張はかなり胡散臭く聞こえるんだけど。