2026年8月8日(土)掲載 3,372本日 29
HN295

金額の数値が全部マイナスになっちゃうのはなぜ?

Why are all the amounts values negative?

4pkjai6日前

議論

5
1engkimo5日前

PDFのテキストレイヤーが必ずしも表示されているコンテンツと一致するとは限らない、という良い例だね。

「黒以外は非表示」というルールを一般化するのは慎重になったほうがいいかも。生のテキスト抽出とフルOCRの中間案として、ページをレンダリングして、抽出された各グリフのバウンディングボックスをレンダリングされたピクセルにマッピングし、背景とのコントラストがほとんどないグリフを除外する、というやり方はどうだろう。

それなら表示されている文字の埋め込みテキストを正確に保持しつつ、可視性の判定にだけラスタライズを使えるはず。

こういうハイブリッドなアプローチを試した人はいるかな?

2happymellon4日前

これって最後は続きが気になる終わり方をしてるの?

あと、彼らは一つの手法を試したのか、そのフィードバックはどうだったのか気になる。

3TZubiri約6時間前

PDFをOCRにかければいいじゃん。

それが確実だし、PDFのパースより複雑ってわけでもないでしょ。今となってはOCR技術の方がPDFのパースより優れている可能性すらある。PDFのパースって、本来自然じゃない複雑さが山積みだしね。

4deepsun約5時間前

数字の直前にないマイナス記号は全部スキップしちゃえばいいんじゃない?見ての通りマイナス記号は全部数字の後ろについていて前にはないから、前についていないものは除外でいいはず。できれば数字と同じBT/ETブロック内にあるものに限るのが良さそう。