HN295
金額の数値が全部マイナスになっちゃうのはなぜ?
Why are all the amounts values negative?
4pkjai・6日前
Why are all the amounts values negative?
金額のデータを確認したところ、なぜかすべての値が負数(マイナス)として記録されています。この現象の原因と、正しく処理するための修正方法を教えてください。
PDFのテキストレイヤーが必ずしも表示されているコンテンツと一致するとは限らない、という良い例だね。
「黒以外は非表示」というルールを一般化するのは慎重になったほうがいいかも。生のテキスト抽出とフルOCRの中間案として、ページをレンダリングして、抽出された各グリフのバウンディングボックスをレンダリングされたピクセルにマッピングし、背景とのコントラストがほとんどないグリフを除外する、というやり方はどうだろう。
それなら表示されている文字の埋め込みテキストを正確に保持しつつ、可視性の判定にだけラスタライズを使えるはず。
こういうハイブリッドなアプローチを試した人はいるかな?
これって最後は続きが気になる終わり方をしてるの?
あと、彼らは一つの手法を試したのか、そのフィードバックはどうだったのか気になる。
PDFをOCRにかければいいじゃん。
それが確実だし、PDFのパースより複雑ってわけでもないでしょ。今となってはOCR技術の方がPDFのパースより優れている可能性すらある。PDFのパースって、本来自然じゃない複雑さが山積みだしね。
数字の直前にないマイナス記号は全部スキップしちゃえばいいんじゃない?見ての通りマイナス記号は全部数字の後ろについていて前にはないから、前についていないものは除外でいいはず。できれば数字と同じBT/ETブロック内にあるものに限るのが良さそう。