作業レシピ
PDFから文字を取り出す
文字を選択できるPDFかスキャンPDFかをユーザーが判断しなくても、ブラウザ内で文字層を確認します。文字層があればそのまま抽出し、画像だけならページを描画して日本語と英語の印刷文字をOCRする一工程のワークフローです。
作業をここから進める
0 / 1 完了
PDFの文字層を確認し、必要時だけOCRして原本と照合する
現在文字層は直接抽出し、画像だけのページは端末内でOCRします。読む順番、固有名詞、数字、日付を原PDFと照合します。
この流れが向いている場面
- 01
文字を選択できるか分からないPDFから文字を取り出したいとき
- 02
スキャンPDFの文字を再入力せず使いたいとき
- 03
抽出文字を確認してTXTとして保存したいとき
完了前に確認すること
まず上のツール工程を実際に完了してください。ページを開いただけでは、確認項目を完了にできません。
保存するのは確認項目数と確認時刻だけです。項目文、入力内容、ファイル、ファイル名は保存しません。
よくある質問
文字を選択できるPDFか、スキャンPDFかを選ぶ必要がありますか?
いいえ。ブラウザ内で文字層を確認し、文字があれば直接抽出します。画像だけのPDFに限ってOCRを準備します。
失敗したページがあっても保存できますか?
失敗ページを明示し、ユーザーが部分結果であることを確認した場合だけ保存できます。全ページ成功と誤表示しません。
PDFはアップロードされますか?
いいえ。文字層の確認、抽出、必要時のPDF描画とOCRはブラウザ内で行い、PDF、ファイル名、抽出文字を自動送信しません。