作業レシピ

PDFから文字を取り出す

文字を選択できるPDFかスキャンPDFかをユーザーが判断しなくても、ブラウザ内で文字層を確認します。文字層があればそのまま抽出し、画像だけならページを描画して日本語と英語の印刷文字をOCRする一工程のワークフローです。

作業をここから進める

0 / 1 完了

  1. PDFの文字層を確認し、必要時だけOCRして原本と照合する

    現在

    文字層は直接抽出し、画像だけのページは端末内でOCRします。読む順番、固有名詞、数字、日付を原PDFと照合します。

この流れが向いている場面

  • 01

    文字を選択できるか分からないPDFから文字を取り出したいとき

  • 02

    スキャンPDFの文字を再入力せず使いたいとき

  • 03

    抽出文字を確認してTXTとして保存したいとき

完了前に確認すること

まず上のツール工程を実際に完了してください。ページを開いただけでは、確認項目を完了にできません。

PDFから文字を取り出すの最終確認

保存するのは確認項目数と確認時刻だけです。項目文、入力内容、ファイル、ファイル名は保存しません。

よくある質問

文字を選択できるPDFか、スキャンPDFかを選ぶ必要がありますか?

いいえ。ブラウザ内で文字層を確認し、文字があれば直接抽出します。画像だけのPDFに限ってOCRを準備します。

失敗したページがあっても保存できますか?

失敗ページを明示し、ユーザーが部分結果であることを確認した場合だけ保存できます。全ページ成功と誤表示しません。

PDFはアップロードされますか?

いいえ。文字層の確認、抽出、必要時のPDF描画とOCRはブラウザ内で行い、PDF、ファイル名、抽出文字を自動送信しません。