PDFを画像へ変換
DPIと形式を選び、最大30ページを元の順番で1枚またはZIPへ出力します。
PDFをJPG/PNG/WEBPへ変換し、用紙背景の除去、傾き・遠近補正、情報のマスキング、署名・印影抽出、多言語OCRを端末内で行います。
ページ抽出、スキャン補正、形状補正、プライバシー、OCR、結果出力を1つの標準エンジンで処理します。
必要な出力から選んでください。画像で十分な場合はOCRを使わず、マスキングはプレビューだけでなく出力ファイルを開いて確認します。
DPIと形式を選び、最大30ページを元の順番で1枚またはZIPへ出力します。
グレースケール、二値化、灰色背景除去、回転、傾き、遠近補正をOCRや保存前に適用します。
見える情報を隠し、対応12言語のいずれかを認識して、テキスト、基本TSV、検索可能PDFへ出力します。
画面キャプチャではなく、PDF.jsが指定DPIでページを描画します。
書類フィルターは用紙とインクを分離しますが、非常に細い線を消すことがあります。
元画像の四隅を新しい長方形画像へ対応付けます。
選択範囲を覆った新しいラスター画像を作成します。
署名は暗さ、印影は赤色の強さを使って透明部分を作成します。
PDFページを先に描画し、各Canvasを端末内のOCR Workerで認識します。
PDF.js、Canvas、OCR Workerが端末内でPDF/画像を読み込み、重いライブラリとモデルは選択した処理でのみ読み込みます。
Tool Officeのサーバーへ書類を送るAPIはなく、結果は端末内のBlobとして作成されます。
描画、フィルター、切り抜き、マスキング、OCRはプレビューと出力で確認できます。
最大30ページ/画像、1ファイル25 MB、共通Canvas上限によりタブ停止のリスクを抑えます。
いいえ。ファイルはブラウザ内で処理されます。TesseractがCDNからコードや言語モデルを取得する場合がありますが、画像をOCRサービスへ送信しません。
軽いプレビューは150 DPI、バランスは200 DPI、印刷や小さい文字のOCRは300 DPIが目安です。高DPIほどメモリと容量が増えます。
傾き補正は文字行を水平にするため数度回転します。遠近補正は四隅を対応付け、斜めから撮影した台形の用紙を平らにします。
十分とは限りません。黒塗りでラスター化する方が明確ですが、必ず出力ファイルを開き直して確認してください。
いいえ。解像度、フォント、文字、照明、傾き、スキャン品質によって変わります。氏名、数字、日付、金額を必ず確認してください。
PDF.jsが各ページをCanvasへ描画し、Tesseract Workerが画像を認識します。Tesseract.jsはPDFを直接読み込みません。
ページ画像を保持し、検索・選択用のOCR文字レイヤーを追加したPDFです。文字レイヤーにはOCRと同じ認識誤りが含まれる場合があります。
安定して処理できません。暗号化PDFはパスワードを求めるか描画に失敗する場合があります。本ツールはPDFのパスワードを解析・解除しません。