スキャンPDF・画像PDF

スキャンPDFをMarkdown(マークダウン)に変換

画像だけのPDFでも、日本語を指定してOCRを実行できます。文字だけでなく、見出し、表、数式、読み順を再構成し、選択・検索できるMarkdownとして出力します。

要点

画像PDFを、編集できるMarkdownへ

スキャンPDFはページ全体が画像なので、そのままコピーしても文字を取得できません。PDF to Markdownは画像だけのページを検出してOCRを実行し、認識した文字を文書構造とともにMarkdownへ変換します。日本語の請求書、契約書、論文、官公庁資料にも使えます。既存のテキスト層が壊れているPDFでは、OCRを強制してページ画像から読み直せます。

使い方

4ステップで変換します

登録は不要です。画像だけのPDFではOCRが自動で実行され、壊れたテキスト層がある場合はOCRを強制できます。

1

変換画面を開く

Chrome拡張機能を追加するか、Web変換ツールを開きます。アカウント登録なしでも利用できます。

2

PDFとOCR言語を選ぶ

ファイルをドロップするか、PDFのURLを貼り付けます。日本語文書ではOCR言語に「日本語」を選びます。

3

変換を待つ

状態は queued、processing、ready の順に進みます。OCRはデジタルテキストの抽出より時間がかかります。

4

確認して保存する

レンダリング済み表示とRaw表示の両方で内容を確認し、コピーするか .md ファイルをダウンロードします。

変換結果

文書構造を保ったMarkdown

日本語OCR

日本語をリクエスト単位で指定できます。英語や欧州言語が混在する文書にも対応します。

実際の表

スキャンされた列を、位置の崩れた文字列ではなくMarkdownの行とセルへ再構成します。

数式を維持

数式を単なる文字列へ平坦化せず、可能な範囲で記法と文脈を保ちます。

OCRを強制

埋め込みテキストが文字化けしている場合は、既存レイヤーを使わず画像から読み直せます。

読み順を復元

段組みページでも、段落が交互に混ざらないように読み順を組み立てます。

MinerU / Docling

文書の種類に応じて変換エンジンを選べます。既定のMinerUはスキャンに強い構成です。

精度を上げるポイント

鮮明でまっすぐな原稿を使います

OCRは画像を読むため、入力画像の品質がそのまま結果へ影響します。300 DPI前後以上、濃い文字、均一な背景、傾きの少ないページが理想です。

良い結果になりやすい条件

印刷文字が鮮明で、ページが正立し、文字と背景のコントラストが十分にあるPDFです。デジタルページとスキャンページが混ざるPDFも処理できます。

確認が必要な条件

低解像度、影、傾き、手書き文字は精度が下がります。結果が一部の場合は truncated が付きます。長い文書は分割するか、処理時間枠の長いプランを使います。

認識された表は、そのまま貼り付けや索引化に使えるMarkdownで返ります。

| Quarter | Revenue | Growth |
| ------- | ------- | ------ |
| Q1      | $1.2M   | +8%    |
| Q2      | $1.4M   | +17%   |
日本語PDFの注意点

縦書きは読めますが、必ず確認してください

実測ではMinerUの日本語モデルは縦書きの読み順をおおむね正しく復元しました。ただし、句読点や改行が失われたり、一部の文字を落としたりする場合があります。ふりがな、手書き、複雑なルビは特に難しいため、重要文書ではRaw表示と原本を照合してください。

プライバシー: 無料プランは3スロット、最大10 MB、処理時間枠15分、保存期間1時間です。ファイルは保存期間後に自動削除され、モデル学習には使用されません。

コードやAIエージェントから変換しますか?

同じ変換処理をREST APIとホスト型MCPから利用できます。サーバーのメッセージ、エンドポイント、契約値は原文のままです。

FAQ

よくある質問

スキャンPDFをMarkdownに変換できますか?

はい。画像だけのPDFをOCRで読み取り、選択・検索できるMarkdownへ変換します。別のOCRソフトは不要です。

日本語OCRを指定できますか?

はい。変換画面のOCR言語で日本語を選べます。デジタルテキストのページには影響せず、スキャン部分の認識に使われます。

縦書きやふりがなにも対応しますか?

縦書きの読み順はおおむね復元できますが、句読点、改行、一部文字の欠落が起こることがあります。ふりがなは要確認です。

表と数式は残りますか?

はい。表はMarkdownの行とセルへ再構成され、数式は可能な範囲で記法を保ちます。複雑なページは原本との確認を推奨します。

文字化けしたテキスト層は直せますか?

OCRを強制すると、壊れた埋め込みテキストを使わず、ページ画像を読み直せます。

無料で使えますか?

はい。無料プランは登録不要で、3スロット、最大10 MB、処理時間枠15分、保存期間1時間です。

結果にtruncatedと表示されるのはなぜですか?

長いスキャンが処理時間枠に達し、一部結果が返されたためです。PDFを分割するか、処理時間枠の長いプランを使います。

OCRにはどの程度のスキャン品質が必要ですか?

300 DPI前後以上で、文字が鮮明、コントラストが十分、傾きの少ない原稿が理想です。

手書き文字を読めますか?

印刷文字を主な対象としています。整った手書きの一部は読める場合もありますが、精度は保証されません。