日本語PDFの実測記録 更新・2026年9月6日
変換のあとPDFから、その先へ。
← トップへ

初回の検証結果

単純な表は一致。
結合セルには、補完が必要だった。

pdfplumber 0.11.9で、自作の日本語PDFを4種類試しました。数字の文字列が一致していても、すぐに集計できるとは限りません。

変換のあと(AI支援による制作) / 検証日:2026-09-05
このページは一つの抽出ライブラリの基準試験です。商用ソフト同士の比較や、おすすめ順位ではありません。

結果の一覧

資料入力の特徴本文セルの完全一致数値内容の一致確認できたこと
T1単純な日本語表120 / 12060 / 60本文セルの文字列は一致
T2結合セル・複数行の表42 / 4824 / 246セルの補完が必要
T4先頭ゼロ・数値・日付の表48 / 4824 / 24本文セルの文字列は一致
T3画像だけのPDF(対照試験)0 / 120抽出なしOCRなしでは表を抽出できず

本文のみを管理番号で照合。見出し・注記は採点対象外です。数値内容の一致は桁区切りを外して比較したもので、Excel上の数値型の一致ではありません。T3は表が抽出されず、一致セルは0としています。

「数字が合う」と「集計できる」は別

T1とT4は本文の文字列がすべて一致しました。しかし、今回の抽出直後の値は文字列です。先頭ゼロを残す管理番号と、計算に使う金額・数量では、Excelへ渡す際に必要な扱いが異なります。

T2では数量・単価・金額の24セルはすべて一致。一方、縦結合された分類を一行ずつ持たせるには、6セルを補完する必要がありました。これは分類の文字を読めなかったという意味ではなく、結合された構造を集計用の表へ展開する作業です。

結合セルの実例を見る →

画像だけのPDFは、今回の方法では抽出できず

T3はT1を画像にしてPDFに埋め込んだ対照資料です。見た目は同じでも、内部に文字の情報を持ちません。今回のOCRなしの処理では、表は0件でした。OCR機能がある製品の精度は、この試験からは判断できません。

時間と再現性について

各PDFを3回ずつ開いて抽出し、3回とも同じ出力でした。記録した時間はプログラムの抽出処理だけです。設定、Excelへの読み込み、型の変換、人による確認・修正は含みません。人の修正時間は未測定のため、時短効果は掲載していません。

抽出処理の測定値を見る
資料1回目(秒)2回目(秒)3回目(秒)中央値(秒)
T10.06310.06210.06440.0631
T20.03650.03540.03770.0365
T40.03420.03660.03770.0366
T30.00390.00270.00260.0027

短い処理のため測定の揺れが影響します。この数字を製品選びや人の作業時間の比較には使いません。

今回の結論

罫線のある単純な自作表では文字列を取り出せました。集計まで進めるには、結合セルの展開と列ごとの型の設定が必要です。画像PDFは別の方法を検証する必要があります。

この結果だけでは有料ソフトを買う理由はまだ確認できていません。今後、同じ入力を使って、出力の型や補完の手間を含めて比較します。

資料と出典

入力PDF・正解・抽出直後のファイルpdfplumber公式ドキュメント
9月6日追加:AdobeオンラインのT1出力を取得・照合しました。値・型・表示形式の実測と配布資料を見る →