JOURNAL
手書き日本語をOCRで読むには|試す資料と校正範囲の決め方
手書きOCRは文字の癖や資料の状態で結果が変わります。検索の補助にする場合と正確な翻刻が必要な場合を分け、代表ページの試行、原画像との照合、読めない箇所の残し方を解説します。
公開日:2025-10-21
更新日:2026-09-27
執筆・編集:複写 HUKUSYA

手書きの台帳や手紙を文字で検索できれば、資料を探す負担が減ります。ただし、OCRで得た文章を原文そのものとして扱うのは慎重に考える必要があります。読めそうな文章に見えても、人名、地名、数字が違っていることがあるからです。
検索の補助か、正確な書き起こしかを決める
OCRは画像の文字を機械で読み取る処理です。資料の所在を探すための検索用テキストと、展示や刊行物に載せる校正済みの文章では、必要な確認の深さが違います。最初に用途を決めると、どこまで人が読むかを見積もれます。
手書きの癖、続け字、旧字体、にじみ、裏写りなどによって難しさは変わります。国立国会図書館の「資料デジタル化の手引」でも、文字の種類による認識精度や校正工数の違いが扱われています。特定の文字サイズや角度だけで、結果を保証することはできません。資料デジタル化の手引(2011年版)
読みやすいページだけで試さない
全体を処理する前に、資料の特徴が違うページを選びます。例えば、筆者が違う手紙、薄い文字のページ、訂正が多い台帳、縦書きと横書きが混じるページです。試行には、実際に使う原画像と処理方法を使ってください。
- 人名・地名・日付は正しく読めるか。
- 行の順序や表の項目の対応が保たれるか。
- 欄外注記や印影が本文に混じっていないか。
- 読めない部分が抜けるのか、別の文字になるのか。
修正にかかった時間も記録すると、残りの作業量を考えやすくなります。自動処理の時間だけで比較せず、確認と直しを含めて判断します。草書などでは、OCRを繰り返すより、読める人による翻刻や目録作成を検討した方がよい場合もあります。
原画像と確認結果を離さない
資料IDとページ番号を、画像とテキストの両方へ付けます。元の書き方を残す翻刻と、現代の表記へ直した説明文は別に保存しましょう。読みやすくするために言葉を補った場合は、補足であることが分かるようにします。
読めない文字を文脈だけで確定させず、「判読不能」「要確認」などの記号を先に決めます。推定した読みには推定と分かる注記を付け、確認者と日付を残します。特に金額や年月日など、間違いの影響が大きい項目は、検索用であっても利用時に原画像へ戻れるようにしてください。
処理する前に資料の安全と共有範囲を確認する
OCRに都合よくするため、弱った紙を無理に平らにしたり、書き込みを消したりしてはいけません。まず原物の状態を記録し、補正は原画像の複製へ行います。保存用画像と文字認識用画像を分ければ、薄い筆跡を処理で失っても比較できます。
クラウドへ画像を送る場合は、私信や住所などの情報を含むか、外部サービスで処理してよい資料かを管理者と確認します。複写への相談では、文字認識まで必要か、画像として残せばよいか、どの範囲を人が確認するかをお知らせください。OCR・翻刻の対応範囲は個別に確認し、資料の状態に合う記録方法からご相談を承ります。




