info:ocr

Ceci est une ancienne révision du document !


Reconnaissance optique de caractères

PDF > txt directement avec un script bash linux

un grand merci à Frans de Jonge pour son excellent script: http://fransdejonge.com/2012/04/ocr-text-in-pdf-with-tesseract/

#!/bin/bash
#ocrpdftotext
# Simplified implementation of http://ubuntuforums.org/showthread.php?t=880471
# mod Frans de Jong http://fransdejonge.com/2012/04/ocr-text-in-pdf-with-tesseract/
# mod Fred Radeff, akademia.ch
# usage: ocrpdftotext PutYourFilename.pdf
# Might consider doing something with getopts here, see http://wiki.bash-hackers.org/howto/getopts_tutorial
DPI=300
#TESS_LANG=nld
#adapt to french
TESS_LANG=fra

FILENAME=${@%.pdf}
SCRIPT_NAME=`basename "$0" .sh`
TMP_DIR=${SCRIPT_NAME}-tmp
OUTPUT_FILENAME=${FILENAME}-output@DPI${DPI}

mkdir ${TMP_DIR}
cp ${@} ${TMP_DIR}
cd ${TMP_DIR}

convert -density ${DPI} -depth 8 ${@} "${FILENAME}.tif"
tesseract "${FILENAME}.tif" "${OUTPUT_FILENAME}" -l ${TESS_LANG}

mv ${OUTPUT_FILENAME}.txt ..
rm *
cd ..
rmdir ${TMP_DIR}

absolument génial, de l'ordre de 90% et plus… jetez-vous dessus

2e version

#!/usr/bin/bash
# pdf_ocr2txt
ls *.pdf | while read i
do
	echo "converting pdf file: " $i " to tif file " $i.tif
	convert -density 400 -depth 8 $i $i.tif
	echo "-----"
	echo "Generating txt file " $i.txt
	tesseract $i.tif $i.txt -l fra
done

, ocrad et gocr tentent de rattraper le retard linuxien en matière d'OCR

apt-get install ocrad gocr

Faut avouer que c'est moins performant que les produits windaube…

Un petit script pratique pour ocrad (que je préfère nettement à gocr, notamment plus rapide)

ocr.sh

#! /bin/bash
# ocr.sh
# Usage:
# ocr.sh
# script bash pour convertir des fichiers images en *.pbm et les traiter ensuite automatiquement avec le 
# logiciel de reconnaissance optique de caractères (OCR) ocrad pour en extraire un fichier texte
# Required: convert, ocrad
# FR, fradeff@akademia.ch, www.unige.ch
# History  2008/10/29, created FR
############
# se placer dans le répertoire dans lequel on a stocké les pages scannées ou photographièes, ici des fichiers JPG
mkdir pbm #cree un rep de travail
find . -name "*.JPG" | while read i #trouve les fichiers JPG
do
	convert $i pbm/$i.pbm #les convertit dans un format accepte par ocrad via convert
done
echo "Tous les fichiers images ont été convertis"

cd pbm #va dans le rep de travail
find . | while read i
do
	ocrad $i >> result.txt #fait l'OCR
done

echo "Voici le résultat:"
more result.txt
  • info/ocr.1434439424.txt.gz
  • Dernière modification : 2015/06/16 09:23
  • de radeff