info:ocr

Différences

Ci-dessous, les différences entre deux révisions de la page.

Lien vers cette vue comparative

Les deux révisions précédentes Révision précédente
Prochaine révision
Révision précédente
info:ocr [2017/09/24 14:29] radeffinfo:ocr [2024/05/16 02:51] (Version actuelle) radeff
Ligne 4: Ligne 4:
 requiert tesseract: requiert tesseract:
  
-  sudo apt-get install tesseract +  sudo apt-get install tesseract-ocr tesseract-ocr-fra 
-<code>+   
 + <code>
 #!/usr/bin/bash #!/usr/bin/bash
 # pdf_ocr2txt # pdf_ocr2txt
Ligne 45: Ligne 46:
     tesseract page$i.png $OUTPUT$i -l fra     tesseract page$i.png $OUTPUT$i -l fra
 done</code> done</code>
-http://www.tristancollins.me/computing/ocr-using-tesseract-on-multipage-pdfs/ 
  
 +==== Liens ====
  
-http://code.google.com/p/tesseract-ocr/+  * https://github.com/tesseract-ocr/tesseract/blob/main/README.md 
 +  * http://www.tristancollins.me/computing/ocr-using-tesseract-on-multipage-pdfs/ 
 +  * https://azlinux.fr/tesseract/|Comment utiliser Tesseract pour extraire du texte à partir d'images
  
 marche nickel! marche nickel!
 +===== GUI =====
  
-par contre pas en russe, je suis à la recherche... y'a visiblement du monde qui y bosse:+Si on veut pas s'embêter avec la ligne de commande (et avec les formats de fichiers...
 +    sudo apt-get install gimagereader
  
-http://groups.google.com/group/tesseract-ocr-russian/+{{:info:ksnip_20220816-115703.jpg?nolink|}}
  
-http://groups.google.com/group/tesseract-ocr-russian/files+si on veut du russe il faudra installer le dictionnaire 
 +    sudo apt install hunspell-ru 
 +et bien sûr le dico français si vous ne l'avez pas déjà 
 +    sudo apt install hunspell-fr    
  
-voir aussi:+===== Russe =====
  
-http://code.google.com/p/owlboxer/+  * https://pyimagesearch.com/2020/08/03/tesseract-ocr-for-non-english-languages/ 
 +  * https://github.com/tesseract-ocr/tessdata/blob/main/rus.traineddata
  
 +    mv rus.traineddata /usr/share/tesseract-ocr/4.00/tessdata/
  
-===== Old =====+Ou encore plus simple 
 +    sudo apt-get install tesseract-ocr-rus
  
-, ocrad et gocr tentent de rattraper le retard linuxien en matière d'OCR +==== exemple de script bash pour le russe ==== 
- +<code bash    
-apt-get install ocrad gocr +#!/usr/bin/bash 
- +# ocr-ru: convert (optical character recognition) jpg russian voc to text/csv file 
-Faut avouer que c'est moins performant que les produits windaube... +usage: ocr-ru then translate it and drill it with anki 
- +copyleft radeff.red - use it at your own risk! 
-Un petit script pratique pour ocrad (que je préfère nettement à gocr, notamment plus rapide) +ladate=$(date +'%Y%m%d'
- +echo "ocr which russian image?" 
- +ls *.jpg 
-ocr.sh +read i 
-<code> +convert $i $i.png 
-#! /bin/bash +tesseract $i.png $ladate -l rus 
-# ocr.sh +rm $i.png 
-Usage: +echo "conversion ok, edit "$ladate".txt now
-ocr.sh +#delete empty lines 
-script bash pour convertir des fichiers images en *.pbm et les traiter ensuite automatiquement avec le  +sed -'/^$/d' $ladate.txt 
-# logiciel de reconnaissance optique de caractères (OCRocrad pour en extraire un fichier texte +#delete line with only spaces 
-# Required: convert, ocrad +sed -i '/^ *$/d' $ladate.txt 
-# FR, fradeff@akademia.ch, www.unige.ch +#delete end line with strange char from whatsapp 
-# History  2008/10/29, created FR +sed -i '/^ $/d' $ladate.txt 
-############ +mv $ladate.txt $ladate.csv 
-# se placer dans le répertoire dans lequel on a stocké les pages scannées ou photographièes, ici des fichiers JPG +geany $ladate".csv"& 
-mkdir pbm #cree un rep de travail +
-find . -name "*.JPG" | while read i #trouve les fichiers JPG +
-do +
- convert $i pbm/$i.pbm #les convertit dans un format accepte par ocrad via convert +
-done +
-echo "Tous les fichiers images ont été convertis+
- +
-cd pbm #va dans le rep de travail +
-find . | while read +
-do +
- ocrad $i >> result.txt #fait l'OCR +
-done +
- +
-echo "Voici le résultat:" +
-more result.txt+
 </code> </code>
- 
  • info/ocr.1506256151.txt.gz
  • Dernière modification : 2017/09/24 14:29
  • de radeff