Detail aplikovaného výsledku

Software pro adaptabilní rozpoznávání textu starých tisků

HRADIŠ, M.; KIŠŠ, M.; KODYM, O.; KOHÚT, J.; BENEŠ, K.; BUCHAL, P.

Originální název

Software pro adaptabilní rozpoznávání textu starých tisků

Anglický název

Adaptive OCR for older printed documents

Druh

Software

Abstrakt

Tento Python balíček zapouzdřuje celý řetězec OCR včetně, analýzy rozložení stránky, detekci řádků, rozpoznání textu a dekódování textu s využitím jazykového modelu. Software je zaměřený na zpracování nekvalitních dokumentů (například digitalizovaných z mikrofilmů). Balíček poskytuje nástroj spustitelný z příkazové řádky i třídu, kterou je možné integrovat do vlastního software.

Abstrakt anglicky

This Python package implements the entire OCR pipeline, including page layout analysis, text line detection, text recognition, and text decoding using a language model. The software is focused on processing of low-quality documents (for example documents digitized from microfilms). The package provides a command-line tool and a class that can be integrated into your own software.

Klíčová slova

OCR, tištěné dokumenty, analýza rozložení stránky, automatický přepis textu, jazykový model, Python

Klíčová slova anglicky

OCR, printed documents, page layout analysis, text recognition, language model, Python

Umístění

https://github.com/DCGM/pero-ocr, pip https://pypi.org/project/pero-ocr/

Licenční poplatek

K využití výsledku jiným subjektem je vždy nutné nabytí licence

www

Dokumenty