Přístupnostní navigace
E-přihláška
Vyhledávání Vyhledat Zavřít
Detail aplikovaného výsledku
HRADIŠ, M.; KIŠŠ, M.; KODYM, O.; KOHÚT, J.; BENEŠ, K.; BUCHAL, P.
Originální název
Software pro adaptabilní rozpoznávání textu starých tisků
Anglický název
Adaptive OCR for older printed documents
Druh
Software
Abstrakt
Tento Python balíček zapouzdřuje celý řetězec OCR včetně, analýzy rozložení stránky, detekci řádků, rozpoznání textu a dekódování textu s využitím jazykového modelu. Software je zaměřený na zpracování nekvalitních dokumentů (například digitalizovaných z mikrofilmů). Balíček poskytuje nástroj spustitelný z příkazové řádky i třídu, kterou je možné integrovat do vlastního software.
Abstrakt anglicky
This Python package implements the entire OCR pipeline, including page layout analysis, text line detection, text recognition, and text decoding using a language model. The software is focused on processing of low-quality documents (for example documents digitized from microfilms). The package provides a command-line tool and a class that can be integrated into your own software.
Klíčová slova
OCR, tištěné dokumenty, analýza rozložení stránky, automatický přepis textu, jazykový model, Python
Klíčová slova anglicky
OCR, printed documents, page layout analysis, text recognition, language model, Python
Umístění
https://github.com/DCGM/pero-ocr, pip https://pypi.org/project/pero-ocr/
Licenční poplatek
K využití výsledku jiným subjektem je vždy nutné nabytí licence
www
https://www.fit.vut.cz/research/product/666/
Dokumenty
Uživatelský manuál