Vestigia Scriptorium
Články
Naučte se připravit Ground Truth, natrénovat HTR model a vyhodnotit přepis historických rukopisů. Praktické návody pro Transkribus, eScriptorium a Kraken.
Trénování HTR modelů pro rozpoznávání historických rukopisů
Handwritten Text Recognition (HTR) je technologie určená k automatickému rozpoznávání rukopisného textu z digitálních obrazů dokumentů. Na rozdíl od klasického OCR, které bylo historicky zaměřeno především na tištěné předlohy, musí HTR pracovat s výrazně větší variabilitou znaků, slov a celých písařských stylů. Stejné písmeno může mít v rukopisu mnoho podob a jeho vzhled se mění nejen mezi jednotlivými písaři, ale také podle okolních znaků, použitého psacího nástroje, období vzniku dokumentu nebo fyzického stavu předlohy.
Číst článek HTR · 02Praktický postup: jak natrénovat první HTR model
Vytvoření vlastního HTR (Handwritten Text Recognition) modelu nemusí vyžadovat znalost programování nebo strojového učení. Základní princip spočívá v tom, že systému předložíme dostatečný počet obrazů řádků rukopisu společně s jejich správným přepisem. Tato dvojice – obraz dokumentu a jeho ověřená transkripce – tvoří tzv. Ground Truth (GT), tedy referenční data, z nichž se model učí.
Číst článek HTR · 03Praktický příklad: vytvoření HTR modelu pro jednu archivní knihu
Představme si, že máme digitalizovanou pozemkovou knihu o rozsahu 300 stran. Kniha vznikala během několika desetiletí a obsahuje zápisy několika písařů. Cílem není vytvořit diplomatickou edici celého pramene, ale získat dostatečně kvalitní automatický přepis, v němž bude možné vyhledávat jména osob, místní názvy, čísla usedlostí a další údaje.
Číst článek HTR · 04Příprava testovacího prostředí pro práci s HTR
Než začneme vytvářet vlastní Ground Truth a trénovat HTR model, je vhodné připravit oddělené testovací prostředí, ve kterém lze bezpečně experimentovat s digitalizovanými dokumenty, modely a nastavením jednotlivých nástrojů.
Číst článek