Digitalizace papírových dokumentů pomocí multifunkční laserové tiskárny vyžaduje správné nastavení fyzikálních parametrů snímače, optimální volbu rozlišení a správný postup při manipulaci s papírem. Pochopením technických principů optického snímání a softwarového zpracování dosáhnete dokonale ostrých textů s minimální velikostí výsledných souborů.
Optické senzory a mechanika: Jak vzniká digitální obraz
Základem každého skeneru integrovaného v barevné laserové tiskárně je optický senzor, který převádí odražené světlo na elektrický signál. V moderních zařízeních pro domácnosti a kanceláře se nejčastěji setkáte s technologií CIS (Contact Image Sensor). Tento systém využívá řadu LED diod umístěných v bezprostřední blízkosti skleněné desky. Výhodou CIS senzorů je nízká spotřeba energie a kompaktní rozměry, avšak mají velmi nízkou hloubku ostrosti. Pokud dokument neleží dokonale ploše na skle, dochází k rozostření. Proto je klíčové při skenování z knih nebo zmačkaných papírů vyvinout na víko skeneru mírný tlak, aby se eliminovaly vzduchové mezery.
Pokročilejší zařízení mohou využívat technologii CCD (Charge-Coupled Device), která pracuje se systémem zrcadel a čoček. CCD senzory mají výrazně vyšší hloubku ostrosti, což umožňuje věrné skenování trojrozměrných objektů nebo otevřených knih bez rozmazání u hřbetu vazby. Bez ohledu na technologii je pro čistotu obrazu zásadní stav skleněné plochy. Každé zrnko prachu nebo otisk prstu láme světlo diod a vytváří na výsledném snímku nežádoucí šmouhy nebo čáry.
Automatický podavač dokumentů a mechanické limity
Pro digitalizaci vícestránkových dokumentů je klíčovým prvkem automatický podavač (ADF – Automatic Document Feeder). Mechanismus funguje na principu třecích gumových válečků, které oddělují jednotlivé listy ze stohu papíru a posouvají je přes snímací sklo. Zde rozlišujeme dva základní typy: jednoprůchodový (Single-pass ADF) a reverzní (RADF). Jednoprůchodový podavač obsahuje dva skenovací senzory, takže digitalizuje obě strany papíru současně při jediném průchodu. To dramaticky snižuje mechanické opotřebení dokumentu a urychluje celý proces.
Reverzní podavač musí papír mechanicky otočit a protáhnout zařízením znovu. Tento proces zvyšuje riziko zaseknutí papíru, zejména u tenkých nebo naopak velmi tuhých listů. Pro bezproblémový chod je nutné pravidelně čistit gumové podávací válečky isopropylalkoholem. Tím se odstraní papírový prach a mastnota, které způsobují prokluzování a šikmé vtahování stránek.
Volba rozlišení a barevného režimu pro maximální efektivitu
Častou chybou při skenování dokumentů je volba zbytečně vysokého rozlišení. Rozlišení se udává v jednotkách DPI (Dots Per Inch – bodů na palec) a určuje hustotu vzorkování obrazu. Pro běžný textový dokument určený k archivaci nebo odeslání e-mailem je optimální hodnotou 300 DPI. Tato hodnota poskytuje ideální poměr mezi čitelností, přesností rozpoznávání znaků a velikostí souboru.
- 150 DPI: Vhodné pro rychlé náhledy nebo čistě textové dokumenty bez drobných fontů, kde je prioritou minimální velikost souboru.
- 300 DPI: Standard pro úřední dokumenty, smlouvy a faktury. Tato hodnota je vyžadována softwarovými nástroji pro optické rozpoznávání znaků (OCR).
- 600 DPI a více: Určeno pro detailní grafiku, fotografie nebo historické dokumenty s jemným písmem. Pro běžnou administrativní práci je toto rozlišení neefektivní, protože generuje extrémně velké soubory, které zpomalují síťový přenos.
Důležitou roli hraje také volba barevného režimu. Skenování v plné barvě (24-bit) je nutné pouze u dokumentů s barevnými prvky, jako jsou loga nebo grafy. Pro standardní texty je mnohem výhodnější zvolit režim stupňů šedi (Grayscale) nebo černobílý režim (Bitonal / Lineart). Černobílý režim pracuje pouze s čistou černou a bílou barvou, což eliminuje šum na pozadí papíru a vytváří nejostřejší kontrast pro text.
Formáty souborů a příprava na softwarové zpracování (OCR)
Výběr výstupního formátu určuje, jakým způsobem bude digitální dokument dále využíván. Nejrozšířenějším formátem pro dokumenty je PDF (Portable Document Format). Pokud skener podporuje technologii prohledávatelného PDF (Searchable PDF), probíhá na pozadí proces OCR. Tento algoritmus analyzuje kontrastní tvary na naskenované stránce, porovnává je s databází znaků a převádí grafické body na skutečný textový řetězec. Výsledný soubor pak obsahuje jak vizuální obraz stránky, tak neviditelnou textovou vrstvu, která umožňuje vyhledávání klíčových slov a kopírování textu.
Pro archivaci obrázků bez ztráty kvality se používá formát TIFF, který nepoužívá ztrátovou kompresi. Naopak formát JPEG je kvůli kompresním algoritmům pro textové dokumenty nevhodný. Komprese JPEG totiž vytváří kolem ostrých hran písmen takzvané artefakty (drobné rozmazání), což výrazně zhoršuje čitelnost a úspěšnost následného OCR zpracování.