(openPR) OCR Software und Add-On Module erzeugen durchsuchbare PDF´s
Viele Dokumente sind jedoch noch immer in Papierform vorhanden bzw. kommen über die Eingangspost in das Unternehmen. Auch diese Dokumente müssen einer elektronischen Verarbeitung und Archivierung zugänglich gemacht werden. Diese Dokumente werden über angeschlossene Scanner oder Multifunktionsgeräte erfaßt, nachbearbeitet und beschlagwortet. Auch dafür ist das PDF bzw. besser noch das PDF/A Dokumentenformat ideal geeignet.
Wir sind oft genug mit der Anforderung konfrontiert, einen bestehenden Dokumentenbestand in ein DMS/ECM System zu importieren. Die Dokumente liegen in unterschieldichsten Formaten und meist in großer Menge im Dateisystem. Neben den üblichen MS-Office Formaten werden aber immer öfter auch PDF Dokumente abgelegt. Scans werden heute üblicherweise auch bereits als PDF gespeichert. Bei der Übernahme / Import möchte man nun alle vorhandenen PDF Dokumente durchsuchbar machen, damit man später möglichst einfach auch über den Inhalt der Dokumente suchen kann.
Es wäre nun möglich, einfach alle vorhandenen PDF Dokumente durch eine OCR Verarbeitung (z.b. AutoOCR) zu “schicken”, unabhängig davon ob die PDF Datei bereits durchsuchbar ist oder nicht. Das ist natürlich technisch möglich da bei der OCR Verarbeitung jede PDF Datei verarbeitet werden kann, egal wie diese erstellt wurde. Diese Vorgangsweise ist jedoch nicht sehr sinnvoll da, z.B. eine per PDF Druckertreiber aus einer Anwendung erzeugte Datei, bereits eine durchsuchbare PDF Datei ist und jede zusätzliche OCR Verarbeitung die Datei nur größer macht, sowie Verarbeitungszeit als auch Seiten der OCR Lizenz kostet. Und das kann je nach Verteilung und Anzahl der PDF Dokumente ein wesentlicher Zeit- und Kostenfaktor sein.
Deswegen sollte man jedenfalls nur jene PDF Dokumente einer OCR Verarbeitung unterziehen die diese wirklich auch benötigen. Aus diesem Grund stellen wir das kostenlose Tool PDFFilter zur Verfügung mit dem gezielt diese Dokumente gefunden und herausgefiltert werden können.
Mehr Information und den Download finden Sie hier:
http://www.scan2pdf.at/de/pdf-filter-ocr.html
Damit das digitalisieren von Dokumenten auf "Knopfdruck" funktionieren kann haben wir auch unser Produkt DirectScan erweitert.
DirectScan dient dazu möglichst einfach und schnell ohne viel Aufwand ein Dokument über einen angeschlossenen TWAIN/WIA Scanner zu scannen und als PDF / TIFF oder JPEG Datei im Dateisystem zur Verfügung zu stellen. Softwareentwickler können eigene Anwendungen mit Hilfe der Commandline-, .NET- oder Active-X-Schnittstelle ohne viel Aufwand um Scanfunktionen erweitern.
Ab der Version 1.3.8. verfügt DirectScan jetzt auch über die Möglichkeit das gescannte Dokument direkt einer OCR Verarbeitung zu unterziehen. Dabei können entweder durchsuchbare PDF Dokumente mit der Bilddatei im Vordergrund und mit dem Text im Hintergrund oder zur Imagedatei zusätzlich eine TXT und/oder XML Datei mit der Volltextinformation erzeugt werden. Selbstverständlich ist auch die Ausgabe im PDF/A-1b Format möglich.
Mehr Information und den Download der 30 Tage DEMO Version finden Sie hier:
http://www.scan2pdf.at/de/directscan/produktinformation.html






