Skip to main content

OCR Vergleich

Lokale Open-Source-OCR-Werkzeuge im Vergleich

Stand: August 2026. Fokus auf Tools, die sich lokal/selbst hosten lassen (kein Cloud-Zwang). Eigene Praxiserfahrung (⭐-markiert)) stammt aus dem GIGA-Document-OCR-Benchmark-Projekt; restliche Angaben aus aktueller Marktrecherche — vor Produktivsatz am eigenen Dokumentenbestand prüfen.


Kurzübersicht: Wann welches Tool?

bersicht

Situation Empfehlung
Digitale PDFs mit Textlayer (Verträge, DocuSign, CAD-Exporte) Docling oder direkt PyMuPDF/pdfplumber — kein OCR nötig
GroßeViele Mengen einfachereinfache Scans, keine GPU vorhanden Tesseract
Mehrsprachige Dokumente,Mehrsprachig, Tabellen, GPU vorhanden PaddleOCR / PaddleOCR-VL
Komplexe Layouts → sauberes Markdown fürs RAG/LLM MinerU (jetzt Apache-2.0-basiert)
Handschrift, sehr unregelmäßige Layouts VLM-Ansatz (PaddleOCR-VL,VL, Marker, Qwen-VL-Familie)Marker)
Kommerzielles Produkt, Lizenzprüfung durch Rechtsabteilung nötig Docling (MIT) oder PaddleOCR (Apache-2.0) zuerst prüfen

Tesseract

VergleichstabelleAnsatz:

KlassischeOCR-Pipeline, ZeichenLizenz: Sprachpakete.glage.


EasyOCR

Schwächen: Layoutanspruch.


nger.für:


Umsatzschwellen.Handschrift.


Layouts..


.Tools.


Durchgang.PaddleOCR.ist.


Lizenz.MinerU.
ToolAnsatzLizenzHardwareStärkenSchwächenAm bestenZeichen für
TesseractKlassische OCR-Pipeline (Erkennung pro Zeichen)Apache-2.0 Hardware: CPU (kein GPU-Zwang,Zwang)

GPU/OpenCL

Stärken: experimentell)

Extrem etabliert, läuft überall, kostenlos, hoher Durchsatz bei sauberem Druckt­ext, viele Sprachpakete Schwächen: Schwach bei Handschrift, komplexen Layouts, Tabellen;Tabellen. keinKein Strukturverständnis;ndnis. Genauigkeit sinkt stark bei schlechten Scans/Scans oder Schrägstellung Am besten für: Große Archive mit sauberem gedrucktem Text, Budget = 0, kein GPU-Server verfügbargbar.(Backend von Paperless-ngx und GIGA.Lens' Bbox-Refine-Fallback)Fallback.

EasyOCRAnsatz:

CNN+RNN-basierte klassische OCR Lizenz: Apache-2.0 Hardware: GPU empfohlen, CPU möglich

Stärken: Sehr schneller Einstieg (~5 Min Setup), gute Confidence-Scores, brauchbar bei gekrümmtem/fotografiertem TextText. (Straßenschilder-Stil)

Schwächer bei Dokumentlayout/Dokumentlayout und Tabellen als PaddleOCR;PaddleOCR. wenigerAm bestenrsr: strukturierte Dokumenten-Parsing gedachtSchnelle Prototypen, Szenentext, einfache mehrsprachige Erkennung ohne Layoutanspruch

PaddleOCR / PaddleOCR-VL

Ansatz:

Modulare klassische PipelinePipeline, plus VLM-Variante (PaddleOCR-VL 1.5+) für Layoutverständnis Lizenz: Apache-2.0 Hardware: GPU für Serverpräzision, CPU für Lightweight-Modelle

Stärken: 80+ Sprachen inkl. starkem CJK, gute Tabellenerkennung (PP-Structure), hoher Durchsatz auf GPU (~120 Seiten/Min),. PP-OCRv6 zeigt spürbaren GenauigkeitssprungSprung ggü. Vorgänger

Schwächen: Mehr Konfigurationsaufwand als leichtere Libraries;Libraries. reineReine PaddleOCR-Basisversion ohne PP-Structure liefert nur Text, keine Struktur;Struktur. Versions-Kompatibilität engeng. (z.Am B.besten paddlepaddle-Pins) Produktive mehrsprachige Pipelines mit Tabellen/Formularen und GPU-ZugriffZugriff.(PP-OCRv6 in eigenen Tests klar stärkste reine OCR auf deutschen Alt-Scans;Scans. strikterStrikter Versions-Pin nötig — 3.2.2 funktioniert, 3.3.1 crasht)crasht.

Docling (IBM)

Ansatz: Ensemble spezialisierter Modelle, einheitliche API

Lizenz: MIT (permissiv) Hardware: CPU-fähig, dadurch langsamer als GPU-Alternativen

Stärken: Sehr sauberes, lesbares Markdown;Markdown. hervorragendHervorragend bei digital-geborenen PDFs mit einfachem Layout;Layout. decktDeckt viele Formate ab (PDF, DOCX, PPTX, XLSX, HTML);. permissivePermissive Lizenz ohne Umsatzschwellen

Schwächen: Markdown-first-Design begrenzt Erhalt komplexer Layouts/strukturierter Daten;Daten. schwäSchwächer bei Scans/Handschrift Am besten für: Digitale PDFs, RAG-Ingestion, wenn Lizenzprüfung schnell gehen mussmuss.(inIm eigenemeigenen Benchmark durchgehend schnellster Kandidat auf born-digital PDFs — 4–6 Sek. durch Textlayer-Zugriff)Zugriff.

Marker (Datalab)

Ansatz: LLM-gestützte PDF-zu-Markdown-Pipeline

Lizenz: Code Apache-2.0, Gewichte GPL-3.0 /mit Umsatzschwelle 5 Mio. USD — Lizenzdatei der gepinnten Version lesen Hardware: GPU für brauchbare Geschwindigkeit, CPU-Modus deutlich langsamer

Stärken: Gute Strukturerhaltung, LLM-gestützte Interpretation auch bei unsauberen Layouts

Schwächen: Ohne GPU langsam;langsam. Lizenzlage bei kommerziellem Einsatz separat prüfen (Gewichte ≠ Code-Lizenz) Am besten für: Mittelgroße Dokumentenmengen mit GPU-Budget, wo Docling zu einfach strukturiertstrukturiert.(imIm eigenen Setup 120–180 Sek./Dokument auf CPU, benötigt gepinntes llama.cpp-Backend)Backend.

MinerU (OpenDataLab)

Pipeline:

Ansatz: Pipeline aus Layout-Erkennung →Erkennung, OCR (nutzt intern u. a. PaddleOCR-Modelle) →, Formel-/Tabellenerkennung →Tabellenerkennung, Zusammenbau

Lizenz: Seit v3.1 (April 2026): MinerU Open Source License (Apache-2.0-Basis + Zusatzbedingungen;Zusatzbedingungen), vorher AGPL-3.0)0LizenzänderungWechsel erleichtert kommerzielle Nutzung deutlich Hardware: GPU/CUDA, NPU/CANN, MPS-Beschleunigung; CPU-Pipeline-Modus möglich, aber langsamer

Stärken: Sehr strukturiertes Markdown/JSON, gute Formel-(LaTeX)- und Tabellen-(HTML)-Erkennung, aktive Weiterentwicklung,Weiterentwicklung. seitSeit v3.4 PP-OCRv6-Backend (~11 %11% Genauigkeitsgewinn)

Schwächen: Bei komplexen Layouts/Handschrift laut eigener Doku noch ausbaufähig;hig. Pipeline-Charakter macht Debugging vielschichtiger als Einzelmodell-Tools Am besten für: RAG-Ingestion-Layer vor Chunking/Embedding, wissenschaftliche/technische Dokumente mit FormelnFormeln.(imIm eigenen Benchmark schnellster "schwerer" Kandidat, 30–70 Sek., aber leicht konservativere Zeichenzahl als andere Engines)Engines.

Surya (Datalab)

Ansatz: VLM-nah:nah — Layout, Leserichtung, Texterkennung, Tabellen in einem Modell

Lizenz: Code Apache-2.0, Gewichte modifizierte OpenRAIL-M /mit Umsatzschwelle 5 Mio. USD Hardware: GPU empfohlen Kompakt

Stärken: (~650 M Parameter bei vergleichbaren Modellen dieser Klasse),Kompakt, gutes Kosten-Genauigkeits-Verhältnis, 90+ Sprachen, layoutbewusste Ausgabe in einem Durchgang

Schwächen: Gewichte-Lizenz separat prüfen bei Umsatz >über 5 Mio. USD;USD. jünger/Jünger und weniger etabliert als Tesseract/PaddleOCR Am besten für: Layout-Analyse +und OCR in einem Schritt, wenn Lizenzschwelle unproblematisch ist

GOT-OCR2 (StepFun)

Ansatz: Kompaktes, spezialisiertes OCR-Modell

(~580 M Parameter) Lizenz: Apache-2.0 Hardware: Ein einzelnes GPU-Modell ausreichend

(~580

Stärken: M Parameter)

Gute Leistung bei Fließtext, Formeln, Tabellen;Tabellen. sehrSehr permissive Lizenz Schwächen: Geringere Community-Adoption, weniger Tooling/Ökosystem als PaddleOCR oder MinerU Am besten für: Schlanke Einzelmodell-Lösung ohne Pipeline-Overhead
Overhead.


Nach Dokumenttyp

Dokumenttyp 1. Wahl 2. Wahl Warum
Digitale PDFs (Verträge, DocuSign, E-Rechnungen)DocuSign) Docling / PyMuPDF-Textlayer direkt Kein OCR nötig, Millisekunden statt Sekunden ⭐
Saubere Scans, gedruckter Text PaddleOCR Tesseract PaddleOCR schneller/robuster auf GPU; Tesseract als GPU-freie Alternative
Alte/verschlissene Scans (Flecken, Streifen, Schräglage) PaddleOCR-VL MinerU VLM-Ansatz kompensiert Bildfehler besser als klassische Pipeline — Vorverarbeitung (Enhancement) vorher stark empfohlen ⭐
Formulare/Tabellen PaddleOCR (PP-Structure) MinerU Beide mit dedizierter Tabellenerkennung; MinerU gibt HTML-Tabellen aus
Technische Zeichnungen/PläneZeichnungen (A0–A2) PaddleOCR-VL Docling (falls Textlayer vorhanden)Große Formate brauchen Layout-/VLM-Verständnis, reines Tesseract überfordert bei MischinhaltTextlayer)
Wissenschaftliche Dokumente mit Formeln MinerU Marker Beide mit LaTeX-Formelerkennung
Handschrift VLM-Ansatz (PaddleOCR-VL, Qwen-VL-Familie)VL) Klassische Pipelines (Tesseract, EasyOCR) strukturell schwach bei Handschrift
Mehrsprachig / CJK PaddleOCR Surya Beide mit breiter Sprachabdeckung (80+ bzw. 90+ Sprachen)
RAG/LLM-Ingestion, gemischter Bestand MinerU (Scans/PDF) + Docling (digital-nativ) im Zwei-Stufen-Setup

Warum die Reihenfolge: Bei digitalen PDFs kostet ein Textlayer-Zugriff Millisekunden statt Sekunden — kein OCR nötig. Bei Alt-Scans kompensiert der VLM-Ansatz Bildfehler besser als eine klassische Pipeline, Vorverarbeitung (Enhancement) davor ist trotzdem stark empfohlen. Bei Formeln/Tabellen zählt die dedizierte Erkennung (LaTeX/HTML-Ausgabe), nicht reine Texterkennung. Für gemischte Bestände hat sich das Zwei-Stufen-Muster (günstiger Konverter zuerst, schwerer Parser nur bei BedarfBedarf) in gängigesder ProduktivmusterPraxis durchgesetzt.


Lizenz-Stolperfallen

(unbedingt vor Produktivsatz prüfen)

  • Code- und Gewichte-Lizenz können auseinanderfallen. Bei der Datalab-Familie (Marker, Surya) ist der Code Apache-2.0, die Modell-Gewichte laufen aber unter restriktiveren Lizenzen mit Umsatzschwellen (~5 Mio. USD/Jahr). Eine Apache-Lizenz auf dem Repo sagt nichts über die Nutzbarkeit der Gewichte aus.

  • MinerU hat die Lizenz gewechselt: bis Version 3.0 AGPL-3.0 (copyleft, für viele Firmen ein Ausschlusskriterium), seit v3.1 (April 2026) die MinerU Open Source License"License auf Apache-2.0-Basis mit Zusatzbedingungen — deutlich unternehmensfreundlicher, aber die genaue eingesetzte Version prüfen,fen.

    die tatsächlich deployt wird.
  • Immer die LICENSE-Datei der exakt gepinnten Version lesen, nicht nur einen Blogpost oder das GitHub-Repo-Badge — Bedingungen ändern sich zwischen Minor-Versionen.


Eigene Erfahrungswerte

AufAus einemdem ReferenzdokumentGIGA-Document-OCR-Benchmark, (August 2026. Referenzdokument: born-digital,digital PDF, 1 Seite) im eigenen Docker-Stack:Seite.

Engine Zeit ZeichenAnmerkung
Docling 4–6 s 2078 Textlayer-Pfad, mit Abstand am schnellsten
MinerU 30–70 s 2028 Leicht konservativer als andere
Marker 120–180 s 2124CPU-Modus, mit llama.cpp-Backend
PaddleOCR-VL 340–450 s 2106 Langsamster,

Docling am schnellsten dank Textlayer-Pfad. MinerU liest leicht konservativer als die anderen. Marker läuft im CPU-Modus mit llama.cpp-Backend. PaddleOCR-VL am langsamsten, aber stabil nach einem Self-Healing-Patch gegen einen internen Worker-Absturz.

Auf einem harten Fall (Bebauungsplan 1987, großformatiger Scan)Scan von 1987) zeigte sich zusätzlich: Vorverarbeitung entscheidet oft mehr als die EnginewahlEnginewahl. — Beleuchtungskorrektur, Entstreifung und Deskew vor der OCR verbessern die Lesbarkeit messbar,messbar — müssen aber vorsichtig dosiert werdenwerden, (da zu aggressive Kontrastanhebung/Kontrastanhebung oder Binarisierung kann blasse Schrift wieder zerstören).ren kann.