Funktionen zur Zeichenerkennung

Die optische Zeichenerkennung (Optical Character Recognition, OCR) ist eine der drei vortrainierten Vertex AI APIs in Google Distributed Cloud (GDC) mit Air-Gap. Der OCR Dienst erkennt Text in verschiedenen Dateitypen wie Bildern, Dokumentdateien und handgeschriebenem Text.

OCR bietet die folgenden Methoden, die in Distributed Cloud verfügbar sind, um Text zu erkennen:

Methode Beschreibung
BatchAnnotateImages Erkennt Text aus einem Batch von JPEG- oder PNG-Bildern, die in einer Inline-Anfrage bereitgestellt werden.
BatchAnnotateFiles Erkennt Text aus einem Batch von PDF- oder TIFF-Dateien, die in einer Inline-Anfrage bereitgestellt werden.
AsyncBatchAnnotateFiles Erkennt Text aus einem Batch von PDF- oder TIFF-Dateien in einem Speicher-Bucket für Offline-Anfragen.

Weitere Informationen zu den unterstützten Sprachen die von der Texterkennungsfunktion erkannt werden.

Funktionen der optischen Zeichenerkennung

Die OCR API kann Text in Bildern erkennen und extrahieren. Die folgenden beiden Anmerkungsfunktionen unterstützen die optische Zeichenerkennung:

  • TEXT_DETECTION erkennt und extrahiert Text aus beliebigen Bildern. Ein Foto kann beispielsweise ein Straßen- oder Verkehrsschild enthalten. Der OCR-Dienst gibt eine JSON-Datei mit dem extrahierten String, einzelnen Wörtern und deren Begrenzungsrahmen zurück.

    Straßenschild mit einzelnen Wörtern und Begrenzungsrahmen für die Texterkennung

    Abbildung 1. Foto eines Straßenschilds, auf dem die OCR API Wörter und deren Begrenzungsrahmen erkennt.

  • DOCUMENT_TEXT_DETECTION extrahiert auch Text aus einem Bild, optimiert die Antwort jedoch für Fließtext und Dokumente. Ein gescanntes Bild von getipptem Text kann beispielsweise mehrere Absätze und Überschriften enthalten. Der OCR-Dienst gibt eine JSON-Datei mit Informationen zu Seite, Block, Absatz, Wort und Worttrennung zurück.

    Gescannte Abbildung von getipptem Text mit einem hohen Anteil an Anmerkungen

    Abbildung 2. Gescanntes Bild von getipptem Text, auf dem die OCR API Informationen wie Wörter, Seiten und Absätze erkennt.

Handgeschriebener Text

Abbildung 3 zeigt ein Bild von handgeschriebenem Text. Die OCR API erkennt und extrahiert Text aus diesen Bildern. Eine Liste der Handschrift-Scripts, die die Handschrifterkennung unterstützen, finden Sie unter Handschrift-Scripts.

Abbildung mit handschriftlichem Text

Abbildung 3. Bild von Handschrift, auf dem die OCR API Text erkennt.

Limits für die optische Zeichenerkennung

Die API-Methoden BatchAnnotateImages und BatchAnnotateFiles unterstützen nur eine Anfrage pro Batchaufruf.

In der folgenden Tabelle sind die aktuellen Limits des OCR-Dienstes in Distributed Cloud aufgeführt.

Dateilimit für OCR Wert
Maximale Anzahl von Seiten 5
Maximale Dateigröße 20 MB
Maximale Bildgröße 20 Millionen Pixel (Länge × Breite)

Für Dateien, die für die OCR API eingereicht werden und die maximale Anzahl von Seiten oder die maximale Dateigröße überschreiten, wird ein Fehler zurückgegeben. Eingereichte Dateien, die die maximale Bildgröße überschreiten, werden auf 20 Millionen Pixel verkleinert.

Unterstützte Dateitypen für OCR

Die vortrainierte OCR API erkennt und transkribiert Text aus den folgenden Dateitypen:

  • PDF
  • TIFF
  • JPG
  • PNG

Sie müssen die Dateien lokal in Ihrer Distributed Cloud-Umgebung speichern. Sie können für die Texterkennung nicht auf Dateien zugreifen, die in Cloud Storage gehostet werden, oder auf öffentlich verfügbare Dateien.