רשימת התכונות

נכון לעכשיו, Vision API מאפשר לכם להשתמש בתכונות הבאות:

כל סוגי התכונות

זיהוי טקסט

תמונה של תמרור
  • זיהוי תווים אופטי (OCR) של תמונה; זיהוי טקסט והמרה לטקסט מקודד למכונה. מזהה ומחלץ טקסט בפורמט UTF-8 בתמונה.
  • תמונות: אופטימיזציה לאזורים דלילים של טקסט בתוך תמונה גדולה יותר.
  • תשובה: מחזירה רשימה של מילים שזוהו עם טקסט, תיבות תוחמות ו-textAnnotations, וגם את ההיררכיה המבנית של הטקסט שזוהה באמצעות OCR (fullTextAnnotation).
    • היררכיה של מבנה הטקסט שחולץ:
      • TextAnnotation -> Page -> Block -> Paragraph -> Word -> Symbol.
      • לכל רכיב מבני מהדף יכולות להיות תכונות משלו, כמו שפות שזוהו, מעברים וכו'.
  • השפות הנתמכות: פועל עם שפות נתמכות, ממופות וניסיוניות.
  • ערך ה-enum של התכונה: TEXT_DETECTION.

זיהוי טקסט במסמך (טקסט צפוף / כתב יד)

תמונה צפופה עם הערות
תמונה של כתב יד
  • זיהוי תווים אופטי (OCR) לקובץ (PDF/TIFF) או לתמונה עם טקסט צפוף; זיהוי טקסט צפוף והמרה לטקסט בקידוד מכונה.
  • קבצים: אופטימיזציה לקובצי מסמכים (PDF/TIFF).
  • תמונות: אופטימיזציה לאזורים צפופים של טקסט בתמונה (תמונות שהן מסמכים) ולתמונות שמכילות כתב יד.
  • תשובה: מחזירה את ההיררכיה המבנית של הטקסט שזוהה על ידי ה-OCR (fullTextAnnotation).
    • היררכיה של מבנה הטקסט שחולץ:
      • TextAnnotation -> Page -> Block -> Paragraph -> Word -> Symbol.
      • לכל רכיב מבני מהדף יכולות להיות תכונות משלו, כמו שפות שזוהו, מעברים וכו'.
  • השפות הנתמכות: פועל עם שפות נתמכות, ממופות וניסיוניות.
  • ערך ה-enum של התכונה: DOCUMENT_TEXT_DETECTION.
    • מקבל עדיפות כשמבוקשות גם DOCUMENT_TEXT_DETECTION וגם TEXT_DETECTION.

זיהוי ציוני דרך 1

תמונה של קתדרלת וסילי הקדוש
  • התגובה כוללת את שם ציון הדרך, ציון מהימנות ותיבת תוחמת בתמונה של ציון הדרך.
  • הפונקציה מחזירה את הקואורדינטות של הישות שאותרה.

זיהוי לוגו 2

לוגו עם הערות
  • התכונה מספקת תיאור טקסטואלי של הישות שזוהתה, ציון רמת סמך ופוליגון תחום של הלוגו בקובץ.

זיהוי תוויות 3

תמונה של רחוב בשנגחאי
  • מספק תוויות כלליות לתמונה.
  • לכל תווית מוחזר תיאור מילולי, ציון מהימנות ודירוג רלוונטיות לנושא.

מאפייני תמונה 4

תמונה של באלי עם מאפיינים
  • הפונקציה מחזירה את הצבעים הדומיננטיים בתמונה.
  • כל צבע מיוצג במרחב הצבעים RGBA, יש לו ציון מהימנות, והוא מציג את החלק היחסי של הפיקסלים שתפוסים על ידי הצבע [0, 1].

לוקליזציה של אובייקטים 5

תמונה עם תיבות תוחמות
  • מספק הערות כלליות של תוויות ותיבות תוחמות לכמה אובייקטים שזוהו בתמונה אחת.
  • לכל אובייקט שזוהה מוחזרים הרכיבים הבאים: תיאור טקסטואלי, ציון מובהקות וקודקודים מנורמלים [0,1] של הפוליגון התוחם סביב האובייקט.

זיהוי רמזים לחיתוך 6

תמונה עם גרסה חתוכה
  • לכל בקשה מוחזר פוליגון תוחם של התמונה החתוכה, ציון מובהקות ושבר חשיבות של האזור הבולט הזה ביחס לתמונה המקורית.
  • אפשר לציין עד 16 ערכים של יחסי תמונה (רוחב:גובה) לכל תמונה.

דפי אינטרנט וישויות באינטרנט 7

תמונה עם טבלת ישויות באינטרנט
  • מספק סדרה של תכנים קשורים באינטרנט לתמונה.
  • הפונקציה מחזירה את המידע הבא:
    • ישויות באינטרנט: ישויות (תוויות או תיאורים) שמוסקות מתמונות דומות באינטרנט.
    • תמונות תואמות באופן מלא: רשימה של כתובות URL של תמונות תואמות באופן מלא בכל גודל באינטרנט.
    • התאמה חלקית של תמונות: רשימה של כתובות URL של תמונות שיש להן מאפיינים משותפים של נקודות מרכזיות, כמו גרסה חתוכה של התמונה המקורית.
    • דפים עם תמונות תואמות: רשימה של דפי אינטרנט (שמזוהים לפי כתובת ה-URL של הדף, כותרת הדף וכתובת ה-URL של התמונה התואמת) עם תמונה שעומדת בתנאים שמתוארים למעלה.
    • תמונות דומות מבחינה ויזואלית: רשימה של כתובות URL של תמונות שיש להן כמה מאפיינים משותפים עם התמונה המקורית.
    • תווית של ניחוש מושכל: ניחוש מושכל לגבי הנושא של התמונה המבוקשת, שמוסק מתמונות דומות באינטרנט.

זיהוי תוכן בוטה (חיפוש בטוח)

  • המאפיין הזה מספק דירוגי סבירות לקטגוריות הבאות של תוכן בוטה: adult, spoof, medical, violence ו-racy.
  • דירוגי הסבירות מופיעים ב-6 ערכים שונים: UNKNOWN, VERY_UNLIKELY, UNLIKELY, POSSIBLE, LIKELY או VERY_LIKELY.

זיהוי פנים

תמונה לדוגמה עם זיהוי פנים
  • התכונה מאתרת פנים באמצעות מצולעים תחומים, ומזהה תווי פנים ספציפיים כמו עיניים, אוזניים, אף, פה וכו', יחד עם ערכי המהימנות המתאימים.
  • דירוגי הסבירות להחזרות לפי רגש (שמחה, עצב, כעס, הפתעה) ומאפיינים כלליים של התמונה (חשיפת חסר, טשטוש, כיסוי ראש).
  • דירוגי הסבירות מופיעים ב-6 ערכים שונים: UNKNOWN, VERY_UNLIKELY, UNLIKELY, POSSIBLE, LIKELY או VERY_LIKELY.
  • זיהוי של אדם ספציפי באמצעות זיהוי פנים לא נתמך.

1. קרדיט על התמונה: Nikolay Vorobyev ב-Unsplash (הערות נוספו).

2. ‫Image credit: Robert Scoble (CC BY 2.0, annotation added).

3. Image credit: Alex Knight on Unsplash.

4. Image credit: Jeremy Bishop on Unsplash.

5. קרדיט לתמונה: Bogdan Dada ב-Unsplash (נוספו הערות).

6. קרדיט על התמונה: Yasmin Dangor ב-Unsplash (התמונה המקורית והתמונה החתוכה מוצגות).

7. קרדיט על התמונה: Quinten de Graaf ב-Unsplash.