Amazon Athena

‫Looker תומך בחיבורים ל-Amazon Athena, שירות שאילתות אינטראקטיבי שמאפשר לנתח נתונים ב-Amazon S3 באמצעות SQL סטנדרטי. ‫Amazon Athena הוא שירות ללא שרתים, כך שאין תשתית לניהול. החיוב מתבצע רק על השאילתות שמופעלות.

הצפנה של תנועה ברשת

מומלץ להצפין את תעבורת הנתונים ברשת בין אפליקציית Looker לבין מסד הנתונים. כדאי לשקול אחת מהאפשרויות שמתוארות בדף הפעלת גישה מאובטחת למסד נתונים.

הגדרה של חיבור ל-Amazon Athena

בדף הזה מוסבר איך לחבר את Looker למופע של Amazon Athena.

  1. ודאו שיש לכם את הפריטים הבאים:

    • זוג מפתחות גישה של Amazon AWS.
    • קטגוריית S3 שמכילה את הנתונים שרוצים לשלוח לגביהם שאילתות ב-Looker באמצעות Amazon Athena. למפתחות הגישה של Amazon AWS צריכה להיות גישת קריאה וכתיבה לקטגוריה הזו.

      ל-Amazon Athena צריכה להיות גישה לקטגוריית S3 הזו באמצעות תפקיד או קבוצת הרשאות, וגם באמצעות כללי חומת אש. אל תוסיפו כללי אבטחה לקטגוריית S3 עבור כתובת ה-IP של Looker, כי זה עלול לחסום בטעות את הגישה של Amazon Athena לקטגוריית S3. (בניבים אחרים מלבד Amazon Athena, יכול להיות שהמשתמשים ירצו להגביל את הגישה לנתונים משכבת הרשת באמצעות רשימת כתובות IP שאפשר לגשת אליהן, כפי שמתואר בדף התיעוד בנושא הפעלת גישה מאובטחת למסד נתונים).

    • ידע לגבי המיקום של נתוני המופע של Amazon Athena. שם האזור מופיע בפינה השמאלית העליונה של Amazon Console.

  2. בקטע ניהול ב-Looker, בוחרים באפשרות חיבורים ואז לוחצים על הוספת חיבור.

  3. ממלאים את פרטי החיבור:

    • שם: מציינים את שם החיבור. כך תתייחסו לחיבור בפרויקטים של LookML.
    • ‫Dialect (ניב): בוחרים באפשרות Amazon Athena.
    • מארח ויציאה: מציינים את שם המארח והיציאה כפי שמתואר בתיעוד של Athena בנושא פורמט כתובת ה-JDBC. המארח צריך להיות נקודת קצה תקפה של אמזון (למשל athena.eu-west-1.amazonaws.com), והיציאה צריכה להישאר 443. רשימה עדכנית של נקודות קצה שתומכות ב-Athena מופיעה בדף AWS General Reference.
    • מסד נתונים: מציינים את מסד הנתונים שרוצים להשתמש בו כברירת מחדל. אפשר לגשת למסדי נתונים אחרים, אבל Looker מתייחס למסד הנתונים הזה כאל מסד הנתונים שמוגדר כברירת מחדל.
    • שם משתמש: מציינים את מזהה מפתח הגישה של AWS.
    • סיסמה: מציינים את מפתח הגישה הסודי ל-AWS.
    • הפעלת PDTs: משתמשים במתג הזה כדי להפעיל טבלאות נגזרות קבועות (PDTs). הפעלת PDTs חושפת שדות PDT נוספים ואת הקטע PDT Overrides (שינויים ב-PDT) בחיבור.
    • ‫Temp Database (מסד נתונים זמני): מציינים את השם של ספריית הפלט בקטגוריית S3 שבה רוצים ש-Looker יכתוב את טבלאות ה-PDT. צריך לציין את הנתיב המלא לספריית הפלט בשדה Additional JDBC parameters. פרטים נוספים מופיעים בקטע Specifying your S3 bucket for query results output and PDTs בדף הזה.
    • מספר החיבורים המקסימלי ליצירת PDT: מציינים את מספר יצירות ה-PDT האפשריות בו-זמנית בחיבור הזה. הגדרת ערך גבוה מדי עלולה להשפיע לרעה על זמני השאילתות. מידע נוסף זמין בדף התיעוד בנושא חיבור Looker למסד הנתונים.
    • פרמטרים נוספים של JDBC: מציינים פרמטרים נוספים לחיבור:
      • הפרמטר s3_staging_dir הוא קטגוריית S3 ש-Looker צריך להשתמש בה כדי להפיק פלט של תוצאות שאילתות וטבלאות PDT. מידע נוסף זמין בקטע הגדרת קטגוריית S3 להפקת פלט של תוצאות שאילתות וטבלאות PDT בדף הזה.
      • סימון תוצאות של סטרימינג. אם יש לכם את מדיניות athena:GetQueryResultsStream שמשויכת למשתמש Athena, אתם יכולים להוסיף את ;UseResultsetStreaming=1 לסוף הפרמטרים הנוספים של JDBC כדי לשפר באופן משמעותי את הביצועים של חילוץ מערך תוצאות גדול. כברירת מחדל, הפרמטר הזה מוגדר כ-0.
      • פרמטרים נוספים אופציונליים שאפשר להוסיף למחרוזת החיבור של JDBC. רשימת הפרמטרים ש-Looker תומך בהם מופיעה בקטע פרמטרים נתמכים של JDBC בדף הזה.
    • ‫SSL: אין צורך להתייחס. כברירת מחדל, כל החיבורים ל-AWS API מוצפנים.
    • מספר החיבורים המקסימלי לכל צומת: כברירת מחדל, הערך הזה מוגדר כ-5. אפשר להגדיל את המספר הזה עד 20 אם Looker הוא מנוע השאילתות הראשי שפועל מול Athena. פרטים נוספים על מגבלות השירות זמינים במאמרי העזרה בנושא מגבלות השירות של Athena. מידע נוסף זמין בדף חיבור Looker למסד הנתונים.
    • הזמן הקצוב לתפוגה של מאגר החיבורים: מציינים את הזמן הקצוב לתפוגה של מאגר החיבורים. כברירת מחדל, הזמן הקצוב לתפוגה מוגדר ל-120 שניות. מידע נוסף זמין בדף חיבור Looker למסד הנתונים.
    • SQL Runner Precache (טרום-שמירה במטמון של SQL Runner): מבטלים את הסימון של האפשרות הזו אם אתם מעדיפים ש-SQL Runner יטען את פרטי הטבלה רק כשבוחרים טבלה. מידע נוסף זמין בדף חיבור Looker למסד הנתונים.
    • ‫Database Time Zone (אזור זמן של מסד הנתונים): מציינים את אזור הזמן שבו נעשה שימוש במסד הנתונים. אם לא רוצים להמיר את אזור הזמן, משאירים את השדה הזה ריק. מידע נוסף זמין בדף התיעוד בנושא שימוש בהגדרות אזור הזמן.

כדי לוודא שהחיבור בוצע בהצלחה, לוחצים על הלחצן בדיקת החיבור בקטע פרטי הסטטוס בחלק התחתון של הדף הגדרות החיבורים.

אם ב-Looker מוצגת ההודעה Can Connect (אפשר להתחבר), לוחצים על Connect (התחברות) כדי ליצור את החיבור.

החיבור למסד הנתונים יתווסף לרשימה בדף Connections Admin ב-Looker.

ציון של דלי S3 לפלט של תוצאות השאילתות ול-PDT

משתמשים בשדה Additional JDBC parameters בדף Connections כדי להגדיר את הנתיב ל-S3 bucket שבו Looker ישתמש לאחסון של פלט תוצאות השאילתות, וכדי לציין את השם של ספריית הפלט ב-S3 bucket שבה רוצים ש-Looker יכתוב PDT. מציינים את המידע הזה באמצעות הפרמטר s3_staging_dir.

הפרמטר s3_staging_dir JDBC הוא דרך חלופית להגדרת הנכס S3OutputLocation של Amazon Athena, שנדרש לחיבורי JDBC של Athena. מידע נוסף ורשימה של כל האפשרויות הזמינות של מנהלי התקנים של JDBC זמינים במאמרי העזרה של Athena בנושא אפשרויות של מנהלי התקנים של JDBC.

בשדה Additional JDBC parameters (פרמטרים נוספים של JDBC), מציינים את הפרמטר s3_staging_dir בפורמט הבא:

`s3_staging_dir=s3://<s3-bucket>/<output-path>`

כאשר:

  • ‫<s3-bucket> הוא שם קטגוריית S3.
  • ‫<output-path> הוא הנתיב שבו Looker יכתוב את פלט תוצאות השאילתה.

לזוג מפתחות הגישה של AWS צריכות להיות הרשאות כתיבה לספרייה <s3-bucket>.

כדי להגדיר את הספרייה שבה Looker יכתוב PDT, מזינים את הנתיב של הספרייה בקטגוריית S3 בשדה Temp Database. לדוגמה, אם רוצים ש-Looker יכתוב טבלאות PDT ל-s3://<s3-bucket>/looker_scratch, צריך להזין את הערך הבא בשדה Temp Database:

`looker_scratch`

מזינים רק את הנתיב של הספרייה. ‫Looker מקבל את שם קטגוריית ה-S3 מהפרמטר s3_staging_dir שמוזן בשדה Additional JDBC Parameters (פרמטרים נוספים של JDBC).

שיקולים לגבי קטגוריות S3

מומלץ להגדיר מחזורי חיים של אובייקטים ב-Amazon S3 כדי לנקות מעת לעת קבצים לא נחוצים בקטגוריית S3 שצוינה. יש לכך כמה סיבות:

  • ‫Athena שומרת את תוצאות השאילתה של כל שאילתה בקטגוריה ב-S3. ראו שאילתות ב-Athena.
  • אם הפעלתם PDT, כשמבצעים בנייה של PDT, מטא-נתונים לגבי הטבלה שנוצרה מאוחסנים בקטגוריית S3.

משאבים

פרמטרים נתמכים של JDBC

ב-Amazon Athena, ‏ Looker תומך בפרמטרים הבאים של JDBC בשדה Additional JDBC parameters (פרמטרים נוספים של JDBC) לחיבור. מידע על הפרמטרים האלה זמין במסמכי התיעוד של מסד הנתונים.

  • ApplicationName
  • AwsCredentialsProviderArguments
  • AwsCredentialsProviderClass
  • AwsRegion
  • Catalog
  • Database
  • EnableResultReuseByAge
  • EndPointOverride
  • LogLevel
  • MaxQueryExecutionPollingInterval
  • maxResultReuseAgeInMinutes
  • MetadataRetrievalMethod
  • MinQueryExecutionPollingInterval
  • OutputLocation
  • password
  • ‫ProxyHost: במופעי Looker ציבוריים, הערך של הפרמטר ProxyHost חייב להיות כתובת ה-IP הציבורית של המופע.
  • ProxyPort
  • ProxyPWD
  • ProxyUID
  • QueryExecutionPollingIntervalMultiplier
  • Region
  • ResultFetcher
  • ResultReuseByAgeConfiguration
  • s3_staging_dir
  • S3OutputEncOption
  • S3OutputLocation
  • Schema
  • user
  • UseResultsetStreaming
  • WorkGroup

תמיכה בתכונות

כדי ש-Looker יתמוך בתכונות מסוימות, הדיאלקט של מסד הנתונים צריך לתמוך בהן גם כן.

התכונות הבאות נתמכות ב-Amazon Athena החל מ-Looker 26.18:

תכונה נתמך?
Looker (Google Cloud core)‎
צבירה סימטרית
טבלאות נגזרות
טבלאות נגזרות מתמידות שמבוססות על SQL
טבלאות נגזרות מתמידות מבוססות LookML
תצוגות יציבות
ביטול שאילתה
טבלאות ציר שמבוססות על SQL
אזורי זמן
SSL
סיכומי ביניים
פרמטרים נוספים של JDBC
תלוי רישיות
סוג מיקום
סוג הרשימה
מאון
אחוזון נפרד
SQL Runner Show Processes
SQL Runner Describe Table
SQL Runner Show Indexes
SQL Runner Select 10
מספר הפעלות של SQL Runner
SQL Explain
פרטי כניסה של OAuth 2.0
תגובות להוספת הקשר
איגום חיבורים
רישומים מסוג HLL
מודעות מצטברת
PDT מצטברות
אלפיות שנייה
מיקרו-שניות
תצוגות מהותיות
מדדים של השוואה בין תקופות שונות
ספירה משוערת של ערכים ייחודיים
מודלים לניתוח נתונים במסד הנתונים
יומנים בהתאמה אישית

השלבים הבאים

אחרי שמסיימים את הקישור למסד הנתונים, מגדירים את אפשרויות האימות.