בדף הזה מוסבר איך לחבר את Looker ל-Apache Hive 2.3+ ול-Apache Hive 3.1.2+.
חשוב לשים לב לנקודות הבאות לגבי התמיכה של Looker בגרסאות השונות של Apache Hive:
- Looker תומך בחיבורים ל-Apache Hive 2.3 ואילך ול-Apache Hive 3.1.2 ואילך:
- ל-Apache Hive 2.3 ואילך, ל-Looker יש תמיכה ברמת השילוב.
- ב-Apache Hive 3.1.2 ואילך, אפשר לשלב את Looker באופן מלא עם מסדי נתונים של Apache Hive 3 רק בגרסאות מאוחרות יותר מ-3.1.2. הסיבה לכך היא בעיה בניתוח שאילתות בגרסאות Hive 2.4.0 עד 3.1.2, שגרמה לזמני ניתוח ארוכים במיוחד של SQL שנוצר על ידי Looker.
- Looker לא תומך בחיבורים ל-Apache Hive 2. שאילתות על חיבורים ל-Apache Hive 2 יחזירו שגיאה.
הצפנה של תנועה ברשת
מומלץ להצפין את תעבורת הנתונים ברשת בין אפליקציית Looker לבין מסד הנתונים. כדאי לשקול אחת מהאפשרויות שמתוארות בדף הפעלת גישה מאובטחת למסד נתונים.
מבוא
הארכיטקטורה של Looker מאפשרת להתחבר לשרת מסד נתונים באמצעות JDBC. במקרה של Hive, זהו שרת ה-Thrift (HiveServer2). מידע נוסף זמין במאמרי העזרה של Apache.
כברירת מחדל, השרת הזה יאזין ליציאה 10000.
Looker הוא כלי אינטראקטיבי לשאילתות, ולכן הוא מצפה לעבוד עם מנוע SQL אינטראקטיבי. אם Hive פועל ב-MapReduce – הערך של hive.execution.engine מוגדר ל-mr – אז Hive יחזיר את תוצאות השאילתה לאט מדי, כך שלא יהיה אפשר להשתמש בהן.
Looker נבדק עם Hive on Tez (hive.execution.engine=tez), אבל אפשר גם להריץ את Looker מול Hive on Spark. התמיכה ב-Spark נוספה בגרסה 1.1 של Hive. (Looker תומך ב-Hive 1.2.1 ואילך).
טבלאות נגזרות מתמידות (PDT)
כדי להפעיל טבלאות נגזרות קבועות (PDT) ב-Looker באמצעות חיבור Hive, צריך ליצור סכימת גירוד לשימוש ב-Looker. הדוגמה הבאה היא של פקודה שאפשר להשתמש בה כדי ליצור סכימת looker_scratch:
CREATE SCHEMA looker_scratch;
לחשבון המשתמש שבו Looker משתמש כדי להתחבר ל-Hive (יכול להיות אנונימי אם לא נעשה שימוש באימות) צריכות להיות היכולות הבאות בסכימת ה-scratch:
- יצירת טבלאות
- שינוי טבלאות
- הסרת טבלאות
מומלץ לבדוק את זה באמצעות לקוח JDBC לפני שמנסים ליצור PDT באמצעות Hive.
תורים
אם רוצים שהשאילתות מ-Looker יועברו לתור ספציפי, מזינים את פרמטר שם התור בשדה Additional JDBC parameters בדף Connection Settings:
?tez.queue.name=the_bi_queue
אפשר להגדיר פרמטרים אחרים של Hive בשדה Additional JDBC parameters (פרמטרים נוספים של JDBC) בדף Connection Settings (הגדרות חיבור).
באמצעות מאפייני משתמש, אפשר להעביר שאילתות ממשתמשים שונים או מקבוצות משתמשים שונות לתורים שונים. כדי לעשות זאת, יוצרים מאפיין משתמש בשם כלשהו, כמו queue_name, ואז בשדה Additional JDBC parameters מוסיפים את הפרמטרים הבאים:
?tez.queue.name={{ _user_attributes['queue_name'] }}
אפשר להשתמש בזה גם כדי להתאים אישית פרמטרים אחרים של hive-site.xml על בסיס משתמש יחיד או קבוצה.
יצירת חיבור Looker למסד הנתונים
כדי ליצור את החיבור מ-Looker למסד הנתונים:
- בקטע ניהול ב-Looker, בוחרים באפשרות חיבורים ואז לוחצים על הוספת חיבור.
בחר Apache Hive 2.3+ או Apache Hive 3.1.2+ מהתפריט הנפתח דיאלקט.
ממלאים את פרטי החיבור. רוב ההגדרות משותפות לרוב הניבים של מסדי הנתונים. מידע נוסף זמין בדף חיבור Looker למסד הנתונים. בהמשך מפורטות חלק מההגדרות:
- שם: ציין את שם החיבור. כך תתייחסו לחיבור בפרויקטים של LookML.
- מארח: ציין את שם המארח.
- פורט: ציין את פורט מסד הנתונים.
- מסד נתונים: ציין את שם מסד הנתונים.
- שם משתמש: ציין את שם המשתמש של מסד הנתונים.
- סיסמה: ציין את סיסמת המשתמש של מסד הנתונים.
- הפעלת PDT: משתמשים במתג הזה כדי להפעיל טבלאות נגזרות מתמידות (PDT). כשהאפשרות PDT מופעלת, בחלון Connection מופיעות הגדרות נוספות של PDT והקטע PDT Overrides.
- מסד נתונים זמני: ציין את שם סכימת הגרסה הקודמת שנוצרה בקטע טבלאות נגזרות קבועות (PDTs) בדף תיעוד זה.
- מספר מרבי של חיבורי בונה PDT: ציין את מספר מערכות הבנייה של PDT האפשריות בו-זמניות בחיבור זה. הגדרת ערך גבוה מדי עלולה להשפיע לרעה על זמני השאילתה. למידע נוסף, עיין בדף התיעוד של חיבור Looker למסד הנתונים שלך.
- פרמטרים נוספים של JDBC: מוסיפים פרמטרים נוספים של JDBC. רשימת הפרמטרים הנתמכים מופיעה בקטע פרמטרים נתמכים של JDBC בדף הזה.
- לוח זמנים לתחזוקה ציין א
cronביטוי המציין מתי Looker צריך לבדוקקבוצות נתונים וטבלאות נגזרות מתמידות. קרא עוד על הגדרה זו בתיעוד של לוח זמנים לתחזוקה. - SSL: סמן כדי להשתמש בחיבורי SSL.
- אימות SSL: בדוק את אימות שם המארח.
- מספר חיבורים מקסימלי לכל צומת: ניתן להשאיר הגדרה זו על ערך ברירת המחדל בתחילה. מידע נוסף זמין בדף חיבור Looker למסד הנתונים.
- זמן קצוב של מאגר חיבורים: ניתן להשאיר הגדרה זו בערך ברירת המחדל בתחילה. קרא עוד על הגדרה זו בסעיף זמן קצוב של מאגר חיבורים בדף התיעוד של חיבור Looker למסד הנתונים שלך.
- SQL Runner Precache: כדי לגרום ל-SQL Runner לא לטעון מראש את פרטי הטבלה ולטעון את פרטי הטבלה רק כאשר טבלה נבחרת, בטל אפשרות זו. קרא עוד על הגדרה זו בסעיף SQL Runner Precache בדף התיעוד של חיבור Looker למסד הנתונים שלך.
- אזור זמן של מסד נתונים: ציין את אזור הזמן שבו נעשה שימוש במסד הנתונים. השאר שדה זה ריק אם אינך מעוניין בהמרת אזור זמן. למידע נוסף, עיין בדף התיעוד של שימוש בהגדרות אזור זמן.
כדי לוודא שהחיבור בוצע בהצלחה, לוחצים על הלחצן בדיקת החיבור בקטע פרטי הסטטוס בחלק התחתון של הדף הגדרות החיבורים.
אם ב-Looker מוצגת ההודעה Can Connect (אפשר להתחבר), לוחצים על Connect (התחברות) כדי ליצור את החיבור.
החיבור למסד הנתונים יתווסף לרשימה בדף Connections Admin ב-Looker.
פרמטרים נתמכים של JDBC
עבור Apache Hive, Looker תומך בפרמטרי JDBC הבאים בשדה Additional JDBC parameters עבור החיבור. מידע על הפרמטרים האלה זמין במסמכי התיעוד של מסד הנתונים.
fetchSizehttpPathkeyStorePasswordpasswordprincipalserviceDiscoveryModessltez.queue.nametransportModetwoWayuserzooKeeperNamespace
תמיכה בתכונות
כדי ש-Looker יתמוך בתכונות מסוימות, הדיאלקט של מסד הנתונים צריך לתמוך בהן גם כן.
אפאצ'י הייב 2.3+
Apache Hive 2.3+ תומך בתכונות הבאות החל מ-Looker 26.16:
| תכונה | נתמך? |
|---|---|
| Looker (Google Cloud core) | |
| צבירה סימטרית | |
| טבלאות נגזרות | |
| טבלאות נגזרות מתמידות שמבוססות על SQL | |
| טבלאות נגזרות מתמידות מבוססות LookML | |
| תצוגות יציבות | |
| ביטול שאילתה | |
| טבלאות ציר שמבוססות על SQL | |
| אזורי זמן | |
| SSL | |
| סיכומי ביניים | |
| פרמטרים נוספים של JDBC | |
| תלוי רישיות | |
| סוג מיקום | |
| סוג הרשימה | |
| מאון | |
| אחוזון נפרד | |
| SQL Runner Show Processes | |
| SQL Runner Describe Table | |
| SQL Runner Show Indexes | |
| SQL Runner Select 10 | |
| מספר הפעמים שהופעל SQL Runner | |
| SQL Explain | |
| פרטי כניסה של OAuth 2.0 | |
| תגובות להוספת הקשר | |
| איגום חיבורים | |
| רישומים מסוג HLL | |
| מודעות מצטברת | |
| המרות מצטברות של PDT | |
| אלפיות שנייה | |
| מיקרו-שניות | |
| תצוגות מהותיות | |
| מדדים של השוואה בין תקופות שונות | |
| ספירה משוערת של ערכים ייחודיים | |
| מודלים לניתוח נתונים במסד הנתונים | |
| יומנים בהתאמה אישית |
Apache Hive 3.1.2 ואילך
Apache Hive 3.1.2 ואילך תומך בתכונות הבאות החל מ-Looker 26.16:
| תכונה | נתמך? |
|---|---|
| Looker (Google Cloud core) | |
| צבירה סימטרית | |
| טבלאות נגזרות | |
| טבלאות נגזרות מתמידות שמבוססות על SQL | |
| טבלאות נגזרות מתמידות מבוססות LookML | |
| תצוגות יציבות | |
| ביטול שאילתה | |
| טבלאות ציר שמבוססות על SQL | |
| אזורי זמן | |
| SSL | |
| סיכומי ביניים | |
| פרמטרים נוספים של JDBC | |
| תלוי רישיות | |
| סוג מיקום | |
| סוג הרשימה | |
| מאון | |
| אחוזון נפרד | |
| SQL Runner Show Processes | |
| SQL Runner Describe Table | |
| SQL Runner Show Indexes | |
| SQL Runner Select 10 | |
| מספר הפעמים שהופעל SQL Runner | |
| SQL Explain | |
| פרטי כניסה של OAuth 2.0 | |
| תגובות להוספת הקשר | |
| איגום חיבורים | |
| רישומים מסוג HLL | |
| מודעות מצטברת | |
| המרות מצטברות של PDT | |
| אלפיות שנייה | |
| מיקרו-שניות | |
| תצוגות מהותיות | |
| מדדים של השוואה בין תקופות שונות | |
| ספירה משוערת של ערכים ייחודיים | |
| מודלים לניתוח נתונים במסד הנתונים | |
| יומנים בהתאמה אישית |
השלבים הבאים
אחרי שמקשרים את מסד הנתונים ל-Looker, צריך להגדיר את אפשרויות הכניסה למשתמשים.