סקירה כללית על תרגומים בהתאמה אישית
מודל ברירת המחדל של Google לתרגום מכונה עצבי (NMT) תומך במגוון רחב של שפות ומתאים לתרגום טקסט למטרות כלליות. עם זאת, במקרים שבהם מתרגמים טקסט שספציפי לדומיין או שרגיש לסגנון, תרגומים מותאמים אישית יכולים לעזור לקבל תרגומים רלוונטיים יותר.
כדי להשתמש בתרגומים בהתאמה אישית, צריך לספק דוגמאות לתרגומים. לאחר מכן, Cloud Translation יכול ליצור תוצאות שדומות מאוד לסגנון, לטון ולמילים של הדוגמאות שלכם.
הגרסה המתקדמת של Cloud Translation API מספקת מגוון פתרונות להתאמה אישית של תרגומים:
התאמה אישית של NMT: אתם יכולים לאמן גרסה מותאמת אישית משלכם של מודל NMT רגיל עם מערך נתונים עשיר של דוגמאות לתרגום.
התאמה אישית של TLLM: אתם יכולים לכוונן גרסה מותאמת אישית משלכם של מודל TLLM (מודל שפה גדול לתרגום) רגיל באמצעות מערך נתונים מוגבל או נרחב של דוגמאות לתרגום.
תרגום אדפטיבי: אפשר ליצור התאמה אישית קלה של מודל ה-LLM לתרגום (TLLM) עם מערך נתונים מוגבל של דוגמאות לתרגום.
מילון מונחים: אפשר להשתמש במילון מונחים כדי ליצור מילון מותאם אישית לתרגום נכון ועקבי של מונחים ספציפיים לתחום.
התאמה אישית של NMT
כדי לאמן גרסה משלכם של מודל NMT, אתם מייבאים סט נתונים משמעותי של דוגמאות תרגום משלכם. לאחר מכן תוכלו לבקש תרגומים שמשתמשים במודל שלכם במקום במודל ברירת המחדל של NMT. מודל מותאם אישית מהסוג הזה יכול להתאים במיוחד לתרגום טקסטים בתחום ספציפי, שבהם חשוב מאוד להשתמש במינוח הנכון.
אתם מחויבים גם על הזמן שנדרש לאימון המודל וגם על מספר התווים של הקלט שאתם שולחים לתרגום.
התאמה אישית של TLLM
כדי לאמן גרסה משלכם של מודל TLLM, אתם מייבאים מערך נתונים של דוגמאות תרגום משלכם. לאחר מכן תוכלו לבקש תרגומים באמצעות המודל שלכם במקום מודל ה-TLLM שמוגדר כברירת מחדל. מודל מותאם אישית מהסוג הזה יכול להתאים במיוחד לתרגום טקסטים בתחום ספציפי, שבהם חשוב מאוד להשתמש במינוח הנכון.
אתם מחויבים גם על הזמן שנדרש לאימון המודל וגם על מספר התווים של הקלט שאתם שולחים לתרגום.
תרגום דינמי
תרגומים אדפטיביים משתמשים במודלים גדולים של שפה (LLM) בשילוב עם מערכי נתונים קטנים כדי לספק תרגומים באיכות גבוהה, שלעתים קרובות שווה לזו של מודלים מותאמים אישית של Cloud Translation. אתם לא מאמנים או מתחזקים מודלים. בהשוואה למודלים מותאמים אישית, תרגום דינמי מתאים במיוחד לקבלת תשובות שדומות בסגנון, בטון ובקול לקלט שלכם.
במקרה של תרגום דינמי, החיוב מתבצע לפי מספר התווים של הקלט והפלט.
מילוני מונחים
מילוני מונחים מאפשרים לכם לציין איך לתרגם מונחים מסוימים. אתם מספקים רשימה של מונחים והתרגומים שלהם, ו-Cloud Translation משתמש בהם כדי לוודא שהתרגומים של המונחים האלה יהיו עקביים ומדויקים. האפשרות הזו שימושית במיוחד כשמדובר באוצר מילים ספציפי לדומיין.
החיוב על השימוש במילון המונחים מבוסס על מספר התווים שנשלחים לתרגום.
הכנת דוגמאות לתרגומים
מכינים דוגמאות לתרגומים כזוגות של פלחים, שכוללים משפט אחד בשפת המקור ומשפט תואם שמתורגם לשפת היעד. שומרים את צמדי המקטעים האלה בקובץ ערכים מופרדים בטאבים (TSV) או בקובץ Translation Memory eXchange (TMX).
בוחרים דוגמאות שמייצגות את התחום הלשוני של התוכן שמתכננים לתרגם. הנחיות נוספות מפורטות בקטע הכנת נתונים.
TSV
בקבצים מופרדים בטאבים, כל שורה היא בפורמט הבא:
Source segmentכרטיסייהTranslated segment
אל תכללו שורת כותרת עם קודי שפה כדי לזהות את שפת המקור ואת שפת היעד. מציינים את השפות האלה כשיוצרים מערך נתונים. בדוגמה הבאה מוצגים זוגות של פלחים לתרגומים מאנגלית לגרמנית:
It's a beautiful day.\tEs ist ein schöner Tag. Tomorrow it will rain.\tMorgen wird es regnen.
כל התוכן בקובץ TSV חייב להיות טקסט פשוט. אם הטקסט כולל תגי HTML או סימון אחר, Cloud Translation מתייחס לסימון כטקסט פשוט.
TMX
TMX הוא פורמט XML סטנדרטי לאספקת פלחים של תרגום ממקור ליעד. Cloud Translation תומך בקובצי קלט בפורמט שמבוסס על TMX גרסה 1.4. בדוגמה הבאה אפשר לראות את המבנה הנדרש:
<?xml version='1.0' encoding='utf-8'?>
<!DOCTYPE tmx SYSTEM "tmx14.dtd">
<tmx version="1.4">
<header segtype="sentence" o-tmf="UTF-8"
adminlang="en" srclang="en" datatype="PlainText"/>
<body>
<tu>
<tuv xml:lang="en">
<seg>It's a beautiful day.</seg>
</tuv>
<tuv xml:lang="de">
<seg>Es ist ein schöner Tag.</seg>
</tuv>
</tu>
<tu>
<tuv xml:lang="en">
<seg>Tomorrow it will rain.</seg>
</tuv>
<tuv xml:lang="de">
<seg>Morgen wird es regnen.</seg>
</tuv>
</tu>
</body>
</tmx>
רכיב <header> בקובץ TMX תקין צריך לזהות את שפת המקור באמצעות המאפיין srclang, וכל רכיב <tuv> צריך לזהות את השפה של הטקסט שכלול בו באמצעות המאפיין xml:lang.
כל הרכיבים <tu> חייבים להכיל זוג רכיבים <tuv> עם אותן שפות מקור ויעד. אם רכיב <tu> מכיל יותר משני רכיבי <tuv>, Cloud Translation מעבד רק את רכיב <tuv> הראשון שתואם לשפת המקור ואת רכיב <tuv> הראשון שתואם לשפת היעד, ומתעלם מהשאר. אם לרכיב <tu> אין זוג תואם של רכיבי <tuv>, Cloud Translation מדלג על רכיב <tu> הלא תקין.
Cloud Translation מסיר את תגי העיצוב מסביב לרכיב <seg> לפני העיבוד שלו. אם רכיב <tuv> מכיל יותר מרכיב <seg> אחד, Cloud Translation משרשר את הטקסט שלהם לרכיב אחד עם רווח ביניהם.
אם הקובץ מכיל תגי XML אחרים מאלה שמוצגים למעלה, Cloud Translation מתעלם מהם.
אם הקובץ לא תואם לפורמט XML ו-TMX (לדוגמה, אם חסר תג סיום או רכיב <tmx>), Cloud Translation מפסיק את העיבוד שלו. בנוסף, Cloud Translation מפסיק את העיבוד אם הוא מדלג על יותר מ-1,024 רכיבי <tu> לא תקינים.
המספר המינימלי הנדרש והמספר המקסימלי המותר של זוגות פלחים שונים לכל תכונה. מידע נוסף זמין במאמר בנושא הכנת נתונים ל-Cloud Translation או דרישות נתונים לתרגום אדפטיבי.
כדי להכין מערך נתונים למודל TLLM מותאם אישית, אפשר לעיין במאמר הכנת נתונים להתאמה מפוקחת.
המאמרים הבאים
- מידע נוסף על כל תכונה זמין במאמרים סקירה כללית על התאמה אישית של NMT ותרגום אדפטיבי.
- במאמר שפות נתמכות מפורטות השפות שבהן אפשר לקבל תמיכה.
- לפרטים על התמחור, אפשר לעיין במחירון של Cloud Translation.