עברית או אנגלית
Therapix Team ·
כותבים תיאור קליני בעברית, ומקבלים בחזרה ניתוח שנשמע קצת שטוח, כאילו נכתב על מישהו אחר. זו לא התרשמות מקרית, ויש לה שני הסברים מבניים.
לפני שניכנס אליהם, כדאי לומר מה אין: אין מחקר שמדד ביצועי מודלים בעברית קלינית. מה שיש הוא מדידות מבלשנות חישובית וממשימות כלליות, ומהן אפשר להסיק לאן להסתכל, לא כמה גדול הפער.
למה עברית יוצאת חלשה יותר
הסבר ראשון: כמות. חלקה של העברית בחומר שעליו מודלים גדולים מאומנים הוא זעיר. מפתחי DictaLM, מודל עברי ייעודי, מנסחים את זה כך: מודלים מאומנים על כמויות טקסט אדירות, ורק חלק זעום מהן מייצג שפות עם מעט חומר דיגיטלי כמו עברית, ולכן הביצועים בהן נופלים משמעותית. כדי לאמן את המודל שלהם הם נאלצו להרכיב את מה שהם מתארים כאוסף הטקסטים העבריים הגדול ביותר הידוע להם, 35 מיליארד מילים. זה סדר גודל שאנגלית מייצרת ללא מאמץ.
הסבר שני: הדרך שבה הטקסט נחתך ליחידות לפני שהמודל בכלל רואה אותו. החיתוך הזה נבנה ברובו סביב אנגלית, ועברית משלמת עליו מחיר שאפשר למדוד. באותה עבודה דווח שמילה עברית ממוצעת נחתכת ליותר מחמש יחידות נפרדות, כלומר בערך יחידה לכל אות, בעוד מילה אנגלית באותו חיתוך נשארת לרוב שלמה או כמעט שלמה. הוספה של אלף יחידות עבריות בלבד הפחיתה את הפיצול ביותר מחצי.
למה זה משנה קלינית: מילה עברית נושאת מידע דקדוקי שאנגלית מפזרת על כמה מילים נפרדות. שורש ומשקל, אותיות שימוש שנצמדות, כינויים חבורים, סמיכות. כשמילה כזאת מתפרקת לחמש או שש יחידות, המידע שהיא נושאת, ובכלל זה מי עשה את הפעולה ולמי, מתפזר בין יחידות שהמודל צריך להרכיב מחדש. זה מה שהוליד גם מודלים עבריים ייעודיים וגם לוח השוואות עברי נפרד, שנבנה במפורש משום שלוחות ההשוואה הרב-לשוניים הקיימים אינם משקפים את מאפייני העברית.
וכדאי לא להפוך את זה להסבר-על. ברוב הזמן העבודה בעברית תקינה לגמרי. החולשות יוצאות כשנדרשת הבחנה דקה, וזה החומר של החדר.
חמישה מקומות שבהם זה נופל
שלילה, ובעיקר כפולה. "היא לא אמרה שהיא לא רוצה." הבדיקה: בקשה מהמודל לנסח את המשפט מחדש בשלוש דרכים ולסמן אם המשמעות השתנתה. אם היא השתנתה, הוא לא קרא אותו נכון מלכתחילה.
מין דקדוקי וייחוס דובר. בעברית המין נישא בתוך הפועל, ובשיחה בין שניים מודל שמאבד אותו מאבד את מי אמר מה. הבדיקה: אחרי תיאור עם שני דוברים, בקשה לשורה אחת שאומרת מי אמר מה, לפני כל ניתוח.
זמן ורצף. עבר עברי אחד עושה את העבודה של כמה זמנים באנגלית, ולכן סדר האירועים לא תמיד עובר. הבדיקה: בקשה לציר זמן קצר של מה קרה קודם ומה אחר כך, והשוואה לכוונה המקורית.
אירוניה והמעטה. "היה בסדר" הוא לפעמים ההפך הגמור, ומודל קורא אותו כפשוטו. הבדיקה: כשאמירה נשענת על טון, כותבים את הטון בסוגריים. "היה בסדר (נאמר בהשטחה, אחרי שתיקה ארוכה)".
מונחים מקצועיים בלי צורה עברית יציבה. החזקה, הכלה, נסיגה, העברה. לכל אחת מהן יש משמעות יומיומית בעברית שאיננה המשמעות המקצועית, והמודל בוחר ביניהן לפי הקשר סטטיסטי. הבדיקה: עוגן באנגלית בהופעה הראשונה, "נסיגה (regression)".
שלושה כללי כתיבה
1. משפטים קצרים. משפט עם שתי פסוקיות משועבדות הוא המקום שבו ייחוס מתבלבל. שני משפטים קצרים במקומו עולים חצי שורה ומונעים את רוב זה.
2. בלי ראשי תיבות, וגם בלי אות בודדת כשם. "מ'" או "פ'" מתפרקות בטוקניזציה ומבלבלות גם את המין וגם את הייחוס. שם בדוי מלא ותואם מגדר, "דנה" או "יואב", עם שורה שמסמנת שזה שם בדוי, קריא יותר וגם בטוח יותר.
3. קריאה חוזרת לפני הניתוח. שתי שורות: מה המודל הבין שקרה, ומי אמר מה. זו כנראה ההגנה היעילה ביותר מפני טעויות ייחוס, שלילה וזמן, והיא עולה חמש שניות. היא גם הופכת שגיאה שקטה לשגיאה גלויה, וזה כל ההבדל.
מתי כן לעבור לאנגלית
ההבחנה היא לפי מה יש בפנים, לא לפי כמה השאלה קשה.
שאלה תיאורטית בלי אדם בתוכה תקבל תשובה טובה יותר באנגלית, כי שם יושב רוב החומר. "מה הספרות אומרת על נסיגה אחרי הפסקה טיפולית" הוא המקרה.
חומר של מטופל נשאר בעברית, גם כשהניתוח באנגלית היה יוצא חד יותר.
למה לא לתרגם חומר של מטופל. הפיתוי הגיוני, והמחיר גבוה מהתועלת. תרגום הוא מעבר מאבד, וחזרה לעברית היא מעבר שני. מה שהולך לאיבוד ראשון הוא מה שיש לו ערך קליני: הבחירה במילה מסוימת, הרגיסטר, החזרה על ניסוח, השיבוש, ההמעטה. ניתוח מעט חלש יותר של המילים שנאמרו באמת עדיף על ניתוח טוב של פרפרזה.
עבודה בעברית, תשובה בעברית. מונחי מפתח והמשמעות המקצועית שלהם:נסיגה (regression), הכלה (containment), החזקה (holding), העברה (transference)[להוסיף או להוריד לפי הצורך] השמות בתיאור הם שמות בדויים. התיאור, בלי פרטים מזהים: [שתיים-שלוש שורות]השאלה: [שאלה אחת] לפני שאתה עונה, החזר שתי שורות:(א) מה הבנת שקרה, ומי אמר מה;(ב) האם יש בתיאור משפט שאתה לא בטוח איך לקרוא. אם כן, שאל לפני שתמשיך.
הקריאה החוזרת לפני הניתוח היא זו שמחזירה את מרב הערך מבין השלושה. היא תופסת את הטעויות שקשה לזהות אחר כך, כי אחר כך הן כבר מוטמעות בניתוח שנשמע סביר.
בשורה התחתונה: עברית יוצאת חלשה יותר משתי סיבות מבניות, מיעוט חומר עברי באימון והדרך שבה מילה עברית נחתכת ליחידות. ברוב הזמן זה לא מורגש; זה מורגש כשנדרשת הבחנה דקה, וזה החומר של החדר.
חמישה מקומות שבהם זה נופל: שלילה כפולה, מין דקדוקי וייחוס דובר, סדר האירועים בזמן, אירוניה והמעטה, ומונחים מקצועיים שיש להם משמעות יומיומית אחרת בעברית.
מה עושים בפועל:
- מבקשים קריאה חוזרת לפני כל ניתוח: שתי שורות שאומרות מה המודל הבין שקרה ומי אמר מה.
- כותבים משפטים קצרים, ומחליפים ראשי תיבות ואות בודדת כשם בשם בדוי מלא ותואם מגדר.
- מוסיפים עוגן באנגלית למונח מקצועי בהופעה הראשונה שלו, למשל "נסיגה (regression)".
מתי לעבור לאנגלית: רק בשאלה תיאורטית שאין בה אדם. חומר של מטופל נשאר בעברית גם כשהניתוח באנגלית היה יוצא חד יותר, כי מה שהולך לאיבוד בתרגום הוא מה שיש לו ערך קליני.
מאיפה המספרים
כל מספר במדריך הזה מגיע מהעבודה הבאה. אין צורך לקרוא אותה כדי להשתמש במדריך.
- כמה עברית עולה למודל. מילה עברית ממוצעת נחתכת ליותר מחמש יחידות נפרדות, בערך יחידה לאות, והוספת אלף יחידות עבריות מפחיתה את הפיצול ביותר מחצי. באותה עבודה מתוארת גם מצוקת החומר: כדי לאמן מודל עברי ייעודי נדרש להרכיב את אוסף הטקסטים העבריים הגדול ביותר הידוע למחברים, 35 מיליארד מילים.
- Shmidman, S. et al. (2024). Adapting LLMs to Hebrew: Unveiling DictaLM 2.0 with Enhanced Vocabulary and Instruction Capabilities. arXiv:2407.07080 (נפתח בחלון חדש)
- ולמה נדרש לוח השוואות עברי נפרד. הוא נבנה מתוך הנימוק שלוחות ההשוואה הרב-לשוניים הקיימים אינם משקפים את מאפייני העברית.
- Open Hebrew LLM Leaderboard (נפתח בחלון חדש), Hugging Face
אין מדידה של ביצועי מודלים בעברית קלינית. כל מה שכתוב למעלה מגיע מבלשנות חישובית וממשימות כלליות, ומאפשר לדעת לאן להסתכל, לא כמה גדול הפער.