לבדוק סיכום AI לפני שהוא נכנס לתיק

Therapix Team ·

סיכום שנוצר אוטומטית מפגישה נקרא טוב. הוא מסודר, בנוי בסעיפים, וכתוב בשפה המקצועית הנכונה, וזה מה שמקשה לבדוק אותו: הסדר נקרא כדיוק, וההרגשה שנשארת אחרי הקריאה היא שהכול שם.

זו לא רק התרשמות. בעבודה של פאלם ועמיתיו מ-2025 הושוו 97 מפגשים קליניים, לכל אחד שני סיכומים: אחד שכתב הרופא ואחד שהפיק כלי תמלול אוטומטי. הסיכומים האוטומטיים הכילו תוכן שאין לו מקור במפגש בשיעור גבוה יותר, 31% מול 20%, והסוקרים בכל זאת העדיפו אותם, 47% מול 39%. הטקסט שנקרא טוב יותר הוא גם זה שהכיל יותר המצאות. זו הסיבה שקריאה רגילה איננה בדיקה.

השאלה המעשית היא מה לא נמצא שם, ואיפה לחפש את זה בשתי דקות במקום בעשרים.

מה נמדד, ומה אפשר לגזור מזה

שלוש עבודות מ-2025, וכולן מרפואה כללית ומרפואת חירום. בפסיכותרפיה לא נמדד דבר מקביל, ולכן השיעורים עצמם לא עוברים לחדר הטיפולים. מה שכן עובר הוא סוג השגיאה ומיקומה.

כמה שגיאות יש בסיכום של מודל יחיד. ויליאמס ועמיתיו ב-PLOS Digital Health לקחו מאה ביקורים במיון, הפיקו לכל אחד סיכום ב-GPT-4, ושני רופאי חירום דירגו כל סיכום. שליש מהסיכומים (33%) היו נקיים לחלוטין מכל סוג שגיאה. אי-דיוקים הופיעו ב-10%, תוכן שאין לו מקור ב-42%, והשמטה של תוכן שהמדרגים סיווגו כרלוונטי קלינית ב-47%.

מה זה אומר כאן: בערך בכל סיכום שני חסר משהו שנאמר בפגישה. חיפוש של מה שחסר הוא מעבר נפרד, והוא לא קורה מעצמו בקריאה רגילה. מה זה לא אומר: רוב השגיאות שנמצאו שם היו קלות. באותה עבודה נבדק גם דור מודלים קודם, ושם רק 10% מהסיכומים היו נקיים, כלומר המספרים זזים עם הדור ומתארים רגע מסוים ולא קבוע טבע.

איך השגיאות מתפלגות במוצרים מסחריים. דרייפר ועמיתיו ב-BMJ Digital Health & AI בדקו שבעה מוצרי תמלול וסיכום קליניים מסחריים על שמונה תרחישי התייעצות מתוקננים. 83.8% מכלל השגיאות היו השמטות. הזיות ואי-דיוקים היו נדירים יותר, אבל חמורים יותר מבחינה קלינית. אף אחד משבעת המוצרים לא הפיק סיכום נקי משגיאות, וההבדלים בין המוצרים היו גדולים. ההמלצה המפורשת שלהם ממוקדת: לבדוק במיוחד פרטים פסיכו-סוציאליים שהושמטו ותרופות, ולחשוד בתוספות שנשמעות סבירות. בהערכת האיכות הכללית הסיכומים יצאו חזקים בעקביות ובשימושיות, וחלשים דווקא בתמציתיות ובארגון.

הקו שמצטייר משתיהן יחד: השגיאה השכיחה היא השמטה, השגיאה המסוכנת היא המצאה, והן דורשות שתי בדיקות שונות. זה מסביר גם למה מעבר קריאה אחד לא מספיק.

למה השמטה קשה לתפוס יותר מהמצאה

המצאה בולטת. קוראים משפט, לא מזהים אותו, ומשהו נדלק. השמטה לא בולטת, כי כל מה שכתוב נכון ואין שום סימן פנימי לכך שמשהו חסר. טקסט לא מכריז על מה שאין בו.

מכאן נובע דבר אחד מעשי, והוא לא נעים: קשה לבדוק סיכום מול הזיכרון, גם כשהזיכרון טוב. מה שנשכח הוא מה שלא בלט בזמן אמת, והקריאה עצמה עלולה לקבע את גרסת הסיכום כגרסה של הפגישה. בדיקה שיטתית דורשת מקור, כלומר תמלול או הקלטה. בלי מקור נשארים עם טיוטה שלא ניתן לאמת במלואה, וזה עדיין מצב שאפשר לעבוד בו, בתנאי שיודעים שזה המצב.

שלוש שכבות, שתי דקות

הסדר כאן הוא לפי כמה מהר השגיאה מתפשטת החוצה, לא לפי חומרה. שגיאה במינון או הסכמה שהומצאה הן שגיאות קליניות לכל דבר.

1. עובדות וציטוטים. שמות, תאריכים, תרופות ומינונים, מספרים, וכל ציטוט שמופיע במרכאות. אלה הפרטים שגורם שלישי עשוי לפעול לפיהם, והם היחידים שאפשר לאמת בצורה בינארית: או שזה מה שנאמר או שלא. ציטוט במרכאות שאינו זהה למקור אינו ציטוט, גם כשהמשמעות נשמרה.

2. סיכון ומצב נפשי. האם נאמר משהו שנוגע לסיכון ולא נכתב, או נכתב ולא נאמר. זו השכבה היחידה שלא כדאי לקרוא מהסיכום גם כשהוא נראה תקין לגמרי, כי כאן ההשמטה היא סוג השגיאה השכיח, והיא בדיוק סוג התוכן שדרייפר ועמיתיו מצאו שנוטה ליפול.

3. תוכנית והסכמות. מה סוכם, מה נקבע, מה הצעד הבא. זה המקום שבו מודל נוטה להשלים תוכנית סבירה שלא נאמרה, וההשלמה הזו לא מפריעה לקריאה בכלל. היא נראית כמו הסעיף שאמור להיות שם.

כשאין תמלול ואין הקלטה

זה המצב של רוב מי שעובד בקליניקה פרטית, וגם של מי שמזין למודל ראשי פרקים שכתב בעצמו במקום תמלול מלא. חלק מהבדיקה פשוט נופל, ומה שנשאר הוא זה:

שכבה 2 ושכבה 3 נכתבות מחדש ביד, מהזיכרון, לפני שקוראים את מה שהמודל כתב עליהן. ואז משווים. ההפרש בין שתי הגרסאות הוא המידע שחיפשתם, וזה כל מה שאפשר להשיג בלי מקור. הסדר הזה הוא כל העניין: קריאה קודם הופכת את הבדיקה לאישור.

שכבה 1 נבדקת מול מה שכן קיים בלי הקלטה: התיק, המרשם, יומן הפגישות.

שתי דרישות שמשנות את הפלט עצמו

הראשונה היא לבקש מהמודל לפלוט, לצד הסיכום, רשימה של מה שלא הצליח לקבוע מהחומר. מודל שלא התבקש לכך נוטה למלא את הפערים בעצמו, כי פלט שלם נראה כמו פלט טוב.

השנייה היא לבקש שכל אמירה תסומן כנאמרה או כמוסקת. הסימון אינו אמין לגמרי, ומודל שהסיק בביטחון עשוי לסמן את ההסקה שלו כעובדה. הוא בכל זאת מוציא החוצה חלק מההשלמות, וזה מספיק כדי להצדיק שורה אחת בפרומפט.

מעבר שני מצמצם את הרשימה, הוא לא מאמת אותה. אפשר להגיש למודל את התמלול ואת הסיכום יחד ולבקש את ההפרש בשני הכיוונים. זה לוקח פחות מדקה ומחזיר רשימה קצרה של חשודים. אבל זה אותו כלי עם אותן מגבלות: הוא עלול לפספס באמצע טקסט ארוך, והוא עלול להמציא ציטוט. הפריטים שהוא מחזיר נבדקים מול המקור בעיניים. הוא מקצר את החיפוש ולא מחליף אותו.

להעתקה
להלן תמלול של פגישה ולאחריו סיכום שנוצר ממנו אוטומטית. תפקידך הוא השוואה, לא שיפור. אל תכתוב סיכום חדש. החזר שלוש רשימות:(א) טענות שמופיעות בסיכום ואין להן בסיס בתמלול. לכל אחת, ציין מה בסיכום ומהבתמלול הכי קרוב אליה;(ב) תוכן שמופיע בתמלול ונעדר מהסיכום, ושלהערכתך רלוונטי קלינית. לכל אחד,צטט מהתמלול במדויק וציין את מספר השורה;(ג) ציטוטים המופיעים בסיכום במרכאות ואינם זהים מילה במילה למקור. אל תשמיט פריטים כדי לקצר. אם רשימה ריקה, כתוב שהיא ריקה. --- תמלול ---[הדבקה] --- סיכום ---[הדבקה]

הסיכום הוא טיוטה, וברגע שהוא נכנס לתיק הוא הטקסט של מי שחתום עליו. זה נכון גם לגבי מה שנשמט ממנו.

בשורה התחתונה: השגיאה השכיחה בסיכום אוטומטי איננה משפט שגוי אלא משהו שנשמט, וקריאה רגילה לא תופסת אותה. בדיקה יעילה לוקחת שתי דקות ועובדת בשלוש שכבות.

מה עושים בפועל:

  • עוברים על העובדות שניתנות לאימות: שמות, תאריכים, תרופות ומינונים, וכל ציטוט שמופיע במרכאות.
  • חוזרים למקור בכל מה שנוגע לסיכון ולמצב נפשי, גם כשהסיכום נראה תקין לגמרי.
  • מוודאים שהתוכנית וההסכמות הן מה שנאמר בפגישה, ולא השלמה סבירה שנוספה.

כשאין תמלול: כותבים את שכבות הסיכון והתוכנית מהזיכרון לפני שקוראים את הסיכום, ורק אז משווים. קריאה קודם הופכת את הבדיקה לאישור.

מתי להחמיר: כשהסיכום נוגע לשינוי תרופתי, להערכת סיכון, או כשהוא עתיד לצאת לגורם שלישי.

מאיפה המספרים

כל מספר במדריך הזה מגיע מאחת העבודות הבאות. אין צורך לקרוא אותן כדי להשתמש במדריך.

  • האם טקסט שנקרא טוב יותר הוא גם מדויק יותר. 97 מפגשים, סיכום אוטומטי מול סיכום שכתב רופא: 31% מול 20% תוכן ללא מקור, ובכל זאת העדפה של הסוקרים לסיכום האוטומטי, 47% מול 39%.
  • כמה שגיאות יש בסיכום אוטומטי, כשמישהו באמת בודק. מאה סיכומי ביקור במיון שהפיק GPT-4, ושני רופאי חירום קראו כל אחד: 33% נקיים לחלוטין, 42% עם תוכן ללא מקור, 47% עם השמטה. ציון הנזק הפוטנציאלי הממוצע היה 0.57 בסולם 0 עד 7, ושלוש שגיאות בלבד דורגו 4 ומעלה. דור מודלים קודם באותה בדיקה הגיע ל-10% נקיים בלבד.
  • איך השגיאות מתפלגות במוצרים מסחריים. שבעה מוצרים על שמונה תרחישים מתוקננים: 83.8% מכלל השגיאות היו השמטות, ואף מוצר לא הפיק סיכום נקי.

מדריכים כאלה, ישר למייל

מדי פעם יוצא מדריך מעשי אחד למטפלות ומטפלים, כמו זה. משאירים כתובת, ושולחים כשיש משהו ששווה לקרוא. בלי לוח זמנים קבוע, ואפשר להסיר את ההרשמה בכל רגע.

הכתובת נשמרת לצורך שליחת התוכן בלבד. פרטים על השמירה ועל הזכויות שלך – במדיניות הפרטיות (נפתח בחלון חדש).