לבדוק סיכום AI לפני שהוא נכנס לתיק

Therapix Team ·

סיכום שנוצר אוטומטית מפגישה נקרא טוב. הוא מסודר, הוא בנוי בסעיפים, והוא כתוב בשפה המקצועית הנכונה. הסכנה היא שהסדר מחליף דיוק: טקסט מסודר נקרא כמדויק, וההרגשה שנשארת אחרי קריאה שלו היא שהכול שם.

השאלה המעשית היא מה לא, ואיפה לחפש את זה בשתי דקות במקום בעשרים.

מה נמדד

בעבודה שפורסמה ב-2025 ב-PLOS Digital Health נבדקו סיכומים שהפיק GPT-4 למאה ביקורים במיון. שליש מהסיכומים היו נקיים לחלוטין מכל סוג שגיאה. אי-דיוקים נמצאו ב-10% מהמקרים, הזיות ב-42%, והשמטה של תוכן שהמדרגים סיווגו כרלוונטי קלינית ב-47%. ציון הנזק הממוצע היה 0.57 מתוך 7, ושלוש שגיאות בלבד דורגו ברמה שמשמעותה נזק אפשרי בלתי הפיך.

בעבודה בריטית שפורסמה ב-2025 ב-BMJ Digital Health & AI נבחנו שבעה מוצרי תמלול וסיכום קליניים מסחריים על שמונה תרחישי התייעצות מתוקננים. 83.8% מהשגיאות היו השמטות. הזיות ואי-דיוקים היו נדירים יותר אבל חמורים יותר מבחינה קלינית. אף אחד משבעת המוצרים לא הפיק סיכום נקי משגיאות. הם ממליצים במיוחד לבדוק פרטים פסיכו-סוציאליים שהושמטו ותרופות, ולחשוד בתוספות שנשמעות סבירות.

בעבודה נוספת מ-2025 יושם אותו קריטריון בינארי על שני סוגי פתקים: תוכן שאין לו מקור במפגש נמצא ב-31% מהפתקים האוטומטיים וב-20% מהפתקים שכתבו רופאים. המספר השני הוא תזכורת שגם תיעוד אנושי אינו נקי, ולא סיבה להוריד את הרף.

כל הנתונים האלה מגיעים מרפואה כללית ומרפואת חירום. לא נמדד שום דבר מקביל בפסיכותרפיה, ואין להסיק מהם שיעורים לחדר הטיפולים. מה שאפשר להסיק הוא לאן להסתכל.

למה השמטה קשה לתפוס יותר מהמצאה

המצאה בולטת: קוראים משפט ולא מזהים אותו, ומשהו נדלק. השמטה לא בולטת, כי כל מה שכתוב נכון ואין שום סימן פנימי שמשהו חסר.

מכאן נובע דבר אחד מעשי: קשה לבדוק סיכום מול הזיכרון, גם כשהזיכרון טוב. מה שנשכח הוא בדיוק מה שלא בלט, והקריאה עצמה עלולה לקבע את גרסת הסיכום. בדיקה שיטתית דורשת מקור, כלומר תמלול או הקלטה. בלי מקור נשארים עם טיוטה שלא ניתן לאמת במלואה, וזה עדיין מצב שאפשר לעבוד בו, בתנאי שיודעים את זה.

שלוש שכבות, שתי דקות

הסדר לפי מה שקורה אם השגיאה תעבור.

1. עובדות וציטוטים. שמות, תאריכים, תרופות ומינונים, מספרים, וכל ציטוט שמופיע במרכאות. אלה הפרטים שגורם שלישי עשוי לפעול לפיהם, והם היחידים שאפשר לאמת בצורה בינארית. ציטוט במרכאות שאינו זהה למקור אינו ציטוט.

2. סיכון ומצב נפשי. האם נאמר משהו שנוגע לסיכון ולא נכתב, או נכתב ולא נאמר. את השכבה הזאת לא לוקחים מהסיכום. חוזרים למקור, גם כשהסיכום נראה תקין.

3. תוכנית והסכמות. מה סוכם, מה נקבע, מה הצעד הבא. זה המקום שבו מודל נוטה להשלים תוכנית סבירה שלא נאמרה, והסוג הזה של הזיה לא מפריע לקריאה בכלל.

שלוש השכבות אינן מסודרות לפי חומרה. שגיאה במינון תרופה או הסכמה שהומצאה הן שגיאות קליניות לכל דבר. הסדר הוא לפי כמה מהר הן מתפשטות החוצה.

כשאין תמלול ואין הקלטה

זה המצב של רוב מי שעובד בקליניקה פרטית, וגם של מי שמזין למודל ראשי פרקים שכתב בעצמו במקום תמלול מלא. אז חלק מהבדיקה נופל, ומה שנשאר הוא זה:

את שכבה 2 ואת שכבה 3 כותבים מחדש ביד, מהזיכרון, לפני שקוראים את מה שהמודל כתב עליהן. ואז משווים. ההפרש בין שתי הגרסאות הוא בדיוק המידע שחיפשתם, וזה כל מה שאפשר לקבל בלי מקור.

את שכבה 1 בודקים מול מה שכן קיים: התיק, המרשם, יומן הפגישות.

שתי דרישות שמשנות את הפלט עצמו

הראשונה: לבקש מהמודל לפלוט, לצד הסיכום, רשימה של מה שלא הצליח לקבוע מהחומר. מודל שלא התבקש לכך נוטה למלא את הפערים בעצמו.

השנייה: לבקש שכל אמירה תסומן כנאמרה או כמוסקת. הסימון אינו אמין לגמרי, והוא בכל זאת מוציא החוצה חלק מההשלמות.

מעבר שני מצמצם את הרשימה, הוא לא מאמת אותה. אפשר להגיש למודל את התמלול ואת הסיכום יחד ולבקש את ההפרש בשני הכיוונים. זה לוקח פחות מדקה ומחזיר רשימה קצרה של חשודים. אבל זה אותו כלי עם אותן מגבלות: הוא עלול לפספס באמצע טקסט ארוך, והוא עלול להמציא ציטוט. את הפריטים שהוא מחזיר בודקים מול המקור בעיניים. הוא מקצר את החיפוש ולא מחליף אותו.

להעתקה
להלן תמלול של פגישה ולאחריו סיכום שנוצר ממנו אוטומטית.

תפקידך הוא השוואה, לא שיפור. אל תכתוב סיכום חדש.

החזר שלוש רשימות:
(א) טענות שמופיעות בסיכום ואין להן בסיס בתמלול. לכל אחת, ציין מה בסיכום ומה
בתמלול הכי קרוב אליה;
(ב) תוכן שמופיע בתמלול ונעדר מהסיכום, ושלהערכתך רלוונטי קלינית. לכל אחד,
צטט מהתמלול במדויק וציין את מספר השורה;
(ג) ציטוטים המופיעים בסיכום במרכאות ואינם זהים מילה במילה למקור.

אל תשמיט פריטים כדי לקצר. אם רשימה ריקה, כתוב שהיא ריקה.

--- תמלול ---
[הדבקה]

--- סיכום ---
[הדבקה]

הסיכום הוא טיוטה, וברגע שהוא נכנס לתיק הוא הטקסט שלכם. החתימה עליו שלכם, גם כשלא כתבתם בו אף מילה.

מקורות

  • Williams, C. Y. K. et al. (2025). Evaluating large language models for drafting emergency department encounter summaries. PLOS Digital Health. 10.1371/journal.pdig.0000899
  • Draper, T. C. et al. (2025). Clinical AI Scribes in primary care: accuracy, error severity and implications for clinical practice. BMJ Digital Health & AI 1(1):e000092. 10.1136/bmjdhai-2025-000092
  • Palm, E. et al. (2025). Assessing the quality of AI-generated clinical notes: validated evaluation of a large language model ambient scribe. Frontiers in Artificial Intelligence. 10.3389/frai.2025.1691499