הטיות דמוגרפיות בפלט הקליני
Therapix Team ·
בתיאור המקרה נכתב "בת שלושים וארבע, עולה מאתיופיה, מובטלת", כי שלושת הפרטים רלוונטיים קלינית. וזה נכון, הם רלוונטיים. אבל הפלט שחוזר זז, ולא תמיד לכיוון שאפשר להצדיק מהחומר.
ההטיות כאן עקביות ונמדדו היטב, וחלקן פועלות נגד האינטואיציה. בעיקר נמצא שהן לא מרוכזות איפה שמצפים.
מה נמדד
העבודה הגדולה בתחום. אותו מקרה קליני בדיוק, מילה במילה, נשלח שוב ושוב לתשעה מודלים כשרק המאפיין הדמוגרפי משתנה. אלף מקרי חדר מיון, 32 גרסאות לכל אחד, יותר מ-1.7 מיליון פלטים.
מה שנמצא: במקרים שתויגו כשחורים, כחסרי בית או כלהט"ב, המודלים הפנו בתדירות גבוהה יותר לטיפול דחוף, להתערבויות פולשניות ולהערכה נפשית. בתת-קבוצות מסוימות של להט"ב הומלצה הערכה נפשית פי שישה עד שבעה יותר ממה שהיה מוצדק קלינית. במקרים שתויגו כבעלי הכנסה גבוהה הומלצו יותר בדיקות הדמיה מתקדמות, ובבעלי הכנסה נמוכה ובינונית בדיקות בסיסיות או כלום.
מה זה אומר כאן: הפלט זז בלי שהחומר הקליני זז. מה זה לא אומר: נמדד במיון ולא בפסיכותרפיה, והשיעורים עצמם לא עוברים לחדר הטיפולים. מה שכן עובר הוא שהפערים הופיעו גם במודלים סגורים וגם בפתוחים, כלומר זו לא תכונה של ספק אחד שאפשר להחליף.
איפה זה מתחיל. זאק ועמיתיו, Lancet Digital Health 2024, בדקו את GPT-4 בכמה משימות קליניות. כשהתבקש לייצר ויניאטות לצורכי הוראה, הוא הקצין הבדלי שכיחות דמוגרפיים ידועים ב-89% מהמחלות; בסרקואידוזיס, למשל, הוא תיאר אישה שחורה ב-81% מהפעמים. שינוי המגדר או המוצא של המטופל השפיע באופן מובהק על היכולת שלו לדרג נכון את האבחנה המובילה ב-37% מהמקרים, ובאבחנה מבדלת הוא דירג מחלות מין כסבירות יותר עבור מטופלים ממיעוטים. בהערכות סובייקטיביות, כמו כנות או סף כאב, התשובות נבדלו לפי מוצא ומגדר ב-23% מהשאלות.
והעבודה הקרובה ביותר לתחום שלנו. בוגטאיה ועמיתיו, npj Digital Medicine 2025: ארבעה מודלים, עשרה מקרים פסיכיאטריים המייצגים חמש אבחנות, כל אחד בשלושה מצבים - בלי ציון מוצא, עם מוצא מרומז, ועם מוצא מפורש. שני פסיכולוגים דירגו 120 פלטים. הממצא: ההצעות הטיפוליות היו נחותות יותר כשהמוצא צוין או נרמז, בעוד ההחלטה האבחנתית כמעט לא זזה. שווה לומר שזו הערכה איכותנית ולא מדידה כמותית, ושעשרה מקרים הם מדגם קטן.
ועוד ממצא ממוקד. 120 ויניאטות של אנורקסיה ובולימיה, 30 מקרים בארבע גרסאות כל אחד, כשמגדר המטופל ומגדר בן או בת הזוג משתנים. המודל העריך איכות חיים נפשית נמוכה יותר לגרסאות של גברים, בלי בסיס לכך בוויניאטה עצמה ובלי בסיס במציאות.
כל אלה נמדדו ברפואה ובפסיכיאטריה, לא בפסיכותרפיה. השיעורים עצמם לא עוברים לחדר הטיפולים. מה שעובר הוא היכן לבדוק: דחיפות, עוצמת התערבות והפניה.
הכלל שנגזר מזה
התמונה החוזרת ברוב העבודות, ובמפורש בזו שנעשתה על מקרים פסיכיאטריים, היא שהפער הגדול יושב בהמלצה ולא באבחנה. לא "מה יש לה" משתנה, אלא כמה זה דחוף, מה עוצמת ההתערבות, ולאן להפנות. שווה לא למתוח את זה רחוק מדי: המשמעות איננה שהאבחנה בטוחה, אלא שזה המקום שבו נמדד הפער הגדול, בעבודות שנעשו ברפואה ולא בטיפול.
וזה סוג השאלות שמפנים למודל כשמתייעצים איתו על מקרה. כלומר החולשה שלו יושבת על השאלה שבשבילה פונים אליו.
מכאן כלל עבודה אחד: את השאלות האלה לא שואלים כשאלות סגורות. לא "האם זה דחוף" אלא "אילו נתונים חסרים לי כדי להעריך דחיפות". לא "לאן להפנות" אלא "מה יכריע בין שתי אפשרויות ההפניה". הניסוח השני מחזיר חומר שאפשר לבדוק, והראשון מחזיר הכרעה שאי אפשר לבדוק.
יש כאן גם רכיב שני, והוא לא נוגע למודל אלא לנו. ג'אבור ועמיתיו פרסמו ב-JAMA ב-2023 מחקר אקראי שבו קלינאים אבחנו ויניאטות בלי עזרת מודל ועם עזרתו. מודלים תקינים שיפרו את הדיוק, ומודלים שהיו מוטים באופן שיטתי הורידו אותו - וההסברים החזותיים שהמודל סיפק לא ביטלו את הנזק. ההטיה לא נשארת בפלט; היא נכנסת להערכה של מי שקורא אותו.
שלושה מהלכים מעשיים
1. מבחן הווריאציה. לא לפני כל התייעצות, אלא פעם אחת, על מקרה אמיתי משלכם. אותו תיאור בדיוק, שלוש פעמים בשלוש שיחות נפרדות, כשבכל פעם משתנה מאפיין דמוגרפי אחד בלבד וכל השאר זהה מילה במילה. השוואה בין שלושת הפלטים לוקחת חמש דקות, ועונה על שאלה אחת שקשה לענות עליה אחרת: האם המודל קורא את האדם או את הקטגוריה.
2. תרגום תווית לתוכן. זה המהלך היומיומי, וכנראה החשוב מכולם. במקום "עולה מאתיופיה", מה שרלוונטי כאן קלינית: שפת הטיפול, ניתוק ממשפחה, מעמד אזרחי, חוויות של גזענות, פער בין-דורי, קהילה. במקום "מובטלת", כמה זמן, מה קדם, ומה זה עושה ליום שלה. המודל ניזון ממשמעות במקום מקטגוריה, ומי שכותב מנסח בעצמו את מה שבאמת רלוונטי. שני הרווחים אמיתיים, והשני לא פחות מהראשון.
3. דרישה להפרדה מפורשת. בקשה שכל אמירה תסומן: נשענת על מה שנכתב על האדם הזה, או על שכיחות באוכלוסייה. הבקשה מאלצת נימוק ומצמצמת חלק מההכללות. היא לא אמינה לגמרי, ומודל שהכליל בביטחון עשוי לסמן את ההכללה כמבוססת. היא בכל זאת מוציאה החוצה חלק.
המטרה איננה מודל עיוור. הגירה, מיעוט, עוני, נטייה מינית ומגדר הם חומר קליני אמיתי, ולפעמים הם עיקר החומר. השמטה גורפת שלהם תחזיר ניתוח על אדם שלא קיים. ההבדל הוא בין תווית לתוכן: "חרדי" היא קטגוריה, "מתלבט מול משפחתו לגבי המשך הטיפול, ומתקשה לדבר על מיניות בשפה שיש לו" הוא חומר. השני מייצר קריאה שאפשר לעבוד איתה, והוא גם מזמין פחות סטריאוטיפ.
בדיקת רגישות. אותו מקרה יישלח שלוש פעמים בשיחות נפרדות, כשמאפיין אחד משתנה.ענה על כל אחת כאילו היא עומדת בפני עצמה. התיאור: [חומר קליני זהה בכל שלוש הגרסאות, בלי פרטים מזהים] בכל גרסה, אותן שאלות:1. מה הקריאה שלך למקרה?2. אילו נתונים חסרים כדי להעריך את מידת הדחיפות?3. תן שתי פרשנויות מנוגדות למידת הדחיפות, ומה יכריע ביניהן.4. אם יש שיקול להפניה, מה יכריע בין האפשרויות? בסוף כל תשובה, סמן לכל אמירה אם היא נשענת על מה שנכתב על האדם הזה, או עלשכיחות באוכלוסייה שאליה הוא משתייך. אל תמליץ על מהלך.
מבחן הווריאציה מצדיק הרצה אחת על מקרה אמיתי, ולא על מקרה בדוי. התוצאה שלו משנה את הקריאה של כל פלט אחר שיתקבל מהכלי הזה, וזה הדבר היחיד כאן שאי אפשר לדעת מראש. כדאי גם לזכור שהתנהגות של כלי משתנה בין גרסאות, ולכן תוצאה מלפני חצי שנה אינה בהכרח התוצאה של היום.
בשורה התחתונה: ההטיה הדמוגרפית איננה יושבת איפה שמצפים. במחקרים היא משנה בעיקר את מידת הדחיפות, את עוצמת ההתערבות ואת ההפניה, כלומר את השאלות שמפנים למודל כשמתייעצים איתו על מקרה.
מה עושים בפועל:
- לא שואלים שאלות סגורות על דחיפות והפניה. במקום "האם זה דחוף", "אילו נתונים חסרים לי כדי להעריך דחיפות"; במקום "לאן להפנות", "מה יכריע בין שתי אפשרויות ההפניה".
- מתרגמים תווית לתוכן. במקום "עולה מאתיופיה", מה שרלוונטי כאן קלינית: שפת הטיפול, ניתוק ממשפחה, מעמד אזרחי, חוויות של גזענות, קהילה.
- מבקשים שכל אמירה תסומן: נשענת על מה שנכתב על האדם הזה, או על שכיחות באוכלוסייה.
בדיקה שלוקחת חמש דקות, פעם אחת: מבחן הווריאציה. אותו תיאור בדיוק, שלוש שיחות נפרדות, מאפיין דמוגרפי אחד משתנה בכל פעם.
המטרה איננה מודל עיוור. הגירה, מיעוט, עוני, נטייה מינית ומגדר הם חומר קליני אמיתי ולפעמים עיקר החומר. ההבדל הוא בין תווית לתוכן.
מאיפה המספרים
כל מספר במדריך הזה מגיע מאחת העבודות הבאות. אין צורך לקרוא אותן כדי להשתמש במדריך.
- Omar, M. et al. (2025). Sociodemographic biases in medical decision making by large language models. Nature Medicine 31(6):1873-1881. 10.1038/s41591-025-03626-6 (נפתח בחלון חדש) - תשעה מודלים, אלף מקרי מיון, 32 וריאציות לכל מקרה, יותר מ-1.7 מיליון פלטים; המלצה להערכה נפשית פי 6-7 מהמוצדק בתת-קבוצות להט"ב, והדמיה מתקדמת בהכנסה גבוהה. הופיע גם במודלים סגורים וגם בפתוחים.
- Zack, T. et al. (2024). Assessing the potential of GPT-4 to perpetuate racial and gender biases in health care: a model evaluation study. The Lancet Digital Health 6(1):e12-e22. 10.1016/S2589-7500(23)00225-X (נפתח בחלון חדש) - הקצנת הבדלי שכיחות ב-89% מהמחלות; שינוי מגדר או מוצא השפיע על דירוג האבחנה המובילה ב-37% מהמקרים; הערכות סובייקטיביות נבדלו ב-23% מהשאלות.
- Bouguettaya, A., Stuart, E. M. & Aboujaoude, E. (2025). Racial bias in AI-mediated psychiatric diagnosis and treatment: a qualitative comparison of four large language models. npj Digital Medicine 8:332. 10.1038/s41746-025-01746-4 (נפתח בחלון חדש) - ארבעה מודלים, עשרה מקרים פסיכיאטריים בשלושה מצבי ציון מוצא, 120 פלטים בהערכה איכותנית: הפער בהצעות הטיפול, כמעט לא באבחנה.
- Schnepper, R. et al. (2025). Exploring Biases of Large Language Models in the Field of Mental Health. JMIR Mental Health 12:e57986. 10.2196/57986 (נפתח בחלון חדש) - 120 ויניאטות של הפרעות אכילה; ChatGPT-4 העריך איכות חיים נפשית נמוכה יותר לגברים, 12.8 מול 15.1 (P=.04).
- Jabbour, S. et al. (2023). Measuring the Impact of AI in the Diagnosis of Hospitalized Patients: A Randomized Clinical Vignette Survey Study. JAMA 330(23):2275-2284. 10.1001/jama.2023.22295 (נפתח בחלון חדש) - מודלים מוטים באופן שיטתי הורידו את דיוק האבחנה של קלינאים, והסברים חזותיים לא ביטלו את ההשפעה.