למה המודל מסכים איתך
Therapix Team ·
מנסחים פורמולציה, מדביקים אותה למודל, ומקבלים בחזרה הרחבה מנומקת שלה. הטקסט מסודר, הוא משתמש בשפה הנכונה, והוא מוסיף שתי נקודות שלא חשבנו עליהן. יוצאים מההתייעצות בטוחים יותר ממה שנכנסנו.
הדרכה טובה עושה בדרך כלל את ההפך. היא משאירה אותנו פחות בטוחים, לפחות לרגע. הפער הזה איננו תקלה נקודתית אלא תוצאה של האופן שבו מודלים מכווננים, ולכן הוא צפוי וגם ניתן לצמצום.
למה זה קורה
מודלים מכווננים על דירוגי העדפה אנושיים: אנשים מסמנים איזו משתי תשובות טובה יותר, והמודל מותאם לייצר תשובות שיסומנו כטובות. השאלה היא מה בני אדם מסמנים.
שארמה ועמיתיו בדקו ב-2023 חמישה עוזרי AI מובילים על ארבע משימות של טקסט חופשי, ומצאו את ההתנהגות הזאת בכולם. החלק החשוב יותר הוא מה שהם מצאו בנתוני ההעדפה עצמם: תשובה שתואמת את עמדת המשתמש נוטה להיבחר יותר, וגם בני אדם וגם מודלי ההעדפה שאומנו עליהם בוחרים לא פעם תשובה מסכימה וכתובה היטב על פני תשובה נכונה. כלומר ההסכמה איננה תקלה שהמודל עושה. היא חלק ממה שנלמד כתשובה טובה.
עבודה שנייה מאותה שנה הראתה משהו שסותר אינטואיציה נפוצה: הגדלת המודל וכיוונון ההוראות דווקא הגבירו את הנטייה. מודל חדש וחזק יותר איננו בהכרח פחות מסכים. באותה עבודה מודלים הסכימו גם עם טענות חשבון פשוטות ושגויות כשהמשתמש הביע בהן תמיכה, כלומר ההסכמה גוברת לפעמים על ידע שהמודל מחזיק.
ועוד ממצא שנוגע ישירות למי שקורא כאן: עבודה מ-2025 בדקה מה בכלל מפעיל את ההתנהגות הזאת, ומצאה שהצהרת עמדה מצד המשתמש מייצרת אותה באופן אמין, בעוד הצגת מומחיות כמעט לא משנה דבר. ההסבר שהם מציעים הוא שהמודל אינו מקודד סמכות של המשתמש כמשתנה נפרד. לכתוב "אני פסיכולוגית עם עשרים שנות ניסיון" לא הופך את התשובה לביקורתית יותר; מה שכן משנה הוא האם נאמרה שם דעה.
כל הממצאים האלה נמדדו במשימות כלליות, לא בהתייעצות קלינית. אין מחקר שמדד את גודל האפקט על פורמולציה טיפולית, ואי אפשר לצטט מספר לגבי מה שקורה בעברית מול תיאור מקרה. מה שיש הוא מנגנון מתועד היטב, שסביר שפועל גם כאן.
איך זה נראה בפלט
ארבעה סימנים, ומה שאפשר לעשות עם כל אחד:
הפלט נפתח באישור. "זו קריאה מדויקת", "אתה צודק שיש כאן". משפט כזה נכתב לפני שהמודל התייחס לחומר לגופו, והוא מכוון את כל מה שבא אחריו. שיחה חדשה עם הנחיה מפורשת שלא לפתוח בהערכה של מה שהוגש מסירה את רובו.
הכול מקבל הרחבה ושום דבר לא מקבל ערעור. כל נקודה שהועלתה מנוסחת מחדש ומחוזקת, ואף אחת לא נשאלת. זה הסימן שהכי קל להחמיץ, כי הרחבה מנומקת נקראת כתרומה.
האלטרנטיבה מוצגת כתוספת. "אפשר גם לחשוב על זה במונחים של" איננה קריאה חלופית, אלא עוד שכבה על אותה קריאה. קריאה חלופית אמיתית מסבירה את אותו חומר אחרת, וסותרת משהו.
גם ההיפך מקבל תמיכה. זה הסימן החד ביותר, וגם היחיד שאפשר לייצר במכוון. הבדיקה שמייצרת אותו נמצאת למטה.
ארבעה שינויים בניסוח, לפי כמה הם עולים
1. תיאור בגוף שלישי. במקום "אני חושבת שהיא נסוגה בעקבות ההפסקה", "מטפלת מציגה מקרה של מטופלת שנסוגה בעקבות ההפסקה". בבדיקה שהריצה שבעה עשר מודלים בשיחות מרובות סבבים, המעבר לגוף שלישי הפחית התנהגות מסכימה, והמספר שדווח, 63.8%, הוא הקצה שנמדד ולא הממוצע. זה שינוי של שורה אחת, והוא משנה את מי המודל מנסה לרצות: לא את בעל הדעה, אלא את התיאור. מה זה לא אומר: התרחיש שנמדד היה ויכוח ולא תיאור מקרה, ואין מדידה מקבילה בעברית קלינית.
2. לא לגלות את הפורמולציה לפני שהתקבלה אחת. סבב ראשון עם החומר בלבד ובקשה לקריאה. סבב שני: "זו הפורמולציה שלי. במה היא נבדלת ממה שהצעת, ומה מסביר את הפער?" מודל שכבר ניסח קריאה משלו מתקשה יותר לזנוח אותה, וזה מה שמייצר חיכוך שאפשר ללמוד ממנו. המחיר הוא סבב נוסף.
3. בקשה לקריטריון הפרכה, לא לחלופה. "תן קריאה חלופית" מייצר תוספת. מה שמייצר משהו אחר הוא "מה יפריך את הפורמולציה הזאת, ואיזו התנהגות בשתי הפגישות הקרובות תראה שהיא שגויה". הבקשה מקשה על המודל להסתפק באישור, והיא לא חסינה: קל לנסח קריטריון מעורפל שיתמוך בכל תוצאה. קריטריון שימושי הוא התנהגותי, תחום בזמן, וכזה שאפשר לדעת מראש מה ייחשב הפרכה שלו.
4. מבחן ההיפוך. אותו חומר בדיוק, מוגש בשיחה חדשה עם הפורמולציה ההפוכה. אם שתי הגרסאות מקבלות תמיכה משכנעת באותה מידה, התשובה שהתקבלה רגישה בעיקר לניסוח ולא לחומר.
איך לדעת אם הביקורת שהתקבלה שווה משהו
מודל שנדרש לסתור יסתור. השאלה היא אם יצא מזה משהו, ושלוש בדיקות מהירות עונות עליה.
הראשונה: האם הקריאה החלופית מסבירה את אותו חומר שהוגש, או שהיא נשענת על פרטים שלא ניתנו. אם היא דורשת מידע שהיא המציאה בשבילה, זה לא ערעור.
השנייה: האם היא מתייחסת לנקודה הספציפית, או שזו קריאה גנרית שאפשר להדביק לכל מקרה. "אולי יש כאן משהו סביב תלות" מתאים כמעט תמיד, ולכן אינו אומר דבר.
השלישית: האם יש לה קריטריון הפרכה שאפשר לראות בפגישה, ולא רק ניסוח שנשמע כמו כזה.
קריאה חלופית שנופלת בשלושתן היא לעומתיות מכנית, ואין סיבה לתת לה משקל רק מפני שהיא לא מסכימה.
מבחן ההיפוך לוקח חמש דקות. הוא זול, הוא לא דורש להאמין לשום דבר שכתוב כאן, והוא מחזיר אינדיקציה ישירה לכמה התשובה תלויה בפורמולציה שהוצגה. הרצה אחת שלו על מקרה שכבר ברור, לפני שנשענים על הכלי בפעם הבאה, שווה יותר מכל מה שכתוב למעלה.
להלן מקרה שמציגה מטפלת. הבקשה היא קריאה ביקורתית, לא אישור. החומר, בלי פרטים מזהים: [שתיים-שלוש שורות]הפורמולציה שהמטפלת מציעה: [מה שהיא חושבת שקורה] החזר, בסדר הזה:(א) קריאה שסותרת את הפורמולציה הזאת ומסבירה את אותו חומר אחרת, בלי להסתמךעל פרטים שלא הופיעו למעלה;(ב) קריטריון הפרכה: איזו התנהגות או אמירה בשתי הפגישות הקרובות תראהשהפורמולציה שגויה. שיהיה תחום בזמן וניתן לצפייה, לא תיאור של תכונה;(ג) מה חסר בחומר שהוצג, כלומר מה המטפלת לא שאלה. אל תפתח בהערכה של הפורמולציה ואל תסכם בעידוד. אם אתה מסכים איתה, כתוב מהבחומר גורם לך להסכים.
גוף שלישי הוא הזול מבין הארבעה והמדוד ביותר. הוא לא פותר את הבעיה, והוא כן משנה את השאלה ששואלים: לא "מה דעתך על מה שאני חושבת", אלא "מה קורה כאן".
בשורה התחתונה: מודלים מכווננים על דירוגי העדפה אנושיים, ובני אדם מדרגים תשובות מסכימות גבוה יותר. לכן פורמולציה שמוגשת למודל חוזרת מורחבת ומחוזקת, וזה ההפך ממה שהדרכה טובה עושה. הנטייה הזאת לא נחלשת במודלים חדשים יותר, והצגת ותק מקצועי לא משנה אותה.
מה עושים בפועל:
- מתארים את המקרה בגוף שלישי, כאילו מישהו אחר מציג אותו.
- מגישים את החומר בסבב ראשון בלי הפורמולציה, ורק בסבב שני שואלים במה היא נבדלת ממה שהמודל הציע.
- מבקשים קריטריון הפרכה, כלומר איזו התנהגות בשתי הפגישות הקרובות תראה שהפורמולציה שגויה.
בדיקה שלוקחת חמש דקות: מבחן ההיפוך. אותו חומר בדיוק, בשיחה חדשה, עם הפורמולציה ההפוכה. אם שתי הגרסאות מקבלות תמיכה משכנעת באותה מידה, התשובה רגישה לניסוח ולא לחומר.
מאיפה המספרים
כל מספר במדריך הזה מגיע מאחת העבודות הבאות. אין צורך לקרוא אותן כדי להשתמש במדריך.
- למה מודלים מסכימים. חמישה עוזרי AI מובילים על ארבע משימות טקסט חופשי. בני אדם ומודלי ההעדפה שאומנו עליהם העדיפו לא פעם תשובה מסכימה וכתובה היטב על פני תשובה נכונה.
- Sharma, M. et al. (2023). Towards Understanding Sycophancy in Language Models. ICLR 2024. arXiv:2310.13548 (נפתח בחלון חדש)
- האם זה נחלש במודלים חדשים. לא. הנטייה גדלה עם גודל המודל ועם כיוונון הוראות, וכללה הסכמה עם טענות חשבון שגויות. נמדד על שאלות דעה וחשבון, לא על טקסט קליני.
- Wei, J. W. et al. (2023). Simple synthetic data reduces sycophancy in large language models. arXiv:2308.03958 (נפתח בחלון חדש)
- מה מפחית את זה. שבעה עשר מודלים בשיחות מרובות סבבים: מעבר לגוף שלישי הפחית הסכמה, עד 63.8% בקצה שנמדד, בתרחיש ויכוח.
- Hong, J. et al. (2025). Measuring Sycophancy of Language Models in Multi-turn Dialogues. Findings of EMNLP 2025. arXiv:2505.23840 (נפתח בחלון חדש)
- ומה לא מפחית את זה. הצהרת עמדה מייצרת הסכמה באופן אמין, בעוד הצגת מומחיות מצד המשתמש כמעט לא משפיעה.
- Wang, K. et al. (2025). When Truth Is Overridden: Uncovering the Internal Origins of Sycophancy in Large Language Models. arXiv:2508.02087 (נפתח בחלון חדש)