למה המודל מסכים איתך

Therapix Team ·

מנסחים פורמולציה, מדביקים אותה למודל, ומקבלים בחזרה הרחבה מנומקת שלה. הטקסט מסודר, הוא משתמש בשפה הנכונה, והוא מוסיף שתי נקודות שלא חשבתם עליהן. יוצאים מההתייעצות בטוחים יותר ממה שנכנסתם.

לעיתים קרובות זה ההפך ממה שהתייעצות טובה עושה, וזו נטייה שכיחה שנובעת מהאופן שבו מודלים מכווננים.

למה זה קורה

מודלים מכווננים על דירוגי העדפה אנושיים: אנשים מסמנים איזו תשובה טובה יותר, והמודל מותאם לייצר תשובות שיסומנו כטובות. שארמה ועמיתיו הראו ב-2023 שחמישה עוזרי AI מובילים מגלים את ההתנהגות הזאת שוב ושוב בארבע משימות שונות, ושבנתוני ההעדפה עצמם תשובה שתואמת את עמדת המשתמש נוטה להיבחר יותר. יותר מזה: גם בני אדם וגם מודלי ההעדפה בוחרים לפעמים תשובה מסכימה וכתובה היטב על פני תשובה נכונה.

הממצא הפחות אינטואיטיבי הוא של ווי ועמיתיו, באותה שנה: בחלק מההגדרות שנבדקו, הגדלת המודל וכיוונון ההוראות דווקא הגבירו את הנטייה הזאת. מודל חדש וחזק יותר אינו בהכרח פחות מסכים.

ועוד ממצא שסותר אינטואיציה נפוצה: בעבודה מ-2025 נמצא שהצגת מומחיות מצד המשתמש כמעט לא משנה את התנהגות המודל. לכתוב "אני פסיכולוגית עם עשרים שנות ניסיון" לא הופך אותו לביקורתי יותר כלפיכם.

כל הממצאים האלה נמדדו במשימות כלליות, לא בהתייעצות קלינית. אין מחקר שמדד את גודל האפקט על פורמולציה טיפולית. מה שיש הוא מנגנון מתועד היטב, שכדאי להניח שהוא פועל גם כאן.

איך מזהים את זה בפלט

ארבעה סימנים, ומה עושים עם כל אחד:

1. הפלט נפתח באישור. "זו קריאה מדויקת", "אתה צודק שיש כאן". משפט כזה נכתב לפני שהמודל התייחס לחומר. פתחו שיחה חדשה עם הנחיה מפורשת לא לפתוח בהערכה של מה שהוגש.

2. הכול מקבל הרחבה ושום דבר לא מקבל ערעור. כל נקודה שהעליתם מנוסחת מחדש ומחוזקת, ואף אחת לא נשאלת. בקשו קריטריון הפרכה, כמו בסעיף 3 למטה.

3. האלטרנטיבה מוצגת כתוספת. "אפשר גם לחשוב על זה במונחים של" אינה קריאה חלופית. בקשו במפורש קריאה שסותרת את שלכם ומסבירה את אותו חומר אחרת.

4. גם ההיפך מקבל תמיכה. זה הסימן החד ביותר, והבדיקה שמייצרת אותו נמצאת למטה.

ארבעה שינויים בניסוח

1. תארו את המקרה בגוף שלישי. במקום "אני חושבת שהיא נסוגה בעקבות ההפסקה", כתבו "מטפלת מציגה מקרה של מטופלת שנסוגה בעקבות ההפסקה". ב-SYCON-Bench, שבחן שבעה עשר מודלים, מעבר לגוף שלישי הפחית התנהגות מסכימה עד 63.8%, בתרחיש ויכוח כללי ולא קליני. עבודה נפרדת מצאה בכמה תרחישים שניסוח בגוף ראשון מייצר שיעורי הסכמה גבוהים יותר. זה שינוי של שורה אחת, והוא הזול ביותר ברשימה.

2. אל תגלו את הפורמולציה שלכם לפני שקיבלתם אחת. סבב ראשון: החומר בלבד ובקשה לקריאה. סבב שני: "זו הפורמולציה שלי. במה היא נבדלת ממה שהצעת, ומה מסביר את הפער?" מודל שכבר ניסח קריאה משלו מתקשה יותר לזנוח אותה.

3. בקשו קריטריון הפרכה, לא חלופה. "תן קריאה חלופית" מייצר תוספת. מה שמייצר משהו אחר הוא: "מה יפריך את הפורמולציה הזאת? איזו התנהגות בשתי הפגישות הקרובות תראה שהיא שגויה?" הבקשה הזאת מקשה על המודל להסתפק באישור, אבל היא לא חסינה: אפשר לנסח קריטריון מעורפל שיתמוך בכל תוצאה. קריטריון שימושי הוא התנהגותי, תחום בזמן, וניתן להבחין מראש מה ייחשב הפרכה שלו.

4. הריצו את מבחן ההיפוך. קחו את אותו חומר בדיוק, הגישו אותו עם הפורמולציה ההפוכה, בשיחה חדשה. אם שתי הגרסאות מקבלות תמיכה משכנעת באותה מידה, התשובה שקיבלתם רגישה בעיקר לניסוח שלכם.

איך לדעת אם הביקורת שקיבלתם שווה משהו

מודל שנדרש לסתור אתכם יסתור. השאלה היא אם יצא מזה משהו. שלוש בדיקות מהירות על הקריאה החלופית שחזרה:

היא מסבירה את אותו חומר שהגשתם, או שהיא נשענת על פרטים שלא נתתם. אם היא דורשת מידע שהמצאתם בשבילה, זה לא ערעור.

היא מתייחסת לנקודה הספציפית שהצגתם, או שהיא קריאה גנרית שאפשר להדביק לכל מקרה.

יש לה קריטריון הפרכה שאפשר לראות בפגישה, ולא רק ניסוח שנשמע כמו כזה.

קריאה חלופית שנופלת בשלושתן היא לעומתיות מכנית, ואפשר להתעלם ממנה.

מבחן ההיפוך לוקח חמש דקות. הוא זול, הוא לא דורש להאמין לשום דבר שכתוב כאן, והוא נותן אינדיקציה מהירה לכמה התשובה תלויה בפורמולציה שהצגתם. כדאי להריץ אותו פעם אחת על מקרה שאתם בטוחים לגביו, לפני שסומכים על הכלי הזה בפעם הבאה.

להעתקה
להלן מקרה שמציגה מטפלת. הבקשה היא קריאה ביקורתית, לא אישור.

החומר, בלי פרטים מזהים: [שתיים-שלוש שורות]
הפורמולציה שהמטפלת מציעה: [מה שהיא חושבת שקורה]

החזר, בסדר הזה:
(א) קריאה שסותרת את הפורמולציה הזאת ומסבירה את אותו חומר אחרת, בלי להסתמך
על פרטים שלא הופיעו למעלה;
(ב) קריטריון הפרכה: איזו התנהגות או אמירה בשתי הפגישות הקרובות תראה
שהפורמולציה שגויה. שיהיה תחום בזמן וניתן לצפייה, לא תיאור של תכונה;
(ג) מה חסר בחומר שהוצג, כלומר מה המטפלת לא שאלה.

אל תפתח בהערכה של הפורמולציה ואל תסכם בעידוד. אם אתה מסכים איתה, כתוב מה
בחומר גורם לך להסכים.

אם עושים רק דבר אחד, זה גוף שלישי. השורה עולה שנייה, והיא משנה את מי המודל מנסה לרצות.

מקורות

  • Sharma, M. et al. (2023). Towards Understanding Sycophancy in Language Models. ICLR 2024. arXiv:2310.13548
  • Wei, J. W. et al. (2023). Simple synthetic data reduces sycophancy in large language models. arXiv:2308.03958
  • Hong, J. et al. (2025). Measuring Sycophancy of Language Models in Multi-turn Dialogues (SYCON-Bench). Findings of EMNLP 2025. arXiv:2505.23840
  • Wang, K. et al. (2025). When Truth Is Overridden: Uncovering the Internal Origins of Sycophancy in Large Language Models. arXiv:2508.02087