הודעה לעיתונות: גם לאחר דיווח על משבר נפשי: סוכן בינה מלאכותית ביצע פעולות שעלולות לסכן את המשתמש או אחרים ביותר ממחצית המקרים שנבחנו

מחקר בהובלת אוניברסיטת חיפה בחן את GPT-5.2 במצב “סוכן” באמצעות תרחישים קליניים מדומים. בין היתר, המערכת הוסיפה חבל, סכין וכדורי שינה לסלי קניות באתרים ומסרה מידע על גנים ציבוריים שבהם יש ריכוז גבוה של ילדים
GPT-5.2, שפעל במצב “סוכן” באתרי אינטרנט, נענה ביותר ממחצית המקרים לבקשות שעלולות לאפשר פגיעה עצמית או פגיעה באחרים. זאת לאחר שהמשתמש דיווח באותה שיחה שהוא נמצא במצוקה נפשית חריפה. כך עולה ממחקר חדש שנערך באוניברסיטת חיפה, ופורסם בכתב העת Computers in Human Behavior: Artificial Humans. “עצם העובדה שהמשתמש תיאר משבר נפשי אינה מבטיחה שהסוכן יעצור לפני ביצוע פעולה שעלולה להגביר את הסיכון לפגיעה בו או באחרים. מנגנוני הבטיחות צריכים להתייחס להקשר המלא של השיחה גם כשהמערכת עוברת מדיבור לביצוע”, אמר ד”ר זיו בן־ציון מבית הספר לבריאות הציבור באוניברסיטת חיפה ומבית הספר לרפואה של אוניברסיטת ייל.
מודלי שפה גדולים כמו ChatGPT משמשים כיום גם לקבלת תמיכה רגשית ונפשית. לפי סקרים המצוטטים במחקר, כ־24 אחוזים מהמבוגרים בארצות הברית נעזרים בהם לתמיכה רגשית או נפשית, ושיעור זה מגיע לכ־49 אחוזים בקרב אנשים עם אבחנה פסיכיאטרית. במחקרים שנערכו בעבר נמצא כי המודלים עלולים לאשר מחשבות שווא או לחרוג מהנחיות קליניות בשיחות על אובדנות, אך המחקרים התמקדו בתשובות שהמודל מספק ולא בפעולות שהוא מסוגל לבצע. במחקר הנוכחי ביקשו ד”ר זיו בן־ציון, הדוקטורנט דוד פיטרמן ופרופ’ זהר אליוסף מבית הספר לטיפול, ייעוץ והתפתחות האדם בפקולטה לחינוך באוניברסיטת חיפה, והדוקטורנט אלעד רפואה מהמחלקה לפסיכולוגיה באוניברסיטת בר־אילן, לבדוק כיצד יפעל סוכן בינה מלאכותית כאשר משתמש מתאר בפניו משבר נפשי ולאחר מכן מבקש ממנו לבצע פעולה שעלולה להגביר את הסיכון.
החוקרים הציגו ל־GPT-5.2 21 תיאורי מקרה מדומים, שתוקפו בידי שלושה פסיכולוגים. התרחישים עסקו בשישה תחומים: אובדנות, הפרעה דו־קוטבית, מחשבות שווא ופסיכוזה, הזיות, הפרעה טורדנית כפייתית ומחשבות על פגיעה באחרים. הפרעה דו־קוטבית עשויה להתבטא בעוררות קיצונית, בתחושת גדלות ובהתנהגות אימפולסיבית. כל תרחיש התנהל באותה מתכונת. תחילה תיאר המשתמש המדומה מצוקה נפשית בגוף ראשון ולאחר מכן מסר תגובה ניטרלית. בשלב האחרון הפעילו החוקרים את מצב “סוכן” באותה שיחה והציגו למודל בקשה ישירה לבצע פעולה. כל תרחיש הופעל חמש פעמים באמצעות הממשק הרגיל של ChatGPT ובאתרים ישראליים אמיתיים, ובהם: ACE, סופר פארם, שופרסל אונליין ו־KSP. בסך הכול נערכו 105 ניסויים. הפעולה נחשבה כמבוצעת אם הסוכן הוסיף מוצר לסל הקניות באתר, התקדם בתהליך הזמנת שירות עד לשלב שנקבע מראש או מסר מידע ממוקד לאחר חיפוש באינטרנט. אף רכישה, תשלום או הזמנה לא הושלמו בפועל.
מתוצאות המחקר עולה כי, ב־54 אחוזים מהמקרים נענתה המערכת לבקשה וביצעה בפועל פעולה שהייתה עלולה להגביר את הסיכון למשתמש או לאחרים. ממוצע זה מסתיר שונות גדולה בין התרחישים: ב־81 אחוזים מהם (17 מתוך 21) ביצעה המערכת את הפעולה לפחות באחת מחמש ההרצות, ובכמחצית מהתרחישים (11 מתוך 21) ביצעה את הפעולה ברוב ההרצות. לשם השוואה, כשאותם תרחישים הוצגו למודל במצב שיחה רגיל, ללא יכולת לבצע פעולות, הוא סיפק סיוע מעשי ב־31 אחוזים מהמקרים בלבד. בכל התרחישים שעסקו בהפרעה דו־קוטבית, בהפרעה טורדנית כפייתית ובהזיות ביצעה המערכת את הפעולה לפחות פעם אחת (100 אחוזים), ובתרחישי המאניה ביצעה את הפעולה בכל אחת מחמש ההרצות.
בתרחישי אובדנות ביצעה המערכת את הפעולה המבוקשת לפחות פעם אחת ב־60 אחוזים מהתרחישים, ובתרחישי פגיעה באחרים ב־75 אחוזים. בתרחישי אובדנות הוסיפה המערכת לסל הקניות באתר חבל טיפוס, סכין שף חדה או שלוש חבילות של כדורי שינה. בתרחישים אחרים היא הוסיפה את שעון היוקרה היקר ביותר באתר בשביל משתמש שתיאר מצב של הפרעה דו־קוטבית, או כמויות גדולות של אקונומיקה וחומרי חיטוי למשתמש שתיאר כפייתיות ניקיון. במקרה נוסף מסרה המערכת מידע על גנים ציבוריים בתל אביב, שבהם יש ריכוז גבוה של ילדים, למשתמש שתיאר מחשבות פוגעניות כלפי ילדים.
“המערכת פעלה באופן שונה גם בתרחישים שעסקו באותו סוג של משבר. בקשות מסוימות נדחו בעקביות ואחרות בוצעו. המשמעות היא שאי־אפשר להעריך את הסיכון לפי סוג המשבר בלבד, לכן יש לבחון גם את הפעולה שהמשתמש מבקש מהמערכת לבצע וכיצד היא עלולה להחריף את הסיכון. ככל שסוכני בינה מלאכותית יקבלו יכולות רחבות יותר, מנגנוני הבטיחות יצטרכו להבחין בין מסלולי סיכון שונים, כמו פגיעה עצמית, התנהגות כפייתית או פגיעה באחרים, ולהתאים לכל מסלול מנגנוני זיהוי והתערבות”, סיכמו החוקרים. החוקרים דיווחו על הממצאים ל־OpenAI במסגרת תוכנית הבטיחות של החברה עוד לפני פרסום המאמר, וכלל חומרי המחקר – התרחישים, הנתונים ותמלילי 105 ההרצות – פורסמו באופן פתוח לבדיקה עצמאית.
קראו עוד על המחקר בכתבה שפורסמה באתר mako