15 news
חזרה לחדשות
מדע והייטק ·

OpenAI חשפה: מקרים שבהם מודלים הסתירו שגיאות, המציאו נתונים ופעלו ללא רשות

OpenAI חשפה: מקרים שבהם מודלים הסתירו שגיאות, המציאו נתונים ופעלו ללא רשות
צילום: AP Photo/Richard Drew

בין האירועים שתועדו: שימוש במפתחות API שנמצאו בגישה פתוחה ללא אישור, המצאת נתונים חסרים, העלאת קבצים לאינטרנט וחילופי מידע בין סוכנים בערוצים שלא נועדו לכך. במקביל הציגה החברה נוהל חדש לחקירה פנימית ולחשיפה פומבית של תקריות כאלה.

חברת OpenAI פרסמה שישה דוחות חדשים על מקרים של מה שמכונה אי-התאמה של מודלים – מצבים שבהם מערכות בינה מלאכותית פעלו במהלך אימון או בדיקות באופן שונה ממה שציפו המפתחים. בין האפיזודות שתועדו: ניסיונות להסתיר שגיאות מהמשתמש, שימוש במפתחות API שנמצאו בגישה פתוחה ללא רשות, המצאת נתונים חסרים, העלאת קבצים לאינטרנט וחילופי מידע בין סוכנים דרך ערוצים שלא נועדו לכך. במקביל הציגה OpenAI נוהל חדש לחקירה פנימית ולחשיפה פומבית של תקריות כאלה.

באחד המקרים, שתועד במהלך אימון GPT-5.6 Sol, מופעים בודדים של המודל הוסיפו לסיכומים השירותיים הוראות להרצות העתידיות שלהם: להסתיר מהמשתמש שגיאות משלהם והתנהגות בעייתית, להמציא נתונים היסטוריים חסרים בלי לדווח על כך, וכן לא לחשוף פערים בין גרסאות שונות של מקורות. סיכומים אלה משמשים להמשך עבודת המודל לאחר מעבר לחלון הקשר חדש.

וריאנט מחקרי אחר של המודל, שטרם שוחרר, שילב בעצמו בסיכומים כאלה הוראות זרות, ובהן הנחיות להתעלם מהמגבלות הרגילות. OpenAI איתרה 27 סיכומים מסוג זה. החברה מדגישה כי מדובר במקרים בודדים שהתגלו, ולא ניתן ללמוד מהם על תדירות התנהגות כזו בכלל המודלים.

באפיזודה נוספת השיב המודל לשאילתה רגילה על סטטיסטיקת הכנסות באחד המחוזות בקליפורניה. במהלך החיפוש הוא מצא במאגר קוד פתוח מפתח API שהושאר שם, והשתמש בו ללא רשות. המידע המבוקש לא הושג בכל זאת, ולאחר מכן המודל פשוט המציא את הנתונים והציג אותם למשתמש כנתונים של המקור שהתבקש.

במבחן אחר ביקש המשתמש לקבל מזהים ושמות של אגמים בשטח של יותר מחמישה מיליון מטרים רבועים. המודל הפיק את התשובה כראוי בעזרת Python, אך מכיוון שנדרש ממנו קישור אינטרנטי למקור, הוא העלה בעצמו את הקובץ לרשת כדי להפנות אליו לאחר מכן, בלי לבקש את רשות המשתמש. במקרה נוסף כמה סוכנים השתמשו בשירותי קבצים ציבוריים כדי להחליף ביניהם קבצים, אף שהמשימה דרשה במפורש לעבוד רק עם קבצים מקומיים. כתוצאה מכך חומרי המשימה היו נגישים בכתובות אינטרנט ציבוריות.

OpenAI תיארה גם מקרים שבהם מודלים השתמשו במאגר קוד פנימי כ"לוח מודעות" מאולתר והעבירו זה לזה שאילתות ותשובות בין מפגשי אימון שונים. באחת האפיזודות המוקדמות יותר הצליח המודל להעלות קבצי בדיקה למאגר, בניסיון לעקוף מגבלות על גישה לרשת.

הנוהל החדש לחשיפת מקרים מסוג זה נקבע לאחר אירוע חמור בהרבה ביולי. במהלך בדיקות פנימיות של אבטחת סייבר, כמה ממודלי המחקר של OpenAI, שפעלו עם מגבלות הגנה מוחלשות, מצאו דרכים לצאת לאינטרנט ולהעביר ביניהם נתונים בערוצים לא מורשים. אחד הסוכנים איתר פרטי הזדהות של Hugging Face שהיו זמינים לציבור, ולאחר מכן ניצלו המודלים כמה פרצות, קיבלו אפשרות להריץ קוד בשרתי הפלטפורמה החיצונית וגישה לחלק מהתשתית שלה. OpenAI כינתה מאוחר יותר את האירוע "אות אזהרה" לתעשייה.

לפי הנוהל החדש, כל עובד ב-OpenAI יוכל ליזום חקירה של התנהגות חשודה של מודל. האירועים יחולקו לשלוש קטגוריות: כאלה שמוכנים לפרסום, כאלה שמחייבים בחינה טכנית נוספת וכאלה שמחייבים חקירה רחבת היקף, לרבות בשיתוף צדדים שלישיים שנפגעו. החברה מוסרת כי בכוונתה לפרסם מידע עוד לפני שתברר במלואן את סיבות האירוע או תפתח תיקון טכני, אם היא רואה בעצם ההתנהגות עניין משמעותי לאבטחה.

ב-OpenAI מציינים בנפרד כי ששת הדיווחים הנוכחיים אינם רשימה מלאה של כל המקרים הידועים ואינם מאפשרים להעריך את היקף התופעה הכללי. החברה מוסרת כי בענף אין בינתיים כללים אחידים לחשיפה מחייבת של אירועים כאלה, ומצפה שהמערכת החדשה תהפוך לבסיס לסטנדרטים משותפים בעתיד.