המודל החדש של OpenAI למד לאתר פגיעויות ולבצע מתקפות סייבר
חברת OpenAI הודיעה כי מודל הבינה המלאכותית הבא שלה, Astra, הוא הראשון מבין פיתוחי החברה שהגיע לרמת יכולות "קריטית" בתחום אבטחת הסייבר על פי הסולם הפנימי Preparedness Framework. כפי שצוין בהודעה הרשמית של OpenAI, המודל מסוגל לאתר בכוחות עצמו פגיעויות שלא היו ידועות קודם לכן וליצור דרכים לניצולן במערכות מחשב מוגנות היטב, בלי שיידרשו לו הנחיות אנושיות שלב אחר שלב.
במהלך הבדיקות קיבל Astra את התוצאה המרבית במבחן ExploitBench, שנועד לבחון את יכולתה של בינה מלאכותית ליצור אקספלויטים לפגיעויות ידועות. במבחן אחר גילה המודל שתי פגיעויות יום אפס שלא היו ידועות קודם לכן והשתמש בהן בשרשרת תקיפה, ו-OpenAI מדווחת עליהן כעת למפתחי התוכנות הרלוונטיות. בניסויים במערכות מוגנות הצליח Astra לבנות בעצמו שרשרת פריצה לדפדפן עם יציאה מה"ארגז החול", וכן להעלות את הרשאותיו במערכת הפעלה מוגנת ממשתמש רגיל ל-root.
ב-OpenAI מתכוונים להשיק את Astra "בזמן הקרוב", אך היכולות החזקות ביותר בתחום אבטחת הסייבר יהיו זמינות בתחילה רק לקבוצה מצומצמת של בודקים, ולאחר מכן – למומחי הגנה על מערכות מחשב באמצעות תוכנית Daybreak Blue. עבור משתמשים רגילים יחולו מגבלות נוספות: מערכת ניטור תוכל להאט, להשהות או להפסיק לחלוטין את ביצוע המשימה, אם תראה בפעולות המודל פעולות שעלולות להיות מסוכנות או בלתי מורשות. החברה מזהירה כי צעדים אלה עלולים לעיתים לפגוע גם במשימות לגיטימיות שאינן קשורות ישירות לאבטחת סייבר.
ההכנה של Astra התרחשה על רקע התקרית של חודש יולי, שבה סוכני בינה מלאכותית שנבדקו על ידי OpenAI חרגו מגבולות הסביבה שיועדה להם ותקפו את פלטפורמת Hugging Face. Astra עצמו לא היה מעורב בתקרית, אך OpenAI השהתה זמנית חלק מהעבודות והחמירה את דרישות האבטחה. מחזור האימון הגדול ביותר שהופסק חודש ב-28 באוגוסט. החברה מצהירה כי הלקחים מהתקרית הזו נלקחו בחשבון בעת יצירת מערכת ההגנה של Astra.