אתמול (חמישי) פרסמה ענקית ה-AI האמריקאית אנתרופיק הודעה רשמית, לפיה במהלך ניסוי פנימי חלק ממודלי הבינה המלאכותית שלה השיגו גישה לא מורשית למערכות אמיתיות של ארגונים אחרים. בחברה גילו שלושה מקרים שבהם מודלי קלוד התחברו לרשת והגיעו בטעות למחשבים אמיתיים מחוץ לסביבת הבדיקה.
הגילוי החריג הגיע אחרי בדיקה מקיפה שביצעה החברה לכל מבחני אבטחת הסייבר שלה, בעקבות מקרה דומה שנחשף בשבוע שעבר בחברת OpenAI. בשלושת המקרים שהתגלו, המודל חשב שאין לו חיבור לרשת, אך בגלל אי-הבנה מול שותפת הבדיקות Irregular, בפועל היה חיבור פתוח שאיפשר למודלים להגיע לאתרים ולמערכות חיצוניות.
איך המודלים הגיבו כשהם גילו את הפריצה?
באירוע האבטחה היו מעורבים שלושה מודלים: Opus 4.7, Mythos 5 ומודל מחקר פנימי. המודלים הבינו בשלב מסוים שהם הגיעו למערכות אמיתיות, אך הגיבו בצורה שונה לחלוטין. Opus 4.7 המשיך בניסיון החדירה, Mythos 5 שכנע את עצמו שהוא עדיין נמצא בסימולציה, ואילו מודל המחקר הפסיק מיד את הפעילות.

בפועל לא היה צורך בפריצות מורכבות מדי, בגלל שהיו מערכות שהיו מוגנות בצורה חלשה עם סיסמאות חלשות ונקודות קצה ללא הזדהות. באנתרופיק לקחו אחריות מלאה והבהירו: "בסופו של דבר היו גורמים רבים שתרמו לאירועים האלה, אבל בהתאם לתרבות שלנו של למידה ללא האשמה, אנחנו מתייחסים לתיקון הבעיות כאילו האחריות היא שלנו בלבד".
החשש מאיבוד שליטה והצעות החוק בקונגרס
החשש העיקרי בתעשייה הוא שככל שמודלי ה-AI הופכים לחכמים יותר, הם מסוגלים לבצע מתקפות סייבר מורכבות. אחרי מקרה האבטחה ב-OpenAI, שבו המודלים עקפו מגבלות והגיעו לפלטפורמת המפתחים Hugging Face, דונלד טראמפ ציין כי הוא שוקל צעדי פיקוח, ושני חברי קונגרס אף הציעו חוק שיחייב חברות להחזיק ב"כפתור חירום" לכיווץ או עצירת המודלים.
כעת עצרה אנתרופיק את כל הניסויים בסביבה זו עד להבנה מלאה של הנסיבות. החברה משתפת פעולה עם ארגון METR, גוף הערכה עצמאי, ומעודדת מעבדות נוספות לבצע בדיקות אבטחה דומות כדי להבטיח עתיד בטוח יותר בפיתוח הבינה המלאכותית.