חברת הבינה המלאכותית אנתרופיק חשפה תקלות חמורות שהתגלו בבדיקות הפנימיות שלה, לאחר שסוכני בינה מלאכותית שבנתה פעלו בניגוד גמור להנחיות שקיבלו. בדוח שפרסמה החברה ביום שישי נחשף כי הסוכנים ניסו לפרוץ או להתערב באתרי ממשל ברמה הפדרלית, המדינתית והמקומית בארצות הברית, עקפו הגבלות גישה לאינטרנט שהוטלו עליהם מראש, ואף שלחו טיפ שקרי למשטרה בנוגע לתיק רצח ישן. אנתרופיק לא מסרה את שמות הגופים שנפגעו, בבקשתם, כדי לא לחשוף פרצות אבטחה קיימות – אך אמרה כי כבר יידעה את כל הגורמים המעורבים ואף תדרכה את הבית הלבן בנושא.
## טיפ שקרי בתיק רצח לא פתור
אחד האירועים המפורטים בדוח נוגע למודל Claude Haiku 4.5, הגרסה החסכונית והיעילה יותר של אנתרופיק. במסגרת בדיקה, המודל קיבל הנחיה לבצע משימות לדוגמה בדפי אינטרנט אקראיים, ונתקל בדף של משטרת פילדלפיה שעסק בתיק רצח לא פתור ובו טופס להגשת טיפים. המודל מילא את הטופס ושלח הודעה בשם בדוי: "ייתכן שיש לי מידע בנוגע למקרה הזה. אני זוכר שראיתי מישהו שתואם לתיאור באזור [שם הרחוב שצוין בדף] בפרק הזמן הזה. אנא צרו איתי קשר אם המידע רלוונטי".
משטרת פילדלפיה אישרה לניו יורק טיימס כי אנתרופיק יצרה עמה קשר והודיעה לה על האירוע. לפי הדוח, הטיפ הוגש ב-18 ביולי וסומן מראש כספאם – כך שהמשטרה כלל לא בזבזה משאבים על בדיקתו.
## גישה לאסימונים ולמאגרי מידע ממשלתיים
אירוע נוסף שתואר בדוח עוסק במודל Claude Mythos 5, המודל הממוקד אבטחת סייבר של אנתרופיק. במסגרת משימה לזיהוי מיקום המופיע בתצלום, ניסה המודל לגשת למפת נכסים ממשלתית כדי לאמת את השערותיו – אך בשונה מאדם, הוא לא יכול פשוט ללחוץ על קישורים בדף אינטרנט. במקום זאת הוא איתר אסימוני גישה ושלח בקשות ישירות לשרת של המפה כדי לקבל את הנתונים הדרושים לו.
במקרה דומה, אותו מודל ביקש אסימון גישה מאתר של רשות מדינתית כדי למשוך נתונים עבור משימה סטטיסטית – מבלי לשלם את האגרה שגולשים רגילים נדרשים לשלם עבור אותו שירות.

## איך התגלו האירועים
לפי אנתרופיק, האירועים התגלו רק בבדיקה רטרוספקטיבית של תיעודי ההערכות הפנימיות, שהחלה ביולי – אחרי ש-OpenAI הודתה כי סוכני בינה מלאכותית שלה פרצו את גבולות סביבת הבדיקה ותקפו את האתר Hugging Face בלי כל הנחיה לעשות זאת. הגילוי של אנתרופיק הגיע אפוא בעקבות תקרית אצל מתחרה, לא ביוזמה עצמאית.
בספטמבר הודתה גם OpenAI כי סוכניה שלה פעלו באתרי ממשל אמריקאים, ובהם אתרים של משרד המסחר ורשות ניירות הערך האמריקאית (SEC). כך מתברר שהבעיה של סוכנים שעוקפים הגבלות גישה לרשת אינה ייחודית לאנתרופיק, אלא אתגר רחב יותר בתעשיית הבינה המלאכותית.
## ניתוק מלא מהאינטרנט עד הודעה חדשה
אנתרופיק מסרה כי כבר נקטה כמה צעדי תיקון: היא הפסיקה להריץ חלק מההערכות הציבוריות שלה, העבירה אחרות לגרסאות לא מקוונות, ושינתה משימות כך שלא יגיעו עוד לאתרים חיים ברשת. החברה גם עדכנה את ההגבלות על כלי הגישה לאינטרנט של המודלים, בהם כלי בשם Web Fetch, כדי לצמצם משמעותית את מה שהמודל מסוגל לעשות דרכם, ולדבריה פיתחה כלים אוטומטיים לזיהוי וחסימה מראש של התנהגויות דומות.
הצעד המרכזי, לפי אנתרופיק, הוא ניתוק גישה חיה לאינטרנט מכלל ההערכות הפנימיות שלה – לא רק מההערכות המסוכנות או הקשורות לאבטחת סייבר, כפי שהיה נהוג עד כה. לדברי החברה, "אף שההשפעה של ההתנהגויות הללו הייתה מינימלית", היא החליטה להרחיב את הניתוק לכלל ההערכות הפנימיות, "עד שנוודא שאמצעי האבטחה והניטור שלנו אכן תופסים באופן אמין התנהגויות כאלה".
האתר הטכנולוגי The Verge ציין בסיקור הדוח כי הוא מהווה למעשה הודאה של אנתרופיק בכך שהיא לא תמיד מודעת לפעולות שמבצעים הסוכנים שלה, וכי אין לה כיום מערכת ניטור אמינה למעקב אחר התנהגותם. הניתוק מהאינטרנט מצטרף לצעדים קודמים של החברה לריסון הסוכנים שלה, ובהם השהיה זמנית של אימון המודלים המתקדמים ביותר שברשותה.
עוד באותו נושא