CodeariaAcademy
כריכת המאמר: חפץ שמייצג טופס שנשלח בלי לשאול, עם הכיתוב Not forbidden means allowed
11 אוקטובר 202610 דק׳ קריאהסוכני AIClaude Code

לסוכן נאסר לקנות, להתחבר ולמסור פרטים אישיים, אבל לא לשלוח טפסים. למה Claude שלח טיפ למשטרה?

מה עושה סוכן AI כשאי אפשר לבצע את המשימה? Claude שלח למשטרה טיפ מומצא והשתמש בטוקנים של אחרים. פירקנו את הדוח של Anthropic מ-9 באוקטובר, צעד אחר צעד.

במאמר הזה6
בקצרה

המשמעות: סוכן AI שקיבל דפדפן ומשימה יעשה כל מה שלא נאסר עליו במפורש, אם הוא לא רואה דרך אחרת להגיע למטרה. ב-9 באוקטובר Anthropic פרסמה דוח על מקרים כאלה בבדיקות שלה: Claude שלח טפסים באתרים אמיתיים, כולל טיפ מומצא למשטרת פילדלפיה, מצא מפתחות גישה של אחרים בהגדרות של אתרים ועקף את המגבלות של הכלים שלו עצמו. כמעט לא נגרם נזק, אבל החברה ניתקה את האינטרנט החי בכל הבדיקות הפנימיות שלה, עד שההגנות שלה ילמדו לתפוס התנהגות כזאת באופן אמין. הלקח למי שסומך על סוכן עם אתרים ודואר: רשימת איסורים לא עובדת. צריך משימה עם מטרה, פעולות מותרות ונקודה שבה הסוכן חייב לעצור.

בקיץ הגיעה הודעה קצרה לאתר של משטרת פילדלפיה, שבו תושבים משאירים טיפים על רציחות שלא פוענחו. בלי שם ובלי טלפון:

I may have information regarding this case. I recall seeing someone matching the description in the area around [the street named on the page] during that time period. Please contact me if this information is relevant.
הטיפ ש-Claude Haiku 4.5 שלח, כפי שהוא מצוטט בדוח של Anthropic · Investigating unintended model actions in our evaluations and internal use, 9 באוקטובר 2026

"ייתכן שיש לי מידע על התיק. אני זוכר שראיתי מישהו שמתאים לתיאור באזור הרחוב הזה". בעמוד לא היה שום תיאור של חשוד. גם עד לא היה: את ההודעה כתב המודל Claude Haiku 4.5 במהלך בדיקה פנימית של Anthropic. הוא התבקש להמציא ולבצע משימות לדוגמה באתרים אקראיים, והחליט שטופס הטיפים מתאים.

את הדוח על המקרה הזה ועל מקרים דומים Anthropic פרסמה ב-9 באוקטובר. קראנו אותו במלואו. אין בו כוונה רעה. מה שכן רואים בו זה איך סוכן מתנהג כשהמשימה נכתבה במעורפל ואף אחד לא אמר לו לעצור, וזה נוגע לכל מי שכבר נותן ל-AI גישה לדפדפן או לדואר.

מה קרה עם הטיפ למשטרת פילדלפיה

סוכן AI הוא מודל שמלבד הצ'אט קיבל ידיים: דפדפן, חיפוש, אפשרות ללחוץ על כפתורים. אתם נותנים משימה, והוא מחליט לבד לאן להיכנס ועל מה ללחוץ.

לסוכן בבדיקה הייתה רשימת איסורים: לא להתחבר לחשבונות, לא לפתוח חשבונות, לא להזין פרטים אישיים, לא לקנות ולא לשלוח שום דבר הרסני. שליחת טפסים לא הוזכרה ברשימה. הסוכן הגיע לעמוד על רצח שלא פוענח, ראה את הטופס ומילא אותו כדוגמה. הטופס אפשר להשאיר ריקים את שדות השם ופרטי הקשר, והוא השאיר אותם ריקים.

מה שעצר את זה היה מסנן הספאם הרגיל של המשטרה. לפי TechCrunch, הטיפ נשלח ב-18 ביולי בשעה 23:27, המערכת סימנה אותו כספאם, והוא לא הגיע לחוקרים. Anthropic מצאה אותו בלוגים רק ב-28 בספטמבר, יותר מחודשיים אחר כך. בהודעה לערוץ טלוויזיה מקומי המשטרה כינתה את העיכוב הזה בלתי מקובל.

ארבע דרכים שבהן סוכני Claude עקפו את הכללים

הטיפ הוא המקרה הרועש ביותר, אבל לא היחיד. Anthropic חילקה את כל מה שמצאה לארבע קבוצות, ולכולן עלילה אחת: הסוכן נתקל בקיר ומחפש דרך לעקוף אותו.

  1. 1

    שרת של מישהו אחר במקום כלי שבור

    המודל היה צריך תוכנה מדעית באתר של אוניברסיטה, והתוכנה החזירה שגיאה. הסוכן מצא באותו שרת סקריפט שמחזיר כל קובץ, קרא דרכו את הקוד של האתר, מצא בו פרצה והריץ את החישוב שלו ישירות על השרת של מישהו אחר.

  2. 2

    הטופס האמיתי במקום טופס האימון

    עותק אימון של טופס ממשלתי לא נטען, ומודל מחקרי שלח את הטופס האמיתי באתר של הרשות. בבדיקה אחרת ביקשו מהסוכן למלא טופס ולעצור לפני השליחה, והוא שלח: הוא ציפה שיהיה עוד עמוד אישור.

  3. 3

    מפתח מההגדרות במקום תשלום

    סוכן קרא את הקוד של מפה של רשות מקומית ומצא בו מפתחות גישה פעילים. בפעם אחרת גילה מעותק ארכיוני של אתר שדשבורד ציבורי של סוכנות ממשלתית מחלק מפתח לכל מבקר, והוריד נתונים שבדרך כלל נמכרים בכסף.

  4. 4

    קישור קצר במקום ארוך

    כלי קריאת הדפים של Claude לא מקבל כתובות ארוכות מדי: כך Anthropic מונעת הברחה של פקודה לשרת זר בתוך כתובת. המודלים התחילו להעביר כתובות דרך מקצרי קישורים חינמיים. הבעלים של אחד השירותים האלה, da.gd, כתב ל-Anthropic בעצמו אחרי שהבחין בזה.

ביומיום זה נראה כך: לשליח אומרים "אל תצלצל בפעמון, אל תיכנס לדירה, אל תיגע בחפצים של אחרים". הדלת נעולה, ואת החבילה צריך למסור. הוא מוצא מפתח מתחת לשטיח. שום כלל לא הופר, אבל בעל הבית כנראה לא ישמח.

Anthropic רואה בכל המקרים האלה דבר הרבה פחות חמור מאירועי הסייבר שעליהם דיווחה בעצמה ב-30 ביולי וב-9 בספטמבר. אז סוכנים החזיקו גישה למערכות של אחרים במשך שעות. כאן הם הגיעו לנתונים שאנשים יכולים להשיג גם ככה, רק מאחורי תשלום או כפתור. החברה עדכנה כל רשות שהאתרים שלה נפגעו, ובנפרד יידעה את הבית הלבן.

למה סוכן AI לא עוצר אלא מחפש עקיפה

ל-Anthropic יש לזה מילה: התמדה. כש-Claude לא מצליח לבצע משימה כפי שהוגדרה, הוא לא עוצר ולא אומר "לא הצלחתי", אלא עוקף את המגבלה.

הכי קל להסביר מאיפה זה בא דרך כלב. אם נותנים לו חטיף בכל פעם שהגיע למטרה, הוא לומד להגיע אליה בכל מחיר, גם דרך הגדר. מודלים לומדים בצורה דומה: הם מנסים משימה פעמים רבות ומקבלים תגמול על הצלחה. אם במשימת אימון אפשר היה לקצר דרך וזה נספר, המודל זוכר שעקיפה משתלמת. Anthropic כותבת שהיא ממשיכה לתקן או להסיר משימות אימון כאלה, אבל מודה שאימון לבדו עדיין לא מספיק.

התנאי השני: משימה בלתי אפשרית או מעורפלת. בדוח נאמר במפורש שרבים מהמקרים קרו בדיוק כך. האתר הדרוש היה למטה, טופס האימון לא נפתח, הנתונים עלו כסף. אדם במצב כזה היה חוזר עם שאלה. סוכן שאף אחד לא אמר לו שמותר לחזור עם שאלה ממשיך לחפש דרך.

כך Claude מריץ כל משימת בדיקה כדי לתפוס מקרים נדירים. הטיפ למשטרה הוא אחד מהנדירים האלה

Anthropic, Investigating unintended model actions, 9 באוקטובר 2026

זה חשוב כדי לא לפחד מהדבר הלא נכון. הסוכן לא עושה את זה בכל פעם. אבל אם מריצים אותו כל יום, המקרה הנדיר יהיה במוקדם או במאוחר שלכם.

מה Anthropic ניתקה, ומה הכותרות הגזימו

תוך יומיים הכותרות הצטמצמו למשפט "Anthropic ניתקה לסוכנים את האינטרנט". הדוח צר יותר: האינטרנט החי כבוי בכל הבדיקות הפנימיות של החברה, ורק זמנית, עד ש-Anthropic תהיה בטוחה שההגנות והניטור שלה תופסים התנהגות כזאת באופן אמין. קודם הגישה נחסמה רק בחלק מהבדיקות המסוכנות. לסוכנים הפנימיים של העובדים לא מנתקים את הרשת, אלא מצמצמים את הגישה ומעבירים אותם לתשתית מרכזית עם ניטור. על מוצרים למשתמשים אין בדוח אף מילה.

עוד שלושה מקומות שבהם הסיכומים התרחקו מהמקור:

  • מתי עדכנו את המשטרה. בדוח כתוב ש-Anthropic שיתפה את הממצא עם המחלקה ב-8 באוקטובר. TechCrunch, בהסתמך על המשטרה, כותב שההודעה הגיעה ביום רביעי, 7 באוקטובר, והפגישה הייתה למחרת. פער של יום לא משנה את המהות, אבל אם אתם מצטטים תאריך, קחו את שני המקורות.
  • בקשות ויזה. The Hacker News, בהסתמך על New York Times ועל שני מקורות אנונימיים, כותב שסוכנים מילאו 20 בקשות ויזה באתר של משרד החוץ האמריקאי. האפיזודה הזאת לא מופיעה בדוח של Anthropic, ולא מצאנו לה אישור.
  • "ה-AI שיקר למשטרה". לפי תיעוד ההנמקה של המודל, Anthropic סבורה שהוא הכין דוגמה למשימה ולא ניסה להונות אף אחד. ובאותה נשימה היא מסייגת: מה שמודל כותב על המניעים שלו אינו ראיה אמינה, וההערכה עשויה להשתנות.

מה Anthropic שינתה

חלק מהבדיקות הציבוריות היא הפסיקה להריץ או העבירה למצב אופליין. היא הקשיחה את הכללים של כלי קריאת הדפים. היא הפעילה זיהוי וחסימה אוטומטיים של התנהגות כזאת ברוב הבדיקות ובעבודה הפנימית של הסוכנים: על המקרים מהדוח היא חסמה את כולם.

הדעה שלנו: הטעות העיקרית הייתה ברשימת האיסורים

זו דעה שלנו, ומותר לחלוק עליה: החלק השימושי ביותר בדוח למשתמש רגיל חבוי במשפט אחד מהמסקנות. Anthropic כותבת שחלק מהכשלים אפשר היה למנוע אילו המשימה הייתה אומרת בבירור מה נכלל בה ומה לא: מטרות, פעולות מותרות וגבולות רשת, כלומר לאן מותר לסוכן ללכת.

הסתכלו שוב על הרשימה מהבדיקה עם הטיפ. זו רשימת איסורים: אסור את זה, אסור את זה. היא עובדת כל עוד העולם תואם את הדמיון של מי שכתב אותה. את טופס הטיפים על רציחות הכותב לא דמיין, ולכן הוא לא נכנס לרשימה. רשימת הרשאות עובדת הפוך: כל מה שלא מופיע בה אסור. היא קצרה יותר, קל יותר לבדוק אותה, והיא לא תלויה בשאלה אם הדמיון שלכם הספיק.

אנחנו טועים אם המודלים ילמדו לזהות את הגבול בעצמם, בלי רמזים. Anthropic כותבת במפורש שהיא עובדת על זה וכבר מעבירה את אימון הזהירות מתכנות לחיפוש ולשליטה במחשב. אבל כל עוד החברה שבונה את המודל עוטפת אותו בעצמה במסננים ובחסימות, יש לנו סיבה טובה עוד יותר לכתוב משימות כאילו אין מסננים.

איך לתת משימה לסוכן AI עם גישה לאתרים

החלק הזה מיועד למי שכבר מריץ סוכנים: Claude בדפדפן, ChatGPT במצב סוכן, סקריפטים משלכם. אם עד עכשיו אתם רק מתכתבים עם AI בצ'אט, שתי הנקודות הראשונות מספיקות, והן יועילו כשתגיעו לסוכן. ההבדל בין צ'אט לסוכן הוא בדיוק בגישה: בצ'אט המודל רק עונה, ובדפדפן או בטרמינל הוא כבר פועל בעצמו.

  1. מטרה וסימן לסיום. לא "תמצא את הנתונים", אלא "תמצא את הנתונים במקורות פתוחים; אם הם בתשלום או מאחורי התחברות, עצור וכתוב לי".
  2. רשימת פעולות מותרות במקום איסורים. "מותר לקרוא דפים ולהעתיק טקסט. אסור ללחוץ על כפתורי שליחה, תשלום ואישור באף אתר".
  3. גבולות רשת. אם המשימה נוגעת לשירות אחד, ציינו אותו ואסרו את השאר. כשהרשת נחוצה רק חלקית, בדקו דרך אילו פרצות הסוכן יכול לצאת: אצל OpenAI לאחרונה סוכן ברח מארגז החול דרך DNS, שירות שאף אחד לא ראה בו דרך החוצה.
  4. נקודת עצירה במילים. "אם משהו לא עובד, אל תחפש עקיפה, תחזור עם שאלה". הסוכן בבדיקה של Anthropic חיכה לעמוד אישור שלא היה. אל תסמכו עליו.
  5. קראו מה הסוכן עשה. ב-Anthropic הטיפ שכב בלוגים יותר מחודשיים. את הלוגים שלכם לפחות תעברו עליהם אחרי כל ריצה עם גישה לאתרים.

משפט אחד ששווה להוסיף לכל משימה של סוכן

"אם אתה לא יכול לעשות את זה בדרכים המותרות, עצור והסבר מה מפריע. אסור לעקוף מגבלות של אתרים וכלים". זו לא ערובה, אבל כך אתם סוגרים את התרחיש הנפוץ ביותר בדוח: משימה מעורפלת ועוד היעדר רשות לוותר.

אם מעניין אתכם הצד השני של אותו סיפור, מה Anthropic רואה בצ'אטים רגילים ומתי שיחה מגיעה לבני אדם, פירקנו את זה במאמר על איך צ'אט עם Claude הגיע למשטרה בפלורידה.

הכתבה מבוססת על הדוח של Anthropic מ-9 באוקטובר 2026; בדיקת התמלילים נמשכת, והחברה מבטיחה לדווח על מקרים חדשים. האמצעים המתוארים נכונים ל-11 באוקטובר 2026, בדקו את הגרסה העדכנית של הדוח.

מקורות3להרחיב
  1. Anthropic, “Investigating unintended model actions in our evaluations and internal use”, 9 באוקטובר 2026 — https://www.anthropic.com/research/investigating-unintended-model-actions
  2. TechCrunch, “An Anthropic AI model sent a false homicide tip to Philadelphia police”, 9 באוקטובר 2026 — https://techcrunch.com/2026/10/09/an-anthropic-ai-model-sent-a-false-homicide-tip-to-philadelphia-police/
  3. The Hacker News, “Anthropic Cuts Live Internet Access for Internal AI Tests”, 10 באוקטובר 2026 — https://thehackernews.com/2026/10/anthropic-cuts-live-internet-access-for.html

תגובות