
הסקיל שממנו צמחו 7,245 הבאגים ש-Cloudflare מצאה. מה הוא ימצא בריפוזיטורי שלכם?
אפשר לסמוך על Claude Code בביקורת אבטחה? Cloudflare שחררה סקיל שבו סוכן אחר בודק כל ממצא. השלבים, ההתקנה ומה חסר בו, בלי קיצורי דרך ובלי הבטחות.
במאמר הזה6
security-audit-skill הוא סקיל קוד פתוח של Cloudflare ברישיון MIT, שהופך סוכן קוד כמו Claude Code למבקר אבטחה. הביקורת עוברת שישה שלבים: סיור, ציד לפי סוגי מתקפות, בדיקה של כל מועמד על ידי סוכן רענן שמנסה להפריך אותו, רישום JSON של הממצאים, מעבר בלתי תלוי נוסף מול קוד המקור, ודוח. הרתמה (harness) הפנימית של Cloudflare צמחה מהסקיל הזה: 20,799 מועמדים גולמיים, ומתוכם 7,245 ממצאים הגיעו לצוותי ההנדסה אחרי אימות והסרת כפילויות. אבל המספרים האלה הושגו על ידי הרתמה, ושוחרר רק הסקיל. הוא מותקן בפקודה אחת, npx skills add, ודורש מודל שיודע להריץ תת-סוכנים במקביל. לדברי המחברים, ריצה אחת מוצאת בערך מחצית ממה שכמה ריצות מוצאות יחד.
Cloudflare שחררה את הכלי שמצא 7,245 באגים בקוד שלה. ליתר דיוק, היא שחררה את מה שממנו הכלי הזה התחיל. ב-18 ביוני 2026 צוות האבטחה של Cloudflare פרסם בבלוג סקירה של הרתמה שלו לחיפוש פגיעויות, ובאותו יום פתח את הריפוזיטורי cloudflare/security-audit-skill. עד 29 בספטמבר צברו בו 22,845 כוכבים, 3,962 מהם בשבוע האחרון, והוא בראש GitHub Trending.
ביקורת אבטחה שמריץ סוכן היא משהו שרוצים לנסות על הפרויקט שלכם כבר היום, והנה מתכון מוכן מצוות שכבר הריץ את הגישה על 128 ריפוזיטוריז שלו. נראה מה המתכון הזה, איך הוא עובד ב-Claude Code ומה לא לצפות ממנו.
סקיל לסוכני קוד: ביקורת אבטחה בשישה שלבים עם בדיקה בלתי תלויה של כל ממצא, רישום JSON ו-validators ב-Node.js ללא תלויות. רישיון MIT.
מה זה security-audit-skill ומאיפה הוא הגיע
סקיל הוא סט של הוראות markdown שהסוכן טוען כשהוא מזהה בקשה מתאימה. כאן קובץ SKILL.md הראשי קובע את הכללים ואת סדר העבודה, ולצדו יש פרומפטים לכל שלב, רשימה משותפת של סוגי מתקפות ועשרה קבצים נלווים לסוגי קוד שונים: קוד נייטיב ובינאריים, אפליקציות LLM, HTTP והרשאות, צד הלקוח בדפדפן, שרשרת האספקה, ענן, RPC ותורים, מיצוי משאבים, בידוד נתונים, אפליקציות דסקטופ ומובייל.
לפי הבלוג, Cloudflare התחילה מסקיל של כ-450 שורות, הריצה אותו על ריפוזיטורי אחד וכיווננה את הפרומפטים עד שהתחילו לצאת באגים אמיתיים. אחר כך כל שלב הפך לסוכן נפרד, ומאחוריהם הוצבו מסד נתונים ו-orchestrator. הדרך מהריצה הראשונה בפקודת slash ועד סורק של 128 ריפוזיטוריז ארכה כשישה שבועות. המחברים כותבים שעיקר הערך נמצא בפרומפטים, ובתוך הרתמה הם כמעט לא השתנו.
שישה שלבי ביקורת: סוכנים אחדים מחפשים, אחרים מפריכים
הרעיון המרכזי של הסקיל נכנס בשורה אחת של ה-README: הסוכן שמאמת ממצא לעולם אינו זה שמצא אותו. כל השאר בנוי סביב זה.
- 1
סיור
סוכנים מקבילים קוראים את הקוד וכותבים architecture.md: הסטאק, נקודות הכניסה, גבולות האמון. במקביל נוצר coverage-ledger.json, רישום של מה צריך לבדוק ומול איזה סוג מתקפה.
- 2
ציד לפי כיסוי
ציידים מבודדים מקבלים את האזורים שלהם מהרישום ומחפשים הפרות של אינווריאנטים מסוימים. אחרי כל גל, מבקר נפרד מחפש נקודות כניסה שפוספסו.
- 3
אימות מועמדים
כל מועמד עובר לסוכן רענן עם ההנחיה «You did not write this candidate. Try to refute it». הוא לא רואה את הפלט של מאמתים אחרים.
- 4
פלט מובנה
הממצאים נכתבים ל-findings.json עם פסיקה confirmed, needs_validation או rejected. את הקובץ בודקים JSON schema ו-validator ב-Node.js.
- 5
מעבר שני
סוכנים חדשים בודקים שוב כל רשומה סופית מול קוד המקור. כל תיקון מהותי נבדק על ידי סוכן בלתי תלוי נוסף.
- 6
דוח
מהרשומות שנבדקו נבנים REPORT.md, FINDINGS-DETAIL.md ו-NEEDS-VALIDATION.md.
מה שהכי מוצא חן בעינינו הוא איך הסקיל מתייחס לספק. הפסיקה needs_validation לא אומרת «פגיעות, אבל אנחנו לא בטוחים». זו השערה מסוימת עם עובדה לא ידועה אחת: למשל הגדרת proxy שאין בריפוזיטורי. לרשומה כזו אין רמת חומרה, אבל יש לה תוכנית איך לבדוק את העובדה הזו. רמת החומרה של ממצאים מאושרים קשורה בקפדנות למה שהוכח: critical רק אם תוקף לא מאומת מקבל הרצת קוד, גישה מלאה לאחסון או חשבונות של אחרים. היעדר פרקטיקה מומלצת לא נחשב פגיעות.
7,245 באגים ב-Cloudflare: אילו מספרים שייכים לסקיל
בסיכומים ברשת מסתובב המשפט «12 אלף פגיעויות מאושרות ב-128 ריפוזיטוריז». בבלוג של Cloudflare למספרים יש משמעות אחרת. 20,799 הם המועמדים הגולמיים של הרתמה לאורך כל חייה. כ-12,057 מהם עברו את האימות הראשון. אחר כך נוספו ממצאים של רתמה נוספת, המאגר המשותף גדל ל-13,841 ב-145 ריפוזיטוריז, סוכן הסרת כפילויות איחד 5,442 כפילויות, ועוד 1,154 הלכו לסל «ריפוזיטורי שגוי או לא סיכון».
ממצאים הגיעו לצוותי ההנדסה של Cloudflare אחרי אימות והסרת כפילויות, מתוך 20,799 מועמדים גולמיים
הפער העיקרי אינו בחשבון. את המספרים האלה השיגה הרתמה, לא הסקיל. ברתמה מודל אחד מחפש ומודל אחר לגמרי מאמת, כדי שהממצא ייבחן על ידי משקלות אחרים ונתוני אימון אחרים. בסקיל סוכן אחר מפריך את הממצא, אבל בדרך כלל של אותו מודל, רק עם הקשר רענן. בנוסף, לרתמה יש דברים שלסקיל אין מעצם הגדרתו: מסד נתונים שמאפשר להמשיך עבודה אחרי כשל, מעקב אחרי פגיעויות בין ריפוזיטוריז, וסוכנים נפרדים להסרת כפילויות ולתיקון. את הרתמה עצמה Cloudflare מבטיחה לשחרר בהמשך; נכון ל-29 בספטמבר בריפוזיטורי יש רק את הסקיל.
וגם הסקיל כבר לא זה שמתואר בבלוג. הבלוג מתאר שבעה שלבים וכ-450 שורות. בריפוזיטורי יש שישה שלבים, וב-10 בספטמבר PR גדול עיבד מחדש את התהליך, את חוזה הממצאים ואת ה-validators: עכשיו רק SKILL.md, HUNTING.md ו-VALIDATION-AND-REPORTING.md לבדם עוברים 600 שורות, ושני ה-validators מגיעים לכ-1,650. נוספו רישום כיסוי, פרופילי ריצה ודרישות מחמירות ל-sandbox. הסקיל נעשה מדויק וכבד יותר.
איך מריצים ביקורת אבטחה ב-Claude Code
הסקיל לא קשור לסוכן מסוים: הוא צריך מודל עם קריאה לכלים ותת-סוכנים מקבילים. Claude Code מתאים. ההתקנה דרך ה-CLI של skills.sh:
npx skills add https://github.com/cloudflare/security-audit-skill \--skill security-audit# add --global to install it for every project on the machine# then in an agent session, at the root of the repository:security audit this codebasedo a security review, output to ~/audits/my-project
כברירת מחדל הסקיל עובד במצב הנחיה: הוא יענה על שאלה על פגיעות מסוימת, אבל לא ייצור קבצים ולא יריץ את כל ששת השלבים. ביקורת מלאה מתחילה רק בבקשה מפורשת לבצע ביקורת או pentest לבסיס הקוד. התוצאות נכתבות מחוץ לריפוזיטורי, אל ~/security-audit-skill/<repo-name>/run-<N>. בתוך הפרויקט הסקיל כותב רק לתיקייה שנתתם לה שם בעצמכם ו-git מתעלם ממנה.
גודל הריצה נקבע בפרופיל: quick למבט ראשון, standard כברירת מחדל, deep למערכות גדולות וקריטיות. אפשר גם להגדיר תקציב כמספר קריאות לסוכנים. אם התקציב לא מכסה סיור ואימות, הסקיל יסרב בכנות להתחיל במקום לדלג על בדיקת הממצאים. ריצות חוזרות משלימות זו את זו: הסקיל קורא רישומים קודמים ומכוון אל הפערים.
איפה הסקיל נתקע
שלוש מגבלות לפני הריצה הראשונה
צריך sandbox ברמת מערכת ההפעלה: בלי רשת, עם סביבה ריקה ומגבלות משאבים. בלעדיו הסקיל לא יריץ את הקוד שלכם וישאיר ממצאים ב-needs_validation. ריצה אחת, לפי המחברים, מוצאת בערך מחצית ממה שכמה ריצות מוצאות יחד, ולרוב את הבאגים הפשוטים. וזו ביקורת תקופתית, לא בדיקה לכל PR: הסריקה המלאה הגרועה ביותר של Cloudflare ארכה יותר מ-14 שעות.
ה-sandbox כאן אינו עניין טכני בלבד: בזמן האימות הסוכן בונה ומריץ את הקוד של המטרה, והקוד הזה יכול לעשות כל דבר. איך סוכנים מוצאים דרך החוצה מקונטיינר שלא נסגר היטב, פירקנו בדוח של OpenAI על סוכן שברח דרך DNS.
מה אנחנו לוקחים לעצמנו
זו דעתנו, ומותר לחלוק עליה: הדבר הכי שווה בריפוזיטורי אינו סוגי המתקפות אלא הכלל «מי שמצא לא מאשר». הוא עובד הרבה מעבר לאבטחה. סקירת קוד, בדיקת עובדות בטקסט, הגירת נתונים: בכל מקום שבו סוכן מעריך את העבודה של עצמו, הוא נוטה לאשר אותה. Cloudflare כותבת בבלוג שסוכן עלול לשנות את קוד המקור כדי שה-exploit שלו יעבוד, ואז לדווח בחגיגיות על באג שהוא עצמו יצר. סוכן נפרד בלי גישה לחשיבה של הראשון תופס את זה בזול יותר מאדם. נטעה אם במשימות שלכם סוכן שני של אותו מודל פשוט יחזור על הטעויות של הראשון; אז צריך לבדוק עם מודל אחר, בדיוק כמו שהרתמה של Cloudflare עושה. כמה עולה המעטפת סביב המודל ומתי היא משתלמת, חישבנו בהשוואה בין Claude Code, Codex ו-pi.
איך להתחיל בלי סיכון מיותר
התחילו עם quick על שירות אחד שיש לו קלט חיצוני: API, webhooks, העלאת קבצים. קראו את NEEDS-VALIDATION.md: יש בו רשימת עובדות שרק אתם יודעים. הריצו מעבר שני שבוע אחר כך, הוא ישלים את מה שפוספס. הסקיל רק מתאר תיקונים, הוא לא משנה את הקוד.
גרסאות ומספרים נכון ל-29 בספטמבר 2026: הקומיט האחרון בריפוזיטורי ב-14 בספטמבר, 22,845 כוכבים. הסקיל השתנה משמעותית מאז יוני, לכן בדקו את ה-README העדכני.
מקורות4להרחיב
- Cloudflare, «cloudflare/security-audit-skill», README ו-SKILL.md, נבדק ב-29 בספטמבר 2026 — https://github.com/cloudflare/security-audit-skill
- Dan Jones, Alexandra Godoi, Grant Bourzikas, «Build your own vulnerability harness», Cloudflare Blog, 18 ביוני 2026 — https://blog.cloudflare.com/build-your-own-vulnerability-harness/
- Cloudflare, «security-audit-skill commits», היסטוריית שינויים, נבדק ב-29 בספטמבר 2026 — https://github.com/cloudflare/security-audit-skill/commits/main
- GitHub, «Trending repositories this week», 29 בספטמבר 2026 — https://github.com/trending?since=weekly




תגובות