CodeariaAcademy

אותו מודל, אותה הצלחה, פי שניים כסף. על מה אתם באמת משלמים ל-Claude Code?

דמיינו שאתם משלמים על מודל פעמיים: פעם אחת על האינטליגנציה, ופעם שנייה על הדרך שבה היא מוגשת. ברקלי הריצה שבעה מודלים דרך שלוש מעטפות. בצמד אחד Claude Code יצא יקר פי שלושה וגרוע בשתים-עשרה נקודות. אנחנו מפרקים מאיפה בא המס הזה, ואיפה המחקר לא נוגע לעבודה שלכם.

17 ספטמבר 20268 דק׳ קריאהנבדק עם HarnessTax, פורסם ב-16 בספטמבר 2026. המספרים נשלפו מנתוני לוח המחוונים AgentBRANE. Claude Code 2.1.224, Codex CLI 0.146.0, Pi 0.85.1. לא הרצנו בנצ'מרק משלנו
כריכת המאמר: מונה של מונית על לוח המחוונים, ובמקום סכום מוצגת עליו המילה harness
במאמר הזה6
בקצרה

ב-16 בספטמבר 2026 מעבדת Sky Lab של UC Berkeley ו-Arena פרסמו את HarnessTax: שבעה מודלים הורצו דרך Claude Code, ‏Codex CLI ו-Pi על משימות SWE-bench Lite ו-Terminal-Bench 2.0. המעטפת כמעט לא משנה את שיעור ההצלחה (בטווח ±2%), אבל משנה את המחיר פי כמה. ‏Claude Fable 5 פותר 97.8% מהניסיונות ב-Claude Code ו-96.7% ב-Pi, במחיר 1.33 דולר מול 0.67 דולר. המס מתחיל בקריאה הראשונה: ‏Claude Code מצהיר על 23 כלים מול ארבעה ב-Pi, ולכן ההקשר הפותח שלו הוא 27,011 טוקנים מול 1,972. המקרה החד ביותר: ‏GPT-5.6 Sol ב-Terminal-Bench 2.0 עולה 1.355 דולר עם 71.1% הצלחה ב-Claude Code, ו-0.421 דולר עם 83.3% ב-Pi. זול פי שלושה וטוב יותר. אבל ההסתייגות חשובה מהממצא: נמדדו משימות קצרות לפי מחירי API ישיר, בלי סוכני משנה, בלי hooks ובלי MCP, כלומר בלי כל מה שבשבילו מתקינים מעטפת.

נתחיל מהמספר שנראה כמו טעות דפוס.

‏GPT-5.6 Sol במשימות Terminal-Bench 2.0 עולה 1.355 דולר לניסיון ב-Claude Code ופותר 71.1%. אותו מודל ב-Pi, מעטפת פתוחה מינימלית, עולה 0.421 דולר ופותר 83.3%. מודל אחד, אותן משימות. זול פי שלושה וטוב יותר בשתים-עשרה נקודות.

זה מתוך HarnessTax, שפורסם ב-16 בספטמבר בידי Sky Lab מברקלי וצוות Arena. בין הכותבים Ion Stoica ו-Matei Zaharia, ממייסדי Databricks ויוצרי Apache Spark, ו-Wei-Lin Chiang מ-LMArena. את השאלה הם ניסחו כך שקשה להתווכח: האם מעטפת אחרת יכולה לגרום לאותו מודל לפתור יותר משימות, או לעלות פחות?

מעטפת היא התוכנית שיושבת ביניכם לבין המודל: היא מחליטה על אילו כלים להצהיר, מה ייכנס להוראות המערכת ומתי לעצור. ‏Claude Code, ‏Codex CLI ו-Cursor הן מעטפות. עד עכשיו לא מדדו אותן בנפרד מהמודל, ולכן "מה יותר טוב" תמיד התגלגל לוויכוח על המודל שבפנים.

מה נמדד

שבעה מודלים על שלוש מעטפות: ‏Claude Code 2.1.224, ‏Codex CLI 0.146.0 ו-Pi 0.85.1, מעטפת פתוחה מינימלית עם ארבעה כלים (read, write, edit, bash). שלושים משימות מכל אחד מהבנצ'מרקים, שלוש הרצות למשימה, ומחירים לפי מחירון API ישיר קבוע. לניקיון הניסוי נחסמה גישת הרשת מהקונטיינרים, כדי שאף מעטפת לא תנצח בזכות יציאה לאינטרנט.

הערה על מקור המספרים שלנו. לפתוח את דף המחקר בדרך הרגילה לא הצליח: לוח המחוונים מצויר בצד הלקוח, והשרת מוסר טוען ריק. חצי שעה בזבזנו על שליפת נתונים מסיכומים של אחרים, ושם הם כבר התחילו להתפצל. כל מה שלמטה שוחזר מהנתונים של לוח המחוונים עצמו, ותאריך הפרסום נלקח מהיסטוריית הקומיטים, כי בטקסט הוא לא מופיע.

ההצלחה עומדת במקום, המחיר זז

±2%ההשפעה הממוצעת של המעטפת על שיעור ההצלחה ב-SWE-bench Lite. המחיר באותו טווח נבדל פי שנייםHarnessTax, ‏UC Berkeley ו-Arena, 16 בספטמבר 2026

הדגל מדגים זאת בצורה הנקייה ביותר. ‏Claude Fable 5 ב-SWE-bench Lite פותר 97.8% מהניסיונות ב-Claude Code ו-96.7% ב-Pi. הפער יושב בתוך טווח הטעות: רווח הסמך נע בין 93.3% ל-100%. הכסף נבדל בדיוק פי שניים, ‏1.33 דולר מול 0.67 דולר.

והסוכן עושה אותו מספר צעדים, ‏15.3 תורות מול 15.4. פשוט כל צעד עולה יותר.

מודל אחד, שלוש מעטפות. הנקודות יושבות באותו גובה, כלומר ההצלחה לא זזה. הן מתפזרות רק אופקית, והציר הזה הוא המחיר. צילום מסך מלוח המחוונים harnesstax.github.io, ‏17 בספטמבר 2026

התמונה חוזרת בכל שבעת המודלים. הנה ארבע השורות המדברות ביותר:

מודלClaude CodeCodexPi
Claude Fable 5$1.329 / 97.8%$0.890 / 96.7%$0.666 / 96.7%
Claude Haiku 4.5$0.426 / 52.2%$0.392 / 57.8%$0.374 / 60.0%
GPT-5.6 Sol$1.540 / 77.8%$0.561 / 73.3%$0.441 / 74.4%
GPT-5.6 Luna$0.152 / 55.6%$0.035 / 55.6%$0.030 / 53.3%

שורת Luna נקראת כמו טעות דפוס: חמישה-עשר סנט מול שלושה, באותם 55.6%. שורת Haiku מעניינת יותר, כי שם Claude Code לא רק יקר יותר אלא גם גרוע יותר, ‏52.2% מול 60.0% ב-Pi.

בממוצע על פני המודלים, ‏Claude Code יקר מ-Pi בערך פי שניים ומ-Codex פי 1.6. הכותבים קוראים לפער הזה harness tax, ומדייקים מתי משלמים אותו: כשלוקחים את מעטפת ברירת המחדל בלי להשוות אותה לכלום.

מאיפה מגיע המס

הוא מתחיל עוד לפני שהסוכן עשה משהו. כבר הבקשה הראשונה שונה.

PiCodexClaude Code
כלים מוצהרים47.423
תווים בסכמות הכלים2,87318,11476,995
טוקנים בקריאה הראשונה1,97211,30827,011

עשרים ושלושה כלים מוצהרים מול ארבעה, והסכמות שלהם תופסות פי עשרים ושבעה מקום. ההקשר הפותח כבד פי ארבעה-עשר כמעט, והמשקל הזה נוסע עם כל בקשה בסשן.

משם פועל אותו חשבון שפירקנו כשספרנו את המגבלות השבועיות: הקשר ארוך נשלח שוב במלואו בכל צעד. אז ראינו את התוצאה, מגבלה שנגמרת מוקדם מהצפוי. כאן הסיבה מפורטת.

והחלק המפתיע: ‏Pi, עם ארבעת הכלים שלו, מגיע לחזית פארטו בשני הבנצ'מרקים. תשעה-עשר הכלים הנוספים של Claude Code אינם מיותרים, הם פשוט לא מחזירים את ההשקעה במשימה מסוג "תקן באג במאגר שכבר יש בו בדיקות".

מודל יכול להצליח יותר מחוץ למעטפת שלו

זה הממצא המוזר ביותר. על פני שישה מודלים של Anthropic ו-OpenAI בשני בנצ'מרקים, מעטפת חלופית הניבה את התוצאה הטובה ביותר בתשעה מתוך שנים-עשר מקרים.

‏Sonnet 4.6 פותר יותר ב-Codex מאשר ב-Claude Code. ‏Haiku 4.5 טוב יותר ב-Pi. ‏GPT-5.6 Sol ב-Pi מנצח את עצמו ב-Codex הביתי. אופטימיזציה של מודל לסביבה שלו, שהספקים אכן מתארים, לא מבטיחה את הצימוד הטוב ביותר.

אל תקראו את זה כ"Claude Code גרוע"

התוצאה המוחלטת הטובה ביותר בכל המחקר שייכת לצירוף של Claude Code עם Fable 5: ‏97.8% ב-SWE-bench Lite. השאלה איננה אם המעטפת עובדת, אלא אם אתם משלמים על מה שהמשימה שלכם צריכה.

איפה זה לא נוגע לכם

קראנו עד הסוף, ולדעתנו המגבלות כאן חשובות מהממצאים.

המשימות קצרות. תקרה של 100 תורות, ממוצע סביב חמש-עשרה. זה תיקון בתוך מאגר מוכר שכבר יש בו בדיקות. לא בשביל זה מתקינים מעטפת. היא מצדיקה את עצמה בשעה הרביעית של סשן, כשההקשר מלא וחצי מהעבודה יושבת אצל סוכני משנה.

התמחור הוא API ישיר. על מנוי, מחיר הקריאה הבודדת לא הבעיה שלכם בכלל. המגבלה השבועית כן, וזה חשבון אחר.

אף אחת מהסיבות שבגללן מתקינים מעטפת לא נמדדה. בלי סוכני משנה, בלי hooks, בלי skills, בלי MCP, בלי זיכרון בין סשנים. עשרים ושלושה כלים נראים כמו מס בדיוק עד הרגע שבו אתם צריכים אחד מהם.

והכותבים אומרים זאת בעצמם: הבנצ'מרקים פומביים, וייתכן שהמודלים ראו את המשימות באימון.

מה עושים עם זה

חשבו את העלות שלכם לפני שאתם מחליפים כלי. על מנוי, בלי להיתקל במגבלה, אתם לא משלמים מס מעטפת בכלל.

משימה קצרה וחוזרת לא צריכה מעטפת כבדה. תיקונים המוניים לפי תבנית, מעבר לינטר, ייצור בדיקות דומות: כאן עשרים ושלושה כלים מובילים אוויר. משימה ארוכה עם סוף לא ידוע רוצה בדיוק את ההפך, ושם הכלים והזיכרון כן משתלמים.

ההקשר הפותח הוא החלק שבשליטתכם. עשרים ושלושת הכלים מגיעים מהקופסה, אבל כל שרת MCP שאתם מחברים כותב את הסכמות שלו לאותה קריאה ראשונה. אם אתם מחזיקים חמישה שרתים ומשתמשים באחד, אתם משלמים מעבר למה שברקלי מדדה. אחרי המחקר הזה התחלנו מביקורת על השרתים המחוברים אצלנו, וזו הייתה הדרך המהירה לראות את החשבון.

החדשה האמיתית כאן היא לא המספרים אלא שסוף סוף מודדים את המעטפת בנפרד מהמודל. כשהמודל קבוע, בחירת המעטפת משנה את החשבון פי שניים ולפעמים את התוצאה בשתים-עשרה נקודות. הכותבים חותמים במחשבה שאנחנו מסכימים איתה: המשתמש לא אמור לקבל את ההחלטה הזאת ידנית, והמעטפת הנכונה מסתגלת תוך כדי המשימה. עד שתהיה כזאת, ההחלטה אצלכם, ולפחות עכשיו יש לה מספרים.

המחירים והגרסאות נכונים ל-17 בספטמבר 2026: ‏Claude Code 2.1.224, ‏Codex CLI 0.146.0, ‏Pi 0.85.1, מחירון API ישיר מ-1 בספטמבר 2026. מודלים ותעריפים מתעדכנים תכופות, בדקו נתונים עדכניים לפני שאתם בונים עליהם תקציב.

מקורות3להרחיב
  1. Melissa Z. Pan, Shuo Yang, Negar Arabzadeh, Wei-Lin Chiang, Ion Stoica, Matei Zaharia, «HarnessTax: How Much Does the Harness Matter for Coding Agents?», UC Berkeley Sky Lab ו-Arena, 16 בספטמבר 2026, harnesstax.github.io.
  2. נתוני לוח המחוונים AgentBRANE: data/charts/system-frontier-swe, system-frontier-tb, system-agent-context-swe, מאגר github.com/HarnessTax/HarnessTax.github.io, נבדק ב-17 בספטמבר 2026.
  3. Codearia Academy, «Anthropic העלתה את המגבלות השבועיות של Claude Code ב-25% וקיצצה אותן ב-17% באותו יום», 15 בספטמבר 2026 (על האופן שבו אורך ההקשר שורף את המגבלה).

תגובות