
57 טוקנים בשנייה במקום 30 על אותו Mac. איך Magnitude עוקף את llama.cpp?
אפשר להריץ סוכן על מודל מקומי מהר פי שניים בלי להחליף חומרה? אנחנו מפרקים את Magnitude: קרנלים שמכוונים לשבב שלכם, ואיפה llama.cpp עדיין מהיר יותר.
במספרים
במאמר הזה6
Magnitude הוא מנוע הסקה בקוד פתוח לסוכנים, של סטארטאפ מ-YC S25, שהושק ב-Hacker News ב-30 בספטמבר 2026. במקום לספק קרנלים מוכנים מראש למשפחה רחבה של חומרה, כמו llama.cpp, הוא מכוונן אותם בתוך כדקה לשבב המדויק שלכם בזמן הורדת המודל. במדידה של המפתחים על Mac M4 Pro, ה-decode עלה מ-30 ל-57 טוקנים בשנייה על אותו מודל. Claude Code, Codex, Cline וסוכנים אחרים מתחברים בלחיצה אחת, והרישיון Apache 2.0. ההסתייגות שחסרה בהכרזות: במדידה הזו ה-KV cache של llama.cpp היה כבד פי שניים, ועל M5 Max משתמשים קיבלו תמונה הפוכה, llama.cpp יצא מהיר בערך פי שניים. המפתחים הודו בפער בקרנלים לשבבים החדשים ומבטיחים לסגור אותו.
30 ו-57. זה מספר הטוקנים בשנייה שאותו מודל מוציא על אותו Mac M4 Pro: המספר הראשון ב-llama.cpp, השני ב-Magnitude. החומרה לא השתנתה, השתנו הקרנלים שמחשבים את המודל. לסוכן שמייצר עשרות אלפי טוקנים בסשן, זו המתנה קצרה כמעט בחצי בכל צעד.
טוקנים בענן עולים לסוכן כסף, ולא מעט: חישבנו כמה באמת עולה משימה עם GPT-6 Sol ועם Opus 5.5. לכן מנוע שסוחט עוד טוקנים מהמחשב הנייד נוגע לכל מי שחשב להעביר חלק מהעבודה של הסוכן למודל מקומי.
מה זה Magnitude ולמה הוא מהיר יותר מ-llama.cpp
את Magnitude בונים Anders ו-Tom, צוות מ-YC S25. קודם לכן הם הוציאו סוכן דפדפן, שנמצא במאגר שכן ואסף 4,134 כוכבים. המאגר magnitudedev/magnitude עצמו עבר שלושה גלגולים במהלך הקיץ: ביוני זה היה CLI עם מפתח ענן וקרדיטים, באוגוסט סוכן על מודלים מקומיים, ומאמצע ספטמבר מנוע ואפליקציית דסקטופ. לכן חלק מ-5.9 אלף הכוכבים נכון ל-1 באוקטובר הגיע מגרסאות קודמות של הפרויקט.
הרעיון פשוט. llama.cpp ו-Ollama מגיעים עם קרנלים שקומפלו מראש למשפחה רחבה של חומרה. מנועים שנכתבו לשבב מסוים מהירים יותר, לדברי המפתחים, אבל תומכים בפחות. Magnitude כותב קרנלים עם פרמטרים מתכווננים ובוחר את הערכים על המכשיר שלכם. המנוע כתוב ב-Rust, עם runtime משלו לקרנלים של GPU ו-autotuner. הוא רץ על Apple Silicon, NVIDIA, AMD (דרך Vulkan) ועל CPU בלבד, ב-macOS, Linux ו-Windows.
מנוע הסקה לסוכנים: קרנלים שמכוונים לשבב שלכם, אפליקציית דסקטופ, חיבור סוכנים בלחיצה אחת ו-API תואם OpenAI. Rust, Apache 2.0.
קרנלים שמתכווננים לשבב שלכם בתוך דקה
הכיוונון קורה פעם אחת: כשאתם מורידים מודל חדש, המנוע מנסה פרמטרים של קרנלים במשך כדקה, עד שהשיפור מפסיק לגדול. מכאן והלאה המודל רץ על התצורה שנמצאה.
החצי השני של המהירות בא מהזיכרון. את ה-KV cache, שבו המודל מחזיק את ההקשר שכבר קרא, Magnitude שומר ב-8 ביט למפתחות וב-4 ביט לערכים. לדברי המפתחים, ה-cache תופס חצי מקום וה-decode מואץ בזכות זה. השאר תוכנן לסוכנים ולא לצ'אט:
- זיכרון להקשר לא נשמר מראש, הוא גדל במהלך הסשן ומשתחרר כשהסוכן עוצר;
- סשנים מקבילים שמתחילים אותו דבר (הוראות מערכת, סכמות של כלים) חולקים prefix cache משותף;
- המודל נטען כשסוכן מבקש אותו ונפרק אחרי זמן סרק.
הקטלוג עדיין קטן: 15 מודלים משש משפחות, מ-Qwen ו-Gemma ועד Nemotron ו-Liquid LFM, בגדלים מ-1.1B עד 35B. קוונטיזציה רק מ-4 ביט ומעלה: מתחת לזה, לדברי המפתחים, ההסקה והקריאות לכלים של המודלים מתפרקות.
איך לחבר את Claude Code, Codex או Cline למודל מקומי
ההתקנה עוברת דרך האפליקציה: מורידים מ-magnitude.dev, בוחרים מודל בלשונית Discover ומחברים סוכן ב-Connections. ה-CLI magnitude מגיע עם האפליקציה. Pi, OpenCode, Hermes, OpenClaw, Codex, Claude Code, Oh My Pi ו-Cline מתחברים בלחיצה אחת, וכל השאר עובר דרך נקודת קצה תואמת OpenAI.
עם Claude Code יש פרט שכדאי לדעת מראש. כפתור Connect כותב מחדש את ~/.claude/settings.json שלכם ומעביר את Claude Code דרך השער של Magnitude:
"ANTHROPIC_BASE_URL": "http://ADDRESS:10100/inference/anthropic/proxies/claude-code","CLAUDE_CODE_ENABLE_GATEWAY_MODEL_DISCOVERY": "1","model": "anthropic-local/MODEL_ID"claude --model anthropic-local/MODEL_ID
גם בקשות למודלים בענן עוברות דרך השער, ולכן Magnitude צריך לרוץ כל הזמן שבו Claude Code מחובר. כדי לחזור לעבודה רגילה לוחצים Disconnect ומפעילים מחדש את Claude Code. אם כבר הגדרתם משתנים משלכם ב-settings.json, שמרו עותק לפני החיבור.
מאיפה "מהיר פי שניים מ-llama.cpp"
המספר הראשי של Magnitude נמדד על מודל אחד ושתי מכונות:
טוקנים בשנייה ב-decode על Mac M4 Pro עם 48GB, Qwen 3.6 35B A3B, 4 ביט, הקשר של 64k, בלי speculative decoding. על DGX Spark השיפור 19% (49 → 58), וה-prefill מהיר ב-9% וב-23%
משימת המדידה סינתטית: ממלאים את הבקשה ב"מובי דיק" עד 64 אלף טוקנים ומבקשים לחזור על הקטע האחרון. ב-HN המפתחים תיארו בגלוי איך הגדירו את llama.cpp: flash attention מופעל, KV cache של 16 ביט. הם ניסו לקוונטז את ה-cache שלו ל-8 ו-4 ביט, כמו אצלם, אבל ה-decode של llama.cpp נפל מזה. יוצא שבהשוואה ה-cache של Magnitude קל כמעט בחצי, ו-cache קל, לפי דבריהם שלהם, מאיץ את ה-decode. חלק מהשיפור מגיע ממנו, ולא רק מכיוונון הקרנלים.
יש גם דקות שנייה, ומצאנו אותה במתודולוגיה שלהם עצמם. ב-session-bench Magnitude עובד עם גרסת MLX של המודל ו-llama.cpp עם GGUF, והמסמך מזהיר במפורש ששם מודל זהה לא מוכיח שהקבצים שקולים. המספר הוגן, אבל הוא מתאר את השילוב של מנוע, פורמט ו-cache, ולא את הקרנלים לבדם. השוואה מול MLX המפתחים עוד לא פרסמו, ומבטיחים בקרוב.
איפה Magnitude עדיין איטי יותר
ביממה הראשונה ב-HN משתמשים הריצו אותו על החומרה שלהם. הפער הבולט ביותר הוא על מחשבי ה-Mac החדשים:
| חומרה ומודל | מה יצא |
|---|---|
| M5 Max, Qwen3.8 Q6 עם ה-drafter DFlash2 | llama.cpp מהיר בערך פי שניים גם ב-prefill וגם ב-decode |
| M5 Max 128GB, כמה מודלים של Qwen | rapid-mlx: 175 טוקנים בשנייה ו-64ms עד הטוקן הראשון; Magnitude: 161 ו-111ms |
| M5 Pro 48GB, Gemma 4 26B | הייצור מהיר מ-oMLX (82.8 מול 76.5), ה-prefill איטי פי 2.6 |
| RTX 5070 Ti, Gemma 4 12B | llama.cpp מהיר ב-20–30% ב-decode, הכרטיס השני לא בשימוש |
את הסיבה על M5 המפתחים ציינו בעצמם: הקרנלים עוד לא משתמשים בפעולות המטריצה של Metal 4 שהופיעו בשבבים האלה. לדברי אחד המשתמשים, llama.cpp סגר פער דומה ב-prefill רק לאחרונה, ב-build b10853. Magnitude עדיין לא תומך בכמה כרטיסי מסך במכונה אחת, וזה בתוכניות הקרובות. עוד שני באגים מהיום הראשון: שלב ארוך של הערכת מודלים לפני ההורדה הראשונה, והמלצות נמוכות מדי על מכונות עם כרטיס יחיד של 16GB.
גרסה 0.2 מ-30 בספטמבר
אלה הימים הראשונים של מנוע ציבורי. חלק מהמדידות של המשתמשים נעשו על 0.2.1, ובאותו יום יצאו עוד שני תיקונים. המספרים בחלק הזה יתיישנו הכי מהר.
מה אנחנו לוקחים מזה
הדעה שלנו, ואפשר להתווכח איתה: את Magnitude שווה לנסות למי שמריץ סוכנים על Mac עם M4 Pro או M4 Max ונתקע במהירות ה-decode בהקשר ארוך. השיפור שם נטען על מתודולוגיה פתוחה, ואפשר לשחזר אותו אצלכם עם session-bench. נתברר כטועים אם ההשוואה המובטחת מול MLX תראה שמנוע MLX רגיל על Mac לא איטי יותר: אז Magnitude יישאר מעטפת נוחה ולא סוג חדש של מנוע.
על M5, על כרטיסי NVIDIA לצרכנים ובמערכות עם כמה כרטיסי מסך עדיף לחכות לעדכון הקרנלים. מעניין יותר מהמהירות הוא הרעיון עצמו: מנוע לסשנים ארוכים של סוכנים, עם cache משותף וזיכרון שגדל ומשתחרר. כמה עולה המעטפת שסביב המודל בדקנו כשהשווינו את Claude Code, Codex ו-pi לפי מחיר, ומנוע מקומי מכסה בדיוק את החלק בחשבון שהולך על טוקנים.
איך לבדוק על המכונה שלכם בערב אחד
קחו מודל מהקטלוג שכבר הרצתם ב-llama.cpp או ב-MLX, והשוו על פרומפט אמיתי של הסוכן שלכם ולא על שאלה קצרה: היתרון של Magnitude נטען על הקשר ארוך. לפני שמחברים את Claude Code, שמרו עותק של ~/.claude/settings.json.
גרסאות ומספרים נכונים ל-1 באוקטובר 2026, בדקו את העדכניים במאגר.
מקורות6להרחיב
- Magnitude, «magnitudedev/magnitude», README ובנצ'מרק מול llama.cpp, נבדק ב-1 באוקטובר 2026 — https://github.com/magnitudedev/magnitude
- Magnitude, «Session bench», מתודולוגיית המדידה, נבדק ב-1 באוקטובר 2026 — https://github.com/magnitudedev/magnitude/blob/main/inference-v2/session-bench.md
- Magnitude, «Claude Code», תיעוד החיבור, נבדק ב-1 באוקטובר 2026 — https://github.com/magnitudedev/magnitude/blob/main/docs/integrations/claude-code.mdx
- Magnitude, «Models», קטלוג, נבדק ב-1 באוקטובר 2026 — https://magnitude.dev/models
- Anders ו-Tom, «Launch HN: Magnitude (YC S25) – Self-optimizing inference engine for agents», 30 בספטמבר 2026, עם תגובות משתמשים — https://news.ycombinator.com/item?id=49911995
- Magnitude, «browser-agent», נבדק ב-1 באוקטובר 2026 — https://github.com/magnitudedev/browser-agent




תגובות