
57 токенов в секунду вместо 30 на том же Mac. За счёт чего Magnitude обгоняет llama.cpp?
Можно ли гонять агента на локальной модели вдвое быстрее, не меняя железо? Разбираем Magnitude: как он настраивает ядра под чип и где llama.cpp пока быстрее.
В цифрах
В этой статье6
Magnitude это открытый движок инференса для агентов от стартапа из YC S25, запущенный на Hacker News 30 сентября 2026. Он не везёт готовые ядра под класс железа, как llama.cpp, а за минуту настраивает их под ваш конкретный чип при скачивании модели. По замеру авторов на Mac M4 Pro декод вырос с 30 до 57 токенов в секунду на той же модели. Claude Code, Codex, Cline и другие агенты подключаются в один клик, лицензия Apache 2.0. Оговорка, которой нет в анонсах: в замере у llama.cpp KV-кэш вдвое тяжелее, а на M5 Max пользователи получили обратную картину, llama.cpp оказался примерно вдвое быстрее. Авторы признали пробел в ядрах для новых чипов и обещают его закрыть.
30 и 57. Столько токенов в секунду выдаёт одна и та же модель на одном и том же Mac M4 Pro: первое число в llama.cpp, второе в Magnitude. Железо не менялось, менялись ядра, которые считают модель. Для агента, который за сессию генерирует десятки тысяч токенов, это почти вдвое меньше ожидания на каждом шаге.
Облачные токены для агента стоят денег, и немалых: мы считали, сколько на самом деле обходится задача у GPT-6 Sol и Opus 5.5. Поэтому движок, который выжимает из ноутбука лишние токены, касается каждого, кто думал увести часть задач агента на локальную модель.
Что такое Magnitude и почему он быстрее llama.cpp
Magnitude делают Anders и Tom, команда из YC S25. Раньше они выпустили браузерного агента, он живёт в соседнем репозитории и собрал 4 134 звезды. Сам magnitudedev/magnitude за лето сменил три жизни: в июне это был CLI с облачным ключом и кредитами, в августе агент на локальных моделях, с середины сентября движок и десктопное приложение. Поэтому часть из 5,9 тысячи звёзд на 1 октября досталась от прошлых версий проекта.
Идея простая. llama.cpp и Ollama везут ядра, собранные заранее под широкий класс железа. Движки под конкретный чип, по словам авторов, быстрее, но поддерживают меньше. Magnitude пишет ядра с настраиваемыми параметрами и подбирает их на вашем устройстве. Движок написан на Rust, со своим рантаймом GPU-ядер и автотюнером. Работает на Apple Silicon, NVIDIA, AMD (через Vulkan) и на голом CPU, на macOS, Linux и Windows.
Движок инференса для агентов: ядра настраиваются под ваш чип, десктопное приложение, подключение агентов в один клик, OpenAI-совместимый API. Rust, Apache 2.0.
Ядра, которые настраиваются под ваш чип за минуту
Настройка разовая: когда вы скачиваете новую модель, движок около минуты перебирает параметры ядер, пока прирост не перестанет расти. Дальше модель работает на подобранной конфигурации.
Вторая половина скорости из памяти. KV-кэш, где модель держит прочитанный контекст, Magnitude хранит в 8 битах для ключей и 4 битах для значений. По словам авторов, кэш занимает вдвое меньше и декод от этого ускоряется. Остальное придумано под агентов, а не под чат:
- память под контекст не резервируется заранее, а растёт по мере сессии и освобождается, когда агент остановился;
- параллельные сессии с одинаковым началом (системный промпт, схемы инструментов) делят общий префикс-кэш;
- модель загружается, когда агент её запросил, и выгружается после простоя.
Каталог пока небольшой: 15 моделей шести семейств, от Qwen и Gemma до Nemotron и Liquid LFM, размером от 1,1B до 35B. Квантование только от 4 бит и выше: ниже, по словам авторов, у моделей ломаются рассуждения и вызовы инструментов.
Как подключить Claude Code, Codex или Cline к локальной модели
Установка через приложение: скачать с magnitude.dev, выбрать модель во вкладке Discover, подключить агента в Connections. CLI magnitude входит в приложение. В один клик подключаются Pi, OpenCode, Hermes, OpenClaw, Codex, Claude Code, Oh My Pi и Cline, всё прочее ходит через OpenAI-совместимый эндпоинт.
С Claude Code есть деталь, которую стоит знать заранее. Кнопка Connect переписывает ваш ~/.claude/settings.json и пускает Claude Code через шлюз Magnitude:
"ANTHROPIC_BASE_URL": "http://ADDRESS:10100/inference/anthropic/proxies/claude-code","CLAUDE_CODE_ENABLE_GATEWAY_MODEL_DISCOVERY": "1","model": "anthropic-local/MODEL_ID"claude --model anthropic-local/MODEL_ID
Через шлюз идут и запросы к облачным моделям, поэтому Magnitude должен быть запущен всё время, пока Claude Code подключён. Чтобы вернуться к обычной работе, нужно нажать Disconnect и перезапустить Claude Code. Если у вас в settings.json уже настроены свои переменные, сохраните копию до подключения.
Откуда «вдвое быстрее llama.cpp»
Главная цифра Magnitude снята на одной модели и двух машинах:
токенов в секунду в декоде на Mac M4 Pro 48 ГБ, Qwen 3.6 35B A3B, 4 бита, 64k контекста, без спекулятивного декодирования. На DGX Spark прирост 19% (49 → 58), префилл быстрее на 9% и 23%
Задача в замере синтетическая: в запрос кладут «Моби Дика» до 64 тысяч токенов и просят повторить последний отрывок. Авторы на HN честно описали, как настраивали llama.cpp: flash attention включён, KV-кэш 16 бит. Квантовать кэш до 8 и 4 бит, как у себя, они пробовали, но у llama.cpp от этого проседал декод. Получается, что в сравнении у Magnitude кэш почти вдвое легче, а лёгкий кэш, по их же словам, ускоряет декод. Часть прироста даёт именно он, а не только настройка ядер.
Есть и вторая тонкость, её мы нашли в их же методике. В session-bench Magnitude работает с MLX-версией модели, llama.cpp с GGUF, и документ прямо предупреждает: одинаковое имя модели не доказывает, что файлы эквивалентны. Цифра честная, но это цифра про связку «движок плюс формат плюс кэш», а не про ядра в чистом виде. Сравнения с MLX авторы пока не опубликовали, обещают скоро.
Где Magnitude пока медленнее
В первые сутки на HN пользователи прогнали его на своём железе. Самое заметное расхождение на новых Mac:
| Железо и модель | Что получилось |
|---|---|
| M5 Max, Qwen3.8 Q6 с драфтером DFlash2 | llama.cpp примерно вдвое быстрее и в префилле, и в декоде |
| M5 Max 128 ГБ, несколько моделей Qwen | rapid-mlx: 175 ток/с и 64 мс до первого токена, Magnitude: 161 и 111 мс |
| M5 Pro 48 ГБ, Gemma 4 26B | генерация быстрее oMLX (82,8 против 76,5), префилл в 2,6 раза медленнее |
| RTX 5070 Ti, Gemma 4 12B | llama.cpp на 20–30% быстрее в декоде, вторая карта не используется |
Причину на M5 авторы назвали сами: ядра пока не используют матричные операции Metal 4, которые появились в этих чипах. По словам одного из пользователей, llama.cpp закрыл такой же разрыв в префилле недавно, в сборке b10853. Несколько видеокарт в одной машине Magnitude пока не поддерживает, это в ближайших планах. Ещё два бага с первого дня: долгий шаг оценки моделей перед первым скачиванием и заниженные рекомендации на машинах с одной картой на 16 ГБ.
Версия 0.2 от 30 сентября
Это первые дни публичного движка. Часть замеров пользователей сделана на 0.2.1, в тот же день вышли ещё два патча. Цифры в этом разделе устареют быстрее всего.
Что мы берём себе
Наше мнение, с которым можно спорить: Magnitude стоит попробовать тем, кто гоняет агентов на Mac с M4 Pro или M4 Max и упирается в скорость декода на длинном контексте. Прирост там заявлен на открытой методике, её можно повторить у себя командой session-bench. Мы окажемся неправы, если обещанное сравнение с MLX покажет, что обычный MLX-движок на Mac не медленнее: тогда Magnitude останется удобной оболочкой, а не новым классом движков.
На M5, на картах NVIDIA потребительского класса и в связках из нескольких видеокарт пока лучше подождать обновления ядер. Интереснее скорости здесь сама идея: движок под долгие сессии агентов с общим кэшем и памятью, которая растёт и отпускается. Сколько стоит сама обвязка вокруг модели, мы разбирали, сравнивая Claude Code, Codex и pi по деньгам, и локальный движок закрывает ровно ту часть счёта, которая уходит на токены.
Как проверить на своей машине за вечер
Возьмите модель из каталога, которую уже запускали в llama.cpp или MLX, и сравните на своём реальном промпте агента, а не на коротком вопросе: выигрыш Magnitude заявлен на длинном контексте. Перед подключением Claude Code сохраните копию ~/.claude/settings.json.
Версии и цифры на 1 октября 2026, проверяйте актуальные в репозитории.
Источники6развернуть
- Magnitude, «magnitudedev/magnitude», README и бенчмарк против llama.cpp, проверено 1 октября 2026 — https://github.com/magnitudedev/magnitude
- Magnitude, «Session bench», методика замеров, проверено 1 октября 2026 — https://github.com/magnitudedev/magnitude/blob/main/inference-v2/session-bench.md
- Magnitude, «Claude Code», документация подключения, проверено 1 октября 2026 — https://github.com/magnitudedev/magnitude/blob/main/docs/integrations/claude-code.mdx
- Magnitude, «Models», каталог, проверено 1 октября 2026 — https://magnitude.dev/models
- Anders и Tom, «Launch HN: Magnitude (YC S25) – Self-optimizing inference engine for agents», 30 сентября 2026, с комментариями пользователей — https://news.ycombinator.com/item?id=49911995
- Magnitude, «browser-agent», проверено 1 октября 2026 — https://github.com/magnitudedev/browser-agent




Комментарии