Та же модель, та же успеваемость, вдвое больше денег. За что вы на самом деле платите Claude Code?
Представьте, что вы платите за модель дважды: один раз за интеллект, второй за то, как его подают. Berkeley прогнала семь моделей через три обвязки. На одной паре Claude Code оказался втрое дороже и на двенадцать пунктов хуже. Разбираем, откуда берётся этот налог и где исследование к вашей работе не относится.

В этой статье6
16 сентября 2026 Sky Lab UC Berkeley и Arena опубликовали HarnessTax: семь моделей прогнали через Claude Code, Codex CLI и Pi на задачах SWE-bench Lite и Terminal-Bench 2.0. Обвязка почти не меняет успешность (в пределах ±2%), но меняет цену в разы. Claude Fable 5 решает 97,8% попыток в Claude Code и 96,7% в Pi, при этом стоит $1,33 против $0,67. Налог начинается с первого вызова: Claude Code объявляет 23 инструмента против четырёх у Pi, и его стартовый контекст 27 011 токенов против 1 972. Самый резкий случай: GPT-5.6 Sol на Terminal-Bench 2.0 в Claude Code стоит $1,355 при 71,1% успеха, а в Pi $0,421 при 83,3%. Втрое дешевле и заметно лучше. Но оговорка важнее вывода: измеряли короткие задачи по ценам прямого API, без субагентов, хуков и MCP, то есть без всего, ради чего обвязку и ставят.
Начнём с цифры, которая выглядит как опечатка.
GPT-5.6 Sol на задачах Terminal-Bench 2.0 в Claude Code стоит $1,355 за попытку и решает 71,1%. Он же в минимальной открытой обвязке Pi стоит $0,421 и решает 83,3%. Одна модель, одни задачи. Втрое дешевле и на двенадцать пунктов лучше.
Это из HarnessTax, работы Sky Lab из Berkeley и команды Arena, вышедшей 16 сентября. В авторах Ion Stoica и Matei Zaharia, сооснователи Databricks и создатели Apache Spark, и Wei-Lin Chiang из LMArena. Вопрос они поставили так, что спорить трудно: может ли другая обвязка заставить ту же модель решать больше задач или стоить дешевле?
Обвязка (harness) это программа между вами и моделью: она решает, какие инструменты объявить, что положить в системный промпт и когда остановиться. Claude Code, Codex CLI и Cursor это обвязки. До сих пор их не измеряли отдельно от модели, и спор «что лучше» всегда сводился к тому, какая модель внутри.
Что измеряли
Семь моделей на трёх обвязках: Claude Code 2.1.224, Codex CLI 0.146.0 и Pi 0.85.1, минимальная открытая обвязка с четырьмя инструментами (read, write, edit, bash). По 30 задач из SWE-bench Lite и Terminal-Bench 2.0, три прогона на задачу, цены по фиксированному прайсу прямого API. Для чистоты сеть из контейнеров отрезали, чтобы никто не выиграл за счёт похода в интернет.
Отступление о том, откуда у нас цифры. Открыть страницу исследования обычным способом не вышло: дашборд рисуется на клиенте, и сервер отдаёт пустой загрузчик. Полчаса мы потратили впустую, собирая числа из чужих пересказов, где они уже разъезжались. В итоге всё ниже собрано из данных самого дашборда, а дату публикации пришлось взять из истории коммитов, потому что в тексте её нет вовсе.
Успешность стоит на месте, цена едет
Флагман показывает это чище всего. Claude Fable 5 на SWE-bench Lite решает 97,8% попыток в Claude Code и 96,7% в Pi. Разница внутри погрешности: доверительный интервал там идёт от 93,3% до 100%. А деньги отличаются ровно вдвое, $1,33 против $0,67.
Причём агент делает столько же движений: 15,3 хода против 15,4. Дороже обходится каждый.
Картина повторяется на всех семи моделях. Вот четыре самые говорящие строки:
| Модель | Claude Code | Codex | Pi |
|---|---|---|---|
| Claude Fable 5 | $1,329 / 97,8% | $0,890 / 96,7% | $0,666 / 96,7% |
| Claude Haiku 4.5 | $0,426 / 52,2% | $0,392 / 57,8% | $0,374 / 60,0% |
| GPT-5.6 Sol | $1,540 / 77,8% | $0,561 / 73,3% | $0,441 / 74,4% |
| GPT-5.6 Luna | $0,152 / 55,6% | $0,035 / 55,6% | $0,030 / 53,3% |
Строка Luna читается как опечатка: пятнадцать центов против трёх при одинаковых 55,6%. Строка Haiku интереснее: в Claude Code модель не только дороже, но и хуже, 52,2% против 60,0% в Pi.
Если усреднить по всем моделям, Claude Code выходит дороже Pi примерно вдвое и дороже Codex в 1,6 раза. Авторы называют эту разницу harness tax и точно формулируют, когда вы её платите: когда берёте обвязку по умолчанию, ни с чем её не сравнив.
Откуда берётся налог
Он начинается до того, как агент сделает хоть что-нибудь. Первый запрос к модели уже разный.
| Pi | Codex | Claude Code | |
|---|---|---|---|
| Инструментов объявлено | 4 | 7,4 | 23 |
| Символов в схемах инструментов | 2 873 | 18 114 | 76 995 |
| Токенов в первом вызове | 1 972 | 11 308 | 27 011 |
Двадцать три объявленных инструмента против четырёх, и схемы этих инструментов занимают в двадцать семь раз больше места. Стартовый контекст тяжелее почти в четырнадцать раз, и этот вес едет с каждым запросом в сессии.
Дальше работает арифметика, которую мы разбирали, когда считали недельные лимиты: длинный контекст отправляется целиком на каждом шаге. Тогда мы видели следствие в виде рано кончающегося лимита, здесь видно причину.
И вот что неожиданно: Pi со своими четырьмя инструментами выходит на границу Парето на обоих бенчмарках. Остальные девятнадцать инструментов Claude Code не бесполезны, просто на задаче «почини баг в репозитории, где уже есть тесты» они не окупаются.
Модель может работать лучше не в своей обвязке
Это самая странная часть. По шести моделям Anthropic и OpenAI на двух бенчмарках лучший результат показала чужая обвязка в девяти случаях из двенадцати.
Sonnet 4.6 решает больше задач в Codex, чем в Claude Code. Haiku 4.5 лучше в Pi. GPT-5.6 Sol в Pi обгоняет сам себя в родном Codex. Оптимизация модели под свою среду, о которой говорят разработчики, лучшей пары не гарантирует.
Не читайте это как «Claude Code плохой»
Лучший абсолютный результат всего исследования принадлежит связке Claude Code и Fable 5: 97,8% на SWE-bench Lite. Вопрос не в том, работает ли обвязка, а в том, платите ли вы за то, что нужно на вашей задаче.
Где это к вам не относится
Мы дочитали до конца и считаем, что ограничения тут важнее выводов.
Задачи короткие. Потолок 100 ходов, в среднем около пятнадцати. Это правка в известном репозитории с готовыми тестами. Обвязка нужна не для этого: она нужна на четвёртом часу сессии, когда контекст переполнен, а половина работы висит на субагентах.
Считали прямой API. Если вы на подписке, цена вызова вас не касается вовсе. Вас касается недельный лимит, а это другая арифметика.
Не измеряли ничего, ради чего обвязку ставят. Ни субагентов, ни хуков, ни скилов, ни MCP, ни памяти между сессиями. Двадцать три инструмента выглядят налогом ровно до того момента, пока вам не понадобится один из них.
Плюс сами авторы честно пишут: бенчмарки открытые, модели могли видеть эти задачи при обучении.
Что с этим делать
Посчитайте свою цену раньше, чем менять инструмент. На подписке и без упора в лимит налог вы не платите, он остаётся проблемой Anthropic.
Короткая повторяемая задача не требует тяжёлой обвязки. Массовая правка по шаблону, прогон линтера, генерация однотипных тестов: здесь двадцать три инструмента возят воздух. Длинная задача с неизвестным концом требует обратного, и там инструменты и память как раз окупаются.
Стартовый контекст это то, на что вы влияете. Двадцать три инструмента приходят из коробки, но каждый подключённый MCP-сервер дописывает свои схемы в тот же первый вызов. Держите пять серверов, пользуясь одним, и платите сверх того, что померила Berkeley. Мы после этой статьи начали с ревизии подключённых серверов, и это оказалось самым быстрым способом увидеть собственный счёт.
Главное здесь даже не цифры, а то, что обвязку вообще начали мерить отдельно от модели. При одной и той же модели выбор обвязки меняет счёт вдвое, а иногда и результат на двенадцать пунктов. Сами авторы заканчивают мыслью, с которой мы согласны: пользователь не должен принимать это решение вручную, правильная обвязка подстраивается под задачу сама. Пока такой нет, решение за вами, и теперь у него хотя бы есть цифры.
Цены и версии на 17 сентября 2026: Claude Code 2.1.224, Codex CLI 0.146.0, Pi 0.85.1, прайс прямого API на 1 сентября 2026. Модели и тарифы меняются часто, проверяйте актуальные значения перед тем, как считать свой бюджет.
Источники3развернуть
- Melissa Z. Pan, Shuo Yang, Negar Arabzadeh, Wei-Lin Chiang, Ion Stoica, Matei Zaharia, «HarnessTax: How Much Does the Harness Matter for Coding Agents?», UC Berkeley Sky Lab и Arena, 16 сентября 2026, harnesstax.github.io.
- Данные дашборда AgentBRANE: data/charts/system-frontier-swe, system-frontier-tb, system-agent-context-swe, репозиторий github.com/HarnessTax/HarnessTax.github.io, проверено 17 сентября 2026.
- Codearia Academy, «Anthropic подняла недельные лимиты Claude Code на 25% и в тот же день урезала их на 17%», 15 сентября 2026 (разбор того, как длина контекста расходует лимит).

Комментарии