
Сделать агента быстрее и дешевле за вечер: увести его решения с пишущей модели
К концу гайда у вас будет четыре вещи: размеченный список точек решений в вашем цикле, типизированная схема вопросов под них, роутер с порогом уверенности и запасным путём, и собственный замер до и после. Генерация остаётся у Claude Code. Переезжают только проверки.
Что внутри
всё бесплатноАгент делает два разных дела, а инструмент у него один
Генерация и решение это разные задачи с разной ценой. Пока обе идут через одну модель, вы платите за классификацию по расценкам сочинения.
Генерация
Написать функцию, составить ответ, пересказать документ. Пространство ответов открыто, перечислить все допустимые выходы заранее невозможно. Здесь нужна языковая модель, и так будет всегда.
Решение
Прошли ли тесты, чья это заявка, достаточно ли это рискованно для человека. Пространство ответов закрыто и типизировано: да или нет, один из пяти, оценка. По сути это классификация.
Смешение
Агент отправляет и то и другое в одну модель, поэтому решение из трёх вариантов приезжает абзацем рассуждений, который вы потом разбираете. Полная цена генерации и полная задержка ради ответа с тремя допустимыми значениями.

Где решения прячутся в вашем цикле
Возьмите цикл, который у вас уже работает, и прочитайте его как два потока. Генеративный остаётся на месте. Переносить стоит поток решений, и обычно он больше, чем кажется, пока вы пишете промпты.
- Предыдущий шаг действительно прошёл?
- Это тот файл, который имелся в виду?
- Результат укладывается в заданное ограничение?
- Повторить, эскалировать или продолжать?
- Нужен ли здесь человек до того, как это уедет дальше?
У каждого вопроса два или три допустимых ответа. Ни одному из них не нужно предложение. И на каждый в обычном цикле модель это предложение пишет.
Соседнее звено той же цепочки, где агент выбирает не ответ, а инструмент: Monid, шлюз инструментов для агентов.
Сколько это даёт на самом деле и откуда берётся
По сети ходят 200x быстрее и 400x дешевле. Цифры настоящие, но это верх диапазона, и сам диапазон опубликован. В запускающем посте TypeSafe сказано, что выигрыш в скорости идёт от 40x до 200x в зависимости от задачи, а заголовочные числа названы верхним краем реальных результатов. Планируйте по диапазону, а не по потолку.
диапазон по скорости, опубликованный TypeSafe для задач формата System One
за миллион входных токенов у jev-1.13.0, выходные бесплатны
сквозная задержка решения против 3–329 секунд у фронтирной модели на той же проверке
Множитель берётся из плотности решений, а не из одного вызова
Отдельная проверка сама по себе не быстрее в двести раз. Выигрыш накапливается, потому что цикл с этапом проверки или ревью задаёт один и тот же тип вопроса снова и снова. Перенесли тридцать проверок, значит убрали тридцать полноценных генераций. Процесс, который почти целиком состоит из письма, не выиграет почти ничего: переносить там нечего.

Цифры с typesafe.ai и из документации, проверены 20 сентября 2026. Версии и цены меняются, сверяйтесь перед расчётами.
Проведите аудит своего цикла до того, как что-то менять
Не начинайте с SDK. Начните с настоящего транскрипта агента, а не с воображаемого, и отметьте каждое место, где модели задали вопрос с конечным числом ответов. Отдайте транскрипт и этот промпт в Claude Code.
Прочитай транскрипт работы агента и найди все места, где модель просили выбрать из ограниченного набора ответов, а не что-то написать.
По каждому месту дай: где оно в цикле, как вопрос был задан на самом деле, ограничено пространство ответов или открыто, сколько примерно ушло токенов и секунд, и стоит ли переносить это на модель решений.
Правила: вопрос считается ограниченным, только если я могу перечислить все допустимые ответы заранее. Если не уверен, так и напиши, не угадывай. Отдельно перечисли, что по транскрипту оценить нельзя.
В конце: сколько вызовов было решениями, сколько генерацией и какую долю прогона заняли решения.Работают здесь две последние строки. Список, который никогда не признаёт неуверенности и не говорит, чего он не увидел, придётся переделывать.

Что такое Jev, сколько он стоит и девять мест, где он ломается
Откуда берётся диапазон 40–200x, что возвращают Choice, Score и Noul, и режимы отказа, которые авторы публикуют сами. Бесплатно и без регистрации.
Четыре способа всё испортить
- 01
Отправлять генерацию в модель решений, потому что там дёшево. Она ответит. Ответит плохо, потому что вы попросили классификатор писать. Дёшево и быстро не равно правильно, если инструмент не тот.
- 02
Один порог уверенности на всё. Неверно направленная заявка в поддержку и ошибочно влитый пул-реквест это разные риски. Одно число на оба случая означает, что вы либо слишком мягки к опасному, либо слишком строги к дешёвому.
- 03
Пересекающиеся категории. Если два ваших варианта могут быть верны одновременно, модель всё равно вернёт уверенный ответ, и по ответу этого не видно. Сломанная схема не выдаёт ошибку, она выдаёт аккуратно выглядящие промахи.
- 04
Считать 200x целью. Это описание узкой полосы: большой объём, низкая неоднозначность, жёстко ограниченные решения. Строить архитектуру под статистику вместо своей нагрузки значит получить быстрый неправильный ответ.

Весь конвейер, а не только разделение
Выбор порога под каждый тип решения, отлов дрейфа схемы до того, как он станет закономерностью, и замер до и после на своей нагрузке. Это та часть, для которой нужна не страница, а курс.
Цикл перестаёт ждать собственную бухгалтерию
В самой работе ничего не меняется
Ревью, правки и черновики остаются у Claude Code, потому что это настоящая генеративная работа. Уходит бухгалтерия: чтение «прошло или нет», маршрутизация, вопрос «показывать ли человеку». Умнее агент не становится. Он перестаёт брать с вас по ставке писателя за арифметику, которой никогда и не занимался.
Шесть шагов до разделения
Хватит, чтобы прогнать это на одном цикле за неделю
01.Возьмите настоящий транскрипт
Выберите прогон, который правда был, и не самый простой. Воображаемый цикл прячет проверки: вспоминая своего агента, вы помните письмо и забываете двадцать раз, когда он спрашивал сам себя, сработало ли.
Это карта. Подбор порогов под каждое решение, выборочные проверки на дрейф и доказательство экономии на своих числах разобраны по шагам в курсе.
Что считать результатом
Не скриншот графика задержек. Результат это когда у одного реально работающего цикла проверки уехали на модель решений, порог выбран замером, а не на глаз, и вы хотя бы раз видели, как срабатывает запасной путь. Если вы не можете сказать, что происходит при низкой уверенности, разделение не закончено.
Собрать агента, а не только срезать угол
На курсах проходим весь путь: агенты, которые сами распределяют свою работу, проверки, которые держат их в честных рамках, и замеры, которые говорят, окупилось ли это.

Комментарии