
50 страниц за $0.002, а не за $43: парсер, который нужен модели решений
codearia-sieve это наш открытый MCP-сервер и библиотека. Он превращает веб-страницу в состояние: даты как даты, числа с единицами, чанки под окно модели и счёт токенов до и после. Ставится одной строкой, работает без модели и без ключа API.
Что внутри
бесплатно, целикомТри причины, по которым сырая страница ломает модель решений
15 сентября вышел Jev: модель, которая ничего не пишет, берёт состояние и типизированные вопросы и возвращает решения с вероятностями за четыре цента на миллион токенов. Самой дешёвой и быстрой модели нужен самый аккуратный вход.
Гниение контекста
У Jev 32 000 токенов на состояние, и его авторы сами пишут, что точность падает, когда их заполняет лишнее. Скачанная страница это меню, cookie-баннер, футер и рекламные слоты вокруг одного абзаца. Медиана в нашей выборке: 53 718 токенов на страницу, содержимое которой помещается в 1 106.
Она не умеет считать
Модель решений не делает арифметику. «$42 per billion tokens» в прозе это строка, о которой надо рассуждать; { value: 42, unit: "USD_per_billion" } это число, которое можно сравнить. Markdown для чтения оставляет каждое число прозой.
Даты для неё текст
«Published September 15, 2026» для неё предложение, а не упорядоченное значение. Проверка свежести, «что из этого новее», всё, где есть «до» и «после», не работает, пока дата не приходит отдельным полем.

Состояние, а не текст
Любой инструмент «страница в markdown» готовит вход для читателя. Этот готовит вход для судьи. Разница в форме результата: поля вместо предложений, и каждое поле знает, откуда на странице оно взято.
- «Published September 15, 2026» → «2026-09-15»
- «$42 per billion tokens» → { value: 42, unit: "USD_per_billion" }
- чанки: tokens, chars, blocks, #anchor
- usage: rawTokens 53 718 → stateTokens 1 106
- warnings: paywall, blocked, empty-without-js …
Даты читаются сначала из JSON-LD, meta-тегов и <time>, из подписи автора только когда разметка молчит, и никогда не угадываются. Число без единицы не факт, год никогда не факт. Ожидаемые неудачи не бросают исключений: они приходят одним из восьми именованных предупреждений.

Claude Code, sieve, Jev
Вы говорите словами, чего хотите. Claude Code находит страницы и вызывает sieve_page для каждой. В режиме summary по умолчанию он получает схему страницы, размеры и якоря без текста, и тянет один чанк через sieve_chunk только когда он нужен. Состояние уходит в Jev через jev-mcp типизированным вопросом, оценки возвращаются с вероятностями, а Claude пишет отчёт. Вставить нужно две вещи: конфиг MCP и задачу.
{ "mcpServers": { "sieve": { "command": "npx", "args": ["-y", "codearia-sieve"] } } }Следи за этими четырьмя страницами с тарифами: [URL].
Для каждой страницы вызови sieve_page. Если вернулось предупреждение, скажи какое и остановись на этой странице, а не угадывай.
Отдай чанк с тарифами Jev с одним вопросом: какой самый дешёвый план включает [функцию]? Попроси цену, название плана и оценку уверенности.
Верни таблицу: вендор, план, цена, уверенность, #anchor на странице, где я могу это проверить. Всё, что ниже 0.9, пометь, чтобы я прочитал сам.Это пример pricing-watch из репозитория. На четырёх страницах вендоров он ужал 806 986 токенов до 8 527 и вернул «Vercel Pro $20/mo» с уверенностью 0,99 и проверкой по каждому вендору.

Четыре места, где он останавливается
- 01
Закрытые сайты. Stack Exchange и Reddit отвечают боту страницей-проверкой. Вы получаете предупреждение blocked со статусом, а не обход и не поддельную страницу.
- 02
Тарифные сетки. Факт знает блок, из которого взят, но не колонку тарифа, под которой стоит, и парсер эту пару не угадывает. Отдайте чанк, после очистки это около тысячи токенов, и пусть его прочитает судья.
- 03
Магазины и приложения, которые рисует скрипт. Когда контейнер статьи пуст и заполнить его должен JavaScript, вы получаете empty-without-js. Сайт, который отдаёт тизер и дотягивает остальное, без браузера не отличить.
- 04
Текстовые страницы экономят меньше. Целый роман даёт 22 %, RFC 84 %: снимать нечего, текст сохраняется полностью. Это инструмент работает, а не ломается.
AI-агенты для бизнеса: от чата до команды, которая работает сама
Sieve это один слой. В курсе собираются агенты над ним: те, что собирают, решают, проверяют и отчитываются, пока вы заняты другим.
Сколько стоит запуск
Один прогон на 50 страниц, замерен 21 сентября 2026
С Jev в роли судьи прогон на 50 страниц стоит около $0,002. Те же страницы сырым HTML в Sonnet стоят около $8,60, в Opus около $43. Запускайте каждый день, и месяц выходит $0,06 против $258. Разница не в более умной модели, а в том, что модель никогда не видит меню.
- 50 страниц, sieve + Jev: ≈ $0,002
- 50 страниц, сырой HTML → Sonnet: ≈ $8,60
- 50 страниц, сырой HTML → Opus: ≈ $43
- ежедневные прогоны, месяц: $0,06 против $258
Шесть шагов до первого решения
Верхний уровень процесса. Пороги уверенности, запасные пути и замер разбираются в курсе.
01.Добавьте сервер
Одна строка в конфиге MCP у Claude Code или Cursor: command npx, args -y codearia-sieve. Без модели, без ключа API. Появляются два инструмента: sieve_page и sieve_chunk.
Это карта, а не инструкция. Полный цикл с проверками и замером разобран в курсе по шагам.
Замерено, а не обещано
Лаборатория из семи сценариев, около 130 страниц: источники новостей веб-разработки, тарифы конкурентов, свежесть документации, новости на иврите и арабском, государственные таблицы пошлин, длинные документы вроде RFC и Википедии, форумы. Она нашла 16 багов, исправленных в тот же день: подписи авторов простым текстом, трекинг-параметры против robots.txt, ложные пейволы из флагов JSON-LD, единицы на иврите и арабском, RFC без тела, чанки, разрезанные посреди раздела. На каждое исправление есть тест. 69 тестов, все офлайн, а npm run analytics перегоняет выборку из 56 страниц из README.
Агенты, которые решают, проверяют и отчитываются
Парсер это одна деталь. В курсе весь цикл: какие решения увести с пишущей модели, как поставить порог уверенности, как отдать рутину агентам и замерить, что реально изменилось.

Комментарии