open-source savings field guide · agent-ready

token economy

практическая рамка для снижения полного расхода токенов ai-агента. качество фиксируется gate, а open source даёт готовые рычаги экономии.

acceptance gate
retrieval
skills · tools
routing · cache
trace · eval
качество в центре
слои покупаются по мере нужды
единица ценности
все токены основной модели, failed runs, роутеров, компрессоров и embeddings
÷
число задач, прошедших заранее заданный gateprimary: tokens / accepted task · secondary: cost / accepted task

цель — сократить числитель. gate удерживает экономию от превращения в деградацию результата. дешёвый вызов с дорогим ретраем может тратить больше токенов, чем один точный маршрут.

01 · философия рынка

токены тратятся слоями

рынок уже производит готовые рычаги для каждого источника расхода: контекст, tools, cache, routing, compression, retries и output. задача — найти крупнейший tax и менять один слой за раз.

shift 01

контекст выбирается

repo map, retrieval и task slice заменяют передачу целого workspace. Aider показывает структурный путь для кода.

shift 02

возможности раскрываются постепенно

описание skill видно всегда; полная инструкция и references загружаются только после совпадения задачи.

shift 03

модель становится маршрутом

поиск, классификация и сложный patch получают разные lanes, gates и понятное правило escalation.

shift 04

стабильный prefix покупается один раз

cache-friendly layout отделяет правила и tools от изменяемой задачи и результатов исполнения.

shift 05

компрессия следует за отбором

LLMLingua и компактная сериализация полезны после удаления нерелевантного; код и policy остаются дословными.

shift 06

качество становится gate

traces считают полный token footprint. evals отвечают, принята ли работа. вместе они создают tokens per accepted task.

02 · operating model

семь слоёв

слои упорядочены от определения ценности к её наблюдаемой цене. каждый следующий слой имеет смысл только после предыдущего.

00acceptance gateфиксирует, что считается законченной задачей
01task sliceдаёт минимальный подтверждённый контекст запроса
02repo map / retrievalнаходит структуру, символы и нужные документы
03skills / toolsраскрывает возможности по требованию
04cache / routingпереиспользует prefix и выбирает model lane
05compression / serializationуменьшает уже отобранный материал
06trace / ledgerсчитает полную цену и объясняет ретраи
03 · audit signal
711kinput tokens в одном локальном meta-research run. это наблюдение, не сравнительный benchmark.
wall time489.91 s
input tokens711 387
cached input652 288
uncached input59 099
output8 182
reasoning output4 488
разлом: высокий cache hit снижает повторную цену, но не устраняет latency, attention dilution и сложность траектории. узкая задача всё ещё может прочитать весь control plane.
04 · savings recipes

четыре гипотезы экономии

готовые starting points для разных источников token tax. каждый рецепт меняет один основной слой и проверяется paired experiment на одинаковых задачах.

small · provable

маленький доказуемый старт

видимый эксперимент для команды без большой agent platform.

Aider LiteLLM Langfuse native tests + Promptfoo
runtime · event replay

platform-first

готовый runtime, condenser и воспроизводимый coding benchmark.

OpenHands LiteLLM Phoenix SWE-bench subset
capability · progressive disclosure

capability economy

для систем, где token tax создаёт большой каталог tools и skills.

Agent Skills FastMCP / Composio / Code Mode Langfuse
ablation · long context

compression lab

для длинных prose, логов и структурированных tool results.

baseline LLMLingua / TOON paired gate
05 · market map

open-source детали

звёзды показывают распространённость, не fit. snapshot проверен через GitHub API 3 августа 2026; license и security требуют повторной проверки перед production use.

context · repo map47.9k ★

Aider

структурная карта репозитория и явный token budget.

runtime · condenser83.0k ★

OpenHands

agent runtime с конфигурируемым сжатием истории.

skills · disclosure23.8k ★

Agent Skills

спецификация трёхступенчатой загрузки инструкций.

tools · code mode695 ★

Cloudflare MCP

паттерн search + execute для больших API surfaces.

tools · search29.5k ★

Composio

tool search и just-in-time сужение capability scope.

gateway · routing55.4k ★

LiteLLM

единый gateway, routing, budgets и usage surface.

routing · research5.3k ★

RouteLLM

маршрутизация между сильной и дешёвой моделью.

routing · semantic3.8k ★

semantic-router

быстрый semantic decision layer до model call.

cache · semantic8.1k ★

GPTCache

semantic cache для детерминированных read paths.

compression · prose6.5k ★

LLMLingua

компрессия длинных prompts и документов.

serialization · data25.1k ★

TOON

компактная сериализация JSON-like результатов.

trace · eval32.4k ★

Langfuse

traces, cost analytics, prompts и evals.

observability10.9k ★

Phoenix

open-source tracing и evaluation workbench.

trace · experiments21.1k ★

Opik

observability, experiment comparison и evals.

eval · gate23.9k ★

Promptfoo

воспроизводимые evals, red teaming и quality gates.

полная карта из 22 репозиториев, включая лицензии и даты обновления, лежит в starter pack.

06 · first experiment

один день до первой экономии

начинать стоит с воспроизводимого token ledger. один крупнейший tax, один lever, пять парных задач.

выбрать 5 задач

реальных, повторяемых, сопоставимых.

задать gate

до изменения stack.

снять baseline

trace, tokens, retries, wall time.

найти tax

context, tools, routing, retry или output.

выбрать 1 lever

один repo или паттерн из карты.

повторить парно

одинаковая задача и gate.

оставить выигрыш

качество стабильно, accepted cost ниже.

07 · handoff layer

передайте это агенту

артефакты превращают исследование в входной контекст следующего агента. он начинает с выбора решения и эксперимента, не с повторного обзора рынка.

нулевой prompt для своего агента
используй приложенный token-economy-meta-ru-SKILL.md. цель — снизить полный расход токенов на accepted task. сначала зафиксируй gate и baseline на 5 реальных задачах. найди крупнейший token tax, выбери один open-source lever из market map и спроектируй paired experiment. учитывай failed runs, router, compressor и retries.
08 · boundaries

где оптимизация ломается

экономия становится системой только при явных границах. иначе метрика быстро учится выглядеть лучше за счёт качества, безопасности или скрытых вызовов.

semantic cacheработает для детерминированных read paths; mutable actions и verification требуют свежего исполнения.
routingсчитается вместе с router calls, ошибочными lanes и escalation.
compressionсчитается вместе с compressor cost, потерей точности и дополнительными ретраями.
provider dashboardдополняет raw usage ledger; полная цена включает вызовы вокруг основной модели.
09 · evidence

первоисточники

карта собрана из репозиториев, спецификаций и официальной документации. snapshot датирован, потому что рынок движется быстрее любой презентации.