textmachine/docs/experiments/08-cost-model-v2.md

17 KiB
Raw Blame History

Эксперимент 08. COGS v2 на ратифицированном Ф1-стеке (draft=DeepSeek, editor=grok, apex=Gemini)

Дата: 2026-07-05 · Зона: полигон · Гейтит: дефолты budget_usd и приёмочные $-пороги Ф1 (D-эконом, D11/Q4). Заменяет: цифры эксп.01 (были на Sonnet-редакторе) и оба устаревших порога — стандарт $0.6, премиум $5/$30.

TL;DR

  • Редактор теперь ~8890% стоимости стандарт-микса (робастно 8790% по h_e и с учётом deepseek-reasoning). grok-выход $2.50/M ≈ 9× дешёвого draft-выхода ($0.28/M) при одинаковом объёме → один смешанный множитель M_out (эксп.01) больше неприменим, каждую стадию считаем по цене её модели.
  • Стандарт-микс (draft+editor): ja→ru ранобэ том $0.69, zh→ru вебновелла-500 $10.94, en→ru роман $0.93. Порог приёмки $0.6 — мёртв (был на дешёвом редакторе). Совпадает с прикидкой decisions-log ($0.73).
  • ⚠ grok-4.3 форсирует reasoning, который НЕ отключается (reasoning_effort:low/none не помогают, живая проба) и биллится как output (+25% output на продакшн-размере). Истинный «thinking-OFF редактор» — grok-4.20-0309-non-reasoning (тот же прайс-кард, тот же видимый выход, reasoning=0). Если оставить grok-4.3 ради качества reasoning — стандарт-микс +1314%.
  • Премиум full-apex (Gemini-3.1-Pro, форс-thinking → reasoning-as-output): ранобэ $5.0, вебновелла-500 ~$81.5 (центр rf=1.0; диапазон $66112), роман $6.8. Полный apex вебновеллы приближается к человеческому якорю $100 (достигает/превышает лишь при rf≳1.4 или >200k-тарифе) → как дефолт не годится.
  • Селективный премиум (apex только на ~15% трудных/флагнутых чанков): ранобэ $1.5, вебновелла $24.6, роман $2.1 — экономически жив.
  • budget_usd: $5 ≈ полный apex ранобэ; $30 вебновеллы держит только селективный премиум (apex на ~23% чанков), не full-apex ($82). Полный apex больших работ — не дефолт; премиум крупных работ ОБЯЗАН быть селективным (эскалация флагнутых, согласовано с D11: escalation уважает budget_usd, inline-последователен).
  • Батч 50% только у Gemini (судья/QA), не у draft/editor (deepseek/grok батч не публикуют). Reasoning-as-output: deepseek-draft reasoning ≈26% выхода черновика (эксп.07 данные: 20462/77637), но <2% стандарта (черновик — ~10% стоимости) → в модели опущен (не «мал сам по себе»); grok-4.3 +25%; Gemini форс (rf, не измерен — см. ниже).

Прайсы — официальные доки, датированы, кросс-верифицированы (2026-07-05, НЕ по памяти)

Собраны воркфлоу-фетчем (по агенту на провайдера) + независимая верификация 3 ядровых по второму источнику. Все — стандартные (не промо) USD/1M токенов.

Модель вход вход cache-hit выход батч reasoning источник
deepseek-v4-flash (draft) $0.14 $0.0028 $0.28 нет биллится как output (мал) api-docs.deepseek.com/quick_start/pricing
deepseek-v4-pro $0.435 $0.003625 $0.87 нет как output там же
grok-4.3 (editor/канал B/судья 18+) $1.25 $0.20 $2.50 нет форс-ON, аддитивный→output docs.x.ai/developers/models/grok-4.3
grok-4.20-0309-non-reasoning (истинный editor) $1.25 $0.20 $2.50 нет reasoning=0 docs.x.ai/…/grok-4.20-0309-non-reasoning
Gemini 3.1 Pro (apex/судья) $2.00 (≤200k) / $4.00 (>200k) $0.20 / $0.40 $12.00 / $18.00 (вкл. thinking) 50% форс-thinking → output ai.google.dev/gemini-api/docs/pricing (upd 2026-06-30)
glm-4.5-air / 4.6 / 5 / 5.1 0.2 / 0.6 / 1.0 / 1.4 0.03 / 0.11 / 0.2 / 0.26 1.1 / 2.2 / 3.2 / 4.4 нет docs.z.ai
kimi-k2.6 $0.95 $0.16 $4.00 40% многословный (~11k/абз) platform.moonshot.ai
gpt-5-mini / nano 0.25 / 0.05 0.025 / 0.005 2.0 / 0.4 50% как output openai.com/api/pricing

Оговорки прайсов: даты — дата наблюдения (офиц. страницы deepseek/xai без видимого стампа; Gemini «upd 2026-06-30»). Gemini cache-storage $4.50/M·час — отдельно (не в этих цифрах). $150 xAI data-sharing — кредит, не скидка тарифа. Reseller-цены (OpenRouter $0.09/$0.18 на deepseek) — не офиц. лист-прайс, не используем.

Токен-модель (покомпонентно, цена — по модели стадии)

На книгу из B исходных токенов, коэффициент r = выход/вход (из эксп.01, параллельные пары):

Стадия вход выход
Draft (билингв. переводчик, deepseek) (1+h_d)·B, h_d=1.0 r·B (deepseek-reasoning ≈26% выхода → +1.6% стандарта, опущен)
Editor (моноязычный D1, grok-non-reason) (r+h_e)·B, h_e=0.5 r·B (reasoning=0)
Apex (Gemini билингв. финал, форс-think) (1.5+r)·B r·B·(1+rf)
Judge (Gemini, 20% выборки, батч) 0.2·(1+r)·B 0.1·r·B·(1+rf)

h_d=1.0 (исходник + систем-промпт + селективный глоссарий + STM ≈ B); h_e=0.5 (моноредактор видит черновик r·B + малый промпт, БЕЗ исходника/большого STM — воспроизводит decisions-log $0.670.73); rf — Gemini thinking-as-output (центр 1.0; чувствительность 0.52.0). Книги: ja→ru ранобэ B=113k/r=1.29; zh→ru вебновелла-500 B=1.29M/r=1.88; en→ru роман B=131k/r=1.53.

Результаты

Стандарт-микс (draft + editor) — приёмка Ф1

Книга было (эксп.01) стало (v2, non-reason editor) editor доля grok-4.3 reasoning 50% cache draft
ja→ru ранобэ том $0.17 $0.69 89% $0.78 (+13%) $0.67
zh→ru вебновелла-500 $2.57 $10.94 90% $12.46 (+14%) $10.76
en→ru роман $0.22 $0.93 90% $1.05 (+14%) $0.91

Скачок от эксп.01 — целиком редактор (grok-выход ×9 против прежнего GLM/DeepSeek). Экономика жива (том <$1 против якоря $100), но приёмочный порог $0.6 устарел на всех парах. Это zero-defect нижняя граница: без ретраев/эскалаций. Для эхо-тяжёлой классической zh (эксп.07: deepseek эхает 54%) single-hop эскалация черновика поднимает draft-стоимость (editor-доля → ~80%); современные вебновеллы вне претрейна — риск ниже.

Премиум-микс (+ Gemini-3.1-Pro apex + судья)

Книга apex (rf=1.0) судья PREMIUM full (rf=1.0) диапазон rf=0.52.0 селективный 15%
ja→ru ранобэ том $4.13 $0.23 $5.05 $4.1$6.9 $1.54
zh→ru вебновелла-500 $66.93 $3.65 $81.52 $66$112 $24.63
en→ru роман $5.60 $0.31 $6.84 $5.6$9.4 $2.07

Полный apex вебновеллы = центр ~$82 (rf=1.0; диапазон $66112) — в основном НИЖЕ человеческого якоря $100 (дешевле человека — это ценность, не дисквалификатор). Он не годится как дефолт по другой причине: переполняет потолок $30 и его наценка над стандартом $11 слишком велика для прогона на КАЖДОЙ книге. Дефолт $30 держит только селективный премиум (apex на ~23% чанков; 25% = $31.3 уже чуть за бюджетом). Для ранобэ/романа полный apex ($57) остаётся жив.

⚠ Живая проба: grok-4.3 форсирует reasoning (→ бэкенду, важно для ledger и config)

reasoning_effort:low и extra_body.reasoning.effort:none НЕ отключают reasoning у grok-4.3 — на тривиальной правке 873 reasoning-токена, на продакшн-правке (~2428 ток.) 495 reasoning на 1972 видимых = +25% output. reasoning у xAI аддитивен к completion (в usage отдельным полем; видимый completion + reasoning = биллинг). grok-4.20-0309-non-reasoning даёт тот же видимый выход с reasoning=0 по тому же прайс-карду.

Следствие: заявленный «дефолт-редактор grok-4.3 @ thinking-OFF» (D3) на практике = grok-4.20-0309-non-reasoning (иначе ledger недосчитает 25% output — тот же класс ошибки, что сжёг vojo 3044%). Если reasoning grok-4.3 реально улучшает ru-редактуру (НЕ измерено — эксп.04 сравнивал стиль, не reasoning-вклад) — это осознанный размен +14% COGS, но тогда EstimateUSD ОБЯЗАН резервировать reasoning-буфер редактора. Уточнить в пилоте Ф2.5 (think-ON/OFF рука уже там).

Рекомендации (→ оркестратору/бэкенду)

  1. Приёмочный $-порог Ф1: снять жёсткий $0.6. Мягкий sanity — ~$0.7/ранобэ, ~$11/вебновелла-500 (non-reason editor); приёмка держится на точности телеметрии денег + escalation-respects-budget (D11), НЕ на конкретном числе.
  2. budget_usd дефолты: премиум-потолок задавать под селективный apex, не под полный. Предложение: ранобэ/роман — $2 (полный apex жив); вебновелла — либо потолок-на-главу, либо явная apex_fraction (селективная эскалация трудных чанков). Полный apex вебновеллы ($82) как дефолт — НЕТ (переполняет $30-потолок; при этом дешевле человека-$100).
  3. Editor slug = grok-4.20-0309-non-reasoning (reasoning=0), не grok-4.3, если только пилот не докажет ценность reasoning-редактуры. models.yaml: reasoning_control для grok-4.3 = mandatory (не extra_body_disable — не отключается), бюджетировать reasoning как output.
  4. Батч 50% только к Gemini-судье/QA (deepseek/grok батч не имеют; inline-эскалация последовательна из-за STM — не батчуется). Gemini = и apex, и судья → эскалированный чанк платит Gemini дважды, оба с форс-reasoning.
  5. deepseek auto-cache экономит ~2% стандарта (стабильный префикс мал против r·B выхода) — не рычаг здесь; рычаг — выбор редактора.

Расхождения

  • эксп.01 / research/09: оба порога ($0.6 стандарт, $5/$30 премиум) устарели после смены редактора на grok. Стандарт вырос ×34 (редактор ×9 по выходу); премиум вебновеллы вырос до якоря (Gemini $1218/M выхода + форс-reasoning против прежнего Sonnet $15). Направление то же, что предупреждал эксп.01 («буфер премиума сжался»), но теперь количественно: полный премиум вебновеллы экономически не дефолтен.
  • decisions-log D3 «grok-4.3 thinking-OFF» — фактически недостижимо на slug grok-4.3; истинный не-reasoning editor — grok-4.20-non-reasoning (выше).

Ограничения

  • B/r — эксп.01 (PD-классика, одна пара/направление); порядок величин надёжен, второй знак — нет. Довалидация r на реальных вебновеллах владельца (эксп.07 просьба) уточнит и это.
  • Токенизаторы grok/Gemini закрыты → r-множитель на их сторонах — o200k/символьный прокси (эксп.01 §Ограничения): премиум-цифры могут ещё подрасти (кириллица у закрытых токенизаторов +1520%).
  • Премиум-композиция (полный apex + судья 20%) — модельный выбор; точную форму (что именно делает apex, доля судьи) финализирует оркестратор. Селективный apex — лишь параметризация frac.
  • h_d=1.0/h_e=0.5 — оценка накладных; чувствительность ±0.5 меняет стандарт на ±510% (editor доминирует выходом, не входом). h_e=0.5 привязан к D1 (моноязычный редактор, БЕЗ исходника). Если редактор гонять БИЛИНГВАЛЬНО (исходник+черновик), вход = (r+1.5)·B → стандарт +1520% (больше заявленной ±10% полосы). ⚠ Quality-transfer риск: эксп.04 ВЫБРАЛ grok, кормя его исходник+черновик (билингвально); его рейтинг качества установлен в ДРУГОМ режиме, чем оцениваемый здесь моноязычный — выбор grok на моноредактуре строго не перенесён.
  • rf (Gemini thinking-as-output) НЕ ИЗМЕРЕН и доминирует в каждом премиум-числе (при rf=1.0 половина apex-выхода — предполагаемые thinking-токены). Живая проба (2026-07-05): OpenAI-совместимый слой Gemini НЕ отдаёт thinking-токены (completion_tokens_details.reasoning_tokens=0, completion≈видимый выход) → rf через этот слой неизмерим; нужен нативный Gemini API (usageMetadata.thoughtsTokenCount) на 510 реальных чанках ПЕРЕД привязкой бюджета к rf=1.0. Все премиум-цифры — rf-условны; go/no-go выживает всю полосу (даже rf=0 → $51 ≫ $30-потолок).
  • Gemini apex — тариф ≤200k (при чанкинге ~1.5k ток./вызов apex всегда <200k). Если apex гонять длинным контекстом (>200k), тариф прыгает на $4/$18 → полный премиум +~55% (вебновелла apex → ~$104). Селективный чанковый apex остаётся на ≤200k.
  • deepseek cache-hit $0.0028с офиц. страницы (api-docs), но соотношение к cache-miss $0.14 (÷50) необычно низко (V3 исторически ÷10 ≈ $0.014); не нагружает вывод (cache — ~2% стандарта), но перепроверить на живой странице при использовании как рычага.

Воспроизведение

eval/.venv/bin/python eval/cost_model_v2.py     # таблицы + eval/data/cost_model_v2.json

Прайсы: workflow fetch-provider-prices (per-provider фетч + верификация), 2026-07-05. grok-reasoning проба — inline в этом отчёте (usage.reasoning_tokens на grok-4.3 vs grok-4.20-non-reasoning).