textmachine/docs/experiments/08-cost-model-v2.md

102 lines
17 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

# Эксперимент 08. COGS v2 на ратифицированном Ф1-стеке (draft=DeepSeek, editor=grok, apex=Gemini)
**Дата:** 2026-07-05 · **Зона:** полигон · **Гейтит:** дефолты `budget_usd` и приёмочные $-пороги Ф1 (D-эконом, D11/Q4).
**Заменяет:** цифры эксп.01 (были на Sonnet-редакторе) и оба устаревших порога — стандарт $0.6, премиум $5/$30.
## TL;DR
- **Редактор теперь ~8890% стоимости стандарт-микса** (робастно 8790% по h_e и с учётом deepseek-reasoning). grok-выход $2.50/M ≈ **9× дешёвого draft-выхода** ($0.28/M) при одинаковом объёме → один смешанный множитель M_out (эксп.01) больше неприменим, каждую стадию считаем по цене её модели.
- **Стандарт-микс (draft+editor):** ja→ru **ранобэ том $0.69**, zh→ru **вебновелла-500 $10.94**, en→ru **роман $0.93**. Порог приёмки **$0.6 — мёртв** (был на дешёвом редакторе). Совпадает с прикидкой decisions-log ($0.73).
- **⚠ grok-4.3 форсирует reasoning, который НЕ отключается** (`reasoning_effort:low/none` не помогают, живая проба) и **биллится как output** (+25% output на продакшн-размере). **Истинный «thinking-OFF редактор» — `grok-4.20-0309-non-reasoning`** (тот же прайс-кард, тот же видимый выход, reasoning=0). Если оставить grok-4.3 ради качества reasoning — стандарт-микс **+1314%**.
- **Премиум full-apex (Gemini-3.1-Pro, форс-thinking → reasoning-as-output):** ранобэ **$5.0**, вебновелла-500 **~$81.5** (центр rf=1.0; диапазон $66112), роман **$6.8**. **Полный apex вебновеллы приближается к человеческому якорю $100** (достигает/превышает лишь при rf≳1.4 или >200k-тарифе) → как дефолт не годится.
- **Селективный премиум** (apex только на ~15% трудных/флагнутых чанков): ранобэ $1.5, вебновелла **$24.6**, роман $2.1 — экономически жив.
- **`budget_usd`:** $5 ≈ полный apex ранобэ; $30 вебновеллы держит только **селективный** премиум (apex на **~23%** чанков), не full-apex ($82). **Полный apex больших работ — не дефолт; премиум крупных работ ОБЯЗАН быть селективным** (эскалация флагнутых, согласовано с D11: escalation уважает budget_usd, inline-последователен).
- **Батч 50% только у Gemini** (судья/QA), не у draft/editor (deepseek/grok батч не публикуют). **Reasoning-as-output:** deepseek-draft reasoning ≈**26%** выхода черновика (эксп.07 данные: 20462/77637), но **<2% стандарта** (черновик ~10% стоимости) в модели опущен (не «мал сам по себе»); grok-4.3 +25%; Gemini форс (rf, не измерен см. ниже).
## Прайсы — официальные доки, датированы, кросс-верифицированы (2026-07-05, НЕ по памяти)
Собраны воркфлоу-фетчем (по агенту на провайдера) + независимая верификация 3 ядровых по второму источнику. Все стандартные (не промо) USD/1M токенов.
| Модель | вход | вход cache-hit | выход | батч | reasoning | источник |
|---|---|---|---|---|---|---|
| **deepseek-v4-flash** (draft) | $0.14 | $0.0028 | $0.28 | нет | биллится как output (мал) | api-docs.deepseek.com/quick_start/pricing |
| deepseek-v4-pro | $0.435 | $0.003625 | $0.87 | нет | как output | там же |
| **grok-4.3** (editor/канал B/судья 18+) | $1.25 | $0.20 | $2.50 | нет | форс-ON, аддитивныйoutput | docs.x.ai/developers/models/grok-4.3 |
| **grok-4.20-0309-non-reasoning** (истинный editor) | $1.25 | $0.20 | $2.50 | нет | **reasoning=0** | docs.x.ai/…/grok-4.20-0309-non-reasoning |
| **Gemini 3.1 Pro** (apex/судья) | $2.00 (≤200k) / $4.00 (>200k) | $0.20 / $0.40 | **$12.00 / $18.00** (вкл. thinking) | **50%** | форс-thinking → output | ai.google.dev/gemini-api/docs/pricing (upd 2026-06-30) |
| glm-4.5-air / 4.6 / 5 / 5.1 | 0.2 / 0.6 / 1.0 / 1.4 | 0.03 / 0.11 / 0.2 / 0.26 | 1.1 / 2.2 / 3.2 / 4.4 | нет | — | docs.z.ai |
| kimi-k2.6 | $0.95 | $0.16 | $4.00 | 40% | многословный (~11k/абз) | platform.moonshot.ai |
| gpt-5-mini / nano | 0.25 / 0.05 | 0.025 / 0.005 | 2.0 / 0.4 | 50% | как output | openai.com/api/pricing |
**Оговорки прайсов:** даты — дата наблюдения (офиц. страницы deepseek/xai без видимого стампа; Gemini «upd 2026-06-30»). Gemini cache-storage $4.50/M·час — отдельно (не в этих цифрах). $150 xAI data-sharing — **кредит, не скидка тарифа**. Reseller-цены (OpenRouter $0.09/$0.18 на deepseek) — не офиц. лист-прайс, не используем.
## Токен-модель (покомпонентно, цена — по модели стадии)
На книгу из **B** исходных токенов, коэффициент **r = выход/вход** (из эксп.01, параллельные пары):
| Стадия | вход | выход |
|---|---|---|
| Draft (билингв. переводчик, deepseek) | (1+h_d)·B, h_d=1.0 | r·B (deepseek-reasoning ≈26% выхода → +1.6% стандарта, опущен) |
| Editor (**моноязычный** D1, grok-non-reason) | (r+h_e)·B, h_e=0.5 | r·B (reasoning=0) |
| Apex (Gemini билингв. финал, форс-think) | (1.5+r)·B | r·B·(1+rf) |
| Judge (Gemini, 20% выборки, батч) | 0.2·(1+r)·B | 0.1·r·B·(1+rf) |
`h_d=1.0` (исходник + систем-промпт + селективный глоссарий + STM ≈ B); `h_e=0.5` (моноредактор видит черновик r·B + малый промпт, БЕЗ исходника/большого STM — воспроизводит decisions-log $0.670.73); `rf` — Gemini thinking-as-output (центр 1.0; чувствительность 0.52.0). Книги: ja→ru ранобэ B=113k/r=1.29; zh→ru вебновелла-500 B=1.29M/r=1.88; en→ru роман B=131k/r=1.53.
## Результаты
### Стандарт-микс (draft + editor) — приёмка Ф1
| Книга | было (эксп.01) | **стало (v2, non-reason editor)** | editor доля | grok-4.3 reasoning | 50% cache draft |
|---|---|---|---|---|---|
| ja→ru ранобэ том | $0.17 | **$0.69** | 89% | $0.78 (+13%) | $0.67 |
| zh→ru вебновелла-500 | $2.57 | **$10.94** | 90% | $12.46 (+14%) | $10.76 |
| en→ru роман | $0.22 | **$0.93** | 90% | $1.05 (+14%) | $0.91 |
Скачок от эксп.01 — целиком редактор (grok-выход ×9 против прежнего GLM/DeepSeek). Экономика **жива** (том <$1 против якоря $100), но приёмочный порог $0.6 устарел на всех парах. **Это zero-defect нижняя граница:** без ретраев/эскалаций. Для эхо-тяжёлой классической zh (эксп.07: deepseek эхает 54%) single-hop эскалация черновика поднимает draft-стоимость (editor-доля → ~80%); современные вебновеллы вне претрейна — риск ниже.
### Премиум-микс (+ Gemini-3.1-Pro apex + судья)
| Книга | apex (rf=1.0) | судья | **PREMIUM full (rf=1.0)** | диапазон rf=0.52.0 | **селективный 15%** |
|---|---|---|---|---|---|
| ja→ru ранобэ том | $4.13 | $0.23 | **$5.05** | $4.1$6.9 | **$1.54** |
| zh→ru вебновелла-500 | $66.93 | $3.65 | **$81.52** | $66$112 | **$24.63** |
| en→ru роман | $5.60 | $0.31 | **$6.84** | $5.6$9.4 | **$2.07** |
**Полный apex вебновеллы = центр ~$82 (rf=1.0; диапазон $66112) — в основном НИЖЕ человеческого якоря $100** (дешевле человека — это ценность, не дисквалификатор). Он не годится как **дефолт** по другой причине: **переполняет потолок $30** и его наценка над стандартом $11 слишком велика для прогона на КАЖДОЙ книге. Дефолт $30 держит только селективный премиум (apex на **~23%** чанков; 25% = $31.3 уже чуть за бюджетом). Для ранобэ/романа полный apex ($57) остаётся жив.
## ⚠ Живая проба: grok-4.3 форсирует reasoning (→ бэкенду, важно для ledger и config)
`reasoning_effort:low` и `extra_body.reasoning.effort:none` **НЕ отключают** reasoning у grok-4.3 — на тривиальной правке 873 reasoning-токена, на продакшн-правке (~2428 ток.) **495 reasoning на 1972 видимых = +25% output**. reasoning у xAI **аддитивен к completion** (в usage отдельным полем; видимый completion + reasoning = биллинг). `grok-4.20-0309-non-reasoning` даёт **тот же видимый выход с reasoning=0** по тому же прайс-карду.
**Следствие:** заявленный «дефолт-редактор grok-4.3 @ thinking-OFF» (D3) на практике = **`grok-4.20-0309-non-reasoning`** (иначе ledger недосчитает 25% output — тот же класс ошибки, что сжёг vojo 3044%). Если reasoning grok-4.3 реально улучшает ru-редактуру (НЕ измерено — эксп.04 сравнивал стиль, не reasoning-вклад) — это осознанный размен +14% COGS, но тогда `EstimateUSD` ОБЯЗАН резервировать reasoning-буфер редактора. Уточнить в пилоте Ф2.5 (think-ON/OFF рука уже там).
## Рекомендации (→ оркестратору/бэкенду)
1. **Приёмочный $-порог Ф1:** снять жёсткий $0.6. Мягкий sanity — **~$0.7/ранобэ, ~$11/вебновелла-500** (non-reason editor); приёмка держится на точности телеметрии денег + escalation-respects-budget (D11), НЕ на конкретном числе.
2. **`budget_usd` дефолты:** премиум-потолок задавать **под селективный apex**, не под полный. Предложение: ранобэ/роман — **$2** (полный apex жив); вебновелла — либо **потолок-на-главу**, либо явная `apex_fraction` (селективная эскалация трудных чанков). Полный apex вебновеллы ($82) как дефолт — НЕТ (переполняет $30-потолок; при этом дешевле человека-$100).
3. **Editor slug = `grok-4.20-0309-non-reasoning`** (reasoning=0), не `grok-4.3`, если только пилот не докажет ценность reasoning-редактуры. `models.yaml`: `reasoning_control` для grok-4.3 = `mandatory` (не `extra_body_disable` — не отключается), бюджетировать reasoning как output.
4. **Батч 50% только к Gemini-судье/QA** (deepseek/grok батч не имеют; inline-эскалация последовательна из-за STM — не батчуется). Gemini = и apex, и судья → эскалированный чанк платит Gemini дважды, оба с форс-reasoning.
5. **deepseek auto-cache** экономит ~2% стандарта (стабильный префикс мал против r·B выхода) — не рычаг здесь; рычаг — выбор редактора.
## Расхождения
- **эксп.01 / research/09:** оба порога ($0.6 стандарт, $5/$30 премиум) устарели после смены редактора на grok. Стандарт вырос ×34 (редактор ×9 по выходу); премиум вебновеллы вырос до якоря (Gemini $1218/M выхода + форс-reasoning против прежнего Sonnet $15). Направление то же, что предупреждал эксп.01 («буфер премиума сжался»), но теперь количественно: **полный премиум вебновеллы экономически не дефолтен**.
- **decisions-log D3 «grok-4.3 thinking-OFF»** — фактически недостижимо на slug grok-4.3; истинный не-reasoning editor — grok-4.20-non-reasoning (выше).
## Ограничения
- B/r — эксп.01 (PD-классика, одна пара/направление); порядок величин надёжен, второй знак — нет. Довалидация r на реальных вебновеллах владельца (эксп.07 просьба) уточнит и это.
- Токенизаторы grok/Gemini закрыты → r-множитель на их сторонах — o200k/символьный прокси (эксп.01 §Ограничения): премиум-цифры могут ещё подрасти (кириллица у закрытых токенизаторов +1520%).
- Премиум-композиция (полный apex + судья 20%) — модельный выбор; точную форму (что именно делает apex, доля судьи) финализирует оркестратор. Селективный apex — лишь параметризация frac.
- `h_d=1.0`/`h_e=0.5` — оценка накладных; чувствительность ±0.5 меняет стандарт на ±510% (editor доминирует выходом, не входом). **h_e=0.5 привязан к D1 (моноязычный редактор, БЕЗ исходника).** Если редактор гонять **БИЛИНГВАЛЬНО** (исходник+черновик), вход = (r+1.5)·B → стандарт **+1520%** (больше заявленной ±10% полосы). ⚠ **Quality-transfer риск:** эксп.04 ВЫБРАЛ grok, кормя его исходник+черновик (билингвально); его рейтинг качества установлен в ДРУГОМ режиме, чем оцениваемый здесь моноязычный — выбор grok на моноредактуре строго не перенесён.
- **rf (Gemini thinking-as-output) НЕ ИЗМЕРЕН** и доминирует в каждом премиум-числе (при rf=1.0 половина apex-выхода — предполагаемые thinking-токены). **Живая проба (2026-07-05): OpenAI-совместимый слой Gemini НЕ отдаёт thinking-токены** (`completion_tokens_details.reasoning_tokens=0`, completion≈видимый выход) → rf через этот слой неизмерим; нужен **нативный Gemini API** (`usageMetadata.thoughtsTokenCount`) на 510 реальных чанках ПЕРЕД привязкой бюджета к rf=1.0. Все премиум-цифры — **rf-условны**; go/no-go выживает всю полосу (даже rf=0 → $51 ≫ $30-потолок).
- **Gemini apex — тариф ≤200k** (при чанкинге ~1.5k ток./вызов apex всегда <200k). Если apex гонять длинным контекстом (>200k), тариф прыгает на $4/$18 → полный премиум **+~55%** (вебновелла apex → ~$104). Селективный чанковый apex остаётся на ≤200k.
- **deepseek cache-hit $0.0028** — с офиц. страницы (api-docs), но соотношение к cache-miss $0.14 (÷50) необычно низко (V3 исторически ÷10 ≈ $0.014); **не нагружает вывод** (cache — ~2% стандарта), но перепроверить на живой странице при использовании как рычага.
## Воспроизведение
```bash
eval/.venv/bin/python eval/cost_model_v2.py # таблицы + eval/data/cost_model_v2.json
```
Прайсы: workflow `fetch-provider-prices` (per-provider фетч + верификация), 2026-07-05. grok-reasoning проба — inline в этом отчёте (usage.reasoning_tokens на grok-4.3 vs grok-4.20-non-reasoning).