textmachine/docs/experiments/08-cost-model-v2.md

103 lines
18 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

# Эксперимент 08. COGS v2 на ратифицированном Ф1-стеке (draft=DeepSeek, editor=grok, apex=Gemini)
> **⚠ Точка-во-времени 05.07 (ревизия D31 / D30, 12.07).** Модель стоит на ДВУХ снятых посылках: `h_e=0.5` (МОНО-редактор без исходника) и `editor=grok reasoning-off` — обе флипнуты D30.1 (редактор БИЛИНГВ, вход +60% токенов; кандидат glm-5-билингв). **COGS-рамка → D30.4: флип D1 = +1525%, ~$0.830.86/ранобэ; «$1.52» = опция Б (селективный апекс+память), НЕ подписана.** Пере-съём заказан как **exp08 v3** (D21.8: строки annotator+voice/pair; D25.8: API-only vs all-in COGS раздельно + human-minutes). Сам док ЧЕСТНО предсказал обе проблемы (см. §Ограничения — quality-transfer риск grok-моно). Токен-множители/пропорции стадий — живая фактура; конкретные $-числа читать через D30.4.
**Дата:** 2026-07-05 · **Зона:** полигон · **Гейтит:** дефолты `budget_usd` и приёмочные $-пороги Ф1 (D-эконом, D11/Q4).
**Заменяет:** цифры эксп.01 (были на Sonnet-редакторе) и оба устаревших порога — стандарт $0.6, премиум $5/$30.
## TL;DR
- **Редактор теперь ~8890% стоимости стандарт-микса** (робастно 8790% по h_e и с учётом deepseek-reasoning). grok-выход $2.50/M ≈ **9× дешёвого draft-выхода** ($0.28/M) при одинаковом объёме → один смешанный множитель M_out (эксп.01) больше неприменим, каждую стадию считаем по цене её модели.
- **Стандарт-микс (draft+editor):** ja→ru **ранобэ том $0.69**, zh→ru **вебновелла-500 $10.94**, en→ru **роман $0.93**. Порог приёмки **$0.6 — мёртв** (был на дешёвом редакторе). Совпадает с прикидкой decisions-log ($0.73).
- **Редактор — `grok-4.3` + явный `reasoning_effort:"none"`** (reasoning=0; дефолт grok = `low`, must-be-explicit). Экономика ниже — для reasoning-off. Механизм/квирк — `00-provider-quirks.md §grok`.
- **Премиум full-apex (Gemini-3.1-Pro, форс-thinking → reasoning-as-output):** ранобэ **$5.0**, вебновелла-500 **~$81.5** (центр rf=1.0; диапазон $66112), роман **$6.8**. **Полный apex вебновеллы приближается к человеческому якорю $100** (достигает/превышает лишь при rf≳1.4 или >200k-тарифе) → как дефолт не годится.
- **Селективный премиум** (apex только на ~15% трудных/флагнутых чанков): ранобэ $1.5, вебновелла **$24.6**, роман $2.1 — экономически жив.
- **`budget_usd`:** $5 ≈ полный apex ранобэ; $30 вебновеллы держит только **селективный** премиум (apex на **~23%** чанков), не full-apex ($82). **Полный apex больших работ — не дефолт; премиум крупных работ ОБЯЗАН быть селективным** (эскалация флагнутых, согласовано с D11: escalation уважает budget_usd, inline-последователен).
- **Батч 50% только у Gemini** (судья/QA), не у draft/editor (deepseek/grok батч не публикуют). **Reasoning-as-output:** deepseek-draft reasoning ≈**26%** выхода черновика (эксп.07 данные: 20462/77637), но **<2% стандарта** (черновик ~10% стоимости) в модели опущен (не «мал сам по себе»); grok-4.3 при reasoning ON (дефолт `low`) +25%, при `reasoning_effort:"none"` = 0 (дефолт редактора); Gemini форс (rf, не измерен см. ниже).
## Прайсы — официальные доки, датированы, кросс-верифицированы (2026-07-05, НЕ по памяти)
Собраны воркфлоу-фетчем (по агенту на провайдера) + независимая верификация 3 ядровых по второму источнику. Все стандартные (не промо) USD/1M токенов.
| Модель | вход | вход cache-hit | выход | батч | reasoning | источник |
|---|---|---|---|---|---|---|
| **deepseek-v4-flash** (draft) | $0.14 | $0.0028 | $0.28 | нет | биллится как output (мал) | api-docs.deepseek.com/quick_start/pricing |
| deepseek-v4-pro | $0.435 | $0.003625 | $0.87 | нет | как output | там же |
| **grok-4.3** (editor/канал B/судья 18+) | $1.25 | $0.20 | $2.50 | нет | дефолт `low`, off=`reasoning_effort:"none"` (→0), аддитивныйoutput | docs.x.ai/developers/models/grok-4.3 |
| **Gemini 3.1 Pro** (apex/судья) | $2.00 (≤200k) / $4.00 (>200k) | $0.20 / $0.40 | **$12.00 / $18.00** (вкл. thinking) | **50%** | форс-thinking → output | ai.google.dev/gemini-api/docs/pricing (upd 2026-06-30) |
| glm-4.5-air / 4.6 / 5 / 5.1 | 0.2 / 0.6 / 1.0 / 1.4 | 0.03 / 0.11 / 0.2 / 0.26 | 1.1 / 2.2 / 3.2 / 4.4 | нет | — | docs.z.ai |
| kimi-k2.6 | $0.95 | $0.16 | $4.00 | 40% | многословный (~11k/абз) | platform.moonshot.ai |
| gpt-5-mini / nano | 0.25 / 0.05 | 0.025 / 0.005 | 2.0 / 0.4 | 50% | как output | openai.com/api/pricing |
**Оговорки прайсов:** даты — дата наблюдения (офиц. страницы deepseek/xai без видимого стампа; Gemini «upd 2026-06-30»). Gemini cache-storage $4.50/M·час — отдельно (не в этих цифрах). $150 xAI data-sharing — **кредит, не скидка тарифа**. Reseller-цены (OpenRouter $0.09/$0.18 на deepseek) — не офиц. лист-прайс, не используем.
## Токен-модель (покомпонентно, цена — по модели стадии)
На книгу из **B** исходных токенов, коэффициент **r = выход/вход** (из эксп.01, параллельные пары):
| Стадия | вход | выход |
|---|---|---|
| Draft (билингв. переводчик, deepseek) | (1+h_d)·B, h_d=1.0 | r·B (deepseek-reasoning ≈26% выхода → +1.6% стандарта, опущен) |
| Editor (**моноязычный** D1, grok-non-reason) | (r+h_e)·B, h_e=0.5 | r·B (reasoning=0) |
| Apex (Gemini билингв. финал, форс-think) | (1.5+r)·B | r·B·(1+rf) |
| Judge (Gemini, 20% выборки, батч) | 0.2·(1+r)·B | 0.1·r·B·(1+rf) |
`h_d=1.0` (исходник + систем-промпт + селективный глоссарий + STM ≈ B); `h_e=0.5` (моноредактор видит черновик r·B + малый промпт, БЕЗ исходника/большого STM — воспроизводит decisions-log $0.670.73); `rf` — Gemini thinking-as-output (центр 1.0; чувствительность 0.52.0). Книги: ja→ru ранобэ B=113k/r=1.29; zh→ru вебновелла-500 B=1.29M/r=1.88; en→ru роман B=131k/r=1.53.
## Результаты
### Стандарт-микс (draft + editor) — приёмка Ф1
| Книга | было (эксп.01) | **стало (v2, editor reasoning=none)** | editor доля | если reasoning ON (дефолт low) | 50% cache draft |
|---|---|---|---|---|---|
| ja→ru ранобэ том | $0.17 | **$0.69** | 89% | $0.78 (+13%) | $0.67 |
| zh→ru вебновелла-500 | $2.57 | **$10.94** | 90% | $12.46 (+14%) | $10.76 |
| en→ru роман | $0.22 | **$0.93** | 90% | $1.05 (+14%) | $0.91 |
Скачок от эксп.01 — целиком редактор (grok-выход ×9 против прежнего GLM/DeepSeek). Экономика **жива** (том <$1 против якоря $100), но приёмочный порог $0.6 устарел на всех парах. **Это zero-defect нижняя граница:** без ретраев/эскалаций. Для эхо-тяжёлой классической zh (эксп.07: deepseek эхает 54%) single-hop эскалация черновика поднимает draft-стоимость (editor-доля → ~80%); современные вебновеллы вне претрейна — риск ниже.
### Премиум-микс (+ Gemini-3.1-Pro apex + судья)
| Книга | apex (rf=1.0) | судья | **PREMIUM full (rf=1.0)** | диапазон rf=0.52.0 | **селективный 15%** |
|---|---|---|---|---|---|
| ja→ru ранобэ том | $4.13 | $0.23 | **$5.05** | $4.1$6.9 | **$1.54** |
| zh→ru вебновелла-500 | $66.93 | $3.65 | **$81.52** | $66$112 | **$24.63** |
| en→ru роман | $5.60 | $0.31 | **$6.84** | $5.6$9.4 | **$2.07** |
**Полный apex вебновеллы = центр ~$82 (rf=1.0; диапазон $66112) — в основном НИЖЕ человеческого якоря $100** (дешевле человека — это ценность, не дисквалификатор). Он не годится как **дефолт** по другой причине: **переполняет потолок $30** и его наценка над стандартом $11 слишком велика для прогона на КАЖДОЙ книге. Дефолт $30 держит только селективный премиум (apex на **~23%** чанков; 25% = $31.3 уже чуть за бюджетом). Для ранобэ/романа полный apex ($57) остаётся жив.
## grok reasoning — стоимостное следствие (механизм → `00-provider-quirks.md §grok`)
Дефолт редактора — **`reasoning_effort:"none"` → reasoning=0** (проба 05.07: none→0, дефолт `low`→444, low→384). Экономика ниже ($0.69/$10.94) считалась для reasoning-off, и он достижим → **таблицы верны, пересчёта нет**. Оставить reasoning ON (дефолт grok = `low`, аддитивен к output) → editor-выход +25%, стандарт +1314% (столбец таблицы). Точный off-switch (плоский vs вложенный, баг первой пробы) — канон в `00-provider-quirks.md`.
Ценность reasoning-редактуры grok НЕ измерена (эксп.04 сравнивал стиль) → пилот Ф2.5 (think-ON/OFF + моно-редактура).
## Рекомендации (→ оркестратору/бэкенду)
1. **Приёмочный $-порог Ф1:** снять жёсткий $0.6. Мягкий sanity — **~$0.7/ранобэ, ~$11/вебновелла-500** (non-reason editor); приёмка держится на точности телеметрии денег + escalation-respects-budget (D11), НЕ на конкретном числе.
2. **`budget_usd` дефолты:** премиум-потолок задавать **под селективный apex**, не под полный. Предложение: ранобэ/роман — **$2** (полный apex жив); вебновелла — либо **потолок-на-главу**, либо явная `apex_fraction` (селективная эскалация трудных чанков). Полный apex вебновеллы ($82) как дефолт — НЕТ (переполняет $30-потолок; при этом дешевле человека-$100).
3. **Editor = `grok-4.3` + явный `reasoning_effort:"none"`** (слаг не менять; «off by omission» неверна — конфиг-квирк в `00-provider-quirks.md §grok`). Если пилот докажет ценность reasoning-редактуры — включить и бюджетировать reasoning как output в `EstimateUSD`.
4. **Батч 50% только к Gemini-судье/QA** (deepseek/grok батч не имеют; inline-эскалация последовательна из-за STM — не батчуется). Gemini = и apex, и судья → эскалированный чанк платит Gemini дважды, оба с форс-reasoning.
5. **deepseek auto-cache** экономит ~2% стандарта (стабильный префикс мал против r·B выхода) — не рычаг здесь; рычаг — выбор редактора.
## Расхождения
- **эксп.01 / research/09:** оба порога ($0.6 стандарт, $5/$30 премиум) устарели после смены редактора на grok. Стандарт вырос ×34 (редактор ×9 по выходу); премиум вебновеллы вырос до якоря (Gemini $1218/M выхода + форс-reasoning против прежнего Sonnet $15). Направление то же, что предупреждал эксп.01 («буфер премиума сжался»), но теперь количественно: **полный премиум вебновеллы экономически не дефолтен**.
- **decisions-log D3 «grok-4.3 thinking-OFF»** — ДОСТИЖИМО явным `reasoning_effort:"none"` (дефолт grok = `low`, must-be-explicit); slug остаётся grok-4.3. Первоначальный вывод отчёта «недостижимо» был багом пробы (off-switch не отправлялся) — исправлено.
## Ограничения
- B/r — эксп.01 (PD-классика, одна пара/направление); порядок величин надёжен, второй знак — нет. Довалидация r на реальных вебновеллах владельца (эксп.07 просьба) уточнит и это.
- Токенизаторы grok/Gemini закрыты → r-множитель на их сторонах — o200k/символьный прокси (эксп.01 §Ограничения): премиум-цифры могут ещё подрасти (кириллица у закрытых токенизаторов +1520%).
- Премиум-композиция (полный apex + судья 20%) — модельный выбор; точную форму (что именно делает apex, доля судьи) финализирует оркестратор. Селективный apex — лишь параметризация frac.
- `h_d=1.0`/`h_e=0.5` — оценка накладных; чувствительность ±0.5 меняет стандарт на ±510% (editor доминирует выходом, не входом). **h_e=0.5 привязан к D1 (моноязычный редактор, БЕЗ исходника).** Если редактор гонять **БИЛИНГВАЛЬНО** (исходник+черновик), вход = (r+1.5)·B → стандарт **+1520%** (больше заявленной ±10% полосы). ⚠ **Quality-transfer риск:** эксп.04 ВЫБРАЛ grok, кормя его исходник+черновик (билингвально); его рейтинг качества установлен в ДРУГОМ режиме, чем оцениваемый здесь моноязычный — выбор grok на моноредактуре строго не перенесён.
- **rf (Gemini thinking-as-output) НЕ ИЗМЕРЕН** и доминирует в каждом премиум-числе (при rf=1.0 половина apex-выхода — предполагаемые thinking-токены). **Живая проба (2026-07-05): OpenAI-совместимый слой Gemini НЕ отдаёт thinking-токены** (`completion_tokens_details.reasoning_tokens=0`, completion≈видимый выход) → rf через этот слой неизмерим; нужен **нативный Gemini API** (`usageMetadata.thoughtsTokenCount`) на 510 реальных чанках ПЕРЕД привязкой бюджета к rf=1.0. Все премиум-цифры — **rf-условны**; go/no-go выживает всю полосу (даже rf=0 → $51 ≫ $30-потолок).
- **Gemini apex — тариф ≤200k** (при чанкинге ~1.5k ток./вызов apex всегда <200k). Если apex гонять длинным контекстом (>200k), тариф прыгает на $4/$18 → полный премиум **+~55%** (вебновелла apex → ~$104). Селективный чанковый apex остаётся на ≤200k.
- **deepseek cache-hit $0.0028** — с офиц. страницы (api-docs), но соотношение к cache-miss $0.14 (÷50) необычно низко (V3 исторически ÷10 ≈ $0.014); **не нагружает вывод** (cache — ~2% стандарта), но перепроверить на живой странице при использовании как рычага.
## Воспроизведение
```bash
eval/.venv/bin/python eval/cost_model_v2.py # таблицы + eval/data/cost_model_v2.json
```
Прайсы: workflow `fetch-provider-prices` (per-provider фетч + верификация), 2026-07-05. grok-reasoning проба — inline (usage.reasoning_tokens на grok-4.3: `reasoning_effort:"none"`→0, дефолт→444, `low`→384; точная форма — `00-provider-quirks.md`).