103 lines
18 KiB
Markdown
103 lines
18 KiB
Markdown
# Эксперимент 08. COGS v2 на ратифицированном Ф1-стеке (draft=DeepSeek, editor=grok, apex=Gemini)
|
||
|
||
> **⚠ Точка-во-времени 05.07 (ревизия D31 / D30, 12.07).** Модель стоит на ДВУХ снятых посылках: `h_e=0.5` (МОНО-редактор без исходника) и `editor=grok reasoning-off` — обе флипнуты D30.1 (редактор БИЛИНГВ, вход +60% токенов; кандидат glm-5-билингв). **COGS-рамка → D30.4: флип D1 = +15–25%, ~$0.83–0.86/ранобэ; «$1.5–2» = опция Б (селективный апекс+память), НЕ подписана.** Пере-съём заказан как **exp08 v3** (D21.8: строки annotator+voice/pair; D25.8: API-only vs all-in COGS раздельно + human-minutes). Сам док ЧЕСТНО предсказал обе проблемы (см. §Ограничения — quality-transfer риск grok-моно). Токен-множители/пропорции стадий — живая фактура; конкретные $-числа читать через D30.4.
|
||
|
||
**Дата:** 2026-07-05 · **Зона:** полигон · **Гейтит:** дефолты `budget_usd` и приёмочные $-пороги Ф1 (D-эконом, D11/Q4).
|
||
**Заменяет:** цифры эксп.01 (были на Sonnet-редакторе) и оба устаревших порога — стандарт $0.6, премиум $5/$30.
|
||
|
||
## TL;DR
|
||
|
||
- **Редактор теперь ~88–90% стоимости стандарт-микса** (робастно 87–90% по h_e и с учётом deepseek-reasoning). grok-выход $2.50/M ≈ **9× дешёвого draft-выхода** ($0.28/M) при одинаковом объёме → один смешанный множитель M_out (эксп.01) больше неприменим, каждую стадию считаем по цене её модели.
|
||
- **Стандарт-микс (draft+editor):** ja→ru **ранобэ том $0.69**, zh→ru **вебновелла-500 $10.94**, en→ru **роман $0.93**. Порог приёмки **$0.6 — мёртв** (был на дешёвом редакторе). Совпадает с прикидкой decisions-log ($0.73).
|
||
- **Редактор — `grok-4.3` + явный `reasoning_effort:"none"`** (reasoning=0; дефолт grok = `low`, must-be-explicit). Экономика ниже — для reasoning-off. Механизм/квирк — `00-provider-quirks.md §grok`.
|
||
- **Премиум full-apex (Gemini-3.1-Pro, форс-thinking → reasoning-as-output):** ранобэ **$5.0**, вебновелла-500 **~$81.5** (центр rf=1.0; диапазон $66–112), роман **$6.8**. **Полный apex вебновеллы приближается к человеческому якорю $100** (достигает/превышает лишь при rf≳1.4 или >200k-тарифе) → как дефолт не годится.
|
||
- **Селективный премиум** (apex только на ~15% трудных/флагнутых чанков): ранобэ $1.5, вебновелла **$24.6**, роман $2.1 — экономически жив.
|
||
- **`budget_usd`:** $5 ≈ полный apex ранобэ; $30 вебновеллы держит только **селективный** премиум (apex на **~23%** чанков), не full-apex ($82). **Полный apex больших работ — не дефолт; премиум крупных работ ОБЯЗАН быть селективным** (эскалация флагнутых, согласовано с D11: escalation уважает budget_usd, inline-последователен).
|
||
- **Батч −50% только у Gemini** (судья/QA), не у draft/editor (deepseek/grok батч не публикуют). **Reasoning-as-output:** deepseek-draft reasoning ≈**26%** выхода черновика (эксп.07 данные: 20462/77637), но **<2% стандарта** (черновик — ~10% стоимости) → в модели опущен (не «мал сам по себе»); grok-4.3 при reasoning ON (дефолт `low`) +25%, при `reasoning_effort:"none"` = 0 (дефолт редактора); Gemini форс (rf, не измерен — см. ниже).
|
||
|
||
## Прайсы — официальные доки, датированы, кросс-верифицированы (2026-07-05, НЕ по памяти)
|
||
|
||
Собраны воркфлоу-фетчем (по агенту на провайдера) + независимая верификация 3 ядровых по второму источнику. Все — стандартные (не промо) USD/1M токенов.
|
||
|
||
| Модель | вход | вход cache-hit | выход | батч | reasoning | источник |
|
||
|---|---|---|---|---|---|---|
|
||
| **deepseek-v4-flash** (draft) | $0.14 | $0.0028 | $0.28 | нет | биллится как output (мал) | api-docs.deepseek.com/quick_start/pricing |
|
||
| deepseek-v4-pro | $0.435 | $0.003625 | $0.87 | нет | как output | там же |
|
||
| **grok-4.3** (editor/канал B/судья 18+) | $1.25 | $0.20 | $2.50 | нет | дефолт `low`, off=`reasoning_effort:"none"` (→0), аддитивный→output | docs.x.ai/developers/models/grok-4.3 |
|
||
| **Gemini 3.1 Pro** (apex/судья) | $2.00 (≤200k) / $4.00 (>200k) | $0.20 / $0.40 | **$12.00 / $18.00** (вкл. thinking) | **−50%** | форс-thinking → output | ai.google.dev/gemini-api/docs/pricing (upd 2026-06-30) |
|
||
| glm-4.5-air / 4.6 / 5 / 5.1 | 0.2 / 0.6 / 1.0 / 1.4 | 0.03 / 0.11 / 0.2 / 0.26 | 1.1 / 2.2 / 3.2 / 4.4 | нет | — | docs.z.ai |
|
||
| kimi-k2.6 | $0.95 | $0.16 | $4.00 | −40% | многословный (~11k/абз) | platform.moonshot.ai |
|
||
| gpt-5-mini / nano | 0.25 / 0.05 | 0.025 / 0.005 | 2.0 / 0.4 | −50% | как output | openai.com/api/pricing |
|
||
|
||
**Оговорки прайсов:** даты — дата наблюдения (офиц. страницы deepseek/xai без видимого стампа; Gemini «upd 2026-06-30»). Gemini cache-storage $4.50/M·час — отдельно (не в этих цифрах). $150 xAI data-sharing — **кредит, не скидка тарифа**. Reseller-цены (OpenRouter $0.09/$0.18 на deepseek) — не офиц. лист-прайс, не используем.
|
||
|
||
## Токен-модель (покомпонентно, цена — по модели стадии)
|
||
|
||
На книгу из **B** исходных токенов, коэффициент **r = выход/вход** (из эксп.01, параллельные пары):
|
||
|
||
| Стадия | вход | выход |
|
||
|---|---|---|
|
||
| Draft (билингв. переводчик, deepseek) | (1+h_d)·B, h_d=1.0 | r·B (deepseek-reasoning ≈26% выхода → +1.6% стандарта, опущен) |
|
||
| Editor (**моноязычный** D1, grok-non-reason) | (r+h_e)·B, h_e=0.5 | r·B (reasoning=0) |
|
||
| Apex (Gemini билингв. финал, форс-think) | (1.5+r)·B | r·B·(1+rf) |
|
||
| Judge (Gemini, 20% выборки, батч) | 0.2·(1+r)·B | 0.1·r·B·(1+rf) |
|
||
|
||
`h_d=1.0` (исходник + систем-промпт + селективный глоссарий + STM ≈ B); `h_e=0.5` (моноредактор видит черновик r·B + малый промпт, БЕЗ исходника/большого STM — воспроизводит decisions-log $0.67–0.73); `rf` — Gemini thinking-as-output (центр 1.0; чувствительность 0.5–2.0). Книги: ja→ru ранобэ B=113k/r=1.29; zh→ru вебновелла-500 B=1.29M/r=1.88; en→ru роман B=131k/r=1.53.
|
||
|
||
## Результаты
|
||
|
||
### Стандарт-микс (draft + editor) — приёмка Ф1
|
||
|
||
| Книга | было (эксп.01) | **стало (v2, editor reasoning=none)** | editor доля | если reasoning ON (дефолт low) | 50% cache draft |
|
||
|---|---|---|---|---|---|
|
||
| ja→ru ранобэ том | $0.17 | **$0.69** | 89% | $0.78 (+13%) | $0.67 |
|
||
| zh→ru вебновелла-500 | $2.57 | **$10.94** | 90% | $12.46 (+14%) | $10.76 |
|
||
| en→ru роман | $0.22 | **$0.93** | 90% | $1.05 (+14%) | $0.91 |
|
||
|
||
Скачок от эксп.01 — целиком редактор (grok-выход ×9 против прежнего GLM/DeepSeek). Экономика **жива** (том <$1 против якоря $100), но приёмочный порог $0.6 устарел на всех парах. **Это zero-defect нижняя граница:** без ретраев/эскалаций. Для эхо-тяжёлой классической zh (эксп.07: deepseek эхает 54%) single-hop эскалация черновика поднимает draft-стоимость (editor-доля → ~80%); современные вебновеллы вне претрейна — риск ниже.
|
||
|
||
### Премиум-микс (+ Gemini-3.1-Pro apex + судья)
|
||
|
||
| Книга | apex (rf=1.0) | судья | **PREMIUM full (rf=1.0)** | диапазон rf=0.5–2.0 | **селективный 15%** |
|
||
|---|---|---|---|---|---|
|
||
| ja→ru ранобэ том | $4.13 | $0.23 | **$5.05** | $4.1–$6.9 | **$1.54** |
|
||
| zh→ru вебновелла-500 | $66.93 | $3.65 | **$81.52** | $66–$112 | **$24.63** |
|
||
| en→ru роман | $5.60 | $0.31 | **$6.84** | $5.6–$9.4 | **$2.07** |
|
||
|
||
**Полный apex вебновеллы = центр ~$82 (rf=1.0; диапазон $66–112) — в основном НИЖЕ человеческого якоря $100** (дешевле человека — это ценность, не дисквалификатор). Он не годится как **дефолт** по другой причине: **переполняет потолок $30** и его наценка над стандартом $11 слишком велика для прогона на КАЖДОЙ книге. Дефолт $30 держит только селективный премиум (apex на **~23%** чанков; 25% = $31.3 уже чуть за бюджетом). Для ранобэ/романа полный apex ($5–7) остаётся жив.
|
||
|
||
## grok reasoning — стоимостное следствие (механизм → `00-provider-quirks.md §grok`)
|
||
|
||
Дефолт редактора — **`reasoning_effort:"none"` → reasoning=0** (проба 05.07: none→0, дефолт `low`→444, low→384). Экономика ниже ($0.69/$10.94) считалась для reasoning-off, и он достижим → **таблицы верны, пересчёта нет**. Оставить reasoning ON (дефолт grok = `low`, аддитивен к output) → editor-выход +25%, стандарт +13–14% (столбец таблицы). Точный off-switch (плоский vs вложенный, баг первой пробы) — канон в `00-provider-quirks.md`.
|
||
|
||
Ценность reasoning-редактуры grok НЕ измерена (эксп.04 сравнивал стиль) → пилот Ф2.5 (think-ON/OFF + моно-редактура).
|
||
|
||
## Рекомендации (→ оркестратору/бэкенду)
|
||
|
||
1. **Приёмочный $-порог Ф1:** снять жёсткий $0.6. Мягкий sanity — **~$0.7/ранобэ, ~$11/вебновелла-500** (non-reason editor); приёмка держится на точности телеметрии денег + escalation-respects-budget (D11), НЕ на конкретном числе.
|
||
2. **`budget_usd` дефолты:** премиум-потолок задавать **под селективный apex**, не под полный. Предложение: ранобэ/роман — **$2** (полный apex жив); вебновелла — либо **потолок-на-главу**, либо явная `apex_fraction` (селективная эскалация трудных чанков). Полный apex вебновеллы ($82) как дефолт — НЕТ (переполняет $30-потолок; при этом дешевле человека-$100).
|
||
3. **Editor = `grok-4.3` + явный `reasoning_effort:"none"`** (слаг не менять; «off by omission» неверна — конфиг-квирк в `00-provider-quirks.md §grok`). Если пилот докажет ценность reasoning-редактуры — включить и бюджетировать reasoning как output в `EstimateUSD`.
|
||
4. **Батч −50% только к Gemini-судье/QA** (deepseek/grok батч не имеют; inline-эскалация последовательна из-за STM — не батчуется). Gemini = и apex, и судья → эскалированный чанк платит Gemini дважды, оба с форс-reasoning.
|
||
5. **deepseek auto-cache** экономит ~2% стандарта (стабильный префикс мал против r·B выхода) — не рычаг здесь; рычаг — выбор редактора.
|
||
|
||
## Расхождения
|
||
|
||
- **эксп.01 / research/09:** оба порога ($0.6 стандарт, $5/$30 премиум) устарели после смены редактора на grok. Стандарт вырос ×3–4 (редактор ×9 по выходу); премиум вебновеллы вырос до якоря (Gemini $12–18/M выхода + форс-reasoning против прежнего Sonnet $15). Направление то же, что предупреждал эксп.01 («буфер премиума сжался»), но теперь количественно: **полный премиум вебновеллы экономически не дефолтен**.
|
||
- **decisions-log D3 «grok-4.3 thinking-OFF»** — ДОСТИЖИМО явным `reasoning_effort:"none"` (дефолт grok = `low`, must-be-explicit); slug остаётся grok-4.3. Первоначальный вывод отчёта «недостижимо» был багом пробы (off-switch не отправлялся) — исправлено.
|
||
|
||
## Ограничения
|
||
|
||
- B/r — эксп.01 (PD-классика, одна пара/направление); порядок величин надёжен, второй знак — нет. Довалидация r на реальных вебновеллах владельца (эксп.07 просьба) уточнит и это.
|
||
- Токенизаторы grok/Gemini закрыты → r-множитель на их сторонах — o200k/символьный прокси (эксп.01 §Ограничения): премиум-цифры могут ещё подрасти (кириллица у закрытых токенизаторов +15–20%).
|
||
- Премиум-композиция (полный apex + судья 20%) — модельный выбор; точную форму (что именно делает apex, доля судьи) финализирует оркестратор. Селективный apex — лишь параметризация frac.
|
||
- `h_d=1.0`/`h_e=0.5` — оценка накладных; чувствительность ±0.5 меняет стандарт на ±5–10% (editor доминирует выходом, не входом). **h_e=0.5 привязан к D1 (моноязычный редактор, БЕЗ исходника).** Если редактор гонять **БИЛИНГВАЛЬНО** (исходник+черновик), вход = (r+1.5)·B → стандарт **+15–20%** (больше заявленной ±10% полосы). ⚠ **Quality-transfer риск:** эксп.04 ВЫБРАЛ grok, кормя его исходник+черновик (билингвально); его рейтинг качества установлен в ДРУГОМ режиме, чем оцениваемый здесь моноязычный — выбор grok на моноредактуре строго не перенесён.
|
||
- **rf (Gemini thinking-as-output) НЕ ИЗМЕРЕН** и доминирует в каждом премиум-числе (при rf=1.0 половина apex-выхода — предполагаемые thinking-токены). **Живая проба (2026-07-05): OpenAI-совместимый слой Gemini НЕ отдаёт thinking-токены** (`completion_tokens_details.reasoning_tokens=0`, completion≈видимый выход) → rf через этот слой неизмерим; нужен **нативный Gemini API** (`usageMetadata.thoughtsTokenCount`) на 5–10 реальных чанках ПЕРЕД привязкой бюджета к rf=1.0. Все премиум-цифры — **rf-условны**; go/no-go выживает всю полосу (даже rf=0 → $51 ≫ $30-потолок).
|
||
- **Gemini apex — тариф ≤200k** (при чанкинге ~1.5k ток./вызов apex всегда <200k). Если apex гонять длинным контекстом (>200k), тариф прыгает на $4/$18 → полный премиум **+~55%** (вебновелла apex → ~$104). Селективный чанковый apex остаётся на ≤200k.
|
||
- **deepseek cache-hit $0.0028** — с офиц. страницы (api-docs), но соотношение к cache-miss $0.14 (÷50) необычно низко (V3 исторически ÷10 ≈ $0.014); **не нагружает вывод** (cache — ~2% стандарта), но перепроверить на живой странице при использовании как рычага.
|
||
|
||
## Воспроизведение
|
||
|
||
```bash
|
||
eval/.venv/bin/python eval/cost_model_v2.py # таблицы + eval/data/cost_model_v2.json
|
||
```
|
||
Прайсы: workflow `fetch-provider-prices` (per-provider фетч + верификация), 2026-07-05. grok-reasoning проба — inline (usage.reasoning_tokens на grok-4.3: `reasoning_effort:"none"`→0, дефолт→444, `low`→384; точная форма — `00-provider-quirks.md`).
|