18 KiB
Эксперимент 08. COGS v2 на ратифицированном Ф1-стеке (draft=DeepSeek, editor=grok, apex=Gemini)
⚠ Точка-во-времени 05.07 (ревизия D31 / D30, 12.07). Модель стоит на ДВУХ снятых посылках:
h_e=0.5(МОНО-редактор без исходника) иeditor=grok reasoning-off— обе флипнуты D30.1 (редактор БИЛИНГВ, вход +60% токенов; кандидат glm-5-билингв). COGS-рамка → D30.4: флип D1 = +15–25%, ~$0.83–0.86/ранобэ; «$1.5–2» = опция Б (селективный апекс+память), НЕ подписана. Пере-съём заказан как exp08 v3 (D21.8: строки annotator+voice/pair; D25.8: API-only vs all-in COGS раздельно + human-minutes). Сам док ЧЕСТНО предсказал обе проблемы (см. §Ограничения — quality-transfer риск grok-моно). Токен-множители/пропорции стадий — живая фактура; конкретные $-числа читать через D30.4.
Дата: 2026-07-05 · Зона: полигон · Гейтит: дефолты budget_usd и приёмочные $-пороги Ф1 (D-эконом, D11/Q4).
Заменяет: цифры эксп.01 (были на Sonnet-редакторе) и оба устаревших порога — стандарт $0.6, премиум $5/$30.
TL;DR
- Редактор теперь ~88–90% стоимости стандарт-микса (робастно 87–90% по h_e и с учётом deepseek-reasoning). grok-выход $2.50/M ≈ 9× дешёвого draft-выхода ($0.28/M) при одинаковом объёме → один смешанный множитель M_out (эксп.01) больше неприменим, каждую стадию считаем по цене её модели.
- Стандарт-микс (draft+editor): ja→ru ранобэ том $0.69, zh→ru вебновелла-500 $10.94, en→ru роман $0.93. Порог приёмки $0.6 — мёртв (был на дешёвом редакторе). Совпадает с прикидкой decisions-log ($0.73).
- Редактор —
grok-4.3+ явныйreasoning_effort:"none"(reasoning=0; дефолт grok =low, must-be-explicit). Экономика ниже — для reasoning-off. Механизм/квирк —00-provider-quirks.md §grok. - Премиум full-apex (Gemini-3.1-Pro, форс-thinking → reasoning-as-output): ранобэ $5.0, вебновелла-500 ~$81.5 (центр rf=1.0; диапазон $66–112), роман $6.8. Полный apex вебновеллы приближается к человеческому якорю $100 (достигает/превышает лишь при rf≳1.4 или >200k-тарифе) → как дефолт не годится.
- Селективный премиум (apex только на ~15% трудных/флагнутых чанков): ранобэ $1.5, вебновелла $24.6, роман $2.1 — экономически жив.
budget_usd: $5 ≈ полный apex ранобэ; $30 вебновеллы держит только селективный премиум (apex на ~23% чанков), не full-apex ($82). Полный apex больших работ — не дефолт; премиум крупных работ ОБЯЗАН быть селективным (эскалация флагнутых, согласовано с D11: escalation уважает budget_usd, inline-последователен).- Батч −50% только у Gemini (судья/QA), не у draft/editor (deepseek/grok батч не публикуют). Reasoning-as-output: deepseek-draft reasoning ≈26% выхода черновика (эксп.07 данные: 20462/77637), но <2% стандарта (черновик — ~10% стоимости) → в модели опущен (не «мал сам по себе»); grok-4.3 при reasoning ON (дефолт
low) +25%, приreasoning_effort:"none"= 0 (дефолт редактора); Gemini форс (rf, не измерен — см. ниже).
Прайсы — официальные доки, датированы, кросс-верифицированы (2026-07-05, НЕ по памяти)
Собраны воркфлоу-фетчем (по агенту на провайдера) + независимая верификация 3 ядровых по второму источнику. Все — стандартные (не промо) USD/1M токенов.
| Модель | вход | вход cache-hit | выход | батч | reasoning | источник |
|---|---|---|---|---|---|---|
| deepseek-v4-flash (draft) | $0.14 | $0.0028 | $0.28 | нет | биллится как output (мал) | api-docs.deepseek.com/quick_start/pricing |
| deepseek-v4-pro | $0.435 | $0.003625 | $0.87 | нет | как output | там же |
| grok-4.3 (editor/канал B/судья 18+) | $1.25 | $0.20 | $2.50 | нет | дефолт low, off=reasoning_effort:"none" (→0), аддитивный→output |
docs.x.ai/developers/models/grok-4.3 |
| Gemini 3.1 Pro (apex/судья) | $2.00 (≤200k) / $4.00 (>200k) | $0.20 / $0.40 | $12.00 / $18.00 (вкл. thinking) | −50% | форс-thinking → output | ai.google.dev/gemini-api/docs/pricing (upd 2026-06-30) |
| glm-4.5-air / 4.6 / 5 / 5.1 | 0.2 / 0.6 / 1.0 / 1.4 | 0.03 / 0.11 / 0.2 / 0.26 | 1.1 / 2.2 / 3.2 / 4.4 | нет | — | docs.z.ai |
| kimi-k2.6 | $0.95 | $0.16 | $4.00 | −40% | многословный (~11k/абз) | platform.moonshot.ai |
| gpt-5-mini / nano | 0.25 / 0.05 | 0.025 / 0.005 | 2.0 / 0.4 | −50% | как output | openai.com/api/pricing |
Оговорки прайсов: даты — дата наблюдения (офиц. страницы deepseek/xai без видимого стампа; Gemini «upd 2026-06-30»). Gemini cache-storage $4.50/M·час — отдельно (не в этих цифрах). $150 xAI data-sharing — кредит, не скидка тарифа. Reseller-цены (OpenRouter $0.09/$0.18 на deepseek) — не офиц. лист-прайс, не используем.
Токен-модель (покомпонентно, цена — по модели стадии)
На книгу из B исходных токенов, коэффициент r = выход/вход (из эксп.01, параллельные пары):
| Стадия | вход | выход |
|---|---|---|
| Draft (билингв. переводчик, deepseek) | (1+h_d)·B, h_d=1.0 | r·B (deepseek-reasoning ≈26% выхода → +1.6% стандарта, опущен) |
| Editor (моноязычный D1, grok-non-reason) | (r+h_e)·B, h_e=0.5 | r·B (reasoning=0) |
| Apex (Gemini билингв. финал, форс-think) | (1.5+r)·B | r·B·(1+rf) |
| Judge (Gemini, 20% выборки, батч) | 0.2·(1+r)·B | 0.1·r·B·(1+rf) |
h_d=1.0 (исходник + систем-промпт + селективный глоссарий + STM ≈ B); h_e=0.5 (моноредактор видит черновик r·B + малый промпт, БЕЗ исходника/большого STM — воспроизводит decisions-log $0.67–0.73); rf — Gemini thinking-as-output (центр 1.0; чувствительность 0.5–2.0). Книги: ja→ru ранобэ B=113k/r=1.29; zh→ru вебновелла-500 B=1.29M/r=1.88; en→ru роман B=131k/r=1.53.
Результаты
Стандарт-микс (draft + editor) — приёмка Ф1
| Книга | было (эксп.01) | стало (v2, editor reasoning=none) | editor доля | если reasoning ON (дефолт low) | 50% cache draft |
|---|---|---|---|---|---|
| ja→ru ранобэ том | $0.17 | $0.69 | 89% | $0.78 (+13%) | $0.67 |
| zh→ru вебновелла-500 | $2.57 | $10.94 | 90% | $12.46 (+14%) | $10.76 |
| en→ru роман | $0.22 | $0.93 | 90% | $1.05 (+14%) | $0.91 |
Скачок от эксп.01 — целиком редактор (grok-выход ×9 против прежнего GLM/DeepSeek). Экономика жива (том <$1 против якоря $100), но приёмочный порог $0.6 устарел на всех парах. Это zero-defect нижняя граница: без ретраев/эскалаций. Для эхо-тяжёлой классической zh (эксп.07: deepseek эхает 54%) single-hop эскалация черновика поднимает draft-стоимость (editor-доля → ~80%); современные вебновеллы вне претрейна — риск ниже.
Премиум-микс (+ Gemini-3.1-Pro apex + судья)
| Книга | apex (rf=1.0) | судья | PREMIUM full (rf=1.0) | диапазон rf=0.5–2.0 | селективный 15% |
|---|---|---|---|---|---|
| ja→ru ранобэ том | $4.13 | $0.23 | $5.05 | $4.1–$6.9 | $1.54 |
| zh→ru вебновелла-500 | $66.93 | $3.65 | $81.52 | $66–$112 | $24.63 |
| en→ru роман | $5.60 | $0.31 | $6.84 | $5.6–$9.4 | $2.07 |
Полный apex вебновеллы = центр ~$82 (rf=1.0; диапазон $66–112) — в основном НИЖЕ человеческого якоря $100 (дешевле человека — это ценность, не дисквалификатор). Он не годится как дефолт по другой причине: переполняет потолок $30 и его наценка над стандартом $11 слишком велика для прогона на КАЖДОЙ книге. Дефолт $30 держит только селективный премиум (apex на ~23% чанков; 25% = $31.3 уже чуть за бюджетом). Для ранобэ/романа полный apex ($5–7) остаётся жив.
grok reasoning — стоимостное следствие (механизм → 00-provider-quirks.md §grok)
Дефолт редактора — reasoning_effort:"none" → reasoning=0 (проба 05.07: none→0, дефолт low→444, low→384). Экономика ниже ($0.69/$10.94) считалась для reasoning-off, и он достижим → таблицы верны, пересчёта нет. Оставить reasoning ON (дефолт grok = low, аддитивен к output) → editor-выход +25%, стандарт +13–14% (столбец таблицы). Точный off-switch (плоский vs вложенный, баг первой пробы) — канон в 00-provider-quirks.md.
Ценность reasoning-редактуры grok НЕ измерена (эксп.04 сравнивал стиль) → пилот Ф2.5 (think-ON/OFF + моно-редактура).
Рекомендации (→ оркестратору/бэкенду)
- Приёмочный $-порог Ф1: снять жёсткий $0.6. Мягкий sanity — ~$0.7/ранобэ, ~$11/вебновелла-500 (non-reason editor); приёмка держится на точности телеметрии денег + escalation-respects-budget (D11), НЕ на конкретном числе.
budget_usdдефолты: премиум-потолок задавать под селективный apex, не под полный. Предложение: ранобэ/роман — $2 (полный apex жив); вебновелла — либо потолок-на-главу, либо явнаяapex_fraction(селективная эскалация трудных чанков). Полный apex вебновеллы ($82) как дефолт — НЕТ (переполняет $30-потолок; при этом дешевле человека-$100).- Editor =
grok-4.3+ явныйreasoning_effort:"none"(слаг не менять; «off by omission» неверна — конфиг-квирк в00-provider-quirks.md §grok). Если пилот докажет ценность reasoning-редактуры — включить и бюджетировать reasoning как output вEstimateUSD. - Батч −50% только к Gemini-судье/QA (deepseek/grok батч не имеют; inline-эскалация последовательна из-за STM — не батчуется). Gemini = и apex, и судья → эскалированный чанк платит Gemini дважды, оба с форс-reasoning.
- deepseek auto-cache экономит ~2% стандарта (стабильный префикс мал против r·B выхода) — не рычаг здесь; рычаг — выбор редактора.
Расхождения
- эксп.01 / research/09: оба порога ($0.6 стандарт, $5/$30 премиум) устарели после смены редактора на grok. Стандарт вырос ×3–4 (редактор ×9 по выходу); премиум вебновеллы вырос до якоря (Gemini $12–18/M выхода + форс-reasoning против прежнего Sonnet $15). Направление то же, что предупреждал эксп.01 («буфер премиума сжался»), но теперь количественно: полный премиум вебновеллы экономически не дефолтен.
- decisions-log D3 «grok-4.3 thinking-OFF» — ДОСТИЖИМО явным
reasoning_effort:"none"(дефолт grok =low, must-be-explicit); slug остаётся grok-4.3. Первоначальный вывод отчёта «недостижимо» был багом пробы (off-switch не отправлялся) — исправлено.
Ограничения
- B/r — эксп.01 (PD-классика, одна пара/направление); порядок величин надёжен, второй знак — нет. Довалидация r на реальных вебновеллах владельца (эксп.07 просьба) уточнит и это.
- Токенизаторы grok/Gemini закрыты → r-множитель на их сторонах — o200k/символьный прокси (эксп.01 §Ограничения): премиум-цифры могут ещё подрасти (кириллица у закрытых токенизаторов +15–20%).
- Премиум-композиция (полный apex + судья 20%) — модельный выбор; точную форму (что именно делает apex, доля судьи) финализирует оркестратор. Селективный apex — лишь параметризация frac.
h_d=1.0/h_e=0.5— оценка накладных; чувствительность ±0.5 меняет стандарт на ±5–10% (editor доминирует выходом, не входом). h_e=0.5 привязан к D1 (моноязычный редактор, БЕЗ исходника). Если редактор гонять БИЛИНГВАЛЬНО (исходник+черновик), вход = (r+1.5)·B → стандарт +15–20% (больше заявленной ±10% полосы). ⚠ Quality-transfer риск: эксп.04 ВЫБРАЛ grok, кормя его исходник+черновик (билингвально); его рейтинг качества установлен в ДРУГОМ режиме, чем оцениваемый здесь моноязычный — выбор grok на моноредактуре строго не перенесён.- rf (Gemini thinking-as-output) НЕ ИЗМЕРЕН и доминирует в каждом премиум-числе (при rf=1.0 половина apex-выхода — предполагаемые thinking-токены). Живая проба (2026-07-05): OpenAI-совместимый слой Gemini НЕ отдаёт thinking-токены (
completion_tokens_details.reasoning_tokens=0, completion≈видимый выход) → rf через этот слой неизмерим; нужен нативный Gemini API (usageMetadata.thoughtsTokenCount) на 5–10 реальных чанках ПЕРЕД привязкой бюджета к rf=1.0. Все премиум-цифры — rf-условны; go/no-go выживает всю полосу (даже rf=0 → $51 ≫ $30-потолок). - Gemini apex — тариф ≤200k (при чанкинге ~1.5k ток./вызов apex всегда <200k). Если apex гонять длинным контекстом (>200k), тариф прыгает на $4/$18 → полный премиум +~55% (вебновелла apex → ~$104). Селективный чанковый apex остаётся на ≤200k.
- deepseek cache-hit $0.0028 — с офиц. страницы (api-docs), но соотношение к cache-miss $0.14 (÷50) необычно низко (V3 исторически ÷10 ≈ $0.014); не нагружает вывод (cache — ~2% стандарта), но перепроверить на живой странице при использовании как рычага.
Воспроизведение
eval/.venv/bin/python eval/cost_model_v2.py # таблицы + eval/data/cost_model_v2.json
Прайсы: workflow fetch-provider-prices (per-provider фетч + верификация), 2026-07-05. grok-reasoning проба — inline (usage.reasoning_tokens на grok-4.3: reasoning_effort:"none"→0, дефолт→444, low→384; точная форма — 00-provider-quirks.md).