Trim grok-reasoning re-narration in exp08 and cost_model: single-source the mechanism in provider-quirks, keep only cost-relevant facts plus pointers
This commit is contained in:
parent
9792285e76
commit
1aed2c7627
2 changed files with 9 additions and 16 deletions
|
|
@ -7,7 +7,7 @@
|
|||
|
||||
- **Редактор теперь ~88–90% стоимости стандарт-микса** (робастно 87–90% по h_e и с учётом deepseek-reasoning). grok-выход $2.50/M ≈ **9× дешёвого draft-выхода** ($0.28/M) при одинаковом объёме → один смешанный множитель M_out (эксп.01) больше неприменим, каждую стадию считаем по цене её модели.
|
||||
- **Стандарт-микс (draft+editor):** ja→ru **ранобэ том $0.69**, zh→ru **вебновелла-500 $10.94**, en→ru **роман $0.93**. Порог приёмки **$0.6 — мёртв** (был на дешёвом редакторе). Совпадает с прикидкой decisions-log ($0.73).
|
||||
- **⚠ grok-4.3 reasoning ОТКЛЮЧАЕТСЯ явным `reasoning_effort:"none"`** (плоский, Chat Completions) → `reasoning_tokens=0`; **дефолт = `low` (must-be-explicit)** — не задал → думает и +reasoning-надбавка (аддитивна к output, молчаливый недосчёт ledger). Слаг **остаётся `grok-4.3`** (= grok-4.20-non-reasoning + `effort:none` под капотом). *(Первый вывод «не отключается» был багом пробы — off-switch не отправлялся; переснято 2026-07-05.)*
|
||||
- **Редактор — `grok-4.3` + явный `reasoning_effort:"none"`** (reasoning=0; дефолт grok = `low`, must-be-explicit). Экономика ниже — для reasoning-off. Механизм/квирк — `00-provider-quirks.md §grok`.
|
||||
- **Премиум full-apex (Gemini-3.1-Pro, форс-thinking → reasoning-as-output):** ранобэ **$5.0**, вебновелла-500 **~$81.5** (центр rf=1.0; диапазон $66–112), роман **$6.8**. **Полный apex вебновеллы приближается к человеческому якорю $100** (достигает/превышает лишь при rf≳1.4 или >200k-тарифе) → как дефолт не годится.
|
||||
- **Селективный премиум** (apex только на ~15% трудных/флагнутых чанков): ранобэ $1.5, вебновелла **$24.6**, роман $2.1 — экономически жив.
|
||||
- **`budget_usd`:** $5 ≈ полный apex ранобэ; $30 вебновеллы держит только **селективный** премиум (apex на **~23%** чанков), не full-apex ($82). **Полный apex больших работ — не дефолт; премиум крупных работ ОБЯЗАН быть селективным** (эскалация флагнутых, согласовано с D11: escalation уважает budget_usd, inline-последователен).
|
||||
|
|
@ -21,8 +21,7 @@
|
|||
|---|---|---|---|---|---|---|
|
||||
| **deepseek-v4-flash** (draft) | $0.14 | $0.0028 | $0.28 | нет | биллится как output (мал) | api-docs.deepseek.com/quick_start/pricing |
|
||||
| deepseek-v4-pro | $0.435 | $0.003625 | $0.87 | нет | как output | там же |
|
||||
| **grok-4.3** (editor/канал B/судья 18+) | $1.25 | $0.20 | $2.50 | нет | дефолт `low`, off=`reasoning_effort:"none"`; аддитивный→output | docs.x.ai/developers/models/grok-4.3 |
|
||||
| grok-4.3 + `reasoning_effort:"none"` (editor thinking-OFF) | $1.25 | $0.20 | $2.50 | нет | **reasoning=0** при явном none | docs.x.ai/developers/model-capabilities/text/reasoning |
|
||||
| **grok-4.3** (editor/канал B/судья 18+) | $1.25 | $0.20 | $2.50 | нет | дефолт `low`, off=`reasoning_effort:"none"` (→0), аддитивный→output | docs.x.ai/developers/models/grok-4.3 |
|
||||
| **Gemini 3.1 Pro** (apex/судья) | $2.00 (≤200k) / $4.00 (>200k) | $0.20 / $0.40 | **$12.00 / $18.00** (вкл. thinking) | **−50%** | форс-thinking → output | ai.google.dev/gemini-api/docs/pricing (upd 2026-06-30) |
|
||||
| glm-4.5-air / 4.6 / 5 / 5.1 | 0.2 / 0.6 / 1.0 / 1.4 | 0.03 / 0.11 / 0.2 / 0.26 | 1.1 / 2.2 / 3.2 / 4.4 | нет | — | docs.z.ai |
|
||||
| kimi-k2.6 | $0.95 | $0.16 | $4.00 | −40% | многословный (~11k/абз) | platform.moonshot.ai |
|
||||
|
|
@ -65,19 +64,17 @@
|
|||
|
||||
**Полный apex вебновеллы = центр ~$82 (rf=1.0; диапазон $66–112) — в основном НИЖЕ человеческого якоря $100** (дешевле человека — это ценность, не дисквалификатор). Он не годится как **дефолт** по другой причине: **переполняет потолок $30** и его наценка над стандартом $11 слишком велика для прогона на КАЖДОЙ книге. Дефолт $30 держит только селективный премиум (apex на **~23%** чанков; 25% = $31.3 уже чуть за бюджетом). Для ранобэ/романа полный apex ($5–7) остаётся жив.
|
||||
|
||||
## ⚠ Живая проба: grok-4.3 reasoning ОТКЛЮЧАЕТСЯ явным `reasoning_effort:"none"` (→ бэкенду, ledger/config)
|
||||
## grok reasoning — стоимостное следствие (механизм → `00-provider-quirks.md §grok`)
|
||||
|
||||
**ИСПРАВЛЕНО 2026-07-05 (баг первой пробы; doc-аудит оркестратора).** grok-4.3 reasoning **отключается** — но `reasoning_effort` ∈ {none, low, medium, high} с **дефолтом `low`** (must-be-explicit): не задал явно → модель думает. Off-switch у Chat Completions — **ПЛОСКИЙ `reasoning_effort:"none"`** в теле запроса. Первая проба слала `reasoning_effort:low` (это low, не off) и вложенный `extra_body.reasoning.effort:none` (форма Responses API — Chat Completions её молча глотает) → документированный off-switch не отправлялся ни разу, отсюда ложный вывод «не отключается».
|
||||
Дефолт редактора — **`reasoning_effort:"none"` → reasoning=0** (проба 05.07: none→0, дефолт `low`→444, low→384). Экономика ниже ($0.69/$10.94) считалась для reasoning-off, и он достижим → **таблицы верны, пересчёта нет**. Оставить reasoning ON (дефолт grok = `low`, аддитивен к output) → editor-выход +25%, стандарт +13–14% (столбец таблицы). Точный off-switch (плоский vs вложенный, баг первой пробы) — канон в `00-provider-quirks.md`.
|
||||
|
||||
Переснято правильно (grok-4.3, продакшн-правка 7284 симв.): **`reasoning_effort:"none"` → `reasoning_tokens=0`** (completion=видимый выход, биллинг без надбавки); дефолт-`low` → 444 reasoning; `low` → 384. reasoning у xAI аддитивен к completion (billed = completion+reasoning), при `none` → 0. `grok-4.20-0309-non-reasoning` = тот же grok-4.3 + `effort:none` под капотом (мигрированные слаги, ретайр 15.05.2026) → **слаг менять не надо**.
|
||||
|
||||
**Следствие:** дефолт-редактор = **`grok-4.3` + ЯВНЫЙ `reasoning_effort:"none"`** (не полагаться на omission — дефолт `low` даёт reasoning-надбавку и молча недосчитанный ledger). Экономика ниже ($0.69/$10.94) — для reasoning-off, и он достижим → **таблицы верны, пересчёта нет**. Ценность reasoning-редактуры grok НЕ измерена (эксп.04 сравнивал стиль) → пилот Ф2.5 (think-ON/OFF + моно-редактура, рука §пилот). Точная рабочая форма параметра — `experiments/00-provider-quirks.md`.
|
||||
Ценность reasoning-редактуры grok НЕ измерена (эксп.04 сравнивал стиль) → пилот Ф2.5 (think-ON/OFF + моно-редактура).
|
||||
|
||||
## Рекомендации (→ оркестратору/бэкенду)
|
||||
|
||||
1. **Приёмочный $-порог Ф1:** снять жёсткий $0.6. Мягкий sanity — **~$0.7/ранобэ, ~$11/вебновелла-500** (non-reason editor); приёмка держится на точности телеметрии денег + escalation-respects-budget (D11), НЕ на конкретном числе.
|
||||
2. **`budget_usd` дефолты:** премиум-потолок задавать **под селективный apex**, не под полный. Предложение: ранобэ/роман — **$2** (полный apex жив); вебновелла — либо **потолок-на-главу**, либо явная `apex_fraction` (селективная эскалация трудных чанков). Полный apex вебновеллы ($82) как дефолт — НЕТ (переполняет $30-потолок; при этом дешевле человека-$100).
|
||||
3. **Editor = `grok-4.3` + ЯВНЫЙ `reasoning_effort:"none"`** (reasoning=0; слаг не менять). `models.yaml`: капабилити редактора должна слать плоский `reasoning_effort:"none"` ЯВНО — «off by omission» для grok НЕВЕРНА (дефолт=`low` → reasoning-надбавка). Если пилот докажет ценность reasoning-редактуры — включить и бюджетировать reasoning как output в `EstimateUSD`.
|
||||
3. **Editor = `grok-4.3` + явный `reasoning_effort:"none"`** (слаг не менять; «off by omission» неверна — конфиг-квирк в `00-provider-quirks.md §grok`). Если пилот докажет ценность reasoning-редактуры — включить и бюджетировать reasoning как output в `EstimateUSD`.
|
||||
4. **Батч −50% только к Gemini-судье/QA** (deepseek/grok батч не имеют; inline-эскалация последовательна из-за STM — не батчуется). Gemini = и apex, и судья → эскалированный чанк платит Gemini дважды, оба с форс-reasoning.
|
||||
5. **deepseek auto-cache** экономит ~2% стандарта (стабильный префикс мал против r·B выхода) — не рычаг здесь; рычаг — выбор редактора.
|
||||
|
||||
|
|
|
|||
|
|
@ -55,13 +55,9 @@ def draft_cost(B, r, cache_frac=0.0):
|
|||
c_out = r * B * P["ds_out"]
|
||||
return c_in + c_out, c_in, c_out
|
||||
|
||||
# grok reasoning is ADDITIVE (separate from completion tokens) and IS DISABLED by an explicit
|
||||
# FLAT reasoning_effort:"none" on Chat Completions (re-probe 2026-07-05: none→reasoning_tokens=0,
|
||||
# default `low`→444, low→384 on a ~2000-tok edit). ⚠ grok's DEFAULT is `low` (must-be-explicit),
|
||||
# and the NESTED extra_body.reasoning.effort form is silently swallowed by Chat Completions — that
|
||||
# bug made the first exp08 probe wrongly conclude "unstoppable". So the editor = grok-4.3 +
|
||||
# explicit reasoning_effort:"none" (slug unchanged). EDITOR_REASONING_FACTOR=0 is the default
|
||||
# (reasoning off); 0.25 models leaving reasoning ON (default low) — +25% at production output size.
|
||||
# Editor = grok-4.3 + explicit reasoning_effort:"none" → reasoning=0 (grok default is `low`,
|
||||
# billed additively as output). reasoning_factor=0 = editor default (off); 0.25 = reasoning left
|
||||
# ON, +25% output. Off-switch mechanism/probe → docs/experiments/00-provider-quirks.md §grok.
|
||||
EDITOR_REASONING_FACTOR = 0.0
|
||||
|
||||
def editor_cost(B, r, cache_frac=0.0, reasoning_factor=0.0):
|
||||
|
|
|
|||
Loading…
Add table
Reference in a new issue