Reconcile grok-reasoning across polygon docs: reasoning_effort:none disables it (probe bug), editor stays grok-4.3 with provider-quirks slug fixed; economics unchanged; add pilot mono-editor arm
This commit is contained in:
parent
3911bafe30
commit
84737d032c
4 changed files with 34 additions and 22 deletions
|
|
@ -9,7 +9,7 @@
|
|||
| Провайдер | base_url | Модель (на 2026-07-04) | env-ключ |
|
||||
|---|---|---|---|
|
||||
| DeepSeek | `https://api.deepseek.com/v1` | **`deepseek-v4-flash`** (`deepseek-chat` не в /models, но работает как алиас до депрекации 24.07.2026; эхает zh — см. ниже, брать v4-flash с thinking) | `DEEPSEEK_API_KEY` |
|
||||
| xAI Grok | `https://api.x.ai/v1` | `grok-4.20-0309-non-reasoning` (явный не-reasoning слаг; `grok-4-fast` не в /v1/models, но работает как алиас — проверено HTTP 200; флагман `grok-4.3`) | `XAI_API_KEY` |
|
||||
| xAI Grok | `https://api.x.ai/v1` | **`grok-4.3`** (дефолт-редактор/переводчик; для thinking-OFF слать явный `reasoning_effort:"none"` — см. thinking-таблицу ниже; слаг НЕ меняем на non-reasoning вариант — он = grok-4.3+`none` под капотом, ретайр 15.05.2026). `grok-4-fast` не в /v1/models, но работает как алиас (HTTP 200). | `XAI_API_KEY` |
|
||||
| GLM (Z.ai) | `https://api.z.ai/api/paas/v4` | `glm-4.5-air` (дёшево) / `glm-4.6`; в /models: glm-4.7, glm-5, glm-5.1, glm-5.2 | `ZAI_API_KEY` |
|
||||
| Gemini | `https://generativelanguage.googleapis.com/v1beta/openai` | `gemini-2.5-flash`, `gemini-2.5-pro`, `gemini-3.1-pro-preview` | `GEMINI_API_KEY` |
|
||||
| Kimi (Moonshot) | `https://api.moonshot.ai/v1` (intl, **не** `.cn`) | `kimi-k2.6` (доступны k2.5, k2.7-code) | `KIMI_API_KEY` |
|
||||
|
|
@ -30,6 +30,7 @@
|
|||
| **Gemini 3.1 Pro** | thinking **обязателен** | `thinking_budget:0` → HTTP 400 «only works in thinking mode». НЕ отключать; дать большой `max_tokens` (≥8000) |
|
||||
| gpt-5-mini (reasoning) | reasoning ON, выжигал бюджет → пустой ответ | `reasoning_effort: "minimal"`; **без `temperature`**; `max_completion_tokens` вместо `max_tokens` |
|
||||
| **Kimi K2.6** | думающая, **очень многословная**: ~11k reasoning-токенов на абзац; reasoning в `reasoning_content`, ответ в `content`; при малом бюджете reasoning съедает лимит → `content` **пуст** (finish=length, не ошибка!) | дать `max_tokens` ≥16000; ответ из `content`. **Дорогой в роли редактора** — reasoning биллится как выход |
|
||||
| **grok-4.3 (xAI)** | reasoning **ON по дефолту = `low`** (must-be-explicit: не задал → думает) | **Off-switch (Chat Completions) — ПЛОСКИЙ `reasoning_effort:"none"` в теле** (`reasoning_effort` ∈ {none,low,medium,high}). ⚠ **Вложенная форма `extra_body.reasoning.effort:"none"` — это Responses API; Chat Completions её МОЛЧА ГЛОТАЕТ** (остаётся дефолт `low`) — из-за этого exp08-проба ложно решила «не отключается». Проверено 05.07: `reasoning_effort:"none"`→`usage.reasoning_tokens=0`, дефолт→444, `low`→384 (на правке ~2000 ток.). reasoning у xAI **аддитивен к completion** (billed = completion+reasoning). `grok-4.20-0309-non-reasoning` = grok-4.3 + `effort:none` под капотом (ретайр 15.05.2026) → слаг не нужен, слать `none` явно. Для роли editor/translator — ВСЕГДА явный `reasoning_effort:"none"`. Источник: docs.x.ai/developers/model-capabilities/text/reasoning. |
|
||||
| Qwen3.5 / локальные | thinking ON | ollama: `think: false` + `num_predict` cap. Иначе рассуждения (в поле `thinking`, не `response`) забивают контекст |
|
||||
|
||||
**Находка (эксп. 03):** reasoning реально улучшает реалии/имена в переводе (羅生門: «Радзёмон»→«Рашо-мон»), но локально нежизнеспособен (8.6 мин/фрагмент). **Открытый вопрос для бэкенда: проверить think-ON на быстром облачном черновике/редакторе как рычаг качества.**
|
||||
|
|
@ -60,7 +61,7 @@
|
|||
|
||||
- `deepseek-chat` → `deepseek-v4-flash` к **24.07.2026**.
|
||||
- **Grok 4.1 Fast retired 15.05.2026** → слаги молча редиректят на `grok-4.3` (цена ×9). Ретайрнулся дешёвый тир, НЕ сам xAI: grok-4.3 остаётся основным пермиссивным тиром канала B.
|
||||
- **Аудит /models 04.07.2026 (воркфлоу) — с поправкой на перепроверку:** и `deepseek-chat`, и `grok-4-fast` НЕ в списках /models (там v4-flash/v4-pro у DeepSeek; версионные слаги у xAI), НО **оба работают как алиасы** (перепроверено вживую: HTTP 200, переводят). Агент-аудитор написал «сняты» — это была неточность: «нет в /models» ≠ «не работает». deepseek-chat депрекируется 24.07.2026. У xAI reasoning/non-reasoning — РАЗНЫЕ слаги (`grok-4.20-0309-non-reasoning` / `-reasoning` / `-multi-agent`); для перевода брать non-reasoning. xAI `usage` отдаёт нестандартные `cost_in_usd_ticks`/`num_sources_used` — игнорировать. **Урок: имя модели проверять не только `/models`, но и пробным вызовом — алиас может работать, даже если его нет в списке; и наоборот.** Реальная причина сменить deepseek на v4-flash — не «chat умер», а ЭХО на zh (лечится thinking-on), см. раздел thinking.
|
||||
- **Аудит /models 04.07.2026 (воркфлоу) — с поправкой на перепроверку:** и `deepseek-chat`, и `grok-4-fast` НЕ в списках /models (там v4-flash/v4-pro у DeepSeek; версионные слаги у xAI), НО **оба работают как алиасы** (перепроверено вживую: HTTP 200, переводят). Агент-аудитор написал «сняты» — это была неточность: «нет в /models» ≠ «не работает». deepseek-chat депрекируется 24.07.2026. У xAI есть мигрированные слаги-обёртки (`grok-4.20-0309-non-reasoning` / `-reasoning` / `-multi-agent`, ретайр 15.05.2026), но **для перевода/редактуры берём `grok-4.3` + явный `reasoning_effort:"none"`** (слаг не меняем; non-reasoning вариант = grok-4.3+`none` под капотом — см. thinking-таблицу). xAI `usage` отдаёт нестандартные `cost_in_usd_ticks`/`num_sources_used` — игнорировать. **Урок: имя модели проверять не только `/models`, но и пробным вызовом — алиас может работать, даже если его нет в списке; и наоборот.** Реальная причина сменить deepseek на v4-flash — не «chat умер», а ЭХО на zh (лечится thinking-on), см. раздел thinking.
|
||||
- Claude Sonnet 5 промо $2/$10 до **31.08.2026** (не закладывать в долгий прайс).
|
||||
- **ПОПРАВКА (04.07, владелец): удалён только Anthropic (за дороговизну). OpenAI ОСТАЁТСЯ** (ключ есть — GPT-5 nano/mini). Живой набор ключей у бэкенда и полигона: DEEPSEEK, ZAI, KIMI, OPENAI, GEMINI, XAI. Источник истины по стеку — `architecture/05-decisions-log.md` (D3) и Р4. Ранее эта строка ошибочно исключала OpenAI — исправлено оркестратором.
|
||||
|
||||
|
|
|
|||
|
|
@ -7,11 +7,11 @@
|
|||
|
||||
- **Редактор теперь ~88–90% стоимости стандарт-микса** (робастно 87–90% по h_e и с учётом deepseek-reasoning). grok-выход $2.50/M ≈ **9× дешёвого draft-выхода** ($0.28/M) при одинаковом объёме → один смешанный множитель M_out (эксп.01) больше неприменим, каждую стадию считаем по цене её модели.
|
||||
- **Стандарт-микс (draft+editor):** ja→ru **ранобэ том $0.69**, zh→ru **вебновелла-500 $10.94**, en→ru **роман $0.93**. Порог приёмки **$0.6 — мёртв** (был на дешёвом редакторе). Совпадает с прикидкой decisions-log ($0.73).
|
||||
- **⚠ grok-4.3 форсирует reasoning, который НЕ отключается** (`reasoning_effort:low/none` не помогают, живая проба) и **биллится как output** (+25% output на продакшн-размере). **Истинный «thinking-OFF редактор» — `grok-4.20-0309-non-reasoning`** (тот же прайс-кард, тот же видимый выход, reasoning=0). Если оставить grok-4.3 ради качества reasoning — стандарт-микс **+13–14%**.
|
||||
- **⚠ grok-4.3 reasoning ОТКЛЮЧАЕТСЯ явным `reasoning_effort:"none"`** (плоский, Chat Completions) → `reasoning_tokens=0`; **дефолт = `low` (must-be-explicit)** — не задал → думает и +reasoning-надбавка (аддитивна к output, молчаливый недосчёт ledger). Слаг **остаётся `grok-4.3`** (= grok-4.20-non-reasoning + `effort:none` под капотом). *(Первый вывод «не отключается» был багом пробы — off-switch не отправлялся; переснято 2026-07-05.)*
|
||||
- **Премиум full-apex (Gemini-3.1-Pro, форс-thinking → reasoning-as-output):** ранобэ **$5.0**, вебновелла-500 **~$81.5** (центр rf=1.0; диапазон $66–112), роман **$6.8**. **Полный apex вебновеллы приближается к человеческому якорю $100** (достигает/превышает лишь при rf≳1.4 или >200k-тарифе) → как дефолт не годится.
|
||||
- **Селективный премиум** (apex только на ~15% трудных/флагнутых чанков): ранобэ $1.5, вебновелла **$24.6**, роман $2.1 — экономически жив.
|
||||
- **`budget_usd`:** $5 ≈ полный apex ранобэ; $30 вебновеллы держит только **селективный** премиум (apex на **~23%** чанков), не full-apex ($82). **Полный apex больших работ — не дефолт; премиум крупных работ ОБЯЗАН быть селективным** (эскалация флагнутых, согласовано с D11: escalation уважает budget_usd, inline-последователен).
|
||||
- **Батч −50% только у Gemini** (судья/QA), не у draft/editor (deepseek/grok батч не публикуют). **Reasoning-as-output:** deepseek-draft reasoning ≈**26%** выхода черновика (эксп.07 данные: 20462/77637), но **<2% стандарта** (черновик — ~10% стоимости) → в модели опущен (не «мал сам по себе»); grok-4.3 +25%; Gemini форс (rf, не измерен — см. ниже).
|
||||
- **Батч −50% только у Gemini** (судья/QA), не у draft/editor (deepseek/grok батч не публикуют). **Reasoning-as-output:** deepseek-draft reasoning ≈**26%** выхода черновика (эксп.07 данные: 20462/77637), но **<2% стандарта** (черновик — ~10% стоимости) → в модели опущен (не «мал сам по себе»); grok-4.3 при reasoning ON (дефолт `low`) +25%, при `reasoning_effort:"none"` = 0 (дефолт редактора); Gemini форс (rf, не измерен — см. ниже).
|
||||
|
||||
## Прайсы — официальные доки, датированы, кросс-верифицированы (2026-07-05, НЕ по памяти)
|
||||
|
||||
|
|
@ -21,8 +21,8 @@
|
|||
|---|---|---|---|---|---|---|
|
||||
| **deepseek-v4-flash** (draft) | $0.14 | $0.0028 | $0.28 | нет | биллится как output (мал) | api-docs.deepseek.com/quick_start/pricing |
|
||||
| deepseek-v4-pro | $0.435 | $0.003625 | $0.87 | нет | как output | там же |
|
||||
| **grok-4.3** (editor/канал B/судья 18+) | $1.25 | $0.20 | $2.50 | нет | форс-ON, аддитивный→output | docs.x.ai/developers/models/grok-4.3 |
|
||||
| **grok-4.20-0309-non-reasoning** (истинный editor) | $1.25 | $0.20 | $2.50 | нет | **reasoning=0** | docs.x.ai/…/grok-4.20-0309-non-reasoning |
|
||||
| **grok-4.3** (editor/канал B/судья 18+) | $1.25 | $0.20 | $2.50 | нет | дефолт `low`, off=`reasoning_effort:"none"`; аддитивный→output | docs.x.ai/developers/models/grok-4.3 |
|
||||
| grok-4.3 + `reasoning_effort:"none"` (editor thinking-OFF) | $1.25 | $0.20 | $2.50 | нет | **reasoning=0** при явном none | docs.x.ai/developers/model-capabilities/text/reasoning |
|
||||
| **Gemini 3.1 Pro** (apex/судья) | $2.00 (≤200k) / $4.00 (>200k) | $0.20 / $0.40 | **$12.00 / $18.00** (вкл. thinking) | **−50%** | форс-thinking → output | ai.google.dev/gemini-api/docs/pricing (upd 2026-06-30) |
|
||||
| glm-4.5-air / 4.6 / 5 / 5.1 | 0.2 / 0.6 / 1.0 / 1.4 | 0.03 / 0.11 / 0.2 / 0.26 | 1.1 / 2.2 / 3.2 / 4.4 | нет | — | docs.z.ai |
|
||||
| kimi-k2.6 | $0.95 | $0.16 | $4.00 | −40% | многословный (~11k/абз) | platform.moonshot.ai |
|
||||
|
|
@ -47,7 +47,7 @@
|
|||
|
||||
### Стандарт-микс (draft + editor) — приёмка Ф1
|
||||
|
||||
| Книга | было (эксп.01) | **стало (v2, non-reason editor)** | editor доля | grok-4.3 reasoning | 50% cache draft |
|
||||
| Книга | было (эксп.01) | **стало (v2, editor reasoning=none)** | editor доля | если reasoning ON (дефолт low) | 50% cache draft |
|
||||
|---|---|---|---|---|---|
|
||||
| ja→ru ранобэ том | $0.17 | **$0.69** | 89% | $0.78 (+13%) | $0.67 |
|
||||
| zh→ru вебновелла-500 | $2.57 | **$10.94** | 90% | $12.46 (+14%) | $10.76 |
|
||||
|
|
@ -65,24 +65,26 @@
|
|||
|
||||
**Полный apex вебновеллы = центр ~$82 (rf=1.0; диапазон $66–112) — в основном НИЖЕ человеческого якоря $100** (дешевле человека — это ценность, не дисквалификатор). Он не годится как **дефолт** по другой причине: **переполняет потолок $30** и его наценка над стандартом $11 слишком велика для прогона на КАЖДОЙ книге. Дефолт $30 держит только селективный премиум (apex на **~23%** чанков; 25% = $31.3 уже чуть за бюджетом). Для ранобэ/романа полный apex ($5–7) остаётся жив.
|
||||
|
||||
## ⚠ Живая проба: grok-4.3 форсирует reasoning (→ бэкенду, важно для ledger и config)
|
||||
## ⚠ Живая проба: grok-4.3 reasoning ОТКЛЮЧАЕТСЯ явным `reasoning_effort:"none"` (→ бэкенду, ledger/config)
|
||||
|
||||
`reasoning_effort:low` и `extra_body.reasoning.effort:none` **НЕ отключают** reasoning у grok-4.3 — на тривиальной правке 873 reasoning-токена, на продакшн-правке (~2428 ток.) **495 reasoning на 1972 видимых = +25% output**. reasoning у xAI **аддитивен к completion** (в usage отдельным полем; видимый completion + reasoning = биллинг). `grok-4.20-0309-non-reasoning` даёт **тот же видимый выход с reasoning=0** по тому же прайс-карду.
|
||||
**ИСПРАВЛЕНО 2026-07-05 (баг первой пробы; doc-аудит оркестратора).** grok-4.3 reasoning **отключается** — но `reasoning_effort` ∈ {none, low, medium, high} с **дефолтом `low`** (must-be-explicit): не задал явно → модель думает. Off-switch у Chat Completions — **ПЛОСКИЙ `reasoning_effort:"none"`** в теле запроса. Первая проба слала `reasoning_effort:low` (это low, не off) и вложенный `extra_body.reasoning.effort:none` (форма Responses API — Chat Completions её молча глотает) → документированный off-switch не отправлялся ни разу, отсюда ложный вывод «не отключается».
|
||||
|
||||
**Следствие:** заявленный «дефолт-редактор grok-4.3 @ thinking-OFF» (D3) на практике = **`grok-4.20-0309-non-reasoning`** (иначе ledger недосчитает 25% output — тот же класс ошибки, что сжёг vojo 30–44%). Если reasoning grok-4.3 реально улучшает ru-редактуру (НЕ измерено — эксп.04 сравнивал стиль, не reasoning-вклад) — это осознанный размен +14% COGS, но тогда `EstimateUSD` ОБЯЗАН резервировать reasoning-буфер редактора. Уточнить в пилоте Ф2.5 (think-ON/OFF рука уже там).
|
||||
Переснято правильно (grok-4.3, продакшн-правка 7284 симв.): **`reasoning_effort:"none"` → `reasoning_tokens=0`** (completion=видимый выход, биллинг без надбавки); дефолт-`low` → 444 reasoning; `low` → 384. reasoning у xAI аддитивен к completion (billed = completion+reasoning), при `none` → 0. `grok-4.20-0309-non-reasoning` = тот же grok-4.3 + `effort:none` под капотом (мигрированные слаги, ретайр 15.05.2026) → **слаг менять не надо**.
|
||||
|
||||
**Следствие:** дефолт-редактор = **`grok-4.3` + ЯВНЫЙ `reasoning_effort:"none"`** (не полагаться на omission — дефолт `low` даёт reasoning-надбавку и молча недосчитанный ledger). Экономика ниже ($0.69/$10.94) — для reasoning-off, и он достижим → **таблицы верны, пересчёта нет**. Ценность reasoning-редактуры grok НЕ измерена (эксп.04 сравнивал стиль) → пилот Ф2.5 (think-ON/OFF + моно-редактура, рука §пилот). Точная рабочая форма параметра — `experiments/00-provider-quirks.md`.
|
||||
|
||||
## Рекомендации (→ оркестратору/бэкенду)
|
||||
|
||||
1. **Приёмочный $-порог Ф1:** снять жёсткий $0.6. Мягкий sanity — **~$0.7/ранобэ, ~$11/вебновелла-500** (non-reason editor); приёмка держится на точности телеметрии денег + escalation-respects-budget (D11), НЕ на конкретном числе.
|
||||
2. **`budget_usd` дефолты:** премиум-потолок задавать **под селективный apex**, не под полный. Предложение: ранобэ/роман — **$2** (полный apex жив); вебновелла — либо **потолок-на-главу**, либо явная `apex_fraction` (селективная эскалация трудных чанков). Полный apex вебновеллы ($82) как дефолт — НЕТ (переполняет $30-потолок; при этом дешевле человека-$100).
|
||||
3. **Editor slug = `grok-4.20-0309-non-reasoning`** (reasoning=0), не `grok-4.3`, если только пилот не докажет ценность reasoning-редактуры. `models.yaml`: `reasoning_control` для grok-4.3 = `mandatory` (не `extra_body_disable` — не отключается), бюджетировать reasoning как output.
|
||||
3. **Editor = `grok-4.3` + ЯВНЫЙ `reasoning_effort:"none"`** (reasoning=0; слаг не менять). `models.yaml`: капабилити редактора должна слать плоский `reasoning_effort:"none"` ЯВНО — «off by omission» для grok НЕВЕРНА (дефолт=`low` → reasoning-надбавка). Если пилот докажет ценность reasoning-редактуры — включить и бюджетировать reasoning как output в `EstimateUSD`.
|
||||
4. **Батч −50% только к Gemini-судье/QA** (deepseek/grok батч не имеют; inline-эскалация последовательна из-за STM — не батчуется). Gemini = и apex, и судья → эскалированный чанк платит Gemini дважды, оба с форс-reasoning.
|
||||
5. **deepseek auto-cache** экономит ~2% стандарта (стабильный префикс мал против r·B выхода) — не рычаг здесь; рычаг — выбор редактора.
|
||||
|
||||
## Расхождения
|
||||
|
||||
- **эксп.01 / research/09:** оба порога ($0.6 стандарт, $5/$30 премиум) устарели после смены редактора на grok. Стандарт вырос ×3–4 (редактор ×9 по выходу); премиум вебновеллы вырос до якоря (Gemini $12–18/M выхода + форс-reasoning против прежнего Sonnet $15). Направление то же, что предупреждал эксп.01 («буфер премиума сжался»), но теперь количественно: **полный премиум вебновеллы экономически не дефолтен**.
|
||||
- **decisions-log D3 «grok-4.3 thinking-OFF»** — фактически недостижимо на slug grok-4.3; истинный не-reasoning editor — grok-4.20-non-reasoning (выше).
|
||||
- **decisions-log D3 «grok-4.3 thinking-OFF»** — ДОСТИЖИМО явным `reasoning_effort:"none"` (дефолт grok = `low`, must-be-explicit); slug остаётся grok-4.3. Первоначальный вывод отчёта «недостижимо» был багом пробы (off-switch не отправлялся) — исправлено.
|
||||
|
||||
## Ограничения
|
||||
|
||||
|
|
@ -99,4 +101,4 @@
|
|||
```bash
|
||||
eval/.venv/bin/python eval/cost_model_v2.py # таблицы + eval/data/cost_model_v2.json
|
||||
```
|
||||
Прайсы: workflow `fetch-provider-prices` (per-provider фетч + верификация), 2026-07-05. grok-reasoning проба — inline в этом отчёте (usage.reasoning_tokens на grok-4.3 vs grok-4.20-non-reasoning).
|
||||
Прайсы: workflow `fetch-provider-prices` (per-provider фетч + верификация), 2026-07-05. grok-reasoning проба — inline (usage.reasoning_tokens на grok-4.3: `reasoning_effort:"none"`→0, дефолт→444, `low`→384; точная форма — `00-provider-quirks.md`).
|
||||
|
|
|
|||
|
|
@ -80,7 +80,15 @@
|
|||
Гипотеза владельца частично подтвердилась локально (羅生門→Радзёмон) + DRT (arXiv:2412.17498). Но COGS: deepseek-reasoning мал, grok-4.3 +25% (эксп.08), Gemini форс. Мерить **по качеству** на draft/translator И editor (не только Terminologist):
|
||||
- пары think-ON vs think-OFF того же ядра → BWS + судья;
|
||||
- скоуп think-ON — subset-billing провайдеры (deepseek/glm/kimi, reasoning ⊆ completion); xAI/Grok think-ON только после reasoning-буфера в EstimateUSD (D6.2);
|
||||
- **вход в решение:** оправдывает ли прирост качества +13–25% COGS редактора (эксп.08 §grok-4.3).
|
||||
- **вход в решение:** оправдывает ли прирост качества +25% COGS редактора при reasoning ON (эксп.08: grok-reasoning отключается `reasoning_effort:"none"`, дефолт-редактор — off; reasoning-редактура — опция под этот замер).
|
||||
|
||||
## 7-bis. Моно-редактор бейк-офф (F8 — доп-рука, из caveat эксп.08:92)
|
||||
|
||||
**Зачем:** эксп.04 выбрал grok-4.3 редактором, кормя его **билингвально** (исходник+черновик), но боевой редактор D1 — **моноязычный** (только черновик, без исходника) → рейтинг grok на моноредактуре **строго не перенесён** (оркестратор свернул caveat в D3/D1). Отдельная рука пилота — валидировать выбор редактора на РЕАЛЬНОЙ моноязычной задаче:
|
||||
- **grok-4.3 моно-редактура** (вход = только русский черновик + глоссарий-констрейнты, БЕЗ исходника) vs кандидаты (gemini-3.1-pro, gpt-5-mini, glm-5) на той же моно-задаче;
|
||||
- крест с think-ON/OFF (§7): reasoning может значить для моноредактуры иначе, чем для билингвальной;
|
||||
- метрика — BWS-стиль (§4, русская сторона, исходник не нужен) + консистентность глоссаря (§6, decl-метрика) + верность через сверку с эталоном (моноредактор не должен «улучшать» смысл прочь от исходника — риск калек убран D1, но проверить, что моноредактор не дрейфит factual);
|
||||
- **вход в решение:** держится ли ранг grok-редактора при переходе билингв→моно; если нет — перевыбрать редактора Ф1 на моно-режиме.
|
||||
|
||||
## 8. Пре-пасс Annotator (A/B)
|
||||
|
||||
|
|
|
|||
|
|
@ -55,17 +55,18 @@ def draft_cost(B, r, cache_frac=0.0):
|
|||
c_out = r * B * P["ds_out"]
|
||||
return c_in + c_out, c_in, c_out
|
||||
|
||||
# grok reasoning is ADDITIVE (separate from completion tokens) and UNSTOPPABLE on grok-4.3
|
||||
# (reasoning_effort=low/none do NOT disable it — live probe 2026-07-05). Measured surcharge at
|
||||
# PRODUCTION output size (~2428-tok edit): reasoning=495 on visible=1972 → +0.25× output.
|
||||
# grok-4.20-0309-non-reasoning gives the SAME visible output with reasoning=0 at the SAME rate
|
||||
# card → it is the true "thinking-OFF editor". EDITOR_REASONING_FACTOR=0 is the recommended
|
||||
# (non-reasoning) config; 0.25 models keeping grok-4.3.
|
||||
# grok reasoning is ADDITIVE (separate from completion tokens) and IS DISABLED by an explicit
|
||||
# FLAT reasoning_effort:"none" on Chat Completions (re-probe 2026-07-05: none→reasoning_tokens=0,
|
||||
# default `low`→444, low→384 on a ~2000-tok edit). ⚠ grok's DEFAULT is `low` (must-be-explicit),
|
||||
# and the NESTED extra_body.reasoning.effort form is silently swallowed by Chat Completions — that
|
||||
# bug made the first exp08 probe wrongly conclude "unstoppable". So the editor = grok-4.3 +
|
||||
# explicit reasoning_effort:"none" (slug unchanged). EDITOR_REASONING_FACTOR=0 is the default
|
||||
# (reasoning off); 0.25 models leaving reasoning ON (default low) — +25% at production output size.
|
||||
EDITOR_REASONING_FACTOR = 0.0
|
||||
|
||||
def editor_cost(B, r, cache_frac=0.0, reasoning_factor=0.0):
|
||||
"""Monolingual editor. reasoning_factor=0 → grok-4.20-non-reasoning (thinking-OFF);
|
||||
0.25 → grok-4.3 with its unstoppable reasoning billed as output."""
|
||||
"""Monolingual editor (grok-4.3 + reasoning_effort:"none"). reasoning_factor=0 → reasoning off
|
||||
(default); 0.25 → reasoning left ON (grok default `low`), billed additively as output."""
|
||||
tin = (r + H_EDIT) * B
|
||||
hit = tin * cache_frac
|
||||
miss = tin - hit
|
||||
|
|
|
|||
Loading…
Add table
Reference in a new issue