textmachine/docs/POLYGON_SESSION_PROMPT_CONSOLIDATION.md

4.7 KiB
Raw Blame History

Промт: eval/полигон-сессия — коррекция exp08 (grok-reasoning) + пилот-arm (2026-07-05)

Ты — полигон-сессия TextMachine, зона eval/ + docs/experiments/. Оркестратор прогнал doc-аудит; одна из твоих находок (exp08, «живая проба» grok-reasoning) оказалась основана на баге пробы. Ниже — коррекция + доп-arm в пилот. Источник истины по решениям — architecture/05-decisions-log.md. НЕ читай .env.

Коррекция exp08: grok-4.3 reasoning ОТКЛЮЧАЕТСЯ (баг пробы)

exp08 §«Живая проба» / §«Расхождения» (docs/experiments/08-cost-model-v2.md) заключил: «grok-4.3 форсирует reasoning, thinking-OFF недостижимо, истинный non-reasoning редактор = grok-4.20-0309-non-reasoning». Это неверно — xAI docs (docs.x.ai/developers/model-capabilities/text/reasoning, 05.07):

  • reasoning_effort ∈ {none, low, medium, high}; none = 0 thinking-токенов; дефолт = low.
  • Проба слала reasoning_effort:low (это low, не off) и extra_body.reasoning.effort:none (вложенная форма Responses-API; на Chat Completions нужен ПЛОСКИЙ reasoning_effort:"none") → документированный off-switch не отправлялся ни разу.
  • grok-4.20-0309-non-reasoning = grok-4.3 + effort:none под капотом (мигрированные слаги, ретайр 15.05.2026).

Задача 1 — переснять пробу правильным off-switch

На grok-4.3, Chat Completions, послать плоский reasoning_effort:"none" на боевую правку. Подтвердить: usage.reasoning_tokens=0, completion = видимый выход, биллинг без reasoning-надбавки. Зафиксировать точную рабочую форму параметра в 00-provider-quirks.md.

+ Reconcile 00-provider-quirks.md (обязательно): строки :12 (столбец model = grok-4.20-0309-non-reasoning) и :64 («для перевода брать non-reasoning») противоречат исправленной :33 → привести к grok-4.3 + explicit reasoning_effort:none (слаг НЕ меняем). Бэкенд wire-ит адаптеры отсюда — иначе возьмёт неверный слаг. (Если пробу уже переснял 05.07 — подтверди и закрой только этот reconcile :12/:64.)

Задача 2 — исправить exp08

  • §«Живая проба» и §«Расхождения» (D3-строка): вывод → «reasoning отключается явным reasoning_effort:none; дефолт grok = low (must-be-explicit); slug остаётся grok-4.3».
  • Рек #3 («editor slug = grok-4.20-0309-non-reasoning») → «editor slug = grok-4.3 + explicit reasoning_effort:none» (эквивалент, слаг не меняем).
  • Экономика exp08 ($0.69 ранобэ / $10.94 вебновелла) СТОИТ — она считалась для reasoning-off, а он достижим. Таблицы НЕ пересчитывать.

Задача 3 — editor mono-quality arm в пилот (F8)

exp08 (§Ограничения, Quality-transfer риск) верно отметил: exp04 выбрал grok, кормя его билингвально (исходник+черновик), а боевой редактор D1 — моноязычный (только черновик) → рейтинг grok на моноредактуре строго не перенесён. Добавить в пилот-протокол (09-pilot-protocol.md) явную руку: grok-4.3 моно-редактура (think-ON vs OFF — рука уже там) против кандидатов на реальной моноязычной задаче. Оркестратор уже свернул этот caveat в D3/D1.

Что УЖЕ сделал оркестратор (не дублируй)

  • exp07 (coverage 0/57 FP, ≥2 флага=fail, content_filter мёртв) свёрнут в D12/D2.4.
  • exp08-экономика ($0.69/$10.94) свёрнута в Р5/D11; пороги $0.6/$5/$30 сняты.

Приёмка

  • exp08 больше не утверждает «grok reasoning недостижимо»; проба переснята; точная форма параметра — в 00-provider-quirks.
  • Пилот-протокол имеет mono-editor arm.
  • Отчёт оркестратору.