textmachine/docs/POLYGON_QUALITY_DIAG_SESSION_PROMPT.md

46 lines
7.1 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

# Промт: полигон-сессия «exp12 — диагностика качества 25 глав» (2026-07-11, приоритет №1)
---
## Кто ты и зачем
Ты — **полигон-сессия** (eval) TextMachine, эксперимент 12. Контекст: владелец прочитал 25 глав приёмочного прогона (draft deepseek-v4-flash → editor glm-5 моно) и вынес первый человеческий вердикт: **качество нечитаемо, хуже всего редактура**. Этап B заморожен (D26) до читаемого конфига. Твоя задача — **локализовать, где теряется качество, и найти конфиг-кандидата** для пере-прогона 25 глав. Это пре-скрин пилота Ф2.5, не сам пилот (N=1 читатель, честный «безκ-режим»).
Зона записи: `eval/` + `docs/experiments/12-quality-diagnosis.md` + секция в `docs/PROGRESS.md` «Полигон». Бэкенд НЕ трогать (там параллельно живёт пакет №5). Артефакты приёмки — только копиями (store: `/home/ubuntu/books/gu-zhenren/acceptance/guzhenren-acc-a.db`, вне git). Сэмплы/выходы — в `/home/ubuntu/books/gu-zhenren/diag/` (ВНЕ git; в доки — числа и короткие цитаты ≤15 слов).
## Онбординг (~30 мин)
1. `CLAUDE.md` → CURRENT-STATE → **D26** (мандат), D24 (итоги этапа A), D17/D13.1 (моно vs билингв — оспоренный D1), D3 (бейк-офф exp04: glm слабейший, grok ранг-1 верность, gemini лучшая проза — но всё мерено БИЛИНГВАЛЬНО и на PD-классике).
2. `docs/experiments/00-provider-quirks.md` (grok: reasoning off ТОЛЬКО явным `reasoning_effort:"none"`; gemini: слаг `-preview`, mandatory thinking, max_tokens ≥8000; deepseek thinking ON) + `04-editor-quality.md` (методика exp04) + уроки слепоты D13.5 (пере-рандомизация меток по фрагментам, ключ ВНЕ артефакта).
3. Отчёт «## Приёмка Ф1» в PROGRESS (разбор D10/флагов — какие главы чистые).
## Дизайн (пре-регистрация ДО платных вызовов — армы, судьи, бюджет, критерии; в exp12-док)
**Материал:** 3 ЧИСТЫЕ главы из 25 (без флагов; выбор по пре-регистрированному критерию разнообразия: диалого-плотная / экшен / экспозиция — не черри-пик). Черновики этих глав УЖЕ есть в store приёмки (checkpoints) — переиспользуй, $0.
**Армы (на одних и тех же черновиках, где применимо):**
- A0 — черновик без редактуры (из store, $0).
- A1 — glm-5 моно (= финал этапа A, из store, $0).
- A2 — glm-5 билингв (боевой editor-промпт + блок исходника; минимальная пре-регистрированная модификация, БЕЗ итераций промпта по ходу).
- A3 — grok-4.3 моно (`reasoning_effort:"none"`, temp как в боевом конфиге).
- A4 — grok-4.3 билингв.
- A5 — gemini-3.1-pro-preview билингв (премиум-якорь; max_tokens ≥8000, thinking биллится как output).
- A6 — grok-4.3 моно БЕЗ глоссарных dst-констрейнтов (гипотеза «инъекция деревянит стиль»; терминологию потом сверить отдельно).
**xAI-ключ:** текущий допустим (категория «eval + приёмочная книга владельца» — D19.4). **Бюджет: кап $5**, пре-регистрируй оценку.
**Оценка (два слоя):**
1. **Владелец-читатель (главный сигнал):** слепые пакеты — по каждой главе варианты в случайном порядке, метки пере-рандомизированы ПО ФРАГМЕНТАМ, ключ соответствий в отдельном файле вне пакета. Формат ответа: ранжирование + бинарный гейт «читаемо да/нет» + свободные пометки. Уложи его время в ~12 часа.
2. **LLM-судьи (вторично):** 2 кросс-семейных судьи, **семейство не судит свои выходы** (grok-армы НЕ судит grok — D13.3г); ≥3 повтора со свапом позиций, медиана; оси: верность (билингвально, против исходника!) и стиль раздельно. Обязательно: арм, выигравший чтение, прогнать через билингвальную сверку смысла — «гладко-неверное» не должно победить молча (D1.1).
**Root-cause разбор текущих 25 глав:** владелец даёт 1020 худших мест своего чтения → классифицируй каждое по фактам (черновик vs финал vs исходник): `ошибка черновика (смысл)` / `редактор ухудшил/не спас` / `скованность от инъекции терминов` / `оформление диалогов/пунктуация` / `другое`. Распределение + примеры — в отчёт.
## Deliverable
`docs/experiments/12-quality-diagnosis.md`: пре-регистрация → результаты по армам (чтение владельца + судьи, расхождения честно) → root-cause распределение → **рекомендация конфига для пере-прогона 25 глав** (редактор, моно/билингв, констрейнты) с ценой/главу. Решение о смене дефолта — НЕ твоё (ратифицирует оркестратор, D-блоком). Секция в PROGRESS. Ничего не коммитить.
## Дисциплина
- Слепота свята (урок exp04: сломанная слепота уже один раз дала дефолт-редактора). Промпты армов заморожены после пре-регистрации — никакого промпт-инжиниринга по ходу.
- Провайдер странно себя ведёт → вендор-дока, не гадание (шапка quirks); слаги — live `/models`.
- `.env` не читать; тексты книги в git-доки не тащить; результаты — «безκ-режим, N=1, пре-скрин» (не выдавать за пилот).