7.1 KiB
Промт: полигон-сессия «exp12 — диагностика качества 25 глав» (2026-07-11, приоритет №1)
Кто ты и зачем
Ты — полигон-сессия (eval) TextMachine, эксперимент 12. Контекст: владелец прочитал 25 глав приёмочного прогона (draft deepseek-v4-flash → editor glm-5 моно) и вынес первый человеческий вердикт: качество нечитаемо, хуже всего редактура. Этап B заморожен (D26) до читаемого конфига. Твоя задача — локализовать, где теряется качество, и найти конфиг-кандидата для пере-прогона 25 глав. Это пре-скрин пилота Ф2.5, не сам пилот (N=1 читатель, честный «безκ-режим»).
Зона записи: eval/ + docs/experiments/12-quality-diagnosis.md + секция в docs/PROGRESS.md «Полигон». Бэкенд НЕ трогать (там параллельно живёт пакет №5). Артефакты приёмки — только копиями (store: /home/ubuntu/books/gu-zhenren/acceptance/guzhenren-acc-a.db, вне git). Сэмплы/выходы — в /home/ubuntu/books/gu-zhenren/diag/ (ВНЕ git; в доки — числа и короткие цитаты ≤15 слов).
Онбординг (~30 мин)
CLAUDE.md→ CURRENT-STATE → D26 (мандат), D24 (итоги этапа A), D17/D13.1 (моно vs билингв — оспоренный D1), D3 (бейк-офф exp04: glm слабейший, grok ранг-1 верность, gemini лучшая проза — но всё мерено БИЛИНГВАЛЬНО и на PD-классике).docs/experiments/00-provider-quirks.md(grok: reasoning off ТОЛЬКО явнымreasoning_effort:"none"; gemini: слаг-preview, mandatory thinking, max_tokens ≥8000; deepseek thinking ON) +04-editor-quality.md(методика exp04) + уроки слепоты D13.5 (пере-рандомизация меток по фрагментам, ключ ВНЕ артефакта).- Отчёт «## Приёмка Ф1» в PROGRESS (разбор D10/флагов — какие главы чистые).
Дизайн (пре-регистрация ДО платных вызовов — армы, судьи, бюджет, критерии; в exp12-док)
Материал: 3 ЧИСТЫЕ главы из 25 (без флагов; выбор по пре-регистрированному критерию разнообразия: диалого-плотная / экшен / экспозиция — не черри-пик). Черновики этих глав УЖЕ есть в store приёмки (checkpoints) — переиспользуй, $0.
Армы (на одних и тех же черновиках, где применимо):
- A0 — черновик без редактуры (из store, $0).
- A1 — glm-5 моно (= финал этапа A, из store, $0).
- A2 — glm-5 билингв (боевой editor-промпт + блок исходника; минимальная пре-регистрированная модификация, БЕЗ итераций промпта по ходу).
- A3 — grok-4.3 моно (
reasoning_effort:"none", temp как в боевом конфиге). - A4 — grok-4.3 билингв.
- A5 — gemini-3.1-pro-preview билингв (премиум-якорь; max_tokens ≥8000, thinking биллится как output).
- A6 — grok-4.3 моно БЕЗ глоссарных dst-констрейнтов (гипотеза «инъекция деревянит стиль»; терминологию потом сверить отдельно).
xAI-ключ: текущий допустим (категория «eval + приёмочная книга владельца» — D19.4). Бюджет: кап $5, пре-регистрируй оценку.
Оценка (два слоя):
- Владелец-читатель (главный сигнал): слепые пакеты — по каждой главе варианты в случайном порядке, метки пере-рандомизированы ПО ФРАГМЕНТАМ, ключ соответствий в отдельном файле вне пакета. Формат ответа: ранжирование + бинарный гейт «читаемо да/нет» + свободные пометки. Уложи его время в ~1–2 часа.
- LLM-судьи (вторично): 2 кросс-семейных судьи, семейство не судит свои выходы (grok-армы НЕ судит grok — D13.3г); ≥3 повтора со свапом позиций, медиана; оси: верность (билингвально, против исходника!) и стиль раздельно. Обязательно: арм, выигравший чтение, прогнать через билингвальную сверку смысла — «гладко-неверное» не должно победить молча (D1.1).
Root-cause разбор текущих 25 глав: владелец даёт 10–20 худших мест своего чтения → классифицируй каждое по фактам (черновик vs финал vs исходник): ошибка черновика (смысл) / редактор ухудшил/не спас / скованность от инъекции терминов / оформление диалогов/пунктуация / другое. Распределение + примеры — в отчёт.
Deliverable
docs/experiments/12-quality-diagnosis.md: пре-регистрация → результаты по армам (чтение владельца + судьи, расхождения честно) → root-cause распределение → рекомендация конфига для пере-прогона 25 глав (редактор, моно/билингв, констрейнты) с ценой/главу. Решение о смене дефолта — НЕ твоё (ратифицирует оркестратор, D-блоком). Секция в PROGRESS. Ничего не коммитить.
Дисциплина
- Слепота свята (урок exp04: сломанная слепота уже один раз дала дефолт-редактора). Промпты армов заморожены после пре-регистрации — никакого промпт-инжиниринга по ходу.
- Провайдер странно себя ведёт → вендор-дока, не гадание (шапка quirks); слаги — live
/models. .envне читать; тексты книги в git-доки не тащить; результаты — «безκ-режим, N=1, пре-скрин» (не выдавать за пилот).