textmachine/docs/POLYGON_EXP14B_SESSION_PROMPT.md

50 lines
10 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

# Промт: полигон-сессия exp14b — батарея смысл-трапов (нога-2) + ранг P1a↔фронтир (2026-07-12, D37, приоритет №1)
---
## Кто ты и зачем
Ты — **полигон-сессия** TextMachine, exp14b — прямое продолжение exp14 (ратифицировано D37). exp14 закрыло **претензию-1 (абзацы) = рычаг ПРОМПТА/активации** (дискурс-промпт реверстает у всех семей; фронтир+старый промпт рубит хуже дешёвого — доказано, ратифицировано). Осталось ДВЕ незакрытые вещи, и это ровно твоя задача — **домерить, НЕ утверждать:**
1. **Нога-2 (претензия-2, смысл внутри чанка) — НЕДО-МОЩНА.** exp14 нашёл: дешёвый glm-5 инвертирует двойное отрицание `没有一个不知道` (все знали→никто), grok-4.3 И gemini-3.1-pro тоже, **только gpt-5.4 чинит**. НО это **1 конструкция + один судья** на фронтире (gpt-5-mini self-excluded → фронтир судил только kimi). Дорогое COGS-решение «селективно гонять gpt-5.4 на смысл-мины» НЕ ратифицировано. **Твоя задача: батарея смысл-трапов ≥35 типов → робастна ли «только gpt-5.4», или конструкция-специфична; какую долю смысл-трапов дешёвая модель валит → стоит ли gpt-5.4-эскалация COGS.**
2. **P1a (рекомендованный near-term конфиг, одинарный дискурс-пасс) НИКОГДА не ранжировался против фронтира** — финалисты exp14 были {P0, A-2pass, F-disc}, P1a исключён. **Задача: P1a ↔ F-disc head-to-head** (насколько близко дешёвый дискурс подходит к фронтиру по прозе И верности).
Зона: `eval/` + `docs/experiments/14b-*.md` + секция «Полигон» в `PROGRESS.md`. Прямые API-вызовы из `eval/`-харнеса. **НЕ коммить батчи** (урок D37: exp14 закоммитил 6 батчей сам — фризь ТОЛЬКО пре-рег §1, остальное лендит оркестратор).
## Онбординг
1. `CLAUDE.md` → CURRENT-STATE → **D37 целиком** (мандат; + D36/D35) → **`docs/experiments/14-quality-empirics.md` С РЕВЬЮ-ШАПКОЙ ОРКЕСТРАТОРА** (там поправки: «13 катастроф» завышено; §2Б.3-панель-литерал-смещение = пере-натяжка; нога-2 недо-мощна).
2. **Мемо `eval-aggregation-no-manufactured-convergence` (ОБЯЗАТЕЛЬНО, вкл. exp14-грань D37):** НЕ дисконтируй свою панель, чтобы продвинуть фронтир; НЕ строй floor-клейм на n=1 + одном судье; катастроф-скрин к победителю; ≥2 независимых глаза на катастрофу (в exp14 A-2pass-катастрофу поймал только 1 из 2 внешних — n=1 мало).
3. `docs/experiments/00-provider-quirks.md`: deepseek thinking ON; gpt-5 `max_completion_tokens`/без temp/`reasoning_effort`; grok reasoning-ON аддитив, НЕ на архаичной ch1 (D22.5); gemini `-preview`/mandatory-thinking/`additive_total`.
## Пре-регистрация (закоммить §1 exp14b-дока ДО первого платного вызова — path-scoped только этот док; D30.10)
### 1. Батарея смысл-трапов (нога-2)
Собери **≥35 КЛАССОВ конструкций × ≥2 инстанса** из реальной книги (`rerun/records.json` + срез), каждый размечен `supporting_span` + опустимый_смысл` ДО генерации. Классы (бери реальные места, часть уже известна):
- **(a) полярность / двойное отрицание** (`没有一个不知道`-класс, ch7.0 — уже T1);
- **(b) числа/масштаб** (`四分/八分`, `分=1%`/`成=10%` — ch10.1, редактор съехал в 10×);
- **(c) ранг/иерархия** (`丙等→В` не Б — ch9.1/ch18.0; `人上之人`«над людьми» не «среди»; `四代族长` глава не старейшина — ch16.0);
- **(d) контрфактив** (`否则…` — exp14 передали верно, контроль-класс: убедиться, что не ломается);
- **(e) чэнъюй-сплющивание** (`物是人非`«вещи те же, люди иные»→«всё изменилось» — T2);
- **(f) кореференция/нулевое подлежащее** (кто субъект — zh zero-anaphora, экспликация в РЯ).
**Дизайн армов (ПРОМПТ константен = дискурс; варьируем РЕДАКТОРА-модель на общем flash-черновике):** cheap `glm-5` (baseline) × frontier `gpt-5.4` × frontier `grok-4.3-ON`. **Gemini почти исчерпан (~€0.39 — см. бюджет) → НЕ полноценный арм; макс 23 спот-ре-теста ключевых трапов ИЛИ дропни, отметив.**
**Скоринг — ДЕТЕРМИНИРОВАННО где можно (это чище судьи):** классы (a)/(b)/(c)/(d) проверяемы по правилу (полярность/число/ранг/направление) — скорь программно + цитируй спан. Классы (e)/(f) — **≥2 КРОСС-семейных span-цитирующих судьи** (self-family exclusion; kimi + gpt-5-mini + mistral как третий не-семейный; НЕ один судья на арм). Пер-конструкция fix-rate: cheap vs каждый фронтир. **Вывод: робастна ли «только gpt-5.4 чинит» по классам, или отдельные классы чинит и grok/дешёвый; доля смысл-трапов, что валит дешёвая → COGS-оценка селективной эскалации (сколько чанков триггернут gpt-5.4 × цена).**
### 2. P1a ↔ F-disc head-to-head (ранг)
На тех же 3 чистых главах (17/18/19, исключая ch5/ch20-экспорт-баг) собери **P1a (одинарный дискурс, glm-5)** и **F-disc (gpt-5.4+дискурс)** → слепой пакет (monitor-паттерн, ключ отдельно, вне хостинга — копирайт). Оси: **стиль** + **span-верность** (раздельно), ≥2 независимых глаза на катастрофу. Владелец может дать слепой вердикт. Цель: **насколько близко дешёвый P1a подходит к фронтиру** — если близко по обеим осям, дорогой gpt-5.4 не нужен и на прозе.
### 3. Метрики/гейты (пре-рег)
Пер-конструкция fix-rate (детерм. где можно); доля проваленных смысл-трапов дешёвой; per-call usage/cost; leave-one-judge-out на soft-классах; катастроф-скрин к ПОБЕДИТЕЛЮ; omission-гард (агрессивный reflow ↔ пропуски — считать смысловые атомы). **НИКОГДА не гейтить художественность на BLEU/COMET.**
## Дешёвые фиксы (параллельно, вне критического пути ноги-2 — можно отдать в отчёт как готовое к бэкенду)
- **Глоссарий разрядов 甲/乙/丙/丁 → кириллица «класс А/Б/В/Г»** (владелец зафиксировал D37) + принудительная сверка; развести с `转`→«ранг/оборот». Курация сида — твоя зона, статусы → владельцу если спорно.
- Заметить классы санитайзер-дыр из re-gate (CJK-утечка `耳边` ch16.0; битые склейки черновика даже у фронтира) — в fix-лист бэкенда (не чинить код).
## Deliverable
`docs/experiments/14b-meaning-battery.md`: пре-рег (§1, заморожена коммитом) → таблица fix-rate по конструкциям×моделям (детерм.+судьи со спанами) → вывод по ноге-2 (нужен ли gpt-5.4, на каких классах, COGS-оценка) → P1a↔F-disc ранг → рекомендация (на ратификацию оркестратора, дефолт НЕ менять). **Ничего не коммитить, КРОМЕ пре-рег §1.**
## Дисциплина / бюджет
- **Остатки ключей после exp14 (D37):** OpenAI **~$6.77**, Gemini **~€0.39 (почти пусто — беречь/дропнуть)**, Kimi ~$5.80, ZAI/glm ~$8.31, xAI/grok ~$8.85, DeepSeek ~$8.98, Mistral ~$9. **Кап exp14b ≤$5**, per-call predicted-cost кап ОБЯЗАТЕЛЕН до каждого вызова (НЕ group — exp13/exp14 «0 ошибок» оказалось 36 ошибок+биллинг). Кончился ключ → стоп на нём.
- Слепота свята; пре-рег заморожен коммитом; аномалии провайдеров → вендор-дока + `/models`; `.env` не читать; тексты книги в git-доки ≤15 слов; каждый платный вызов персистит usage/cost. Полигонное Python-зеркало ↔ Go: при расхождении верить Go.
- **Методика (мемо eval-aggregation, ловил 3×):** детерм.-скоринг где можно; ≥2 кросс-семейных судьи на soft; leave-one-out; катастроф-скрин к победителю; независимость сигналов; НЕ дисконтировать свою панель ради фронтира; floor-клейм требует ≥3 конструкций, не n=1.