textmachine/docs/archive/prompts/POLYGON_EXP14B_SESSION_PROMPT.md

10 KiB
Raw Blame History

Промт: полигон-сессия exp14b — батарея смысл-трапов (нога-2) + ранг P1a↔фронтир (2026-07-12, D37, приоритет №1)


Кто ты и зачем

Ты — полигон-сессия TextMachine, exp14b — прямое продолжение exp14 (ратифицировано D37). exp14 закрыло претензию-1 (абзацы) = рычаг ПРОМПТА/активации (дискурс-промпт реверстает у всех семей; фронтир+старый промпт рубит хуже дешёвого — доказано, ратифицировано). Осталось ДВЕ незакрытые вещи, и это ровно твоя задача — домерить, НЕ утверждать:

  1. Нога-2 (претензия-2, смысл внутри чанка) — НЕДО-МОЩНА. exp14 нашёл: дешёвый glm-5 инвертирует двойное отрицание 没有一个不知道 (все знали→никто), grok-4.3 И gemini-3.1-pro тоже, только gpt-5.4 чинит. НО это 1 конструкция + один судья на фронтире (gpt-5-mini self-excluded → фронтир судил только kimi). Дорогое COGS-решение «селективно гонять gpt-5.4 на смысл-мины» НЕ ратифицировано. Твоя задача: батарея смысл-трапов ≥35 типов → робастна ли «только gpt-5.4», или конструкция-специфична; какую долю смысл-трапов дешёвая модель валит → стоит ли gpt-5.4-эскалация COGS.
  2. P1a (рекомендованный near-term конфиг, одинарный дискурс-пасс) НИКОГДА не ранжировался против фронтира — финалисты exp14 были {P0, A-2pass, F-disc}, P1a исключён. Задача: P1a ↔ F-disc head-to-head (насколько близко дешёвый дискурс подходит к фронтиру по прозе И верности).

Зона: eval/ + docs/experiments/14b-*.md + секция «Полигон» в PROGRESS.md. Прямые API-вызовы из eval/-харнеса. НЕ коммить батчи (урок D37: exp14 закоммитил 6 батчей сам — фризь ТОЛЬКО пре-рег §1, остальное лендит оркестратор).

Онбординг

  1. CLAUDE.md → CURRENT-STATE → D37 целиком (мандат; + D36/D35) → docs/experiments/14-quality-empirics.md С РЕВЬЮ-ШАПКОЙ ОРКЕСТРАТОРА (там поправки: «13 катастроф» завышено; §2Б.3-панель-литерал-смещение = пере-натяжка; нога-2 недо-мощна).
  2. Мемо eval-aggregation-no-manufactured-convergence (ОБЯЗАТЕЛЬНО, вкл. exp14-грань D37): НЕ дисконтируй свою панель, чтобы продвинуть фронтир; НЕ строй floor-клейм на n=1 + одном судье; катастроф-скрин к победителю; ≥2 независимых глаза на катастрофу (в exp14 A-2pass-катастрофу поймал только 1 из 2 внешних — n=1 мало).
  3. docs/experiments/00-provider-quirks.md: deepseek thinking ON; gpt-5 max_completion_tokens/без temp/reasoning_effort; grok reasoning-ON аддитив, НЕ на архаичной ch1 (D22.5); gemini -preview/mandatory-thinking/additive_total.

Пре-регистрация (закоммить §1 exp14b-дока ДО первого платного вызова — path-scoped только этот док; D30.10)

1. Батарея смысл-трапов (нога-2)

Собери ≥35 КЛАССОВ конструкций × ≥2 инстанса из реальной книги (rerun/records.json + срез), каждый размечен supporting_span + допустимый_смысл ДО генерации. Классы (бери реальные места, часть уже известна):

  • (a) полярность / двойное отрицание (没有一个不知道-класс, ch7.0 — уже T1);
  • (b) числа/масштаб (四分/八分, 分=1%/成=10% — ch10.1, редактор съехал в 10×);
  • (c) ранг/иерархия (丙等→В не Б — ch9.1/ch18.0; 人上之人«над людьми» не «среди»; 四代族长 глава не старейшина — ch16.0);
  • (d) контрфактив (否则… — exp14 передали верно, контроль-класс: убедиться, что не ломается);
  • (e) чэнъюй-сплющивание (物是人非«вещи те же, люди иные»→«всё изменилось» — T2);
  • (f) кореференция/нулевое подлежащее (кто субъект — zh zero-anaphora, экспликация в РЯ). Дизайн армов (ПРОМПТ константен = дискурс; варьируем РЕДАКТОРА-модель на общем flash-черновике): cheap glm-5 (baseline) × frontier gpt-5.4 × frontier grok-4.3-ON. Gemini почти исчерпан (~€0.39 — см. бюджет) → НЕ полноценный арм; макс 23 спот-ре-теста ключевых трапов ИЛИ дропни, отметив.

Скоринг — ДЕТЕРМИНИРОВАННО где можно (это чище судьи): классы (a)/(b)/(c)/(d) проверяемы по правилу (полярность/число/ранг/направление) — скорь программно + цитируй спан. Классы (e)/(f) — ≥2 КРОСС-семейных span-цитирующих судьи (self-family exclusion; kimi + gpt-5-mini + mistral как третий не-семейный; НЕ один судья на арм). Пер-конструкция fix-rate: cheap vs каждый фронтир. Вывод: робастна ли «только gpt-5.4 чинит» по классам, или отдельные классы чинит и grok/дешёвый; доля смысл-трапов, что валит дешёвая → COGS-оценка селективной эскалации (сколько чанков триггернут gpt-5.4 × цена).

2. P1a ↔ F-disc head-to-head (ранг)

На тех же 3 чистых главах (17/18/19, исключая ch5/ch20-экспорт-баг) собери P1a (одинарный дискурс, glm-5) и F-disc (gpt-5.4+дискурс) → слепой пакет (monitor-паттерн, ключ отдельно, вне хостинга — копирайт). Оси: стиль + span-верность (раздельно), ≥2 независимых глаза на катастрофу. Владелец может дать слепой вердикт. Цель: насколько близко дешёвый P1a подходит к фронтиру — если близко по обеим осям, дорогой gpt-5.4 не нужен и на прозе.

3. Метрики/гейты (пре-рег)

Пер-конструкция fix-rate (детерм. где можно); доля проваленных смысл-трапов дешёвой; per-call usage/cost; leave-one-judge-out на soft-классах; катастроф-скрин к ПОБЕДИТЕЛЮ; omission-гард (агрессивный reflow ↔ пропуски — считать смысловые атомы). НИКОГДА не гейтить художественность на BLEU/COMET.

Дешёвые фиксы (параллельно, вне критического пути ноги-2 — можно отдать в отчёт как готовое к бэкенду)

  • Глоссарий разрядов 甲/乙/丙/丁 → кириллица «класс А/Б/В/Г» (владелец зафиксировал D37) + принудительная сверка; развести с →«ранг/оборот». Курация сида — твоя зона, статусы → владельцу если спорно.
  • Заметить классы санитайзер-дыр из re-gate (CJK-утечка 耳边 ch16.0; битые склейки черновика даже у фронтира) — в fix-лист бэкенда (не чинить код).

Deliverable

docs/experiments/14b-meaning-battery.md: пре-рег (§1, заморожена коммитом) → таблица fix-rate по конструкциям×моделям (детерм.+судьи со спанами) → вывод по ноге-2 (нужен ли gpt-5.4, на каких классах, COGS-оценка) → P1a↔F-disc ранг → рекомендация (на ратификацию оркестратора, дефолт НЕ менять). Ничего не коммитить, КРОМЕ пре-рег §1.

Дисциплина / бюджет

  • Остатки ключей после exp14 (D37): OpenAI ~$6.77, Gemini ~€0.39 (почти пусто — беречь/дропнуть), Kimi ~$5.80, ZAI/glm ~$8.31, xAI/grok ~$8.85, DeepSeek ~$8.98, Mistral ~$9. Кап exp14b ≤$5, per-call predicted-cost кап ОБЯЗАТЕЛЕН до каждого вызова (НЕ group — exp13/exp14 «0 ошибок» оказалось 36 ошибок+биллинг). Кончился ключ → стоп на нём.
  • Слепота свята; пре-рег заморожен коммитом; аномалии провайдеров → вендор-дока + /models; .env не читать; тексты книги в git-доки ≤15 слов; каждый платный вызов персистит usage/cost. Полигонное Python-зеркало ↔ Go: при расхождении верить Go.
  • Методика (мемо eval-aggregation, ловил 3×): детерм.-скоринг где можно; ≥2 кросс-семейных судьи на soft; leave-one-out; катастроф-скрин к победителю; независимость сигналов; НЕ дисконтировать свою панель ради фронтира; floor-клейм требует ≥3 конструкций, не n=1.