10 KiB
Промт: полигон-сессия exp14b — батарея смысл-трапов (нога-2) + ранг P1a↔фронтир (2026-07-12, D37, приоритет №1)
Кто ты и зачем
Ты — полигон-сессия TextMachine, exp14b — прямое продолжение exp14 (ратифицировано D37). exp14 закрыло претензию-1 (абзацы) = рычаг ПРОМПТА/активации (дискурс-промпт реверстает у всех семей; фронтир+старый промпт рубит хуже дешёвого — доказано, ратифицировано). Осталось ДВЕ незакрытые вещи, и это ровно твоя задача — домерить, НЕ утверждать:
- Нога-2 (претензия-2, смысл внутри чанка) — НЕДО-МОЩНА. exp14 нашёл: дешёвый glm-5 инвертирует двойное отрицание
没有一个不知道(все знали→никто), grok-4.3 И gemini-3.1-pro тоже, только gpt-5.4 чинит. НО это 1 конструкция + один судья на фронтире (gpt-5-mini self-excluded → фронтир судил только kimi). Дорогое COGS-решение «селективно гонять gpt-5.4 на смысл-мины» НЕ ратифицировано. Твоя задача: батарея смысл-трапов ≥3–5 типов → робастна ли «только gpt-5.4», или конструкция-специфична; какую долю смысл-трапов дешёвая модель валит → стоит ли gpt-5.4-эскалация COGS. - P1a (рекомендованный near-term конфиг, одинарный дискурс-пасс) НИКОГДА не ранжировался против фронтира — финалисты exp14 были {P0, A-2pass, F-disc}, P1a исключён. Задача: P1a ↔ F-disc head-to-head (насколько близко дешёвый дискурс подходит к фронтиру по прозе И верности).
Зона: eval/ + docs/experiments/14b-*.md + секция «Полигон» в PROGRESS.md. Прямые API-вызовы из eval/-харнеса. НЕ коммить батчи (урок D37: exp14 закоммитил 6 батчей сам — фризь ТОЛЬКО пре-рег §1, остальное лендит оркестратор).
Онбординг
CLAUDE.md→ CURRENT-STATE → D37 целиком (мандат; + D36/D35) →docs/experiments/14-quality-empirics.mdС РЕВЬЮ-ШАПКОЙ ОРКЕСТРАТОРА (там поправки: «13 катастроф» завышено; §2Б.3-панель-литерал-смещение = пере-натяжка; нога-2 недо-мощна).- Мемо
eval-aggregation-no-manufactured-convergence(ОБЯЗАТЕЛЬНО, вкл. exp14-грань D37): НЕ дисконтируй свою панель, чтобы продвинуть фронтир; НЕ строй floor-клейм на n=1 + одном судье; катастроф-скрин к победителю; ≥2 независимых глаза на катастрофу (в exp14 A-2pass-катастрофу поймал только 1 из 2 внешних — n=1 мало). docs/experiments/00-provider-quirks.md: deepseek thinking ON; gpt-5max_completion_tokens/без temp/reasoning_effort; grok reasoning-ON аддитив, НЕ на архаичной ch1 (D22.5); gemini-preview/mandatory-thinking/additive_total.
Пре-регистрация (закоммить §1 exp14b-дока ДО первого платного вызова — path-scoped только этот док; D30.10)
1. Батарея смысл-трапов (нога-2)
Собери ≥3–5 КЛАССОВ конструкций × ≥2 инстанса из реальной книги (rerun/records.json + срез), каждый размечен supporting_span + допустимый_смысл ДО генерации. Классы (бери реальные места, часть уже известна):
- (a) полярность / двойное отрицание (
没有一个不知道-класс, ch7.0 — уже T1); - (b) числа/масштаб (
四分/八分,分=1%/成=10%— ch10.1, редактор съехал в 10×); - (c) ранг/иерархия (
丙等→Вне Б — ch9.1/ch18.0;人上之人«над людьми» не «среди»;四代族长глава не старейшина — ch16.0); - (d) контрфактив (
否则…— exp14 передали верно, контроль-класс: убедиться, что не ломается); - (e) чэнъюй-сплющивание (
物是人非«вещи те же, люди иные»→«всё изменилось» — T2); - (f) кореференция/нулевое подлежащее (кто субъект — zh zero-anaphora, экспликация в РЯ).
Дизайн армов (ПРОМПТ константен = дискурс; варьируем РЕДАКТОРА-модель на общем flash-черновике): cheap
glm-5(baseline) × frontiergpt-5.4× frontiergrok-4.3-ON. Gemini почти исчерпан (~€0.39 — см. бюджет) → НЕ полноценный арм; макс 2–3 спот-ре-теста ключевых трапов ИЛИ дропни, отметив.
Скоринг — ДЕТЕРМИНИРОВАННО где можно (это чище судьи): классы (a)/(b)/(c)/(d) проверяемы по правилу (полярность/число/ранг/направление) — скорь программно + цитируй спан. Классы (e)/(f) — ≥2 КРОСС-семейных span-цитирующих судьи (self-family exclusion; kimi + gpt-5-mini + mistral как третий не-семейный; НЕ один судья на арм). Пер-конструкция fix-rate: cheap vs каждый фронтир. Вывод: робастна ли «только gpt-5.4 чинит» по классам, или отдельные классы чинит и grok/дешёвый; доля смысл-трапов, что валит дешёвая → COGS-оценка селективной эскалации (сколько чанков триггернут gpt-5.4 × цена).
2. P1a ↔ F-disc head-to-head (ранг)
На тех же 3 чистых главах (17/18/19, исключая ch5/ch20-экспорт-баг) собери P1a (одинарный дискурс, glm-5) и F-disc (gpt-5.4+дискурс) → слепой пакет (monitor-паттерн, ключ отдельно, вне хостинга — копирайт). Оси: стиль + span-верность (раздельно), ≥2 независимых глаза на катастрофу. Владелец может дать слепой вердикт. Цель: насколько близко дешёвый P1a подходит к фронтиру — если близко по обеим осям, дорогой gpt-5.4 не нужен и на прозе.
3. Метрики/гейты (пре-рег)
Пер-конструкция fix-rate (детерм. где можно); доля проваленных смысл-трапов дешёвой; per-call usage/cost; leave-one-judge-out на soft-классах; катастроф-скрин к ПОБЕДИТЕЛЮ; omission-гард (агрессивный reflow ↔ пропуски — считать смысловые атомы). НИКОГДА не гейтить художественность на BLEU/COMET.
Дешёвые фиксы (параллельно, вне критического пути ноги-2 — можно отдать в отчёт как готовое к бэкенду)
- Глоссарий разрядов 甲/乙/丙/丁 → кириллица «класс А/Б/В/Г» (владелец зафиксировал D37) + принудительная сверка; развести с
转→«ранг/оборот». Курация сида — твоя зона, статусы → владельцу если спорно. - Заметить классы санитайзер-дыр из re-gate (CJK-утечка
耳边ch16.0; битые склейки черновика даже у фронтира) — в fix-лист бэкенда (не чинить код).
Deliverable
docs/experiments/14b-meaning-battery.md: пре-рег (§1, заморожена коммитом) → таблица fix-rate по конструкциям×моделям (детерм.+судьи со спанами) → вывод по ноге-2 (нужен ли gpt-5.4, на каких классах, COGS-оценка) → P1a↔F-disc ранг → рекомендация (на ратификацию оркестратора, дефолт НЕ менять). Ничего не коммитить, КРОМЕ пре-рег §1.
Дисциплина / бюджет
- Остатки ключей после exp14 (D37): OpenAI ~$6.77, Gemini ~€0.39 (почти пусто — беречь/дропнуть), Kimi ~$5.80, ZAI/glm ~$8.31, xAI/grok ~$8.85, DeepSeek ~$8.98, Mistral ~$9. Кап exp14b ≤$5, per-call predicted-cost кап ОБЯЗАТЕЛЕН до каждого вызова (НЕ group — exp13/exp14 «0 ошибок» оказалось 36 ошибок+биллинг). Кончился ключ → стоп на нём.
- Слепота свята; пре-рег заморожен коммитом; аномалии провайдеров → вендор-дока +
/models;.envне читать; тексты книги в git-доки ≤15 слов; каждый платный вызов персистит usage/cost. Полигонное Python-зеркало ↔ Go: при расхождении верить Go. - Методика (мемо eval-aggregation, ловил 3×): детерм.-скоринг где можно; ≥2 кросс-семейных судьи на soft; leave-one-out; катастроф-скрин к победителю; независимость сигналов; НЕ дисконтировать свою панель ради фронтира; floor-клейм требует ≥3 конструкций, не n=1.