Issue exp14b polygon prompt: meaning-trap battery to settle whether gpt-5.4 escalation is needed plus P1a-vs-frontier ranking, per owner direction

This commit is contained in:
Claude (backend session) 2026-07-12 05:21:56 +03:00
parent 7ee668fba0
commit 7a30ab4fb6
4 changed files with 53 additions and 3 deletions

View file

@ -34,7 +34,7 @@
**Что уже сделано (D30→D35, залендено):** флип D1→билингв-редактор, reflow, output-санитайзер (+фикс D33.1), сид v2 подписан владельцем (D34.1); пере-прогон 25 глав связкой выполнен (инфра держится, флор D24.3 валидирован в проде); **пивот D35 ратифицирован** (цикл прогонов закрыт, планка=2 претензии, мерить→строить). exp13 закрыт (переводчик=flash, pro отклонён — D32). Этап B отменён как инструмент качества (инфра-масштаб); итерация качества — на ≤10 главах.
> **СТАТУС D36 (оркестратор №4, 12.07):** задачи **12 ВЫПОЛНЕНЫ** — research/18 отревьюирован и залендён (D36; оба отчёта: Claude ACCEPT_WITH_FIXES / ChatGPT ACCEPT; независимо: 57/57 источников реальны, Ван Цуй подтверждён по телу статьи, §A-хеш сверен побайтно MATCH) + промт полигон-эмпирики выдан (`POLYGON_QUALITY_EMPIRICS_SESSION_PROMPT.md`, D36). Бюджеты ключей подтверждены владельцем (OpenAI ~$9, Gemini ~€2.6, DeepSeek/ZAI/Kimi/xAI/Mistral ~$9; других нет — D36.1). Спент-промты заархивированы (D36.1). **Остаётся:** 3 (fidelity re-gate — полигон параллельно), 4 (бэкенд-фикс-лист D35.4 — в следующий бэкенд-пакет), 5 (readme чужих зон). Контракт D24→**D36**. Ниже — исходный список задач хендоффа (12 закрыты).
> **СТАТУС D36 (оркестратор №4, 12.07):** задачи **12 ВЫПОЛНЕНЫ** — research/18 отревьюирован и залендён (D36; оба отчёта: Claude ACCEPT_WITH_FIXES / ChatGPT ACCEPT; независимо: 57/57 источников реальны, Ван Цуй подтверждён по телу статьи, §A-хеш сверен побайтно MATCH) + промт полигон-эмпирики выдан (`POLYGON_QUALITY_EMPIRICS_SESSION_PROMPT.md`, D36). Бюджеты ключей подтверждены владельцем (OpenAI ~$9, Gemini ~€2.6, DeepSeek/ZAI/Kimi/xAI/Mistral ~$9; других нет — D36.1). Спент-промты заархивированы (D36.1). **Остаётся:** 4 (бэкенд-фикс-лист D35.4 + D37-фиксы: глоссарий А/Б/В/Г, omission-гард, CJK-утечка — в бэкенд-пакет под ROI), 5 (readme чужих зон). **D37 (12.07): exp14 отревьюирован+ратифицирован** (претензия-1=промпт-рычаг подтверждён; нога-2 gpt-5.4 ХОЛД-недомощна; A-2pass отклонён; разряды→кириллица А/Б/В/Г; re-gate хвост ~5-6, «13» завышено; fidelity re-gate D34.3 прогнан). **exp14b ВЫДАН** (`POLYGON_EXP14B_SESSION_PROMPT.md`; владелец выбрал перед бэкендом). Контракт D24→**D37**. Ниже — исходный список задач хендоффа (12 закрыты).
**⚠ ТВОИ НЕПОСРЕДСТВЕННЫЕ ЗАДАЧИ (по приоритету):**
1. **Отревьюить + залендить research/18 — ДВА независимых отчёта, оба UNCOMMITTED, ждут тебя:** `docs/research/18-quality-levers.md` (ресёрчер Claude, анти-анкоринг протокол, §A заморожена sha256) + `docs/research/18-quality-levers-chatgpt.md` (параллельный ChatGPT, запущен владельцем). Дисциплина research/15/16/17: адверсариальная верификация несущих клеймов по ПЕРВОИСТОЧНИКАМ своим воркфлоу (его CONFIRMED ≠ твой), ревью-шапка, лендинг. ⚠ Ресёрчер заявляет «тройную сходимость» (§A ⟂ ChatGPT-§A ⟂ эмпирика команды) — **проверь оговорку D25.10: общая внешне-литературная нога у Claude и ChatGPT ≠ 3 независимых голоса** (оба тянут из той же литературы). Ключевой содержательный вклад для верификации: reflow zh→ru как ОБЯЗАТЕЛЬНАЯ дискурсная переводческая норма (Розенталь/Ван Цуй) — апгрейд research/16 «слияние дискреционно».

View file

@ -0,0 +1,50 @@
# Промт: полигон-сессия exp14b — батарея смысл-трапов (нога-2) + ранг P1a↔фронтир (2026-07-12, D37, приоритет №1)
---
## Кто ты и зачем
Ты — **полигон-сессия** TextMachine, exp14b — прямое продолжение exp14 (ратифицировано D37). exp14 закрыло **претензию-1 (абзацы) = рычаг ПРОМПТА/активации** (дискурс-промпт реверстает у всех семей; фронтир+старый промпт рубит хуже дешёвого — доказано, ратифицировано). Осталось ДВЕ незакрытые вещи, и это ровно твоя задача — **домерить, НЕ утверждать:**
1. **Нога-2 (претензия-2, смысл внутри чанка) — НЕДО-МОЩНА.** exp14 нашёл: дешёвый glm-5 инвертирует двойное отрицание `没有一个不知道` (все знали→никто), grok-4.3 И gemini-3.1-pro тоже, **только gpt-5.4 чинит**. НО это **1 конструкция + один судья** на фронтире (gpt-5-mini self-excluded → фронтир судил только kimi). Дорогое COGS-решение «селективно гонять gpt-5.4 на смысл-мины» НЕ ратифицировано. **Твоя задача: батарея смысл-трапов ≥35 типов → робастна ли «только gpt-5.4», или конструкция-специфична; какую долю смысл-трапов дешёвая модель валит → стоит ли gpt-5.4-эскалация COGS.**
2. **P1a (рекомендованный near-term конфиг, одинарный дискурс-пасс) НИКОГДА не ранжировался против фронтира** — финалисты exp14 были {P0, A-2pass, F-disc}, P1a исключён. **Задача: P1a ↔ F-disc head-to-head** (насколько близко дешёвый дискурс подходит к фронтиру по прозе И верности).
Зона: `eval/` + `docs/experiments/14b-*.md` + секция «Полигон» в `PROGRESS.md`. Прямые API-вызовы из `eval/`-харнеса. **НЕ коммить батчи** (урок D37: exp14 закоммитил 6 батчей сам — фризь ТОЛЬКО пре-рег §1, остальное лендит оркестратор).
## Онбординг
1. `CLAUDE.md` → CURRENT-STATE → **D37 целиком** (мандат; + D36/D35) → **`docs/experiments/14-quality-empirics.md` С РЕВЬЮ-ШАПКОЙ ОРКЕСТРАТОРА** (там поправки: «13 катастроф» завышено; §2Б.3-панель-литерал-смещение = пере-натяжка; нога-2 недо-мощна).
2. **Мемо `eval-aggregation-no-manufactured-convergence` (ОБЯЗАТЕЛЬНО, вкл. exp14-грань D37):** НЕ дисконтируй свою панель, чтобы продвинуть фронтир; НЕ строй floor-клейм на n=1 + одном судье; катастроф-скрин к победителю; ≥2 независимых глаза на катастрофу (в exp14 A-2pass-катастрофу поймал только 1 из 2 внешних — n=1 мало).
3. `docs/experiments/00-provider-quirks.md`: deepseek thinking ON; gpt-5 `max_completion_tokens`/без temp/`reasoning_effort`; grok reasoning-ON аддитив, НЕ на архаичной ch1 (D22.5); gemini `-preview`/mandatory-thinking/`additive_total`.
## Пре-регистрация (закоммить §1 exp14b-дока ДО первого платного вызова — path-scoped только этот док; D30.10)
### 1. Батарея смысл-трапов (нога-2)
Собери **≥35 КЛАССОВ конструкций × ≥2 инстанса** из реальной книги (`rerun/records.json` + срез), каждый размечен `supporting_span` + опустимый_смысл` ДО генерации. Классы (бери реальные места, часть уже известна):
- **(a) полярность / двойное отрицание** (`没有一个不知道`-класс, ch7.0 — уже T1);
- **(b) числа/масштаб** (`四分/八分`, `分=1%`/`成=10%` — ch10.1, редактор съехал в 10×);
- **(c) ранг/иерархия** (`丙等→В` не Б — ch9.1/ch18.0; `人上之人`«над людьми» не «среди»; `四代族长` глава не старейшина — ch16.0);
- **(d) контрфактив** (`否则…` — exp14 передали верно, контроль-класс: убедиться, что не ломается);
- **(e) чэнъюй-сплющивание** (`物是人非`«вещи те же, люди иные»→«всё изменилось» — T2);
- **(f) кореференция/нулевое подлежащее** (кто субъект — zh zero-anaphora, экспликация в РЯ).
**Дизайн армов (ПРОМПТ константен = дискурс; варьируем РЕДАКТОРА-модель на общем flash-черновике):** cheap `glm-5` (baseline) × frontier `gpt-5.4` × frontier `grok-4.3-ON`. **Gemini почти исчерпан (~€0.39 — см. бюджет) → НЕ полноценный арм; макс 23 спот-ре-теста ключевых трапов ИЛИ дропни, отметив.**
**Скоринг — ДЕТЕРМИНИРОВАННО где можно (это чище судьи):** классы (a)/(b)/(c)/(d) проверяемы по правилу (полярность/число/ранг/направление) — скорь программно + цитируй спан. Классы (e)/(f) — **≥2 КРОСС-семейных span-цитирующих судьи** (self-family exclusion; kimi + gpt-5-mini + mistral как третий не-семейный; НЕ один судья на арм). Пер-конструкция fix-rate: cheap vs каждый фронтир. **Вывод: робастна ли «только gpt-5.4 чинит» по классам, или отдельные классы чинит и grok/дешёвый; доля смысл-трапов, что валит дешёвая → COGS-оценка селективной эскалации (сколько чанков триггернут gpt-5.4 × цена).**
### 2. P1a ↔ F-disc head-to-head (ранг)
На тех же 3 чистых главах (17/18/19, исключая ch5/ch20-экспорт-баг) собери **P1a (одинарный дискурс, glm-5)** и **F-disc (gpt-5.4+дискурс)** → слепой пакет (monitor-паттерн, ключ отдельно, вне хостинга — копирайт). Оси: **стиль** + **span-верность** (раздельно), ≥2 независимых глаза на катастрофу. Владелец может дать слепой вердикт. Цель: **насколько близко дешёвый P1a подходит к фронтиру** — если близко по обеим осям, дорогой gpt-5.4 не нужен и на прозе.
### 3. Метрики/гейты (пре-рег)
Пер-конструкция fix-rate (детерм. где можно); доля проваленных смысл-трапов дешёвой; per-call usage/cost; leave-one-judge-out на soft-классах; катастроф-скрин к ПОБЕДИТЕЛЮ; omission-гард (агрессивный reflow ↔ пропуски — считать смысловые атомы). **НИКОГДА не гейтить художественность на BLEU/COMET.**
## Дешёвые фиксы (параллельно, вне критического пути ноги-2 — можно отдать в отчёт как готовое к бэкенду)
- **Глоссарий разрядов 甲/乙/丙/丁 → кириллица «класс А/Б/В/Г»** (владелец зафиксировал D37) + принудительная сверка; развести с `转`→«ранг/оборот». Курация сида — твоя зона, статусы → владельцу если спорно.
- Заметить классы санитайзер-дыр из re-gate (CJK-утечка `耳边` ch16.0; битые склейки черновика даже у фронтира) — в fix-лист бэкенда (не чинить код).
## Deliverable
`docs/experiments/14b-meaning-battery.md`: пре-рег (§1, заморожена коммитом) → таблица fix-rate по конструкциям×моделям (детерм.+судьи со спанами) → вывод по ноге-2 (нужен ли gpt-5.4, на каких классах, COGS-оценка) → P1a↔F-disc ранг → рекомендация (на ратификацию оркестратора, дефолт НЕ менять). **Ничего не коммитить, КРОМЕ пре-рег §1.**
## Дисциплина / бюджет
- **Остатки ключей после exp14 (D37):** OpenAI **~$6.77**, Gemini **~€0.39 (почти пусто — беречь/дропнуть)**, Kimi ~$5.80, ZAI/glm ~$8.31, xAI/grok ~$8.85, DeepSeek ~$8.98, Mistral ~$9. **Кап exp14b ≤$5**, per-call predicted-cost кап ОБЯЗАТЕЛЕН до каждого вызова (НЕ group — exp13/exp14 «0 ошибок» оказалось 36 ошибок+биллинг). Кончился ключ → стоп на нём.
- Слепота свята; пре-рег заморожен коммитом; аномалии провайдеров → вендор-дока + `/models`; `.env` не читать; тексты книги в git-доки ≤15 слов; каждый платный вызов персистит usage/cost. Полигонное Python-зеркало ↔ Go: при расхождении верить Go.
- **Методика (мемо eval-aggregation, ловил 3×):** детерм.-скоринг где можно; ≥2 кросс-семейных судьи на soft; leave-one-out; катастроф-скрин к победителю; независимость сигналов; НЕ дисконтировать свою панель ради фронтира; floor-клейм требует ≥3 конструкций, не n=1.

View file

@ -42,7 +42,7 @@
**12.07 (№4): D36.1 — гигиена доков + бюджеты (по запросу владельца).** Заархивированы **5** спент-промтов (`archive/prompts/`, git mv, история не переписана — D23.3): ресёрчер/exp13/санитайзер-фикс/приёмка-v2/D152-этап-А. **`POLYGON_PACKAGE4` НЕ архивирован** (проверка по запросу владельца): как сессия не запускался, отработана лишь task-1 сид-мн.ч. (в exp13/D32); **residual жив** (D22.6 судья-дублёр — блокер пилота, D25.7 echo-кал, миграция memory_eval с 2.5-flash, пилот-пре-рег, P4-хвост) — **пилот/18+/echo-трек, ОРТОГОНАЛЬНО exp14** (не вносить); оставлен активным со статус-баннером как residual-трекер до активации пилота. Активны `ORCHESTRATOR_*` + `POLYGON_QUALITY_EMPIRICS_*` (exp14) + `POLYGON_PACKAGE4_*` (отложен); README-карта + титул D-лога D35→D36 актуализированы. **Бюджеты подтверждены владельцем:** OpenAI ~$9, Gemini ~€2.6, DeepSeek/ZAI/Kimi/xAI/Mistral ~$9; других нет; «полигон делает что нужно в рамках» → блокер фронтир-ceiling снят (exp14: GPT-5 основной фронтир, Gemini точечно/мета-ревьюер, grok не на ch1; per-call кап + пре-рег). D36.1 — в D-логе.
**12.07 (№4): exp14 (эмпирика рычагов качества) отревьюирован и ратифицирован — D37.** Полигон прогнал exp14 (нарезка×промпт 2×2 + аблации + фронтир 3-семейный gpt-5.4/gemini/grok + кривая + fidelity re-gate + слепые финалисты P0/A-2pass/F-disc), закоммитил 6 батчей САМ (отклонение — впредь фризить только пре-рег). Владелец прочёл монитор слепо (3 главы) + 2 внешние сессии (ChatGPT+Claude). **Независимая верификация — 7-агентный воркфлоу span-уровнем ($0):** (1) **Претензия-1=промпт-рычаг ПОДТВЕРЖДЕНА** (F-base фронтир+старый промпт 1.75 spp рубит хуже P0 1.95; дискурс-промпт реверстает у всех). (2) **A-2pass-катастрофа 人上之人 РЕАЛЬНА** (span; одинарный P0 её починил → одинарный дискурс безопаснее). (3) **Разряды 甲乙丙 плывут** (ch9.1 В→Б, ch18.1 «цинское качество») → **владелец выбрал кириллицу «класс А/Б/В/Г»**. (4) **T1-floor (только gpt-5.4 чинит двойное отрицание, grok/gemini инвертируют) ВЕРИФИЦИРОВАН, но n=1 + одно-судейно на фронтире → нога-2 (gpt-5.4-эскалация) НЕДО-МОЩНА, ХОЛД.** (5) **Поправки:** «13 катастроф» завышено (~5-6 реальных; kimi оверфлаг, ошибся 29/55; ch11.0 — редактор УЛУЧШИЛ); §2Б.3 «панель литерал-смещена→P0 не вернее» = пере-натяжка (T1 в ch7 вне ранг-выборки; IN-SAMPLE спан выгораживает P0); «0 ошибок» неточно (36 ошиблись+билленулись $0.89). Деньги $8.67 (в 2%), капы соблюдены, Gemini €2.21=85% бюджета. **Следующий шаг — exp14b:** батарея смысл-трапов (≥3-5 типов, ≥2 фронтир-судьи) для ноги-2 + ранг P1a head-to-head vs F-disc (финалисты его исключили). Курс не разворачивается; планка = 2 претензии ИНТЕРИМ; пилот не разбавляется. (Разбор — D37.)
**12.07 (№4): exp14 (эмпирика рычагов качества) отревьюирован и ратифицирован — D37.** Полигон прогнал exp14 (нарезка×промпт 2×2 + аблации + фронтир 3-семейный gpt-5.4/gemini/grok + кривая + fidelity re-gate + слепые финалисты P0/A-2pass/F-disc), закоммитил 6 батчей САМ (отклонение — впредь фризить только пре-рег). Владелец прочёл монитор слепо (3 главы) + 2 внешние сессии (ChatGPT+Claude). **Независимая верификация — 7-агентный воркфлоу span-уровнем ($0):** (1) **Претензия-1=промпт-рычаг ПОДТВЕРЖДЕНА** (F-base фронтир+старый промпт 1.75 spp рубит хуже P0 1.95; дискурс-промпт реверстает у всех). (2) **A-2pass-катастрофа 人上之人 РЕАЛЬНА** (span; одинарный P0 её починил → одинарный дискурс безопаснее). (3) **Разряды 甲乙丙 плывут** (ch9.1 В→Б, ch18.1 «цинское качество») → **владелец выбрал кириллицу «класс А/Б/В/Г»**. (4) **T1-floor (только gpt-5.4 чинит двойное отрицание, grok/gemini инвертируют) ВЕРИФИЦИРОВАН, но n=1 + одно-судейно на фронтире → нога-2 (gpt-5.4-эскалация) НЕДО-МОЩНА, ХОЛД.** (5) **Поправки:** «13 катастроф» завышено (~5-6 реальных; kimi оверфлаг, ошибся 29/55; ch11.0 — редактор УЛУЧШИЛ); §2Б.3 «панель литерал-смещена→P0 не вернее» = пере-натяжка (T1 в ch7 вне ранг-выборки; IN-SAMPLE спан выгораживает P0); «0 ошибок» неточно (36 ошиблись+билленулись $0.89). Деньги $8.67 (в 2%), капы соблюдены, Gemini €2.21=85% бюджета. **Следующий шаг — exp14b (промт ВЫДАН, `POLYGON_EXP14B_SESSION_PROMPT.md`; владелец выбрал exp14b ПЕРЕД бэкендом — строить бэкенд один раз под финальный конфиг):** батарея смысл-трапов (≥3-5 типов, детерм.-скоринг + ≥2 фронтир-судьи) для ноги-2 + ранг P1a head-to-head vs F-disc (финалисты его исключили); дешёвые фиксы (глоссарий А/Б/В/Г) параллельно. Курс не разворачивается; планка = 2 претензии ИНТЕРИМ; пилот не разбавляется. (Разбор — D37.)
## Приёмка Ф1 — ПЕРЕ-ПРОГОН 25 глав кандидат-конфигом (билингв glm-5 + reflow + сид v2 + санитайзер), 2026-07-12 (D30.9/D34.2)

View file

@ -16,7 +16,7 @@
- `experiments/` — эмпирика «Полигона»: `00-provider-quirks` (читать перед любым вызовом провайдера), `01-token-calibration`, `02-refusal-benchmark`, `03-local-stand`, `04-editor-quality`, `06-local-extraction`, `07-coverage-precision`, `08-cost-model-v2` (актуальная денежная модель), `09-pilot-protocol` (пилот Ф2.5 + поправки D13), `10-explicit-benchmark` (18+ violence-рука канала B), `11-erotica-benchmark` (erotica по трём парам/регистрам — закрытие D14.4, D22).
- `research/` — фактура исследований 0405.07: `0110` базовые, `11-gap-*` добор критиком, `12-*` режимы отказа/отзывы/таксономии (+ два внешних материала с провенанс-шапками), `13` валидация памяти, `14` адаптивная память, `15` голос и состояние (принят, D21), **`16` ридер-IDE (принят с ревью-шапкой, D29)**, **`17` внешняя критика GPT-5.6 (принят с ревью-шапкой, D25)** — у 16/17 читать шапку прежде тела. ⚠ Часть под superseded-баннерами (01/02/03/04/05/09 и gap-1/2/5) — **читай баннер прежде содержимого**.
- `PROGRESS.md`**журнал** (CURRENT-STATE сверху, ниже хронология; НЕ источник решений).
- **Активные хендофф-промты** (пивот D35→D37, очередь «мерить→строить»): [`ORCHESTRATOR_SESSION_PROMPT.md`](ORCHESTRATOR_SESSION_PROMPT.md) (роль оркестратора) · [`POLYGON_PACKAGE4_SESSION_PROMPT.md`](POLYGON_PACKAGE4_SESSION_PROMPT.md) (**ОТЛОЖЕН, пилот-residual:** task-1 закрыт exp13/D32; открыты D22.6 судья-дублёр + D25.7 echo-кал + пилот-пре-рег + P4-хвост — для пилота, не exp14). **СЛЕДУЮЩИЙ (свежий промт при направлении владельца):** exp14b — батарея смысл-трапов для ноги-2 (gpt-5.4-эскалация недо-мощна, D37) + ранг P1a↔F-disc; ∥ дешёвые фиксы (дискурс-промпт / глоссарий разрядов кириллица А/Б/В/Г / санитайзер) → бэкенд под ROI (стейдж Б/В D15.2 — свежий промт, дизайн = спека v3.1). Закрытые в `archive/prompts/`: exp14 (нарезка×промпт+blind-eval)→D37, research/18-ресёрчер→D36, exp13→D32, санитайзер-фикс→D33.1, приёмка v2 (цикл ЗАКРЫТ D35), D152-этап-А→D33, пакеты №35, erotica, «Голос», r/17, r/16, exp12→D30.
- **Активные хендофф-промты** (пивот D35→D37, очередь «мерить→строить»): [`ORCHESTRATOR_SESSION_PROMPT.md`](ORCHESTRATOR_SESSION_PROMPT.md) (роль оркестратора) · [`POLYGON_PACKAGE4_SESSION_PROMPT.md`](POLYGON_PACKAGE4_SESSION_PROMPT.md) (**ОТЛОЖЕН, пилот-residual:** task-1 закрыт exp13/D32; открыты D22.6 судья-дублёр + D25.7 echo-кал + пилот-пре-рег + P4-хвост — для пилота, не exp14). [`POLYGON_EXP14B_SESSION_PROMPT.md`](POLYGON_EXP14B_SESSION_PROMPT.md) (**СЛЕДУЮЩИЙ, ВЫДАН — владелец выбрал перед бэкендом:** батарея смысл-трапов для ноги-2 [gpt-5.4-эскалация недо-мощна, D37] + ранг P1a↔F-disc; ∥ дешёвые фиксы: дискурс-промпт / глоссарий разрядов кириллица А/Б/В/Г / санитайзер) → бэкенд под ROI (стейдж Б/В D15.2 — свежий промт, дизайн = спека v3.1). Закрытые в `archive/prompts/`: exp14 (нарезка×промпт+blind-eval)→D37, research/18-ресёрчер→D36, exp13→D32, санитайзер-фикс→D33.1, приёмка v2 (цикл ЗАКРЫТ D35), D152-этап-А→D33, пакеты №35, erotica, «Голос», r/17, r/16, exp12→D30.
- `archive/` — закрытые сессионные промты (только история, инструкции оттуда не исполнять).
## Статус (2026-07-12, пост-пивот D35)