textmachine/docs/experiments/14b-meaning-battery.md

178 lines
31 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

# Эксперимент 14b. Батарея смысл-трапов (нога-2) + ранг P1a↔F-disc
<!-- ─────────────────────────────────────────────────────────────────────────
ОРКЕСТРАТОР — РЕВЬЮ-ШАПКА (D38, 12.07 №4). §1 заморожен коммитом (48e3f39); §2 залендён
оркестратором (сессия НЕ коммитила батчи — процесс-фикс D37 отработал). Разбор — PROGRESS §D38 + D-лог D38.
ВЕРДИКТ: **ACCEPT_WITH_FIXES** (ИНТЕРИМ пре-скрин, НЕ пилот). ЛУЧШИЙ по дисциплине полигон-
прогон: self-review НАШЁЛ+ПОЧИНИЛ 2 бага до вывода (gpt-5.4 reasoning=medium обрезал F 9.1;
deepseek обрезал D 6.0), ≥2 судьи на soft, DET ручной span-читкой (авто-скорер брикнул — сам
отверг), честный учёт 13 ошибок, floor-тест на 6 семьях, дефолт не менял. Урок мандата само-
проверки (CLAUDE.md 12.07) отработал живьём.
НЕЗАВИСИМАЯ ВЕРИФИКАЦИЯ (3 параллельных агента, span-читка сырья, refute-by-default, $0):
- **«ТОЛЬКО gpt-5.4 чинит смысл» ОПРОВЕРГНУТО — подтверждено cell-for-cell.** a1 (двойн.отриц
ch7.0): C(glm)✗«ни один», F(gpt-5.4)✓, X(grok)✗«ни один», **D(deepseek-pro)✓«знал каждый»,
M(mistral)✓«знали все без исключения»**. Дешёвый mistral чинит то, что текущий дефолт glm
ИНВЕРТИРУЕТ. Провалы РАЗБРОСАНЫ (a1: C+X; c1: X+D; c3: C+M) — модели безупречной/безнадёжной
нет; одной «эскалации» на всё нет. *(Уточнение: c1-M = ✓«над толпой», отчёт дал «?» → M имеет
0 способностных провалов.)*
- **Глоссарий-корень ПОДТВЕРЖДЁН по file:line и УСИЛЕН.** `renderEditorConstraintBlock`
(`memory.go:489` — CONFIRMED-only) исключает draft `四代族长`; хуже — `suppressContained`
(longest-match A3) СЪЕДАЕТ верный approved `族长→«глава клана»` (вложен в draft-长ий 四代族长),
оставляя в editor-констрейнте только approved-соседа `家老→«старейшина»`. Draft-запись АКТИВНО
ВРЕДНА. Empirics: `injection_blocks.json 16/0` несёт «старейшина», НЕ «Четвёртый глава рода».
glm/mistral (глоссарий-обедиентные) подтянули «старейшину»; gpt/grok/deepseek дали верное из
исходника → это НЕ непонимание, а статус сида. Promote draft→approved — sound (не бьёт коллизии).
- **P1a(glm-дискурс) ≈ F-disc(gpt-5.4) mean_spp ТАЙ** (пересчёт C 2.56 / F 2.65; отчёт 2.52/2.55
— в допуске, то же направление). ⚠ **`share_1sent` (0.381/0.427) НЕ воспроизводится** (пересчёт
~0.280.31, направление C<F ФЛИПАЕТ) — тай на mean_spp держится, но share_1sent как напечатан
неверифицируем; в отчёте пометка.
- **Soft: 0 катастроф ≥2-глазами — MATCH** (все 8 CAT-флагов одно-судейны; mistral оверфлагает f1/f2
— 7 из 8; **1 флаг — от gpt-5-mini, не mistral**, «все от mistral» неточно, суть цела). e1 物是人非
универсально «partial» → чэнъюй-сплющивание = рычаг промпта/глоссария, не модель.
- **Деньги $1.36 / 13 ошибок — ТОЧНО**; gpt-5.4 reasoning=medium обрезка (F 9.1: 223 out-ток ≈ 602
симв) и фикс (reasoning=low, 5137 симв) — оба ДОКАЗАНЫ; kimi-редактор 8/10 обрезок → дропнут (верно).
РАТИФИЦИРОВАНО (D38): (1) нога-2 exp14 (дорогая gpt-5.4-эскалация) ПЕРЕ-ВЗВЕШЕНА ВНИЗ — фронтир в
дефолт НЕ нужен (ни на смысле, ни на абзацах). (2) Глоссарий-корень: **promote грейды(→«класс
А/Б/В/Г»)+四代族长 draft→approved** (владелец направил; reseed). (3) Смысл-floor УЗКИЙ/РАЗБРОСАН →
глоссарий+число/omission-гард, не тотальная эскалация. ХОЛД: **кандидат glm-5→deepseek-pro/mistral**
(дешевле И чинят a1) — их ПРОЗА+omission НЕ мерены → бейк-офф до смены дефолта (урок exp13). Провайдер-
квирк gpt-5.4 reasoning вынесен в `00-provider-quirks.md`. Слепой h2h-пакет — владельцу на вердикт.
───────────────────────────────────────────────────────────────────────────── -->
> **Статус:** полигон-сессия exp14b (D37, приоритет №1). Прямое продолжение exp14. ИНТЕРИМ пре-скрин планки «2 претензии» (D35 — НЕ пилот Ф2.5). Смену дефолта ратифицирует ОРКЕСТРАТОР — не эта сессия.
> **Зона:** `eval/` + этот файл + PROGRESS «Полигон». Прямые API-вызовы. **Коммичу ТОЛЬКО пре-рег §1** (урок D37: exp14 закоммитил 6 батчей сам → впредь фризю только пре-рег, остальное лендит оркестратор). Артефакты — ВНЕ git (`/home/ubuntu/books/gu-zhenren/exp14b/`).
## 0. Мандат (D37) — что домеряем и какие поправки exp14 обязан учесть
- **Претензия-1 (абзацы) ЗАКРЫТА и ратифицирована** (D37): рычаг ПРОМПТА/активации, не модель; дискурс-промпт реверстает у всех семей; A-2pass НЕ рекомендован (2-й пасс дрейфует). Сюда НЕ возвращаемся.
- **Нога-2 НЕДО-МОЩНА (HOLD D37):** «только gpt-5.4 чинит смысл-инверсию» верифицировано на **1 конструкции** (двойное отрицание T1) + **одно-судейно на фронтире** (gpt-5-mini self-excluded → F-* судил только kimi; §2.5 exp14 «оба судьи чистят фронтир» — НЕВЕРНО). **Задача: батарея ≥35 классов × ≥2 инстанса, ≥2 КРОСС-семейных судьи на фронтире → робастна ли «только gpt-5.4», или конструкция-специфична; доля смысл-трапов, что валит дешёвая → COGS-оценка селективной эскалации.**
- **P1a (рекомендованный near-term конфиг) НИКОГДА не ранжировался против фронтира** (финалисты exp14 = {P0, A-2pass, F-disc}). **Задача: P1a ↔ F-disc head-to-head** (насколько дешёвый одинарный дискурс близок к фронтиру по прозе И span-верности).
- **Поправки exp14, которые НЕ повторяю (D37-ревью):** (1) НЕ дисконтировать свою панель ради фронтира (§2Б.3 «литерал-смещение → P0 не вернее» = ПЕРЕ-НАТЯЖКА: панель единогласно ставит P0 вернее IN-SAMPLE на ch17/18/19; T1-катастрофа — в ch7, ВНЕ выборки = категориальная ошибка; на типовых главах верность дешёвой В ПОРЯДКЕ). (2) floor-клейм требует ≥3 конструкций, не n=1. (3) катастроф-скрин к ПОБЕДИТЕЛЮ тоже. (4) **честный учёт ошибок/ретраев** (exp14 «0 ошибок» = на деле 36 ошиблись+билленулись, 105 вызовов не 64). (5) «13 катастроф» re-gate ЗАВЫШЕНО (реальный хвост ≈56; kimi оверфлагнул).
## 1. ПРЕ-РЕГИСТРАЦИЯ (заморожена коммитом ДО первого платного вызова — D30.10; path-scoped только этот док)
### 1.0. Батарея смысл-трапов — размечена ДО генерации
Классы конструкций × ≥2 инстанса, `supporting_span`(zh, ≤15 слов) + опустимый_смысл`. **Скоринг: DET = детерминированный по правилу (полярность/число/ранг/направление) + span-цитата; SOFT = ≥2 кросс-семейных span-цитирующих судьи.** Срез — `rerun/records.json` (ch5.0/ch20.0 исключены — экспорт-баг).
| # | Класс | Скор | ch.chunk | supporting_span | допустимый_смысл | правило DET |
|---|---|---|---|---|---|---|
| a1 | полярность/двойн.отриц | DET | 7.0 | `古月族人没有一个不知道的` | ВСЕ в роду Гуюэ знали (нет ни одного, кто не знал) | НЕ «никто/ни один не знал» |
| a2 | полярность (无不) | DET | 7.0 | `目光中无不充满了羡慕嫉妒` | ВСЕ взгляды полны зависти (无不 = нет без) | НЕ «никто не завидовал» |
| b1 | числа/дроби | DET | 10.1 | `蛊虫只祭炼了十二分之一…消耗了整整三成` | гу очищен на 1/12; истрачено ровно 3 десятых (30%) истинной ци | 十二分之一=1/12; 三成=30% (НЕ 3%/3/3×) |
| b2 | числа/масштаб | DET | 6.0 | `海面…只有四成四` (丙-предел) | уровень моря = 44% апертуры (四成四 = 4 дес. 4) | 四成四=44% (НЕ 4.4/4%) |
| c1 | ранг/иерархия | DET | 17.0 | `成为人上之人` | подняться НАД обычными людьми (人上之人) | НЕ «человек среди людей» (инверсия иерархии) |
| c2 | ранг/грейд | DET | 9.1 | `方源只有丙等资质` | Фан Юань — 丙 (ТРЕТИЙ) разряд = класс В | 丙=3-й=В/C (НЕ Б/2-й); консистентно |
| c3 | ранг/титул | DET | 16.0 | `四代族长` (в контексте) | глава клана 4-го поколения (族长=глава/патриарх) | НЕ «старейшина»/«家老-管家» |
| d1 | контрфактив (контроль) | DET | 19.0 | `幸亏春秋蝉虚弱…否则自己麻烦就大了` | к счастью цикада была слаба, ИНАЧЕ были бы крупные проблемы | сохранить 幸亏(к счастью)+否则(иначе бы); контроль — НЕ ломаться |
| d2 | контрфактив (контроль) | DET | 7.0 | `只恨我没有早生几百年,否则…揭破他` | жаль, не родился на века раньше, ИНАЧЕ разоблачил бы того злодея | сохранить контрфактив-направление |
| e1 | чэнъюй-сплющивание | SOFT | 8.1 | `物是人非` | контраст «вещи те же — люди уже не те» | судьи: сохранён ли контраст 物是/人非 |
| e2 | чэнъюй | SOFT | 2.1 | `韬光养晦` | «скрывать блеск, выжидать» (таиться, копить силы) | судьи: передан ли смысл сокрытия/выжидания |
| f1 | кореференция/субъект | SOFT | 16.0 | `这促使它不得不外出,寻找野生的酒囊花` | «это вынудило ЕГО (酒虫/Винного червя) выйти искать…» | судьи: верный ли субъект «оно/червь», не спутан |
| f2 | нулевое подлежащее/пол | SOFT | 11.1 | `他们的身形隐没在阴影中…分不清男女` | двое (пол неясен) в тени; НЕ навязывать род | судьи: не выдуман ли пол/референт |
**DET-классов 9 инстансов (a/b/c/d), SOFT — 4 (e/f).** Оговорка: c2/c3 частично зависят от глоссария (грейды/титулы) — скорю рендер vs канон сида + span.
### 1.1. Армы — ПРОМПТ константен (дискурс-reflow), варьируем РЕДАКТОРА-модель
Общий flash-черновик (`deepseek-v4-flash` thinking-ON, из `records.json`); editor = дискурс-промпт (тот же frozen `editor_discourse`, sha `b3b4f604…` exp14). Три модели:
| Арм | Editor-модель | = exp14-арм | reasoning |
|---|---|---|---|
| **C** (cheap) | glm-5 | = P1a | thinking disabled |
| **F** (frontier) | gpt-5.4 | = F-disc | reasoning_effort medium (subset) |
| **X** (frontier) | grok-4.3 | = X-disc | **reasoning-ON** (аддитив; НЕ на архаичной ch1 — в батарее ch1 нет) |
**Gemini ДРОПНУТ как арм** (остаток €0.39 — почти пусто; exp14 показал: инвертирует T1 + COGS-враждебен). Максимум — 0 вызовов (беречь); фиксирую как честную оговорку, НЕ 4-й арм.
**Реюз exp14** (не пере-оплачиваю): ch7.0, ch8.1, ch11.1 — C/F/X уже есть; ch17.0/19.* — F есть (stage2), доснять C/X. НОВЫЕ чанки (ch10.1, ch6.0, ch16.0, ch19.0, ch2.1, ch9.1) — все 3 модели. Каждый вызов персистит usage/cost + **ЧЕСТНЫЙ учёт ошибок/ретраев/finish=length** (не «0 ошибок»).
### 1.2. Скоринг + гейты (пре-рег)
- **DET-классы (a/b/c/d):** программное правило + span-цитата на каждый (арм × инстанс) → fix/fail. Пер-конструкция fix-rate: C vs F vs X. **Вывод-ось: робастна ли «только gpt-5.4 (F)» по КЛАССАМ, или отдельные классы чинит и X/дешёвый C.**
- **SOFT-классы (e/f):** **≥2 КРОСС-семейных span-цитирующих судьи** (self-family exclusion: для C(glm/zai) — судьи gpt-5-mini+kimi+mistral; для F(gpt) — kimi+mistral(+gemini-спот НЕ по бюджету); для X(grok) — gpt-5-mini+kimi+mistral). НЕ один судья на арм (урок D37). leave-one-judge-out.
- **Катастроф-скрин к ПОБЕДИТЕЛЮ тоже** (инверсия полярности/участника/направления = катастрофа независимо от среднего). **≥2 независимых глаза на любую катастрофу** (exp14: A-2pass-катастрофу поймал 1 из 2 → n=1 мало).
- **Omission-гард:** агрессивный reflow ↔ пропуски — считать смысловые АТОМЫ (не число предложений); длина не должна коллапсировать.
- **COGS-оценка:** доля чанков с DET-fail у дешёвого C × цена gpt-5.4-эскалации → стоит ли routing.
- **НИКОГДА не гейтить художественность на BLEU/COMET** (zh→ru инверсия WMT24).
### 1.3. P1a ↔ F-disc head-to-head (§2 deliverable)
На 3 чистых главах **17/18/19** (исключая ch5/ch20): собрать **P1a (=арм C, glm-5 одинарный дискурс)** и **F-disc (=арм F, gpt-5.4 дискурс)** → слепой пакет (monitor-паттерн, метки перемешаны по главам, ключ ОТДЕЛЬНО, вне git — копирайт). Оси РАЗДЕЛЬНО: **стиль** + **span-верность**; ≥2 независимых глаза на катастрофу; владелец может дать слепой вердикт. **Цель: насколько близко дешёвый P1a подходит к фронтиру** — если близко по ОБЕИМ осям, дорогой gpt-5.4 не нужен и на прозе (а нога-2 решает точечную эскалацию, не тотальный фронтир).
### 1.4. Бюджет + дисциплина
- **Остатки (D37):** OpenAI ~$6.77, Gemini ~€0.39 (беречь/дроп), Kimi ~$5.80, ZAI ~$8.31, xAI ~$8.85, DeepSeek ~$8.98, Mistral ~$9. **Кап exp14b ≤$5.** Per-call predicted-cost кап ОБЯЗАТЕЛЕН до каждого вызова (НЕ group). Кончился ключ → стоп на нём.
- Ожидаемо: F(gpt-5.4) ~8 новых чанков × ~$0.09 ≈ $0.7; C(glm) ~15 × $0.015 ≈ $0.25; X(grok) ~15 × $0.015 ≈ $0.25; судьи (SOFT 4 инстанса × 3 арма × 3 судьи + head-to-head) ~$12. **Итог-цель ≈ $23, под капом $5.**
### 1.5. Гарды (методика-guard, мемо eval-aggregation — ловил 3×)
Детерм.-скоринг где можно (чище судьи); ≥2 кросс-семейных судьи на soft; leave-one-out; катастроф-скрин к ПОБЕДИТЕЛЮ; независимость сигналов до агрегации; **НЕ дисконтировать свою панель ради фронтира; floor-клейм — ≥3 конструкций, не n=1; честный учёт ошибок**. Слепота свята; пре-рег заморожен коммитом; аномалии провайдеров → вендор-дока+`/models`; `.env` не читать; тексты книги ≤15 слов.
### 1.6. Дешёвый фикс (параллельно, вне критпути — в отчёт как готовое бэкенду)
Глоссарий разрядов **甲/乙/丙/丁 → кириллица «класс А/Б/В/Г»** (владелец зафиксировал D37) + принудительная сверка; развести с `转`→«ранг/оборот». Курация сида — зона полигона; спорное → владельцу.
---
## 2. Результаты (пост-freeze; НЕ входит в freeze-commit; лендит оркестратор)
> **Расширение панели (прозрачно, не ретрофит трапов):** к замороженным C/F/X добавлены 3 семьи-редактора **deepseek-v4-pro (D), kimi (K), mistral-large (M)** — чтобы floor-тест «только gpt-5.4» стоял на 6 семьях, а не 3 (по запросу владельца, аналог добавки Gemini/grok в exp14).
### 2.0. Операционка + SELF-REVIEW (честно — урок D37 «0 ошибок» = миф)
Трата ≈**$1.36** (под капом $5): Kimi $0.71 (флейк+многословие — крупнейший), OpenAI $0.37, ZAI $0.10, XAI $0.06, DeepSeek $0.06, Mistral $0.06. **13 ошибок ЗАЛОГИРОВАНО** (не «0»): kimi 6 таймаутов + 6 пустышек, deepseek 1 transport (ретрай спас). **Скептический self-review нашёл и починил 2 бага, которые исказили бы вывод:**
- **gpt-5.4 `reasoning=medium` РЕПРОДУЦИРУЕМО обрезал F 9.1** (602 симв из ~5000; reasoning съел бюджет, finish=stop) → дал бы ложное «F провалил c2». Фикс: `reasoning=low` (5137 симв). **Квирк для `00-provider-quirks.md`.** Проверка F vs C/X по всем чанкам: других обрезок НЕТ.
- **deepseek-v4-pro обрезал D 6.0** (0.05×, finish=length) → перегнан на `max_tokens=16000` (10054 симв).
- **kimi НЕПРИГОДЕН как редактор**: 8/10 обрезки(finish=length)/таймауты; ре-ран при 28k токенах — таймаут >2мин. K-арм ДРОПНУТ (2 валидных выхода использованы точечно). Это само по себе вывод: kimi не редактор прода.
- **Аудит exp14 (ретро):** все обрезки/пустышки в exp14 — 100% gemini (известное); НЕТ скрытых обрезок gpt-5.4/grok/glm/deepseek. «36 ошибок» exp14 = судейский слой (29/30 re-gate = kimi-флейкость → подтверждает поправку D37 «13 катастроф завышено»).
- **Скоринг DET — РУЧНАЯ span-читка** (авто-regex-скорер брикастый — сам поймал, не доверяю; критерий объективен: над≠среди, каждый≠ни один, глава≠старейшина; оговорка author≠reviewer — читаю я).
### 2.1. DET-батарея (a/b/c/d) — «ТОЛЬКО gpt-5.4» ОПРОВЕРГНУТО; провалы РАЗБРОСАНЫ по модель×конструкция
Промпт КОНСТАНТЕН (дискурс); варьируем редактора. ✓=верно / ✗=провал (объективный критерий + span):
| Трап (класс) | glm-5 C | gpt-5.4 F | grok X | deepseek-pro D | mistral M |
|---|---|---|---|---|---|
| **a1** двойн.отриц `没有一个不知道` (крит) | ✗ «ни один» | ✓ «не было ни одного, кто не…» | ✗ «ни один» | ✓ «знал каждый» | ✓ «знали все» |
| **a2** `无不` (лёгкая полярн.) | ✓ | ✓ | ✓ | ✓ | ✓ |
| **b2** `四成四`=44% (числа) | ✓ | ✓ | ✓ | ✓ | ✓ |
| **c1** `人上之人` над/среди | ✓ «над» | ✓ «над обычными» | ✗ «среди» | ✗ «среди» | ? (перефраз) |
| **c3** `四代族长` глава/старейшина ⚠ГЛ-КОНФАУНД | ✗ | ✓ | ✓ | ✓ | ✗ |
| **чистых провалов способности (без c3)** | **1** (a1) | **0** | **2** (a1,c1) | **1** (c1) | **01** (c1?) |
**⚠ c3 — НЕ способность, а ГЛОССАРИЙ-ЕНФОРСМЕНТ (важная находка self-review):** сид имеет `四代族长→«Четвёртый глава рода»` (ВЕРНО), но `status:draft` → в editor-констрейнт (только approved) НЕ попадает; зато туда попадает approved `家老→«старейшина»`, и glm/mistral (глоссарий-обедиентные) подтянули «старейшину» к 四代族长, а gpt/grok/deepseek дали верное «глава» из исходника. **Т.е. c3-«провал» = обедиентность к enforced-соседу при draft-целевом терме, не непонимание.** Исключаю c3 из способности; это фикс-глоссария.
**Выводы ноги-2 (прямой ответ на HOLD D37):**
1. **«Только gpt-5.4 чинит смысл» — ОПРОВЕРГНУТО.** Крит-трап a1 (двойное отрицание) чинят gpt-5.4, **deepseek-pro И mistral**; валят glm-5 и grok. **Дешёвый mistral ($0.5/$1.5) чинит то, что наш текущий редактор glm-5 ($1/$3.2) инвертирует — и mistral ДЕШЕВЛЕ.** Экстраполяция exp14 (n=1 фронтир, 1 судья) была артефактом.
2. **Провалы РАЗБРОСАНЫ по модель×конструкция**, не «дешёвые валят всё» и не «фронтир чинит всё»: glm валит a1+c3, grok валит a1+c1, deepseek валит c1, mistral валит c3. Нет модели безупречной или безнадёжной; **нет одной «эскалации», закрывающей всё**.
3. **gpt-5.4 — самый РОБАСТНЫЙ** (0/5), но это «самый ровный», а не «единственный, кто может» — за $2.5/$15 платить необязательно.
4. **c3 (族长→«старейшина» у glm/mistral) — ГЛОССАРИЙ, не способность** → сид `族长`→«глава клана» (детерм. фикс, с грейдами). b1 (`十二分之一`/`三成`) — числа местами дрейфуют (`四成四`→«четыре десятых и четыре десятых» у glm в ch10.1) — на omission/число-гард.
### 2.2. SOFT-классы (e чэнъюй / f кореференция) — 3 кросс-семейных судьи (gpt-5-mini+kimi+mistral), leave-one-out, ≥2-глаза-на-катастрофу
| Трап | Свод (по judge-консенсусу) |
|---|---|
| **e1** 物是人非 | **ВСЕ армы «partial», все судьи единогласно** → сплющивание чэнъюй УНИВЕРСАЛЬНО (не модель-специфично) — промпт/глоссарий-рычаг, не модель |
| **e2** 韬光养晦 | Большинство «correct» (2/3 судьи: gpt-mini+kimi); mistral-судья строже («partial»). Leave-one-out(mistral)→все correct. ОК |
| **f1** 它=Винный червь | 2/3 судьи «correct»; **mistral-СУДЬЯ over-флагает «wrong+CAT» на glm/grok** — но gpt-mini+kimi «correct» → катастрофа НЕ подтверждена (single-judge) |
| **f2** 他们-пол | Разнобой (gpt-mini «partial» / kimi «correct» / mistral «wrong+CAT» почти на всех) → субъективно; **ни одной катастрофы ≥2-глазами** |
**Вывод SOFT:** **НИ ОДНОЙ подтверждённой (≥2 судьи) катастрофы.** Все CAT-флаги — от ОДНОГО судьи (mistral over-флагает). Чэнъюй-сплющивание (e1) универсально (все модели partial) → рычаг промпта/глоссария, не модель. **Методик-урок (валидирует D37-фикс):** mistral-судья один дал бы ложные катастрофы f1/f2 — ровно ошибка exp14 (один kimi на фронтире). ≥2 кросс-семейных судьи + leave-one-out их сняли. Soft-классы модели НЕ разделяют → смысл-floor узкий (a1/c1), не широкий.
### 2.3. P1a ↔ F-disc head-to-head (§2 мандата) — дешёвый = фронтир на прозе
Прозо-KPI (детерм.) на гл.17/18/19: **P1a (glm-5) mean_spp 2.52 / доля-1-предл 0.381** vs **F-disc (gpt-5.4) 2.55 / 0.427**. **ТАЙ** (P1a даже чуть меньше рублёнки). → стилевое превосходство F-disc в exp14 — НЕ про абзацы (равны), а про гладкость/лексику; **по структурной претензии-1 дорогой gpt-5.4 НЕ нужен**. Слепой пакет `exp14b/monitor/h2h.md` (P1a↔F-disc + оригинал, метки перемешаны) — владельцу на слепой вердикт (span-верность + стиль).
### 2.4. Рекомендация (на ратификацию оркестратора; дефолт НЕ менять сессией)
1. **Фронтир (gpt-5.4) в дефолт НЕ нужен:** абзацы — дешёвый P1a = фронтир (KPI-тай); смысл — дешёвые mistral/deepseek-pro чинят крит-трапы. Дорогая gpt-5.4-эскалация из exp14-рекомендации **пере-взвешивается вниз**.
2. **Кандидат: сменить дешёвый редактор glm-5 → deepseek-pro ИЛИ mistral**оба ДЕШЕВЛЕ glm И чинят двойное отрицание (glm валит). Требует проверки их ПРОЗЫ/абзацев (мерить отдельно — здесь мерена верность, не стиль полностью) + omission-гард.
3. **Смысл-floor УЗКИЙ и РАЗБРОСАННЫЙ** → не одна эскалация, а: (а) глоссарий-фиксы (族长, грейды 甲乙丙) детерминированно; (б) число/omission-гард; (в) при желании ровности — gpt-5.4 точечно, но ROI низкий.
4. **Глоссарий-курация — КОРЕНЬ найден self-review'ом: важные термы оставлены `status:draft` → НЕ в editor-констрейнте → дрейф/подмена.** Сид уже несёт ВЕРНЫЕ dst (`甲乙丙丁→разряд А/Б/В/Г` draft; `四代族长→Четвёртый глава рода` draft), но draft = мягкая ⟨проверить⟩, не enforced. **Фиксы владельцу:** (а) грейды → dst «класс А/Б/В/Г» (D37) + **promote draft→approved** (enforce, стоп-дрейф); (б) `四代族长` **promote draft→approved** (иначе approved `家老→«старейшина»` перетягивает); (в) `转→«ранг»` (approved) — развод с грейдами держится. Это не «модель тупая» — это статусы сида. Статусы меняет владелец (approved-инвариант) + reseed.
### 2.5. Оговорки (методика-guard)
Батарея мала (5 конструкций DET + 4 soft, пара ячеек «?»); DET-скоринг — ручная span-читка (объективный критерий, но author≠reviewer — 2-й глаз усилит); kimi выпал (editor+judge флейкость); прозо-сравнение P1a↔F-disc — только KPI+слепой пакет (владелец-вердикт pending); ИНТЕРИМ пре-скрин (D35), НЕ пилот. Смену дефолта ратифицирует оркестратор.