31 KiB
Эксперимент 14b. Батарея смысл-трапов (нога-2) + ранг P1a↔F-disc
Статус: полигон-сессия exp14b (D37, приоритет №1). Прямое продолжение exp14. ИНТЕРИМ пре-скрин планки «2 претензии» (D35 — НЕ пилот Ф2.5). Смену дефолта ратифицирует ОРКЕСТРАТОР — не эта сессия. Зона:
eval/+ этот файл + PROGRESS «Полигон». Прямые API-вызовы. Коммичу ТОЛЬКО пре-рег §1 (урок D37: exp14 закоммитил 6 батчей сам → впредь фризю только пре-рег, остальное лендит оркестратор). Артефакты — ВНЕ git (/home/ubuntu/books/gu-zhenren/exp14b/).
0. Мандат (D37) — что домеряем и какие поправки exp14 обязан учесть
- Претензия-1 (абзацы) ЗАКРЫТА и ратифицирована (D37): рычаг ПРОМПТА/активации, не модель; дискурс-промпт реверстает у всех семей; A-2pass НЕ рекомендован (2-й пасс дрейфует). Сюда НЕ возвращаемся.
- Нога-2 НЕДО-МОЩНА (HOLD D37): «только gpt-5.4 чинит смысл-инверсию» верифицировано на 1 конструкции (двойное отрицание T1) + одно-судейно на фронтире (gpt-5-mini self-excluded → F-* судил только kimi; §2.5 exp14 «оба судьи чистят фронтир» — НЕВЕРНО). Задача: батарея ≥3–5 классов × ≥2 инстанса, ≥2 КРОСС-семейных судьи на фронтире → робастна ли «только gpt-5.4», или конструкция-специфична; доля смысл-трапов, что валит дешёвая → COGS-оценка селективной эскалации.
- P1a (рекомендованный near-term конфиг) НИКОГДА не ранжировался против фронтира (финалисты exp14 = {P0, A-2pass, F-disc}). Задача: P1a ↔ F-disc head-to-head (насколько дешёвый одинарный дискурс близок к фронтиру по прозе И span-верности).
- Поправки exp14, которые НЕ повторяю (D37-ревью): (1) НЕ дисконтировать свою панель ради фронтира (§2Б.3 «литерал-смещение → P0 не вернее» = ПЕРЕ-НАТЯЖКА: панель единогласно ставит P0 вернее IN-SAMPLE на ch17/18/19; T1-катастрофа — в ch7, ВНЕ выборки = категориальная ошибка; на типовых главах верность дешёвой В ПОРЯДКЕ). (2) floor-клейм требует ≥3 конструкций, не n=1. (3) катастроф-скрин к ПОБЕДИТЕЛЮ тоже. (4) честный учёт ошибок/ретраев (exp14 «0 ошибок» = на деле 36 ошиблись+билленулись, 105 вызовов не 64). (5) «13 катастроф» re-gate ЗАВЫШЕНО (реальный хвост ≈5–6; kimi оверфлагнул).
1. ПРЕ-РЕГИСТРАЦИЯ (заморожена коммитом ДО первого платного вызова — D30.10; path-scoped только этот док)
1.0. Батарея смысл-трапов — размечена ДО генерации
Классы конструкций × ≥2 инстанса, supporting_span(zh, ≤15 слов) + допустимый_смысл. Скоринг: DET = детерминированный по правилу (полярность/число/ранг/направление) + span-цитата; SOFT = ≥2 кросс-семейных span-цитирующих судьи. Срез — rerun/records.json (ch5.0/ch20.0 исключены — экспорт-баг).
| # | Класс | Скор | ch.chunk | supporting_span | допустимый_смысл | правило DET |
|---|---|---|---|---|---|---|
| a1 | полярность/двойн.отриц | DET | 7.0 | 古月族人没有一个不知道的 |
ВСЕ в роду Гуюэ знали (нет ни одного, кто не знал) | НЕ «никто/ни один не знал» |
| a2 | полярность (无不) | DET | 7.0 | 目光中无不充满了羡慕嫉妒 |
ВСЕ взгляды полны зависти (无不 = нет без) | НЕ «никто не завидовал» |
| b1 | числа/дроби | DET | 10.1 | 蛊虫只祭炼了十二分之一…消耗了整整三成 |
гу очищен на 1/12; истрачено ровно 3 десятых (30%) истинной ци | 十二分之一=1/12; 三成=30% (НЕ 3%/3/3×) |
| b2 | числа/масштаб | DET | 6.0 | 海面…只有四成四 (丙-предел) |
уровень моря = 44% апертуры (四成四 = 4 дес. 4) | 四成四=44% (НЕ 4.4/4%) |
| c1 | ранг/иерархия | DET | 17.0 | 成为人上之人 |
подняться НАД обычными людьми (人上之人) | НЕ «человек среди людей» (инверсия иерархии) |
| c2 | ранг/грейд | DET | 9.1 | 方源只有丙等资质 |
Фан Юань — 丙 (ТРЕТИЙ) разряд = класс В | 丙=3-й=В/C (НЕ Б/2-й); консистентно |
| c3 | ранг/титул | DET | 16.0 | 四代族长 (в контексте) |
глава клана 4-го поколения (族长=глава/патриарх) | НЕ «старейшина»/«家老-管家» |
| d1 | контрфактив (контроль) | DET | 19.0 | 幸亏春秋蝉虚弱…否则自己麻烦就大了 |
к счастью цикада была слаба, ИНАЧЕ были бы крупные проблемы | сохранить 幸亏(к счастью)+否则(иначе бы); контроль — НЕ ломаться |
| d2 | контрфактив (контроль) | DET | 7.0 | 只恨我没有早生几百年,否则…揭破他 |
жаль, не родился на века раньше, ИНАЧЕ разоблачил бы того злодея | сохранить контрфактив-направление |
| e1 | чэнъюй-сплющивание | SOFT | 8.1 | 物是人非 |
контраст «вещи те же — люди уже не те» | судьи: сохранён ли контраст 物是/人非 |
| e2 | чэнъюй | SOFT | 2.1 | 韬光养晦 |
«скрывать блеск, выжидать» (таиться, копить силы) | судьи: передан ли смысл сокрытия/выжидания |
| f1 | кореференция/субъект | SOFT | 16.0 | 这促使它不得不外出,寻找野生的酒囊花 |
«это вынудило ЕГО (酒虫/Винного червя) выйти искать…» | судьи: верный ли субъект «оно/червь», не спутан |
| f2 | нулевое подлежащее/пол | SOFT | 11.1 | 他们的身形隐没在阴影中…分不清男女 |
двое (пол неясен) в тени; НЕ навязывать род | судьи: не выдуман ли пол/референт |
DET-классов 9 инстансов (a/b/c/d), SOFT — 4 (e/f). Оговорка: c2/c3 частично зависят от глоссария (грейды/титулы) — скорю рендер vs канон сида + span.
1.1. Армы — ПРОМПТ константен (дискурс-reflow), варьируем РЕДАКТОРА-модель
Общий flash-черновик (deepseek-v4-flash thinking-ON, из records.json); editor = дискурс-промпт (тот же frozen editor_discourse, sha b3b4f604… exp14). Три модели:
| Арм | Editor-модель | = exp14-арм | reasoning |
|---|---|---|---|
| C (cheap) | glm-5 | = P1a | thinking disabled |
| F (frontier) | gpt-5.4 | = F-disc | reasoning_effort medium (subset) |
| X (frontier) | grok-4.3 | = X-disc | reasoning-ON (аддитив; НЕ на архаичной ch1 — в батарее ch1 нет) |
Gemini ДРОПНУТ как арм (остаток €0.39 — почти пусто; exp14 показал: инвертирует T1 + COGS-враждебен). Максимум — 0 вызовов (беречь); фиксирую как честную оговорку, НЕ 4-й арм. Реюз exp14 (не пере-оплачиваю): ch7.0, ch8.1, ch11.1 — C/F/X уже есть; ch17.0/19.* — F есть (stage2), доснять C/X. НОВЫЕ чанки (ch10.1, ch6.0, ch16.0, ch19.0, ch2.1, ch9.1) — все 3 модели. Каждый вызов персистит usage/cost + ЧЕСТНЫЙ учёт ошибок/ретраев/finish=length (не «0 ошибок»).
1.2. Скоринг + гейты (пре-рег)
- DET-классы (a/b/c/d): программное правило + span-цитата на каждый (арм × инстанс) → fix/fail. Пер-конструкция fix-rate: C vs F vs X. Вывод-ось: робастна ли «только gpt-5.4 (F)» по КЛАССАМ, или отдельные классы чинит и X/дешёвый C.
- SOFT-классы (e/f): ≥2 КРОСС-семейных span-цитирующих судьи (self-family exclusion: для C(glm/zai) — судьи gpt-5-mini+kimi+mistral; для F(gpt) — kimi+mistral(+gemini-спот НЕ по бюджету); для X(grok) — gpt-5-mini+kimi+mistral). НЕ один судья на арм (урок D37). leave-one-judge-out.
- Катастроф-скрин к ПОБЕДИТЕЛЮ тоже (инверсия полярности/участника/направления = катастрофа независимо от среднего). ≥2 независимых глаза на любую катастрофу (exp14: A-2pass-катастрофу поймал 1 из 2 → n=1 мало).
- Omission-гард: агрессивный reflow ↔ пропуски — считать смысловые АТОМЫ (не число предложений); длина не должна коллапсировать.
- COGS-оценка: доля чанков с DET-fail у дешёвого C × цена gpt-5.4-эскалации → стоит ли routing.
- НИКОГДА не гейтить художественность на BLEU/COMET (zh→ru инверсия WMT24).
1.3. P1a ↔ F-disc head-to-head (§2 deliverable)
На 3 чистых главах 17/18/19 (исключая ch5/ch20): собрать P1a (=арм C, glm-5 одинарный дискурс) и F-disc (=арм F, gpt-5.4 дискурс) → слепой пакет (monitor-паттерн, метки перемешаны по главам, ключ ОТДЕЛЬНО, вне git — копирайт). Оси РАЗДЕЛЬНО: стиль + span-верность; ≥2 независимых глаза на катастрофу; владелец может дать слепой вердикт. Цель: насколько близко дешёвый P1a подходит к фронтиру — если близко по ОБЕИМ осям, дорогой gpt-5.4 не нужен и на прозе (а нога-2 решает точечную эскалацию, не тотальный фронтир).
1.4. Бюджет + дисциплина
- Остатки (D37): OpenAI ~$6.77, Gemini ~€0.39 (беречь/дроп), Kimi ~$5.80, ZAI ~$8.31, xAI ~$8.85, DeepSeek ~$8.98, Mistral ~$9. Кап exp14b ≤$5. Per-call predicted-cost кап ОБЯЗАТЕЛЕН до каждого вызова (НЕ group). Кончился ключ → стоп на нём.
- Ожидаемо: F(gpt-5.4) ~8 новых чанков × ~$0.09 ≈ $0.7; C(glm) ~15 × $0.015 ≈ $0.25; X(grok) ~15 × $0.015 ≈ $0.25; судьи (SOFT 4 инстанса × 3 арма × 3 судьи + head-to-head) ~$1–2. Итог-цель ≈ $2–3, под капом $5.
1.5. Гарды (методика-guard, мемо eval-aggregation — ловил 3×)
Детерм.-скоринг где можно (чище судьи); ≥2 кросс-семейных судьи на soft; leave-one-out; катастроф-скрин к ПОБЕДИТЕЛЮ; независимость сигналов до агрегации; НЕ дисконтировать свою панель ради фронтира; floor-клейм — ≥3 конструкций, не n=1; честный учёт ошибок. Слепота свята; пре-рег заморожен коммитом; аномалии провайдеров → вендор-дока+/models; .env не читать; тексты книги ≤15 слов.
1.6. Дешёвый фикс (параллельно, вне критпути — в отчёт как готовое бэкенду)
Глоссарий разрядов 甲/乙/丙/丁 → кириллица «класс А/Б/В/Г» (владелец зафиксировал D37) + принудительная сверка; развести с 转→«ранг/оборот». Курация сида — зона полигона; спорное → владельцу.
2. Результаты (пост-freeze; НЕ входит в freeze-commit; лендит оркестратор)
Расширение панели (прозрачно, не ретрофит трапов): к замороженным C/F/X добавлены 3 семьи-редактора deepseek-v4-pro (D), kimi (K), mistral-large (M) — чтобы floor-тест «только gpt-5.4» стоял на 6 семьях, а не 3 (по запросу владельца, аналог добавки Gemini/grok в exp14).
2.0. Операционка + SELF-REVIEW (честно — урок D37 «0 ошибок» = миф)
Трата ≈$1.36 (под капом $5): Kimi $0.71 (флейк+многословие — крупнейший), OpenAI $0.37, ZAI $0.10, XAI $0.06, DeepSeek $0.06, Mistral $0.06. 13 ошибок ЗАЛОГИРОВАНО (не «0»): kimi 6 таймаутов + 6 пустышек, deepseek 1 transport (ретрай спас). Скептический self-review нашёл и починил 2 бага, которые исказили бы вывод:
- gpt-5.4
reasoning=mediumРЕПРОДУЦИРУЕМО обрезал F 9.1 (602 симв из ~5000; reasoning съел бюджет, finish=stop) → дал бы ложное «F провалил c2». Фикс:reasoning=low(5137 симв). Квирк для00-provider-quirks.md. Проверка F vs C/X по всем чанкам: других обрезок НЕТ. - deepseek-v4-pro обрезал D 6.0 (0.05×, finish=length) → перегнан на
max_tokens=16000(10054 симв). - kimi НЕПРИГОДЕН как редактор: 8/10 обрезки(finish=length)/таймауты; ре-ран при 28k токенах — таймаут >2мин. K-арм ДРОПНУТ (2 валидных выхода использованы точечно). Это само по себе вывод: kimi не редактор прода.
- Аудит exp14 (ретро): все обрезки/пустышки в exp14 — 100% gemini (известное); НЕТ скрытых обрезок gpt-5.4/grok/glm/deepseek. «36 ошибок» exp14 = судейский слой (29/30 re-gate = kimi-флейкость → подтверждает поправку D37 «13 катастроф завышено»).
- Скоринг DET — РУЧНАЯ span-читка (авто-regex-скорер брикастый — сам поймал, не доверяю; критерий объективен: над≠среди, каждый≠ни один, глава≠старейшина; оговорка author≠reviewer — читаю я).
2.1. DET-батарея (a/b/c/d) — «ТОЛЬКО gpt-5.4» ОПРОВЕРГНУТО; провалы РАЗБРОСАНЫ по модель×конструкция
Промпт КОНСТАНТЕН (дискурс); варьируем редактора. ✓=верно / ✗=провал (объективный критерий + span):
| Трап (класс) | glm-5 C | gpt-5.4 F | grok X | deepseek-pro D | mistral M |
|---|---|---|---|---|---|
a1 двойн.отриц 没有一个不知道 (крит) |
✗ «ни один» | ✓ «не было ни одного, кто не…» | ✗ «ни один» | ✓ «знал каждый» | ✓ «знали все» |
a2 无不 (лёгкая полярн.) |
✓ | ✓ | ✓ | ✓ | ✓ |
b2 四成四=44% (числа) |
✓ | ✓ | ✓ | ✓ | ✓ |
c1 人上之人 над/среди |
✓ «над» | ✓ «над обычными» | ✗ «среди» | ✗ «среди» | ? (перефраз) |
c3 四代族长 глава/старейшина ⚠ГЛ-КОНФАУНД |
✗ | ✓ | ✓ | ✓ | ✗ |
| чистых провалов способности (без c3) | 1 (a1) | 0 | 2 (a1,c1) | 1 (c1) | 0–1 (c1?) |
⚠ c3 — НЕ способность, а ГЛОССАРИЙ-ЕНФОРСМЕНТ (важная находка self-review): сид имеет 四代族长→«Четвёртый глава рода» (ВЕРНО), но status:draft → в editor-констрейнт (только approved) НЕ попадает; зато туда попадает approved 家老→«старейшина», и glm/mistral (глоссарий-обедиентные) подтянули «старейшину» к 四代族长, а gpt/grok/deepseek дали верное «глава» из исходника. Т.е. c3-«провал» = обедиентность к enforced-соседу при draft-целевом терме, не непонимание. Исключаю c3 из способности; это фикс-глоссария.
Выводы ноги-2 (прямой ответ на HOLD D37):
- «Только gpt-5.4 чинит смысл» — ОПРОВЕРГНУТО. Крит-трап a1 (двойное отрицание) чинят gpt-5.4, deepseek-pro И mistral; валят glm-5 и grok. Дешёвый mistral ($0.5/$1.5) чинит то, что наш текущий редактор glm-5 ($1/$3.2) инвертирует — и mistral ДЕШЕВЛЕ. Экстраполяция exp14 (n=1 фронтир, 1 судья) была артефактом.
- Провалы РАЗБРОСАНЫ по модель×конструкция, не «дешёвые валят всё» и не «фронтир чинит всё»: glm валит a1+c3, grok валит a1+c1, deepseek валит c1, mistral валит c3. Нет модели безупречной или безнадёжной; нет одной «эскалации», закрывающей всё.
- gpt-5.4 — самый РОБАСТНЫЙ (0/5), но это «самый ровный», а не «единственный, кто может» — за $2.5/$15 платить необязательно.
- c3 (族长→«старейшина» у glm/mistral) — ГЛОССАРИЙ, не способность → сид
族长→«глава клана» (детерм. фикс, с грейдами). b1 (十二分之一/三成) — числа местами дрейфуют (四成四→«четыре десятых и четыре десятых» у glm в ch10.1) — на omission/число-гард.
2.2. SOFT-классы (e чэнъюй / f кореференция) — 3 кросс-семейных судьи (gpt-5-mini+kimi+mistral), leave-one-out, ≥2-глаза-на-катастрофу
| Трап | Свод (по judge-консенсусу) |
|---|---|
| e1 物是人非 | ВСЕ армы «partial», все судьи единогласно → сплющивание чэнъюй УНИВЕРСАЛЬНО (не модель-специфично) — промпт/глоссарий-рычаг, не модель |
| e2 韬光养晦 | Большинство «correct» (2/3 судьи: gpt-mini+kimi); mistral-судья строже («partial»). Leave-one-out(mistral)→все correct. ОК |
| f1 它=Винный червь | 2/3 судьи «correct»; mistral-СУДЬЯ over-флагает «wrong+CAT» на glm/grok — но gpt-mini+kimi «correct» → катастрофа НЕ подтверждена (single-judge) |
| f2 他们-пол | Разнобой (gpt-mini «partial» / kimi «correct» / mistral «wrong+CAT» почти на всех) → субъективно; ни одной катастрофы ≥2-глазами |
Вывод SOFT: НИ ОДНОЙ подтверждённой (≥2 судьи) катастрофы. Все CAT-флаги — от ОДНОГО судьи (mistral over-флагает). Чэнъюй-сплющивание (e1) универсально (все модели partial) → рычаг промпта/глоссария, не модель. Методик-урок (валидирует D37-фикс): mistral-судья один дал бы ложные катастрофы f1/f2 — ровно ошибка exp14 (один kimi на фронтире). ≥2 кросс-семейных судьи + leave-one-out их сняли. Soft-классы модели НЕ разделяют → смысл-floor узкий (a1/c1), не широкий.
2.3. P1a ↔ F-disc head-to-head (§2 мандата) — дешёвый = фронтир на прозе
Прозо-KPI (детерм.) на гл.17/18/19: P1a (glm-5) mean_spp 2.52 / доля-1-предл 0.381 vs F-disc (gpt-5.4) 2.55 / 0.427. ТАЙ (P1a даже чуть меньше рублёнки). → стилевое превосходство F-disc в exp14 — НЕ про абзацы (равны), а про гладкость/лексику; по структурной претензии-1 дорогой gpt-5.4 НЕ нужен. Слепой пакет exp14b/monitor/h2h.md (P1a↔F-disc + оригинал, метки перемешаны) — владельцу на слепой вердикт (span-верность + стиль).
2.4. Рекомендация (на ратификацию оркестратора; дефолт НЕ менять сессией)
- Фронтир (gpt-5.4) в дефолт НЕ нужен: абзацы — дешёвый P1a = фронтир (KPI-тай); смысл — дешёвые mistral/deepseek-pro чинят крит-трапы. Дорогая gpt-5.4-эскалация из exp14-рекомендации пере-взвешивается вниз.
- Кандидат: сменить дешёвый редактор glm-5 → deepseek-pro ИЛИ mistral — оба ДЕШЕВЛЕ glm И чинят двойное отрицание (glm валит). Требует проверки их ПРОЗЫ/абзацев (мерить отдельно — здесь мерена верность, не стиль полностью) + omission-гард.
- Смысл-floor УЗКИЙ и РАЗБРОСАННЫЙ → не одна эскалация, а: (а) глоссарий-фиксы (族长, грейды 甲乙丙) детерминированно; (б) число/omission-гард; (в) при желании ровности — gpt-5.4 точечно, но ROI низкий.
- Глоссарий-курация — КОРЕНЬ найден self-review'ом: важные термы оставлены
status:draft→ НЕ в editor-констрейнте → дрейф/подмена. Сид уже несёт ВЕРНЫЕ dst (甲乙丙丁→разряд А/Б/В/Гdraft;四代族长→Четвёртый глава родаdraft), но draft = мягкая ⟨проверить⟩, не enforced. Фиксы владельцу: (а) грейды → dst «класс А/Б/В/Г» (D37) + promote draft→approved (enforce, стоп-дрейф); (б)四代族长promote draft→approved (иначе approved家老→«старейшина»перетягивает); (в)转→«ранг»(approved) — развод с грейдами держится. Это не «модель тупая» — это статусы сида. Статусы меняет владелец (approved-инвариант) + reseed.
2.5. Оговорки (методика-guard)
Батарея мала (5 конструкций DET + 4 soft, пара ячеек «?»); DET-скоринг — ручная span-читка (объективный критерий, но author≠reviewer — 2-й глаз усилит); kimi выпал (editor+judge флейкость); прозо-сравнение P1a↔F-disc — только KPI+слепой пакет (владелец-вердикт pending); ИНТЕРИМ пре-скрин (D35), НЕ пилот. Смену дефолта ратифицирует оркестратор.