textmachine/docs/experiments/14b-meaning-battery.md

31 KiB
Raw Permalink Blame History

Эксперимент 14b. Батарея смысл-трапов (нога-2) + ранг P1a↔F-disc

Статус: полигон-сессия exp14b (D37, приоритет №1). Прямое продолжение exp14. ИНТЕРИМ пре-скрин планки «2 претензии» (D35 — НЕ пилот Ф2.5). Смену дефолта ратифицирует ОРКЕСТРАТОР — не эта сессия. Зона: eval/ + этот файл + PROGRESS «Полигон». Прямые API-вызовы. Коммичу ТОЛЬКО пре-рег §1 (урок D37: exp14 закоммитил 6 батчей сам → впредь фризю только пре-рег, остальное лендит оркестратор). Артефакты — ВНЕ git (/home/ubuntu/books/gu-zhenren/exp14b/).

0. Мандат (D37) — что домеряем и какие поправки exp14 обязан учесть

  • Претензия-1 (абзацы) ЗАКРЫТА и ратифицирована (D37): рычаг ПРОМПТА/активации, не модель; дискурс-промпт реверстает у всех семей; A-2pass НЕ рекомендован (2-й пасс дрейфует). Сюда НЕ возвращаемся.
  • Нога-2 НЕДО-МОЩНА (HOLD D37): «только gpt-5.4 чинит смысл-инверсию» верифицировано на 1 конструкции (двойное отрицание T1) + одно-судейно на фронтире (gpt-5-mini self-excluded → F-* судил только kimi; §2.5 exp14 «оба судьи чистят фронтир» — НЕВЕРНО). Задача: батарея ≥35 классов × ≥2 инстанса, ≥2 КРОСС-семейных судьи на фронтире → робастна ли «только gpt-5.4», или конструкция-специфична; доля смысл-трапов, что валит дешёвая → COGS-оценка селективной эскалации.
  • P1a (рекомендованный near-term конфиг) НИКОГДА не ранжировался против фронтира (финалисты exp14 = {P0, A-2pass, F-disc}). Задача: P1a ↔ F-disc head-to-head (насколько дешёвый одинарный дискурс близок к фронтиру по прозе И span-верности).
  • Поправки exp14, которые НЕ повторяю (D37-ревью): (1) НЕ дисконтировать свою панель ради фронтира (§2Б.3 «литерал-смещение → P0 не вернее» = ПЕРЕ-НАТЯЖКА: панель единогласно ставит P0 вернее IN-SAMPLE на ch17/18/19; T1-катастрофа — в ch7, ВНЕ выборки = категориальная ошибка; на типовых главах верность дешёвой В ПОРЯДКЕ). (2) floor-клейм требует ≥3 конструкций, не n=1. (3) катастроф-скрин к ПОБЕДИТЕЛЮ тоже. (4) честный учёт ошибок/ретраев (exp14 «0 ошибок» = на деле 36 ошиблись+билленулись, 105 вызовов не 64). (5) «13 катастроф» re-gate ЗАВЫШЕНО (реальный хвост ≈56; kimi оверфлагнул).

1. ПРЕ-РЕГИСТРАЦИЯ (заморожена коммитом ДО первого платного вызова — D30.10; path-scoped только этот док)

1.0. Батарея смысл-трапов — размечена ДО генерации

Классы конструкций × ≥2 инстанса, supporting_span(zh, ≤15 слов) + допустимый_смысл. Скоринг: DET = детерминированный по правилу (полярность/число/ранг/направление) + span-цитата; SOFT = ≥2 кросс-семейных span-цитирующих судьи. Срез — rerun/records.json (ch5.0/ch20.0 исключены — экспорт-баг).

# Класс Скор ch.chunk supporting_span допустимый_смысл правило DET
a1 полярность/двойн.отриц DET 7.0 古月族人没有一个不知道的 ВСЕ в роду Гуюэ знали (нет ни одного, кто не знал) НЕ «никто/ни один не знал»
a2 полярность (无不) DET 7.0 目光中无不充满了羡慕嫉妒 ВСЕ взгляды полны зависти (无不 = нет без) НЕ «никто не завидовал»
b1 числа/дроби DET 10.1 蛊虫只祭炼了十二分之一…消耗了整整三成 гу очищен на 1/12; истрачено ровно 3 десятых (30%) истинной ци 十二分之一=1/12; 三成=30% (НЕ 3%/3/3×)
b2 числа/масштаб DET 6.0 海面…只有四成四 (丙-предел) уровень моря = 44% апертуры (四成四 = 4 дес. 4) 四成四=44% (НЕ 4.4/4%)
c1 ранг/иерархия DET 17.0 成为人上之人 подняться НАД обычными людьми (人上之人) НЕ «человек среди людей» (инверсия иерархии)
c2 ранг/грейд DET 9.1 方源只有丙等资质 Фан Юань — 丙 (ТРЕТИЙ) разряд = класс В 丙=3-й=В/C (НЕ Б/2-й); консистентно
c3 ранг/титул DET 16.0 四代族长 (в контексте) глава клана 4-го поколения (族长=глава/патриарх) НЕ «старейшина»/«家老-管家»
d1 контрфактив (контроль) DET 19.0 幸亏春秋蝉虚弱…否则自己麻烦就大了 к счастью цикада была слаба, ИНАЧЕ были бы крупные проблемы сохранить 幸亏(к счастью)+否则(иначе бы); контроль — НЕ ломаться
d2 контрфактив (контроль) DET 7.0 只恨我没有早生几百年,否则…揭破他 жаль, не родился на века раньше, ИНАЧЕ разоблачил бы того злодея сохранить контрфактив-направление
e1 чэнъюй-сплющивание SOFT 8.1 物是人非 контраст «вещи те же — люди уже не те» судьи: сохранён ли контраст 物是/人非
e2 чэнъюй SOFT 2.1 韬光养晦 «скрывать блеск, выжидать» (таиться, копить силы) судьи: передан ли смысл сокрытия/выжидания
f1 кореференция/субъект SOFT 16.0 这促使它不得不外出,寻找野生的酒囊花 «это вынудило ЕГО (酒虫/Винного червя) выйти искать…» судьи: верный ли субъект «оно/червь», не спутан
f2 нулевое подлежащее/пол SOFT 11.1 他们的身形隐没在阴影中…分不清男女 двое (пол неясен) в тени; НЕ навязывать род судьи: не выдуман ли пол/референт

DET-классов 9 инстансов (a/b/c/d), SOFT — 4 (e/f). Оговорка: c2/c3 частично зависят от глоссария (грейды/титулы) — скорю рендер vs канон сида + span.

1.1. Армы — ПРОМПТ константен (дискурс-reflow), варьируем РЕДАКТОРА-модель

Общий flash-черновик (deepseek-v4-flash thinking-ON, из records.json); editor = дискурс-промпт (тот же frozen editor_discourse, sha b3b4f604… exp14). Три модели:

Арм Editor-модель = exp14-арм reasoning
C (cheap) glm-5 = P1a thinking disabled
F (frontier) gpt-5.4 = F-disc reasoning_effort medium (subset)
X (frontier) grok-4.3 = X-disc reasoning-ON (аддитив; НЕ на архаичной ch1 — в батарее ch1 нет)

Gemini ДРОПНУТ как арм (остаток €0.39 — почти пусто; exp14 показал: инвертирует T1 + COGS-враждебен). Максимум — 0 вызовов (беречь); фиксирую как честную оговорку, НЕ 4-й арм. Реюз exp14 (не пере-оплачиваю): ch7.0, ch8.1, ch11.1 — C/F/X уже есть; ch17.0/19.* — F есть (stage2), доснять C/X. НОВЫЕ чанки (ch10.1, ch6.0, ch16.0, ch19.0, ch2.1, ch9.1) — все 3 модели. Каждый вызов персистит usage/cost + ЧЕСТНЫЙ учёт ошибок/ретраев/finish=length (не «0 ошибок»).

1.2. Скоринг + гейты (пре-рег)

  • DET-классы (a/b/c/d): программное правило + span-цитата на каждый (арм × инстанс) → fix/fail. Пер-конструкция fix-rate: C vs F vs X. Вывод-ось: робастна ли «только gpt-5.4 (F)» по КЛАССАМ, или отдельные классы чинит и X/дешёвый C.
  • SOFT-классы (e/f): ≥2 КРОСС-семейных span-цитирующих судьи (self-family exclusion: для C(glm/zai) — судьи gpt-5-mini+kimi+mistral; для F(gpt) — kimi+mistral(+gemini-спот НЕ по бюджету); для X(grok) — gpt-5-mini+kimi+mistral). НЕ один судья на арм (урок D37). leave-one-judge-out.
  • Катастроф-скрин к ПОБЕДИТЕЛЮ тоже (инверсия полярности/участника/направления = катастрофа независимо от среднего). ≥2 независимых глаза на любую катастрофу (exp14: A-2pass-катастрофу поймал 1 из 2 → n=1 мало).
  • Omission-гард: агрессивный reflow ↔ пропуски — считать смысловые АТОМЫ (не число предложений); длина не должна коллапсировать.
  • COGS-оценка: доля чанков с DET-fail у дешёвого C × цена gpt-5.4-эскалации → стоит ли routing.
  • НИКОГДА не гейтить художественность на BLEU/COMET (zh→ru инверсия WMT24).

1.3. P1a ↔ F-disc head-to-head (§2 deliverable)

На 3 чистых главах 17/18/19 (исключая ch5/ch20): собрать P1a (=арм C, glm-5 одинарный дискурс) и F-disc (=арм F, gpt-5.4 дискурс) → слепой пакет (monitor-паттерн, метки перемешаны по главам, ключ ОТДЕЛЬНО, вне git — копирайт). Оси РАЗДЕЛЬНО: стиль + span-верность; ≥2 независимых глаза на катастрофу; владелец может дать слепой вердикт. Цель: насколько близко дешёвый P1a подходит к фронтиру — если близко по ОБЕИМ осям, дорогой gpt-5.4 не нужен и на прозе (а нога-2 решает точечную эскалацию, не тотальный фронтир).

1.4. Бюджет + дисциплина

  • Остатки (D37): OpenAI ~$6.77, Gemini ~€0.39 (беречь/дроп), Kimi ~$5.80, ZAI ~$8.31, xAI ~$8.85, DeepSeek ~$8.98, Mistral ~$9. Кап exp14b ≤$5. Per-call predicted-cost кап ОБЯЗАТЕЛЕН до каждого вызова (НЕ group). Кончился ключ → стоп на нём.
  • Ожидаемо: F(gpt-5.4) ~8 новых чанков × ~$0.09 ≈ $0.7; C(glm) ~15 × $0.015 ≈ $0.25; X(grok) ~15 × $0.015 ≈ $0.25; судьи (SOFT 4 инстанса × 3 арма × 3 судьи + head-to-head) ~$12. Итог-цель ≈ $23, под капом $5.

1.5. Гарды (методика-guard, мемо eval-aggregation — ловил 3×)

Детерм.-скоринг где можно (чище судьи); ≥2 кросс-семейных судьи на soft; leave-one-out; катастроф-скрин к ПОБЕДИТЕЛЮ; независимость сигналов до агрегации; НЕ дисконтировать свою панель ради фронтира; floor-клейм — ≥3 конструкций, не n=1; честный учёт ошибок. Слепота свята; пре-рег заморожен коммитом; аномалии провайдеров → вендор-дока+/models; .env не читать; тексты книги ≤15 слов.

1.6. Дешёвый фикс (параллельно, вне критпути — в отчёт как готовое бэкенду)

Глоссарий разрядов 甲/乙/丙/丁 → кириллица «класс А/Б/В/Г» (владелец зафиксировал D37) + принудительная сверка; развести с →«ранг/оборот». Курация сида — зона полигона; спорное → владельцу.


2. Результаты (пост-freeze; НЕ входит в freeze-commit; лендит оркестратор)

Расширение панели (прозрачно, не ретрофит трапов): к замороженным C/F/X добавлены 3 семьи-редактора deepseek-v4-pro (D), kimi (K), mistral-large (M) — чтобы floor-тест «только gpt-5.4» стоял на 6 семьях, а не 3 (по запросу владельца, аналог добавки Gemini/grok в exp14).

2.0. Операционка + SELF-REVIEW (честно — урок D37 «0 ошибок» = миф)

Трата ≈$1.36 (под капом $5): Kimi $0.71 (флейк+многословие — крупнейший), OpenAI $0.37, ZAI $0.10, XAI $0.06, DeepSeek $0.06, Mistral $0.06. 13 ошибок ЗАЛОГИРОВАНО (не «0»): kimi 6 таймаутов + 6 пустышек, deepseek 1 transport (ретрай спас). Скептический self-review нашёл и починил 2 бага, которые исказили бы вывод:

  • gpt-5.4 reasoning=medium РЕПРОДУЦИРУЕМО обрезал F 9.1 (602 симв из ~5000; reasoning съел бюджет, finish=stop) → дал бы ложное «F провалил c2». Фикс: reasoning=low (5137 симв). Квирк для 00-provider-quirks.md. Проверка F vs C/X по всем чанкам: других обрезок НЕТ.
  • deepseek-v4-pro обрезал D 6.0 (0.05×, finish=length) → перегнан на max_tokens=16000 (10054 симв).
  • kimi НЕПРИГОДЕН как редактор: 8/10 обрезки(finish=length)/таймауты; ре-ран при 28k токенах — таймаут >2мин. K-арм ДРОПНУТ (2 валидных выхода использованы точечно). Это само по себе вывод: kimi не редактор прода.
  • Аудит exp14 (ретро): все обрезки/пустышки в exp14 — 100% gemini (известное); НЕТ скрытых обрезок gpt-5.4/grok/glm/deepseek. «36 ошибок» exp14 = судейский слой (29/30 re-gate = kimi-флейкость → подтверждает поправку D37 «13 катастроф завышено»).
  • Скоринг DET — РУЧНАЯ span-читка (авто-regex-скорер брикастый — сам поймал, не доверяю; критерий объективен: над≠среди, каждый≠ни один, глава≠старейшина; оговорка author≠reviewer — читаю я).

2.1. DET-батарея (a/b/c/d) — «ТОЛЬКО gpt-5.4» ОПРОВЕРГНУТО; провалы РАЗБРОСАНЫ по модель×конструкция

Промпт КОНСТАНТЕН (дискурс); варьируем редактора. ✓=верно / ✗=провал (объективный критерий + span):

Трап (класс) glm-5 C gpt-5.4 F grok X deepseek-pro D mistral M
a1 двойн.отриц 没有一个不知道 (крит) ✗ «ни один» ✓ «не было ни одного, кто не…» ✗ «ни один» ✓ «знал каждый» ✓ «знали все»
a2 无不 (лёгкая полярн.)
b2 四成四=44% (числа)
c1 人上之人 над/среди ✓ «над» ✓ «над обычными» ✗ «среди» ✗ «среди» ? (перефраз)
c3 四代族长 глава/старейшина ⚠ГЛ-КОНФАУНД
чистых провалов способности (без c3) 1 (a1) 0 2 (a1,c1) 1 (c1) 01 (c1?)

⚠ c3 — НЕ способность, а ГЛОССАРИЙ-ЕНФОРСМЕНТ (важная находка self-review): сид имеет 四代族长→«Четвёртый глава рода» (ВЕРНО), но status:draft → в editor-констрейнт (только approved) НЕ попадает; зато туда попадает approved 家老→«старейшина», и glm/mistral (глоссарий-обедиентные) подтянули «старейшину» к 四代族长, а gpt/grok/deepseek дали верное «глава» из исходника. Т.е. c3-«провал» = обедиентность к enforced-соседу при draft-целевом терме, не непонимание. Исключаю c3 из способности; это фикс-глоссария.

Выводы ноги-2 (прямой ответ на HOLD D37):

  1. «Только gpt-5.4 чинит смысл» — ОПРОВЕРГНУТО. Крит-трап a1 (двойное отрицание) чинят gpt-5.4, deepseek-pro И mistral; валят glm-5 и grok. Дешёвый mistral ($0.5/$1.5) чинит то, что наш текущий редактор glm-5 ($1/$3.2) инвертирует — и mistral ДЕШЕВЛЕ. Экстраполяция exp14 (n=1 фронтир, 1 судья) была артефактом.
  2. Провалы РАЗБРОСАНЫ по модель×конструкция, не «дешёвые валят всё» и не «фронтир чинит всё»: glm валит a1+c3, grok валит a1+c1, deepseek валит c1, mistral валит c3. Нет модели безупречной или безнадёжной; нет одной «эскалации», закрывающей всё.
  3. gpt-5.4 — самый РОБАСТНЫЙ (0/5), но это «самый ровный», а не «единственный, кто может» — за $2.5/$15 платить необязательно.
  4. c3 (族长→«старейшина» у glm/mistral) — ГЛОССАРИЙ, не способность → сид 族长→«глава клана» (детерм. фикс, с грейдами). b1 (十二分之一/三成) — числа местами дрейфуют (四成四→«четыре десятых и четыре десятых» у glm в ch10.1) — на omission/число-гард.

2.2. SOFT-классы (e чэнъюй / f кореференция) — 3 кросс-семейных судьи (gpt-5-mini+kimi+mistral), leave-one-out, ≥2-глаза-на-катастрофу

Трап Свод (по judge-консенсусу)
e1 物是人非 ВСЕ армы «partial», все судьи единогласно → сплющивание чэнъюй УНИВЕРСАЛЬНО (не модель-специфично) — промпт/глоссарий-рычаг, не модель
e2 韬光养晦 Большинство «correct» (2/3 судьи: gpt-mini+kimi); mistral-судья строже («partial»). Leave-one-out(mistral)→все correct. ОК
f1 它=Винный червь 2/3 судьи «correct»; mistral-СУДЬЯ over-флагает «wrong+CAT» на glm/grok — но gpt-mini+kimi «correct» → катастрофа НЕ подтверждена (single-judge)
f2 他们-пол Разнобой (gpt-mini «partial» / kimi «correct» / mistral «wrong+CAT» почти на всех) → субъективно; ни одной катастрофы ≥2-глазами

Вывод SOFT: НИ ОДНОЙ подтверждённой (≥2 судьи) катастрофы. Все CAT-флаги — от ОДНОГО судьи (mistral over-флагает). Чэнъюй-сплющивание (e1) универсально (все модели partial) → рычаг промпта/глоссария, не модель. Методик-урок (валидирует D37-фикс): mistral-судья один дал бы ложные катастрофы f1/f2 — ровно ошибка exp14 (один kimi на фронтире). ≥2 кросс-семейных судьи + leave-one-out их сняли. Soft-классы модели НЕ разделяют → смысл-floor узкий (a1/c1), не широкий.

2.3. P1a ↔ F-disc head-to-head (§2 мандата) — дешёвый = фронтир на прозе

Прозо-KPI (детерм.) на гл.17/18/19: P1a (glm-5) mean_spp 2.52 / доля-1-предл 0.381 vs F-disc (gpt-5.4) 2.55 / 0.427. ТАЙ (P1a даже чуть меньше рублёнки). → стилевое превосходство F-disc в exp14 — НЕ про абзацы (равны), а про гладкость/лексику; по структурной претензии-1 дорогой gpt-5.4 НЕ нужен. Слепой пакет exp14b/monitor/h2h.md (P1a↔F-disc + оригинал, метки перемешаны) — владельцу на слепой вердикт (span-верность + стиль).

2.4. Рекомендация (на ратификацию оркестратора; дефолт НЕ менять сессией)

  1. Фронтир (gpt-5.4) в дефолт НЕ нужен: абзацы — дешёвый P1a = фронтир (KPI-тай); смысл — дешёвые mistral/deepseek-pro чинят крит-трапы. Дорогая gpt-5.4-эскалация из exp14-рекомендации пере-взвешивается вниз.
  2. Кандидат: сменить дешёвый редактор glm-5 → deepseek-pro ИЛИ mistralоба ДЕШЕВЛЕ glm И чинят двойное отрицание (glm валит). Требует проверки их ПРОЗЫ/абзацев (мерить отдельно — здесь мерена верность, не стиль полностью) + omission-гард.
  3. Смысл-floor УЗКИЙ и РАЗБРОСАННЫЙ → не одна эскалация, а: (а) глоссарий-фиксы (族长, грейды 甲乙丙) детерминированно; (б) число/omission-гард; (в) при желании ровности — gpt-5.4 точечно, но ROI низкий.
  4. Глоссарий-курация — КОРЕНЬ найден self-review'ом: важные термы оставлены status:draftНЕ в editor-констрейнте → дрейф/подмена. Сид уже несёт ВЕРНЫЕ dst (甲乙丙丁→разряд А/Б/В draft; 四代族长→Четвёртый глава рода draft), но draft = мягкая ⟨проверить⟩, не enforced. Фиксы владельцу: (а) грейды → dst «класс А/Б/В/Г» (D37) + promote draft→approved (enforce, стоп-дрейф); (б) 四代族长 promote draft→approved (иначе approved 家老→«старейшина» перетягивает); (в) 转→«ранг» (approved) — развод с грейдами держится. Это не «модель тупая» — это статусы сида. Статусы меняет владелец (approved-инвариант) + reseed.

2.5. Оговорки (методика-guard)

Батарея мала (5 конструкций DET + 4 soft, пара ячеек «?»); DET-скоринг — ручная span-читка (объективный критерий, но author≠reviewer — 2-й глаз усилит); kimi выпал (editor+judge флейкость); прозо-сравнение P1a↔F-disc — только KPI+слепой пакет (владелец-вердикт pending); ИНТЕРИМ пре-скрин (D35), НЕ пилот. Смену дефолта ратифицирует оркестратор.