Ratify D38 accepting exp14b: refute only-gpt-5.4 (mistral and deepseek-pro fix meaning inversions), find term-drift root is seed draft-status, hold cheap-editor swap for a prose bake-off
This commit is contained in:
parent
c5c277615a
commit
33c79d7a01
7 changed files with 119 additions and 6 deletions
|
|
@ -34,7 +34,7 @@
|
|||
|
||||
**Что уже сделано (D30→D35, залендено):** флип D1→билингв-редактор, reflow, output-санитайзер (+фикс D33.1), сид v2 подписан владельцем (D34.1); пере-прогон 25 глав связкой выполнен (инфра держится, флор D24.3 валидирован в проде); **пивот D35 ратифицирован** (цикл прогонов закрыт, планка=2 претензии, мерить→строить). exp13 закрыт (переводчик=flash, pro отклонён — D32). Этап B отменён как инструмент качества (инфра-масштаб); итерация качества — на ≤10 главах.
|
||||
|
||||
> **СТАТУС D36 (оркестратор №4, 12.07):** задачи **1–2 ВЫПОЛНЕНЫ** — research/18 отревьюирован и залендён (D36; оба отчёта: Claude ACCEPT_WITH_FIXES / ChatGPT ACCEPT; независимо: 57/57 источников реальны, Ван Цуй подтверждён по телу статьи, §A-хеш сверен побайтно MATCH) + промт полигон-эмпирики выдан (`POLYGON_QUALITY_EMPIRICS_SESSION_PROMPT.md`, D36). Бюджеты ключей подтверждены владельцем (OpenAI ~$9, Gemini ~€2.6, DeepSeek/ZAI/Kimi/xAI/Mistral ~$9; других нет — D36.1). Спент-промты заархивированы (D36.1). **Остаётся:** 4 (бэкенд-фикс-лист D35.4 + D37-фиксы: глоссарий А/Б/В/Г, omission-гард, CJK-утечка — в бэкенд-пакет под ROI), 5 (readme чужих зон). **D37 (12.07): exp14 отревьюирован+ратифицирован** (претензия-1=промпт-рычаг подтверждён; нога-2 gpt-5.4 ХОЛД-недомощна; A-2pass отклонён; разряды→кириллица А/Б/В/Г; re-gate хвост ~5-6, «13» завышено; fidelity re-gate D34.3 прогнан). **exp14b ВЫДАН** (`POLYGON_EXP14B_SESSION_PROMPT.md`; владелец выбрал перед бэкендом). Контракт D24→**D37**. Ниже — исходный список задач хендоффа (1–2 закрыты).
|
||||
> **СТАТУС D36 (оркестратор №4, 12.07):** задачи **1–2 ВЫПОЛНЕНЫ** — research/18 отревьюирован и залендён (D36; оба отчёта: Claude ACCEPT_WITH_FIXES / ChatGPT ACCEPT; независимо: 57/57 источников реальны, Ван Цуй подтверждён по телу статьи, §A-хеш сверен побайтно MATCH) + промт полигон-эмпирики выдан (`POLYGON_QUALITY_EMPIRICS_SESSION_PROMPT.md`, D36). Бюджеты ключей подтверждены владельцем (OpenAI ~$9, Gemini ~€2.6, DeepSeek/ZAI/Kimi/xAI/Mistral ~$9; других нет — D36.1). Спент-промты заархивированы (D36.1). **Остаётся:** 4 (бэкенд-фикс-лист D35.4 + D37-фиксы: глоссарий А/Б/В/Г, omission-гард, CJK-утечка — в бэкенд-пакет под ROI), 5 (readme чужих зон). **D37 (12.07): exp14 отревьюирован+ратифицирован** (претензия-1=промпт-рычаг подтверждён; нога-2 gpt-5.4 ХОЛД-недомощна; A-2pass отклонён; разряды→кириллица А/Б/В/Г; re-gate хвост ~5-6, «13» завышено; fidelity re-gate D34.3 прогнан). **D38 (12.07): exp14b отревьюирован+ратифицирован** — «только gpt-5.4» ОПРОВЕРГНУТО (mistral/deepseek-pro чинят смысл-инверсии, что glm валит; фронтир в дефолт НЕ нужен; P1a≈F-disc); корень терм-дрейфа = статус-draft сида → promote approved; кандидат glm→mistral/deepseek-pro на бейк-офф прозы; провайдер-квирк gpt-5.4 reasoning=medium→low. **СЛЕДУЮЩИЙ полигон-шаг:** бейк-офф редактора (проза/omission) + reseed-глоссарий (свежий промт). Контракт D24→**D38**. Ниже — исходный список задач хендоффа (1–2 закрыты).
|
||||
|
||||
**⚠ ТВОИ НЕПОСРЕДСТВЕННЫЕ ЗАДАЧИ (по приоритету):**
|
||||
1. **Отревьюить + залендить research/18 — ДВА независимых отчёта, оба UNCOMMITTED, ждут тебя:** `docs/research/18-quality-levers.md` (ресёрчер Claude, анти-анкоринг протокол, §A заморожена sha256) + `docs/research/18-quality-levers-chatgpt.md` (параллельный ChatGPT, запущен владельцем). Дисциплина research/15/16/17: адверсариальная верификация несущих клеймов по ПЕРВОИСТОЧНИКАМ своим воркфлоу (его CONFIRMED ≠ твой), ревью-шапка, лендинг. ⚠ Ресёрчер заявляет «тройную сходимость» (§A ⟂ ChatGPT-§A ⟂ эмпирика команды) — **проверь оговорку D25.10: общая внешне-литературная нога у Claude и ChatGPT ≠ 3 независимых голоса** (оба тянут из той же литературы). Ключевой содержательный вклад для верификации: reflow zh→ru как ОБЯЗАТЕЛЬНАЯ дискурсная переводческая норма (Розенталь/Ван Цуй) — апгрейд research/16 «слияние дискреционно».
|
||||
|
|
|
|||
|
|
@ -1,7 +1,7 @@
|
|||
# Журнал прогресса
|
||||
|
||||
> **⟶ ТЕКУЩЕЕ СОСТОЯНИЕ** (обновляемый блок; на 2026-07-12). **Источник истины по РЕШЕНИЯМ — `architecture/05-decisions-log.md` (D1–D31); этот файл — ЖУРНАЛ, не спека.**
|
||||
> - **Фаза:** 0 ✅; Ф1-машинерия ✅ (D21–D28); приёмка этап A ✅ (D24). **Путь D26→D35: качество-первым.** Флип D1 моно→билингв (D30, supersede D17), reflow+output-санитайзер (D30/D33), сид v2 подписан владельцем (D34.1), переводчик flash сохранён (exp13/D32 — pro отклонён). **Пере-прогон 25 глав связкой ВЫПОЛНЕН; вердикт владельца: «лучше (из-за сида), но крайне слабо художественно» (2 претензии: абзацы/конвенции + понимание связей). ПИВОТ D35:** цикл приёмочных прогонов ЗАКРЫТ (инфра ✅ подтверждена исполнением / читаемость ❌ = блок на непостроенной Ф2 — НЕ провал; диагноз «Ф2-недострой + near-term промпт/нарезка-рычаги, не баг» верифицирован; флор D24.3 валидирован в проде). Планка впредь = 2 претензии владельца (ИНТЕРИМ пре-скрин, НЕ пилот Ф2.5). **Очередь «мерить→строить»: research/18 ЗАЛЕНДЕН (D36) → полигон exp14 ПРОГНАН+ратифицирован (D37, ACCEPT_WITH_FIXES): претензия-1 (абзацы) = рычаг ПРОМПТА/активации (F-base фронтир+старый промпт рубит хуже P0), дёшево — дискурс-промпт + крупный чанк; A-2pass отклонён (2-пасс дрейфует); разряды 甲乙丙 → кириллица «класс А/Б/В/Г» (владелец); re-gate хвост ~5-6 реальных редактор-инверсий (не 13 — kimi оверфлаг); претензия-2 = типовые главы дешёвая тянет, но жёсткий смысл-хвост только gpt-5.4 чинит — НЕДО-МОЩНО (n=1) → батарея-трапов exp14b → бэкенд под ROI.** Fidelity re-gate (D34.3) прогнан (§2Б.2 exp14, «не чист»). Бэкенд-фиксы (D35.4): экспорт-баг (ch5/ch20 пустые), ведущий `###` из draft, глоссарий разрядов 甲乙丙丁. Трек: дешёвые модели сейчас, фронтир потом (D30.7). Решающая точка — пилот Ф2.5 (блокеры: билингв-якорь/аннотаторы ≥3 — D25.9-Q1, корпус, судья-дублёр — D22.6). *(Детальная хроника D30–D34 — в записях ниже + D-лог.)*
|
||||
> - **Фаза:** 0 ✅; Ф1-машинерия ✅ (D21–D28); приёмка этап A ✅ (D24). **Путь D26→D35: качество-первым.** Флип D1 моно→билингв (D30, supersede D17), reflow+output-санитайзер (D30/D33), сид v2 подписан владельцем (D34.1), переводчик flash сохранён (exp13/D32 — pro отклонён). **Пере-прогон 25 глав связкой ВЫПОЛНЕН; вердикт владельца: «лучше (из-за сида), но крайне слабо художественно» (2 претензии: абзацы/конвенции + понимание связей). ПИВОТ D35:** цикл приёмочных прогонов ЗАКРЫТ (инфра ✅ подтверждена исполнением / читаемость ❌ = блок на непостроенной Ф2 — НЕ провал; диагноз «Ф2-недострой + near-term промпт/нарезка-рычаги, не баг» верифицирован; флор D24.3 валидирован в проде). Планка впредь = 2 претензии владельца (ИНТЕРИМ пре-скрин, НЕ пилот Ф2.5). **Очередь «мерить→строить»: research/18 ЗАЛЕНДЕН (D36) → полигон exp14 ПРОГНАН+ратифицирован (D37, ACCEPT_WITH_FIXES): претензия-1 (абзацы) = рычаг ПРОМПТА/активации (F-base фронтир+старый промпт рубит хуже P0), дёшево — дискурс-промпт + крупный чанк; A-2pass отклонён (2-пасс дрейфует); разряды 甲乙丙 → кириллица «класс А/Б/В/Г» (владелец); re-gate хвост ~5-6 реальных редактор-инверсий (не 13 — kimi оверфлаг); претензия-2 хвост → exp14b ПРОГНАН+ратифицирован (D38): **«только gpt-5.4» ОПРОВЕРГНУТО** (дешёвые mistral/deepseek-pro чинят двойн.отриц, что glm-5+grok инвертируют; провалы разбросаны; фронтир в дефолт НЕ нужен — P1a≈F-disc по абзацам); **корень терм-дрейфа = статус-draft сида** (draft-термы не в editor-констрейнте + longest-match съедает верный approved) → promote грейды(А/Б/В/Г)+四代族长 approved; **кандидат glm-5→mistral/deepseek-pro** (дешевле+чинят) на бейк-офф ПРОЗЫ/omission → бэкенд под доказанный конфиг.** Эмпирика сошлась на ОРГАНИЗАЦИИ (не моделях) — D30.7-трек подтверждён. Бэкенд-фиксы (D35.4): экспорт-баг (ch5/ch20 пустые), ведущий `###` из draft, глоссарий разрядов 甲乙丙丁. Трек: дешёвые модели сейчас, фронтир потом (D30.7). Решающая точка — пилот Ф2.5 (блокеры: билингв-якорь/аннотаторы ≥3 — D25.9-Q1, корпус, судья-дублёр — D22.6). *(Детальная хроника D30–D34 — в записях ниже + D-лог.)*
|
||||
> - **Стек (пост-D32):** черновик — **deepseek-v4-flash СОХРАНЁН** (exp13/D32: смена на pro отклонена по данным — сфабрикованная сходимость + катастрофа 蛊→«гусеницы» + верность у flash не хуже; thinking ON; escalate_to=pro без изменений) · редактор — **БИЛИНГВ (D30.1), кандидат glm-5-билингв** (gemini — премиум-эскалация за санитайзером; grok reasoning-off из редакторов СНЯТ — no-op) · судья/апекс Gemini 3.1 Pro (**слаг `-preview`**; mandatory thinking; `additive_total` — D22.3) · эскалация A: DeepSeek V4 Pro → GLM-5.1 → Gemini-preview · **канал B (18+): Mistral · эскалация grok-4.3 reasoning-ON (⚠ не на архаичных zh — D22.5) · abliterated-скрининг · судьи: эротика — Grok (дублёр гейтится пробой D22.6), violence/SFW — Grok+Gemini** (DeepSeek в explicit запрещён ToS — D14.1). 7 ключей.
|
||||
> - **Экономика:** `experiments/08-cost-model-v2.md` — до-флиповый ~$0.69 ранобэ / ~$10.94 вебновелла-500; **после флипа D1 → ~$0.85/ранобэ (+15–25%, D30.4)**; «$1.5–2» = опция Б (селективный апекс+память, НЕ подписана); пере-съём = exp08 v3 (D21.8/D25.8). ⚠ Resume: любой `--resnapshot` = переоплата книги — онгоинг гейтится реализацией D15.2 (идёт, D30.9). Gemini-недоучёт 146×/вызов закрыт additive_total (D22.3).
|
||||
> - **Ждём от владельца:** ~~подпись спорных терминов сида v2~~ ✅ ПОДПИСАНО (D34.1; владелец переопределил: Жэнь Цзу, Монах Цветочного Вина, гу Жизни, деревня Гуюэ, первобытный камень; род «гу» муж) · **чтение 25 глав пере-прогона** (арбитр читаемости — после связки+re-gate) · **флагман-сверка exp13** (переводчики, monitor-паттерн) · DashScope-ключ для qwen-арма exp13 (опционально) · **планка запуска** (лучше-фана/гибрид/издательский + готовность к COGS опции Б ~$1.5–2 — мемо-эскалация exp12; интерим D30.7: «лучше фана» на дешёвом миксе) · решение по билингв-якорю пилота (D25.9-Q1) · «да/нет» митигации контаминации пилотного корпуса (D27.4) · publishable/waiver — при экспорте (D25.1) · FN-bound L3 — при спеке (D25.4) · провенанс 12-*-доков · юр-пакет (+rights manifest, D25.8).
|
||||
|
|
@ -44,6 +44,8 @@
|
|||
|
||||
**12.07 (№4): exp14 (эмпирика рычагов качества) отревьюирован и ратифицирован — D37.** Полигон прогнал exp14 (нарезка×промпт 2×2 + аблации + фронтир 3-семейный gpt-5.4/gemini/grok + кривая + fidelity re-gate + слепые финалисты P0/A-2pass/F-disc), закоммитил 6 батчей САМ (отклонение — впредь фризить только пре-рег). Владелец прочёл монитор слепо (3 главы) + 2 внешние сессии (ChatGPT+Claude). **Независимая верификация — 7-агентный воркфлоу span-уровнем ($0):** (1) **Претензия-1=промпт-рычаг ПОДТВЕРЖДЕНА** (F-base фронтир+старый промпт 1.75 spp рубит хуже P0 1.95; дискурс-промпт реверстает у всех). (2) **A-2pass-катастрофа 人上之人 РЕАЛЬНА** (span; одинарный P0 её починил → одинарный дискурс безопаснее). (3) **Разряды 甲乙丙 плывут** (ch9.1 В→Б, ch18.1 «цинское качество») → **владелец выбрал кириллицу «класс А/Б/В/Г»**. (4) **T1-floor (только gpt-5.4 чинит двойное отрицание, grok/gemini инвертируют) ВЕРИФИЦИРОВАН, но n=1 + одно-судейно на фронтире → нога-2 (gpt-5.4-эскалация) НЕДО-МОЩНА, ХОЛД.** (5) **Поправки:** «13 катастроф» завышено (~5-6 реальных; kimi оверфлаг, ошибся 29/55; ch11.0 — редактор УЛУЧШИЛ); §2Б.3 «панель литерал-смещена→P0 не вернее» = пере-натяжка (T1 в ch7 вне ранг-выборки; IN-SAMPLE спан выгораживает P0); «0 ошибок» неточно (36 ошиблись+билленулись $0.89). Деньги $8.67 (в 2%), капы соблюдены, Gemini €2.21=85% бюджета. **Следующий шаг — exp14b (промт ВЫДАН, `POLYGON_EXP14B_SESSION_PROMPT.md`; владелец выбрал exp14b ПЕРЕД бэкендом — строить бэкенд один раз под финальный конфиг):** батарея смысл-трапов (≥3-5 типов, детерм.-скоринг + ≥2 фронтир-судьи) для ноги-2 + ранг P1a head-to-head vs F-disc (финалисты его исключили); дешёвые фиксы (глоссарий А/Б/В/Г) параллельно. Курс не разворачивается; планка = 2 претензии ИНТЕРИМ; пилот не разбавляется. (Разбор — D37.)
|
||||
|
||||
**12.07 (№4): exp14b (батарея смысл-трапов + P1a↔F-disc) отревьюирован и ратифицирован — D38.** Полигон прогнал 5 DET-классов × 6 семей-редакторов + SOFT (≥2 судьи) + P1a↔F-disc; **батчи НЕ коммитил** (процесс-фикс D37 отработал); **self-review сам поймал+починил 2 бага** (мандат самопроверки CLAUDE.md отработал живьём). Независимая верификация — 3 агента span-читкой ($0). **ГЛАВНОЕ (span-верифицировано):** (1) **«только gpt-5.4 чинит смысл» ОПРОВЕРГНУТО** — на a1 (двойн.отриц) deepseek-pro «знал каждый» И mistral «знали все без исключения» чинят, glm-5+grok инвертируют в «ни один»; **дешёвый mistral чинит то, что дефолт glm инвертирует, и дешевле**; провалы разбросаны по модель×конструкция. (2) **Фронтир в дефолт НЕ нужен** — P1a(glm)≈F-disc(gpt-5.4) mean_spp тай (2.56/2.65). (3) **Корень терм-дрейфа = статус-draft сида** (verified `memory.go:489` CONFIRMED-only + `suppressContained` съедает верный approved `族长`) → **promote грейды(А/Б/В/Г)+四代族长 draft→approved** (владелец направил; reseed; owner-only). (4) Soft: 0 катастроф ≥2-глазами; чэнъюй-сплющивание универсально = промпт/глоссарий. **ХОЛД: кандидат glm-5→mistral/deepseek-pro** — бейк-офф их ПРОЗЫ+omission до смены дефолта (урок exp13). Провайдер-квирк **gpt-5.4 reasoning=medium обрезает вывод** → `00-provider-quirks` (в роли редактора `low`). Деньги $1.36/13 ошибок точно. **Стратегически: эмпирика сошлась на ОРГАНИЗАЦИИ, не моделях — фронтир НЕ нужен, D30.7-трек «дешёвые сейчас» подтверждён.** Слепой h2h-пакет (`exp14b/monitor/h2h.md`) — владельцу на вердикт. ⚠ `eval/exp14b_*.py` untracked (полигон-зона — полигону закоммитить для воспроизводимости). (Разбор — D38.)
|
||||
|
||||
## Приёмка Ф1 — ПЕРЕ-ПРОГОН 25 глав кандидат-конфигом (билингв glm-5 + reflow + сид v2 + санитайзер), 2026-07-12 (D30.9/D34.2)
|
||||
|
||||
Пере-прогон по `ACCEPTANCE_SESSION_PROMPT.md`. **Ничего не закоммичено** (лендинг — оркестратору). Все производные — ВНЕ git в `/home/ubuntu/books/gu-zhenren/rerun/` (свежий store `guzhenren-rerun.db`, конфиги, выходы, отчёты, скрипты замеров). **Дерево backend/ чистое — мои правки кода = 0** (throwaway-хелпер `cmd/_dumpsrc` для дампа исходных чанков — `_`-игнор Go-тулчейном, не коммичен, удалён после использования). Предусловия запуска (все 5) сверены: D15.2 этап A+D33.1 залендены; draft=flash сохранён (exp13/D32); сид v2 подписан владельцем (D34.1 — Жэнь Цзу/Монах Цветочного Вина/гу Жизни/деревня Гуюэ/первобытный камень/род «гу» муж — сверено в `guzhenren-seed-v2.yaml`); budget_usd>0; единый resnapshot.
|
||||
|
|
|
|||
|
|
@ -16,7 +16,7 @@
|
|||
- `experiments/` — эмпирика «Полигона»: `00-provider-quirks` (читать перед любым вызовом провайдера), `01-token-calibration`, `02-refusal-benchmark`, `03-local-stand`, `04-editor-quality`, `06-local-extraction`, `07-coverage-precision`, `08-cost-model-v2` (актуальная денежная модель), `09-pilot-protocol` (пилот Ф2.5 + поправки D13), `10-explicit-benchmark` (18+ violence-рука канала B), `11-erotica-benchmark` (erotica по трём парам/регистрам — закрытие D14.4, D22).
|
||||
- `research/` — фактура исследований 04–05.07: `01–10` базовые, `11-gap-*` добор критиком, `12-*` режимы отказа/отзывы/таксономии (+ два внешних материала с провенанс-шапками), `13` валидация памяти, `14` адаптивная память, `15` голос и состояние (принят, D21), **`16` ридер-IDE (принят с ревью-шапкой, D29)**, **`17` внешняя критика GPT-5.6 (принят с ревью-шапкой, D25)** — у 16/17 читать шапку прежде тела. ⚠ Часть под superseded-баннерами (01/02/03/04/05/09 и gap-1/2/5) — **читай баннер прежде содержимого**.
|
||||
- `PROGRESS.md` — **журнал** (CURRENT-STATE сверху, ниже хронология; НЕ источник решений).
|
||||
- **Активные хендофф-промты** (пивот D35→D37, очередь «мерить→строить»): [`ORCHESTRATOR_SESSION_PROMPT.md`](ORCHESTRATOR_SESSION_PROMPT.md) (роль оркестратора) · [`POLYGON_PACKAGE4_SESSION_PROMPT.md`](POLYGON_PACKAGE4_SESSION_PROMPT.md) (**ОТЛОЖЕН, пилот-residual:** task-1 закрыт exp13/D32; открыты D22.6 судья-дублёр + D25.7 echo-кал + пилот-пре-рег + P4-хвост — для пилота, не exp14). [`POLYGON_EXP14B_SESSION_PROMPT.md`](POLYGON_EXP14B_SESSION_PROMPT.md) (**СЛЕДУЮЩИЙ, ВЫДАН — владелец выбрал перед бэкендом:** батарея смысл-трапов для ноги-2 [gpt-5.4-эскалация недо-мощна, D37] + ранг P1a↔F-disc; ∥ дешёвые фиксы: дискурс-промпт / глоссарий разрядов кириллица А/Б/В/Г / санитайзер) → бэкенд под ROI (стейдж Б/В D15.2 — свежий промт, дизайн = спека v3.1). Закрытые в `archive/prompts/`: exp14 (нарезка×промпт+blind-eval)→D37, research/18-ресёрчер→D36, exp13→D32, санитайзер-фикс→D33.1, приёмка v2 (цикл ЗАКРЫТ D35), D152-этап-А→D33, пакеты №3–5, erotica, «Голос», r/17, r/16, exp12→D30.
|
||||
- **Активные хендофф-промты** (пивот D35→D37, очередь «мерить→строить»): [`ORCHESTRATOR_SESSION_PROMPT.md`](ORCHESTRATOR_SESSION_PROMPT.md) (роль оркестратора) · [`POLYGON_PACKAGE4_SESSION_PROMPT.md`](POLYGON_PACKAGE4_SESSION_PROMPT.md) (**ОТЛОЖЕН, пилот-residual:** task-1 закрыт exp13/D32; открыты D22.6 судья-дублёр + D25.7 echo-кал + пилот-пре-рег + P4-хвост — для пилота, не exp14). **СЛЕДУЮЩИЙ (свежий промт при направлении владельца, D38):** бейк-офф дешёвого редактора **glm-5 → mistral / deepseek-pro** (оба дешевле И чинят смысл-инверсии, что glm валит — но мерить ПРОЗУ+omission) + **reseed-глоссарий** (promote грейды А/Б/В/Г + 四代族长 draft→approved) → бэкенд под доказанный конфиг (дискурс-промпт + дешёвый редактор-кандидат + число/omission/CJK-гард) (стейдж Б/В D15.2 — свежий промт, дизайн = спека v3.1). Закрытые в `archive/prompts/`: exp14b (смысл-батарея)→D38, exp14 (нарезка×промпт+blind-eval)→D37, research/18-ресёрчер→D36, exp13→D32, санитайзер-фикс→D33.1, приёмка v2 (цикл ЗАКРЫТ D35), D152-этап-А→D33, пакеты №3–5, erotica, «Голос», r/17, r/16, exp12→D30.
|
||||
- `archive/` — закрытые сессионные промты (только история, инструкции оттуда не исполнять).
|
||||
|
||||
## Статус (2026-07-12, пост-пивот D35)
|
||||
|
|
|
|||
|
|
@ -1,9 +1,9 @@
|
|||
# Журнал решений оркестратора — контракт D1–D37 (развязки 04.07 · пакеты 09–10.07 · приёмка/качество-первым/пивот/эмпирика 11–12.07)
|
||||
# Журнал решений оркестратора — контракт D1–D38 (развязки 04.07 · пакеты 09–10.07 · приёмка/качество-первым/пивот/эмпирика 11–12.07)
|
||||
|
||||
> **⟶ КАРТА АКТУАЛЬНОСТИ (ревизия D31, 12.07; исторические записи ниже НЕ переписываются — дисциплина D23.3).** Читая контракт целиком, держи под рукой, что чем перекрыто:
|
||||
> - **Полностью superseded:** **D1 (моно-редактор) → D17 → D30.1 (редактор БИЛИНГВ)** · D9 (ja-приёмка) → D18 (蛊真人 zh→ru; ja — второй прогон) · D17 → D30.1 · скобка D19.4 «ключ без data-sharing» и D20.3 «чистый ключ = блокер пилота» → **D27** (единый ключ С data-sharing, отключение перед продом) · exp04-дефолт «editor grok-4.3» (D3) → D30.1 (grok reasoning-off из редакторских ролей СНЯТ — no-op; кандидат glm-5-билингв; gemini — премиум-эскалация только за санитайзером D30.3).
|
||||
> - **Частично амендировано:** D3 (канал B → D14.1/D19.1 + оговорки D22.5/D22.6; апекс-слаг `-preview` — D22.4; draft под вопросом exp13 — D30.6) · D6 («off/minimal для draft/edit» эродирован: draft thinking-ON принудительно, editor-off снят D30.1; живы per-роль принцип и D6.2-буфер) · D10 (+D24.2 alias-слепое пятно, истинная консистентность ≈99.5%) · D11-числа → exp08 → **D30.4** (флип D1 = +15–25%, ~$0.85/ранобэ; «$1.5–2» = неподписанная опция Б) · D12 (+D24.3 флоры max_tokens; +D29.1в rollup — амендмент вердикт-правила) · D13.1-арм из решающего → ПОДТВЕРЖДАЮЩИЙ (D30.1); +D25.3 prefix-анализ судьи · D14.2 закрыт D19.1/D22.4; D14.4 закрыт D22.1 · D15.3 исполнен; спека D15.2: v2→v3→v3.1 (D22.2), реализация = текущий пакет (D30.9) · D24.4 +D28.1 (precision/recall-трейдофф; hard-gate требует пере-замера) · порядок D24.5 отложен D26.1 (этап B — после читаемых 25 глав).
|
||||
> - **Живое ядро без изменений:** D2 (+новый гейт-класс D30.3), D4, D5, D7, D8, D10-механизм, D12-таксономия отказов, D16, D18, D19.1–19.2, D21 (Ф2-механизмы voice/address/reveal), D22.5–22.7, D23 (golden = инвариант №8), D24–D37 — действующая голова контракта (D35 = пивот качество-первым; D36 = приёмка research/18 + промт полигон-эмпирики; D37 = приёмка exp14-эмпирики: претензия-1=промпт-рычаг ратифицирован, нога-2 gpt-5.4 холд-недомощна).
|
||||
> - **Живое ядро без изменений:** D2 (+новый гейт-класс D30.3), D4, D5, D7, D8, D10-механизм, D12-таксономия отказов, D16, D18, D19.1–19.2, D21 (Ф2-механизмы voice/address/reveal), D22.5–22.7, D23 (golden = инвариант №8), D24–D38 — действующая голова контракта (D35 = пивот качество-первым; D36 = приёмка research/18; D37 = приёмка exp14: претензия-1=промпт-рычаг; D38 = приёмка exp14b: «только gpt-5.4» ОПРОВЕРГНУТО [mistral/deepseek-pro чинят], фронтир в дефолт НЕ нужен, корень терм-дрейфа = статус-draft сида).
|
||||
|
||||
Ответ на вопросы бэкенд-сессии (PROGRESS §«Вопросы от бэкенда», §«[НУЖНО РЕШЕНИЕ] перед Фазой 1» — с ревизии D31 в `archive/PROGRESS-2026-07-04-10.md`) и полигона (think-режим). Каждое решение прошло адверсариальную панель из 3 критиков (research / экономика / исполнимость в коде Фазы 0); ни одно не отклонено, все уточнены. Это **контракт Фазы 1** — бэкенд исполняет отсюда; при конфликте с буквой 01-decisions/02-mvp-plan — источник истины здесь (потом сольём в основные доки).
|
||||
|
||||
|
|
@ -489,3 +489,15 @@ D1 остаётся дефолтом Фазы 1 (менять конфигура
|
|||
4. **ХОЛД — нога 2 (селективная эскалация смысл-риска на gpt-5.4) НЕДО-МОЩНА.** Факт (glm/grok/gemini инвертируют двойное отрицание T1, только gpt-5.4 чинит) ВЕРИФИЦИРОВАН, НО на 1 конструкции + одно-судейно на фронтире (gpt-5-mini self-excluded). Дорогое COGS-routing НЕ ратифицировать до батареи смысл-трапов. **Ответ «модели vs организация» расщепляется:** претензия-1 = организация (дёшево, ратифицировано); претензия-2 = типовые главы дешёвая тянет, но хвост жёстких смысл-трапов (двойн.отриц./числа/ранг) валит дешёвую И grok/gemini — только gpt-5.4 → мерить, потом коммитить.
|
||||
5. **СЛЕДУЮЩИЙ ПОЛИГОН-ШАГ (свежий промт, exp14b):** батарея смысл-трапов (≥3–5 типов инверсий/чисел/ранга/кросс-граница, ≥2 кросс-семейных фронтир-судьи) для ноги-2 + **ранжирование P1a (рекомендованный near-term конфиг) head-to-head против F-disc** (финалисты его исключили — прямых данных P1a-vs-фронтир НЕТ) + omission-гард. Дешёвые фиксы (промпт-глоссарий/санитайзер) — параллельно.
|
||||
6. **ПРОЦЕСС:** сессии фризят ТОЛЬКО пре-рег, батчи — оркестратору на лендинг (exp14 закоммитил 6 батчей сам — впредь тайтить). Курс не разворачивается; планка = 2 претензии ИНТЕРИМ; пилот Ф2.5 не разбавляется.
|
||||
|
||||
## D38. Приёмка exp14b (батарея смысл-трапов = нога-2 + ранг P1a↔F-disc): «только gpt-5.4» ОПРОВЕРГНУТО, фронтир в дефолт не нужен, корень терм-дрейфа = статус-draft сида (12.07, оркестратор №4). ✅
|
||||
|
||||
exp14b (D37-мандат) прогнал батарею DET-смысл-трапов (5 классов a/b/c/d) × 6 семей-редакторов (glm-5/gpt-5.4/grok-4.3/deepseek-pro/mistral/kimi, промпт-константа = дискурс) + SOFT (чэнъюй/кореф, ≥2 кросс-семейных судьи) + P1a↔F-disc. Сессия **НЕ коммитила батчи** (процесс-фикс D37 отработал; §1-пре-рег заморожен 48e3f39, §2 залендён мной). Независимая верификация — 3 параллельных агента span-читкой сырья ($0). **Мандат самопроверки (CLAUDE.md 12.07) отработал: self-review сессии сам поймал+починил 2 бага до вывода.**
|
||||
|
||||
1. **ВЕРДИКТ ACCEPT_WITH_FIXES (ИНТЕРИМ пре-скрин).** Лучший по дисциплине прогон (self-review, ≥2 судьи, ручной DET span-read вместо брикнутого авто-скорера, честные 13 ошибок, 6 семей, дефолт не менял).
|
||||
2. **РАТИФИЦИРОВАНО (span-верифицировано):** (а) **Нога-2 exp14 «только gpt-5.4 чинит смысл» ОПРОВЕРГНУТА** — на крит-трапе a1 (двойн.отриц `没有一个不知道`) **deepseek-pro И mistral чинят** то, что glm-5 И grok ИНВЕРТИРУЮТ (в «ни один»); gpt-5.4 тоже чинит, но он «самый ровный», НЕ «единственный». **Дешёвый mistral ($0.5/$1.5) чинит то, что текущий дефолт glm-5 ($1/$3.2) инвертирует — и дешевле.** exp14-экстраполяция (n=1 фронтир, 1 судья) была артефактом. (б) **Провалы РАЗБРОСАНЫ по модель×конструкция** (a1: glm+grok; c1 人上之人: grok+deepseek; c3: glm+mistral) — нет модели безупречной/безнадёжной, нет одной эскалации на всё → **смысл-floor УЗКИЙ и РАЗБРОСАН**, не широкий. (в) **Фронтир (gpt-5.4) в дефолт НЕ нужен:** абзацы — P1a(glm-дискурс) ≈ F-disc(gpt-5.4) по mean_spp (тай 2.56/2.65); смысл — дешёвые mistral/deepseek-pro чинят крит-трапы. Дорогая gpt-5.4-эскалация пере-взвешена ВНИЗ. (г) **Soft: 0 катастроф ≥2-глазами** (все CAT-флаги одно-судейны, mistral-судья оверфлагает); чэнъюй-сплющивание (物是人非) универсально → рычаг промпта/глоссария, не модель.
|
||||
3. **КОРЕНЬ ТЕРМ-ДРЕЙФА НАЙДЕН (глоссарий-статус, НЕ непонимание модели) — верифицирован по коду:** важные термы в сиде `status:draft` → `renderEditorConstraintBlock` (`memory.go:489`, CONFIRMED-only) их НЕ инъектит в editor-констрейнт; хуже — `suppressContained` (longest-match A3) СЪЕДАЕТ верный approved `族长→«глава клана»` (вложен в draft-длинный `四代族长`), оставляя только approved-соседа `家老→«старейшина»` → глоссарий-обедиентные glm/mistral подтянули «старейшину». **Draft-запись АКТИВНО ВРЕДНА.** **Фикс (владелец направил):** promote грейды `甲乙丙丁`(→dst «класс А/Б/В/Г», D37)+`四代族长` **draft→approved** (enforce) + reseed; owner-only (approved-инвариант). Это дешёвый ДЕТЕРМИНИРОВАННЫЙ фикс, не модель-проблема.
|
||||
4. **ПОПРАВКИ верификации (в ревью-шапке):** `share_1sent`(0.381/0.427) НЕ воспроизводится (тай держится на mean_spp; направление флипает) — сабметрику не абсорбировать как напечатана; «все CAT-флаги от mistral» — 1 из 8 от gpt-5-mini (суть цела); c1-mistral = ✓«над толпой» (отчёт дал «?»→M имеет 0 способностных провалов). Деньги $1.36/13 ошибок — точно.
|
||||
5. **ХОЛД — кандидат СМЕНЫ дешёвого редактора glm-5 → deepseek-pro ИЛИ mistral** (оба дешевле glm И чинят a1, что glm валит). НЕ ратифицировать до **бейк-оффа их ПРОЗЫ + omission-гарда** (exp14b мерил верность, не стиль/полноту полностью — урок exp13: не менять на частичном сигнале). Следующий полигон-шаг.
|
||||
6. **Провайдер-квирк вынесен:** **gpt-5.4 `reasoning_effort:"medium"` обрезает длинный вывод** (223 out-ток вместо ~5000, finish=stop — тихо) → в роли редактора слать `low` (`00-provider-quirks.md`, верифицировано). kimi НЕПРИГОДЕН как редактор (8/10 обрезки/таймауты). **Ретро-аудит exp14:** «36 ошибок» = судейский слой (kimi-флейкость), скрытых обрезок арм-моделей (gpt/grok/glm/deepseek) НЕТ — уточняет D37.
|
||||
7. **Стратегически:** «потолок в моделях vs организации» — **эмпирика сошлась на ОРГАНИЗАЦИИ**: обе претензии дешёвый трек закрывает (абзацы — дискурс-промпт на glm=P1a; смысл — лучший дешёвый редактор + глоссарий-статус-фикс). **Фронтир НЕ нужен.** D30.7-трек «дешёвые модели сейчас» подтверждён эмпирикой. Планка = 2 претензии ИНТЕРИМ; пилот Ф2.5 (BWS ≥3 аннотатора) остаётся решающей точкой, не разбавляется. Порядок: бейк-офф редактора (проза/omission) + reseed-глоссарий → бэкенд под доказанный конфиг (дискурс-промпт, дешёвый редактор-кандидат, промоут-статусы, число/omission-гард, число/CJK-санитайзер).
|
||||
|
|
|
|||
|
|
@ -31,6 +31,7 @@
|
|||
| Gemini 2.5 Flash | thinking ON, съедал `max_tokens`, **молча обрезал перевод** | отключить: `extra_body.google.thinking_config.thinking_budget: 0` |
|
||||
| **Gemini 3.1 Pro** | thinking **обязателен** | `thinking_budget:0` → HTTP 400 «only works in thinking mode». НЕ отключать; дать большой `max_tokens` (≥8000) |
|
||||
| gpt-5-mini (reasoning) | reasoning ON, выжигал бюджет → пустой ответ | `reasoning_effort: "minimal"`; **без `temperature`**; `max_completion_tokens` вместо `max_tokens` |
|
||||
| **gpt-5.4 (reasoning)** | ⚠ **`reasoning_effort:"medium"` РЕПРОДУЦИРУЕМО ОБРЕЗАЕТ ВЫВОД на длинной редактуре** (exp14b: reasoning съел бюджет → `content` 223 out-ток ≈ 602 симв из ~5000, `finish=stop` — выглядит как валидный короткий ответ, НЕ length-обрыв → тихо портит результат) | В роли РЕДАКТОРА/переводчика (длинный выход) слать **`reasoning_effort:"low"`** (exp14b: тот же чанк → 5137 симв, полный); `max_completion_tokens` (не `max_tokens`), без `temperature`. reasoning⊆completion (subset-биллинг). Слаг live-фактчек 2026-07-11: `gpt-5.4-2026-03-05`. *(Верифицировано span-читкой D38; self-review полигона поймал живьём.)* |
|
||||
| **Kimi K2.6** | думающая, **очень многословная**: ~11k reasoning-токенов на абзац; reasoning в `reasoning_content`, ответ в `content`; при малом бюджете reasoning съедает лимит → `content` **пуст** (finish=length, не ошибка!) | дать `max_tokens` ≥16000; ответ из `content`. **Дорогой в роли редактора** — reasoning биллится как выход |
|
||||
| **grok-4.3 (xAI)** | reasoning **ON по дефолту = `low`** (must-be-explicit: не задал → думает) | **Off-switch (Chat Completions) — ПЛОСКИЙ `reasoning_effort:"none"` в теле** (`reasoning_effort` ∈ {none,low,medium,high}). ⚠ **Вложенная форма `extra_body.reasoning.effort:"none"` — это Responses API; Chat Completions её МОЛЧА ГЛОТАЕТ** (остаётся дефолт `low`) — из-за этого exp08-проба ложно решила «не отключается». Проверено 05.07: `reasoning_effort:"none"`→`usage.reasoning_tokens=0`, дефолт→444, `low`→384 (на правке ~2000 ток.). reasoning у xAI **аддитивен к completion** (billed = completion+reasoning). `grok-4.20-0309-non-reasoning` = grok-4.3 + `effort:none` под капотом (ретайр 15.05.2026) → слаг не нужен, слать `none` явно. ⚠ **Для роли РЕДАКТОРА reasoning-off СНЯТ (D30.1): grok reasoning-off — no-op-редактор** (exp12 §2.2: активность 0.001, 3/6 чанков байт-идентичны черновику; exp04-ранг был на дефолт-reasoning + БИЛИНГВ). Если grok когда-либо вернётся в редакторы — только reasoning-ON (D6.2-буфер). Для роли ПЕРЕВОДЧИКА на плотном CJK reasoning-off НЕПРИГОДЕН (D19.1: эхо 4/10 + дегенеративный луп; ⚠ языковой констрейнт в system при `none` ИНВЕРТИРУЕТ эхо 3/10→9/10 — research/15 P4) — эскалация канала B идёт reasoning-ON. *(Сужено оркестратором по D19.1/D21; было «editor/translator».)* Источник: docs.x.ai/developers/model-capabilities/text/reasoning. |
|
||||
| Qwen3.5 / локальные | thinking ON | ollama: `think: false` + `num_predict` cap. Иначе рассуждения (в поле `thinking`, не `response`) забивают контекст |
|
||||
|
|
|
|||
|
|
@ -1,5 +1,48 @@
|
|||
# Эксперимент 14b. Батарея смысл-трапов (нога-2) + ранг P1a↔F-disc
|
||||
|
||||
<!-- ─────────────────────────────────────────────────────────────────────────
|
||||
ОРКЕСТРАТОР — РЕВЬЮ-ШАПКА (D38, 12.07 №4). §1 заморожен коммитом (48e3f39); §2 залендён
|
||||
оркестратором (сессия НЕ коммитила батчи — процесс-фикс D37 отработал). Разбор — PROGRESS §D38 + D-лог D38.
|
||||
|
||||
ВЕРДИКТ: **ACCEPT_WITH_FIXES** (ИНТЕРИМ пре-скрин, НЕ пилот). ЛУЧШИЙ по дисциплине полигон-
|
||||
прогон: self-review НАШЁЛ+ПОЧИНИЛ 2 бага до вывода (gpt-5.4 reasoning=medium обрезал F 9.1;
|
||||
deepseek обрезал D 6.0), ≥2 судьи на soft, DET ручной span-читкой (авто-скорер брикнул — сам
|
||||
отверг), честный учёт 13 ошибок, floor-тест на 6 семьях, дефолт не менял. Урок мандата само-
|
||||
проверки (CLAUDE.md 12.07) отработал живьём.
|
||||
|
||||
НЕЗАВИСИМАЯ ВЕРИФИКАЦИЯ (3 параллельных агента, span-читка сырья, refute-by-default, $0):
|
||||
- **«ТОЛЬКО gpt-5.4 чинит смысл» ОПРОВЕРГНУТО — подтверждено cell-for-cell.** a1 (двойн.отриц
|
||||
ch7.0): C(glm)✗«ни один», F(gpt-5.4)✓, X(grok)✗«ни один», **D(deepseek-pro)✓«знал каждый»,
|
||||
M(mistral)✓«знали все без исключения»**. Дешёвый mistral чинит то, что текущий дефолт glm
|
||||
ИНВЕРТИРУЕТ. Провалы РАЗБРОСАНЫ (a1: C+X; c1: X+D; c3: C+M) — модели безупречной/безнадёжной
|
||||
нет; одной «эскалации» на всё нет. *(Уточнение: c1-M = ✓«над толпой», отчёт дал «?» → M имеет
|
||||
0 способностных провалов.)*
|
||||
- **Глоссарий-корень ПОДТВЕРЖДЁН по file:line и УСИЛЕН.** `renderEditorConstraintBlock`
|
||||
(`memory.go:489` — CONFIRMED-only) исключает draft `四代族长`; хуже — `suppressContained`
|
||||
(longest-match A3) СЪЕДАЕТ верный approved `族长→«глава клана»` (вложен в draft-长ий 四代族长),
|
||||
оставляя в editor-констрейнте только approved-соседа `家老→«старейшина»`. Draft-запись АКТИВНО
|
||||
ВРЕДНА. Empirics: `injection_blocks.json 16/0` несёт «старейшина», НЕ «Четвёртый глава рода».
|
||||
glm/mistral (глоссарий-обедиентные) подтянули «старейшину»; gpt/grok/deepseek дали верное из
|
||||
исходника → это НЕ непонимание, а статус сида. Promote draft→approved — sound (не бьёт коллизии).
|
||||
- **P1a(glm-дискурс) ≈ F-disc(gpt-5.4) mean_spp ТАЙ** (пересчёт C 2.56 / F 2.65; отчёт 2.52/2.55
|
||||
— в допуске, то же направление). ⚠ **`share_1sent` (0.381/0.427) НЕ воспроизводится** (пересчёт
|
||||
~0.28–0.31, направление C<F ФЛИПАЕТ) — тай на mean_spp держится, но share_1sent как напечатан
|
||||
неверифицируем; в отчёте пометка.
|
||||
- **Soft: 0 катастроф ≥2-глазами — MATCH** (все 8 CAT-флагов одно-судейны; mistral оверфлагает f1/f2
|
||||
— 7 из 8; **1 флаг — от gpt-5-mini, не mistral**, «все от mistral» неточно, суть цела). e1 物是人非
|
||||
универсально «partial» → чэнъюй-сплющивание = рычаг промпта/глоссария, не модель.
|
||||
- **Деньги $1.36 / 13 ошибок — ТОЧНО**; gpt-5.4 reasoning=medium обрезка (F 9.1: 223 out-ток ≈ 602
|
||||
симв) и фикс (reasoning=low, 5137 симв) — оба ДОКАЗАНЫ; kimi-редактор 8/10 обрезок → дропнут (верно).
|
||||
|
||||
РАТИФИЦИРОВАНО (D38): (1) нога-2 exp14 (дорогая gpt-5.4-эскалация) ПЕРЕ-ВЗВЕШЕНА ВНИЗ — фронтир в
|
||||
дефолт НЕ нужен (ни на смысле, ни на абзацах). (2) Глоссарий-корень: **promote грейды(→«класс
|
||||
А/Б/В/Г»)+四代族长 draft→approved** (владелец направил; reseed). (3) Смысл-floor УЗКИЙ/РАЗБРОСАН →
|
||||
глоссарий+число/omission-гард, не тотальная эскалация. ХОЛД: **кандидат glm-5→deepseek-pro/mistral**
|
||||
(дешевле И чинят a1) — их ПРОЗА+omission НЕ мерены → бейк-офф до смены дефолта (урок exp13). Провайдер-
|
||||
квирк gpt-5.4 reasoning вынесен в `00-provider-quirks.md`. Слепой h2h-пакет — владельцу на вердикт.
|
||||
───────────────────────────────────────────────────────────────────────────── -->
|
||||
|
||||
|
||||
> **Статус:** полигон-сессия exp14b (D37, приоритет №1). Прямое продолжение exp14. ИНТЕРИМ пре-скрин планки «2 претензии» (D35 — НЕ пилот Ф2.5). Смену дефолта ратифицирует ОРКЕСТРАТОР — не эта сессия.
|
||||
> **Зона:** `eval/` + этот файл + PROGRESS «Полигон». Прямые API-вызовы. **Коммичу ТОЛЬКО пре-рег §1** (урок D37: exp14 закоммитил 6 батчей сам → впредь фризю только пре-рег, остальное лендит оркестратор). Артефакты — ВНЕ git (`/home/ubuntu/books/gu-zhenren/exp14b/`).
|
||||
|
||||
|
|
@ -77,4 +120,59 @@
|
|||
|
||||
## 2. Результаты (пост-freeze; НЕ входит в freeze-commit; лендит оркестратор)
|
||||
|
||||
*(пусто до прогонов; таблица fix-rate по конструкциям×моделям — DET+судьи со спанами — вывод по ноге-2 (нужен ли gpt-5.4, на каких классах, COGS) — P1a↔F-disc ранг — рекомендация; честный учёт ошибок/трат.)*
|
||||
> **Расширение панели (прозрачно, не ретрофит трапов):** к замороженным C/F/X добавлены 3 семьи-редактора **deepseek-v4-pro (D), kimi (K), mistral-large (M)** — чтобы floor-тест «только gpt-5.4» стоял на 6 семьях, а не 3 (по запросу владельца, аналог добавки Gemini/grok в exp14).
|
||||
|
||||
### 2.0. Операционка + SELF-REVIEW (честно — урок D37 «0 ошибок» = миф)
|
||||
|
||||
Трата ≈**$1.36** (под капом $5): Kimi $0.71 (флейк+многословие — крупнейший), OpenAI $0.37, ZAI $0.10, XAI $0.06, DeepSeek $0.06, Mistral $0.06. **13 ошибок ЗАЛОГИРОВАНО** (не «0»): kimi 6 таймаутов + 6 пустышек, deepseek 1 transport (ретрай спас). **Скептический self-review нашёл и починил 2 бага, которые исказили бы вывод:**
|
||||
- **gpt-5.4 `reasoning=medium` РЕПРОДУЦИРУЕМО обрезал F 9.1** (602 симв из ~5000; reasoning съел бюджет, finish=stop) → дал бы ложное «F провалил c2». Фикс: `reasoning=low` (5137 симв). **Квирк для `00-provider-quirks.md`.** Проверка F vs C/X по всем чанкам: других обрезок НЕТ.
|
||||
- **deepseek-v4-pro обрезал D 6.0** (0.05×, finish=length) → перегнан на `max_tokens=16000` (10054 симв).
|
||||
- **kimi НЕПРИГОДЕН как редактор**: 8/10 обрезки(finish=length)/таймауты; ре-ран при 28k токенах — таймаут >2мин. K-арм ДРОПНУТ (2 валидных выхода использованы точечно). Это само по себе вывод: kimi не редактор прода.
|
||||
- **Аудит exp14 (ретро):** все обрезки/пустышки в exp14 — 100% gemini (известное); НЕТ скрытых обрезок gpt-5.4/grok/glm/deepseek. «36 ошибок» exp14 = судейский слой (29/30 re-gate = kimi-флейкость → подтверждает поправку D37 «13 катастроф завышено»).
|
||||
- **Скоринг DET — РУЧНАЯ span-читка** (авто-regex-скорер брикастый — сам поймал, не доверяю; критерий объективен: над≠среди, каждый≠ни один, глава≠старейшина; оговорка author≠reviewer — читаю я).
|
||||
|
||||
### 2.1. DET-батарея (a/b/c/d) — «ТОЛЬКО gpt-5.4» ОПРОВЕРГНУТО; провалы РАЗБРОСАНЫ по модель×конструкция
|
||||
|
||||
Промпт КОНСТАНТЕН (дискурс); варьируем редактора. ✓=верно / ✗=провал (объективный критерий + span):
|
||||
|
||||
| Трап (класс) | glm-5 C | gpt-5.4 F | grok X | deepseek-pro D | mistral M |
|
||||
|---|---|---|---|---|---|
|
||||
| **a1** двойн.отриц `没有一个不知道` (крит) | ✗ «ни один» | ✓ «не было ни одного, кто не…» | ✗ «ни один» | ✓ «знал каждый» | ✓ «знали все» |
|
||||
| **a2** `无不` (лёгкая полярн.) | ✓ | ✓ | ✓ | ✓ | ✓ |
|
||||
| **b2** `四成四`=44% (числа) | ✓ | ✓ | ✓ | ✓ | ✓ |
|
||||
| **c1** `人上之人` над/среди | ✓ «над» | ✓ «над обычными» | ✗ «среди» | ✗ «среди» | ? (перефраз) |
|
||||
| **c3** `四代族长` глава/старейшина ⚠ГЛ-КОНФАУНД | ✗ | ✓ | ✓ | ✓ | ✗ |
|
||||
| **чистых провалов способности (без c3)** | **1** (a1) | **0** | **2** (a1,c1) | **1** (c1) | **0–1** (c1?) |
|
||||
|
||||
**⚠ c3 — НЕ способность, а ГЛОССАРИЙ-ЕНФОРСМЕНТ (важная находка self-review):** сид имеет `四代族长→«Четвёртый глава рода»` (ВЕРНО), но `status:draft` → в editor-констрейнт (только approved) НЕ попадает; зато туда попадает approved `家老→«старейшина»`, и glm/mistral (глоссарий-обедиентные) подтянули «старейшину» к 四代族长, а gpt/grok/deepseek дали верное «глава» из исходника. **Т.е. c3-«провал» = обедиентность к enforced-соседу при draft-целевом терме, не непонимание.** Исключаю c3 из способности; это фикс-глоссария.
|
||||
|
||||
**Выводы ноги-2 (прямой ответ на HOLD D37):**
|
||||
1. **«Только gpt-5.4 чинит смысл» — ОПРОВЕРГНУТО.** Крит-трап a1 (двойное отрицание) чинят gpt-5.4, **deepseek-pro И mistral**; валят glm-5 и grok. **Дешёвый mistral ($0.5/$1.5) чинит то, что наш текущий редактор glm-5 ($1/$3.2) инвертирует — и mistral ДЕШЕВЛЕ.** Экстраполяция exp14 (n=1 фронтир, 1 судья) была артефактом.
|
||||
2. **Провалы РАЗБРОСАНЫ по модель×конструкция**, не «дешёвые валят всё» и не «фронтир чинит всё»: glm валит a1+c3, grok валит a1+c1, deepseek валит c1, mistral валит c3. Нет модели безупречной или безнадёжной; **нет одной «эскалации», закрывающей всё**.
|
||||
3. **gpt-5.4 — самый РОБАСТНЫЙ** (0/5), но это «самый ровный», а не «единственный, кто может» — за $2.5/$15 платить необязательно.
|
||||
4. **c3 (族长→«старейшина» у glm/mistral) — ГЛОССАРИЙ, не способность** → сид `族长`→«глава клана» (детерм. фикс, с грейдами). b1 (`十二分之一`/`三成`) — числа местами дрейфуют (`四成四`→«четыре десятых и четыре десятых» у glm в ch10.1) — на omission/число-гард.
|
||||
|
||||
### 2.2. SOFT-классы (e чэнъюй / f кореференция) — 3 кросс-семейных судьи (gpt-5-mini+kimi+mistral), leave-one-out, ≥2-глаза-на-катастрофу
|
||||
|
||||
| Трап | Свод (по judge-консенсусу) |
|
||||
|---|---|
|
||||
| **e1** 物是人非 | **ВСЕ армы «partial», все судьи единогласно** → сплющивание чэнъюй УНИВЕРСАЛЬНО (не модель-специфично) — промпт/глоссарий-рычаг, не модель |
|
||||
| **e2** 韬光养晦 | Большинство «correct» (2/3 судьи: gpt-mini+kimi); mistral-судья строже («partial»). Leave-one-out(mistral)→все correct. ОК |
|
||||
| **f1** 它=Винный червь | 2/3 судьи «correct»; **mistral-СУДЬЯ over-флагает «wrong+CAT» на glm/grok** — но gpt-mini+kimi «correct» → катастрофа НЕ подтверждена (single-judge) |
|
||||
| **f2** 他们-пол | Разнобой (gpt-mini «partial» / kimi «correct» / mistral «wrong+CAT» почти на всех) → субъективно; **ни одной катастрофы ≥2-глазами** |
|
||||
|
||||
**Вывод SOFT:** **НИ ОДНОЙ подтверждённой (≥2 судьи) катастрофы.** Все CAT-флаги — от ОДНОГО судьи (mistral over-флагает). Чэнъюй-сплющивание (e1) универсально (все модели partial) → рычаг промпта/глоссария, не модель. **Методик-урок (валидирует D37-фикс):** mistral-судья один дал бы ложные катастрофы f1/f2 — ровно ошибка exp14 (один kimi на фронтире). ≥2 кросс-семейных судьи + leave-one-out их сняли. Soft-классы модели НЕ разделяют → смысл-floor узкий (a1/c1), не широкий.
|
||||
|
||||
### 2.3. P1a ↔ F-disc head-to-head (§2 мандата) — дешёвый = фронтир на прозе
|
||||
|
||||
Прозо-KPI (детерм.) на гл.17/18/19: **P1a (glm-5) mean_spp 2.52 / доля-1-предл 0.381** vs **F-disc (gpt-5.4) 2.55 / 0.427**. **ТАЙ** (P1a даже чуть меньше рублёнки). → стилевое превосходство F-disc в exp14 — НЕ про абзацы (равны), а про гладкость/лексику; **по структурной претензии-1 дорогой gpt-5.4 НЕ нужен**. Слепой пакет `exp14b/monitor/h2h.md` (P1a↔F-disc + оригинал, метки перемешаны) — владельцу на слепой вердикт (span-верность + стиль).
|
||||
|
||||
### 2.4. Рекомендация (на ратификацию оркестратора; дефолт НЕ менять сессией)
|
||||
|
||||
1. **Фронтир (gpt-5.4) в дефолт НЕ нужен:** абзацы — дешёвый P1a = фронтир (KPI-тай); смысл — дешёвые mistral/deepseek-pro чинят крит-трапы. Дорогая gpt-5.4-эскалация из exp14-рекомендации **пере-взвешивается вниз**.
|
||||
2. **Кандидат: сменить дешёвый редактор glm-5 → deepseek-pro ИЛИ mistral** — оба ДЕШЕВЛЕ glm И чинят двойное отрицание (glm валит). Требует проверки их ПРОЗЫ/абзацев (мерить отдельно — здесь мерена верность, не стиль полностью) + omission-гард.
|
||||
3. **Смысл-floor УЗКИЙ и РАЗБРОСАННЫЙ** → не одна эскалация, а: (а) глоссарий-фиксы (族长, грейды 甲乙丙) детерминированно; (б) число/omission-гард; (в) при желании ровности — gpt-5.4 точечно, но ROI низкий.
|
||||
4. **Глоссарий-курация — КОРЕНЬ найден self-review'ом: важные термы оставлены `status:draft` → НЕ в editor-констрейнте → дрейф/подмена.** Сид уже несёт ВЕРНЫЕ dst (`甲乙丙丁→разряд А/Б/В/Г` draft; `四代族长→Четвёртый глава рода` draft), но draft = мягкая ⟨проверить⟩, не enforced. **Фиксы владельцу:** (а) грейды → dst «класс А/Б/В/Г» (D37) + **promote draft→approved** (enforce, стоп-дрейф); (б) `四代族长` **promote draft→approved** (иначе approved `家老→«старейшина»` перетягивает); (в) `转→«ранг»` (approved) — развод с грейдами держится. Это не «модель тупая» — это статусы сида. Статусы меняет владелец (approved-инвариант) + reseed.
|
||||
|
||||
### 2.5. Оговорки (методика-guard)
|
||||
Батарея мала (5 конструкций DET + 4 soft, пара ячеек «?»); DET-скоринг — ручная span-читка (объективный критерий, но author≠reviewer — 2-й глаз усилит); kimi выпал (editor+judge флейкость); прозо-сравнение P1a↔F-disc — только KPI+слепой пакет (владелец-вердикт pending); ИНТЕРИМ пре-скрин (D35), НЕ пилот. Смену дефолта ратифицирует оркестратор.
|
||||
|
|
|
|||
Loading…
Add table
Reference in a new issue