From 7ca14c2c5f3137c5ccda7606ac1c12a13f80f638 Mon Sep 17 00:00:00 2001 From: "Claude (backend session)" Date: Sat, 11 Jul 2026 00:44:20 +0300 Subject: [PATCH] Land phase-1 stage-A acceptance report with orchestrator verification: headline numbers reproduced by execution, text defects corrected, verdict caveats and alias-blind-spot drift note added --- docs/PROGRESS.md | 69 ++++++++++++++++++++++++++++++++++++++++++++++++ 1 file changed, 69 insertions(+) diff --git a/docs/PROGRESS.md b/docs/PROGRESS.md index 92c1de3..f27fd1f 100644 --- a/docs/PROGRESS.md +++ b/docs/PROGRESS.md @@ -7,6 +7,75 @@ > - **Ждём от владельца:** чистый xAI-ключ без data-sharing (блокер пилота, не приёмки — D20.3) · провенанс двух внешних 12-*-доков · решение по юр-пакету · порядок «приёмка ↔ рефакторинг». > - Записи ниже — хронология; РАННИЕ (день-0, 04.07) содержат устаревшие цифры/решения (COGS $2–4, BYOK, Anthropic-Sonnet), переопределённые позже — см. блок выше и 05-decisions-log. +## Приёмка Ф1 — 蛊真人 zh→ru, этап A (25 глав), 2026-07-10 + +Приёмочная сессия по `ACCEPTANCE_SESSION_PROMPT.md`. Прогон реальной книги end-to-end, вердикт по критериям `02-mvp-plan §Приёмка Фазы 1`. **Ничего не закоммичено** (лендинг — оркестратору). Все производные (store.db, срез, выходы, отчёты) — ВНЕ git (`/home/ubuntu/books/gu-zhenren/acceptance/`). Дерево backend/ чистое (мои правки = 0; `docs/research/17-*` — чужая GPT-сессия, не трогал). + +**Конфиг прогона (по контракту):** срез 25 глав (57 чанков) из `guzhenren-gb18030.txt` (GB18030, ре-энкод среза лосслесс), сид 49 терминов; draft=deepseek-v4-flash (thinking ON), editor=**glm-5** (D20.3 — чистого xAI-ключа нет), draft `escalate_to`=deepseek-v4-pro, `escalation.budget_usd=2.0` (D22.11), гейты дефолтные (coverage OFF, postcheck-гейт OFF=флаггер). Промпты/версии/пороги — байт-в-байт из pipeline-c1. + +### Чек-лист приёмки (каждое — исполнением) + +| # | Пункт | Как проверено | Результат | +|---|---|---|---| +| 1 | `committed == SUM(checkpoints)` | SQL по живому store на 3 срезах | ✅ ТОЧНО: honest-stop $0.07446423; **пережил SIGKILL** $0.08639944 (32 ckpt); финал $0.408077 *(испр. оркестратором: на финале после redrive инвариант по D15.3 — «≥»: SUM(130 ckpt)=$0.405370; «==» держалось до redrive и на конец полного прогона)* | +| 1 | Честный стоп потолка (committed+reserved) | book_usd=$0.08 → отказ резервации | ✅ отклонён ch5/1 edit *(испр. оркестратором: denied estimate=$0.00732 по phase1.log:74, не $0.0733)*, reserved=$0, «raise ceilings.book_usd or stop», exit 1 (код-путь tmctl, в логах не зафиксирован), резюмируемо | +| 1 | kill -9 посреди этапа → без переоплаты | реальный SIGKILL в in-flight glm-5 вызове | ✅ orphan-резервация $0.0075 восстановлена («recovered 1 stale reservation»), committed==SUM пережил краш, ≤1 вызов | +| 1 | resume не переоплачивает | поднял потолок $0.08→$2.0 (wiring-поле, не snapshot) → translate | ✅ *(испр. оркестратором — два resume смешаны в одну строку, оба чистые: ceiling-resume переиграл гл.1–5 за $0, первый платный — ровно отклонённая потолком стадия ch5/1 edit; пост-SIGKILL resume переиграл гл.1–6 за $0 (24 tm_hit), первый платный — ровно убитая стадия ch6/1 edit)* | +| 2 | echo-эскалация стреляет и ре-гейтится (D18) | ch1/0,1: cjk_artifact 76–82% | ✅ → deepseek-v4-pro → ре-гейт → флаг остаётся (fallback тоже провалил), edit skip, мусор в TM НЕ коммитится | +| 2 | refusal/empty → flag+skip+continue | 4 флага (cjk_artifact×2 стойких, length×2) | ✅ edit пропущен (DispSkipped), FinalText="" не течёт в TM/экспорт/STM | +| 2 | `tmctl redrive` на реальном флаге | dry-run (план 4) + real `--chapter 1 --chunk 4` | ✅ **флаг RESCUED** (length был транзиентным бюджетом → ok, attempts=2); флагов 4→3; committed≥SUM (D15.3: сброшенный $0.0027 остаётся в committed) | +| 2 | `tmctl status` живой при прогоне (OpenReadOnly) | status / status --json / report при активном translate | ✅ работают без flock; --json exit 2 (флаги); D23 orphan reserved-хвост виден до recovery | +| 3 | Консистентность D10 ≥98% (все approved) | замер ниже (нативный post-check + независимый пересчёт) | ⚠️ **суть выполнена (0 реальной терминодрейфа); флаггер шумит из-за неполноты decl сида** — разбор ниже | +| 4 | Ноль молчаливых потерь глав | ingest 25 глав → 57 чанков, spine consistent | ✅ все 25 глав обработаны, 0 U+FFFD, 0 потерь. (coverage-гейт OFF по дефолту — ≥90%-recall искусств. пропусков не гонялся, отдельный тест) | +| 5 | Честная оговорка D1.1 | — | ✅ приёмка = инфраструктура; верность НЕ мерена (это пилот Ф2.5) | + +### Деньги (этап A, весь прогон) + +- **committed = $0.408077**, reserved = $0.000000, потолок $2.00 (20.4%). **committed ≥ SUM(checkpoints)=$0.405370** (разница $0.0027 = *(испр. оркестратором)* ДВА сброшенных пре-redrive draft-вызова ch1/4, побайтно $0.0010117+$0.0016956; честное направление D15.3). +- **$/глава = $0.0162** (25 глав). **Проекция полной книги (2283 гл.) ≈ $37** — в коридоре промта $25–55, ниже человеческого якоря $100. +- **Доля стадий:** editor(glm-5) **83.3%**, draft(deepseek-flash) 15.3%, эскалация(deepseek-pro) 1.4%. +- **Санити vs exp08 (честно, не подгоняя):** exp08 моделировал editor 88–90% на grok-4.3. Здесь 83.3% — ниже, потому что (а) 3 флагнутых чанка пропустили дорогой edit *(испр. оркестратором: финально 3 — ch1/4 после redrive edit получил)* и (б) draft тяжелее (deepseek reasoning subset + ретраи length + эскалации). **⚠️ Клейм промта «glm-5 дешевле grok» неверен по выходу:** glm-5 output $3.2/M против grok $2.5/M = **+28% за токен**; итоговая $/глава ниже якоря из-за размера глав и пропуска edit флагнутыми, НЕ из-за дешевизны glm-5. +- Телеметрия чиста: deepseek reasoning=subset (внутри completion, `reasoning_tokens`-поле=0 — не путать с thinking-off), glm-5 billed по факту, эскалация billed отдельной осью (2 ckpt, $0.0056). Gemini/grok на wire-пути дефолт-конфига НЕТ (ожидаемо). + +### Консистентность D10 — разбор (числитель/знаменатель + классы промахов) + +Нативный post-check (retrieval_state, decl-aware, реальный матчер) на 57 чанках: **55 confirmed-промахов**, 14 style-флагов, инъекций(точных)=529, sticky=166. Независимый пересчёт по сиду+выходам (author≠reviewer, дважды): + +- **Occurrence-level D10 = 1780/1938 = 91.8%**; **presence-level = 370/390 = 94.9%**. По типам (presence): **имена 98.5%, места 100%, титулы 99%, термины 89%**. *(Пометка оркестратора: точные числители/знаменатели метод-зависимы и без приложенного скрипта третьей стороной не воспроизводятся — независимая реплика под 6 конвенциями матчинга даёт occurrence 83.1–93.8% / presence 91.6–99.3%, отчётные значения внутри диапазонов, качественная структура (термины — слабейший класс, места 100%) совпадает; с decl-докредитом (база+мн.ч.) occurrence-реплика = 99.0% ≥ 98%. Методику пересчёта на этапе B приложить скриптом.)* +- **Классификация ВСЕХ 55 confirmed-промахов (по фактическим выходам):** + - **37 = nominative_gap** — approved-dst присутствует в ИМЕНИТЕЛЬНОМ, но `decl.forms` перечисляет только косвенные падежи, а фолбэк на базовый dst в `dstFormPresent` (mempostcheck.go:85-96) срабатывает ТОЛЬКО при пустом decl. Пример: `方源→Фан Юань` — «Фан Юань» есть в выходе (+«он» ×4–10 для прочих упоминаний), но флагается. + - **18 = inflection_gap** — корень dst присутствует в форме, которой нет в сиде (обычно МН.Ч.): `元石→первокамень` рендерится «первокамней/первокамни/первокамнями» (сид дал только ед.ч.); так же `凡人→смертный`→«смертных/смертными», `蛊师→гу-мастер`→«гу-мастеров». + - **0 = genuine drift** — среди 55 промахов флаггера реального рассогласования терминологии НЕТ. *(Уточнение оркестратора: адверсариальный поиск ВНЕ зоны видимости флаггера нашёл ровно 1 дрейф-вхождение — гл.18/0 рендерит 古月方源 раздельно «гу юэ фан юань» против «гуюэ…»×35 и «гуюэ»×154 в остальном корпусе; post-check структурно слеп к этому классу: полное имя longest-match'ится на 方源, чей dst присутствует → промах не фаерится. Alias-слепое пятно зафиксировано в D24.)* +- **Вывод:** машинерия (инъекция + decl-aware post-check + флаггер) работает; **истинная терминоконсистентность ≈ 99.5% (1 наблюдение дрейфа на ~190 поверхностей клан-имени, вне видимости флаггера)** *(испр. оркестратором: было «≈100% (0 дрейфа)»)*. Измеренный <98% — целиком артефакт **неполноты decl в сиде** (нет именительного-в-decl + нет мн.ч.), воспроизведён двумя независимыми методами. Порог 98% ДОСТИЖИМ; правка — сиду (дописать nom+мн.ч. в `decl.forms`) ИЛИ post-check (всегда проверять базовый dst, а не только при пустом decl). Это ровно почему `postcheck_gate` дефолтно OFF (флаггер): флип ON сейчас = флаг-шторм на легитимных именительных. + +### G2 flag-rate (первый замер человеческой петли на реальной книге) + +- **3/57 чанков (5.3%) флагнуто** после redrive (4/57=7.0% до redrive; redrive снял 1 транзиентный length). +- **Концентрация: 2 из 25 глав** несут все флаги — гл.1 (классический зачин «第一节:纵身亡魔心仍不悔» — эхо на плотной архаике, ср. register-оговорка D22.5) и гл.10 (length). **23/25 глав — чисто.** Человеческая петля front-loaded на классику/плотный ханьский зачин, не размазана. +- Стиль-флаггеры (наблюдаемость): **14, все `dialogue_dash`** (0 ё / 0 транслит-междометий / 0 разрядов 万億). + +### Находки для оркестратора (НЕ чинил — правят wire/вердикты → изменение поведения) + +1. **[major] Эскалация draft→deepseek-v4-pro неэффективна под дефолтным max_tokens.** deepseek-thinking требует ≥8000 (quirks), а `max_output_ratio=2.2`+`min_max_tokens=2048` дают ~2–3k на чанк → эскалация возвращает empty/length (finish=length), сжигая ~3× цену draft впустую. На ch1/0,1 хоп deepseek-v4-pro дал compl=2048/3291 finish=length. Известный техдолг («min-budget Kimi≥16k/Gemini≥8k — комментарии, не схема») подтверждён эмпирически для deepseek. **Вопрос: ввести per-model floor max_tokens для thinking-моделей (schema, не комментарий)?** Правит снапшот → решение оркестратора/владельца. +2. **[major] Post-check `dstFormPresent` не проверяет базовый dst (именительный) при непустом `decl.forms`** (mempostcheck.go:87-89: фолбэк на base только при пустом decl). Даёт 37/55 ложных промахов на именительных. Правка: либо сиду дописать nom+мн.ч. в `decl.forms` (зона полигона), либо коду — всегда добавлять базовый dst к проверяемым формам (правит вердикты флаггера → изменение поведения). Гейтит осмысленность/флип `postcheck_gate`. +3. **[info] deepseek-flash эхает на классическом зачине гл.1** (cjk_artifact 76–82%, finish=stop — интринсик, не бюджет). Ожидаемо (D18/D22.5), гейт ловит корректно. Не баг. + +### Вердикт + +**Критерии приёмки Фазы 1 (`02-mvp-plan`) ВЫПОЛНЕНЫ — как инфраструктурная веха — С ОГОВОРКАМИ.** +- Деньги (committed==SUM, честный потолок, resume $0, kill-9 ≤1 вызов, budget_usd-гейт эскалации), диспозиции (echo-эскалация+ре-гейт, flag+skip+continue, мусор не в TM), redrive (rescue+D15.3), живой OpenReadOnly-status, телеметрия/паспорта — **подтверждены исполнением, без исключений.** +- Консистентность D10: **суть выполнена (дрейф ≈0: 1 вхождение вне видимости флаггера — см. разбор)**; формальный порог 98% по флаггеру не достигнут из-за неполноты decl-сида — не машинный/модельный отказ, воспроизведено, actionable (находка 2). +- Верность НЕ мерена (D1.1, по контракту — пилот Ф2.5). +- *(Оговорки вердикта дополнены оркестратором при верификации, D24):* (а) **объём**: прогнан срез 25/2283 глав (~80k zh-символов), не «том целиком» буквы критерия 1 — полный объём двигается в этап B по этапности промта; (б) **coverage-гейт**: recall-тест «≥90% искусственных пропусков» НЕ гонялся (гейт OFF по дефолту) — остаётся отдельной задачей, вторая половина критерия 4 (ноль молчаливых потерь) выполнена; (в) **grok-биллинг** (под-критерий 2) не мерен — редактор glm-5 по D20.3, grok на wire отсутствовал; (г) **budget_usd эскалации** проверен только в направлении «>0 → стреляет» (D22.11), отказ по исчерпанию не исполнялся; (д) parallel-экспорт устарел для спасённого redrive'ом ch1/4 (показывает старый флаг без перевода) — перегенерить на этапе B. + +### Вопросы владельцу + +1. **Этап B (полная книга 2283 гл.): да / нет / потолок?** Этап A стоил **$0.41** за 25 глав; полная проекция **~$37** (glm-5-editor). Нужен явный «да» + `ceilings.book_usd`/`day_usd` (согласие на трату, Р6). Рекомендация: `book_usd≈45`, `day_usd` по темпу (сейчас ~$0.016/гл × скорость). +2. **Редактор этапа B:** glm-5 (как A) или ждать чистый xAI-ключ под grok-4.3? По D20.3 glm-5 для приёмки допустим (B — та же инфра-веха). Напоминание: glm-5-output на 28% дороже grok/токен. +3. **Сид перед этапом B:** дописывать полноту decl (nom+мн.ч.) сейчас (полигон), чтобы D10-флаггер стал осмысленным, или гнать этап B с флаггером как есть (гейт OFF, прогон не блокирует — просто шумный retrieval_state)? Приёмку инфры B не гейтит; но без этого D10-число останется заниженным. + +*(Ревью оркестратора 11.07, воркфлоу 5 осей — всё исполнением по копии store/логам/экспортам: деньги воспроизведены до float-epsilon (все 130 чекпоинтов пересчитаны из usage×прайсов), классификация 55 промахов реплицирована бит-в-бит независимой реализацией матчера, SIGKILL/honest-stop/resume сверены по phase-логам, конфиг-паритет с pipeline-c1 подтверждён diff'ом с ровно двумя санкционированными дельтами. Правки текста и дополнительные оговорки внесены выше с пометками «испр. оркестратором». Ратификация вердикта и обе развязки — D24; ответы на вопросы 1–3 — в D24.4–24.5.)* + ## 2026-07-04 — Старт проекта (MVP-сессия) - Прочитан стартовый бриф `START_PROMT.MD` (37 пунктов идей).