Archive five spent session prompts, record confirmed key budgets, and keep partially-run POLYGON_PACKAGE4 active as pilot-track residual (D36.1)

This commit is contained in:
Claude (backend session) 2026-07-11 21:33:15 +03:00
parent bf24d64e53
commit ee259bd4d0
11 changed files with 21 additions and 4 deletions

View file

@ -34,6 +34,8 @@
**Что уже сделано (D30→D35, залендено):** флип D1→билингв-редактор, reflow, output-санитайзер (+фикс D33.1), сид v2 подписан владельцем (D34.1); пере-прогон 25 глав связкой выполнен (инфра держится, флор D24.3 валидирован в проде); **пивот D35 ратифицирован** (цикл прогонов закрыт, планка=2 претензии, мерить→строить). exp13 закрыт (переводчик=flash, pro отклонён — D32). Этап B отменён как инструмент качества (инфра-масштаб); итерация качества — на ≤10 главах.
> **СТАТУС D36 (оркестратор №4, 12.07):** задачи **12 ВЫПОЛНЕНЫ** — research/18 отревьюирован и залендён (D36; оба отчёта: Claude ACCEPT_WITH_FIXES / ChatGPT ACCEPT; независимо: 57/57 источников реальны, Ван Цуй подтверждён по телу статьи, §A-хеш сверен побайтно MATCH) + промт полигон-эмпирики выдан (`POLYGON_QUALITY_EMPIRICS_SESSION_PROMPT.md`, D36). Бюджеты ключей подтверждены владельцем (OpenAI ~$9, Gemini ~€2.6, DeepSeek/ZAI/Kimi/xAI/Mistral ~$9; других нет — D36.1). Спент-промты заархивированы (D36.1). **Остаётся:** 3 (fidelity re-gate — полигон параллельно), 4 (бэкенд-фикс-лист D35.4 — в следующий бэкенд-пакет), 5 (readme чужих зон). Контракт D24→**D36**. Ниже — исходный список задач хендоффа (12 закрыты).
**⚠ ТВОИ НЕПОСРЕДСТВЕННЫЕ ЗАДАЧИ (по приоритету):**
1. **Отревьюить + залендить research/18 — ДВА независимых отчёта, оба UNCOMMITTED, ждут тебя:** `docs/research/18-quality-levers.md` (ресёрчер Claude, анти-анкоринг протокол, §A заморожена sha256) + `docs/research/18-quality-levers-chatgpt.md` (параллельный ChatGPT, запущен владельцем). Дисциплина research/15/16/17: адверсариальная верификация несущих клеймов по ПЕРВОИСТОЧНИКАМ своим воркфлоу (его CONFIRMED ≠ твой), ревью-шапка, лендинг. ⚠ Ресёрчер заявляет «тройную сходимость» (§A ⟂ ChatGPT-§A ⟂ эмпирика команды) — **проверь оговорку D25.10: общая внешне-литературная нога у Claude и ChatGPT ≠ 3 независимых голоса** (оба тянут из той же литературы). Ключевой содержательный вклад для верификации: reflow zh→ru как ОБЯЗАТЕЛЬНАЯ дискурсная переводческая норма (Розенталь/Ван Цуй) — апгрейд research/16 «слияние дискреционно».
2. **Написать промт полигон-эмпирики (D35.6) из §C research/18:** оси — **нарезка×промпт** (глава|чанк × сильный-дискурс|текущий — на ≤5 главах прямыми вызовами, чанк-арм воспроизводит прод-инъекцию как якорь; это ось, которую exp04/12/13 НЕ крутили) + **диагностик-фронтир-арм** (владелец согласовал: Gemini/GPT переводчик+редактор+мета-ревьюер → потолок в моделях vs в машинерии; гарды: эхо-скрин/исключить grok на архаичной ch1 — D22.5, self-family exclusion мета-ревьюера, per-call кап + пре-регистрация) + кривая размер-чанка↔качество↔биллинг↔ретраи. Методика-guard D32.4 (fidelity-first агрегация, leave-one-out, катастроф-скрин — полигон дважды собирал ложную «сходимость», лови третий раз).

View file

@ -1,5 +1,13 @@
# Промт: полигон-сессия, пакет №4 — сид этапа B + fix-лист D22.8 + задачи D25 (2026-07-11)
> **СТАТУС (оркестратор №4, D36.1, 12.07) — НЕ архивирован, ЧАСТИЧНО отработан, residual ЖИВ.**
> Как отдельная сессия пакет №4 **НЕ запускался**. Отработана только **Задача 1 (сид-мн.ч.)** — влита в сид v2 внутри exp13 (D32, `guzhenren-seed-v2.yaml`). **Открыто (пилот/18+/echo-трек — ОРТОГОНАЛЬНО текущему exp14, НЕ вносить в него):**
> - **Задача 2 (fix-лист D22.8):** (а) content-filter матчер подстрокой + самотест; (б) параметризация языка/жанра `explicit_judges.py`; (в) **миграция судьи `memory_eval.py` с gemini-2.5-flash** (EOL 16.10.2026 — `00-provider-quirks.md:72`); **(ж) проба судьи-дублёра 18+ (D22.6) — НАЗВАННЫЙ БЛОКЕР ПИЛОТА** (`09-pilot-protocol.md`, CURRENT-STATE).
> - **Задача 3 (D25):** echo-калибровка (D25.7); дополнения пре-регистрации пилота (D25.2/25.6/25.8 → `09-pilot-protocol.md`); minimal-pairs shadow fidelity (совместить с корпусом пилота).
> - **Задача 4 (D21.9):** P4 fidelity-хвост (35 пар); wire-аудит темп-свипа; D22.8-минорки (U+FF70 kana, append-only провенанс, judge-raw).
>
> **Порядок:** это ПИЛОТ-трек, downstream от текущей качественной развязки (exp14). При активации пилота — переупакую residual в свежий пилот-преп-промт (или гони отсюда, слаги судей — live-фактчеком `/models`). **exp14 (`POLYGON_QUALITY_EMPIRICS_SESSION_PROMPT.md`) — приоритетнее.** 18+: только существующие артефакты `eval/data`, счётчики/метаданные в отчёт.
---
## Кто ты и что делаешь

View file

@ -40,9 +40,9 @@
- **Semantic-first vs combined:** один combined-editor против двух узких пассов (билингв семантика-репэйр → target-only литературный reflow) под ОДНИМ coverage-гейтом → снимает конкуренцию мандатов у слабой модели; замерить реальный output-множитель (≤~2× editor-output).
- **±1 reference-контекст:** дать пред-source+пред-target хвост и след-source-абзац до границы сцены, явно `REFERENCE — НЕ ПЕРЕВОДИТЬ`; **три РАЗДЕЛЬНЫЕ абляции prev / next / both** (не сливать в один «context arm»). Цель — кросс-граница (тип d), нулевые подлежащие, катафора.
### 2. Фронтир-арм — ДИАГНОСТИКА потолка (владелец согласовал трату; gated на подтверждённом потолке budget)
### 2. Фронтир-арм — ДИАГНОСТИКА потолка (бюджеты владельцем ПОДТВЕРЖДЕНЫ D36.1 — трата разрешена в рамках ключей)
- **Capability-vs-activation 2×2:** {дешёвая прод-модель | фронтир} × {baseline-промпт | дискурс-промпт} на trap-наборе + 1 главе. Разводит: фронтир верстает, дешёвая нет → **gap способности**; ни та ни другая → недоспецифицированный промпт; краткое правило/пример чинит дешёвую → это была **активация**.
- Фронтир: **Gemini 3.1 Pro (`-preview`)** и **GPT-5** (ключи есть); **НЕ Claude/Opus** (нет ключа); grok — можно как доп, но **НЕ на ch1** (D22.5).
- Фронтир: **GPT-5 — основной** (OpenAI ~$9); **Gemini 3.1 Pro (`-preview`) — ЭКОНОМНО** (остаток ~€2.6, thinking = аддитив-биллинг → быстро сгорит; лучше как кросс-семейный мета-ревьюер, НЕ прогонять им всё); grok (~$9) — доп, но **НЕ на архаичной ch1** (D22.5, эхо-риск); **НЕ Claude/Opus** (нет ключа). Мета-ревьюер — **self-family exclusion** (не ревьюит свой выход).
- **Фронтир кросс-семейный мета-ревьюер** (span-цитаты: где ломается смысл + какой механизм чинит): **self-family exclusion** (модель НЕ ревьюит свой выход — если Gemini переводил, мета-ревьюер GPT, и наоборот).
- Гарды: эхо/refusal-скрин на всех выходах; **per-call predicted-cost кап ДО вызова** (НЕ group-level — урок exp13 +10%); пре-регистрация армов заморожена коммитом.
@ -92,7 +92,7 @@ Few-shot — минимальные, ортогональные: narrative N:1,
`docs/experiments/14-quality-empirics.md`: пре-регистрация (§1, заморожена коммитом) → таблицы армов (KPI-абзацы / trap-accuracy со спанами / perturbation / retry-по-причинам / цена) → кривые размер↔качество↔биллинг↔ретраи → capability-vs-activation вывод (потолок: модели vs организация) → рекомендация near-term конфига + что строить под ROI → 3 финалиста для слепого чтения владельца. Смена дефолта — ратификация оркестратора. **Ничего не коммитить, КРОМЕ пре-рег-раздела** (D30.10-гейт).
## Дисциплина / бюджет
- **Кап: предложи в пре-регистрации** (ориентир: near-term армы+судьи ~$34; фронтир-арм — отдельная строка; **суммарно держи ≤$10**). Per-call predicted-cost кап ОБЯЗАТЕЛЕН до каждого платного вызова (exp13 переоврал group-cap на +10%). **Фронтир-траты — подтверди явный `ceilings` с оркестратором/владельцем ДО первых фронтир-вызовов** (Р6 — согласие на трату; near-term армы не блокируются, идут первыми).
- **Бюджеты ключей (подтверждены владельцем, D36.1 — «делай что нужно в этих рамках»):** OpenAI ~$9, Gemini ~€2.6 (крошечный — беречь), DeepSeek/ZAI(glm)/Kimi/xAI(grok)/Mistral ~$9 каждый; ДРУГИХ ключей нет. Отдельный owner-`ceiling`-запрос НЕ нужен — работай внутри остатков. **Per-call predicted-cost кап ОБЯЗАТЕЛЕН до каждого платного вызова** (НЕ group-level — exp13 переоврал на +10%); в пре-регистрации разложи ожидаемую трату по ключам и держи запас (near-term дешёвые армы — первыми; фронтир GPT-5 — основная фронтир-статья; Gemini — точечно). Заканчивается ключ → останавливайся на нём, не блокируй остальные армы.
- Каждый платный вызов персистит usage/cost; финальная сумма в отчёте (D30.10). Полигонное Python-зеркало ↔ Go: при расхождении верить Go.
- Слепота свята; пре-рег заморожен после коммита; аномалии провайдеров → вендор-дока + `/models` (не гадать); `.env` не читать; тексты книги в git-доки не тащить (≤15 слов); 18+ регистров в раннем срезе нет — перенос на 18+ требует отдельной пробы (D22/exp10-11).
- **Методика-guard (мемо eval-aggregation — ловил ДВАЖДЫ):** fidelity-first агрегация, leave-one-out по судьям, катастроф-скрин к ПОБЕДИТЕЛЮ тоже, независимость сигналов до агрегации, ось решения (near-term-достаточность vs потолок-моделей). Не собирай ложную «сходимость».

View file

@ -21,6 +21,8 @@
**12.07 (№4): research/18 (ОБА отчёта) отревьюирован и залендён с ревью-шапками, ратификация D36.** Мультиагентный воркфлоу 26 агентов ($0, refute-by-default, первоисточники + реплика сырья): **§A-заморозка Claude sha256 44f90364… воспроизведена побайтно (MATCH) → не редактировалась; 57/57 несущих цитат СУЩЕСТВУЮТ (0 сфабрикованных — проверены ВСЕ «2026»-препринты)**; эмпирика воспроизведена (ch5.0/ch20.0-void ТОЧНО, CJK 13 финалов, 41/51 в допуске, gl.7-инверсия/gl.8-сплющивание фактически есть → на fidelity re-gate); **Ван Цуй ПОДТВЕРЖДЁН по ТЕЛУ статьи** (скептик декодировал CID/Identity-H шрифт: 5 техник + причастные/деепричастные + подчинение + прескриптивная необходимость — Вестник МГУ Сер.22 2024№3, рецензирован). **Вердикты: Claude — ACCEPT_WITH_FIXES** (5 поправок в ревью-шапке: DocRepair-числа принадлежат D19-1081 не P19-1116 — числа верны; TransAgents двойная-метка; Z5 автор Dingxu Shi не Li&Thompson; Ван Цуй = прескрипция ТЕХНИКИ, не «норма языка»; «пост-черновая регрессия > 2 претензий» пере-возвышена — ch5-void = экспорт-баг); **ChatGPT — ACCEPT** (цитатно-чист, §C — самый исполнимый скелет; оговорки: §A-заморозка НЕ воспроизводима из документа = дисконт на вес сходимости, §C4-гейт не ссылается на D34.3). **Калибровка «тройной сходимости»:** оговорка честна (D25.10 взята), но (а) вторая необъявленная общая нога — оба §A читали одно сырьё/код; (б) цитатные базы почти НЕ пересекаются (~3 общие) → где литература расходится, совпадение сильнее; (в) ChatGPT-заморозку — с дисконтом. **Несущий вклад для «строить» держится:** Ван Цуй-контент → в reflow-промпт полигона; экспорт-баг ch5/ch20 подтверждён двумя репликами (бэкенд-fix D35.4a). Выдан `POLYGON_QUALITY_EMPIRICS_SESSION_PROMPT.md` (D36: скелет §C ChatGPT + графт Ван Цуй/COGS/D34.3 из Claude; добавлены недостающая ячейка current-промпт×глава и явный P0-baseline; ch5/ch20 исключены из слепых пакетов).
**12.07 (№4): D36.1 — гигиена доков + бюджеты (по запросу владельца).** Заархивированы **5** спент-промтов (`archive/prompts/`, git mv, история не переписана — D23.3): ресёрчер/exp13/санитайзер-фикс/приёмка-v2/D152-этап-А. **`POLYGON_PACKAGE4` НЕ архивирован** (проверка по запросу владельца): как сессия не запускался, отработана лишь task-1 сид-мн.ч. (в exp13/D32); **residual жив** (D22.6 судья-дублёр — блокер пилота, D25.7 echo-кал, миграция memory_eval с 2.5-flash, пилот-пре-рег, P4-хвост) — **пилот/18+/echo-трек, ОРТОГОНАЛЬНО exp14** (не вносить); оставлен активным со статус-баннером как residual-трекер до активации пилота. Активны `ORCHESTRATOR_*` + `POLYGON_QUALITY_EMPIRICS_*` (exp14) + `POLYGON_PACKAGE4_*` (отложен); README-карта + титул D-лога D35→D36 актуализированы. **Бюджеты подтверждены владельцем:** OpenAI ~$9, Gemini ~€2.6, DeepSeek/ZAI/Kimi/xAI/Mistral ~$9; других нет; «полигон делает что нужно в рамках» → блокер фронтир-ceiling снят (exp14: GPT-5 основной фронтир, Gemini точечно/мета-ревьюер, grok не на ch1; per-call кап + пре-рег). D36.1 — в D-логе.
## Приёмка Ф1 — ПЕРЕ-ПРОГОН 25 глав кандидат-конфигом (билингв glm-5 + reflow + сид v2 + санитайзер), 2026-07-12 (D30.9/D34.2)
Пере-прогон по `ACCEPTANCE_SESSION_PROMPT.md`. **Ничего не закоммичено** (лендинг — оркестратору). Все производные — ВНЕ git в `/home/ubuntu/books/gu-zhenren/rerun/` (свежий store `guzhenren-rerun.db`, конфиги, выходы, отчёты, скрипты замеров). **Дерево backend/ чистое — мои правки кода = 0** (throwaway-хелпер `cmd/_dumpsrc` для дампа исходных чанков — `_`-игнор Go-тулчейном, не коммичен, удалён после использования). Предусловия запуска (все 5) сверены: D15.2 этап A+D33.1 залендены; draft=flash сохранён (exp13/D32); сид v2 подписан владельцем (D34.1 — Жэнь Цзу/Монах Цветочного Вина/гу Жизни/деревня Гуюэ/первобытный камень/род «гу» муж — сверено в `guzhenren-seed-v2.yaml`); budget_usd>0; единый resnapshot.

View file

@ -16,7 +16,7 @@
- `experiments/` — эмпирика «Полигона»: `00-provider-quirks` (читать перед любым вызовом провайдера), `01-token-calibration`, `02-refusal-benchmark`, `03-local-stand`, `04-editor-quality`, `06-local-extraction`, `07-coverage-precision`, `08-cost-model-v2` (актуальная денежная модель), `09-pilot-protocol` (пилот Ф2.5 + поправки D13), `10-explicit-benchmark` (18+ violence-рука канала B), `11-erotica-benchmark` (erotica по трём парам/регистрам — закрытие D14.4, D22).
- `research/` — фактура исследований 0405.07: `0110` базовые, `11-gap-*` добор критиком, `12-*` режимы отказа/отзывы/таксономии (+ два внешних материала с провенанс-шапками), `13` валидация памяти, `14` адаптивная память, `15` голос и состояние (принят, D21), **`16` ридер-IDE (принят с ревью-шапкой, D29)**, **`17` внешняя критика GPT-5.6 (принят с ревью-шапкой, D25)** — у 16/17 читать шапку прежде тела. ⚠ Часть под superseded-баннерами (01/02/03/04/05/09 и gap-1/2/5) — **читай баннер прежде содержимого**.
- `PROGRESS.md`**журнал** (CURRENT-STATE сверху, ниже хронология; НЕ источник решений).
- **Активные хендофф-промты** (пивот D35, очередь «мерить→строить»): [`ORCHESTRATOR_SESSION_PROMPT.md`](ORCHESTRATOR_SESSION_PROMPT.md) (роль оркестратора) · [`RESEARCHER_QUALITY_SESSION_PROMPT.md`](RESEARCHER_QUALITY_SESSION_PROMPT.md) (**СЛЕДУЮЩИЙ: ресёрч рычагов качества, нейтральный/анти-анкоринг — вход полигону, D35.5**) · fidelity re-gate `rerun/FIDELITY_REGATE_HANDOFF.md` (полигон, параллельно, D34.3) · далее — полигон-эмпирика (нарезка×промпт + фронтир-диагностик, промт после отчёта ресёрчера) → бэкенд под ROI · [`BACKEND_D152_SESSION_PROMPT.md`](BACKEND_D152_SESSION_PROMPT.md) (D15.2 этап Б/В — после качественной развязки) · [`ACCEPTANCE_SESSION_PROMPT.md`](ACCEPTANCE_SESSION_PROMPT.md) (цикл прогонов ЗАКРЫТ D35; итерация качества — на ≤10 главах). Закрытые (пакеты №35, санитайзер-фикс D33.1, erotica, «Голос», r/17, r/16, exp12→D30, exp13→D32) — в `archive/prompts/`.
- **Активные хендофф-промты** (пивот D35→D36, очередь «мерить→строить»): [`ORCHESTRATOR_SESSION_PROMPT.md`](ORCHESTRATOR_SESSION_PROMPT.md) (роль оркестратора) · [`POLYGON_QUALITY_EMPIRICS_SESSION_PROMPT.md`](POLYGON_QUALITY_EMPIRICS_SESSION_PROMPT.md) (**СЛЕДУЮЩИЙ: эмпирика рычагов качества exp14 — нарезка×промпт + фронтир-диагностик + кривая нарезки, D36**) · fidelity re-gate `rerun/FIDELITY_REGATE_HANDOFF.md` (полигон, параллельно, D34.3) · [`POLYGON_PACKAGE4_SESSION_PROMPT.md`](POLYGON_PACKAGE4_SESSION_PROMPT.md) (**ОТЛОЖЕН, пилот-residual:** task-1 закрыт exp13/D32; открыты D22.6 судья-дублёр + D25.7 echo-кал + пилот-пре-рег + P4-хвост — НЕ для exp14, для пилота) · далее — бэкенд под доказанный ROI (стейдж Б/В D15.2 — СВЕЖИЙ промт после развязки; дизайн = спека v3.1). Закрытые в `archive/prompts/` (D36.1): research/18-ресёрчер→D36, exp13→D32, санитайзер-фикс→D33.1, приёмка v2-пере-прогон (цикл ЗАКРЫТ D35), D152-этап-А→D33, пакеты №35, erotica, «Голос», r/17, r/16, exp12→D30.
- `archive/` — закрытые сессионные промты (только история, инструкции оттуда не исполнять).
## Статус (2026-07-12, пост-пивот D35)

View file

@ -473,3 +473,8 @@ D1 остаётся дефолтом Фазы 1 (менять конфигура
5. **ВЫДАН промт полигон-эмпирики `POLYGON_QUALITY_EMPIRICS_SESSION_PROMPT.md`** (D36; ратифицирует §C обоих отчётов в исполнимый дизайн): скелет §C ChatGPT (P0-baseline → армы с фаза-тегами → пре-рег метрики/гейты → дерево решений) + графт из Claude (Ван Цуй-контент reflow-промпта, COGS-модель кириллица-фертильность/cache-ordering, привязка мандатного re-gate D34.3); **добавлены** недостающая ячейка `текущий-промпт × глава` (полный 2×2 нарезка×промпт — оба отчёта её не крутили) и явный чистый baseline; **ch5/ch20 исключены/чинятся до слепых пакетов** (дыры спутают худ-оценку). Гарды: fidelity-first, leave-one-out, катастроф-скрин, per-call кап (exp13 +10%), эхо-скрин/grok-off на архаичной ch1 (D22.5), self-family exclusion фронтир-мета-ревьюера, пре-регистрация до платных вызовов. Fidelity re-gate (D34.3) — параллельно, независимо.
6. **Курс не разворачивается.** research/18 — вход эмпирики, НЕ приговор; планка = 2 претензии владельца (ИНТЕРИМ пре-скрин, D35); пилот Ф2.5 остаётся решающей точкой и не разбавляется. Порядок: полигон-эмпирика → владелец читает результат → решение «дешёвый трек дотягивает / нужен фронтир / нужна Ф2» → бэкенд под доказанный ROI.
## D36.1 — Документационная гигиена + подтверждённые бюджеты ключей (12.07, оркестратор №4, по запросу владельца). ✅
1. **Заархивированы 5 спент/superseded промтов** в `docs/archive/prompts/` (git mv, история журнала/D-лога НЕ переписана — D23.3, только карта актуальности): ресёрчер research/18 (→D36), exp13 (→D32), санитайзер-фикс (→D33.1), **приёмка v2-пере-прогон** (цикл прогонов ЗАКРЫТ D35 — идентичный ре-прогон = 0 инфо), **D152-этап-А** (→D33; этап Б/В — СВЕЖИЙ промт после качественной развязки, дизайн-оф-рекорд = спека D15.2 v3.1). **НЕ архивирован `POLYGON_PACKAGE4_SESSION_PROMPT.md`** (проверка по запросу владельца): как сессия НЕ запускался; отработана только task-1 сид-мн.ч. (влита в exp13/D32); **residual ЖИВ и НЕ пуст — пилот/18+/echo-трек, ОРТОГОНАЛЬНО exp14:** D22.6 судья-дублёр (НАЗВАННЫЙ блокер пилота), D25.7 echo-калибровка, миграция `memory_eval` с gemini-2.5-flash (EOL 16.10), пилот-пре-рег (`09-pilot-protocol.md`), D21.9 P4 fidelity-хвост, D22.8-минорки. Оставлен активным как residual-трекер со статус-баннером; НЕ вносить в exp14 (разбавит SFW-пре-рег); переупакуется в пилот-преп-промт при активации пилота. **Активны:** `ORCHESTRATOR_*` + `POLYGON_QUALITY_EMPIRICS_*` (exp14) + `POLYGON_PACKAGE4_*` (пилот-residual, отложен). README-карта актуализирована; титул контракта D35→D36.
2. **Бюджеты ключей подтверждены владельцем (12.07):** OpenAI ~$9, Gemini ~€2.6, DeepSeek/ZAI(glm)/Kimi/xAI(grok)/Mistral ~$9 каждый; ДРУГИХ ключей нет; «полигон делает что нужно в этих рамках» → снимает блокер фронтир-`ceiling` из D36. **Импликация exp14:** Gemini-бюджет крошечный (€2.6, thinking = аддитив-биллинг) → фронтир-переводчик/редактор преим. **GPT-5** ($9); Gemini — экономно, лучше кросс-семейным мета-ревьюером (self-family exclusion); grok ($9) доступен, НЕ на архаичной ch1 (D22.5); Claude/Opus нет. Per-call predicted-cost кап + пре-рег остаются (exp13 +10% урок). Записано в промт полигона.