8.2 KiB
Промт: полигон-сессия, пакет №4 — сид этапа B + fix-лист D22.8 + задачи D25 (2026-07-11)
⚠ СТАТУС (оркестратор №4, D36.1, 12.07) — НЕ архивирован, ЧАСТИЧНО отработан, residual ЖИВ. Как отдельная сессия пакет №4 НЕ запускался. Отработана только Задача 1 (сид-мн.ч.) — влита в сид v2 внутри exp13 (D32,
guzhenren-seed-v2.yaml). Открыто (пилот/18+/echo-трек — ОРТОГОНАЛЬНО текущему exp14, НЕ вносить в него):
- Задача 2 (fix-лист D22.8): (а) content-filter матчер подстрокой + самотест; (б) параметризация языка/жанра
explicit_judges.py; (в) миграция судьиmemory_eval.pyс gemini-2.5-flash (EOL 16.10.2026 —00-provider-quirks.md:72); (ж) проба судьи-дублёра 18+ (D22.6) — НАЗВАННЫЙ БЛОКЕР ПИЛОТА (09-pilot-protocol.md, CURRENT-STATE).- Задача 3 (D25): echo-калибровка (D25.7); дополнения пре-регистрации пилота (D25.2/25.6/25.8 →
09-pilot-protocol.md); minimal-pairs shadow fidelity (совместить с корпусом пилота).- Задача 4 (D21.9): P4 fidelity-хвост (35 пар); wire-аудит темп-свипа; D22.8-минорки (U+FF70 kana, append-only провенанс, judge-raw).
Порядок: это ПИЛОТ-трек, downstream от текущей качественной развязки (exp14). При активации пилота — переупакую residual в свежий пилот-преп-промт (или гони отсюда, слаги судей — live-фактчеком
/models). exp14 (POLYGON_QUALITY_EMPIRICS_SESSION_PROMPT.md) — приоритетнее. 18+: только существующие артефактыeval/data, счётчики/метаданные в отчёт.
Кто ты и что делаешь
Ты — полигон-сессия (eval) TextMachine, пакет №4. Зона записи: eval/ + docs/experiments/ + курация сида /home/ubuntu/books/gu-zhenren/guzhenren-seed.yaml (вне git) — плюс своя секция в docs/PROGRESS.md → «## Полигон». Ничего не коммитить — лендинг у оркестратора. Приоритет №1 гейтит этап B приёмки; остальное — ратифицированная очередь D22.8/D25.
Онбординг (~40 мин)
CLAUDE.md→ CURRENT-STATE вdocs/PROGRESS.md→ отчёт «## Приёмка Ф1 … этап A» (разбор D10 и класс промахов).docs/architecture/05-decisions-log.md: D24.2/D24.4 (сид), D25.6–25.8 (твои задачи из внешней критики), D22.8 (fix-лист), D21.9 (висящие поручения).eval/README.md+docs/experiments/00-provider-quirks.md(шапка: правило двух направлений).
Задачи (по приоритету)
1. Сид-обогащение 蛊真人 — ГЕЙТИТ ЭТАП B (D24.4)
- Пройти все 49 записей
guzhenren-seed.yaml: дописать мн.ч. (все падежи мн.ч., где термин счётный) вdecl.forms— этап A дал 18 ложных промахов класса inflection_gap (元石→«первокамней/первокамни/первокамнями», 凡人→«смертных/смертными», 蛊师→«гу-мастеров»). Именительный ед.ч. дублировать НЕ нужно (код с пакета №5 всегда проверяет базовый dst — D24.4). - Не менять dst/статусы/окна (白凝冰 gender=hidden — не трогать, D19.3). Изменение сида = memory content-hash (D8) → resnapshot: координируется оркестратором ВМЕСТЕ с лендингом бэкенд-пакета №5 — один resnapshot на всё.
- В
docs/architecture/06-memory-risk-registry.md— пометка нового класса (D24.2): alias-слепое пятно post-check (вложенный алиас внутри longest-match полного имени невидим флаггеру; репро: гл.18/0 古月方源 → «гу юэ» раздельно при dst-родителе в тексте).
2. Fix-лист D22.8 (major-часть)
- (а) Матчер content-filter подстрокой + самотест на составной
'content_filter: PROHIBITED_CONTENT'(сейчас 8/8 отказов Gemini лежатbehaviour='empty'). - (б) Параметризация языка/жанра судейского промпта
explicit_judges.py(ja/en-fidelity сняты под zh-рамкой). - (в) Миграция судьи
memory_eval.pyс gemini-2.5-flash (EOL 16.10.2026; двойнойextra_body; нет 404-ретрая). - (ж) Проба судьи-дублёра 18+ (D22.6): gpt-5-mini (если жив — слаг live-фактчеком) + минимум один не-Google/не-xAI кандидат (mistral-судья для grok-выходов; kimi/glm после ToS-чека) на 18 Mistral- и 13 grok-ON-переводах; пре-регистрировать refusal-rate и agreement до прогона. 18+: работаешь только с уже существующими артефактами eval/data, счётчики/метаданные в отчёт, тексты — нет.
3. Задачи D25 (из внешней критики, ратифицированы)
- Echo-gate калибровка (D25.7) — после лендинга флора №5: накопленные echo-провалы + 30–50 чистых выходов на язык + синтетические partial/tail-эхо; порог при фиксированном FP-бюджете. Каузальный factorial регистра НЕ нужен.
- Пре-регистрация пилота — дополнения (D25.2/25.6/25.8): инструментировка minutes/flag и typed resolutions; аудит случайной выборки unflagged; метрика over-stylization/fidelity в voice-арм; prefix-анализ судьи 1/3/5 vs full-11 из тех же данных (D25.3 — решающий протокол остаётся 11+ со свапом, D13.3). Внести в
09-pilot-protocol.md. - Подготовка minimal-pairs 100–150 для shadow fidelity cascade (D25.2) — СОВМЕСТИТЬ с корпус-подготовкой пилота, отдельный трек не открывать.
4. Висящие хвосты (D21.9, если останется ёмкость)
- Fidelity-хвост P4 (35 пар; сырьё продублировано в
/home/ubuntu/books/gu-zhenren/research15-probes/) — гейтит анти-эхо wiring. - Wire-аудит пре-шаг temp-свипа; (г/д/е) D22.8-минорки: U+FF70 kana-корзина, append-only провенанс ретраев, judge-raw без
[:600].
Дисциплина
- Пробы за деньги — центы, по пре-регистрации; Python-зеркало ↔ Go: при расхождении верить Go; transient-прогоны в чужой зоне — только в копиях вне дерева (D22.10).
- Аномалия провайдера → официальная вендор-дока, НЕ гадание (шапка quirks); слаги — live-фактчек
/models. .envне читать;eval/data/*corpus*— только по прямой задаче (п.2ж — метаданные/счётчики);/home/ubuntu/books/тексты в доки не цитировать.- Отчёт: секция в
docs/PROGRESS.md«Полигон» — числа, провенанс артефактов, вопросы. Не коммитить.