textmachine/docs/POLYGON_PACKAGE4_SESSION_PROMPT.md

8.2 KiB
Raw Blame History

Промт: полигон-сессия, пакет №4 — сид этапа B + fix-лист D22.8 + задачи D25 (2026-07-11)

СТАТУС (оркестратор №4, D36.1, 12.07) — НЕ архивирован, ЧАСТИЧНО отработан, residual ЖИВ. Как отдельная сессия пакет №4 НЕ запускался. Отработана только Задача 1 (сид-мн.ч.) — влита в сид v2 внутри exp13 (D32, guzhenren-seed-v2.yaml). Открыто (пилот/18+/echo-трек — ОРТОГОНАЛЬНО текущему exp14, НЕ вносить в него):

  • Задача 2 (fix-лист D22.8): (а) content-filter матчер подстрокой + самотест; (б) параметризация языка/жанра explicit_judges.py; (в) миграция судьи memory_eval.py с gemini-2.5-flash (EOL 16.10.2026 — 00-provider-quirks.md:72); (ж) проба судьи-дублёра 18+ (D22.6) — НАЗВАННЫЙ БЛОКЕР ПИЛОТА (09-pilot-protocol.md, CURRENT-STATE).
  • Задача 3 (D25): echo-калибровка (D25.7); дополнения пре-регистрации пилота (D25.2/25.6/25.8 → 09-pilot-protocol.md); minimal-pairs shadow fidelity (совместить с корпусом пилота).
  • Задача 4 (D21.9): P4 fidelity-хвост (35 пар); wire-аудит темп-свипа; D22.8-минорки (U+FF70 kana, append-only провенанс, judge-raw).

Порядок: это ПИЛОТ-трек, downstream от текущей качественной развязки (exp14). При активации пилота — переупакую residual в свежий пилот-преп-промт (или гони отсюда, слаги судей — live-фактчеком /models). exp14 (POLYGON_QUALITY_EMPIRICS_SESSION_PROMPT.md) — приоритетнее. 18+: только существующие артефакты eval/data, счётчики/метаданные в отчёт.


Кто ты и что делаешь

Ты — полигон-сессия (eval) TextMachine, пакет №4. Зона записи: eval/ + docs/experiments/ + курация сида /home/ubuntu/books/gu-zhenren/guzhenren-seed.yaml (вне git) — плюс своя секция в docs/PROGRESS.md → «## Полигон». Ничего не коммитить — лендинг у оркестратора. Приоритет №1 гейтит этап B приёмки; остальное — ратифицированная очередь D22.8/D25.

Онбординг (~40 мин)

  1. CLAUDE.md → CURRENT-STATE в docs/PROGRESS.md → отчёт «## Приёмка Ф1 … этап A» (разбор D10 и класс промахов).
  2. docs/architecture/05-decisions-log.md: D24.2/D24.4 (сид), D25.625.8 (твои задачи из внешней критики), D22.8 (fix-лист), D21.9 (висящие поручения).
  3. eval/README.md + docs/experiments/00-provider-quirks.md (шапка: правило двух направлений).

Задачи (по приоритету)

1. Сид-обогащение 蛊真人 — ГЕЙТИТ ЭТАП B (D24.4)

  • Пройти все 49 записей guzhenren-seed.yaml: дописать мн.ч. (все падежи мн.ч., где термин счётный) в decl.forms — этап A дал 18 ложных промахов класса inflection_gap (元石→«первокамней/первокамни/первокамнями», 凡人→«смертных/смертными», 蛊师→«гу-мастеров»). Именительный ед.ч. дублировать НЕ нужно (код с пакета №5 всегда проверяет базовый dst — D24.4).
  • Не менять dst/статусы/окна (白凝冰 gender=hidden — не трогать, D19.3). Изменение сида = memory content-hash (D8) → resnapshot: координируется оркестратором ВМЕСТЕ с лендингом бэкенд-пакета №5 — один resnapshot на всё.
  • В docs/architecture/06-memory-risk-registry.md — пометка нового класса (D24.2): alias-слепое пятно post-check (вложенный алиас внутри longest-match полного имени невидим флаггеру; репро: гл.18/0 古月方源 → «гу юэ» раздельно при dst-родителе в тексте).

2. Fix-лист D22.8 (major-часть)

  • (а) Матчер content-filter подстрокой + самотест на составной 'content_filter: PROHIBITED_CONTENT' (сейчас 8/8 отказов Gemini лежат behaviour='empty').
  • (б) Параметризация языка/жанра судейского промпта explicit_judges.py (ja/en-fidelity сняты под zh-рамкой).
  • (в) Миграция судьи memory_eval.py с gemini-2.5-flash (EOL 16.10.2026; двойной extra_body; нет 404-ретрая).
  • (ж) Проба судьи-дублёра 18+ (D22.6): gpt-5-mini (если жив — слаг live-фактчеком) + минимум один не-Google/не-xAI кандидат (mistral-судья для grok-выходов; kimi/glm после ToS-чека) на 18 Mistral- и 13 grok-ON-переводах; пре-регистрировать refusal-rate и agreement до прогона. 18+: работаешь только с уже существующими артефактами eval/data, счётчики/метаданные в отчёт, тексты — нет.

3. Задачи D25 (из внешней критики, ратифицированы)

  • Echo-gate калибровка (D25.7) — после лендинга флора №5: накопленные echo-провалы + 3050 чистых выходов на язык + синтетические partial/tail-эхо; порог при фиксированном FP-бюджете. Каузальный factorial регистра НЕ нужен.
  • Пре-регистрация пилота — дополнения (D25.2/25.6/25.8): инструментировка minutes/flag и typed resolutions; аудит случайной выборки unflagged; метрика over-stylization/fidelity в voice-арм; prefix-анализ судьи 1/3/5 vs full-11 из тех же данных (D25.3 — решающий протокол остаётся 11+ со свапом, D13.3). Внести в 09-pilot-protocol.md.
  • Подготовка minimal-pairs 100150 для shadow fidelity cascade (D25.2) — СОВМЕСТИТЬ с корпус-подготовкой пилота, отдельный трек не открывать.

4. Висящие хвосты (D21.9, если останется ёмкость)

  • Fidelity-хвост P4 (35 пар; сырьё продублировано в /home/ubuntu/books/gu-zhenren/research15-probes/) — гейтит анти-эхо wiring.
  • Wire-аудит пре-шаг temp-свипа; (г/д/е) D22.8-минорки: U+FF70 kana-корзина, append-only провенанс ретраев, judge-raw без [:600].

Дисциплина

  • Пробы за деньги — центы, по пре-регистрации; Python-зеркало ↔ Go: при расхождении верить Go; transient-прогоны в чужой зоне — только в копиях вне дерева (D22.10).
  • Аномалия провайдера → официальная вендор-дока, НЕ гадание (шапка quirks); слаги — live-фактчек /models.
  • .env не читать; eval/data/*corpus* — только по прямой задаче (п.2ж — метаданные/счётчики); /home/ubuntu/books/ тексты в доки не цитировать.
  • Отчёт: секция в docs/PROGRESS.md «Полигон» — числа, провенанс артефактов, вопросы. Не коммитить.