Record the 08.08 checkout incident in the polygon journal and correct two figures the backup predated

This commit is contained in:
heaven 2026-08-08 00:40:28 +03:00
parent caaf36d24f
commit 64a40ed7fd

View file

@ -221,6 +221,34 @@ S3 упёрлась в замок (контракта нет) — по слов
## Полигон
**⛔ ИНЦИДЕНТ 08.08 00:13, вина оркестратора №15:** агент проверочной панели выполнил `git reset; git checkout -- .` в реальном дереве. Откачены незакоммиченные правки: отчёт `21-role-topology.md` потерял §11§16 (четвёртая и пятая редакции, армы G и дрейф, пост-хок аудита), `verify_report.py` — точное сличение чисел и проверки §14, `absjudge.py` — поправку на степени свободы, `drift.py` — счётную метрику. **Сырьё цело полностью** (1672 файла в `~/books/role-topology`, git туда не заглядывает) ⇒ потеряна ЗАПИСЬ, не замер. Скрипты восстановлены и проверены исполнением: числа воспроизвелись из сырья точь-в-точь (148/163 · 91/163 · 138/163 · 139/163). Отчёт восстанавливается из сырья; всё, что восстановить нельзя, помечается «утрачено инцидентом 08.08, D39.113». Резервные копии зоны и сырья сняты вне репозитория.
**⚠ ЭКСП-21 ПРОШЁЛ НЕЗАВИСИМЫЙ АУДИТ ПО 4 ДОМЕНАМ (посылки · код · выводы · их соотношение), $0.** Главное: **прод-редактор обязан нести закон-блок** — без него арм единственный ломает терминологию (покрытие канона 0.566 против 0.917 у черновика, p=0.003), при неотличимом качестве и +5% цены · **70% заголовка +2.50 объясняется ЧЕРНОВИКОМ**, а не вторым проходом (тот же редактор над другим черновиком: 7.66 против 5.91, 14/16, p=0.006) · **нога 2×2**: дорогая модель в ОДИН проход неотличима от дешёвого черновика (+0.50, p=0.48), она же в позиции редактора даёт +2.50 ⇒ **работает ТОПОЛОГИЯ, а не жилец**. Отозвано: дрейф §14 целиком (метрика ШОВ в коде не считается ничем), «доказанный потолок» роутинга (верное основание — экономика: G берёт 25% выигрыша за 55% цены, хуже случайного), «+114% токенов» (артефакт: 68% разрыва — кэшированный вход). ⚠ **Нарушения процедуры к сведению владельца:** $2.62 (52% пака) сожжено на нарушении заказанного контроля судей; потолки Ф1 и Ф2а пробиты без пинга; главный zh-замер на книге с узнаванием 4/5 вместо заказанного свежего среза; Ф2б $2.99 НЕ потрачена — армы C/E не куплены при живых деньгах. **Все zh-числа ПРЕДВАРИТЕЛЬНЫЕ до неконтаминированного среза.**
**ЭКСП-21 «ТОПОЛОГИЯ РОЛЕЙ»: замер закончен ПЯТОЙ редакцией, отчёт `docs/experiments/21-role-topology.md`.** Пак целиком по факту диска **$4.92166**, из них **$0.18830 оплачено за ПУСТОЙ выход** (18 вызовов: 12 фильтр контента, 6 `length`; крупнейшие — по $0.076 у `glm-5.2` на скрине); успешные $4.86187; ⚠ прежние «$0.19191, 43 вызова» неверны: счётчик смотрел только поле `content`, а проба контаминации пишет в `answer` — её 25 записей содержательны; судейство четвёртой и пятой редакций — **$0** (агенты сессии вместо платных судей, амендмент владельца 07.08). Числа сверяются `eval/role_topology/verify_report.py` — 63 проверки, проходит. ⚠ Свип приёмки 07.08: 4 проверки НЕ СПОСОБНЫ были покраснеть, 18 слепы к префиксу числа, §14 не покрывался вовсе; починено классом (`num_in`, точное вхождение), проверено сломом. Читать гейт как «грубые расхождения отсекаются», а не «числа сверены». Риг пятой редакции зафризен `6d79dfb` ДО выпуска пачки.
**Инструмент сменён по находке, а не по вкусу.** Четыре независимых агента-судьи, получив ПАРНЫЕ пакеты с зеркальной раскладкой, все четыре свернули их обратно: оценили каждый уникальный текст ОДИН раз против исходника и разнесли числа. Оснастка переписана под это (`absjudge.py`): абсолютная шкала, позиции не существует как измерения, 138 прочтений вместо 320, семь контрастов вместо четырёх. ⚠ Требование ригов «зеркальная раскладка/оба порядка» (промт стр.59) писалось под ПЛАТНОГО судью и на агента не переносится — правка требований подлежит ратификации оркестратором.
**ЧТО УСТАНОВЛЕНО ТВЁРДО** (Холм по объявленному семейству из 7, ноль вылетов leave-one-out, воспроизведено ДВУМЯ независимыми проходами по 16 судей каждый): второй проход поверх черновика покупает качество — `A/F3` +2.50 [+1.56, +3.47] Holm 0.0004 и `B/F3` +2.44 [+1.81, +3.19] Holm 0.0002 (⚠ не независимо: делят опорный арм F3, прямое `A` против `B` даёт +0.06 p=0.95); ⚠ эффект держится на ОДНОЙ оси — без ЯЗЫКА `A/F3` падает до +0.75 Holm 0.407 · однопроходка С МАНДАТОМ перевёрстки проигрывает связке крупно, `D/A` 3.31 [4.47, 2.16] Holm 0.0014 (вклад делится: ЯЗЫК 1.34, ФОРМА 1.09).
**ЧТО НЕ УСТАНОВЛЕНО:** ⚠ **однопроходка без мандата против связки порога НЕ проходит**`D_/A` 2.00 [3.34, 0.62], Holm 0.063. Направление воспроизвелось в обоих проходах, интервал ноль не накрывает, но формально утверждение не доказано; прежний заголовок «связка бьёт однопроходку» снят. Так же не проходят: мандат перевёрстки `D/D_` 1.31 Holm 0.109 · закон-блок `A_law/A` 0.75 · выбор движка `A_law/B` 0.69. ⚠ «Не обнаружено» ≠ «нет»: различимый эффект оснастки ≈2 ошибки.
**ГЛАВНЫЙ МЕТОДИЧЕСКИЙ РЕЗУЛЬТАТ ПАКА — шум разложен: компоненты СОПОСТАВИМЫ.** Пол (две генерации одного арма, ОДИН судья, уровень сокращается точно) var 7.98 = 2σ²ген+2σ²судья; кросс-проход (один и тот же текст, два судьи, уровень снят центрированием) var 4.07 = 2σ²судья (с поправкой на степени свободы) ⇒ ⚠ **разложение шума НЕ УСТАНОВЛЕНО:** три способа счёта из тех же данных дают «генерация больше» (1.48/1.34), «поровну» (1.43/1.40) и «судья больше» (корреляция пола между проходами r=0.30 ⇒ 0.65), и ни один не отличим от остальных при n=16. Считать оценкой порядка величины; ⚠ какая больше, НЕ установлено: бутстрап даёт отношение 1.08 с ДИ [0.58, 1.44], P(генерация больше)=0.64. Судейская компонента подтверждена ПРЯМЫМ повтор-тестом (те же задания побайтно, новые судьи, σ 1.29, r=0.707); рандомизация раскладки стоит 0.08 sd, то есть бесплатна. Планирование: ×2 судьи дают SE 0.706→0.622 за $0, ×2 единицы — 0.706→0.500 за ≈$0.48. ⚠ Число исправлялось ДВАЖДЫ по адверсариальному ревью: «шум в генерации» опиралось на совпадение двух sd (совпадение дисперсию не раскладывает), «шум в судье, 73%» считалось на СЫРОЙ кросс-разности, куда входит разница уровней строгости, которой в поле нет. Свод и разложение считаются `absjudge.py --pool`, в дереве (прежде считались вне его).
**ЭКОНОМИКА — РАЗМЕН, не доминирование.** Парно связка ДОРОЖЕ однопроходки на +0.00096/единицу, 11 из 16 (≈+20%), ⚠ но как УСТАНОВЛЕННЫЙ факт не держится: собственный точный тест даёт p=0.061, интервал накрывает ноль при удалении любой из 9 единиц. ✔ По ТОКЕНАМ жёстче: +7601 (+114%), 16 из 16, p<0.0001 долларовая разница есть артефакт прайс-листа. Прежнее «связка дешевле на 6 сравнивало медианы маргиналов и переворачивалось при парном счёте. Жилец роли редактора `deepseek-v4-pro`, обоснование ЦЕНОЙ: полная связка $0.00580 против $0.01025 у `glm-5` (парные средние), не качеством.
**⚠ ДЕТЕРМИНИРОВАННЫЙ КОНТУР ВЫВОД НЕ ПОДПИРАЕТ.** Батарея, пересчитанная на ТЕХ ЖЕ текстах, что судились, даёт другой порядок: `D` (худший по судье) — лучший по правилам. Расхождение локализовано в слипании абзацев, которого не проверяет ни одно правило. Контуры смотрят в разные части оси ФОРМА.
**ЧЕТЫРЕ АДВЕРСАРИАЛЬНЫХ РЕВЮ, находки приняты без спора.** Сняты клеймы: «позиция исчезла по построению» (наклон +0.147 на шаг метки, измерен и поправлен) · «слипание у редактора не штрафуется» (штрафуется, 6 единиц из 16) · «связка дешевле» · «шум в генерации» · «ФОРМА конфаундом быть перестала» (размен внутри оси остался, лишь сошёлся в ноль). Починены исполнением: касса не видела оплачиваемых ею тегов `bo4-*` ($0.29309 мимо потолка) · гард пропускал `python -c` из каталога зоны · разбор ответов утаскивал соседнюю строку при пустом поле · контроль пола мерил разницу черновиков · приёмка требовала меньше, чем обещано судье.
**ОСТАЛОСЬ НЕЗАКРЫТЫМ — требует владельца:** слепое чтение ВЛАДЕЛЬЦА (единственный контур вне семейства сессии; агентские читатели семейно зависимы) · армы **C/E/G** заказа не построены (точечный ремонт, обратная связка, маршрутизация; `route_arm.py` в текущем виде не запускается) · дрейф на связном отрезке 810 глав · пара en под абсолютным ригом · арбитр вне семейства (нужны кредиты xAI). ⚠ **Потолки ФАЗ промта пробиты:** Ф1 $1.07473 против $1.00, Ф2а $3.887 против $2.50; верификатор сверяет отчёт с сырьём, но потолки промта НЕ сверяет.
**ВТОРАЯ ПАРА en→ru** (Kristoff, контаминация 1/5 против 4/5 у основного материала) заведена сверх промта по слову владельца 07.08. Пар-специфика боевого промта редактора измерена — **4 места из 42 строк**; пар-пакет `eval/role_topology/prompts/en-ru/` заведён правкой только их ⇒ новая пара стоит ~4 клауз в данных, правки Go не требует.
**⚠ ВНЕШНИЙ БЛОКЕР ВЛАДЕЛЬЦУ: кредиты xAI исчерпаны** (HTTP 403 на 250 голосах). Второй судья заменён на `gemini-3.1-flash-lite` через положительный контроль (декой 6/6 в обоих порядках). Grok нужен и как судья 18+ — по quirks единственный живой на эротике.
**Уточнение к quirks 00:** оговорка «на violence/SFW Gemini-судья жив» на вебновелле держится не целиком — 10 клеток пришли БЕЗ объекта сообщения с `finish_reason: content_filter: PROHIBITED_CONTENT`. Google непригоден как ЕДИНСТВЕННЫЙ второй контур на этом материале.
**Эхо-мина черновика измерена как частота:** 5 ре-генов на 16 единиц zh (31% против документированных 15%), 0 на 12 единицах en.
**Открыто:** дрейф на связном отрезке · армы C/E/G не гнались · банкнота как канал не замерена · разброс судьи-замены на повторе не измерен · чистый контраст мандата (у D_ своя вёрсточная строка, у D блок из 4 правил, промт ×1.92) · слепое чтение владельца · цена черновика, который реально правят армы.
Не коммичу, кроме пре-рег-фриза; отчёт 21, харнесс `eval/role_topology/` и этот пинг — на лендинг оркестратору.
**Поправки приёмки №15 (D39.108) к пингам ниже — шапки отчётов первичны:** verify_report = 20 проверок, не 19 · «вся сессия $2.1793» включала $0.107335 сырья research/24 — фактически 18+19+20 = $2.0720 · решающий замер §5.2 не персистирован («со слов»; направление держит §5.3) · цена раунда починки не входила в дифф (lu/ON 0.89→1.08) · offblock-числа сняты до-фризовым стемом.
**ЭКСП-20 «РОЛЬ РЕДАКТОРА»: прогнан, отчёт `docs/experiments/20-editor-role.md`, $1.2285 из потолка $2.00 (поднимался дважды, оба раза объявлено ДО прогона).** 7 контрактов × до 5 моделей × 2 целевых языка + арм починки + три раунда слепого судейства. Числа отчёта сверяются с сырьём командой: `eval/editor_harness/verify_report.py` (19 проверок, проходит).