146 KiB
22. Панель жильцов: кто занимает роль черновика и роль редактора
Полигон-сессия, 08.08.2026. Исполнение docs/POLYGON_TENANT_PANEL_SESSION_PROMPT.md
(санкция владельца 08.08, D39.117). Зона: eval/tenant_panel/ + точечные починки
eval/role_topology/ + этот файл + пинг в PROGRESS «Полигон».
⚠⚠ РЕВЬЮ-ШАПКА ПРИЁМКИ (оркестратор №16, 10.08) — шапка первична над телом. Приёмка исполнена: все несущие числа пака подтверждены независимым пересчётом мимо харнесса (11 агентов, 105 проверок по обоим пакам; деньги до цента, провенанс до секунд, leave-one-out по судейским сессиям устойчив). Выводы НЕ ратифицированы: владелец 10.08 признал постановку эксп-22/23 неполной (en-ось недомощна по построению · сильный тир не закрыт без gemini · ставка владельца на edit-контур не мерилась · en-промпты пар не выверены) — ратификация заморожена до фазы Д (
docs/POLYGON_EXP2223_REDO_SESSION_PROMPT.md), чек-лист поправок тела — её §Д8. Крупнейшая поправка: интерпретация §15 ОПРОВЕРГНУТА — 5 из 6 «молчаливо коротких» клеток суть эхо-первые-попытки, пойманные гейтом (судились здоровые ре-гены, доказано подписями sig в ключах); реально коротка одна E2finish=length. Решения владельца, известные со слов сессии (потолки · санкции · куки · кредиты xAI · мандаты), подтверждены его словом 10.08; Sol-инцидент и нормы рига идут в D-ноту при ратификации.
СТАТУС: замер закончен, приёмка пройдена. Потрачено $3.409743 при пакетном потолке $6.50. Все числа ниже пере-считываются
eval/tenant_panel/itog22.pyиз персистированного сырья и сторожатсяeval/tenant_panel/verify22.py(85 проверок); ненулевой код возврата = отчёт не сдаётся.⚠ Что гейт НЕ проверяет: он сторожит, что число ПРИСУТСТВУЕТ в тексте, а не что предложение вокруг числа истинно. Приёмка нашла ровно этот класс — «все перевесы выше порога 2.47» при всех сходящихся числах (§2). Пороговые и сравнительные утверждения проверяются только чтением.
Приёмка (08.08): три независимых прохода — снизу вверх (заказ → код → результаты, ИТОГ закрыт до последней ступени), сверху вниз (утверждение → число → сырьё → код → посылка, с независимым пере-счётом контрастов мимо харнесса) и охота за дефектами ВНЕ карты отчёта по шести анти-паттернам приёмки. Блокеров нет ни у одного, перепрогон не требуется. Всё найденное отработано $0-раундом без покупок; крупнейшее — ось (а) заказа была отсуждена и не напечатана (§1), позиционная поправка не была вычтена (§7), граница двойной оплаты не выводилась из артефактов (§8). Правки внесены в тело, не в историю.
ИТОГ — ВХОД ДЛЯ РЕШЕНИЯ ВЛАДЕЛЬЦА
Материал впервые чист. 《阴阳天帝诀》, 首发 2026-07-13, 16 единиц из 16 разных глав; проба контаминации 0/5 узнавания и 0/5 клоуза на ДВУХ моделях при живом положительном контроле (金瓶梅 4/5 и 5/5). Величины эксп-21 стояли на книге, узнанной 4/5; эти — нет.
1. ЖИЛЕЦ ЧЕРНОВОЙ РОЛИ: менять не на что — рекомендация deepseek-v4-flash
Шесть жильцов на 16 zh + 6 en единицах, финал каждого доведён боевым редактором. Ни один альтернативный черновик не улучшил финал; все пять перевесов отрицательны, ни один не проходит Холма, и все, кроме одного, лежат ниже порога различимости 2.03:
⚠ Оговорка фазы Д: «кроме одного» (это E2) держится не крепко — в собственном арме E2
стоит клетка с finish=length, и на подвыборке без затронутых обрывом единиц он тоже ниже порога
(§15). Вывод секции от этого не меняется: ни один альтернативный черновик финал не улучшил.
E1 luna −0.44 · E2 dspro −2.56 · E3 gemini-fl −1.87 · E4 glm-4.7 −1.25 · E5 grok −1.69
⇒ Правило ничьей D39.117 применяется как ратифицировано: рекомендация = самый дешёвый жилец.
Им и остаётся deepseek-v4-flash ($0.00130/ед против $0.00368–0.00993 у прочих).
Черновик КАК ТЕКСТ — ось (а) заказа, до редактора (описательная: пре-рег Ф2 сузил решающее семейство до финалов, поэтому поправку она не несёт; знак «+» = черновик жильца лучше якорного):
D1 luna +0.12 · D2 dspro +1.81 · D3 gemini-fl +0.87 · D4 glm-4.7 −5.44 · D5 grok −0.44
Точная форма вердикта такова: выше порога различимости 2.03 якорный черновик не проигрывает
никому — лучший из соперников, deepseek-v4-pro, опережает его на +1.81, то есть внутри шума.
Ниже порога он проигрывает троим из пяти, и это надо читать как «не установлено», а не как
«ничья по существу». Зато в обратную сторону разрыв реален: черновик glm-4.7 хуже якорного на
−5.44 — больше любого перевеса в решающих таблицах Ф2 и Ф3.
⚠ И этот же −5.44 бьёт по посылке, выданной промтом. Промт исходил из эксп-21 §16.2, что черновик двигает ~70% качества финала. Здесь черновик, отстающий на −5.44, даёт финал, отстающий всего на −1.25 (E4): редактор съедает четыре пятых разрыва. Панель редакторов при этом разошлась ШИРЕ (от −2.12 до −4.75), чем панель черновиков (от −0.44 до −2.56). На этом материале доля черновика в качестве финала не 70%, а заметно меньше доли редактора — посылка не подтвердилась, и это вход для решения владельца, а не сноска.
2. ЖИЛЕЦ РЕДАКТОРСКОЙ РОЛИ: роль впервые РАЗДЕЛИЛАСЬ — deepseek-v4-pro побеждает значимо
Поверх ПОБАЙТНО одной якорной базы, семейство из четырёх, Холм по четырём:
R2 glm-5 −2.12 [−3.81, −0.75] Холм 0.0188 ✔
R3 deepseek-v4-flash −2.54 [−4.00, −1.00] Холм 0.0188 ✔
R4 grok-4.3 −4.75 [−6.12, −3.44] Холм 0.0001 ✔
R0 vs F (КОНТРОЛЬ) +4.44 [+3.00, +6.12] Холм 0.0002 ✔
Все три альтернативы значимо хуже боевого редактора. О пороге различимости — точно, потому что порогов в паке ДВА и они дают разный ответ для одного арма:
| порог | откуда | R2 −2.12 | R3 −2.54 | R4 −4.75 |
|---|---|---|---|---|
| 2.03 | пол Ф2; пред-объявлен для обеих фаз (§0-Ф3) | проходит на 0.09 | проходит | проходит |
| 2.47 | собственный пол прохода p3 (снят позже) | НЕ проходит | проходит | проходит |
По зафризенному критерию glm-5 проходит — но запасом 0.09 при поле, чья оценка сама шумная.
Честная форма: R3 и R4 хуже боевого при любом пороге; R2 — пограничный.
Эксп-21 на паре {dspro, glm-5} писал «движки неразличимы» (−0.69, ноль внутри интервала); здесь знак тот же, что и у эксп-21, но величина выросла до −2.12 и Холм пройден. ⇒ Резерв D39.22 не опровергнут и не подтверждён: единственный контраст, который его касается, — ровно тот, что стоит на границе. Формулировка «требует пере-рассмотрения» была бы сильнее данных; правильный статус — под вопросом, решать не на этом замере.
3. ВТОРОЙ ПРОХОД ПОДТВЕРЖДЁН ДВАЖДЫ И УСИЛИЛСЯ
Контроль «редактор поверх черновика» прошёл поправку в ОБЕИХ фазах на разных панелях: +3.25 (Ф2, [+2.25, +4.19], Холм 0.0007) и +4.44 (Ф3, [+3.00, +6.12], Холм 0.0002). У эксп-21 на контаминированной книге было +2.50 / +2.81. Топология подтверждена на материале, которого модель не видела.
4. ⚠ НА ПАРЕ en ВЫВОД НЕ ПЕРЕНОСИТСЯ — контроль равен НУЛЮ
E0 vs D0 на английском исходнике = +0.00 [−2.50, +2.33]: боевой редактор поверх якорного
черновика не покупает НИЧЕГО, а финалы поверх других черновиков скорее лучше (+0.17…+2.17).
⚠ «Ни один контраст не проходит поправку» на en — свойство ДИЗАЙНА, а не данных, и как довод не годится. При n=6 минимально достижимое p точного знакового теста = 2⁻⁵ = 0.03125; после Холма по шести контрастам это 0.1875 > 0.05. То есть en-ветка не могла дать значимость ни при каком результате — её мощности не хватало по построению, и объявлять её отрицательный итог «замером» было бы подгонкой под удобный вывод. Несущее здесь — не «незначимо», а точечная оценка контроля ровно ноль при zh-контроле +3.25, причём интервал [−2.50, +2.33] исключает лишь эффект ≥+2.5: эффект величиной ~+2 на en этими данными НЕ исключён.
⇒ Выбор жильцов — решение ПАРЫ zh→ru. На другую пару его переносить нельзя; но и утверждать, что на en связка не работает, этот замер не даёт права — он даёт право сказать, что перенос не показан, и что en-ветку надо мерить отдельным паком с достаточным n.
5. ЦЕНА СВЯЗКИ И ПРОЕКЦИЯ НА КНИГУ (1500 единиц, $/ед из usage), p50 И p95
Промт заказал оба квантиля по единицам. p95 при n=16 — это максимум по выборке (ближайший ранг), и он важнее медианы для потолков: платить придётся по хвосту, а не по середине.
жилец связка p50 связка p95 книга p50 книга p95
gemini-3.1-flash-lite 0.00881 0.01886 $13.21 $28.30
deepseek-v4-flash 0.00897 0.01675 $13.45 $25.13
gpt-5.6-luna 0.00921 0.02006 $13.81 $30.10
glm-4.7 0.01271 0.02116 $19.06 $31.73
deepseek-v4-pro 0.01321 0.02238 $19.81 $33.56
grok-4.3 0.01536 0.02516 $23.04 $37.75
Против БОЕВОЙ ПАРЫ, как заказано промтом: боевая пара — это deepseek-v4-flash (черновик) +
deepseek-v4-pro (редактор), то есть первая строка с ценой $0.00897/ед → $13.45 за книгу по
медиане и $25.13 по p95. Ни один соперник её не удешевляет: ближайший, gemini-3.1-flash-lite,
дешевле на 1.8% по медиане ($13.21) и дороже на 12.6% по хвосту ($28.30). ⇒ По цене менять
жильца не на что — как и по судье.
⚠ Хвост почти вдвое выше медианы у всех шести (p95/p50 = 1.7–2.2×), и по хвосту порядок
жильцов меняется: рекомендованный deepseek-v4-flash по медиане второй, а по p95 — самый
дешёвый. Потолки на книгу надо ставить по p95, иначе каждая длинная глава будет пробивать смету.
⚠ DeepSeek объявил на прайс-странице 08.08 повышение цен («significant increase expected») —
проекция едет с этой оговоркой и подлежит пере-счёту при смене прайса.
6. ⛔ ОБЯЗАТЕЛЬНЫЙ КАНДИДАТ ПРОМТА НЕ ОТРАБОТАЛ НА ПРОВОДЕ
gemini-3.1-pro-preview: в скрине четыре отказа HTTP 503 — две редакторские клетки и две
переводческие; переводческие взялись с ретрая, редакторские не взялись вовсе, поэтому
редакторской цены у модели нет, а скрин-вердикт ПРОВАЛ вынесен по переводческой ($0.14282 против
порога $0.02). В Ф3 — 1 клетка из 16, один вызов держал замок 74.5 минуты без ответа и без
ошибки. Цена состоявшейся клетки $0.14702 при 11 504 тарифицируемых выходных токенах на 2 532
видимых: тарифицируется в 4.5 раза больше, чем видно, то есть скрытая часть — 8 972 токена,
втрое больше самого ответа; видно это только в total_tokens. ⇒ Гипотеза эксп-04 «gemini-pro —
аутлаер прозы» НЕ проверена и остаётся открытой — по операбельности, а не по качеству.
7. ЧТО ЕЩЁ ИЗМЕРЕНО (детерминированно, судьи не требует)
- Эхо-мина — свойство МАТЕРИАЛА:
deepseek-v4-flashдал 6% ре-генов (1/16) против 31–38% на 蛊真人;gemini-3.1-flash-lite— 12% и одна единица не покупается вовсе (эхо 3/3 попыток). Гипотеза 5.3 эксп-21 подтверждена вторым замером. - Редактор чистит письменность и теряет канон. Утечка ханьцзы в черновиках luna 75 и glm-4.7 53 → после редактора 2 и 0. Но покрытие канона падает у ВСЕХ шести жильцов (−0.027…−0.057) несмотря на закон-блок; у победителя Ф3 оно худшее в панели (0.882 против 0.933 у glm-5 и 0.909 у самого черновика).
deepseek-v4-flashв роли редактора однажды вернул черновик побайтно без правок (1 клетка из 62) — класс «no-op редактора».- ⚠
deepseek-v4-flashв роли редактора Ф3 сжёг бюджет вхолостую на 3 клетках из 16. Ровно 16 000 из 16 000 выходных токенов ушли в размышление,contentпуст, заплачено $0.01529. Это ровно класс Г6, которым пак дисквалифицировалkimi-k2.6, — и он воспроизвёлся на модели, ПРОШЕДШЕЙ скрин, только в другой роли. ОтсюдаR3 n=13: контраст −2.54 посчитан по 13 удачным клеткам, то есть по благоприятному для дешёвого редактора подмножеству (вывод от этого не падает — он и так против дешёвого, — но читателю это сказано явно). Провод-факт для quirks: дешёвый режим DeepSeek в РЕДАКТОРСКОЙ роли уходит в отказ по исчерпанию бюджета размышления, чего в переводческой роли на тех же единицах не случилось ни разу. - Довесок
D_/Aна сырье эксп-21: −1.56 [−2.88, −0.25], p=0.0526 — и это число до позиционной поправки. Промт требует наклон замерить и вычесть; замерено по всем четырём проходам:p2zh+0.078,p2en+0.037,p3−0.005 — ничтожны, ни один вердикт не двигают. А вdvaнаклон +0.469 ошибки на шаг метки, и поправка даёт −1.65, p=0.0356, то есть переводит контраст через 0.05. ⚠ Вердикт я на этом НЕ меняю. Наклон вdvaснят на трёх метках (n=48) — оценка хрупкая, а решение, зависящее от того, снята поправка или нет, по определению не устойчиво. Честный статус контраста «однопроходка против связки»: знак воспроизведён третьим независимым замером (−1.56 сырой, −1.65 с поправкой), значимость — на самой границе и от способа счёта зависит. «НЕ УСТАНОВЛЕНО» остаётся, но теперь с указанием, что оно держится на границе, а не с запасом.
8. ДЕНЬГИ И ДИСЦИПЛИНА
Ф0 $0.008153 / $0.40 Ф2 $1.681912 / $2.00
Ф1 $1.087758 / $1.05 ⛔ ПРОБОЙ Ф3 $0.631920 / $3.00
ПАК $3.409743 / $6.50
⛔ Потолок Ф1 пробит на $0.0378. Против поднятого потолка $1.05 это 3.6%, против исходного
потолка промта $1.00 — 8.8%; вторая цифра честнее как мера промаха планирования. Механизм:
проекционный гард брал p95 УЖЕ купленных вызовов, а gemini-3.1-pro-preview оказался в семь раз
дороже любого предшественника. Починено (ожидание считается по ЭТОЙ модели из прайса), заведена
регрессия. Потолки Ф1 ($1.00→$1.05), Ф3 ($1.60→$3.00) и пакетный ($5.00→$6.50) подняты словом
владельца 08.08, объявлено ДО трат (пункты 1–2 §9 — до подтверждения не ратифицированы).
⚠ Подъём потолков Ф3 и пака НЕ ПОНАДОБИЛСЯ. Основанием была смета Ф3 $2.91, из которых $2.43
на gemini-3.1-pro-preview; модель отдала одну клетку, и Ф3 стоила $0.631920 — внутри
ИСХОДНОГО потолка $1.60, а пак $3.409743 — внутри исходных $5.00. Дисциплина ниже печатается
против поднятых границ, но мерить себя надо по тем, что были до просьбы: по ним пак чист везде,
кроме Ф1.
⚠ Неопределённость расхода Ф2 — граница пере-считана и она ХУЖЕ прежде объявленной. Часть стадии шла двумя наборами параллельных процессов, а проверка «файла ещё нет» была неатомарной: клетка могла быть куплена дважды, и вторая оплата в леджер не попадает (на диске одна запись). Прежде здесь стояло «≤66 клеток × $0.005 ≈ $0.33» — это число из артефактов не выводится (откуда 66 — нигде не записано, а $0.005 ниже фактической цены 124 клеток Ф2), и я его снимаю. Выводимая из сырья граница одна: атомарный замок заведён в 20:43:25, до него куплено 176 клеток Ф2 на $0.846103, и в худшем случае каждая из них оплачена дважды.
⇒ Верхняя граница невозвратной пере-оплаты: ≤$0.846103. Если бы она реализовалась целиком, Ф2 стоила бы $2.53 и пробила бы свой потолок $2.00 — то есть чистота Ф2 в таблице выше верна для записанного расхода и НЕ доказана для фактического. Реальная величина почти наверняка много меньше (гонка бьёт лишь когда два воркера берут одну и ту же клетку в одну и ту же секунду), но величины этой не существует ни в каком артефакте, и подменять границу правдоподобной оценкой — ровно то, чего гейт обязан не допускать. Класс закрыт атомарным замком; проверить фактическое можно только по счетам провайдеров.
⚠ Оплачено за ПУСТОЙ выход: 7 вызовов на $0.21726 — 6.4% пака. Три клетки kimi-k2.6 в
скрине, три редакторские клетки deepseek-v4-flash в Ф3 (§7) и один черновик. Это не накладные
расходы, а прямая потеря на отказном режиме размышления.
⚠ Ф2 стоила $1.681912 против собственной сметы $1.4533 (+15.7%). В потолок влезла, поэтому согласия не требовалось, но расхождение сметы с фактом — тот же класс, что и сверка прогнозов, и молчать о нём нельзя. Источник — ре-гены эхо-мины и повторные клетки, которых смета не закладывала.
Агент-запусков: 40 из 60. Из них 6 списаны на аннулированный проход en (см. §12).
§16 ВНЕШНИЙ СУДЬЯ SOL — ПАКЕТ (а) ОТСУЖЕН, АРБИТРАЖ НЕ СОСТОЯЛСЯ
20 пакетов, обе половины каждой зеркальной пары, прогнаны владельцем 09.08 двумя сессиями. Границы задания Sol не нарушал, формат выдержал везде.
Что уцелело. ДЕКОЙ пойман 2/2 в обоих порядках: модель другой семьи независимо отличает подсаженную деградацию от чистого текста на этом материале. Позиционное смещение замерено и велико — первый предъявленный вариант получает в среднем на 4.61 ошибки меньше, причём стабильно в обоих заходах (−5.00 и −4.22). Это внешнее подтверждение того, что позиционный контроль в абсолютном риге не формальность.
Почему арбитраж не состоялся — три причины, все на стороне замысла, не Sol.
- Недомощность по построению.
N_UNITS = 3: три единицы на контраст. Расхождение платных судей, ради которого пакет существует (luna +0.84 против gemini +3.03), тремя точками не разводится ни при какой калибровке. Константа стояла в коде до того, как пакеты ушли владельцу. - Дрейф абсолютной шкалы между сессиями ×2.6. Медиана ошибок на вариант: заход 1 — 23.5 (разброс 5–44), заход 2 — 9.0 (2–21). Один и тот же текст получает 43 ошибки в первом заходе и 6 во втором.
- Зеркальные пары разведены по разным сессиям — решение полигона, принятое чтобы Sol не узнал тексты со второго раза. Из-за этого усреднение двух порядков, которое должно снимать позиционное смещение, складывало число из одной шкалы с числом из другой: знак совпал лишь в 3 парах из 9. Напечатанные ригом «Sol: −7.50 / −5.33 / +1.33» этим и порождены; как третье мнение рядом с luna и gemini их подавать нельзя, и здесь они не подаются.
Сравнение со своим ригом — в пользу структуры, а не судей. Мои судьи дрейфуют почти так же: медианы 8 сессий эксп-23 — от 4.5 до 9.0, отношение 2.0×. Разница в том, что в абсолютном риге все армы единицы судятся В ОДНОМ контексте, поэтому множитель шкалы стоит в обоих слагаемых перевеса и из разности уходит; у Sol разность считалась между двумя головами. ⇒ Требование «все армы единицы — в одном пакете одной сессии» переходит из удобства в норму рига.
Чинится не промтом. Нужен якорь шкалы внутри КАЖДОГО пакета (откалиброванный фрагмент с
известным числом ошибок) плюс достаточное n. Это новый пак по заказу владельца, а не пере-запуск:
пакет (б) в нынешнем виде (N_UNITS_B = 3) ляжет в ту же яму и не выпускается.
Диагноз подтверждён исполнением на соседнем паке. Тому же внешнему судье отдали задания эксп-23 — не пакеты этой конструкции, а обычные файлы абсолютного рига, где все армы единицы лежат в ОДНОМ задании. Результат: 32 из 32 приняты, декой пойман 32/32, вердикт совпал с моими судьями (эксп-23 §12в). ⇒ Дефект был не в судье и не в канале, а в конструкции пакета: разнесение зеркальных пар по сессиям. Требование «все армы единицы — в одном задании» подтверждено с двух сторон: нарушив его, замер разваливается; соблюдя — работает на том же судье.
Строка 150 бэклога: пакет (а) исполнен и дал отрицательный результат по своей задаче; пакет (б) НЕ запускать — вместо него внешний контур строить на заданиях абсолютного рига, как в эксп-23.
9. CONFIRM/DENY ВЛАДЕЛЬЦУ (известно только со слов сессии, до подтверждения не ратифицируется)
⚠ Пункты 9–11 добавлены 09.08 по итогам аудита закрытия заказа — того, что искал обязательства, закрытые артефактом вместо действия. Пункт 7 в том же аудите переписан: он скрывал суть.
-
Подъём потолка Ф1 до $1.05 (08.08). Пробой случился всё равно: $1.087758.
-
Подъём потолков Ф3 до $3.00 и пакетного до $6.50 (08.08), с отклонением варианта «gemini-pro на подмножестве единиц». ⚠ Сессия применила отклонённый вариант.
editors.pyограничивает медленную модель восемью единицами (SLOW_UNITS = 8), то есть ровно подмножеством, от которого владелец отказался в пользу подъёма потолка. Практического следа это не оставило — модель отдала 1 клетку из-за провода, а не из-за лимита, — но решение было моё, а не владельца, и подаваться как согласованное оно не должно. -
Разрешение на удаление вложенности
~/books/books/и перенос сырья наверх (08.08). На тех же симлинках стоит воспроизводимость эксп-21. -
Использование живой сессии владельца (куки) для доступа к площадке при сборе среза. Мера была предложена самим владельцем, но санкция на неё известна только со слов сессии, и у неё есть ToS-сторона, которую подтверждать владельцу.
-
Гейт прав снял две главы (верхний дециль эротических маркеров) ДО отбора единиц. Это решение сессии по договорам провайдеров, и оно сужает продуктовый класс материала — см. §11.
-
Кредиты xAI. Промт фиксировал их исчерпанными 07.08 с пометкой «вопрос у владельца»;
grok-4.3в паке скринился и покупался во всех фазах, то есть пополнение состоялось. Подтвердить, что оно было осознанным. -
Sol ВЕРНУЛСЯ 09.08 — и для арбитража оказался непригоден; отдельно: его не просили сутки. Владелец прогнал все 20 пакетов (а) двумя сессиями. Результат по существу — в §16. Прежняя редакция этого пункта («выпущен и не вернулся») скрывала главное: пакеты пролежали в
~/books/tenant-panel/sol*/сутки, каталогиanswers/пусты, а просьба владельцу прозвучала только 09.08, после его прямого вопроса «где я это должен был запустить». Промт (стр.33) требовал отдать paste-ready пакеты ему в руки; сессия сочла обязательство закрытым по факту генерации файлов. ⚠ Поправка фазы Д (найдена приёмкой другого модельного семейства): фраза «без Sol у обоих паков нет ни одного контура вне одной семьи» здесь стояла и была неверна — она против §12в эксп-23, где подпись судьи вне Claude по проходуborderнапечатана числами. Верно так: контур ПОСТРОЕН и работает, но на заданиях абсолютного рига и по контрастам ЧУЖОГО пака; контрасты ЭТОГО пака внешней подписи не имеют (§11). -
Оплаченная en-ось шла БЕЗ обязательного банк-закона (D39.104, промт стр.30 и 55 — пункт ОБЯЗАТЕЛЕН, для таких «путь один: пинг»). 72 клетки куплены без блоков; причина не в сторожах кода, а в том, что банк среза собран только по zh (22 термина, все китайские), поэтому на en блок вышел бы пустым в любом случае. Отступление объявлено во фризе Ф2 ДО покупок, но пинга не было и выбор «собрать en-банк или принять ось описательной» владельцу до трат не выносился. ⚠ Сводная таблица §13а называет этот пункт «исполнено» — это неверно и правится: на оси en не исполнено. Решение владельца: собирать en-банк и пере-купить 72 клетки — или объявить ось описательной.
-
Пробой потолка Ф1 не остановил пак. $1.087758 против поднятого $1.05: промт (стр.5) требовал «не влезает → СТОП и пинг ДО покупок». Число названо владельцу в день пробоя и напечатано в отчёте со знаком ⛔, но СТОПа не было — следующая фаза зафризена и покупки пошли дальше. Вопрос: остаются ли $1.05 и пакетные $6.50 нормой в
money.py(их унаследовал пак 23) или откатываются к $1.00/$5.00 как мерилу дисциплины. -
Вахта dspro исполнена одним обращением и ПОСЛЕ покупок. Промт (стр.31) требовал сверку вендор-changelog дважды — в Ф0 и перед Ф3. Фактически: одно обращение к changelog DeepSeek после фризов Ф0/Ф3 и после покупок Ф3, снимок страницы не сохранён (в
prices/лежат только прайс-листы). Сам вывод «смены маппинга после фриза Ф2 не было» проверен и держится, условие «сменился → стоп и пинг» не наступало; неисполненной осталась ФОРМА вахты, а не её итог. -
Отказ гнать строку 153 (уравненный мандат
D/D_) и отказ от второй базы Ф3 — обе опции промта сняты решением сессии, не владельца.
⚠ Поправка фазы Д (чек-лист приёмки №16 п.10): нумерация этой секции была сломана. Ряд шёл 1–7, 9, 10, 11, 8 — пункт «отказ гнать строку 153» стоял под номером 8 ПОСЛЕ одиннадцатого, а пункта 8 в положенном месте не было вовсе. Причина видна по датам: пункты 9–11 дописаны 09.08 аудитом закрытия заказа и вставлены перед хвостом. Пункт пере-нумерован в 12 (текст не тронут), три ссылки в §13а и §14 на прежний номер поправлены на «§9 п.12».
9а. ⚠ ГЕЙТ ToS Z.AI — ГЕЙТ РЕШЕНИЯ ВЛАДЕЛЬЦА, НЕ ЗАМЕРА
Промт требует пометить это в ИТОГе, и вот пометка. Замер glm-5 и glm-4.7 легален — якорь
покупается, и все числа пака по ним получены правомерно. Но ПРОД-выбор жильца Z.AI — отдельный
гейт: маршрутизация по договорам провайдеров идёт ПРАВОМ, а не поведением модели, и класс
sexually-explicit для zai объявлен FORBIDDEN. Для книги с чувствительным содержимым это значит,
что glm-5/glm-4.7 нельзя ставить жильцом на такой материал, даже если замер их пропустит.
На выводы пака это не влияет ни в одну сторону: glm-4.7 в черновой роли и так не рекомендован,
а glm-5 в редакторской — пограничный (§2). Но если владелец будет выбирать жильца по цене или
по будущим замерам, гейт прав срабатывает РАНЬШЕ качества. Лейбл-вопросы — не задача полигона.
10. ДИСПОЗИЦИИ СТРОК БЭКЛОГА
- 55 (эмпирика на претрейн-классике предварительна) — ЗАКРЫТА. Неконтаминированный zh-срез добыт и замерен (0/5 на двух моделях при живом контроле); главные выводы топологии на нём воспроизвелись и усилились. Остаток строки исчерпан.
- 150 (Sol-арбитраж) — ПАКЕТ (а) ПРОГНАН ВЛАДЕЛЬЦЕМ 09.08, АРБИТРАЖ НЕ СОСТОЯЛСЯ; ПАКЕТ (б)
НЕ ЗАПУСКАТЬ. ⚠ Поправка фазы Д (п.3): прежняя редакция этой строки гласила «оба пакета
выпущены, ждут владельца» и обрывалась на середине фразы — статус устарел на день и противоречил
§16 того же отчёта.
(а) 20 файлов в
~/books/tenant-panel/sol/+ инструкция; контрастыA/F,B/F,A_law/Aотобраны по фактическому расхождению судей эксп-21. Прогнан владельцем двумя сессиями. Итог — §16: границы задания Sol не нарушал, декой поймал 2/2 в обоих порядках, позиционное смещение замерил (−4.61), но арбитраж развалился по КОНСТРУКЦИИ пакета (N_UNITS = 3, дрейф шкалы между сессиями ×2.6, зеркальные пары разнесены по разным сессиям — знак совпал в 3 парах из 9). (б) заказан промтом «по готовности Ф2/Ф3» — обе фазы готовы, поэтому был выпущен: 14 файлов в~/books/tenant-panel/sol-b/, слепые пары финалистов, оба порядка, декой, ключ отдельно. Контрасты:R0противR2(рекомендованный редактор против пограничного — на нём висит вопрос о Резерве D39.22) иE0противE2(крупнейший перевес Ф2). Единицы отобраны те, где внутрисемейный судья был увереннее всего. Семейный запрет соблюдён и проверяется кодом: клеток OpenAI-моделей в пакете нет (sol.py::_no_openai). Владельцу НЕ отдавать в этом виде: та же конструкция и тот жеN_UNITS_B = 3уложат его в ту же яму. ⇒ Рабочая замена найдена и проверена на соседнем паке: внешний контур строится на заданиях АБСОЛЮТНОГО РИГА, где все армы единицы лежат в одном задании. Так эксп-23 получил подпись судьи вне Claude по проходуborder— 32 из 32 приняты, декой 32/32, вердикт совпал (эксп-23 §12в). Контрасты ЭТОГО пака внешней подписи по-прежнему не имеют. - 153 (чистый контраст мандата
D/D_) — НЕ ГНАЛСЯ. Опция промта; бюджет ушёл в обязательные части, а уравненные промты требуют отдельного пре-рега. Остаётся открытой. - 151 (отказной режим связки) — УСИЛЕНА: на новом материале воспроизведён случай, когда
годного черновика нет ВОВСЕ (
gemini-3.1-flash-lite, эхо 3/3 попыток на одной единице). - 152 (слипание абзацев — слепое пятно детерминированного контура) — УСИЛЕНА: судья и батарея дали РАЗНЫЙ порядок армов в Ф3 (победитель по судье имеет худшее покрытие канона).
11. ЧТО НЕ ПЕРЕНОСИМО И ПОЧЕМУ
- Величины на пару en — контроль редактора там ноль (§4).
- Величины на другую книгу — эхо-мина изменилась с 38% до 6% при смене материала; всё, что зависит от свойств текста, обязано пере-меряться.
- Вывод про
gemini-3.1-pro— его нет; есть вывод про провод. - Абсолютные уровни между проходами — пороги строгости судейских популяций различаются; сравнивать можно только внутриединичные разности внутри одного прохода.
- ⚠ ВСЕ судейские числа пака сняты ОДНОЙ модельной семьёй. Сорок судейских сессий — это сорок
независимых контекстов одной и той же модели, а не независимые популяции. Проход
dvaназван в теле «третьей независимой судейской популяцией» — независимы там СЕССИИ, семья одна. Структурная защита от «судья тянет за своих» в паке есть и она сработала: в ростере (roster.py) нет ни одной модели семьи судьи, то есть подсудимых своей семьи у него нет. Но защиты от общего для семьи ПРЕДПОЧТЕНИЯ (какая русская проза считается хорошей) нет никакой, а эксп-21 показал, что смена семьи судьи двигает контраст на 2.19 балла (D39.117 п.5б). Заголовочный вывод пака держится на согласии однородных судей. ⚠ Поправка фазы Д (п.3): здесь стояло «внешний контур — это Sol-пакет, и он НЕ ВЕРНУЛСЯ». Он вернулся 09.08 и оказался непригоден по конструкции пакета (§16), а рабочий внешний контур построен на заданиях абсолютного рига и покрывает ПРОХОД ЧУЖОГО ПАКА (эксп-23border), а не контрасты этого. ⇒ Все судейские величины ЭТОГО пака по-прежнему следует читать как «так их видит одна модельная семья», а не как «так есть» — но по причине «внешний судья наших контрастов не читал», а не «внешний судья не ответил». - ⚠ Ось отказов замерена на материале, из которого убран самый провокативный класс. Гейт прав снял две главы верхнего дециля эротических маркеров ДО отбора единиц (§0.2), после чего гейт Г3 «отказ на чувствительном фрагменте» не поймал никого. Это ожидаемо и ничего не говорит о том, как жильцы ведут себя на чувствительном материале, — а именно он и есть рабочий случай продукта (цель 1 канона владельца). Ноль отказов здесь — свойство выборки, не моделей.
§0 ПРЕ-РЕГ. Секция Ф0/Ф1 (зафризена до трат)
0.1 Вопрос и что НЕ мерится
Топология «дешёвый черновик → дорогой редактор-переписыватель» решена эксп-21 и здесь не
пере-меряется. Открыт вопрос ЖИЛЬЦОВ обеих ролей: черновиком за всю историю проекта была одна
модель (deepseek-v4-flash), а выбор редактора проверен на паре из двух движков.
Не мерится и не варьируется: банк как фактор (наличие/отсутствие — чужой слот, строки 5/36б); топология как таковая; контракт редактора (full-regen против диффов — строка 106).
«Правильного ответа» не существует: армы равноправны, движок по паре и по модели не ветвится
(§0.1 12-go-style-notes.md), поэтому любой исход — строки конфига, а не код.
0.2 Материал: невиданный zh-срез
Эксп-21 главный zh-замер сделал на 蛊真人, которую его же проба оценила как узнанную моделью 4/5 — наравне с положительным контролем. Промт эксп-22 заказывает срез повторно и жёстко.
Метод поиска (объявляется, потому что «нашёл в вебе» без метода не проверяем):
- Площадка отбиралась по механическому критерию — текст главы отдаётся сервером. Проверено
curl: 七猫 и 番茄 отдают JS-каркас без текста; 纵横中文网 (zongheng.com) отдаёт<div class="content">с полной главой. Пиратские агрегаторы не рассматривались. - Из блока новинок главной снято 17 книг; у каждой прочитано поле
首发时间— дату первой публикации печатает сама площадка на странице главы. - Отобрана книга с датой первой публикации в июле 2026 (то есть заведомо позже любого правдоподобного среза обучения) и жанром, совпадающим с продуктовым (东方玄幻 — то же семейство, что 蛊真人).
Книга среза: 《阴阳天帝诀》, 玄幻奇幻 / 东方玄幻, zongheng.com/detail/1569059,
首发时间 2026-07-13, на день замера 71 глава / 15万字, 393 суммарных клика.
Проверка непереведённости (метод и его границы объявляются вместе):
- поиск по названию (zh) и транслитерации — совпадений нет;
- поиск, ограниченный восемью ru/en-площадками переводов (
tl.rulate.ru,ranobelib.me,ranobes.com,ranobehub.org,novelupdates.com,ficbook.net,mlate.ru,bllate.org) — совпадений нет; - ⚠ прямой поиск в формах этих площадок механически НЕ подтверждён:
novelupdatesотдаёт 403,rulateигнорирует параметр запроса (отдаёт весь каталог, 83 555 переводов),ranobelibиranobes— SPA. Это объявленная граница проверки, а не подтверждение; - базовая ставка: 393 суммарных клика за 26 дней — вероятность существования перевода пренебрежима, но это аргумент, а не замер.
⚠ ГЕЙТ ПРАВ, объявлен ДО отбора единиц. Срез — взрослая вебновелла: слой насилия плотный (это
рабочий случай продукта, его меряли все прежние паки), но у ДВУХ якорных провайдеров панели лейбл
sexually-explicit в договоре стоит FORBIDDEN (quirks 00, таблица прав: deepseek ToU §3.4(5);
zai п. g) «Submitting … sexually explicit»). Поэтому из пула единиц сняты две главы с наибольшей
плотностью эротических маркеров (верхний дециль по 18 главам): гл. 1 и гл. 2.
Честная граница: после снятия остаётся ровно 16 глав на 16 единиц, то есть отбор «из середины
распределения длин» вырождается в «все оставшиеся». Это ограничение, а не замысел.
⚠ ОБЪЁМ СРЕЗА ОГРАНИЧЕН ВНЕШНЕ. Скачано 18 глав (40 008 знаков), после чего площадка поставила анти-краулерную капчу на IP; снижение темпа до 3 с, куки живой сессии владельца и мобильный хост её не сняли. 16 единиц из 18 глав получены; добор до 71 главы не выполнен.
Единицы (детерминированный отбор, методика эксп-21 §0): дедуп по подписи со снятым заголовком
главы, ключ артефакта — хеш источника (не позиционный индекс), сортировка по (длина, uid).
16 единиц zh: 2073…2517 знаков, медиана 2194; 16 разных глав (у эксп-21 — 16 единиц из
12 глав, то есть по кластеризации срез чище); максимальная попарная близость 0.069
(эксп-21: 0.060). Хеши единиц — ~/books/tenant-panel/manifest.json.
Ось переноса en (обязательна): Kristoff, «Empire of the Dawn» (узнавание 1/5 по эксп-21),
6 единиц из отбора эксп-21 — 3 страты fr, 3 страты plain; единица 129b73ad5a выброшена
(выходные данные и библиография, а не проза — §8 эксп-21).
Порог контаминации — объявлен эксп-21 и здесь не двигается: узнавание ≥3/5 = материал
непригоден. Проба — узнавание + клоуз по 5 отрывкам (contam.py). Две поправки против эксп-21:
проба идёт двумя моделями (gpt-5.6-luna для сопоставимости и deepseek-v4-flash — боевой
жилец черновой роли; §4 п.9 эксп-21 оставил это открытым) и с двумя опорами — положительный
контроль 金瓶梅 и книга эксп-21 蛊真人 (там 4/5). Не пройдёт порог — материал меняется на
резервную книгу 《吞仙葫》 (detail/1573203, 首发 2026-07-23), объявленную здесь ДО замера.
0.3 Починки эксп-21 §8 — закрыты, проверены исполнением
eval/tenant_panel/checks21.py, ненулевой код возврата = покупки запрещены. Все четыре пункта
списка §8 оказались УЖЕ закрытыми самим эксп-21 (список не был вычеркнут). Проверено запуском, а
не чтением; где возможно — на том артефакте, из-за которого пункт появился:
| §8 | Чем проверено | Итог |
|---|---|---|
| гейт ре-гена ловит и ЦЕЛЕВУЮ письменность | четыре входа с известным ответом + исторический артефакт bo2-DRAFT-34749d6ccc-r2 (латиница 1.00) |
отвергается «выход не на целевом языке» |
| карта раскладки слепого чтения вне каталога пакетов | blind_read.KEYS ≠ PACKETS, карт в каталоге пакетов нет |
закрыт |
| персист обоснований судьи | absjudge --selfcheck (три регрессии) + 120/120 боевых клеток прохода abs4 несут текст |
закрыт |
| три лживых докстринга | сверка докстринга с исполняемым кодом (REPS_PER_ORDER, run_draft, кортеж JUDGES) |
противоречий нет |
0.4 Каcса и фриз — механизм, а не обещание
eval/tenant_panel/money.py. Три урока эксп-21, каждый стоил денег:
- новый тег покупок не попадал в глоб кассы (трижды; последний раз гейт ложное число
СЕРТИФИЦИРОВАЛ) ⇒ теги объявлены в одном месте, и
--selftestпроверяет по одному тегу за раз, что каждый даёт кассе фазы и кассе пака ровно свою сумму; - потолки фаз пробивались ⇒ каждая покупка проходит ДВА проекционных гарда: фазовый и пакетный ($5.00);
- покупки шли кодом вне зафризенного дерева ⇒ покупка отказывает, если файл вызывающего не отслеживается git ИЛИ отличается от закоммиченного. «Фриз ДО покупок фазы» стал механизмом.
Проверено исполнением: 7/7 тегов видны обеими кассами, проекционный гард отказывает при нулевом потолке, фриз-гейт отвергает покупку из НЕ-файла.
0.5 Ф1 — кандидаты, пороги, прогнозы
Живой листинг /models 08.08 (role_topology/list_models.py): deepseek 2 · zai 8 · kimi 12 ·
gemini 59 · xai 10 · mistral 53; openai — ReadTimeout, пере-снять до скрина.
gemini-3.1-pro-preview в листинге ЖИВ — обязательный кандидат Ф3 доступен.
Ростер (11 моделей, roster.py), цены сверены 08.08 по прайс-страницам вендоров.
Живая сверка удалась по DeepSeek · Z.AI · Gemini · Kimi (страницы сохранены); не удалась по
OpenAI (Cloudflare 403), xAI (308→403; Wayback свежее эксп-21 не имеет) и Mistral (прайс
рендерится JS) — там цены перенесены из эксп-21 с датой его сверки, и это объявлено.
Три поправки к role_topology/prices.py, найденные живой сверкой:
- у Gemini кэш-цена выделена вендором и в 8–10 раз ниже входной ($0.20 против $2.00 у 3.1-pro; $0.15 против $1.50 у 3.6-flash; $0.025 против $0.25 у flash-lite) — эксп-21 ставил кэш = входу и ЗАВЫШАЛ цену Gemini;
- у Z.AI появились
glm-4.7-flash(бесплатный) иglm-4.7-flashx($0.07/$0.40) — тир дешевле боевого черновика; в live-/modelsих НЕТ, поэтому в ростер не берутся, а проверяются $0-пробой существования слага; - DeepSeek на прайс-странице 08.08 объявляет ПОВЫШЕНИЕ цен («significant increase expected») — это бьёт по проекции себестоимости книги и едет с ИТОГом.
Рез по прайсу (промт разрешает при >16 кандидатах; каждому провайдеру оставлен слот): сняты
gpt-5.6-terra, kimi-k3, glm-5.1, glm-5.2, glm-5-turbo, grok-4.5,
mistral-medium-latest — каждый доминирован одноимённым семейством при той же роли (основания
пер-модельно в roster.CUT).
Пороги скрина — содержательные, из требований пайплайна, записаны ДО замера (screen.py).
Порог, не способный отсеять никого, — не порог; но пороги выводятся из требований, а не
подгоняются под желаемый состав:
| Гейт | Что и почему | Провал |
|---|---|---|
| Г1 ФОРМАТ на боевой единице | сервис-преамбула, markdown-заголовки, обрыв — ровно те классы, которые боевой санитайзер считает вердикт-гейтом (D30.3) | нарушение более чем в одной единице из двух |
| Г2 ЭХО/УТЕЧКА | доля исходной письменности; боевой порог disposition.go = 0.15 |
любая единица выше 0.15 ЛИБО ханьцзы во ВСЕХ единицах |
| Г3 ОТКАЗ на чувствительном фрагменте | вебновелла упирается в насилие; тихий отказ на главе N рвёт конвейер | отказ |
| Г4 ЦЕЛЕВОЙ ЯЗЫК | эксп-21 оплатил и принял английский выход (латиница 0.79) | доля кириллицы среди букв < 0.5 |
| Г5 ЦЕНА/ЕДИНИЦА | считается из usage, не из прайса; роль черновика имеет объявленный порог |
draft: > $0.02/ед · editor: > $0.06/ед |
| Г6 УПРАВЛЯЕМОСТЬ РАЗМЫШЛЕНИЯ | класс, уже стоивший проекту волны (quirks §10) | finish=length при пустом выходе |
Урок эксп-20 применяется: механический показатель ≠ качество, поэтому спорных кандидатов СТИЛЬ-осей скрин не решает — они доводятся до Ф2/Ф3.
Прогнозы (калибруют удивление; совпадение НЕ цель).
- Скрин убьёт 2–4 кандидата из 11; наиболее вероятные —
kimi-k2.6(многословность размышления → обрыв),grok-4.3(кредиты xAI исчерпаны 07.08),mistral-large-latest(преамбула в выходе),gemini-3.1-flash-lite(формат). - Разброс панели ЧЕРНОВИКОВ будет БОЛЬШЕ разброса панели редакторов. Основание — §16.2
эксп-21 (тот же редактор над другим черновиком: 7.66 против 5.91) и §12 (
A_law/B−0.69, ноль внутри интервала). gemini-3.1-proНЕ окажется аутлаером прозы: гипотеза эксп-04 снята мёртвым поколением и слабым ригом. Прогноз: его перевес надdeepseek-v4-proляжет НИЖЕ шумового пола.- Победитель черновой роли будет решаться ценой, а не качеством: прогноз — перевесы черновиков лягут в полосу 1–3 ошибки при поле ≈1.9, то есть правило ничьей D39.117 (самый дешёвый жилец) окажется рабочим, а не декоративным.
- Частота эхо-мины
deepseek-v4-flashна этой книге — 25–40% (приор эксп-21: 38% на zh, 0% на en).
⚠ Числа-приоры взяты из эксп-21 для сметы и дизайна, не как ожидания: новый замер их не обязан воспроизвести, расхождение = находка.
0.6 Смета и план агент-запусков
Смета считается по ФАКТИЧЕСКИМ $/вызов эксп-21 из сырья (медианы по scr-* и bo4-*),
масштабированным на длину единицы (2194/1683 = ×1.31) и на отношение цен вендоров.
| Фаза | Что покупается | Смета | Потолок |
|---|---|---|---|
| Ф0 | контаминация 3 книги × 5 отрывков × 2 модели = 30 вызовов; терминолог 1 вызов | $0.02 | $0.40 |
| Ф1 | 11 моделей × 2 единицы × 2 роли = 44 вызова | $0.62 (до $0.80, если Gemini-pro много думает) | $1.00 |
| Ф2 | ≤5 жильцов + якорь × 22 единицы (черновик) + боевой редактор поверх каждого + шумовой пол | $1.27 при панели из 5 | $2.00 |
| Ф3 | ≤5 редакторов × 16 единиц поверх замороженного flash-черновика (клетка dspro переиспользуется из Ф2) | $1.50 | $1.60 |
| сумма | $3.41 | $5.00 |
⚠ Правило усечения панели Ф2, объявляется ЗАРАНЕЕ. Если смета не влезает в $2.00, панель
режется так, чтобы СОХРАНИТЬ ЦЕНОВУЮ ОСЬ: обязательны якорь deepseek-v4-flash, самый дешёвый
прошедший и самый дорогой прошедший; середина добирается по возрастанию цены до упора в потолок.
Причина: вопрос пака — «покупает ли дорогой черновик качество», и панель, срезанная по цене
сверху, на него ответить не может. Каждый снятый кандидат печатается с его числами.
План агент-запусков (кап промта ≤60; 1 запуск = одна судейская сессия суб-агента).
| Стадия | Пакетов | Текстов в пакете | Запусков |
|---|---|---|---|
| Ф2 zh — черновики + редактор поверх каждого | 16 единиц | ≤5 черновиков + ≤5 редактур + декой + пара пола ≈ 13 | 16 |
| Ф2 en — ось переноса | 6 единиц | ≤5 черновиков + декой ≈ 7 | 3 |
| Ф3 zh — панель редакторов | 16 единиц | ≤5 редакторов + база + декой + пара пола ≈ 9 | 8 |
Довесок D_/A на сырье эксп-21 |
16 единиц | 2 текста + декой | 4 |
| план | 31 | ||
| резерв на сессии, аннулированные декоем | 12 | ||
| потолок | 43 из 60 |
0.7 Что фризится этим коммитом
eval/tenant_panel/ целиком (material.py · checks21.py · roster.py · money.py ·
prompts.py · bank.py · contam.py · screen.py) + эта секция отчёта. Дальнейшие фазы
получают свои секции и свои фриз-коммиты; amend фриза запрещён, девиации объявляются в отчёте.
§1 Ф0 — ИСПОЛНЕНО
1.1 Контаминация среза: чисто на двух моделях при живом положительном контроле
Проба узнавания + клоуза, 5 отрывков на книгу, две модели (tp0-cont-*, $0.005709):
книга модель узнано клоуз вердикт (порог: узнавание ≥3/5)
slice22 gpt-5.6-luna 0/5 0/5 следов нет
slice22 deepseek-v4-flash 0/5 0/5 следов нет
gu-zhenren gpt-5.6-luna 1/5 0/5 следов нет
gu-zhenren deepseek-v4-flash 3/5 3/5 НЕПРИГОДЕН
jinpingmei gpt-5.6-luna 4/5 4/5 НЕПРИГОДЕН
jinpingmei deepseek-v4-flash 5/5 5/5 НЕПРИГОДЕН
Материал среза чист по объявленному порогу, и проба при этом работает: положительный контроль опознан 4/5 и 5/5.
Находка, которой у эксп-21 не было: КОНТАМИНАЦИЯ ЗАВИСИТ ОТ МОДЕЛИ. На 蛊真人 luna даёт 1/5
(«следов нет»), а deepseek-v4-flash — 3/5 узнавания И 3/5 клоуза, то есть знает конкретику.
Эксп-21 мерил ОДНОЙ моделью и оставил это открытым пунктом (§4 п.9); здесь видно, что одна модель
занижает оценку — и занижает её как раз для той модели, которая населяет черновую роль. Практика:
пробу контаминации гонять на ЖИЛЬЦАХ, а не на удобной дешёвой модели.
1.2 Банк среза
Терминолог-прогон (gpt-5.6-luna, $0.002444) по 26 частотным кандидатам майнинга → 26 строк
термин ⇥ перевод. Ручная правка сессии: выброшены четыре (瞬间 «мгновенно», 声音 «голос, 仿佛«словно»,庭院` «двор») — это общеязыковая лексика, канон на неё превратил бы метрику
покрытия в замер словарного совпадения. Остальные 22 приняты как есть, ручных ПОДМЕН нет.
Банк: 22 термина, знаменатель 1124 упоминания на 16 единицах (у эксп-21 — 8 терминов,
228 упоминаний). Помечен signed: false — ручной канон сессии, НЕ подпись владельца (D39.47).
⚠ Девиация: регексы канонных форм расширены под русское словоизменение ПОСЛЕ фриза Ф0 и ПОСЛЕ
покупки терминолога (то есть $0 и на результат прогона не влияет). Причина — короткие склоняемые
слова («род Цинь») не находились в форме «рода Цинь»: метрика занижалась бы у всех армов
одинаково, но занижалась. Регрессии на реальные формы банка — в bank.py --selfcheck.
1.3 Sol-пакет (а) выпущен
20 пакетов (~/books/tenant-panel/sol/), парный протокол, слепые метки, ОБА порядка, две
контрольные пары с посаженной деградацией, инструкция владельцу отдельным файлом. Контрасты и
основание отбора — в шапке sol.py: A/F (заказан промтом), B/F (тот же заголовочный вопрос,
разрыв судей 1.90) и A_law/A — единственный контраст, где судьи расходятся знаком
(+0.91 против −0.20), а расхождение знака меняет вердикт, а не точность.
§2 Ф1 — ПРОФИЛЬ-СКРИН: ЧТО ПОКАЗАЛ И ЧТО ПОЧИНИЛ
2.1 Таблица по КАЖДОМУ кандидату — и вошедшему, и нет
модель вердикт $/ед transl $/ед edit ханьцзы размышл причины
deepseek-v4-flash прошёл 0.00089 0.00264 14 21.4%
deepseek-v4-pro прошёл 0.00384 0.00545 6 15.7%
gpt-5.6-luna прошёл 0.00367 0.00437 16 5.0%
gemini-3.1-flash-lite прошёл 0.00398 0.00490 12 0.0%
glm-4.7 прошёл 0.00656 0.00853 6 0.0%
glm-5 прошёл 0.00959 0.01303 4 0.0%
grok-4.3 прошёл 0.00984 0.01452 0 20.9%
kimi-k2.6 ПРОВАЛ 0.05661 0.06773 0 100.0% Г1 (3 клетки) · Г5 обе роли · Г6 пустой выход
mistral-large-latest ПРОВАЛ 0.02016 0.02661 0 0.0% Г5 цена translator $0.0202 > $0.02
gemini-3.6-flash ПРОВАЛ 0.07320 0.06354 0 0.0% Г5 цена обеих ролей
gemini-3.1-pro-preview ПРОВАЛ 0.14282 — 0 0.0% Г5 цена translator $0.1428 > $0.02
Скрин убил 4 из 11 — против 2 из 12 у эксп-21, и убил по СОДЕРЖАТЕЛЬНЫМ порогам, а не по удобству состава. Прошли 7: якорь и шесть кандидатов черновой роли.
⚠ gemini-3.1-pro-preview — вердикт на НЕПОЛНОМ замере. Его строка стоит на 2 клетках вместо
4: обе редакторские ушли в HTTP 503 (§2.3), поэтому редакторской цены у него нет вовсе. Вердикт
ПРОВАЛ выносится по переводческой цене, которая выше порога в семь раз, — разрыв такой, что двумя
недостающими клетками он не закрывается. Это не отменяет его участия в Ф3: обязательный
кандидат промта берётся туда безусловно, мимо скрина (§6), и именно поэтому потолок Ф3 поднимался
владельцем до покупок.
⚠ mistral-large-latest провалился с запасом в 1% ($0.02016 против порога $0.02). Порог
объявлен до замера и не двигается, но честная форма вердикта — «на границе», а не «дорог».
⚠ kimi-k2.6 — единственный, кто отдал ПУСТОЙ выход: 3 клетки из 4 пришли finish=length
с нулевым content при 100% доли размышления, каждая по $0.065–0.070. Это ровно тот класс,
который уже стоил проекту волны (quirks §10), и он воспроизвёлся на новом вендоре.
2.2 Три починки, найденные ИСПОЛНЕНИЕМ по ходу Ф1
| Что сломалось | Как поймано | Правка |
|---|---|---|
эхо-мина на ПЕРВОЙ же покупке: черновик единицы 474f822806 вернулся полным китайским исходником (finish=stop, ханьцзы 1785, кириллица 0.00) |
вскрытие единицы глазами сразу после покупки | в скрин добавлен боевой гейт годности + N ре-генов; цена ре-гена ложится в леджер |
касса считала цену по таблице эксп-21: buy.priced звал role_topology/prices.cost, где новых моделей нет — прогон упал KeyError: kimi-k2.6 на середине |
падение прогона | прайс-таблица пака подставлена в кассу явно; заведена проверка «цена считается для ВСЕХ моделей ростера»; сверка уже купленных записей новой таблицей — 0 расхождений |
детектор markdown ловил разделитель сцены: *** (стандартный русский типографский разделитель) считался протёкшей разметкой ⇒ ПРОВАЛ получали glm-5 и gemini-3.1-flash-lite |
вскрытие клеток перед выводом (D39.61) | детектор приведён к БОЕВОМУ (checks/sanitizer.go + D33.2: декоративный разделитель не заголовок); порог «нарушений более чем в одной клетке» НЕ менялся — менялось, что считается нарушением |
⚠ Третья правка сделана ПОСЛЕ того, как первые вердикты были видны. Это признак подгонки, и
защита от него одна: правка меняет ДЕТЕКТОР, а не ПОРОГ; она приводит его к боевому гейту, а не
к желаемому составу; и она проверена регрессиями на девяти входах с известным ответом
(***, * * *, # # #, ## ***, **жирный**, ### Глава 1, …).
2.3 Провод-факты для quirks
gemini-3.1-pro-previewотдаёт HTTP 503 «This model is currently experiencing high demand» сериями. Четыре вызова подряд — четыре 503 за 3–5 секунд, $0; через минуту тот же слаг ответил с первой попытки. Страница статуса Google инцидентов не показывала. ⇒ адаптер обязан иметь отступ на 5xx, иначе клетка теряется по причине, которая замером не является.kimi-k2.6без ручки эффорта выжигает бюджет: 3 клетки из 4finish=length,contentпуст, 100% выхода — размышление. Ручки управления размышлением у Kimi в quirks не описано.gemini-3.6-flashдороже в роли ПЕРЕВОДЧИКА ($0.0732), чем в роли РЕДАКТОРА ($0.0635) — при том, что редакторский вход длиннее вдвое. То есть размышление у него растёт на задаче перевода с нуля, а не на объёме входа.- DeepSeek объявил на прайс-странице повышение цен («We plan to raise the overall pricing for DeepSeek API services in the near future, with a significant increase expected»). Проекция себестоимости книги в ИТОГе едет с этой оговоркой.
§0-Ф2 ПРЕ-РЕГ ФАЗЫ 2 (зафризен своим коммитом ДО покупок Ф2)
Панель (6 клеток = якорь + 5 жильцов, потолок промта «до 5 + якорь»). Правило состава объявлено в §0.6 и применено механически: прошедших скрин кандидатов черновой роли шесть, слотов пять, поэтому сохранена ЦЕНОВАЯ ОСЬ — обязательны якорь, самый дешёвый и самый дорогой прошедшие, середина добирается по возрастанию цены.
D0 deepseek-v4-flash $0.00089/ед ЯКОРЬ (боевой черновик)
D1 gpt-5.6-luna $0.00367/ед самый дешёвый прошедший
D2 deepseek-v4-pro $0.00384/ед
D3 gemini-3.1-flash-lite $0.00398/ед
D4 glm-4.7 $0.00656/ед
D5 grok-4.3 $0.00984/ед самый дорогой прошедший
Снят правилом: glm-5 ($0.00959/ед, скрин ПРОШЁЛ) — шестой по цене из шести, вытеснен
границей «до 5 жильцов». Он не выбывает из пака: в Ф3 он входит как ратифицированный резерв.
Ценовая ось панели — 11× от края до края, то есть вопрос «покупает ли дорогой черновик
качество» на ней задаваем.
Что покупается: черновик каждого жильца на 16 zh + 6 en единицах (с банкнотой на zh; пара en
идёт БЕЗ блока — подписанного глоссария для книги Kristoff не существует, девиация унаследована
от эксп-21) + боевой редактор A_law-конфига (deepseek-v4-pro, full-regen + закон-блок) поверх
КАЖДОГО черновика + шумовой пол.
ШУМОВОЙ ПОЛ. Якорный арм гоняется ДВАЖДЫ end-to-end (p1, p2) на тех же 16 zh-единицах:
свой черновик и своя редактура в каждом прогоне. Истинная разница — ноль по построению, поэтому
измеренный разброс есть шум ПАЙПЛАЙНА (генерация черновика + генерация редактуры + судья), а не
только редактора: у эксп-21 пол мерил повтор редактора над замороженным черновиком и потому был
нижней границей. Пол применяется к Ф2 И Ф3; перевес ниже пола печатается вердиктом
«ниже порога различимости» — это статус «не разрешено ригом», запрета печатать числа нет.
⚠ Пол кладётся ОТДЕЛЬНОЙ парой p1/p2, а не «боевая клетка + её повтор»: иначе одна половина
пола побайтно совпала бы с армом E0 в том же судейском пакете, судья увидел бы один текст
дважды, а контроль «близнец» сработал бы на боевом арме.
СЕМЕЙСТВО КОНТРАСТОВ Ф2 (zh и en раздельно), объявляется ЗДЕСЬ и впечатывается в ключ судейского прохода ДО первого ответа:
E1 vs E0 · E2 vs E0 · E3 vs E0 · E4 vs E0 · E5 vs E0 — финал поверх черновика жильца против
финала поверх якоря (5 гипотез)
E0 vs D0 — КОНТРОЛЬ: покупает ли боевой редактор
поверх якорного черновика
Поправка Холма — по шести. Контрасты D_i vs D_0 (черновик как ТЕКСТ) и разложение по осям
объявляются описательными: поправку не несут и решений не определяют. Основание такого сужения
— продуктовое: решение владельца принимается по ФИНАЛУ (что уедет в книгу), а не по черновику;
эксп-21 §9 показал, чем кончается семейство, объявленное задним числом.
КРИТЕРИИ (объявляются ДО покупок, как требует промт).
- «X бьёт Y» засчитывается, если перевес больше шумового пола (порог различимости = 2.8·SE
пола при 80% мощности) И
pХолма < 0.05 по объявленному семейству. - Перевес ниже пола печатается как «ниже порога различимости» с числом, а не замалчивается.
- Правило ничьей (ратифицировано D39.117): при неразличимости рекомендация = самый дешёвый жилец. Это правило ОТЧЁТА, а не ожидание результата.
- Детерминированные оси (эхо, батарея, покрытие канона, цена) читаются НЕЗАВИСИМО от судьи: они шума не имеют, и расхождение с судейским порядком — находка (строка 152 бэклога).
СМЕТА Ф2 по фактическим ценам скрина: $1.4533 (черновики 132 вызова + редактуры 132 + пол 32) при потолке $2.00. Не влезет — стоп и пинг, не резать молча.
АГЕНТ-ЗАПУСКИ Ф2: 16 (zh, по одной единице на сессию: 6 черновиков + 6 редактур + декой + пара пола = 14 текстов) + 3 (en, по две единицы: 6 черновиков + 6 редактур + декой = 13 текстов).
§3 ОБРАТНАЯ СВЯЗЬ ПО ОРГАНИЗАЦИИ ЗОНЫ eval/ (сайд-задание владельца)
Пишется как наблюдение исполнителя, который в этот код только что въехал и на каждой мине постоял. Приоритет — по цене ошибки, а не по красоте.
1. Две мины импорта, на которые наступит каждый следующий пак.
probe.py существует И в editor_contract/, И в editor_harness/; какой подхватится — решает
ПОРЯДОК sys.path.insert в вызывающем файле. bakeoff.py вставляет четыре каталога и получает
editor_harness/probe.py, хотя по тексту импорта это неочевидно. Переименование любой из папок
порвёт чужой пак молча. Дёшево лечится: __init__.py + импорт пакетами (from editor_harness import probe), либо хотя бы assert probe.__file__.endswith(...) в шапке.
2. Сырьё привязано к пути константой, и путь уже ломался. Все паки пишут в
Path.home()/"books"/<пак>; на этом стенде каталог оказался вложен на уровень глубже
(~/books/books/role-topology), и харнесс эксп-21 видел ПУСТОТУ вместо 2 055 файлов — печатал
«голосов нет» и завершался с кодом 0. То есть отчёт мог быть «пере-снят из сырья» на нулевом
сырье. Лечение: один модуль paths.py с проверкой «каталог непустой, иначе падать громко».
(На время пака поставлены симлинки ~/books/role-topology и ~/books/gu-zhenren/bank-arbitration
— это костыль, не решение.)
3. Прайс-таблица дублируется по пакам. role_topology/prices.py и tenant_panel/roster.py
знают разные множества моделей и РАЗНЫЕ цены (у Gemini кэш-цена в первой равна входной, а вендор
публикует её в 8–10 раз ниже). Касса эксп-21 считает цену своей таблицей — эксп-22 упёрся в
KeyError на середине скрина. Прайс — это данные с датой и источником; ему место в одном файле
на зону, а не в каждом паке.
4. Верхний уровень eval/ смешивает эпохи. Тридцать свободных .py от экспов 01–11 лежат
рядом с папками exp12/…exp16/, promptlang/, role_topology/. Решение владельца D38.2
(«код → логические папки») исполнено ЧАСТИЧНО: старое не переехало. Пока это не мешает, но карта
в README устаревала именно из-за этого.
5. README зоны отставал на четыре пака. Карта покрывала exp01–16 и promptlang/, но не
bank_arbitration/, editor_contract/, editor_harness/, role_topology/ — то есть ВСЕ
действующие харнессы. Новая сессия не могла найти по README ни судейский риг, ни кассу, ни
батарею. Исправлено этим паком: в eval/README.md добавлена таблица «Действующие харнессы
паков 18–22» и две мины импорта из п.1–2.
6. Что НЕ надо трогать. absjudge.py, battery.py, buy.py, editor_wire_probe.py,
inject_probe.py — это фундамент, на котором стоят числа трёх паков. Их стоит вынести в общий
слой и покрыть тестами, но не переписывать: цена регрессии здесь измеряется деньгами прогонов.
Вывод по рефакторингу. Крупный не нужен. Нужны три дешёвых шага в порядке цены ошибки:
paths.py с громким падением (п.2) · единый prices.py на зону с датой и источником (п.3) ·
пакетные импорты вместо sys.path-цепочек (п.1). Переезд старых скриптов в папки (п.4) — косметика,
делать по случаю.
§0-Ф3 ПРЕ-РЕГ ФАЗЫ 3
⚠ Поправка о статусе этой секции (внесена приёмкой). Прежде заголовок гласил «зафризен своим
коммитом ДО покупок Ф3». Это неверно и проверяется одной командой: git log -S"ПРЕ-РЕГ ФАЗЫ 3" -- docs/experiments/22-tenant-panel.md пуст — текста секции нет ни в одном коммите, он живёт только
в рабочем дереве. Заморожен КОДОМ: состав панели, семейство контрастов и изоляция уехали во фриз
56b34d4 (21:12), первая покупка Ф3 — 21:13:38, и именно код определяет, что было куплено и как
судилось. Существо пре-рега от этого не страдает, но самоописание секции было ложным, и
оставлять его нельзя: «зафризено» — проверяемое утверждение, а не риторика.
База — ОДНА и замороженная: боевой черновик deepseek-v4-flash из Ф2, тот самый, что прошёл
гейт эха. Все редакторы правят побайтно один текст, поэтому контраст между ними чист от разницы
черновиков — конфаунда, который эксп-21 назвал носителем ~70% эффекта. Изоляция клеток
(различие ТОЛЬКО в модели) проверяется editors.py --isolation сборкой сообщений ДО покупок.
Состав панели по объявленному ЗДЕСЬ правилу:
R0 deepseek-v4-pro боевой редактор — база всех контрастов; клетка КУПЛЕНА В Ф2
(`tp2-edit` над якорным черновиком) и заново не покупается
R1 gemini-3.1-pro-preview ОБЯЗАТЕЛЬНЫЙ кандидат промта (гипотеза эксп-04 «аутлаер прозы»)
R2 glm-5 ратифицированный резерв D39.22 = арм B эксп-21 — ПРЕЕМСТВЕННОСТЬ:
только он позволяет пере-снять `A_law/B` на чистом материале
R3 deepseek-v4-flash самый ДЕШЁВЫЙ прошедший редактор — «хватает ли дешёвого»
R4 grok-4.3 самый ДОРОГОЙ прошедший — «покупает ли дорогой качество»
Вторая база (лучший черновик Ф2) — ОПЦИЯ промта, НЕ берётся. Основание: смета Ф3 и без неё упирается в потолок (см. ниже), а вопрос «меняется ли выбор редактора при другой базе» — интеракция, на которую 16 единиц мощности не дают. Решение объявлено ДО покупок, а не после.
СЕМЕЙСТВО КОНТРАСТОВ Ф3, впечатывается в ключ ДО первого ответа:
R1 vs R0 · R2 vs R0 · R3 vs R0 · R4 vs R0 — каждый редактор против боевого над ТОЙ ЖЕ базой
R0 vs F — КОНТРОЛЬ: покупает ли боевой редактор над базой
Поправка Холма — по пяти.
КРИТЕРИИ — те же, что в Ф2, и на том же поле: «X бьёт Y» при перевесе больше шумового пола
(пол измерен в Ф2 двумя end-to-end прогонами якорного арма и применяется к обеим фазам) И
p Холма < 0.05. Ниже пола — вердикт «ниже порога различимости» с числом. Ничья ⇒ рекомендация
= самый дешёвый жилец (D39.117).
СМЕТА Ф3 по ЗАМЕРЕННЫМ ценам (не по прайсу): R1 $0.152×16 = $2.43 · R2 $0.01303×16 = $0.21 ·
R3 $0.00264×16 = $0.04 · R4 $0.01452×16 = $0.23 · R0 = $0 (из Ф2) ⇒ $2.91 при потолке $3.00.
Потолок Ф3 поднят с $1.60 до $3.00 и пакетный с $5.00 до $6.50 словом владельца 08.08,
объявлено ДО покупок; причина — замер скрина: gemini-3.1-pro-preview тарифицирует 11 144–12 010
выходных токенов на ответ в 2 508 (скрытое размышление видно ТОЛЬКО в total_tokens).
ДОВЕСОК на купленном сырье эксп-21 (генерации НЕ покупаются): прямой контраст D_ против A
агент-голосами, проход dva, семейство из одного контраста. Эксп-21 дал −2.00 (p=0.0157, Холма
не проходит) на пуле двух проходов; здесь он пере-снимается третьей независимой судейской
популяцией.
АГЕНТ-ЗАПУСКИ Ф3: 8 (по две единицы на сессию: 5 редакторов + база + декой + пара пола ≈ 9
текстов) + 4 на довесок dva (по четыре единицы: 2 текста + декой).
§4 Ф2 — ПАНЕЛЬ ЧЕРНОВИКОВ: РЕЗУЛЬТАТЫ
4.0 КОНТРОЛИ САМОГО РИГА (читать ДО боевых чисел)
проход ДЕКОЙ (посаженная деградация) ПОЛ (две генерации одного арма, истина = 0)
p2zh −4.44 · поймано 16/16 ✔ +0.19 [−1.19, +1.56] n=16 · ЧЕСТЕН
p2en −3.50 · поймано 6/6 ✔ не ставился (пол — заказ zh)
sd пола по единицам 2.90, стандартная ошибка среднего 0.72 ⇒ различимый средний эффект
≈ 2.03 ошибки при 80% мощности. Это и есть порог, к которому прикладываются все перевесы Ф2/Ф3.
Побайтных близнецов в пачках нет.
⚠ Граница декоя, объявляю. Посадки книго-независимы (заменены эксп-22), но у них узнаваемый
«почерк»: химера на -нительние, сорок вместо числительного, снятое отрицание, висячая прямая
кавычка. Судьи, получавшие 2–4 задания в одной сессии, называли метку декоя в каждом. Контроль от
этого не рушится — он меряет, ВИДИТ ли судья посаженную порчу, — но величина −4.44 завышена
и как оценка чувствительности не читается.
4.1 Судейство zh (16 единиц, семейство впечатано в ключ ДО ответов, Холм по 6)
контраст ед. перевес 95% ДИ p p Холма
E1 vs E0 16 −0.44 [−2.00, +1.25] 0.6711 0.6711 финал поверх черновика luna
E2 vs E0 16 −2.56 [−5.62, +0.06] 0.1058 0.3452 …поверх черновика deepseek-v4-pro
E3 vs E0 15 −1.87 [−3.60, +0.00] 0.0863 0.3452 …поверх черновика gemini-3.1-flash-lite
E4 vs E0 16 −1.25 [−3.19, +0.75] 0.2663 0.5326 …поверх черновика glm-4.7
E5 vs E0 16 −1.69 [−3.00, −0.25] 0.0444 0.2222 …поверх черновика grok-4.3
E0 vs D0 16 +3.25 [+2.25, +4.19] 0.0001 0.0007 ✔ КОНТРОЛЬ: редактор поверх якоря
Читается так. Единственный контраст, переживший поправку на множественность, — КОНТРОЛЬ: боевой редактор поверх якорного черновика покупает +3.25 ошибки. Заголовок эксп-21 (+2.50 · +2.81 на контаминированной книге) воспроизвёлся на чистом материале и усилился.
Ни один альтернативный черновик не улучшил финал. Все пять перевесов ОТРИЦАТЕЛЬНЫ (финал
поверх якоря лучше), ни один не проходит Холма, и все, кроме E2, лежат ниже порога различимости
2.03. E2 (−2.56) порог по величине превышает, но p Холма 0.3452 — как установленный факт не
держится.
⚠ И даже эта величина хрупка (см. §15): в собственном арме E2 на единице 474f822806 стоит
клетка с finish=length; на подвыборке без затронутых обрывом единиц E2 даёт −1.83 при пороге
2.33, то есть порог не превышает. Вывод секции от этого не меняется — он и был «не держится».
⚠ Знак важнее величины. Прогноз пре-рега был «разброс панели черновиков будет БОЛЬШЕ разброса редакторов»; замер его не подтвердил в ожидаемой форме: разброс есть, но он весь в сторону УХУДШЕНИЯ относительно самой дешёвой модели, а не в пользу дорогих.
4.2 Ось переноса en (6 единиц)
E1 vs E0 +1.83 · E2 vs E0 +1.17 · E3 vs E0 +2.17 · E4 vs E0 +0.17 · E5 vs E0 +1.83
E0 vs D0 +0.00 [−2.50, +2.33] ← КОНТРОЛЬ
Знак противоположен zh, и контроль равен НУЛЮ. На английском исходнике боевой редактор поверх якорного черновика не покупает ничего, а финалы поверх других черновиков скорее лучше. Ни один контраст не проходит поправку (n=6). Это тот же класс, что нашёл эксп-21 («на паре, где исходник уже гипотактичен, разница между топологиями сжимается»), но здесь он доведён до нуля на контроле. ⇒ Вывод про жильца черновой роли на пару en НЕ переносится.
4.3 Детерминированные оси (шума не имеют, судьи не требуют)
(в) Эхо-мина — свойство МАТЕРИАЛА, а не константа модели:
deepseek-v4-flash zh 1/16 = 6% en 0/6
gemini-3.1-flash-lite zh 2/16 = 12% en 0/6 (одна единица не покупается вовсе: 3/3 попытки — эхо)
luna · deepseek-v4-pro · glm-4.7 · grok-4.3 zh 0/16 en 0/6
Приор эксп-21 на 蛊真人 — 31–38% у той же модели с той же ручкой. На этой книге 6%. Гипотеза 5.3 эксп-21 («частота эха — измеримое свойство материала») подтверждена вторым замером.
(г) Батарея и покрытие канона (знаменатель 1124 упоминания):
арм ханьцзы типогр потеря вел. покрытие канона
D[deepseek-v4-flash] 12 27 18 0.909
E[deepseek-v4-flash] 0 18 16 0.882
D[gpt-5.6-luna] 75 23 16 0.970
E[gpt-5.6-luna] 2 14 17 0.932
D[deepseek-v4-pro] 5 20 14 0.913
E[deepseek-v4-pro] 2 12 16 0.860
D[gemini-3.1-flash-lite] 6 24 18 0.927
E[gemini-3.1-flash-lite] 0 11 18 0.877
D[glm-4.7] 53 21 19 0.960
E[glm-4.7] 0 12 17 0.903
D[grok-4.3] 2 22 16 0.946
E[grok-4.3] 3 16 17 0.893
Два независимых от судьи факта: редактор вычищает утечку письменности (75 и 53 ханьцзы у черновиков luna и glm-4.7 → 2 и 0 после редактора) и редактор теряет канон У ВСЕХ ШЕСТИ жильцов (−0.027 … −0.057), несмотря на закон-блок. Второе — линия эксп-21 §16.1, здесь она получает шесть независимых подтверждений вместо одного.
(д) Цена связки и проекция на книгу (1500 единиц):
жилец черновик редактор связка книга $
gemini-3.1-flash-lite 0.00407 0.00466 0.00873 13.09
deepseek-v4-flash 0.00130 0.00769 0.00899 13.49
gpt-5.6-luna 0.00368 0.00557 0.00926 13.89
deepseek-v4-pro 0.00415 0.00751 0.01167 17.50
glm-4.7 0.00664 0.00559 0.01223 18.34
grok-4.3 0.00993 0.00525 0.01518 22.77
⚠ Редактор поверх ЯКОРНОГО черновика дороже, чем поверх любого другого ($0.00769 против $0.00466–0.00559): якорь пишет длиннее, и это удорожает второй проход. Итоговая цена связки у якоря всё равно вторая снизу.
§5 ДОВЕСОК D_/A НА КУПЛЕННОМ СЫРЬЕ ЭКСП-21 (генерации не покупались)
D_ против A 16 единиц −1.56 [−2.88, −0.25] p=0.0526 декой 16/16 ✔
Эксп-21 на пуле двух проходов: −2.00, p=0.0157, Холма 0.0630 — не прошёл. Третья независимая судейская популяция воспроизвела ЗНАК и не дала значимости. Статус контраста «однопроходка без мандата против связки» остаётся НЕ УСТАНОВЛЕНО — теперь на трёх замерах, а не на одном.
§6 Ф3 — ПАНЕЛЬ РЕДАКТОРОВ ПОВЕРХ ОДНОЙ ЯКОРНОЙ БАЗЫ
6.0 Контроли (читать ДО чисел)
ДЕКОЙ −4.75 · поймано 16/16 ✔
ПОЛ −0.25 [−1.88, +1.56] n=16 · sd 3.53 · ст.ошибка 0.88 ⇒ порог различимости 2.47 · ЧЕСТЕН
БЛИЗНЕЦ побайтно одинаковых пар 1 · перевес ровно ноль 1/1 ✔
⚠ Близнец — не дефект рига, а находка: deepseek-v4-flash в роли редактора на единице
2484f16eac вернул черновик побайтно без единой правки (проверено сверкой текстов: 1 клетка
из 62 в Ф3). Класс «no-op редактора», который эксп-12 ловил на grok reasoning-off, воспроизвёлся
у дешёвой модели без всякого гашения размышления.
6.1 Судейство (16 единиц, семейство в ключе ДО ответов, Холм по 4)
контраст ед. перевес 95% ДИ p p Холма
R0 vs F 16 +4.44 [+3.00, +6.12] 0.0001 0.0002 ✔ КОНТРОЛЬ: редактор поверх базы
R2 vs R0 16 −2.12 [−3.81, −0.75] 0.0094 0.0188 ✔ glm-5 против боевого
R3 vs R0 13 −2.54 [−4.00, −1.00] 0.0146 0.0188 ✔ deepseek-v4-flash против боевого
R4 vs R0 16 −4.75 [−6.12, −3.44] 0.0000 0.0001 ✔ grok-4.3 против боевого
Все четыре контраста проходят поправку, все три альтернативных редактора значимо ХУЖЕ боевого
deepseek-v4-pro над побайтно одной базой, и все перевесы выше порога различимости 2.47.
Это первый замер проекта, в котором роль редактора вообще разделилась. Эксп-21 на паре
{dspro, glm-5} давал A_law/B = −0.69 с нулём внутри интервала и писал «движки неразличимы»;
здесь на чистом материале glm-5 проигрывает −2.12 значимо. Причина расхождения не установлена:
кандидаты — другая книга, другая судейская популяция, другой банк.
R1 gemini-3.1-pro-preview — обязательный кандидат промта — в таблицу не попал. Он взят в
фазу, как требует промт, и выдал не число, а отказ на проводе: 1 клетка из 16 (см. §6.3).
6.2 Детерминированные оси Ф3
арм ед. ханьцзы типогр канон покрытие $/ед
R0 deepseek-v4-pro 16 0 18 991/1124 0.882 0.00769
R1 gemini-3.1-pro-preview 1 0 0 95/97 0.979 0.14702
R2 glm-5 16 5 27 1049/1124 0.933 0.01249
R3 deepseek-v4-flash 13 0 21 830/911 0.911 0.00177
R4 grok-4.3 16 2 18 1009/1124 0.898 0.01426
БАЗА (черновик) 16 12 27 1022/1124 0.909 0.00130
⚠ Детерминированный контур и судья дают РАЗНЫЙ порядок. Победитель по судье (deepseek-v4-pro)
имеет ХУДШЕЕ покрытие канона из всей панели — 0.882 против 0.933 у glm-5 и 0.909 у самого
черновика. То есть боевой редактор покупает язык и верность, а платит терминологией. Это прямое
подтверждение строки 152 бэклога («расхождение детерминированного контура и судьи») и довод к
тому, что покрытие канона обязано быть ОТДЕЛЬНЫМ гейтом, а не следствием выбора редактора.
6.3 ⛔ ОБЯЗАТЕЛЬНЫЙ КАНДИДАТ ПРОМТА НЕ ОТРАБОТАЛ НА ПРОВОДЕ
gemini-3.1-pro-preview взят в Ф3 безусловно, как требует промт. Что он выдал:
- скрин Ф1: четыре отказа HTTP 503 «This model is currently experiencing high demand», $0, страница статуса Google инцидентов не показывала. Состав отказов — две редакторские клетки и две переводческие; переводческие взялись с ретрая, редакторские не взялись ни разу, поэтому редакторской цены у модели нет вовсе, а скрин-вердикт ПРОВАЛ вынесен по переводческой цене;
- Ф3: 1 клетка из 16. Один вызов держал замок 74.5 минуты без ошибки и без ответа
(таймаут клиента 900 с умножался на внутренние ретраи SDK). После жёсткой границы (300 с,
max_retries=0) и объявленного подмножества в 8 единиц новых клеток не прибавилось; - цена состоявшейся клетки: $0.14702 — вход 4485, видимый выход 2532, тарифицировано 11 504
выходных токена, то есть в 4.5 раза больше видимого. Сама скрытая часть = 11 504 − 2 532 =
8 972 токена, втрое больше ответа; видно это ТОЛЬКО в
total_tokens.
⇒ Гипотеза эксп-04 «gemini-pro — аутлаер прозы» этим паком НЕ проверена и остаётся открытой. Проверить её на текущем слаге нельзя не из-за качества, а из-за операбельности: модель в редакторской роли на боевой длине входа не отдаёт результат. Это ответ на заказ промта, но ответ про ПРОВОД, а не про прозу.
§12 АННУЛИРОВАННЫЙ ПРОХОД p2en — ЧТО СЛУЧИЛОСЬ И ЧЕГО ЭТО СТОИЛО
Первый выпуск английского прохода ушёл к судьям без контроля: декой не был посажен ни в одну единицу, и заметил это не гейт, а вскрытие голосов. Причина — книго-специфичность посадок: правила порчи были написаны под лексику 蛊真人 (имена, термины культивации), и на новой книге ни одно из них не срабатывало, а функция посадки при нулевом совпадении молча возвращала текст без изменений.
Проход аннулирован целиком (голоса лежат в annulled-p2en-run1/, в счёт не идут), посадки
переписаны книго-независимыми — грамматика и типографика вместо лексики: снятие отрицания, подмена
величины, выдуманное слово, слом диалоговой вёрстки, слипание абзацев. После переписывания декой
ловится 6/6 на en и 16/16 на zh.
Цена ошибки — 6 агент-запусков из 60 (списаны безвозвратно) и задержка фазы. Урок в прибор: контроль, который может «не сработать» молча, не контроль. Посадка теперь падает, если не изменила текст, — молчаливый ноль больше невозможен.
⚠ Девиация ключей, объявляю. Ключи слепых меток проходов p2zh/p2en были пере-созданы в
22:16:22, то есть ПОСЛЕ того, как судьи начали отвечать (p2zh с 21:24). Пере-создание внесло
одно поле — decoy_from, базу, из которой посажен декой; задания судьям (21:08–21:10) не менялись
ни одним байтом, перестановка меток не менялась тоже. Пред-объявление семейства доказывается не
этими файлами, а фриз-коммитами 43381fe (19:54) и af6d885 (20:38), которые старше и заданий, и
ответов. Но артефакт, на который ссылается печать, моложе ответов — и это надо знать тому, кто
будет проверять провенанс.
§12а ВСКРЫТИЕ ЕДИНИЦ ПЕРЕД СРАВНИТЕЛЬНЫМ ВЫВОДОМ (D39.61, мандат самопроверки)
Запрет выводить на агрегате, не открыв единиц, — жёсткий. Вот что видно глазами на единице
d6cbc0179d (2114 знаков исходника), по одной стороне каждого решающего сравнения.
Ф3, R0 боевой deepseek-v4-pro против R2 пограничного glm-5. Оба дают связную русскую
прозу; провала нет ни у одного, и это согласуется с перевесом 2.12 при пороге прохода 2.47.
Различия стилистические: боевой идиоматичнее и охотнее сворачивает придаточные («нипочём не стал
бы», «прибрал к рукам»), glm-5 ближе к буквальному и дробит абзацы сильнее. Вывод вскрытия:
назвать glm-5 проигравшим по этой паре текстов нельзя — только пограничным, что и сделано в §2.
Ф2, черновик glm-4.7 (D4, −5.44) против якорного. Здесь разрыв виден сразу и он не
стилистический: черновик glm-4.7 идёт по одному предложению на строку — абзацной структуры
нет вовсе. Это отказ по оси ФОРМА, а не по языку, и он объясняет и величину −5.44, и то, почему
боевой редактор вытягивает этот черновик до −1.25: редактор переливает текст в абзацы. Именно
это вскрытие даёт механизм за находкой §13 — редактор работает компрессором различий черновика,
потому что худшие различия черновиков оказались вёрсточными, а не смысловыми.
⚠ Обратная сторона: если бы панель черновиков состояла из моделей, ломающих СМЫСЛ, а не вёрстку, компрессия могла бы и не сработать. Вывод «черновик решает меньше редактора» верен для той полосы качества, которую дала эта панель, и не обязан держаться шире.
§13 СВЕРКА ПРОГНОЗОВ §0.5 С ФАКТОМ (заказана промтом: расхождение = находка)
| # | прогноз (объявлен ДО покупок) | факт | итог |
|---|---|---|---|
| 1 | скрин убьёт 2–4 из 11; вероятны kimi-k2.6, grok-4.3, mistral-large-latest, gemini-3.1-flash-lite |
убил 4: kimi, mistral, gemini-3.6-flash, gemini-3.1-pro-preview |
число верно, состав — наполовину нет |
| 2 | разброс панели ЧЕРНОВИКОВ будет БОЛЬШЕ разброса панели редакторов | финалы поверх черновиков: размах 2.12; редакторы: размах 2.63 | ОПРОВЕРГНУТ, знак обратный |
| 3 | gemini-3.1-pro не окажется аутлаером; перевес ляжет ниже пола |
1 клетка из 16 — перевеса нет | НЕ РАЗРЕШЁН (провод, не проза) |
| 4 | победитель черновой роли решится ценой; перевесы лягут в 1–3 ошибки при поле ≈1.9 | перевесы 0.44–2.56, пол 2.03, правило ничьей применено | ПОДТВЕРЖДЁН |
| 5 | эхо-мина deepseek-v4-flash на этой книге 25–40% |
6% (1/16) | ПРОМАХ в 4–6 раз |
Прогноз 2 — самая содержательная находка сверки, и она против посылки заказа. Промт строил дизайн на том, что черновик двигает ~70% качества финала, поэтому и панель черновиков заказана шире. Данные говорят иначе: КАК ТЕКСТ черновики расходятся огромно (размах 7.25: от +1.81 до −5.44), но после боевого редактора этот разброс сжимается до 2.12, тогда как выбор самого редактора даёт 2.63. Редактор работает компрессором различий черновика. Отсюда практический вывод, которого пак не планировал: деньги на верхний тир имеет смысл тратить в редакторской роли, а не в черновой, — и именно это независимо подтверждают обе рекомендации (дешёвый черновик, дорогой редактор).
Прогноз 5 промахнут вчетверо, и это не «подтверждение гипотезы 5.3», а промах. Направление гипотезы («эхо — свойство материала») он поддерживает, но как ожидание величины прогноз был неверен, и подавать его подтверждением значило бы задним числом переписывать, что предсказывалось.
§13а МЕХАНИЧЕСКАЯ СВЕРКА С БУКВОЙ ПРОМТА (сделана ПОСЛЕ приёмки, по требованию владельца)
⚠ Зачем отдельно от §14. Критик полноты в §14 писала та же голова, что вела пак, и он унаследовал её слепоту: проверял по МОДЕЛИ промта, а не по промту. Здесь промт пройден построчно, включая придаточные. Все найденные пробелы закрыты $0; два — не закрываемы без покупок и объявлены девиациями.
| требование промта | где стоит в промте | статус |
|---|---|---|
| Sol-пакет (б) — слепые пары финалистов «по готовности Ф2/Ф3» | хвост п.4 Ф0 | ⛔ НЕ ЗАКРЫТО и не будет (поправка фазы Д): пакет сгенерирован, но владельцу в этом виде НЕ отдаётся — та же конструкция N_UNITS_B = 3, что развалила пакет (а) (§16). Прежняя пометка «выпущен» — маркер дефекта «артефакт вместо действия». Замена: контур на заданиях абсолютного рига |
| Вахта dspro — сверка вендор-changelog маппинга эффорта в Ф0 и ПЕРЕД Ф3 | буллет ЗАКОНа про DeepSeek | было не сделано → сделано, девиация по времени (§14) |
| Гейт ToS Z.AI пометить в ИТОГе | последняя строка промта | было в §14 → вынесено в ИТОГ (§9а) |
| цена связки p50/p95 по единицам против боевой пары | строка «Отчёт» | квантили добавлены, сравнение с боевой парой сделано явным (§5) |
| вывод на агрегате до вскрытия единиц запрещён (D39.61) | мандат самопроверки | не было документировано → §12а, дало механизм за находкой §13 |
| ось (а) — абсолютный суд черновика как ТЕКСТА | п. (а) Ф2 | было куплено и не напечатано → §1 |
| позиционный наклон «замерь и вычти» | буллет ЗАКОНа про судейство | было не вычтено → §7, все четыре прохода |
en-единицы Kristoff, 129b73ad5a выброшен |
п.2 Ф0 | исполнено: 6 единиц, выброшена |
закон-блок HEADER_LAW_PLAIN во всех армах + банкнота на переводческом |
банк-закон D39.104 | ⛔ на zh исполнено, на en НЕТ (поправка фазы Д, п.2): 72 en-клетки куплены без блока, потому что банк среза собран только по zh — §9 п.9. Селфтест prompts.py сторожит zh-ветку; en-ветки у него нет |
| клетка dspro-над-flash покупается один раз, в Ф3 переиспользуется | конец Ф2 | исполнено (editors.py::text_of) |
| спорных кандидатов СТИЛЬ-осей скрином не решать | урок эксп-20 в Ф1 | исполнено: скрин убивал по цене, формату и пустому выходу, не по качеству прозы |
| Claude-модели в армы не брать | буллет ЗАКОНа | исполнено: моделей семьи судьи в ростере нет |
| дешёвый + сильный тир КАЖДОГО провайдера, срез только при >16 | абзац «Кандидаты» Ф1 | ⛔ НЕ ИСПОЛНЕНО — девиация, см. ниже |
| вторая база Ф3 · строка 153 | опции Ф3 | не гнались — решение сессии, §9 п.12 |
⛔ Девиация: панель кандидатов срезана сильнее разрешённого
Промт разрешал до 16 кандидатов и требовал у каждого провайдера оба тира — дешёвый
(кандидаты черновой роли) и сильный (кандидаты редакторской); «провайдера целиком не выкидывать —
хотя бы один слот» — это ПОЛ правила на случай среза, а не цель. Я срезал до 11, и срез снёс
сильный тир у четырёх провайдеров из семи: у OpenAI, Moonshot, xAI и Mistral остался один слот
(roster.CUT: gpt-5.6-terra, kimi-k3, grok-4.5, mistral-medium-latest, три слага Z.AI).
Обоснование по каждой срезанной модели в коде есть — требование «с обоснованием» выполнено, —
но запас на пять кандидатов не был использован.
Что это меняет для читателя. Панель Ф3 состояла из того, что прошло суженный скрин; сильные
тиры четырёх провайдеров в замере не участвовали вовсе. Поэтому вывод «deepseek-v4-pro побеждает
значимо» верен ВНУТРИ панели и не является утверждением о лучшем доступном редакторе: не
проверены gpt-5.6-terra, kimi-k3, grok-4.5. Починка требует покупок и в этот пак не входит;
для следующего — это первая строка работы.
§15 КОРОТКИЕ КЛЕТКИ В СЫРЬЕ ЭТОГО ПАКА — ⚠ ИНТЕРПРЕТАЦИЯ ПЕРЕПИСАНА ФАЗОЙ Д
⚠ Эта секция дважды говорила неверное, и оба раза — не про числа, а про ПРИЧИНУ. Первая редакция (в отчёте пака 23) сравнивала длину клетки с медианой ПУЛА и объявила оборванными три клетки, которые нормальны: они из английского пула, где расширения нет. Вторая (здесь) правило починила — отношение к СВОЕМУ исходнику, — но объявила, что «пять клеток из шести завершились штатно и ни один гейт этого не ловит». Это опровергнуто приёмкой №16 и пере-снято фазой Д: пять клеток из шести — ЭХО ИСХОДНИКА, и эхо-гейт поймал каждую.
Замер (доля письменности в выходе, $0, content из сырья):
клетка исх вых ханьцзы кирилл finish что это
tp2-draft-D-deepseek-v4-flash-474f822806 2194 2279 1.000 0.000 stop ЭХО → ре-ген
└ …-r2 2194 7814 0.001 0.999 stop ×3.6, СУДИЛСЯ как D0
tp2-floor-p1-D-deepseek-v4-flash-474f822806 2194 2281 1.000 0.000 stop ЭХО → ре-ген
└ …-r2 2194 7994 0.001 0.997 stop ×3.6
tp2-floor-p2-D-deepseek-v4-flash-41599f30df 2116 2167 1.000 0.000 stop ЭХО → ре-ген
└ …-r2 2116 6950 0.001 0.999 stop ×3.3
tp2-floor-p2-D-deepseek-v4-flash-ef9cd38ec4 2155 2190 1.000 0.000 stop ЭХО → ре-ген
└ …-r2 2155 2211 1.000 0.000 stop ЭХО ещё раз
└ …-r3 2155 7672 0.000 0.998 stop ×3.6
tp2-draft-D-gemini-3.1-flash-lite-ed068182cf 2517 2448 1.000 0.000 stop ЭХО 3/3 — арм не куплен
tp2-edit-E-deepseek-v4-pro-474f822806 2194 1638 0.000 1.000 length ОБРЫВ, и он СУДИЛСЯ
Что именно судилось — доказано подписями sig в ключах слепых меток (обратное сопоставление
подписи с файлом на диске): эхо-попытки в ключах не встречаются ни разу — это главное и это
доказано. ⚠ Уточнение фазы Д: буквально «судился ре-ген» верно для ОДНОЙ клетки — черновика
474f822806-r2 (арм D0 в p2zh, F в p3). У трёх флор-клеток в ключах подписаны не сами
ре-гены, а РЕДАКТУРЫ поверх них; что редактура снята именно с ре-гена, подписью sig не
доказывается — в записи редакторской клетки хеша входа нет. Утверждение «эхо не судилось» от
этого не страдает, но провенанс «поверх чего сделана редактура» — открытая дыра прибора, и её
надо закрыть полем input_sig в записи клетки. Арм D3/E3 на единице ed068182cf отсутствует вовсе — это и есть объявленная в §7
«единица, которая не покупается» (отсюда E3 n=15).
⇒ Первые пять — не пропуск гейта, а его РАБОТА, видимая в леджере: эхо поймано, ре-ген оплачен,
судился здоровый текст. Настоящий пропуск ровно один — обрыв finish=length.
⛔ А вот РАЗМЕР КЛАССА ОБРЫВОВ больше, чем думали обе прежние редакции
Пере-счёт по ВСЕМ ключам пака (404 судимых клетки опознаны на диске по подписи): finish=length
у семи судимых слотов, четыре различных текста (три из них судились дважды — в p2zh и в
p3, потому что клетка R0 куплена один раз и переиспользована).
проход арм клетка len $
p2zh CTRLfloorB tp2-floor-p2-E-deepseek-v4-flash-bbb54d0043 5319 0.015336
p2zh CTRLfloorB tp2-floor-p2-E-deepseek-v4-flash-f6da9f76b2 7581 0.015200
p2zh E0 tp2-edit-E-deepseek-v4-flash-41599f30df 5759 0.015727
p2zh E2 tp2-edit-E-deepseek-v4-pro-474f822806 1638 0.015241
p3 CTRLfloorB tp2-floor-p2-E-deepseek-v4-flash-bbb54d0043 5319 0.015336
p3 CTRLfloorB tp2-floor-p2-E-deepseek-v4-flash-f6da9f76b2 7581 0.015200
p3 R0 tp2-edit-E-deepseek-v4-flash-41599f30df 5759 0.015727
⚠ И это не весь класс обрывов в паке — только его СУДИМАЯ часть. Отдельно на диске лежат
шесть клеток finish=length с ПУСТЫМ content на $0.216770: три скрина kimi-k2.6 и три
редакторские клетки deepseek-v4-flash фазы Ф3. В ключи слепых меток они не попали (судить нечего),
поэтому в таблицу выше не входят — но фраза «пере-счёт по ВСЕМ ключам» описывает именно судимую
часть, и объявить границу надо здесь. Пустые клетки Ф3 — тот же режим, из-за которого R3 считан
по 13 единицам из 16 (§7), а пустые клетки скрина — основание дисквалификации kimi-k2.6.
Читать судимую часть надо не как «ещё четыре клетки», а как две конкретные беды:
- две клетки стоят в ШУМОВОМ ПОЛУ обеих фаз. Пол — калибровка прибора, из него берётся порог различимости; недоработавший вызов в паре завышает разброс, а значит и порог;
- одна клетка стоит в БАЗЕ ВСЕХ КОНТРАСТОВ.
tp2-edit-E-deepseek-v4-flash-41599f30df— этоE0в Ф2 и он жеR0в Ф3 (клетка куплена один раз и переиспользована, §0-Ф3). То есть на единице41599f30dfкаждый контраст обеих фаз сравнивался ПРОТИВ оборванного текста.
Чувствительность выводов — замерена, а не оценена
Leave-out по единицам, несущим хоть одну оборванную судимую клетку (пол пере-считан по оставшимся):
⚠ Первая редакция этой таблицы печатала ТОЛЬКО пороги — вторичный критерий, — а решающее
правило пака есть p Холма < 0.05 (§0-Ф2). Поймано ревью; пере-считано точным знаковым тестом.
Ф2 (p2zh) все 16 единиц без 4 затронутых (n=12)
пол/порог +0.19 / 2.03 +0.17 / 2.33
E1 vs E0 −0.44 p 0.6711 Холм 0.6711 −1.25 p 0.1855 Холм 0.2739
E2 vs E0 −2.56 p 0.1058 Холм 0.3452 −1.83 p 0.1084 Холм 0.2739 ← был выше порога
E3 vs E0 −1.87 p 0.0863 Холм 0.3452 −2.18 p 0.0098 Холм 0.0391 ✔ ← стал ЗНАЧИМ
E4 vs E0 −1.25 p 0.2663 Холм 0.5326 −2.08 p 0.0913 Холм 0.2739
E5 vs E0 −1.69 p 0.0444 Холм 0.2222 −2.25 p 0.0078 Холм 0.0391 ✔ ← стал ЗНАЧИМ
E0 vs D0 +3.25 p 0.0001 Холм 0.0007 ✔ +3.33 p 0.0020 Холм 0.0117 ✔ КОНТРОЛЬ
Ф3 (p3) все 16 единиц без 3 затронутых (n=13)
пол/порог −0.25 / 2.47 −0.31 / 2.41
R2 vs R0 −2.12 p 0.0094 Холм 0.0188 ✔ −1.92 p 0.0103 Холм 0.0205 ✔
R3 vs R0 −2.54 p 0.0146 Холм 0.0188 ✔ −2.60 p 0.0430 Холм 0.0430 ✔
R4 vs R0 −4.75 p 0.0000 Холм 0.0001 ✔ −4.85 p 0.0002 Холм 0.0010 ✔
R0 vs F +4.44 p 0.0001 Холм 0.0002 ✔ +4.38 p 0.0005 Холм 0.0015 ✔ КОНТРОЛЬ
Что устояло и что нет. Решающая таблица пака — Ф3, выбор редактора — не двигается ни в одном вердикте: все четыре контраста проходят Холма и до, и после. Заголовочные выводы («ни один альтернативный черновик не улучшил финал», «все три альтернативных редактора хуже боевого», «контроль воспроизводится в обеих фазах») держатся.
⛔ Не устояли ДВА напечатанных утверждения §1, а не одно, как объявляла первая редакция этой
секции. (1) «Все, кроме E2, лежат ниже порога различимости»: без затронутых единиц E2 тоже
ниже порога. (2) «Ни один не проходит Холма»: на подвыборке E3 и E5 проходят (Холм 0.0391).
Второе нашла не сессия — ревью, и нашла ровно потому, что сессия сэкономила усилие на дорогой
статистике: напечатала пороги и не пере-считала p.
Куда это ведёт содержательно. Обе правки направлены ПРОТИВ альтернативных черновиков: убрав
единицы, где сам якорный финал E0 оборван, мы делаем E0 сильнее, и два альтернативных черновика
становятся значимо ХУЖЕ. То есть заголовок «ни один альтернативный черновик не улучшил финал» после
поправки не ослабевает, а усиливается — но формулировка «ни один не проходит Холма» верна только
для полного набора, и так её и надо читать.
⚠ Это leave-out, а не чистый пере-замер: выбрасывание единиц меняет и n, и пол. Оно отвечает на вопрос «зависит ли вывод от затронутых единиц» и не отвечает на вопрос «какими были бы числа, если бы клетки не оборвались». Второго ответа не существует без покупки.
В прибор — гейт СУЖЕН до класса finish=length (так предписала приёмка, и замер это
подтверждает). Отношение «длина клетки к длине исходника» как признак не нужно: эхо-класс уже
покрыт эхо-гейтом, а на разноязычных пулах отношение даёт ложные срабатывания. Нужное правило
одно и детерминированное: клетка с finish=length в судейскую пачку не допускается — ни боевым
армом, ни половиной шумового пола. Провод сообщает этот флаг сам, деньги за клетку уже уплачены,
и стоит гейт $0. В фазе Д он стоит ДО судейства и жёсткий; для этого пака клетки уже куплены и
отсужены, поэтому здесь класс объявлен с замером чувствительности, а не пере-куплен.
§14 КРИТИК ПОЛНОТЫ ПО ФАЗАМ (заказан промтом)
Что заказано · что закрыто · что осталось. Пишется по фазам, а не по впечатлению от объёма.
Ф0 — материал. Заказано: свежий незаражённый zh-срез, проба контаминации, банк, Sol-пакет (а).
Закрыто всё. Не закрыто: ToS-роутинг помечен, но не проверен исполнением — sexually-explicit
объявлен FORBIDDEN для deepseek и zai по договорам провайдеров (маршрутизация правом, не
поведением), и гейт прав снял по этому основанию две главы; но самого отказа моделей на
чувствительном материале пак не наблюдал, потому что материал этого класса убрал (§11).
Ф1 — скрин. Заказано: профиль каждого кандидата, пороги до замера, сверка прогнозов. Закрыто:
таблица по всем 11, три починки исполнением, четвёртая (отступ на 5xx) — в §2.3. Сверка прогнозов
доделана здесь, §13. Кредиты xAI: промт фиксировал их исчерпанными 07.08 с пометкой «вопрос у
владельца»; grok-4.3 скринился и покупался во всех фазах, то есть пополнение состоялось — строка
об этом промтом требовалась и печатается здесь (§9 п.6 — подтвердить владельцу).
Ф2 — панель черновиков. Заказано пять осей: (а) черновик как текст, (в) эхо, (г) батарея и канон, (д) цена. Закрыто всё, но ось (а) была отсуждена и не напечатана — исправлено (§1), и это самый крупный пропуск пака: замер существовал в сырье и отсутствовал в отчёте.
Ф3 — панель редакторов. Заказано: обязательный кандидат, резерв эксп-21, дешёвый и дорогой
над одной базой. Закрыто. Не закрыто: вторая база Ф3 (опция промта) не гналась — решение
сессии, не владельца (§9 п.12); R1 не дал панели (1 клетка); R3 считан по 13/16 из-за
оплаченного пустого выхода (§7).
Вахта dspro (ЗАКОН промта: сверка вендор-changelog маппинга эффорта в Ф0 и ПЕРЕД Ф3).
Отработана по вендор-доке ($0, без вызовов): reasoning_effort в API DeepSeek присутствует,
управление размышлением — через thinking; последняя запись вендор-changelog, затрагивающая
deepseek-v4-flash, датирована 31.07.2026 и описывает пере-обучение при той же архитектуре и
размере — ровно тот факт, что уже зафиксирован D39.61 («слаг живой ≠ модель та же»). Смены
маппинга эффорта после фриза Ф2 нет, поэтому стоп и пинг, которые промт предписывает при смене,
не требовались. ⚠ Сверка сделана ПОСЛЕ покупок, а не в Ф0 и перед Ф3, как предписано; я это
объявляю девиацией, а не выдаю за исполненное вовремя. Задним числом она безопасна ровно потому,
что изменения не нашлось: найдись оно — пришлось бы аннулировать фазу, а не дописывать абзац.
Сквозное. Закрыто: позиционный наклон замерен по всем четырём проходам и вычтен (§7),
p50/p95 по единицам напечатаны (§5), деньги сведены двумя путями. Не закрыто и переносится:
строка 153 (уравненный мандат D/D_) не гналась; Sol вернулся 09.08, но арбитраж не
состоялся (§16: пакет (а) прогнан владельцем и развалился по конструкции — N_UNITS = 3, дрейф
шкалы ×2.6, зеркальные пары в разных сессиях; пакет (б) в этом виде не выпускать), поэтому
судейского контура вне одной модельной семьи у ЭТОГО пака по-прежнему нет (§11) — ⚠ поправка фазы
Д, п.3: прежняя формулировка «Sol не вернулся» неверна; фактическая величина двойной оплаты Ф2
невосстановима в принципе (§8).
Чего в паке нет и не могло быть. Вебновелл-срез взят одной книгой и одной парой: всё, что зависит от свойств текста, обязано пере-меряться на следующей. Ни один вывод пака не является утверждением о моделях вообще — только о них на этой паре, этой книге и этих 16 единицах.