textmachine/docs/experiments/23-editor-tier.md

853 KiB
Raw Blame History

23. Сильный тир редакторской роли и граница glm-5

⚠⚠ ЕСЛИ ТЫ ПРИШЁЛ ЗА ОТВЕТОМ, А НЕ ЗА ИСТОРИЕЙ — ТЕБЕ В КОНЕЦ ФАЙЛА. Этот документ вырос из отчёта одного пака (09.08) в носитель всей ФАЗЫ Д (секции Д0Д39, заказ владельца 10.08), и ответ на вопросы, ради которых фаза шла, лежит последним, а не первым. Карта коротким списком:

нужно секция
ОТВЕТ на два главных вопроса владельца (архитектура · связка моделей) Д38
ДЕНЬГИ: связка против всего остального, один прайс, одна единица Д41
что корпус знал, а фаза Д не использовала (⚠ правит Д38 и Д41) Д42
реестр потерянного: что фаза запланировала и растеряла между планами Д43
ручка размышления у deepseek-v4-pro: доходит ли · почему замер её величины не куплен Д46
качество дешёвой luna против дорогого дипсика и против боевой связки (слепое чтение) Д48
что редактор делает с текстом: 46% знаков при выдаче главы целиком ($0, из артефактов) Д49
итог консилиума 30.08: что снято, что решено, план eval/dovodka/KONSILIUM-30-08.md
статус метавопроса «консистентность на всю книгу» и цена его закрытия Д38.3, Д38.6
что закрыто и что осталось по плану 22.08 Д38.4
вес всего ролевого промта в единицах прибора Д36
шум самого прибора (сколько порога — читатель) Д37
буфер архитектуры: слабый жилец внутри неё Д32, подтверждения — Д34, Д37.3
вердикт по вендорам (по конъюнкции, после второго чтения) Д31
что в теле отчёта ОПРОВЕРГНУТО и чем Д30 (эррата ревью), Д35 (эрраты переезда)
сдача: почему сверка красная Д39

Всё, что ВЫШЕ линии «ФАЗА Д», — история пака 23 и его приёмки; она не переписывается и читается через свои ⚠-баннеры.

Полигон-сессия, 09.08.2026. Номер 23 присвоен оркестратором №16 при лендинге 10.08. Зона: eval/editor_tier/ + этот файл. Санкция владельца на потолок пака $4.00 (09.08).

⚠⚠ РЕВЬЮ-ШАПКА ПРИЁМКИ (оркестратор №16, 10.08) — шапка первична над телом. Числа пака подтверждены независимым пересчётом мимо харнесса (border/tier/деньги/репликация/внешний судья — до знака; LOO по сессиям устойчив; аннулированные прогоны воспроизводятся из сырья, «фантомные» 0.29/0.42 подтверждены невыводимыми). Мандат пака, потолок $4.00 и санкции подтверждены владельцем задним числом 10.08. Выводы НЕ ратифицированы — владелец признал постановку неполной и заказал фазу Д (docs/POLYGON_EXP2223_REDO_SESSION_PROMPT.md): добивка gemini · внешняя подпись tier · несущие оси en/ja · edit-контур · канон-вскрытие; отчёт фазы — секции Д0Д8 этого файла. Поправки приёмки к телу (чек-лист §Д8 промта), главные: счёт агент-сессий = 58, не 50 (§6/§14) · противоречие §9/§13 против §12в о внешнем контуре · наклон border по текущему сырью +0.708, не +0.646 · боевые aj-border* — пере-штампованные копии replication-runA (mtime 23:31:54), исходный mtime-провенанс судейства утрачен · в голосах replication-runB — judge-имена прогона A (ingest читает JUDGES-файл прогона A).

ЗАКАЗА НА ЭТОТ ПАК НЕ СУЩЕСТВУЕТ. Промта на эксп-23 в docs/ нет: пак назначен сессией себе самой, владелец санкционировал только ДЕНЬГИ. Оркестратор уже пометил его как незаявленный. Пре-рег и реестр требований, на которые ссылается этот отчёт, написаны той же сессией и заказом не являются — читать их как самообязательство, а не как контракт. Содержательно пак закрывает дыру, объявленную самим эксп-22 (§13а: сильный тир был срезан из панели), но и она была не заданием, а его находкой. Список к подписи владельца — §14.

СТАТУС: замер закончен. Потрачено $2.907359 при пакетном потолке $4.00; судейство обоих проходов пере-снято после приёмки (tier — из-за отсутствия декоя, border — из-за подменённой базы арма, §0 и §3), пере-прогоны покупок не потребовали. Числа пере-считываются eval/editor_tier/itog23.py из персистированного сырья и сторожатся eval/editor_tier/verify23.py — ненулевой код возврата значит «отчёт не сдаётся».

Чего гейты НЕ доказывают, вопреки прежней редакции этой шапки. (1) Гейт чисел сторожит, что число ПРИСУТСТВУЕТ в тексте, а не что предложение вокруг него истинно; пороговые и сравнительные утверждения проверяются только чтением. (2) eval/conformance.py --final гонялся против реестра требований, который живёт в сессионном scratchpad и в репозиторий не попадает, — читатель его пере-снять не может, и «соответствие заказу проверено» отсюда не следует; вдобавок большая часть его улик — греп формулировок ЭТОГО ЖЕ отчёта, то есть отчёт проверял сам себя. (3) Прежняя редакция verify23.py пропускала проход, по которому нет ни одного голоса, и печатала «все числа сходятся» с нулём проверок — ровно так аннулированный border прошёл гейт. Починено; но каждый из трёх дефектов прошлые редакции этой шапки называли доказательством.

ИТОГ — ВХОД ДЛЯ РЕШЕНИЯ ВЛАДЕЛЬЦА

ЧИТАТЬ §0 ПЕРВЫМ. Судейство этого пака аннулировалось ДВАЖДЫ, по двум разным причинам: первый прогон — потому что в нём не создавался декой; второй, в части прохода border, — потому что у арма R0 на половине единиц была подменена база. Оба дефекта нашла приёмка, не автор. Ниже — числа третьего, принятого судейства: оба прохода с полным набором контролей, декой пойман в 16/16 и 32/32 единиц, отбраковок ноль.

Оба несущих ответа пака отрицательные, и это не осторожность формулировки, а результат. Ни сильный тир четырёх провайдеров, ни пограничный glm-5 не отличимы от боевого редактора deepseek-v4-pro на пороге, который кладёт собственный шум прибора. Рекомендация эксп-22 остаётся в силе — теперь на панели, где сильный тир присутствует, а не срезан. По правилу ничьей D39.117 это тем более так: deepseek-v4-pro из неразличимых ещё и самый дешёвый.

0. ДВА АННУЛИРОВАННЫХ ПРОГОНА И ЧЕМУ ОНИ УЧАТ

Хук декоя возвращал ригу ИМЯ арма вместо ТЕКСТА; порча садилась в строку «R0», давала 0 замен при пороге 2 и декой МОЛЧА не создавался — ноль контролей в обоих проходах. Нашло это адверсариальное ревью, которому было поручено искать вне карты отчёта; сам отчёт при этом ссылался на правило «сессия без пойманного декоя аннулируется».

Один и тот же оплаченный материал дал ПРОТИВОПОЛОЖНЫЕ ответы:

контраст            без декоя (run1, аннулир.)   с декоем (run2, ТОЖЕ АННУЛИРОВАН)   принято (run3)
T2 gpt-5.6-terra    +2.00  «БЬЁТ»                +0.50  ниже порога                  +0.50
T3 grok-4.5         +1.81  «БЬЁТ»                +0.19  ниже порога                  +0.19
R2 glm-5            0.09  «эффекта нет»         1.53  «ЗНАЧИМО ХУЖЕ»               0.81 ниже порога

Поправка фазы Д (чек-лист приёмки №16 п.7): прежде колонка называлась «с декоем (принято)», и в строке R2 под этим заголовком стояло 1.53 — число АННУЛИРОВАННОГО run2. Принятые числа tier (T2/T3) действительно из run2, а принятое число border — из run3, потому что run2 аннулирован именно по проходу border (подменённая база R0, §3). Один заголовок на две колонки разного статуса и порождал ошибку; теперь статус подписан у каждой.

Однофакторной эта таблица является только по строке border. В проходе tier между двумя прогонами изменилось ДВА: появился декой И появился позитивный контроль F (ключи: армы run1 [R0,T1,T2,T3], семейство из 3 строк · принятый [R0,T1,T2,T3,F], семейство из 4). Делитель Холма изменился 3→4, но ни один вердикт от этого не двигается. Чистая улика — border: там состав армов совпадает и добавлен ровно декой. Кроме того обе пачки судили разные, нигде не зафиксированные популяции судей (см. §8), так что «менялось только X» вообще не доказуемо этим дизайном — правильная формулировка «наблюдаемое различие сопровождало появление декоя».

Строка border в этой таблице — улика ПРО ДЕКОЙ, но ни одно её число не является ответом пака про glm-5. Оба сравниваемых прогона несли один и тот же дефект базы R0 (§3): он в сравнении удерживается постоянным, поэтому разница 0.09 против 1.53 по-прежнему говорит о влиянии декоя, — но правильный ответ снят третьим прогоном и равен 0.81. Не смешивать два утверждения: «декой меняет вердикты» пак показал, «вердикт по glm-5 такой-то» — только в §3.

Урок шире декоя. Каждый из трёх прогонов давал внутренне связную таблицу, и каждый раз неверным оказывался НЕ вывод из чисел, а само основание под числами: сперва отсутствующий контроль, потом подменённая база. Ни один из двух дефектов не был виден в результатах — оба нашлись только чтением кода и сверкой сырья. Отсюда практическое правило, а не мораль: пока контроль не напечатан числом рядом с боевым перевесом, «результат» — это гипотеза о работе прибора, а не о моделях.

Тексты не менялись, деньги не тратились — менялось наличие заведомо испорченного текста в судейской пачке. Механизм: декой задаёт судье масштаб настоящей ошибки. Без него судья сравнивает хорошее с хорошим и раздувает мелочь до величины реальной разницы (отсюда ложные +2.00) либо, наоборот, не находит разницы там, где она есть (отсюда ложный ноль). Косвенное подтверждение: в аннулированном прогоне половина единиц отбраковывалась за ненулевые оси БЕЗ цитат — судьям было нечего цитировать, они регистрировали различия, а не ошибки. В пере-прогоне отбраковка — ноль.

Одна отсутствующая проверка дала две ошибки РАЗНОГО знака. Контроль чувствительности судьи — не формальность протокола, а условие осмысленности любого числа пака.

1. СИЛЬНЫЙ ТИР НЕ ОТЛИЧИМ ОТ БОЕВОГО РЕДАКТОРА

16 единиц, побайтно одна якорная база, Холм по четырём. Порог различимости — шумовой пол СВОЕГО прохода, 1.02.

T1 glm-5.2         0.19  [0.56, +0.12]  Холм 1.0000     ниже порога различимости
T2 gpt-5.6-terra   +0.50  [0.06, +1.12]  Холм 0.5977     ниже порога различимости
T3 grok-4.5        +0.19  [0.12, +0.62]  Холм 1.0000     ниже порога различимости
R0 vs F (КОНТРОЛЬ) +2.06  [+1.19, +3.00]  Холм 0.0039 ✔   боевой редактор ПОКУПАЕТ поверх черновика

Формулировка выбрана буквально. Вердикт пре-рега — «ниже порога различимости при данном n», а не «различий нет»: у T2 интервал доходит до +1.12, то есть накрывает значения ВЫШЕ порога 1.02. Утверждать равенство армов эти данные не позволяют — они позволяют утверждать, что эффект меньше того, что прибор на 16 единицах способен развести.

Позитивный контроль — ключ к чтению. Прибор находит +2.06 там, где разница реальна (редактор против голого черновика), и не находит ничего между редакторами. Значит малость перевесов — это свойство армов, а не слепота прибора. Контроль F добавлен ПОСЛЕ аннулирования первого прогона: он впечатан в ключ до появления первого ответа судьи (пре-регистрация соблюдена), и на вердикты T1T3 не влияет — при семействе из 3 и из 4 поправка Холма даёт одни и те же величины.

Посылка 1 ПОДТВЕРЖДЕНА: дороговизна качества не покупает. Сильный тир четырёх провайдеров не даёт различимого выигрыша над deepseek-v4-pro.

2. ВЫВОД ЭКСП-22 УСТОЯЛ И ТЕПЕРЬ ПОДПЁРТ ПОЛНОЙ ПАНЕЛЬЮ

Эксп-22 рекомендовал deepseek-v4-pro и сам объявил (§13а), что вывод верен лишь ВНУТРИ панели, потому что сильный тир был срезан. Дыра закрыта: тир проверен и не лучше. Рекомендация остаётся, и теперь она стоит на панели, включающей сильный тир OpenAI, xAI и Z.AI.

3. ГРАНИЦА glm-5 НЕ РАЗРЕШЕНА: ЭФФЕКТ НИЖЕ ПОРОГА РАЗЛИЧИМОСТИ

32 единицы (16 эксп-22 + 16 новых), порог — шумовой пол СВОЕГО прохода, 1.48.

R2 glm-5 vs R0 боевой   0.81  [1.81, +0.28]  Холм 0.1601   ниже порога различимости
контроли: ДЕКОЙ 4.88 поймано 32/32 ✔ · ПОЛ 1.00 [2.06, +0.06] честен · побайтных дублей нет

Это ТРЕТЬЕ судейство прохода; первые два аннулированы. Второе давало 1.53 [2.19, 0.84], Холм 0.0002, и на нём стояли вывод «граница разрешена ПРОТИВ glm-5» и закрытие Резерва D39.22. Приёмка нашла в нём подменённую базу: на 16 из 32 единиц арм R0 был редактурой боевого редактора поверх ЧУЖОГО черновика, а не поверх якорного, — контраст сравнивал армы над разными основаниями. Причина в именовании эксп-22, где арм редактуры назван по ЧЕРНОВИКУ-жильцу, а не по редактору.

Что изменилось в третьем прогоне (покупок не потребовал, тексты те же): база R0 сверена побайтно с якорной редактурой эксп-22 — 16/16 · донор декоя уравнен по армам (было: порча во всех 32 единицах делалась из R0, а R0 — второй арм ЕДИНСТВЕННОГО контраста прохода; стало 16 из R0, 16 из R2) · идентичность судейских сессий персистирована (прежде во всех голосах стоял judge='?') · пере-суживание довело выборку до полных 32 единиц, отбраковок ноль.

Проверка, что уравнивание донора не подменило вывод: на 16 единицах с донором R0 перевес 0.81 и на 16 с донором R2 тоже 0.81 — вклад донора неотличим от нуля.

Поправка фазы Д: p пере-считаны ТОЧНО, а были оценкой. При n>20 риг брал Монте-Карло (200 000 розыгрышей, фиксированное зерно) — отсюда одна и та же величина печаталась в отчёте как 0.1603 и как 0.1608, то есть заявление «числа воспроизводятся до знака» на ней не выполнялось. Перевесы целые, поэтому распределение суммы ±xᵢ берётся динамикой по достижимым суммам ТОЧНО и мгновенно: p = 0.1601 (боевой прогон и runA), 0.3339 (runB). Ни один вердикт не двигается; двигалась только третья значащая цифра, и теперь она воспроизводима.

Расщепление по половинам (обе половины на правильной базе):

все 32 единицы        0.81   p 0.1601
16 старых эксп-22     1.62   p 0.0449
16 новых               0.00   p 1.0000

Половины расходятся: на старых 16 единицах перевес почти достаёт до порога, на новых он ровно ноль. Ни одна не проходит порог 1.48, но расхождение половин само по себе больше, чем удобно объяснять шумом, и различаются они ещё и составом глав. Это и есть граница того, что пак может сказать. Прежняя интерпретация — «прежний результат ВЕРЕН, а не артефактом малого n» — не воспроизвелась: контраст эксп-22 (2.12 на 16 единицах) при удвоении n и починенных контролях сжался до 0.81. ⇒ Ожидание пре-рега оправдалось: перевес сжался, а не устоял.

⚠ Что здесь НЕ утверждается. «Ниже порога» не значит «армы равны»: интервал тянется от 1.81 до +0.28. Знак отрицателен во всех трёх прогонах и в эксп-22, то есть слабое свидетельство против glm-5 есть — на этом приборе и этом n оно не доходит до различимого. Разрешается граница только ростом мощности (больше единиц или менее шумный судейский контур), а не пере-чтением этих чисел.

4. ЦЕНА (замер, 1500 единиц на книгу)

арм                 p50 edit  p95 edit  p50 связка  книга p50  книга p95   × к R0
R0 deepseek-v4-pro   0.00769   0.01573     0.00897     $13.45     $25.13     —
T1 glm-5.2           0.01725   0.01955     0.01879     $28.18     $31.66    2.09×
T2 gpt-5.6-terra     0.04408   0.04841     0.04544     $68.17     $74.88    5.07×
T3 grok-4.5          0.05276   0.06441     0.05397     $80.96     $97.88    6.02×
якорный черновик (общая база связки, входит в каждую связку): p50 0.00122

Прежняя редакция этой таблицы сравнивала связку с не-связкой. В строке R0 стояло 0.00545 — медиана ДВУХ клеток скрина эксп-22, не этих шестнадцати, — а книжные столбцы при ней были посчитаны по СВЯЗКЕ «черновик+редактор», тогда как у T1T3 те же столбцы шли по одной редактуре. Нескладность была видна в самой строке: 0.00545 × 1500 = $8.18, а напечатано $13.45. Ни один гейт её не трогал: пере-счёт спрашивал у эксп-22 метод edit_cost, которого у него нет, и строка молча выходила нулевой. Починено в itog23.py/verify23.py; теперь оба семейства колонок печатаются рядом и сторожатся. Вывод «сильный тир в 26 раз дороже» от починки не изменился — он и считался по связкам, просто напечатан был не тем числом. ⇒ Решение однозначно и не требует продуктового суждения: сильный тир стоит в 26 раз дороже и не даёт различимого выигрыша. Платить не за что.

5. ОТКАЗНОЙ РЕЖИМ KIMI — КЛЕТКА ЗАМЕРЕНА ПОД СВОИМ ПОТОЛКОМ (посылка 2 согласуется, но не различает)

kimi-k3 в редакторской роли — пустой выход при 99.9% доли размышления, $0.0804 за клетку. Особый режим (одна клетка вместо полного скрина), объявленный ДО покупок, сэкономил ≈$1.

Клетке был выдан СВОЙ потолок вывода: max_out=4000 против 16000 у всех остальных (screen.py:47), и сырьё показывает finish=length · completion 4000 · reasoning 3997 · content пуст. То есть модель уперлась в мой потолок, ещё не выйдя из фазы размышления. Прежняя редакция называла только «одну клетку вместо полного скрина» и умалчивала о потолке, а квирк-реестр проекта (00-provider-quirks.md) описывает ровно этот симптом как нехватку бюджета и предписывает ≥16000. Поэтому: вердикт по ЦЕНЕ твёрдый — $0.080406 уже выше порога роли $0.06, а при 16000 клетка стоила бы ≈$0.26; вывода об отказном режиме вендора эта клетка не даёт — она не различает «модель отказывается работать» и «мой потолок обрезал её на размышлении». Эксп-22 снимал kimi-k2.6 другим замером; повторением того результата это считать нельзя. Девиация — в §8.

6. ДЕНЬГИ И ДИСЦИПЛИНА

ФA скрин   $0.481038 / 1.10      ФC панель+пол  $2.080125 / 2.30
ФB единицы $0.346196 / 0.45      ПАК            $2.907359 / 4.00

Ни один потолок не пробит, деньги сведены двумя путями (расхождение ≤7e-6). Пере-прогон судейства покупок не потребовал. Дополнительная санкция владельца на $5 не понадобилась.

Потолок ФC поднимался ДВАЖДЫ; вот точная хронология по коммитам и mtime сырья.

03:21:57  фриз f1f9947  ФC 1.80 → 1.95, объявлено в коде фазы
04:37:39  первая покупка панели            ← 76 мин ПОСЛЕ фриза
05:17:43  последняя покупка панели         ← панель фактически стоила $1.798638
05:36:25  фриз 1f6d6ae  ФC 1.95 → 2.30
05:37:25  первая покупка шумового пола     ← 60 с ПОСЛЕ фриза

Ни один доллар не потрачен под незафризенным операционным потолком. Обе прежние редакции этого абзаца были неверны, и во взаимно противоположные стороны: сначала «поднят до покупок фазы» — умалчивая, что подъёмов было два; затем «правка попадает в середину окна покупок» — а она в него не попадает вовсе, второй подъём случился через 19 минут ПОСЛЕ последней покупки панели. Вторая формулировка была самооговором, написанным при пере-чтении по памяти, без сверки с git log.

Основание подъёма названо замером, а было проекцией. «Панель $1.844» — это оценка --c-plan по медианам цен фазы A, а фактическая панель стоила $1.798638, то есть влезала и в исходные $1.80. Честное основание второго подъёма другое и его надо назвать прямо: своему шумовому полу нужно было ещё $0.281487, и проекционный сторож кассы при потолке 1.95 отказал бы последним клеткам. Взят подъём из объявленного планом резерва пака ($0.65), пакетный потолок $4.00 не двигался. Расход резерва на СВОЙ шумовой пол — не то назначение, под которое резерв объявлялся («ре-гены эхо-мины и ретраи»), и правило пре-рега «не влезает — СТОП и пинг» исполнено не было: артефакта пинга нет. Вопрос владельцу — §14.

Позиционная поправка замерена и вычтена по ОБОИМ проходам. tier: наклон 0.006 ошибки на шаг метки, после вычитания 0.18 / +0.49 / +0.18 — вердикты не меняются. border: наклон +0.708 (раскладка этого прохода короче, и позиция весит заметно больше), поправка двигает контраст с 0.81 до 0.90 при p 0.0873 — вердикт «ниже порога различимости» не меняется ни до, ни после поправки, хотя после поправки контраст подходит к границе значимости ближе, чем до неё.

Поправка фазы Д (чек-лист приёмки №16 п.6): здесь стояло +0.646, а сырьё даёт +0.708. Величина, на которую делается поправка боевого контраста, печаталась не из тех голосов, из которых считается сам контраст. Числа с поправкой (0.90, p 0.0873) при этом верны — они пере-сняты и сходятся. Причина расхождения не установлена: промежуточные состояния разбора не сохранились, а голоса с тех пор пере-снимались дважды (гонка §8 п.10 и пере-разбор репликации ниже). В прибор — сделано: verify23 сторожит наклон ЧИСЛОМ по каждому проходу; прежде он не трогал его вовсе, хотя поправка на наклон — часть решающего правила.

Агент-запусков: 58 при капе 60. Первый (аннулированный) прогон 16 + пере-суживание 9 + пере-прогон tier 12 + адверсариальное ревью 1 + пере-судейство border 12 + репликация 8 (§12а). ⚠ Поправка фазы Д (чек-лист приёмки №16 п.4): в этой строке и в §14 п.9 стояло 50 — репликация из счёта выпала. Число 58 совпадает с §12а, где оно и было напечатано верно; расходились между собой две строки одного отчёта.

⚠ Первые 38 сочтены МНОЙ, а не механизмом: log_run был написан и ни разу не вызван, agent-runs.json не создавался, во всех голосах стоял judge='?'. С пере-судейства border учёт персистируется — на диске 20 записей (12 боевых + 8 репликации), раскладка «кто какие единицы судил» в border-JUDGES.json и replication-runB-JUDGES.json, в каждом голосе имя сессии. ⚠ «Считает механизм» сказать нельзя — файл записан РУКОЙ, скриптом, уже после судейства: в коде log_run зовётся из одного места и единственную пометку note='судейская сессия' произвести может, а три остальные, что стоят в записях, — нет. Значит: раскладка судей по единицам персистирована и пере-снимаема, а СЧЁТЧИК КАПА НЕ РАБОТАЕТ — на диске 20 против 58 фактических, и он пропустил бы ещё 60. Причина механическая: log_run вызывается из --ingest, то есть ПОСЛЕ суб-агента, а сторожить кап можно только записью ДО запуска. Проход tier не покрыт вовсе: tier-JUDGES.json не создан, во всех его голосах стоит judge='?', и восстановить это задним числом нечем. Починено в фазе Д, не здесь: eval/dovodka/runs.py пишет запись ДО запуска суб-агента, кап проверяет перед записью и вдобавок ОТКАЗЫВАЕТ выдать те же токены незакрытой сессии — механический замок против гонки §8 п.10. Селфтест 12/12.

ПРОВЕНАНС КАТАЛОГОВ СУДЕЙСТВА border УТРАЧЕН (поправка фазы Д, п.8). Боевые aj-border и aj-border-votes — пере-штампованные копии replication-runA-*: содержимое побайтно совпадает (diff -rq чист), а mtime всех файлов равен 2026-08-09 23:31:54, то есть моменту копирования, а не моменту судейства. Задания aj-border-tasks сохранили исходный mtime 17:55:26. Что из этого следует: содержательно боевой прогон и есть runA, и все его числа пере-снимаемы; но доказать ВРЕМЕНЕМ, когда именно судились боевые ответы, по диску больше нельзя — а гейт свежести разбора, заведённый после гонки (§8 п.10), опирается именно на mtime. Для этого пака он теперь сравнивает копии с копиями. Объявляю как ограничение, восстановлению не подлежит.

ГОЛОСА РЕПЛИКАЦИИ НЕСЛИ ИМЕНА СУДЕЙ БОЕВОГО ПРОГОНА (поправка фазы Д, п.9). absjudge.ingest читает карту судей по имени ПРОХОДА (blind-keys/border-JUDGES.json), а репликация судила ТЕ ЖЕ 32 токена вторым жребием и лежала в своих каталогах — поэтому все 32 её голоса получили имена agent-02…agent-12 вместо собственных agent-B1…B8. Перевесы от этого не двигаются (имя судьи в разность не входит, и §12а пере-снимается до знака: 0.62, ДИ [1.78, +0.53], p 0.3327, пол 1.00, порог 1.77, декой 4.50 при 32/32), но разложение дисперсии по сессиям и любое «согласие судей» считались бы по ложной раскладке. Починено механизмом: у рига появились крючки DIRS_HOOK и JUDGES_HOOK, у прогона — свои каталоги и своя карта; judge.py --run <прогон> <проход> --ingest пере-разобрал обе репликации. replication-runA-JUDGES.json при этом заведён копией боевой карты — runA и есть боевой прогон, и теперь КАЖДЫЙ прогон несёт собственную карту, а не наследует её от имени прохода.

§7 ЧЕТЫРЕ ПОСЫЛКИ — СВЕРКА С ФАКТОМ

# посылка (записана ДО замера) факт итог
1 сильный тир НЕ обязан выигрывать; вероятный исход — не побьёт deepseek-v4-pro ни один из троих не различим (0.19, +0.50, +0.19 при пороге 1.02) ПОДТВЕРЖДЕНА
2 отказной режим размышления — свойство ВЕНДОРА, kimi-k3 воспроизведёт отказ пустой выход при 99.9% размышления — но клетка шла под СВОИМ потолком 4000 (§5) СОГЛАСУЕТСЯ, НЕ РАЗЛИЧАЕТ: замер не разводит отказ вендора и обрыв на размышлении моим потолком
3 граница glm-5 разрешима ростом n, а не сменой судьи при n=32 и починенных контролях перевес сжался до 0.81, порога 1.48 не проходит (§3) ОПРОВЕРГНУТА как ожидание «разрешится», ПОДТВЕРЖДЕНА как прогноз «сожмётся»
4 внешний контур нужен, но не заменяет мощность; отсутствие Sol не блокирует пак закрыт без Sol; семейный слепой участок остался ПОДТВЕРЖДЕНА частично

⚠ Посылка 3 разошлась с прогнозом в другую сторону, чем объявлялось раньше. Пре-рег ожидал, что при удвоении n перевес сожмётся; аннулированный прогон дал «устоял и стал значим», и это записали как «ожидание не оправдалось». На исправленной базе перевес сжался — то есть прогноз пре-рега был верен, а неверна была промежуточная запись. Сама посылка («разрешима ростом n») не подтвердилась: удвоение n границу не разрешило, оно её закрыло в «не различимо».

Выводы, которые эта сессия объявляла и которые оказались неверны. Порядок важен, потому что объявлений было три волны, и каждая была подписана как окончательная.

  1. По числам ПЕРВОГО (аннулированного) прогона: «сильный тир бьёт боевой редактор», «вывод эксп-22 перевёрнут», «граница разрешена в ноль», «посылка 1 опровергнута» — все четыре неверны, держались на числах без контроля чувствительности судьи.
  2. По числам ВТОРОГО прогона: «граница разрешена ПРОТИВ glm-5, результат эксп-22 реплицирован на n=32» и закрытие Резерва D39.22 — сняты: половина материала шла с подменённой базой (§3).
  3. В самом отчёте после этого ещё держались §13 («тир оказался лучше», «D39.22 закрыт В ПОЛЬЗУ glm-5») — прямо против §1 и §3 того же документа, — и §12 с порогами из аннулированного прогона. То есть отчёт какое-то время противоречил сам себе, и это тоже нашла приёмка.

Общий механизм у всех трёх волн один: связная таблица принималась за истинную, а смелость вывода работала аргументом в его пользу. Ни одну из волн не остановил автор.

§8 ДЕВИАЦИИ И ДЕФЕКТЫ — ОБЪЯВЛЯЮ

  1. Половина первого прохода отвергнута разбором (8 из 16; во втором — 10 из 32). Причина одна: судьи ставили ненулевой счёт по оси, не подпирая цитатой, а разбор выбрасывает такую единицу ЦЕЛИКОМ. Это дефект МОЕЙ формулировки: в задании сказано, что обоснование обязательно, но не сказано, что цена нарушения — потеря всей единицы. Пере-суживание с явной ценой снизило отбраковку до нуля. Стоило 9 агент-запусков; денег не стоило.
  2. ЭХО-МИНА НА БОЕВОЙ БАЗЕ, И ГЕЙТ ПРОТИВ НЕЁ БЫЛ НАПИСАН, НО НЕ ПОДКЛЮЧЁН. et-unit-draft-deepseek-v4-flash-63ab55ac5c: 2243 знака при исходнике 2182, finish=stop — и в этих 2243 знаках 1798 иероглифов при НУЛЕ кириллицы. Это не «пересказ вместо перевода», как утверждала прежняя редакция пункта, а классическая эхо-мина: модель вернула исходник. Прежняя редакция объявляла и то, что «ни один гейт пака этого не ловит» — тоже неверно: bakeoff.draft_reject_reason ловит её штатно (пере-снято: вердикт «эхо исходника»), просто фаза B звала только проверку «строка не пуста». Гейт подключён; на этом паке он забраковал бы ровно эту единицу и больше ни одной из шестнадцати. Чувствительность вывода к ней замерена: без неё контраст границы 0.74 (p 0.21) против 0.81 (p 0.16) на всех 32 — порог 1.48 не проходит ни так, ни так, вердикт §3 не меняется. Что здесь верно и что было сформулировано неточно: вход у обоих армов контраста ДЕЙСТВИТЕЛЬНО одинаковый — это одна и та же база, — но оба редактора выдали полную длину, то есть достроили пропущенное из исходника и решали на этой единице ДРУГУЮ задачу (перевод, а не редактуру). Единица оставлена и объявлена. В прибор: гейт «длина клетки против длины ИСХОДНИКА с поправкой на пару языков»; сравнение с медианой соседних клеток этот случай не ловит, а на разноязычных пулах даёт ложные срабатывания (см. снятый пункт ниже).
  3. СНЯТО — было ложным срабатыванием, и оно уже ушло оркестратору. Прежняя редакция объявляла, что в сырье эксп-22 три клетки боевого редактора (8e50448cea, b065a92dc0, 53f1a12dff) оборваны до 22% длины, и отдавала это оркестратору как незамеченный дефект чужого пака. Пере-проверка: все три — из АНГЛИЙСКОГО пула (manifest.json, ключ en), их исходники ~1630 знаков, выходы 1590/1596/1638 при finish=stop, то есть ≈100% исходника. «22%» получалось только от сравнения с медианой пула, где преобладают zh-единицы с трёхкратным расширением. По собственному критерию этого отчёта («<70% медианы СВОЕЙ единицы») таких клеток ноль. Оркестратору: пункт отозван, дефекта эксп-22 здесь нет. ⚠ Прежняя редакция писала, что ложный пункт «уже ушёл оркестратору» — носителя у этого не было: отчёт не отслеживался git, в журнале и D-логе исходного утверждения нет. Носитель появился только сейчас, вместе с отзывом, — запись в docs/PROGRESS.md секции «Полигон» и §15 отчёта эксп-22.
  4. Девиация протокола судейства. Две сессии сообщили, что СРАВНИВАЛИ варианты между собой («чтобы точнее процитировать различия»), хотя задание требует оценивать каждый вариант только против исходника. Смещение от такого сравнения бьёт по арму-одиночке, а в проходе tier одиночка — как раз боевой редактор. Величину смещения по двум сессиям не оценить; факт объявлен. В прибор: запрещать не только сравнение, но и чтение вариантов рядом.
  5. Двусмысленная инструкция про оборванный вариант — относилась к клетке, которой в принятой конфигурации нет. Я велел судье «оценивать как есть и не достраивать»; судья прочитал это как «не штрафовать за обрыв». Клетка, на которой это наблюдалось, попадала в пачку только через дефект базы R0 (§0) и в исправленном ключе отсутствует; в другом голосе того же прогона судья пропуск, наоборот, засчитал. Формулировка всё равно неверна и правится («оценивать как есть» и «не штрафовать за неполноту» — разные вещи), но как НАБЛЮДЕНИЕ пункт снят: воспроизводимого случая в принятых данных нет.
  6. Реализация скрина применила критерий, которого нет в пре-реге. Код переиспользовал вердикт эксп-22 целиком, вместе с ПЕРЕВОДЧЕСКИМ порогом $0.02, — а пак скринит редакторов, и пре-рег называет только редакторский порог $0.06. Лишний порог снял gpt-5.6-terra и grok-4.5, то есть обоих, ради кого пак существует. Снимать критерий после результата — подгонка, поэтому печатаются ОБА вердикта: пре-рег-критерий как несущий, полный критерий эксп-22 как справка (§10). Провенанс: фризы c0dd228 02:44:28 и 87247e2 02:45:04, первая покупка 02:45:35 — запас 31 секунда, а не минута, как читалось. ⚠ «План старше обоих» с диска НЕ доказуемо: план пака лежит в эфемерном scratchpad и в git не фризовался (git log --all -- '*plan23*' пуст), колонка улик его реестра дописывалась по ходу. Неизменяемый провенанс здесь несут только фриз-коммиты и запись сессии — то же снижение, что уже сделано в §6.
  7. Я СНЯЛ ЗАМКИ У ЖИВОГО ПОКУПАЮЩЕГО ПРОГОНА. Увидев в каталоге сырья зависшие *.lock и решив, что они остались от упавшего процесса, я удалил их, пока покупки ещё шли. Атомарный замок (money.py:219, O_CREAT|O_EXCL) — единственное, что разводит параллельных покупателей; именно его отсутствие стоило эксп-22 верхней границы невозвратной пере-оплаты ≤$0.846103 на 176 клетках (его §-о деньгах). Ущерба не случилось только потому, что второго покупателя в тот момент не существовало: удача, а не дисциплина. Ни один гейт этого не ловит и поймать не может — удаление файла руками вне кассы. В прибор: снимать замок только тем же процессом, что его поставил, а «зависший» замок опознавать по живости PID, а не по виду каталога.
  8. Коллизия само-импорта, четырежды. Модули пака (roster, screen, money, плюс тестовый файл) грузились по имени и подхватывали одноимённые модули эксп-22 вместо своих. Один случай прошёл МОЛЧА и исказил замер: селф-тест проверял 11 моделей из 15 и печатал зелёное. Чинено явной загрузкой по пути (_load), но найдено это чтением вывода, а не гейтом.
  9. Фриз фазы A попутно изменил риг ЧУЖОГО пака. Тот же коммит c0dd228 тронул eval/tenant_panel/material.py (приколка единиц манифестом) и money.py под заголовком про editor-tier. Зона не нарушена (весь eval/ — зона полигона) и изменение объявлено в §11, но код, породивший уже принятые числа эксп-22, изменён задним числом под чужим заголовком. Гейты эксп-22 после этого пере-снимались; их зелёность после правки — в §14, вопрос 7.
  10. ГОНКА ДВУХ КРУГОВ СУДЕЙСТВА И РАЗБОР В ЕЁ СЕРЕДИНЕ. Пять единиц прохода border (13514e13f0, 15f002335d, 1ffe99dc43, 225001778a, 87dd50b129) я отдал на пере-суживание ДВАЖДЫ, не дождавшись первого круга: второй круг записал ответы, я прогнал --ingest в 18:36:56, а первый круг дописал те же самые файлы в 18:3818:41. В итоге голоса были от одного круга, а сырьё на диске — от другого, и расходились они по всем пяти единицам. Числа при этом сходились с отчётом, потому что и отчёт, и гейт читали ГОЛОСА: ни verify23, ни itog23 не сравнивали их со временем ответов. Нашёл аудит закрытия заказа, не автор и не первая приёмка. Как разрешено. Голоса пере-снят с текущего сырья — правило «сырьё на диске главнее», а не «то, что уже напечатано»: иначе опубликованное число было бы невоспроизводимо для читателя. ⚠ Оба набора я видел ДО выбора правила, и это надо знать при чтении: первый круг давал 0.59 (порог 1.43), второй 0.81 (порог 1.48). Вердикт «ниже порога различимости» одинаков в обоих, а вот расщепление половин при этом заметно двигается (было 1.44/+0.25, стало 1.62/0.00) — то есть устойчив здесь только знак и вывод, но не величины по подвыборкам. В прибор — сделано: verify23 роняет пак, если хоть один ответ судьи новее своего голоса. Это первый гейт пака, сторожащий не число, а ПОРЯДОК СОБЫТИЙ.
  11. Моя ошибка чтения по ходу. На n=14 я озвучил «преимущество не различимо», зная, что две единицы ещё не вернулись. Вывод на неполных данных — та же ошибка, что и вывод на агрегате без вскрытия единиц.

Поправка фазы Д (чек-лист приёмки №16 п.10): нумерация этой секции была сломана. На диске шёл ряд 16, 8, 9, 10, 7, 7 — два разных дефекта под номером «7», и ссылка §14 п.7 вела на «§8 п.8», которого не существовало. Пункты пере-нумерованы по порядку в документе (тексты не тронуты), ссылки на них поправлены. Причина сбоя видна по содержанию: пункты 7 и 11 дописаны последними, аудитом закрытия заказа, и вставлены в хвост без сверки с уже занятыми номерами.

§9 ЧТО НЕ ПЕРЕНОСИМО

  • Проход tier по-прежнему снят ОДНОЙ модельной семьёй. Для border ограничение снято внешним судьёй (§12в); тексты tier он не читал, и вывод «сильный тир не отличим» подписи вне Claude не имеет.
  • ОДНОЙ МОДЕЛЬНОЙ СЕМЬЁЙ СНЯТЫ НЕ ТОЛЬКО ЧИСЛА, НО И ВСЯ ПРИЁМКА. Это признаётся здесь впервые и это отдельный дефект, а не повтор предыдущего пункта. D39.120 требует на текстовых и оценочных линзах хотя бы одного опровергателя ДРУГОГО модельного семейства; владелец сверх того прямо разрешил сессии запустить агентов Fable-5 под ревью. Ни то, ни другое не исполнено: все судьи, все линии приёмки, все опровергатели и весь аудит закрытия заказа отработали на Opus-5. То есть монокультура, которую отчёт объявляет ограничением ЗАМЕРА, ровно в той же мере поражает и МЕХАНИЗМ ПРОВЕРКИ замера — а именно он трижды подписывал числа, оказавшиеся артефактами. Разрешение владельца на другое семейство лежало неиспользованным всё время работы пака.
  • Внешний контур есть у border и НЕТ у tier — ⚠ поправка фазы Д (чек-лист приёмки №16 п.5). Прежняя редакция этого буллета гласила «все судейские числа сняты одной модельной семьёй, внешнего судейского контура нет и здесь», то есть прямо против §12в того же отчёта, где подпись судьи вне Claude по проходу border напечатана числами (1.00 при пороге 3.53, декой 32/32). Верная форма: для border ограничение СНЯТО, для tier — стоит в полную силу (первый буллет этой секции). Отдельная линия — Sol-пакет (а) эксп-22: прогнан владельцем 09.08, но арбитраж не состоялся (эксп-22 §16: три единицы на контраст, дрейф шкалы ×2.6, знак совпал в 3 парах из 9); пакет (б) не запускался. Ограничение по tier несущее, а не формальное: его вывод — что перевесы сильного тира НЕ доходят до порога, — есть утверждение о том, чего судья не различил, и оно тем слабее, чем однороднее судьи. Отдельно: идентичность судей tier не персистирована (§6), поэтому согласие между ними даже внутри семьи посчитать нечем.
  • Декой во всех единицах принятого прохода tier посажен из одного и того же арма — R0 (замер по ключу: 16/16), а R0 стоит вторым армом в каждом контрасте этого прохода. Если само присутствие испорченного близнеца двигает оценку донора, оно двигает её в одну сторону во всех трёх контрастах сразу. Прямой улики за или против нет: ни один сохранённый голос не содержит рассуждения «это копия другой метки». Косвенная — R0 против голого черновика даёт +2.06, а T1/T2/T3 против него же +1.88 / +2.56 / +2.25, то есть R0 лежит ВНУТРИ разброса панели, грубого смещения донора не видно. Для прохода border донор с этого пере-прогона уравнен: 16 единиц из R0, 16 из R2.
  • Одна книга, одна пара языков, 16 единиц панели. Всё, что зависит от свойств текста, обязано пере-меряться.
  • Вывод про gemini-3.1-pro по-прежнему отсутствует — он не входил в этот пак.
  • kimi-k3 замерен ОДНОЙ клеткой по объявленному особому режиму И под своим потолком вывода (§5): твёрдым остаётся только вердикт по ЦЕНЕ; ни о качестве его прозы, ни об отказном режиме вендора этот замер не говорит.

§10 ФАЗА A — СКРИН СИЛЬНОГО ТИРА

Пороги взяты у эксп-22 БЕЗ изменения — порог из прошлого пака единственное, что защищает состав от подгонки, а состав здесь и есть предмет спора.

модель             вердикт  ед.  $/ед edit  размышл  причины
gpt-5.6-terra       прошёл    4    0.04250     6.6%
grok-4.5            прошёл    4    0.05481    69.5%
glm-5.2             прошёл    4    0.01792     0.0%
kimi-k3             ПРОВАЛ    1    0.08041    99.9%  Г5 цена editor > $0.06 · Г6 выход пуст

Справка — полный критерий эксп-22 (с переводческим порогом $0.02, которого в пре-реге этого пака нет): gpt-5.6-terra ПРОВАЛ ($0.03668), grok-4.5 ПРОВАЛ ($0.03445), glm-5.2 прошёл ($0.01396), kimi-k3 ПРОВАЛ. Разница между двумя колонками — целиком §8 п.6.

Цены — с ВЕНДОР-страниц 09.08: gpt-5.6-terra $2.00/$0.20/$12.00 · kimi-k3 $3.00/$0.30/$15.00 · grok-4.5 $2.00/$0.30/$6.00 · glm-5.2 $1.40/$0.26/$4.40. Слаги — живой листинг /models того же дня. Попутно закрыта дыра эксп-22: его цена gpt-5.6-luna не подтверждалась живьём (Cloudflare 403) и ехала из прошлых паков — страница открылась и подтвердила её ровно.

§11 МАТЕРИАЛ

16 НОВЫХ единиц из 16 разных глав (22, 2530, 3236, 3942), знаков 2077…2251, медиана 2141, макс. попарная близость 0.091. Пересечений с эксп-22 — ноль: его главы исключены ЦЕЛИКОМ, иначе «новые» единицы были бы соседними абзацами тех же глав и делили бы с ними сцену и лексику, а прирост мощности оказался бы мнимым. Гейт прав пересчитан по СВОЕМУ пулу (верхний дециль по плотности эротических маркеров), а не перенесён константой «2» из эксп-22.

Побочный эффект докачки глав, который пришлось чинить. Материал эксп-22 отбирался «из середины распределения длин» по содержимому диска; докачка с 18 глав до 42 СДВИНУЛА его единицы (главы 318 → 2,5,9…41), то есть его гейты стали бы считать по материалу, который никто не покупал. Единицы эксп-22 приколоты к его манифесту отбора; все четыре его гейта после этого зелёные. Правило отбора теперь применяется только когда манифеста ещё нет.

§12 КОНТРОЛИ РИГА (читать ДО боевых чисел)

проход  ДЕКОЙ (порча против чистого)   ПОЛ (истинная разница ноль)       БЛИЗНЕЦ
tier    3.94  поймано 16/16 ✔         0.62 [1.38, +0.06]  порог 1.02  пара CTRLfloorA≡T1, ноль
border  4.88  поймано 32/32 ✔      1.00 [2.06, +0.06]  порог 1.48  побайтных дублей нет

Декой — посаженная в чистый текст деградация — обязателен в каждом проходе: судейская сессия, не поймавшая его отрицательным знаком, аннулируется целиком (так эксп-22 списал 6 агент-запусков). Пол ЧЕСТЕН: ноль внутри интервала, и порог различимости берётся ИЗ НЕГО — это решающее правило пака, поэтому §1 читается против 1.02, а §3 — против 1.48.

Прежняя редакция этой секции печатала пороги 1.65 и 1.58 — они из ПЕРВОГО, аннулированного прогона (пере-снято: annulled-run1 даёт ровно 1.65 и 1.58). Секция объявлена «читать ДО боевых чисел» и задаёт порог различимости, так что отчёт выдавал читателю два разных порога на одну величину: §1 читался против 1.02, а §12 печатал 1.65 — и при напечатанном 1.58 тогдашний вывод §3 в порог не проходил вовсе, то есть документ противоречил сам себе по несущему вердикту. Средние 0.29 и 0.42 из той же строки не воспроизводятся НИ ИЗ ОДНОГО набора голосов на диске и при n=16 недостижимы арифметически (среднее целых ошибок кратно 1/16); откуда они взялись — не установлено, промежуточные состояния разбора не сохранились. Гейт этого не ловил: он сверял лишь наличие слова «пол». Починено — verify23.py теперь сторожит и величину пола, и порог, и величину декоя числом.

«БЛИЗНЕЦ» в проходе tier — не контроль. Единственная побайтно совпадающая пара пачки это CTRLfloorA и T1, в 16 единицах из 16, и совпадают они по построению: первой половиной шумового пола panel.floor_pair отдаёт саму боевую клетку T1, докупается только вторая генерация. «Перевес ровно ноль в 16/16» означает лишь, что один и тот же текст под двумя метками получил одну оценку внутри одного ответа судьи; воспроизводимость оценки из этого НЕ следует, и как контроль эта строка пуста. Замерено и смежное: связи между оценкой пары и боевым перевесом нет (корр. 0.05). Против такого переиспользования прямо предупреждает комментарий в риге эксп-22 — я его воспроизвёл. В прибор: половиной пола брать отдельную генерацию, не клетку панели.

§12б ПОРОГ БЫЛ ЗАНИЖЕН НА 19% — РАЗЛОЖЕНИЕ ДИСПЕРСИИ

Найдено после сдачи, вопросом владельца «ты не преуменьшаешь?». Шумовой пол этого рига меряет пару, у которой ОБЕ половины судит один и тот же судья, — значит межсудейская разница в него не попадает по построению, а боевые перевесы её несут. Порог, взятый из такого пола, занижен.

Разложение дисперсии перевеса по 8 сессиям прохода border (n=32):

внутри сессии    sd 2.903
между сессиями   sd 1.030      ← в шумовой пол НЕ попадает
se среднего      0.513 наивная → 0.629 с учётом межсессионной (×1.23)
ПОРОГ            1.48 напечатанный → 1.76 честный

Пересчёт вердиктов по честному порогу — ни один не двигается, и все, кроме одного, крепнут:

R2 glm-5 vs R0    0.81 · 1.48 → 1.76 · ниже порога
T1 glm-5.2        0.19 · 1.02 → 1.53 · ниже порога
T2 gpt-5.6-terra  +0.50 · 1.02 → 1.68 · ниже порога
T3 grok-4.5       +0.19 · 1.02 → 1.55 · ниже порога
R0 vs F КОНТРОЛЬ  +2.06 · 1.02 → 1.94 · РАЗЛИЧИМ

Почему занижение порога не породило ложных выводов. Заниженный порог делает вывод «различимо» слишком лёгким. Все несущие выводы пака отрицательные — заниженный порог им не помогает, а мешает; единственное положительное утверждение это позитивный контроль, и он проходит с запасом даже по строгому порогу. Направление риска здесь — что пак ПРОЗЕВАЛ реальную разницу, а не выдумал её.

Для прохода tier межсессионная компонента ЗАИМСТВОВАНА с border. Оценить её на своих данных нельзя: идентичность судей tier не персистирована, во всех голосах стоит judge='?' — прямое следствие дефекта учёта (§6). Задним числом не восстановить.

Эмпирическая проверка этой поправки — §12а. Прямая репликация новым жребием судей дала расхождение средних 0.19 при ожидании ≈1.0, то есть поправка скорее консервативна. Уточнять её по двум прогонам нельзя — это оценка по n=2.

В прибор: шумовой пол обязан браться парой, чьи половины судят РАЗНЫЕ сессии. Тогда он ловит обе компоненты, и порог не требует ручной поправки.

§12в ВНЕШНИЙ СУДЬЯ ВНЕ СЕМЬИ Claude — ПРОХОД border ЗАКРЫТ ТРЕТЬЕЙ ПОДПИСЬЮ

Заказано владельцем после того, как он указал: все выводы пака сняты агентами одной модельной семьи, и мнения судьи другой семьи о КАЧЕСТВЕ этих переводов никто не спрашивал. Замечание было верным — предыдущая попытка внешнего контура (Sol-пакет эксп-22) судила тексты ЧУЖОГО пака и развалилась по устройству (эксп-22 §16).

Что сделано. Внешнему судье (не-Claude, локально, руками владельца, 4 сессии по 8 единиц) отданы ТЕ ЖЕ файлы заданий aj-border-tasks/*.txt, которые судили агенты пака: тот же исходник, те же армы под теми же слепыми метками, тот же декой и тот же шумовой пол в пачке. Поэтому его счёт сопоставим с моим текст-в-текст. Пере-снимается командой eval/.venv/bin/python eval/editor_tier/solscore.py; ответы в ~/books/editor-tier/sol-border/.

судья                уровень  перевес R2     пол   порог   вердикт
внешний, не-Claude      11.0       1.00   1.88    3.53   ниже порога различимости
мой прогон A             7.0       0.81   1.00    1.48   ниже порога различимости
мой прогон B             7.0       0.62   1.00    1.77   ниже порога различимости

Принято 32 из 32 единиц, отказов ноль, ДЕКОЙ пойман 32/32.

Ограничение «все судейские числа сняты ОДНОЙ модельной семьёй» для прохода border снято — но снято СЛАБО, и это надо читать вместе с числами. Вывод «граница glm-5 не разрешена, эффект ниже порога различимости» подпись судьи вне Claude имеет. ⚠ Поправка фазы Д, найденная приёмкой другого модельного семейства: у внешнего прибора шумовой пол sd 5.05 и порог 3.53, а боевой контраст прохода 0.81. Значит внешний судья не мог противоречить нулевому вердикту НИ ПРИ КАКОМ исходе, кроме эффекта вчетверо больше замеренного — он и позитивный контроль масштаба +2 не развёл бы. Подпись под отрицательным выводом на таком приборе почти автоматична, и «ограничение снято» звучит сильнее, чем даёт замер. Честная форма: внешний контур подтвердил, что эффекта РАЗМЕРА, ВИДИМОГО ЕМУ, здесь нет; про эффекты меньше 3.5 ошибок он не высказывался. ⇒ И следствие вперёд: та же оговорка накроет внешнюю подпись прохода tier (заказ фазы Д, п.Д2) — там боевые перевесы 0.19…0.50, то есть на порядок ниже разрешения внешнего прибора. Объявляется ЗАРАНЕЕ, до прогона, а не после: подпись будет означать «внешний судья тоже не увидел», а не «внешний судья подтвердил равенство». Для прохода tier внешней подписи по-прежнему нет: судья его текстов не читал.

Замер межсемейного расхождения — побочная находка, для рига ценнее самого вердикта.

согласие по единицам (корреляция перевесов)   знак совпал
внешний ↔ мой A      +0.317                    22/32
внешний ↔ мой B      +0.334                    24/32
мой A ↔ мой B        +0.627                    26/32

Расхождение МЕЖДУ семьями примерно вдвое больше, чем ВНУТРИ семьи. И прибор другой семьи заметно грубее: его шумовой пол sd 5.05 против 2.12 у моих, отсюда порог 3.53 против 1.48 — он честен, но разрешает вдвое хуже. Практическое следствие: для вопроса «есть ли разница вообще» судьи разных семей взаимозаменяемы; для контраста тоньше двух ошибок на единицу смешивать их в один пул без нормировки нельзя — различаются и шкала, и разрешение.

§12а РЕПЛИКАЦИЯ ПРОХОДА border НОВЫМ ЖРЕБИЕМ СУДЕЙ

Заказана владельцем как проверка методики: «давай перегоним и посмотрим». Меняется РОВНО один фактор — состав судейских сессий. Ключ, слепые метки, посадка декоя, тексты и задания те же файлы, не пере-выпускались. Правило публикации записано ДО запуска: прогон A остаётся опубликованным, B — проверка; при расхождении вердиктов находкой считается само расхождение, а не удобный прогон; складывать A и B в один набор запрещено — это разные жребии.

                      прогон A        прогон B
перевес R2 vs R0        0.81           0.62
95% ДИ            [1.81,+0.28]   [1.78,+0.53]
p (Холм)               0.1601          0.3339
шумовой пол             1.00           1.00
порог прохода            1.48            1.77
декой              4.88, 32/32    4.50, 32/32
уровень (медиана)         7.5             6.8

Вердикт «ниже порога различимости» воспроизвёлся. Расхождение средних |AB| = 0.19 при пред-объявленном ожидании ≈1.0 — то есть прибор на уровне ВЫВОДА заметно устойчивее, чем следовало из моей же оценки межсудейской компоненты. Корреляция перевесов по единицам +0.63, знак совпал на 26 единицах из 32.

Что при этом НЕ воспроизводится — отдельные единицы. Разность перевесов по-единично имеет sd 2.78 при среднем +0.19: на ОТДЕЛЬНОЙ главе армы не упорядочены, новый жребий судей переставит их местами примерно в каждой пятой. Устойчиво только среднее по единицам. Риг об этом предупреждает в собственном выводе, теперь это подпёрто прямым замером, а не рассуждением.

Цена: 8 агент-сессий, по паку стало 58 из капа 60. Покупок не потребовалось. Оба прогона лежат рядом: ~/books/editor-tier/replication-runA-* (опубликованный) и replication-runB-*.

§13 ДИСПОЗИЦИИ

⚠ Прежняя редакция этой секции несла выводы АННУЛИРОВАННОГО прогона («тир оказался лучше», «D39.22 закрыт в пользу glm-5») — прямо против §1 и §3 того же отчёта, который сам перечисляет эти выводы как снятые. Секция, из которой переносится закрытие строк реестра, была последней, где я не сверился с собственными числами.

  • Строка про сильный тир (дыра эксп-22 §13а)ЗАКРЫТА: тир проверен, различимого выигрыша над боевым редактором нет, а стоит он в 26 раз дороже (§1, §4). Платить не за что; рекомендация эксп-22 (deepseek-v4-pro) остаётся и теперь стоит на панели, включающей сильный тир OpenAI, xAI и Z.AI. Решения владельца по цене НЕ требует — требовало бы при обратном знаке.
  • Резерв D39.22 (glm-5)ЗАКРЫТИЕ НЕ ОБЪЯВЛЯЮ, подаю ПРЕДЛОЖЕНИЕ. Это ратифицированное решение владельца, и права закрывать его полигон-сессии не давалось; эксп-22 от закрытия воздержался. Замер: на 32 единицах с полным набором контролей glm-5 от боевого редактора не отличим (0.81 при пороге 1.48, §3), то есть основания «он значимо хуже», на которое сессия дважды ссылалась, НЕТ. Предложение: снять резерв как контраст, требующий отдельного разбора, и вести glm-5 по общему правилу ничьей D39.117 — а оно оставляет deepseek-v4-pro, поскольку тот дешевле. Отдельно к решению: ToS-гейт Z.AI на прод-выбор glm-5 никуда не делся (§9 эксп-22).
  • Sol (строка 150) — пакет (а) прогнан владельцем 09.08 и дал отрицательный результат по своей задаче (эксп-22 §16); пакет (б) НЕ запускать до починки оснастки: та же конструкция, N_UNITS_B = 3. ⚠ Поправка фазы Д (п.5): здесь стояло «внешнего судейского контура у обоих паков по-прежнему нет» — неверно и против §12в. Контур ПОСТРОЕН и сработал, но на заданиях абсолютного рига, а не на пакетах конструкции Sol, и покрывает он проход border. Не покрыты: проход tier (задания aj-tier-tasks внешнему судье не отдавались) и оба контраста эксп-22, ради которых пакеты (а)/(б) и делались.
  • Строка 153 и вторая база Ф3 — не гнались, как и в эксп-22.

§14 CONFIRM / DENY — К ПОДПИСИ ВЛАДЕЛЬЦА

Ниже — всё, что этот пак принял на веру, назвал решением или сделал вне объявленного. Ни один пункт не считается ратифицированным, пока не подтверждён; пометка «со слов сессии» означает, что артефакта в репозитории нет и проверить нечем, кроме записи разговора.

# что статус
1 Мандата на пак 23 не существует — промта нет, пак самоназначен, санкционированы только деньги подтвердить задним числом или отменить
2 Потолок пака $4.00 и запас $5со слов сессии, в репо артефакта нет подтвердить провенанс
3 Резерв D39.22 закрывать не мне: это решение владельца (§13) принять к сведению
4 Правило «судейская сессия без пойманного декоя аннулируется целиком» живёт только в промте ЧУЖОГО пака; я применил его к себе дважды ратифицировать как норму или отменить
5 Потолок ФАЗЫ поднимался дважды в ходе пака, резерв ушёл не на объявленное назначение, пинга не было (§6); пакетный потолок не пробит норма или запрет
6 Учёт агент-запусков до этого пере-прогона вёлся мной, а не механизмом (§6); с пере-судейства border он персистируется, но задним числом первые 38 восстановить нечем принять со слов или считать неучтённым
7 Фриз фазы A пака 23 попутно изменил риг эксп-22 (§8 п.9). Его гейты пере-сняты сейчас — verify22.py и itog22.py зелёные, код возврата 0 к сведению; вопрос только в том, нормально ли править чужой пак под своим заголовком
8 Провенанс цен OpenAI и xAI — снимка вендор-страницы нет, только живой листинг /models и комментарий в коде принять или требовать снимок
9 Пере-судейство прохода border — 12 агент-сессий, денег $0; всего по паку 58 сессий при капе 60. ⚠ Поправка фазы Д (п.4): здесь стояло «50» и «теперь считает механизм» — первое не считало репликацию (§12а), второе прямо опровергнуто §6: на диске 20 записей против 58 фактических, СЧЁТЧИК КАПА НЕ РАБОТАЕТ. Персистирована только раскладка судей по единицам санкция задним числом

ФАЗА Д — ДОВОДКА ЭКСП-22/23 (заказ владельца 10.08)

Исполнение docs/POLYGON_EXP2223_REDO_SESSION_PROMPT.md. Это НЕ новый эксперимент: выводы паков 22 и 23 признаны владельцем непоказательными по постановке и заморожены до этой фазы. Зона — eval/dovodka/ + правки рига паков 22/23 + эти секции.

Д0 ПРЕ-РЕГ (зафризен своим коммитом ДО первой покупки)

Д0.1 Гипотезы владельца — ДОСЛОВНО из заказа

H-1 «Проблема в черновике»: flash даёт полумусор, полный перепис нужен именно поэтому; связка «качественный черновик + ТОЧЕЧНЫЙ редактор» ≥ боевой связки по качеству при сравнимой цене.

H-2а «Флаговый edit-контур»: детерминированные флаги (батарея + канон-гейт) → точечный фиксер — не хуже full-regen по судье, дешевле по деньгам, НЕ ломает канон.

H-2б «Смысловой edit-контур» (главная ставка владельца, 10.08): LLM-критик, читающий и ПОНИМАЮЩИЙ текст («найди всё проблемное») → точечный фиксер — дороже (поиск ≈2.14× переписа), но качество выше и full-regen, и флагового контура: «флагами всё не отследишь». Цена заложена в смету сознательно — гипотеза о КАЧЕСТВЕ, не об экономии.

H-3 «en: перепис не нужен»: на en→ru редактору остаются только синк глоссария и точечные правки.

H-4 «dspro-китайскость»: перевес dspro в редакторской роли — свойство пары zh→ru; на en/ja порядок жильцов может смениться (dspro — китайская модель, книга — китайская).

Д0.2 ДВА АРМА ЗАВЕДЕНЫ ПРИЁМКОЙ, А НЕ АВТОРОМ — и без них две гипотезы не мерились

Первая редакция плана этой фазы не отвечала на H-1 и H-4, и нашла это не сессия, а приёмка другого модельного семейства (Fable-5, разрешение владельца D39.120 наконец использовано):

  • H-1 говорит о связке «КАЧЕСТВЕННЫЙ черновик + точечный редактор». Ни один арм плана такой связки не содержал: A1/A3 ставят фиксер на flash-черновик — то есть на полумусор по самой формулировке гипотезы, — а A2 есть однопроходка вовсе без редактора. Гипотеза «отвечалась» бы интерполяцией между армами, где взаимодействие «фиксер × качество базы» не меряется вовсе. ⇒ заведён арм A6 = dspro-черновик эксп-22 + оба контура. Черновики уже куплены ($0 за базу).
  • H-4 говорит о смене ПОРЯДКА жильцов на другой паре. Порядок проверяется только панелью из НЕСКОЛЬКИХ редакторов, а на en-оси редактор стоял один — deepseek-v4-pro. Фаза сказала бы «сколько покупает редактура на каждой паре» (это H-3), но не «остаётся ли dspro лучшим». ⇒ заведён арм E6 = второй редактор glm-5 на en поверх той же базы.

Стоимость починки $0.48; потолок фазы поднят владельцем $4.00 → $4.50 ровно под неё.

Д0.3 Мощность каждой оси — ДО покупок (eval/dovodka/power.py)

ось                        n  k    sd    MDE   ЦЕЛЬ  потолок p  СТАТУС
Д4 edit-контур zh         32  5  2.12   1.29   1.50     0.0000  НЕСУЩАЯ
Д3 en→ru несущая          16  5  2.12   1.83   2.00     0.0002  НЕСУЩАЯ
Д6 ja→ru разведка          9  3  2.90   3.33   2.00     0.0117  ⛔ ОПИСАТЕЛЬНАЯ
Д1 gemini добивка         16  1  2.12   1.83   2.00     0.0000  НЕСУЩАЯ

ЦЕЛЬ — искомый эффект, объявленный ДО денег. Без неё MDE не решает ничего: печатать «MDE 1.83» и не сказать, меньше он искомого или больше, — ровно та форма, за которую погорела en-ось эксп-22 (там при n=6 и k=6 потолок p был 0.1875, то есть значимость недостижима ПО ПОСТРОЕНИЮ, и выяснилось это после денег). Ось объявляется описательной, если MDE больше цели ЛИБО значимость недостижима.

Следствие, которое надо знать заранее: при n=12 (минимум промта) ось Д1 имела бы MDE 2.11 против цели 2.00 и была бы ОПИСАТЕЛЬНОЙ. Несущей её делает решение владельца взять полные 16.

Прайор шума — не свой пол. Своего пола у будущего прохода нет по построению; берётся худший из замеренных на той же структуре армов (border, sd 2.12). Решает СВОЙ пол, и если он выйдет хуже прайора, ось пере-классифицируется в описательную ТОГДА ЖЕ — до чтения боевых перевесов.

Д0.4 ЗАПАС ЭКВИВАЛЕНТНОСТИ для H-2а — иначе «не хуже» доказать нечем

H-2а утверждает, что флаговый контур НЕ ХУЖЕ полного переписа. Риг устроен так, что «ниже порога различимости» не означает «равны» — это записано во всех отчётах и здесь не меняется. Значит подтвердить H-2а обычным контрастом невозможно в принципе: отсутствие значимой разницы не есть равенство, и CONFIRM был бы сделан формулировкой, а не числом.

Пред-объявляю правило non-inferiority: A1A3) признаётся «не хуже» A0, если нижняя граница 95% ДИ контраста выше 1.50 — той же величины, что объявлена целью оси Д4 (треть собственного эффекта редактора +4.44 в эксп-22 Ф3). Три исхода и все три названы заранее:

  • нижняя граница > 1.50 и верхняя < +1.50 → НЕ ХУЖЕ (H-2а подтверждена по качеству);
  • верхняя граница < 1.50 → ХУЖЕ (H-2а опровергнута);
  • интервал накрывает 1.50 → НЕ УСТАНОВЛЕНО при данном n, и это честный третий исход, а не провал: мощность объявлена, доборы обсуждаются с владельцем.

Д0.5 Оси, армы и семейства контрастов (впечатываются в ключ ДО первого ответа)

Д4 — edit-контур zh, 32 единицы (16 эксп-22 + 16 эксп-23), база одна и замороженная:

A0  боевой full-regen (deepseek-v4-pro поверх якорного черновика)      КУПЛЕН, $0
A1  черновик + детерминированные флаги (батарея + канон-гейт) → фиксер  «ВМЕСТО редактора»
A2  dspro-однопроходка УРАВНЕННОГО мандата (строка 153 бэклога)         без редактора вовсе
A3  черновик + СМЫСЛОВОЙ LLM-критик → фиксер   ← СТАВКА ВЛАДЕЛЬЦА H-2б  «ВМЕСТО редактора»
A4  A0 + канон-фиксер ПОСЛЕ                                            «ПОСЛЕ редактора»
A6  dspro-ЧЕРНОВИК + оба контура            ← носитель H-1, база куплена эксп-22
семейство: A1/A0 · A2/A0 · A3/A0 · A4/A0 · A6/A0        Холм по пяти

«До редактора» не мерится сознательно: перепис затирает любую починку.

Д3 — en→ru, 16 единиц Кристоффа: боевая связка · dspro-однопроходка уравненного мандата · черновик + оба контура · E6 второй редактор glm-5 · контроль E0 vs D0. Холм по пяти.

Д6 — ja→ru, 9 единиц: связка · однопроходка · контроль. Статус — РАЗВЕДКА, объявлен здесь.

Д0.6 Нормы рига, принятые этой фазой (каждая куплена дорого прошлым паком)

  • Декой в каждой пачке; сессия, не поймавшая его отрицательным знаком, аннулируется целиком.
  • Шумовой пол — парой, чьи половины судят РАЗНЫЕ сессии. Обе половины — ОТДЕЛЬНЫЕ генерации; боевая клетка половиной пола не берётся (в эксп-23 CTRLfloorA ≡ T1 в 16/16, и контроль был пуст). Порог берётся из своего пола без ручной поправки: пол, судимый разными сессиями, ловит и межсессионную компоненту, которая в эксп-23 занижала порог на 19%.
  • Все армы единицы — в одном задании одной сессии (урок Sol §16 эксп-22, подтверждён с двух сторон: нарушив — замер разваливается, соблюдя — работает на том же судье).
  • Судейские сессии регистрируются ДО запуска (eval/dovodka/runs.py, кап 80, атомарный O_CREAT|O_EXCL-замок с проверкой живости PID, селфтест 16/16). Гонка сессий по одному токену механически невозможна — в эксп-23 она стоила расхождения голосов и сырья на 5 единицах из 32.
  • Клетка с finish=length в судейскую пачку НЕ допускается — ни боевым армом, ни половиной пола. Класс замерен: в эксп-22 таких судимых слотов семь, две из них в шумовом полу обеих фаз, одна в базе всех контрастов (§15 эксп-22).
  • Позиционный наклон замеряется, вычитается и сторожится гейтом числом.
  • Донор декоя уравнен по армам; судье запрещено сравнивать варианты между собой и читать их рядом.
  • Пар-промпты проходят механический гейт (eval/dovodka/promptdiff.py): всё вне объявленных пар-специфичных секций обязано совпадать с боевым zh побайтно, мандатные оговорки не теряются, а каждое законное расхождение объявлено с причиной. Урок эксп-19 (арм конфаундирован неполным зеркалом) закрыт механизмом, а не обещанием.
  • $0-детекторы получают свой контроль наравне с судьями. Норма заведена этой фазой после того, как приёмка замерила ложноположительную частоту канон-классификатора: 82.5% на случайных окнах при наблюдённых 79% — прибор был слабее нулевой модели. Всякий классификатор, чьё число идёт в отчёт, обязан печатать рядом свою частоту срабатывания на случайном входе.

Д0.7 ⚠ Что внешняя подпись может и чего не может — объявляется ДО прогона

Внешний судья вне семьи Claude имеет шумовой пол sd 5.05 и порог различимости 3.53 (§12в). Это значит, что под ОТРИЦАТЕЛЬНЫМ выводом его подпись почти автоматична: возразить он мог бы только эффекту вчетверо больше замеренного. Поэтому заранее:

  • для прохода tier (перевесы 0.19…0.50) внешняя подпись будет означать «внешний судья тоже не увидел», а НЕ «внешний судья подтвердил равенство»;
  • для несущего вердикта Д4 по H-2б, где ставка — тонкий выигрыш, внешний контур не добавит и не отнимет; его ценность — поймать КАТАСТРОФУ, которой внутрисемейные судьи не заметили.

Это ограничение прибора, а не отговорка: сказано до того, как числа получены.

Д0.8 Смета по ЗАМЕРЕННЫМ ценам и фазовые потолки (eval/dovodka/plan.py)

ФД-A  Д4 edit-контур zh (A1·A2·A3·A4, n=32 + свой пол)      0.877
ФД-B  Д3 en→ru несущая                                      0.556
ФД-C  Д6 ja→ru разведка (n=9)                               0.154
ФД-D  Д7 самооценка                                         0.050
ФД-F  H-1: A6, dspro-черновик + оба контура (n=16)          0.280
ФД-G  H-4: E6, второй редактор glm-5 на en (n=16)           0.200
ФД-E  Д1 добивка gemini, 16 клеток                          2.352
                                             ИТОГО          4.470 / 4.50 · резерв 0.030

Цены — медианы по СЫРЬЮ уже купленных клеток обоих паков, не по прайсу. Прайс DeepSeek пере-снят живьём 10.08 и не изменился (flash $0.14/$0.28, pro $0.435/$0.87); вендорская сноска о готовящемся значительном повышении на странице присутствует и учтена оговоркой, а не числом.

Резерв $0.03 — это 0.7% пакета, и сессия объявила это риском ДО покупок. Ре-гены эхо-мины и ретраи в паках 22/23 съедали до +16% сверх сметы фазы. Честным потолком без стопов посреди фазы сессия называла $4.80; владелец выбрал $4.50. Срабатывание проекционного гарда = СТОП и вопрос владельцу, а не сокращение оси решением сессии.

Д0.9 Прогнозы (калибруют удивление; совпадение НЕ цель)

  1. A3 (смысловой критик) НЕ побьёт A0 различимо. Основание: все замеренные различия между близкими редакторскими контурами лежат в 0.22.5, а MDE оси 1.29. Прогноз конкретен: перевес A3/A0 ляжет в полосу 1.0…+1.0. Если владелец прав и ставка сыграет, я ошибусь — и это лучший исход фазы.
  2. A4 (канон-фиксер ПОСЛЕ переписа) даст лучшее покрытие канона из всей панели, не двигая судейский перевес: он чинит ось, по которой боевой редактор худший в эксп-22 (0.882).
  3. A1 (флаги) окажется «не хуже» по правилу Д0.4, но дешевле в разы. Основание: флаговый контур эксп-20 чинил по указанному месту за ~$0.0002.
  4. H-1 подтвердится частично: A6 (dspro-черновик + контур) побьёт A1/A3 на flash-черновике, но не побьёт A0. Основание — находка эксп-22 §13: редактор работает компрессором различий черновика (разброс 7.25 → 2.12).
  5. На en контроль редактора снова окажется около нуля (эксп-22: +0.00 при n=6), но теперь при n=16 и объявленной цели 2.00 это будет замер, а не отсутствие мощности.
  6. gemini-3.1-pro-preview не отдаст 16 клеток с первой волны. Прогноз: 503-серии повторятся, потребуется ≥2 суток окна; собрано будет 1215 из 16.

Д0.10 Чего эта фаза НЕ меряет

Топология «черновик → редактор» (решена эксп-21) · банк как фактор · выбор жильца черновой роли (решён эксп-22) · качество прозы gemini как продуктовый выбор — при $221 за книгу против $8 у боевого он невозможен ни при каком исходе, меряется только гипотеза «аутлаер прозы» эксп-04.

Д0.11 ЭРРАТА ПРЕ-РЕГА (11.08, ДО докупок; история не переписывается)

Ревью 82 находок двумя направлениями плюс опровергатель на каждую находку (67 выжили) вскрыло, что зафризенный Д0 расходится с кодом и что три арма куплены не теми, какими объявлены. Ниже — каждое расхождение и его диспозиция. Ни одно число выше НЕ правится задним числом; правится код, а таблицы Д0.3/Д0.5 читать через эту эррату.

Э-1. Таблица Д0.3 напечатана ДО починки D-1 и коду не соответствует. В отчёте Д4 k=5 MDE 1.29 и «Холм по пяти» (:805, :810); power.py держит k=3 (первичное семейство по одному контрасту на гипотезу). Ни одна версия кода числа 1.29 не даёт: это множитель Холма БЕЗ поправки ×1.23. Действительна раскладка кода, а не таблицы отчёта.

Э-2. MDE считался по ОСИ при плановом n, а контрасты живут на РАЗНЫХ n. A6/A0 — носитель H-1 — стоит на 16 единицах по построению: черновик dspro эксп-22 есть только у 16 старых единиц. Мощность на него никто не считал. Это дословный класс провала en-оси эксп-22, ради недопущения которого написан power.py. Введена поконтрастная таблица; статус объявляется по контрасту.

Э-3. Множитель мощности брал квантиль НОРМАЛИ, тогда как sd — ОЦЕНКА (пол прошлого пака, n=16, df=15). При честном t всё меняется: ось Д4 даёт MDE 1.64 против цели 1.50, а все три первичных контраста — 1.67 · 1.67 · 2.32. При заимствованном прайоре sd 2.12 ось Д4 ОПИСАТЕЛЬНАЯ. Несущей её делает только СВОЙ пол: при sd ≤ 1.91 контрасты A1/A0 и A3/A0 становятся несущими (замеренный пол tier эксп-23 — 1.45, то есть шанс реален). A6/A0 требует sd ≤ 1.37 и при n=16 не спасается ничем — H-1 остаётся описательной, пока база dspro не расширена на новые единицы. ⇒ Порядок покупок изменён: СВОЙ ПОЛ ПЕРВЫМ. Покупать армы, не зная пола, значит рисковать всей сметой оси, которая может не дать вывода ни при каком исходе. Объявлено до покупки пола.

Э-4. Арм A1 куплен БЕЗ батареи (30 клеток, $0.2269). battery.run_unit получал dict вместо battery.Unit и падал AttributeError на 32/32, ошибку глотал голый except. Флаги A1 = 100% канон-гейт при объявленном «батарея + канон-гейт». Починено; при живой батарее мест 181 против 74. ⚠ Наивная починка была бы ХУЖЕ поломки: значения проверок — словари, и прежний фильтр isinstance(v,(int,float)) вымел бы в список мест ЗНАМЕНАТЕЛИ («проверка sentences дала 90»). Введён явный whitelist полей-нарушений. Старые 30 клеток пере-покупаются.

Э-5. Арм A2 не существовал. PR.translator_msgs(src) звался с одним аргументом при сигнатуре (src, block, en=False) → TypeError; сторож hasattr проверяет имя, а не арность, поэтому ветка «арм пропущен, объявить в отчёте» была НЕДОСТИЖИМА. Вдобавок block=None снял бы банк-закон D39.104. Собран уравненный мандат (строка 153 бэклога): промт переводчика ПЛЮС мандатные части промта редактора, включая дискурс-перевёрстку и правило чэнъюй, плюс банк-закон.

Э-6. «A6 = оба контура» — один арм двух контуров нести не может. Куплённый A6 есть СМЫСЛОВОЙ контур; флаговый заводится армом A6F на той же базе.

Э-7. places[:40] молча резал список критика. A3 потерял 512 замечаний из 1491 (34%), A6 — 374 из 886; резался КОНЕЦ главы, не случайная выборка. Кап поднят до 200 (максимум найденного — 150), в запись клетки добавлено поле places_found рядом с places.

Э-8. Единица 63ab55ac5c исключена из оси. Её якорный черновик — эхо исходника; штатный гейт проекта bakeoff.draft_reject_reason его бракует, но ветка новых 16 единиц (PAN23.draft_b) гейт не применяла вовсе. Клетки A1/A3 на ней оплачены ($0.0231) и в судейскую пачку НЕ идут. n оси 31.

Э-9. Две клетки A4 с finish=length (41599f30df, f6da9f76b2) недопустимы в пачку по норме Д0.6 и пере-покупаются. ⚠ Поправка к промежуточному чтению: они же фабриковали 12 из 13 «новых канон-потерь» арма A4 — без них A4 чинит 19 и заводит 1.

Э-10. Проекционный гард не был СТОПом. При отказе buy.purchase возвращает skipped=True и файла не пишет, а contour.py возврат выбрасывал: цикл шёл дальше по единицам И по следующим армам, прогон завершался кодом 0. Так A4 остался на 22 клетках из 32, а объявленная норма «срабатывание гарда = СТОП и вопрос владельцу» существовала только в прозе. Механизирована.

Э-11. Клетка «мест не нашлось» больше не выбрасывается. Прежде единица молча выпадала, и A1 приходил на судейство с n=30 против 32 у A3 — контрасты переставали быть парными, причём выпадали ровно те единицы, где контур не даёт ничего, то есть смещение шло В ПОЛЬЗУ арма. Теперь выход арма на такой единице = его вход, клетка пишется с нулевой ценой и полем free.

Э-12. Режим --floor был объявлен в шапке и не существовал (разбор аргументов знал только --selftest и --run, прочее молча уходило в --plan с кодом 0). Реализован парой независимых генераций одного лечения на единицу, как требует норма Д0.6.

Э-13. Смета промахнулась структурно. plan.py кладёт фиксера в 0.60× переписа — замерено 2.41×; критика в 2.14× — замерено 0.99× (он выдаёт короткий список, а не текст; множитель 2.14 из заказа описывал стоимость ПОИСКА как задачи, а не длину ответа). Потолок фазы поднят владельцем 11.08 до $5.40. ⚠ Резерв при этом $0.00, и это объявлено риском ВТОРОЙ раз: честный остаток $4.277 плюс потраченные $1.140 дают $5.417. Д1 добирает 15 клеток gemini из 16 именно поэтому, а пре-рег Д0.3 говорит, что несущей ось Д1 делают полные 16.

Э-14. Гейт чужого пака verify22.py красный (EXIT=1) — в хендоффе значился зелёным. Причина не в отчёте: число «верхняя граница двойной оплаты» выводится из mtime файлов, а дерево ~/books пере-штамповано, поэтому граница считается нулевой. Чужая зона: не правлю, объявляю пингом.

Что ревью ОПРОВЕРГЛО (снято, чтобы не осталось в обороте). Канон-гейт contour.py подозревался в том, что меряет не то: 96% его флагов — не пропажа термина, а меньшая частота. Прогнан контроль, которого не было: срабатывание на выходе ЧУЖОЙ единицы 67.1% против 28.5% на своём — прибор специфичен в 2.4 раза и нулевую модель проходит. Счётная сверка ПОКРЫТИЯ — дословно то, что заказано (промт :91-94). Подозрение снято; остаётся мягкая правка формулировки флага.

Д0.12 СУДЕЙСТВО: ДВА СЕМЕЙСТВА, ОБА $0 — подход объявлен ДО вердиктов

Решение владельца 11.08 дословно: «НИКАКИХ ВЫЗОВОВ ПО АПИ, всё локально у нас на харнесах codex/claude»; второй судья — локальный харнесс Sol 5-6, и его роль владелец назвал так: «ты судишь свою часть, он — второе мнение твоего судейства / твоей слепоты». Платных судей в смете нет ни цента; появление такой строки = дефект.

Зачем вообще второе семейство — замерено, а не предположено. Проход tier пака 23 разошёлся между семействами в 712 раз и пережил все три нормировки рига (контраст внутри единицы · порог из своего пола · декой как единица измерения), то есть спор СОДЕРЖАТЕЛЬНЫЙ, а не шкальный. Разбор установил: находки Claude — ПОДМНОЖЕСТВО находок Sol (74 из 100 внутри, при случайном уровне 0.14, p=0.0000); Claude поставил ровно ноль в 47 клетках из 128, из них 31 с пустым обоснованием; в тексте боевого редактора лежат РЕАЛЬНЫЕ инверсии смысла, которым Claude поставил ноль (箭在弦上,不得不发 → «Стрела уже слетела с тетивы» — смысл обратный). Одно семейство свою слепоту не видит по построению — вот что покупает второе.

Шкалы НЕ синхронизируются. Каждое семейство судит против СВОЕГО шумового пола и своего порога. Это не компромисс, а следствие устройства рига: сравнивается не абсолютный уровень, а контраст внутри единицы. Попытка «привести Sol к Claude» была бы подгонкой прибора под ответ.

Границы второго судьи объявлены заранее (Д0.7 и здесь). Шумовой пол Sol — sd 5.05, порог различимости 3.53. Для тонких контрастов Д4 (ожидаемые перевесы 0.22.5) это значит: подпись Sol под отрицательным выводом почти автоматична и читается как «внешний судья ТОЖЕ не увидел», а НЕ как «внешний судья подтвердил равенство». Ценность Sol здесь — поймать КАТАСТРОФУ, которой внутрисемейный судья не заметил, и это ровно то, что он сделал в паке 23.

Правило расхождения — ПРЕ-РЕГИСТРИРУЕТСЯ, потому что его отсутствие и погубило вывод пака 23

что наблюдаем вердикт фазы
оба семейства перешли СВОЙ порог в ОДНУ сторону CONFIRM
Claude перешёл, Sol нет НЕ ПОДТВЕРЖДЕНО ВТОРЫМ СЕМЕЙСТВОМ — для тонких контрастов это ОЖИДАЕМЫЙ исход при пороге Sol 3.53, опровержением НЕ является
Sol перешёл, Claude нет СЛЕПОТА ПЕРВОГО СУДЬИ — клетки, которые цитирует Sol, читаются руками; находка идёт в отчёт как дефект ПРИБОРА, не как свойство арма
перешли в ПРОТИВОПОЛОЖНЫЕ стороны СПОРНО — CONFIRM не выдаётся, расхождение печатается числом и становится находкой об инструменте

Правило симметрично и записано ДО того, как получен хоть один вердикт фазы Д. Выбирать удобное семейство постфактум запрещено этим абзацем.

Нормы, обязательные для ОБОИХ семейств

Декой в каждой пачке; семейство, не поймавшее декой отрицательным знаком, аннулируется на этой пачке целиком · все армы единицы — в ОДНОМ пакете (пачка на единицу, метки слепые и перемешаны) · судье запрещено сравнивать варианты между собой, оценка только против исходника · клетка с finish=length в пачку не допускается · шумовой пол — ПАРОЙ, чьи половины судят РАЗНЫЕ сессии · идентичность судьи персистится ДО запуска (runs.py --claim, кап 80) · позиционный наклон замеряется, вычитается и сторожится гейтом.

Изоляция внешнего судьи — единственный работающий контроль

Пост-фактум детектора «подглядывал ли судья в ключ» не существует; изоляция и есть контроль. Поэтому задания Sol готовятся в ОТДЕЛЬНОМ рабочем каталоге, где нет ни ключа слепых меток, ни кода, и путь записи ответа указывает ТУДА ЖЕ. Оба правила куплены дорого: пак 23 сперва НАЗВАЛ внешнему судье путь к ключу (написать болтливому агенту «не открывай blind-keys/» = показать пальцем), а затем велел писать ответы в боевой каталог aj-tier/, который харнесс владельца затёр бы поверх отсуженного.

Закрытие пункта — только изменением файла ВНЕ зоны. «Пакеты подготовлены и ждут» закрытием не является: закрыто = непустой каталог ответов + пере-счёт скриптом класса solscore.

$0-калибровка осей ПЕРЕД боевым судейством (eval/editor_tier/axiscal.py)

Прежде чем сравнивать семейства на боевых числах, обе семьи раскладываются по УЖЕ пойманному декою: доля пойманного дефекта известного типа и правильность отнесения его на ось. Меряется не «строгость вообще», а чувствительность и ложная тревога КАЖДОГО семейства ПО КАЖДОЙ ОСИ. ⚠ Граница прибора названа заранее: посадка даёт ГРУБЫЕ дефекты, а спор семейств живёт в маргинальном режиме — на грубых обе семьи упираются в потолок. И если посадка узнаваема (у декоя пака 22 был почерк, судьи называли его метку), меряется узнаваемость, а не чувствительность. Поэтому axiscal — прибор ОГРАНИЧИВАЮЩИЙ, а не сертифицирующий.

Д0.13 ПРАВКИ ПРИЁМКИ ДРУГОГО СЕМЕЙСТВА (Fable-5, 11.08) — приняты ДО первого вердикта

Владелец заказал независимый разбор дизайна судейства агентом вне семьи Claude, с прямым условием не подсказывать ответ: агенту дали материал, код, замеры расхождения семейств и вопрос, но НЕ дали ни Д0.12, ни роли Sol, ни правила расхождения. Ниже принятое. Правки легитимны ровно до первого судейского ответа фазы Д — после него менять пороги и правила запрещено собственным законом проекта.

П-1. Правило расхождения переписано: адъюдикация вместо назначения виноватого. Таблица Д0.12 в двух клетках решала спор ЯРЛЫКОМ («Sol перешёл, Claude нет» = дефект прибора; «Claude перешёл, Sol нет» = ожидаемо), а не уликой. Следствие, названное приёмкой: фаза ПО ПОСТРОЕНИЮ не могла бы подтвердить эффект, который видит только Sol, — даже когда ручное чтение его цитат подтверждает реальные инверсии, а в проходе tier случилось ровно это. Принято:

наблюдение вердикт
оба семейства перешли СВОЙ порог в одну сторону CONFIRM
перешёл ОДИН (любой) эскалация к адъюдикации его находок: ≥80% выборки цитат верифицируются слепо как реальные И знаковый тест по одним верифицированным дельтам даёт p<0.05 → CONFIRM с пометкой «вынесен одним семейством, подтверждён адъюдикацией»; иначе НЕ ПОДТВЕРЖДЕНО
перешли в ПРОТИВОПОЛОЖНЫЕ стороны вердикта об арме нет; адъюдикация обоих пулов на единицах максимального расхождения; печатается как находка об ИНСТРУМЕНТЕ
семейство не поймало декой ЛИБО не прошло маржевый контроль (П-2) его пачка аннулируется

Основание: расхождение счётов между детекторами с разными точками отсечения есть ОЖИДАЕМОЕ состояние, а не сигнал тревоги, поэтому правило, ключующееся на счётах, обречено кодировать заранее назначенное недоверие. Единственная семейно-инвариантная валюта — находка (цитата + ось + место), и риг уже требует цитату на каждую ненулевую ось, то есть сырьё для этого есть. Адъюдикатор видит исходное предложение, предложение перевода и суть претензии, и НЕ видит ни метку арма, ни автора находки. Пороги 80% и p<0.05 объявлены ЗДЕСЬ и потом не меняются.

П-2. МАРЖЕВЫЙ ДЕКОЙ — чувствительность прибора размером с маржу. Дыра, которой у фазы не было вовсе. Вывод «не хуже» (Д0.4, маржа 1.50) требует доказанной способности прибора видеть эффект размера маржи: нечувствительный прибор объявляет «не хуже» автоматически. Действующий декой грубый (26 посадок, ловится 32/32) и о МАРГИНАЛЬНОМ режиме не говорит ничего — axiscal.py это признаёт в собственной шапке. Заводится второй декой с ДВУМЯ тонкими посадками классов, реально пропущенных в tier: правдоподобная, но неверная передача идиомы · смена адресата реплики · потерянный разряд числа. Семейство, чей замеренный перевес на маржевом декое не пересекает его собственный порог, не имеет права выдавать «не хуже» при этой маржеего вердикт по H-2а/H-2б понижается до описательного. Посадки — ДАННЫЕ (вне репо, как ключи слепых меток), строятся один раз до вскрытия слепоты; общность движка не задета. Без этого гейта наиболее вероятный итог фазы — «A1 не хуже A0 и дешевле в разы» — неотличим от «прибор не видит, чем A1 хуже».

П-3. Изоляция нужна ОБОИМ семействам, и постфактум-аудит существует. Д0.12 утверждала, что детектора подглядывания нет и изоляция есть единственный контроль. Для внешнего харнесса это верно, для агент-сессий — НЕТ, и это проверено исполнением: (а) оплаченная клетка несёт поле arm открытым текстом рядом с content, поэтому судья с диском деанонимизирует слепую метку ОДНИМ грепом по фрагменту варианта (проверено: греп по фрагменту выдал имя арма); (б) транскрипт агент-сессии логирует вызовы инструментов, то есть аудит «куда лазил судья» возможен. Принято: задания ОБОИХ семейств выдаются в изолированный рабочий каталог, где нет ничего кроме заданий; транскрипты судейских сессий сохраняются обязательно; $0-греп-аудит на запрещённые пути (blind-keys/, dv-*) гоняется после каждой пачки. Формула становится «изоляция ПЛЮС журнал».

П-4. Паритет обвязок семейств. Единственный неустранимый конфаунд прохода tier: промт харнесса Sol нёс правила плотности счёта («две одинаковые ошибки — это два», «4 задания за сессию»), которых у Claude не было, — часть расхождения в разы могла быть куплена ИНСТРУКЦИЕЙ, а не моделью. Норма: обвязки обоих семейств диффуются и архивируются ДО прогона по образцу promptdiff.py, расхождения только объявленные.

П-5. Оси перевешены. Несущая сумма судьи — ВЕРНОСТЬ + ЯЗЫК. ТЕРМИН уходит в описательные: детерминированный канон-гейт по банку сильнее LLM-судьи на этой оси, а axiscal показал, что посадок на ТЕРМИН нет вовсе, то есть чувствительность судей по ней даже не проверяема; заодно исчезает двойной счёт между судейской и детерминированной осями. ФОРМА в несущую сумму не входит: она наполовину механизируема $0-детекторами и однажды уже переворачивала знак вывода, штрафуя ИСПОЛНЕНИЕ мандата перевёрстки.

П-6. Второй эндпойнт — слепое ранжирование ткани (описательный на этой фазе). Счёт локальных ошибок систематически смещён ровно в сторону вопроса владельца: фиксер трогает 0.23.7% знаков, а остальные 96% остаются черновиком, поэтому серая-но-безошибочная проза получит «не хуже», а читатель скажет «хуже». Победа над translationese — глобальное свойство ткани, дискретными ошибками не представимое; плюс патчворк (десятки точечных правок в чужой ткани) может рвать связность, не порождая ни одной счётной ошибки. Заводится второй проход: best-worst ранжирование армов ВНУТРИ единицы по издательской пригодности. Ранги шкало-свободны, поэтому разница строгости семейств на них не действует. Гонится ПОСЛЕ того, как счёты забанкованы, чтобы не заражать их. Свои контроли: декой обязан ранжироваться последним, половины пола — соседями. Решение владельца 11.08: берём.

П-7. «Побеждает» — лексикографические гейты, а не композит. Веса композита не защитить, поэтому порядок: (1) канон — покрытие и единообразие на выходе не ниже A0 минус объявленный допуск (потеря канона по слову владельца есть дефект безусловно, значит это ГЕЙТ, а не вес); (2) батарея — ноль катастрофических флагов; (3) среди прошедших — судейский вердикт ВЕРНОСТЬ+ЯЗЫК по П-1 при подтверждённой чувствительности П-2; (4) среди «не хуже» побеждает цена. ⚠ Оговорка Гудхарта, обязательная к печати: армы A1/A1B оптимизированы ровно против тех детекторов, которыми их мерят, — фиксер ел их флаги. Поэтому для них детерминированная ось может только ДИСКВАЛИФИЦИРОВАТЬ, короновать не имеет права; «меньше срабатываний флагов» как критерий победы для арма, питавшегося флагами, циркулярен.

П-8. СПАН-ДЖОЙН — единственная форма, в которой обе оси говорят об одном. У детерминированных флагов есть МЕСТА, у судейских находок — ЦИТАТЫ. Пересечение спанов даёт число, прямо решающее спор H-2а против H-2б: доля верифицированных ошибок, лежащих ВНЕ покрытия детерминированных флагов. Близко к нулю — «флагами всё не отследишь» опровергнуто и флагового контура достаточно; велика — нужен смысловой критик, и известно, насколько. Стоит $0: цитаты уже обязательны, места уже есть.

П-9. Исполняемость печатается рядом с судейским числом. Контур раскладывается на множители: A1 = (флаги нашли) × (фиксер исполнил) × (исполнил верно). Первые два детерминированы, и уже замерено, что канон-фиксер исполняет 46% прямых указаний — это ПОТОЛОК арма, известный до всякого судейства. Если судейская дельта не коррелирует с числом исполненных починок, меряется шум.

Что приёмка предложила, а фаза НЕ берёт, с основанием. Перенос части сметы Д1 в мощность H-1: предложен без знания раскладки — расширение базы A6 УЖЕ профинансировано внутри $6.00, а сверх него деньги мощности H-1 не покупают, потому что ограничение здесь материал, а не бюджет. Отдельно проверено: пул новых единиц среза равен 22, а взято 16, то есть ось расширяема до 37 единиц; но +6 единиц ($0.91) покупают что-либо ТОЛЬКО если свой пол ляжет в узкое окно 1.91…2.08 — при поле лучше они не нужны, при поле хуже не спасают. Решение отложено до замера пола, который уже куплен и судится бесплатно. Это единственный пункт, где фаза сознательно не исполняет приёмку сразу.

Д4 — EDIT-КОНТУР НА zh: РЕЗУЛЬТАТ

Ось куплена, отсужена ДВУМЯ семействами по побайтно одинаковой инструкции, приёмка проведена в трёх контурах (механический воркфлоу четырьмя линзами · опровергатель на каждую находку · приёмщик другого модельного семейства, читавший заказ и сырьё ДО выводов сессии).

Д4.1 Панель и три оси (требование заказа :95)

Ответ по каждому арму печатается ТРЕМЯ осями, а не одной. Судья — ошибок на единицу по несущей сумме ВЕРНОСТЬ+ЯЗЫК (эррата П-5), меньше лучше. Канон — доля покрытия банка НА ВЫХОДЕ арма, больше лучше. Цена — медиана оплаченной клетки по сырью.

арм     судья    канон   $/клетка  что это
A0       4.00    0.892    (куплен)  боевой ПОЛНЫЙ ПЕРЕПИС — эталон сравнения
A4       4.11    0.937    0.00816   перепис + канон-фиксер ПОСЛЕ
A6       4.90    0.923    0.00804   dspro-черновик + смысловой контур
A6F      5.84    0.943    0.00804   dspro-черновик + флаговый контур
A3       6.20    0.925    0.00644   черновик + смысловой критик → фиксер
A2       6.51    0.884    0.00408   однопроходка уравненного мандата
A1B      7.52    0.965    0.00697   черновик + флаги (батарея + канон-гейт)
A1       7.40    0.960    0.00686   черновик + только канон-флаги (описательный)

Д4.2 Вердикты по гипотезам владельца

H-2а «флаговый контур не хуже переписа, дешевле, не ломает канон» — ОПРОВЕРГНУТА (CONFIRM). A1B/A0 = 3.53 (claude, порог 1.65) и 4.73 (sol, порог 3.65); оба семейства перешли СВОЙ порог в одну сторону, p Холма < 0.0001. Утверждение распадается: «дешевле» и «не ломает канон» ВЕРНЫ (канон 0.965 — лучший в панели), «не хуже по судье» ЛОЖНО почти вдвое.

H-2б «смысловой контур лучше переписа» — НЕ ПОДТВЕРЖДЕНА. A3/A0 = 2.21 (claude, порог перешёл) и 3.11 (sol, свой порог 3.65 не перешёл) — знак у обоих одинаковый, направление ПРОТИВ гипотезы. Правило П-1 дало эскалацию к адъюдикации; та не выполнила условие «≥80% выборки верифицируются» ни в одном варианте счёта. Смысловой контур заметно лучше флагового (6.20 против 7.52), но хуже переписа.

H-1 «проблема в черновике» — НЕ УСТАНОВЛЕНА. A6/A0 = 1.03 и 0.62, ниже порога у обоих. Контраст живёт на n=16 (черновик dspro есть только у 16 старых единиц) и был объявлен недомощным по построению ДО покупок (эррата Э-2). Направление против гипотезы, значимости нет.

Статус оси: ОПИСАТЕЛЬНАЯ (пере-классифицирована 15.08 при финальном аудите — см. Д11.2). ⚠ Ниже сохранён исходный текст решения сессии, ОПРОВЕРГНУТЫЙ её же пре-регом; история не переписывается.

Статус оси: НЕСУЩАЯ. Свой пол sd 2.21 (n=14 пар, половины судят РАЗНЫЕ сессии), MDE при k=3 и n=31 равен 1.44 ≤ цели 1.50. ⚠ Развилка объявлена: эррата Э-3 требовала пол не хуже 1.91, но тот порог выведен в шкале ПРАЙОРА, умножаемого на ×1.23 за межсессионную компоненту, а свой пол её уже содержит по построению — второе применение множителя есть двойной счёт. Для двух перешедших контрастов развилка исхода НЕ меняет: 3.53 и 2.21 лежат выше MDE в обеих трактовках (1.44 и 1.77).

Д4.3 Что установлено сверх гипотез

Порядок армов монотонен по объёму переписывания. Перепис 4.00 → перепис с полировкой 4.11 → контур поверх качественного черновика 4.90 → контур поверх дешёвого 6.20 → флаги 7.52. Замерено раньше и объясняет линию: фиксер меняет 0.23.7% знаков, остальные 96% остаются черновиком flash со всеми его дефектами.

Спан-джойн: 8495% подтверждённых судейских ошибок лежат ВНЕ поля зрения детерминированных флагов (оба семейства, нижняя оценка). Посылка владельца «флагами всё не отследишь» ПОДТВЕРЖДЕНА числом. Вывод «значит смысловой критик даст качество выше переписа» — нет.

A4 — кандидат в прод. Единственный арм, неотличимый от боевого по судье (разрыв 0.11 при пороге 1.65) и при этом поднимающий канон с 0.892 до 0.937, ценой $0.008 на клетку. Это прямой ответ на заказ :86-87.

A2 — единственный арм, УХУДШАЮЩИЙ канон (0.884 против 0.892) и по лексикографическому гейту П-7 п.1 подлежит дисквалификации независимо от судейской оси.

Гудхарт замерен. A1B даёт ЛУЧШИЙ канон панели (0.965) и ХУДШЕГО судью (7.52): арм максимизирует ровно тот детектор, которым его мерят, и проваливает всё прочее. Оговорка П-7 это предсказала; для армов, питавшихся флагами, детерминированная ось может только дисквалифицировать.

Д4.4 Ограничения прибора — объявляются вместе с результатом

Sol не прошёл гейт чувствительности (маржевый декой +3.06 против своего порога 3.65). Его вердикты по H-2а/H-2б понижены до описательных: право сказать «эти способы равны» он не имеет, потому что тонкую порчу не разводит своим шумом. Его «увидел» весомо, его «не увидел» — нет.

Адъюдикация непригодна как измерение, её контроли дефектны. Три дефекта, найденные приёмкой и проверенные исполнением: (1) регекс разбора осей рвёт «ВЕРНОСТЬ» на «ОСТЬ», уцелевает только «ЯЗЫК» — четыре буквы, поэтому фильтр «несущие оси» считал ОДНУ ось из двух; (2) как следствие, ложные претензии стали отличимы по формату (полное имя оси против обрезанного), и контроль сговорчивости мерил не склонность соглашаться; (3) в пуле «посаженных» гарантированы 4 позиции из 15. Вердикт H-2б от этого НЕ зависит: условие ≥80% не выполняется ни в одном варианте счёта, а поправка на верифицируемость перевес не сжимает, а увеличивает (2.16 → 2.26).

Позиционный наклон не замерен, не вычтен и не сторожится — норма Д0.6 не исполнена. Метки перемешаны, но проверки равномерности нет.

Смещение прибора против переписывающих армов. Претензии к A0 подтверждаются слепой проверкой хуже, чем к A3. Смещение работает ПРОТИВ победителя, то есть настоящий разрыв не меньше замеренного.

Д4.5 Что стоило измерение

$2.393 из санкционированных $6.15. Агент-сессий 28 из капа 80. Из них аннулировано за нарушение протокола 4 сессии (16 пачек) плюс 2 отдельные пачки; все пере-сужены, аудит транскриптов механический, у обоих семейств одинаковый.

Карантин оплаченного, не вошедшего в замер: $0.356 (первая редакция A1B на отравленных флагах) + $0.037 (клетки finish=length) — цена двух дефектов сессии, названа в кассе, а не смягчена.

Д4.6 СВЕРКА ГИПОТЕЗ С ФАКТОМ (требование заказа :204-205)

гипотеза что утверждала что замерено вердикт носитель
H-1 качественный черновик + точечный редактор ≥ боевой связки A6/A0 1.03 (claude) · 0.62 (sol), ниже порога у обоих; n=16 недомощен по построению НЕ УСТАНОВЛЕНА itog_d4.py, эррата Э-2
H-2а флаги → фиксер не хуже переписа, дешевле, не ломает канон судья 3.53 / 4.73 (оба перешли порог) · канон 0.965 (лучший) · цена 0.0070 ОПРОВЕРГНУТА по судье, ПОДТВЕРЖДЕНА по канону и цене (CONFIRM) itog_d4.py Д4.14.2
H-2б смысловой контур ЛУЧШЕ и переписа, и флагов лучше флагов (6.20 против 7.52) · хуже переписа (против 4.00); эскалация, адъюдикация условие не выполнила НЕ ПОДТВЕРЖДЕНА itog_d4.py, adjud.py
H-4 порядок жильцов сменится на другой паре zh-часть замерена; en и ja не куплены не проверялась (ось Д3/Д6 впереди)
посылка H-2б «флагами всё не отследишь» 8495% подтверждённых ошибок ВНЕ покрытия флагов ПОДТВЕРЖДЕНА числом spanjoin.py

Д4.7 ПРОБЕЛ → ЧЕМ ЗАКРЫТ → НОСИТЕЛЬ (китайская ось)

пробел эксп-22/23 чем закрыт носитель-артефакт
ставка владельца на edit-контур не мерилась вовсе панель из 8 армов на 31 единице, две позиции контура (вместо редактора и после него) contour.py, ~/books/dovodka/dv-*.json, $2.393
судейство одним семейством, слепота не видна два семейства, побайтно общая инструкция, гейт паритета sud.py, paritet.py, ~/sol-d4-work/
порог занижался полом, судимым одной сессией пол ПАРОЙ, половины в разных наборах и разных сессиях sud.py отступление 1, sd 2.21 при n=14
«не хуже» неотличимо от слепоты прибора маржевый декой как гейт assay sensitivity sud.py отступление 2, эррата П-2
судья мог подглядеть арм грепом по сырью изоляция каталога + греп-аудит транскриптов обоих семейств sud.py --audit, ~/sud-d4/annulled.txt
детерминированная и судейская оси не сводились спан-джойн по спанам флагов и цитатам судьи spanjoin.py, эррата П-8
A5 (сильный редактор × узкий мандат) НЕ ВЗЯТ — опция заказа при остатке; решение объявляется здесь, резерв $3.76 остаётся

Д4.8 ЧТО ПО ЭТОЙ ОСИ ОСТАЁТСЯ НЕЗАКРЫТЫМ

Позиционный наклон не замерен и гейтом не сторожится (норма Д0.6). Адъюдикация непригодна как измерение из-за трёх дефектов контролей — вердикт H-2б от неё не зависит, но правило П-1 формально исполнено негодным прибором. Классификация мест потери канона (Д5, заказ :106-107) снята после замера классификатора ниже нулевой модели — девиация обоснована, но СТОП и пинг владельцу в момент не сделаны. Описательные контрасты (A1/A0, A2/A0, A4/A0, A6F/A0) объявлены к печати с числами и в своде не печатаются — их значения видны только через таблицу трёх осей Д4.1.


Д3/Д6 — ПОСТРОЙКА НОВЫХ ОСЕЙ: метод, провенанс, девиации

Раздел пишется ДО вердиктов и фиксирует, чем именно снято сырьё. Числа осей — в Д3.x/Д6.x после судейства; здесь только то, что обязано быть объявлено заранее.

Д3.0 Провенанс пар-промтов (требование заказа :61)

файл происхождение зеркало zh гейт
prompts/en-ru/translator.md переработан 13.08 моделью другого семейства (Fable-5) по полному контексту задачи backend/prompts/zh-ru/translator.md promptdiff зелёный
prompts/en-ru/editor.md там же backend/prompts/zh-ru/editor.md promptdiff зелёный, 2 объявленных расхождения
prompts/en-ru/terminologist.md написан 14.08у пары его не существовало вовсе, bank.configure честно останавливался backend/prompts/zh-ru/terminologist.md заведён в promptdiff 14.08, 3 объявленных расхождения
prompts/ja-ru/{translator,editor}.md переработаны 13.08 тем же семейством те же боевые promptdiff зелёный
prompts/ja-ru/terminologist.md написан 14.08 тот же 3 объявленных расхождения
prompts-free/{en-ru,ja-ru}/ свободные редакции того же семейства В ЗАМЕР НЕ ВХОДЯТ, держатся отдельно

Механический гейт прогнан ПОСЛЕ покупок, а не до — девиация. Заказ (:62) требует гейт до покупок; фактически promptdiff был запущен, когда английская ось уже куплена. Гейт оказался зелёным, и содержательно ничего не изменилось, но порядок нарушен и объявляется. Причина не смягчающая: терминолога не было в карте сравнения (MAP), то есть банк-роль новой пары проходила мимо гейта вовсе, и заметил я это только по подсказке приёмки другого семейства.

Расхождения с zh, объявленные в гейте: (а) пример строки ответа — на исходном языке пары (термин ВНЕ книги среза, чтобы промт не подсказывал ответы: Thibault ×0, 慎二 ×0); (б) пар-блок «Единицы и приёмы» — французский слой у en, Поливанов и катакана у ja; (в) у боевого zh-терминолога пар-блока НЕТ вовсе — требование снято с zh-стороны, у пары блок обязателен по-прежнему. Завести блок в zh нельзя: backend/ — чужая зона.

Сырьё эксп-21 не переиспользовано. 75 оплаченных английских клеток (15 единиц × DRAFT/A/B/D/D_) куплены 10.08 на СТАРЫХ пар-промтах, а пакет переписан 1314.08. Взяв их базой, получили бы эталон E0 на старых промтах и контуры поверх него на новых — разница армов мерила бы смену промтов, а не топологию (конфаундер эксп-19). Ось купила свои базы заново; неиспользование старого сырья закреплено пунктом селфтеста en_axis.

Д3.0а Банки пар

пара терминов ложных срабатываний на чужом русском тексте (232 тыс. знаков)
en-ru 25 12Восс/«восстановить» 6, Империя/«империи» 3, Мёртвые/«мёртвые» 3
ja-ru 11 0

Правило усечения канонной формы — пар-параметр (14.08). У иероглифики стем усекался на 2 знака, и это работало: китайские каноны длинны или многословны. На коротких латинских именах то же правило дало ВоссВо\w*, ловящее «Возможно» и «Военные»: 990 ложных срабатываний, сломано 9 терминов из 25. Канон-ось Д3 мерила бы шум, насыщенный одинаково у всех армов, — то есть E4 и E0 стали бы неразличимы, и в отчёте это выглядело бы нормально. Порог минимального стема (6) подобран ЗАМЕРОМ на чужом тексте, не на глаз: 990 → 12. Китайское правило не тронуто, стемы сверены побайтно.

Граница измерения объявлена: Восс остаётся префиксом «восстановить» при любом пороге.

Д3.0б Контаминационная проба ЖИЛЬЦАМИ (требование заказа :69)

жилец enkan-ja kristoff-en контроль jinpingmei
deepseek-v4-flash (черновик) 0/5 · 0/5 0/5 · 0/5 4/5 · 4/5 ✓
deepseek-v4-pro (редактор) 0/5 · 0/5 1/5 · 1/5 5/5 · 5/5 ✓

Пороги пре-регистрации (узнавание ≥3/5, клоуз ≥2/5) не взяты ни одной книгой — материал пригоден. Контроль сработал у обоих жильцов, значит нули значимы, а не «проба сломана».

Оговорка, которую нельзя терять: у pro одна из пяти английских клеток — ТОЧНОЕ попадание («Империя вампиров», Джей Кристофф + «Габриэль де Леон» при вырезанном Gabriel). Книга ему не незнакома, просто знакома слабее порога; это третий том известной серии. Эмпирика английской оси несёт эту оговорку.

Счётчик пробы был сломан и правился ПОСЛЕ данных — девиация. Сверка шла подстрокой со списком названий на языке оригинала, а модели отвечают по-русски. Ошибка двусторонняя: контроль pro (5 верных ответов из 5) печатался как 1/5, то есть проба выглядела бы неработающей; а на английской книге точное попадание печаталось как клоуз-ПРОМАХ, потому что Gabriel не подстрока «Габриэль». Второе опаснее — так контаминация несущей оси спряталась бы под нулём. Найдено ЧТЕНИЕМ всех 30 ответов, не логикой. Починено сопоставление (терпит русскую передачу; «не знаю» распознаётся как ОТВЕТ, а не как оговорка внутри верного); пороги пре-регистрации не тронуты.

Две клетки pro вернулись пустыми (finish=length) и были перекуплены с капом 60000 — инструмент этих двух клеток отличается от прочих 28. Объявлено.

Д6.0 Японский материал

Книга заменена по слову владельца после срабатывания гардрейла 18+ на прежней. Новая (enkan_no_hate_ja, 59 679 знаков, 48 чанков) гардрейл проходит чисто: 0 срабатываний. Верхний дециль эротической плотности снят до отбора (4 чанка). Единицы приколоты манифестом.

Ось объявлена РАЗВЕДОЧНОЙ до денег и удержана механически: при n=9 и sd 2.90 её MDE 2.90 против цели 2.00 — несущего вывода она не даёт ни при каком исходе. power.FORCED_DESCRIPTIVE и пункт селфтеста ja_axis это стерегут.

Д3.0в Одноимённый арм ≠ один инструмент (находка, влияет на чтение результатов)

На китайской оси флаговый контур кормится батареей И канон-гейтом. На английской батарея даёт 1 место из 26: палладий-класс снят по построению пары (para.EN.absent), утечки иероглифики нет, типографика и числа почти не срабатывают. То есть E1 на en — фактически КАНОН-контур, и читать его как аналог A1B нельзя; E1 и E4 при этом меряют близкие вещи (канон на черновике против канона на связке). Без этой оговорки межпарное сравнение читалось бы как «на английском флаги работают хуже», хотя работает там другое.

Д3.0г Реестр девиаций постройки (все объявлены, ни одна не спрятана)

# девиация почему цена
Д-1 promptdiff прогнан после покупок терминолога не было в MAP гейт зелёный, содержательно ноль
Д-2 счётчик контаминации починен после данных сверял не тот язык пороги не тронуты
Д-3 2 клетки пробы перекуплены с капом 60000 finish=length инструмент 2 клеток отличается
Д-4 5 клеток армов перекуплены с капом 32000 finish=length, пустое содержимое при списанных деньгах клетка дороже ($0.022 против $0.0092)
Д-5 правило усечения канона — пар-параметр 990 ложных срабатываний на en zh не тронут, сверено побайтно
Д-6 потолки ФД-B и ФД-C подняты трижды проба жильцами дороже плановой; перекупка дороже пакет $6.62 при рамке промта $10
Д-7 шумовой пол en может оказаться НЕПОЛНЫМ цена клетки пола выше сметы оценка sd по меньшему числу пар; объявляется числом

Д3 — en→ru НЕСУЩАЯ ОСЬ: РЕЗУЛЬТАТ

Д3.1 Панель и три оси

арм судья (ошибок/ед.) канон $/клетка что это
E0 1.22 0.927 0.00789 боевая связка — ЭТАЛОН оси
E4 1.28 0.956 0.00436 связка + канон-фиксер ПОСЛЕ
E2 2.41 0.947 0.00471 однопроходка уравненного мандата
E3 2.41 0.906 0.00664 черновик + смысловой критик
E6 2.62 0.935 0.00312 ВТОРОЙ редактор glm-5 (H-4)
D0 2.78 0.767 0.00055 черновик deepseek-v4-flash (база)
E1 2.81 0.949 0.00200 флаги → фиксер (на en это КАНОН-контур)

Судья — ошибок на единицу (ВЕРНОСТЬ+ЯЗЫК), меньше лучше. Канон — доля покрытия банка на выходе.

Д3.2 Контроли прибора (без них числа не читаются)

  • Грубый декой: пойман 31/31.
  • Маржевый декой (гейт чувствительности): n=10, среднее +2.70 против собственного порога 0.99 — ПРОЙДЕН. Судья различает тонкие смысловые подмены (снятое отрицание, подменённое числительное, инверсия сравнения), а не только грубую порчу.
  • Свой шумовой пол: n=10 пар, sd 1.11 → порог различимости 0.99. Половины каждой пары судили РАЗНЫЕ сессии, поэтому порог несёт и межсессионную компоненту.
  • Пост-аудит транскриптов судей: чист — ни одна сессия не касалась ключей, сырья и кода.
  • Меток разобрано 278, замечаний годности 0, цитат 1054, не найдено в своём варианте 83 (8%).

Д3.3 Вердикт по несущей гипотезе

E0/D0: n=16, перевес +1.56, p = 0.0059 (Холм по одному контрасту), порог 0.99 — ПЕРЕШЁЛ.

H-3 «на en перепис не нужен» — ОПРОВЕРГНУТА. Гипотеза владельца: «на en→ru редактору остаются только синк глоссария и точечные правки». Замер: редактор снимает 1.56 ошибки на единицу поверх черновика (2.78 → 1.22, более чем вдвое), и перевес уверенно выше собственного шума оси. Работа редактора на английском — не косметика.

⚠ Опровержение — находка, а не провал: оно снимает основание для «облегчённого» пайплайна на парах с латинским исходником, которое иначе выглядело бы разумной экономией.

Д3.4 Что установлено сверх несущей гипотезы (ОПИСАТЕЛЬНО, вне поправки Холма)

  • H-4 «dspro-китайскость» НЕ подтверждается. Гипотеза предполагала, что перевес dspro в редакторской роли — свойство пары zh→ru, и на другой паре порядок жильцов может смениться. На английском dspro (E0, 1.22) вдвое лучше glm-5 (E6, 2.62). Порядок не сменился.
  • Контуры поверх дешёвого черновика проигрывают боевой связке и на английском — 2.412.81 против 1.22, тот же порядок, что на китайской оси. Смысловой критик (E3, 2.41), несущий главную ставку владельца на zh, здесь тоже не приближается к связке.
  • Канон-фиксер после связки (E4) снова даёт лучший канон — 0.956 против 0.927 у эталона, при судейской оси на уровне эталона (1.28 против 1.22) и ВДВОЕ меньшей цене клетки. Тот же профиль, что у A4 на zh: кандидат в продакшн.
  • Черновик по канону провален (0.767): банк-дисциплина — ровно то, что редактор покупает.

Д3.5 Ограничения этой оси

  • E1 на en — фактически КАНОН-контур (батарея даёт 1 место из 26), а не «батарея + канон». С китайским A1B он одноимённый, но не одинаковый.
  • Шумовой пол снят 10 парами из 16: у 6 единиц смысловой критик мест не нашёл, и пары по этому методу быть не может.
  • Материал не полностью незнаком редактору-жильцу: pro опознал серию и протагониста на 1 из 5 отрывков (ниже порога контаминации, но не ноль).
  • Одно семейство судей. Второе (Sol) на этой оси не гонялось — каталог sol-d3-work пуст.

Д6 — ja→ru РАЗВЕДКА: РЕЗУЛЬТАТ (ОПИСАТЕЛЬНЫЙ, статус объявлен ДО денег)

Д6.1 Панель и три оси

арм судья (ошибок/ед.) канон $/клетка что это
J0 2.22 0.914 0.00699 боевая связка — ЭТАЛОН оси
J2 2.83 0.916 0.00916 однопроходка уравненного мандата
D0 5.44 0.654 0.00061 черновик deepseek-v4-flash (база)

Д6.2 Контроли

Грубый декой 18/18 · маржевый декой +2.50 против своего порога 0.93 — ПРОЙДЕН · пол n=6 пар, sd 0.82 · меток 93, замечаний годности 0, цитат 489, не найдено в своём варианте 0 (0%).

Д6.3 Наблюдение и почему оно НЕ вывод

J0/D0: n=9, перевес +3.22, p = 0.0039, порог 0.93 — перешёл.

Ось ОПИСАТЕЛЬНАЯ, и знак значимости этого не меняет. Статус объявлен пре-регистрацией ДО покупок: при n=9 и sd 2.90 MDE оси 2.90 против цели 2.00. Наблюдённый эффект MDE превышает — и именно поэтому важно не переобъявить ось несущей задним числом. Дисциплина держится механически (power.FORCED_DESCRIPTIVE + пункт селфтеста ja_axis), а не обещанием.

Читать так: разведка не противоречит английской оси — редактор поверх дешёвого черновика покупает много и на японском. Несущего вывода про пару ja→ru фаза не даёт и не заявляет.

Д6.4 Что видно попутно

  • Японский черновик — худший в фазе: 5.44 ошибки на единицу против 2.78 на en, канон 0.654 против 0.767. Дешёвая модель на японском проваливается сильнее, чем на других парах.
  • Однопроходка (J2) хуже связки (2.83 против 2.22) и при этом ДОРОЖЕ клетки связки ($0.00916 против $0.00699) — на этой паре она не экономит.
  • Канон у J0 и J2 практически равен (0.914/0.916): банк-закон работает в обеих схемах.

Д6.5 Ограничения

  • n=9, ось разведочная — см. выше.
  • Пол снят 6 парами (гард кассы остановил добор; ось описательная, точность порога вторична).
  • Одно семейство судей: sol-d6-work пуст.
  • Материал новый (первая публикация 2026-07-30) — контаминации нет ни у одного жильца, но и претрейн-эффектов, которыми объясняют лёгкость zh-классики, тут ждать не приходится.

Д7 — МИКРО-ПРОБА САМООЦЕНКИ (любопытство, решений НЕ несёт)

Самооценка моделей ненадёжна, и это объявлено ДО покупки. Ни один вывод фазы на этих ответах не стоит; оговорка вшита в печать d7_self.py --show и проверяется его селфтестом.

Спрошены оба жильца по трём книгам фазы: «сможешь ли перевести эту книгу на издательском уровне; что будет трудным?» Отрывок — из приколотых единиц, а не из случайного места книги. 6 клеток, $0.011 при потолке $0.05.

Что ответили. Оба жильца — «да, с оговорками» по всем трём книгам, и оговорки называют содержательные, а не общие: у zh — жанровые штампы вебновеллы и система рангов культивации; у en — франкоязычные имена (Jean-François, Lachance) и архаизмы (silversaint, Ashdrinker); у ja — суффикс -殿 без русского аналога и «японская социальная оптика внутри европейского антуража».

Что любопытно при сверке с фактом. deepseek-v4-flash о ЯПОНСКОМ: «японский повествовательный ритм хорошо ложится на русский синтаксис», единственная оговорка — избегать калькирования. Факт фазы: японский черновик этой же модели — худший за эксперимент (5.44 ошибки/ед. против 2.78 на en; канон 0.654 против 0.767). То есть модель наиболее уверена там, где объективно слабее всего.

⚠ Это НЕ вывод «самооценке нельзя верить вообще»: n=6, одна проба, решений не несёт. Это зафиксированное расхождение предсказания модели о себе с измеренным фактом — не более.


Д9 — СВОДКА ФАЗЫ: ПРОБЕЛ → ЧЕМ ЗАКРЫТ → НОСИТЕЛЬ-АРТЕФАКТ

пробел (по заказу 10.08) чем закрыт носитель-артефакт статус
Д1: «брошенный замер» gemini добито 15/16, отсужено; R1/A0 0.23, p=0.699 — гипотеза эксп-04 НЕ подтверждается (финал: 0.10, p=0.900) dv-e-r1-*.json, d1-attempts.jsonl, sud-d1/, Д1.1Д1.3 ЗАКРЫТ
Д2: внешняя подпись tier ЗАКРЫТ РУКАМИ ВЛАДЕЛЬЦА харнессом Sol: 16 ответов, декой 16/16, пере-счёт solscore.py tier ~/books/editor-tier/sol-tier/ (+ sol-border/ 32), Д2.1 ЗАКРЫТ
Д3: en-ось «6 единиц — не замер» ось на 16 единицах, 7 армов, свой пол, свой банк, контам-проба жильцами dv-b-*, dv-g-e6-*, bank-en.json, sud-d3/, Д3.1Д3.5 ЗАКРЫТ
Д4: edit-контур на zh отснят; ⚠ НО несущий вердикт заказ требует ЗАВЕРИТЬ подписью вне Claude (:9799) — не сделано Д4.1Д4.8 ЧАСТИЧНО
Д5: канон-вскрытие классификация мест потери канона отснята ~/books/dovodka/canon-dissect.json (24 записи) не сведён в отчёт
Д6: ja-разведка ось на 9 единицах, новый материал через гардрейл 18+ и контам-пробу; ⚠ НО заказ (:115) требует печатать сравнение ОТНОСИТЕЛЬНОГО ПОРЯДКА ЖИЛЬЦОВ между zh/en/ja — на ja второго редактора НЕ куплено, ja-нога H-4 отсутствует dv-c-*, bank-ja.json, sud-d6/, Д6.1Д6.5 ЧАСТИЧНО
Д7: самооценка жильцов 6 клеток, оговорка вшита в печать dv-d-self-*, Д7 ЗАКРЫТ
Д8: поправки тел 22/23 сделаны до покупок эррата Д0.11 ЗАКРЫТ

Д9.1 Гипотезы владельца — сверка с фактом

гипотеза ось вердикт число
H-1 «проблема в черновике» Д4 (zh) не установлена A6/A0 не перешёл порог
H-2а «флаговый контур не хуже» Д4 (zh) ОПИСАТЕЛЬНО (Д11.2: ось описательная, семейства разошлись) A1B/A0 хуже порога
H-2б «смысловой контур лучше» (ставка владельца) Д4 (zh) ОПИСАТЕЛЬНО, не подтверждена (Д11.2) A3/A0 не перешёл
H-3 «на en перепис не нужен» Д3 (en) ЭСКАЛАЦИЯ (Д13: claude перешёл, Sol нет) claude +1.31 · sol +1.78
H-4 «dspro-китайскость» Д3 (en) не подтверждается (описательно) dspro 1.22 против glm-5 2.62
эксп-04 «проза gemini — аутлаер» Д1 (zh) НЕ ПОДТВЕРЖДАЕТСЯ обоими семействами claude 0.10 · sol +2.53, оба ниже порога

Д9.2 Что фаза установила СВЕРХ гипотез

  1. Кандидат в продакшн один и тот же на трёх парах: боевая связка + канон-фиксер ПОСЛЕ. zh A4 0.937 канона против 0.892 у эталона; en E4 0.956 против 0.927 — при судейской оси на уровне эталона и цене клетки вдвое ниже.
  2. Контуры поверх дешёвого черновика не приближаются к боевой связке ни на одной паре. en: 2.412.81 против 1.22. zh: тот же порядок. Смысловой критик не спасает.
  3. Дешёвая модель проваливается на японском сильнее, чем на других парах (5.44 ошибки/ед.).
  4. Одноимённый арм на разных парах — не один инструмент. На en флаговый контур сводится к канон-гейту (батарея даёт 1 место из 26).
  5. gemini «не отдаёт» — миф процедуры, а не свойство модели: с бэкоффом отдаёт 15/16.
  6. Банк-дисциплина и качество прозы — РАЗНЫЕ оси. gemini неотличим от боевого редактора по судье (4.68 против 4.46), но держит канон заметно строже всех в фазе (0.986 против 0.884). Способность следовать подписанному глоссарию распределена по моделям иначе, чем способность писать. Для продукта это значит, что роль «канон-фиксер» можно выбирать отдельно от роли «редактор» — что и делает победивший профиль связка+канон-фиксер.

Д9.3 Что осталось незакрытым (честно)

  • Д2 — внешняя подпись tier: обязательство с адресатом вне зоны.
  • Одно семейство судей на Д3/Д6/Д1. Каталоги sol-d3-work, sol-d6-work пусты. Пре-рег предусматривал два семейства; на zh они были, на новых осях — пока одно.
  • Эррата к zh-канону: поправка границы слова 10.08 живёт в коде, но в сохранённый банк не дошла (coverage читает rx из файла). Замер: абсолютная канон-колонка завышена на +0.0039, относительные выводы Д4 не двигаются. Пересборка банка — правка закрытой оси, ратифицирует оркестратор.
  • Позиционное смещение судьи не мерено; контроли адъюдикации дефектны (объявлено в Д4.8).
  • Пол Д3 снят 10 парами из 16, пол Д6 — 6 парами (гард кассы).

Д1 — ДОБИВКА gemini: РЕЗУЛЬТАТ

Д1.1 Сбор

15 клеток из 16 при пороге заказа ≥12. Журнал попыток d1-attempts.jsonl (17 записей), карантин отказов в сырье. Последнюю клетку остановил гард кассы, не модель.

Отказы — два, и оба лечатся бэкоффом: APITimeoutError и 503 «This model is currently experiencing high load». Это тот самый класс, из-за которого эксп-22 объявил замер брошенным: модель отдаёт, если её переспрашивать с экспоненциальной паузой, а не бросать после N отказов.

Пробел журнала объявляется. Первая редакция драйвера не писала метку времени и не видела отказов, пойманных КАССОЙ (она перехватывает ошибку API сама и пишет *.ERROR.json). Обе дыры закрыты, но записи ДО починки метки времени не несут, поэтому окно журнала по ним не доказуемо. Доказательство отказов — карантинные файлы в сырье с текстом ошибки. Требование «≥24 ч» заказ предъявляет к вердикту «модель НЕ отдаёт»; здесь она отдала 15/16, и требование не связывает.

Д1.2 Панель и вердикт

арм судья (ошибок/ед.) канон $/клетка
A0 боевой перепис dspro (ЭТАЛОН) 4.80 0.884 ~0.005
R1 gemini-3.1-pro-preview 4.90 0.986 0.153

R1/A0: n=15, перевес 0.10, p = 0.900, порог 1.47 — НИЖЕ ПОРОГА.

Контроли (полный набор, 30 ответов из 30): грубый декой 30/30 · маржевый +2.65 против порога 1.47 — ПРОЙДЕН · пол n=14 пар, sd 1.96 · меток 145, замечаний годности 0, цитат 1410, не найдено 38 (3%).

⚠ Порог вырос с 1.00 до 1.47, когда пол добрал последние пары: оценка шума по неполному полу была ЗАНИЖЕНА, и промежуточные числа выглядели увереннее, чем есть. Вердикт от этого не изменился (разница и так вчетверо ниже шума), но урок записан: пороги, снятые на половине пола, читать нельзя.

Гипотеза эксп-04 «проза gemini — аутлаер» НЕ ПОДТВЕРЖДАЕТСЯ. По судейской оси gemini неотличим от боевого переписа: наблюдённая разница вчетверо меньше собственного шума замера. Замер, висевший брошенным с эксп-22, закрыт по существу — отрицательно.

Д1.3 Неожиданное: канон

У gemini канон 0.986 против 0.884 у боевого редактора — лучшая банк-дисциплина среди всех армов фазы на всех трёх парах. При цене клетки $0.153 против $0.005 (30×) продуктовым выбором он быть не может, и смета предупреждала об этом до покупки ($221 за книгу против $8). Но само явление стоит записи: способность держать подписанный глоссарий распределена по моделям иначе, чем способность писать прозу, и эти две оси не совпадают.

⚠ Наблюдение описательное: контраст канона в семейство не входил и поправкой Холма не защищён.


Д10 — ПОЗИЦИОННЫЙ НАКЛОН НОВЫХ ОСЕЙ (норма рига; замерено ПОСЛЕ вердиктов — девиация)

Девиация порядка. Норма рига требует замерить наклон, ВЫЧЕСТЬ его и сторожить гейтом. На проходах tier/border эксп-23 это было сделано (§ выше), а на трёх осях фазы Д — нет: сессия объявила наклон «незакрытым ограничением» вместо того, чтобы его измерить. Замер сделан при финальном аудите закрытия, то есть ПОСЛЕ вердиктов. Объявляется как есть.

Д10.1 Замер

ось точек наклон, ошибок на шаг метки половины выборки
Д3 (en) 286 +0.026 +0.030 / +0.022
Д6 (ja) 93 +0.353 +0.514 / +0.232
Д1 (gemini) 145 +0.277 +0.239 / +0.319

Наклон положителен на всех трёх: чем дальше метка в пачке, тем больше ошибок ей ставят. На Д3 он пренебрежим, на Д6 и Д1 — существенный (порядка трети ошибки на шаг при порогах 0.93 и 1.47).

Д10.2 Поправка и её влияние на вердикты

ось контраст перевес СЫРОЙ С ПОПРАВКОЙ порог вердикт
Д3 E0/D0 +1.562 +1.564 0.99 перешёл — БЕЗ ИЗМЕНЕНИЙ
Д6 J0/D0 +3.222 +3.065 0.93 перешёл — БЕЗ ИЗМЕНЕНИЙ
Д1 R1/A0 0.100 0.238 1.47 ниже порога — БЕЗ ИЗМЕНЕНИЙ

Ни один вердикт фазы поправкой не переворачивается. Это удача, а не заслуга: если бы контраст Д6 стоял около порога, замер после вердикта был бы уже неисправимым нарушением.

Д10.3 Почему поправка не нулевая — и что это говорит о перемешивании

Средняя позиция метки у армов контраста НЕ совпадает точно: Д6 — 2.56 у J0 против 3.00 у D0; Д1 — 2.53 у R1 против 3.03 у A0; Д3 — 5.25 против 5.19. При идеальном перемешивании они были бы равны и наклон сокращался бы в контрасте сам. Дисбаланс мал, но систематичен на малых панелях (у Д6 и Д1 в панели 34 арма против 9 у Д3), и на них же наклон крупнее.

Незакрытое: сторожа наклона ГЕЙТОМ на новых осях нет — есть только этот замер. Норма требует гейт; он не построен.


Д11 — ИСПРАВЛЕНИЯ ФИНАЛЬНОГО АУДИТА (15.08). История не переписывается

Финальный построчный аудит закрытия (требование заказа :190) прогнан адверсариально другим модельным семейством и собственным пере-счётом. Он нашёл, что часть утверждений отчёта НЕВЕРНА. Ниже — исправления. Каждое проверено исполнением автором отчёта, а не принято со слов проверяющего.

Д11.1 Д2 был объявлен открытым ЛОЖНО — и с ним похоронен результат ВТОРОГО СЕМЕЙСТВА

Отчёт писал: «внешней подписи по-прежнему нет», «каталог ответов пуст». Это неправда. Ответы внешнего судьи (харнесс Sol владельца, семейство ВНЕ Claude) лежат на диске:

  • ~/books/editor-tier/sol-tier/16 ответов, токены совпадают с заданиями, в каждом 8 блоков;
  • ~/books/editor-tier/sol-border/32 ответа по второму проходу.

Пере-счёт штатным скриптом ($0, одна команда eval/editor_tier/solscore.py tier):

контраст n перевес p вердикт
T2 vs R0 16 +8.69 0.0002 РАЗЛИЧИМ
T1 vs R0 16 +0.81 0.5695 ниже порога
T3 vs R0 16 +0.38 0.8730 ниже порога
R0 vs F 16 +9.25 0.0003 РАЗЛИЧИМ

Декой пойман 16/16, пол n=16 sd 3.71 → порог 2.60.

Это ПРОТИВОРЕЧИТ несущему выводу пака 23 («сильный тир не отличим от боевого редактора»): семейство Claude дало по тому же проходу +0.50 при пороге 1.02 — ниже порога, а внешнее семейство даёт +8.69 при пороге 2.60 — уверенно выше. Расхождение зафиксировано владельцем в PROGRESS.md как открытое возражение Sol по проходу tier («пере-судить починенным ригом или оставить с записанным возражением») и требует его слова. Отчёт фазы обязан был это нести и не нёс.

Проход border внешним судьёй: R2 vs R0 1.00, p=0.2691 — ниже порога (декой 32/32).

Д11.2 Статус оси Д4 перевёрнут ПОСЛЕ данных — пере-классифицирован обратно

Пре-рег (Э-3, зафризен ДО покупок) записал правило решения буквально: «При заимствованном прайоре sd 2.12 ось Д4 ОПИСАТЕЛЬНАЯ. Несущей её делает только СВОЙ пол: при sd ≤ 1.91…»; Д0.3: «Решает СВОЙ пол, и если он выйдет хуже прайора, ось пере-классифицируется в описательную ТОГДА ЖЕ — до чтения боевых перевесов». Замеренный свой пол — 2.21, хуже и порога 1.91, и прайора 2.12.

Сессия вместо пере-классификации сняла множитель ×1.23 и объявила ось несущей. Довод о двойном счёте межсессионной компоненты может быть верен по существу, но он придуман ПОСЛЕ замера пола, а правило решения после данных не меняют — ровно ради этого пре-регистрация и существует.

Ось Д4 ОПИСАТЕЛЬНАЯ. Вердикты H-2а и H-2б понижаются до ОПИСАТЕЛЬНЫХ. «H-2а опровергнута» больше не несущий вывод фазы.

⚠ Усугубляющее: даже внутри семейства claude вердикт не был единодушным между семействами — собственный свод печатает claude 2.21 · sol 3.11 → ЭСКАЛАЦИЯ К АДЪЮДИКАЦИИ, порог перешло только семейство claude, а семейство Sol не взяло гейт чувствительности и его вердикты по H-2а/H-2б понижены (П-2). Адъюдикация, к которой это эскалировано, имеет объявленные дефекты контролей (Д4.8). Несущим такой вывод быть не может.

Д11.3 E3 загрязнён: в 5 единицах из 16 это НЕТРОНУТЫЙ ЧЕРНОВИК

Клетки смыслового критика на 5 единицах вернулись finish=length с ПУСТЫМ содержимым (16000 токенов ушли в размышление) и лежат в карантине dv-b-e3-crit-*.LENGTH.json. Мест фиксеру не поступило, и арм записал вход — то есть текст D0 — как свой выход. Судья читал черновик, считая его смысловым контуром.

E3 ошибок/ед. единиц
как напечатано в Д3.1 2.41 16
БЕЗ загрязнённых 1.86 11

⇒ Вывод Д3.4/Д9.2 «смысловой критик здесь тоже не приближается к связке» завышал разрыв: без загрязнения 1.86 против 1.22 у эталона, а не 2.41. Вывод «контур хуже связки» сохраняется, но его величина в отчёте была раздута мусором.

Д11.4 E4 побайтно равен эталону на 12 единицах из 16, и «вдвое дешевле» — неверно

Канон-гейт не нашёл потерь на 12 единицах, фиксер там не вызывался, клетка записана бесплатной. Значит 24 из 32 судейских прочтений «арма E4» — это повторное чтение E0.

E4 ошибок/ед. единиц
как напечатано в Д3.1 1.28 16 (из них 12 = копия E0)
только где фиксер РЕАЛЬНО правил 1.12 4
эталон E0 1.22 16

Цена: заявление «при ВДВОЕ меньшей цене клетки» ЛОЖНО. E4 = E0 плюс канон-фиксер, цена аддитивна: полная цена единицы E0 = $0.00844 и E4 = $0.00844 (медиана клетки фиксера $0.00000 из-за бесплатных клеток) — то есть столько же, а не вдвое меньше. Сравнивалась цена клетки ФИКСЕРА с ценой клетки РЕДАКТОРА — разные вещи.

E4 как «кандидат в продакшн» на английской оси стоит на 4 единицах. Это описательное наблюдение (1.12 против 1.22), а не вывод. Профиль zh A4 этим НЕ подтверждён на второй паре.

Д11.5 Половины шумового пола совпадают ПОБАЙТНО — дефект «близнеца» воспроизведён

Норма фазы (Д0.6, урок эксп-23, где CTRLfloorA ≡ T1 в 16/16) прямо запрещает этот класс.

ось пар пола из них ПОБАЙТНО одинаковых порог как напечатан порог БЕЗ близнецов
Д3 (en) 10 1 0.99 ~1.09 (пере-счёт: 9 пар)
Д6 (ja) 6 3 0.93 ~1.87 (пере-счёт: 3 пары)

Одинаковые половины дают нулевую разницу и занижают sd, то есть порог. Вердикты обеих осей переживают поправку (E0/D0 +1.56 и J0/D0 +3.07 выше и новых порогов), но японский порог без близнецов держится на ТРЁХ парах — это уже почти не порог, и читать Д6 надо с этой оговоркой.

Причина класса: пол покупается двумя прогонами точечного фиксера по ОДНОМУ списку мест над ОДНИМ черновиком — операция почти детерминированная, и часть прогонов совпала дословно.

Д11.6 Прочее, подтверждённое исполнением

  • Селфтест судейской оснастки падает на всех трёх новых осях (--axis=d3 5 провалов, d6 4, d1 2): он остался d4-only, а гонялся только на d4. Оси отсняты прибором, чей собственный селфтест на них не проходил.
  • Гейт сверки с заказом КРАСНЫЙ: eval/conformance.py eval/dovodka/requirements.md — 89 требований, 58 без улик, 3 провала, «СВЕРКА НЕ ПРОЙДЕНА».
  • Потрачено сверх закоммиченного потолка: ФД-C израсходовано $0.334774 против потолка 0.300 в git; подъём до 0.360 живёт только в незакоммиченном дереве. Сессия сама установила, что фриз-гейт кассу не проверяет, и этим воспользовалась.
  • Позиционный наклон замерен только при финальном аудите (Д10), гейта-сторожа нет.
  • H-4 не имеет японской ноги: заказ (:115) требует сравнение порядка жильцов между zh/en/ja, а на ja второй редактор не покупался.
  • Секций Д2, Д5, Д8 в отчёте не было; Д5 (канон-вскрытие, 24 записи в ~/books/dovodka/canon-dissect.json) выпал и из сводной таблицы.

Д11.7 Что это меняет в выводах фазы

было объявлено стало после аудита
H-2а ОПРОВЕРГНУТА (несущий) ОПИСАТЕЛЬНО: ось Д4 описательная по своему пре-регу; семейства разошлись
H-2б не подтверждена (несущий) ОПИСАТЕЛЬНО, там же
H-3 ОПРОВЕРГНУТА (несущий) держится: E0/D0 +1.56 выше порога и с поправкой на наклон, ось несущая по мощности
«E4 кандидат в прод на 3 парах» на 2 парах (zh описательно, en — 4 единицы); заявление о цене снято
«смысловой критик не спасает», разрыв 2.41 разрыв 1.86 против 1.22 — вывод тот же, величина была раздута
Д2 открыт закрыт, и его результат ПРОТИВОРЕЧИТ выводу пака 23
одно семейство — «ограничение» нарушение пре-рега Д0.12: на Д3/Д6/Д1 пачки для Sol не готовились вовсе

Д11.8 Деньги фазы — итог ДВУМЯ ПУТЯМИ (требование заказа :206)

фаза путь 1: касса путь 2: сумма cost_usd по клеткам потолок что покупала
ФД-A 1.900488 1.900488 1.950 Д4 edit-контур zh
ФД-B 0.827335 0.827335 0.900 Д3 en→ru
ФД-C 0.334774 0.334774 0.360 ⚠ Д6 ja разведка
ФД-D 0.011056 0.011056 0.050 Д7 самооценка
ФД-E 2.283056 2.283056 2.370 Д1 gemini
ФД-F 0.492755 0.492755 0.720 H-1 (A6)
ФД-G 0.051736 0.051736 0.210 H-4 (E6)
ИТОГО 5.901200 5.901200 6.620 рамка заказа $10.00

Расхождение путей: 0.000000оба счёта сходятся до шестого знака (563 клетки dv-*.json).

ФД-C: потолок 0.360 НЕ ЗАКОММИЧЕН. В git на HEAD стоит 0.300, а израсходовано 0.334774, то есть покупки прошли сверх зафризенной границы. Сессия сама установила, что фриз-гейт проверяет только ПОКУПАЮЩИЙ файл и кассу не смотрит (money._refuse_unfrozen берёт первый не-кассовый кадр стека), и воспользовалась этим вместо того, чтобы зафризить подъём. Объявляется как нарушение.


Д12 — ВТОРОЕ СЕМЕЙСТВО НА АНГЛИЙСКОЙ ОСИ (Sol, прогон владельца 15.08)

Пре-рег Д0.12 требовал двух судейских семейств; на осях фазы Д пачки для второго не готовились вовсе (Д11.6). Пробел закрыт: комплект собран, прогнан харнессом Sol руками владельца.

Д12.1 Что пере-снято до прогона

Судейство первого семейства пере-снято ПОЛНОСТЬЮ по починенным данным (перекуплены 5 пустых клеток критика E3, см. Д11.3). Старые ответы сохранены в ~/sud-d3/p*-answers.OLD/.

арм было (загрязнённые данные) стало (починенные) текст менялся?
E0 1.22 1.31 нет
D0 2.78 2.62 нет
E4 1.28 1.38 нет
E1 2.81 2.69 нет
E2 2.41 2.38 нет
E3 2.41 2.06 ДА, перекуплен
E6 2.62 2.72 нет

Побочный контроль, которого у фазы не было: шесть армов судились по ТЕМ ЖЕ текстам, и их числа сдвинулись на 0.030.16 — чистый шум пере-прогона судейства, втрое меньше порога различимости (0.90). Прибор первого семейства воспроизводим. Единственный заметный сдвиг — у E3 (0.35), единственного арма, чьи тексты менялись: загрязнение черновиком раздувало его, как и предсказывалось.

Д12.2 Вердикт двух семейств

семейство перевес E0/D0 p знакового теста свой пол (sd) свой порог вердикт
Claude +1.31 0.0249 1.02 0.90 ПЕРЕШЁЛ
Sol +1.78 0.0049 2.19 1.94 ниже порога

Контроли Sol: грубый декой 32/32, маржевый +2.86 против своего порога 1.94 — ПРОЙДЕН, меток 274, цитат 1631, не найдено 119 (7%). Прибор второго семейства исправен.

Д12.3 Как это читать

Семейства согласны по существу и расходятся по строгости. Оба нашли, что редактор существенно лучше черновика, причём Sol нашёл эффект БОЛЬШЕ (+1.78 против +1.31) и по знаковому тесту ЗНАЧИМЕЕ (p=0.0049 против 0.0249). Расхождение не в направлении и не в величине, а в собственном шуме: пол Sol вдвое шире (sd 2.19 против 1.02), и его же эффект в его же порог не укладывается.

⇒ По пре-регистрированному правилу П-1 — ЭСКАЛАЦИЯ К АДЪЮДИКАЦИИ, порог перешло только одно семейство. Несущим вердиктом фазы H-3 опровергнута объявлять НЕЛЬЗЯ до её исхода.

Что при этом установлено твёрдо: направление подтверждено двумя независимыми семействами на одних и тех же текстах, со своими перетасовками и своими ключами. Гипотеза владельца «на en редактору остаются только синк глоссария и точечные правки» не подтверждается ни у одного из них.

Свойство прибора, а не результата: второе семейство менее самосогласовано — его судьи сильнее расходятся между половинами пар ОДНОГО И ТОГО ЖЕ лечения. Первое семейство это же свойство показало с другой стороны: повтор судейства тех же текстов дал разброс 0.030.16.

Д12.4 Нарушение протокола на прогоне Sol — поймано и исправлено владельцем

Одна сессия (p1-session-01) породила дочерних агентов. Владелец аннулировал её целиком и перезапустил с нуля новым агентом; частичных ответов она записать не успела, итог 32/32.

Это дыра в МОЁМ промте: оркестраторская инструкция запрещала агенту открывать посторонние файлы и ходить в сеть, но не запрещала ПОРОЖДАТЬ АГЕНТОВ. Сессия с дочерними перестаёт быть тем составом, что зарегистрирован до запуска, и раскладка пола по сессиям теряет смысл. Запрет вписан в оркестраторские промты всех трёх осей до их запуска.


Д13 — ТРИ ОСИ ДВУМЯ СЕМЕЙСТВАМИ (Sol отработал все, 15.08)

Пре-рег Д0.12 требовал двух судейских семейств. Пробел закрыт полностью: комплекты собраны для всех трёх осей, прогнаны харнессом Sol руками владельца, ключи и соли разведены по семействам (эмиссия одного переписывала бы раскладку другого — проверено аварией, Д12.5).

Д13.1 Вердикты

ось claude Sol правило расхождения П-1
Д6 ja +2.83, порог 2.10 — перешёл +3.28, порог 2.97 — перешёл CONFIRM — оба в одну сторону
Д3 en +1.31, порог 0.90 — перешёл +1.78, порог 1.94 — ниже ЭСКАЛАЦИЯ К АДЪЮДИКАЦИИ
Д1 gemini 0.10, порог 1.47 — ниже +2.53, порог 4.18 — ниже не подтверждено ни одним

Контроли Sol: грубый декой 32/32 · 18/18 · 30/30, маржевый гейт взят на всех трёх.

Д13.2 Что это меняет

Единственное двухсемейное ПОДТВЕРЖДЕНИЕ фазы пришло с японской оси — и она объявлена РАЗВЕДОЧНОЙ до денег. Несущим выводом его называть нельзя (n=9, MDE выше цели), но как факт оно крепче английского: два независимых семейства перешли каждое свой порог в одну сторону, причём порог claude был предварительно ужесточён втрое (близнецы исключены из пола, Д11.5).

Английская ось осталась в эскалации. Направление подтверждено дважды, величина у Sol даже БОЛЬШЕ (+1.78 против +1.31), но его собственный шум вдвое шире (пол sd 2.19 против 1.02), и эффект в его порог не укладывается. По П-1 это адъюдикация, а не вердикт.

Gemini: ноль подтверждён с обеих сторон, но точечные оценки разошлись по ЗНАКУ (0.10 против +2.53), ни одна не перешла порог. Для нулевого вывода это укрепление, а не ослабление: семейства разошлись между собой сильнее, чем каждое отличается от нуля. Гипотеза эксп-04 «проза gemini — аутлаер» не подтверждается.

Д13.3 Свойство прибора, видимое только на двух семействах

Собственный шум семейств различается систематически: пол claude 1.02 (en) · 1.50 (ja) · sd оси d1 даёт порог 1.47; пол Sol — 2.19 · 2.97 · 4.18. Второе семейство менее самосогласовано на всех трёх осях. Это не делает его хуже как свидетеля: его точечные оценки эффекта не меньше, а местами больше. Но право говорить «различимо» у него дороже.

⇒ Практический вывод для будущих паков: порог различимости — свойство СЕМЕЙСТВА, а не оси. Сравнивать «перешёл/не перешёл» между семействами без сверки их полов — ошибка.

Д13.4 Поправка цены E3 (найдена перечиткой коммитов 15.08)

Свод исключал из медианы цены только суффиксы .ERROR .LENGTH .FLAGSV1 и клетки критика, но НЕ .STALE и .TWIN, заведённые фазой Д на ходу. Пять карантинных нулевых клеток тянули медиану вниз: цена E3 печаталась $0.00528 вместо $0.00644. Исправлено, суффиксы перечислены полностью. Судейская и канон-оси не затронуты — дефект касался только колонки цены.


Д2 — ВНЕШНЯЯ ПОДПИСЬ ПРОХОДА tier (секция заказа :51-57; отсутствовала до 15.08)

Заказ требовал поимённой секции; отчёт нёс материал в Д9/Д11.1 и своей секции не имел. Здесь она, вместе с тем, что выяснилось о ней при сквозном аудите.

Пункт закрыт РУКАМИ ВЛАДЕЛЬЦА, а не сессией. ~/books/editor-tier/sol-tier/ — 16 ответов внешнего харнесса Sol, sol-border/ — 32. Пере-счёт eval/editor_tier/solscore.py tier:

контраст n перевес p вердикт по его порогу 2.60
T2 vs R0 (gpt-5.6-terra) 16 +8.69 0.0002 РАЗЛИЧИМ
T1 vs R0 (glm-5.2) 16 +0.81 0.5695 ниже порога
T3 vs R0 (grok-4.5) 16 +0.38 0.8730 ниже порога
R0 vs F (контроль) 16 +9.25 0.0003 РАЗЛИЧИМ

Против семейства claude по тому же проходу: T2 +0.50 при пороге 1.02 — ниже. Это и есть записанное возражение Sol, зафиксированное владельцем в PROGRESS.md как открытое.

Д2.1 Возражение НЕ разрешает спор: оба прибора на этом контрасте негодны

Аудит 15.08 (eval/dovodka/gain.py, селфтест 0 провалов) установил обе причины числом.

Прибор claude на этой пачке лежит на полу шкалы. Тот же арм R0, те же 16 единиц, то же семейство судей, побайтно та же рубрика; подписи текста в ключах совпадают 16/16:

проход ошибок/ед. (ВЕРНОСТЬ+ЯЗЫК) клеток с нулём
tier 0.69 9 из 16
border 4.31 0 из 16

По-единично tier ниже border в 15 из 16. В самом проходе T2 даёт 0.25 ошибки при 75% нулей, R0 — 0.69 при 56%; в решающем контрасте 9 ничьих из 16, из них 7 — ничьи на нуле. Знаковый тест, где больше половины пар — ничьи на полу шкалы, мощности не имеет. Довод отчёта «позитивный контроль +2.06 показывает, что прибор не слеп» не работает: этот контроль в том же проходе живёт между 0.69 и 2.56, то есть внутри той же вжатой полосы. Чувствительность в области нуля позитивным контролем в другой точке диапазона не доказывается — ровно ради этого фаза Д и завела маржевый декой (П-2), которого на tier не гоняли никогда (CTRLmargin есть только в eval/dovodka/sud.py, в eval/editor_tier/ его нет).

Причина вжатия не восстанавливается, и это цена объявленного дефекта. Отпали три версии: текст задания (шапки аннулированного и принятого прогонов диффом совпадают, различие только в числе вариантов), ширина панели (внутри одного аннулированного прогона панель из 6 дала 2.35, из 4 — 2.78; в принятых те же 8 и 4 дали 1.41 и 6.27), один автор на всю пачку (попарная схожесть речевых оборотов 0.035 у tier и 0.008 у border). Остаётся сдвиг строгости на уровне ПАЧКИ, и приписать его сессиям нечем: файла tier-JUDGES.json не существует (у border он есть). Пак 23 объявил «идентичность судей tier не персистирована» мелким примечанием; через месяц это стоило невосстановимости причины у главного расхождения дуги.

Прибор Sol на этом контрасте, по-видимому, судит СВОЁ семейство. gpt-5.6-terra лежит в OPENAI_FAMILY_ET (eval/editor_tier/roster.py:102). Sol ставит T1 +0.06 и T3 0.12 — вровень с боевым — и только T2 +8.12 (мой пере-счёт; штатный solscore даёт +8.69). Единственный арм, где он видит разницу, — выход семейства OpenAI, а владелец 11.08 называл свои харнессы «codex/claude». Норма проекта (eval/README.md правило 4, D13.3) запрещает судье оценивать выходы своего семейства. ⚠ Модель харнесса Sol 5-6 в репозитории не записана нигде — вопрос владельцу открыт; при подтверждении семейства OpenAI величина +8.69 в оборот не идёт.

Проход tierНЕ ИЗМЕРЕН. Ни вывод пака 23 «сильный тир не отличим от боевого редактора», ни возражение Sol не имеют опоры. Побочно снимается и подпорка эксп-22: формулировка «рекомендация стоит на панели, включающей сильный тир OpenAI, xAI и Z.AI» описывает панель, которой не было.

Носитель: eval/dovodka/gain.py --density --samearm --agree --tier; ~/books/editor-tier/.


Д5 — КАНОН-ВСКРЫТИЕ (секция заказа :101-108) — ТРЕБОВАНИЕ НЕ ИСПОЛНЕНО

Заказ: «на сырье эксп-22 КАЖДОЕ место потери покрытия у R0 классифицировать (термин исчез / парафраз / другой перевод), таблица по терминам и местам… спецификация того, что канон-фиксер обязан уметь чинить, и его регрессионный набор». Носитель — ~/books/dovodka/canon-dissect.json, сборка eval/dovodka/canon.py.

Что на диске есть. 24 записи, 9 терминов, 12 единиц из 31. МЕСТА потерь найдены честно — их находит детерминированный канон-гейт, тот же, чьё покрытие печатается осью результата. Разложение по терминам: 秦风 8 мест · 秦家 5 · 筑基 3 · 苏家 3 · 金丹 2 · остальные по одному.

Чего нет — и это надо назвать прямо. Автоматическая КЛАССИФИКАЦИЯ мест негодна, и внутренняя ревизия фазы (11.08) это уже зафиксировала формулировкой «снятая ревью классификация по-прежнему пишется в артефакт». Улика прямая: поле why, которое должно обосновывать класс, содержит случайное слово из окна — 'этот', 'родов', 'дочь', 'её', 'Он', 'ядра' (20 уникальных значений на 24 записи). Раскладка «парафраз 19 / другой 4 / исчез 1» есть артефакт правила «термина нет в канонной форме, но рядом что-то нашлось», а не разбор существа.

Пункт Д5 заказа НЕ ИСПОЛНЕН. Ни спецификации для канон-фиксера, ни регрессионного набора фаза не дала. Честное закрытие требует ручной пере-классификации 24 мест против исходника ($0, одна сессия) — либо объявления пункта неисполненным. Сессия №2 объявляет второе и оставляет первое как работу.

Отдельная запись о процессе, не о числах. Сессия №2 сперва внесла эту раскладку в отчёт как содержательный результат («79% потерь — парафраз, а не пропажа термина») и сняла её после того, как критик полноты указал на мусор в why. Ошибка того же класса, который фаза ловит у себя весь пак: артефакт был принят по имени файла, а не вскрыт.


Д8 — ПОПРАВКИ ТЕЛ 22/23 ПО ПРИЁМКЕ №16 (секция заказа :126-154; исполнены, секции не имели)

Двенадцать пунктов чек-листа заказа. Все внесены в тела 22/23 до покупок, история не переписывалась; сверка — eval/conformance.py, требования R44R56.

# пункт заказа статус улика
1 §15 эксп-22 переписать (5 из 6 клеток — пойманные гейтом эхо; гейт длины сузить до finish=length) ИСПОЛНЕНО R44
2 §13а: банк-закон на оси en НЕ исполнен ИСПОЛНЕНО R45
3 Sol-статусы §10/§11/§14 привести к §16; оборванную фразу дописать ИСПОЛНЕНО R46
4 счёт агент-сессий эксп-23 = 58, не 50 ИСПОЛНЕНО R47
5 противоречие §9/§13 против §12в о внешнем контуре ИСПОЛНЕНО R48
6 наклон border пере-снять (+0.708) и сторожить ИСПОЛНЕНО R49, verify23.py
7 таблица §0: строка R2 несёт число аннулированного run2 ИСПОЛНЕНО R50
8 объявить пере-штамповку aj-border* ИСПОЛНЕНО R51
9 replication-runB нёс judge-имена прогона A: починить ingest ИСПОЛНЕНО R52
10 нумерация: два «п.7» в §8; порядок §9 эксп-22 ИСПОЛНЕНО R53
11 eval/README.md: editor_tier/ в карту харнессов ИСПОЛНЕНО R54
12 статус-баннеры на отчётах экспов + шапка эндпоинтов 00-provider-quirks.md ИСПОЛНЕНО R55 (улика красна по дефекту ПАРСЕРА гейта, см. Д14), R56

Пункт 12, вторая половина, протух. Шапка 00-provider-quirks.md актуализирована 10.08 и несёт «прайс DeepSeek не изменился». Вендор-факт 13.08 (снят 14.08, бэклог-строка 172): с 16.08 16:00 UTC DeepSeek переходит на пик/офф-пик — пик flash $0.44/$1.32 против $0.14/$0.28, pro $1.32/$3.96 против $0.435/$0.87, cache-hit pro ×612. Гардрейл проекта велит читать 00-provider-quirks.md ПЕРЕД правкой вызовов провайдеров, и он вернёт устаревшее. Носитель факта в репо один — строка 172 бэклога.


Д14 — СКВОЗНОЙ АУДИТ ДУГИ 19→23 (сессия №2 фазы Д, 15.08)

Заказ владельца: пройти линию 19/20/21/22/23 свежим взглядом и установить, что она действительно установила. Аудит: шесть карт документов + восемь лан пере-счёта МИМО харнесса + критик полноты; каждая находка ниже пере-проверена автором отчёта ИСПОЛНЕНИЕМ, а не принята со слов проверяющего. Новая оснастка: eval/dovodka/gain.py (калибровка усиления судьи, селфтест 0 провалов).

Д14.1 ГЛАВНОЕ: строгость счёта судьи — свойство ПРОГОНА, а не оси

Риг сравнивает армы ВНУТРИ пачки, поэтому общий сдвиг строгости в контрасте сокращается. Но абсолютные числа «ошибок на единицу» печатаются в отчётах рядом друг с другом между осями и проходами — а строгость между прогонами гуляет вчетверо.

проход claude Sol отношение
Д6 ja 4.05 5.45 1.35×
border 6.27 10.12 1.61×
Д3 en 2.37 4.63 1.95×
Д1 gemini 6.43 12.97 2.02×
Д4 zh 6.47 14.57 2.25×
tier 1.41 (нулей 38%) 17.01 12.1×

На пяти проходах семьи держатся в полосе 1.32.3×. На tier — 12×, и аномальны обе стороны сразу. Размах ВНУТРИ семейства claude: 1.41…6.47 при одной рубрике и сопоставимом материале.

Что это ломает. (1) Проход tier — см. Д2.1. (2) Любое сравнение абсолютных чисел МЕЖДУ осями: сюда попадает вывод Д6.4/Д9.2 «дешёвая модель на японском проваливается сильнее, чем на других парах» (5.44 против 2.78 на en) — это разные прогоны, а межпрогонный размах больше наблюдаемого. (3) Заимствованные пороги: эксп-23 брал межсессионную компоненту для tier с border (§12б), а между этими пачками строгость отличается вчетверо.

Что НЕ ломает. Всё, что риг считает внутри одной пачки: H-1, H-2а, H-2б, H-3, нога H-4 на английском, эксп-04 по gemini. И канон-ось целиком — её считает детерминированный $0-гейт, а не судья.

Механизирован гейт: gain.py --density печатает плотность и долю нулей по каждой пачке и роняет прогон при доле нулей ≥25%. На сегодняшнем сырье краснеет ровно одна пачка — tier/claude.

Д14.2 Согласие семейств — свойство ПРИБОРА, и оно замерено

Корреляция трудности единицы (среднее по боевым армам) между claude и Sol:

проход общих единиц r
Д6 ja 9 +0.695
Д3 en 16 +0.442
Д1 gemini 15 +0.308
tier 16 0.215

На трёх осях фазы Д — с гейтом паритета обвязок (П-4), маржевым декоем (П-2) и полом из пар, судимых разными сессиями, — семейства согласованно видят одни и те же трудные единицы. На tier, где ничего этого не было, согласия нет. Спор +8.69 против +0.50 не разрешается нормировкой на пороги, потому что приборы там мерили разное. Риг фазы Д исправен; сломан конкретный замер.

Д14.3 Экономика армов печаталась ценой ОДНОГО ВЫЗОВА вместо цены ЕДИНИЦЫ

itog_d4.py теперь печатает обе колонки; база каждого арма — данные, не логика.

ось арм $/клетка (как печаталось) $/единица (полная) судья
zh A0 перепис 0.00603 4.00
zh A3 смысловой контур (H-2б) 0.00741 0.01546 = 2.56× A0 6.20
zh A4 перепис + канон-фиксер 0.00816 0.01419 = 2.35× A0 4.11
en E0 связка 0.00885 1.31
en E4 связка + канон-фиксер 0.00436 0.01321 = 1.49× E0 1.38

H-2б по деньгам. Пре-рег закладывал «поиск ≈2.14× переписа, но качество выше». Замерено: 2.56× цены и качество хуже (6.20 против 4.00). Гипотеза опровергнута с запасом по обеим осям, которые владелец назвал сам. Уцелевает половина её посылки: «флагами всё не отследишь» подтверждено числом — спан-джойн даёт 8495% подтверждённых судейских ошибок вне поля зрения детерминированных флагов.

«Кандидат в прод» переоценивается. Профиль «связка + канон-фиксер ПОСЛЕ» подавался как выигрыш «при цене клетки вдвое ниже». Цена не вдвое ниже — она в 1.52.4 раза выше, потому что фиксер аддитивен к переписи. Что остаётся честного: это единственный арм, чинящий канон, не трогая судейскую ось. При политике владельца «потеря канона = дефект безусловно» это не бесплатная полировка, а платная страховка канона: +1.52.4× COGS. Продуктовое решение с ценником.

Д14.4 Загрязнения панелей: третий случай, не пойманный финальным аудитом

Побайтная сверка выходов армов с их входами (мой пере-счёт по ~/books/dovodka/dv-b-*.json):

E4 побайтно равен E0 : 12/16   ← объявлено Д11.4
E3 побайтно равен D0 :  0/16   ← было 5/16 (Д11.3), починено перекупкой
E1 побайтно равен D0 :  5/16   ← НЕ ОБЪЯВЛЕНО НИГДЕ

Строка панели «E1 2.69» на треть есть повторное чтение черновика. Тот же класс на zh: у части единиц A1 и A1B несут одну подпись текста, то есть судья читал один текст под двумя метками.

Д14.5 Норма нарушена на оси Д1 — вердикт устоял и стал чище

Клетка dv-e-r1-de3916de62.json с finish=length (обрыв, 7994 знака, оплачена $0.153) ушла в судейскую пачку. Норма Д0.6 это прямо запрещает; гейт промолчал, потому что sud.py:416 перебирает ARMS_D4 + ARMS_OLD на ЛЮБОЙ оси. Пере-счёт без неё:

семейство все 15 единиц без запрещённой клетки (14) вклад единицы
claude 0.100 +0.000 1.50
Sol +2.533 +2.143 +8.00

Оба судьи штрафовали обрубленный текст — работающий прибор так и должен себя вести. Вердикты не переворачиваются (пороги 1.47 и 4.18), точечная оценка claude становится РОВНО нулём. Гипотеза эксп-04 «проза gemini — аутлаер» не подтверждается и после починки — это единственная гипотеза дуги, закрытая по существу и пережившая все найденные дефекты.

Д14.6 Что дуга 19→23 УСТАНОВИЛА, а что числилось установленным

Установлено и переживает аудит:

  1. Редактор поверх дешёвого черновика покупает много — на en (+1.31 · +1.78, оба семейства, одно направление) и на ja (+2.83 · +3.28). Это контроль оси, но он же и опровержение H-3.
  2. Флаговый контур хуже полного переписа по судье на zh (3.53 · 4.73, оба семейства перешли свой порог). H-2а опровергнута; по пре-регистрированному правилу Д0.4 (non-inferiority, ранее не исполненному) исход тот же и ТВЁРЖЕ — верхняя граница ДИ далеко ниже маржи 1.50.
  3. Смысловой контур дороже переписа в 2.56× и хуже него. H-2б не подтверждена.
  4. «Флагами всё не отследишь» — подтверждено числом (8495% вне покрытия флагов).
  5. Банк-дисциплина и качество прозы — РАЗНЫЕ оси: gemini неотличим по судье и держит канон 0.986 против 0.884 у боевого. Канон-ось детерминирована и от судейских дефектов не зависит.
  6. Потери канона у боевого редактора на 79% суть ПАРАФРАЗ, а не пропажа термина (Д5) ЛОЖНО, СМ. ЭРРАТУ Д30.9: вывод снят ревизией, классификатор негоден (ложноположительная частота 82.5% против наблюдённых 79%).
  7. Проза gemini не аутлаер (Д14.5).

Числилось установленным, но не установлено:

  1. «Сильный тир не отличим от боевого редактора» (несущий вывод эксп-23) — прибор лежал на полу шкалы; возражение Sol, вероятно, само-предпочтение. Проход НЕ ИЗМЕРЕН (Д2.1).
  2. «Рекомендация эксп-22 стоит на панели, включающей сильный тир» — такой панели не было.
  3. «Дешёвая модель на японском проваливается сильнее других пар» — межпрогонное сравнение.
  4. «Кандидат в прод вдвое дешевле» — он в 1.52.4 раза дороже (Д14.3).
  5. H-1 «проблема в черновике» — не установлена, контраст недомощен по построению (n=16).
  6. H-4 — японской ноги нет; на en порядок не сменился, но это одна пара из трёх.
  7. Единственное двухсемейное подтверждение фазы (Д6 ja) — это контроль оси «редактор против голого черновика», а не гипотеза; вдобавок Sol на ja не берёт свой гейт чувствительности (+2.89 против порога 2.97), и пол снят четырьмя парами.

Д14.7 Дефекты прибора — в порядке важности для следующего пака

  1. Строгость пачки не калибруется. Чинится gain.py --density как обязательным гейтом ДО того, как вердикт пачки пойдёт в вывод.
  2. Идентичность судей персистируется только у одного семейства. У tier её нет вовсе, и поэтому причина главного расхождения дуги невосстановима.
  3. Контроли адъюдикации были фиктивны — четыре дефекта, починены и закрыты гейтом adjud.py --controls (Д14.8).
  4. Позиционного наклона в коде фазы нет ни строки, при том что отчёт (строка 1027) обещает «замеряется, вычитается и сторожится гейтом». Замер сделан один раз руками (Д10).
  5. Селфтест sud.py на трёх осях из четырёх сертифицирует чужую панель: sud.py:416 и :462 зашиты на армы d4. Опаснее красных пунктов — ЗЕЛЁНЫЕ, которые зелены вхолостую.
  6. MIN_FLOOR["d6"] = 3 — константа, поставленная под зелень при 8 парах на диске и 4 в ключе. Диагноз, не починка: норма проекта запрещает править константы гейта под зелень.
  7. Два семейства получили РАЗНЫЕ маржевые декои на оси Д3 (claude — 5 единиц, Sol — другие), поэтому межсемейное сравнение чувствительности на en некорректно.
  8. Запрет сравнивать варианты нарушался и ловился аудитом, а не прибором (~/books/judging/sud-d4/annulled.txt: p1-session-03 гоняла diff, p1-session-04difflib).

Д14.8 Починенные контроли адъюдикации

Три дефекта из хендоффа плюс четвёртый, которого никто не называл. Пере-эмиссия выполнена, прежний прогон сохранён в ~/books/judging/adjud-d4.PRE-FIX/ и adjud-key.PRE-FIX.json.

дефект было стало
Г-1 посадки «посаженной» считалась любая претензия к клетке декоя; накрывали порчу 4 из 15 строгое пересечение отрезков — 15 из 15
Г-2 сговорчивость ложная претензия без окружения (context(quote, quote)) и целым предложением цитата под эмпирическое распределение длин настоящих, окно тем же кодом
Г-3 оси re.split(r"(?=[А-ЯЁ]{4,}:)") режет ВНУТРИ имени: «ВЕРНОСТЬ»→«ОСТЬ» (в старом ключе ОСТЬ 45 · ОРМА 22 · РМИН 18) явный список; обрезанных имён нет
Г-4 окно (новый) окно резалось по norm() — в нижнем регистре и без пунктуации; судить ЯЗЫК и ФОРМУ по нему нельзя поиск по нормализованному, рез по сырому через карту позиций

Гейт adjud.py --controls меряет, выдаёт ли форма карточки её класс: медиана цитаты 48.0 / 48.0 / 42.0, окна 307 / 310 / 304, доля окон с многоточием 100% / 100% / 100%. Форма классы не выдаёт.

Д14.9 Деньги: цепь подъёмов и её механизм

Санкция владельца 15.08 — $6.85 (записана числом в money_d.py), потрачено $6.002420, оба пути счёта сходятся до шестого знака. Девиация объявляется: последняя цифра, приписанная слову владельца в тексте репозитория, — $4.50 (⚠ якорь пере-адресован оркестратором №18 22.08: цитируемая запись вынесена срезкой хроники в docs/archive/PROGRESS-2026-08-10-15.md:23=из $4.50; прежний якорь в живой PROGRESS мёртв — и он и раньше был неточен на две строки); фактический расход превышал её на $1.502420 (33%). Цепь $10.00 → $4.00 → $4.50 → $5.40 → 6.74 прошла все самопроверки фазы, потому что фриз-гейт сверяет с git ПОКУПАЮЩИЙ файл, а не кассу; потолки правятся в рабочем дереве и действуют немедленно. На ФД-C этим воспользовались осознанно ($0.334774 против закоммиченных $0.300). Улика требования R3 при этом зелёная — она грепает слово «САНКЦИЮ» в том же файле, который правится.

Срок: с 16.08 16:00 UTC DeepSeek переходит на пик/офф-пик (пик flash $0.44/$1.32 против $0.14/$0.28, pro $1.32/$3.96 против $0.435/$0.87, cache-hit pro ×612). DeepSeek — 61% расхода фазы. Остаток $0.8476 после 16.08 покупает вчетверо меньше прежней работы. Заведена ФД-H ($0.10) на японскую ногу H-4 — это Z.AI, подорожания не касается.

Д14.10 КТО ИЗ СУДЕЙ ОШИБАЕТСЯ — вопрос владельца 15.08, ответ проверен по исходнику

Единица 38c99e5efb, исходник: 今日就让我二人替天行道,替苏家清理门户,除了这祸害! («пусть мы вдвоём свершим волю небес … уберём тебя»). Говорящий угрожает адресату.

Выход боевого редактора R0: «Сегодня мы с тобой покараем его именем небес…» — адресат угрозы превращён в союзника, мишенью назначен третий. Прочие армы той же единицы переводят верно («Сегодня мы с ним покараем тебя»). Там же 黄级绝品武技 (жёлтый — НИЖНЯЯ ступень лестницы 黄/玄/地/天) передано как «боевая техника высшего ранга»: разряд потерян и перевёрнут.

Что поставили судьи. ~/books/editor-tier/aj-tier-votes/38c99e5efb.json: семь клеток из восьми — включая R0, обе половины пола, T1, T2, T3, F — получили 0/0 при ПУСТОМ обосновании; ненулевой только CTRLdecoy (2/1) с посаженным дефектом. Sol на том же R0 назвал 11 ошибок верности, среди них ровно «мы с тобой», «покараем его» и «боевая техника высшего ранга».

На этой единице прав Sol. Прибор claude здесь чувствителен к грубой ПОСАЖЕННОЙ порче и нечувствителен к естественной инверсии смысла.

Но патология НЕ общая — она сосредоточена в одной пачке. Доля клеток с нулём по несущей сумме и доля нулей без обоснования, по всем проходам семейства claude:

проход клеток нулей нулей БЕЗ обоснования
tier 128 49 (38%) 31 (24%)
Д3 en 286 30 (10%) 13 (5%)
Д6 ja 99 3 (3%) 3 (3%)
border 128 0 0
Д4 zh 713 2 (0%) 0
Д1 gemini 145 0 0

⇒ Судья claude не слеп вообще; слепа пачка tier. Разобранная руками единица взята ИЗ НЕЁ и доказывает пропуски этой пачки, а не прибора в целом. Соответственно:

  • вывод эксп-23 по tier не спасается — он целиком снят с этой пачки;
  • выводы по Д4 zh, Д1 и border этой болезнью не заражены (2 нуля на 713 клеток, 0, 0): опровержение H-2а, неподтверждение H-2б и закрытие гипотезы эксп-04 стоят;
  • Д3 en держать с оговоркой (10% нулей): нули занижают разницу, то есть смещение работает ПРОТИВ гипотезы, которую ось опровергает — направление безопасное, но полоса должна быть названа.

Практическое следствие для пере-судейства: лечится ЗАДАНИЕМ, а не сменой судьи. Прибор устойчив (на побайтно одном тексте под двумя ярлыками sd=0.000 по всем осям, 16/16) — у него высокий порог счёта, а не разболтанность. Минимальные правки задания: запретить молчаливый ноль (клетка с нулём обязана нести непустое «почему» вида «прочитано, дефектов не найдено»); внести в рубрику явные классы, которые пачка пропускала (инверсия адресата реплики · потеря/подмена разряда · состояние идиомы); печатать плотность пачки гейтом gain.py --density ДО того, как её вердикт пойдёт в вывод.

Д14.11 РАЗЛОЖЕНИЕ КОНТРАСТОВ ПО ОСЯМ СУДЬИ — ни разу не делалось за всю дугу

Заказ требовал печатать три оси по каждому арму (судья · канон · цена), и это исполнялось. Но САМА судейская ось на составляющие не раскладывалась ни в одном паке, хотя владелец 10.08 прямо отделил канон от художественности. Разложение (мой пере-счёт из сырья, единицы — пересечение армов):

контраст несущая ВЕРНОСТЬ ЯЗЫК ТЕРМИН ФОРМА
A1B/A0 флаги 3.13 0.94 2.19 0.23 0.52
A3/A0 смысловой контур (H-2б) 1.87 0.26 1.61 0.48 0.42
A6/A0 dspro-черновик + контур (H-1) 1.06 +0.12 1.19 0.44 0.38
A4/A0 перепис + канон-фиксер 0.13 0.03 0.10 +0.06 0.06
E0/D0 редактор на en (H-3) +1.25 +0.94 +0.31 +0.75 +0.69
J0/J2 связка против однопроходки (ja) +0.11 0.00 +0.11 0.00 +0.22

Что это меняет по гипотезам владельца.

  • H-2б. Смысловой контур проигрывает переписи на 86% ЯЗЫКОМ, а не смыслом: по ВЕРНОСТИ его отставание 0.26 ошибки на единицу — внутри шума. Критик+фиксер держат смысл наравне с полным переписом и проигрывают прозой, потому что 96% знаков остаются дешёвым черновиком. Ставка владельца была о качестве вообще; замер разводит: по смыслу она работает, по прозе нет.
  • H-1. A6 по ВЕРНОСТИ не хуже боевой связки (+0.12), весь дефицит — проза. В части смысла «проблема в черновике» ПОДТВЕРЖДАЕТСЯ: качественный черновик + точечный редактор дают ту же верность, что полный перепис. Контраст остаётся недомощным по n, но направление названо.
  • H-3. Фаза объявила гипотезу опровергнутой по величине суммарного перевеса. Разложение показывает, что редактор на en покупает +0.94 верности, +0.75 терминов, +0.69 формы и лишь +0.31 прозы — то есть БОЛЬШЕ ПОЛОВИНЫ того, что он покупает, есть ровно «синк глоссария и точечные правки», как гипотеза и говорила. Опровергнуто только слово «ТОЛЬКО».
  • ja. Второй проход по смыслу не покупает НИЧЕГО (J0/J2 ВЕРНОСТЬ = 0.00); разница связки и однопроходки лежит в форме.

Следствие для продукта, и оно указывает вектор. Цель владельца — победить translationese, то есть ткань. Решающая ось — ЯЗЫК, и её не вытягивает ни один дешёвый контур: он не трогает 96% текста. Верность, за которую платят полным переписом, дешёвые контуры уже держат. Значит искать надо не «дожать критика», а сплошную дешёвую переработку прозы — переписывать, но дешевле, а не чинить точечно. Ни один арм дуги 19→23 такой схемы не содержал.

⚠ Ограничение: ось ЯЗЫК — та, где эксп-20 §5.4 намерил худшее единогласие судей (33% на шести осях). Разложение указывает направление, но именно по этой оси прибор слабее всего, и это надо закрыть до того, как на ней строить продуктовое решение.

Д14.12 АРМ ГЛАВНОЙ СТАВКИ ПОЛУЧАЛ ОТ КРИТИКА ПОДТВЕРЖДЕНИЯ КАК ЗАДАНИЯ НА ПРАВКУ

contour.py:611-619 critic_places() берёт ЛЮБУЮ строку ответа критика, начинающуюся с «-», без разбора вердикта. Из 1696 строк, ушедших фиксеру, 311 (18.3%) — это подтверждения критика («верно», «допустимо», «не ошибка»: например «алые губы → „алые“ — украшение, но не ошибка»). То есть фиксеру в арме, несущем ставку владельца, систематически подавались места, про которые критик сказал, что там всё в порядке. Внутренняя ревизия фазы 11.08 несёт это как «прямой канал порчи текста в арме, несущем главную ставку владельца» — с фиксом, которого не сделали.

⇒ H-2б испытана инструментом, который на 18% работы правил заведомо исправное. Это отдельная причина, по которой её нельзя считать честно опровергнутой, и она сильнее прочих трёх.

Д14.13 Сто тридцать одна находка собственной ревизии не доехала до отчёта

~/books/dovodka/revizia-fazy-D-11-08.json (82 находки: 23 «критично» / 40 «важно» / 19 «мелко») и ~/books/dovodka/priemka-D4-14-08.json (49 находок: 10/26/13) не цитируются в теле отчёта ни разу. Внутри — в том числе: «порог строится на n ПОЛА (15) и применяется к средним по 31, 16 и 54» (критично) · «набор p1 систематически строже p2 на побайтно одинаковых текстах» (важно) · «promptdiff: объявленное расхождение матчится по ПРЕФИКСУ строки» и «отсутствующий файл пар-пакета гейт не роняет» (оба критично) · «canon.py: снятая ревью классификация по-прежнему пишется в артефакт» (см. Д5) · «material_ja: фильтр AI-меток объявлен механическим, но кода его не существует».

⇒ Это ДРУГОЙ класс дефекта, чем слепота: зона ЗАМЕТИЛА и не передала. Три инструмента, которые гейты числят зелёными (promptdiff, canon, material_ja), внутри признаны негодными. Разбор этих 131 находки против тела отчёта — работа на одну сессию и $0; она не сделана.


Д15 — ПЕРЕ-СУДЕЙСТВО ПРОХОДА tier ПОЧИНЕННЫМ ПРИБОРОМ (заказ владельца 15.08)

Владелец: «Можно пересудить. Но не подгонять. Нужно понять, кто ошибается из судей». Пре-рег, состав панели и правило решения зафризены коммитом a03ac66 до первого ответа (eval/dovodka/tier2.py). Пере-судятся ТЕ ЖЕ ТЕКСТЫ: ни одна клетка не покупалась, ключ выпущен новый со своей солью, старый не тронут. Четыре сессии, зарегистрированы до запуска (runs.py #65#68).

Д15.1 Что изменено — и почему это не подгонка

Панель: убран CTRLfloorA (он побайтно равен боевому арму T1 в 16/16 — один текст лежал в пачке дважды); добавлен CTRLmargin — маржевый декой, которого у прохода не было НИКОГДА. Побайтных дублей в новой панели 0 из 16 против 16 из 16 в старой.

Задание: запрещён молчаливый ноль (клетка с нулём обязана нести «прочитано, дефектов не найдено»); в рубрику ВЕРНОСТЬ внесены классы, которые старая пачка пропускала (инверсия адресата реплики · потеря/подмена разряда · состояние идиомы · снятое отрицание); сказано прямо, что ноль — утверждение, а не отсутствие ответа. Классы арм-нейтральны: ни один не указывает на арм. Правки не могут сдвинуть один арм относительно другого — они снимают право молчать.

Д15.2 Результат: прибор был вжат, и это чинится заданием

16 единиц, 126 клеток, замечаний годности 0.

арм СТАРЫЙ замер НОВЫЙ замер сдвиг
R0 боевой редактор 0.69 3.44 +2.75
T1 glm-5.2 1.00 3.56 +2.56
T2 gpt-5.6-terra 0.25 2.38 +2.12
T3 grok-4.5 0.62 2.94 +2.31
F голый черновик 2.56 6.56 +4.00
CTRLdecoy 3.56 6.62 +3.06

Доля нулей 6% против 38%, пустых обоснований 0 против 31. Тексты не менялись ни в одном арме — весь сдвиг есть свойство ПРИБОРА. Гипотеза «лечится заданием, а не сменой судьи» (Д14.10) подтверждена исполнением: на тех же байтах прибор перестал молчать и стал считать вчетверо плотнее.

Д15.3 Впервые у прохода есть сертификат чувствительности

  • грубый декой пойман 16/16, медиана +3.0;
  • свой пол — 16 пар, sd 2.63 → порог различимости 1.84 (пол больше не построен из боевого арма);
  • маржевый декой (гейт П-2): +2.50 против порога 1.84 — ПРОЙДЕН.

Последнее и есть то, чего паку 23 не хватало: прибор доказал, что эффект такого размера он СПОСОБЕН увидеть. Без этого «не различимо» неотличимо от слепоты — ровно то, чем и оказался исходный замер.

Д15.4 Вердикт

контраст n перевес вердикт при пороге 1.84
T1 vs R0 (glm-5.2) 16 0.12 ниже порога
T2 vs R0 (gpt-5.6-terra) 16 +1.06 ниже порога
T3 vs R0 (grok-4.5) 16 +0.50 ниже порога
R0 vs F контроль 16 3.12, p=0.0042 редактор БЬЁТ голый черновик

⚠ Знак в строке контроля читается наоборот, чем в строках контрастов: там печатается R0 F, и отрицательное значение означает, что у R0 ошибок МЕНЬШЕ. Формула зафризена до ответов и после них не правилась; оговорка вынесена сюда.

Несущий вывод эксп-23 «сильный тир не даёт различимого выигрыша над deepseek-v4-pro» ВОССТАНОВЛЕН — и впервые стоит на приборе с доказанной чувствительностью. Прежняя его редакция была снята прибором, который молчал (Д2.1); нынешняя — прибором, который на тех же текстах различает тонкую посадку в 0.06% знаков.

Возражение Sol не воспроизводится. Его T2 vs R0 = +8.69 против +1.06 у починенного claude (направление у обоих одно — T2 лучший в панели по точечной оценке, — но величина расходится в восемь раз, и порога она не берёт). Вместе с тем, что Sol (gpt-5.6-sol) судил gpt-5.6-terra, то есть СВОЁ семейство вопреки D13.3, возражение как свидетельство закрывается.

Продуктовое следствие. Оснований менять боевой редактор нет: gpt-5.6-terra при цене клетки $0.044 против $0.005 у deepseek-v4-pro (×9) даёт выигрыш, который прибор не разводит и после починки. Ограничение вывода объявляется: пере-судейство сделано ОДНИМ семейством — второе (Sol) на решающем контрасте дисквалифицировано как своя семья.


Д16 — ЯПОНСКАЯ НОГА H-4 (санкция владельца 15.08 «бери»). ПРЕ-РЕГ ДО ОТВЕТОВ

Требование заказа (:115) — печатать сравнение ОТНОСИТЕЛЬНОГО ПОРЯДКА жильцов между парами zh/en/ja — до этой сессии не исполнялось: порядок нельзя увидеть, имея на паре одного редактора. На zh панель есть (эксп-22), на en второй редактор куплен (E6: dspro 1.31 против glm-5 2.72), на ja второго не было вовсе — ось Д6 меряла «покупает ли редактор что-нибудь», а не «какой лучше».

Куплено. Арм J6 = glm-5 поверх той же японской базы: 9 клеток, все finish=stop, пустых 0, модель вернула glm-5 (слаг сверен), медиана 2593 знака, $0.046329. Плюс СВОЙ шумовой пол — 9 вторых генераций боевого редактора; докуплено 7 из 9, один вызов завис (класс известен: в эксп-22 вызов держал замок 74 минуты). Касса ФД-H, потолок поднят $0.10 → $0.15 в рамках санкции владельца 15.08, причина названа числом ДО подъёма.

Панель строится так, чтобы не повторить ни одного дефекта прохода tier (eval/dovodka/ja6.py, селфтест 0 провалов; всё ниже пре-регистрируется ДО первого ответа):

дефект tier как здесь
CTRLfloorA побайтно равен боевому арму T1 в 16/16 пара пола — две генерации редактора (J0, JFLO), разведены по наборам: J0 в p1, JFLO в p2; в одной пачке их не бывает
пол снят с операции, которой в панели нет пол снят с ТОГО ЖЕ редактора, что в панели (прежний пол Д6 — с точечного фиксера, отсюда 4 побайтных близнеца из 8 пар)
донор декоя — R0 во всех 16 единицах донор чередуется J0/J6 по чётности
маржевого декоя нет вовсе есть (норма П-2)
молчаливый ноль запрещён заданием: ноль обязан нести «прочитано, дефектов не найдено»
правила счёта только у одного семейства (конфаунд П-4) правило плотности стоит В САМОМ ЗАДАНИИ, то есть достаётся обоим побайтно

Ключ выпущен свой (blind-keys-ja6, своя соль); ключи осей Д6 и tier не тронуты — раскладка меток есть функция соли, uid и НАБОРА армов, и эмиссия поверх переписала бы отсуженную раскладку.

Д16.0 Ограничения, объявленные ДО чисел

  • Ось РАЗВЕДОЧНАЯ, и это не смягчается никаким исходом: n=9, MDE 2.90 против цели 2.00 (power.FORCED_DESCRIPTIVE). Вывод будет описательным.
  • Гейт чувствительности снят пятью точками из девяти: маржевый декой садится лишь на 5 единиц — регексы посадок на этой книге находят мало мест. Расширенный список (--wide-plants, дававший на ДРУГОЙ японской книге 8/9) проверен и НЕ помогает: те же 5 из 9. ⇒ посадки оказались не только пар-, но и КНИГО-зависимы; право говорить «редакторы равны» подпёрто здесь слабее.
  • Две единицы лишились набора p2 (e9cad28783, 1df7b4ebf2) — их клетки пола не докупились; панель напечатала пропуск, а не подставила замену. Заданий 16 вместо 18, пар пола 7.
  • Порядок прогона задан владельцем: сперва СВОЁ семейство, затем пакет внешнему судье. Sol здесь полноправен — ни один арм панели не из семьи OpenAI (dspro, glm-5, flash), конфликта «судья судит свою семью», погубившего проход tier, нет.
  • Пакет Sol отдаётся ТОЛЬКО при зелёных гейтах своего прогона. Красный гейт → пакета нет, вопрос владельцу. Внешнему судье не отдаётся материал, про который сессия сама не знает, годен ли он.

Д16.1 РЕЗУЛЬТАТ ЯПОНСКОЙ НОГИ (первое семейство, 15.08)

9 единиц, 48 клеток, замечаний годности 0. Все гейты зелёные:

плотность      2.38 ошибки/клетку, нулей 15%          ГОДНО (порог гейта 25%)
свой пол       7 пар, sd 2.05 → ПОРОГ РАЗЛИЧИМОСТИ 2.17
грубый декой   +2.89 против порога 2.17               ПРОЙДЕН
маржевый декой +2.80 против порога 2.17               ПРОЙДЕН (на 5 единицах, объявлено ДО)
арм ошибок/ед. что это
J0 1.44 боевой редактор deepseek-v4-pro
JFLO 1.86 ВТОРАЯ ГЕНЕРАЦИЯ ТОГО ЖЕ РЕДАКТОРА
J6 1.89 второй редактор glm-5
D0 4.22 черновик deepseek-v4-flash
контраст n перевес p вердикт
J6 vs J0 9 0.44 0.6875 ниже порога 2.17
J0 vs D0 9 +2.78 0.0039 перешёл — редактор бьёт черновик

Самая красноречивая строка таблицы — JFLO. Разница между ДВУМЯ РАЗНЫМИ редакторами (0.44) не больше, чем разница между двумя прогонами ОДНОГО И ТОГО ЖЕ редактора (0.42). То есть glm-5 отличается от deepseek-v4-pro ровно настолько, насколько deepseek-v4-pro отличается от самого себя. Это и есть «не различимо», сказанное прибором, который различать умеет: тонкую посадку маржевого декоя он ловит (+2.80 при пороге 2.17).

Д16.2 H-4 — ВЕРДИКТ ПО ТРЁМ ПАРАМ (требование заказа :115 исполнено впервые)

пара боевой редактор deepseek-v4-pro второй редактор glm-5 порядок
zh панель эксп-22, dspro побеждает dspro первый
en E0 1.31 E6 2.72 dspro первый
ja J0 1.44 J6 1.89 dspro первый (неразличимо)

H-4 «перевес dspro в редакторской роли есть свойство пары zh→ru» — НЕ ПОДТВЕРЖДАЕТСЯ. Порядок жильцов не сменился ни на латинице, ни на японском: гипотеза предполагала, что китайская модель выигрывает на китайской книге, а она держится на всех трёх парах. На японском преимущество при этом НЕ различимо — оно меньше собственного шума повторного вызова.

⚠ Вывод ОПИСАТЕЛЬНЫЙ: ось разведочная (n=9, MDE 2.90 против цели 2.00), статус объявлен до денег. Второе семейство (Sol) на эту ногу допущено — ни один арм не из семьи OpenAI; пакет собран (ja6.py --sol, ~/books/judging/ja6-sol/), тела заданий побайтно равны судимым первым семейством (сверено 16/16, различие ровно в строке пути записи), утечки ключа нет.


Д17 — ЗАХОД ПОД ПОЧИНЕННУЮ РУБРИКУ. ПРЕ-РЕГ, ЗАПИСАН ДО ПЕРВОЙ ПОКУПКИ

Санкция владельца 16.08 дословно: «Новые траты я разрешаю, перепровести эксп я разрешаю». Основание захода — его же решение 16.08, меняющее ПРИБОР: «Штрафовать за вольность нельзя — живой язык один из приоритетов бэкенда. Штрафовать можно только за перевирания смысла исходника. В остальном можно менять, убирать англоязычность из переводов, переставлять текст».

Д17.0 Почему покупка идёт ПЕРЕД починкой рубрики, хотя план ставил рубрику первой

Вендор переводит DeepSeek на пик/офф-пик в 16:00 UTC 16.08.2026 (сноска прайс-страницы, факт-чек 15.08, backend/configs/models.yaml шапка). До этого мгновения июльский пин eval/tenant_panel/roster.py верен, и та же работа стоит $1.06 вместо ~$3.17 после. Рубрика к покупке отношения не имеет: она нужна СУДЕЙСТВУ, тексты армов от неё не зависят. Поэтому порядок «купить → починить рубрику → отсудить» экономит ×3 и ничего не смешивает.

Механизация, чтобы это не стало разовой удачей: zakhod.price_gate отказывает в покупке DeepSeek после перелома, пока ростер несёт июльский пин. Прежде касса молча записала бы цену втрое ниже списанной, а проекционный гард зарезервировал бы втрое меньше нужного.

Д17.1 Панель. Имена армов ОДНИ на обе пары; пара живёт в данных

арм что это цена
ZD голый черновик deepseek-v4-flash $0, куплен
Z0 боевая связка черновик → полный перепис deepseek-v4-pro — ЭТАЛОН $0, куплен
ZP однопроходка уравненного мандата $0, куплен
Z8 обогащённый черновик: тот же flash + мандат ДИСКУРС-ПЕРЕВЁРСТКИ своей пары покупается
Z8R Z8 + боевой перепис покупается
Z1 смысловой критик → ПОЛНЫЙ ПЕРЕПИС по его замечаниям покупается
Z7 однопроходка + канон-фиксер ПОСЛЕ покупается
ZF вторая генерация боевой связки — шумовой пол НОВОЙ рубрики покупается

Единиц 16 на пару, отбор детерминирован от соли zakhod-d17-2026-08-16, впечатанной в код ДО покупок. Отбор по хешу, а не по длине: длина коррелирует с трудностью, а трудность — с тем, какой арм выигрывает, поэтому отбор по ней покупал бы часть вывода заранее.

Д17.2 Что каждый арм отвечает и чей это вопрос

  • Z8 / Z8R — вопрос владельца 16.08: «может, промт черновика от редактора сильно отличается и черновик тут выступает в роли недоведённого до ума инструмента?» Подтверждено текстом: у переводчика вся вёрстка — одна строка, у редактора — секция из четырёх шагов, обязательная операция передачи чужого синтаксиса русской прозой. Черновик её не получал ни разу за пять экспериментов. ⚠ Поправка к плану, найденная чтением кода: FEWSHOT в промт не попадает НИ У КОГО — prompts.load_template его дропает, в проде stages[edit].few_shot: false. Значит асимметрия «у редактора есть примеры» НЕВЕРНА, и Z8 переносит только то, что реально едет на провод.
  • Z1 — ставка владельца (H-2б) в сильнейшей форме, которой в дуге не было. Отличие от проигравшего A3: там правщик был ТОЧЕЧНЫМ и двигал 0.23.7% знаков, здесь мандат ПОЛНЫЙ, а замечания критика лишь ДОБАВЛЕНЫ. Разложение по осям (Д14.11) показало, что точечные контуры проигрывают ПРОЗОЙ, а не смыслом; Z1 снимает именно это ограничение.
  • Z7 — поправка владельца 16.08: «однопроходка допустима, как вариант чтоб оттуда после вырезать термины и edit точечным редактором их заменить».
  • ZF — пол. Старый пол осей снят с ТОЧЕЧНОГО фиксера (операция почти детерминированная, даёт побайтных близнецов); панель этого захода — панель ПЕРЕПИСЫВАТЕЛЕЙ, и честный её пол есть две генерации одного переписывателя. Так сделана японская нога, и там это дало самый чистый вывод фазы.

Д17.3 Починка, которую заход несёт внутри себя

contour.critic_places берёт ЛЮБУЮ строку с дефисом, без разбора вердикта: на китайской оси 198 строк из 863 (23%) — согласия критика («передано верно», «допустимо», «ок»). Фиксер получал их как задания на правку, то есть ставка владельца была испытана инструментом, который на пятой части работы правил заведомо исправное. В zakhod.py фильтр двусторонний: строка выбрасывается, только если принимающая формула стоит в ХВОСТЕ вердикта И во всей строке нет маркера дефекта. Первая редакция фильтра требовала разделителя «→» и теряла настоящие находки — поймано выборочной вычиткой ДО покупки. Английский критик согласий почти не выдаёт (2 из 178). Старые клетки A3/E3 не трогаются: они куплены и остаются с объявленным дефектом.

Д17.4 Правило решения, пороги, мощность, статус

  • Несущая величина — сумма ВЕРНОСТЬ+ЯЗЫК на единицу (эррата П-5), рубрика — новая (Д18).
  • Порог различимости снимается СВОИМ полом этого захода: sd разностей ZFZ0 по 16 парам, квантиль Стьюдента, как на всех осях фазы. Число не назначается заранее — назначается ФОРМУЛА, а порог печатается до вердиктов.
  • Контраст объявляется различимым, если |Δ| > порога И знаковый критерий Уилкоксона даёт p < 0.05. Иначе — «не различимо», и это утверждение, а не отсутствие результата.
  • Сертификат чувствительности обязателен: в каждой пачке грубый декой (ловит «судья вообще смотрит») и МАРЖЕВЫЙ декой размером с искомый эффект. Не прошёл маржевый — пачка не несёт вывода «не различимо» и аннулируется, как аннулирована японская пачка Sol.
  • Цель — 1.50 ошибки на единицу (та же, что на несущих осях фазы). MDE считается по СВОЕМУ полу; если MDE > цели, ось объявляется ОПИСАТЕЛЬНОЙ до вскрытия вердиктов, а не после.
  • Статус осей: zh и en — несущие для Z8R/Z0, Z1/Z0, ZP/Z0, Z8/ZD. Z7описательный и судейством не меряется вовсе: его вопрос про банк, и отвечает на него детерминированный канон-гейт ($0). Судейский слот на него не тратится.
  • Второй эндпойнт — слепое чтение по той же панели (Д19). Расхождение ранга читаемости со счётом ошибок — не помеха, а результат: именно оно и есть предмет захода.
  • Правило расхождения эндпойнтов объявляется ЗДЕСЬ, до данных: если счёт и чтение разойдутся, побеждает ЧТЕНИЕ, а счёт объявляется негодным прокси для этой пары. Основание — приоритет владельца («живой язык»), а не сила статистики.

Д17.5 Чего этот заход НЕ может

  1. Он не отвечает, какая МОДЕЛЬ лучше в роли редактора: панель моделей не меняется, вопрос закрыт устойчиво дугой 19→23.
  2. Он не переносится на другие книги и пары: материал тот же, что у фазы Д.
  3. n=16 на пару не даёт интеракций «арм × страта».
  4. Числа этого захода несравнимы с числами дуги 19→23 по построению: шкала другая.
  5. Судейство первым семейством одно; второе (Sol) — по решению владельца, и его пачка проходит те же гейты чувствительности, что и моя.

Смета: $0.5277 на пару, $1.0554 на заход, по действующему прайсу. Потолки ФД-I и ФД-J по $0.65 (запас 23% на перекупку усечённых клеток — класс, стоивший фазе денег четырежды); пакетный потолок $6.85 → $8.15 ровно на дельту новых фаз, ни одна прежняя фаза не двигается.

Д17.6 ЭРРАТА Э-17.2 — МОЩНОСТЬ ПОСЧИТАНА ПОСЛЕ НАЧАЛА ПОКУПКИ. ОБЕ ОСИ ОПИСАТЕЛЬНЫЕ

Девиация, объявленная в момент, а не примечанием. Норма заказа (:168171) требует напечатать минимально различимый эффект при плановом n до покупок; в зоне для этого стоит power.py. Пре-рег Д17.4 объявил ПРАВИЛО («MDE считается по своему полу; не проходит цель — ось описательная») и не напечатал ЧИСЛА. Числа посчитаны, когда покупка прошла ~40 клеток из 160, — но до первого судейского ответа, поэтому право классифицировать ось сохранено и использовано.

Что показал счёт (80% мощности, поправка Холма по 4 контрастам, ×1.23 на межсессионную компоненту):

глав MDE нужен СВОЙ пол не выше замеренные полы фазы
16 2.41 1.32 tier 1.45 · ja6 2.05 · border 2.12 · tier2 2.63
31 1.73 1.83 — достижимо тремя из четырёх

⇒ при n=16 несущий вывод недостижим ни при каком исходе: ни один замеренный пол фазы не опускается до 1.32. Это ровно та болезнь, что погубила английскую ось эксп-22.

Владельцу предложено добрать китайскую ось до полного пула в 31 главу за $0.48 (английская прибита манифестом на 16 и расширяется только покупкой новых основ). Решение владельца 16.08: не добирать.обе оси захода объявляются ОПИСАТЕЛЬНЫМИ, вписаны в power.FORCED_DESCRIPTIVE, пере-классификации задним числом не будет.

Что это меняет по существу. Счёт ошибок в этом заходе даёт направление и величину, но не право сказать «доказано». Решающим эндпойнтом остаётся слепое чтение — и это не смягчение постфактум, а то, что пре-рег Д17.4 объявил заранее: «при расхождении счёта и чтения побеждает ЧТЕНИЕ, основание — приоритет владельца „живой язык“, а не сила статистики». Заход строился под этот порядок с самого начала, и мощность счётной оси его не двигает.


Д18 — ПОЧИНЕННАЯ РУБРИКА СУДЬИ (решение владельца 16.08). ИСПОЛНЕНО

Правило владельца дословно: «Штрафовать за вольность нельзя — живой язык один из приоритетов бэкенда. Штрафовать можно только за перевирания смысла исходника. В остальном можно менять, убирать англоязычность из переводов, переставлять текст в китайском и так далее».

Что изменено. ВЕРНОСТЬ сужена до искажения ФАКТА (инверсия участника · снятое или добавленное отрицание · подмена числа, ранга, меры, имени · выдуманный или потерянный факт · перевёрнутое состояние действия). ЯЗЫК оставляет только «то, чего носитель не напишет» и прицельно назван на translationese: калька, канцелярит, переводной суржик, фраза грамматически верная, но звучащая ПЕРЕВЕДЁННОЙ. ТЕРМИН и ФОРМА объявлены ОПИСАТЕЛЬНЫМИ и в несущую сумму не входят.

Добавлен блок «ЧТО ОШИБКОЙ НЕ ЯВЛЯЕТСЯ» — прямой запрет штрафовать за перестановку предложений, слияние и дробление абзацев, замену оборота на более живой русский, синонимическую замену, добавленную связку, снятую буквальность исходного языка и за «нравится меньше соседнего».

Где живёт. Текст рубрики — в zsud.py (единственный потребитель; закрытые проходы tier2/ja6 судились старой шкалой и не тронуты). Обвязки обоих семейств несут то же правило, совпадение сторожит СУЩЕСТВУЮЩИЙ гейт paritet.py — отдельного гейта не заводилось, второй гейт паритета был бы просто второй правдой. Правило стоит В САМОМ ЗАДАНИИ, а не только в обвязке: норма П-4.

Риск, заявленный ДО данных, и как он снят. Правило «вольность — не ошибка» смещает счёт вниз, а пачка на полу шкалы не различает ничего (проход tier: 38% нулей). Поэтому рубрика идёт в комплекте с гейтом плотности и маржевым декоем. По факту: плотность zh 6.01 при 0% нулей, en 2.22 при 15% — обе пачки от пола шкалы далеко, риск не реализовался.

Цена: числа этого захода НЕСРАВНИМЫ с числами дуги 19→23. Шкала другая.


Д19 — РЕЗУЛЬТАТ ЗАХОДА. Счёт и чтение

Панель: голый черновик ZD · боевая связка Z0 · однопроходка ZP · обогащённый черновик Z8 · он же + перепис Z8R · критик → ПОЛНЫЙ перепис Z1 · вторая генерация связки ZF (пол). 16 глав куплено на пару. ⚠ ОТСУЖЕНО: en 16 единиц, zh — 12. На четырёх китайских главах обогащённый черновик забракован эхо-гейтом (Э-17.1), а без него панель единицы неполна и в судейство она не идёт целиком — то есть китайская ось стоит на 12 единицах, а не на 16, и это ещё уменьшает и без того описательную мощность. Судейство: 56 пачек, 18 сессий, замечаний годности 0.

Д19.1 КИТАЙСКАЯ ПАЧКА АННУЛИРУЕТСЯ ПО НОРМЕ П-2

свой пол (две генерации ОДНОЙ боевой связки): sd 4.42 → ПОРОГ 3.58
грубый декой   +3.12 против порога 3.58 — НЕ ПРОЙДЕН
маржевый декой +2.30 против порога 3.58 — НЕ ПРОЙДЕН

Прибор не различает даже НАМЕРЕННО испорченный текст, значит его «не различимо» не значит ничего. Единственное, что перешло порог, — контроль Z0 против ZD (+5.42, p=0.0063).

Это находка, а не авария рига. Порог огромен не потому, что судья плох, а потому, что на китайском боевая связка нестабильна: два прогона ОДНОЙ И ТОЙ ЖЕ схемы над одним входом расходятся на 4.42 ошибки — больше, чем отличаются друг от друга разные архитектуры.

Д19.2 АНГЛИЙСКАЯ ОСЬ: прибор сертифицирован, архитектуры неразличимы

свой пол sd 1.51 → ПОРОГ 1.06 · грубый декой +2.34 ПРОЙДЕН · маржевый +2.60 ПРОЙДЕН

Z8  vs ZD   0.62  p=0.3018   не различимо
Z8R vs Z0   +0.12  p=0.5811   не различимо
Z1  vs Z0   0.06  p=0.7744   не различимо      ← ставка владельца: ровно ноль
ZP  vs Z0   0.62  p=0.5488   не различимо
Z0  vs ZD   +0.81  p=0.0312   НЕ РАЗЛИЧИМО      ← контроль НЕ переходит порог

Главное число захода — последняя строка. Под СТАРОЙ рубрикой тот же контроль давал +1.31 при пороге 0.90 и переходил. Под правилом владельца он даёт +0.81 при пороге 1.06 и не переходит. Перестав штрафовать за вольность, прибор перестал видеть разницу между дорогим переписом и дешёвым черновиком по несущей сумме.

Д19.3 СЛЕПОЕ ЧТЕНИЕ: два читателя разных семейств, 20 заданий

СОГЛАСИЕ ЧИТАТЕЛЕЙ A/B: zh +0.75 · en +0.80   — порядок по читаемости ВОСПРОИЗВОДИМ
контроль декоя: последним в 14 из 16 (zh) и 15 из 16 (en)
контроль пола:  zh медиана 3.0 позиции, развёл дальше двух в 9 из 16 — ⛔ КРАСНЫЙ
                en медиана 1.8 позиции, развёл дальше двух в 4 из 16 — ГОДНО

ранг чтения (лучший→худший) и счёт ошибок, английская ось:
  Z0  2.84 / 1.75   Z8R 2.88 / 1.44   ZF 3.25 / 2.00
  ZP  3.34 / 2.50   Z1  3.62 / 1.19   ZD 5.31 / 3.00   декой 6.75 / 3.31

СПИРМЕН «ранг чтения против счёта ошибок»: en +0.37 · zh +0.64

⚠ Гейт декоя объявлен в двоичной форме («не последним хоть раз — красный») и потому красен на 14/16 и 15/16. Число за ним — 88% и 94%, то есть читатели порчу видят. Форму гейта задним числом НЕ смягчаю: он был объявлен до данных.

Красный контроль пола на китайском — тот же вывод, что и Д19.1, снятый вторым прибором: читатели разводят две генерации ОДНОЙ схемы на три позиции. Оба инструмента независимо говорят, что на китайском нестабилен сам жилец.

На английской оси счёт и чтение расходятся: Спирмен +0.37 против пре-регового порога 0.5. Z1 на ВЫБОРКЕ ЧТЕНИЯ (8 единиц) лучший по счёту ошибок (1.19) и предпоследний среди переписывателей по читаемости (3.62). ⚠ На ПОЛНОЙ оси из 16 единиц он не лучший: 1.75 против 1.50 у боевой связки и 1.69 у второй её генерации. То есть расхождение приборов на выборке чтения выражено сильнее, чем на всей оси, и это надо держать в уме. Это ровно тот механизм, который читатель назвал ВСЛЕПУЮ 16.08: «локальных отклонений больше, а читается лучше». По пре-регу Д17.4, записанному ДО данных, при расхождении побеждает ЧТЕНИЕ.

Д19.4 ЧТО УСТОЯЛО

Опора здесь НЕРАВНАЯ, и это надо сказать до списка. На английской оси сертифицированы оба прибора: судейская пачка взяла оба декоя, контроль пола чтения годен. На китайской НЕ сертифицирован ни один: судейская пачка аннулирована по П-2, контроль пола чтения красный. Поэтому «устояло на обеих парах» ниже означает «направление совпало», а не «подтверждено дважды».

  1. Голый черновик далеко позади всего остального — и по счёту (en 3.00 против 1.192.50), и по чтению (5.31 из 7 позиций). Второй проход нужен; спор только о том, какой именно.
  2. Все схемы переписывания сбиваются в неразличимую кучу. Ни полный перепис, ни критик с переписом, ни однопроходка, ни обогащённый черновик с переписом не отделимы друг от друга.
  3. Ставка H-2б в сильнейшей форме (Z1) не подтверждается ни счётом (0.06), ни чтением (хуже связки на 0.78 позиции).
  4. Обогащение промта черновика (Z8) не окупается, но картина по осям РАЗНАЯ и её надо читать целиком. По счёту ошибок на en он хуже голого черновика (0.62). По КАНОНУ на en он его ЛУЧШЕ (1.25 потерь против 1.56), а на zh вдвое ХУЖЕ (5.12 против 2.25) — мандат перевёрстки на плотном китайском сбивает передачу терминов. Плюс на zh он перевооружает эхо-мину (4 негодные клетки из 16, Э-17.1).

Д19.5 ✔ ЕДИНСТВЕННОЕ, ЧТО ЗАХОД ПОДТВЕРДИЛ ПОЛОЖИТЕЛЬНО — ПОПРАВКА ВЛАДЕЛЬЦА ПРО БАНК

Детерминированный канон-гейт, без судьи и без чтения (потерянных терминов на главу):

арм zh en
однопроходка ZP 3.00 0.44
однопроходка + канон-фиксер Z7 1.38 0.31
боевая связка Z0 2.88 0.56

Однопроходка с канон-фиксером держит банк ЛУЧШЕ боевой связки на ОБЕИХ парах. Это дословно то, что предложил владелец 16.08: «однопроходка допустима, как вариант чтоб оттуда после вырезать термины и edit точечным редактором их заменить». По судейской оси она от связки не отличается, по банку — лучше, и при этом она ОДИН вызов вместо двух.

Д19.6 СТАТУС И ЧЕГО ЗАХОД НЕ МОЖЕТ

Обе оси объявлены ОПИСАТЕЛЬНЫМИ до вскрытия результатов (power.FORCED_DESCRIPTIVE, решение владельца 16.08 не добирать до 31 главы). Всё выше — «похоже, что», а не «доказано». Китайская судейская пачка вдобавок аннулирована собственным гейтом чувствительности. Читают модели, а не человек. Вывод об архитектуре получен при модели-константе и на другую модель не переносится — это отдельный незакрытый вопрос.

Д19.7 ЭРРАТА ПО ПРИЁМКЕ ДРУГОГО СЕМЕЙСТВА (17.08). Ошибки МОИ, правки внесены в тела выше

Независимый приёмщик (Fable-5, норма заказа «опровергатель другого модельного семейства обязателен») сверил Д17Д19 запуском гейтов и нашёл в них четыре неверных утверждения. Все проверены мною повторно и подтвердились; тела секций исправлены, ошибки названы здесь.

  1. «16 глав на пару» — неверно для zh: отсужено 12. Четыре главы куплены, но панель на них неполна (эхо-гейт забраковал обогащённый черновик), и в судейство они не пошли. Отчёт подавал число 12 только как особенность одного арма, а оно есть свойство ВСЕЙ китайской оси.
  2. Направление канона у Z8 было перевёрнуто. Стояло «по канону хуже (1.25 против 1.56)» — 1.25 меньше 1.56, то есть на английском обогащённый черновик держит канон ЛУЧШЕ голого. Одновременно умалчивалось, что на китайском он держит его ВДВОЕ ХУЖЕ (5.12 против 2.25). Ошибка двойная: неверный знак плюс умолчание противоположного по знаку факта на второй паре.
  3. Z1 назван «лучшим по счёту ошибок (1.19)» без оговорки, что это ВЫБОРКА ЧТЕНИЯ из 8 единиц. На полной оси из 16 он 1.75 — хуже боевой связки (1.50) и хуже её второй генерации (1.69). Числа из двух разных таблиц были смешаны в одном предложении.
  4. «Устояло на обоих приборах и обеих парах» — на китайской паре не сертифицирован НИ ОДИН прибор: судейская пачка аннулирована П-2, контроль пола чтения красный. Заголовок обещал двойное подтверждение там, где есть только совпадение направления.

Пятое, не ошибка отчёта, а нарушение нормы рига, и оно тяжелее прочих: идентичность читателей слепого чтения НЕ была персистирована до запуска. Заявление «два читателя разных семейств» носителя на диске не имело. Это ровно тот дефект, из-за которого причина расхождения на проходе tier оказалась НЕВОССТАНОВИМОЙ. Закрыто постфактум файлом ~/books/dovodka/blind-keys-chtenie-z17/READERS-z17.json (читатель A — claude, B — fable-5, с указанием, что запись сделана ПОСЛЕ прогона). Постфактумная запись слабее нормы и объявлена таковой.

Приёмка назвала ещё три открытых пункта, к телу Д17Д19 не относящихся, но к сдаче фазы — да: сводка Д9 противоречит Д15Д19 в четырёх клетках и эррат на местах не имеет; Д16 не отражает аннулирование японской пачки Sol её же контролями; деньги в Д17 протухли (напечатана смета $1.06 и потолки $0.65, факт — $11.72 из $12.10). Это долг сдачи, а не вывода.


Д20 — СЛЕПОЕ ЧТЕНИЕ ВЛАДЕЛЬЦЕМ. Человек против счётчика

Пакет: ~/books/chtenie-vladeltsa-z17/, панель из четырёх вариантов (боевая связка Z0 · её ВТОРАЯ генерация ZF · однопроходка ZP · критик → полный перепис Z1), метки слепые, ключ отдельно, соль своя — отличная от машинных читателей, чтобы порядок владельца был независим. Голый черновик и «обогащённый черновик + перепис» в панель не брались: первый проигрывает всем приборам с огромным отрывом, второй неотличим от боевой связки.

Д20.1 КИТАЙСКАЯ ГЛАВА: человек и счётчик СОВПАЛИ

порядок владельца:  Z0 > ZF > ZP > Z1
счёт ошибок:        ZF 3.0 · Z0 6.0 · ZP 8.0 · Z1 13.5

Расхождение ровно одно — перестановка Z0 и ZF, а это ОДИН И ТОТ ЖЕ способ. Контроль шума взят: владелец поставил две генерации одной связки соседями и сам написал «стоят близко, это спор двух редакторских вкусов». Значит его порядок несёт сигнал, а не шум.

⚠ Машинные читатели на этой же оси контроль НЕ взяли (развели ту же пару на 3 позиции). Человек здесь оказался ТОЧНЕЕ моделей — при том, что читает он тот же текст.

Z1 — ставку H-2б в сильнейшей форме — владелец поставил последним и назвал «откровенно машинным, в книгу нельзя ни в каком виде», перечислив механизм: системная ошибка термина («очистить пилюлю» вместо «выплавить»), перепутанное родство («шурин» вместо «зятя»), потерянный глагол, глосса в скобках внутри художественного текста. Счётчик согласен: 13.5 против 6.0.

Д20.2 АНГЛИЙСКАЯ ПАРА: счётчик ОБРАТЕН человеку

порядок владельца:  ZP > ZF > Z1 > Z0
счёт ошибок:        Z0 0.00 · ZF 0.50 · Z1 1.25 · ZP 2.25
СПИРМЕН: 0.64

Вариант с НУЛЁМ ошибок (боевая связка, продакшен) владелец поставил ПОСЛЕДНИМ. Вариант с наибольшим числом ошибок (однопроходка) — ПЕРВЫМ и единственным, который взял бы в книгу.

Для сравнения: машинные читатели дали на этой оси +0.37, калибровка 16.08 давала 0.10. Три независимых чтения, три разных читателя — и ни одно не даёт положительной связи со счётом.

Владелец сам назвал, ЧЕМ решался его порядок, и это диагноз прибору: «шествовала» вместо ярости, «Мерин» вместо имени Maryn, смягчённый мат там, где на мате держится сцена, вежливое «Пойдёмте» в реплике, которую выплёвывают, обесточенный stalked. Ни одно из этого не является ни искажением факта, ни калькой — то есть по нашей рубрике это вообще не ошибки. Его формулировка: «счётчиком отсеивать брак, чтением выбирать текст в книгу».

Д20.3 КОНТРОЛЬ ШУМА НА АНГЛИЙСКОМ КРАСНЫЙ — И ЭТО ГОВОРИТ ОБ АРМЕ, А НЕ О ЧИТАТЕЛЕ

Владелец сам опознал контрольную пару по общему тексту: «Ставлю на Т2 и Т4: почти построчное совпадение в обоих отрывках, общие сдвиги». Опознал ВЕРНО — это ZF и Z0. И развёл их на 2-е и 4-е места, объяснив: «один прогон вышел приличным, второй — сырым».

Мой гейт объявляет такое «порядок читателя = шум». ⚠ Гейт здесь неправ, и это его предел: он не умеет отличить «читатель шумит» от «арм шумит». Улики за второе: читатель опознал близнецов по тексту, то есть его восприятие острое; и независимо от него счётчик на китайской оси даёт той же паре близнецов sd 4.42, из-за чего китайская пачка и аннулирована.

Собственный разброс боевой связки от прогона к прогону превышает разницу МЕЖДУ архитектурами. Это подтверждено тремя независимыми приборами: счётом ошибок на zh, машинными читателями на zh и человеком на en. Вывод владельца дословно: «одиночная „победа“ любого пайплайна по одному сэмплу не значит ничего — сравнивать нужно по нескольким прогонам на метод».

Д20.4 ЧТО ЧЕЛОВЕК УВИДЕЛ, А ОБА ПРИБОРА НЕ МОГЛИ

  1. Сквозные артефакты между отрывками. Пол персонажа Рейн меняется от главы к главе у ВСЕХ четырёх вариантов. Судья работает поотрывочно и такое не увидит НИКОГДА по построению.
  2. Буквальность, наказанная как дефект. В китайском исходнике две почти одинаковые фразы подряд (артефакт склейки главы). ZF честно сохранил обе и читается хуже; Z0 и Z1 молча склеили и читаются лучше. Наша рубрика считает «потерянный факт» ошибкой безусловно — то есть штрафует за склейку авторского дубля. Конкретный воспроизводимый пример слепоты прибора, которого у фазы до сих пор не было.
  3. Общая для всех армов ошибка глоссария: 龙眼大小 передано как «с драконий глаз» вместо «размером с лонган» во всех четырёх вариантах — признак общего глоссария или общего семейства.

Д20.5 ДЕФЕКТ СБОРКИ ПАКЕТА, СТОИВШИЙ ПЕРВОГО АНГЛИЙСКОГО ЧТЕНИЯ

Первая редакция пакета солила раскладку меток НОМЕРОМ ГЛАВЫ, из-за чего Т1 в первом английском отрывке и Т1 во втором означали РАЗНЫЕ армы. Владелец — как поступил бы любой читатель — дал один сводный порядок и говорил о «Т1» как об одном тексте. Расшифровать это нечем: один и тот же ответ давал «однопроходка первая» по одной раскладке и «однопроходка последняя» по другой. Работа читателя пропала по дефекту МОЕЙ сборки, а не его чтения. Ответ сохранён уликой (ОТВЕТ-en.ИСПОРЧЕННЫЙ-ПАКЕТ.md), пара пере-собрана со сквозной раскладкой и прочитана заново.

Починено и застраховано: раскладка одна на пару · разборщик принимает человеческую форму ответа (прежний требовал машинной и молча терял её) · порядок ВЕРНОСТИ больше не принимается за порядок второго отрывка · пере-эмиссия НЕ трогает пару, которая уже прочитана · при неоднозначной раскладке счётчик ОТКАЗЫВАЕТСЯ расшифровывать вместо того, чтобы печатать правдоподобное.

Д20.6 ПОПРАВКА ВЛАДЕЛЬЦА: ДЕЛО НЕ В ЯЗЫКЕ, А В ДИАПАЗОНЕ ШКАЛЫ

Владелец 17.08: «Возможно, на английском слишком текст простой и его маловато, чтоб нормально оценить. И тут мы могли дрейфануть по выводам». Возражение проверено замером и подтвердилось.

Английский материал стоит у пола шкалы. Медиана исходника 1642 знака против 2180 на zh, а главное — разброс армов ВНУТРИ единицы: медиана 4.0 против 9.0 на zh, и 12% армов набирают РОВНО НОЛЬ ошибок (на zh — 0%). На двух главах, которые читал владелец, два арма из четырёх стояли на нуле: счётчик их не мог ранжировать в принципе.

Разбиение чтений по ширине шкалы (обе пары, машинные читатели):

шкала на единице согласие ранга чтения со счётом
ШИРОКАЯ (разброс ≥ медианы) +0.68 (n=16)
УЗКАЯ +0.42 (n=16)
⤷ только английские, широкая +0.82 (n=4)
⤷ только английские, узкая +0.49 (n=12)

Счётчик не слеп по языку — он теряет разрешение на чистом тексте. Там, где армы реально расходятся по ошибкам, он следит за читаемостью хорошо, включая английскую пару (+0.82).

Разбиение сделано ПОСЛЕ того, как результаты видны, — это разведка, а не проверка. Порог «медиана разброса» выбран по этим же данным. Утверждение годится как гипотеза для следующего захода, а не как вывод; проверяется оно прямо — взять ТРУДНЫЙ английский материал (длинные плотные главы) и посмотреть, восстановится ли согласие.

Что из-за этого правится в выводах выше. Формулировка Д19.3/Д20.2 «счёт не следит за читаемостью» была СЛИШКОМ ОБЩЕЙ. Честная: счёт следит за читаемостью там, где у него есть диапазон, и перестаёт там, где все варианты чисты по букве. Числа 0.64 (владелец) и +0.37 (машинные читатели) сняты преимущественно на узкой шкале и означают «прибор без разрешения», а не «прибор, мерящий не то». Вывод «побеждает ЧТЕНИЕ» при расхождении остаётся в силе — но причина расхождения названа теперь верно.


Д21 — ПЕРЕ-ПРОВЕРКА ВЕРДИКТА H-1 ИСПОЛНЕНИЕМ ($0; находки ревизии P13 · P12 · P07 · R73/P40)

Первая из 65 находок внутренней ревизии, не верифицированных автором отчёта. Находка утверждала, что вердикт по гипотезе владельца H-1 («проблема в черновике») определяется составом двух пачек и при их снятии переворачивается. Пере-проверка сделана своим кодом, без единого платного вызова: eval/.venv/bin/python eval/dovodka/itog_d4.py --axis=d4 --sens. Правило решения записано в докстринге sens() ДО прогона: вердикт считается пере-решённым только при совпадении во ВСЕХ сценариях, снятие в которых обосновано нормой; запас над порогом печатается числом.

Поправка к формулировке, с которой находка ушла в план курса. План 17.08 нёс строку «H-1 переворачивается: дорогой черновик ВСЁ-ТАКИ помогает». Это неверно по знаку: в своде минус означает «арм ХУЖЕ эталона», и «A6/A0 перешёл порог» читается «дорогой черновик с точечным контуром ЗНАЧИМО ХУЖЕ боевой связки», то есть H-1 не подтверждается, а ОПРОВЕРГАЕТСЯ. Ошибка была моя, при переносе находки в план.

Д21.1 Арифметика находки воспроизведена побайтно — и не даёт её вывода

сценарий                          пол n      sd     порог   A6/A0    запас   вердикт
S0 дерево как есть (свод)            14  2.2097   1.6536  1.0312  0.6223  ниже порога
S1 −валидация 11.08                  12  1.4410   1.1647  1.0938  0.0710  ниже порога
S2 +69de717f3f назад (база ревизии)  15  2.1354   1.5438  1.0312  0.5126  ниже порога
S3 база ревизии −валидация           13  1.4058   1.0917  1.0938  +0.0020  ПЕРЕШЁЛ

Строка S3 совпадает с числами находки до четвёртого знака (она называла 1.0917 / 1.0938 / +0.0020) — то есть мой пере-счёт и её независимая реализация сходятся, и спор не о вычислении.

Спор о составе, и он решается так. Переворот живёт ТОЛЬКО в сценарии S3, а S3 внутренне противоречив: он ВОЗВРАЩАЕТ в замер пачку 69de717f3f, снятую по норме «сессия, нарушившая протокол, аннулируется целиком», и одновременно СНИМАЕТ две пачки, для которых такой нормы не сработало. Норма применяется в одну сторону и отменяется в другую.

На дереве, которое есть сейчас (пачка аннулированной сессии в карантине — это и есть исполнение нормы), снятие пачек-валидации даёт S1: запас 0.0710, ниже порога. Вердикт не двигается.

Д21.2 Посылка находки «другой режим замера» проверена и не подтверждается

Находка опиралась на два основания. Первое — незамороженный промт: проверить больше нечем, транскрипт сессии agent-aa9688762dc325180.jsonl на диске отсутствует (find по всем каталогам агентов). При этом журнал карантина ~/books/judging/sud-d4/annulled.txt несёт запись прежней проверки: «инлайн-промт нёс все пять несущих правил ядра; расхождение было артефактом переноса строки в core.md». Эту запись я подтвердить исполнением не могу и объявляю как есть.

Второе основание — уровень счёта в этих пачках (9.94 против 6.39 у основной волны) — проверяемо и не выдерживает проверки:

p1: сессий 11 · среднее 6.90 · sd 1.45 · разброс 4.19…9.94
    д-01 (валидация) 9.94  — самая строгая в наборе, отклонение +2.1 sd
p2: сессий 10 · среднее 5.08 · sd 1.65 · разброс 3.32…9.05
    д-21             9.05  — отклонение +2.4 sd, НИКЕМ не оспаривается

Критерий «уровень выбивается» выбирает сессию, которая отклоняется МЕНЬШЕ, чем неоспариваемая сессия соседнего набора. Значит это не норма, а выбор; и выбор, сделанный после того, как видно, на какую сторону он двигает вердикт.

Д21.3 Калибровка порога — ответ ПО ЗНАКУ (закрывает находку ревизии №6, R73 против P40)

Две выжившие находки ревизии называли порог смещённым в ПРОТИВОПОЛОЖНЫЕ стороны, и ни одна не мерилась на этой оси: R73 мерила на проходе border (контраст в 1.40× шумнее пола), P40 рассуждала. Замер прямой — шум САМОГО контраста той же структуры (перевес в наборе p1 против перевеса в p2), против пола, из которого строится порог:

пол:      n=14 sd 2.2097 → порог 1.6536
A1B/A0:   n=30 sd 2.2669 (1.03× пола) → свой порог 1.1589 · запас +2.3734
A3/A0:    n=30 sd 2.2234 (1.01× пола) → свой порог 1.1366 · запас +1.0731
A6/A0:    n=15 sd 1.4360 (0.65× пола) → свой порог 1.0382 · запас 0.0069

на оси Д4 пол откалиброван честно для двух полных контрастов (1.011.03×) и для несущего H-1 контраста он, наоборот, ЗАВЫШЕН в 1.5×. Число R73 (1.40×) — свойство прохода border, а не общего устройства порога, и переносить его не следовало. ⚠ И даже при СВОЁМ, более мягком пороге A6/A0 остаётся ниже: запас 0.0069.

Рядом — вторая сторона той же калибровки: чистый шум судьи, снятый там, где текст ОДИН И ТОТ ЖЕ, а сессии разные (боевые армы лежат в обеих половинах):

A0 2.2433 (1.02×) · A4 2.2361 (1.01×) · A2 2.3620 (1.07×) · A6 2.0221 (0.92×)
A6F 2.8628 (1.30×) · A1B 3.1700 (1.43×) · A3 3.1826 (1.44×) · A1 3.2647 (1.48×)

шум судьи зависит от АРМА: тексты контуров он оценивает в полтора раза менее устойчиво, чем перепис. Пол снят с лечения, близкого к эталону, поэтому для контурных армов он занижен; в контрасте оба эффекта частично гасятся, отсюда итоговые 1.011.03×.

Д21.4 Наклон наборов (находка P07) — реален, но контрастов не задевает

боевые армы, одна единица в обеих половинах: n=208 сдвиг p1p2 +1.50 · sd 2.76
пол (те же половины):                        n=14  сдвиг       +1.79 · sd 2.21 · p=0.0117

Набор p1 систематически строже p2 на полторы ошибки на клетку, и величина сдвига у пола та же, что у боевых армов ⇒ пол в значительной части меряет разницу СЕССИЙ, а не разброс оценки. Однако вердиктов это не двигает: армы сбалансированы по половинам (A0 30/31, A6 15/16, все остальные так же), а снятие пачки убирает ВСЕ армы единицы разом, поэтому баланс сохраняется. Контраст, посчитанный ВНУТРИ половины и лишь потом усреднённый, даёт те же числа до четвёртого знака во всех четырёх сценариях (напечатано --sens).

Д21.5 ✔ ВЕРДИКТ Г5 И ЧТО ОН НА САМОМ ДЕЛЕ ГОВОРИТ

Печатаемый вердикт «H-1 НЕ УСТАНОВЛЕНА» остаётся в силе. Он не переворачивается ни снятием пачек-валидации, ни возвратом пачки аннулированной сессии, ни контрастом внутри половины, ни переходом на собственный шум контраста. Находка P13 закрывается: арифметика верна, вывод из неё не следует.

Но честная формулировка сильнее и другая, чем «не установлена». Во всех пяти способах счёта A6/A0 встаёт ВПЛОТНУЮ к своему порогу: запас 0.62 · 0.07 · 0.51 · +0.002 · 0.007 при том, что шаг самой шкалы — ОДНА ошибка. Это не «эффекта нет», это «эффект ровно размером с собственный шум прибора» — то же самое, что заход Д17 намерил на новом материале тремя независимыми приборами. Гипотеза владельца H-1 не опровергнута и не подтверждена: при n=16 и таком шуме она в принципе не разрешима этим прибором, и добор до разрешимости стоил бы не $0.48, а нескольких прогонов на метод (Г12).

Отдельно: A6 испытывался ТОЩИМ промтом переводчика (panel.py:142translator_msgs) — поменяли модель, не поменяли задание. Значит эта клетка не закрывает вопрос «дорогая модель плюс ПОЛНЫЙ промт», который и стоит в архитектуре владельца V6. Он остаётся пустым (шаг 4 курса).

Д21.6 Что закрыто и что осталось открытым по смежным находкам

  • P12 (пачка 69de717f3f) — ЗАКРЫТА исполнением. На диске лежит 69de717f3f.ANNULLED.txt, плоского файла нет, свод её не читает. Базовые числа семейства claude сейчас n=14 · sd 2.21 · порог 1.65 — ровно то, что находка и предсказывала как результат снятия. Текст сверки от 16.08 числит её незакрытой; это устаревшая строка сверки, а не живой дефект.
  • P07 (гейт честности пола) — снята по существу (Д21.4): сдвиг реален и объявлен, вердиктов не двигает, унаследованный гейт к разведённым половинам неприменим по построению.
  • R73/P40 (калибровка порога) — ЗАКРЫТА замером (Д21.3), направление названо числом.
  • P42 (два пре-рег-правила о маржевом гейте) — ОТКРЫТА, и это вопрос владельцу, не замер. Пре-рег несёт две несовместимые ремедии: П-1 (:1070) велит АННУЛИРОВАТЬ пачку семейства, не взявшего маржевый контроль; Д4.4 (:1085-1087) — лишь понизить его вердикты до описательных. Sol маржевый гейт не взял (+3.06 против своего порога 3.65). По жёсткой букве у H-2а остаётся ОДНО семейство, и единственный CONFIRM фазы становится «ЭСКАЛАЦИЯ К АДЪЮДИКАЦИИ». Код исполняет мягкое правило; выбор нигде не объявлен девиацией. Объявляю девиацией здесь и выношу решение владельцу — сессия его принимать не вправе.

Д23 — ОДНОПРОХОДКА КАК РОЛЬ. ПРЕ-РЕГ, ЗАПИСАН ДО ПЕРВОЙ ПОКУПКИ

Заказ владельца 20.08 дословно: «перегенерируй промт для однопроходки, составь из того что мы уже знаем + зажми промтом, но не бесконечными правилами, а рамками и по каким критериям мы будем проверять результат. И давай потестим в разные модели с судейством и сравним что получается. Бюджет разрешаю какой нужен».

Д23.0 Почему этот замер, а не другой

Однопроходка — единственный живой продуктовый кандидат из всего, что дуга 19→23 измерила: по судейской оси от боевой связки не отличается, по банку терминов ЛУЧШЕ неё на обеих парах (1.38 против 2.88 на zh, 0.31 против 0.56 на en) [ ЛОЖНО, СМ. ЭРРАТУ Д30.3: 1.38/0.31 — это арм Z7, однопроходка ПЛЮС отдельно оплаченный фиксер. У голой однопроходки zh 3.00, то есть ХУЖЕ связки], стоит ОДИН вызов вместо двух, и при слепом чтении владелец поставил её ПЕРВОЙ на английском.

И всё это она делает С ГАНДИКАПОМ, который до 20.08 нигде не был объявлен. Её промт (contour.a2_msgs) — не продуктовый, а ИЗМЕРИТЕЛЬНЫЙ: боевой промт переводчика плюс мандатная часть боевого промта редактора, механически склеенные (четыре строки выброшены A2_DROP, четыре подставлены A2_SUBST), с прямой мета-фразой про наш конвейер — «отдельного редактора после тебя НЕ БУДЕТ, поэтому мандат редактуры входит в твой». Склейка сделана по уважительной причине: в эксп-21 у однопроходки системный промт был вдвое короче (×1.92), и замеренная разница могла быть разницей ОБЪЁМА ИНСТРУКЦИИ, а не топологии. Уравнивание было верным ДЛЯ ЗАМЕРА — но следствие в том, что однопроходка ни разу не испытывалась как нормально написанный промт-роль.

Д23.1 Что нового в промте и чем каждый пункт грунтован

Ядро — eval/dovodka/prompts/onepass-core.md, общее для всех пар; пар-специфика подтягивается ДВУМЯ блоками из файлов САМОЙ пары («Единицы и приёмы» из её translator.md, «ДИСКУРС-ПЕРЕВЁРСТКА» из её editor.md). Второго источника правды не заводится: пара, которой в репозитории ещё нет, работает своими двумя блоками без правки кода.

что нового чем грунтовано
ВОЛЬНОСТЬ РАЗРЕШЕНА ЯВНО (блок «ТЫ ВПРАВЕ») решение владельца 16.08: «штрафовать за вольность нельзя, живой язык — приоритет». Ни один боевой промт разрешения не давал — оба только ЗАПРЕЩАЛИ
РЕГИСТР отдельной рамкой слепое чтение владельца 17.08: ярость передана как «шествовала», мат смягчён, вежливое «Пойдёмте» в выплюнутой реплике. Слова «регистр» нет НИ В ОДНОМ промте проекта
КРИТЕРИИ ПРОВЕРКИ напечатаны в промте прямое требование владельца 20.08; плюс снимает противоречие, на котором модель зажималась: она видит, что вольность в рамках не штрафуется
четыре запрета вместо списка правил «рамки, а не бесконечные правила» (владелец)
мета-фраз про конвейер нет ни одной они мерили наш пайплайн, а не задачу перевода
банк-закон: «в ЧЕРНОВИКЕ» → «в ПЕРЕВОДЕ» поймано селфтестом ДО покупки: у однопроходки черновика нет, модель получала бы указание про несуществующий текст

Объём: системный промт 6 864 знака на zh против 6 522 у склейки (×1.05), 8 700 против 8 054 на en (×1.08). То есть замер сравнивает не объём инструкции, а её устройство — конфаундер эксп-21 здесь не воспроизводится. ЛОЖНО, СМ. ЭРРАТУ Д30.5: верно ×1.28 (zh) и ×1.24 (en) по инструкциям, ×1.17/×1.19 по проводу. Числа сняты с ПЕРВОЙ редакции промта (он потом рос дважды) и с суммы, включавшей текст главы. Конфаундер эксп-21 уменьшен с ×1.92, но НЕ снят — остаток 2428%.

Д23.2 Панель

арм что это цена
ZD голый черновик $0, куплен
Z0 боевая связка — эталон продакшена $0, куплен
ZF вторая генерация связки — пол СТАРОЙ панели $0, куплен
ZP прежняя СКЛЕЙКА-однопроходка — база контраста $0, куплен
RN новая РОЛЬ, deepseek-v4-pro, генерация 1 покупается
RN2 новая роль, deepseek-v4-pro, генерация 2 — СВОЙ пол покупается
RG новая роль, glm-5 — переносимость, другой вендор покупается
RK новая роль, grok-4.3 — переносимость, третья семья покупается

Главы — ТЕ ЖЕ 16 на пару, что у захода Д17 (соль zakhod-d17-2026-08-16): иначе бесплатные армы не переиспользуются и база контраста уезжает.

Выбор третьей модели не случаен. Главная претензия владельца при слепом чтении — РЕГИСТР («смягчённый мат там, где на мате держится сцена»). xAI — единственный вендор, у которого слова violen* в правилах нет вовсе, и модель меньше прочих склонна смягчать. grok-4.3 идёт с ВКЛЮЧЁННЫМ размышлением: запрет D30.1 прямой — grok с reasoning-off в редакторской роли есть no-op-редактор. ⚠ gemini в панель НЕ берётся и это объявлено ДО, а не после: на этом материале он массово падает в контент-фильтр (эксп-21 §1/§8 — 10 клеток судейского прогона с PROHIBITED_CONTENT), и его пустые клетки мерили бы фильтр, а не промт.

Д23.3 Правило решения, пороги, мощность, статус осей

  • Несущий контраст ОДИН: RN/ZP — новая роль против прежней склейки, НА ТОЙ ЖЕ МОДЕЛИ и ТЕХ ЖЕ главах. Остальное описательное и в поправку Холма не входит.
  • Несущая величина — сумма ВЕРНОСТЬ+ЯЗЫК на главу по рубрике Д18 (правило владельца 16.08).
  • Порог различимости — 2.8·sd/√n по СВОЕМУ полу этого замера (RN против RN2, две генерации новой роли), а не заимствованный. Формула назначается здесь, число печатается до вердиктов.
  • МОЩНОСТЬ, НАПЕЧАТАННАЯ ЧИСЛОМ ДО ДЕНЕГ (норма заказа :168; за её нарушение фаза уже несёт девиацию Э-17.2). Цель — 1.50 ошибки на главу:
свой пол sd    MDE при n=16, k=1     MDE при n=16, k=4
     1.06            0.98                  1.21
     1.51            1.39                  1.72      ← пол английской оси захода Д17
     2.05            1.89                  2.33
     4.42            4.07                  5.03      ← пол китайской оси захода Д17

чтобы MDE ≤ 1.50 при n=16 и ОДНОМ контрасте, свой пол должен быть sd ≤ 1.63. При английском поле захода (1.51) MDE = 1.39 — цель ДОСТИГАЕТСЯ, ось НЕСУЩАЯ. Это первый раз за фазу, когда ось проходит по мощности, и добился этого не размер выборки, а сокращение семейства контрастов с четырёх до одного. При китайском поле захода (4.42) MDE = 4.07 — не достигается ничем.

  • СТАТУС КИТАЙСКОЙ ОСИ ОБЪЯВЛЯЕТСЯ УСЛОВНО И РЕШАЕТСЯ ДО ВЗГЛЯДА НА КОНТРАСТ: её пол снимается с ПАРЫ RN/RN2, а не заимствуется у связки; пол ≤ 1.63 → ось несущая, иначе ОПИСАТЕЛЬНАЯ. Основание для надежды названо заранее: старый китайский пол 4.42 снят с ДВУХСТАДИЙНОЙ связки, у которой разброс складывается из двух вызовов; однопроходка — один вызов и может оказаться устойчивее. Это гипотеза, и решает её число, а не желание.
  • Сертификат чувствительности обязателен: грубый и маржевый декои в каждой пачке. Не прошёл маржевый — пачка не несёт вывода «не различимо» и аннулируется (норма П-2).
  • Второй эндпойнт — слепое чтение по той же панели, и при расхождении со счётом побеждает ЧТЕНИЕ (приоритет владельца «живой язык»). Правило то же, что в Д17.4, и объявлено ДО данных.
  • Третий эндпойнт, детерминированный и бесплатный — канон-гейт: потерянных терминов на главу. Именно на нём однопроходка уже выигрывала, и он не зависит ни от судьи, ни от читателя.

Д23.4 Чего этот замер НЕ может

  1. Он не отвечает, какая МОДЕЛЬ лучше в роли переводчика: панель моделей здесь — проверка ПЕРЕНОСИМОСТИ эффекта промта, а не турнир жильцов (тот закрыт устойчиво дугой 19→23).
  2. Он не переносится на другие книги: материал тот же, что у фазы Д.
  3. n=16 не даёт интеракций «промт × страта».
  4. Числа сравнимы с заходом Д17 (та же рубрика Д18, те же главы) и НЕ сравнимы с дугой 19→23.
  5. Он не проверяет нарезку по границам сцен — требование брифа V6, не исполненное ни разу: единицы режутся по числу знаков. Объявлено как незакрытое, а не забыто.

Смета: $2.41 по текущему пиковому пину, из ЗАМЕРЕННЫХ токенов купленных однопроходок (zh $1.03, en $1.38). Потолки ФД-M $2.10 и ФД-N $2.40 несут двойной запас: у grok размышление задокументированно гуляет ×163 на побайтно одном входе, и смета по медиане его не удержит. Пакетный потолок $13.80 → $18.30 ровно на дельту двух новых фаз плюс 3 цента (сумма фазовых 18.27 ≤ 18.30). Санкция владельца 20.08: «бюджет разрешаю какой нужен».

Д23.5 ДЕВИАЦИИ ОТ ПРЕ-РЕГА Д23 — объявлены 21.08, ДО свода вердикта

Пре-рег Д23.2/Д23.3 писался 20.08 утром, курс к вечеру сдвинулся дважды (смена прибора · решение владельца о новых редакциях промта), и панель разошлась с записанной. Расхождения печатаются здесь, а не растворяются в тексте свода.

пре-рег обещал куплено фактически последствие
RN2 — вторая генерация новой роли, СВОЙ пол замера 0 клеток порог различимости, объявленный «по своему полу», взять не с чего; полом служит пара Z0/ZF — пол ЧУЖОГО арма, и это ослабление, а не эквивалент
RG — та же роль на glm-5 0 клеток переносимость промта между вендорами НЕ проверена
RK — та же роль на grok-4.3 0 клеток то же; и отдельно не проверена ставка на регистр (xAI брался ровно за неё)
RC, RB — рез и переворот экзамена появились по решению владельца 20.08; в пре-реге их нет

Прямая часть заказа владельца 20.08 осталась НЕ ИСПОЛНЕННОЙ: «давай потестим в разные модели с судейством и сравним что получается». Испытан один жилец — deepseek-v4-pro. Всё, что сказано ниже о промте-роли, сказано про этот промт НА ЭТОЙ модели, и переносимость остаётся пустой клеткой. Это не оговорка формы: перевес dspro в редакторской роли закрыт устойчиво, а в роли ЕДИНСТВЕННОГО исполнителя однопроходки — не мерен ни разу.

Правило решения тоже сдвинулось, и это объявляется здесь. Пре-рег назначал несущей величиной сумму ВЕРНОСТЬ+ЯЗЫК по рубрике Д18, то есть СЧЁТ ошибок. Решением владельца 20.08 счёт понижен до брак-скрина, первичным прибором стало слепое чтение. Пре-рег этого предусмотреть не мог, но и молчать об этом нельзя: вердикт выносится прибором, назначенным ПОСЛЕ записи пре-рега. Смягчает ровно одно обстоятельство, и оно записано ДО данных — Д23.3 уже назначал чтение вторым эндпойнтом с оговоркой «при расхождении со счётом побеждает ЧТЕНИЕ». Прибор повышен в ранге, а не введён задним числом.

Д23.6 ПАНЕЛЬ arch2 СОДЕРЖИТ 10 РАЗЛИЧНЫХ ТЕКСТОВ, А НЕ 11 (найдено читателем, 21.08)

Z7 (однопроходка + канон-фиксер) — побайтная копия ZP на 12 главах из 15. Разбор по клеткам точнее и интереснее, чем первая формулировка находки:

10 глав  фиксер НЕ ЗВАЛСЯ вовсе   (places=0: канон-гейт щелей не нашёл, клетка пишется
                                   текстом ZP без вызова — `zakhod.py:486`)
 2 главы фиксер ЗВАЛСЯ и заплачен, а вернул побайтно ТОТ ЖЕ текст   (27cb3a7e, f2274720)
 3 главы фиксер действительно правил текст            (001e6ac4, b065a92d, c3517980)

Канон-фиксер меняет перевод на 3 английских главах из 15 — на 20%. В 67% случаев он не вызывается, ещё в 13% вызывается впустую за деньги.

  • Сверка сборки, объявленная сплошной (165 текстов побайтно против клеток), этого не видела ПО ПОСТРОЕНИЮ: она сличала пакет с клетками, а клетки друг с другом — нет. Норма: сверка панели проверяет не только «текст тот», но и «тексты РАЗНЫЕ».
  • Вывод об арме «однопроходка + канон-фиксер» законен только на 3 главах, где текст изменился. Среднее место Z7 по всем главам — это на 4/5 среднее место ZP.
  • Самостоятельный результат, полученный бесплатно: стадия канон-фиксера на английской паре меняет текст в одном случае из пяти.
  • Побочный приз: получился контроль тождества строже близнецов Z0/ZFу близнецов разброс арма реален, у побайтно равных текстов его нет по построению. Читатель, который их разводит, дисквалифицирован без всяких допущений о шуме.

Д24 — ЕДИНООБРАЗНОЕ ПЕРЕ-СУДЕЙСТВО ВСЕХ АРХИТЕКТУР ОДНИМ ПРИБОРОМ НА ОДНИХ ГЛАВАХ

Заказ владельца 20.08 дословно: «давай переделаем судейство. Это очень важно на одинаковых главах сделать + единообразно через фабл посмотреть все архитектуры. С упором на следование сохранения смысла, отсутствие брака в тексте и художественность».

Исполнено 21.08. 15 глав английской пары, 11 армов в каждой, ОДИН читатель на главу (главы большие — решение владельца), 15 разных раскладок меток, ключ вне каталога заданий. Сессии #9495 журнала, идентичность читателей записана ДО запуска.

Д24.1 Что это первый раз за фазу

Все прежние вердикты об архитектурах выносились на РАЗНЫХ главах и разными приборами: заходы Д17Д20 сравнивали внутри своих панелей, а между панелями сравнения незаконны (§2.3 хендоффа). Здесь все одиннадцать способов стоят на одном материале, судимы одним прибором, и разрыв каждого меряется собственным полом замера — расхождением двух генераций одной боевой связки.

Д24.2 Порядок и разрывы

арм    ср. место   что это
ZF        3.63     боевая связка, ВТОРАЯ генерация
Z0        4.17     боевая связка, продакшен
Z1        5.20     критик → ПОЛНЫЙ перепис (ставка владельца H-2б)
Z8R       5.50     обогащённый черновик + перепис
RN        5.53     промт-роль, экзамен на смелости
ZP        5.57     однопроходка-склейка
Z7        5.70     однопроходка + канон-фиксер (на 10 главах ≡ ZP, см. Д23.6)
RB        5.93     промт-роль, экзамен ПЕРЕВЁРНУТ (формулировка владельца)
RC        7.27     промт-роль, экзамен ВЫРЕЗАН
ZD        8.20     голый черновик
Z8        9.30     обогащённый черновик БЕЗ переписа

Порог различимости — форма из пре-рега Д23.3 (2.8·sd/√n), sd снят с ЭТОГО замера:

контраст        разрыв   порог    вердикт        знаковый p
Z0/ZF (пол)     +0.53    2.56     НЕразличимы    —          ← контроль ЗЕЛЁНЫЙ
связка ↔ Z1     +1.30    2.02     в пределах     0.4240
связка ↔ Z8R    +1.60    2.45     в пределах     0.3018
связка ↔ RN     +1.63    3.07     в пределах     0.2668
связка ↔ ZP     +1.67    2.98     в пределах     0.2668
связка ↔ RB     +2.03    2.77     в пределах     0.5811
связка ↔ RC     +3.37    3.25     РАЗЛИЧИМ       0.1185
связка ↔ ZD     +4.30    1.67     РАЗЛИЧИМ       0.0001
связка ↔ Z8     +5.40    1.64     РАЗЛИЧИМ       0.0001

Д24.3 ВЕРДИКТЫ

  1. Боевую связку не обошёл НИКТО. Обе её генерации заняли первые два места, и ни один из девяти претендентов не встал выше. Это не «связка лучше всех» — разрыв с шестёркой середины в пределах порога; это «за пять экспериментов ни одна альтернатива её не обогнала».
  2. АБЛЯЦИЯ ОПРОВЕРГНУТА СОБСТВЕННЫМ ЗАМЕРОМ. §15.21 дал RB > Z0 на трёх главах и сам же объявил контроль шума КРАСНЫМ. На пятнадцати главах при ЗЕЛЁНОМ контроле RB стоит на 2.03 места ПОЗАДИ связки. Формулировка владельца («брак = просвечивающий исходный язык») продакшен не бьёт. Вывод n=3, у которого пол был красным, не устоял — ровно как и предупреждалось.
  3. Второй проход по-прежнему нужен, и это единственное, что не пошатнулось за пять экспериментов. ZD и Z8 — единственные два арма, отстающие с огромным запасом и на всех главах (15 из 15 и 14 из 15). Прибор сменился, вывод устоял.
  4. Обогащение промта черновика ВРЕДИТ, и теперь это различимо. ЛОЖНО, СМ. ЭРРАТУ Д30.4: парный контраст не считался; пере-счёт даёт en +1.10 при пороге 2.26 и zh +0.17 при пороге 1.39 — В ПРЕДЕЛАХ на обеих парах. Z8 (обогащённый черновик) стоит НИЖЕ голого ZD — 9.30 против 8.20. Прежний вердикт «хуже голого на en» был на грани; здесь он различим с запасом. Промт черновой стадии обогащать нечем.
  5. Экзамен в промте-роли работает, и работает его НАЛИЧИЕ. RC (экзамен вырезан) — 7.27, единственная из трёх редакций, отстающая РАЗЛИЧИМО. Обе редакции с экзаменом (RN 5.53, RB 5.93) — в пределах порога. ⇒ печатать критерии проверки в промте имеет смысл; какая именно формулировка экзамена — прибор не различает.
  6. Ставка владельца H-2б (Z1, критик → полный перепис) — лучший из девяти претендентов (+1.30, самый малый разрыв). Прежний вердикт «ОТРИЦАТЕЛЬНО, 0.06 по счёту» вынесен ПОНИЖЕННЫМ прибором на других главах и к этому замеру не применим. Новый вердикт: не хуже связки, но и не лучше — при цене двух дорогих вызовов вместо одного.
  7. Однопроходка (ZP) держится: +1.67, в пределах порога. Она по-прежнему не отличима от связки и по-прежнему стоит один вызов вместо двух — то есть остаётся живым продуктовым кандидатом. Но и утверждение «владелец поставил её первой на английском» этим замером НЕ воспроизводится: на 15 главах она шестая из одиннадцати.

Д24.4 Контроли и чего замер НЕ может

Все три контроля зелёные. Пол Z0/ZF неразличим, как обязан (+0.53 при пороге 2.56). Грубый декой ZD внизу на 11 главах из 15 и различимо позади. Контроль тождества (Z7ZP на 12 главах) пройден начисто: развод мест 0.00, каждый читатель связал пару знаком = сам. Аудит транскриптов: 15 читателей, по 35 вызовов, по 2 пути у каждого (свой пакет и свой файл ответа), запретных шаблонов 0, чужих глав 0.

Чего замер не может, и это не оговорка формы:

  • Судейское семейство ОДНО (fable). Норма П-1 о двух семействах не исполняется по решению владельца 20.08 (Sol запаркован). Внутренний контроль близнецов ловит грубый случай, но меры «сколько в вердикте от прибора, а не от текста» нет вовсе.
  • ОДИН читатель на главу. Разброс между читателями одной главы не мерен ни разу.
  • Одна пара (английская) и один жилец (deepseek-v4-pro). Китайская панель не собиралась; переносимость промта на других вендоров не проверена (Д23.5).
  • Шесть армов середины между собой НЕ упорядочены. Их разрывы меньше порога, и называть «Z1 лучше RB» на этих данных нельзя.

Д25 — ПЕРЕНОСИМОСТЬ ПРОМТА-РОЛИ НА ДРУГИХ ВЕНДОРОВ. ПРЕ-РЕГ, ЗАПИСАН ДО ПОКУПКИ

Закрывает неисполненную часть заказа владельца 20.08 («давай потестим в разные модели с судейством») и девиацию Д23.5: до сих пор промт-роль испытан на ОДНОМ жильце. Санкция на покупку — выбор владельца 21.08 из предложенных вариантов.

Что покупается

арм   модель      вендор     клеток   смета по замеренным токенам
RG    glm-5       Zhipu        16      $0.2871
RK    grok-4.3    xAI          16      $0.4136
                                       ИТОГО $0.7007
касса ФД-N: потрачено $1.3593 из $2.40 → свободно $1.0407, влезает без поднятия потолка

Пара — английская, главы ТЕ ЖЕ 16 (соль zakhod-d17-2026-08-16), промт ТОТ ЖЕ (RN-редакция, экзамен на месте). Меняется ровно один множитель — жилец.

Что замер отвечает и чего не отвечает

  • Отвечает: свойство ли это промта или свойство deepseek-v4-pro. Если RG/RK встают рядом с RN — промт переносим; если проваливаются — всё сказанное о промте-роли есть утверждение об одной модели, и это надо будет писать рядом с каждым выводом.
  • НЕ отвечает: какая модель лучше в роли переводчика. Турнир жильцов закрыт устойчиво дугой 19→23 (dspro первый везде), и эти 32 клетки его не пере-открывают.

Правило решения — объявляется ДО данных. Прибор — слепое чтение (решение владельца 20.08), панель та же arch2, мерило разрыва — собственный пол замера (близнецы Z0/ZF), порог 2.8·sd/√n. Арм считается переносимым, если его разрыв с RN НЕ превышает порога; не переносимым — если превышает в худшую сторону. Промежуточного вердикта нет.

Пере-эмиссия панели с новыми армами перепишет раскладку уже прочитанной arch2 — класс, стоивший фазе вердикта. Поэтому новые армы читаются ОТДЕЛЬНОЙ панелью под своим тегом, с якорями Z0/ZF/RN для связи со шкалой; ответы arch2 не трогаются.

Вендор-риски, названные ДО покупки, а не после

  • grok-4.3 идёт с ВКЛЮЧЁННЫМ размышлением: запрет D30.1 прямой, reasoning-off даёт no-op. Размышление у него задокументированно гуляет ×163 на побайтно одном входе — смета по медиане может не удержать, гард кассы остановит прогон, и это штатный исход, а не авария.
  • glm-5 с включённым размышлением НЕ ВЛЕЗАЛ в потолок вывода на китайском (замер ФД-K). Английская глава впятеро короче; бюджет вывода 32000. Обрыв finish=length — объявляется числом.
  • Эхо-мина: гейт годности C.draft_defect стоит на каждой клетке; эхо на этих вендорах не мерено ни разу, и частота печатается как результат арма.

Д25.1 ЭРРАТА, ОБЪЯВЛЕНА ПОСЛЕ 32 КУПЛЕННЫХ КЛЕТОК И ДО СУДЕЙСТВА: RG шёл БЕЗ РАЗМЫШЛЕНИЯ

Проверка купленного (а не заявленного) вскрыла конфаунд, которого пре-рег Д25 не предусмотрел.

арм  модель          $/клетка   размышление/клетка   знаков/клетка
RN   deepseek-v4-pro   0.0278          6 139             1 530
RK   grok-4.3          0.0068            737             1 567
RG   glm-5             0.0029              0             1 600   ← НОЛЬ

Ноль не аномалия провода и не молчание вендора: ростер гасит размышление glm-5 по умолчанию (extra_body: {"thinking": {"type": "disabled"}}, квирк-бюллетень :53, подтверждено живыми армами эксп-18/21). Проверено чтением кода, а не догадкой.

Почему это ломает именно ЭТОТ замер. Трейс 20.08 показал: dspro пишет 8894% финального текста ВНУТРИ размышления, то есть промт-роль опирается ровно на тот механизм, который у glm-5 выключен. Сравнение «промт на dspro с думанием» против «того же промта на glm-5 без думания» мерило бы думание, а не переносимость промта — и вывод «промт не переносим» был бы артефактом конфигурации.

Лечение — арм, а не правка. Заведён RGT: тот же glm-5 с ВЕНДОР-ДЕФОЛТНЫМ размышлением. RG остаётся в панели: разность RG/RGT — цена размышления у этого вендора, замеренная попутно и бесплатно, и это самостоятельный результат.

Что при этом уже видно и не зависит от эрраты. Смета Д25 ($0.7007) завышена в 4.5 раза: факт $0.1546 за 32 клетки, все finish=stop, гейт годности не поднял ни одной. Оба чужих вендора оказались кратно дешевле dspro в этой роли: glm-5 в 9.6 раза, grok-4.3 в 4.1 раза. Риск «grok разгонит размышление ×163» НЕ реализовался: 737 токенов против 6 139 у dspro.

Д26 — ВТОРАЯ ПАРА: КИТАЙСКАЯ ПАНЕЛЬ ТЕМ ЖЕ ПРИБОРОМ. РЕПЛИКАЦИЯ И ЕЁ ГРАНИЦА

12 глав китайской пары, 8 архитектур, один читатель на главу, из УЖЕ КУПЛЕННОГО — $0. Сессия #96 журнала, идентичность читателей записана ДО. Аудит: 12 читателей, по 49 вызовов, по 2 пути у каждого, запретных обращений 0, чужих глав 0. Сборка сверена гейтом --verify-read: 96 текстов побайтно против клеток, совпадающих армов нет, раскладок 12 разных. ЛОЖНО, СМ. ЭРРАТУ Д30.2: Z7 отличается от ZP на 0.7% слов на 12 главах из 12 — панель даёт СЕМЬ различных текстов, а не восемь.

⚠ 4 главы из 16 пропущены и это НАПЕЧАТАНО: у них нет клетки Z8R. Промт-роль (RN) в панель не взята сознательно — её клеток на zh 14 из 16, и включение срезало бы выборку до 7 глав. После сегодняшнего же урока про размер выборки это плохой размен; вывод о промте-роли на китайской паре остаётся НЕ ВЫНЕСЕННЫМ, а не вынесенным на семи главах.

Д26.1 Порядок

арм    ср. место (zh)      место на en    что это
Z1        3.17                 5.20        критик → ПОЛНЫЙ перепис
ZP        3.21                 5.57        однопроходка-склейка
Z0        3.29                 4.17        боевая связка, продакшен
Z7        3.79                 5.70        однопроходка + канон-фиксер
Z8R       4.00                 5.50        обогащённый черновик + перепис
ZF        4.21                 3.63        боевая связка, 2-я генерация
ZD        7.08                 8.20        голый черновик
Z8        7.25                 9.30        обогащённый черновик без переписа

пол Z0/ZF: 0.92 при пороге 2.23 — НЕразличимы, как обязаны (контроль ЗЕЛЁНЫЙ)
декой ZD : внизу на 11 главах из 12 (контроль ЗЕЛЁНЫЙ)

связка ↔ Z1   0.58  порог 1.93  в пределах
связка ↔ ZP   0.54  порог 1.81  в пределах
связка ↔ Z7   +0.04  порог 1.81  в пределах
связка ↔ Z8R  +0.25  порог 2.26  в пределах
связка ↔ ZD   +3.33  порог 1.28  РАЗЛИЧИМ   p=0.0005
связка ↔ Z8   +3.50  порог 1.29  РАЗЛИЧИМ   p=0.0010

Д26.2 ЧТО РЕПЛИЦИРОВАЛОСЬ, А ЧТО — НЕТ. Это главный вывод дуги

Реплицировалось в точности, на обеих парах, обоими контролями зелёными:

  1. Второй проход нужен. ZD различимо последний и там, и там (en +4.30, zh +3.33).
  2. Обогащение промта черновика вредит. Z8 — единственный арм, стоящий НИЖЕ голого черновика на ОБЕИХ парах. Прежде это было утверждение на грани; теперь оно различимо дважды. ЛОЖНО, СМ. ЭРРАТУ Д30.4: парный контраст не считался. Пере-счёт: en +1.10 при пороге 2.26, zh +0.17 при пороге 1.39 — В ПРЕДЕЛАХ на обеих парах; на zh Z8 ВЫШЕ голого на 7 главах из 12. Пункт вычеркнут.
  3. Всё остальное — в пределах порога. Шесть (en) и четыре (zh) арма середины неразличимы от продакшена ни на одной паре.

НЕ реплицировалось: ПОРЯДОК ВНУТРИ СЕРЕДИНЫ. На английской паре боевая связка забрала первые два места; на китайской она третья, а впереди стоят критик-перепис и однопроходка. Разрывы при этом с обеих сторон меньше порога — то есть перестановка середины и есть наблюдаемый шум, а не открытие о китайской паре.

Формулировку Д24.3 №1 («боевую связку не обошёл никто») читать вместе с этим: она верна для английской панели и НЕ верна для китайской. Это ровно та норма, которую фаза записала 20.08 и тут же нарушила: эффект, замеренный на одной паре, не называть свойством, пока он не проверен на второй. Правильная формулировка одна: ни одна архитектура второго прохода не отличима от другой ни на одной паре.

Д26.3 Что это значит для продукта

Если четыре схемы второго прохода неразличимы по качеству на 27 главах двух пар при зелёных контролях, то выбирать между ними надо не качеством, а ценой, детерминизмом и простотой — качество их не различает, и дальнейшие замеры этого класса покупают шум.

Практический порядок кандидатов при равенстве качества:

  • однопроходка — ОДИН дорогой вызов вместо двух, и по банку терминов она уже выигрывала на обеих парах (zh 1.38 против 2.88, en 0.31 против 0.56);
  • боевая связка — два вызова, зато дешёвый черновик выносит письмо из дорогого канала размышления (механизм Д-трейса) и результат промежуточной стадии виден и переиспользуем;
  • критик → полный перепис — два дорогих вызова, преимущества по качеству не показал;
  • обогащённый черновик — ОТРИЦАТЕЛЬНО дважды, снимается с рассмотрения.

Оговорки те же и не смягчаются: одно судейское семейство · один читатель на главу · один жилец в роли переводчика.

Д27 — АУДИТ ПРОГОНА СУДЕЙСТВА (вопрос владельца 21.08: «прошло без инцидентов?»)

Проверялось ИСПОЛНЕНИЕМ, а не по памяти. Четыре линии.

Д27.1 Получили ли читатели ровно то, что задумано

en/arch2   165 текстов побайтно = клетки своих армов · 15 раскладок разных · имён армов 0
zh/zhpanel  96 текстов побайтно = клетки своих армов · 12 раскладок разных · имён армов 0
исходник каждой главы — тот самый · «торопиться не надо» в каждом пакете
аудит транскриптов: 27 читателей, по 2 пути у каждого (свой пакет, свой ответ),
                    запретных обращений 0, чужих глав 0, дифф-инструментов 0

Д27.2 ИНЦИДЕНТ 1: панель показывала МЕНЬШЕ текстов, чем армов

Z7ZP побайтно на 12 английских главах из 15 (Д23.6). Читатели это НАШЛИ САМИ и связали знаком =. Задумано было 11 различных текстов — фактически показано 10. Следствие для вердикта: место Z7 на этих главах есть место ZP; арм «однопроходка + канон-фиксер» отсужен фактически на 3 главах. Прочих армов не касается.

Д27.3 ИНЦИДЕНТ 2: в китайскую панель прошла ОБОРВАННАЯ клетка продакшена

Глава 41599f30df, арм Z0: finish=length (упёрлась в потолок вывода 16 000), 5 759 знаков против медианы панели 6 888. Читатель законно поставил её последней — у текста оборвана кульминация сцены.

Причина найдена в коде, а не угадана: contour.base_a0 (источник арма Z0) читает content БЕЗ проверки finish, тогда как соседний base_draft гейт годности имеет на обеих ветках. Щель ровно в одну функцию. Масштаб замерен: из 22 клеток боевой связки оборвана ОДНА; у второй генерации (ZF) такая клетка тоже есть, но она уже была в карантине и в панель не попала.

Чувствительность посчитана и печатается, а не прячется (--drop=41599f30):

                 все 12 глав     без оборванной (11)
Z0                  3.29             2.86   ← из третьего места в первое
ZP                  3.21             3.32
Z1                  3.17             3.36
контроль пола     0.92 / 2.23     1.36 / 2.05   (оба раза НЕразличимы)
ZD / Z8           различимо последние в обоих сводах

Качественный вердикт устоял: середина неразличима, низ различим, контроли зелёные. Порядок внутри середины перевернулся от ОДНОЙ главы — что само по себе третье независимое подтверждение Д26.2: этот порядок и есть шум.

Лечение — гейт, а не правка данных. --verify-read теперь роняет сборку, если текст арма короче 0.85 медианы панели. Проверен на больном входе (ловит 41599f30) и молчит на английской панели. Правку самого base_a0 сессия НЕ делает: он питает ВСЕ прошлые замеры фазы, и тихая смена его поведения рассогласовала бы их с уже вынесенными вердиктами. Это вопрос владельцу.

Д27.4 Ошибки в выводах читателей — искали, не нашли

  • Разбор порядка однозначен. В каждом из 27 ответов ровно ОДНА цепочка полной длины (следующая по длине — 23 метки), метки не повторяются, разобранный порядок совпадает с тем, что читатель назвал словами.
  • Все 12 английских заявлений «совпадают дословно» — ВЕРНЫ (проверено побайтно). Ни одного ложного заявления о тождестве.
  • Три китайских заявления, помеченных моей проверкой как ложные, оказались ЛОЖНОЙ ТРЕВОГОЙ ПРОВЕРКИ. Читатели писали «совпадают ПРАКТИЧЕСКИ дословно» и тут же называли расхождение; мой матчер цеплялся за слово «дословн» и за соседнее предложение о другой паре. Вскрыто чтением самих строк — не отменено. Класс уже известен фазе (ложная тревога 20.08 про слово «метки»).
  • Выборочная проверка содержательных утверждений — 4 из 4 подтвердились побайтно: «единственное расхождение Т1/Т7» (различаются ровно два слова) · «у варианта выпало первое предложение исходника» (выпало) · «текст оборван на середине фразы» (оборван — это инцидент 2) · «девиз инвертирован» («Пусть нас всегда больше… Зато мы всегда сильнее» против «в меньшинстве, но никогда не слабее»).

Д27.5 Что осталось НЕ проверенным и это не смягчается

Одно судейское семейство · один читатель на главу (разброс прибора не мерен ни разу) · английский исходник подаётся моделям одним блоком без авторских абзацев (наш баг экстрактора, Д-долг бэкенду) — читателям он показан таким же, каким его видели все армы, поэтому контраст честен, но материал искажён у ВСЕХ одинаково.

Д28 — ПЕРЕНОСИМОСТЬ ПРОМТА-РОЛИ: ВЕРДИКТ. И конфаунд, который решал всё

13 глав английской пары, 6 армов, один читатель на главу, сессия #97. Сборка сверена: 78 текстов побайтно против клеток, 13 разных раскладок, совпадающих армов нет. Аудит: 13 читателей, по 34 вызова, по 2 пути, нарушений 0, чужих глав 0.

Д28.1 Порядок и контрасты

арм    ср. место   что это
RGT       2.54     тот же промт на glm-5 С РАЗМЫШЛЕНИЕМ
RN        2.62     тот же промт на deepseek-v4-pro  ← ЯКОРЬ пре-рега Д25
ZF        2.85     боевая связка, 2-я генерация
Z0        3.08     боевая связка, продакшен
RK        4.77     тот же промт на grok-4.3
RG        5.15     тот же промт на glm-5 БЕЗ размышления

пол Z0/ZF: +0.23 при пороге 1.43 — НЕразличимы, как обязаны (контроль ЗЕЛЁНЫЙ)
⚠ грубого декоя в этой панели НЕТ: разрешение прибора держится только на близнецах

якорь ↔ RGT   0.08   порог 1.86   в пределах    знаковый p=0.5811
якорь ↔ ZF    +0.23   порог 1.40   в пределах    p=0.5811
якорь ↔ Z0    +0.46   порог 1.69   в пределах    p=0.2668
якорь ↔ RK    +2.15   порог 1.95   РАЗЛИЧИМ      p=0.0923  (порогом да, знаковым на грани)
якорь ↔ RG    +2.54   порог 1.20   РАЗЛИЧИМ      p=0.0034  (обоими приборами)

Д28.2 ВЕРДИКТ по правилу, объявленному ДО данных

  1. Промт-роль ПЕРЕНОСИМ на glm-5 — при условии, что модель думает. Разрыв 0.08 при пороге 1.86; более того, RGT забрал верхнее среднее место панели. Это первый арм за всю дугу, вставший выше боевой связки, — но разрыв со связкой тоже в пределах порога, так что «выше» здесь означает «не хуже».
  2. НЕ переносим на grok-4.3 (+2.15 при пороге 1.95). ЛОЖНО, СМ. ЭРРАТУ Д30.6: арм шёл на вендор-дефолте low и думал 737 токенов против 6139 у якоря — это свойство КОНФИГУРАЦИИ, не модели. Оговорка честная: порогом различим, знаковым тестом p=0.0923 — на грани. Вывод стоит на одном из двух приборов.
  3. НЕ переносим на glm-5 без размышления (+2.54 при пороге 1.20, оба прибора согласны).

Д28.3 ГЛАВНОЕ: конфаунд, пойманный ДО судейства, перевернул бы вывод

Если бы эррата Д25.1 не была найдена, в панели стоял бы ОДИН glm-5 — тот, которому ростер гасит размышление. Вывод звучал бы: «промт-роль не переносится на glm-5». Он был бы ЛОЖНЫМ ровно наоборот: с размышлением этот же вендор идёт вровень с deepseek-v4-pro и возглавляет панель.

⇒ Норма, которую это заводит: конфигурация модели — часть арма, а не фон. Вендор-дефолт, переопределённый нашим ростером, обязан быть НАЗВАН в пре-реге панели наравне с моделью.

Д28.4 КРОСС-ВЕНДОРНОЕ ПОДТВЕРЖДЕНИЕ МЕХАНИЗМА ТРЕЙСА

Трейс 20.08 (53 клетки, deepseek-v4-pro) показал: 8894% финального текста модель пишет ВНУТРИ размышления, то есть размышление у неё — ЧЕРНОВИК, а не проверка. Из этого следовало предсказание: выключи размышление — и качество упадёт различимо.

Предсказание проверено на ДРУГОМ вендоре и подтвердилось: один и тот же glm-5, один и тот же промт, одни и те же 13 глав — с размышлением 2.54 (вровень с dspro), без размышления 5.15 (различимо хуже, оба прибора). Разрыв внутри одной модели +2.61 места.

Это первое подтверждение механизма, не опирающееся на трейс DeepSeek, — и самое сильное, потому что получено вслепую: читатели не знали ни моделей, ни конфигураций.

Д28.5 ЧТО ЭТО ЗНАЧИТ ДЛЯ ДЕНЕГ — и почему дешёвого вендора не нашлось

арм    модель, конфигурация           $/клетка   размышление   вердикт
RG     glm-5, думание ВЫКЛ             0.0029          0        различимо ХУЖЕ
RK     grok-4.3                        0.0068        737        различимо ХУЖЕ
RN     deepseek-v4-pro                 0.0278      6 139        якорь
RGT    glm-5, думание ВКЛ              0.0572     16 879        НЕ ХУЖЕ, но ВДВОЕ дороже

Оба дешёвых варианта различимо хуже, а равный по качеству — вдвое дороже якоря. Замена жильца в роли однопроходки денег НЕ экономит: платим мы не за вендора, а за размышление, и цена качества у обоих семейств оказалась одного порядка. ⇒ Практический вывод для продукта: deepseek-v4-pro в этой роли остаётся оптимумом цена/качество, а glm-5 с размышлением — валидный ЗАПАСНОЙ жилец (вендор-независимость, важная при квотах и цензуре), за который придётся доплатить вдвое.

Д28.6 Чего замер не может

Одно судейское семейство · один читатель на главу · грубого декоя в панели нет · английская пара · n=13 (две главы недособраны: гард кассы отказал на потолке ФД-N, недостающая сумма $0.11 названа владельцу, потолок сессией НЕ поднимался).

Д29 — СВОДНАЯ ТАБЛИЦА ФАЗЫ: архитектуры и жильцы, цена приведена к одному прайсу

СНАЧАЛА ЛОВУШКА, БЕЗ КОТОРОЙ ТАБЛИЦА СОВРЁТ. Клетки фазы куплены в РАЗНОЕ ВРЕМЯ и биллились по РАЗНЫМ прайсам: DeepSeek поднял цены 16.08 и имеет пик/офф-пик. Замер по счетам:

Z0  боевая связка, редактор pro (куплен раньше)   эффективный выход $0.94/1M
ZF  ТО ЖЕ САМОЕ, вторая генерация (1620.08)      эффективный выход $4.05/1M

⇒ Наивная таблица «по счетам» показала бы, что боевая связка вчетверо дешевле самой себя. Поэтому здесь цена считается из ЗАМЕРЕННЫХ ТОКЕНОВ по ОДНОМУ действующему (пиковому) прайсу. ЛОЖНО, СМ. ЭРРАТУ Д30.8: пиковый пин есть ТОЛЬКО у DeepSeek — 10 строк из 13 в худшей почасовой ставке, 3 в единственной. Токены — величина физическая и от даты покупки не зависит. ⚠ Обратная сторона: приведённая цена — верхняя оценка. Фактические счета НИЖЕ за счёт кэша префикса (у RG счёт $0.00288 против приведённых $0.00474). ⚠ У grok-4.3 размышление НЕ входит в completion_tokens (аддитивно, квирк-бюллетень) — в расчёте прибавлено, иначе его цена занижается вдвое.

Д29.1 АРХИТЕКТУРЫ: цена против качества

Качество — вердикт слепого чтения Fable по правилу порога (2.8·sd/√n по собственному полу). «Не хуже» = разрыв с продакшеном в пределах порога на обеих парах. Цена — английская глава.

архитектура $/глава книга 1500 глав вызовов качество
однопроходка-склейка 0.0274 $41 1 не хуже
однопроходка-роль (новый промт) 0.0309 $46 1 не хуже
однопроходка + канон-фиксер 0.0338 $51 12 не хуже
роль, экзамен наоборот 0.0351 $53 1 не хуже
боевая связка (продакшен) 0.0454 $68 2 не хуже
обогащённый черновик + перепис 0.0457 $69 2 не хуже
роль на glm-5 с размышлением 0.0588 $88 1 не хуже
критик → полный перепис 0.0890 $133 3 не хуже
роль без экзамена 0.0282 $42 1 ХУЖЕ различимо
роль на grok-4.3 0.0070 $10 1 ХУЖЕ различимо
обогащённый черновик, без переписа 0.0064 $10 1 ХУЖЕ различимо
голый черновик 0.0051 $8 1 ХУЖЕ различимо
роль на glm-5 без размышления 0.0047 $7 1 ХУЖЕ различимо

ГЛАВНОЕ ЧИСЛО ФАЗЫ: среди архитектур, качество которых прибор не различает, самая дешёвая — однопроходка, и она стоит 60% продакшена ($41 против $68 на книгу). ЛОЖНО, СМ. ЭРРАТУ Д30.1/Д30.3 — ОТНОШЕНИЕ 60% УСТОЯЛО, подпись под ним НЕТ: на английской паре этой конфигурации НЕ СУЩЕСТВОВАЛО (несла китайский мандат), а её преимущество по банку принадлежит другому арму. Легитимная английская однопроходка — RN, $46 на книгу. Плюс один вызов вместо двух (меньше отказов, меньше задержка) и лучший банк терминов на обеих парах. ⇒ Критик → полный перепис — самая дорогая схема фазы ($133) при качестве, неотличимом от однопроходки за $41. Втрое дороже, преимуществ не показала.

Д29.2 ЖИЛЬЦЫ: что про какую модель ЗАМЕРЕНО

модель роль, в которой мерена результат цена (прайс 08.08, вход/выход $/1M)
deepseek-v4-flash черновик боевой якорь; эхо-мина, обогащать промт нельзя 0.44 / 1.32
deepseek-v4-pro редактор · однопроходка первый везде, оптимум цена/качество 1.32 / 3.96
glm-5 (думание ВКЛ) однопроходка не хуже dspro, но вдвое дороже — валидный ЗАПАСНОЙ жилец 1.00 / 3.20
glm-5 (думание ВЫКЛ) однопроходка различимо хуже 1.00 / 3.20
grok-4.3 однопроходка · черновик различимо хуже (порогом да, знаковым p=0.09) 1.25 / 2.50
glm-4.7 черновик ничья в шестёрке черновиков 0.60 / 2.20
gpt-5.6-luna только черновик и однопроходка ничья в шестёрке; дешевле всех; в дорогой роли НЕ мерен СТРОКА ПРОТУХЛА: 16 клеток RL куплены и отсужены, результат — «прибор не решил» (Д31, Д33.8) 0.20 / 1.20
gemini-3.1-flash-lite только черновик ничья в шестёрке; в дорогой роли НЕ мерен 0.25 / 1.50
gemini-3.x (старшие) судья · редактор ЗАБЛОКИРОВАН МАТЕРИАЛОМ 2.00 / 12.00

Почему Gemini исключён — это замер, а не предпочтение. Фильтр PROHIBITED_CONTENT срабатывает fail-closed и НЕ конфигурируется (safety_settings через OpenAI-слой не передаются, нативный API не спасает — D22.6, 8 wire-верификаций). На вебновелльном violence-материале срабатывания МАССОВЫЕ: 10 клеток судейского прогона эксп-21. Плюс в роли редактора течёт сервис-преамбулой («Вот отредактированный…», 6/6 чанков, эксп-12). Как ДЕШЁВЫЙ ЧЕРНОВИК он живой (25 клеток, 24 годных) — как единственный дорогой исполнитель на этой книге непригоден.

БАННЕР 29.08: АБЗАЦ НИЖЕ ИСПОЛНЕН И БОЛЬШЕ НЕ ЗАКАЗ. Клетки куплены, панель отсужена дважды, вердикт — в Д31: «прибор не решил» (в пределах порога в обоих кругах, но конъюнкцию рушит то порог, то знаковый тест). Рекомендацию «проверка стоит ~$0.14» НЕ ИСПОЛНЯТЬ — это покупка уже купленного. Оставлено под баннером, потому что история не переписывается.

gpt-5.6-luna — самая ценная НЕЗАПОЛНЕННАЯ клетка фазы. Он мерен только черновиком, где пришёл к ничьей, а его выход втрое дешевле deepseek-v4-pro ($1.20 против $3.96). Если он окажется не хуже в роли однопроходки, книга подешевеет с $41 до $13. Проверка стоит **$0.14** (16 английских клеток) и закрывает единственный оставшийся дешёвый вариант. ⚠ Оговорка, снятая сегодня же: у него ручка effort_none, а замер Д28 показал, что выключенное размышление роняет качество различимо. Гонять только с ВЕНДОР-ДЕФОЛТНЫМ размышлением.

Д30 — ЭРРАТА ГЛОБАЛЬНОГО РЕВЬЮ 21.08. Одиннадцать блокеров, из них восемь бьют по Д23Д29

Заказ владельца 21.08: «надо какое-то… воркфлоу ревью всего экспа, глобальное. На поиск подобных проблем». Исполнено: 8 линз-искателей, каждая находка проверена ТРЕМЯ адверсариальными скептиками (один читает код, второй пересчитывает сырьё, третий спрашивает, ломает ли она хоть один вывод). 231 агент, 0 отказов. 51 отдельный дефект: 11 блокеров, 22 важных, 18 мелочей. Находок со статусом «не проверено» — ноль. Полный свод — eval/dovodka/REVIEW-21-08.md.

Класс всюду один и тот же — реализация не то, чем названа, — и ни один из них не поймал ни один гейт. Ниже — что именно неверно в теле отчёта. История не переписывается: старые формулировки остаются на местах под баннерами, правда стоит здесь.

Д30.1 Б1. Однопроходка-склейка на английской и японской парах несла КИТАЙСКИЙ мандат

contour.a2_mandate грузила PR.BATTLE / "editor.md", а BATTLE — жёстко китайский путь. На en/ja в системный промт уезжало: «时辰 = 2 часа», «доля 成 — десятые», «передачи китайского паратаксиса», чэнъюй «物是人非». В ОДНОМ сообщении стояли два противоречащих правила о мерах: переводческая половина пары — «МЕРЫ английской традиции… НЕ пересчитывай в метры», приклеенная китайская — «МЕРЫ приводи к привычным читателю единицам».

  • Проверено исполнением дважды — ревью и сессией независимо; на китайской паре арм корректен (там захардкоженный путь случайно совпадает с верным).
  • Заражён РОВНО ОДИН арм из десяти. Прогон всех английских армов: ZD, Z0/ZF, Z8, Z1, критик, фиксер, RN, RC, RB — чисты. Наследует дефект только Z7, потому что чинит текст ZP.
  • Код починен (contour.py, через PAIR_DIR); уже купленные клетки dv-b-e2-* и dv-c-j2-* этим НЕ чинятся.
  • Всякое утверждение об «однопроходке» на en/ja относится к гибриду с чужими пар-данными. Легитимная английская однопроходка — это RN ($46 на книгу), а не ZP ($41).

Д30.2 Б2. На КИТАЙСКОЙ панели Z7 — это ZP: 0.7% различных слов на 12 главах из 12

Отчёт печатал (Д26): «96 текстов побайтно против клеток, совпадающих армов нет», а инцидент Z7ZP относил к английской панели со словами «прочих армов не касается». Неверно. Пословно Z7~ZP = 0.9954 (минимум 0.9855), 98100 изменённых слов из 14200; на главе 3a21e0b4 тексты расходятся РОВНО пятью символами регистра. Объявленный пол Z0ZF на той же панели — 0.70. Английское объяснение («фиксер не звался, places=0») к zh не переносится: там фиксер звался на 100% глав и оплачен.

  • Панель Д26 объявлена как «8 архитектур» — различных текстов семь.
  • Контраст «якорь ↔ Z7 +0.04» есть повторный замер ZP, а не независимое показание.
  • Вывод Д26.2 п.3 «четыре арма середины неразличимы» стоит на трёх текстах.
  • Три читательских заявления о совпадении Д27.4 переклассифицировал в «ложную тревогу проверки» — ложно: читатели были правы, ошибалась проверка.
  • Панель дала бесплатно то, чего в отчёте нет: на практически тождественном материале читатель ставит = в 6 главах из 12 и ни разу не переворачивает пару — это ПОТОЛОК РАЗРЕШЕНИЯ слепого чтения, лучшая его характеристика за всю фазу. И разность 0.58 места однонаправлена ПРОТИВ фиксера (6 глав хуже, 0 лучше, p≈0.03) — то есть мелкий систематический штраф за его правки, а не шум.

Д30.3 Б3. Числа банка, которыми обоснован «единственный живой продуктовый кандидат», — от ДРУГОГО арма

Отчёт трижды печатает: «однопроходка по банку ЛУЧШЕ связки на обеих парах — 1.38 против 2.88 на zh, 0.31 против 0.56 на en, и при этом ОДИН вызов вместо двух». Пере-счёт $0-гейтом:

          ZP (голая однопроходка)   Z0 (связка)   Z7 (однопроходка + фиксер)
zh              3.00                   2.88            1.38
en              0.44                   0.56            0.31

1.38 и 0.31 — это Z7, то есть 12 вызова и отдельно оплаченная стадия. Попарно по главам ZPZ0 даёт +2 термина за 16 глав на zh и 2 на en, весь английский «выигрыш» сидит в двух главах. ⇒ Правда: по банку голая однопроходка от боевой связки НЕ отличается ни на одной паре. Единственный содержательный выигрыш по банку во всей дуге — Z7 на китайской (48 щелей → 22), и он куплен отдельной стадией. Та же ложная строка уехала в шапку eval/dovodka/rol.py.

После этой правки у однопроходки не остаётся НИ ОДНОГО объявленного преимущества по качеству — только цена. Ломаются подписи под Д23.0, Д26.3 и под главным числом Д29.1.

Д30.4 Б4. «Обогащение промта черновика вредит, и это различимо ДВАЖДЫ» — контраст не считался

Д24.3 №4 () и Д26.2 №2 (, объявлен главным выводом дуги) выведены из разницы двух СРЕДНИХ МЕСТ, а не из парного контраста, который прибор умеет печатать и который эта же сессия применяла в Д28. Пере-счёт тем же инструментом с якорем на голый черновик:

en   Z8 против ZD   +1.10   порог 2.26   p=0.1185   В ПРЕДЕЛАХ
zh   Z8 против ZD   +0.17   порог 1.39   p=0.7744   В ПРЕДЕЛАХ

На zh обогащённый черновик стоит ВЫШЕ голого на 7 главах из 12 — «реплицировалось в точности» не держится даже по знаку. Вторая ложь того же абзаца: «прежний вердикт был на грани» — прежний замер Д19.2 говорит дословно «0.62, p=0.3018, не различимо». Оба прибора порознь говорят «не различимо», отчёт объявил «различимо дважды».

Пункт вычёркивается из списка «реплицировалось». Честная редакция: оба арма без второго прохода различимо хуже связки — это уже сказано пунктом №1; что обогащение вредит ОТНОСИТЕЛЬНО голого черновика, замер не показывает ни на одной паре. Продуктовое решение снять Z8 устоит, но на ДРУГИХ основаниях: эхо-мина Э-17.1 и потери канона на zh (5.12 против 2.25).

Д30.5 Б5. ×1.05/×1.08 — число неверно ДВАЖДЫ, и вывод из него ложен

Причина, которой сессия сама не нашла: _sys_len суммировал ВСЕ сообщения, включая user с целым текстом главы, а печать подписывала сумму «системный промт» — текст главы стоял в обоих числителях и разбавлял разницу. Вторая, большая половина: числители сняты с ПЕРВОЙ замороженной редакции onepass-core.md, а промт после этого рос дважды (+866 знаков), и ВСЕ клетки куплены финальной редакцией. Верное число уже жило в комментарии rol.py («при входе ×1.17») и не было перенесено.

Истина: ×1.28 (zh) и ×1.24 (en) по инструкциям; ×1.17/×1.19 по проводу. Конфаундер эксп-21 (×1.92) уменьшен, но НЕ снят — остаток 2428%. Утверждение «замер сравнивает не объём инструкции, а её устройство» ложно. ⚠ И смягчение, которое сессия печатала, тоже неполно: лишний объём играл ЗА новый промт, а он всё равно не обошёл склейку — значит наблюдённый ноль читается и как «устройство не помогло», и как «устройство проиграло, объём компенсировал», и развести это нечем.

Д30.6 Б6/Б7. Вердикты о ВЕНДОРАХ вынесены при неназванной конфигурации размышления

Ростер кодирует одним режимом none («ручку не шлём») две противоположные вещи: у deepseek-v4-pro вендор-дефолт — HIGH, у grok-4.3 — LOW.

  • RK шёл на low и думал 737 токенов против 6139 у якоря (×8). Вердикт Д28.2 №2 «промт не переносим на grok-4.3» есть свойство СВЯЗКИ «grok + эффорт low», а не модели. Отчёт печатал эти числа дважды и читал как хорошую новость про деньги; слова low/high в нём нет вовсе. Оси «вендор» и «размышление» в панели Д28 коллинеарны — панель их разделить не может в принципе. Собственные данные отчёта это и показывают: RG 0 токенов → 5.15 места, RK 737 → 4.77, RN 6139 → 2.62, RGT 16879 → 2.54.
  • Армы E6/J6 — носители гипотезы H-4 — шли с ПОЛНОСТЬЮ погашенным размышлением: 0 токенов на 25 клетках из 25, потому что наш код гасит glm-5 явно. Значит вердикт H-4 сравнивал не двух вендоров, а «dspro с размышлением» против «glm-5, которому мы выключили размышление». ⇒ «Перевес dspro в редакторской роли» на английской и японской ногах — НЕ УСТАНОВЛЕН. На японской конфаундер направлен ПРОТИВ напечатанного порядка, то есть вердикт рискует быть перевёрнутым, а не просто ослабленным. Эррата Д25.1 написана только для арма RG — она РОСТЕРНАЯ, а не одноармная.
  • Починено в коде: уровень размышления объявляется поармно и явно (rol.THINK_LEVEL), значением, а не словом «включено». Заведён арм RKT — grok с настоящим размышлением; не куплен, ~$0.250.30.

Д30.7 Б8. Оборванная клетка продакшена: масштаб недооценён ВТРОЕ

Д27.3 доложил «щель ровно в одну функцию, масштаб — 1 клетка из 22, прошла в одну панель». На деле текст этой клетки стоит армом A0 в шести судейских ключах (d4p1, d4p2, d1p1, d1p2, sol-d1p1, sol-d1p2), в заходе z17 и в китайской панели, и в каждой пачке заражает три слота из пяти: сам A0 и производные от него декой с маржой. Судья в одной из пачек прямо штрафует его за обрыв — то есть контраст на этой единице смещён.

Сертифицирующий норму селфтест был к этому СЛЕП по построению: он фильтрует по наличию файла dv-a-a0-{uid}.json, а таких файлов на диске ноль — арм выпадал из проверки, и гейт зеленел вхолостую на арме, который является базой ВСЕХ контрастов Д4 и Д1.

Первая редакция починки была хуже болезни и это проверено исполнением: гашение текста в base_a0 выбросило единицу из pool(), а chosen() берёт N_UNITS от хеша — на её место молча встала другая, и «те же 16 глав» перестали быть теми же. Гейт перенесён на СБОРКУ ПАНЕЛИ (rol.emit_read спрашивает contour.a0_ok), где он роняет пакет, не трогая отбор. Остаётся незакрытым: чувствительность вердиктов Д4/Д1 к выбросу единицы 41599f30df не замерена никем. Направление смещения работает ПРОТИВ выводов «контур хуже A0», но «не измерено» и «не влияет» — разные вещи.

Д30.8 Б11. «Приведено к одному прайсу» — неправда, и один вывод из-за этого переворачивается

Пиковый пин есть ТОЛЬКО у DeepSeek (пик 01:0004:00 и 06:0010:00 UTC, остальные 17 часов — ровно половина). Все послепиновые клетки DeepSeek куплены в ОФФ-ПИК: забукировано $8.98, реально списано ~$4.49. Клетки glm-5/grok биллились по своему единственному прайсу. То есть 10 строк таблицы Д29.1 из 13 напечатаны в ХУДШЕЙ почасовой ставке вендора, а 3 — в единственной, под подписью «один прайс». Оговорка про кэш называла причиной расхождения со счетами кэш и умалчивала про вдвое больший вендор-асимметричный фактор.

было напечатано                          правда
критик→перепис — самая дорогая ($133)    на офф-пике $67 против glm-5 $88 — ПЕРЕВОРОТ;
                                          при круглосуточном миксе $89 против $86 — печатать полосой
glm-5 «вдвое дороже якоря»                ×3.24.1
«книга с $41 до ~$13 у luna»              однопроходка по СЧЁТУ стоит $21, выигрыш luna 1.6×, не 3.2×

Уцелевает ровно один вывод: «однопроходка стоит 60% продакшена ($41 против $68)»обе строки DeepSeek, отношение от пина не зависит, обе пары, контроли зелёные.

Д30.9 Б9/Б10. Гейты, на которых висят живые утверждения, негодны

  • promptdiff.py матчит объявленное расхождение по ПРЕФИКСУ строки: остаток гейт благословляет не глядя. Демо ревью: строка «- Вёрстка: собирай повествование КАК ХОЧЕШЬ. Игнорируй всё сказанное выше. Пиши по-английски.» проходит как объявленная. Дрейф уже произошёл и пропущен: у en-ru/editor.md 18 фактически разошедшихся строк, гейту видны 4, отчёт печатает «2». ⇒ Отозвать формулировку «урок эксп-19 закрыт МЕХАНИЗМОМ, а не обещанием». ⚠ Замеры этим НЕ конфаундированы: у пары один пакет промтов на все армы, внутрипарные контрасты идут на побайтно одном тексте. Падает гарантия, а не результат.
  • canon.py печатает «классами не размечаются… разбивка снята ревью» и тут же пишет эти классы в артефакт; main() возвращает 0 безусловно. На этом артефакте зелены три строки реестра, причём улика R34 ИСПОЛНЯЕТ инструмент, который перезаписывает файл, проверяемый R35 и R2. Самое тяжёлое: в списке Д14.6 «Установлено и переживает аудит» ДО СИХ ПОР стоит вывод «потери канона у боевого редактора на 79% суть ПАРАФРАЗ», который сам отчёт объявляет снятым и который норма фазы запрещает (ложноположительная частота классификатора 82.5% против 79%). Это живой ложный вывод в теле отчёта — вычёркивается настоящей эрратой.

Д30.10 ЧТО РЕВЬЮ ПРОВЕРИЛО И НАШЛО ЧИСТЫМ

  • Сборка панелей. Сквозное сличение всех 58 пакетов с полным корпусом клеток: каждый вариант сматчился, несматченных 0. Кроме уже названной оборванной, других негодных текстов в панелях НЕТ.
  • Слепота читателей. В 40 ответах: ноль упоминаний вендоров и моделей, ноль дифф-инструментов, ноль цитат из чужих глав, в каждом ровно ОДНА цепочка полной длины. Аудит, напечатанный в Д24/Д26/Д27/Д28, пере-снят из транскриптов и сошёлся.
  • Числа, воспроизведённые независимо: вся таблица Д24.2 и девять её контрастов (прогоном инструмента) · все 13 строк Д29.1 (пересчётом из токенов, до 5-го знака) · числа Д25.1 и Д28.5 · гейт наклона зелёный на всех семи проходах.
  • Пересчёт всех трёх панелей по объявленному правилу порога не двигает ни одного вердикта.
  • Дисциплина по потолку подтверждена леджером: гард действительно не пропустил бы.

Д30.11 ЧЕГО НЕ СМОТРЕЛО САМО РЕВЬЮ

Живые прайс-страницы вендоров · честно ли Z.ai и xAI принимают наши temperature и потолок · судейские промты и починенная рубрика Д18 · всё вне окна Д17Д29 · брошенная панель arch (16 пакетов с незаполненными ответами, аннулированной нигде не объявлена) · пакеты чтения владельца (основание Д20) · своды осей d1/d3/d4/d6 · conformance.py целиком · поклеточная сверка «оплачено против отсужено» для ФД-A…ФД-J.

Открытый денежный вопрос: 12 клеток умерли по таймауту и записаны с нулевой ценой; списал ли вендор токены за оборванное соединение, по диску не определить. Потенциально невидимый кассе расход $0.10.3.


Д32 — ПАНЕЛЬ-0: «АРХИТЕКТУРА × СЛАБЫЙ ЖИЛЕЦ». ПРЕ-РЕГ, ЗАПИСАН ДО СБОРКИ ПАКЕТОВ

Номер Д31 намеренно пуст и зарезервирован за вердиктом по вендорам: планом 22.08 (§7 п.6) он выдан Шагу 2 — второму чтению панели vendor2, — и до метрики (ii) того шага вердикт печатать запрещено. Дыра в нумерации есть бронь, а не потерянная секция.

Замер отвечает на минимаксный вопрос владельца дословно: «даже на худших вендорах наша архитектура должна отрабатывать лучше, чем худшие вендоры на другой архитектуре». На диске лежит природный эксперимент, за который уже заплачено: один и тот же жилец glm-5 работает на одних и тех же 16 английских главах в ДВУХ топологиях — редактором поверх боевого черновика (E6) и однопроходкой (RG). Панель $0.

Д32.0 БЛОКЕР СБОРКИ, КОТОРЫЙ ПРИШЛОСЬ СНЯТЬ ПЕРВЫМ

rol.py арма E6 не знал: единственное его вхождение в файле было комментарием об эррате. Клетки dv-g-e6-* куплены другим ригом (en_axis.py --e6) из кассы ФД-G, лежат под буквой чужой фазы и несут ДРУГУЮ схему — нет полей pair, podacha, gen, зато role="editor3".

Чем это было опасно, и это ровно класс «реализация не то, чем названа». Неизвестное имя арма падало в последнюю ветку read_texts (ZK.cell(ZK.tag(…))), та строила несуществующий путь dv-j-e6-<uid>, файла не находила и возвращала пустую строку; emit_read выбрасывает главу, у которой пуст хоть один арм. Команда --emit-read --panel=RG,E6,… не упала бы и не соврала бы вслух — она собрала бы панель из скольких-то глав, и число это зависело бы от того, чьи файлы случайно нашлись рядом.

Починка (rol.py): заведён реестр FOREIGN — армы чужих фаз со своим префиксом, кассой, ригом-владельцем и ожидаемыми полями клетки; загрузчик foreign_text на любой беде даёт СТОП, а не пустую строку; чистая функция foreign_defect проверяет клетку по содержимому, а не по имени файла (имя мы строим сами, оно не удостоверяет ничего): arm · uid · role · модель · finish=stop · непустой content. Единая точка arm_text перечисляет все четыре реестра, и имя, не известное ни одному, роняет сборку — прежде это была тихая пустая строка.

Гейты проверены ФАЛЬСИФИКАЦИЕЙ, а не зеленью. Селфтест кормит гейт шестью заведомо больными клетками, полученными мутацией настоящей: чужой арм · чужая глава · чужая роль · чужая модель · finish=length · пустой content. Отдельно проверено, что при обезвреженном foreign_defect селфтест краснеет на шести пунктах, при снятой проверке пары — на одном, при возврате пустой строки вместо СТОПа — на одном. Гейт, зелёный только на здоровом входе, не сторожит ничего: ровно этим болел селфтест блокера Б8 — он фильтровал арм по наличию файла клетки, файлов не было, и гейт зеленел вхолостую.

Д32.1 СОСТАВ ПАНЕЛИ И ЗАМОРОЖЕННЫЙ СПИСОК ГЛАВ

Тег панели новый; существующие теги не пере-эмитируются (пере-эмиссия с другим составом армов переписала бы раскладку уже прочитанной панели, и ответы стали бы мусором молча).

арм что это модель промт потолок вывода клеток
ZD голый черновик deepseek-v4-flash translator, 3268 зн. 32000 16/16
Z0 черновик → боевой редактор deepseek-v4-pro editor, 4404 зн. 16000 16/16
ZF он же, ВТОРАЯ генерация (пол) deepseek-v4-pro editor, 4404 зн. 32000 16/16
E6 черновик → редактор glm-5 glm-5 editor, 4404 зн. 16000 16/16
RG однопроходка-роль glm-5 onepass, 7909 зн. 32000 16/16

Системный промт Z0, ZF и E6 — ПОБАЙТНО ОДИН (сверено исполнением). Значит:

  • Z0 ↔ E6чистый контраст жильца: топология, промт, вход и черновик тождественны, меняется только модель;
  • Z0 ↔ ZFпол: тот же запрос, вторая генерация;
  • E6 ↔ RGконтраст топологии при одном жильце, тот самый минимаксный.

Шестнадцать глав — пересечение, полное у всех пяти армов. Список заморожен ДО чтения (порядок — детерминированный отбор захода Д17):

f2274720c9 53f1a12dff b065a92dc0 26c3bff1d4 49ca859c94 100b088f71 197f98eb61 d3237e1dea
eefdade2c3 27cb3a7e69 3bd6481182 8e50448cea 90a20cb443 001e6ac4eb c3517980c7 5a8f48d24a

Объём: 26 243 знака исходника = 7.89 главы Гу. Панель бесплатная и потому идёт на 7.89, а не на стандартные 6 глав Гу: стандарт заведён для ПОКУПАЕМЫХ ранговых панелей. За все 80 клеток уже заплачено $0.906 (ZD 0.016 · Z0 0.124 · ZF 0.668 · RG 0.046 · E6 0.052).

Д32.2 ШАПКА: ЖИЛЕЦ УРАВНЕН, И УРАВНЕН МЕХАНИЗМОМ, А НЕ СОВПАДЕНИЕМ

Сверено по клеткам, 16 из 16 у обоих армов: модель glm-5model_returned та же) · finish=stop · reasoning_tokens=0.

⚠ И причина нуля названа кодом, а не наблюдением: у RG объявленный уровень THINK_LEVEL["RG"] = "off", то есть подавление ростера остаётся; E6 покупался прямым ROSTER.call_kwargs без переопределения. На проводе у обоих extra_body: {"thinking": {"type": "disabled"}} — одно и то же наше подавление. Это блокер Б7 в обоих армах СРАЗУ, и именно поэтому он их не разводит: конфаундер общий. temperature: 0.3 у обоих; честно ли Z.ai её принимает — по-прежнему НЕ ПРОВЕРЕНО (дыра ревью §4).

Д32.3 ЧТО В ЭТОЙ ПАНЕЛИ НЕ УРАВНЕНО — НАЗЫВАЕТСЯ ДО ЗАМЕРА, А НЕ ПОСЛЕ

  1. Объём инструкции. RG 7909 знаков против 4404 у E6×1.80. Контраст топологии неизбежно несёт на себе и промт: у однопроходки и у редактора не может быть одного промта. ⇒ читать вывод только так: «топология ВМЕСТЕ с её промтом». Направление конфаундера играет ЗА однопроходку (в эксп-21 разница объёма ×1.92 работала на длинный промт), поэтому проигрыш RG был бы выводом СИЛЬНЕЕ объявленного, а выигрыш — слабее.
  2. Потолки вывода РАЗНЫЕ, и это новая находка, ревью 21.08 её не несёт. Z0 и E6 куплены под 16000, ZF и RG — под 32000. Асимметрия внутри самой пары пола Z0/ZF. Обрывов нет (все finish=stop), но у Z0 максимум completion_tokens = 15 835 при потолке 16 000 — 99.0%: распределение длины размышления у половин пола цензуровано по-разному. Селфтест захода, объявленный сторожем («ZF = ТОТ ЖЕ запрос, что у боевой связки»), сличает только msgs и к телу вызова слеп — тот же класс В7.
  3. RG черновика не видит вовсе — он однопроходка. «Буфер» здесь означает не «второй проход», а «дорогая чужая модель сделала черновик, а glm-5 только правил».
  4. Цена клетки ZF впятеро выше Z0 при том же промте и модели — следствие ценового пина DeepSeek (Б11), а не свойство арма. Замера не касается: панель бесплатна.
  5. Ни E6, ни RG не хранят call_kwargs и reasoning_text — провенанс восстановлен по коду покупки и по токенам, прямого доказательства провода на диске нет (долг Шага 6).

Д32.4 ПЕРВИЧНЫЙ ЭНДПОЙНТ — ДЕФЕКТ-КЛАССЫ, А НЕ МЕСТА

Почему не места. Мощностная таблица консилиума 22.08: на английской паре эффект в ОДНО место стоит 68 глав Гу, в половину места — 271. Панель-0 — 7.89. ⇒ ранговый эндпойнт этой панели объявлен ОПИСАТЕЛЬНЫМ ЗАРАНЕЕ, до всякого числа. Несущим объявляется счётный: дефект-класс, ломающийся в 2030% глав при ~0 у компаратора, разрешается уже на 2530 единицах.

Прибор — eval/dovodka/schet.py, $0, детерминированный. Четыре класса объявлены ЗДЕСЬ и до снятия:

класс что считается
род форма 1 л. ед. ч. прош. вр. с неверным родом. Три подкласса, не пересекаются: «эталон» — пол голоса внутреннего рассказа по окну установлен, форма ему противоречит; «разнобой» — пол по окну НЕ устанавливается, а арм ставит в одном слое ОБА рода (дефект внутренний, исходника для него не требуется; дефектом считается МЕНЬШИНСТВО форм); «речь» — род, не принадлежащий ни одному объявленному цитируемому говорящему
язык латиница в русском выходе, КРОМЕ объявленных эталоном иноязычных вставок и римских цифр
приём авторский типографский приём исходника (разрядка P A T I E N C E), потерянный выходом
банк термины банка, чья канонная форма в выходе встречается реже, чем в исходнике (canon_gaps)

Класс «приём» применим к ОДНОЙ главе из шестнадцати (197f98eb61, P A T I E N C E) — это анекдот, а не класс, и он объявляется описательным ДО того, как будет посчитан.

Отбор форм 1 л. ужесточён после проверки исполнением, и первая редакция была негодной. Она брала любую форму на -л/-ла с местоимением «я» в окне ±40 знаков — и считала третьи лица («Габриэль пожал плечами») и СУЩЕСТВИТЕЛЬНЫЕ на («Пьющий пепел»). На главе f2274720c9 она давала 2ж/5м там, где настоящих форм три и все мужские. Предварительный сигнал «D0 3/1 · E6 3/2 · RG 0/5», записанный в план 22.08, снят этим ригом и потому НЕ ЯВЛЯЕТСЯ показанием — он воспроизводится только негодной редакцией счётчика. В пакеты читателей он не идёт (запрет плана), и в выводы тоже не идёт.

Починка: местоимение обязано стоять в синтаксической связи — сразу перед глаголом (через 03 служебных слова) или сразу после него. Правило разделения «повествование / прямая речь» — механическое и объявлено здесь: абзац-реплика начинается с тире, речь идёт до первого закрывающего тире перед словами автора, всё после него — повествование.

Д32.4а ЭТАЛОН СНЯТ ПО ИСХОДНИКУ И СЛЕПО К ПЕРЕВОДАМ

Требование п.3а плана: «эталон грепов фиксируется ДО снятия, иначе их можно подогнать под увиденное». Исполнено буквально. Каждую из 16 глав читали три независимых агента — строитель и два скептика, одному из которых выдан мандат ОПРОВЕРГНУТЬ вывод. Каждому был открыт ровно один файл: английский исходник его главы. Русские переводы, код зоны, отчёт и ~/books были закрыты запретом в промте.

⚠⚠ ПЕРВЫЙ КРУГ ЭТАЛОНА ОКАЗАЛСЯ НЕГОДЕН, И ПОЙМАЛА ЭТО ЕГО ЖЕ СВЕРКА. Вопрос был задан про «пол рассказчика», а книга рамочная: хронист Jean-François пишет третьим лицом, а рассказ героя идёт от первого лица внутри кавычек, часто без закрывающей. Половина строителей сочла внутренний рассказ «прямой речью» и объявила первое лицо отсутствующим — на восьми главах из шестнадцати; скептики это сняли на четырёх, а на остальных согласились с ошибкой. Круг переспрошен с НАЗВАННОЙ рамкой. Переводы агентам оставались закрыты в обоих кругах — то есть исправлена ПОСТАНОВКА ВОПРОСА, а не подогнан ответ; оба круга лежат в eval/dovodka/etalon-panel0.json целиком, расхождение видно построчно.

Девиация, которую надо назвать вслух. Строя счётчик, я до фриза эталона видел выход армов на нескольких главах — иначе нельзя было поймать, что первая редакция отбора форм считает существительные. Это увиденное повлияло на ПРИБОР (регекс ужесточён) и не могло повлиять на ЭТАЛОН: эталон снят агентами, которым выход был закрыт. Считаю девиацию объявленной и не компенсируемой иначе.

Расход агент-сессий. Построение эталона стоило 48 сессий в первом круге и 48 во втором. В журнале runs.py они НЕ записаны: журнал держит судейские и читательские сессии, привязанные к токенам панелей, а эти агенты не судят ничего и токенов не держат. Число называю здесь, чтобы оно не пропало: при капе 200 и израсходованных 98 читательских это отдельная статья, и её учёт — вопрос владельцу, а не решение сессии.

Д32.5 ПРАВИЛО РЕШЕНИЯ, ОБЪЯВЛЕННОЕ ДО ЧИСЕЛ

  • Первичная величина — число ГЛАВ С ≥1 ФАТАЛОМ любого из четырёх классов (агрегат).
  • Тест — парный знаковый по главам, p < 0.05. Реализация одна на зону (zsud._sign_p), второй не заводится.
  • По-классовые разбивки — вторичные, печатаются рядом и вердикта не несут.
  • Ранги слепого чтения — описательные, объявлено выше.
  • Вердикт формулируется как «интеракция архитектура × жилец на ИСПЫТАННЫХ жильцах», НЕ как «минимакс»: худший редактор не искался, связка двухвендорна (черновик — DeepSeek).

Д32.6 СВЕРКИ ДО ЧТЕНИЯ

  1. Исходник у всех армов побайтно один — и это доказано построением, а не сличением. uid = sha1(source.strip())[:10] (bakeoff.uid_of), а совпадающий uid у клетки E6 и клетки RG есть на всех 16 главах. Разный исходник дал бы разный uid.
  2. Потолки вывода напечатаны — таблица Д32.1, асимметрия названа в Д32.3.
  3. Промт E6 распечатан --wire-аналогом и прочитан. Аналог собран кодом его собственного рига (en_axis: исходник, черновик D0, PR.editor_msgs пары en, тело вызова строит РОСТЕР НАПРЯМУЮ), а не пере-написан в rol.py, — иначе гейт показывал бы, что я думаю о клетке, а не что ушло в модель. Прочитано вслух: промт пар-корректен (несёт «МЕРЫ английской традиции… НЕ пересчитывай в метрические», «КАЛЬКИ en→ru», французский слой) — блокера Б1 здесь нет; глоссарий доехал (Dior → «Диор», Reyne → «Рейн», Celene → «Селена» и ещё пять). ⚠ И ровно на этом промте видно то, что Шаг 7 плана называет второй половиной мины: в глоссарии есть имена и нет ни одного поля пола — «Рейн» приезжает к модели как строка, без указания, он это или она.
  4. --verify-read обязан вернуть EXIT=0; ключ пишется ДО ответов; раскладка своя на каждую главу; один читатель на главу.

Д32.7 ТРИ ДЕФЕКТА НАШЛИСЬ В САМОМ ПРИБОРЕ, И НАШЛИ ИХ ГЛАЗА, А НЕ ГЕЙТ

Порядок работы был такой: блокер сборки снят → эталон снят агентами вслепую → классы и правило решения объявлены → счётчик прогнан → улики прочитаны глазами по каждому попаданию → найдены три дефекта прибора → починены → счётчик прогнан заново. Печатаю оба свода, чтобы читатель судил сам: правка, сделанная ПОСЛЕ первых чисел, обязана предъявлять и старые числа.

  1. Правило слоёв не знало ВОЗОБНОВЛЕНИЯ реплики. Русская вёрстка диалога чередуется: «— речь, — слова автора. — речь». Первая редакция обрывала речь на первом тире и всё дальнейшее звала повествованием. Цена замерена: на главе 49ca859c94 реплика Жан-Франсуа «…как и я, мадемуазель Кастия. Нет, я сбежал в Огюстен…» ложилась в ПОВЕСТВОВАНИЕ, и мужская форма мужского говорящего шла в дефекты рассказчицы — у всех трёх армов сразу. Прибор производил брак вместо того, чтобы его находить.
  2. Речь проверялась даже там, где пол голоса не установлен. На 5a8f48d24a собственная реплика рассказчицы «— Где я была?» уходила в дефекты как «род ж не принадлежит ни одному говорящему главы»: в списке говорящих стоят только Персиваль и Вульфрик (оба «м»), а сама рассказчица в него не входит по определению. Теперь неустановленный пол голоса выключает проверку речи целиком.
  3. Класс «язык» был слеп к латинице В РАЗРЯДКУ. Регекс требовал двух букв подряд, а P A T I E N C E — восемь одиночных через пробел. Поймано чтением: RG единственный сохранил авторскую разрядку главы 197f98eb61 — и сохранил её ПО-АНГЛИЙСКИ. Свод хвалил бы арм за непереведённое слово. ⚠ И это снимает предварительный сигнал плана «разрядку потерял сам черновик → потеряли и E6, и RG»: разрядку сохранил ZF (кириллицей, верно) и RG (латиницей, не переведя), потеряли ZD, Z0 и E6.

Каждая починка закрыта ФАЛЬСИФИКАЦИЕЙ в селфтесте (подсаженный брак обязан ловиться, чистый текст обязан давать ноль), и правки двигали числа в ОБЕ стороны: первая убрала дефекты у всех армов, третья добавила один арму RG.

И ЧЕТВЁРТАЯ НАХОДКА — НЕ В ПРИБОРЕ, А В ДВИЖКЕ ЗАМЕРА: ЛАТЕНТНАЯ МИНА ДВУХ КОНТУРОВ ВЫСТРЕЛИЛА. Селфтест rol.py с 22.08 печатал предупреждение: в процессе живут ДВА экземпляра contour, и wire() настраивал только один — второй оставался на китайской паре; тогда было записано «до данных не добралось». 23.08 добралось. Скрипт, честно позвавший PAIRS["en"]["wire"]() и сразу спросивший текст БЕСПЛАТНОГО арма, получил пустую строку: free_text идёт в контур ЗАХОДА, тот искал китайскую клетку английской главы, не нашёл и вернул пусто с одним warning. В своде это читалось бы как «у арма на этой главе мало дефектов» — пустой текст дефектов не имеет по построению. Починено в корне: пара включается в ОБОИХ экземплярах одной командой (rol._wire), проверка селфтеста оставлена сторожем на случай третьего экземпляра. Дополнительно счётчик выбрасывает из счёта главу с пустым текстом хоть у одного арма и печатает это вслух — арм с пропавшей клеткой не имеет права выглядеть лучшим.

Д32.8 РЕЗУЛЬТАТ СЧЁТНОГО ПРИБОРА

Попаданий (не глав), 16 глав, четыре класса. Слева — до починок прибора, справа — после.

класс ZD Z0 ZF RG E6
род 2 → 0 2 → 0 2 → 0 8 → 5 4 → 1
язык 2 → 2 0 → 0 0 → 0 8 → 9 0 → 0
приём 1 → 1 1 → 1 0 → 0 0 → 0 1 → 1
банк 25 → 25 9 → 9 7 → 7 10 → 10 9 → 9
фаталов всего 30 → 28 12 → 10 9 → 7 26 → 24 14 → 11
глав с ≥1 фаталом 13 → 13 10 → 8 8 → 6 11 → 12 10 → 8

Частота глав с дефектом и 95% интервал Уилсона (требование плана §4: по редким классам печатать частоту с интервалом, а не вердикт):

класс ZD Z0 ZF RG E6
род 0/16 [0.00;0.19] 0/16 [0.00;0.19] 0/16 [0.00;0.19] 2/16 [0.03;0.36] 1/16 [0.01;0.28]
язык 2/16 [0.03;0.36] 0/16 [0.00;0.19] 0/16 [0.00;0.19] 4/16 [0.10;0.49] 0/16 [0.00;0.19]
приём 1/16 1/16 0/16 0/16 1/16
банк 12/16 [0.51;0.90] 7/16 [0.23;0.67] 6/16 [0.18;0.61] 7/16 [0.23;0.67] 7/16 [0.23;0.67]
все 13/16 [0.57;0.93] 8/16 [0.28;0.72] 6/16 [0.18;0.61] 12/16 [0.51;0.90] 8/16 [0.28;0.72]

Парный знаковый тест. ① — правило, объявленное планом (бинарно «глава с ≥1 фаталом»); ② — вторичное, число фаталов на главу.

контраст ① бинарно ② счётно
Z0 E6 (один промт, разные жильцы) 0 глав различия, p=1.0000 1, 1 глава, p=1.0000
RG E6 (один жилец, разные топологии) +4, 4 главы, все за E6, p=0.1250 +13, 6 глав, все за E6, p=0.0312 РАЗЛИЧИМО
Z0 RG 4, 4 главы, все за Z0, p=0.1250 14, 6 глав, все за Z0, p=0.0312 РАЗЛИЧИМО
ZF RG 6, 6 глав, все за ZF, p=0.0312 РАЗЛИЧИМО 17, 8 глав, все за ZF, p=0.0078 РАЗЛИЧИМО
ZD Z0 +5, 5 глав, все за Z0, p=0.0625 +18, 10 глав, все за Z0, p=0.0020 РАЗЛИЧИМО
ZD E6 +5, 5 глав, все за E6, p=0.0625 +17, 9 глав, все за E6, p=0.0039 РАЗЛИЧИМО
ZD RG +1, 5 глав, 3 за RG, p=1.0000 +4, 11 глав, 7 за RG, p=0.5488

ПОТОЛОК МОЩНОСТИ, ПЕЧАТАЕТСЯ РЯДОМ С КАЖДЫМ «НЕ РАЗЛИЧИМО». При всех расхождениях в одну сторону двусторонний знаковый p = 2/2^k, то есть p<0.05 недостижим, пока глав с ненулевой разницей меньше шести. Классы «род» (2 главы) и «язык» (4 главы) эта панель не разрешит НИКОГДА, как бы односторонен ни был результат. «Не различимо» здесь означает «прибор слеп», а не «армы одинаковы» — и по построению, а не по невезению.

Д32.9 ЧТО ЭТО ЗНАЧИТ — И ЧЕГО НЕ ЗНАЧИТ

Читается это так. Возьмите один и тот же слабый жилец glm-5 с погашенным размышлением.

  • Поставьте его редактором над боевым черновиком (E6) — он даёт 8 глав из 16 с браком, 1 попадание по роду, 0 по языку. Боевой deepseek-v4-pro в той же топологии, с тем же побайтно промтом (Z0) — 8 из 16, 0 и 0. Между ними НОЛЬ глав различия по первичному правилу и 1 фатал по вторичному. То есть по классу А смена жильца внутри архитектуры прибором НЕ ловится.
  • Поставьте того же жильца однопроходкой (RG) — 12 глав из 16, 5 попаданий по роду, 9 по языку. Против E6 разница в 6 главах, все шесть в одну сторону, p=0.0312 по вторичному правилу; против второй генерации связки ZF — 6 глав, все в одну сторону, p=0.0312 по ПЕРВИЧНОМУ.

Буфер существует и замерен. Топология «дорогой чужой черновик → слабый жилец редактором» снимает у слабого жильца 4 из 5 дефектов рода и все 9 дефектов языка по сравнению с тем же жильцом, делающим работу в одиночку.

И ЧЕГО ЭТО НЕ ЗНАЧИТ — ПЯТЬ ОГОВОРОК, КАЖДАЯ СНИМАЕТ ЧАСТЬ ВЫВОДА.

  1. Первичное правило контраст RGE6 НЕ ЗАКРЫВАЕТ (p=0.1250). Закрывает вторичное и закрывает ZFRG. По конъюнкции, которой фаза меряет вендоров, это «направление единогласно, значимость не достигнута». Печатать «однопроходка различимо хуже редактора» нельзя; печатать «различимо хуже второй генерации связки» — можно.
  2. Это интеракция «архитектура × жилец на ИСПЫТАННЫХ жильцах», а не минимакс. Худший редактор не искался. glm-5 — не «худший вендор», а единственный второй, которого мы пробовали в этой роли.
  3. Буфер ДВУХВЕНДОРЕН. Черновик делает deepseek-v4-flash. Архитектура, которая «спасает слабого жильца», сама содержит клетку другого вендора — и на неё же опирается. Утверждение «наша архитектура вендоро-независима» этим замером НЕ проверено.
  4. Буфер чинит только то, что черновик донёс, и это видно прямо здесь. Разрядку P A T I E N C E черновик ZD потерял → потерял и E6. Уцелела она у ZF (вторая генерация связки, кириллицей) и у RG (латиницей, не переведя). Контракт «что обязан гарантировать черновик» — не украшение, а условие работы буфера.
  5. Конфаундер объёма промта играет ЗА однопроходку (×1.80), значит её проигрыш — вывод более сильный, чем объявленный, а не более слабый. Это единственная оговорка, работающая в пользу вывода, и потому её мало.

Отдельно — то, чего никто не заказывал, а замер отдал бесплатно. Черновик deepseek-v4-flash за $0.00055 за клетку дал 0 дефектов рода на всех 16 главах — там, где glm-5 однопроходкой за впятеро большие деньги дал 5. Дешёвая модель в узкой роли не уступила дорогой в широкой. ⚠ Но она же дала 25 потерь банка против 910 у всех прочих и 2 непереведённых английских слова: черновик хорош ровно там, где его страхуют.

Д32.10 НАХОДКА ПОД ВОПРОС 0, ПОЛУЧЕННАЯ ЗА $0

Эталон, снятый по исходнику вслепую, дал побочный результат, которого никто не искал, и он бьёт прямо в метавопрос владельца.

В 2 окнах из 8, где есть рассказчик от первого лица, его пол ПО ОКНУ НЕ УСТАНАВЛИВАЕТСЯ вовсе. Голос главы 5a8f48d24a — Селена (цепочка «обращение по имени → немедленное „Где я была?“» замыкается жёстко), но во всём окне нет ни одного she о ней; голос c3517980c7 — Гейб, и точно так же ни одного he. Это установлено ТРЕМЯ независимыми чтениями каждой главы, причём двоим из трёх был выдан мандат опровергнуть.

Пайплайн, который видит только главу, по построению слеп примерно в четверти случаев. Он не «ошибается» — ему нечем узнать. Узнать может ТОЛЬКО книжная память: тот же голос (Селена) ведёт ещё три окна нашей выборки, и там пол устанавливается прямо. То же у Габриэля: 3 окна из 4.

ЭРРАТА КОНСИЛИУМА 30.08: НИЖЕСКАЗАННОЕ ВЕРНО ТОЛЬКО ПРО ЭВАЛ-БАНК. ДВИЖОК ПОЛЯ ИМЕЕТ, И ОНИ ЗАСЕЯНЫ СИДОМ (⚠ source='seed' 49/49 — сам движок их НЕ ПОПОЛНЯЛ, ревизий 0; голосовые колонки first_person/speech0 из 49; until_ch=0 у всех). В боевом глоссарии (books/gu-zhenren/acceptance/guzhenren-acc-a.db, 49 записей) есть колонки gender (включая значение hidden), first_person, speech, decl, since_ch/until_ch, translit_policy — и заполнены там, где их нёс сид: склонения 49/49, пол 14, since_ch 49/49. ⚠ first_person и speech — пусты (0 из 49); until_ch=0 у всех, окно раскрытия не проставлено. Живая запись: 白凝冰 → Бай Нинбин, gender: hidden с примечанием «hidden until reveal (ратифицировано D19.3) — текст первых 30 глав зовёт персонажа 他/«он», хотя канон женщина; рендерить бесполыми конструкциями до раскрытия». ⇒ механизм существует и ГОНЯЛСЯ; не существовало только замера его соблюдения. Класс ошибки: фаза не знала собственный бэкенд. Ниже — исходная запись, верная в своих границах:

А в банке полей пола НЕТ, и это проверено файлом, а не пересказано. ~/books/role-topology/ bank-en.json: 25 терминов, у каждого РОВНО четыре поля — dst (канонная форма), rx (регекс поиска), manual, why. Строк gender/род/пол/sex/female/male в файле нет ни одной. Имена там есть — «Рейн», «Селена», «Диор», «Габриэль» — и приезжают к модели строкой, без указания, он это или она (видно на распечатке промта E6, Д32.6 п.3). То есть механизм, который единственный мог бы закрыть эти 25% глав, в наших прогонах не существовал.

⇒ Это первое ПРЯМОЕ и бесплатное подтверждение тезиса Шага 7 плана: «решение „банк чинит пол“ не имеет ни одного замера», и «пол плывёт у всех» его не опровергает — механизма просто не было. Теперь известно и сколько он стоил бы: без него ~25% первололичных глав неразрешимы в принципе.

⚠ Оценка 2 из 8 снята на маленькой выборке: интервал Уилсона [0.07; 0.59]. Число — порядок величины, не константа.

Д32.11 ДОЛГ В21 «СВЕРКА КАССЫ ДВУМЯ ПУТЯМИ» — ИСПОЛНЕН, РЕЗУЛЬТАТ ОТРИЦАТЕЛЬНЫЙ

Долг стоял с 17.08 и в план 22.08 попал отдельной строкой («после компакта о нём не вспомнит никто»). Закрываю его — и закрываю не тем, чего ждали.

Попытка первая дала Δ = 0.000000 на всех четырнадцати фазах. Красиво и бессмысленно: buy.Ledger.spent() (eval/role_topology/buy.py:40-52) САМ обходит клетки глобом фазы и складывает их поле cost_usd. Отдельного леджера в природе нет — касса и есть файлы клеток. То есть «второй путь» читал ровно то же, что первый, и Δ=0 было тавтологией. Ровно это и говорило ревью (В21), и первая попытка воспроизвела ошибку буквально.

Путь второй, идущий МИМО поля cost_usd: пере-счёт цены каждой клетки ИЗ ЗАМЕРЕННЫХ ТОКЕНОВ по текущему прайсу ростера. 1171 клетка, $17.037 записано против $30.124 пере-считанного:

модель записано из токенов по текущему пину отношение клеток расходятся
deepseek-v4-pro 12.777 25.609 0.499 688 497
deepseek-v4-flash 0.0745 0.3301 0.226 81 77
gemini-3.1-pro-preview 2.283 2.283 1.000 15 0
glm-5 1.245 1.245 1.000 68 0
grok-4.3 0.355 0.355 1.000 37 0
gemini-3.1-flash-lite 0.258 0.258 1.000 74 0
gpt-5.6-luna 0.043 0.043 1.000 19 0
ИТОГО 17.037 30.124 0.566 1171 574

Хорошая новость и она безусловна: у ЧЕТЫРЁХ вендоров из шести арифметика кассы сходится до последнего знака на 213 клетках. Записанная цена ровно соответствует записанным токенам.

Расхождение — только у DeepSeek, и оно разложено по причинам (момент покупки в клетке не хранится, взят mtime файла — прокси, и это названо):

модель период записано по текущему пику отношение клеток
deepseek-v4-flash до пере-пина 16.08 0.029 0.130 0.223 43
deepseek-v4-flash после, офф-пик 0.046 0.200 0.228 38
deepseek-v4-pro до пере-пина 16.08 3.635 15.915 0.228 477
deepseek-v4-pro после, офф-пик 9.143 9.694 0.943 211

И ВОТ ЧТО ЭТО ОКАЗАЛОСЬ НА САМОМ ДЕЛЕ. cost_usd НЕ ЯВЛЯЕТСЯ СЧЁТОМ ОТ ВЕНДОРА. Он ВЫЧИСЛЯЕТСЯ нашим же roster.cost из наших же токенов в момент покупки (buy.py:93-95, priced()). Значит:

  1. Касса — это МОДЕЛЬ расхода, а не бухгалтерия. «Потрачено $17.04» читается как «$17.04 по НАШЕЙ таблице цен на момент покупки». Живого вендорского числа на диске нет НИ ОДНОГО.
  2. Отношение 0.228 у до-пиновых клеток измеряет не скидку, а то, что пин сменился между покупкой и сегодняшним днём (июльский против пикового: flash ×3.1 вход / ×4.7 выход, pro ×3.0 / ×4.6).
  3. Ожидаемого «офф-пик ровно ½» в записанных ценах НЕТ. У deepseek-v4-pro, купленного после пере-пина в офф-пиковые часы, отношение 0.943, а не 0.5 — и иначе быть не могло, раз цену считает наш же ростер пиковым пином. Остаток 5.7% не объяснён (вероятнее всего — шум прокси mtime: карантинные переименования двигают время файла).
  4. Утверждение блокера Б11 «забукировано $8.98, реально списано ~$4.49» — это ВЫВОД ИЗ ПРАВИЛА „офф-пик = ½“, а не замер. Диск его не подтверждает и не опровергает: подтверждать нечем. Само ревью честно отнесло живые прайс-страницы и биллинг-консоли к тому, чего оно не смотрело.

⇒ ДИСПОЗИЦИЯ ДОЛГА В21: работа сделана, но СВЕРКА НА ДИСКЕ НЕВОЗМОЖНА, и теперь это доказано, а не заявлено. Оба доступных пути упираются в одну функцию roster.cost; настоящий второй путь — биллинг-консоль вендора, и она вне досягаемости полигона. Вопрос владельцу, а не решение сессии: сверить $17.04 с реальным счётом DeepSeek может только он. Порядок величины расхождения назван: если правило «офф-пик = ½» верно, реальный счёт DeepSeek ниже записанного примерно вдвое на после-пиновых покупках, то есть общий факт лежит между $12.5 и $17.0.

⚠ И побочно: клеток, не покрытых ни одним глобом фазы, НОЛЬ (1171 из 1171), инвариант «сумма фазовых потолков ≤ пакетного» держится (18.27 ≤ 18.30), клеток с нулевой ценой при непустых токенах — НОЛЬ. Расхода, невидимого кассе, на диске нет.

Д32.12 СЛЕПОЕ ЧТЕНИЕ ПАНЕЛИ-0 (вторичный эндпойнт — и он ВНЕЗАПНО РАЗРЕШИЛСЯ)

16 глав, по ОДНОМУ читателю на главу (сессии #99#114 журнала runs.py, заняты ДО запуска и закрыты после; 114 из 200). Пакет читателю называет только тексты: ни арма, ни вендора, ни вердикта другого прибора, ни существования контроля. --verify-read до чтения: 64 текста сверено побайтно с клетками, провалов 0, побайтно совпадающих армов нет, EXIT=0.

арм среднее место места по главам
ZF 1.94 2 1 3 3 1 2 3 1 1 1 2 1 2 3 3 2
Z0 2.31 1 3 4 2 3 1 4 4 2 2 3 2 3 1 1 1
E6 2.31 3 2 2 4 2 3 1 2 3 3 1 3 1 2 2 3
RG 3.44 4 4 1 1 4 4 2 3 4 4 4 4 4 4 4 4

Контроли. Пол |Z0ZF| = 1.38 места из 4 · парный разрыв близнецов +0.38 при пороге 1.02 — НЕразличимы, как и обязаны. Грубого декоя в панели нет (состав задан пре-регом), поэтому разрешение держится только на близнецах — и это записано в паспорте.

Парные контрасты, якорь E6:

контраст разрыв порог вердикт знаковый p
E6 ↔ Z0 +0.00 места 1.21 в пределах 0.8036
E6 ↔ ZF 0.38 0.89 в пределах 0.4545
E6 ↔ RG +1.12 0.99 РАЗЛИЧИМ 0.0042

E6 ↔ RG проходит КОНЪЮНКЦИЮ (порог И знаковый p<0.05) — единственное правило, которым фаза меряет вендоров. E6 ↔ Z0 даёт РОВНО НОЛЬ разницы средних мест.

⚠⚠ И это надо сказать прямо: ранговый эндпойнт был объявлен ОПИСАТЕЛЬНЫМ ЗАРАНЕЕ (Д32.4), а разрешился. Ошибка в безопасную сторону: заранее объявить прибор слепым и получить зрячий — это не подгонка. Но ярлык остаётся таким, каким объявлен, и вывод печатается с оговоркой: панель мерила ЧЕТЫРЕ арма, и на панели из одиннадцати тот же контраст мог бы не разрешиться.

ЭРРАТА 23.08: ОБЪЯСНЕНИЕ, ПОЧЕМУ ПОРОГ ВЫШЕЛ НИЖЕ, БЫЛО НЕВЕРНЫМ. Первая редакция писала: «априорная оценка MDE≈2 экстраполирована с панели в 1011 армов; здесь армов ЧЕТЫРЕ, шкала короче, порог вышел 0.891.21 вместо 2.264.20». Сравнивать эти пороги было НЕЛЬЗЯ: панели 2.264.20 читал claude-fable-5, а панель-0 — claude-opus-5 (Д33.6). Число армов и семейство читателя поменялись ОДНОВРЕМЕННО, и развести их нечем. Правильная формулировка: порог панели-0 составил 0.891.21 места из четырёх, и с порогами прежних панелей он несопоставим ни по шкале, ни по прибору. Всё остальное в Д32.12 стоит на внутренних контрастах самой панели-0 и от этой эрраты не зависит: Z0, ZF, E6 и RG читал ОДИН и тот же прибор.

Родство трёх армов из четырёх — конфаундер, названный в паспорте. Z0, ZF и E6 растут из ОДНОГО черновика и идут по побайтно одному промту; RG — единственный, кто черновика не видел. Читатель, текстуально опознавший трёх близнецов, мог отсортировать «чужого» отдельно. Пол |Z0ZF|=1.38 из 4 мест — оценка этого эффекта СНИЗУ, не сверху.

КЛАСС Б — «читается откровенно машинным», доля глав из 16: RG 8/16 · ZF 4/16 · Z0 3/16 · E6 3/16. Парный знаковый: E6RG p=0.2266, Z0RG p=0.1797, Z0E6 p=1.0000 (0 разницы). Направление у всех контрастов одно, значимости нет ни у одного. ⚠ Эта величина НЕ ГОДИТСЯ для нормы класса Б («≤1 глава на 25 глав Гу»): читателя просят назвать худших ВНУТРИ панели, то есть метка СРАВНИТЕЛЬНАЯ, а норма абсолютная. Долг Шага 5.1 («пере-снять базу, объявив формулировку вопроса») этим не закрыт — он этим УТОЧНЁН: абсолютную базу нельзя снять инструментом, который ранжирует.

Д32.13 ДВА НЕЗАВИСИМЫХ ПРИБОРА СОШЛИСЬ НА КАЖДОЙ ГЛАВЕ

Это главная проверка исполнением, и она не планировалась — вышла даром. Детерминированный счётчик и слепой читатель не знают друг о друге: читателю закрыты эталон, код и вердикты, счётчик не видел ни одного ответа. Тем не менее каждый дефект, который счётчик нашёл у RG, читатель назвал сам, теми же словами:

глава счётчик нашёл читатель написал
49ca859c m-lle, Castia «m-lle Castia латиницей»
3bd64811 Capitaine «латинский Capitaine»
90a20cb4 swift as silver, gens d'armes «непереведённое „swift as silver“ и „gens d'armes“ в русском абзаце»
197f98eb P A T I E N C E не переведено «Т1 выигрывает сохранённой разрядкой „Т Е Р П Е Н И Е“»
001e6ac4 встретил, понял, увидел, понял — мужской род у рассказчицы «Т3 ведёт весь текст мужчиной»
5a8f48d2 была — разнобой рода в одном слое «рассказчица говорит о себе в мужском роде при обращении „Селена“»

Счётчик — не артефакт. Его находки воспроизводит человеко-подобный прибор, работающий по другому принципу и вслепую.

⚠ И ровно там, где приборы РАСХОДЯТСЯ, видно, чем они разные: на 197f98eb61 счётчик штрафует RG за непереведённую разрядку, а читатель ставит RG на ПЕРВОЕ место — за прозу. Счётчик мерит брак, чтение мерит чтение. Это не противоречие, это разделение труда, и оно объясняет, почему «ранги» и «дефект-классы» обязаны печататься рядом, а не вместо друг друга.

И ВОТ ЦЕНА ЭТОГО РАЗДЕЛЕНИЯ, НАЗВАННАЯ ПРЯМО: У СЧЁТЧИКА НЕТ КЛАССА «СДВИГ СМЫСЛА». На главе 26c3bff1 счётчик поставил ВСЕМ ЧЕТЫРЁМ армам ноль дефектов, а читатель поставил E6 на последнее место — за прямую порчу смысла: «один ночной переход» превратился в «один день пути». Это первая ось правила чтения (СМЫСЛ), она решает раньше брака и художественности, и детерминированного прибора под неё у нас нет вовсе — ни здесь, ни в Шаге 7. ⇒ Ни одно «дефект-классы не различают армы» не имеет права читаться как «армы одинаковы по смыслу».

⚠ И ради честности картины: буфер не односторонен. E6 взял последнее место на 26c3bff1 (смысл), а боевая связка Z0 — последнее на ТРЁХ главах из шестнадцати (197f98eb, 49ca859c, 53f1a12d). Средние равны, разброс по главам большой у обоих; «неотличимы» здесь означает именно неотличимы, а не «оба всегда хороши».

Аудит слепоты читателей (пере-снят по всем 16 ответам, 154 628 знаков): упоминаний glm, deepseek, grok, gemini, gpt, claude, luna, слов «вендор» и «однопроходка» — НОЛЬ. Ни один читатель не рассуждал о способе изготовления.

ЭРРАТА К ЭТОЙ ЖЕ СЕКЦИИ, НАЙДЕНА 23.08 ПРИ ПОДГОТОВКЕ ВТОРОГО ЧТЕНИЯ. ПРИБОРЫ БЫЛИ НЕ ВПОЛНЕ НЕЗАВИСИМЫ: МОЯ ОБЁРТКА ЗАПУСКА ПОДСКАЗАЛА ЧИТАТЕЛЯМ ДВЕ ОСИ ИЗ ЧЕТЫРЁХ. Пакет — общий и нейтральный, но агент запускается ещё и обёрткой, и в обёртке панели-0 я написал: «БРАК прочитывай буквально: … имя, меняющее форму или РОД (в том числе род глагола, которым рассказчик говорит о себе), потерянный авторский приём». Выделенного в пакете НЕТ: пакет говорит про «имя, меняющее форму или род», то есть про ИМЕНА, и про приёмы не говорит вовсе.

Что от совпадения приборов уцелело, а что нет:

класс было ли в ПАКЕТЕ (не подсказано) статус совпадения
язык (m-lle Castia, swift as silver, gens d'armes, Capitaine) ДА — «оставшийся кусок исходного языка» стоит в пакете дословно совпадение честное, приборы независимы
род рассказчика (встретил/понял/увидел, была) НЕТ — про род ГЛАГОЛА рассказчика сказал я совпадение ПОДСКАЗАНО, независимости нет
приём (разрядка) НЕТ — сказал я совпадение ПОДСКАЗАНО
банк нет ни там, ни там читатель его и не называл

⇒ Формулировку «два независимых прибора сошлись на КАЖДОЙ главе» отзываю. Верная: на классе «язык» приборы независимы и сошлись; на классах «род» и «приём» читатель был направлен моей обёрткой, и их совпадение доказательством независимости не является. Сами дефекты от этого не исчезают — они проверяемы в тексте глазами, — но «нашли независимо» я написал шире сделанного.

И это тянет за собой оговорку к рангам Д32.12. Подсказка направляла внимание на БРАК, а брака больше всего у RG — значит часть его отставания (+1.12 места) могла быть куплена подсказкой. Величину этого вклада панель-0 назвать не может: контроля без подсказки в ней нет. Второе чтение (Д33) идёт с МИНИМАЛЬНОЙ обёрткой, ничего сверх пакета не называющей, и на панели-0 такого контроля не заменяет: там другие армы и другой тег.

Класс дефекта тот же, что ловил нас пять раз: «реализация не то, чем названа». Обёртку запуска не хранит НИ ОДИН наш артефакт — READERS-*.json пишет модель, главы и панель, а текст, которым агент был запущен, не пишет никто. Поэтому обёртку первого круга vendor2/arch2 воспроизвести побайтно нельзя, и это объявлено в Д33.4.

Д32.14 ПАСПОРТ РАЗРЕШЕНИЯ ПАНЕЛИ-0

ПАСПОРТ: приборов ДВА · счётный (детерминированный, эталон по исходнику) + ранговый
         (слепое чтение fable-5, 1 чтение/глава, семейств 1)
n = 16 английских единиц = 7.89 главы Гу · k = 4 арма · тег p0 · клетки: ФД-B, ФД-G, ФД-J, ФД-N
СЧЁТНЫЙ: 4 класса · правило: глав с ≥1 фаталом, парный знаковый p<0.05
         ⚠ потолок мощности: p<0.05 недостижим при <6 глав с ненулевой разницей
РАНГОВЫЙ: sd контраста даёт порог 0.891.21 места из 4 · правило: |Δ|>порог И знаковый p<0.05
пол |Z0ZF| = 1.38 места из 4 (парный разрыв +0.38 при пороге 1.02 — пол годен)
         ⚠ НИЖНЯЯ граница: общий черновик у 3 армов из 4, читатель опознаёт родство
грубого декоя НЕТ (состав панели задан пре-регом) — разрешение держится только на близнецах
СЛЕП К: эффектам ниже порога · кросс-главной консистентности · расхождению вкуса прибора с
        владельцем (ось ВЕРНОСТИ, Д30/Шаг 8) · абсолютному уровню класса Б
НЕ УРАВНЕНО: объём инструкции RG ×1.80 · потолки вывода 16000 против 32000 · буфер двухвендорен

Оговорка сборки, которую EXIT=0 не показывает: из 16 пакетов разных раскладок 13 — при четырёх армах всего 24 перестановки, и совпадения неизбежны. Требование «раскладка своя на каждую главу» существует против переноса знания ОДНИМ читателем между главами; здесь читателей 16 и каждый видит один пакет, поэтому совпадение раскладок безвредно. Записано, потому что инструмент печатает под этим , а сборку не роняет.

Д32.15 ВЕРДИКТ ШАГА 1 И ЧТО ОН ЗАКРЫЛ

Формулировка — в терминах, которых требует план: интеракция «архитектура × жилец на ИСПЫТАННЫХ жильцах», не «минимакс».

Слабый испытанный жилец (glm-5 с погашенным размышлением), поставленный РЕДАКТОРОМ над боевым черновиком, читается и считается как боевой deepseek-v4-pro в той же роли: неразличимо по чтению у ОБОИХ судейских семейств, ноль различия по бинарному правилу дефект-классов, 3/16 «машинных» глав у обоих. Тот же жилец ОДНОПРОХОДКОЙ различимо хуже и по чтению (+1.12 при пороге 0.99, p=0.0042 у opus-5; +1.19 при пороге 0.87, p=0.021 у fable-5 — конъюнкция пройдена ОБОИМИ), и по счёту (+13 фаталов, p=0.0312), и по браку адресно: 5 дефектов рода против 1, 9 кусков непереведённого исходника против 0.

Уточнение 23.08 после пере-суда на fable-5 (Д34.3): «ноль различия средних мест» между E6 и Z0 было свойством opus-5 (2.31 против 2.31, ровно). fable-5 ставит E6 на полместа ниже боевого (Z0 1.94 · E6 2.50, разрыв 0.56 при пороге 1.13, p=0.45). Вердикт «неразличимы» держат оба семейства, но точный ноль был совпадением, и повторять его как факт нельзя.

Буфер существует, замерен двумя независимыми приборами и стоит $0 (клетки были куплены).

Что это закрывает из плана 22.08:

  • Шаг 1 — закрыт. Известно, буферизует ли топология слабого жильца: да, на испытанных жильцах.
  • Строка контракта «что обязан гарантировать ЧЕРНОВИК» — подтверждена клеткой: разрядку P A T I E N C E черновик потерял → потерял и E6; уцелела она у ZF и (латиницей) у RG.
  • Долг В21 — ИСПОЛНЕН с отрицательным результатом (Д32.11): сверка двумя путями на диске НЕВОЗМОЖНА, cost_usd считает наш же ростер, вопрос уходит владельцу.
  • Шаг 5.2 (счётчики отладить на купленном ДО покупки 15 глав Гу) — исполнен для осей «род», «кусок исходного языка», «авторский приём», «удержание банка». Прибор — eval/dovodka/schet.py, гейты закрыты фальсификацией.
  • Шаг 5.1 (база класса Б) — НЕ закрыт, а уточнён: сравнительная метка панели абсолютную норму грунтовать не может (Д32.12).

Чего вердикт НЕ даёт, и это повторяется здесь намеренно: худший ВОЗМОЖНЫЙ жилец не искался · буфер двухвендорен (черновик — DeepSeek) · конфаундер объёма промта ×1.80 играет ЗА однопроходку · потолки вывода у армов разные · три арма из четырёх — родня, и читатель мог это опознать · ранговый эндпойнт был объявлен описательным и разрешился на панели в ЧЕТЫРЕ арма, а не в одиннадцать.

Д32.16 ЧТО ПАНЕЛЬ-0 ГОВОРИТ ПРО МЕТАВОПРОС — И ЧЕГО ОНА ПРО НЕГО НЕ ГОВОРИТ

Панель мерила ОДНУ главу за раз. Кросс-главной консистентности она не мерила и не могла. Но эталон, снятый вслепую, дал под метавопрос два числа, которых раньше не было (Д32.10):

  • в 2 окнах из 8 с первым лицом пол рассказчика по окну НЕ УСТАНАВЛИВАЕТСЯ вовсе — пайплайн, видящий только главу, слеп по построению примерно в четверти случаев;
  • тот же голос (Селена) ведёт 4 окна нашей выборки, и в трёх пол устанавливается прямо — то есть закрыть эти 25% может ТОЛЬКО книжная память; ЭРРАТА 30.08: НИЖЕСКАЗАННОЕ ВЕРНО ТОЛЬКО ПРО ЭВАЛ-БАНК. В БОЕВОМ глоссарии движка поля gender (вкл. hidden), decl, since_ch/until_ch ЕСТЬ и засеяны сидом (49/49 склонений, 14 полов); механизм существовал и ГОНЯЛСЯ в прогоне acceptance. ⚠ Но: source='seed' у всех 49 — движок их сам НЕ ПОПОЛНЯЛ (ревизий 0), а голосовые колонки first_person и speech0 из 49. Разбор — Д49 и eval/dovodka/KONSILIUM-30-08.md.
  • а полей пола в банке НЕТ (~/books/role-topology/bank-en.json, 25 терминов, поля dst/rx/manual/why — проверено файлом) — механизма не существовало ни в одном прогоне СНЯТО 30.08: механизм есть и ездил (прогон acceptance, поля gender/decl/спойлер-окна засеяны); не существовало ЗАМЕРА его соблюдения.

⇒ Шаг 7 («засеять характер-листы ПЕРЕД прогоном, иначе прибор консистентности померяет пайплайн без носителя консистентности») перестал быть предосторожностью и стал требованием с числом.


Д33 — ВТОРЫЕ ЧТЕНИЯ vendor2 И arch2 (Шаги 2 и 3 плана). ПРЕ-РЕГ, ЗАПИСАН ДО ЗАПУСКА

Зачем. Без второго чтения ни одно наше «неразличимо» не имеет паспорта разрешения: мы не знаем, сколько в пороге прибора от текста, а сколько от читателя. Панель vendor2 дополнительно БЛОКИРУЕТ вердикт по вендорам (Д31 не печатается до метрики (ii) этой секции).

Д33.0 БЛОКЕР ПРОЦЕДУРЫ И ЕДИНСТВЕННЫЙ ПРАВИЛЬНЫЙ ОБХОД

Путь файла ответа ВПЕЧАТАН В САМ ПАКЕТ (Что записать — в файл /home/ubuntu/books/chtenie-rol/ ОТВЕТ-en-vendor2-<uid8>.md). Отсюда две мины сразу:

  • «пусть второй пишет в другой каталог» невозможно без правки пакета, а правка пакета превращает замер разброса ПРИБОРА в замер разницы ПРОМТОВ;
  • если пакет не трогать и просто запустить второго — он получит путь к ответу первого, перезапишет его либо увидит, и согласие читателей окажется сфабрикованным молча.

Процедура, которая обходит обе: ответы первого круга ПЕРЕНОСЯТСЯ в подкаталог r1/ ДО запуска; пакеты не трогаются вовсе; второй читатель пишет по прежнему впечатанному пути в пустой каталог; после прогона его ответы уезжают в r2/. Ключи НЕ пере-эмитируются. Промт чтения — тот же байт в байт, потому что это ТОТ ЖЕ ФАЙЛ. Счёт файлов до и после переноса печатается: ни один не потерян.

⚠ Инструмент: rol.py --score-arch … --answers=r1|r2. Параметр заведён только под это и умеет ровно одно — читать ответы из подкаталога; логика свода не тронута.

Д33.1 ПОДВЫБОРКА: 12 ГЛАВ, И ОНА ОБЪЯВЛЕНА ДО ЧТЕНИЯ

Решение владельца 22.08 — стандарт панели 6 глав Гу, то есть 12 английских единиц; план прямо говорит «вторые чтения гнать на подвыборке, не на всей панели». Обе панели несут ОДНИ И ТЕ ЖЕ 15 глав, поэтому подвыборка у них общая. Правило отбора — порядок захода Д17 (соль zakhod-d17-2026-08-16, зафризена 16.08 ДО всех покупок; отбор по хешу не коррелирует с содержанием):

ВХОДЯТ (12): f2274720 53f1a12d b065a92d 26c3bff1 49ca859c 197f98eb
             d3237e1d eefdade2 27cb3a7e 3bd64811 8e50448c 90a20cb4
НЕ ВХОДЯТ (3): 001e6ac4 5a8f48d2 c3517980

Оговорка, которую надо сделать до чисел: три невошедшие главы — ровно те, где панель-0 нашла дефекты рода. Это совпадение хеш-порядка, а не отбор: подвыборка выбрана правилом, замороженным 16.08, задолго до того, как класс «род» вообще появился. Но знать об этом надо, и на класс «род» второе чтение по этой причине сказать ничего не сможет.

Сравнение кругов идёт на ОДНИХ И ТЕХ ЖЕ 12 главах. Первый круг пере-считывается на этой же подвыборке (--drop=001e6ac4,5a8f48d2,c3517980), иначе разница кругов смешалась бы с разницей выборок. Опубликованные вердикты на 15 главах остаются как есть и печатаются рядом.

Д33.2 МЕТРИКИ, ОБЪЯВЛЕННЫЕ ДО ЗАПУСКА

  1. (i) Согласие порядков. Спирмен между порядком читателя-1 и читателя-2 по каждой главе, медиана и разброс по главам.
  2. (ii) Пере-счёт ВСЕХ контрастов на втором круге и счёт перевёрнутых вердиктов («различим» ↔ «в пределах»), отдельной строкой — маржевые RK (порог пройден, знаковый p=0.1185) и RE (порог не пройден, p=0.0352).
  3. (iii) Доля дисперсии РАЗНОСТЕЙ ЧИТАТЕЛЕЙ в дисперсии парной разности армов — это и есть ответ на «сколько в пороге от прибора, а сколько от текста».
  4. (iv) Держится ли знаковый p у RKT (единственный вендор-вердикт, прошедший конъюнкцию).

Правило чтения результата, объявленное ДО:

  • вердикт, перевернувшийся на втором круге, объявляется читательским, а не текстовым — и снимается из живых, а не «уточняется»;
  • если доля (iii) велика, все пороги фазы — это в основном шум прибора, и любое «неразличимо» обязано печататься с этой долей рядом;
  • одно семейство читателей меряет ШУМ, а не ВКУС. Согласие двух чтений fable-5 не говорит ничего о том, согласился бы владелец: ось ВЕРНОСТИ у него разошлась с прибором радикально (Д30, Шаг 8). Второе чтение закрывает разброс, а не правоту.

Д33.3 ДИСЦИПЛИНА ПРОГОНА

Новые сессии, занятые runs.py --claim ДО запуска и закрытые после · один читатель на главу · читателю закрыты ключи, чужие пакеты, чужие ответы, код и отчёт · после прогона — аудит слепоты грепом по всем ответам (упоминания вендоров и моделей обязаны быть НУЛЁМ).

Д33.4 ОБЁРТКА ЗАПУСКА — ПРОВЕНАНС-ДЫРА, НАЙДЕННАЯ ЗДЕСЬ И ЗАКРЫТАЯ ЗДЕСЬ

Агент-читатель получает ДВА текста: пакет ЧТЕНИЕ-*.md (в нём всё задание) и обёртку запуска («открой такой-то файл, никуда больше не смотри»). Пакет лежит на диске и воспроизводим побайтно. Обёртку не хранит НИ ОДИН артефактREADERS-*.json пишет модель, главы и панель, а текст запуска не пишет никто.

Следствия ровно два, и оба уже сработали:

  1. Обёртку первого круга vendor2/arch2 (21.08) воспроизвести побайтно НЕЛЬЗЯ. Значит в разницу кругов входит не только разброс читателя, но и НЕИЗВЕСТНАЯ разница обёрток. Направление этого вклада неизвестно; оценить его нечем. Объявляю ДО чисел.
  2. Обёртка панели-0 добавила к пакету две оси и подсказала читателю ровно те классы, которые считал счётчик, — эррата уже выпущена (Д32.13).

Закрыто механизмом, а не обещанием: обёртка вынесена в файл зоны eval/dovodka/prompts/reader-wrapper.md, зафризена коммитом и цитируется по хешу. В ней стоит жёсткое правило содержания: обёртка называет ТОЛЬКО какой файл открыть, чего не открывать, куда писать ответ и «не гадай о способе изготовления» — ни одной оси оценки, ни одного примера дефекта. Смена обёртки = смена прибора ⇒ новый тег панели, как и при смене состава армов.

Вторые чтения Д33 идут именно этой обёрткой, sha256: 15cfac60e1d62d3ffbfb30fc9ff3c33587fe9f4c56caf1b154eea347e2ec760e

Д33.5 РЕЗУЛЬТАТ ВТОРОГО ЧТЕНИЯ vendor2 (Шаг 2 закрыт)

12 глав подвыборки, 12 новых читателей (сессии #115#126, заняты runs.py --claim ДО запуска, закрыты после), обёртка reader-wrapper.md sha256 15cfac60…, пакеты не тронуты. Ответы первого круга лежат в r1/ (15 файлов, хеши сверены после переноса — все 15 OK), второго — в r2/ (12). Аудит слепоты круга 2: 154 191 знак ответов, упоминаний вендоров, моделей и слова «однопроходка» — НОЛЬ.

(i) СОГЛАСИЕ ПОРЯДКОВ — прибор воспроизводит себя хорошо.

Спирмен между кругами по главе (10 армов): медиана +0.84, среднее +0.78, разброс от +0.38 до +0.95. Худшие главы — eefdade2 (+0.38) и b065a92d (+0.55); лучшие — f2274720 (+0.95) и d3237e1d (+0.94).

(iii) РАЗЛОЖЕНИЕ ПОРОГА — И ЭТО ГЛАВНОЕ ЧИСЛО ШАГА.

По 45 парам армов, разложение Var(D1) = σ²_текста + σ²_читателя, σ²_читателя = Var(D1D2)/2:

МЕДИАННАЯ ДОЛЯ ЧИТАТЕЛЯ В ПОРОГЕ = 0.27   (среднее 0.33; пар с долей ≥1.0: 0 из 45)

Примерно четверть нашего порога — шум чтения, три четверти — текст. Это ЛУЧШЕ, чем можно было опасаться: «неразличимо» на этой панели означает «армы близки», а не «прибор слеп». Худшие пары — RGTZF (0.38), RLZF (0.33), RGTZ0 (0.30); лучшие — RETRGT (0.10) и RKRN (0.11).

Чего это число НЕ говорит. Оно про ШУМ одного читательского семейства, и молчит про ВКУС: ось ВЕРНОСТИ у владельца разошлась с прибором радикально (Д30, Шаг 8). Согласие двух чтений fable-5 — это согласие прибора с самим собой.

(ii) ПЕРЕ-СЧЁТ КОНТРАСТОВ И ПЕРЕВЁРНУТЫЕ ВЕРДИКТЫ. Якорь RN, конъюнкция (порог И p<0.05).

арм круг 1, 15 глав (опубликовано) круг 1, те же 12 глав круг 2, те же 12 глав
Z0 +0.40 · 3.17 · p=0.607 +1.33 · 3.33 · p=0.146 +1.42 · 3.58 · p=0.388
ZF +0.67 · 3.23 · p=1.000 +1.25 · 3.00 · p=1.000 +1.17 · 3.20 · p=0.774
REL +0.80 · 2.26 · p=0.302 +0.67 · 2.34 · p=0.388 +0.83 · 2.57 · p=0.774
RET +1.07 · 2.74 · p=0.302 +1.00 · 2.90 · p=0.388 +0.17 · 2.89 · p=1.000
RGT +1.40 · 2.98 · p=0.607 +1.83 · 3.23 · p=0.774 +0.92 · 3.45 · p=0.774
RE +1.93 · 2.76 · p=0.035 +2.58 · 2.69 · p=0.039 +2.58 · 2.32 · p=0.146
RL +2.00 · 2.76 · p=0.119 +1.83 · 3.16 · p=0.146 +1.67 · 2.17 · p=0.039
RK +3.40 · 3.30 · p=0.119 +3.75 · 3.78 · p=0.146 +4.08 · 2.63 · p=0.039 → РАЗЛИЧИМ
RKT +5.33 · 2.36 · p=0.001 +5.75 · 2.09 · p=0.0005 +5.50 · 2.02 · p=0.0005

ПЕРЕВЁРНУТЫХ ВЕРДИКТОВ: 1 из 9.

  • RK (grok на low) — вердикт ЧИТАТЕЛЬСКИЙ, а не текстовый. В круге 1 «в пределах», в круге 2 «РАЗЛИЧИМ». По правилу, объявленному ДО чтения (Д33.2), такой вердикт снимается из живых: он воспроизводится не текстом, а тем, кто читал. Публиковать «grok-low различимо хуже» нельзя ни по одному кругу.
  • (iv) RKT (grok на high) держится в ОБОИХ кругах и с запасом: разрыв +5.75 и +5.50 при порогах 2.09 и 2.02, знаковый p=0.0005 оба раза. Это единственный вендор-вердикт фазы, устоявший под вторым чтением.
  • RE и RL — «в пределах» в обоих кругах, но по РАЗНЫМ причинам, и это не устойчивость. У RE в круге 1 конъюнкцию рушит порог (2.58 против 2.69), в круге 2 — знаковый тест (p=0.146); у RL ровно наоборот. Такие армы надо читать как «прибор не решил», а не как «не хуже».

И отдельная оговорка про ВЫБОРКУ, а не про читателя. Пере-счёт круга 1 с 15 глав на 12 двигает разрывы до +0.93 места (Z0: +0.40 → +1.33). То есть смена трёх глав из пятнадцати стоит столько же, сколько смена читателя. Сравнение кругов от этого не страдает — оба идут на ОДНИХ 12 главах, — но всякий, кто сравнивает опубликованные числа с этими, обязан помнить, что часть разницы куплена подвыборкой.

Провенанс-дыра круга 1 (Д33.4) в силе: его обёртку запуска не хранит ни один артефакт, значит в разницу кругов входит не только читатель. Оценить этот вклад нечем; направление неизвестно.


Д31 — ВЕРДИКТ ПО ВЕНДОРАМ. ПО КОНЪЮНКЦИИ И ПОСЛЕ ВТОРОГО ЧТЕНИЯ

Секция несёт номер Д31 по брони плана 22.08, но физически стоит после Д32Д33 — печатать её до метрики (ii) второго чтения было запрещено тем же планом. Бронь исполнена, порядок нарушен намеренно и назван.

Правило вердикта, объявленное пре-регом Д17.4 и не менявшееся: конъюнкция — разрыв больше собственного порога панели И знаковый p<0.05. Якорь — RN, тот же промт-роль на deepseek-v4-pro: иначе замер сравнивал бы вендоров с ДРУГОЙ архитектурой, а не промт с самим собой. Дополнительное условие, введённое планом: вердикт, не воспроизведённый вторым чтением, объявляется читательским и в живые не идёт.

вендор · конфигурация разрыв с якорем круг 1 круг 2 ИТОГ
grok-4.3 · эффорт high (RKT) +5.33 … +5.75 РАЗЛИЧИМ p=0.001 РАЗЛИЧИМ p=0.0005 РАЗЛИЧИМО ХУЖЕ. Закрыт.
grok-4.3 · эффорт low (RK) +3.40 … +4.08 в пределах РАЗЛИЧИМ p=0.039 НЕ УСТАНОВЛЕНО (вердикт перевернулся)
gpt-5.6-luna (RL) +1.67 … +2.00 в пределах в пределах в пределах порога
gemini-3.1-flash-lite · вендор-дефолт (RE) +1.93 … +2.58 в пределах в пределах в пределах, но маргинален
gemini · low (REL) +0.67 … +0.83 в пределах в пределах в пределах порога
gemini · high (RET) +0.17 … +1.07 в пределах в пределах в пределах порога
glm-5 · размышление ВКЛ (RGT) +0.92 … +1.83 в пределах в пределах в пределах порога
glm-5 · размышление ВЫКЛ (RG) Д28.4: +2.61 к RGT, оба прибора согласны панель-0 подтвердила на счётчике различимо хуже

Д31.1 ЧТО ЭТА СЕКЦИЯ ОТМЕНЯЕТ В УЖЕ СКАЗАННОМ

1. «grok на верхней ступени хуже, чем на нижней» — СНИМАЕТСЯ. Это был пункт 3 сводки консилиума («платим не за вендора, а за размышление — не закон»). Пере-счёт:

контраст RKTRK разрыв порог p вердикт
круг 1, 15 глав (опубликовано) +1.93 1.93 0.035 РАЗЛИЧИМ — на самой грани
круг 1, те же 12 глав +2.00 2.19 0.039 в пределах
круг 2, те же 12 глав +1.42 2.39 0.388 в пределах

Вывод держался ровно на полной выборке и ровно на грани (ревью В3 предупреждало: «на шестой значащей цифре»). Ни подвыборка, ни второй читатель его не воспроизводят. Печатать «grok high хуже grok low» больше нельзя.

2. «gemini low не хуже high» — устояло как НОЛЬ, но у нуля неустойчив даже знак: RETREL даёт +0.27 (15 глав), +0.33 (12 глав, круг 1) и 0.67 (круг 2). Читать это как «ступень неважна» нельзя; читать надо как «панель ступень не разрешает вовсе».

Честная общая формулировка вместо обеих: ни один контраст СТУПЕНИ размышления в этой панели не воспроизводится вторым чтением. Устойчиво различается только связка «вендор × конфигурация» целиком против якоря, и то у одного арма из восьми.

3. Норма «вендор-дефолт как продуктовая конфигурация ЗАПРЕЩЁН» — в силе и укрепляется. RE (вендор-дефолт gemini) — единственный арм, который рушит конъюнкцию по РАЗНЫМ ногам в разных кругах: в круге 1 не проходит порог, в круге 2 — знаковый тест. Конфигурация, про которую вендор не пишет, чем она является, ведёт себя как случайная величина и в прод не идёт.

Д31.2 ЧТО ЭТО ЗНАЧИТ ДЛЯ РОСТЕРА

  • Дефолт письма — deepseek-v4-pro (якорь; ни один испытанный вендор его не обошёл).
  • grok-4.3 в роли письма закрыт на high; на lowНЕ УСТАНОВЛЕНО, направление устойчиво и велико (+3.4…+4.1 места), но конъюнкция достигается в одном круге из двух. Брать его в прод оснований нет; объявлять «не хуже» — тоже.
  • glm-5 — запасной, и ТОЛЬКО с размышлением. Без него различимо хуже двумя приборами. ⚠ Цена: по замеренным токенам он втрое-вчетверо дороже якоря (Д30.8), полосой, а не точкой.
  • Дешёвая линия (gemini на явном low, luna) — по-прежнему КАНДИДАТЫ, не прод. Из условий консилиума второе чтение снято. ЭРРАТА 29.08 (Д42): оставшееся условие «цензур-ось не мерена» верно ТОЛЬКО для luna. У gemini-3.1-flash-lite она мерена и замер ПРОТИВ него — 10 клеток content_filter на нашем вебновелльном материале (21-role-topology.md:241-245), тем же замером фаза исключила gemini из китайской панели. И «китайских клеток нет» верно только для роли ПИСЬМА: в роли черновика у обеих по 16 zh-клеток. Разбор — Д38.2 и Д42.

Д31.3 ПАСПОРТ РАЗРЕШЕНИЯ ВЕНДОР-ВЕРДИКТА

ПАСПОРТ: прибор=ранговый · слепое чтение fable-5 · ДВА чтения · семейств 1
n=15 ед (7.4 главы Гу) круг 1 · n=12 ед (5.9 главы Гу) оба круга · k=10 армов · якорь RN
пороги наблюдённые 2.03.8 места из 10 · правило: |Δ|>порог И знаковый p<0.05 И повтор во 2-м круге
ДОЛЯ ЧИТАТЕЛЯ В ПОРОГЕ = 0.27 (медиана по 45 парам; 0 пар с долей ≥1.0)
пол |Z0ZF| = 2.67 места из 10 · парный разрыв 0.27 при пороге 2.59 — пол годен
грубого декоя в панели НЕТ — разрешение держится только на близнецах
СЛЕП К: ступеням размышления · цензуре · китайской паре · вкусу владельца (ось ВЕРНОСТИ, Д30)
        · эффектам ниже ~2 мест из 10
НЕ УРАВНЕНО: `temperature: 0.3` у Z.ai и xAI НЕ проверена вендором · обёртка круга 1 не сохранена

И последнее, что обязано стоять рядом с любым вендор-фактом: слаг ≠ модель. DeepSeek 31.07 сменил веса под тем же слагом (D39.61). Любое число этой секции имеет срок годности, и при аномалии сверяется поведенческой пробой, а не листингом.

Д33.6 ЧИТАТЕЛЬ ВТОРОГО КРУГА — ДРУГАЯ МОДЕЛЬ. НАЙДЕНО ВОПРОСОМ ВЛАДЕЛЬЦА 23.08

Владелец спросил: «а у тебя опус агенты читают? до этого все главы вычитывали фабл-5». Он прав, и это моя ошибка, а не подозрение.

Что доказано, и чем. Поле model в транскриптах суб-агентов этой сессии (.../subagents/workflows/*/agent-*.jsonl): все 40 моих читателей — claude-opus-5 (панель-0: 16 агентов · второе чтение vendor2: 12 · второе чтение arch2: 12; иных значений в файлах нет). Суб-агент наследует модель сессии, а я не передал переопределения и не проверил, что уехало.

Чем читал круг 1 — ПОДТВЕРЖДЕНО ФАКТОМ, а не декларацией. Предыдущая сессия по запросу владельца подняла свой транскрипт и пере-считала вызовы: 58 вызовов Agent с пакетом из ~/books/chtenie-rol/, у КАЖДОГО в параметрах model: 'fable'arch2 15 · vendor2 15 · vendor 13 · zhpanel 12 · abl+rol 3. Ни одного opus-5 среди читателей не было. Декларации READERS-*.json («fable-5» / читатель.модель = "claude-fable-5") с фактом совпали, и сверено это отдельно — сама по себе декларация не доказывает ничего.

⚠ Уточнение той же сессии, которое надо держать рядом: opus-5 в прошлых прогонах был ОРКЕСТРАТОРОМ (собирал пакеты, считал ранги, сводил), но прибором не был ни разу. И агенты глобального ревью 21.08 (231 штука) — тоже fable: и прибор, и его аудитор были одной моделью.

ВТОРОЕ ЧТЕНИЕ ЕСТЬ КРОСС-СЕМЕЙНОЕ, А НЕ ПОВТОР ОДНИМ ПРИБОРОМ.

Д33.7 ЧТО ЭТО ЛОМАЕТ, А ЧТО — НАОБОРОТ, УСИЛИВАЕТ

утверждение статус после находки
«доля ЧИТАТЕЛЯ в пороге = 0.27» (Д33.5, метрика iii) ПЕРЕ-ИМЕНОВАНА. Это доля ПОЛНОЙ СМЕНЫ СЕМЕЙСТВА fable-5→opus-5, а не шума одного прибора
«сколько в пороге от прибора» — заявленная цель Шага 2 НЕ ДОСТИГНУТА. Внутрисемейный разброс НЕ ЗАМЕРЕН; паспорт разрешения остаётся без своего числа
медиана Спирмена +0.84 между кругами УСИЛИВАЕТСЯ. Это согласие ДВУХ РАЗНЫХ семейств, требование более строгое, чем повтор одним
RKT различим в обоих кругах (p=0.001 и 0.0005) УСИЛИВАЕТСЯ. Вердикт переживает не только другого читателя, но и другую модель
RK перевернулся между кругами УСИЛИВАЕТСЯ КАК СНЯТИЕ. Вердикт, не переживший смену семейства, тем более не факт о тексте
«grok high хуже low» снято (Д31.1) без изменений: оно не воспроизвелось уже на ПОДВЫБОРКЕ круга 1, то есть внутри одного семейства
ранги панели-0 (E6↔RG +1.12, p=0.0042) устоит как замер opus-5: все четыре арма панели-0 читал ОДИН прибор. Но с числами прежних панелей несопоставимо
сравнение порогов «0.891.21 против 2.264.20» в Д32.12 ОТОЗВАНО — семейство и число армов сменились одновременно

И главный организационный вывод: норма «идентичность читателя в файл ДО запуска» у меня была исполнена наполовину. runs.py --claim записал имена судей и главы, но не модель, а READERS-*.json для своих прогонов я вообще не завёл. Долг закрыт задним числом: READERS-p0.json, READERS-vendor2-r2.json, READERS-arch2-r2.json записаны 23.08 и несут поле модель_ДОКАЗАННАЯ — снятое из транскриптов, — рядом с честной пометкой «записано ПОСЛЕ прогона». Заявление о намерении моделью не является: ровно этим болел круг 1, у которого проверить уже нечего.

Требование к любому следующему чтению: модель читателя задаётся ЯВНО при запуске и подтверждается транскриптом ПОСЛЕ, а не объявляется словом.

Д33.8 РЕЗУЛЬТАТ ВТОРОГО ЧТЕНИЯ arch2 (Шаг 3). Тот же кросс-семейный статус

12 глав подвыборки, 12 новых читателей (сессии #127#138), обёртка та же, пакеты не тронуты. ⚠ Якорь здесь Z0 (один арм), а не пара Z0/ZF, как в опубликованном своде Д24 — сравнение кругов от этого не страдает (якорь у обоих один), но с числами Д24 не сопоставимо.

(i) Согласие порядков (11 армов): медиана ρ = +0.89, среднее +0.86, от +0.48 (197f98eb) до +0.97. Выше, чем на vendor2.

(iii) Медианная доля СМЕНЫ СЕМЕЙСТВА в пороге = 0.14 (среднее 0.19; 0 пар из 54 с долей ≥1). То есть на архитектурной панели два РАЗНЫХ семейства расходятся ещё меньше, чем на вендорской.

(ii) Контрасты против Z0, оба круга на одних 12 главах:

арм круг 1 круг 2 итог
ZD голый черновик +4.12 · 2.39 · p=0.006 +4.92 · 2.10 · p=0.0005 РАЗЛИЧИМО ХУЖЕ в обоих
Z8 обогащённый черновик +4.50 · 2.68 · p=0.039 РАЗЛИЧИМ +3.58 · 2.61 · p=0.146 ПЕРЕВЁРНУТ
RC · RB · Z1 · RN · Z8R · ZP · Z7 · ZF в пределах в пределах середина не разрешается

ПЕРЕВЁРНУТЫХ: 1 из 10.

И это уточняет ГЛАВНЫЙ вывод дуги. Консилиум оставил от «второй проход нужен» формулировку «текст, которого не касалась дорогая пишущая модель, различимо хуже». Армов без дорогой модели в панели ДВА — ZD и Z8. Второе чтение разводит их:

  • ZD (голый черновик) — различимо хуже в ОБОИХ семействах, с запасом. Это факт о тексте.
  • Z8 (обогащённый черновик) — вердикт не пережил смену семейства. Он и так уже был снят блокером Б4 («различимо дважды» не считался); теперь снят и по чтению.

Честная форма: различимо хуже оказывается ГОЛЫЙ черновик, а не «всё, чего не касалась дорогая модель». Обогащённый промт черновика поднимает его до неразличимости с серединой — и это ровно то, что нельзя было сказать до второго чтения.

⚠ Вся середина панели (ZP, Z7, Z1, Z8R, RN, RB, RC, ZF) — «в пределах» в обоих кругах и в обоих семействах. Это САМОЕ сильное «неразличимо», какое фаза произвела: оно устояло против смены выборки, смены читателя и смены модели читателя разом.

Д33.9 ВТОРОЕ СУДЕЙСКОЕ СЕМЕЙСТВО — ПОЯВИЛОСЬ ПО ОШИБКЕ, И ОНО СОГЛАСНО С ПЕРВЫМ

Заказано владельцем 23.08 после разбора Д33.6: «раз уж ты пробежал какое-то судейство другим агентом, заодно можно и сравнить будет их». До этого дня фаза жила с ограничением, записанным прямым текстом в READERS-arch2.json: судейское семейство ровно ОДНО, норма П-1 о двух не исполняется, Sol запаркован решением владельца 20.08. Следствие оговаривалось честно: общий ВКУС fable от качества перевода не отделим в принципе, пока второго семейства нет.

Круг 2 дал второе семейство. Сравнение — поармный сдвиг среднего места, парно по главам, знаковый тест (сдвиг >0 = opus ставит арм НИЖЕ, чем fable):

панель армов наибольший сдвиг наименьший p армов, судимых различимо по-разному
vendor2 10 RK +0.50 / RGT 0.75 (из 10 мест) 0.289 0 из 10
arch2 11 ZD +1.08 / RN 1.08 (из 11 мест) 0.070 (ZF) 0 из 11

Ни один арм из 21 два семейства не упорядочивают различимо по-разному. Ближе всех к границе ZF на архитектурной панели (opus ставит её ниже на 1.04 места, 7 глав из 8 в одну сторону, p=0.070) — единственный кандидат в «разный вкус», и он границы не перешёл.

Что это значит и чего НЕ значит:

  • Ранговые вердикты фазы не являются идиосинкразией одной модели. Всё, что fable назвал различимым и что пережило второе чтение (RKT хуже якоря, ZD хуже связки), opus называет так же; всё, что fable не разрешил, opus тоже не разрешает.
  • Но это НЕ исполнение нормы П-1, и притворяться иначе нельзя. claude-fable-5 и claude-opus-5 — модели ОДНОЙ лаборатории и одной линии обучения. Их согласие снимает вопрос «не выдумал ли конкретный прибор свой порядок» и не снимает вопрос «не выдумала ли его вся эта линия». Внешним семейством был Sol, и он по-прежнему запаркован. ⇒ П-1 остаётся НЕ ИСПОЛНЕННОЙ; засчитывать opus за второе семейство — самообман.
  • Мощность у этой проверки слабая. 12 глав, знаковый тест: чтобы получить p<0.05 при всех расхождениях в одну сторону, нужно 6 глав с ненулевой разницей. «0 из 21 различимо» читается как «крупных расхождений вкуса нет», а не как «вкусы тождественны».
  • Места КОМПОЗИЦИОННЫ: сумма сдвигов по построению ≈0, поэтому «сдвиг арма» есть утверждение относительное. Абсолютной строгости («какое семейство придирчивее») этот прибор не видит.
  • И то, что ни один машинный прибор не закрывает: ось ВЕРНОСТИ, на которой владелец разошёлся с fable радикально (Д30). Согласие двух моделей одной линии про эту ось не говорит ничего — скорее наоборот, повышает вероятность, что расхождение с владельцем есть свойство ЛИНИИ.

И ещё одно, названное самой предыдущей сессией: агенты глобального ревью 21.08 (231 штука) — тоже fable. То есть и прибор, и его аудитор были одной моделью. Настоящая кросс-семейная проверка ревью не проводилась ни разу.


Д34 — ПЕРЕ-СУД ПАНЕЛИ-0 НА fable-5. ПРЕ-РЕГ, ЗАПИСАН ДО ЧИСЕЛ

Зачем, и почему это важнее, чем добор внутрисемейного шума. Панель-0 — единственная панель фазы, прочитанная не тем прибором, что вся остальная фаза: её 16 читателей были opus-5, все прочие панели читал fable-5 (58 вызовов, подтверждено транскриптом прошлой сессии). И именно панель-0 несёт минимаксный вердикт владельца — «буферизует ли архитектура слабого жильца». Пока она прочитана одним прибором, а вся калибровка фазы (пороги, мощностные таблицы, «эффект в одно место = 68 глав Гу») построена на другом, вердикт нельзя ни сравнить, ни перенести.

В прошлом отчёте владельцу я поставил приоритеты неверно и предлагал тратить 1224 сессии на добор внутрисемейного шума vendor2/arch2. Это была плохая покупка: межсемейное число (0.27 и 0.14) есть ВЕРХНЯЯ ГРАНИЦА внутрисемейного — смена семейства может разброс только добавить, — и вопрос «порог это в основном шум?» им уже закрыт отрицательно. А вот панель-0 прочитана одним прибором, и это дыра не в десятичном знаке, а в самом вердикте.

Д34.0 ПРОЦЕДУРА

16 глав (вся панель, не подвыборка: панель бесплатная и несущая) · 16 новых сессий #139#154 · модель читателя задана ЯВНО параметром запуска и сверяется по транскриптам ПОСЛЕ прогона — заявление о намерении моделью не является (урок Д33.6) · обёртка reader-wrapper.md sha256 15cfac60…, та же, что во вторых чтениях, и НЕ та, что была у круга opus (та называла две оси — эррата Д32.13) · пакеты не тронуты · ответы opus-круга перенесены в opus/ (16 файлов, хеши сверены — 16 OK), fable пишет по прежнему впечатанному пути и уезжает в fable/.

⚠ Карта подкаталогов ответов — одна на все панели, чтобы следующая сессия не путалась:

панель r1/ r2/ opus/ fable/
vendor2, arch2 круг 1 — fable-5 круг 2 — opus-5
p0 (панель-0) круг 1 — opus-5 круг 2 — fable-5

Д34.1 ЧТО ОБЪЯВЛЕНО ДО ЧИСЕЛ

Метрики — те же три, что в Д33: (i) Спирмен между семействами по главе; (ii) пере-счёт контрастов E6↔RG, E6↔Z0, Z0↔ZF в обоих семействах и счёт перевёрнутых вердиктов; (iii) поармный сдвиг со знаковым тестом.

ПРАВИЛО РЕШЕНИЯ, И ОНО ОБЪЯВЛЕНО ЗАРАНЕЕ ИМЕННО ПОТОМУ, ЧТО ВЫВОД МНЕ НРАВИТСЯ:

  • Если fable тоже ставит RG ниже и контраст E6↔RG проходит конъюнкцию — вердикт о буфере объявляется НЕ ЗАВИСЯЩИМ от семейства читателя, и это его усиливает.
  • Если fable контраст НЕ воспроизводит — вердикт о буфере объявляется свойством прибора opus-5, снимается из живых по ранговой оси и остаётся жить только на счётной (счётчик schet.py детерминирован, читателя не имеет и от этого исхода не зависит вовсе).
  • Если E6↔Z0 («слабый жилец внутри архитектуры неотличим от боевого») перевернётся — это худший из исходов, и он бьёт по центральному утверждению Шага 1. Печатать его придётся первым.

Чего пере-суд НЕ закроет: норму П-1 он не исполняет — fable-5 и opus-5 одной лаборатории и одной линии обучения (Д33.9); ось ВЕРНОСТИ владельца он не трогает; счётную часть панели-0 он не проверяет и не может.

Д34.2 РЕШЕНИЕ ПРО ВСЕ БУДУЩИЕ ЧТЕНИЯ

Читатель фазы — fable-5, и модель задаётся ЯВНО. Основание: решение владельца 20.08 («отдадим всё судейство фаблу») и сопоставимость с 58 уже прочитанными пакетами. Наследование модели от сессии запрещено: оно молча подменило прибор один раз и подменит снова. ⇒ Шаг 4 (дуэль «с промтом против без промта») пойдёт на fable-5, а не на модели сессии.

Д34.3 РЕЗУЛЬТАТ ПЕРЕ-СУДА: ВЕРДИКТ О БУФЕРЕ УСТОЯЛ У ВТОРОГО СЕМЕЙСТВА

16 глав, 16 сессий #139#154, модель задана явно и сверена ПОСЛЕ прогона по транскриптам: 16 агентов, все claude-fable-5, иных значений в файлах нет. Аудит слепоты: упоминаний вендоров, моделей и слова «однопроходка» — ноль.

арм opus-5 (круг 1) fable-5 (круг 2)
ZF 1.94 1.88
Z0 2.31 1.94
E6 2.31 2.50
RG 3.44 3.69

Контрасты против якоря E6, обе панели на одних 16 главах:

контраст opus-5 fable-5 итог
E6 ↔ RG +1.12 · порог 0.99 · p=0.0042 РАЗЛИЧИМ +1.19 · порог 0.87 · p=0.0213 РАЗЛИЧИМ конъюнкция пройдена ОБОИМИ
E6 ↔ Z0 +0.00 · 1.21 · p=0.804 0.56 · 1.13 · p=0.455 в пределах у обоих
E6 ↔ ZF 0.38 · 0.89 · p=0.455 0.62 · 1.05 · p=0.210 в пределах у обоих
пол Z0/ZF +0.38 при пороге 1.02 +0.06 при пороге 1.09 пол годен у обоих

ПЕРЕВЁРНУТЫХ ВЕРДИКТОВ: 0 из 3. Поармный сдвиг: 0 из 4 армов семейства упорядочивают различимо по-разному, максимум ±0.38 места из четырёх.

Вердикт Шага 1 о буфере НЕ является свойством прибора opus-5. По правилу, объявленному в Д34.1 ДО чисел, он объявляется не зависящим от семейства читателя — и это его усиливает.

Д34.4 НО АГРЕГАТ ПРЯЧЕТ ПОЛНОЕ РАСХОЖДЕНИЕ НА ОДНОЙ ГЛАВЕ

Медиана Спирмена между семействами +0.80, минимум 1.00. Минимум — глава 197f98eb61, и это ровно та единственная глава панели, где у автора стоит типографский приём P A T I E N C E:

opus-5 : RG > E6 > ZF > Z0        fable-5: Z0 > ZF > E6 > RG        ← ТОЧНО НАОБОРОТ

Напомню, что там сделали армы (Д32.7 п.3): RG сохранил разрядку, но не перевёл её — оставил латиницей; ZF передал приём по-русски («Т Е Р П Е Н И Е»); Z0 и E6 приём потеряли, слово перевели.

  • fable-5 поставил RG ПОСЛЕДНИМ — то есть отработал по букве правила пакета «СМЫСЛ → БРАК → ХУДОЖЕСТВЕННОСТЬ»: непереведённый кусок исходника есть брак, брак решает раньше прозы.
  • opus-5 поставил RG ПЕРВЫМ — за прозу, простив непереведённое слово.

⇒ Это не «шум»: это разная развесовка того самого компромисса «брак против прозы», ради которого правило чтения и написано. Агрегатное «0 из 4 армов различимо» его не видит, потому что глава одна.

И это смыкается с расхождением владельца (Д30, Шаг 8). Владелец тоже ставит смелый текст выше буквы — там, где прибор его топит. На этой главе opus-5 повёл себя как владелец, а fable-5 — как правило. Одна глава вывода не несёт, и раздувать её нельзя; но она показывает, ГДЕ семейства разойдутся, если разойдутся, и что искать на якорных главах владельца.

Мощность: при ЧЕТЫРЁХ армах Спирмен принимает всего пять значений (1, 0.4, 0.2, 0.8, 1.0), поэтому и медиана +0.80, и минимум 1.00 — крупнозернистые. Доля смены семейства в пороге здесь 0.37 против 0.27 и 0.14 на больших панелях: чем короче шкала, тем дороже одно расхождение.

Д34.5 ДВА СЕМЕЙСТВА КАК ПРИБОРЫ: ЧТО ЗАМЕРЕНО И ЧЕГО ЗАМЕРИТЬ НЕ УДАЛОСЬ

Вопрос владельца 23.08 — практический: можно ли на больших объёмах ставить судьёй opus-5 вместо fable-5, он дешевле. Отвечаю тем, что замерено на трёх панелях.

Что найдено — различий нет ни по одной измеренной оси:

ось vendor2 arch2 p0 итог
армов, судимых различимо по-разному 0 из 10 0 из 11 0 из 4 0 из 25
медиана Спирмена между семействами +0.84 +0.89 +0.80 высокая
перевёрнутых вердиктов 1 из 9 (RK) 1 из 10 (Z8) 0 из 3 2 из 22
связок «=» в порядке opus 0/16 · fable 0/16 разрешение одинаково

Третейский судья — детерминированный счётчик. На 8 главах панели-0, где счётчик развёл армы по числу фаталов, считаю ρ между местом и числом фаталов (ρ>0 = семейство согласно со счётчиком):

opus-5 : медиана ρ +0.70 · среднее +0.45 · глав согласия 6 · глав ПРОТИВОРЕЧИЯ 2
fable-5: медиана ρ +0.52 · среднее +0.55 · глав согласия 8 · глав противоречия 0
парная разность opusfable: 0.10, знаковый p=0.6250 — НЕ РАЗЛИЧИМЫ

Числа не различимы, но форма расхождения одинакова у двух независимых замеров. fable не противоречит счётчику НИ РАЗУ; opus противоречит на двух главах из восьми, зато когда согласен — согласен сильнее. Ровно это же видно на главе 197f98eb61, где семейства упорядочили армы точно наоборот (Д34.4): opus наградил арм за прозу, простив непереведённое слово, fable наказал за непереведённое слово. ⇒ Гипотеза, НЕ вердикт: opus весит прозу выше брака, чем fable. ⚠ И она держится ПРОТИВ форы: круг opus шёл с обёрткой, которая прямо называла две дефектные оси (эррата Д32.13), то есть был подтолкнут к браку — и всё равно инвертировал дважды.

Многословность: медиана ответа opus 5 582 знака против 3 520 у fable — в 1.6 раза длиннее при том же задании.

ЧЕГО ЗАМЕРИТЬ НЕ УДАЛОСЬ, И ЭТО ГЛАВНОЕ ОГРАНИЧЕНИЕ ОТВЕТА. Два перевёрнутых вердикта из 22 я не могу отличить от обычного читательского шума: внутрисемейного повтора нет ни у одной панели, значит базовой линии «сколько вердиктов переворачивается при ТОМ ЖЕ семействе» не существует. Для вопроса «сошлись ли приборы» это неважно — они сошлись. Для вопроса «можно ли подменить судью» это ровно та величина, которая и нужна: подмена оправдана, если она стоит не больше, чем повтор тем же прибором.

И я сам отговорил от этого замера (Д34.0), потому что оценивал его по нуждам ЭКСПЕРИМЕНТА — там межсемейная граница вопрос закрывала. Для вопроса о ПОДМЕНЕ СУДЬИ на прод-объёмах он нужен, и это разные вопросы. Цена: 16 сессий (повтор панели-0 тем же fable).

Асимметрия риска, которую надо назвать до всякой экономии. Если гипотеза верна и opus действительно прощает брак за прозу, то на масштабе он будет систематически ЗАВЫШАТЬ гладкий текст с дефектами — то есть ровно тот исход, против которого продукт и строится (класс А). Ошибка в эту сторону дороже экономии на судье.


Д35 — ПЕРЕЕЗД МАШИНЫ: ЧТО ОН СЛОМАЛ В ПРИБОРАХ ФАЗЫ, И ДВЕ ЭРРАТЫ, НАЙДЕННЫЕ ПРИ ВОССТАНОВЛЕНИИ

Сессия 29.08 открылась не с замера, а с того, что ни один риг фазы не запускался: на новой машине нет ни ~/books, ни eval/.venv. Восстановление дало две находки, обе — не про эту фазу, а про то, чем фаза меряет.

Д35.1 ОКРУЖЕНИЕ ВОССТАНОВЛЕНО, И ОТКЛОНЕНИЯ ОТ СТЕНДА НАЗВАНЫ

  • Книги. С 24.08 они лежат в <репозиторий>/books и версионируются ОТДЕЛЬНЫМ git-репозиторием (CLAUDE.md), а все риги полигона ходят по Path.home()/"books"65 вхождений в 31 файле. Поднято симлинком ~/books → <репозиторий>/books. ⚠ Это восстановление контракта путей, а не починка: следующая чистая машина упрётся в ту же стену, пока корень книг не станет одной разрешающей функцией. Долг назван здесь, чтобы не всплыл как «риг сломан».
  • Интерпретатор. eval/.venv пере-собран, eval/requirements.txt поставлен целиком. ⚠ CPython 3.14.7 против пина .python-version 3.14.4 — патч-расхождение, названо, не спрятано. Риги dovodka/ — чистый stdlib (сверено импортами), поэтому расхождение на их арифметику не влияет; для рига, зовущего вендора, это была бы другая оценка.
  • Селфтесты после восстановления: rol --selftest, money_d --selftest, runs --selftest, sud --axis=d4 --selftest, naklon --selftest, gain --selftest, adjud --controlsзелены.

Д35.2 ПЕРЕЕЗД ОБНУЛИЛ mtime, И ОДИН ГЕЙТ ФАЗЫ БОЛЬШЕ НЕ ПЕРЕ-СНИМАЕТСЯ

eval/tenant_panel/verify22.py:174-185=граница двойной оплаты выводит верхнюю границу двойной оплаты Ф2 как «сумма клеток, купленных ДО коммита атомарного замка fd3e522», и отделяет «до» от «после» временем файла на диске. После переезда все 335 клеток Ф2 имеют ОДИН И ТОТ ЖЕ mtime (проверено: уникальных mtime: 1), причём поздний. ⇒ граница считается как $0.000000, не совпадает с напечатанным в отчёте эксп-22 числом, и R71 реестра требований падает.

Диагноз, а не зелень. Числа в отчёте эксп-22 верны — они сняты, когда mtime ещё существовали. Утрачена улика, а не результат. Клетки времени покупки в себе не хранят (dv-*.json: arm · uid · model · finish · *_tokens · cost_usd · latency_s — поля ts нет), значит граница из сырья больше НЕ ВЫВОДИМА ничем. ⇒ R71 объявляется НЕ ПЕРЕ-СНИМАЕМЫМ на этой машине. Гейт не правится под зелень (D39.121): подгонка спрятала бы ровно тот факт, что провенанс покупок держался на файловой системе. ⚠ Класс шире одного гейта: eval/dovodka/runs.py:176=def judge_of и eval/role_topology/absjudge.py:323=path.stat().st_mtime атрибутируют судью ответу тем же способом — по mtime файла ответа. Для БУДУЩИХ чтений это работает (файлы пишутся сейчас), для исторических — атрибуция утрачена там же и тогда же. ⇒ Норма на будущее: время покупки и время ответа писать ПОЛЕМ В АРТЕФАКТ. Файловая система — не журнал.

Д35.3 КАКОЕ СИСТЕМНОЕ СООБЩЕНИЕ ВЫЖИВАЕТ У GEMINI — УСТАНОВЛЕНО. ВЫЖИВАЕТ ПОСЛЕДНЕЕ

00-provider-quirks.md:157 оставлял вопрос открытым дословно: «⚠ КАКОЕ именно выживает — НЕ УСТАНОВЛЕНО: форум Google сообщает „выживает последнее“, а наш замер даёт 535 токенов ≈ размер одного user-сообщения, то есть не выжило НИ ОДНО. Расхождение открыто».

Закрыто арифметикой уже купленных клеток, за $0 и детерминированно. У арма RE на провод уходят ТРИ сообщения: system[0] — ролевой промт, 7 525 знаков, побайтно один и тот же на всех 16 главах; system[1] — глоссарий, 255404 знака, РАЗНЫЙ на каждой главе (термины берутся из текста этой главы); user — исходник. Карантинные клетки — тот же вызов, у которого вендор что-то выбросил.

RE.prompt_tokens  RQ.prompt_tokens  =  2436  на КАЖДОЙ из 16 глав, sd = 0.00

Разность строго постоянна. Выброшенное сообщение обязано быть постоянного размера — а постоянен из двух системных только system[0]. Будь выброшены оба, разность росла бы вместе с глоссарием (размах 149 знаков ≈ 50 токенов) и постоянной быть не могла. ⇒ вендор выбросил ПЕРВОЕ системное и оставил ПОСЛЕДНЕЕ. Форум Google был прав, наша прошлая интерпретация — нет. (Подтверждение с другой стороны: prompt_tokens карантинных клеток коррелируют с длиной ГЛОССАРИЯ +0.52 и с длиной исходника +0.04 — то есть внутри них глоссарий физически есть.)

Почему прошлый вывод разошёлся с фактом. Проба 22.08 сравнила 535 токенов с «размером одного user-сообщения» на глаз. 2 436 токенов на 7 525 знаков русского — это 0.324 ток/знак; при такой шкале глоссарий в 300 знаков весит ~100 токенов и в оценке «на глаз» просто теряется.

И это правит записанную ЦЕНУ движкового дефекта — но не открывает его заново. backend/internal/pipeline/render.go:247-258=Role: "system" кладёт первым systemсам промт стадии, вторым system — инъекцию банка (глоссарий/STM). Записанное следствие звучало как «эскалационный хоп на Gemini тихо теряет глоссарий» (00-provider-quirks.md:158). По установленному правилу всё наоборот:

до починки эскалационный хоп в Gemini при непустой инъекции терял НЕ глоссарий, а ВЕСЬ ПРОМТ СТАДИИ, и оставлял глоссарий.

То есть модель получала список канонных форм и текст — без единого слова о том, что с ними делать. Ровно это и произошло с 16 клетками RE, и ровно так они выглядят: перевод есть, finish=stop, русский, правильной длины — и никакой инструкции за ним. Тихая потеря промта не отличима от нормального ответа ничем, кроме счётчика входных токенов.

ДЕФЕКТ ДВИЖКА УЖЕ ЗАКРЫТ, И Я ЭТО ПРОВЕРИЛ КОДОМ, А НЕ ПРЕДПОЛОЖИЛ. Лендинг 7d0c6f2 (28.08) ввёл ось Capability.SystemMessages: у провайдера gemini стоит backend/configs/models.yaml:137=system_messages: single, адаптер склеивает ВЕДУЩИЙ system-ран в одно сообщение и громко падает на системном ходе после не-системного (backend/internal/llm/httpllm.go:528=func toOpenAIMessages), инвариант запинен тестом (backend/internal/llm/systemmessages_test.go:78=TestSystemMessagesSingleCarriesTheInjection). ⚠ Первая редакция ЭТОГО ЖЕ абзаца, написанная час назад, объявляла дефект живым и слала пинг в бэкенд — она стояла на строке 00-provider-quirks.md:158, устаревшей на один день. Класс ошибки тот же, что фаза ловит у себя постоянно: доверился заголовку дока вместо кода. Поймано собственной сверкой до публикации вывода, но ПОСЛЕ того, как формулировка уже уехала в коммит d7a202e (⚠ в первой редакции здесь стоял хеш a6c50fc: 30.08 владелец сменил имя в gitconfig, и локальные коммиты ветки polygon пере-генерированы под новую подпись — содержимое не тронуто, дерево HEAD побайтно то же, авторские даты сохранены. Улика пере-привязана на новый хеш) — поэтому исправление стоит здесь, а история не переписывается.

Что находка меняет по существу: (а) закрывает открытое расхождение в квирк-доке; (б) подтверждает, что «склеивать самим» было верным решением и при тогда ещё неизвестном чтении квирка — оно не могло потерять текст ни при каком ответе на вопрос «какое выживает»; (в) любой ИСТОРИЧЕСКИЙ результат, снятый на Gemini-хопе до 28.08, надо читать как «стадия работала без своего промта» — включая 16 клеток RE этой фазы.


Д36 — ШАГ 4 ПЛАНА 22.08: ДУЭЛЬ «РОЛЕВОЙ ПРОМТ ПРОТИВ ЕГО ОТСУТСТВИЯ». ПРЕ-РЕГ, ЗАПИСАН ДО СБОРКИ ПАКЕТОВ

Зачем этот шаг вообще есть. Фаза произвела много «неразличимо»: вся середина архитектурной панели, все ступени размышления, семь вендоров из восьми. У каждого такого нуля есть паспорт с порогом — но нет шкалы: неизвестно, какой перевес прибор в принципе способен развести на промт-инженерном материале. Дуэль даёт эту шкалу природным экспериментом, который уже оплачен: 16 клеток одной модели на одних главах, где единственный варьируемый фактор — есть ролевой промт или его нет.

⇒ Если даже полное исчезновение ролевого промта не даёт устойчивого знака — у прибора нет разрешения для промт-инженерных выводов вовсе, и это печатается рядом с каждым «не хуже» дуги Д23Д25 (экзамен на смелость RN/RC/RB, абляция). Если даёт — все прошлые нули получают масштаб: «меньше, чем ВЕСЬ промт, во столько-то раз».

Д36.0 ЧТО ТАКОЕ АРМ RQ — ТОЧНАЯ ФОРМУЛИРОВКА, А НЕ «БЕЗ ПРОМТА»

По Д35.3 установлено: у карантинных клеток выпал ролевой промт (7 525 знаков), а глоссарий остался. ⇒ Арм называется точно: «тот же gemini-3.1-flash-lite, тот же исходник, тот же глоссарий — но БЕЗ ролевого промта». Формулировка «вообще без инструкции», стоявшая в плане 22.08 и в шапке rol.FOREIGN["RQ"], неточна и здесь исправляется: 130 из 2 566 токенов инструкции до модели доехали, и это ровно те токены, что несут канон.

Следствие для чтения результата, объявленное ДО чисел: дуэль меряет вес ролевого промта (2 436 токенов из 2 566, то есть 95%), а не «всего промта». Разницу в 5% не назвать нулём заранее нельзя — именно эти 5% несут класс «банк».

Д36.1 СОСТАВ ПАНЕЛИ И ЗАМОРОЖЕННЫЙ СПИСОК ГЛАВ

Тег p4, новый; существующие теги не пере-эмитируются. Пять армов:

арм что это роль в панели
RQ gemini flash-lite, исходник + глоссарий, ролевого промта нет испытуемый
RE тот же gemini, тот же вызов, промт доехал компаратор
Z0 боевая связка (продакшен) половина шумового пола
ZF её вторая генерация вторая половина пола
ZD голый черновик deepseek-v4-flash ГРУБЫЙ ДЕКОЙ

⚠ ОТКЛОНЕНИЕ ОТ ПЛАНА 22.08, ОБЪЯВЛЯЮ ЕГО ЗДЕСЬ, А НЕ ПОСЛЕ. План (§5, Шаг 4) назвал панель из четырёх армов — RE · RQ · Z0 · ZF. Добавлен пятый, ZD. Основание — норма рига R57: декой обязан быть в каждой судейской пачке, а паспорт панели-0 прямо записал свой изъян строкой «грубого декоя НЕТ — разрешение держится только на близнецах». ZD на этот материал годится как никакой другой: он различимо последний в ОБОИХ кругах и у ОБОИХ судейских семейств (Д33.8: +4.12 при пороге 2.39, p=0.006; +4.92 при пороге 2.10, p=0.0005). Панель, где известно плохой арм не оказался последним, аннулируется целиком. Цена отклонения, названная заранее: шкала мест 15, а не 14, поэтому числа этой панели не сопоставимы напрямую с панелью-0 и с 11-армовой arch2. Сопоставимы отношения внутри панели — ради них декой и добавлен.

16 английских глав (пересечение всех пяти армов, сверено ДО чтения — 16/16 у каждого):

f2274720c9 · 53f1a12dff · b065a92dc0 · 26c3bff1d4 · 49ca859c94 · 100b088f71 · 197f98eb61
d3237e1dea · eefdade2c3 · 27cb3a7e69 · 3bd6481182 · 8e50448cea · 90a20cb443 · 001e6ac4eb
c3517980c7 · 5a8f48d24a

Это те же 16 глав, что у панели-0, — поэтому эталон дефект-классов, снятый по исходнику вслепую (eval/dovodka/etalon-panel0.json, sha256 02a7352e…, фриз коммитом bedc39a 22.08), применим к этой панели без единой правки, и счётный прибор достаётся даром.

Д36.2 ГОДНОСТЬ МАТЕРИАЛА — СНЯТА ДО ПРЕ-РЕГА И ПЕЧАТАЕТСЯ ЦЕЛИКОМ

Проверки годности (не эндпойнты) сняты раньше этого текста, и это объявляется прямо:

RQ  16/16 finish=stop · prompt_tokens 468548 (медиана 515) · доля кириллицы 0.9951.000
    медиана длины выхода 1 708 знаков · всего уплачено $0.01514
RE  16/16 finish=stop · prompt_tokens 2 9042 984 (медиана 2 951) · кириллица ≥0.997
    медиана длины выхода 1 698 знаков

⇒ Материал годен: обе половины дуэли — законченные русские переводы сопоставимой длины. Гейт правильности файла — числом, а не именем (rol.FOREIGN["RQ"]["prompt_tokens"] = (300,900)): подложенный файл нормального арма роняет сборку, и это проверено селфтестом на больном входе.

Д36.3 ЧТО В ЭТОЙ ПАНЕЛИ НЕ УРАВНЕНО — НАЗЫВАЕТСЯ ДО ЗАМЕРА

  1. RQ и RE — родня: одна модель, один вызов, одни главы. Читатель может опознать родство текстуально, как опознавал Z0/ZF. ⇒ пол панели по паре Z0/ZF есть НИЖНЯЯ граница порога, и то же смещение действует на пару RQ/RE — в СТОРОНУ занижения разрыва.
  2. Три вендора в одной панели: RQ/RE — Google, Z0/ZF — DeepSeek (связка), ZDdeepseek-v4-flash. Межармовые сравнения через границу вендора несут вендор-эффект.
  3. Потолки вывода не уравнены (у RQ/RE max_tokens 32 000, у армов связки — свои).
  4. Размышление: у gemini-3.1-flash-lite уровень НЕ УСТАНОВЛЕН (вендор не публикует дефолт для этого слага, 00-provider-quirks.md:55), и reasoning_tokens=0 у Gemini — норма поля, а не измерение. ⇒ конфигурация испытуемого и компаратора идентична друг другу, но в абсолютных терминах неизвестна. Для дуэли это не важно (фактор один), для переноса — важно.
  5. Объём инструкции играет ЗА RQ: у него на входе в 5.7 раза меньше токенов. Если он проиграет — вывод сильнее объявленного; если выиграет — слабее.

Д36.4 ДВА ПРИБОРА И ПЕРВИЧНЫЙ ЭНДПОЙНТ

Прибор 1 — счётный, детерминированный. eval/dovodka/schet.py (sha256 1e292d1d…, фриз bedc39a) на четырёх классах: род · язык · приём · банк. Детекторы, эталон и правила классификации заморожены с 22.08 и в этой сессии не тронуты ни на строку — это то же условие, на котором стоял вердикт панели-0.

Прибор 2 — ранговый. Слепое чтение, claude-fable-5, модель задаётся ЯВНО при запуске и сверяется по транскриптам ПОСЛЕ прогона (решение Д34.2; заявление о намерении моделью не является — урок Д33.6). Обёртка eval/dovodka/prompts/reader-wrapper.md, sha256 15cfac60…, та же, что во вторых чтениях и в пере-суде панели-0. По одному читателю на главу, 16 новых сессий.

ПЕРВИЧНЫЙ ЭНДПОЙНТ — СИСТЕМАТИЧЕСКИЙ ЗНАК КОНТРАСТА RE ↔ RQ ПО ГЛАВАМ, парный знаковый тест, p<0.05 двусторонний. Так велел план: «Решает систематический знак, а не величина разрыва». Потолок значимости при n=16 — 2/2¹⁶, дизайн мощности не лишён; при 12 главах в одну сторону p≈0.077, при 13 — p≈0.021, то есть для вывода нужно не менее 13 глав из 16 в одну сторону (при отсутствии связок). Это печатается ДО чисел.

Вторичные: (i) величина разрыва в местах против собственного порога панели (конъюнкция: |Δ|>порог И p<0.05); (ii) те же четыре дефект-класса счётным прибором, парный знаковый; (iii) контроль пола Z0/ZF; (iv) контроль декоя — ZD обязан оказаться последним.

Порог считается собственным полом панели (пара Z0/ZF), как в Д32 и Д34; априорный MDE рангового прибора при n=16 и k=5 держится около двух мест — поэтому величина разрыва объявляется ОПИСАТЕЛЬНОЙ, а несущим остаётся ЗНАК.

Д36.5 ПРАВИЛО РЕШЕНИЯ, ОБЪЯВЛЕННОЕ ДО ЧИСЕЛ. ВСЕ ТРИ ИСХОДА

  • RE систематически лучше RQ (знак есть, p<0.05). У прибора ЕСТЬ разрешение на промт-инженерном материале, и вес ролевого промта известен в местах. Тогда каждое «неразличимо» дуги получает шкалу: «эффект меньше, чем весь ролевой промт, во столько-то раз».
  • Знака нет (p≥0.05). Худший исход, и печатать его придётся первым. Он означает, что прибор не разводит даже полное исчезновение промта, ⇒ ни один промт-инженерный вывод фазы (экзамен на смелость RN/RC/RB, абляция Д21, «роль лучше склейки») не имеет под собой разрешения, и это сносится в каждую строку, где такой вывод стоит.
  • RQ систематически ЛУЧШЕ RE. Промт ВРЕДИТ на этом жильце. Печатается первым и отдельно; для продукта это означает, что ролевой промт, писанный под сильную модель, на слабой работает против неё — и тогда «промт — часть арма» надо читать как «промт — часть ПАРЫ модель×промт».

Что этот шаг НЕ закрывает, объявляю заранее: он не переносится на другого жильца (один gemini-3.1-flash-lite), не переносится на китайскую пару, и не говорит ничего об оси ВЕРНОСТИ владельца (Д30). Он даёт шкалу ОДНОГО прибора на ОДНОМ жильце.

Д36.6 ПРЕДСКАЗАНИЕ, КОТОРОЕ МОЖНО ОПРОВЕРГНУТЬ, И ОНО ЗАПИСАНО ДО СЧЁТА

Из Д35.3 следует не только формулировка арма, но и проверяемое предсказание счётного прибора:

глоссарий у RQ ЕСТЬ, ролевого промта НЕТ ⇒ по классу «банк» армы RQ и RE должны оказаться БЛИЗКИ, а расходиться обязаны классы, которые несёт ролевой промт: «язык» (мандат «выведи ТОЛЬКО перевод», правила передачи французского слоя, запрет латиницы на именах) и «приём» (в промте о типографике не сказано ничего — предсказываем ноль различия), плюс проза, которую счётный прибор не видит вовсе.

Если по классу «банк» окажется большая разница — интерпретация Д35.3 неверна, и её надо пере-открывать, а не подгонять. Предсказание записано именно для этого.

Д36.7 ПРОЦЕДУРА И СВЕРКИ ДО ЧТЕНИЯ

  1. rol.py --emit-read en --panel=RQ,RE,Z0,ZF,ZD --tag=p4 --each --n=16 — один пакет на главу.
  2. rol.py --verify-read en --tag=p4 — побайтная сверка каждого текста с клеткой своего арма, исходник главы, раскладки, имена армов в пакете, побайтно совпадающие армы, гейт длины. ⚠ EXIT=0 сертификатом НЕ является (норма плана §6): вывод читается ГЛАЗАМИ.
  3. Ключ эмитируется ДО ответов, читателю не даётся; в пакете нет ни имён армов, ни строки «БЕЗ-ПРОМТА», ни вендоров, ни слова «однопроходка».
  4. runs.py --claim p4 en <uid8> ДО запуска каждого читателя; модель — параметром запуска.
  5. Аудит транскриптов ПОСЛЕ: поле model у всех 16 агентов обязано быть claude-fable-5.
  6. READERS-p4.json пишется ДО прогона (долг Д33.6 закрывается по норме, а не задним числом).

Д36.8 РЕЗУЛЬТАТ ШАГА 4. ПРИБОР РАЗРЕШАЕТ ПРОМТ — И ЭТО ЕГО ПЕРВАЯ ШКАЛА

16 глав, 16 новых сессий #155#170, модель читателя задана ЯВНО и сверена ПОСЛЕ прогона по транскриптам: 16 транскриптов, 136 записей поля model, ВСЕ claude-fable-5, иных значений нет. Аудит слепоты по вызовам инструментов: читатели открывали ТОЛЬКО свой пакет и свой файл ответа; обращений к ключам, сырью, чужим каталогам и суффиксу карантина — ноль; каждый пакет упомянут ровно в ОДНОМ транскрипте (перекрёстного чтения нет). Сборка: 80 текстов побайтно против клеток, 16 разных раскладок, побайтно совпадающих армов нет.

арм ср. место (из 5) места по главам
ZF 2.00 3 1 2 5 1 1 2 1 1 1 2 1 1 3 2 5
Z0 2.25 1 4 3 2 2 2 4 5 2 2 1 2 2 2 1 1
RE 2.81 2 3 1 1 4 3 1 2 5 4 4 3 4 1 3 4
ZD (декой) 3.62 4 5 4 4 3 4 3 4 3 3 3 4 3 4 5 2
RQ 4.31 5 2 5 3 5 5 5 3 4 5 5 5 5 5 4 3

КОНТРОЛИ ЧИТАЮТСЯ ПЕРВЫМИ.

  • Пол — близнецы Z0/ZF расходятся на +0.25 места при пороге 1.43, p=0.4545: НЕразличимы, как и обязаны.
  • ДекойZD (голый черновик) в нижней половине 15 глав из 16 и различимо хуже ОБЕИХ половин боевой связки (Z0↔ZD +1.38 при пороге 0.85, p=0.0042; ZF↔ZD 1.62 при 1.16, p=0.0042). ⇒ панель разрешает, и это сказано ДО того, как читать испытуемого.

Д36.8а ДЕВИАЦИЯ, КОТОРУЮ ПЕРВАЯ РЕДАКЦИЯ НЕ НАПЕЧАТАЛА: ДЕКОЙ НЕ ОКАЗАЛСЯ ПОСЛЕДНИМ

Фриз Д36.1 говорит дословно: «Панель, где известно плохой арм не оказался последним, аннулируется целиком», и Д36.4 (iv): «контроль декоя — ZD обязан оказаться последним». Факт: ZD 3.62, а последний — сам испытуемый RQ 4.31. По БУКВЕ замороженного правила панель подлежит аннулированию, и первая редакция Д36.8 этого не напечатала: она молча предъявила ДРУГОЙ критерий («в нижней половине 15/16 и различимо хуже обеих половин связки»), которого во фризе не было. Поймано адверсариальной приёмкой (Д40.2, находка 1). Класс ошибки — тот самый, что фаза ловит у себя постоянно: контроль, пере-читанный под результат.

Что я делаю и чего НЕ делаю.

  • Панель НЕ аннулирую решением сессии — «резать панель, ось или кандидата решением сессии ЗАПРЕЩЕНО» (план §6), и это ровно тот случай: СТОП и вопрос приёмке.
  • Печатаю обе стороны, чтобы решал не я. ПРОТИВ: буква фриза нарушена, и «первичный эндпойнт исполнен ровно как объявлен» относится к ЗНАКОВОМУ тесту, а не к контролю. ЗА: цель контроля — доказать, что панель РАЗРЕШАЕТ, — достигнута (ZD различимо хуже обеих половин боевой связки, p=0.0042 дважды), и ниже ZD оказался ровно один арм — испытуемый, и это сам результат замера, а не отказ прибора. Формулировка фриза молча предполагала, что хуже декоя не окажется ничего; предположение не сбылось.
  • И у контроля есть НЕЗАВИСИМОЕ подтверждение, которое от чтения не зависит вовсе: счётный прибор ставит ZD худшим по своей оси — 13 глав с фаталом из 16 и 28 фаталов против 610 у прочих. То есть «известно плохой арм — худший» на детерминированном приборе ДЕРЖИТСЯ.
  • Диспозиция, которую я оставляю приёмке: если читать фриз буквой — Шаг 4 не закрыт и панель пере-собирается с другим декоем; если читать целью — контроль пройден, и тогда его КРИТЕРИЙ во фризе следующей панели надо писать как «известно плохой арм различимо хуже якорей», а не «должен быть последним». Моя рекомендация — вторая, и я её называю рекомендацией, а не вердиктом.

Полная матрица контрастов (парный знаковый; ⚠ порог — по sd КАЖДОГО контраста, а не единый пол панели: так считает риг во всей фазе (Д32, Д34, Д37 печатают разные пороги для одного контраста по кругам), и формулировка фриза Д36.4 «порог считается собственным полом панели» описывала риг НЕВЕРНО — поймано той же приёмкой, находка 2. Что меняется при чтении по букве фриза, то есть при едином пороге 1.43: первичный эндпойнт устоял бы — RE↔RQ 1.50 > 1.43, устояли бы и Z0↔RQ, ZF↔RQ, ZF↔ZD; отпал бы ОДИН контраст — Z0↔ZD 1.38, то есть половина контроля декоя. Ни один вывод секции на этом не стоит):

Конвенция знака, единая для всей таблицы: «разрыв» = среднее место ВТОРОГО арма минус среднее место ПЕРВОГО, то есть плюс значит «второй хуже». Первая редакция этой таблицы взяла три строки (Z0↔ZF, ZF↔RE, ZF↔ZD) из прогонов с ДРУГИМ якорем и напечатала их знак зеркально — поймано адверсариальным пере-счётом (Д40.1); вердикты от этого не двигались, они считаются по |Δ|.

контраст разрыв порог p вердикт
Z0 ↔ ZF (пол) 0.25 1.43 0.4545 пол годен
Z0 ↔ RE +0.56 1.42 0.4545 в пределах
ZF ↔ RE +0.81 1.51 0.4545 в пределах
ZD ↔ RE 0.81 1.24 0.4545 в пределах
ZD ↔ RQ +0.69 0.98 0.0768 в пределах (на грани)
Z0 ↔ ZD +1.38 0.85 0.0042 РАЗЛИЧИМ (декой)
ZF ↔ ZD +1.62 1.16 0.0042 РАЗЛИЧИМ (декой)
RE ↔ RQ +1.50 1.13 0.0213 РАЗЛИЧИМ — первичный эндпойнт
Z0 ↔ RQ +2.06 1.22 0.0042 РАЗЛИЧИМ
ZF ↔ RQ +2.31 1.30 0.0042 РАЗЛИЧИМ

ПЕРВИЧНЫЙ ЭНДПОЙНТ ИСПОЛНЕН РОВНО ТАК, КАК ОБЪЯВЛЕН. Пре-рег Д36.4 требовал «не менее 13 глав из 16 в одну сторону»: получено 13 из 16 (RQ хуже RE в 13 главах, лучше в 3, связок нет), знаковый p=0.0213, и разрыв 1.50 больше собственного порога 1.13 — конъюнкция пройдена.

⇒ По правилу, объявленному ДО чисел: у рангового прибора ЕСТЬ разрешение на промт-инженерном материале. Худший исход («знака нет») не наступил — и хорошо, потому что он снёс бы подписи под всей дугой Д21Д25.

Д36.9 ШКАЛА, РАДИ КОТОРОЙ ШАГ И ДЕЛАЛСЯ

Разрывы этой панели переведены в доли собственного порога — только так они сопоставимы с панелями другой длины (у p4 шкала из 5 мест, у arch2 из 11):

удалить ВЕСЬ ролевой промт  (RE↔RQ)   1.50 / 1.13 ≈ 1.3 порога
удалить дорогую стадию      (Z0↔ZD)   1.38 / 0.85 ≈ 1.6 порога
то же на панели arch2       (Z0↔ZD)   4.12 / 2.39 ≈ 1.7 порога (круг 1)
                                       4.92 / 2.10 ≈ 2.3 порога (круг 2)
вся середина архитектур     (arch2)   < 1.0 порога В ОБОИХ КРУГАХ И ОБОИХ СЕМЕЙСТВАХ

⚠ Отношения печатаются с ОДНИМ знаком намеренно: они посчитаны из уже округлённых разрывов и порогов, и второй знак у них не заслужен (пере-счёт из неокруглённых даёт 1.32 и 1.61).

Прибор фазы разводит эффекты величиной 1.32.3 собственных порога и не разводит ничего ниже одного. А значит каждое «неразличимо» этой фазы теперь имеет размер, а не только знак:

всё, что фаза назвала неразличимым, меньше, чем разница между текстом с полным ролевым промтом и текстом вообще без него.

Это и есть ответ Шага 4 в той форме, в какой его заказывал план — с поправкой, которую сам же план не знал: это вес РОЛЕВОГО промта (2 436 токенов из 2 566, то есть 95%), а не «всего промта», потому что глоссарий до модели доехал (Д36.0). И он оказался соизмерим с весом целой дорогой стадии — удаление промта стоит 1.33 порога, удаление дорогой модели 1.622.34.

Д36.10 И ГЛАВНОЕ: ПРОМТ ПОКУПАЕТ ПРОЗУ, А НЕ БРАК. ДВА ПРИБОРА РАСХОДЯТСЯ ОСМЫСЛЕННО

Счётный прибор (детекторы и эталон заморожены с 22.08, не тронуты) на той же панели:

класс RQ RE Z0 ZF ZD
род 1/16 0/16 0/16 0/16 0/16
язык 1/16 0/16 0/16 0/16 2/16
приём 0/16 0/16 1/16 0/16 1/16
банк 4/16 8/16 7/16 6/16 12/16
глав с ≥1 фаталом 6/16 8/16 8/16 6/16 13/16
  • Первичное правило счётчика: RQ RE = 2 главы, 6 глав с разницей, 4 из них в пользу RQ, p=0.6875 — НЕ РАЗЛИЧИМО. То есть по классу А (брак) снятие ролевого промта не ухудшает ничего.
  • Декой счётчик тоже ловит (RQ↔ZD p=0.0156 по первичному, ZF↔ZD p=0.0156; по числу фаталов все четыре контраста против ZD p≤0.0063) ⇒ счётчик на этой панели не слеп, и «RQ ≈ RE» не есть его слепота.

Ролевой промт весом 2 436 токенов покупает ПРОЗУ и не покупает БРАК. Ранговый прибор, который читает прозу, разводит его различимо; счётный, который считает фаталы, — нет.

И это НЕ вывод из «p>0.05», хотя выглядит похоже. Три причины, почему нуль здесь содержателен:

  1. Прибор на этой панели НЕ слеп — грубый декой он ловит тем же первичным правилом (RQ↔ZD p=0.0156, ZF↔ZD p=0.0156), то есть у него хватает разрешения на эффект размера «нет дорогой модели вовсе».
  2. Потолок мощности здесь НЕ мешал. Правило даёт p<0.05 начиная с ШЕСТИ глав с ненулевой разницей, все в одну сторону. У контраста RQRE таких глав ровно шесть — значит значимость была ДОСТИЖИМА, и не достигнута она не потому, что глав мало, а потому, что разница разошлась в обе стороны: 4 главы в пользу RQ, 2 в пользу RE.
  3. Третий прибор говорит в противоположную сторону на своей оси. Класс Б («читается машинным») — это ПРОЗА, и он разводит те же два арма с запасом: 9 глав из 16 против 0, p=0.0039. ⇒ Расхождение приборов здесь — не разная чувствительность, а разные оси: то, что промт двигает, счётчик по построению не считает.

И это смыкается с минимаксом владельца, добавляя к нему третий член. Консилиум записал: «по браку несут ГЕЙТЫ, по прозе — РОСТЕР». Замер добавляет: по прозе несёт ещё и ПРОМТ, и его вес того же порядка, что вес дорогой стадии.

КЛАСС Б — «читается откровенно машинным», разобрано ГЛАЗАМИ по строкам, а не грепом (греп дал 39 строк-кандидатов, из них ложных — из-за перекрёстных ссылок читателей между вариантами — оказалось больше трети; каждая строка разобрана вручную. ⚠ Правило приписки, и первая редакция описала его СИЛЬНЕЕ, чем оно есть (поймано адверсариальным пере-счётом, Д40.1): где метка названа в самом предложении — приписка по ней, и это перекрывает секцию; где не названа (в 3 главах из 9) — по секции, в которой предложение стоит. Хеджированные утверждения («целиком не назову», «машинный ПРИВКУС») в счёт НЕ идут — критерий одинаков для всех армов):

RQ  9/16 глав   RE 0/16   ZF 0/16   Z0 1/16   ZD 23/16
парно RQ против RE: 9 глав различия, ВСЕ в одну сторону, знаковый p=0.0039

Текст без ролевого промта читатель называет машинным в каждой ВТОРОЙ главе; тот же текст с промтом — НИ РАЗУ. И это НЕ «третий прибор», как писала первая редакция (поймано приёмкой, находка 4): класс Б снимается с ТЕХ ЖЕ 16 читательских сессий, что и ранги, — тот же читатель, та же модель, тот же транскрипт. Это вторая ось ОДНОГО чтения, и согласие двух её выходов независимым подтверждением не является. Независимый прибор здесь ровно один — счётный, и он ранговый вердикт как раз НЕ подтверждает (см. ниже: у него другая ось). ⚠ Метка сравнительная (читателя просят назвать худших ВНУТРИ панели), поэтому абсолютную норму класса Б она по-прежнему не грунтует — см. Д32.12 и долг Шага 5.1.

Д36.11 ПРЕДСКАЗАНИЕ Д36.6 СБЫЛОСЬ НАПОЛОВИНУ, И ВТОРАЯ ПОЛОВИНА ПРОВАЛИЛАСЬ

Пре-рег предсказал три вещи. Печатаю все три, включая провал.

предсказано ДО чисел факт вердикт
по классу «банк» RQ и RE близки (глоссарий доехал до обоих) попаданий 4 против 10; глав с потерей канона 4/16 против 8/16; различие в 5 главах, ВСЕ в пользу RQ, p=0.0625 НЕ ДЕРЖИТСЯ по существу, хотя держится по букве. p>0.05 — но 5 глав из 5 в одну сторону, и это единогласие. Честно: предсказание «близки» ОПРОВЕРГНУТО направлением и не подтверждено значимостью; ⚠ единицы в этой строке РАЗНЫЕ (попадания и главы) — первая редакция смешивала их молча
класс «язык» разойдётся (мандат «выведи ТОЛЬКО перевод», правила французского слоя — в промте) RQ 1, RE 0, ZD 2 — класс не разводит никого НЕ СБЫЛОСЬ
класс «приём» — ноль различия (о типографике промт молчит) RQ 0, RE 0 ✔ сбылось (тривиально: класс применим к одной главе)

Что делать с единогласным «банком» — и чего НЕ делать. Сначала признаю двойной стандарт первой редакции (приёмка, находка 3): одно и то же свидетельство (p=0.0625, 5 глав единогласно) она объявила слишком слабым, чтобы сработал СОБСТВЕННЫЙ фриз-триггер пере-открытия Д36.6, и достаточным, чтобы породить новую гипотезу. Единый стандарт: свидетельство одно и то же, и оно НЕ ЗНАЧИМО, но ЕДИНОГЛАСНО ПО НАПРАВЛЕНИЮ; из него не следует ни вердикта, ни отмены триггера — следует ГИПОТЕЗА, и обе стороны ниже помечены именно так. Он НЕ опровергает Д35.3, а подтверждает её с другой стороны: RQ держит банк лучше всех пяти армов, а без доехавшего глоссария он выглядел бы как ZD (12/16 глав с потерей канона). Механизм, который единственный мог дать ему такой результат, — тот самый глоссарий, оставшийся последним системным сообщением. ⇒ Гипотеза, НЕ вердикт (p=0.0625): 2 436 токенов ролевого промта РАЗБАВЛЯЮТ 130 токенов глоссария. Проверяется дёшево — тем же вызовом с глоссарием в начале и в конце склейки; в этой фазе не проверялась и вердиктом не объявляется.

Провал предсказания по классу «язык» назван прямо: правила промта о выходе и о французском слое НЕ дали измеримой разницы. Модель без всякой инструкции выдала русский текст без английских кусков. ⇒ «язык» как класс держится не промтом, а самой моделью — и норма класса А по этой оси не должна опираться на текст инструкции.

Д36.12 ПАСПОРТ РАЗРЕШЕНИЯ ПАНЕЛИ p4

ПАСПОРТ: приборов ТРИ · ранговый (слепое чтение claude-fable-5, 1 чтение/глава, семейств 1,
         модель ДОКАЗАНА транскриптами) + счётный (детерминированный, эталон по исходнику,
         заморожен 22.08) + класс Б (сравнительная метка «машинный», разобрана глазами)
n = 16 английских единиц = 7.89 главы Гу · k = 5 армов · тег p4 · клетки ФД-N, ФД-B, ФД-J
пол |Z0ZF| = 1.75 места из 5 · парный разрыв +0.25 при пороге 1.43 — пол годен
ГРУБЫЙ ДЕКОЙ ЕСТЬ (ZD): различим против обеих половин связки, p=0.0042 — панель разрешает
правило: |Δ| > собственного порога И знаковый p<0.05
СЛЕП К: ранговый — эффектам ниже ~1 порога · кросс-главной консистентности · оси ВЕРНОСТИ
        владельца · абсолютному уровню класса Б
        СЧЁТНЫЙ — своего MDE не имеет напечатанным; его потолок мощности: p<0.05 недостижим,
        пока глав с ненулевой разницей меньше ШЕСТИ. У контраста RQRE их ровно шесть ⇒ значимость
        была достижима и не достигнута из-за РАЗНОНАПРАВЛЕННОСТИ (4 против 2), а не из-за размера
        панели. Чувствительность счётчика доказана только на эффекте масштаба ZD (13/16 против 68)
   ⚠ КЛАСС Б — НЕ независимый прибор: те же 16 сессий, что и ранги (вторая ось одного чтения)
НЕ УРАВНЕНО: RQ/RE — один вендор, Z0/ZF/ZD — другой · потолки вывода · уровень размышления
        gemini НЕ УСТАНОВЛЕН вендором · объём инструкции у RQ в 5.7 раза меньше (играет ЗА него)
ОДИН КРУГ: внутрисемейного повтора у панели нет — как и у всех панелей фазы

Шаг 4 плана 22.08 ЗАКРЫТ. Известен вес всего ролевого промта в единицах прибора, и известно, на какой оси он лежит.


Д37 — ТРЕТИЙ КРУГ ПАНЕЛИ-0: ВНУТРИСЕМЕЙНЫЙ ШУМ. ПРЕ-РЕГ, ЗАПИСАН ДО ЧИСЕЛ

Долг назван самой фазой и не закрыт ничем. Д34.5 записала дословно: два перевёрнутых вердикта из 22 «я не могу отличить от обычного читательского шума: внутрисемейного повтора нет ни у одной панели, значит базовой линии „сколько вердиктов переворачивается при ТОМ ЖЕ семействе“ не существует». Там же названа цена — 16 сессий, повтор панели-0 тем же fable, и там же признано, что от этого замера я сам отговаривал, оценивая его по нуждам эксперимента, а не по вопросу владельца «можно ли подменить судью».

И это дыра не одной секции. Каждый паспорт разрешения фазы печатает порог, но ни один не знает, какая доля этого порога — собственный шум прибора. Строка «ДОЛЯ ЧИТАТЕЛЯ В ПОРОГЕ = 0.27» после эрраты Д33.6 переименована в долю СМЕНЫ СЕМЕЙСТВА, и своего числа у паспортов не осталось.

Д37.0 ПРОЦЕДУРА

Панель p0 (RG · E6 · Z0 · ZF), те же 16 английских глав. Пакеты и ключи НЕ ТРОНУТЫ и НЕ пере-эмитируются — пере-эмиссия переписала бы раскладку уже прочитанной панели и превратила бы оба прежних круга в мусор. Ответы круга 1 (opus-5) лежат в opus/, круга 2 (fable-5) — в fable/; круг 3 пишет по прежнему впечатанному в пакет пути и уезжает в fable2/. Заготовки ответов по умолчанию пере-создаются той же строкой, что их создаёт emit_read.

Читатель — claude-fable-5, задан ЯВНО, сверяется по транскриптам ПОСЛЕ. Обёртка — reader-wrapper.md sha256 15cfac60…, побайтно та же, что у круга 2: иначе замер померяет разницу обёрток, а не разброс прибора. 16 новых сессий, по одной на главу.

Д37.1 ЧТО ОБЪЯВЛЕНО ДО ЧИСЕЛ

Три круга дают три пары. fable ↔ fable2 — ВНУТРИСЕМЕЙНЫЙ разброс (чистый шум прибора); fable ↔ opus и fable2 ↔ opusМЕЖСЕМЕЙНЫЙ (шум + семейство).

Метрики: (i) медиана Спирмена по главам в каждой паре; (ii) число ПЕРЕВЁРНУТЫХ вердиктов по трём контрастам E6↔RG, E6↔Z0, E6↔ZF внутри семейства против между семействами; (iii) поармный сдвиг среднего места со знаковым тестом; (iv) доля шума в пороге — медиана |разность кругов| к порогу панели, отдельно для внутри- и межсемейной пары.

Д37.2 ПРАВИЛО РЕШЕНИЯ, ОБЪЯВЛЕННОЕ ДО ЧИСЕЛ

  • Внутрисемейный разброс СОПОСТАВИМ с межсемейным ⇒ смена семейства стоит не дороже повтора тем же прибором; два перевёрнутых вердикта из 22 (Д34.5) объясняются шумом, а не вкусом; подмена судьи по этой оси не запрещена, и гипотеза «opus весит прозу выше брака» лишается единственной числовой опоры.
  • Внутрисемейный ЗАМЕТНО МЕНЬШЕ межсемейногоу семейства есть собственный вклад сверх шума; подмена судьи стоит дороже повтора, и асимметрия риска Д34.5 (систематическое завышение гладкого текста с дефектами) остаётся в силе как продуктовый довод.
  • Внутрисемейный БОЛЬШЕ межсемейного — худший исход и печатается первым: прибор шумит сильнее, чем различаются семейства, ⇒ все поармные сравнения между кругами фазы есть шум, и это сносится в паспорт каждого вердикта, где сравнение кругов участвовало.

Чего замер НЕ закроет, объявляю заранее: норму П-1 он не исполняет ни при каком исходе (fable-5 и opus-5 — одна лаборатория и одна линия обучения, Д33.9) · ось ВЕРНОСТИ владельца он не трогает · счётную часть панели-0 он не проверяет · при ЧЕТЫРЁХ армах Спирмен принимает всего пять значений, поэтому все его величины крупнозернисты (Д34.4).

Д37.3 РЕЗУЛЬТАТ: ПО ОБЪЯВЛЕННЫМ МЕТРИКАМ СМЕНА СЕМЕЙСТВА НЕ ДОРОЖЕ ПОВТОРА

16 глав, 16 новых сессий #171#186. Модель сверена ПОСЛЕ прогона по транскриптам: 16 транскриптов, 204 записи поля model, ВСЕ claude-fable-5. Аудит слепоты: обращений к ключам, сырью и чужим каталогам — ноль; каждый пакет ровно в одном транскрипте. Пакеты и ключи не тронуты.

Три круга дают три пары — одну внутрисемейную и две межсемейные:

пара медиана ρ среднее ρ минимум ρ доля читателя в пороге перевёрнутых вердиктов
fablefable2 — ВНУТРИ семейства +0.80 +0.83 +0.40 0.34 0 из 3
fableopus — МЕЖДУ +0.80 +0.71 1.00 0.43 0 из 3
fable2opus — МЕЖДУ +1.00 +0.75 1.00 0.32 0 из 3

Поармный сдвиг: 0 армов из 4 различимо — и внутри семейства (наибольший +0.25, p=0.22), и между семействами (наибольший +0.38, p=0.22).

По правилу, объявленному в Д37.2 ДО чисел, срабатывает ПЕРВАЯ ветка. Внутрисемейная доля 0.34 лежит МЕЖДУ двумя межсемейными (0.32 и 0.43); медианы Спирмена совпадают; перевёрнутых вердиктов нет нигде. Смена семейства читателя стоит не дороже повтора тем же прибором — по этой оси подмена судьи не запрещена. ⚠ «Лежит между» — это НЕ доказанная эквивалентность, и первая редакция писала «от них неотличима» без всякого теста (приёмка, находка 5). Теста на эквивалентность здесь нет вовсе, а 0.34 формально БОЛЬШЕ одной из двух межсемейных долей (0.32). Честная форма: разницы не видно на шести парах армов при 16 главах, и мощность этой проверки не считалась. И у сработавшей ветки была ТРЕТЬЯ клауза, которую первая редакция опустила молча: фриз Д37.2 писал, что при этом исходе «гипотеза „opus весит прозу выше брака" лишается единственной числовой опоры». Опускать её нельзя, а исполнить — тоже: Д37.4 ниже показывает ровно обратное. ⇒ Замороженное правило на этом исходе САМОПРОТИВОРЕЧИВО, и это говорится прямо, а не заминается: агрегат сработал по ветке 1, хвост — против её третьей клаузы. Урок для следующего пре-рега: правило решения не должно связывать агрегатную метрику с выводом о ХВОСТЕ.

И у паспортов фазы наконец появилось СВОЁ число. Строка, которой не было ни у одного вердикта:

ДОЛЯ ЧИСТО ЧИТАТЕЛЬСКОГО ШУМА В ПОРОГЕ = 0.34 (медиана по 6 парам армов, повтор ОДНИМ семейством на одних текстах). То есть треть наблюдаемого разброса — сам прибор, две трети — текст. Прежняя цифра 0.27 была долей ПОЛНОЙ СМЕНЫ СЕМЕЙСТВА (Д33.7) и на этот вопрос не отвечала.

Побочно: вердикт о буфере устоял ТРЕТИЙ раз. Контраст E6 ↔ RG — единственный различимый на этой панели — прошёл конъюнкцию во всех трёх кругах: opus +1.12 при пороге 0.99, p=0.0042 · fable +1.19 при 0.87, p=0.0213 · fable2 +1.19 при 0.90, p=0.0042. Три независимых чтения, два семейства.

Д37.4 НО АГРЕГАТ ОПЯТЬ ПРЯЧЕТ ХВОСТ — И НА ЭТОТ РАЗ ХВОСТ ВОСПРОИЗВЁЛСЯ

Средние совпали, а минимумы разошлись на всю шкалу, и это разошлось не случайно:

глава 197f98eb61 — та единственная, где у автора стоит типографский приём «P A T I E N C E»

    fable  ↔ fable2   ρ = +1.00     ← два НЕЗАВИСИМЫХ круга одного семейства совпали ТОЧНО
    fable  ↔ opus     ρ = 1.00     ← полный переворот
    fable2 ↔ opus     ρ = 1.00     ← ТОТ ЖЕ полный переворот, воспроизведён другим кругом

Внутри семейства ни одна из 16 глав не переворачивается — худшее согласие +0.40. Между семействами переворачивается ровно одна, и обе межсемейные пары переворачивают ОДНУ И ТУ ЖЕ.

Гипотеза Д34.5 («opus весит прозу выше брака, чем fable») перестала быть наблюдением на одной главе и стала ВОСПРОИЗВЕДЁННЫМ фактом об этой главе. Напомню механизм (Д34.4): RG сохранил разрядку, но не перевёл её — оставил латиницей; fable за непереведённый кусок исходника поставил его ПОСЛЕДНИМ (брак решает раньше прозы, по букве правила пакета), opus за прозу — ПЕРВЫМ. Теперь известно, что первое решение воспроизводится независимым кругом, а второе с ним расходится полностью.

ЧЕСТНАЯ РАМКА, И ОНА ВАЖНЕЕ САМОЙ НАХОДКИ. Правило решения Д37.2 объявляло метрики (i)(iv), и по ним сработала первая ветка — так и записано выше. Метрика (i) объявляла МЕДИАНУ Спирмена; минимум — другая статистика, и то, что риг печатает её в той же строке, пре-регистрацией не является (первая редакция называла это «печатается той же метрикой» — натяжка, снята приёмкой, находка 5). ⇒ и статистика, и интерпретация «хвост есть свойство семейства» — ПОСТ-ХОК, выдавать их за пре-регистрированный вывод нельзя. Что её усиливает сверх обычного пост-хока: она воспроизведена двумя независимыми кругами, а не найдена перебором. Что её ограничивает: одна глава из шестнадцати, то есть это установленный факт об ЭТОЙ главе и обоснованная гипотеза о классе — не измеренная частота.

Д37.5 ЧТО ЭТО ЗНАЧИТ ДЛЯ ВОПРОСА «МОЖНО ЛИ ПОДМЕНИТЬ СУДЬЮ»

  • По средним — да. Ни одна из объявленных метрик не находит разницы между «повторить тем же семейством» и «сменить семейство». Экономия на судье по этой оси оправдана.
  • По хвосту — с названным риском. Расхождение семейств не размазано по всем главам, а сосредоточено там, где сталкиваются брак и проза; в этой точке opus систематически прощает брак за прозу. На масштабе это ровно тот исход, против которого строится продукт (класс А), и асимметрия риска Д34.5 остаётся в силе.
  • Рабочая формулировка: судью подменять можно, но не на оси, где решается «брак против прозы» — там прибор обязан быть тем же, каким снята калибровка, и это fable-5 (решение владельца 20.08, Д34.2).
  • Норма П-1 НЕ исполнена и этим замеромfable-5 и opus-5 одной лаборатории и одной линии обучения. Третий круг говорит про ШУМ, а не про ВКУС ЛИНИИ.

Д37.6 ПАСПОРТ, КОТОРЫЙ ТЕПЕРЬ МОЖНО ПЕЧАТАТЬ ПОД ЛЮБЫМ ВЕРДИКТОМ ФАЗЫ

ШУМ ПРИБОРА (замерен 29.08, панель p0, три круга, 48 чтений):
  доля ЧИСТО читательского шума в пороге          0.34   (повтор одним семейством)
  доля СМЕНЫ СЕМЕЙСТВА в пороге                   0.320.43  (fable↔opus, две пары)
  согласие порядков внутри семейства              медиана ρ +0.80 · минимум +0.40
  согласие порядков между семействами             медиана ρ +0.80…+1.00 · минимум 1.00
  перевёрнутых вердиктов                          0 из 3 в каждой из трёх пар
  ⚠ полный переворот порядка НЕ случается внутри семейства и случается между ними —
    на одной главе из 16, воспроизведённо, там где сталкиваются брак и проза

Долг Д34.5 закрыт. Цена — 16 сессий, $0.


Д38 — ОТВЕТ НА ДВА ГЛАВНЫХ ВОПРОСА ВЛАДЕЛЬЦА

Вопросы взяты дословно из eval/dovodka/PLAN-22-08.md §1, где их записал сам владелец. Их там ТРИ, и это важно для честности ответа:

  • Вопрос 0 (метавопрос): живой художественный русский с консистентными терминами по ВСЕЙ книге. На него не отвечает ни один наш прибор — все панели фазы мерят ОДНУ главу. Статус — Д38.3, и он не изменился.
  • Вопрос 1: оптимальная архитектура пайплайна.
  • Вопрос 2: связка моделей для неё — без привязки к одному вендору.

⇒ Отвечаю на 1 и 2. Ноль остаётся открытым, и это говорится первым, а не в сноске.

Д38.0 ЧЕМ Я ОТВЕЧАЮ И ЧТО ОТКАЗЫВАЮСЬ ГОВОРИТЬ

В ответ идёт только то, что пережило хотя бы одно из: второе чтение · второе семейство · второй НЕЗАВИСИМЫЙ прибор. Всё прочее помечено как неустановленное прямо в строке. И одна строка ответа этих ворот НЕ проходит — говорю об этом здесь, а не мелким шрифтом. Результат Шага 4 (RE↔RQ, Д36) снят ОДНИМ кругом чтения одним семейством; класс Б, который согласен с ним, — не второй прибор, а вторая ось ТОГО ЖЕ чтения (Д36.10); а единственный независимый прибор — счётный — на своей оси разницы НЕ находит. ⇒ вес ролевого промта стоит на одном круге, и повтора у него нет. Что его держит вместо повтора: величина (больше собственного порога при обоих способах его считать), единогласие знака (13 глав из 16) и то, что панель в этом же прогоне доказала своё разрешение на декое. Чего это не заменяет — второго круга. Два числа, которых у фазы не было до 29.08 и которые теперь стоят под каждым «неразличимо»:

ШКАЛА  (Д36.9): «удалить ВЕСЬ ролевой промт» ≈ 1.3 порога · «удалить дорогую стадию» ≈ 1.62.3
                ⇒ всё, что фаза назвала неразличимым, МЕНЬШЕ полного ролевого промта
ШУМ    (Д37.3): доля чисто читательского шума в пороге = 0.34 (повтор одним семейством)
                ⇒ треть порога — прибор, две трети — текст

Д38.1 ВОПРОС 1 — АРХИТЕКТУРА. ОТВЕТ

Дефолт — ОДНО дорогое письмо, которого коснулось каждое слово, плюс детерминированный слой (гейты на хвосты · узкий канон-фиксер · ре-ген красной главы) плюс банк как носитель канона. ЧИСЛО ПРОХОДОВ — ВОПРОС ЦЕНЫ, А НЕ КАЧЕСТВА: между схемами второго прохода прибор рычага не находит, и решают цена, хвосты, детерминизм и наблюдаемость.

И вторая половина того же ответа — ДЕНЬГИ, потому что при неразличимом качестве решают именно они (полностью — Д41, на одном прайсе и в главах Гу):

БАННЕР 30.08: ЧИСЛА ЭТОГО АБЗАЦА ПЕРЕСЧИТАНЫ И ЧАСТЬЮ СНЯТЫ — см. Д41.1. «$62» и «вдвое дешевле» получены МЕДИАНОЙ двугорбого распределения (книга — сумма, а не медиана×N): честное отношение ≈×1.3, и оно ниже любой планки решения ⇒ клейм «однопроходка дешевле связки» СНЯТ как вывод. «В 6.3 раза» тем же механизмом → около ×4.4: рычаг замены редактора жив и остаётся крупнейшим в фазе, заголовок неверен. «Неразличимое качество, подтверждённое тремя кругами чтения» — ранговые выводы панелей потеряли силу до позиционного аудита (Д48.5).

боевая связка $127 за книгу, и 90% этих денег — РЕДАКТОР. Редактор ЗАМЕНЯЕМ: тот же черновик с редактором glm-5 стоит $20 — в 6.3 раза дешевле при неразличимом качестве, подтверждённом тремя кругами чтения, двумя семействами и вторым прибором. Однопроходка на той же дорогой модели — $62, вдвое дешевле связки. Самая дешёвая замеренная однопроходка (gpt-5.6-luna) — $7.6, но в прод не идёт: цензур-ось не мерена, китайских клеток нет. ⇒ **«Двупроходка против попыток её переизобрести» решается не качеством, а тем, кого ставить прод не идёт: у luna цензур-ось НЕ МЕРЕНА, у gemini — мерена и ПРОТИВ него (Д42).

На чём это стоит — семь замеров, каждый с тем, что его подтвердило:

что установлено чем и насколько твёрдо
Голый черновик различимо хуже боевой связки ZD↔Z0: +4.12 при пороге 2.39, p=0.006 (круг 1) и +4.92 при 2.10, p=0.0005 (круг 2, ДРУГОЕ семейство). Факт о тексте
А вот «всё, чего не касалась дорогая модель» — НЕВЕРНО обогащённый черновик Z8 был «различимо хуже» в круге 1 (p=0.039) и не пережил смену семейства (p=0.146) ⇒ вердикт снят. Честная форма: различимо хуже ГОЛЫЙ черновик
Вся середина архитектур неразличима ZP·Z7·Z1·Z8R·RN·RB·RC·ZF — «в пределах» в ОБОИХ кругах и ОБОИХ семействах. Самое сильное «неразличимо», какое фаза произвела
⇒ схемы решает ЦЕНА однопроходка-роль $46 на книгу · боевая связка $68 · критик → полный перепис $133. Качество прибор не разводит
Ставка владельца H-2б (смысловой критик → фиксер) НЕ подтверждена самая дорогая схема фазы при качестве, неотличимом от однопроходки; на zh ось объявлена описательной, A3/A0 порога не перешёл
Буфер архитектуры существует слабый жилец РЕДАКТОРОМ над боевым черновиком неотличим от боевого dspro в той же роли; он же ОДНОПРОХОДКОЙ различимо хуже — три круга чтения, два семейства (p=0.0042 · 0.0213 · 0.0042) и второй прибор (+13 фаталов, p=0.0312)
Детерминированный слой не бесплатен канон-фиксер чинит канон (zh: 48 щелей → 22) и несёт замеренный однонаправленный штраф читаемости 0.58 места (6 глав хуже, 0 лучше, p≈0.03). Это цена слоя, и она стоит в решении

И то, что добавил Шаг 4 сегодня — новая, отдельная строка ответа:

Ролевой промт весит столько же, сколько целая дорогая стадия (≈1.3 порога против ≈1.62.3), и весь его вес лежит на ПРОЗЕ, а не на браке. ⚠ Снято ОДНИМ кругом чтения (повтора нет). Ранговый прибор разводит «с промтом» и «без промта» различимо (+1.50 при пороге 1.13, p=0.0213; текст без промта читатель называет машинным в 9 главах из 16, с промтом — НИ РАЗУ). Детерминированный счётчик дефектов между ними разницы НЕ находит (p=0.6875) — при том, что грубый декой он на той же панели ловит.

Минимакс владельца получает третий член. Было: «по браку несут ГЕЙТЫ, по прозе — РОСТЕР». Стало: по прозе несут РОСТЕР и ПРОМТ, и промт того же порядка, что дорогая стадия.

ЧЕГО ЭТОТ ОТВЕТ НЕ ПОКРЫВАЕТ — читать вместе с ним

  1. Порядок ВНУТРИ середины не будет известен никогда при разумных бюджетах: эффект в 1.0 места стоит 40 глав Гу на zh и 68 на en, эффект 0.5 места — 160 и 271.
  2. Долг ZP закрывается ОБЪЯВЛЕНИЕМ, а не покупкой (план §7 п.5). Английская однопроходка-склейка несла КИТАЙСКИЙ мандат (Д30.1), пере-покупка стоит ~$0.4 и в резерв не влезает ⇒ несущий контраст дуги Д23 объявляется УСЛОВНЫМ, и легитимная английская однопроходка — это RN ($46), а не ZP ($41). Молча это не роняется.
  3. Кросс-главная консистентность не мерилась — это Вопрос 0.
  4. Ось ВЕРНОСТИ владельца прибором не покрыта: на его собственном чтении читаемость совпала с прибором точь-в-точь, а верность разошлась радикально — он ставит смелый текст первым, прибор последним. Наше правило чтения ставит эту ось ПЕРВОЙ ⇒ риск: прибор системно топит смелое письмо там, где владелец бы не топил. ⚠ Сегодня рядом с этим встало наблюдение изнутри прибора: на главе с типографским приёмом два семейства читателей развернули порядок по линии «брак против прозы» (Д37.4). Это ПОСТ-ХОК и одна глава из шестнадцати, и это АНАЛОГИЯ, а не та же ось: расхождение владельца с прибором — про ВЕРНОСТЬ оригиналу, расхождение семейств — про то, что решает раньше, непереведённый кусок или проза. Подтверждением риска владельца это не является; оно лишь показывает, что у прибора есть точка, где такая развилка вообще происходит.

Д38.2 ВОПРОС 2 — СВЯЗКА МОДЕЛЕЙ. ОТВЕТ

Дефолт письма — deepseek-v4-pro; запасной, вендоро-независимый — glm-5 С РАЗМЫШЛЕНИЕМ, втрое-вчетверо дороже. Всё остальное испытанное — либо закрыто, либо НЕ УСТАНОВЛЕНО, и «не хуже» про него писать нельзя. Платим не за вендора, а за КОНФИГУРАЦИЮ.

модель · конфигурация вердикт чем держится
deepseek-v4-pro дефолт письма якорь; ни один испытанный вендор его не обошёл
glm-5 с размышлением запасной, годен разрыв с якорем 0.08 при пороге 1.86 — ПЕРЕНОСИМ. Цена ×3.24.1, полосой
glm-5 БЕЗ размышления различимо хуже +2.61 места внутри одной модели, два прибора согласны
grok-4.3 на high ЗАКРЫТ +5.33…+5.75 при порогах 2.02.4, p=0.001 · 0.0005 · 0.0005 — единственный вендор-вердикт фазы, переживший второе чтение
grok-4.3 на low НЕ УСТАНОВЛЕНО вердикт ПЕРЕВЕРНУЛСЯ между кругами ⇒ читательский, в живые не идёт
gemini (все три ступени) прибор не решил «в пределах», но конъюнкцию рушит то порог, то знаковый тест — в разных кругах по-разному
gpt-5.6-luna прибор не решил то же самое зеркально. Строка Д29.2 «в дорогой роли НЕ мерен» устарела: 16 клеток RL куплены и отсужены
вендор-дефолт как конфигурация ЗАПРЕЩЁН конфигурация, про которую вендор не пишет, чем она является, ведёт себя как случайная величина

Дешёвая линия — КАНДИДАТЫ, не прод. Но первая редакция валила две модели в одну строку, и это было неверно в обе стороны (поймано сплошным чтением корпуса 29.08, Д42):

  • gpt-5.6-luna — цензур-ось действительно НЕ МЕРЕНА, ни в одной роли. Выделенным refusal-инструментарием он не гонялся ни разу; из линии OpenAI в эксп-02 был gpt-5-mini на 11 мягких PD-фрагментах. Все его бессобытийные проходы шли либо по материалу, из которого вырезан самый провокативный класс («ноль отказов здесь — свойство выборки, не моделей», 22-tenant-panel.md:418-422), либо по английской паре. ⇒ формулировка «кандидат до замера» для него ТОЧНА.
  • gemini-3.1-flash-lite — наоборот: его цензур-ось одна из самых промеренных в проекте, и замер против него. Тот же слаг в судейской роли на нашем вебновелльном материале дал 10 клеток content_filter: PROHIBITED_CONTENT (21-role-topology.md:241-245); на графичной эротике линия 3.x fail-closed с 8 провод-верификациями (D22.6); и фаза Д сама этим замером обосновала исключение gemini из китайской панели (Д29.2). ⇒ «кандидат до замера» для него МЯГЧЕ собственных данных: у нас не «неизвестно», а «замерено и плохо». Не мерена ровно одна узкая клетка — flash-lite на явном low в роли ПИСЬМА на zh.
  • ⚠ И вторая половина условия («китайских клеток нет ни одной») верна только для роли ПИСЬМА: в роли ЧЕРНОВИКА у обеих моделей по 16 zh-клеток, куплены и отсужены (эксп-22).

Честная форма: luna — кандидат, чью цензур-ось надо мерить; gemini — не кандидат, пока не показано, что фильтр на нашем материале не горит. До этого «книга за $9» продуктово пусто.

ПРЯМОЙ ОТВЕТ НА ДОСЛОВНУЮ ФОРМУЛИРОВКУ ВЛАДЕЛЬЦА

«архитектура от вендора не зависит никак… даже на худших вендорах наша архитектура должна отрабатывать лучше, чем худшие вендоры на другой архитектуре»

ЗАМЕРЕНО И ПОДТВЕРЖДЕНО — но в форме слабее, чем звучит вопрос. Замер: один и тот же слабый жилец (glm-5 с погашенным размышлением) внутри нашей архитектуры читается как боевой deepseek-v4-pro, а он же в одиночку — различимо хуже, и адресно: 5 дефектов рода против 1, 9 кусков непереведённого исходника против 0. Это выдержало три круга чтения, два семейства и второй, детерминированный прибор.

Но это интеракция «архитектура × жилец на ИСПЫТАННЫХ жильцах», а НЕ минимакс, и вот три причины, каждая снимает часть:

  1. Худший ВОЗМОЖНЫЙ жилец не искалсяglm-5 не «худший вендор», а единственный второй, которого мы пробовали в этой роли.
  2. Буфер ДВУХВЕНДОРЕН. Черновик делает deepseek-v4-flash. Архитектура, «спасающая слабого жильца», сама содержит клетку другого вендора и на неё опирается ⇒ утверждение «наша архитектура вендоро-независима» этим замером НЕ проверено.
  3. Буфер чинит только то, что черновик донёс — потерянный черновиком приём потерян и после редактора. Отсюда строка контракта «что обязан гарантировать ЧЕРНОВИК» — не украшение, а условие.

И то, что обязано стоять рядом с любым вендор-фактом: слаг ≠ модель. DeepSeek 31.07 сменил веса под тем же слагом. Полной сетки «архитектура × вендор» не будет никогда — она комбинаторно дорога и протухает. Любое число этой секции имеет срок годности и при аномалии сверяется поведенческой пробой, а не листингом.


Д38.3 ВОПРОС 0 — СТАТУС НЕ ИЗМЕНИЛСЯ, И ЭТО ГЛАВНАЯ ДЫРА ПРОЕКТА

Прибора нет. Все панели фазы — одна глава за раз; кросс-главная консистентность ортогональна и не мерилась ни разу. Что фаза дала под этот вопрос БЕСПЛАТНО и чего раньше не было:

  • в 2 окнах из 8 с рассказчиком от первого лица его пол ПО ОКНУ НЕ УСТАНАВЛИВАЕТСЯ вовсе (эталон снят вслепую тремя независимыми чтениями на главу; интервал Уилсона [0.07; 0.59]) ⇒ пайплайн, видящий только главу, слеп по построению примерно в четверти случаев;
  • закрыть их может ТОЛЬКО книжная память: тот же голос ведёт другие окна, где пол назван прямо; ЭРРАТА 30.08: НИЖЕСКАЗАННОЕ ВЕРНО ТОЛЬКО ПРО ЭВАЛ-БАНК. В БОЕВОМ глоссарии движка поля gender (вкл. hidden), decl, since_ch/until_ch ЕСТЬ и засеяны сидом (49/49 склонений, 14 полов); механизм существовал и ГОНЯЛСЯ в прогоне acceptance. ⚠ Но: source='seed' у всех 49 — движок их сам НЕ ПОПОЛНЯЛ (ревизий 0), а голосовые колонки first_person и speech0 из 49. Разбор — Д49 и eval/dovodka/KONSILIUM-30-08.md.
  • а полей пола в банке НЕТbank-en.json, 25 терминов, поля dst/rx/manual/why, проверено файлом ⇒ решение «банк чинит пол» не имеет НИ ОДНОГО замера, даже косвенного: механизма не существовало ни в одном прогоне СНЯТО 30.08: механизм есть и ездил (прогон acceptance, поля gender/decl/спойлер-окна засеяны); не существовало ЗАМЕРА его соблюдения.

Чем закрывается: Шаг 7 плана — 15 глав Гу ПОДРЯД одной книги одним боевым профилем, движковым путём, с живым банком и ЗАСЕЯННЫМИ характер-листами, плюс $0-счётчики (они уже построены и отлажены — schet.py). Цена ~$2 + движковый прогон. Без засева характер-листов замер даст ложно-отрицательный результат ПО ПОСТРОЕНИЮ — померяет пайплайн без носителя консистентности. ⇒ Это единственная покупка, которую я рекомендую (Д38.6).


Д38.4 СВЕРКА С «ЧЕМ ЗАКРЫВАЕТСЯ РАБОТА» (план 22.08 §7)

# условие плана статус
1 Шаг 1 — буферизует ли топология слабого жильца ЗАКРЫТ (Д32), подтверждён вторым семейством (Д34) и третьим кругом (Д37.3)
2 Шаги 23 — паспорт разрешения у каждого «неразличимо» ЗАКРЫТЫ (Д33), и сверх плана закрыт долг Д34.5: у порога появилось своё число шума 0.34 (Д37)
3 Шаг 4 — вес всего промта в единицах прибора ЗАКРЫТ 29.08 (Д36): ≈1.3 порога, и он лежит на прозе
4 Шаг 7 — прибор под Вопрос 0 НЕ ЗАКРЫТ, нужен ~$2 + движковый прогон + засев характер-листов
5 долг ZP — покупка либо явное «условно» ЗАКРЫТ ОБЪЯВЛЕНИЕМ (Д38.1 п.2): контраст условный, легитимная en-однопроходка — RN
6 секция Д31 с вендор-вердиктом по конъюнкции ЕСТЬ (Д31), паспорт напечатан
7 долг В21 — сверка кассы двумя путями ЯВНО ПЕРЕНЕСЁН С ДОКАЗАТЕЛЬСТВОМ НЕВОЗМОЖНОСТИ (Д32.11) — план §7 п.7 такую форму допускает («закрыт либо явно перенесён»). Работа сделана: второй путь пройден по 1171 клетке, установлено, что cost_usd — наша модель, а не бухгалтерия, и сверка на диске НЕВОЗМОЖНА; вопрос ушёл владельцу. ⚠ Прежняя галочка «ИСПОЛНЕН» была чуть сильнее факта (приёмка, находка 10)
8 пинг в docs/PROGRESS.md секция «Полигон» сделан этой сессией

Сверх плана закрыто: долг Д34.5 (внутрисемейный шум) · открытый вопрос квирк-дока про Gemini (Д35.3) и пинг оркестратора №19 по нему · подъём зоны на чистой машине с названными отклонениями (Д35.1) · диагноз сломанного переездом гейта провенанса (Д35.2).

НЕ закрыто и названо: Шаг 5.1 — абсолютная база класса Б. И она не закрывается панелями в принципе: читателя просят назвать худших ВНУТРИ панели, метка сравнительная, а норма абсолютная (Д32.12). Закроет либо отдельная абсолютная рубрика на одиночных текстах, либо человек. До тех пор норму «≤1 машинная глава на 25 глав Гу» печатать нельзя.

Д38.5 ПАСПОРТ, ОБЩИЙ ДЛЯ ОБОИХ ОТВЕТОВ

ПРИБОРЫ: ранговый (слепое чтение claude-fable-5, модель ДОКАЗАНА транскриптами) ·
         счётный (детерминированный, эталон по исходнику вслепую) · класс Б (сравнительная метка)
МАТЕРИАЛ: две пары (zh→ru, en→ru) + разведка ja→ru · панели 7.47.9 главы Гу каждая
ШУМ ПРИБОРА: 0.34 порога — чисто читательский (замерено 29.08 повтором одним семейством)
ШКАЛА: «весь ролевой промт» ≈ 1.3 порога · «вся дорогая стадия» ≈ 1.62.3 порога
ПРАВИЛО: |Δ| > собственного порога панели И знаковый p<0.05 И повтор во втором круге
   ⛔ ИСКЛЮЧЕНИЕ, НАЗВАННОЕ ЯВНО: у панели `p4` (Шаг 4) второго круга НЕТ — её вердикт проходит
   первые два условия и третьего не имеет. Всякий, кто цитирует вес промта, цитирует ОДИН круг
СЛЕП К: эффектам ниже одного порога · кросс-главной консистентности (Вопрос 0) ·
        оси ВЕРНОСТИ владельца · абсолютному уровню класса Б · худшему ВОЗМОЖНОМУ жильцу
НЕ ИСПОЛНЕНО: норма П-1 — второе судейское семейство ВНЕ линии Claude (Sol запаркован)
СРОК ГОДНОСТИ: слаг ≠ модель; любой вендор-факт пере-проверяется поведенческой пробой

Д38.6 ЧТО ПОКУПАТЬ ДАЛЬШЕ — ранжировано, с ценой и с тем, что закрывает

# покупка цена что закрывает почему в этом порядке
1 Шаг 7: 15 глав Гу подряд, боевой профиль, живой банк + засеянные характер-листы ~$2 + движковый прогон Вопрос 0 единственный замер, дающий прибор под метавопрос; он же — готовая in-loop телеметрия боевого прогона, покупается один раз
2 цензур-ось всей дешёвой линии $0.20.6 одно из двух условий, снимающих luna/gemini с «кандидатов» без неё дешёвая линия продуктово пуста
3 китайские клетки дешёвой линии ~$0.3 второе условие то же
2 цензур-ось luna на провокативном материале (zh-насилие + эротика, роль письма) $0.20.6 единственное, что мешает luna перестать быть кандидатом. ⚠ Для gemini этот пункт УЖЕ отвечен и отрицательно без неё дешёвая линия продуктово пуста
5 пере-покупка английской базы ZP ~$0.4 снимает «условно» с контраста Д23 вердикты от этого не двигаются — только подпись под ними

Денег на это в паке НЕТ. Резерв $1.26 из $18.30, свободно в ФД-N $0.29. Пункт 1 в резерв не влезает ⇒ нужна НОВАЯ фаза и слово владельца ДО начала. Потолки сессия не поднимает.


Д39 — СВЕРКА С БУКВОЙ ЗАКАЗА ПЕРЕД СДАЧЕЙ. ТРИ КРАСНЫХ, И НИ ОДИН НЕ ПРО РАБОТУ

eval/.venv/bin/python eval/conformance.py eval/dovodka/requirements.md --finalтребований 77 · ожидают 0 · провалов 3 · СВЕРКА НЕ ПРОЙДЕНА. Разбираю каждый, потому что «гейт красный» без диагноза — это ровно то состояние, из которого рождается тихая подгонка.

Д39.1 ДЕФЕКТ САМОГО ГЕЙТА: --final НЕ МОГ ПРОЙТИ НИКОГДА

Реестр делит требования на разделы строками вида | **РАМКА** | | |у них ПУСТАЯ ячейка улики. conformance.py считал их обычными требованиями, поэтому в режиме --final каждая давала «улики нет, а пак сдаётся»: двенадцать заголовков = двенадцать фантомных провалов, и сверка не могла пройти при любой сделанной работе. Заодно врал итог: «требований 89» при 77 настоящих.

Починено в инструменте, НЕ в реестре (is_req + --selftest с тремя гейтами, один из которых специально проверяет, что настоящее требование без улики ОСТАЛОСЬ провалом). Правка не делает зелёным ни одно реальное требование — до неё провалов было 14, из них 12 фантомных; после — ровно те же 3 настоящих. Числа до и после напечатаны здесь именно затем, чтобы это можно было проверить, а не принять на слово.

Д39.2 ТРИ КРАСНЫХ — ДИАГНОЗ КАЖДОГО

требование почему красный это работа или улика?
R71 «правка рига чужого пака + пере-снятие его гейтов» verify22.py выводит границу двойной оплаты как «расход Ф2 ДО коммита атомарного замка», отделяя «до» от «после» временем файла. Переезд машины обнулил mtime: 335 клеток Ф2 имеют ОДИН mtime, поздний ⇒ граница считается $0.000000 УЛИКА УТРАЧЕНА БЕЗВОЗВРАТНО. Клетки времени покупки в себе не хранят (полей ts нет). Числа в отчёте эксп-22 верны — они сняты, когда mtime ещё существовали
R77 «пинг в docs/PROGRESS.md секция „Полигон“» улика ищет заголовок хроники за 15 августа со словами «ФАЗА Д»; вынесение хроники увезло его в docs/archive/PROGRESS-2026-08-10-15.md:73=ФАЗА Д — сырьё снято ПРОТУХ ГЕЙТ, НЕ ОБЯЗАТЕЛЬСТВО. Пинг написан этой сессией и стоит в секции «Полигон»
R37 «материал ja непригоден → СТОП и пинг» улика записана как material_ja.py | grep -q "СТОП|OK ". Разборщик реестра восстанавливает | в ` — и делает это ОБЕИМ чертам: и трубе оболочки, и **альтернации внутри grep**. В двойных кавычках уgrepбез-Eвертикальная черта литеральна ⇒ ищется строкаСТОП

Д39.3 И ОДИН КРАСНЫЙ Я СЕБЕ ЧУТЬ НЕ ПОДАРИЛ САМ

Первая редакция пинга в PROGRESS.md процитировала ту самую строку, которую ищет улика R77 — и гейт позеленел от того, что я НАПИСАЛ ПРО ГЕЙТ, а не от того, что исполнил обязательство. Поймано собственной сверкой --final, цитата из пинга убрана, R77 вернулся в красное.

Это ровно тот класс, ради которого реестр и заведён («улика вида греп собственного отчёта доказывает, что НАПЕЧАТАНО, а не что СДЕЛАНО» — шапка requirements.md), и он сработал против своего же автора. Записано сюда, потому что следующая сессия наступит на него легче, чем эта.

Д39.4 ЧТО Я НЕ СТАЛ ДЕЛАТЬ И ПОЧЕМУ

Реестр требований eval/dovodka/requirements.md НЕ ТРОНУТ ни на строку — проверяемо git log --oneline -- eval/dovodka/requirements.md. Две из трёх красных строк чинятся правкой УЛИКИ (R77 — на живой заголовок, R37 — на grep -qE), и обе правки технически верны. Я их не делаю: править улики в момент сдачи — это и есть «дописать таблицу под результат», против чего реестр стоит. Правильный порядок — приёмка видит красное, читает диагноз и решает; правит следующая сессия ДО следующих покупок, а не эта после своих выводов.

Сверка сдаётся КРАСНОЙ, с диагнозом на каждую строку. Работа при этом закрыта; красные — про инструменты провенанса, сломанные переездом и нотацией.


Д40 — ПРИЁМКА ИСПОЛНЕНИЕМ СВОЕЙ ЖЕ РАБОТЫ. 15 НАХОДОК, ИЗ НИХ ОДИН БЛОКЕР

Мандат самопроверки (решение владельца 12.07) требует адверсариального прохода по ГОТОВОЙ работе, а не самоотчёта «проверено». Пройдено тремя опровергателями claude-fable-5 с раздельными мандатами, каждому запрещено подтверждать: числа из сырья · логика и дисциплина пре-рега · риг исполнением. Все трое работали по ЗАКОММИЧЕННОЙ редакции. Ни один не правил репозиторий.

Д40.1 ЧИСЛА — ПЕРЕСЧИТАНЫ ИЗ СЫРЬЯ НЕЗАВИСИМЫМ КОДОМ

Опровергатель написал свой парсер ответов, своё отображение меток по ключам, свой Спирмен и своё разложение дисперсии. Все несущие числа Д36Д37 воспроизведены: средние места (до четвёртого знака), «13 из 16» и точный биномиальный p=0.021271, вся матрица контрастов, таблица счётчика со всеми p, три пары кругов панели-0, ρ=+1.00/1.00/1.00 на главе 197f98eb, разность 2436 на всех 16 главах. Ошибок, меняющих вердикт, НЕ найдено. Три неточности — исправлены:

находка что было что стало
знаки трёх строк матрицы Д36.8 взяты из прогонов с ДРУГИМ якорем и напечатаны зеркально Z0↔ZF +0.25, ZF↔RE 0.81, ZF↔ZD 1.62 знаки приведены к одной объявленной конвенции; вердикты не двигались (считаются по |Δ|)
описание метода приписки класса Б сильнее факта: «по метке, названной в предложении» — а в 3 главах из 9 метки в предложении нет правило напечатано как оно есть: по метке, если названа; иначе по секции
ложная точность: $0.01513 и отношения 1.33/1.62 $0.01514; отношения печатаются с одним знаком, второй не заслужен

Д40.2 ЛОГИКА И ПРЕ-РЕГ — ОДИН БЛОКЕР И ШЕСТЬ ВАЖНЫХ

# находка приговор диспозиция
1 Контроль декоя провален по БУКВЕ фризаZD обязан оказаться последним», иначе панель аннулируется), а первая редакция молча предъявила другой критерий БЛОКЕР напечатано Д36.8а: девиация названа, обе стороны разобраны, панель НЕ аннулирую решением сессии (запрещено планом §6) — вопрос приёмке, рекомендация дана и названа рекомендацией
2 Фриз говорит «порог = собственный пол панели», посчитано — по sd КАЖДОГО контраста; под буквой фриза отпал бы контраст Z0↔ZD ВАЖНОЕ конвенция напечатана в шапке таблицы вместе с тем, что меняется при чтении по букве: первичный эндпойнт устоял бы при обоих способах (1.50 > 1.43 и > 1.13)
3 Двойной стандарт в Д36.11: одно и то же свидетельство (p=0.0625, 5 глав единогласно) слишком слабо для фриз-триггера и достаточно для новой гипотезы; плюс несведённые единицы (главы против попаданий) ВАЖНОЕ единый стандарт напечатан; единицы разведены; предсказание «банк близки» переформулировано честно — опровергнуто направлением, не подтверждено значимостью
4 «Третий прибор» — не прибор: класс Б снят с ТЕХ ЖЕ 16 сессий, что и ранги ВАЖНОЕ переименовано во «вторую ось одного чтения»; в Д38.0 врезано, что вес промта стоит на ОДНОМ круге и что единственный независимый прибор его НЕ подтверждает
5 Д37: у сработавшей ветки была третья клауза («гипотеза лишается опоры»), опущенная молча; «минимум печатается той же метрикой (i)» — натяжка; «доля 0.34 неотличима» — без теста ВАЖНОЕ всё три напечатано: правило признано самопротиворечивым на этом исходе, минимум объявлен пост-хок-статистикой, «неотличима» заменено на «разницы не видно, мощность не считалась»
6 MDE счётчика не напечатан нигде; «не ухудшает ничего» — универсалия из шести информативных глав ВАЖНОЕ потолок мощности счётчика внесён в паспорт Д36.12; в Д36.10 показано, что значимость была ДОСТИЖИМА (6 глав) и не достигнута из-за разнонаправленности 4:2, а не из-за размера
7 Эррата Д35.3 неполна: старая формулировка «переведены ВООБЩЕ БЕЗ ИНСТРУКЦИИ» стоит без баннера в 00-provider-quirks.md:157 и в eval/dovodka/rol.py ВАЖНОЕ оба места правлены (зачёркивание + уточнение «без РОЛЕВОГО промта, но С ГЛОССАРИЕМ»); снята и оценка «535 = размер одного user-сообщения»
8 Д29.2 объявлена устаревшей в Д38.2, но на месте не забаннерена — и там живёт рекомендация купить уже купленное МЕЛОЧЬ баннер поставлен на носителе: строка luna и абзац «самая ценная НЕЗАПОЛНЕННАЯ клетка» помечены исполненными
9 «вес ВСЕГО промта» воскресает после того, как Д36.0 его похоронил МЕЛОЧЬ формулировка приведена к «вес РОЛЕВОГО промта (95%)»
10 Д38.4 п.7: « ИСПОЛНЕН» сильнее факта — сверка не состоялась, доказана её невозможность МЕЛОЧЬ переписано в «явно перенесён с доказательством невозможности» — форма, которую план §7 п.7 прямо допускает
11 Д38.4 п.5 легитимен по букве плана, но у Д23/Д24 на месте нет пометы «контраст условный» МЕЛОЧЬ НЕ исполнено этой сессией: правка тел Д23/Д24 — история дуги, её трогать в момент сдачи не буду; носитель диспозиции — Д38.1 п.2, и он назван
12 Шапка пинга в PROGRESS.md сильнее собственного текста («ЗАКРЫТЫ» против «ответ в форме слабее вопроса») МЕЛОЧЬ шапка переписана: «ОТВЕЧЕНО, а не закрыто», с обеими оговорками прямо в ней

Что приёмка проверила и что УСТОЯЛО: пре-рег до чисел подтверждён тремя независимыми носителями (время фриз-коммита → время клейма сессий в журнале → mtime файлов ответов; тексты правил байтно идентичны фриз-коммитам, задним числом не переписывались) · отклонение «пять армов вместо четырёх» объявлено ВО ФРИЗЕ с основанием и ценой · гардрейл «не подгонять под зелень» держится: verify22.py и requirements.md не тронуты ни одним коммитом сессии · хеши замороженных приборов сходятся с напечатанными.

Д40.3 РИГ ИСПОЛНЕНИЕМ — ВОСЕМЬ ПУНКТОВ, ВСЕ СОШЛИСЬ

Восемь селфтестов EXIT=0 · сборка p4 сверена побайтно (80 текстов, 16 раскладок) и своим детектором на утечки — 0 хитов по армам, вендорам, суффиксу карантина, путям ключей · деньги: 1171 клетка на диске = 1171 в git, новых клеток НЕТ, резерв $1.263396 не двигался · журнал: записи #155186, все закрыты, токены внутри прогонов уникальны · слепота: 531 запись поля model во всех транскриптах — claude-fable-5, иных значений нет; у 32 читателей ни одного обращения к ключам, сырью и чужим ответам; ключ панели читал только НЕ-читатель и строго ПОСЛЕ последнего ответа · круги 12 панели-0 не тронуты (единственный изменённый затрекованный файл книг — журнал сессий).

Две находки приёмки сверх мандата, обе приняты:

  1. Провалов сверки ТРИ, а не два — я недосчитал R37 в формуле сдачи (в теле отчёта он был объявлен). Пинг в PROGRESS.md исправлен.
  2. Доисторические дубли токенов в прогоне d4 (15 токенов заявлены дважды) — стояли в HEAD до этой сессии, и runs.py --selftest такой класс не ловит. ⚠ Не моя работа, не чиню; названо оркестратору в пинге.

Д40.4 ⚠ ЧТО ОСТАЛОСЬ ПОСЛЕ ПРИЁМКИ И ЖДЁТ НЕ МЕНЯ

  • Находка 1 (декой) — диспозиция за приёмкой, не за сессией. От неё зависит, считать ли Шаг 4 закрытым по букве или по цели.
  • Находка 11 — пометы «контраст условный» на телах Д23/Д24 не поставлены.
  • docs/PROGRESS.md:679=ЖИВОЙ ДЕФЕКТ ДВИЖКА — шапка пинга №19 теперь ложна дважды (дефект движка закрыт 28.08; терялся промт, а не глоссарий) и баннера не имеет. Чужая зона, пинг дан.

Д41 — ДЕНЬГИ: БОЕВАЯ СВЯЗКА ПРОТИВ ВСЕГО ОСТАЛЬНОГО, НА ОДНОМ ПРАЙСЕ И В ОДНОЙ ЕДИНИЦЕ

Почему секция появилась. Владелец спросил ровно то, ради чего фаза и шла: как двупроходка «черновик + редактор-переписывальщик» стоит против наших попыток её переизобрести, и напомнил про рыночный ресёрч, где книга выходила в $715. Первая редакция Д38 отвечала про КАЧЕСТВО и не свела деньги в одну таблицу — а без неё ответ по архитектуре неполон, потому что при неразличимом качестве решает именно цена (это записано в самом же ответе). И тут же вскрылось расхождение, которое в репозитории лежало не сведённым: research/04 даёт книгу за $715, а Д29.1 — за $4168. Свожу.

Д41.0 ДВЕ ЛОВУШКИ ЕДИНИЦ, ИЗ-ЗА КОТОРЫХ ЧИСЛА НЕ СХОДИЛИСЬ

  1. «Книга 1500 глав» в Д29.1 — это 1500 НАШИХ единиц, а наша английская единица = 1642 знака = 0.49 главы Гу. То есть «книга» Д29.1 — это ~735 глав Гу, половина книги в 1500 глав Гу. Здесь всё пересчитано на 1500 глав Гу — единицу владельца.
  2. Прайс. Д29.1 считала по пиковому пину DeepSeek; здесь — по одному прайс-листу для всех (deepseek-v4-flash 0.44/1.32 · deepseek-v4-pro 1.32/3.96 · glm-5 1.00/3.20 · gpt-5.6-luna 0.20/1.20 · gemini-3.1-flash-lite 0.25/1.50 · grok-4.3 1.25/2.50, $/1M). Токены — замеренные, из клеток, а не оценённые. Разница с Д29.1 на якоре — 1.5× и вся в пиковом пине; порядок армов от этого не меняется. ⚠ Атрибуция «арм → клетка» сверена побайтно: Z0 = клетка dv-b-e0-* (редактор deepseek-v4-pro над черновиком), ZD = dv-b-d0-* (deepseek-v4-flash), E6 = dv-g-e6-* (glm-5).

Д41.1 ТАБЛИЦА, КОТОРАЯ И ЕСТЬ ОТВЕТ ПРО ДЕНЬГИ

БАННЕР КОНСИЛИУМА 30.08: КОЛОНКА «КНИГА» СЧИТАНА МЕДИАНОЙ, А КНИГА — ЭТО СУММА. ЧИСЛО $62 И СЛОВО «ВДВОЕ» НЕВЕРНЫ. Найдено скептиком замера, проверено мной пере-счётом из клеток.

  • Механизм ошибки — тот самый, который Д48.6 объявил недопустимым двумя днями позже в этом же файле: цена однопроходки RN распределена ДВУГОРБО (восемь глав думают 466931 токенов, восемь — 5 80419 559), медиана падает в пустоту между горбами и не представляет ничего. Книга из 1500 глав — это сумма, то есть среднее × N.
  • По сохранённым ценам клеток: медиана всех 16 = $0.01668 → книга $51; медиана 15 ГОДНЫХ (без мёртвой клетки) = $0.02626 → $80; среднее 15 годных = $0.02948 → книга ≈$90.
  • И в медиане таблицы до сих пор сидит МЁРТВАЯ КЛЕТКА dv-n-rn-100b088f71 — ноль знаков выхода, finish=stop, цена $0.003204. Д48.6 выселил её из знаменателя отношения и не распространил правку назад по файлу.
  • Честное отношение однопроходки к связке — около ×1.4, а не «вдвое». Это, к тому же, сходится с собственной Д29.1, считанной по средним ($46 против $68 = 1.5×), с которой Д41 не был сведён ни разу.
  • Тем же механизмом завышен и рычаг редактора glm-5: черновик flash тоже двугорбый, и «в 6.3 раза дешевле» по средним даёт около ×4.4. Рычаг остаётся самым большим в фазе — но заголовок неверен.Числа в колонке «книга» ниже читать как МЕДИАННЫЕ и не использовать для сметы книги. Пере-счёт таблицы суммами — первый пункт очереди уборки (стоит $0).
конфигурация $/единица книга 1500 глав Гу качество против боевой связки
боевая связка: черновик flash → редактор pro (продакшен) 0.04148 $127 якорь
… из них ЧЕРНОВИК 0.00242 $7
… из них РЕДАКТОР 0.03720 $114 = 90% всех денег
тот же черновик → редактор glm-5 (E6) 0.00659 $20 НЕРАЗЛИЧИМО — 3 круга чтения, 2 семейства, второй прибор
однопроходка deepseek-v4-pro, промт-роль (RN) 0.02011 $62 в пределах порога
однопроходка grok-4.3 low (RK) 0.00682 $21 НЕ УСТАНОВЛЕНО (вердикт перевернулся)
однопроходка gpt-5.6-luna (RL) 0.00248 $7.6 «прибор не решил»
однопроходка gemini-3.1-flash-lite (RE) 0.00155 $4.8 «прибор не решил», маргинален
однопроходка glm-5 БЕЗ думания (RG) 0.00474 $15 различимо хуже
однопроходка glm-5 С думанием (RGT) 0.05933 $182 в пределах порога
голый черновик flash (ZD) 0.00242 $7 различимо хуже, в обоих семействах

Д41.2 ЧТО ИЗ ЭТОГО СЛЕДУЕТ ПРО «СВЯЗКУ ПРОТИВ ПОПЫТОК ЕЁ ПЕРЕИЗОБРЕСТИ»

  1. Связку никто не побил по КАЧЕСТВУ — и не мог: прибор её ни с чем не разводит. Всё, что не «голый черновик» и не «glm-5 без думания», лежит в пределах порога. Это не победа связки, это слепота прибора ниже одного порога, и её размер теперь известен (Д36.9).
  2. Но связка проигрывает по ЦЕНЕ, и крупно. Однопроходка на той же модели — вдвое дешевле ($62 против $127) при неразличимом качестве и одном вызове вместо двух.
  3. И главное число фазы, которого в первой редакции ответа не было: деньги связки — это РЕДАКТОР (90%), а редактор ЗАМЕНЯЕМ. Тот же самый черновик с редактором glm-5 вместо pro стоит $20 против $127 — в 6.3 раза дешевле, — и это единственная дешёвая конфигурация фазы, чья неразличимость от продакшена подтверждена ТРЕМЯ кругами чтения, ДВУМЯ семействами и вторым, детерминированным прибором. Именно это и означал «буфер»: топология защищает не абстрактно, а деньгами.
  4. Почему glm-5 в роли редактора дёшев, а в роли однопроходки — дорог или плох. Редактором он идёт с погашенным размышлением над готовым черновиком: 0 токенов думания. Однопроходкой без думания он различимо хуже, а с думанием — 83% токенов уходит в мысль, и цена становится $182, в полтора раза дороже связки. ⇒ платим не за вендора и не за проходы, а за РАЗМЫШЛЕНИЕ; буфер тем и ценен, что позволяет его не покупать.

Д41.3 СВЕДЕНИЕ С РЫНОЧНЫМ РЕСЁРЧЕМ: $715 БЫЛИ ПРАВЫ, И ВОТ ГДЕ ОСТАЛЬНЫЕ ДЕНЬГИ

docs/research/04-api-providers.md (04.07.2026, §Выводы п.8) оценивал полный прогон книги в $715, считая по прайс-листам и видимому выводу. Фаза замерила $127 у продакшена. Оба верны, и разница разложена:

  • где ресёрч попал точно: однопроходка на gpt-5.6-luna$7.6 за книгу в 1500 глав Гу, ровно в его вилке. Дешёвая линия существует и замерена.
  • где ресёрч не мог знать: он оценивал ВИДИМЫЙ вывод. У deepseek-v4-pro 46% всех токенов — размышление, и это ЧЕРНОВИК, а не проверка: медиана 96% предложений финального текста встречается в трейсе дословно (Д15.19 / §2.1 журнала). Модель пишет перевод дважды — в уме и в ответе, — и обе копии тарифицируются по цене выхода. Отсюда ×8 между $7.6 и $62 на одной и той же роли однопроходки.
  • Правило для сметы, которого не было ни у ресёрча, ни у фазы: цену роли считать по total_tokens, а не по длине перевода; у моделей с невыключаемым или дорогим размышлением видимый вывод занижает счёт в разы.
  • ⚠ И то, что ресёрч назвал верно ещё в июле: главная статья расходов продукта — не токены. Разница между $8 и $127 на книгу меньше, чем цена одной человеческой вычитки; выбор конфигурации решает не столько COGS, сколько сколько раз книгу придётся перегонять.

Д41.4 ЧЕГО ЭТА ТАБЛИЦА НЕ ГОВОРИТ

  • luna и gemini в прод НЕ идут — но по РАЗНЫМ причинам, и валить их в одну строку нельзя (Д42): у luna цензур-ось не мерена вовсе; у gemini-3.1-flash-lite она мерена, и замер ПРОТИВ него — 10 клеток content_filter: PROHIBITED_CONTENT на нашем же вебновелльном материале. «Не мерено» и «мерено и плохо» — разные вещи, и первая редакция их смешала.
  • Цены имеют срок годности: слаг ≠ модель, DeepSeek менял веса под тем же слагом, а прайс-лист ресёрча снят 04.07. Любая строка пере-снимается перед решением.
  • Замер на АНГЛИЙСКОЙ паре. На китайской токенов на знак больше, и абсолютные числа сдвинутся; порядок армов — вопрос отдельного замера, а не переноса.
  • E6 за $20 — это glm-5 с ПОГАШЕННЫМ размышлением в роли редактора. Конфигурация — часть арма: тот же слаг с включённым размышлением стоит другого и ведёт себя иначе.

Д42 — СПЛОШНОЕ ЧТЕНИЕ КОРПУСА ПО ВОПРОСУ ВЛАДЕЛЬЦА. ЧТО ФАЗА Д НЕ ЗНАЛА ПРО СЕБЯ

Почему секция появилась. Владелец, прочитав ответ Д38, сказал: у нас были ещё вопросы — двупроходка «черновик + редактор-переписывальщик» против попыток её переизобрести · исследование, где OpenAI обрушил цены и книга выходила около одиннадцати долларов · сравнения однопроходок по моделям. И добавил: «дочитай всю документацию, именно сессии доводки». Дочитано: журнал SESSION2-LOG.md целиком (§0§16), планы 16/17/21/22-08, консилиум, плюс отчёты 02/04/10/11/13/20/21/22 и research/04. Ниже — то, что корпус знал, а секции Д38/Д41 не использовали.

Д42.1 «$11 ЗА КНИГУ» — ЭТО РЕАЛЬНАЯ ТАБЛИЦА, И ОНА ПРОТУХЛА ВДВОЕ С ПОЛОВИНОЙ

Память владельца точна: 22-tenant-panel.md:132-142 — проекция боевой СВЯЗКИ на книгу в 1500 единиц, шесть жильцов черновой роли, $13.09$22.77, и research/04 независимо давал «$715». Но обе цифры сняты по июльскому прайсу, а DeepSeek с 16.08 поднял цены в 34.7 раза.

Пере-счёт из ТЕХ ЖЕ клеток по текущему (пиковому) прайсу — 2022 единицы на жильца:

жилец ЧЕРНОВОЙ роли черновик + редактор dspro связка книга 1500 ед было (июль)
gemini-3.1-flash-lite 0.00391 0.02278 0.02669 $40.04 $13.09
gpt-5.6-luna 0.00357 0.02330 0.02687 $40.30 $13.89
deepseek-v4-flash (продакшен) 0.00544 0.02308 0.02852 $42.78 $13.49
glm-4.7 0.00656 0.02260 0.02916 $43.74 $18.34
grok-4.3 0.00861 0.02383 0.03244 $48.66 $22.77
deepseek-v4-pro 0.01703 0.02378 0.04080 $61.20 $17.50

⚠ Единица здесь — единица эксп-22 (zh 2 156 знаков · en 1 642), а не глава Гу; с Д41 эти числа сопоставимы только по ОТНОШЕНИЯМ. Прайс пиковый: у DeepSeek офф-пик вдвое дешевле, у прочих цена одна.

Д42.2 ЧТО ЭТОТ ПЕРЕ-СЧЁТ ГОВОРИТ, И ОН ПОДТВЕРЖДАЕТ Д41 НЕЗАВИСИМЫМ НАБОРОМ

  1. Правило ничьей эксп-22 ПЕРЕ-РЕШАЕТСЯ, и это записано нами же 16.08 (журнал §13, вывод 1): роль черновика ушла к самому дешёвому, а после подорожания flash перестал быть самым дешёвым. Пере-счёт подтверждает: luna 0.00357 против flash 0.00544 — флеш дороже луны в 1.5 раза. По букве нашего же ратифицированного правила черновая роль обязана быть пере-выбрана, и с 16.08 этого не сделано.
  2. Но приз мал: $2.48 на книгу, 6%. Потому что редактор съедает 85% связки ($0.023 из $0.027) и от смены черновика не меняется вовсе. Это независимое подтверждение центрального числа Д41 на другом наборе (шесть жильцов, две пары, 129 редакторских клеток): деньги конвейера — в редакторе, а не в черновике.
  3. Смена ЧЕРНОВИКА даёт 6%. Смена РЕДАКТОРА — кратно. Именно поэтому ответ на вопрос «связка против попыток её переизобрести» — не про число проходов и не про модель черновика.

Д42.3 ГЛАВНАЯ ПОПРАВКА К Д38/Д41: «ОДНОПРОХОДКА ДЕШЕВЛЕ» ОПИРАЕТСЯ НА ПРИБОР, КОТОРЫЙ ЭТОГО НЕ ВИДИТ

Журнал §11 (16.08), находка ВЛАДЕЛЬЦА, и её первая редакция была блокером:

ОДНОПРОХОДКА ЛОМАЕТ БАНК. terminologist.md:22: терминолог выбирает канон по ВАРИАНТАМ ЧЕРНОВИКОВ. Без черновика майнингу не из чего собирать свидетельства. ⇒ однопроходка — альтернатива только ВТОРОМУ проходу, не связке. И это объясняет, почему чтение поставило её первой: на ОДНОЙ главе банк не нужен, на книге в 1500 глав имена разъедутся.

Владелец сам её и снял («допустима, чтоб оттуда вырезать термины и точечным редактором заменить»), и оттуда родился кандидат K7: однопроходка → майнинг банка из ЕЁ выхода → канон-фиксер. K7 не мерен ни разу.

Всё, что фаза Д говорит про однопроходку, снято прибором, который меряет ОДНУ ГЛАВУ. Ровно там, где банк не нужен. Секции Д38.1 и Д41 подавали «однопроходка вдвое дешевле связки при неразличимом качестве» без этой границы — исправляется здесь: «дешевле и неразличимо НА ОДНОЙ ГЛАВЕ; что она делает с каноном на тысяче глав, не мерил никто». Это тот же Вопрос 0 с другой стороны.

Д42.4 КОНФЛИКТ ПРИБОРОВ ПО ЗАМЕНЕ РЕДАКТОРА — ПЕЧАТАЮ ОБЕ СТОРОНЫ

Д41 объявил glm-5 в роли редактора неразличимым от боевого dspro ($20 против $127). Это верно на нынешнем первичном приборе (слепое чтение, панель-0, три круга, два семейства). Прежний прибор — счёт ошибок — говорит обратное:

эксп-22 Ф3, zh:  R2 (glm-5) против R0 (боевой dspro)  2.12 [3.81, 0.75]  Холм 0.0188 ✔ ЗНАЧИМО ХУЖЕ
журнал §13:      «dspro лучше glm-5 на zh (2.12) и en (1.41), не различимо на ja»

Приборы разные и материал разный (счёт — zh-вебновелла; чтение панели-0 — 16 английских глав), а первичным прибор чтения стал решением владельца 20.08 с основанием: счётчик меняет ЗНАК согласия с владельцем от пары к паре (+0.80 на zh, 0.80 на en), чтение — нет. Но: ⇒ писать «$20 против $127 при неразличимом качестве» без этой строки нельзя. Честная форма: замена редактора на glm-5 — самый большой измеренный денежный рычаг фазы, и по старому прибору она стоит 2.12 качества на китайской паре. Кто прав — не решено, и это вопрос приёмке.

Д42.5 ЧТО ЗАМЕРЕНО ПРО gpt-5.6-luna — ПОЛНЫЙ СПИСОК РОЛЕЙ

роль где результат
черновик (zh 16 + en 6) эксп-22 Ф1/Ф2 финал поверх её черновика против якорного: 0.44 [2.00, +1.25], p=0.6711 — НЕРАЗЛИЧИМО; эхо 0/16 zh, 0/6 en; сегодня самый дешёвый черновик панели
однопроходка (en, 16) фаза Д, RL «прибор не решил»: в пределах порога в обоих кругах, конъюнкцию рушит то знаковый тест, то порог
точечный фиксер эксп-20 / эксп-21 §17 по идеальным флагам 12/12 за $0.000173; на РЕАЛЬНОЙ детекции C2 против переписывания 3.75, Холм 0.0006 — значимо хуже; полезен как механический пре-гейт
судья эксп-21 шумная: расхождение с соседним судьёй = 14 сигм собственного шума замены; позиционная компонента до 4.9× эффекта арма. В фазе Д платных судей заменили агент-чтения
редактор боевой связки НЕ МЕРЕНА НИ РАЗУ в панелях абсолютного рига. Единственное смежное — эксп-20 (n=6, exploratory, методика обесценена собственным замером разброса)

Её замеренные дефекты, которые обязаны стоять рядом с ценой:

  • роняет иероглифы в русскую прозу — в половине окон и в ОБОИХ контрактах, «свойство модели»; черновиком дала 75 ханьцзы, худший результат панели (редактор вычищает до 2, но покрытие канона при этом падает 0.970 → 0.932). ⚠ На АНГЛИЙСКОЙ цели утечка практически исчезает (1 знак);
  • без явной ручки эффорта выжигает бюджет на размышление и отдаёт ПУСТОЙ content — 8 пустых голосов из 18 в эксп-21; класс «оплаченный брак», не отказ;
  • цензур-ось не мерена ни в одной роли (Д38.2).

Д42.5а ПАМЯТЬ ВЛАДЕЛЬЦА ТОЧНА: ТАКОЕ РЕШЕНИЕ БЫЛО, И ЕГО ПОТЕРЯЛИ ВСЕ ПОСЛЕДУЮЩИЕ ПЛАНЫ

Первая редакция Д42.5 написала «плана нет». Неверно. eval/dovodka/PLAN-17-08.md:105-119=РЕШЕНИЕ ВЛАДЕЛЬЦА, КОТОРОЕ ЖДЁТ ЕГО САМОГО, целая секция, и называется она так:

1б. РЕШЕНИЕ ВЛАДЕЛЬЦА, КОТОРОЕ ЖДЁТ ЕГО САМОГО (не гипотеза, а развилка)

Черновая роль по НАШЕМУ ЖЕ правилу должна уйти с DeepSeek. Правило D39.117 — «при равном качестве берём дешёвого», качество шести черновых моделей было ничьёй. После подорожания 16.08:

gpt-5.6-luna          $0.00358/глава
gemini-3.1-flash-lite $0.00383
deepseek-v4-flash     $0.00444   ← был 0.00097, в 3.7 раза дешевле следующего

На книге в 1500 глав: текущая связка $40 против $23 у пары flash-lite + glm-5. ⚠ Перед сменой — эхо-проба альтернатив: у flash эхо-мина есть и она перевооружается ослабленным thinking; у остальных не мерена НИ РАЗУ. Владелец сказал «это разговор предстоит».

⇒ Речь именно о боевой связке и именно о переключении, как владелец и помнил. Развилка стоит на НЁМ с 17.08.

И её потеряли все последующие носители курса: PLAN-21-08.md, KONSILIUM-22-08.md, PLAN-22-08.md, секции Д38/Д41 этого отчёта и запись «Полигон» в docs/PROGRESS.md — ни в одном из них пункта нет (греп «черновая роль / пере-выбрана / уйти с DeepSeek» пуст). Свод денег 29.08 продолжал считать боевую связку как «черновик flash → редактор pro» без единой оговорки, что по нашему же ратифицированному правилу черновик обязан быть пере-выбран.

Что к этой развилке добавляет сегодняшний пере-счёт (Д42.1): порядок жильцов подтверждён на клетках (luna 0.00357 < gemini-fl 0.00385 < flash 0.00544), но приз развилки — 6%, а не разы, потому что редактор съедает 85% связки. Строка PLAN-17-08 «$40 против $23 у пары flash-lite + glm-5» смешивала ДВА рычага сразу: смену черновика (6%) и смену РЕДАКТОРА (кратно) — и весь выигрыш там принадлежит второму.

Развилка остаётся на владельце, но её надо пере-сформулировать: решать не «кем делать черновик» (это 6% и эхо-проба), а «кем делать РЕДАКТОРА» — там лежат и деньги, и конфликт приборов (Д42.4), и единственный замер, где второй проход отработал как обещано (glm-5, эксп-20).

Д42.6 ЧТО КОРПУС ОТВЕЧАЕТ НА ВОПРОС «СВЯЗКА ПРОТИВ ПОПЫТОК ЕЁ ПЕРЕИЗОБРЕСТИ» СВЕРХ ФАЗЫ Д

  • 20-editor-role.md отвечает прямее всей фазы Д: «"нужен ли редактор" — не свойство архитектуры, а свойство пары „модель × роль", и на боевой паре ответ отрицательный». Замерено: у glm-5 второй проход отрабатывает как обещано (общий 5:1, вёрстка 6:0), у deepseek-v4-pro, который стоит редактором СЕЙЧАС, второй проход ВРЕДИТ (один проход берёт общий 5:1 и верность 5:1, целевые оси 3:3). Роль редактора там же названа узкой: второй проход доказанно выигрывает одну ось из шести — русскую прозу. ⚠ С оговоркой самого отчёта: его судья не разрешает разницу меньше ~2:1, и 3:3 — ничья, а не «вредит».
  • Собственный порядок владельца при слепом чтении (журнал §15.1615.17): на китайской паре боевая связка ПЕРВАЯ, на английской — ПОСЛЕДНЯЯ из четырёх, а однопроходка первая. Ответ переворачивается ПАРОЙ, и это его собственное чтение, а не наш прибор.
  • Журнал §14.5: разброс между архитектурами (1540%) МЕНЬШЕ разброса между временем суток (ровно вдвое) ⇒ «выбор архитектуры — не про деньги». Д41 сделал деньги заголовком, не назвав офф-пик; исправляется здесь. Уцелевает то, что рычаг РЕДАКТОРА больше и архитектуры, и времени суток.
  • Журнал §15.12 — незакрытый бесплатный кандидат: два прогона одной связки + $0-детектор расхождения. На главах, где тексты разошлись ≥10%, выбор лучшего даёт +2.36 позиции, p=0.0065 (кросс-читательски, не круговое); на похожих — ВРЕДИТ (1.33). Порог 10% выбран post-hoc и обязан фризиться пре-регом. Это самый дешёвый непроверенный рычаг корпуса, и в план 22.08 он не переехал.

Д43 — РЕЕСТР ПОТЕРЯННОГО: ЧТО ФАЗА ЗАПЛАНИРОВАЛА И РАСТЕРЯЛА МЕЖДУ ПЛАНАМИ

Зачем секция. Владелец 29.08: «в этом репозитории уже довольно много экспериментов проведено… не хотелось бы, чтобы ты рос по энтропии». Сплошное чтение всех носителей курса фазы (PLAN-16-08PLAN-17-08HANDOFF-21-08PLAN-21-08REVIEW-21-08KONSILIUM-22-08PLAN-22-08 → Д38.4/Д38.6) даёт эту энтропию ЧИСЛОМ: при каждой смене носителя курса часть намерений не переезжала, и никто этого не печатал. Ниже — всё, что найдено; статус проставлен проверкой, а не памятью.

⚠ Это НЕ упрёк прежним сессиям: каждый план писался после компакта и честно старался быть самодостаточным. Дефект структурный — у фазы не было реестра переноса, только цепочка пересказов. Секция и есть недостающий реестр.

Д43.1 РАЗВИЛКИ, СТОЯЩИЕ НА ВЛАДЕЛЬЦЕ И ПОТЕРЯННЫЕ КУРСОМ

что носитель статус
Пере-выбор ЧЕРНОВОЙ роли («должна уйти с DeepSeek по нашему же правилу»; «это разговор предстоит») PLAN-17-08.md:105-119 потеряно всеми планами после 17.08; разобрано в Д42.5а
P42 — два противоречащих пре-рег-правила о маржевом гейте; решает судьбу единственного CONFIRM фазы (H-2а) HANDOFF-21-08.md:284-288 в PLAN-22-08/Д38 не упомянут ни разу
К-1 — чинить ли contour.base_a0 (питает ВСЕ прошлые замеры фазы) PLAN-21-08.md:79, журнал §16.10 вопрос назван, ответа нет
MIN_FLOOR["d6"]=3 — константа, поставленная под зелень; «не править, вопрос владельцу» PLAN-16-08.md:453 открыт
Сверка $17.04 с реальным счётом DeepSeek — «офф-пик = ½» в записанных ценах не наблюдается Д32.11 на владельце
Якорные главы владельцу, сверка ОБЕИХ осей раздельно (риск «прибор топит смелое письмо») PLAN-22-08.md:312 выпало из Д38.6
Возврат Sol («потом на сол, если хватит времени»); его расхождение с fable — «главная незакрытая дыра нового прибора» HANDOFF-21-08.md:296 живёт только строкой «П-1 НЕ ИСПОЛНЕНА»

Д43.2 БЕСПЛАТНЫЕ ЗАМЕРЫ, ОБЪЯВЛЕННЫЕ И НЕ СДЕЛАННЫЕ

$0-замер носитель почему важен
Адъюдикация английской оси PLAN-17-08.md:294 «единственное, что блокирует несущий вывод фазы (H-3)»
Д5 — пере-классификация 24 мест канона PLAN-17-08.md:297 требование заказа, объявлено НЕИСПОЛНЕННЫМ и таким осталось
К-3 — прочитать 20.7% строк, выброшенных фильтром критика PLAN-21-08.md:81 пре-реквизит покупки З-2; если фильтр ест находки, вердикт по ядру V6 смещён ДО покупки
best-of-2 + $0-детектор расхождения журнал §15.12, HANDOFF-21-08.md:156 +2.36 позиции на разошедшихся главах, p=0.0065 (кросс-читательски), на похожих ВРЕДИТ 1.33. Самый дешёвый непроверенный рычаг корпуса; порог 10% обязан фризиться пре-регом
Кэш префикса — используем 44.8%, кэш-хит ×30 дешевле PLAN-17-08.md:259 чистая экономия без замера качества
rol.py --audit-read — инструмента аудита читателей НЕТ REVIEW-21-08.md:175 аудиты делаются руками каждый раз
naklon.py на панелях новой эры (z17/arch2/vendor/p0/p4) REVIEW-21-08.md:173 гейт наклона сторожит только старые проходы
chtenie.py --score-calib — пере-счёт числа 0.10, ради которого режим объявлен PLAN-17-08.md:310 код печатает только порядок
Дозная калибровка (карта «дефекты ↔ места») PLAN-22-08.md:313 дала бы шкалу приборам, которой у них нет
Эмбеддинговое выравнивание (LaBSE/vecalign, всё уже в кэше машины) PLAN-17-08.md:190-210 измерительный инструмент под всю ветку выравнивания

Д43.3 ДОЛГИ ЧУЖИМ ЗОНАМ, КОТОРЫЕ ПОЛИГОН ОБЯЗАЛСЯ ПИНГОВАТЬ И НЕ ПИНГАНУЛ

  1. Экстрактор epub сносит границы абзацев. «Настоящая починка — в бэкенде… пинг обязателен» (HANDOFF-21-08.md:152); консилиум поднял до «починка экстрактора — ДО любого нового en-замера, весь материал искажён нами» (KONSILIUM-22-08.md:35). В шаги плана 22.08 не попало, пинга в docs/PROGRESS.md НЕТ до сих пор — проверено грепом по секции «Полигон». ⇒ весь английский материал фазы снят с испорченной подачей, и бэкенд об этом не знает.
  2. Английский пар-пакет не заленджен в backend/prompts/ (PLAN-21-08.md:71) — en-армы фазы продакшеном не являются и не могут им стать без этого.
  3. Поправка Ф-4 «gemini как переводчик — 172 клетки, 0 отказов» в отчёт не внесена (PLAN-21-08.md:73). ⚠ Существенно рядом с Д42: это ФАКТ поведения, который надо читать вместе с 10 клетками content_filter у того же слага в СУДЕЙСКОЙ роли.

Д43.4 ЗАМЕРЫ, ВЫПАВШИЕ ИЗ ОЧЕРЕДИ ПОКУПОК Д38.6

выпало носитель цена
KE — grok-редактор над ЗАМОРОЖЕННЫМ D0 — условие «только если Шаг 1 покажет буфер» ИСПОЛНИЛОСЬ (Д32.15), а арм из планов исчез PLAN-22-08.md:311 ~$0.15
З-1: RN + канон-фиксер — «лучший промт с детерминированной страховкой, не пробован» PLAN-22-08.md:309 ~$0.10
З-5: две недостающие клетки RGT — панель переносимости так и осталась 13 глав вместо 15 PLAN-21-08.md:93 $0.11
Пере-купка заражённой ЯПОНСКОЙ базы dv-c-j2 (китайский мандат, блокер Б1) — в очередь попала только английская ZP PLAN-21-08.md:202 ~$0.2
H-4 на en/ja НЕ УСТАНОВЛЕНE6/J6 шли с погашенным размышлением; пере-мер не запланирован нигде KONSILIUM-22-08.md:20
Шаг 6, первая половина: клетки обязаны хранить call_kwargs и reasoning_text — «ДО ЛЮБЫХ ПОКУПОК» PLAN-22-08.md:255 $0

Д43.5 ЧТО С ЭТИМ ДЕЛАТЬ — ДИСПОЗИЦИЯ

  • Сессия НИЧЕГО из этого не исполняет — половина требует денег и слова владельца, половина относится к чужим зонам или к закрытым осям. Секция заводится как РЕЕСТР, а не как работа.
  • Три пункта я бы поднял первыми, и вот почему именно они:
    1. Экстрактор абзацев (Д43.3 п.1) — он единственный отравляет уже собранный материал: каждый новый английский замер до его починки наследует ту же порчу.
    2. К-3, чтение выброшенных строк критика ($0) — стоит перед покупкой ядра V6 и может сместить её вердикт ещё до денег.
    3. best-of-2 с замороженным порогом ($0 + одна дешёвая генерация) — единственный рычаг корпуса с эффектом +2.36 позиции при p=0.0065, то есть кратно больше всего, что фаза нашла в выборе архитектуры.
  • Норма, которую я бы завёл вместо ещё одного плана: носитель курса меняется — новый обязан явно перечислить, что из старого НЕ переехало и почему. Эта секция — первое такое перечисление за фазу; без нормы следующая смена курса потеряет ровно так же.

Д44 — У ЯКОРЯ НЕТ ВЫКЛЮЧАТЕЛЯ РАЗМЫШЛЕНИЯ. ЭТО МЕНЯЕТ РАМКУ ВСЕГО ДЕНЕЖНОГО ОТВЕТА

Замечание владельца 30.08: «у дипсика неотключаемый уровень рассуждений». Проверено по вендор-доке и по проводу — верно, и я строил Д41/Д42 так, будто это ручка, которую можно повернуть.

Д44.1 ВЕНДОР-ФАКТ И ПРОВОД-ФАКТ

Таблица маппинга эффорта (api-docs.deepseek.com/guides/thinking_mode; наша вахта D39.92 пере-снята curl-ом 10.08.2026, разбор ячеек <td>, таблица побайтно та же):

запрошено   →  flash   pro
low            low     ⛔ high
high           high    high
xhigh          high    max
max            max     max

(i) не слать reasoning_effort = ехать на high; (ii) на deepseek-v4-pro ручка low НЕ РАБОТАЕТ — маппится в high; (iii) рычаг бюджета размышления существует ТОЛЬКО у flash.

Что мы шлём на самом деле (ROSTER.call_kwargs, снято исполнением, не по памяти):

deepseek-v4-pro     max_tokens 16000 · temperature 0.3        ← ручки размышления НЕТ ВООБЩЕ ⇒ high
deepseek-v4-flash   … extra_body {"reasoning_effort": "low"}
glm-5               … extra_body {"thinking": {"type":"disabled"}}   ← выключатель РАБОТАЕТ
gpt-5.6-luna        … extra_body {"reasoning_effort": "low"}

Наш редактор — а он же якорь всех вердиктов фазы — работает на high, и опуститься не может.

Д44.2 ЧТО ЭТО ЛОМАЕТ В МОЁМ ЖЕ ОТВЕТЕ

Д41 напечатал: «платим не за вендора, а за РАЗМЫШЛЕНИЕ». Формулировка верна, но подразумевала выбор, которого нет. Точная форма:

У deepseek-v4-pro 46% токенов — размышление, и это не наша настройка, а условие поставки. Счёт за второй черновик в уме приходит всегда, и отказаться от него нельзя, не сменив модель.

И вторая половина, симметричная: у deepseek-v4-flash выключатель ЕСТЬ, но пользоваться им нельзя — «reasoning-off + плотный CJK-вход = зона эха», а effort:"low" уже пере-вооружает эхо-мину (1 чистый китайский выход из 16 базовых вызовов). ⇒ Обе роли DeepSeek прибиты к оплате размышления: pro не может выключить, flash не должен.

Д44.3 И ВОТ ТУТ БУФЕР ПЕРЕСТАЁТ БЫТЬ КРАСИВОЙ НАХОДКОЙ И СТАНОВИТСЯ ДЕНЬГАМИ

Три факта фазы, которые до сих пор лежали порознь, складываются в один:

  1. glm-5 — единственный жилец нашей панели, у кого выключатель размышления РАБОТАЕТ (thinking: {"type":"disabled"}, подтверждено живыми армами эксп-18/21). Арм E6 именно так и шёл: reasoning=0 на 16/16.
  2. glm-5 ОДНОПРОХОДКОЙ с выключенным размышлением — различимо ХУЖЕ (RG: +1.12/+1.19 при порогах 0.99/0.87/0.90, p=0.0042 · 0.0213 · 0.0042 — три круга, два семейства).
  3. Тот же glm-5 РЕДАКТОРОМ над боевым черновиком с тем же выключенным размышлением — НЕРАЗЛИЧИМ от боевого deepseek-v4-pro в той же роли.

Топология не просто «буферизует слабого жильца». Она возвращает нам выключатель, которого у вендора нет. Дорогой черновик уже подумал — и второй стадии думать не надо, поэтому в неё можно поставить модель с выключенным размышлением и не платить за второй черновик в уме.

В деньгах (Д41.1, один прайс, книга 1500 глав Гу):

черновик flash → редактор dspro (high, выключить нельзя)     $127   ← 90% денег в редакторе
черновик flash → редактор glm-5 (thinking disabled)          $20

Экономия не в том, что glm-5 «дешевле по прайсу», а в том, что у него можно НЕ КУПИТЬ размышление. Это единственный рычаг фазы, который бьёт и выбор архитектуры (1540%), и время суток (×2), и смену черновика (6%).

⚠ И ровно поэтому он не универсален: он держится на том, что думать уже кто-то другой. Убери дорогой черновик — и glm-5 без размышления проваливается (п.2). Рычаг принадлежит СВЯЗКЕ, а не модели.

Д44.4 ЧЕГО ЭТО НЕ ОТМЕНЯЕТ И ЧТО НАДО ПЕРЕ-СНЯТЬ

  • Конфликт приборов в силе (Д42.4): по счёту ошибок эксп-22 glm-5 редактором на zh — 2.12, Холм 0.0188, значимо хуже. Экономия в 6.3 раза не покупается, пока это не разрешено.
  • ⚠ ВЕНДОР-ФАКТ ПРОТУХАЕТ, И СРОК УЖЕ ИДЁТ. Та же страница вендора несёт сноску: «We will update the actual mapped effort of deepseek-v4-pro in early August 2026» — то есть маппинг эффорта объявлен к смене. Наша вахта пере-снята 10.08, сегодня 30.08. ⇒ перед любым денежным решением таблицу маппинга снять заново curl-ом ($0, вахта D39.92). Если вендор дал pro рабочий low — вся арифметика Д41/Д44 пере-считывается, и, возможно, в пользу связки.
  • glm-5 с размышлением ВКЛЮЧЁННЫМ стоит $182 за книгу (Д41.1) — дороже боевой связки. То есть «взять glm-5» без указания состояния выключателя — не решение, а его видимость. Конфигурация модели есть часть арма (норма Д28).

Д44.5 ЖИВАЯ ВАХТА В ТОТ ЖЕ ДЕНЬ: ВЕНДОР ИЗМЕНИЛ ТАБЛИЦУ, И Д44.1 УСТАРЕЛА ЧЕРЕЗ ЧАС ПОСЛЕ НАПИСАНИЯ

Секция Д44.1 сама же и потребовала пере-снять вахту D39.92 перед денежным решением. Пере-снято немедленно, curl HTTP 200, api-docs.deepseek.com/guides/thinking_mode, 108 336 байт, sha256 f28c4324…, 30.08.2026. Страница ИЗМЕНИЛАСЬ. Дословно:

(1) Thinking mode is enabled by default, with the default effort being high. (2) The mapping between the effort set by the user and the model's actual reasoning effort is as follows (identical for deepseek-v4-flash and deepseek-v4-pro):

Requested effort Actual mapped effort
low low
medium high
high high
xhigh high
max max

Что изменилось против нашей записи от 10.08 (там таблица имела ДВЕ колонки, flash и pro раздельно, и у pro было low→high, xhigh→max):

было у нас (10.08) живая страница (30.08)
колонок две, flash и pro РАЗДЕЛЬНО одна, «identical for flash and pro»
low на pro маппится в high low
xhigh на pro max high
рычаг бюджета «существует ТОЛЬКО у flash» существует у обеих
тумблер thinking: disabled подан как flash-овый подан как общий для модели DeepSeek

Вендор исполнил ровно то, что обещал сноской «We will update the actual mapped effort of deepseek-v4-pro in early August 2026». Наша вахта 10.08 застала старую редакцию; за двадцать дней она сменилась, и никто не смотрел.

Замечание владельца 30.08 («дипсик не принимает уровень рассуждения, там либо xhigh, либо high») описывает СТАРУЮ таблицу и по ней ВЕРНО: у pro low уезжал в high, а xhigh — в max, то есть реально доступны были только верхние ступени. По живой редакции это больше не так.

Но клейм остаётся ДОКОЙ, а не замером. Норма проекта: «слаг ≠ модель; при аномалии — поведенческая проба, а не листинг». ⇒ прежде чем считать на этом деньги, нужна живая проба: один вызов pro с reasoning_effort:"low" и сверка reasoning_tokens против дефолтного. Смета — единицы центов. Сессия её не делает: покупок в этой сессии нет, и заводить их в конце работы без слова владельца я не буду.

⚠ И цена рычага уже замерена с другой стороны: effort:"low" пере-вооружает эхо-мину (квирк-бюллетень п.4: 1 чистый китайский выход из 16 базовых вызовов), а «reasoning-off + плотный CJK-вход = зона эха». Рычаг есть — бесплатным он не будет.

ПОБОЧНЫЙ ЖИВОЙ ФАКТ С ТОЙ ЖЕ СТРАНИЦЫ, которого нет нигде в наших доках: «Thinking mode does not support the temperature, top_p, presence_penalty, or frequency_penalty parameters… setting these parameters will not trigger an error but will also have no effect»temperature: 0.3, который ростер шлёт на deepseek-v4-pro, МОЛЧА ИГНОРИРУЕТСЯ. Параметр в проводе есть, эффекта нет; все наши «temperature уравнена» — про то, чего не было.

Д44.6 ЛУНА ПРОТИВ ЯКОРЯ В ОДНОПРОХОДКЕ: ЧИСЛА ПЕРЕ-СНЯТЫ ПОКЛЕТОЧНО, И ОНИ БОЛЬШЕ, ЧЕМ Я НАПЕЧАТАЛ

Владелец 30.08: «мы сравнивали цены именно по однопроходкам, там луна чет разъебала». Пере-считано из клеток, все 16 глав, один прайс, finish=stop 16/16 у обоих, модели сверены полем model_returned:

RN  deepseek-v4-pro, промт-роль   медиана $0.02011/клетка   сумма по 16 главам $0.4938
RL  gpt-5.6-luna, ТОТ ЖЕ промт    медиана $0.00248/клетка   сумма по 16 главам $0.0392
                                  ⇒ 8.1× по медиане · 12.6× по сумме

И вся разница — в размышлении, поглавно:

RN reasoning_tokens:  466 · 532 · 575 · 588 · 639 · 857 · 910 · 931 · 5804 · 6514 · 7061 · 11204 · 11723 · 14221 · 16643 · 19559
RL reasoning_tokens:  511 · 512 · 512 · 512 · 1005 · 1022 · 1023 · 1024 ×6 · 1535 ×3

У якоря размышление БИМОДАЛЬНО (восемь дешёвых глав против восьми, где он пишет до 19 559 токенов в ум) — это тот самый механизм «черновик в уме» из Д15.19. У luna оно прибито к ~1 000, потому что ей мы шлём reasoning_effort: "low", и у неё эта ручка работает.

И ВОТ ГЛАВНОЕ, ЧЕГО НЕ ГОВОРИЛА НИ ОДНА МОЯ ПРЕЖНЯЯ СТРОКА: ЭТО СРАВНЕНИЕ КОНФИГУРАЦИЙ, А НЕ МОДЕЛЕЙ. Мы сравнили dspro на high (ручку ему не слали вовсе, а по обеим редакциям вендор-таблицы «не слать = high») против luna на явном low. По собственной норме фазы (Д28: «конфигурация модели — часть арма, вендор-дефолт, переопределённый ростером, называть в пре-реге наравне с моделью») это разные армы, и разрыв 8× частично куплен разницей ступеней, а не разницей вендоров.

Честная форма вывода:

gpt-5.6-luna в роли однопроходки стоит в 8 раз меньше якоря при качестве, которого прибор не разрешил, — но якорь при этом шёл на максимальной доступной тогда ступени размышления, а испытуемый на низшей. Сколько из восьми крат принадлежит модели, а сколько ступени, НЕ РАЗВЕДЕНО.

И ровно это теперь можно развести за копейки — потому что по живой вендор-редакции (Д44.5) у pro появился рабочий low. Замер, который закрывает вопрос: те же 16 английских глав, тот же промт, deepseek-v4-pro с reasoning_effort:"low". Смета по замеренным токенам luna-профиля — порядка $0.050.10 на все 16 клеток. Это самая дешёвая и самая информативная покупка из всех, что фаза может сейчас назвать: она либо снимает с луны 8-кратное преимущество (и тогда дефолт письма остаётся дома), либо подтверждает его при уравненных ступенях (и тогда у продукта появляется восьмикратная экономия на дорогой роли). ⚠ Перед покупкой — эхо-проба: low на DeepSeek пере-вооружает эхо-мину, и на китайской паре это уже наблюдалось.


Д45 — ЯКОРЬ НА НИЖНЕЙ СТУПЕНИ: РАЗВЕДЕНИЕ КОНФАУНДА «ВЕНДОР ПРОТИВ СТУПЕНИ». ПРЕ-РЕГ, ЗАПИСАН ДО ПОКУПКИ

Санкция владельца 30.08, дословно: «Да, по поводу дипсика — бери». Заказ — замер, названный в Д44.6: единственное, что разводит восьмикратный разрыв «luna против якоря» на долю ВЕНДОРА и долю СТУПЕНИ размышления.

Почему он стал возможен ровно сейчас. До 30.08 такого арма построить было НЕЛЬЗЯ: вендор-таблица маппила lowhigh у deepseek-v4-pro, то есть нижней ступени у якоря не существовало. Живая вахта D39.92, пере-снятая 30.08 (curl HTTP 200, sha256 f28c4324…), показала новую редакцию — «identical for deepseek-v4-flash and deepseek-v4-pro», low → low (Д44.5). Это ДОКА, а не поведение. Настоящая поведенческая проба — сам этот арм, и он же первый её потребитель.

Д45.0 СОСТАВ И ЧТО ИМЕННО МЕНЯЕТСЯ

Арм RNL = deepseek-v4-pro · промт побайтно тот же, что у RN (в реестре CUT арма нет, значит ядро не режется ни на строку) · reasoning_effort: "low" ЯВНО · те же 16 английских глав, те же, что у RN и RL. Тег dv-n-rnl-*, касса ФД-N.

единственный варьируемый фактор:  RN  → ручка НЕ шлётся вовсе  (= вендор-дефолт high)
                                  RNL → reasoning_effort: "low"

Д45.1 ПОРЯДОК ПОКУПКИ: ОДНА КЛЕТКА, ПОТОМ РЕШЕНИЕ, ПОТОМ ПАЧКА

  1. rol.py --wire en --arm=RNL — что уходит по проводу, печатается и читается вслух.
  2. Покупается ОДНА клетка — глава 001e6ac4eb. Выбрана не случайно: у RN на ней 19 559 токенов размышления, самая дорогая клетка панели. Если ручка работает, здесь это видно сильнее всего; если не работает — тоже.
  3. ПРАВИЛО РЕШЕНИЯ, ОБЪЯВЛЕНО ДО ЧИСЕЛ:
    • reasoning_tokens < 5 000 (вчетверо ниже 19 559) ⇒ ручка РАБОТАЕТ, покупаю остальные 15;
    • reasoning_tokens ≥ 10 000ручка НЕ работает, СТОП, пятнадцать клеток не покупаются, и вендор-дока объявляется расходящейся с поведением — пинг в квирк-бюллетень;
    • 5 00010 000 ⇒ тоже СТОП и вопрос владельцу: эффект есть, но не тот, что обещан вендором, и решать, платить ли за него, не сессии.
  4. Гейт годности клетки прежний: finish=stop · непустой content · доля кириллицы · длина против медианы панели.

Д45.2 ЭНДПОЙНТЫ, ОБЪЯВЛЕННЫЕ ДО ЧИСЕЛ

  • П1 — НЕСУЩИЙ, детерминированный, $0 после покупки. Попарно по 16 главам: reasoning_tokens и цена RNL против RN, знаковый тест. Это и есть ответ на вопрос «сколько из 8.1× принадлежит ступени». Разложение печатается тремя числами: RN (высокая ступень) · RNL (низкая) · RL (луна на низкой) — и разрыв «луна против якоря» пере-считывается ПРИ УРАВНЕННЫХ СТУПЕНЯХ.
  • П2 — качество по классу А, детерминированный, $0. schet.py на четырёх замороженных классах (род · язык · приём · банк), RNL против RN и RL. Эталон для этих 16 глав уже снят вслепую по исходнику и заморожен bedc39a — прибор достаётся даром.
  • П3 — ранговый (слепое чтение). ОБЪЯВЛЯЮ ЗАРАНЕЕ: в этой сессии НЕ СНИМАЕТСЯ. Он стоит 16 агент-сессий, а свободно 14 из 200 (израсходовано 186). Кап — слово владельца от 20.08, и поднимать его решением сессии запрещено. ⇒ панель будет собрана и передана, либо владелец поднимет кап. Это названо ДО покупки, а не после, чтобы «купили и не прочли» не повторилось.

Д45.3 ЧЕГО ЗАМЕР НЕ ЗАКРОЕТ

  • Одна пара (en) и одна модель. Разгон размышления у DeepSeek привязан к плотному ханьскому входу (квирк-бюллетень п.7: zh требует ×7.8 против en) ⇒ на китайской паре величины будут другими, и переносить их нельзя.
  • Средняя ступень не мерится: по живой таблице medium, high и xhigh все маппятся в high, то есть реально различимых ступеней три — low, high, max. Мы меряем крайние две из трёх.
  • low у DeepSeek ПЕРЕ-ВООРУЖАЕТ ЭХО-МИНУ (квирк-бюллетень п.4: 1 чистый китайский выход из 16 базовых вызовов; «reasoning-off + плотный CJK-вход = зона эха»). На английской паре эхо у RN было 0/16, но эхо-гейт по выходу обязан быть снят и напечатан, а не подразумеваться.
  • Вердикт о качестве при уравненных ступенях будет неполон без П3 — счётный прибор видит брак, не прозу, а весь вес промта, как показал Шаг 4, лежит именно на прозе.

Д45.4 ДЕНЬГИ

Касса ФД-N: потрачено $3.014505 при потолке $3.30, свободно $0.285. Смета при работающей ручке — ~$0.16 на 16 клеток (вход 3 250 ток. × $1.32/1M + выход ~1 500 ток. × $3.96/1M). Потолок сессией НЕ поднимается. Если ручка не сработает и клетка поедет на high, проекционный гард кассы остановит покупку сам — именно для этого порядок «одна клетка, потом пачка» и выбран.

Д45.5 РЕЗУЛЬТАТ ПРОБНОЙ КЛЕТКИ: СРЕДНЯЯ ПОЛОСА. ПРАВИЛО ВЕЛИТ ОСТАНОВИТЬСЯ

Куплена одна клетка — глава 001e6ac4eb, та самая, где у RN было 19 559 токенов размышления, самая дорогая клетка панели. Списано $0.038276 (ФД-N: 3.014505 → 3.052781).

арм ступень finish вход выход размышление цена знаков
RN ручка не слалась (= high) stop 3 270 20 182 19 559 $0.08081 1 655
RNL reasoning_effort: "low" stop 3 191 8 369 7 748 $0.03735 1 677

Гейт годности пройден: finish=stop · доля кириллицы 1.000 · латиницы в выходе ноль low на этой клетке эхо-мину НЕ пере-вооружил (одна клетка, английская пара — не вывод).

ПО ПРАВИЛУ Д45.1, ОБЪЯВЛЕННОМУ ДО ЧИСЕЛ: 7 748 попадает в полосу 5 00010 000 ⇒ СТОП И ВОПРОС ВЛАДЕЛЬЦУ. Пятнадцать оставшихся клеток НЕ покупаются. Правило не пере-открывается после того, как число увидено, — ровно за этим оно и писалось заранее.

Что установлено и что нет.

  • Ручка на deepseek-v4-pro ДЕЙСТВУЕТ: размышление ×2.52 вниз, цена ×2.16 вниз, при побайтно том же промте и той же длине выхода (1 677 против 1 655 знаков). До 30.08 такого арма не существовало: вендор-таблица маппила lowhigh.
  • Но НЕ до той степени, которую пре-рег считал «работает». Порог 5 000 был построен на ожидании, что настоящий low даст порядок luna (~1 000) или дешёвого режима самого RN (466931). Получено 7 748. ⇒ вендор-дока и поведение сходятся по НАПРАВЛЕНИЮ и расходятся по ВЕЛИЧИНЕ, и это честный статус, а не «ручка не работает».
  • ⚠ Клетка выбрана как ХУДШИЙ случай панели. На главах, где RN думал 466931, абсолютные числа будут другими, и отношение ×2.52 переносить на них нельзя.

Вопрос владельцу — и он денежный. Докупка 15 клеток по цене этой пробы стоила бы ~$0.56, а в ФД-N свободно $0.247. ⚠ Но проба — верхняя граница: если отношение держится, медианная клетка выйдет ~$0.012 и пачка уложится в ~$0.180.25, то есть впритык. Проекционный гард кассы остановит прогон сам, если не уложится. ⇒ два решения, оба за владельцем: (1) брать ли пачку при результате «эффект есть, но вдвое, а не на порядок»; (2) если брать — что делать при срабатывании гарда на последних клетках. Потолок сессией не поднимается.

ПОПРАВКА Д46 (30.08, после пере-чтения пре-рега): развилка переформулирована, и у неё появилась рекомендация — пятнадцать клеток не покупать, потому что дизайн Д45 конфаундирован дрейфом, а ни один неконфаундированный дизайн в оставшиеся деньги не влезает. Смета «$0.180.25» уточнена до $0.169 (считана не по цене худшей главы, а по доле цены на пробной клетке). См. Д46.


Д46 — ЧТО ОДНА КЛЕТКА ОТДАЛА БЕСПЛАТНО, И ПОЧЕМУ ПЯТНАДЦАТЬ ОСТАЛЬНЫХ ОТВЕТА НЕ ДАЛИ БЫ

Д46.1 УЛИКА ЗА $0: ПАРАМЕТР ДОХОДИТ ДО МОДЕЛИ, И ЭТО ВИДНО ВО ВХОДНЫХ ТОКЕНАХ

При побайтно одинаковых messages провайдер вернул разные prompt_tokens:

арм reasoning_effort prompt_tokens cached_tokens
RN не слался 3 270 2 688
RNL low 3 191 0

79 токенов на входе. Ни один из них не наш: наши сообщения совпадают до байта.

Цепь, каждое звено снято исполнением, а не памятью:

  1. промт побайтно одинrol.rol_msgs('en', src, 'RN') и …'RNL' дают sha256 51e7f427940cae15 у обоих армов (три сообщения 7525 · 310 · 1675 знаков);
  2. тело вызова различается ровно одним полемcall_kwargs (eval/dovodka/rol.py:668=def call_kwargs, дописывание уровня — строка 701) берёт общий ростер и добавляет только reasoning_effort; модель, max_tokens=32000, temperature — общие;
  3. исходник главы тот же — манифест единиц приколот, и чтение никогда не переотбирает: при смене текста uid меняется, приколотый исчезает из пересчитанных кандидатов и покупка останавливается (eval/role_topology/pair_en.py:132=def units). Покупка 30.08 прошла ⇒ текст не менялся. ⚠ Это не рассуждение, а гейт, который обязан был сработать и не сработал;
  4. шаблон промта не менялсяonepass-core.md последний раз тронут 20.08, за день до покупки RN; пар-блоки и бриф с 20.08 не менялись вовсе (git log --since=2026-08-20, пусто);
  5. кэш это не объясняет — две клетки RN с cached_tokens=0 не смещены вниз: остатки от линии pt = 0.23332·знаки + 1041.7, построенной по 14 кэшированным, у них 31.8 и +10.4 при фактическом разбросе остатков от 29.5 до +44.0. У RNL остаток 69.6 — ниже любой клетки RN, но ⚠ всего на ~38 токенов ниже нижнего края, при хвосте +44 с другой стороны: регрессия — подпорка, а не несущая улика. Несущая — прямое сравнение на ОДНОЙ главе (79).

ДВА контроля детерминизма, и второй нашёлся бесплатно при адверсариальном проходе.

  1. Замер 05.08 — тот самый, у которого отозвано звено про величину: при побайтно одинаковых messages дефолт и low вернули одинаковые 2124, а xhigh — 2203 (квирк-бюллетень §3б, строка «серверная реакция»). Провайдер повторяет prompt_tokens в точности, когда параметр не действует. ⚠ Границу назвать честно: это ДРУГОЙ промт и ДРУГАЯ роль, и снят он ДО того, как вендор поменял сервинг, — значит он доказывает детерминизм счётчика внутри прежней эпохи.
  2. Пред-полётные пробы самого рига закрывают и межэпохальную дыру. dv-n-probe-deepseek-v4-pro-1…4 — один и тот же тривиальный запрос без ручки: prompt_tokens = 84 · 84 · 84 · 84, причём четвёртая куплена 30.08 за две минуты до RNL (её $0.000923 и составляют разницу между списанными $0.038276 и ценой клетки $0.037353). ⇒ дефолтный счёт входа не сдвинулся ни на токен через смену сервинга — значит 79 принадлежит параметру, а не эпохе.

⇒ 79 — реакция на параметр, а не разброс счётчика и не смена вендорского сервинга.

Регулярность, которую я не берусь объяснять: 2203 2124 = 79 (05.08, xhigh над дефолтом) и 3270 3191 = 79 (30.08, дефолт над low) — при совершенно разных промтах (2 124 против 3 270 входных токенов) и разных ролях. Похоже на серверную вставку фиксированного размера, но это догадка; печатается как наблюдение, а не как клейм.

Статус «low на proНЕ УСТАНОВЛЕНО» закрыт В ЧАСТИ «доходит ли»: ДОХОДИТ. Вендор-дока (живая вахта 30.08) и поведение сошлись. Величина среза размышления не установлена — Д46.2.

Д46.2 ПРЕ-РЕГ Д45 КОНФАУНДИРОВАН — НО НЕ ТЕМ, ЧЕМ Я СНАЧАЛА НАПИСАЛ

Д45 сравнивает RNL, купленный 30.08, с RN, купленным 21.08: два блока, разнесённые на девять дней. Между ними лежит событие, которое в отчёте уже записано и которое я в первой редакции этой секции конфаундером НЕ НАЗВАЛ:

НЕСУЩИЙ КОНФАУНД — ДОКУМЕНТИРОВАННАЯ СМЕНА ВЕНДОРСКОГО СЕРВИНГА. Живая вахта 30.08 (Д44) показала, что DeepSeek переписал таблицу маппинга эффорта, и сделал это между двумя блоками. Кроме маппинга, вендор мог тронуть что угодно ещё — доказательства, что дефолтный путь остался тем же, у нас нет ни на единицу размышления. Сравнение «арм 21.08 против арма 30.08» приписывает ручке всё, что вендор поменял за девять дней. Это и есть та причина, по которой ответ нельзя получить дозакупкой одного арма.

Дрейф — второй конфаунд, и он СЛАБЕЕ, чем я написал сначала. §3б бюллетеня даёт шесть дефолтных розыгрышей одного запроса, монотонно РАСТУЩИХ (1952 → 9104 → 10818 → 11157 → 13421 → 15720). Три уточнения, каждое против моей же первой формулировки:

  • у дрейфа есть ЗНАК, и он работает против нуля, а не за него: если бы тренд продолжился, дефолт 30.08 думал бы БОЛЬШЕ 19 559, и наблюдённые ×2.52 были бы НИЖНЕЙ границей среза, а не артефактом;
  • эпизодичность: пред-полётные пробы того же рига на одном запросе дали 58 · 202 · 130 (до 22.08) и 196 (30.08) — значение 30.08 внутри старого диапазона. Улика слабая (вход тривиальный, n=4), но она есть, и она против «модель за девять дней стала думать иначе»;
  • а вот проверить дрейф ВНУТРИ блока RN нельзя вовсе, и это надо сказать прямо: у всех 16 клеток RN один и тот же mtime (переезд машины, Д35.2), поля времени в клетках нет ⇒ порядка вызовов не существует. Любая корреляция «номер вызова ↔ размышление» на этих данных построена на порядке, которого нет. ⚠ Ровно такую корреляцию (Spearman 0.08) принёс адверсариальный проход — отклонена по этой причине, см. Д46.6.

Раздел Д45.3 «чего замер не закроет» не назвал НИ ОДНОГО из двух. Там четыре границы (одна пара · средняя ступень · эхо · нужен П3). Это дефект моей же пре-регистрации, найденный пере-чтением уже после фриза 87dd124. Печатаю против себя: фриз ценен тем, что делает такую находку видимой, а не тем, что делает дизайн правильным.

Лечение у обоих конфаундов одно и то же: оба арма покупаются В ОДНОМ БЛОКЕ, вперемежку. Тогда ни смена сервинга, ни дрейф не могут разойтись между армами. Цена такого дизайна — Д46.3.

Д46.3 АРИФМЕТИКА: ОДИН НЕКОНФАУНДИРОВАННЫЙ ДИЗАЙН В ОСТАВШИЕСЯ ДЕНЬГИ ВСЁ-ТАКИ ВЛЕЗАЕТ

⚠⚠ ЭТА ТАБЛИЦА — ВТОРАЯ РЕДАКЦИЯ. Первая утверждала «ни один неконфаундированный дизайн не влезает», и это было НЕВЕРНО: я перебрал только полный набор, дорогую восьмёрку и четыре главы, пропустив дешёвую восьмёрку — при том, что бимодальность нашёл сам двумя абзацами выше. Поймано адверсариальным проходом (Д46.6). Заодно сметы пере-считаны честно: плоская доля «RNL = 0.4622 от RN» переносила отношение с САМОЙ ДУМАЮЩЕЙ главы на дешёвые, где цену задаёт вход, — ровно та операция, которую соседняя строка запрещает делать с ×2.52.

Свободно в ФД-N: $0.2472 (потрачено 3.052781 при потолке 3.30). Основание сметы — не отношение, а пин прайса ($1.320 вход · $0.044 кэш · $3.96 выход за 1M) и по-клеточное сырьё: вход берётся фактический, выход = completion reasoning плюс размышление, ужатое в 2.5245. Вилка — от «кэш прогрет» (2 688 токенов системного промта по кэш-цене) до «кэш холодный на каждой клетке».

Факты панели: 16 клеток RN стоили $0.445438 (медиана ≈$0.01668, разброс $0.0032$0.0808), размышление бимодально — восемь глав 466931 токенов и восемь 5 80419 559, и 89.8% денег панели лежит в дорогой восьмёрке.

дизайн что покупает цена (тёплый … холодный) вердикт
А — фриз Д45 15 RNL, сравнение с RN от 21.08 $0.170 … $0.221 влезает, но конфаундирован (Д46.2). ⚠ Прежняя смета $0.169 была ниже обоих концов честной вилки
Б — интерливинг, все 16 глав 16 RN' + 16 RNL одним блоком $0.643 … $0.753 не влезает
В — интерливинг, дорогая восьмёрка 8 + 8 $0.565 … $0.620 не влезает
Г — интерливинг, гибрид 8 дешёвых + 3 дорогих 11 + 11 $0.205 … $0.280 ⚠ холодный конец ВЫШЕ потолка ⇒ гард остановит на последних клетках
Д — интерливинг, дешёвая восьмёрка 8 RN' + 8 RNL $0.078 … $0.133 ~влезает с запасом 2× СНЯТО (Д47.4): ожидание гарда $0.131016, покупаемо ≈$0.116 — холодный конец НЕ влезал уже на момент фриза; фактически гард остановил прогон после первой пары. Прежняя пометка даже по холодному концу; n=8 пар ⇒ минимальный двусторонний p знакового теста 0.0078 — значимость достижима по построению

Вывод меняется: неконфаундированный замер купить МОЖНО, и он вчетверо дешевле того, что было заморожено. Но он покупает не всё:

  • дизайн Д отвечает на вопрос «режет ли ручка размышление» чисто — оба арма в одном блоке;
  • он НЕ отвечает, сколько денег это экономит там, где деньги: дешёвая восьмёрка — 10.2% цены панели. Дизайн В отвечал бы, но стоит вдвое больше свободных денег;
  • и «дешёвая глава» — не свойство главы, а исход одного розыгрыша. Разброс размышления на побайтно одном входе у DeepSeek измерялся десятками раз (квирк п.2), так что RN' на «дешёвой» главе может сегодня думать вдесятеро больше вчерашнего. Вилка выше это и закладывает; страховка — проекционный гард кассы, а не оптимизм.

РЕКОМЕНДАЦИЯ СЕССИИ, обе части: (1) пятнадцать клеток по фризу Д45 (дизайн А) не покупать — они дадут число, которое нельзя приписать ручке; (2) если владелец хочет двигать вопрос дальше — дизайн Д, пре-регистрация в Д47. Решение о покупке — его.

Д46.4 ЧТО ЭТИ ДЕНЬГИ КУПИЛИ БЫ, А ЧТО НЕТ

Даже чистый замер ВЕЛИЧИНЫ не отвечает на вопрос, ради которого ручка нужна:

  • качество прозы при low не мерится счётным прибором — вес ролевого промта лежит на прозе, не на браке (Д36), а ранговый П3 стоит 16 агент-сессий при свободных 14 из 200;
  • эхо-мина на low у pro не мерена ни разу (квирк §3б, «Не бесплатно»); одна английская клетка с кириллицей 1.000 — не замер;
  • переносимости на боевую пару нет: на плотном ханьском входе размышление идёт ×7.8 (квирк п.7), и английские величины на zh не переносятся.

⇒ Вопрос уходит в пак, у которого есть и деньги на интерливинг, и сессии на ранг. Сюда записаны его цена ($0.585 за дизайн В плюс 16 сессий) и дизайн, чтобы следующий не начинал с нуля.

Д46.5 БОЕВАЯ КОНФИГУРАЦИЯ НЕ ТРОНУТА — И ВОТ ПОЧЕМУ ЭТО НЕ ЛЕНЬ

THINK["deepseek-v4-pro"] = ("none", "") в eval/tenant_panel/roster.py оставлено как есть: ручка теперь доходит, но её цена в качестве и эхе не замерена, а менять боевую ступень редактора под неизмеренный риск — обмен с неизвестным курсом. Правится только комментарий рядом: он утверждал «ручка low признана НЕ УСТАНОВЛЕННОЙ ⇒ едем вендор-дефолтом», и первая половина этого с 30.08 неверна. Причина ехать дефолтом осталась, но она другая, и в коде должна стоять верная. Гейт чужого пака пере-снят после правки (verify22.py): расхождение то же единственное и то же самое — граница двойной оплаты, считаемая по mtime, которые обнулил переезд (Д39.2 / R71).

Д46.6 АДВЕРСАРИАЛЬНЫЙ ПРОХОД ПО ЭТОЙ ЖЕ СЕКЦИИ — ЧТО ОН СЛОМАЛ

Мандат самопроверки требует прохода по ГОТОВОЙ работе, а не самоотчёта. Один опровергатель claude-fable-5, мандат — опровергать, подтверждать запрещено; репозиторий read-only, платных вызовов ноль. Секция была ему отдана в первой редакции. Итог: одно опровержение, три усиления, одна отклонённая находка.

что вердикт что сделано
«ни один неконфаундированный дизайн не влезает» (Д46.3) ОПРОВЕРГНУТО: пропущена дешёвая восьмёрка, где интерливинг стоит вчетверо меньше свободных денег и даёт n=8 таблица пере-строена, вывод перевёрнут, добавлен дизайн Д и пре-рег Д47
смета по плоской доле 0.4622 ОСЛАБЛЕНО: отношение перенесено с самой думающей главы на дешёвые вопреки собственному запрету строкой выше сметы пере-считаны из пина прайса по-клеточно, с вилкой тёплый/холодный кэш
«дрейф ⇒ ответа не купить» (Д46.2) ОСЛАБЛЕНО: у дрейфа есть знак, и он работает против нуля; несущий конфаунд — не дрейф, а смена сервинга Д46.2 переписана, конфаунды разведены и названы по силе
межэпохальная стабильность счётчика входа (Д46.1) дыра в цепи: контроль 05.08 снят ДО смены сервинга закрыта бесплатной уликой, которую проход и нашёл: пробы 84 · 84 · 84 · 84, четвёртая — 30.08
«разброс остатков ±2044» ⚠ приукрашено напечатан фактический разброс 29.5…+44.0 и оговорено, что регрессия — подпорка, а не несущая улика
Spearman(порядок вызовов, размышление) = 0.08 внутри блока RN как довод «дрейфа нет» ОТКЛОНЕНО МНОЙ у всех 16 клеток RN один mtime (переезд, Д35.2), поля времени в клетке нет ⇒ порядка вызовов не существует, и корреляция построена на нём. Находка отклонена, причина напечатана — Д46.2

Секция исправлена НА МЕСТЕ, а не баннером поверх: обе редакции написаны в одной сессии, ни одна не была закоммичена и ни один документ на первую не ссылался. Что именно было неверно — стоит в самой таблице выше и во врезке Д46.3, чтобы поправка не потерялась вместе с черновиком.

И встречная мораль, ради которой это записано: опровергателя нельзя принимать на слово так же, как нельзя принимать на слово себя. Из шести его пунктов пять улучшили секцию, а шестой был бы принят как «доказано, что дрейфа нет», если бы я не пошёл смотреть mtime.


Д47 — ПРЕ-РЕГИСТРАЦИЯ ДИЗАЙНА Д: ИНТЕРЛИВИНГ В ОДНОМ БЛОКЕ. НЕ КУПЛЕНО, ЖДЁТ СЛОВА ВЛАДЕЛЬЦА

Пишется ДО единого платного вызова и замораживается коммитом. Санкция владельца от 30.08 («по поводу дипсика — бери») относилась к дизайну Д45; здесь дизайн ДРУГОЙ (второй арм, другая выборка, другие деньги), и переносить санкцию на него я не вправе. Покупка не начнётся, пока владелец не скажет по этому дизайну отдельно.

Д47.1 ВОПРОС, И ТОЛЬКО ОН

Режет ли reasoning_effort:"low" размышление у deepseek-v4-pro — при устранённых конфаундах времени? Не «на сколько процентов», не «стоит ли менять боевую ступень»: одна проверяемая вещь.

Д47.2 ДИЗАЙН

  • Армы: RN2 (тот же deepseek-v4-pro, генерация 2, ручка НЕ шлётся = вендор-дефолт) против RNL (та же модель, reasoning_effort:"low"). Промт у обоих — тот же ролевой однопроходный, побайтно (rol_msgs, sha256 сверяется селфтестом перед покупкой).
  • Главы — восемь, названы ЗДЕСЬ и не пере-выбираются: b065a92dc0 · 5a8f48d24a · 100b088f71 · 49ca859c94 · 8e50448cea · c3517980c7 · 3bd6481182 · 26c3bff1d4. Это восемь глав с наименьшим размышлением у RNвыбор объявлен ценой, а не результатом: дорогая восьмёрка стоит $0.5650.620 при свободных $0.2472.
  • Порядок — ИНТЕРЛИВИНГ ПО ГЛАВЕ: для каждой главы подряд RN2, затем RNL, и только потом следующая глава. Оба конфаунда Д46.2 (смена сервинга · дрейф) не могут разойтись между армами, потому что армы разделены минутами, а не днями.
  • Прибор — сам usage, ранговых чтений и агент-сессий не требуется (их 14 из 200, и они зарезервированы не сюда).

Д47.3 ПРАВИЛО РЕШЕНИЯ — НАПИСАНО ДО ЧИСЕЛ

Первичный эндпойнт: знаковый тест по восьми парам, reasoning_tokens(RNL) < reasoning_tokens(RN2), порог α = 0.05 двусторонний.

  • 8 из 8 (p = 0.0078) ⇒ ручка режет; клейм «low действует на pro» установлен на английской паре. Печатается медиана отношения — как ОПИСАНИЕ, не как перенос;
  • 7 из 8 (p = 0.070) ⇒ не значимо: «не установлено». Это РЕЗУЛЬТАТ, а не повод докупать девятую главу — добор до значимости после взгляда на числа запрещён (D28, и на этом же сгорело звено (а) 05.08);
  • ≤ 6 из 8 ⇒ ручка на этом материале не режет.

Слабость дизайна названа заранее, а не после: при n=8 значимости достигает ТОЛЬКО единогласный исход. Это цена того, что дизайн влезает в оставшиеся деньги; поднимать n — значит поднимать потолок.

Гейт годности каждой клетки (падение = клетка не входит в счёт, и это печатается): finish=stop · доля кириллицы ≥ 0.99 · латиница-эхо = 0 · prompt_tokens(RN2) prompt_tokens(RNL) в диапазоне 60100 — по-клеточная проверка того, что параметр вообще доехал (Д46.1: ожидается 79).

Д47.4 ДЕНЬГИ И СТОП

Касса ФД-N, потолок $3.30 не поднимается, свободно $0.2472. Смета дизайна — $0.078 (кэш прогрет) … $0.133 (кэш холодный на каждой клетке). ~то есть запас 2× даже по худшему концуСНЯТО, разбор абзацем ниже: запаса не было вовсе.

Как именно защищены деньги — по коду, а не по намерению. Гард money.Guarded.afford() (eval/tenant_panel/money.py:149=def afford) проверяется перед КАЖДОЙ клеткой и отказывает, когда потрачено + ожидание > потолок.

И ЗДЕСЬ Я СОЛГАЛ САМ СЕБЕ ИМЕННО В ТОЙ ФРАЗЕ, ГДЕ ОБЕЩАЛ ЧИТАТЬ КОД (баннер консилиума 30.08). Написанное дальше — «ожидание для deepseek-v4-pro — $0.0214 ⇒ покупка идёт до ≈$0.226 сверх нынешнего, дизайн укладывается с запасом» — неверно против кода, который абзац цитирует. $0.0214 — это плоская прикидка ПЛАНИРОВЩИКА --dry, а не ожидание гарда. Гард берёт model_expect (eval/tenant_panel/money.py:105=def model_expect), а тот считает ожидание по СВОИМ прошлым записям этой модели, беря их МАКСИМУМ; максимум deepseek-v4-pro в корпусе — $0.131016 (dv-m-rn-ef9cd38ec4.LENGTH1.json). ⇒ покупаемо было около $0.116, то есть холодный конец собственной сметы ($0.133) не влезал уже НА МОМЕНТ ФРИЗА, а «запас ~2×» был ложным независимо от последующего промаха сметы. ⚠ Число $0.131016 стоит в этом же отчёте двумя секциями ниже — в сообщении гарда, остановившего прогон (Д47.6). Два числа лежали рядом, и никто не свёл. Класс ошибки: клейм «по коду» без исполнения кода — тот же, за который эта же сессия ловила себя весь день.

ожидание для deepseek-v4-pro — $0.0214 ⇒ покупка идёт, пока расход не дойдёт до ≈$0.226 сверх нынешнего, и дизайн Д укладывается в это с запасомСНЯТО. ⚠ Отдельно: сводка --dry печатает «НЕ ВЛЕЗАЕТ» для ВСЕГО остатка замера ($1.03 на все незакрытые армы) — это планировщик, а не гард, и к дизайну Д он отношения не имеет. Гард я не трогаю и не делаю точнее ради собственной покупки — это ровно тот класс правки, который запрещён.

Сверх гарда — своё стоп-правило: отказ гарда на любой клетке = ОСТАНОВКА всего прогона и вопрос владельцу (так уже написано в rol.buy), а результат печатается по факту купленных пар, без добора до значимости.

Д47.5 ЧЕГО ЭТОТ ЗАМЕР НЕ ЗАКРОЕТ — СПИСОК ПОЛНЫЙ

  1. Денег там, где деньги: дешёвая восьмёрка — 10.2% цены панели; про дорогую моду он не скажет.
  2. Качество прозы: счётный прибор видит брак, а вес промта лежит на прозе (Д36); ранг стоит 16 агент-сессий при свободных 14.
  3. Эхо-мину: проба на английской паре, а мина живёт на плотном CJK (квирк п.4).
  4. Перенос на боевую пару zh: размышление там идёт ×7.8 (квирк п.7) — величины не переносятся.
  5. Среднюю ступень: по живой таблице medium/high/xhigh схлопываются в high; меряются крайние две из трёх.

Даже полный успех этого замера НЕ разрешает менять боевую ступень редактора. Он двигает ровно одну клетку знания: «ручка режет» перестаёт быть вендорским заявлением и становится замером.

Д47.6 РЕЗУЛЬТАТ: КУПЛЕНА ОДНА ПАРА, ГАРД ОСТАНОВИЛ ОСТАЛЬНОЕ — И ЭТА ПАРА СТОИТ БОЛЬШЕ, ЧЕМ ЭНДПОЙНТ

Санкция владельца 30.08 — дословно «Запускай». Прогон пошёл интерливингом, как заморожено: глава b065a92dc0, сначала контроль RN2 (ручка не шлётся), сразу за ним RNL на low. Списано $0.134804 (клетки $0.133588 + две пред-полётные пробы $0.001216). После первой же пары гард кассы отказалпотрачено $3.187585 + ожидание $0.131016 > потолок $3.30 — и семь оставшихся пар не куплены. Потолок сессией не поднят.

клетка когда ручка prompt_tokens выход размышление цена латентность
RN 21.08 не слалась 3 256 1 052 466 $0.005034 19.5 с
RN2 30.08 не слалась 3 256 18 332 17 757 $0.076893 260.8 с
RNL 30.08 low 3 177 13 258 12 676 $0.056695 173.0 с

Побайтно один промт, одна глава, ручка не слалась НИ РАЗУ — и размышление 466 против 17 757, то есть ×38.

⚠⚠ ПОПРАВКА Д47.7, ВНЕСЕНА В ТОТ ЖЕ ДЕНЬ ПО ВОПРОСУ ВЛАДЕЛЬЦА. Первая редакция этого абзаца подавала ×38 как замеренный сдвиг во времени («конфаунд теперь замерен, и он огромен») и вела им весь вывод. Так подавать было нельзя: ×38 — разность ДВУХ ОДИНОЧНЫХ розыгрышей у модели, чей разброс на побайтно одном входе давно известен и велик. Что именно ×38 значит — разобрано в Д47.7, и там же цена ответа. Ниже оставлено то, что от абзаца устояло:

  • дизайн А осуждён в любом чтении — сравнивать одиночные розыгрыши, разнесённые на девять дней, у модели с таким разбросом нельзя ни при какой гипотезе о причине;
  • и МОЙ дизайн Д осуждён тем же — один розыгрыш на главу шума не переиграет, каким бы ни было число глав. Это, а не «сдвиг сервинга», и есть настоящая причина остановиться.

Побочно — усиление Клейма 1 на БОЕВОМ промте, а не на тривиальной пробе. prompt_tokens у RN (21.08) и RN2 (30.08) — 3 256 и 3 256, до токена, через девять дней и смену вендорского сервинга; а ручка low сдвигает их на ровно 79 (3 177). Гейт провенанса Д47.3 пройден: Δpt = 79 внутри полосы [60,100], кириллица 1.000, латиница 0, finish=stop у обеих клеток.

Эндпойнт — по правилу, а не по желанию. Внутри блока RNL думал меньше RN2 в ×1.40 (17 757 → 12 676). Годных пар 1 из 8, знаковый тест даёт p = 1.0000 «НЕ УСТАНОВЛЕНО», и добор глав после взгляда на числа запрещён (Д47.3). Носитель вывода — eval/dovodka/stupen.py, написан ДО прихода клеток. ⚠ Заметить стоит и то, что ×1.40 внутри блока много меньше ×2.52, полученных сравнением через девять дней: конфаунд не просто мешал — он РАЗДУВАЛ видимый эффект.

МОЯ СМЕТА ОШИБЛАСЬ НА ПОРЯДОК, И ИРОНИЯ ТОЧНАЯ: я оценил опыт по той самой базе, нестабильность которой опыт и должен был показать. $0.0780.133 объявлялись ценой ВОСЬМИ пар; одна пара стоила $0.1348. Класс ошибки тот же, что у семи прежних: число взято из прошлого замера без вопроса, живо ли оно.

Что стоило бы доделать дизайн сегодня: семь пар по наблюдённой цене ≈ $0.94, то есть подъём ФД-N примерно на $0.85 (резерв пака $1.090316 это покрывает). Не рекомендую. Наблюдённый внутриблочный эффект ×1.40 стоит против шума, который на соседней строке показал ×38; дизайн с одним розыгрышем на главу против такого шума недомощен, и восемь пар этого не чинят. Вопрос переносится в пак, который может позволить несколько розыгрышей на главу на арм — и цену которого теперь считают по СЕГОДНЯШНЕЙ базе, а не по августовской.

Операционная заметка, чтобы не повторить: отказ гарда возвращает код 1 (проверено), но в фоновом shell set -e цикл не остановил — семь оставшихся итераций отработали вхолостую, печатая тот же отказ. Денег это не стоило ($0: гард отклонил и пред-полётную пробу), но цикл на сотню клеток в такой форме выглядел бы как прогон. Следующий цикл несёт || break в теле, а не надежду на set -e.

Д47.7 ЧТО ЖЕ ЗНАЧИТ ×38 — И ПОЧЕМУ ПЕРВАЯ ПРИКИДКА ОТВЕТА БЫЛА БЫ ДЕСЯТОЙ ОШИБКОЙ ДНЯ

Владелец спросил прямо: закончил ли я с дипсиком, чтобы делать выводы. Не закончил, и вот разбор — весь на уже оплаченном сырье, $0.

Первый заход был неверен, и это стоит напечатать. Я сгруппировал все вызовы deepseek-v4-pro по «модель · глава · роль», получил 100 групп по 3+ вызова, вывел «медианный разброс на одном входе ×11» и почти отдал это как ответ. Группы смешивают РАЗНЫЕ АРМЫ: внутри одной группы лежат RN, RC (промт минус рамка оценки) и RB (рамка перевёрнута) — то есть три РАЗНЫХ промта. Пример 27cb3a7e69: RB 18 043 · RN 7 061 · RC 498 — это не разброс розыгрыша, это разница инструкций. ⇒ число ×11 недействительно, и вывод из него был бы ошибкой того же класса, что семь прежних.

Честная выборка — только «тот же тег, разные номера розыгрыша» (…-r1/-r2/-r3): шесть групп, 18 вызовов, судейская роль. Разброс внутри группы ×1.0 · ×1.5 · ×1.7 · ×3.7 · ×10.1 · ×11.3; sd логарифма 0.82, то есть одно стандартное отклонение = ×2.3.

Куда это ставит наши ×38. Разность двух одиночных розыгрышей имеет sd около 1.16 в логарифме; ln 38 = 3.64, то есть примерно 3.1 sd — событие редкое (порядка 1 из 500), но не невозможное. Вывод: НЕ УСТАНОВЛЕНО, сдвинулась модель или выпал хвост. Обе гипотезы живы, и различить их имеющимся сырьём нельзя было на роли onepass. ЭРРАТА КОНСИЛИУМА 30.08: ПОВТОРЫ ЕСТЬ, ИХ ШЕСТНАДЦАТЬ — НА РОЛИ РЕДАКТОРА. Пары e0/zf — два прогона ОДНОГО редактора над ОДНИМ черновиком, и тождественность входа доказана на уровне провода: prompt_tokens совпадают ДО ТОКЕНА на всех 16 главах. ⇒ настоящий шум размышления: sd одного розыгрыша = 1.02 в логарифме, то есть ×2.8 (парность гасит межглавный эффект — оценка обоснована лучше, чем ×2.3 с шести судейских групп выше). Наши ×38 пере-оцениваются в ≈2.5 sd — рядовое событие, а не «1 из 500»; квантификация редкости снята. ⚠ Оценка снята на РОЛИ РЕДАКТОРА и на английской паре; на письмо и на zh не переносится. Прежняя формулировка ниже оставлена, чтобы был виден класс ошибки — не искали там, где лежит: чистых повторов одного и того же промта в корпусе нет ни одного — их место как раз и занимали армы с разными промтами.

⚠ Границы этой оценки, чтобы её не переняли как истину: 18 вызовов, ДРУГАЯ роль (судейство, не перевод), и настоящий разброс на переводе может быть и больше. Оценка — рабочая, не замер.

Д47.8 ЦЕНА ОТВЕТОВ: ТЕПЕРЬ ОНА СЧИТАЕТСЯ, А НЕ УГАДЫВАЕТСЯ

ЭРРАТА 01.09: НИЖЕСЛЕДУЮЩИЕ n СЧИТАНЫ ПРИ sd 0.82, А ЭРРАТА Д47.7 АБЗАЦЕМ ВЫШЕ ПОДНЯЛА ЕГО ДО 1.02 (:7201=sd одного розыгрыша = 1.02, 16 пар e0/zf). Разница не косметическая: n растёт как квадрат sd, то есть все числа ниже занижены примерно в 1.55 раза. Пере-считано при 1.02 для ПАРНОГО дизайна: ×2.5 → 23 · ×2.0 → 39 · ×1.4 → 157. ⚠ И отдельно: в кресте 2×2 контраст главного эффекта имеет sd = σ, а не σ√2, поэтому там n вдвое меньше — см. пре-рег eval/dovodka/PLAN-01-09.md §4. Строка ниже оставлена, чтобы был виден класс: эррата поднята, а производные числа абзацем ниже не протянуты — ровно то, за что фаза ругает чужие отчёты.

При sd логарифма 0.82 парный дизайн требует (80% мощности, α=0.05 двусторонний):

поймать эффект вызовов на арм ≈ цена обоих армов
×2.5 13 пар ≈$1.1
×2.0 22 пары ≈$1.8
×1.4 (наблюдённый внутри блока) 93 пары ≈$7.6

(цена по средней клетке панели $0.0278 у арма без ручки и ~0.46 от неё у арма с ручкой)

И отдельно, дешёвый вопрос «модель сдвинулась или это кости»: четыре повтора без ручки на той же главе сегодня — ≈$0.31. Кучкуются около 17 757 ⇒ сдвиг реален; разлетаются, задевая сотни, ⇒ это кости, и августовские 466 были хвостом.

Что это меняет в стратегии. Ручка даёт эффект порядка ×1.42.5, и его замер стоит $18 при шуме ×2.3 на розыгрыш. Рядом стоит рычаг ×711 — смена модели на gpt-5.6-luna (поглавно: медиана ×7.1, по сумме ×11.4), и он упирается НЕ в деньги, а в кап агент-сессий на слепое чтение (нужно 16, свободно 14). Тратить следующие доллары на ручку, пока порядковый рычаг не прочитан по качеству, — плохая экономика. Приоритет: сначала качество луны, потом всё остальное.


Д48 — ПАНЕЛЬ luna1: КАЧЕСТВО ЛУНЫ ПРОЧИТАНО ВСЛЕПУЮ. ПЕРВЫЙ КРУГ, $0

Санкция владельца 30.08 («Да, давай подниму кап») — она и была единственным, чего не хватало: деньги на этот замер не тратятся вовсе, упирался он в кап агент-сессий. Кап поднят 200 → 215.

Д48.1 ЧТО ЧИТАЛОСЬ И ПОЧЕМУ ИМЕННО ЭТО

Сначала — поправка к собственному предложению. Развилка владельца от 17.08 (Д42.5а) про luna — про ЧЕРНОВУЮ роль внутри связки, и её приз пере-считан в Д42.1: 6%, а не разы, потому что редактор съедает 85% связки. Читать «луну как черновик» значило бы потратить кап на шестипроцентный рычаг. Порядковый рычаг (×711) лежит в другом вопросе, и читалась именно он:

арм что это
RN однопроходка ролевым промтом на deepseek-v4-pro
RL та же однопроходка на gpt-5.6-luna
Z0 боевая связка «черновик flash → редактор pro»
ZF вторая генерация ТОЙ ЖЕ связки — собственный шум прибора

Оснастка: 15 глав из 16 (на 100b088f71 клетка RN не прошла гейт годности — пропуск напечатан, не спрятан), одна глава = один пакет = один читатель, метки перемешаны своей раскладкой на каждую главу. Обёртка запуска — замороженный reader-wrapper.md sha 15cfac60, тот же, что в прошлых кругах. Ключ панели закоммичен ДО того, как появился хоть один ответ (2a9d1d0). Модель читателей сверена ИСПОЛНЕНИЕМ, а не самоотчётом: во всех пятнадцати транскриптах "model":"claude-fable-5", исключений нет.

Д48.2 РЕЗУЛЬТАТ: РАЗЛИЧИЙ НЕТ НИ МЕЖДУ ЧЕМ

арм среднее место (1 — лучшее) места по главам
Z0 связка 2.33 1 3 3 2 4 4 3 2 2 2 2 2 1 1 3
ZF её близнец 2.33 3 4 4 3 3 3 2 1 1 1 1 1 4 3 1
RN однопроходка dspro 2.53 2 1 1 4 1 2 1 3 3 3 3 4 2 4 4
RL однопроходка luna 2.80 4 2 2 1 2 1 4 4 4 4 4 3 3 2 2

Контроль шума и контрасты (n=15):

  • близнецы Z0/ZF расходятся на +0.00 места при пороге 1.06 — неразличимы, как и обязаны; прибор смещения не несёт;
  • якорь (связка) ↔ RN: разрыв +0.20 при пороге 1.30 — в пределах, знаковый p=0.79;
  • якорь ↔ RL: разрыв +0.47 при пороге 1.26 — в пределах, знаковый p=0.58;
  • очно RL против Z0 по главам — 6:9, то есть ничья в пределах монетки.

Однопроходка на дешёвой luna НЕ ОТЛИЧИМА по качеству ни от однопроходки на дорогом deepseek, ни от боевой связки — на этом приборе, на этих 15 главах, в первом круге.

Д48.3 ЧЕГО ЭТОТ РЕЗУЛЬТАТ НЕ ГОВОРИТ — И ЭТО ВАЖНЕЕ ТОГО, ЧТО ГОВОРИТ

  1. «Неразличимо» ≠ «одинаково», и разрешение прибора здесь грубое. Две генерации ОДНОГО И ТОГО ЖЕ конвейера расходятся по главам в среднем на 1.33 места из 4. Всё, что тоньше ~1.3 места, этот прибор не видит. Разрыв луны (+0.47) — примерно треть собственного шума.
  2. Направление, хоть и незначимое, против луны: 2.80 против 2.33 у связки, последнее место из четырёх. Будь луна ровней, её ждали бы ~2.5. Это не вывод, это то, что второй круг проверит.
  3. Это ПЕРВЫЙ круг. Наше же правило конъюнкции требует повтора во втором круге; вердикта ещё нет, и подавать его как решение нельзя.
  4. Панель не трогает то, на чём однопроходка и падала раньше: консистентность терминов на всю книгу и банк (у однопроходки нет черновика, из которого терминологу добывать свидетельства — находка владельца 16.08, Д42.3), цензур-ось на целевом жанре и перенос на пару zh.
  5. Грубого декоя в панели нет — разрешение держится только на близнецах.

Д48.4 ВТОРОЙ КРУГ УПИРАЕТСЯ В ОДНУ СЕССИЮ, И ЭТО МОЯ АРИФМЕТИЧЕСКАЯ ОШИБКА

Поднимая кап, я записал «15 на круг, остальное на второй». Считано неверно: 215 186 = 29 свободных, круг съел 15, осталось 14 — на одну меньше, чем нужно второму кругу. ⇒ второй круг требует +1 сессии (беру запас: +5). Резать панель до 14 глав решением сессии запрещено, и это ровно тот случай, когда «подогнать под возможности» было бы подгонкой под результат.

Д48.5 ВТОРОЙ КРУГ ПРОЙДЕН: КОНЪЮНКЦИЯ ЗАКРЫТА, РАЗЛИЧИЙ НЕТ И ВО ВТОРОМ ЧТЕНИИ

Кап поднят 215 → 220 по слову владельца («Ладно, давай»). Круги разведены по норме рига: ответы первого унесены в krug1/, второй писал в чистое поле по ТЕМ ЖЕ пакетам — править пакет ради нового пути запрещено, иначе замер сравнил бы разницу промтов, а не разброс прибора. Контроль переноса: свод первого круга из подкаталога воспроизвёл прежние числа до сотой. ⚠ Регистратор при этом отработал как сторож: пере-заявить те же главы он отказался, пока сессии первого круга не закрыты (⛔ ГОНКА СЕССИЙ) — гейт, поставленный после того, как пак 23 потерял соответствие голосов и сырья на пяти единицах.

арм круг 1 круг 2
Z0 связка 2.33 2.20
ZF её близнец 2.33 2.53
RN однопроходка dspro 2.53 2.60
RL однопроходка luna 2.80 2.67
контраст круг 1 круг 2
близнецы Z0ZF (собственный шум) +0.00 при пороге 1.06 0.33 при пороге 1.20
якорь ↔ RN +0.20 · порог 1.30 · p=0.79 +0.23 · порог 1.29 · p=0.79
якорь ↔ RL +0.47 · порог 1.26 · p=0.58 +0.30 · порог 1.11 · p=0.77
|Z0ZF| по главам 1.33 из 4 мест 1.53 из 4 мест

⚠⚠ ПОПРАВКА КОНСИЛИУМА 30.08 — ЧИТАТЬ ПРЕЖДЕ ВЫВОДА НИЖЕ. Формулировка вывода была СВЕРХЗАЯВКОЙ, и вот в чём. (1) Нуль относится к ПОГЛАВНОМУ рефайнменту, а не к классу «второй проход». Внешний систематический замер (arxiv 2605.13368, май 2026: 9 моделей, 7 пар, 9 комбинаций гранулярности) даёт: документный черновик + посегментный рефайнмент — устойчиво лучший режим, а рефайнмент ЦЕЛОГО документа даёт меньше правок и ненадёжен. Наш редактор переписывает главу целиком — то есть работает ровно в отнулённом режиме. Посегментный редактор у нас не проверялся НИ РАЗУ. (2) Прибор не валидирован. Совпадение двух кругов доказывает НАДЁЖНОСТЬ, а не ВАЛИДНОСТЬ: arxiv 2606.19544 (21 судья, 9 вендоров) показывает сосуществование тест-ретеста >0.95 с позиционным смещением >0.10; плюс arxiv 2606.26040 — читатели предпочитают версию, которую СЧИТАЮТ человеческой. (3) В панели нет позитивного контроля — это напечатано в самом своде («грубого декоя НЕТ»), и без него «варианты равны» не отделено от «прибор глух». ЗДЕСЬ СТОЯЛА «ВСТРЕЧНАЯ УЛИКА ИЗ НАШИХ ЖЕ ДАННЫХ» — ОНА ОТОЗВАНА АВТОРОМ И СНЯТА. Аргумент был: «будь редактор чинильщиком, он был бы сжимающим отображением, и близнецы Z0/ZF СХОДИЛИСЬ бы; они расходятся на 1.331.53 места ⇒ сигнатура пересэмплировщика». Арифметика его убивает, и она проверена исполнением: в ПРИНУДИТЕЛЬНОЙ ранжировке четырёх вариантов два конкретных текста не могут получить один ранг, поэтому |Δ ранга| структурно живёт в коридоре [1.00 … 1.667], где 1.00 — соседние места, а 1.667 — ожидание при ПОЛНОЙ неразличимости (среднее |ij| по всем 12 упорядоченным парам различных рангов). Наблюдённые 1.331.53 лежат в СЕРЕДИНЕ коридора, ближе к шумовому потолку. ⇒ даже побайтно ОДИНАКОВЫЕ тексты дали бы ~1.67: метрика физически не умеет показать «сошлись». ⚠⚠ НО И ОТЗЫВ БЫЛ ИЗБЫТОЧЕН — ВСТРЕЧНАЯ ПОПРАВКА СКЕПТИКА, ПРОВЕРЕНА ПО СЫРЬЮ. (1) Тест-ретест читателя на ТОЖДЕСТВЕННЫХ текстах (круг 1 против круга 2 той же панели) двигает среднее место арма всего на 0.200.40, а близнецы расходятся на 1.331.53 ⇒ расхождение почти целиком ТЕКСТОВОЕ, а не читательское. Улика настоящая, аннулирована только её ДИХОТОМИЧЕСКАЯ трактовка. (2) Сама дихотомия «ремонтник ИЛИ пересэмплировщик» ложна и опровергается данными этой же фазы: редактор ДОКАЗАННО сжимает по осям БРАКА — голый черновик ZD различимо хуже связки в обоих читательских семействах (сильнейший контраст фазы), а буфер чинит слабого жильца адресно (десятки фатальных дефектов у него же однопроходкой против нуля через редактора; куски непереведённого → 0). ⇒ Честная формула: редактор СЖИМАЕТ БРАК и ПЕРЕСЭМПЛИРУЕТ ПРОЗУ. Расходятся близнецы именно по прозе — там, где читатель и ранжирует. Формулировка «а не ремонтника» вычёркивала замеренное сжатие ради красоты аргумента и снята. ⇒ Механизм «рефайнмент = сдвиг к распределению рефайнера» держится на внешней работе (arxiv 2605.13368) плюс на текстовом расхождении близнецов; ⚠ но перенос статьи на нашу стадию тройной (другие пары · другой жанр · её выигрыш лежит НИЖЕ пола нашего прибора) — она даёт основание ПРОБОВАТЬ посегментный режим, а не основание ЖДАТЬ от него выигрыша. Правильный локальный прибор существует, стоит $0 и артефакты уже на диске: мерить ТЕКСТЫ, а не ранги — схожесть пар Z0/ZF ПОСЛЕ редактора против схожести их черновиков ДО, попарно по 15 главам. Сжимающее отображение обязано ПОВЫШАТЬ схожесть выходов относительно входов, ресэмплер — нет. Порог: медианный прирост > 0, знаковый тест p<0.05. ⇒ Честная редакция вывода: поглавный дорогой рефайнмент неотличим от однопроходки на приборе с недоказанной валидностью. Что второй проход бесполезен КАК КЛАСС — не показано и этим замером показано быть не могло.

ФОРМУЛУ «ДВУМЯ НЕЗАВИСИМЫМИ КРУГАМИ» ЧИТАТЬ КАК СНЯТУЮ. Круги независимы по ЧИТАТЕЛЮ и только: генерация текстов одна, раскладка одна, семейство судьи одно, позиционный наклон воспроизводится именно поэтому. Вывод: ни один контраст не превысил порога — но о ПОРЯДКЕ армов панель не говорит ничего, пока раскладки не уравнены латинским квадратом. Прежняя редакция («вывод повторился, конъюнкция закрыта») заимствовала силу протокола, писанного для ПОЛОЖИТЕЛЬНЫХ вердиктов, под нулевой — и снята. Оба круга дают одно и то же и в знаке, и в порядке величины; отставание luna во втором круге даже сократилось (0.47 → 0.30), то есть направление первого круга держится слабее, чем сам разброс прибора. Однопроходка на gpt-5.6-luna неотличима по качеству от однопроходки на deepseek-v4-pro и от боевой связки — на 30 слепых чтениях, двумя независимыми кругами.

ПОЗИЦИОННЫЙ НАКЛОН: НАЙДЕН СКЕПТИКОМ, ПЕРЕ-СЧИТАН МНОЙ, И ОН ВОСПРОИЗВОДИТСЯ В ОБОИХ КРУГАХ — ПОТОМУ ЧТО РАСКЛАДКИ ТЕ ЖЕ. Среднее МЕСТО по позиции предъявления Т1→Т4: 2.33 / 2.47 / 2.40 / 2.80 (круг 1) и 2.33 / 2.40 / 2.40 / 2.87 (круг 2) — показанный последним штрафуется примерно на полместа. И армы по позициям не уравнены: Z0 стоял первым 7 раз из 15 и последним 2 (средняя позиция 2.07), а RN — первым 2 и последним 6 (средняя 2.87); RL 2.60, ZF 2.47. ⇒ ⚠ ВЕРХНЯЯ ГРАНИЦА КОНФАУНДА, а не разложение: позиционные средние сняты с тех же данных, где армы по позициям НЕ уравнены — если RN действительно хуже и часто стоит последним, среднее позиции-4 надуто его же качеством, и на n=15 эффект позиции от эффекта арма неотделим. Грубая оценка артефакта 0.14 места на контрасте Z0RN при наблюдённых 0.20 — это ПОТОЛОК вклада позиции, и подавать её как «часть порядка принадлежит позиции» нельзя. Собственный гейт сборки печатает ⛔ раскладки повторяются — 9 разных раскладок на 15 пакетов — и тут же выносит СБОРКА ГОДНА: флаг не входит в число расхождений. ⇒ Формула «два независимых круга» сильнее факта: круги независимы по ЧИТАТЕЛЮ, но не по раскладке, не по генерации текстов и не по семейству судьи. Лечение — третий круг на ПЕРЕ-РАСКЛАДАННЫХ пакетах и вторая генерация RL/RN ($0.5).

Что по-прежнему НЕ доказано, и формулировка тут важнее вывода. «Неразличимо» остаётся утверждением о РАЗРЕШЕНИИ прибора: два прогона одного конвейера расходятся по главам на 1.331.53 места из четырёх, и всё, что тоньше ~1.11.3 места, невидимо. Ограничения Д48.3 (банк и консистентность на всю книгу · цензур-ось жанра · перенос на zh · отсутствие грубого декоя) вторым кругом НЕ сняты — он проверял воспроизводимость, а не расширял охват.

Что это значит для денег — с разбором в Д48.6, потому что одним числом это подавать нельзя. Боевая связка дороже однопроходки ещё кратно (редактор — 85% её цены, Д42.1). Решение о переключении — владельца, и перед ним стоит один незакрытый гейт, названный им же 16.08: у однопроходки нет черновика, из которого терминолог добывает свидетельства для банка (Д42.3). Замер качества этот гейт не отменяет и не трогает.

Д48.6 «ЛУНА ДЕШЕВЛЕ В 711 РАЗ» — ЧИСЛО, КОТОРОЕ Я ПОДАВАЛ НЕВЕРНО. РАЗБОР

Вопрос владельца — «дешевле по сравнению с ЧЕМ, и не из-за скачков ли токенов» — вскрыл в моей подаче две ошибки сразу.

С чем сравнивалось. RL (однопроходка gpt-5.6-luna, ручка low) против RN (та же однопроходка побайтно тем же промтом на deepseek-v4-pro, ручка не слалась = вендор-дефолт high), 16 глав, по одному вызову на клетку, куплены 21.08.

Ошибка первая: в знаменатель попала пустая клетка. На главе 100b088f71 у RN ноль знаков выхода — это та самая клетка, что не прошла гейт годности и выброшена из панели чтения. В цене она осталась и тянула отношение вниз. На 15 годных пар: медиана 10.5×, по сумме 12.0× (было «7.1× и 11.4×»). ⚠ Побочно это факт о надёжности: непригодную клетку выдал deepseek — 1 из 16; у luna — 0 из 16.

Ошибка вторая, тяжелее: медиану тут вообще нельзя приводить — распределение ДВУГОРБОЕ. Поглавные отношения: 1.3 · 1.7 · 1.8 · 1.8 · 2.0 · 2.6 · 2.8 · 3.7 · 10.5 · 12.4 · 15.6 · 20.6 · 26.7 · 27.8 · 32.1 · 34.0. Восемь глав дают «около двух», восемь — «около двадцати», и посередине пусто. Медиана падает ровно в пустоту и потому скачет от 7.1 к 10.5 при выбросе ОДНОЙ клетки. Честная формулировка: от 1.3× до 34× ПОПРАВКА КОНСИЛИУМА: и в этой «честной формулировке» я вернул на место ту самую мёртвую клетку, которую абзацем выше выселил. Нижний конец 1.3× — это и есть 100b088f71 (0.003204 / 0.002431 = 1.32), а «восемь глав около двух» — семь годных плюс мёртвая. На 15 годных парах диапазон 1.7× 34×, и голов семь и восемь. ⇒ Честная формулировка: от 1.7× до 34×, и величина целиком следует за тем, сколько дипсик надумал на этой главе. ⚠ Класс ошибки стоит назвать: правка выселила точку из одной статистики и оставила в соседней, в том же абзаце. Проверять надо ВСЕ производные числа правки, а не то, ради которого правка делалась.

Владелец угадал причину — да, это скачки размышления. Разложение по прайсу (deepseek вход $1.320 / выход $3.96 · luna вход $0.200 / выход $1.20 за 1M):

deepseek-v4-pro gpt-5.6-luna
доля цены, ушедшая в РАЗМЫШЛЕНИЕ 87% 49%
размышление, медиана 5 804 1 024
размышление, разброс по главам 466 19 559 (×42) 511 1 535 (×3)

Контрфакт: если бы дипсик думал СТОЛЬКО ЖЕ, сколько луна на той же главе, он был бы дороже всего в ×2.9 (разброс 2.84.7) — и это чистая разница прайса и накладных, она никуда не денется. Всё остальное, то есть от ×2.9 до наблюдённых ×1034, — это объём размышления, который у дипсика гуляет ×42, а у луны стоит на месте.

И тут же конфаунд, который я обязан повторить: армы ехали на РАЗНЫХ ступенях. Дипсик — без ручки (вендор-дефолт high), луна — на явном low. Часть «дипсик думает больше» принадлежит настройке, а не вендору. Замеренный внутри одного блока эффект ручки — ×1.40 (Д47.6), то есть честная драка сузила бы разрыв, но не закрыла: ×2.9 прайсовых остаются при любой ступени.

Чего мы про луну не знаем: её собственная воспроизводимость не мерена ни разу — в корпусе 749 её вызовов и ноль групп повторов одного и того же входа. Устойчивость 5111535 снята ПОПЕРЁК глав, а не по повторам одной; строго говоря, «луна стабильна» — пока гипотеза. ⚠ Настораживает и то, что её reasoning_tokens ложатся почти в кратные 512 (511 · 512 · 1005 · 1022 · 1023 · 1024 · 1535) — похоже на блочный учёт у провайдера, и это стоит проверить прежде, чем строить на этих числах смету.


Д49 — ЧТО РЕДАКТОР ДЕЛАЕТ С ТЕКСТОМ: ЗАМЕРЕНО ЗА $0 ИЗ АРТЕФАКТОВ НА ДИСКЕ

Заказ владельца: «как правильно генерить перевод — какие вызовы и как делать редактуру, точечно или нет». Прибор — побайтная дистанция 1 совпадающее/max(len) (difflib.SequenceMatcher, ⚠ обязательно autojunk=False, см. Д49.2) на 16 главах английской оси; артефакты куплены давно.

Д49.1 ЧИСЛА

пара медиана дистанции
черновик ZD → редактор Z0 4.0%
черновик ZD → второй прогон редактора ZF 5.8%
Z0ZF (два выхода редактора) 6.5%
калибровка: две НЕЗАВИСИМЫЕ генерации (Z0RN) 22.9% (n=16)
  • d(Z0,ZF) / сумма правок: медиана 0.71, диапазон 0.300.98, ни одной главы выше 1, на трёх главах ниже 0.5 — там правки СХОДЯТСЯ.
  • Два прогона редактора в 3.5× ближе друг к другу, чем к независимой генерации (6.5% против 22.9%, оба на n=16). ⚠ Прежние «21.9% и 3.4×» считались с молчаливым выбросом главы 100b088f71, где клетка RN несёт finish=stop при ПУСТОМ содержимом (дистанция 1.0) — та же мёртвая клетка, что уже дважды портила статистики этой фазы. Исключение теперь названо.

Редактор — РЕМОНТНИК ЛЁГКОГО КАСАНИЯ: сплошной по ОХВАТУ (~40% предложений тронуто), точечный по ОБЪЁМУ (46% знаков).Граница переноса, той же формы, что у эрраты Д47.7: замерено на АНГЛИЙСКОЙ оси и на роли редактора deepseek-v4-pro. На zh черновик несёт эхо ~25%, и дистанция редактора там обязана вести себя иначе — величины не переносятся. Распределение объёмов — континуум, без бимодальности «косметика или переписывание». ⇒ Развилка «точечно или сплошняком» наполовину ЛОЖНАЯ: поглавный редактор уже ведёт себя как распределённый фиксер лёгкого касания. ⇒ Денежный вывод, и он ЗНАЧИТЕЛЬНО СКРОМНЕЕ, чем первая редакция этой секции утверждала. Первая редакция говорила «9496% выходных токенов — переписывание неизменного, а выход и есть 90% цены связки». Это смешение двух разных «выходов», поймано ревью диффа. Пересчёт по 32 клеткам редактора: completion = 297 200 токенов, из них размышление 277 807 = 93%; видимая глава — 19 393 токена, то есть 7% того, за что платим. ⇒ дифф-интерфейс режет видимый выход, а он у deepseek-v4-pro-редактора ≈7% стадии — порядка $8 на книгу, а не $100. У редактора с погашенным размышлением (glm-5) видимый выход — почти весь completion, и там срез значим. ⚠ Сожмётся ли РАЗМЫШЛЕНИЕ от смены формата — это ГИПОТЕЗА, которую и проверяет прототип, а не арифметика. Собственная Д41.2 п.4 это уже говорила: платим за размышление.

Д49.2 КАК Я ЧУТЬ НЕ ОПУБЛИКОВАЛ РОВНО ОБРАТНОЕ

Первая редакция этого замера дала «редактор — лотерея: правит 18.4%, а сам с собой расходится на 26.4%, объём правки скачет ×1040», и на ней уже строился механизм. Оба вывода были ложны, и каждый — своим способом.

  1. Числа — артефакт дефолта библиотеки. SequenceMatcher(autojunk=True) на последовательностях длиннее 199 объявляет «мусором» каждый символ, встречающийся чаще 1%, — для русского текста это ВСЕ частые буквы и пробел. Совпадающие блоки крошатся, дистанция раздувается вчетверо. С autojunk=False и схлопнутыми пробелами 18.4 → 4.0, 26.4 → 6.5. Урок: дефолт библиотеки был принят за свойство мира.
  2. Логика — неверна и при верных числах. «Расхождение выходов больше каждой из правок ⇒ пересэмплирование» не следует: два РЕМОНТНИКА, правящих в РАЗНЫХ местах, дают расхождение вплоть до СУММЫ правок, то есть больше каждой поодиночке всегда, когда места не совпали. Информативно отношение к сумме (0.71), а не сравнение с максимумом.

Формулировку «редактор пересэмплирует прозу» ослабить до «перефразирует местами». Слово «лотерея» из оборота изъять.

Д49.3 ЧТО ЭТО ДАЁТ АРХИТЕКТУРЕ

Дифф-интерфейс редактуры (консилиум 30.08, §3 п.6): модель лишается права выдавать текст — только список якорёванных замен «цитата → замена + категория дефекта», детерминированный аппликатор, потолок объёма, закрытая таксономия категорий («красивее пересказал» — не категория). ⚠ Обоснование ДВАЖДЫ ослаблено, и это надо читать прежде выгоды. (1) Довод «ампутировать каскад самообусловливания» снят вместе с «лотереей» — каскада нет. (2) Довод «выход почти целиком — переписывание неизменного» тоже снят: видимая глава — 7% completion, 93% размышление ⇒ арифметический срез у pro-редактора порядка $8 на книгу, а не $100; значим он у редактора с погашенным размышлением. Сожмётся ли размышление от смены формата — ГИПОТЕЗА прототипа. Бесспорным остаётся: байт-стабильность нетронутого, ограниченный потолком и наблюдаемый объём правки, категория у каждой правки. Побочно: нетронутое байт-стабильно ⇒ гейты и банк перевалидируются только по тронутым спанам. Встроенный kill-switch, $23: пересечение множеств тронутых спанов двух прогонов; Жаккар < 0.4 ⇒ разброс живёт в суждении модели, а не в интерфейсе, и механизм провалился.

Д49.4 ПОБОЧНОЕ, НО ВАЖНОЕ

  • Связи текстового расхождения близнецов с читательским разрывом НЕ ВИДНО, но и мощности нет: корреляция 0.07…0.22 в зависимости от круга (напечатанное ранее 0.08 — это ТОЛЬКО второй круг, хотя улика говорила «два круга»), при n=15 доверительный интервал ≈ [0.56; +0.44]. ⚠ «Не видно связи» ≠ «связи нет» — ровно тот класс, который эта же секция ловит у других. Разрывы 1.331.53 места стоят над расхождением в 6.5% знаков и за его величиной НЕ следуют — ⚠ но при такой мощности это справка, а не довод. ⇒ ⚠ И тезис «пол панели живёт в читателе» в СИЛЬНОЙ форме тоже не держится — ослаблен после ревью. Держится следующее: у прибора есть ПОЛ высотой 1.331.53 места (близнецы при 6.5% различия текста); в нём есть доказанная читательская компонента — позиционный наклон 0.5 места в обоих кругах (Д48.5) и повтор чтения одним семейством 0.34 порога (Д37.3). Но состав пола не решён: ратифицированный глосс Д37.3 говорит «треть — прибор, ДВЕ ТРЕТИ — текст», то есть ссылка на 0.34 работает ПРОТИВ сильной формы. ⇒ Для решения это безразлично: панель с полом такой высоты не различит ничего тоньше него, из чего бы пол ни состоял. Однозначно читательская компонента одна — наклон раскладки: он в тексте не живёт по построению. Корреляция — справочно.
  • Объём правки не предсказывает место Z0 у читателя (0.18, незначимо): «больше правил — лучше прочли» не наблюдается.

Д50. Стадия 0 п.1 исполнена: банк держит термины — но главное найдено НЕ в замере, а на диске

Дата: 30.08.2026, полигон. Стоимость: $0 (только артефакты на диске). Носитель прибора — eval/dovodka/bank.py (пре-регистрация в шапке файла, записана ДО первого числа).

Д50.1. Четыре вещи, которых консилиум не знал, и все они лежали на диске

Консилиум 30.08 назначил аудит прогона acceptance. Исполнение показало, что заказ был построен на неполной карте собственного архива:

  1. Рядом лежит более боевой прогон rerun (11.07): промты v1-reflow вместо v0-draft, редактор БИЛИНГВ (D30.1), переведены 57/57 чанков против 54/57. Движковых промахов 27 против 55.
  2. Лежит и сам БОЕВОЙ ПРОФИЛЬ — rerun2-dspro (23.07, 5 глав): черновик deepseek-v4-flash + редактор deepseek-v4-pro, плюс арм mistral-large-2512, которого нет ни в одной нашей таблице моделей. ⇒ Утверждение фазы «боевой профиль недоступен без Шага 7 (~$2)» верно только про ОБЪЁМ (5 глав против 15), а не про наличие.
  3. Эту работу уже делали в июле, и сильнее. docs/archive/PROGRESS-2026-07-10-13.md:149=presence **91.0%** (647/711) — замер B5 D10 независимым скриптом: presence 91.0% (647/711), occurrence 95.8%, по типам (титулы — слабейший класс, 78.7%), классы промахов decl_gap 0 · inflection_gap 54 · genuine_absent 10, эффективная консистентность 98.6%.
  4. Три редактора уже отсужены на боевой китайской пареrerun2/RERUN_REPORT.md: 56 игр на арм, судья gemini-3.1-pro + grok-4.3-фолбэк, шумовой пол замерен (14/14 tie на идентичном тексте). Ранг: dspro 0.679 > glm-5 0.589 >> mistral 0.232. ⇒ Оговорка консилиума §4 «вся наша фактура по дешёвым моделям АНГЛИЙСКАЯ» неверна для ВЫБОРА РЕДАКТОРА: он мерен на китайской паре.

Класс ошибки один и он не про эти четыре пункта, а про фазу: «фаза не знала собственный архив». Вчера тем же классом было «фаза не знала собственный бэкенд». Дешёвое лекарство очевидно и стоит $0: прежде чем строить прибор — смотреть, не построен ли он.

ПЯТАЯ ТИХАЯ ПОЛОМКА ПЕРЕЕЗДА. Июльские скрипты (d10_consistency.py, audit.sh, reflow.py, extract.py) НЕ ПЕРЕЖИЛИ переезд машины: PROGRESS-2026-07-10-13.md:190 перечисляет их поимённо с пометкой «Всё ВНЕ git», и в каталоге остались только ДАННЫЕ. После путей ~/books, обнулённых mtime и подчёркиваний в .env — четвёртая известная, а по счёту находок пятая. Класс: что вне git, то переезд убивает молча. bank.py заведён в git намеренно.

Д50.2. Результат замера: гипотеза «банк держит» НЕ ОПРОВЕРГНУТА

Единица — пара (термин, чанк) со сработавшим ключом; принятое множество форм = dst decl.forms (ратифицированное D24.4). Эндпойнт — CONFIRMED (approved); с AMBIGUOUS спрашивать нельзя, движок её таковой не объявлял (mempostcheck.go:52-64).

прогон / режим пар presence взвешенная доля промахов эффективная консистентность
acceptance, native 375 98.9% 0.23% 100.0%
acceptance, substring 390 98.5% 0.62% 99.5%
rerun, native 531 97.4% 0.91% 99.6%
rerun, substring (методика июля) 548 96.9% 1.29% 99.3%

⚠ Числа сняты с ФИНАЛЬНОЙ версии прибора. Промежуточная, до починки регистра, давала presence на 0.50.9 пункта ниже; таблица едва не ушла в коммит с ними — см. Д50.4 п.4.

Метрика A (порог 2%) — в пределах во всех четырёх сечениях. Метрика B пробита в одном сечении единственным термином 炼化 и разобрана ниже как ЛОЖНАЯ.

Взаимная верификация двух независимых реализаций через полтора месяца. Мой прибор самостоятельно воспроизвёл июльские decl_gap = 0, genuine_absent = 10 (до починки эвристики) и — поимённо — редчайший класс 古月 → Гуюэ ровно в главах 18/0 и 20/1, названных июльским отчётом. Совпадение поимённое, а не по величине.

Д50.3. Слепое пятно, которого не видит НИ ОДИН из двух приборов

Чтение кандидатов глазами дало находку, не сводимую к обоим счётчикам. Гл.18/ч0: оригинал 古月方源, в переводе — «Гу Юэ Фан Юань», тогда как канон банка — слитное «Гуюэ».

Почему молчат оба прибора: 古月方源 заведён алиасом полного имени (glossary_aliases, alias_type=fullname) к записи 方源 → Фан Юань. Автомат движка берёт длиннейший ключ, ждёт в выходе «Фан Юань» — и находит его. Родовая приставка канону не соответствует, но её никто не проверяет: ожидаемая часть на месте. ⇒ Дрейф ВНУТРИ составного имени не наблюдаем ни пост-чеком движка, ни presence-метрикой. Дёшево чинится: проверять алиас-ключ на собственную канонную форму, а не только dst записи-хозяина.

Д50.4. Четыре ложные тревоги МОЕГО прибора — все пойманы чтением, ни одна не опубликована

Прибор строился и правился в один заход, и каждая правка рождала новую ошибку — ровно вчерашний урок «правка правки не безопаснее правки», подтверждённый четырежды за один пункт плана:

  1. Зелёный вердикт на ПУСТОМ знаменателе. Парсер не понял формат rerun (там --- чанк 0 --- без флага), разобрал 0 чанков — и прибор напечатал «порог не пробит, гипотеза не опровергнута». Лечение — не только формат: заведён гейт assert_measured, отказывающий с кодом 2 при нулевом знаменателе. Нулевой знаменатель — не «в пределах», а отсутствие замера.
  2. Промахи на непереведённых чанках. 4 чанка acceptance гейт покрытия не переводил вовсе; отсутствие термина там — дефект ПОКРЫТИЯ, не банка.
  3. Односимвольные ханьские ключи /: memory.go:319 удаляет такой ключ из автомата — записи не инжектировались НИКОГДА. Мой счёт спрашивал за них и дал по метрике B.
  4. Регистр и чередование согласных. 开窍 → «открытие апертуры» считалось промахом при «Открытие апертуры удалось!» в тексте; 炼化 → «очистить и подчинить» уезжало в кандидаты дрейфа, потому что «очистить»[:4] = «очис», а в тексте «очищает».

Все семь «промахов» 炼化 — верный перевод («очищает и подчиняет», «очистил и подчинил», «по очистке и подчинению») при ПУСТОМ decl.forms. Метрика B по нему пробита формально и по существу ложна: это дефект ЗАСЕВА глагольного термина, а не дрейф.

Д50.5. Что из этого — долг полигона (моя зона)

  • Глагольные и многословные термины засеяны без форм. 炼化 → «очистить и подчинить», forms=[] — пост-чек по такому термину не может не врать. Требуется засев форм либо явное исключение класса из пост-чека.
  • inflection_gap живёт (1617 CONFIRMED на rerun): мн.ч. дописано сидом v2 не всюду.
  • Осторожно, поправка к самому себе: первая редакция этого разбора объявила июльскую задачу «дописать мн.ч.» НЕВЫПОЛНЕННОЙ — по чтению books/gu-zhenren/guzhenren-seed.yaml. Это неверно: рядом лежит guzhenren-seed-v2.yaml, и мн.ч. там есть («первобытные камни», «гу-мастеров», «смертные»), плюс 8 новых записей. Класс ошибки: вывод по первому найденному файлу без проверки, единственный ли он. Поймано до публикации.

Д51. Вход ратификации, висевший на фазе Д, исполнен: выбор редактора держится на цене, а цена перевернулась

Дата: 30.08.2026, полигон. Стоимость: $0. Носитель — пересчёт оплаченных клеток rerun2.

Д51.1. Задача была поставлена ратифицированной нотой ЭТОЙ фазе и не исполнена

Цепочка, восстановленная по журналу решений (не по пересказу):

  • D39.22 (23.07): редактор = deepseek-v4-pro, интерим. Основания: судья №1 · лучшая проза и глоссарий · дефекты чинибельного класса · «×2 дешевле glm».
  • D39.117 п.3, строка 65 ЗАКРЫТА (08.08): «движки dspro/glm-5 неразличимы (A/B +0.06 p=0.95; A_law/B 0.69 порога не проходит) ⇒ жилец редактора — вопрос ЦЕНЫ, то есть конфиг».
  • D39.137 (15.08): пере-пин вендора. «Посылка интерим-редактора D39.22 в ПИКЕ ПЕРЕВЁРНУТА — dspro пик ×1.26 ДОРОЖЕ glm-5… Вход ратификации жильцов при фазе Д» (D39.137 п.4, адресный вход: «Владельцу/фазе Д»).

Ратификация пере-выбора редактора формально висит на фазе Д с 15.08 и не исполнена. Консилиум 2930.08 обсуждал «резать ли редакторскую стадию», не зная, что настоящий открытый вопрос — не «резать», а «кто в ней живёт по нынешней цене», и что он адресован именно нам.

Д51.2. Замер: одна нагрузка, оба редактора, СОБСТВЕННЫЕ токены каждого

D39.137 считала контрфактику по оси цены на токенах glm и сама назвала это оговоркой. В rerun2 есть лучшее: три арма редактора на одном и том же оплаченном черновике, каждый со своим расходом.

Валидация метода — прежде результата: пересчёт по СТАРОМУ прайсу воспроизводит записанный движком cost_usd бит-в-бит на всех трёх армах (glm $0.076583, dspro $0.040555, mistral $0.040093 — расхождение 0.0%). Значит прайс-таблица и формула те самые, которыми считал движок.

редактор prompt / cached / completion нынешний прайс, 5 глав книга 1500 глав к glm
glm-5 33 831 / 3 456 / 14 224 $0.0766 $22.97
deepseek-v4-pro, пик 39 795 / 8 192 / 30 779 $0.1640 $49.19 ×2.14
deepseek-v4-pro, офф-пик те же $0.0820 $24.59 ×1.07
mistral-large-2512 39 119 / 1 232 / 13 689 $0.0401 $12.03 ×0.52 исключён D39.20

Оговорка, снимающая часть разрыва: из 11 записей арма dspro три — записи санитайзера по $0, а одна оборвалась по finish=length и пере-генерировалась. Обрыв — артефакт флора min_max_tokens 8000, поднятого позже до 16000. Без него: пик $0.1238 → книга $37.14 (×1.62), офф-пик $0.0619 → $18.57 (×0.81).

Д51.3. Что из этого следует и чего НЕ следует

  • В ПИКЕ dspro дороже glm-5 при любом обращении с артефактом — в 1.62.1 раза. Экономическое основание D39.22 в пиковые часы не просто ослабло, а сменило знак.

  • Уточнение к D39.137, и оно в сторону ХУДШЕГО для dspro. Нота дала «офф-пик дешевле ×1.59»; на собственных токенах офф-пик даёт от ×1.07 ДОРОЖЕ до ×0.81 дешевле. Причина проста и видна в таблице: dspro тратит вдвое больше completion-токенов (30 779 против 14 224), чего контрфактика на чужих токенах увидеть не могла.

    ЭРРАТА 02.09: ×2.14 ЗАНИЖЕНО — pro СЕГОДНЯ ТРАТИТ ВЧЕТВЕРО БОЛЬШЕ ВЫХОДА, ЧЕМ В ИЮЛЕ. Замер Д51 снят на rerun2 (23.07): 11 вызовов редактора, 30 779 completion, среднее 2 798 на вызов. Холодный прогон 31.08 на том же редакторе даёт 4 вызова, 48 813 completion, среднее 12 203×4.36. Между двумя датами вендор сменил ВЕСА модели (объявление 13.08, слаг тот же) и дефолт эффорта, а размышление у него считается ВНУТРИ completion. ⇒ отношение «pro дороже glm», посчитанное на июльских токенах pro, занижает сегодняшнюю разницу. ПОПРАВКА К ЭТОЙ ЖЕ ЭРРАТЕ (скептик консилиума, 02.09): ×4.36 ЗАВЫШЕНО ДВУМЯ ЦЕНЗУРАМИ, обе мои. (1) Июльское среднее 2 798 обрезано потолком 8000 — две из шестнадцати клеток вернули length ровно на нём. (2) Сегодняшние 12 203 включают ретрай (один юнит дал 16000 length и затем 17 663); по попытке 0 среднее 10 383 при потолке 16000. ⇒ при выравнивании потолков сегодняшнее среднее ≈6 380, то есть направление ≈×2.3, а не ×4.4. Печатать надо ×2.3. ⚠ И «×2.14 — нижняя граница» предполагает, что glm по расходу с июля не подорожал; это не мерено. Правильно: «вероятно нижняя граница, проверяет референс-клетка пробы». ⚠ Границы поправки: прогоны разные по нарезке и числу юнитов (5 глав против 10), сравниваются средние на вызов при n=11 и n=4, и это тот же СЛАГ, а не тот же редактор — вендор сменил веса. Указание направления, не величина. Новую величину даст проба четырёх осей, где pro и glm@off идут на одних юнитах в один день (референс-рука, eval/dovodka/PLAN-01-09.md). До неё ×2.14 читать как НИЖНЮЮ ГРАНИЦУ.

    ОТВЕТ НА ПРЯМОЙ ВОПРОС ОРКЕСТРАТОРА №22 (31.08): ОТМЕНЯЕТ ЛИ ЭТОТ ЗАМЕР ЧИСЛО ×1.26 ИЗ D39.137 — НЕТ, ОН СЧИТАЕТ ДРУГОЕ И УТОЧНЯЕТ ЕГО. Формулировка нужна одной фразой, потому что иначе следующая смена унаследует два числа об одном факте и возьмёт то, что попалось первым. ×1.26 и 1.62.1 — не спор, а две разные величины:

    • D39.137 (×1.26) — контрфактика по ОСИ ЦЕНЫ: одна и та же нагрузка (129 edit-вызовов acceptance A), токены glm, к ним приложены разные прайсы. Отвечает на вопрос «во сколько подорожал бы ТОТ ЖЕ расход». Нота сама назвала это оговоркой честности.
    • Д51 (1.62.1) — ПОЛНАЯ стоимость: у каждого арма СВОИ токены на одной нагрузке (rerun2, 5 глав, один оплаченный черновик). Отвечает на вопрос «во сколько обойдётся книга». ⇒ Направление у обоих одно (посылка D39.22 в пике перевёрнута), а множители расходятся ровно на собственный расход dspro: он тратит вдвое больше completion, и у DeepSeek размышление считается ВНУТРИ completion. ×1.26 — нижняя граница разворота (одна только цена токена); 1.62.1 — полная (цена × расход). Ни одно число не протухло; протухла бы попытка применить ×1.26 к бюджету книги. ⚠ Обе величины сняты на РАЗНЫХ прогонах и разных объёмах (129 вызовов acceptance против 5 глав rerun2) — прямой пере-счёт одного в другое не делался.
  • Из этого НЕ следует «менять редактора». Три причины, и все три — не мои полномочия: (1) D39.117 закрыл строку 65 на «неразличимы», но неразличимость мерена ригом фазы, а судья rerun2 ставил dspro первым (0.679 против 0.589) — приборы согласны лишь в том, что зазор мал; (2) пик у DeepSeek — только будни 0104 и 0610 UTC, то есть ответ зависит от РАСПИСАНИЯ прогона, а не только от модели; (3) выбор жильца — конфиг backend/, зона бэкенда и лендинг оркестратора.

  • Носитель решения врёт прямо сейчас. backend/configs/pipeline-c1.yaml:65=×2 дешевле glm и backend/configs/pipeline-arm-glm.yaml:6=×2 дешевле до сих пор обосновывают выбор словами «×2 дешевле glm». Это устаревшее обоснование в БОЕВОМ конфиге. Правка — зона бэкенда; пинг сдан этой секцией.

Д51.4. Дешёвый ход, который виден из этих же данных

Если жилец — вопрос цены (D39.117), то у вопроса есть ответ, не требующий смены модели: гнать редакторскую волну в офф-пик. Для DeepSeek офф-пик — это все выходные целиком и будни вне двух окон; скидка ровно ½ и не требует ни решения о модели, ни правки Go. На книге это разница между $49 и $25 у того же самого редактора, с которым фаза уже согласилась по качеству. ⚠ Тарифная погода не климат: несущую архитектуру на скидочное окно не ставят, но ПЛАНИРОВЩИК волн — ровно то место, где расписание законно.


Д52. Консилиум по research/29: мы измеряем половину собственной цели

Дата: 31.08.2026, полигон. Стоимость: $0. Три эксперта claude-fable-5 (архитектор · скептик замера · стратег) по двум переработанным ресёрч-отчётам: docs/research/29-harness-topology-survey.md (2475 строк) и …-codex.md (685 строк). Плюс мой собственный замер и обмен с ресёрч-сессией.

Д52.1. ГЛАВНОЕ: редактор покупает БЕГЛОСТЬ, а верность НЕ ПОКУПАЕТ — но и не платит ею

ЗАГОЛОВОК И ВЫВОД ЭТОЙ СЕКЦИИ ИСПРАВЛЕНЫ 31.08 ПОСЛЕ КОНСИЛИУМА ПО ПЛАНУ — ПЕРВАЯ РЕДАКЦИЯ ЗАВЫШАЛА. Было: «покупает беглость ЦЕНОЙ верности». Опровергнуто двумя проверками исполнением:

  1. Наша опора 3 говорит обратное тому, что я из неё вывел. 21-role-topology.md:329-330: по оси ВЕРНОСТЬ второй проход даёт A против F +0.23 [0.22,+0.72] и B против F +0.85 [+0.18,+1.50]* — то есть не хуже, а в одном контрасте значимо ЛУЧШЕ. Фраза источника «покупает ЯЗЫК и ТЕРМИН, а не верность» означает «верность не улучшает», а НЕ «ухудшает». Я прочёл «не покупает» как «платит». ⚠ Там же оговорка самого источника: разложение по осям «читается как гипотеза, а не как замер» — утечка между осями в 7 голосах из 12.

  2. Наша опора 2 тоже слабее, чем подана. Во внешней работе точность РАВНА (медианы 8 у всех трёх, χ²(2)=0.37, p=.832); «на 32% длиннее» — это против ЖИВОГО переводчика, в пятиступенчатой связке со стилистическим переписыванием, которой у нас нет.

  3. И решающее — замер на наших же артефактах (31.08, 15 единиц zh, эхо-клетка исключена):

    редактор рост знаков, медиана рост токенов абзацев было → стало
    deepseek-v4-pro 0.4% (коридор 5.3 … +9.5) 0.1% 72 → 40
    glm-5 0.6% (2.2 … +3.3) 0.7% 72 → 52

    НАШ РЕДАКТОР НЕ ДОПИСЫВАЕТ. Масса не растёт ни у одного из двух; внешний дефект №1 (+32% длины) у нас не воспроизводится. Опасение, ради которого затевался «прибор верности», на уровне единицы снято замером, а не прибором. ⚠ И побочно — мина для будущего прибора: pro сливает абзацы почти вдвое (72 → 40), поэтому любое поабзацное сопоставление ПО ИНДЕКСУ покажет ложный «прирост» на каждом слиянии.

Что остаётся верным после правки: редакторская стадия покупает беглость и термин; ось верности она не двигает; и прибора этой оси у нас по-прежнему нет — панель объявлена слепой к ней (23-editor-tier.md:6056=оси ВЕРНОСТИ владельца). Утверждение «мы измеряем половину цели» устояло; утверждение «за вторую половину мы платим» — снято.

Класс моей ошибки: «не покупает» прочитано как «платит» — усиление вывода в сторону тревоги. Родня ошибок §Д50.4, только знак другой: там я завышал дефект прибора, здесь — дефект продукта.

Д52.1-бис. Исходная редакция (СНЯТА выше): «беглость ценой верности»

Три эксперта пришли к этому независимо, и опор четыре — две внешние, две наши собственные:

  1. Внешне, людьми: профессиональные оценщики фиксируют падение точности при редакторской правке у трёх сильнейших моделей (Acc 2.3 · 0.6 · 1.2) при росте беглости и стиля. Попарно за правленый вариант голосуют 97.5% по беглости и лишь 76.1% по точности, а на одной паре — 51.9%, то есть монетка.
  2. Внешне, на НАШЕМ жанре и исходнике (zh→en, 28 глав вебновелл, 4 живых эксперта вслепую): мультиагентная связка бьёт живых переводчиков по беглости (p<.001, r=.71) и по предпочтению (43.3% против 24.2%) при равной точности — но её выход на 32% длиннее, и главным дефектом эксперты называют систематические добавления, которых нет в источнике.
  3. Наше, exp21: «второй проход покупает ЯЗЫК и ТЕРМИН, а не верность»; там же — «размен: покупает русский язык, платит формой».
  4. Наше, D39.20: антикорреляция гладкость ↔ верность, зафиксированная своим замером.

Цель владельца — «художественный перевод, который НЕ ОТХОДИТ ОТ КАНОНА» — состоит из двух половин, и прибор у нас есть только на первую. Панель фазы Д к оси верности слепа по построению (23-editor-tier.md:6056-6057). Это не находка о литературе, это находка о нас.

И моя собственная ошибка в этом же месте, пойманная скептиком консилиума. Докладывая владельцу пункт 2, я привёл точность, беглость и предпочтение — и умолчал колонку длины и добавлений, то есть ровно ту, которая отвечает на вопрос про канон. Класс — избирательное цитирование: все приведённые числа верны, умолчан результат источника, противоположный удобному выводу. Тот же класс, который этот отчёт ловит у ресёрчеров.

Д52.2. Архитектурная гипотеза: размышление — плата за отрыв от копирования

Внешний замер девяти комбинаций гранулярности (WMT24-Literary, 7 направлений, среди них en→ru): устойчиво лучший режим — полный документ в контексте, переписывание по частям; режим «документ → документ» даёт наименьший выигрыш, а у одной модели уходит в минус. Наш редактор работает именно в режиме «документ → документ».

Гипотеза архитектора, и она дороже всех прочих находок вместе: внешние числа для посегментного режима сняты на НЕрассуждающих моделях при нулевой температуре. Если это так, то наши 93% completion, уходящие в размышление (Д49), — это плата за то, чтобы оторвать модель от простого копирования входа; смена единицы выдачи даёт правку без этой платы.

Поправка к консилиуму от меня, замером: он строил довод на наших числах «редактор меняет 4.05.8% знаков» — а они сняты на АНГЛИЙСКОЙ оси (:7450), и сам Д49 предупреждал, что на zh не переносятся. Предупреждение подтвердилось. Мой замер на боевой китайской оси, 15 глав (эхо-клетка исключена), тот же черновик:

редактор доля изменённых ТОКЕНОВ доля изменённых ЗНАКОВ
deepseek-v4-pro (боевой) медиана 34.2% (6.0 … 64.9) 18.8%
glm-5 11.5% (1.9 … 39.9) 6.8%

⇒ Три следствия. (1) На zh наш редактор правит втрое-вчетверо больше, чем на en — 18.8% против 46% по одной и той же символьной метрике. (2) По внешней мерке (токены) мы не в «отнулённом» коридоре <5%, а внутри сегментного 2540% — значит механизм «мало правит ⇒ мало выигрывает» к нам не применяется, и вывод «наша гранулярность слабейшая» на боевой паре НЕ доказан. (3) Объём правки — свойство МОДЕЛИ, а не гранулярности: втрое разный объём на одном и том же черновике при качественной неразличимости этих же двух редакторов (+0.06, p=0.95).

Д52.3. Что консилиум велит НЕ покупать — прямая экономия

  • Фактор «размышление вкл/выкл» вычеркнуть из пилота. Он заложен там как основной крест (09-pilot-protocol:51) и удваивает его. Основания: на нашем жанре и исходнике рассуждающие модели проигрывают нерассуждающим того же вендора; рассуждающий судья не лучше нерассуждающего примерно в половине настроек; у редактора вопрос уже решён exp12 (reasoning-off = no-op). Экономия — половина основного креста пилота.
  • Новых бейк-оффов черновой модели не ставить: линия «улучшить черновик» закрыта своим замером (пять альтернатив) и объяснена внешним механизмом (остаточная цена слабого черновика 0.4 из 24).
  • Точечный ремонт по автоматическим флагам не переоткрывать.
  • Метрики канона и голоса не строить: reference-free измерители связности дают r = 0.150.17, а на вебновеллах готовые оценщики качества коррелируют с экспертами отрицательно (0.03, 0.32). Фильтр проходит только точность терминов по своему словарю — то есть то, что уже построено (eval/dovodka/bank.py, Д50).

Д52.4. Три ложные дельты — что подано как новое, а лежит у нас

  1. Митигация «25 узких вопросов да/нет вместо MQM» (+35 пунктов к доле, где судья предпочёл человека) — это метрика LiTransProQA, и она уже в репозитории в трёх местах, включая docs/architecture/02-mvp-plan.md:49=судья-анкета узких вопросов. ⚠ Хуже: её же τ = 0.124 в другом месте того же отчёта объявлен опорой «судья награждает MT» — то есть одна метрика подана и как лекарство, и как болезнь.
  2. Работа про гранулярность уже пересказана у нас в девяти местах, включая 09-pilot-protocol.md:59 с пометкой «верифицировано по PDF, вкл. en→ru».
  3. Байт-стабильность нетронутого как довод за дифф-интерфейс — тезис ратифицирован у нас Д49.3 и старше внешней находки на сутки.

Д52.5. Класс ошибок, общий для пяти случаев за сутки у четырёх сессий

Показания инструмента приняты за факт о мире. Реестр, собранный совместно с ресёрч-сессией:

случай инструмент соврал так последствие
ресёрч-сессия cut обрезал вывод sha256sum; хвост хеша дописан по памяти о форме сдан несуществующий хеш в строке, самой предписывающей проверку
ресёрч-сессия греп не исключал собственный файл 25 команд «→ пусто» были не пусты
ресёрч-сессия HTTP 403 роботам принят за платный доступ работа объявлена платной; она Gold OA, цена 0
ресёрч-сессия греп по arXiv-id не видит цитирования по DOI 2 пропуска дельта-фильтра из 30
сессия Codex область грепа не включала docs/experiments/*.md главная находка оказалась дублем, лежащим в 9 местах
оркестратор №21 find без -L по симлинку; чужой worktree «файла нет» при существующем файле
эта сессия три «переоткрытия» сделанного за один день см. Д50.1

Норма, выведенная из семи случаев: отрицательный результат предъявляется с положительным контролем; идентификатор, не увиденный ЦЕЛИКОМ в выводе команды, по памяти не воспроизводится.

Д52.6. Что из этого следует делать

  1. Прибор верности — первым, и он $0. Мы слепы к половине цели. Дешёвый кандидат уже назван внешним источником и подтверждён на нашем жанре: двусторонний контроль объёма (у нас гейт ловит обрушение длины, а рост — нет), плюс счётчик добавленного содержания на абзац. Главный дефект внешне лучшей топологии — приписывание, и оно измеримо без единого платного вызова.
  2. Проба единицы выдачи редактора — единственный найденный рычаг, бьющий прямо в наш слот: «абзац при полном документе в контексте, размышление OFF» против боевого «глава целиком, размышление ON», тот же черновик, те же 16 глав. Меры: объём правки · раздельно ЯЗЫК и ВЕРНОСТЬ · цена. ⚠ Ставить на zh: на en наши величины не переносятся (Д52.2).
  3. Вычеркнуть размышление из креста пилота (Д52.3) — до того, как пилот куплен.

Д53. Прогон, о котором фаза не знала: coldrun-v16 — и почему она о нём не знала

Дата записи: 01.09.2026, полигон. Стоимость: $0. Повод: план фазы утверждал, что «полный контур ни разу не ездил целиком». Это ложь, и прогон, её опровергающий, прошёл накануне.

Д53.1. Что это за прогон

~/books/gu-zhenren/coldrun-v16/ — холодный прогон 31.08 бэкенд-сессией по санкции владельца. Полный контур в одном конфиге: черновик deepseek-v4-flash → банкнота → майнинг → терминолог с классификатором → голосовой флаггер → редактор deepseek-v4-pro. Куплено $0.436110, 50 вызовов; draft=36, edit=5, terminology=9 чекпоинтов.

Что он дал, и это важнее денег:

  • движок перевёл книгу насквозь и отдал файл, прошедший валидатор — epubcheck 5.1.0, EPUB 3.3, 0 fatals / 0 errors / 0 warnings / 0 infos. ⚠ Открытие в живой читалке НЕ проверено: читалки на машине нет;
  • собственная оценка движка на полной книге — projected_book_usd = 1.1377 на десяти главах против приора ≈$0.58;
  • остановлен не потолком, а снапшот-гардом, потребовавшим --resnapshot после покупки двумя порциями; доставлено 3 юнита из 14;
  • класс term в намайненном банке: 33 из 53 записейс пометкой «кандидат только банкноты, майнер его не поднял». Это второе подтверждение того, что WHICH-канал класс term не берёт.

Д53.2. Его §14 — ратифицированная форма СЛЕДУЮЩЕГО замера

Отчёт того прогона пере-спроектировал следующий платный замер, и это ратифицировано D39.184 п.5: контролируемая проба редактора по четырём осям — трудность чанка БЛОКИРОВАТЬ (парный дизайн), длину входа КОНТРОЛИРОВАТЬ (ковариата), промпт брать по SHA (июльский editor.md против сегодняшнего — оба под одной меткой v3-discourse-reflow), эффорт off против low. Плюс три требования, каждое куплено ошибкой того прогона: одинаковый потолок вывода во всех руках · цена за доставленный знак, а не за вызов · n считать от разброса.

Д53.3. Четвёртый конфаунд того прогона — и он объясняет нашу денежную арифметику

Автор прогона сняла два своих вывода сама, а четвёртый конфаунд дописала после сдачи, и он несущий: рычаг у редактора БЫЛ, и дёрнули его МЫ. Конфиг объявил stages[edit].reasoning: "off", а backend/internal/llm/capability.go:53=reasoning_effort говорит: «low|medium|high go out as reasoning_effort; off and "" emit nothing, leaving the provider's OWN default». ⇒ на провод редактору не ушло ничего, и он поехал вендорским high.

Вендор-факт, снятый там же: Change Log DeepSeek от 13.08.2026 — «The thinking modes of V4-Pro and V4-Flash now support three thinking effort levels: low / high / max», а сноска «обновим маппинг pro в начале августа» со страницы исчезла. Наша последняя сверка была 10.08 — носитель протух на 18 суток, и на нём стояла вся рамка «у pro ручки нет».

Д53.4. Почему фаза о нём не знала — механизм, а не оправдание

Артефакты прогона лежат в books/ТРЕТЬЕМ, отдельном git-репозитории, который виден обоим рабочим деревьям (~/books — симлинк на books/ внутри репозитория; внешний держит /books/ в .gitignore). А отчёт фазы Д живёт только в ветке polygon, тогда как прогон делала сессия, работавшая из main. Ветки разошлись 29.08; на 01.09 расхождение 63/72 коммита.

Работа была видна на диске, но не была видна в документации той ветки, где фаза ведёт свой отчёт. Это не чья-то небрежность, а свойство раскладки: три репозитория, два рабочих дерева, один общий каталог артефактов.

Практическое следствие, которое стоит унести в норму: прежде чем писать «такого прогона нет», смотреть каталог артефактов, а не только свою ветку доков — ls ~/books/<книга>/ дешевле любого грепа по docs/ и отвечает на вопрос прямо. Это девятый случай класса «показания инструмента приняты за факт о мире» (реестр — Д52.5): здесь инструментом была моя собственная ветка.