# Результат слепого чтения + эрраты к пре-регистрации **Замер исполнен 02.09.** 99 судей Opus, 33 материала × 3 линзы, 0 ошибок агентов. Затем — адверсариальная атака шестью линиями (Opus) по своей же работе. Ниже итог ПОСЛЕ атаки: всё, что она сломала, помечено и исправлено в формулировках, а не спрятано. ## 1. Что устояло | Улика | Число | |---|---| | Консенсус (2 из 3 линз) | **low 18 · off 6 · ничьих 6** из 30 | | Точная перестановка с переворотом метки на уровне ЮНИТА (2¹⁵ масок) | **p = 0.0332** | | Нулевые контроли (A и B — побайтная копия) | 9/9 голосов «ничья», 9/9 опознали идентичность | | Позиционный биас | 35 : 44, p = 0.368 — направлен ПРОТИВ находки | | Победитель длиннее | 9/24, p = 0.31 | | Цитаты судей (688 штук) | 662 только в своей руке, **0 в чужой** | | Ключ после судейства | md5 сходится с замороженным — не переписан | **Цена по факту `request_log` (не по смете):** редактура `p7-off` $2.0000 против `p7-low` $0.6727 (**×2.97**); `p9` — $1.5917 против $0.6559 (×2.43). Дороже, чем считала фаза. **Все четыре дефекта сборки смещают замер В ПОЛЬЗУ дорогой руки** (см. §3): выбывшие юниты — ровно объединение провалов `off`; ретраи 11/30 против 2/30; санитайзерный ремонт только у `off`; потолок вывода душит только `off`. Значит перевес дешёвой руки скорее **занижен**. ## 2. Что рухнуло — и это надо говорить вслух 1. **«Консенсус трёх линз» — неправда.** Консенсус совпадает с линзой художественности в 25 из 30 пар, с естественностью в 21, с точностью в 13. Художественность в одиночку даёт 19:8, **p = 0.0522 — своего же порога не берёт**. Естественность и точность согласны лишь в 6 парах из 22, где обе определились (каппа −0.32: согласие НИЖЕ случайного). Правило «2 из 3» здесь не усредняет три взгляда, а усиливает один. 2. **«По точности не хуже» — НЕ ИЗМЕРЕНО.** См. эррату Э-1: в 10 юнитах из 15 линза точности не имела опоры на 21–45% текста. Там, где черновик был полным, точность даёт low 6 : off 3; где усечён — 7 : 8. Обе выборки слишком малы. 3. **«Различаются ТОЛЬКО усилием» — ложно на уровне судимого артефакта** (§3). 4. **Правило решения §5 не исполнено.** Доля бралась из n=30 (60% < 70%), а p — из n=24 (0.0227). При последовательном n=24 срабатывает **E-C**, чья диспозиция — «*до объяснения в бой не ставить*». При буквальном n=30 не срабатывает ни одна ветка. Вывод: **действующего пре-регистрированного p у замера нет**, и «low можно в бой» из него не следует. ## 3. Эрраты к `PREREG-BLIND-READ.md` (ошибки автора, не правки под результат) **Э-1 · §3 — судьям показан УСЕЧЁННЫЙ черновик.** Стадия `edit` склеивает несколько draft-чанков (35 draft-единиц против 20 edit-единиц), а сборщик вклеил только чанк 0. Проверено исполнением: показано 55–79% текста в **10 юнитах из 15**; худший случай гл.7 — 55%. Судьи это видели и штрафовали варианты за «сцену, которой в черновике нет» — фантомная отсебятина. ⇒ линза точности на трети текста работала без эталона. **Э-2 · §2 — «4 таймаута p7-off» неверно.** Таймаутов в БД нет ни одного. Это `decode_error` — оплаченные ответы с нечитаемым телом, каждый ПОСЛЕ клетки, упёршейся в потолок 16000/`length`. **Э-3 · §7.1 — «ни латиницы: 0 на 60 клетках» неверно.** Гард искал `[A-Za-z]{2,}` и пропускал одиночные буквы: их 23–25 в КАЖДОЙ руке («категория B», «категория C»). Асимметрии нет (48 у `off` против 47 у `low`), **слепота не пробита**, но декларация была ложной. **Э-4 · §2 — «юниты с браком выпали по построению» неполно.** Клетка гл.2 в обеих `off`-руках помечена `sanitizer_stripped` (вырезан 公然勒索 из русского текста) и всё равно ушла судьям — отремонтированной. Обе пары дали ничью, на счёт не влияет; но брак дорогой руки до судей не дошёл. **Э-5 · §4 — первичный тест математически невалиден.** «Ничьи в знаменатель, не в числитель» плюс H₀=50% даёт под истинной нулевой ожидаемую долю (1−t)/2, а не 50%. При наблюдённой доле ничьих 0.20 ошибка I рода — **17.8%**, а не 5%. **Э-6 · §6 — вторичный исход не исполнен.** Счётчик претензий кэпится: за 99 вердиктов ни одного значения вне {2,3,4}. Средние 3.82 против 3.69 — разность двух чисел, прижатых к потолку; сопоставление с планкой владельца ≤2 (D39.20) этим прибором невозможно. **Э-7 · механизм «low правит смелее» СНЯТ.** Я озвучил близость к черновику 0.65 против 0.79. Знаковый тест по 30 парам: `off` ближе в **19**, `low` в 11, **p = 0.200**. Свойством руки это не является; разброс порождён Э-1 (близость мерилась против усечённого эталона). ## 4. Чего замер не даёт (сверх §8 пре-рега) - **Фактическое усилие дорогой руки нигде не записано.** `reasoning: "off"` не эмитит параметр — едет вендор-дефолт, который DeepSeek двигал 31.07 и 30.08. `reasoning_tokens` = 0 во всех вызовах. Замер **не воспроизводим** в строгом смысле: сравнивали с движущейся мишенью. - **Дорогая рука судилась задушенной:** `max_output_ratio: 2.2` одинаков у обеих, но мысль биллится внутри `completion_tokens`; 10 и 9 клеток из 20 упёрлись в потолок против 1 и 1 у `low`. - **Нулевой контроль вырожден.** Он доказал лишь, что судья узнаёт побайтную копию. Референсного распределения для 18:6 нет: неизвестно, какой перекос даёт ЧИСТЫЙ шум одной руки при `temperature: 0.4`. - **Переносимость:** 0.63% книги, банк холодный, 13 из 15 юнитов — начала глав. Сшивка через границу чанка и удержание глоссария — то, ради чего усилие покупают на длинной книге, — представлены двумя юнитами. **Парное чтение изолированного куска слепо к дрейфу терминов и голосов по построению** — а это цель №1 владельца. ## 5. Честная формулировка результата > На 15 юнитах из начала книги дешёвая рука в парном слепом чтении выигрывает заметно чаще > (18 : 6, кластер-робастный p = 0.033). Направление устойчиво к позиции, длине и величине правки, > а все найденные дефекты сборки играют против него. Но пре-регистрированный порог не взят ни в > одном честном прочтении, «согласие трёх линз» отсутствует, равенство по точности не измерено, а > дорогая рука ехала на вендор-дефолте под потолком вывода. > > **Это рабочая гипотеза, а не решение о переводе `low` в бой.** ## 6. Следующая проверка (одна, дешёвая) Пере-судейство тех же 30 пар на **полном склеенном черновике** (чинит Э-1 и возвращает опору линзе точности) плюс **10 «активных нулей» low₁ против low₂** — второй независимый прогон дешёвой руки при той же температуре. Если шум одной руки тоже даёт перекос вроде 7:2 — прибор негоден, и это надо знать до любых денег на объёме. Цена: один дешёвый `edit`-прогон ≈ $0.67 по факту логов, правок Go не требует; панель +20%. **Условие: пере-регистрация ДО чисел** — один фиксированный знаменатель, одна первичная линза, заранее объявленный список публикуемых сравнений. Иначе воспроизведём ту же свободу, из которой взялась Э-5.