# Результат 2: слепое чтение на исправленном материале с активными нулями **Исполнено 02.09 по `PREREG-2-BLIND-READ.md`.** 120 судей Opus, 40 материалов × 3 линзы, 0 ошибок агентов. Материал: черновик склеен по манифесту движка, покрытие 99–100%. Куплена реплика `low₂` — $0.659678 (ожидалось $0.656). Всего по фазе $6.17 из $9.50. ## 1. ГЛАВНОЕ: прибор назначает победителя там, где его нет 10 пар `low₁` против `low₂` — два прогона ОДНОЙ руки, отличающиеся только случайностью генерации. Правильный ответ по построению — ничья. | Линза | low₁ | low₂ | ничьих | определилось | |---|---|---|---|---| | точность (первичная) | 6 | 4 | **0** | **10/10** | | художественность (первичная) | 8 | 2 | **0** | **10/10** | | естественность | 7 | 2 | 1 | 9/10 | **Судьи объявили победителя в 29 случаях из 30 на чистом шуме.** Доля ничьих на нулях неотличима от доли на боевых парах (точный тест Фишера: p = 0.165 / 0.560 / 1.000) — то есть прибор реагирует на шум РОВНО ТАК ЖЕ, как на разные режимы. Хуже: **шумовой перекос БОЛЬШЕ боевого.** По художественности шум одной руки даёт 8:2 (80%), а разные руки — 19:8 (70%). По точности 60% против 55%. ⚠ Блокирующий порог §5 строки 0 (p < 0.05 на нулях) НЕ сработал: 0.754 и 0.109. Но он и не мог — при n=10 его берут только расклады 9:1 и 10:0 (посчитано в дополнении §6.1 до чтения чисел). **Непрохождение блокирующего порога исправность прибора не доказывает**, а диагностический критерий того же дополнения сработал по обеим первичным линзам. ## 2. Первичные исходы — различие не предъявлено Тест: точная перестановка метки руки на уровне юнита (2¹⁵ масок), поправка Холма на два первичных. | | low | off | ничьих | p | Холм | |---|---|---|---|---|---| | **P1 точность** (блокирующий) | 12 | 10 | 8 | 0.842 | **0.842** | | **P2 художественность** | 19 | 8 | 3 | 0.070 | **0.141** | Вторичное (поправку не проходило): естественность 16 : 11 : 3, p = 0.414. Описательно, консенсус 2 из 3: low 17, off 8, ничьих 5. **Исход по правилу §5 — строка 4: РАЗЛИЧИЕ НЕ ПРЕДЪЯВЛЕНО.** Ни одна рука не показала превосходства. Строка 3 («low лучше») не объявляется: Холм-p = 0.141. ## 3. Что стало с результатом первой редакции Первая редакция дала консенсус 18 : 6 : 6 и подавалась как «дешёвая рука чаще лучше». Здесь на исправленном материале консенсус 17 : 8 : 5 — **похожая картина**, но теперь известна её цена: **два прогона одной руки дают перекос того же размера и даже больше**. ⇒ **Наблюдавшийся перевес неотличим от случайности розыгрыша.** Вчерашняя находка была артефактом отсутствующего контроля, и первая редакция не могла этого увидеть, потому что активного нуля в ней не было. ## 4. Почему так вышло — измеренная причина Текстовый разброс ВНУТРИ режима больше межрежимного: ``` совпадение low₁ / low₂ (один режим, два запуска) медиана 0.799 совпадение low₁ / off (разные режимы) медиана 0.820 ``` Одна и та же настройка, запущенная дважды, расходится с собой сильнее, чем с конкурентом. При такой структуре шума парное сравнение одного куска не может отделить режим от розыгрыша: судья честно видит разницу — но это разница между двумя случайными реализациями, а не между настройками. ⭐ Независимое подтверждение с другой стороны (сессия пробы, на этой же реплике): по деньгам и объёму размышления эффект режима воспроизводится (×0.230 → ×0.307, знак и значимость держатся), а шум внутри руки ниже разрешения (p = 0.225). **Расходится именно ТЕКСТ, а не расход.** То есть режим устойчиво меняет цену и не устойчиво — формулировки. ## 5. Что теперь честно утверждать **Можно:** - «На 15 юнитах различие в качестве между режимами НЕ ПРЕДЪЯВЛЕНО ни по точности (p = 0.84), ни по художественности (Холм-p = 0.14).» - «Разница между режимами по тексту, если она есть, не превышает разброса между двумя запусками ОДНОГО режима — измерено: 0.820 против 0.799.» - «Судьи-модели на изолированном куске не отличают шум генерации от смены режима: на чистом шуме они назвали победителя в 29 случаях из 30.» - «Экономический эффект режима при этом устойчив и воспроизводится на реплике.» **Нельзя:** - «Дешёвый режим лучше» — опровергнуто настоящим контролем. - «Дешёвый режим не хуже» — отсутствие доказательства не есть доказательство отсутствия; мощность n=30 различает ~25 п.п. - «Прибор годен, нули чисты» — блокирующий порог не сработал по слабости, а не по чистоте. - Переносить на книгу: 0.63% книги, холодный банк, 13 из 15 юнитов — начала глав, и к дрейфу терминов между главами этот прибор слеп по построению. ## 6. Что это значит для решения о деньгах Вопрос «платить ли втрое за высокое усилие редактора» ($2.00 против $0.67 на p7) этим замером **не закрывается в пользу качества**: превосходства дорогого режима не видно, но и равенство не доказано. Решение остаётся за владельцем, и оно теперь опирается на честную рамку, а не на артефакт. **Чего стоил бы ответ.** Чтобы отделить режим от розыгрыша при измеренном шуме, нужно сравнивать СРЕДНИЕ по нескольким репликам каждой руки, а не одиночные тексты: порядка 3–5 реплик на руку и не меньше 40–60 юнитов. Это кратно дороже нынешнего и, по совокупности §5, вероятно измеряет не то, что решает судьбу продукта. **Более дешёвый и более полезный поворот:** мерить то, что этот прибор увидеть не может и что прямо задевает цель владельца, — **дрейф терминов и голосов на длине книги**. Он живёт между главами, детерминирован, ловится без судей-моделей и не тонет в шуме розыгрыша.