9 KiB
Результат 2: слепое чтение на исправленном материале с активными нулями
Исполнено 02.09 по PREREG-2-BLIND-READ.md. 120 судей Opus, 40 материалов × 3 линзы,
0 ошибок агентов. Материал: черновик склеен по манифесту движка, покрытие 99–100%.
Куплена реплика low₂ — $0.659678 (ожидалось $0.656). Всего по фазе $6.17 из $9.50.
1. ГЛАВНОЕ: прибор назначает победителя там, где его нет
10 пар low₁ против low₂ — два прогона ОДНОЙ руки, отличающиеся только случайностью
генерации. Правильный ответ по построению — ничья.
| Линза | low₁ | low₂ | ничьих | определилось |
|---|---|---|---|---|
| точность (первичная) | 6 | 4 | 0 | 10/10 |
| художественность (первичная) | 8 | 2 | 0 | 10/10 |
| естественность | 7 | 2 | 1 | 9/10 |
Судьи объявили победителя в 29 случаях из 30 на чистом шуме. Доля ничьих на нулях неотличима от доли на боевых парах (точный тест Фишера: p = 0.165 / 0.560 / 1.000) — то есть прибор реагирует на шум РОВНО ТАК ЖЕ, как на разные режимы.
Хуже: шумовой перекос БОЛЬШЕ боевого. По художественности шум одной руки даёт 8:2 (80%), а разные руки — 19:8 (70%). По точности 60% против 55%.
⚠ Блокирующий порог §5 строки 0 (p < 0.05 на нулях) НЕ сработал: 0.754 и 0.109. Но он и не мог — при n=10 его берут только расклады 9:1 и 10:0 (посчитано в дополнении §6.1 до чтения чисел). Непрохождение блокирующего порога исправность прибора не доказывает, а диагностический критерий того же дополнения сработал по обеим первичным линзам.
2. Первичные исходы — различие не предъявлено
Тест: точная перестановка метки руки на уровне юнита (2¹⁵ масок), поправка Холма на два первичных.
| low | off | ничьих | p | Холм | |
|---|---|---|---|---|---|
| P1 точность (блокирующий) | 12 | 10 | 8 | 0.842 | 0.842 |
| P2 художественность | 19 | 8 | 3 | 0.070 | 0.141 |
Вторичное (поправку не проходило): естественность 16 : 11 : 3, p = 0.414. Описательно, консенсус 2 из 3: low 17, off 8, ничьих 5.
Исход по правилу §5 — строка 4: РАЗЛИЧИЕ НЕ ПРЕДЪЯВЛЕНО. Ни одна рука не показала превосходства. Строка 3 («low лучше») не объявляется: Холм-p = 0.141.
3. Что стало с результатом первой редакции
Первая редакция дала консенсус 18 : 6 : 6 и подавалась как «дешёвая рука чаще лучше». Здесь на исправленном материале консенсус 17 : 8 : 5 — похожая картина, но теперь известна её цена: два прогона одной руки дают перекос того же размера и даже больше.
⇒ Наблюдавшийся перевес неотличим от случайности розыгрыша. Вчерашняя находка была артефактом отсутствующего контроля, и первая редакция не могла этого увидеть, потому что активного нуля в ней не было.
4. Почему так вышло — измеренная причина
Текстовый разброс ВНУТРИ режима больше межрежимного:
совпадение low₁ / low₂ (один режим, два запуска) медиана 0.799
совпадение low₁ / off (разные режимы) медиана 0.820
Одна и та же настройка, запущенная дважды, расходится с собой сильнее, чем с конкурентом. При такой структуре шума парное сравнение одного куска не может отделить режим от розыгрыша: судья честно видит разницу — но это разница между двумя случайными реализациями, а не между настройками.
⭐ Независимое подтверждение с другой стороны (сессия пробы, на этой же реплике): по деньгам и объёму размышления эффект режима воспроизводится (×0.230 → ×0.307, знак и значимость держатся), а шум внутри руки ниже разрешения (p = 0.225). Расходится именно ТЕКСТ, а не расход. То есть режим устойчиво меняет цену и не устойчиво — формулировки.
5. Что теперь честно утверждать
Можно:
- «На 15 юнитах различие в качестве между режимами НЕ ПРЕДЪЯВЛЕНО ни по точности (p = 0.84), ни по художественности (Холм-p = 0.14).»
- «Разница между режимами по тексту, если она есть, не превышает разброса между двумя запусками ОДНОГО режима — измерено: 0.820 против 0.799.»
- «Судьи-модели на изолированном куске не отличают шум генерации от смены режима: на чистом шуме они назвали победителя в 29 случаях из 30.»
- «Экономический эффект режима при этом устойчив и воспроизводится на реплике.»
Нельзя:
- «Дешёвый режим лучше» — опровергнуто настоящим контролем.
- «Дешёвый режим не хуже» — отсутствие доказательства не есть доказательство отсутствия; мощность n=30 различает ~25 п.п.
- «Прибор годен, нули чисты» — блокирующий порог не сработал по слабости, а не по чистоте.
- Переносить на книгу: 0.63% книги, холодный банк, 13 из 15 юнитов — начала глав, и к дрейфу терминов между главами этот прибор слеп по построению.
6. Что это значит для решения о деньгах
Вопрос «платить ли втрое за высокое усилие редактора» ($2.00 против $0.67 на p7) этим замером не закрывается в пользу качества: превосходства дорогого режима не видно, но и равенство не доказано. Решение остаётся за владельцем, и оно теперь опирается на честную рамку, а не на артефакт.
Чего стоил бы ответ. Чтобы отделить режим от розыгрыша при измеренном шуме, нужно сравнивать СРЕДНИЕ по нескольким репликам каждой руки, а не одиночные тексты: порядка 3–5 реплик на руку и не меньше 40–60 юнитов. Это кратно дороже нынешнего и, по совокупности §5, вероятно измеряет не то, что решает судьбу продукта.
Более дешёвый и более полезный поворот: мерить то, что этот прибор увидеть не может и что прямо задевает цель владельца, — дрейф терминов и голосов на длине книги. Он живёт между главами, детерминирован, ловится без судей-моделей и не тонет в шуме розыгрыша.