textmachine/eval/dovodka/blind-read/RESULT-2-BLIND-READ.md

9 KiB
Raw Blame History

Результат 2: слепое чтение на исправленном материале с активными нулями

Исполнено 02.09 по PREREG-2-BLIND-READ.md. 120 судей Opus, 40 материалов × 3 линзы, 0 ошибок агентов. Материал: черновик склеен по манифесту движка, покрытие 99100%. Куплена реплика low₂ — $0.659678 (ожидалось $0.656). Всего по фазе $6.17 из $9.50.

1. ГЛАВНОЕ: прибор назначает победителя там, где его нет

10 пар low₁ против low₂ — два прогона ОДНОЙ руки, отличающиеся только случайностью генерации. Правильный ответ по построению — ничья.

Линза low₁ low₂ ничьих определилось
точность (первичная) 6 4 0 10/10
художественность (первичная) 8 2 0 10/10
естественность 7 2 1 9/10

Судьи объявили победителя в 29 случаях из 30 на чистом шуме. Доля ничьих на нулях неотличима от доли на боевых парах (точный тест Фишера: p = 0.165 / 0.560 / 1.000) — то есть прибор реагирует на шум РОВНО ТАК ЖЕ, как на разные режимы.

Хуже: шумовой перекос БОЛЬШЕ боевого. По художественности шум одной руки даёт 8:2 (80%), а разные руки — 19:8 (70%). По точности 60% против 55%.

⚠ Блокирующий порог §5 строки 0 (p < 0.05 на нулях) НЕ сработал: 0.754 и 0.109. Но он и не мог — при n=10 его берут только расклады 9:1 и 10:0 (посчитано в дополнении §6.1 до чтения чисел). Непрохождение блокирующего порога исправность прибора не доказывает, а диагностический критерий того же дополнения сработал по обеим первичным линзам.

2. Первичные исходы — различие не предъявлено

Тест: точная перестановка метки руки на уровне юнита (2¹⁵ масок), поправка Холма на два первичных.

low off ничьих p Холм
P1 точность (блокирующий) 12 10 8 0.842 0.842
P2 художественность 19 8 3 0.070 0.141

Вторичное (поправку не проходило): естественность 16 : 11 : 3, p = 0.414. Описательно, консенсус 2 из 3: low 17, off 8, ничьих 5.

Исход по правилу §5 — строка 4: РАЗЛИЧИЕ НЕ ПРЕДЪЯВЛЕНО. Ни одна рука не показала превосходства. Строка 3 («low лучше») не объявляется: Холм-p = 0.141.

3. Что стало с результатом первой редакции

Первая редакция дала консенсус 18 : 6 : 6 и подавалась как «дешёвая рука чаще лучше». Здесь на исправленном материале консенсус 17 : 8 : 5 — похожая картина, но теперь известна её цена: два прогона одной руки дают перекос того же размера и даже больше.

Наблюдавшийся перевес неотличим от случайности розыгрыша. Вчерашняя находка была артефактом отсутствующего контроля, и первая редакция не могла этого увидеть, потому что активного нуля в ней не было.

4. Почему так вышло — измеренная причина

Текстовый разброс ВНУТРИ режима больше межрежимного:

совпадение low₁ / low₂  (один режим, два запуска)  медиана 0.799
совпадение low₁ / off   (разные режимы)            медиана 0.820

Одна и та же настройка, запущенная дважды, расходится с собой сильнее, чем с конкурентом. При такой структуре шума парное сравнение одного куска не может отделить режим от розыгрыша: судья честно видит разницу — но это разница между двумя случайными реализациями, а не между настройками.

Независимое подтверждение с другой стороны (сессия пробы, на этой же реплике): по деньгам и объёму размышления эффект режима воспроизводится (×0.230 → ×0.307, знак и значимость держатся), а шум внутри руки ниже разрешения (p = 0.225). Расходится именно ТЕКСТ, а не расход. То есть режим устойчиво меняет цену и не устойчиво — формулировки.

5. Что теперь честно утверждать

Можно:

  • «На 15 юнитах различие в качестве между режимами НЕ ПРЕДЪЯВЛЕНО ни по точности (p = 0.84), ни по художественности (Холм-p = 0.14).»
  • «Разница между режимами по тексту, если она есть, не превышает разброса между двумя запусками ОДНОГО режима — измерено: 0.820 против 0.799.»
  • «Судьи-модели на изолированном куске не отличают шум генерации от смены режима: на чистом шуме они назвали победителя в 29 случаях из 30.»
  • «Экономический эффект режима при этом устойчив и воспроизводится на реплике.»

Нельзя:

  • «Дешёвый режим лучше» — опровергнуто настоящим контролем.
  • «Дешёвый режим не хуже» — отсутствие доказательства не есть доказательство отсутствия; мощность n=30 различает ~25 п.п.
  • «Прибор годен, нули чисты» — блокирующий порог не сработал по слабости, а не по чистоте.
  • Переносить на книгу: 0.63% книги, холодный банк, 13 из 15 юнитов — начала глав, и к дрейфу терминов между главами этот прибор слеп по построению.

6. Что это значит для решения о деньгах

Вопрос «платить ли втрое за высокое усилие редактора» ($2.00 против $0.67 на p7) этим замером не закрывается в пользу качества: превосходства дорогого режима не видно, но и равенство не доказано. Решение остаётся за владельцем, и оно теперь опирается на честную рамку, а не на артефакт.

Чего стоил бы ответ. Чтобы отделить режим от розыгрыша при измеренном шуме, нужно сравнивать СРЕДНИЕ по нескольким репликам каждой руки, а не одиночные тексты: порядка 35 реплик на руку и не меньше 4060 юнитов. Это кратно дороже нынешнего и, по совокупности §5, вероятно измеряет не то, что решает судьбу продукта.

Более дешёвый и более полезный поворот: мерить то, что этот прибор увидеть не может и что прямо задевает цель владельца, — дрейф терминов и голосов на длине книги. Он живёт между главами, детерминирован, ловится без судей-моделей и не тонет в шуме розыгрыша.