Record the negative result: judges named a winner on 29 of 30 pure-noise pairs, so the earlier cheap-arm advantage is indistinguishable from generation randomness

This commit is contained in:
heaven 2026-09-02 22:23:34 +03:00
parent 56ec3bda44
commit 880b8a6b3f
2 changed files with 9294 additions and 0 deletions

View file

@ -0,0 +1,107 @@
# Результат 2: слепое чтение на исправленном материале с активными нулями
**Исполнено 02.09 по `PREREG-2-BLIND-READ.md`.** 120 судей Opus, 40 материалов × 3 линзы,
0 ошибок агентов. Материал: черновик склеен по манифесту движка, покрытие 99100%.
Куплена реплика `low₂` — $0.659678 (ожидалось $0.656). Всего по фазе $6.17 из $9.50.
## 1. ГЛАВНОЕ: прибор назначает победителя там, где его нет
10 пар `low₁` против `low₂` — два прогона ОДНОЙ руки, отличающиеся только случайностью
генерации. Правильный ответ по построению — ничья.
| Линза | low₁ | low₂ | ничьих | определилось |
|---|---|---|---|---|
| точность (первичная) | 6 | 4 | **0** | **10/10** |
| художественность (первичная) | 8 | 2 | **0** | **10/10** |
| естественность | 7 | 2 | 1 | 9/10 |
**Судьи объявили победителя в 29 случаях из 30 на чистом шуме.** Доля ничьих на нулях
неотличима от доли на боевых парах (точный тест Фишера: p = 0.165 / 0.560 / 1.000) — то есть
прибор реагирует на шум РОВНО ТАК ЖЕ, как на разные режимы.
Хуже: **шумовой перекос БОЛЬШЕ боевого.** По художественности шум одной руки даёт 8:2 (80%),
а разные руки — 19:8 (70%). По точности 60% против 55%.
⚠ Блокирующий порог §5 строки 0 (p < 0.05 на нулях) НЕ сработал: 0.754 и 0.109. Но он и не мог
при n=10 его берут только расклады 9:1 и 10:0 (посчитано в дополнении §6.1 до чтения чисел).
**Непрохождение блокирующего порога исправность прибора не доказывает**, а диагностический
критерий того же дополнения сработал по обеим первичным линзам.
## 2. Первичные исходы — различие не предъявлено
Тест: точная перестановка метки руки на уровне юнита (2¹⁵ масок), поправка Холма на два первичных.
| | low | off | ничьих | p | Холм |
|---|---|---|---|---|---|
| **P1 точность** (блокирующий) | 12 | 10 | 8 | 0.842 | **0.842** |
| **P2 художественность** | 19 | 8 | 3 | 0.070 | **0.141** |
Вторичное (поправку не проходило): естественность 16 : 11 : 3, p = 0.414.
Описательно, консенсус 2 из 3: low 17, off 8, ничьих 5.
**Исход по правилу §5 — строка 4: РАЗЛИЧИЕ НЕ ПРЕДЪЯВЛЕНО.** Ни одна рука не показала
превосходства. Строка 3 («low лучше») не объявляется: Холм-p = 0.141.
## 3. Что стало с результатом первой редакции
Первая редакция дала консенсус 18 : 6 : 6 и подавалась как «дешёвая рука чаще лучше».
Здесь на исправленном материале консенсус 17 : 8 : 5 — **похожая картина**, но теперь известна
её цена: **два прогона одной руки дают перекос того же размера и даже больше**.
**Наблюдавшийся перевес неотличим от случайности розыгрыша.** Вчерашняя находка была
артефактом отсутствующего контроля, и первая редакция не могла этого увидеть, потому что
активного нуля в ней не было.
## 4. Почему так вышло — измеренная причина
Текстовый разброс ВНУТРИ режима больше межрежимного:
```
совпадение low₁ / low₂ (один режим, два запуска) медиана 0.799
совпадение low₁ / off (разные режимы) медиана 0.820
```
Одна и та же настройка, запущенная дважды, расходится с собой сильнее, чем с конкурентом.
При такой структуре шума парное сравнение одного куска не может отделить режим от розыгрыша:
судья честно видит разницу — но это разница между двумя случайными реализациями, а не между
настройками.
⭐ Независимое подтверждение с другой стороны (сессия пробы, на этой же реплике): по деньгам и
объёму размышления эффект режима воспроизводится (×0.230 → ×0.307, знак и значимость держатся),
а шум внутри руки ниже разрешения (p = 0.225). **Расходится именно ТЕКСТ, а не расход.** То есть
режим устойчиво меняет цену и не устойчиво — формулировки.
## 5. Что теперь честно утверждать
**Можно:**
- «На 15 юнитах различие в качестве между режимами НЕ ПРЕДЪЯВЛЕНО ни по точности (p = 0.84),
ни по художественности (Холм-p = 0.14).»
- «Разница между режимами по тексту, если она есть, не превышает разброса между двумя запусками
ОДНОГО режима — измерено: 0.820 против 0.799.»
- «Судьи-модели на изолированном куске не отличают шум генерации от смены режима: на чистом шуме
они назвали победителя в 29 случаях из 30.»
- «Экономический эффект режима при этом устойчив и воспроизводится на реплике.»
**Нельзя:**
- «Дешёвый режим лучше» — опровергнуто настоящим контролем.
- «Дешёвый режим не хуже» — отсутствие доказательства не есть доказательство отсутствия;
мощность n=30 различает ~25 п.п.
- «Прибор годен, нули чисты» — блокирующий порог не сработал по слабости, а не по чистоте.
- Переносить на книгу: 0.63% книги, холодный банк, 13 из 15 юнитов — начала глав, и к дрейфу
терминов между главами этот прибор слеп по построению.
## 6. Что это значит для решения о деньгах
Вопрос «платить ли втрое за высокое усилие редактора» ($2.00 против $0.67 на p7) этим замером
**не закрывается в пользу качества**: превосходства дорогого режима не видно, но и равенство не
доказано. Решение остаётся за владельцем, и оно теперь опирается на честную рамку, а не на
артефакт.
**Чего стоил бы ответ.** Чтобы отделить режим от розыгрыша при измеренном шуме, нужно сравнивать
СРЕДНИЕ по нескольким репликам каждой руки, а не одиночные тексты: порядка 35 реплик на руку и
не меньше 4060 юнитов. Это кратно дороже нынешнего и, по совокупности §5, вероятно измеряет не
то, что решает судьбу продукта.
**Более дешёвый и более полезный поворот:** мерить то, что этот прибор увидеть не может и что
прямо задевает цель владельца, — **дрейф терминов и голосов на длине книги**. Он живёт между
главами, детерминирован, ловится без судей-моделей и не тонет в шуме розыгрыша.

File diff suppressed because it is too large Load diff