textmachine/eval/dovodka/blind-read/RESULT-2-BLIND-READ.md

107 lines
9 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

# Результат 2: слепое чтение на исправленном материале с активными нулями
**Исполнено 02.09 по `PREREG-2-BLIND-READ.md`.** 120 судей Opus, 40 материалов × 3 линзы,
0 ошибок агентов. Материал: черновик склеен по манифесту движка, покрытие 99100%.
Куплена реплика `low₂` — $0.659678 (ожидалось $0.656). Всего по фазе $6.17 из $9.50.
## 1. ГЛАВНОЕ: прибор назначает победителя там, где его нет
10 пар `low₁` против `low₂` — два прогона ОДНОЙ руки, отличающиеся только случайностью
генерации. Правильный ответ по построению — ничья.
| Линза | low₁ | low₂ | ничьих | определилось |
|---|---|---|---|---|
| точность (первичная) | 6 | 4 | **0** | **10/10** |
| художественность (первичная) | 8 | 2 | **0** | **10/10** |
| естественность | 7 | 2 | 1 | 9/10 |
**Судьи объявили победителя в 29 случаях из 30 на чистом шуме.** Доля ничьих на нулях
неотличима от доли на боевых парах (точный тест Фишера: p = 0.165 / 0.560 / 1.000) — то есть
прибор реагирует на шум РОВНО ТАК ЖЕ, как на разные режимы.
Хуже: **шумовой перекос БОЛЬШЕ боевого.** По художественности шум одной руки даёт 8:2 (80%),
а разные руки — 19:8 (70%). По точности 60% против 55%.
⚠ Блокирующий порог §5 строки 0 (p < 0.05 на нулях) НЕ сработал: 0.754 и 0.109. Но он и не мог
при n=10 его берут только расклады 9:1 и 10:0 (посчитано в дополнении §6.1 до чтения чисел).
**Непрохождение блокирующего порога исправность прибора не доказывает**, а диагностический
критерий того же дополнения сработал по обеим первичным линзам.
## 2. Первичные исходы — различие не предъявлено
Тест: точная перестановка метки руки на уровне юнита (2¹⁵ масок), поправка Холма на два первичных.
| | low | off | ничьих | p | Холм |
|---|---|---|---|---|---|
| **P1 точность** (блокирующий) | 12 | 10 | 8 | 0.842 | **0.842** |
| **P2 художественность** | 19 | 8 | 3 | 0.070 | **0.141** |
Вторичное (поправку не проходило): естественность 16 : 11 : 3, p = 0.414.
Описательно, консенсус 2 из 3: low 17, off 8, ничьих 5.
**Исход по правилу §5 — строка 4: РАЗЛИЧИЕ НЕ ПРЕДЪЯВЛЕНО.** Ни одна рука не показала
превосходства. Строка 3 low лучше») не объявляется: Холм-p = 0.141.
## 3. Что стало с результатом первой редакции
Первая редакция дала консенсус 18 : 6 : 6 и подавалась как «дешёвая рука чаще лучше».
Здесь на исправленном материале консенсус 17 : 8 : 5 **похожая картина**, но теперь известна
её цена: **два прогона одной руки дают перекос того же размера и даже больше**.
**Наблюдавшийся перевес неотличим от случайности розыгрыша.** Вчерашняя находка была
артефактом отсутствующего контроля, и первая редакция не могла этого увидеть, потому что
активного нуля в ней не было.
## 4. Почему так вышло — измеренная причина
Текстовый разброс ВНУТРИ режима больше межрежимного:
```
совпадение low₁ / low₂ (один режим, два запуска) медиана 0.799
совпадение low₁ / off (разные режимы) медиана 0.820
```
Одна и та же настройка, запущенная дважды, расходится с собой сильнее, чем с конкурентом.
При такой структуре шума парное сравнение одного куска не может отделить режим от розыгрыша:
судья честно видит разницу но это разница между двумя случайными реализациями, а не между
настройками.
Независимое подтверждение с другой стороны (сессия пробы, на этой же реплике): по деньгам и
объёму размышления эффект режима воспроизводится (×0.230 ×0.307, знак и значимость держатся),
а шум внутри руки ниже разрешения (p = 0.225). **Расходится именно ТЕКСТ, а не расход.** То есть
режим устойчиво меняет цену и не устойчиво формулировки.
## 5. Что теперь честно утверждать
**Можно:**
- «На 15 юнитах различие в качестве между режимами НЕ ПРЕДЪЯВЛЕНО ни по точности (p = 0.84),
ни по художественности (Холм-p = 0.14).»
- «Разница между режимами по тексту, если она есть, не превышает разброса между двумя запусками
ОДНОГО режима измерено: 0.820 против 0.799
- «Судьи-модели на изолированном куске не отличают шум генерации от смены режима: на чистом шуме
они назвали победителя в 29 случаях из 30
- «Экономический эффект режима при этом устойчив и воспроизводится на реплике
**Нельзя:**
- «Дешёвый режим лучше» опровергнуто настоящим контролем.
- «Дешёвый режим не хуже» отсутствие доказательства не есть доказательство отсутствия;
мощность n=30 различает ~25 п.п.
- «Прибор годен, нули чисты» блокирующий порог не сработал по слабости, а не по чистоте.
- Переносить на книгу: 0.63% книги, холодный банк, 13 из 15 юнитов начала глав, и к дрейфу
терминов между главами этот прибор слеп по построению.
## 6. Что это значит для решения о деньгах
Вопрос «платить ли втрое за высокое усилие редактора» ($2.00 против $0.67 на p7) этим замером
**не закрывается в пользу качества**: превосходства дорогого режима не видно, но и равенство не
доказано. Решение остаётся за владельцем, и оно теперь опирается на честную рамку, а не на
артефакт.
**Чего стоил бы ответ.** Чтобы отделить режим от розыгрыша при измеренном шуме, нужно сравнивать
СРЕДНИЕ по нескольким репликам каждой руки, а не одиночные тексты: порядка 35 реплик на руку и
не меньше 4060 юнитов. Это кратно дороже нынешнего и, по совокупности §5, вероятно измеряет не
то, что решает судьбу продукта.
**Более дешёвый и более полезный поворот:** мерить то, что этот прибор увидеть не может и что
прямо задевает цель владельца, **дрейф терминов и голосов на длине книги**. Он живёт между
главами, детерминирован, ловится без судей-моделей и не тонет в шуме розыгрыша.