Land what the two judging families measure against a deterministic third party, and say plainly which number is missing for the substitution question

This commit is contained in:
heaven 2026-08-23 03:12:23 +03:00
parent 1968fefd02
commit 65759bd317

View file

@ -5097,3 +5097,53 @@ opus-5 : RG > E6 > ZF > Z0 fable-5: Z0 > ZF > E6 > RG ← ТОЧН
**Мощность:** при ЧЕТЫРЁХ армах Спирмен принимает всего пять значений (1, 0.4, 0.2, 0.8, 1.0),
поэтому и медиана +0.80, и минимум 1.00 — крупнозернистые. Доля смены семейства в пороге здесь
0.37 против 0.27 и 0.14 на больших панелях: чем короче шкала, тем дороже одно расхождение.
### Д34.5 ⭐ ДВА СЕМЕЙСТВА КАК ПРИБОРЫ: ЧТО ЗАМЕРЕНО И ЧЕГО ЗАМЕРИТЬ НЕ УДАЛОСЬ
Вопрос владельца 23.08 — практический: можно ли на больших объёмах ставить судьёй `opus-5` вместо
`fable-5`, он дешевле. Отвечаю тем, что замерено на трёх панелях.
**Что найдено — различий нет ни по одной измеренной оси:**
| ось | `vendor2` | `arch2` | `p0` | итог |
|---|---|---|---|---|
| армов, судимых различимо по-разному | 0 из 10 | 0 из 11 | 0 из 4 | **0 из 25** |
| медиана Спирмена между семействами | +0.84 | +0.89 | +0.80 | высокая |
| перевёрнутых вердиктов | 1 из 9 (`RK`) | 1 из 10 (`Z8`) | 0 из 3 | **2 из 22** |
| связок «=» в порядке | — | — | opus 0/16 · fable 0/16 | разрешение одинаково |
**Третейский судья — детерминированный счётчик.** На 8 главах панели-0, где счётчик развёл армы по
числу фаталов, считаю ρ между местом и числом фаталов (ρ>0 = семейство согласно со счётчиком):
```
opus-5 : медиана ρ +0.70 · среднее +0.45 · глав согласия 6 · глав ПРОТИВОРЕЧИЯ 2
fable-5: медиана ρ +0.52 · среднее +0.55 · глав согласия 8 · глав противоречия 0
парная разность opusfable: 0.10, знаковый p=0.6250 — НЕ РАЗЛИЧИМЫ
```
**Числа не различимы, но форма расхождения одинакова у двух независимых замеров.** `fable` не
противоречит счётчику НИ РАЗУ; `opus` противоречит на двух главах из восьми, зато когда согласен —
согласен сильнее. Ровно это же видно на главе `197f98eb61`, где семейства упорядочили армы точно
наоборот (Д34.4): `opus` наградил арм за прозу, простив непереведённое слово, `fable` наказал за
непереведённое слово. ⇒ **Гипотеза, НЕ вердикт: `opus` весит прозу выше брака, чем `fable`.**
⚠ И она держится ПРОТИВ форы: круг `opus` шёл с обёрткой, которая прямо называла две дефектные оси
(эррата Д32.13), то есть был подтолкнут к браку — и всё равно инвертировал дважды.
**Многословность:** медиана ответа `opus` 5 582 знака против 3 520 у `fable` — в 1.6 раза длиннее
при том же задании.
**⛔ ЧЕГО ЗАМЕРИТЬ НЕ УДАЛОСЬ, И ЭТО ГЛАВНОЕ ОГРАНИЧЕНИЕ ОТВЕТА.** Два перевёрнутых вердикта из 22
я **не могу отличить от обычного читательского шума**: внутрисемейного повтора нет ни у одной
панели, значит базовой линии «сколько вердиктов переворачивается при ТОМ ЖЕ семействе» не
существует. Для вопроса «сошлись ли приборы» это неважно — они сошлись. Для вопроса **«можно ли
подменить судью»** это ровно та величина, которая и нужна: подмена оправдана, если она стоит не
больше, чем повтор тем же прибором.
**И я сам отговорил от этого замера** (Д34.0), потому что оценивал его по нуждам ЭКСПЕРИМЕНТА —
там межсемейная граница вопрос закрывала. Для вопроса о ПОДМЕНЕ СУДЬИ на прод-объёмах он нужен, и
это разные вопросы. Цена: 16 сессий (повтор панели-0 тем же `fable`).
**Асимметрия риска, которую надо назвать до всякой экономии.** Если гипотеза верна и `opus`
действительно прощает брак за прозу, то на масштабе он будет систематически ЗАВЫШАТЬ гладкий текст
с дефектами — то есть ровно тот исход, против которого продукт и строится (класс А). Ошибка в эту
сторону дороже экономии на судье.