From 65759bd317b6c3cc94538c0df9e68d5ea67ed93e Mon Sep 17 00:00:00 2001 From: heaven Date: Sun, 23 Aug 2026 03:12:23 +0300 Subject: [PATCH] Land what the two judging families measure against a deterministic third party, and say plainly which number is missing for the substitution question --- docs/experiments/23-editor-tier.md | 50 ++++++++++++++++++++++++++++++ 1 file changed, 50 insertions(+) diff --git a/docs/experiments/23-editor-tier.md b/docs/experiments/23-editor-tier.md index ef195bf3..c4b157d2 100644 --- a/docs/experiments/23-editor-tier.md +++ b/docs/experiments/23-editor-tier.md @@ -5097,3 +5097,53 @@ opus-5 : RG > E6 > ZF > Z0 fable-5: Z0 > ZF > E6 > RG ← ТОЧН ⚠ **Мощность:** при ЧЕТЫРЁХ армах Спирмен принимает всего пять значений (−1, −0.4, 0.2, 0.8, 1.0), поэтому и медиана +0.80, и минимум −1.00 — крупнозернистые. Доля смены семейства в пороге здесь 0.37 против 0.27 и 0.14 на больших панелях: чем короче шкала, тем дороже одно расхождение. + +### Д34.5 ⭐ ДВА СЕМЕЙСТВА КАК ПРИБОРЫ: ЧТО ЗАМЕРЕНО И ЧЕГО ЗАМЕРИТЬ НЕ УДАЛОСЬ + +Вопрос владельца 23.08 — практический: можно ли на больших объёмах ставить судьёй `opus-5` вместо +`fable-5`, он дешевле. Отвечаю тем, что замерено на трёх панелях. + +**Что найдено — различий нет ни по одной измеренной оси:** + +| ось | `vendor2` | `arch2` | `p0` | итог | +|---|---|---|---|---| +| армов, судимых различимо по-разному | 0 из 10 | 0 из 11 | 0 из 4 | **0 из 25** | +| медиана Спирмена между семействами | +0.84 | +0.89 | +0.80 | высокая | +| перевёрнутых вердиктов | 1 из 9 (`RK`) | 1 из 10 (`Z8`) | 0 из 3 | **2 из 22** | +| связок «=» в порядке | — | — | opus 0/16 · fable 0/16 | разрешение одинаково | + +**Третейский судья — детерминированный счётчик.** На 8 главах панели-0, где счётчик развёл армы по +числу фаталов, считаю ρ между местом и числом фаталов (ρ>0 = семейство согласно со счётчиком): + +``` +opus-5 : медиана ρ +0.70 · среднее +0.45 · глав согласия 6 · глав ПРОТИВОРЕЧИЯ 2 +fable-5: медиана ρ +0.52 · среднее +0.55 · глав согласия 8 · глав противоречия 0 +парная разность opus−fable: −0.10, знаковый p=0.6250 — НЕ РАЗЛИЧИМЫ +``` + +⚠ **Числа не различимы, но форма расхождения одинакова у двух независимых замеров.** `fable` не +противоречит счётчику НИ РАЗУ; `opus` противоречит на двух главах из восьми, зато когда согласен — +согласен сильнее. Ровно это же видно на главе `197f98eb61`, где семейства упорядочили армы точно +наоборот (Д34.4): `opus` наградил арм за прозу, простив непереведённое слово, `fable` наказал за +непереведённое слово. ⇒ **Гипотеза, НЕ вердикт: `opus` весит прозу выше брака, чем `fable`.** +⚠ И она держится ПРОТИВ форы: круг `opus` шёл с обёрткой, которая прямо называла две дефектные оси +(эррата Д32.13), то есть был подтолкнут к браку — и всё равно инвертировал дважды. + +**Многословность:** медиана ответа `opus` 5 582 знака против 3 520 у `fable` — в 1.6 раза длиннее +при том же задании. + +**⛔ ЧЕГО ЗАМЕРИТЬ НЕ УДАЛОСЬ, И ЭТО ГЛАВНОЕ ОГРАНИЧЕНИЕ ОТВЕТА.** Два перевёрнутых вердикта из 22 +я **не могу отличить от обычного читательского шума**: внутрисемейного повтора нет ни у одной +панели, значит базовой линии «сколько вердиктов переворачивается при ТОМ ЖЕ семействе» не +существует. Для вопроса «сошлись ли приборы» это неважно — они сошлись. Для вопроса **«можно ли +подменить судью»** это ровно та величина, которая и нужна: подмена оправдана, если она стоит не +больше, чем повтор тем же прибором. + +⚠ **И я сам отговорил от этого замера** (Д34.0), потому что оценивал его по нуждам ЭКСПЕРИМЕНТА — +там межсемейная граница вопрос закрывала. Для вопроса о ПОДМЕНЕ СУДЬИ на прод-объёмах он нужен, и +это разные вопросы. Цена: 16 сессий (повтор панели-0 тем же `fable`). + +**Асимметрия риска, которую надо назвать до всякой экономии.** Если гипотеза верна и `opus` +действительно прощает брак за прозу, то на масштабе он будет систематически ЗАВЫШАТЬ гладкий текст +с дефектами — то есть ровно тот исход, против которого продукт и строится (класс А). Ошибка в эту +сторону дороже экономии на судье.