textmachine/eval/dovodka/blind-read/PREREG-BLIND-READ.md

79 lines
7 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

# Пре-регистрация: слепое парное чтение — цена сниженного усилия редактора
**Заморожено 02.09 ДО первого суждения.** Правило решения, пороги и гарды записаны раньше чисел.
Материал: проба `prereg-4axes` (см. `docs/experiments/23-editor-tier.md` §Д54). Судьи — Opus.
## 1. Вопрос
Проба ответила на цену: снижение усилия режет размышление ×3.5 и боевую цену знака ×2.5.
Качество при этом **не судилось** — вне скоупа по построению (§12 промта пробы).
**Вопрос замера:** стал ли текст хуже, когда редактор думал вчетверо меньше?
⚠ Это вопрос о РЕДАКТУРЕ, не о переводе целиком: черновик у всех рук идентичен побайтно
(проверено, sha текста совпадает по 66 клеткам), различие вносит только стадия `edit`.
## 2. Материал
15 юнитов, у которых финальный текст (`chunk_status.final_hash`) непуст у ВСЕХ четырёх рук
deepseek. Юниты с браком выпали по построению: 4 таймаута `p7-off` + 1 пустой `p9-off`.
`glm-off` ИСКЛЮЧЁН: опознаётся по латинице (6 вхождений «cultivation»), слепота по нему
невозможна, и ценовым контролем он в качество не проектировался.
**30 боевых пар** = 15 юнитов × 2 промпта (p7, p9). В каждой паре — `off` против `low` на ОДНОМ
промпте, то есть чистая ось усилия. Плюс **3 нулевых контроля**, где A и B — один и тот же текст.
## 3. Что видит судья
Черновик (общий вход редактора) + два отредактированных варианта под метками A и B. Порядок
рандомизирован блочно: высокое усилие стоит на позиции A в 7 юнитах из 15 на каждом промпте.
Судья не знает ни рук, ни того, чем варианты различаются, ни что различие вообще существует.
Три независимых судьи на пару, разные линзы: **естественность русского** · **точность
относительно черновика** · **художественность и голос**. Консенсус — большинство 2 из 3.
## 4. Первичный исход и тест
**Исход:** доля из 30 пар, где консенсус судей предпочёл руку высокого усилия.
**Тест:** двусторонний биномиальный против H₀ = 50%. Ничьи в знаменатель входят, в числитель нет.
Кластеризация признана ограничением: p7 и p9 на одном юните делят черновик, 30 пар — не 30
независимых наблюдений. Поэтому вторичный анализ — по 15 юнитам (пара засчитывается юниту, если
оба промпта согласны).
## 5. Правило решения (записано до чисел)
| Исход | Что заключаем |
|---|---|
| **E-A** доля за `off` ≥ 70% И p < 0.05 | Экономия имеет цену качества. `low` в бой не ставить без доработки. |
| **E-B** доля за `off` в [40%; 70%] ИЛИ p 0.05 | **Различие не предъявлено** на этом n. `low` допустим к проверке на объёме но «не предъявлено» «доказано равенство». |
| **E-C** доля за `low` 70% И p < 0.05 | Сниженное усилие ЛУЧШЕ. Требует объяснения, до него в бой не ставить. |
| **E-D** нулевые контроли дали победителя в 2 из 3 | **ПРИБОР НЕГОДЕН.** Результат не читается, что бы ни показали боевые пары. |
**Мощность честно:** n=30 при трёх судьях различает сдвиг примерно от 25 процентных пунктов.
Разницу в 510 п.п. этот замер не увидит, и отрицательный результат её не исключает.
## 6. Вторичные исходы (не решают, но записываются)
- **Претензии на юнит** планка владельца из D39.20 (≤2 на главу). Считаем среднее по рукам.
- **Классы дефектов** что именно судьи называют; сырьё для будущих детерминированных гейтов.
- **Позиционный биас** доля побед позиции A независимо от руки. Отклонение от 50% на боевых
парах при чистых нулевых контролях = предупреждение, не отмена.
## 7. Гарды
1. **Гейт слепоты пройден до сборки:** ни латиницы, ни CJK, ни служебных меток 0 на 60 клетках.
2. **Ключ отложен** в `KEY-do-not-show-judges.json`; судьям уходит только `pairs-blind.json`.
3. **Нулевой контроль** ловит судью, который обязан выбрать победителя (см. E-D).
4. **Позиционный баланс** блочный, а не случайный рандомизация первой редакции дала 10/30.
5. Seed рандомизации `20260902` зафиксирован до сборки пакета.
## 8. Чего замер НЕ доказывает
- Не сравнивает `glm-5` с deepseek он исключён.
- Не судит ось промпта: и E3 пробы (p=0.487), и обе текстовые меры (p=1.000, p=0.107) говорят
«ниже разрешения». Пары внутри промпта, а не между ними.
- Не измеряет верность китайскому оригиналу: исходник в снапшоте не хранится, опорой служит
черновик. Искажение, унаследованное от черновика, обеими руками унаследовано одинаково.
- Не заменяет чтение владельцем. Судья-модель прибор, а планка «≤2 претензии» его.