11 KiB
Результат слепого чтения + эрраты к пре-регистрации
Замер исполнен 02.09. 99 судей Opus, 33 материала × 3 линзы, 0 ошибок агентов. Затем — адверсариальная атака шестью линиями (Opus) по своей же работе. Ниже итог ПОСЛЕ атаки: всё, что она сломала, помечено и исправлено в формулировках, а не спрятано.
1. Что устояло
| Улика | Число |
|---|---|
| Консенсус (2 из 3 линз) | low 18 · off 6 · ничьих 6 из 30 |
| Точная перестановка с переворотом метки на уровне ЮНИТА (2¹⁵ масок) | p = 0.0332 |
| Нулевые контроли (A и B — побайтная копия) | 9/9 голосов «ничья», 9/9 опознали идентичность |
| Позиционный биас | 35 : 44, p = 0.368 — направлен ПРОТИВ находки |
| Победитель длиннее | 9/24, p = 0.31 |
| Цитаты судей (688 штук) | 662 только в своей руке, 0 в чужой |
| Ключ после судейства | md5 сходится с замороженным — не переписан |
Цена по факту request_log (не по смете): редактура p7-off $2.0000 против p7-low $0.6727
(×2.97); p9 — $1.5917 против $0.6559 (×2.43). Дороже, чем считала фаза.
Все четыре дефекта сборки смещают замер В ПОЛЬЗУ дорогой руки (см. §3): выбывшие юниты —
ровно объединение провалов off; ретраи 11/30 против 2/30; санитайзерный ремонт только у off;
потолок вывода душит только off. Значит перевес дешёвой руки скорее занижен.
2. Что рухнуло — и это надо говорить вслух
- «Консенсус трёх линз» — неправда. Консенсус совпадает с линзой художественности в 25 из 30 пар, с естественностью в 21, с точностью в 13. Художественность в одиночку даёт 19:8, p = 0.0522 — своего же порога не берёт. Естественность и точность согласны лишь в 6 парах из 22, где обе определились (каппа −0.32: согласие НИЖЕ случайного). Правило «2 из 3» здесь не усредняет три взгляда, а усиливает один.
- «По точности не хуже» — НЕ ИЗМЕРЕНО. См. эррату Э-1: в 10 юнитах из 15 линза точности не имела опоры на 21–45% текста. Там, где черновик был полным, точность даёт low 6 : off 3; где усечён — 7 : 8. Обе выборки слишком малы.
- «Различаются ТОЛЬКО усилием» — ложно на уровне судимого артефакта (§3).
- Правило решения §5 не исполнено. Доля бралась из n=30 (60% < 70%), а p — из n=24 (0.0227). При последовательном n=24 срабатывает E-C, чья диспозиция — «до объяснения в бой не ставить». При буквальном n=30 не срабатывает ни одна ветка. Вывод: действующего пре-регистрированного p у замера нет, и «low можно в бой» из него не следует.
3. Эрраты к PREREG-BLIND-READ.md (ошибки автора, не правки под результат)
Э-1 · §3 — судьям показан УСЕЧЁННЫЙ черновик. Стадия edit склеивает несколько draft-чанков
(35 draft-единиц против 20 edit-единиц), а сборщик вклеил только чанк 0. Проверено исполнением:
показано 55–79% текста в 10 юнитах из 15; худший случай гл.7 — 55%. Судьи это видели и
штрафовали варианты за «сцену, которой в черновике нет» — фантомная отсебятина.
⇒ линза точности на трети текста работала без эталона.
Э-2 · §2 — «4 таймаута p7-off» неверно. Таймаутов в БД нет ни одного. Это decode_error —
оплаченные ответы с нечитаемым телом, каждый ПОСЛЕ клетки, упёршейся в потолок 16000/length.
Э-3 · §7.1 — «ни латиницы: 0 на 60 клетках» неверно. Гард искал [A-Za-z]{2,} и пропускал
одиночные буквы: их 23–25 в КАЖДОЙ руке («категория B», «категория C»). Асимметрии нет (48 у off
против 47 у low), слепота не пробита, но декларация была ложной.
Э-4 · §2 — «юниты с браком выпали по построению» неполно. Клетка гл.2 в обеих off-руках
помечена sanitizer_stripped (вырезан 公然勒索 из русского текста) и всё равно ушла судьям —
отремонтированной. Обе пары дали ничью, на счёт не влияет; но брак дорогой руки до судей не дошёл.
Э-5 · §4 — первичный тест математически невалиден. «Ничьи в знаменатель, не в числитель» плюс H₀=50% даёт под истинной нулевой ожидаемую долю (1−t)/2, а не 50%. При наблюдённой доле ничьих 0.20 ошибка I рода — 17.8%, а не 5%.
Э-6 · §6 — вторичный исход не исполнен. Счётчик претензий кэпится: за 99 вердиктов ни одного значения вне {2,3,4}. Средние 3.82 против 3.69 — разность двух чисел, прижатых к потолку; сопоставление с планкой владельца ≤2 (D39.20) этим прибором невозможно.
Э-7 · механизм «low правит смелее» СНЯТ. Я озвучил близость к черновику 0.65 против 0.79.
Знаковый тест по 30 парам: off ближе в 19, low в 11, p = 0.200. Свойством руки это не
является; разброс порождён Э-1 (близость мерилась против усечённого эталона).
4. Чего замер не даёт (сверх §8 пре-рега)
- Фактическое усилие дорогой руки нигде не записано.
reasoning: "off"не эмитит параметр — едет вендор-дефолт, который DeepSeek двигал 31.07 и 30.08.reasoning_tokens= 0 во всех вызовах. Замер не воспроизводим в строгом смысле: сравнивали с движущейся мишенью. - Дорогая рука судилась задушенной:
max_output_ratio: 2.2одинаков у обеих, но мысль биллится внутриcompletion_tokens; 10 и 9 клеток из 20 упёрлись в потолок против 1 и 1 уlow. - Нулевой контроль вырожден. Он доказал лишь, что судья узнаёт побайтную копию. Референсного
распределения для 18:6 нет: неизвестно, какой перекос даёт ЧИСТЫЙ шум одной руки при
temperature: 0.4. - Переносимость: 0.63% книги, банк холодный, 13 из 15 юнитов — начала глав. Сшивка через границу чанка и удержание глоссария — то, ради чего усилие покупают на длинной книге, — представлены двумя юнитами. Парное чтение изолированного куска слепо к дрейфу терминов и голосов по построению — а это цель №1 владельца.
5. Честная формулировка результата
На 15 юнитах из начала книги дешёвая рука в парном слепом чтении выигрывает заметно чаще (18 : 6, кластер-робастный p = 0.033). Направление устойчиво к позиции, длине и величине правки, а все найденные дефекты сборки играют против него. Но пре-регистрированный порог не взят ни в одном честном прочтении, «согласие трёх линз» отсутствует, равенство по точности не измерено, а дорогая рука ехала на вендор-дефолте под потолком вывода.
Это рабочая гипотеза, а не решение о переводе
lowв бой.
6. Следующая проверка (одна, дешёвая)
Пере-судейство тех же 30 пар на полном склеенном черновике (чинит Э-1 и возвращает опору линзе точности) плюс 10 «активных нулей» low₁ против low₂ — второй независимый прогон дешёвой руки при той же температуре. Если шум одной руки тоже даёт перекос вроде 7:2 — прибор негоден, и это надо знать до любых денег на объёме.
Цена: один дешёвый edit-прогон ≈ $0.67 по факту логов, правок Go не требует; панель +20%.
Условие: пере-регистрация ДО чисел — один фиксированный знаменатель, одна первичная линза,
заранее объявленный список публикуемых сравнений. Иначе воспроизведём ту же свободу, из которой
взялась Э-5.