textmachine/eval/dovodka/blind-read/RESULT-BLIND-READ.md

11 KiB
Raw Permalink Blame History

Результат слепого чтения + эрраты к пре-регистрации

Замер исполнен 02.09. 99 судей Opus, 33 материала × 3 линзы, 0 ошибок агентов. Затем — адверсариальная атака шестью линиями (Opus) по своей же работе. Ниже итог ПОСЛЕ атаки: всё, что она сломала, помечено и исправлено в формулировках, а не спрятано.

1. Что устояло

Улика Число
Консенсус (2 из 3 линз) low 18 · off 6 · ничьих 6 из 30
Точная перестановка с переворотом метки на уровне ЮНИТА (2¹⁵ масок) p = 0.0332
Нулевые контроли (A и B — побайтная копия) 9/9 голосов «ничья», 9/9 опознали идентичность
Позиционный биас 35 : 44, p = 0.368 — направлен ПРОТИВ находки
Победитель длиннее 9/24, p = 0.31
Цитаты судей (688 штук) 662 только в своей руке, 0 в чужой
Ключ после судейства md5 сходится с замороженным — не переписан

Цена по факту request_log (не по смете): редактура p7-off $2.0000 против p7-low $0.6727 (×2.97); p9 — $1.5917 против $0.6559 (×2.43). Дороже, чем считала фаза.

Все четыре дефекта сборки смещают замер В ПОЛЬЗУ дорогой руки (см. §3): выбывшие юниты — ровно объединение провалов off; ретраи 11/30 против 2/30; санитайзерный ремонт только у off; потолок вывода душит только off. Значит перевес дешёвой руки скорее занижен.

2. Что рухнуло — и это надо говорить вслух

  1. «Консенсус трёх линз» — неправда. Консенсус совпадает с линзой художественности в 25 из 30 пар, с естественностью в 21, с точностью в 13. Художественность в одиночку даёт 19:8, p = 0.0522 — своего же порога не берёт. Естественность и точность согласны лишь в 6 парах из 22, где обе определились (каппа 0.32: согласие НИЖЕ случайного). Правило «2 из 3» здесь не усредняет три взгляда, а усиливает один.
  2. «По точности не хуже» — НЕ ИЗМЕРЕНО. См. эррату Э-1: в 10 юнитах из 15 линза точности не имела опоры на 2145% текста. Там, где черновик был полным, точность даёт low 6 : off 3; где усечён — 7 : 8. Обе выборки слишком малы.
  3. «Различаются ТОЛЬКО усилием» — ложно на уровне судимого артефакта (§3).
  4. Правило решения §5 не исполнено. Доля бралась из n=30 (60% < 70%), а p — из n=24 (0.0227). При последовательном n=24 срабатывает E-C, чья диспозиция — «до объяснения в бой не ставить». При буквальном n=30 не срабатывает ни одна ветка. Вывод: действующего пре-регистрированного p у замера нет, и «low можно в бой» из него не следует.

3. Эрраты к PREREG-BLIND-READ.md (ошибки автора, не правки под результат)

Э-1 · §3 — судьям показан УСЕЧЁННЫЙ черновик. Стадия edit склеивает несколько draft-чанков (35 draft-единиц против 20 edit-единиц), а сборщик вклеил только чанк 0. Проверено исполнением: показано 5579% текста в 10 юнитах из 15; худший случай гл.7 — 55%. Судьи это видели и штрафовали варианты за «сцену, которой в черновике нет» — фантомная отсебятина. ⇒ линза точности на трети текста работала без эталона.

Э-2 · §2 — «4 таймаута p7-off» неверно. Таймаутов в БД нет ни одного. Это decode_error — оплаченные ответы с нечитаемым телом, каждый ПОСЛЕ клетки, упёршейся в потолок 16000/length.

Э-3 · §7.1 — «ни латиницы: 0 на 60 клетках» неверно. Гард искал [A-Za-z]{2,} и пропускал одиночные буквы: их 2325 в КАЖДОЙ руке («категория B», «категория C»). Асимметрии нет (48 у off против 47 у low), слепота не пробита, но декларация была ложной.

Э-4 · §2 — «юниты с браком выпали по построению» неполно. Клетка гл.2 в обеих off-руках помечена sanitizer_stripped (вырезан 公然勒索 из русского текста) и всё равно ушла судьям — отремонтированной. Обе пары дали ничью, на счёт не влияет; но брак дорогой руки до судей не дошёл.

Э-5 · §4 — первичный тест математически невалиден. «Ничьи в знаменатель, не в числитель» плюс H₀=50% даёт под истинной нулевой ожидаемую долю (1t)/2, а не 50%. При наблюдённой доле ничьих 0.20 ошибка I рода — 17.8%, а не 5%.

Э-6 · §6 — вторичный исход не исполнен. Счётчик претензий кэпится: за 99 вердиктов ни одного значения вне {2,3,4}. Средние 3.82 против 3.69 — разность двух чисел, прижатых к потолку; сопоставление с планкой владельца ≤2 (D39.20) этим прибором невозможно.

Э-7 · механизм «low правит смелее» СНЯТ. Я озвучил близость к черновику 0.65 против 0.79. Знаковый тест по 30 парам: off ближе в 19, low в 11, p = 0.200. Свойством руки это не является; разброс порождён Э-1 (близость мерилась против усечённого эталона).

4. Чего замер не даёт (сверх §8 пре-рега)

  • Фактическое усилие дорогой руки нигде не записано. reasoning: "off" не эмитит параметр — едет вендор-дефолт, который DeepSeek двигал 31.07 и 30.08. reasoning_tokens = 0 во всех вызовах. Замер не воспроизводим в строгом смысле: сравнивали с движущейся мишенью.
  • Дорогая рука судилась задушенной: max_output_ratio: 2.2 одинаков у обеих, но мысль биллится внутри completion_tokens; 10 и 9 клеток из 20 упёрлись в потолок против 1 и 1 у low.
  • Нулевой контроль вырожден. Он доказал лишь, что судья узнаёт побайтную копию. Референсного распределения для 18:6 нет: неизвестно, какой перекос даёт ЧИСТЫЙ шум одной руки при temperature: 0.4.
  • Переносимость: 0.63% книги, банк холодный, 13 из 15 юнитов — начала глав. Сшивка через границу чанка и удержание глоссария — то, ради чего усилие покупают на длинной книге, — представлены двумя юнитами. Парное чтение изолированного куска слепо к дрейфу терминов и голосов по построениюа это цель №1 владельца.

5. Честная формулировка результата

На 15 юнитах из начала книги дешёвая рука в парном слепом чтении выигрывает заметно чаще (18 : 6, кластер-робастный p = 0.033). Направление устойчиво к позиции, длине и величине правки, а все найденные дефекты сборки играют против него. Но пре-регистрированный порог не взят ни в одном честном прочтении, «согласие трёх линз» отсутствует, равенство по точности не измерено, а дорогая рука ехала на вендор-дефолте под потолком вывода.

Это рабочая гипотеза, а не решение о переводе low в бой.

6. Следующая проверка (одна, дешёвая)

Пере-судейство тех же 30 пар на полном склеенном черновике (чинит Э-1 и возвращает опору линзе точности) плюс 10 «активных нулей» low₁ против low₂ — второй независимый прогон дешёвой руки при той же температуре. Если шум одной руки тоже даёт перекос вроде 7:2 — прибор негоден, и это надо знать до любых денег на объёме.

Цена: один дешёвый edit-прогон ≈ $0.67 по факту логов, правок Go не требует; панель +20%. Условие: пере-регистрация ДО чисел — один фиксированный знаменатель, одна первичная линза, заранее объявленный список публикуемых сравнений. Иначе воспроизведём ту же свободу, из которой взялась Э-5.