Adopt the other-family acceptance amendments before any verdict: adjudication replaces the blame-assigning disagreement table, margin decoy gates non-inferiority, both judge families isolated and audited

This commit is contained in:
heaven 2026-08-11 11:11:52 +03:00
parent 415f54f098
commit 6771a27e2a

View file

@ -1048,3 +1048,104 @@ p=0.0000); Claude поставил ровно ноль в 47 клетках из
маргинальном режиме — на грубых обе семьи упираются в потолок. И если посадка узнаваема (у декоя
пака 22 был почерк, судьи называли его метку), меряется узнаваемость, а не чувствительность.
Поэтому axiscal — прибор ОГРАНИЧИВАЮЩИЙ, а не сертифицирующий.
### Д0.13 ПРАВКИ ПРИЁМКИ ДРУГОГО СЕМЕЙСТВА (Fable-5, 11.08) — приняты ДО первого вердикта
Владелец заказал независимый разбор дизайна судейства агентом вне семьи Claude, с прямым условием
не подсказывать ответ: агенту дали материал, код, замеры расхождения семейств и вопрос, но НЕ дали
ни Д0.12, ни роли Sol, ни правила расхождения. Ниже принятое. Правки легитимны ровно до первого
судейского ответа фазы Д — после него менять пороги и правила запрещено собственным законом проекта.
**П-1. Правило расхождения переписано: адъюдикация вместо назначения виноватого.** Таблица Д0.12
в двух клетках решала спор ЯРЛЫКОМ («Sol перешёл, Claude нет» = дефект прибора; «Claude перешёл,
Sol нет» = ожидаемо), а не уликой. Следствие, названное приёмкой: фаза ПО ПОСТРОЕНИЮ не могла бы
подтвердить эффект, который видит только Sol, — даже когда ручное чтение его цитат подтверждает
реальные инверсии, а в проходе `tier` случилось ровно это. Принято:
| наблюдение | вердикт |
|---|---|
| оба семейства перешли СВОЙ порог в одну сторону | **CONFIRM** |
| перешёл ОДИН (любой) | **эскалация к адъюдикации** его находок: ≥80% выборки цитат верифицируются слепо как реальные И знаковый тест по одним верифицированным дельтам даёт p<0.05 CONFIRM с пометкой «вынесен одним семейством, подтверждён адъюдикацией»; иначе НЕ ПОДТВЕРЖДЕНО |
| перешли в ПРОТИВОПОЛОЖНЫЕ стороны | вердикта об арме нет; адъюдикация обоих пулов на единицах максимального расхождения; печатается как находка об ИНСТРУМЕНТЕ |
| семейство не поймало декой ЛИБО не прошло маржевый контроль (П-2) | его пачка аннулируется |
Основание: расхождение счётов между детекторами с разными точками отсечения есть ОЖИДАЕМОЕ
состояние, а не сигнал тревоги, поэтому правило, ключующееся на счётах, обречено кодировать
заранее назначенное недоверие. Единственная семейно-инвариантная валюта — находка (цитата + ось +
место), и риг уже требует цитату на каждую ненулевую ось, то есть сырьё для этого есть.
Адъюдикатор видит исходное предложение, предложение перевода и суть претензии, и НЕ видит ни метку
арма, ни автора находки. Пороги 80% и p<0.05 объявлены ЗДЕСЬ и потом не меняются.
**П-2. ⛔ МАРЖЕВЫЙ ДЕКОЙ — чувствительность прибора размером с маржу.** Дыра, которой у фазы не
было вовсе. Вывод «не хуже» (Д0.4, маржа 1.50) требует доказанной способности прибора видеть
эффект размера маржи: нечувствительный прибор объявляет «не хуже» автоматически. Действующий декой
грубый (26 посадок, ловится 32/32) и о МАРГИНАЛЬНОМ режиме не говорит ничего — `axiscal.py` это
признаёт в собственной шапке. Заводится второй декой с ДВУМЯ тонкими посадками классов, реально
пропущенных в `tier`: правдоподобная, но неверная передача идиомы · смена адресата реплики ·
потерянный разряд числа. **Семейство, чей замеренный перевес на маржевом декое не пересекает его
собственный порог, не имеет права выдавать «не хуже» при этой марже** — его вердикт по H-2а/H-2б
понижается до описательного. Посадки — ДАННЫЕ (вне репо, как ключи слепых меток), строятся один раз
до вскрытия слепоты; общность движка не задета. Без этого гейта наиболее вероятный итог фазы —
«A1 не хуже A0 и дешевле в разы» — неотличим от «прибор не видит, чем A1 хуже».
**П-3. Изоляция нужна ОБОИМ семействам, и постфактум-аудит существует.** Д0.12 утверждала, что
детектора подглядывания нет и изоляция есть единственный контроль. Для внешнего харнесса это верно,
для агент-сессий — НЕТ, и это проверено исполнением: (а) оплаченная клетка несёт поле `arm` открытым
текстом рядом с `content`, поэтому судья с диском деанонимизирует слепую метку ОДНИМ грепом по
фрагменту варианта (проверено: греп по фрагменту выдал имя арма); (б) транскрипт агент-сессии
логирует вызовы инструментов, то есть аудит «куда лазил судья» возможен. Принято: задания ОБОИХ
семейств выдаются в изолированный рабочий каталог, где нет ничего кроме заданий; транскрипты
судейских сессий сохраняются обязательно; $0-греп-аудит на запрещённые пути (`blind-keys/`, `dv-*`)
гоняется после каждой пачки. Формула становится «изоляция ПЛЮС журнал».
**П-4. Паритет обвязок семейств.** Единственный неустранимый конфаунд прохода `tier`: промт
харнесса Sol нёс правила плотности счёта («две одинаковые ошибки — это два», «4 задания за
сессию»), которых у Claude не было, — часть расхождения в разы могла быть куплена ИНСТРУКЦИЕЙ, а
не моделью. Норма: обвязки обоих семейств диффуются и архивируются ДО прогона по образцу
`promptdiff.py`, расхождения только объявленные.
**П-5. Оси перевешены.** Несущая сумма судьи — **ВЕРНОСТЬ + ЯЗЫК**. **ТЕРМИН** уходит в
описательные: детерминированный канон-гейт по банку сильнее LLM-судьи на этой оси, а `axiscal`
показал, что посадок на ТЕРМИН нет вовсе, то есть чувствительность судей по ней даже не проверяема;
заодно исчезает двойной счёт между судейской и детерминированной осями. **ФОРМА** в несущую сумму
не входит: она наполовину механизируема $0-детекторами и однажды уже переворачивала знак вывода,
штрафуя ИСПОЛНЕНИЕ мандата перевёрстки.
**П-6. Второй эндпойнт — слепое ранжирование ткани (описательный на этой фазе).** Счёт локальных
ошибок систематически смещён ровно в сторону вопроса владельца: фиксер трогает 0.23.7% знаков, а
остальные 96% остаются черновиком, поэтому серая-но-безошибочная проза получит «не хуже», а
читатель скажет «хуже». Победа над translationese — глобальное свойство ткани, дискретными ошибками
не представимое; плюс патчворк (десятки точечных правок в чужой ткани) может рвать связность, не
порождая ни одной счётной ошибки. Заводится второй проход: best-worst ранжирование армов ВНУТРИ
единицы по издательской пригодности. Ранги шкало-свободны, поэтому разница строгости семейств на
них не действует. Гонится ПОСЛЕ того, как счёты забанкованы, чтобы не заражать их. Свои контроли:
декой обязан ранжироваться последним, половины пола — соседями. **Решение владельца 11.08: берём.**
**П-7. «Побеждает» — лексикографические гейты, а не композит.** Веса композита не защитить, поэтому
порядок: (1) канон — покрытие и единообразие на выходе не ниже A0 минус объявленный допуск (потеря
канона по слову владельца есть дефект безусловно, значит это ГЕЙТ, а не вес); (2) батарея — ноль
катастрофических флагов; (3) среди прошедших — судейский вердикт ВЕРНОСТЬ+ЯЗЫК по П-1 при
подтверждённой чувствительности П-2; (4) среди «не хуже» побеждает цена.
**Оговорка Гудхарта, обязательная к печати:** армы `A1`/`A1B` оптимизированы ровно против тех
детекторов, которыми их мерят, — фиксер ел их флаги. Поэтому для них детерминированная ось может
только ДИСКВАЛИФИЦИРОВАТЬ, короновать не имеет права; «меньше срабатываний флагов» как критерий
победы для арма, питавшегося флагами, циркулярен.
**П-8. СПАН-ДЖОЙН — единственная форма, в которой обе оси говорят об одном.** У детерминированных
флагов есть МЕСТА, у судейских находок — ЦИТАТЫ. Пересечение спанов даёт число, прямо решающее спор
H-2а против H-2б: **доля верифицированных ошибок, лежащих ВНЕ покрытия детерминированных флагов**.
Близко к нулю — «флагами всё не отследишь» опровергнуто и флагового контура достаточно; велика —
нужен смысловой критик, и известно, насколько. Стоит $0: цитаты уже обязательны, места уже есть.
**П-9. Исполняемость печатается рядом с судейским числом.** Контур раскладывается на множители:
`A1 = (флаги нашли) × (фиксер исполнил) × (исполнил верно)`. Первые два детерминированы, и уже
замерено, что канон-фиксер исполняет **46%** прямых указаний — это ПОТОЛОК арма, известный до
всякого судейства. Если судейская дельта не коррелирует с числом исполненных починок, меряется шум.
**Что приёмка предложила, а фаза НЕ берёт, с основанием.** Перенос части сметы Д1 в мощность H-1:
предложен без знания раскладки — расширение базы A6 УЖЕ профинансировано внутри $6.00, а сверх него
деньги мощности H-1 не покупают, потому что ограничение здесь материал, а не бюджет. Отдельно
проверено: пул новых единиц среза равен 22, а взято 16, то есть ось расширяема до 37 единиц; но
+6 единиц ($0.91) покупают что-либо ТОЛЬКО если свой пол ляжет в узкое окно 1.91…2.08 — при поле
лучше они не нужны, при поле хуже не спасают. Решение отложено до замера пола, который уже куплен
и судится бесплатно. Это единственный пункт, где фаза сознательно не исполняет приёмку сразу.