diff --git a/docs/experiments/23-editor-tier.md b/docs/experiments/23-editor-tier.md index e7476dd8..9e61a821 100644 --- a/docs/experiments/23-editor-tier.md +++ b/docs/experiments/23-editor-tier.md @@ -1048,3 +1048,104 @@ p=0.0000); Claude поставил ровно ноль в 47 клетках из маргинальном режиме — на грубых обе семьи упираются в потолок. И если посадка узнаваема (у декоя пака 22 был почерк, судьи называли его метку), меряется узнаваемость, а не чувствительность. Поэтому axiscal — прибор ОГРАНИЧИВАЮЩИЙ, а не сертифицирующий. + +### Д0.13 ПРАВКИ ПРИЁМКИ ДРУГОГО СЕМЕЙСТВА (Fable-5, 11.08) — приняты ДО первого вердикта + +Владелец заказал независимый разбор дизайна судейства агентом вне семьи Claude, с прямым условием +не подсказывать ответ: агенту дали материал, код, замеры расхождения семейств и вопрос, но НЕ дали +ни Д0.12, ни роли Sol, ни правила расхождения. Ниже принятое. Правки легитимны ровно до первого +судейского ответа фазы Д — после него менять пороги и правила запрещено собственным законом проекта. + +**П-1. Правило расхождения переписано: адъюдикация вместо назначения виноватого.** Таблица Д0.12 +в двух клетках решала спор ЯРЛЫКОМ («Sol перешёл, Claude нет» = дефект прибора; «Claude перешёл, +Sol нет» = ожидаемо), а не уликой. Следствие, названное приёмкой: фаза ПО ПОСТРОЕНИЮ не могла бы +подтвердить эффект, который видит только Sol, — даже когда ручное чтение его цитат подтверждает +реальные инверсии, а в проходе `tier` случилось ровно это. Принято: + +| наблюдение | вердикт | +|---|---| +| оба семейства перешли СВОЙ порог в одну сторону | **CONFIRM** | +| перешёл ОДИН (любой) | **эскалация к адъюдикации** его находок: ≥80% выборки цитат верифицируются слепо как реальные И знаковый тест по одним верифицированным дельтам даёт p<0.05 → CONFIRM с пометкой «вынесен одним семейством, подтверждён адъюдикацией»; иначе НЕ ПОДТВЕРЖДЕНО | +| перешли в ПРОТИВОПОЛОЖНЫЕ стороны | вердикта об арме нет; адъюдикация обоих пулов на единицах максимального расхождения; печатается как находка об ИНСТРУМЕНТЕ | +| семейство не поймало декой ЛИБО не прошло маржевый контроль (П-2) | его пачка аннулируется | + +Основание: расхождение счётов между детекторами с разными точками отсечения есть ОЖИДАЕМОЕ +состояние, а не сигнал тревоги, поэтому правило, ключующееся на счётах, обречено кодировать +заранее назначенное недоверие. Единственная семейно-инвариантная валюта — находка (цитата + ось + +место), и риг уже требует цитату на каждую ненулевую ось, то есть сырьё для этого есть. +Адъюдикатор видит исходное предложение, предложение перевода и суть претензии, и НЕ видит ни метку +арма, ни автора находки. Пороги 80% и p<0.05 объявлены ЗДЕСЬ и потом не меняются. + +**П-2. ⛔ МАРЖЕВЫЙ ДЕКОЙ — чувствительность прибора размером с маржу.** Дыра, которой у фазы не +было вовсе. Вывод «не хуже» (Д0.4, маржа −1.50) требует доказанной способности прибора видеть +эффект размера маржи: нечувствительный прибор объявляет «не хуже» автоматически. Действующий декой +грубый (2–6 посадок, ловится 32/32) и о МАРГИНАЛЬНОМ режиме не говорит ничего — `axiscal.py` это +признаёт в собственной шапке. Заводится второй декой с ДВУМЯ тонкими посадками классов, реально +пропущенных в `tier`: правдоподобная, но неверная передача идиомы · смена адресата реплики · +потерянный разряд числа. **Семейство, чей замеренный перевес на маржевом декое не пересекает его +собственный порог, не имеет права выдавать «не хуже» при этой марже** — его вердикт по H-2а/H-2б +понижается до описательного. Посадки — ДАННЫЕ (вне репо, как ключи слепых меток), строятся один раз +до вскрытия слепоты; общность движка не задета. Без этого гейта наиболее вероятный итог фазы — +«A1 не хуже A0 и дешевле в разы» — неотличим от «прибор не видит, чем A1 хуже». + +**П-3. Изоляция нужна ОБОИМ семействам, и постфактум-аудит существует.** Д0.12 утверждала, что +детектора подглядывания нет и изоляция есть единственный контроль. Для внешнего харнесса это верно, +для агент-сессий — НЕТ, и это проверено исполнением: (а) оплаченная клетка несёт поле `arm` открытым +текстом рядом с `content`, поэтому судья с диском деанонимизирует слепую метку ОДНИМ грепом по +фрагменту варианта (проверено: греп по фрагменту выдал имя арма); (б) транскрипт агент-сессии +логирует вызовы инструментов, то есть аудит «куда лазил судья» возможен. Принято: задания ОБОИХ +семейств выдаются в изолированный рабочий каталог, где нет ничего кроме заданий; транскрипты +судейских сессий сохраняются обязательно; $0-греп-аудит на запрещённые пути (`blind-keys/`, `dv-*`) +гоняется после каждой пачки. Формула становится «изоляция ПЛЮС журнал». + +**П-4. Паритет обвязок семейств.** Единственный неустранимый конфаунд прохода `tier`: промт +харнесса Sol нёс правила плотности счёта («две одинаковые ошибки — это два», «4 задания за +сессию»), которых у Claude не было, — часть расхождения в разы могла быть куплена ИНСТРУКЦИЕЙ, а +не моделью. Норма: обвязки обоих семейств диффуются и архивируются ДО прогона по образцу +`promptdiff.py`, расхождения только объявленные. + +**П-5. Оси перевешены.** Несущая сумма судьи — **ВЕРНОСТЬ + ЯЗЫК**. **ТЕРМИН** уходит в +описательные: детерминированный канон-гейт по банку сильнее LLM-судьи на этой оси, а `axiscal` +показал, что посадок на ТЕРМИН нет вовсе, то есть чувствительность судей по ней даже не проверяема; +заодно исчезает двойной счёт между судейской и детерминированной осями. **ФОРМА** в несущую сумму +не входит: она наполовину механизируема $0-детекторами и однажды уже переворачивала знак вывода, +штрафуя ИСПОЛНЕНИЕ мандата перевёрстки. + +**П-6. Второй эндпойнт — слепое ранжирование ткани (описательный на этой фазе).** Счёт локальных +ошибок систематически смещён ровно в сторону вопроса владельца: фиксер трогает 0.2–3.7% знаков, а +остальные 96% остаются черновиком, поэтому серая-но-безошибочная проза получит «не хуже», а +читатель скажет «хуже». Победа над translationese — глобальное свойство ткани, дискретными ошибками +не представимое; плюс патчворк (десятки точечных правок в чужой ткани) может рвать связность, не +порождая ни одной счётной ошибки. Заводится второй проход: best-worst ранжирование армов ВНУТРИ +единицы по издательской пригодности. Ранги шкало-свободны, поэтому разница строгости семейств на +них не действует. Гонится ПОСЛЕ того, как счёты забанкованы, чтобы не заражать их. Свои контроли: +декой обязан ранжироваться последним, половины пола — соседями. **Решение владельца 11.08: берём.** + +**П-7. «Побеждает» — лексикографические гейты, а не композит.** Веса композита не защитить, поэтому +порядок: (1) канон — покрытие и единообразие на выходе не ниже A0 минус объявленный допуск (потеря +канона по слову владельца есть дефект безусловно, значит это ГЕЙТ, а не вес); (2) батарея — ноль +катастрофических флагов; (3) среди прошедших — судейский вердикт ВЕРНОСТЬ+ЯЗЫК по П-1 при +подтверждённой чувствительности П-2; (4) среди «не хуже» побеждает цена. +⚠ **Оговорка Гудхарта, обязательная к печати:** армы `A1`/`A1B` оптимизированы ровно против тех +детекторов, которыми их мерят, — фиксер ел их флаги. Поэтому для них детерминированная ось может +только ДИСКВАЛИФИЦИРОВАТЬ, короновать не имеет права; «меньше срабатываний флагов» как критерий +победы для арма, питавшегося флагами, циркулярен. + +**П-8. СПАН-ДЖОЙН — единственная форма, в которой обе оси говорят об одном.** У детерминированных +флагов есть МЕСТА, у судейских находок — ЦИТАТЫ. Пересечение спанов даёт число, прямо решающее спор +H-2а против H-2б: **доля верифицированных ошибок, лежащих ВНЕ покрытия детерминированных флагов**. +Близко к нулю — «флагами всё не отследишь» опровергнуто и флагового контура достаточно; велика — +нужен смысловой критик, и известно, насколько. Стоит $0: цитаты уже обязательны, места уже есть. + +**П-9. Исполняемость печатается рядом с судейским числом.** Контур раскладывается на множители: +`A1 = (флаги нашли) × (фиксер исполнил) × (исполнил верно)`. Первые два детерминированы, и уже +замерено, что канон-фиксер исполняет **46%** прямых указаний — это ПОТОЛОК арма, известный до +всякого судейства. Если судейская дельта не коррелирует с числом исполненных починок, меряется шум. + +**Что приёмка предложила, а фаза НЕ берёт, с основанием.** Перенос части сметы Д1 в мощность H-1: +предложен без знания раскладки — расширение базы A6 УЖЕ профинансировано внутри $6.00, а сверх него +деньги мощности H-1 не покупают, потому что ограничение здесь материал, а не бюджет. Отдельно +проверено: пул новых единиц среза равен 22, а взято 16, то есть ось расширяема до 37 единиц; но ++6 единиц ($0.91) покупают что-либо ТОЛЬКО если свой пол ляжет в узкое окно 1.91…2.08 — при поле +лучше они не нужны, при поле хуже не спасают. Решение отложено до замера пола, который уже куплен +и судится бесплатно. Это единственный пункт, где фаза сознательно не исполняет приёмку сразу.