textmachine/eval/dovodka/KONSILIUM-30-08.md

31 KiB
Raw Blame History

КОНСИЛИУМ 30.08 — АРХИТЕКТУРА ГЕНЕРАЦИИ, МОДЕЛИ, УБОРКА

⚠⚠ ПОПРАВКИ ОТ 30.08 ПОСЛЕ ИСПОЛНЕНИЯ СТАДИИ 0 п.1 — ЧИТАТЬ ПРЕЖДЕ ТЕЛА. Разбор — Д50 и Д51 отчёта docs/experiments/23-editor-tier.md. Консилиум строился на неполной карте собственного архива, и четыре его положения этим затронуты:

  1. §5 п.1 назначал аудит acceptance. Объект выбран неверно: рядом лежит более боевой rerun (11.07, промты v1-reflow, редактор-билингв, 57/57 чанков), а также rerun2-dspro (23.07) — настоящий БОЕВОЙ профиль с редактором deepseek-v4-pro на 5 главах. «Боевого профиля нет без Шага 7» верно про ОБЪЁМ, не про наличие.
  2. Сам п.1 ИСПОЛНЕН, вывод: гипотеза «банк держит» в терминной половине НЕ ОПРОВЕРГНУТА — взвешенная доля промахов 0.231.29% при пороге 2%, эффективная консистентность 99.3100%. Прибор eval/dovodka/bank.py независимо воспроизвёл июльский замер, включая поимённое совпадение редчайшего класса. Работа уже делалась в июле; её скрипты погибли при переезде (были вне git) — ПЯТАЯ тихая поломка того же класса.
  3. §4 «вся наша фактура по дешёвым моделям АНГЛИЙСКАЯ» — неверно для ВЫБОРА РЕДАКТОРА. Три редактора отсужены на боевой китайской паре (rerun2/RERUN_REPORT.md, 56 игр на арм, шумовой пол замерен): dspro 0.679 > glm-5 0.589 >> mistral 0.232.
  4. §7 и §6 п.3 ставят вопрос не там. Открытый вопрос не «резать ли редактора», а «кто в нём живёт по нынешней цене» — и он адресован ФАЗЕ Д ратифицированной нотой D39.137 от 15.08 («вход ратификации жильцов при фазе Д»), не исполненной. Замер сделан (Д51): в пике deepseek-v4-pro дороже glm-5 в 1.62.1 раза, в офф-пик — от ×1.07 дороже до ×0.81 дешевле. ⚠ Это ХУЖЕ для dspro, чем оценка самой D39.137 (×1.59 дешевле в офф-пик), потому что та считала на чужих токенах, а dspro тратит вдвое больше своих. Боевой конфиг backend/configs/pipeline-c1.yaml:65 до сих пор обосновывает выбор словами «×2 дешевле glm» — устаревшее обоснование в живом файле; пинг бэкенду сдан в Д51.3.

Заказ владельца дословно: (1) насколько сложной делать архитектуру харнесса — качество без взлёта цены, с учётом банка памяти; что делает черновая модель; нет ли сдвигов в ландшафте; (2) на каких моделях выгодно ехать по цене/качеству; (3) нет ли ошибок в замерах и ошибок в выводах из правильных замеров — структурировать и выбросить лишнее; (4) план, возвращающий на рельсы.

Отдельным заказом: спросить архитектуру у fable-5 с чистого листа, затем подкармливать контекстом и заставлять отстаивать позицию. Исполнено: шесть раундов, из них раунды 26 — последовательные удары нашими числами. Архитектор дважды отозвал собственные позиции, один раз — уже вписанную мной в отчёт; скептик четырежды ломал мои правки, в том числе правки правок.


1. ЧТО УСТАНОВЛЕНО СЕГОДНЯ (всё — $0, из артефактов на диске)

# факт улика статус
1 Редактор — ремонтник ЛЁГКОГО КАСАНИЯ: меняет 4.05.8% знаков черновика, касаясь ~40% предложений побайтная дистанция 16 глав, autojunk=False замерено
2 Правки частично воспроизводимы: d(Z0,ZF) = 0.71 от суммы правок, ни одной главы выше 1, на трёх ниже 0.5 — там правки СХОДЯТСЯ те же 16 глав замерено
3 Два прогона редактора в 3.5× ближе друг к другу, чем к независимой генерации (6.5% против 22.9%, оба на n=16) калибровка Z0RN; ⚠ прежние 21.9%/3.4× считались с молчаливым выбросом главы 100b088f71 (клетка RN пуста при finish=stop) замерено
4 Редактор выдаёт главу целиком, но видимая глава — лишь 7% completion-токенов стадии; 93% это РАЗМЫШЛЕНИЕ (297 200 всего, 277 807 размышления на 32 клетках) клетки редактора замерено
5 Гейты насыщены нулём на боевых моделях: род 0/15, язык 0/15 у всех четырёх армов панели schet.py --report RN RL Z0 ZF замерено
6 «зелено по гейтам ⇒ приемлемо» МЕРТВО — вся различительная работа читателя идёт выше их потолка 5 + Д36.10 + Д20.2 замерено
7 Второй прибор тоже не различает luna: счётчик даёт p ≥ 0.25 по всем контрастам schet.py на панели luna1 замерено
8 Класс «банк» горит в 6 главах из 15 у боевой связки — канонная форма реже термина в исходнике ПРИ банке в промте там же замерено, требует чтения глазами
9 16 честных повторов deepseek-v4-pro на побайтно одном входе СУЩЕСТВУЮТ (пары e0/zf; prompt_tokens совпадают до токена на всех 16) клетки замерено ⇒ эррата к Д47.7
10 Настоящий шум размышления: 1 sd = ×2.8; наши ×38 = 2.5 sd — не исключительное событие. ⚠ Пары куплены в РАЗНЫЕ тарифные эпохи (июльский пин против пере-пина 16.08), но систематического сдвига нет: средний лог-сдвиг 16 пар ≈ 0.06 (×0.95). ⚠ «Побайтно один вход» доказан равенством СЧЁТЧИКОВ prompt_tokens 16/16, не сверкой байтов 9 замерено
11 Связи текстового расхождения близнецов с читательским разрывом НЕ ВИДНО (0.07…0.22 по кругам), ⚠ но при n=15 доверительный интервал ≈ [0.56; +0.44] — мощности нет, «не видно» ≠ «нет» 15 глав замерено слабо
12 Ранговые вердикты панелей о ПОРЯДКЕ силы не имеют: позиционный наклон 0.5 места воспроизводится в обоих кругах (раскладки те же), армы по позициям не уравнены позиционный пересчёт замерено
13 Движковый глоссарий несёт gender (вкл. hidden), спойлер-окна, склонения — они ЗАСЕЯНЫ СИДОМ и движок возит их в промты.source='seed' у 49/49 — сам движок их не пополнял; until_ch=0 у всех, окно раскрытия не проставлено база: 49 записей, 49/49 склонений, 14 полов замерено ⇒ эррата к Д38.3 и Д32.16
14 acceptance-прогон = 25 глав, 130 чекпоинтов (119 непустых), глоссарий 49 записей.НЕ боевой профиль: редактор glm-5 с погашенным размышлением (не deepseek-v4-pro), прогон 10.07.2026, июльские промты; first_person и speech0 из 49 pipeline-acceptance.yaml:35-41, база замерено
15 Таблица glossary_revisions в движке ЕСТЬ, ревизий во всех трёх прогонах — НОЛЬ там же замерено
16 Пик DeepSeek — только по будням 0104 и 0610 UTC ⇒ выходные целиком вдвое дешевле вендор-страница, живое чтение замерено
17 Отказов у дешёвой линии нет: luna 0 из 749, deepseek 0 из 1651; у gemini 12 — все в роли СУДЬИ корпус замерено
18 Цензур-ось НЕ МЕРЕНА у luna и glm-5 (у gemini мерена и против него); обе экспертизы назвали её главной дырой независимо открыто

2. ЧТО СНЯТО СЕГОДНЯ — МОИ ОШИБКИ И ИХ КЛАСС

снято чем было класс ошибки
«редактор — лотерея, разброс правки ×1040» артефакт SequenceMatcher(autojunk=True): на текстах >199 знаков «мусором» объявляется каждый символ чаще 1% — все частые буквы и пробел дефолт библиотеки принят за свойство мира
«расхождение выходов > каждой правки ⇒ пересэмплировщик» два РЕМОНТНИКА, правящих в разных местах, дают расхождение вплоть до СУММЫ правок логическая ошибка при верных числах
«однопроходка вдвое дешевле связки, $62 против $127» медиана ДВУГОРБОГО распределения; книга — сумма ⇒ ≈×1.3 статистика не по предмету
«запас гарда ~2×, проверено по коду» ожидание гарда — МАКСИМУМ прошлых цен ($0.131016), а не $0.0214 планировщика клейм «по коду» без исполнения кода
«×38 — событие 1 из 500» логнормальность опровергнута собственными данными украшение количественной формой
«сигнатура пересэмплировщика, а НЕ ремонтника» ранговая метрика не может опуститься ниже 1.0 при потолке 1.67 чтение шумового пола как механизма
«в корпусе нет чистых повторов одного промта» их шестнадцать не искали там, где лежит
«полей пола в банке нет» верно только про эвал-банк; движок поля имеет, и они засеяны сидом (⚠ сам движок их не пополнял: ревизий 0; голосовые колонки пусты) фаза не знала собственный бэкенд

Сквозной урок дня, и он дороже любой отдельной правки: из пяти моих исправлений скептик нашёл новые ошибки в трёх. Правка правки — не безопаснее правки. Проверять надо ВСЕ производные числа поправки, а не то, ради которого она делалась.

3. АРХИТЕКТУРА: ЧТО РЕШЕНО

# решение носитель статус
1 Единица — глава, один вызов конвейер сошлось независимо (наша практика + архитектор вслепую)
2 Черновик отвечает за всё НЕОБРАТИМОЕ (полнота · референты · канон · структура); стиль обратим и в контракт не входит промт + $0-гейты принято без замера
3 Гейты — страховка от катастроф, НЕ предиктор качества факт 56 замерено
4 «Точечно или сплошняком» — ложная развилка: наш редактор уже СПЛОШНОЙ ПО ОХВАТУ и ТОЧЕЧНЫЙ ПО ОБЪЁМУ факт 1 замерено
5 Двухпроходность — свойство пары «модель × роль × гранулярность», а не архитектуры Д42.4 + внешний замер замерено/принято
6 Дифф-интерфейс редактуры — модель отдаёт не текст, а список якорёванных замен с категорией; аппликатор детерминированный, потолок объёма не построено открыто, цена $23 на прототип
7 Пре-скан книги до перевода (слом храповика первой догадки) не построено открыто, цена $35
8 Не трогать: банк · гейты · кэш · роутинг · близнецовый контроль как практику принято
9 Латинский квадрат раскладок ПО ПОСТРОЕНИЮ в любые будущие панели риг обязательно, $0

Обоснование п.6 — ДВАЖДЫ ослабленное, и это надо читать прежде выгоды. (1) Довод «ампутировать каскад самообусловливания» снят вместе с «лотереей»: каскада нет, редактор трогает 46%. (2) Довод «выход дорогой стадии почти целиком — переписывание неизменного» тоже неверен: видимая глава — лишь 7% completion-токенов, 93% это размышление (факт 4). ⇒ дифф-интерфейс режет арифметически порядка $8 на книгу у pro-редактора, а не $100; у редактора с погашенным размышлением (glm-5) срез значим, потому что там видимый выход и есть почти весь completion. Сожмётся ли размышление от смены формата — ГИПОТЕЗА, её и проверяет прототип. Что остаётся бесспорным: байт-стабильность нетронутого (инкрементальная перевалидация гейтов), наблюдаемый и ограниченный потолком объём правки, и категория у каждой правки. Встроенный kill-switch: пересечение множеств тронутых спанов двух прогонов < 0.4 ⇒ провал.

4. МОДЕЛИ: ЧТО РЕШЕНО

⚠⚠ ВСЯ ЭТА ТАБЛИЦА ПРЕДВАРИТЕЛЬНА ДО СТАДИИ 0 п.3. Колонка «качество» построена на ранговых вердиктах панелей, а факт 12 этого же документа объявляет их не имеющими силы о ПОРЯДКЕ до уравнивания раскладок. Держится независимо от рангов только одно: «голый черновик различимо хуже» — подтверждено вторым, счётным прибором (schet.py --report ZD Z0: класс «банк» +16, p=0.0039). Про luna так сказать НЕЛЬЗЯ: счётчик её не РАЗЛИЧАЕТ (p ≥ 0.25, факт 7), а молчание прибора, чувствительность которого доказана только на грубом эффекте ZD, — не подтверждение эквивалентности. Оба прибора молчат ниже своего потолка; эквивалентность НЕ УСТАНОВЛЕНА и требует объявленного δ (§6 п.1). Всё прочее — открыто.

форма книга 1500 глав качество
голый дешёвый черновик ~$7 различимо хуже
однопроходка luna $7 неразличимо (оба прибора туповаты)
однопроходка glm-5 без думания $9 различимо хуже
черновик → редактор glm-5 ~$1720 неразличимо: 3 круга, 2 семейства, второй прибор
однопроходка pro ~$9099 неразличимо
боевая связка (черновик → редактор pro) $127 якорь
  • Крупнейший денежный рычаг — замена редактора на glm-5 (~×4.46), и упирается он не в деньги, а в неразрешённый конфликт приборов на zh (Д42.4).
  • Вся наша фактура по дешёвым моделям — АНГЛИЙСКАЯ. Боевая пара китайская.
  • Цензур-ось поимённо, потому что валить их в одну строку запрещено собственной Д41.4: у gemini она МЕРЕНА и против него (12 отказов PROHIBITED_CONTENT, все в роли судьи); у luna и glm-5не мерена ни разу. Кандидат в прод не идёт независимо от цены.
  • Скидочные режимы, не требующие ни одного решения: выходные целиком офф-пик (÷2), батч 50% универсален, кэш-чтение 90%. ⚠ Тарифная погода ≠ климат: несущую архитектуру на скидочное окно не ставят, котировка — датированной строкой в манифест.

5. ПЛАН

Стадия 0 — $0; исполнитель и оговорки названы по пунктам

Проверено ревью: три обещания заголовка держатся не все. «$0» — да, все пункты суть анализ артефактов на диске. «Ноль агент-сессий» — держится для пп. 1, 3, 4, 5; п. 2 (классификация правок) есть труд суждения и может стоить сессию (свободно 4 из 220). «Не требует решений владельца» — держится, ЕСЛИ не превращать скрипт п.1 в постоянный приёмочный гейт: гейт — зона бэкенда и лендинг оркестратора, то есть уже решение. Здесь он остаётся ПРЕДЛОЖЕНИЕМ.

  1. Аудит acceptance-прогона — держит ли банк 49 терминов через 25 глав; соблюдена ли дисциплина hidden до раскрытия; склонения против записанных форм. Прямой замер Вопроса 0. Порог: >2% взвешенно ИЛИ любая сущность топ-50 ⇒ гипотеза «банк держит» ложна в сильной форме. Он НЕ заменяет Шаг 7 целиком, вопреки первой редакции этого документа. Закрывает терминную половину Вопроса 0 — и на ИЮЛЬСКОМ профиле с редактором glm-5. Голосовая половина (пол/родство/голоса рассказчика) им не закрывается ПО ПОСТРОЕНИЮ: first_person и speech в глоссарии пусты (0 из 49), а Д32.16 прямо предупреждает, что без засева характер-листов замер даёт ложноотрицательный результат. Голосовая половина и текущий боевой профиль остаются Стадии 3 либо Шагу 7. Предложение (не пункт плана): сделать скрипт постоянным приёмочным гейтом — решение владельца.
  2. Разбор диффов редактора по категориям — что именно он чинит: канон, вёрстку или прозу. Если 80% массы правок механические, редактор заменяется детерминированным слоем + дешёвой моделью, и спор о ярусе закрыт бесплатно.
  3. Позиционный аудит ВСЕХ купленных панелей (~150 пакетов на диске) + латинский квадрат по построению в будущие. Без этого ни один вердикт по моделям невозможен.
  4. Эрраты — все три сделаны 30.08 (Д47.7, Д38.3, Д32.16). Остаётся грепом проверить, что сильная форма нигде не всплыла: «полей пола … НЕТ», «механизма не существовало».
  5. Базис Жаккара для kill-switch Стадии 1 — пересечение множеств тронутых спанов у нынешних Z0/ZF, из тех же артефактов. Без него порог 0.4 висит в воздухе.
  6. Уборка: пересчёт денег суммами на одном базисе; протяжка непротянутых чисел (греп «62 · вдвое · 6.3 · 7.1 · ×711»); таблица переноса «что из очереди Д38.6 не переехало».

Стадия 1 — единицы долларов. Ответ на «какие вызовы»

Прототип дифф-редактора на тех же 16 главах: тот же промт, выход — список замен. Меряем объём правки · пересечение множеств тронутых спанов двух прогонов · цену выхода И РАЗМЫШЛЕНИЯ. ⚠ Порог kill-switch (Жаккар < 0.4) назначен ДО того, как посчитан базис. Жаккар тронутых спанов у нынешних Z0/ZF считается за $0 из тех же артефактов и обязан войти в Стадию 0 — иначе порог висит в воздухе.

Стадия 2 — $0.20.6. Ответ на «на каких моделях»

Цензур-ось дешёвой линии на боевом жанре, с пре-регом: порог отказов, убивающий вендора, объявляется ДО пробы; wire-лог отделяет отказ от таймаута.

Стадия 3 — единицы долларов, на КИТАЙСКОЙ паре

Решётка на 25 главах acceptance: дорогая однопроходка · связка · дифф-ремонт. Рефери — бесплатный счётчик + статистика правок. Снимает главную оговорку фазы (вся фактура английская).

Чего в плане НЕТ намеренно

  • панели за $1015 с ранговым эндпойнтом — упираются в собственный ПОЛ прибора. Близнецы расходятся на 1.331.53 места при 6.5% различия текста (факт 3 + Д48.5). В этом полу есть ДОКАЗАННАЯ читательская компонента: позиционный наклон 0.5 места, воспроизводящийся в обоих кругах (факт 12), и повтор чтения одним семейством — 0.34 порога (Д37.3/Д38.5). Сколько в полу текста, а сколько читателя — НЕ РЕШЕНО, и подавать это решённым нельзя: факт 11 без мощности, а ратифицированный глосс самой Д37.3 гласит обратное — «треть разброса сам прибор, две трети — текст». ⇒ Панель с полом такой высоты купит очередное «неразличимо» независимо от того, из чего пол состоит — и это единственное, что нужно для решения. ⚠ Однозначно читательская из трёх опор только одна: наклон раскладки, он в тексте не живёт по построению;
  • ручка размышления — при шуме ×2.8 эффект ×1.4 неизмерим в наших бюджетах;
  • Шаг 7 в прежнем виде — ⚠ НЕ «заменён»: аудит acceptance закрывает лишь терминную половину Вопроса 0 на июльском профиле (§5 п.1). Шаг 7 остаётся носителем ГОЛОСОВОЙ половины и текущего боевого профиля — переносится, а не выбрасывается;
  • резать редактора решением сессии — $28 не стоят решения на приборе, объявленном молчащим; и дифф-интерфейс может сделать вопрос беспредметным, срезав цену стадии арифметикой.

6. НА ВЛАДЕЛЬЦЕ

  1. Запас эквивалентности δ. Вилка с ценником: 0.5 → n≈62 на плечо (доллары; якорь — сам позиционный артефакт равен 0.5) · 0.35 → n≈126 ($510) · 0.2 → n≈386 (только живые люди). ⚠ Выбрать 0.2 = выбрать, что доказательство эквивалентности дёшево не наступит никогда. Заземление: δ ≤ половины цены той порчи, которую владелец отверг бы, глядя в текст.
  2. Кап агент-сессий — свободно 4 из 220; читательская половина плана без него стоит.
  3. Судьба редакторской стадии — после стадий 0 и 1, не раньше.

7. ЧТО КОНСИЛИУМ НЕ ЗАКРЫЛ

  • Расхождение экспертов по редактору осталось. Архитектор: резать сейчас. Скептик: редактор ДОКАЗАННО сжимает брак (сильнейший контраст фазы), резать по нулю на прозе — сверхзаявка в обратную сторону. Не сведено намеренно — это решается стадией 0.2, а не голосованием.
  • H0, вынесенная архитектором отдельно: ось прозы, вокруг которой построен проект, может лежать ниже порога безразличия читателя. Наши нули — слабое свидетельство ЗА. Проверяется рынком, не харнессом; решение владельца.
  • Внешний ландшафт: zh→ru отсутствует во всей свежей литературе; масштаб 1500 глав никем публично не отработан с замером; независимых замеров коммерческих новелла-переводчиков нет.