textmachine/eval/dovodka/PLAN-17-08.md

40 KiB
Raw Permalink Blame History

⚠⚠ СОСТОЯНИЕ НА 20.08 — читать ЭТО прежде плана ниже. Курс за день сдвинулся сильнее, чем написано в теле; тело оставлено как есть, потому что в нём основания решений.

1. СМЕНИЛСЯ ПРИБОР. Решение владельца: первичный — слепое чтение Fable-5, счёт ошибок — брак-скрин. Замерено: чтение согласно с владельцем +0.80 на ОБЕИХ парах, счёт +0.80 на китайской и 0.80 на английской. ⇒ все прежние вердикты об архитектурах вынесены прибором, который на английской паре смотрит в обратную сторону, и подлежат пере-суду. 16 пакетов на это уже собраны и проверены (см. HANDOFF-21-08.md). 2. ШАГ 1 (Г5) ЗАКРЫТ, вердикт по H-1 устоял — секция отчёта Д21. 3. ШАГ 2 (подача входа критику) ОСТАНОВЛЕН владельцем после того, как замер показал: критик не видит удалённого абзаца ВООБЩЕ, поэтому «сохранил ли он бдительность» мерить не на чем. 4. Г1в/Г1 частично отвечены: фраза о параллельности срезает размышление на 55% и находки на 50%; «след в след» — неправда на ОБЕИХ парах (проверено позиционно), врать модели нельзя. 5. Г12 усилена до механизма: трейс показал, что 96% финального текста модель пишет ВНУТРИ размышления. Размышление у dspro — черновик, а не проверка. ⇒ двухстадийная связка дёшева БЛАГОДАРЯ топологии: она выносит черновик из дорогого канала размышления в дешёвый выход. 6. Появилась новая живая ветка, которой в плане нет: промт однопроходки как РОЛЬ. Лучшая редакция — формулировка ВЛАДЕЛЬЦА («брак = просвечивающий исходный язык»), она обошла обе мои и встала выше продакшена в слепом чтении, но при КРАСНОМ контроле шума и вчетверо дороже. 7. Г5-строка ниже была НЕВЕРНА ПО ЗНАКУ — исправлено в теле.

ПЛАН НОВОГО КУРСА — проверка живых гипотез (17.08)

Пишется после закрытия захода Д17 и архитектурного разговора с владельцем про V6. Предыдущие слои: PLAN-16-08.md (прошлый курс, ВЫПОЛНЕН) · SESSION2-LOG.md §12§14 · отчёт docs/experiments/23-editor-tier.md секции Д17Д20 · заказ docs/POLYGON_EXP2223_REDO_SESSION_PROMPT.md · хендофф docs/POLYGON_PHASE_D_HANDOFF.md. Читать ЦЕЛИКОМ: прошлая передача теряла пункты именно из-за чтения грепом.


0. ГДЕ МЫ ОКАЗАЛИСЬ

Заход Д17 ответил на вопрос, ради которого затевался, и ответ сместил всю рамку.

  1. Второй проход нужен — голый черновик проигрывает всему и всегда, по всем приборам и трём парам. Единственное, что не пошатнулось за пять экспериментов.
  2. Какой именно второй проход — приборы не различают. Все схемы переписывания легли в неразличимую кучу под починенной рубрикой.
  3. Причина названа и подтверждена трижды независимо: собственный разброс ОДНОГО способа от прогона к прогону перекрывает разницу МЕЖДУ способами. Счёт на zh (sd 4.42 между двумя генерациями связки), машинные читатели на zh, владелец на en (опознал пару близнецов по тексту и развёл на два места: «один прогон приличный, второй сырой»).
  4. Счётчик — браковщик, а не выборщик. Он следит за читаемостью там, где у него есть диапазон (широкая шкала +0.68), и слепнет на чистом тексте (узкая +0.42). Формулировка владельца: «счётчиком отсеивать брак, чтением выбирать текст в книгу».
  5. Деньги конвейера — это размышление, и тратится оно на выравнивание двух текстов. 85% цены дорогой клетки. Перепис думает ×12 против однопроходки только потому, что ему дают черновик.

Курс меняется: раньше мы искали «лучшую архитектуру», теперь ищем условия, при которых архитектуры вообще становятся различимы, и чинить конвейер там, где он жжёт деньги впустую.


1. ЖИВЫЕ ГИПОТЕЗЫ — реестр

Каждая проверяема, у каждой назван замер и цена. Порядок в §2, не здесь.

# гипотеза откуда цена
Г1 Выровненный вход схлопывает размышление сличающей стадии ОДНО наблюдение: критик видел черновик 78 абзацев против 77 строк исходника (0.96:1) и думал 1084; en 8 против 1 — думал 9576 ~$0.3
Г1а После РЕДАКТОРА выравнивание исчезает (77 строк → 43 абзаца), значит критик V6 попадёт в дорогой режим даже на zh замер 17.08 считано: V6 на Гу ~$340 против $226 у связки
Г1в Достаточно СКАЗАТЬ критику, что тексты идут параллельно — размышление упадёт без всякой разметки идея владельца 17.08; нынешний промт критика не говорит о связи текстов НИЧЕГО, кроме «исходник и его перевод» ~$0.15
Г1б Разметку можно поручить ОТДЕЛЬНОМУ дешёвому вызову-экстрактору, не трогая переводчика квирки :51 — эхо бьёт по переводу, не по JSON-выводу ~$0.2
Г1г Локальное эмбеддинговое выравнивание (LaBSE/vecalign/BERTalign) даёт таблицу пар с приемлемой точностью на ХУДОЖЕСТВЕННОЙ прозе идея владельца; модели уже в кэше машины $0 за прогон, только CPU-время
Г2 «Мало думает» = «плохо работает»: ленивый критик находит хуже zh критик 1084 токена, 43 находки на 2 тыс. знаков, контур проиграл в комплекте с Г1
Г3 Языковому критику исходник НЕ нужен — монолингвальная критика не хуже ось ЯЗЫК решает, а она видна без оригинала ~$0.4
Г4 Кэш префикса срезает вход многостадийного конвейера используем 44.8% из возможного $0, перекладка запросов
Г5 вердикт по H-1 зависит от состава пачек ЗАКРЫТА 20.08, Д21: вердикт устоял ⚠ и формулировка была НЕВЕРНА ПО ЗНАКУ — «переходит порог» значило бы «дорогой черновик ХУЖЕ связки», то есть H-1 опровергается, а не подтверждается находка ревизии №1 $0, потрачено
Г6 Счётчик работает при широком диапазоне, слепнет на чистом разбиение +0.68 против +0.42, но post-hoc ~$1.5 (трудный en материал)
Г7 Дорогая модель + ПОЛНЫЙ промт → точечная зачистка ≥ связки пустая клетка; A6 был дорогой моделью с ТОЩИМ промтом ~$1.2
Г8 Промт однопроходки, собранный как РОЛЬ, а не склейка, лучше нынешнего нынешний несёт мета-фразу «редактора после тебя не будет» ~$0.5
Г9 Банк, собранный из хороших переводов, лучше банка из дешёвых черновиков никогда не мерилось; майнер режет исходник, черновики дают лишь drafts: ~$0.3
Г10 Разделение типов сущностей (имена / титулы / предметы) улучшает банк терминолог даёт одно правило на всех ~$0.3
Г11 Сцена как единица нарезки лучше чанка эксп-15: все эффекты когезии под порогом, сигнала нет не считана
Г12 Несколько прогонов на метод — УСЛОВИЕ любого сравнения архитектур п.3 §0 ×2 к любому замеру

1а. ЧТО УЖЕ ЗАКРЫТО — НЕ ПЕРЕОТКРЫВАТЬ БЕЗ НОВОГО ОСНОВАНИЯ

Дописано при перечитывании: без этого списка следующая сессия честно потратит деньги на то, что уже куплено и отвечено.

закрыто чем вердикт
«критик → ПОЛНЫЙ перепис» (K1/Z1) Д17, обе пары 0.06 по счёту, у владельца 3-е и 4-е места. ОТРИЦАТЕЛЬНО
«обогащённый промт черновика» (K8/Z8) Д17, обе пары хуже голого на en, эхо-мина на zh. ОТРИЦАТЕЛЬНО
«дешёвая модель в роли редактора» эксп-22 Ф3 2.54 против боевого + 3 клетки сожгли бюджет. ОТРИЦАТЕЛЬНО
«дорогая модель черновиком» эксп-22 Ф2 ничья, побеждает дешёвый. ЗАКРЫТО
«какая модель лучше редактор» 5 моделей zh, 2-я на en/ja, 3 «сильных тира» dspro первый везде. ЗАКРЫТО устойчиво
«gemini — аутлаер прозы» (эксп-04) Д1, 15 клеток не подтверждается, цена ×30. ЗАКРЫТО
H-4 «перевес dspro — свойство китайской пары» zh/en/ja не подтверждается на всех трёх. ЗАКРЫТО
роутинг «платить дорого адресно» эксп-21 отборщики-монетки. ЗАКРЫТО
второй последовательный перепис эксп-20/21 итеративный дрейф. ЗАКРЫТО
дифф-контракт вместо переписа эксп-19 дороже на thinking-модели. ЗАКРЫТО

Единственный ЖИВОЙ продуктовый кандидат из измеренного: «однопроходка + глоссарный проход». По судейской оси от связки не отличается, по банку ЛУЧШЕ неё на обеих парах (zh 1.38 против 2.88, en 0.31 против 0.56), стоит один полный вызов вместо двух, и владелец при слепом чтении поставил однопроходку первой на английском. Его слабое место — банк без черновика (см. Г9).


1б. РЕШЕНИЕ ВЛАДЕЛЬЦА, КОТОРОЕ ЖДЁТ ЕГО САМОГО (не гипотеза, а развилка)

Черновая роль по НАШЕМУ ЖЕ правилу должна уйти с DeepSeek. Правило D39.117 — «при равном качестве берём дешёвого», качество шести черновых моделей было ничьёй. После подорожания 16.08:

gpt-5.6-luna          $0.00358/глава
gemini-3.1-flash-lite $0.00383
deepseek-v4-flash     $0.00444   ← был 0.00097, в 3.7 раза дешевле следующего

На книге в 1500 глав: текущая связка $40 против $23 у пары flash-lite + glm-5. ⚠ Перед сменой — эхо-проба альтернатив: у flash эхо-мина есть и она перевооружается ослабленным thinking; у остальных не мерена НИ РАЗУ. Владелец сказал «это разговор предстоит».


2. ПОРЯДОК РАБОТ. Он важнее содержания

✔ ШАГ 1 — Г5. ВЫПОЛНЕН 20.08, $0. Секция отчёта Д21

Вердикт «H-1 НЕ УСТАНОВЛЕНА» устоял. Инструмент — itog_d4.py --sens (режим в СВОДЕ, нового файла не заводилось). Арифметика находки воспроизведена побайтно; переворот живёт только в сценарии, который возвращает пачку аннулированной сессии и одновременно снимает пачки-валидации, то есть применяет норму в одну сторону и отменяет в другую. На нынешнем дереве запас 0.0710.

Тем же заходом закрыты смежные находки: P12 (пачка 69de717f3f уже в карантине, строка сверки устарела) · P07 (наклон наборов реален, вердиктов не двигает) · R73/P40 (калибровка порога названа ПО ЗНАКУ: пол на Д4 честен, для H-1 контраста завышен в 1.5×).

Осталась открытой P42 и это ВОПРОС ВЛАДЕЛЬЦУ, не замер: два пре-рег-правила о маржевом гейте несовместимы, и от выбора между ними зависит, остаётся ли единственный CONFIRM фазы подтверждением или становится эскалацией. Объявлено девиацией в Д21.6.

Что вынес сверх задания: A6/A0 во всех пяти способах счёта стоит ВПЛОТНУЮ к порогу (0.62 · 0.07 · 0.51 · +0.002 · 0.007) при шаге шкалы в одну ошибку ⇒ это не «эффекта нет», а «эффект ровно размером с шумом прибора» — та же болезнь, что Д17 намерил на новом материале. И A6 испытывался ТОЩИМ промтом переводчика, поэтому клетка «дорогая модель + ПОЛНЫЙ промт» (она же ядро V6) остаётся пустой — это шаг 4.

ШАГ 2 — Г1в + Г1 + Г2 ОДНИМ ЗАМЕРОМ (~$0.4). БЕЗ ВЫРАВНИВАНИЯ, БЕЗ РАЗМЕТКИ

Замер УРЕЗАН по итогам спора 17.08. Прежняя редакция предлагала подавать критику пронумерованные ПАРЫ, то есть требовала решить задачу выравнивания. Это преждевременно: вся ветка висит на ОДНОМ наблюдении, которое я же и объяснил. Сначала проверяем наблюдение, потом строим схемы — норма, заведённая этим разговором.

ПЕРВЫМ — вариант владельца (Г1в), он дешевле и чище. Меняется ТОЛЬКО ИНСТРУКЦИЯ, данные не трогаются вовсе. Сейчас промт критика говорит о связи двух текстов буквально одно: «тебе дан ИСХОДНИК и его ЧЕРНОВОЙ ПЕРЕВОД». Модель вынуждена сама выяснять, как они соотносятся, — и, похоже, именно на это уходят те 9 576 токенов.

Добавляем фразу о том, что тексты идут ПАРАЛЛЕЛЬНО. Образ владельца: два листа из разных тетрадей, наложенные друг на друга, — тексты идут рядом, а не строчка в строчку.

ФОРМУЛИРОВКА РЕШАЕТ, И ВРАТЬ НЕЛЬЗЯ. «Предложение за предложением» — НЕПРАВДА: наш же промт редактора обязывает сливать абзацы (77 строк исходника → 43 абзаца). Соврём — модель будет искать соответствие, не найдёт и потратит БОЛЬШЕ, а не меньше. Говорить только правду: порядок сохранён · перевод покрывает исходник целиком · членение может отличаться · читай оба параллельно и НЕ ищи точных пар предложений.

ВТОРЫМ — мой вариант: тот же кусок, но исходник разбит по предложению на строку (перевод НЕ трогаем, выравнивания НЕ делаем). Детерминированно, $0.

Гонять лучше все четыре комбинации (инструкция вкл/выкл × разбивка вкл/выкл) на одном материале: тогда видно, что решает — слова или форма подачи. Всё равно копейки.

⚠⚠ РИСК, КОТОРЫЙ ЗАМЕР ОБЯЗАН ПРОВЕРИТЬ НАРАВНЕ С ТОКЕНАМИ. Фраза «перевод покрывает исходник целиком» может заставить критика ПЕРЕСТАТЬ ИСКАТЬ ПРОПУСКИ, а потерянный факт — один из главных классов нашей рубрики. Выигрыш в токенах, купленный слепотой к целому классу дефектов, — это не выигрыш. Поэтому в пре-рег отдельной строкой: считать долю находок класса «пропущено/потеряно» до и после, и падение этой доли считать ПРОВАЛОМ варианта, даже если токены упали.

Смотрим ТРИ вещи:

  • токены размышления — упали или нет (Г1в/Г1);
  • находки в целом — те же, лучше или хуже (Г2);
  • находки класса «пропущено» — не исчезли ли (риск выше).

Если упали при тех же находках — гипотеза жива, и тогда имеет смысл строить разметку (Г1б). Если нет — вся ветка закрывается, и мы экономим себе месяц проектирования. Это и есть цель шага: закрыть ветку дёшево, а не подтвердить её дорого.

⚠ Обещание «минус треть цены конвейера» СНЯТО: оно висело на неподтверждённом. ⚠ Пре-рег обязателен: что считаем «те же находки». Сравнение — по адъюдикации, а не на глаз.

ШАГ 2б — Г1г: ЭМБЕДДИНГОВОЕ ВЫРАВНИВАНИЕ, ЕСЛИ ДЕШЁВОЕ НЕ СРАБОТАЛО ($0)

Гонится ТОЛЬКО если шаги 2 и 2а не дали адресации. Инструмент локальный, вызовов к API нет вовсе.

Что уже есть на машине (проверено): sentence-transformers, torch+cpu, 16 ядер, GTX 1070; в кэше лежат LaBSE, bge-m3, Qwen3-Embedding-0.6B. Кандидаты-алгоритмы: vecalign (динамическое программирование по эмбеддингам, умеет МНОГИЕ-КО-МНОГИМ) и BERTalign (на LaBSE, авторы целились в художественную прозу). Gale-Church по длинам для zh↔ru слабая.

ОГРАНИЧЕНИЕ ПРОДА: в облаке только CPU + диск, GPU нет. Поэтому:

  • выравнивание — НЕ горячий путь, один раз на книгу, результат на диске;
  • объём режется: эмбеддить смысловые ходы (4378 на кусок), а не предложения · сперва ЯКОРЯ (термины банка, числа, реплики) прибивают опорные точки, эмбеддинги — только на промежутках · модель меньше + int8/ONNX;
  • роли разведены: в лаборатории это ИЗМЕРИТЕЛЬ, в проде адреса берутся из номеров смысловых ходов по построению. Прод на эмбеддинги опираться НЕ должен.

Точность мерим БЕЗ ручной разметки, инструментами, которые у нас уже есть: банк терминов (термин в отрезке исходника обязан быть канонной формой в выровненном отрезке перевода) и маржевые посадки (мы сами знаем, куда вставили порчу). ⚠ Чужие цифры качества из статей НЕ переносить: их мерили там, где перевод следует за оригиналом близко, а у нас редактор обязан сливать абзацы.

ШАГ 2а — ЕСЛИ Г1 ПОДТВЕРДИЛАСЬ: РАЗМЕТКА ОТДЕЛЬНЫМ ВЫЗОВОМ (~$0.2)

Переводчику разметку НЕ поручать — это измеренный класс отказа. Обогащённый черновик получил ОДИН добавленный структурный блок и вернул исходник вместо перевода на 4 главах из 16; запрет D21.6 говорит то же про языковые констрейнты в reasoning-ослабленных путях (эхо 3/10 → 9/10).

Разметку делает отдельный дешёвый вызов-экстрактор: вход исходник + готовый перевод, выход ТОЛЬКО соответствие «номер смыслового хода → первые слова абзаца». Ни строчки текста не переписывает. Безопасно по квирк-бюллетеню (:51): эхо бьёт по переводу, не по JSON-выводу.

Алгоритма сопоставления при этом НЕТ и не нужно. Если ходы пронумерованы на шаге 1, а блоки несут те же номера, соответствие возникает по построению. Проверка разметки детерминированна: каждый номер ровно один раз · порядок монотонный · длина блока в разумном отношении к длине хода · термины банка хода N присутствуют в блоке N. Не сошлось — блок «без адреса», обрабатывается как сейчас.

ШАГ 3 — Г3 (~$0.4)

Монолингвальный языковой критик: только русский текст, исходника нет вовсе. Сравнить его находки по оси ЯЗЫК с находками нынешнего двуязычного. Если не хуже — сличение из этой стадии убирается целиком, а это самая дешёвая экономия из всех возможных.

ШАГ 4 — Г7 + Г8, ПУСТЫЕ КЛЕТКИ АРХИТЕКТУРЫ V6 (~$1.7)

Обе покупаются одним заходом, потому что делят базу:

  • Г8: промт однопроходки, собранный НАЧИСТО как роль литературного переводчика с инжектом действий — без мета-фразы про отсутствующего редактора, без следов склейки.
  • Г7: её выход + точечная зачистка по классифицированным замечаниям критика.

Это и есть урезанный V6 на одной паре. ⚠ Брать ОБЕ пары: разница zh/en в этой фазе оказалась не языковой, а структурной (выровненность исходника), и на одной паре вывод не встанет.

ШАГ 5 — Г9 + Г10, БАНК (~$0.6)

Пере-собрать банк из выходов однопроходки и из дорогих черновиков, сравнить с нынешним по составу и покрытию. Отдельно — терминолог с РАЗДЕЛЁННЫМИ типами сущностей.

Почему не раньше: банк определяет связность книги на тысячах глав, но эффект его качества наш прибор не видит вовсе — он сравнивает армы при ОДНОМ банке. Значит замер тут не судейский, а детерминированный (состав, покрытие, устойчивость формы), и его надо ставить отдельно от качественных шагов, чтобы не смешать.

ШАГ 6 — Г6, ТРУДНЫЙ АНГЛИЙСКИЙ МАТЕРИАЛ (~$1.5)

Длинные плотные английские главы вместо коротких и чистых. Проверяет, восстанавливается ли согласие счётчика с чтением при широком диапазоне. Разбиение +0.68/+0.42 сделано ПОСЛЕ данных — это разведка, и подтверждать её надо на новом материале, иначе это подгонка.

ШАГ 7 — Г4, КЭШ ($0)

Переложить порядок запросов так, чтобы исходник сцены был общим неизменным префиксом всех стадий. Замер прямой: доля cached_tokens до и после. Сейчас 44.8%.

ШАГ 8 — ПЕРЕНОСИМОСТЬ ВЫВОДА НА ДРУГУЮ МОДЕЛЬ (~$0.5)

Всё измеренное получено при модели-константе deepseek-v4-pro. Вывод честно звучит «какая архитектура лучше ДЛЯ ЭТОЙ модели». Прогнать победившую архитектуру на glm-5 и проверить, что порядок не зависит от жильца. ⚠ Ставить ПОСЛЕ шагов 24: пока архитектура не выбрана, переносить нечего.

ШАГ 9 — СЛЕПОЕ ЧТЕНИЕ ЧЕЛОВЕКОМ НА НОРМАЛЬНОМ n ($0)

Владелец прочёл 1 китайскую главу и 2 английских. Пре-рег П-6 просил 812 единиц на ось. Его чтение оказалось ТОЧНЕЕ машинных читателей (взял контроль там, где они провалили), поэтому расширение выборки — самый дешёвый способ усилить решающий эндпойнт. Ограничение известно и названо им самим: это его время.


3. ЧТО ПРОНИЗЫВАЕТ ВСЕ ШАГИ — Г12

Сравнение архитектур по ОДНОМУ прогону запрещено. Это вывод захода Д17, подтверждённый тремя приборами. Любой платный замер выше планируется в ДВУХ генерациях на метод, иначе он померяет шум.

Цена этого честная: ×2 к смете. Альтернатива — мерить и не знать, что померил.


4. ДОЛГИ ФАЗЫ Д — их надо закрыть, но они НЕ курс

Не двигают знание, но без них фаза не сдаётся. Порядок внутри — от того, что искажает выводы, к тому, что искажает отчётность.

  1. Адъюдикация английской оси — единственное, что блокирует единственный несущий вывод фазы (H-3 в эскалации). adjud.py прошит на zh, нужна параметризация. $0.
  2. 65 находок ревизии — шаг 1 курса разбирает первую; остальные разобрать там же.
  3. Секция Д5 — ручная пере-классификация 24 мест. $0.
  4. Синхронизация отчёта: сводка Д9 противоречит Д15Д20 в четырёх клетках · Д16 не отражает аннулирование японской пачки Sol её же контролями · деньги в Д17 протухли (напечатана смета $1.06 и потолки $0.65, факт $11.72 из $12.10) · тела эрраты Э-17.1 в отчёте нет.
  5. Реестр требований: строк на Д17Д20 нет вовсе, 16 самореферентных улик, R64 красный.
  6. Пинг в docs/PROGRESS.md секция «Полигон» — последняя запись 15.08.
  7. Селфтесты sud.py красные на трёх осях (d3 — 4 провала, d6 — 1, d1 — 2), все настоящие, диагнозы в журнале. ⚠ MIN_FLOOR["d6"]=3 — константа, поставленная под зелень; НЕ править, это вопрос владельцу.
  8. E1 побайтно равен черновику на 5 единицах из 16 — объявлено в Д14.4, панель без них не пере-считана.
  9. Эррата zh-канона: поправка границы слова живёт в коде, в сохранённый банк не дошла (завышение покрытия +0.0039). Правка закрытой оси — ратифицирует оркестратор.
  10. chtenie.py --score-calib не пере-считывает число 0.10, ради воспроизводимости которого объявлен: печатает только порядок читателя. Долг назван в докстринге, не закрыт.
  11. Пакет второму семейству (Sol) по заходу Д17 — не собирался. Решение владельца нужно: отдавать или объявить заход односемейным явно.

5. ЧЕГО НЕ ДЕЛАТЬ

  • Не строить V6 целиком. Пять стадий сразу — это замер, в котором нельзя понять, что сработало. Шаги 25 покупают его по кускам, и каждый кусок отвечает на свой вопрос.
  • Не выбирать архитектуру по деньгам. Разброс между схемами 1540%, между временем суток — ровно вдвое. Экономить надо расписанием прогона, решать — качеством.
  • Не переносить отрицательные результаты по точечным контурам на V6. Там фиксер чинил дешёвый черновик; в V6 он чинит перевод хорошей модели. Другая работа.
  • Не сравнивать числа разных проходов. Рубрика менялась (Д18), прогоны разной строгости.
  • Не покупать до пере-снятия прайса, если вендор снова его двинет: zakhod.price_gate отказывает автоматически, но проверять руками при первом запуске сессии.

6. ЛОВУШКИ, ДОБАВИВШИЕСЯ ЗА ЭТУ СЕССИЮ

  1. Файл клетки ≠ годная клетка. Считать СОДЕРЖИМОЕ и finish=stop. Я на этом сел и доложил владельцу «80 клеток куплено», когда годных было 23.
  2. Пред-полётная проба обязательна перед циклом на сотню клеток (zakhod.preflight): 96 запросов ушли в 402 и выглядели как успешный прогон.
  3. Оценивать цену клетки ПО СВОЕЙ ПАРЕ, а не по общему пулу: китайская глава впятеро длиннее английской, общая медиана врёт вдвое.
  4. Раскладка меток в пакете ЧЕЛОВЕКУ — одна на всю пару. Раскладка на отрывок сделала ответ владельца нерасшифровываемым, и его работа пропала.
  5. Разборщик обязан принимать человеческую форму ответа. Требовать машинной и молча терять ответ — дефект инструмента, а не читателя.
  6. Пере-эмиссия не имеет права трогать пару, которая уже прочитана. Ключ ДОГРУЖАТЬ.
  7. Гейт, который не может упасть, ничего не сторожит. Пустая панель в селфтесте — ПРОВАЛ, а не пропуск.
  8. git checkout поверх грязного дерева запрещён — владелец отказал в пермишене, и правильно.
  9. Обогащение промта ДЕШЁВОЙ модели перевооружает эхо-мину. Замер Д17: мандат перевёрстки, добавленный к черновику, дал 4 негодные клетки из 16 на zh (модель вернула исходник вместо перевода) против 1 из 16 в базе. Причина документирована: черновик ходит с reasoning_effort: low, а запрет D21.6 говорит не вносить языковые констрейнты в промты reasoning-ослабленных путей без per-model замера. Любое обогащение промта на дешёвой модели — только с эхо-гейтом и ре-геном.
  10. Идентичность судей и ЧИТАТЕЛЕЙ персистится ДО запуска. Я закрыл её постфактум (READERS-z17.json) — это слабее нормы. У прохода tier отсутствие такого файла сделало причину расхождения в 12 раз НЕВОССТАНОВИМОЙ.
  11. Три инструмента зоны признаны негодными ВНУТРИ ревизии, а гейты числят их зелёными: promptdiff.py (расхождение матчится по префиксу строки; отсутствующий файл пар-пакета гейт не роняет) · canon.py (снятая ревью классификация всё равно пишется в артефакт — отсюда негодность Д5) · material_ja.py (фильтр AI-меток объявлен механическим, кода не существует). Опираться на любой — только после вскрытия.
  12. Д17 отсужен ОДНИМ семейством. Норма П-1 требует двух там, где возможно. Пакет для Sol по заходу НЕ собирался. Все выводы Д17Д20 стоят на семействе claude плюс чтение владельца.

7. ЧЕМ ЗАКРЫВАЕТСЯ РАБОТА

  1. Пре-рег ДО каждой покупки, зафризенный коммитом с основанием вслух.
  2. Мощность (power.py) напечатана ЧИСЛОМ до денег — не словами. За это уже была девиация Э-17.2.
  3. Гейты зелёные ИЛИ красные с диагнозом; константы под зелень не подгонять.
  4. Секции в отчёте: следующая свободная — Д21.
  5. Адверсариальная приёмка другим модельным семейством — она за эту сессию нашла 8 дефектов замера и 4 неверных утверждения в моём же отчёте. Без неё не сдавать.
  6. Дерево НЕ коммитить, кроме пре-рег-фризов; лендит оркестратор.