textmachine/eval/dovodka/PLAN-17-08.md

376 lines
40 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

> ⚠⚠ **СОСТОЯНИЕ НА 20.08 — читать ЭТО прежде плана ниже.** Курс за день сдвинулся сильнее, чем
> написано в теле; тело оставлено как есть, потому что в нём основания решений.
>
> **1. СМЕНИЛСЯ ПРИБОР.** Решение владельца: первичный — слепое чтение Fable-5, счёт ошибок —
> брак-скрин. Замерено: чтение согласно с владельцем +0.80 на ОБЕИХ парах, счёт +0.80 на
> китайской и 0.80 на английской. ⇒ **все прежние вердикты об архитектурах вынесены прибором,
> который на английской паре смотрит в обратную сторону, и подлежат пере-суду.** 16 пакетов на
> это уже собраны и проверены (см. `HANDOFF-21-08.md`).
> **2. ШАГ 1 (Г5) ЗАКРЫТ**, вердикт по H-1 устоял — секция отчёта Д21.
> **3. ШАГ 2 (подача входа критику) ОСТАНОВЛЕН владельцем** после того, как замер показал: критик
> не видит удалённого абзаца ВООБЩЕ, поэтому «сохранил ли он бдительность» мерить не на чем.
> **4. Г1в/Г1 частично отвечены:** фраза о параллельности срезает размышление на 55% и находки на
> 50%; «след в след» — неправда на ОБЕИХ парах (проверено позиционно), врать модели нельзя.
> **5. Г12 усилена до механизма:** трейс показал, что 96% финального текста модель пишет ВНУТРИ
> размышления. Размышление у dspro — черновик, а не проверка. ⇒ двухстадийная связка дёшева
> БЛАГОДАРЯ топологии: она выносит черновик из дорогого канала размышления в дешёвый выход.
> **6. Появилась новая живая ветка, которой в плане нет:** промт однопроходки как РОЛЬ. Лучшая
> редакция — формулировка ВЛАДЕЛЬЦА («брак = просвечивающий исходный язык»), она обошла обе мои
> и встала выше продакшена в слепом чтении, но при КРАСНОМ контроле шума и вчетверо дороже.
> **7. Г5-строка ниже была НЕВЕРНА ПО ЗНАКУ** — исправлено в теле.
# ПЛАН НОВОГО КУРСА — проверка живых гипотез (17.08)
> Пишется после закрытия захода Д17 и архитектурного разговора с владельцем про V6.
> Предыдущие слои: `PLAN-16-08.md` (прошлый курс, ВЫПОЛНЕН) · `SESSION2-LOG.md` §12§14 ·
> отчёт `docs/experiments/23-editor-tier.md` секции Д17Д20 · заказ
> `docs/POLYGON_EXP2223_REDO_SESSION_PROMPT.md` · хендофф `docs/POLYGON_PHASE_D_HANDOFF.md`.
> Читать ЦЕЛИКОМ: прошлая передача теряла пункты именно из-за чтения грепом.
---
## 0. ГДЕ МЫ ОКАЗАЛИСЬ
Заход Д17 ответил на вопрос, ради которого затевался, и ответ сместил всю рамку.
1. **Второй проход нужен** — голый черновик проигрывает всему и всегда, по всем приборам и трём
парам. Единственное, что не пошатнулось за пять экспериментов.
2. **Какой именно второй проход — приборы не различают.** Все схемы переписывания легли в
неразличимую кучу под починенной рубрикой.
3. **Причина названа и подтверждена трижды независимо: собственный разброс ОДНОГО способа от
прогона к прогону перекрывает разницу МЕЖДУ способами.** Счёт на zh (sd 4.42 между двумя
генерациями связки), машинные читатели на zh, владелец на en (опознал пару близнецов по тексту
и развёл на два места: «один прогон приличный, второй сырой»).
4. **Счётчик — браковщик, а не выборщик.** Он следит за читаемостью там, где у него есть диапазон
(широкая шкала +0.68), и слепнет на чистом тексте (узкая +0.42). Формулировка владельца:
«счётчиком отсеивать брак, чтением выбирать текст в книгу».
5. **Деньги конвейера — это размышление, и тратится оно на выравнивание двух текстов.** 85% цены
дорогой клетки. Перепис думает ×12 против однопроходки только потому, что ему дают черновик.
Курс меняется: раньше мы искали «лучшую архитектуру», теперь ищем **условия, при которых
архитектуры вообще становятся различимы**, и **чинить конвейер там, где он жжёт деньги впустую**.
---
## 1. ЖИВЫЕ ГИПОТЕЗЫ — реестр
Каждая проверяема, у каждой назван замер и цена. Порядок в §2, не здесь.
| # | гипотеза | откуда | цена |
|---|---|---|---|
| **Г1** | Выровненный вход схлопывает размышление сличающей стадии | ОДНО наблюдение: критик видел черновик 78 абзацев против 77 строк исходника (0.96:1) и думал 1084; en 8 против 1 — думал 9576 | ~$0.3 |
| **Г1а** | ⛔ После РЕДАКТОРА выравнивание исчезает (77 строк → 43 абзаца), значит критик V6 попадёт в дорогой режим даже на zh | замер 17.08 | считано: V6 на Гу ~$340 против $226 у связки |
| **Г1в** | ⭐ Достаточно СКАЗАТЬ критику, что тексты идут параллельно — размышление упадёт без всякой разметки | идея владельца 17.08; нынешний промт критика не говорит о связи текстов НИЧЕГО, кроме «исходник и его перевод» | ~$0.15 |
| **Г1б** | Разметку можно поручить ОТДЕЛЬНОМУ дешёвому вызову-экстрактору, не трогая переводчика | квирки :51 — эхо бьёт по переводу, не по JSON-выводу | ~$0.2 |
| **Г1г** | Локальное эмбеддинговое выравнивание (LaBSE/vecalign/BERTalign) даёт таблицу пар с приемлемой точностью на ХУДОЖЕСТВЕННОЙ прозе | идея владельца; модели уже в кэше машины | **$0** за прогон, только CPU-время |
| **Г2** | «Мало думает» = «плохо работает»: ленивый критик находит хуже | zh критик 1084 токена, 43 находки на 2 тыс. знаков, контур проиграл | в комплекте с Г1 |
| **Г3** | Языковому критику исходник НЕ нужен — монолингвальная критика не хуже | ось ЯЗЫК решает, а она видна без оригинала | ~$0.4 |
| **Г4** | Кэш префикса срезает вход многостадийного конвейера | используем 44.8% из возможного | $0, перекладка запросов |
| ~~**Г5**~~ | ~~вердикт по H-1 зависит от состава пачек~~ **ЗАКРЫТА 20.08, Д21: вердикт устоял** ⚠ и формулировка была НЕВЕРНА ПО ЗНАКУ — «переходит порог» значило бы «дорогой черновик ХУЖЕ связки», то есть H-1 опровергается, а не подтверждается | находка ревизии №1 | $0, потрачено |
| **Г6** | Счётчик работает при широком диапазоне, слепнет на чистом | разбиение +0.68 против +0.42, но post-hoc | ~$1.5 (трудный en материал) |
| **Г7** | Дорогая модель + ПОЛНЫЙ промт → точечная зачистка ≥ связки | пустая клетка; `A6` был дорогой моделью с ТОЩИМ промтом | ~$1.2 |
| **Г8** | Промт однопроходки, собранный как РОЛЬ, а не склейка, лучше нынешнего | нынешний несёт мета-фразу «редактора после тебя не будет» | ~$0.5 |
| **Г9** | Банк, собранный из хороших переводов, лучше банка из дешёвых черновиков | никогда не мерилось; майнер режет исходник, черновики дают лишь `drafts:` | ~$0.3 |
| **Г10** | Разделение типов сущностей (имена / титулы / предметы) улучшает банк | терминолог даёт одно правило на всех | ~$0.3 |
| **Г11** | Сцена как единица нарезки лучше чанка | эксп-15: все эффекты когезии под порогом, сигнала нет | не считана |
| **Г12** | Несколько прогонов на метод — УСЛОВИЕ любого сравнения архитектур | п.3 §0 | ×2 к любому замеру |
---
## 1а. ЧТО УЖЕ ЗАКРЫТО — НЕ ПЕРЕОТКРЫВАТЬ БЕЗ НОВОГО ОСНОВАНИЯ
Дописано при перечитывании: без этого списка следующая сессия честно потратит деньги на то,
что уже куплено и отвечено.
| закрыто | чем | вердикт |
|---|---|---|
| «критик → ПОЛНЫЙ перепис» (`K1`/`Z1`) | Д17, обе пары | 0.06 по счёту, у владельца 3-е и 4-е места. **ОТРИЦАТЕЛЬНО** |
| «обогащённый промт черновика» (`K8`/`Z8`) | Д17, обе пары | хуже голого на en, эхо-мина на zh. **ОТРИЦАТЕЛЬНО** |
| «дешёвая модель в роли редактора» | эксп-22 Ф3 | 2.54 против боевого + 3 клетки сожгли бюджет. **ОТРИЦАТЕЛЬНО** |
| «дорогая модель черновиком» | эксп-22 Ф2 | ничья, побеждает дешёвый. **ЗАКРЫТО** |
| «какая модель лучше редактор» | 5 моделей zh, 2-я на en/ja, 3 «сильных тира» | dspro первый везде. **ЗАКРЫТО устойчиво** |
| «gemini — аутлаер прозы» (эксп-04) | Д1, 15 клеток | не подтверждается, цена ×30. **ЗАКРЫТО** |
| H-4 «перевес dspro — свойство китайской пары» | zh/en/ja | не подтверждается на всех трёх. **ЗАКРЫТО** |
| роутинг «платить дорого адресно» | эксп-21 | отборщики-монетки. **ЗАКРЫТО** |
| второй последовательный перепис | эксп-20/21 | итеративный дрейф. **ЗАКРЫТО** |
| дифф-контракт вместо переписа | эксп-19 | дороже на thinking-модели. **ЗАКРЫТО** |
**Единственный ЖИВОЙ продуктовый кандидат из измеренного: «однопроходка + глоссарный проход».**
По судейской оси от связки не отличается, по банку ЛУЧШЕ неё на обеих парах (zh 1.38 против 2.88,
en 0.31 против 0.56), стоит один полный вызов вместо двух, и владелец при слепом чтении поставил
однопроходку первой на английском. Его слабое место — банк без черновика (см. Г9).
---
## 1б. РЕШЕНИЕ ВЛАДЕЛЬЦА, КОТОРОЕ ЖДЁТ ЕГО САМОГО (не гипотеза, а развилка)
**Черновая роль по НАШЕМУ ЖЕ правилу должна уйти с DeepSeek.** Правило D39.117 — «при равном
качестве берём дешёвого», качество шести черновых моделей было ничьёй. После подорожания 16.08:
```
gpt-5.6-luna $0.00358/глава
gemini-3.1-flash-lite $0.00383
deepseek-v4-flash $0.00444 ← был 0.00097, в 3.7 раза дешевле следующего
```
На книге в 1500 глав: текущая связка $40 против $23 у пары `flash-lite + glm-5`.
**Перед сменой — эхо-проба альтернатив:** у flash эхо-мина есть и она перевооружается
ослабленным thinking; у остальных не мерена НИ РАЗУ. Владелец сказал «это разговор предстоит».
---
## 2. ПОРЯДОК РАБОТ. Он важнее содержания
### ✔ ШАГ 1 — Г5. ВЫПОЛНЕН 20.08, $0. Секция отчёта Д21
**Вердикт «H-1 НЕ УСТАНОВЛЕНА» устоял.** Инструмент — `itog_d4.py --sens` (режим в СВОДЕ, нового
файла не заводилось). Арифметика находки воспроизведена побайтно; переворот живёт только в
сценарии, который возвращает пачку аннулированной сессии и одновременно снимает пачки-валидации,
то есть применяет норму в одну сторону и отменяет в другую. На нынешнем дереве запас **0.0710**.
Тем же заходом закрыты смежные находки: **P12** (пачка `69de717f3f` уже в карантине, строка
сверки устарела) · **P07** (наклон наборов реален, вердиктов не двигает) · **R73/P40** (калибровка
порога названа ПО ЗНАКУ: пол на Д4 честен, для H-1 контраста завышен в 1.5×).
**Осталась открытой P42 и это ВОПРОС ВЛАДЕЛЬЦУ**, не замер: два пре-рег-правила о маржевом
гейте несовместимы, и от выбора между ними зависит, остаётся ли единственный CONFIRM фазы
подтверждением или становится эскалацией. Объявлено девиацией в Д21.6.
**Что вынес сверх задания:** `A6/A0` во всех пяти способах счёта стоит ВПЛОТНУЮ к порогу
(0.62 · 0.07 · 0.51 · +0.002 · 0.007) при шаге шкалы в одну ошибку ⇒ это не «эффекта нет», а
«эффект ровно размером с шумом прибора» — та же болезнь, что Д17 намерил на новом материале.
И `A6` испытывался ТОЩИМ промтом переводчика, поэтому клетка «дорогая модель + ПОЛНЫЙ промт»
(она же ядро V6) остаётся пустой — это шаг 4.
### ШАГ 2 — Г1в + Г1 + Г2 ОДНИМ ЗАМЕРОМ (~$0.4). БЕЗ ВЫРАВНИВАНИЯ, БЕЗ РАЗМЕТКИ
**Замер УРЕЗАН по итогам спора 17.08.** Прежняя редакция предлагала подавать критику
пронумерованные ПАРЫ, то есть требовала решить задачу выравнивания. Это преждевременно: вся
ветка висит на ОДНОМ наблюдении, которое я же и объяснил. Сначала проверяем наблюдение, потом
строим схемы — норма, заведённая этим разговором.
**ПЕРВЫМ — вариант владельца (Г1в), он дешевле и чище.** Меняется ТОЛЬКО ИНСТРУКЦИЯ, данные
не трогаются вовсе. Сейчас промт критика говорит о связи двух текстов буквально одно: «тебе дан
ИСХОДНИК и его ЧЕРНОВОЙ ПЕРЕВОД». Модель вынуждена сама выяснять, как они соотносятся, — и,
похоже, именно на это уходят те 9 576 токенов.
Добавляем фразу о том, что тексты идут ПАРАЛЛЕЛЬНО. Образ владельца: два листа из разных тетрадей,
наложенные друг на друга, — тексты идут рядом, а не строчка в строчку.
**ФОРМУЛИРОВКА РЕШАЕТ, И ВРАТЬ НЕЛЬЗЯ.** «Предложение за предложением» — НЕПРАВДА: наш же промт
редактора обязывает сливать абзацы (77 строк исходника → 43 абзаца). Соврём — модель будет искать
соответствие, не найдёт и потратит БОЛЬШЕ, а не меньше. Говорить только правду: порядок сохранён ·
перевод покрывает исходник целиком · членение может отличаться · читай оба параллельно и НЕ ищи
точных пар предложений.
**ВТОРЫМ — мой вариант:** тот же кусок, но **исходник разбит по предложению на строку**
(перевод НЕ трогаем, выравнивания НЕ делаем). Детерминированно, $0.
**Гонять лучше все четыре комбинации** (инструкция вкл/выкл × разбивка вкл/выкл) на одном
материале: тогда видно, что решает — слова или форма подачи. Всё равно копейки.
⚠⚠ **РИСК, КОТОРЫЙ ЗАМЕР ОБЯЗАН ПРОВЕРИТЬ НАРАВНЕ С ТОКЕНАМИ.** Фраза «перевод покрывает исходник
целиком» может заставить критика ПЕРЕСТАТЬ ИСКАТЬ ПРОПУСКИ, а потерянный факт — один из главных
классов нашей рубрики. Выигрыш в токенах, купленный слепотой к целому классу дефектов, — это не
выигрыш. Поэтому в пре-рег отдельной строкой: считать долю находок класса «пропущено/потеряно»
до и после, и падение этой доли считать ПРОВАЛОМ варианта, даже если токены упали.
Смотрим ТРИ вещи:
* **токены размышления** — упали или нет (Г1в/Г1);
* **находки в целом** — те же, лучше или хуже (Г2);
* **находки класса «пропущено»** — не исчезли ли (риск выше).
**Если упали при тех же находках** — гипотеза жива, и тогда имеет смысл строить разметку (Г1б).
**Если нет** — вся ветка закрывается, и мы экономим себе месяц проектирования. Это и есть цель
шага: закрыть ветку дёшево, а не подтвердить её дорого.
⚠ Обещание «минус треть цены конвейера» СНЯТО: оно висело на неподтверждённом.
⚠ Пре-рег обязателен: что считаем «те же находки». Сравнение — по адъюдикации, а не на глаз.
### ШАГ 2б — Г1г: ЭМБЕДДИНГОВОЕ ВЫРАВНИВАНИЕ, ЕСЛИ ДЕШЁВОЕ НЕ СРАБОТАЛО ($0)
Гонится ТОЛЬКО если шаги 2 и 2а не дали адресации. Инструмент локальный, вызовов к API нет вовсе.
**Что уже есть на машине (проверено):** `sentence-transformers`, `torch+cpu`, 16 ядер, GTX 1070;
в кэше лежат `LaBSE`, `bge-m3`, `Qwen3-Embedding-0.6B`. Кандидаты-алгоритмы: **vecalign**
(динамическое программирование по эмбеддингам, умеет МНОГИЕ-КО-МНОГИМ) и **BERTalign** (на LaBSE,
авторы целились в художественную прозу). Gale-Church по длинам для zh↔ru слабая.
**⛔ ОГРАНИЧЕНИЕ ПРОДА: в облаке только CPU + диск, GPU нет.** Поэтому:
* выравнивание — НЕ горячий путь, один раз на книгу, результат на диске;
* объём режется: эмбеддить смысловые ходы (4378 на кусок), а не предложения · сперва ЯКОРЯ
(термины банка, числа, реплики) прибивают опорные точки, эмбеддинги — только на промежутках ·
модель меньше + int8/ONNX;
* **роли разведены: в лаборатории это ИЗМЕРИТЕЛЬ, в проде адреса берутся из номеров смысловых
ходов по построению.** Прод на эмбеддинги опираться НЕ должен.
**Точность мерим БЕЗ ручной разметки, инструментами, которые у нас уже есть:** банк терминов
(термин в отрезке исходника обязан быть канонной формой в выровненном отрезке перевода) и маржевые
посадки (мы сами знаем, куда вставили порчу). ⚠ Чужие цифры качества из статей НЕ переносить: их
мерили там, где перевод следует за оригиналом близко, а у нас редактор обязан сливать абзацы.
### ШАГ 2а — ЕСЛИ Г1 ПОДТВЕРДИЛАСЬ: РАЗМЕТКА ОТДЕЛЬНЫМ ВЫЗОВОМ (~$0.2)
**Переводчику разметку НЕ поручать — это измеренный класс отказа.** Обогащённый черновик
получил ОДИН добавленный структурный блок и вернул исходник вместо перевода на 4 главах из 16;
запрет D21.6 говорит то же про языковые констрейнты в reasoning-ослабленных путях (эхо 3/10 → 9/10).
Разметку делает **отдельный дешёвый вызов-экстрактор**: вход исходник + готовый перевод, выход
ТОЛЬКО соответствие «номер смыслового хода → первые слова абзаца». Ни строчки текста не
переписывает. Безопасно по квирк-бюллетеню (:51): эхо бьёт по переводу, не по JSON-выводу.
**Алгоритма сопоставления при этом НЕТ и не нужно.** Если ходы пронумерованы на шаге 1, а блоки
несут те же номера, соответствие возникает по построению. Проверка разметки детерминированна:
каждый номер ровно один раз · порядок монотонный · длина блока в разумном отношении к длине хода ·
термины банка хода N присутствуют в блоке N. Не сошлось — блок «без адреса», обрабатывается как сейчас.
### ШАГ 3 — Г3 (~$0.4)
Монолингвальный языковой критик: только русский текст, исходника нет вовсе. Сравнить его находки
по оси ЯЗЫК с находками нынешнего двуязычного. Если не хуже — сличение из этой стадии убирается
целиком, а это самая дешёвая экономия из всех возможных.
### ШАГ 4 — Г7 + Г8, ПУСТЫЕ КЛЕТКИ АРХИТЕКТУРЫ V6 (~$1.7)
Обе покупаются одним заходом, потому что делят базу:
* **Г8**: промт однопроходки, собранный НАЧИСТО как роль литературного переводчика с инжектом
действий — без мета-фразы про отсутствующего редактора, без следов склейки.
* **Г7**: её выход + точечная зачистка по классифицированным замечаниям критика.
Это и есть урезанный V6 на одной паре. ⚠ Брать ОБЕ пары: разница zh/en в этой фазе оказалась
не языковой, а структурной (выровненность исходника), и на одной паре вывод не встанет.
### ШАГ 5 — Г9 + Г10, БАНК (~$0.6)
Пере-собрать банк из выходов однопроходки и из дорогих черновиков, сравнить с нынешним по составу
и покрытию. Отдельно — терминолог с РАЗДЕЛЁННЫМИ типами сущностей.
**Почему не раньше:** банк определяет связность книги на тысячах глав, но эффект его качества наш
прибор не видит вовсе — он сравнивает армы при ОДНОМ банке. Значит замер тут не судейский, а
детерминированный (состав, покрытие, устойчивость формы), и его надо ставить отдельно от
качественных шагов, чтобы не смешать.
### ШАГ 6 — Г6, ТРУДНЫЙ АНГЛИЙСКИЙ МАТЕРИАЛ (~$1.5)
Длинные плотные английские главы вместо коротких и чистых. Проверяет, восстанавливается ли
согласие счётчика с чтением при широком диапазоне. Разбиение +0.68/+0.42 сделано ПОСЛЕ данных —
это разведка, и подтверждать её надо на новом материале, иначе это подгонка.
### ШАГ 7 — Г4, КЭШ ($0)
Переложить порядок запросов так, чтобы исходник сцены был общим неизменным префиксом всех стадий.
Замер прямой: доля `cached_tokens` до и после. Сейчас 44.8%.
### ШАГ 8 — ПЕРЕНОСИМОСТЬ ВЫВОДА НА ДРУГУЮ МОДЕЛЬ (~$0.5)
Всё измеренное получено при модели-константе `deepseek-v4-pro`. Вывод честно звучит «какая
архитектура лучше ДЛЯ ЭТОЙ модели». Прогнать победившую архитектуру на `glm-5` и проверить, что
порядок не зависит от жильца. ⚠ Ставить ПОСЛЕ шагов 24: пока архитектура не выбрана, переносить
нечего.
### ШАГ 9 — СЛЕПОЕ ЧТЕНИЕ ЧЕЛОВЕКОМ НА НОРМАЛЬНОМ n ($0)
Владелец прочёл 1 китайскую главу и 2 английских. Пре-рег П-6 просил 812 единиц на ось.
Его чтение оказалось ТОЧНЕЕ машинных читателей (взял контроль там, где они провалили), поэтому
расширение выборки — самый дешёвый способ усилить решающий эндпойнт. Ограничение известно и
названо им самим: это его время.
---
## 3. ЧТО ПРОНИЗЫВАЕТ ВСЕ ШАГИ — Г12
**Сравнение архитектур по ОДНОМУ прогону запрещено.** Это вывод захода Д17, подтверждённый тремя
приборами. Любой платный замер выше планируется в ДВУХ генерациях на метод, иначе он померяет шум.
Цена этого честная: ×2 к смете. Альтернатива — мерить и не знать, что померил.
---
## 4. ДОЛГИ ФАЗЫ Д — их надо закрыть, но они НЕ курс
Не двигают знание, но без них фаза не сдаётся. Порядок внутри — от того, что искажает выводы,
к тому, что искажает отчётность.
1. **Адъюдикация английской оси** — единственное, что блокирует единственный несущий вывод фазы
(H-3 в эскалации). `adjud.py` прошит на zh, нужна параметризация. $0.
2. **65 находок ревизии** — шаг 1 курса разбирает первую; остальные разобрать там же.
3. **Секция Д5** — ручная пере-классификация 24 мест. $0.
4. **Синхронизация отчёта:** сводка Д9 противоречит Д15Д20 в четырёх клетках · Д16 не отражает
аннулирование японской пачки Sol её же контролями · деньги в Д17 протухли (напечатана смета
$1.06 и потолки $0.65, факт $11.72 из $12.10) · тела эрраты Э-17.1 в отчёте нет.
5. **Реестр требований:** строк на Д17Д20 нет вовсе, 16 самореферентных улик, R64 красный.
6. **Пинг в `docs/PROGRESS.md` секция «Полигон»** — последняя запись 15.08.
7. **Селфтесты `sud.py` красные на трёх осях** (d3 — 4 провала, d6 — 1, d1 — 2), все настоящие,
диагнозы в журнале. ⚠ `MIN_FLOOR["d6"]=3` — константа, поставленная под зелень; НЕ править,
это вопрос владельцу.
8. **`E1` побайтно равен черновику на 5 единицах из 16** — объявлено в Д14.4, панель без них не
пере-считана.
9. **Эррата zh-канона:** поправка границы слова живёт в коде, в сохранённый банк не дошла
(завышение покрытия +0.0039). Правка закрытой оси — ратифицирует оркестратор.
10. **`chtenie.py --score-calib` не пере-считывает число 0.10**, ради воспроизводимости которого
объявлен: печатает только порядок читателя. Долг назван в докстринге, не закрыт.
11. **Пакет второму семейству (Sol) по заходу Д17** — не собирался. Решение владельца нужно:
отдавать или объявить заход односемейным явно.
---
## 5. ЧЕГО НЕ ДЕЛАТЬ
* **Не строить V6 целиком.** Пять стадий сразу — это замер, в котором нельзя понять, что сработало.
Шаги 25 покупают его по кускам, и каждый кусок отвечает на свой вопрос.
* **Не выбирать архитектуру по деньгам.** Разброс между схемами 1540%, между временем суток —
ровно вдвое. Экономить надо расписанием прогона, решать — качеством.
* **Не переносить отрицательные результаты по точечным контурам на V6.** Там фиксер чинил
дешёвый черновик; в V6 он чинит перевод хорошей модели. Другая работа.
* **Не сравнивать числа разных проходов.** Рубрика менялась (Д18), прогоны разной строгости.
* **Не покупать до пере-снятия прайса**, если вендор снова его двинет: `zakhod.price_gate`
отказывает автоматически, но проверять руками при первом запуске сессии.
---
## 6. ЛОВУШКИ, ДОБАВИВШИЕСЯ ЗА ЭТУ СЕССИЮ
1. **Файл клетки ≠ годная клетка.** Считать СОДЕРЖИМОЕ и `finish=stop`. Я на этом сел и доложил
владельцу «80 клеток куплено», когда годных было 23.
2. **Пред-полётная проба обязательна** перед циклом на сотню клеток (`zakhod.preflight`): 96
запросов ушли в `402` и выглядели как успешный прогон.
3. **Оценивать цену клетки ПО СВОЕЙ ПАРЕ**, а не по общему пулу: китайская глава впятеро длиннее
английской, общая медиана врёт вдвое.
4. **Раскладка меток в пакете ЧЕЛОВЕКУ — одна на всю пару.** Раскладка на отрывок сделала ответ
владельца нерасшифровываемым, и его работа пропала.
5. **Разборщик обязан принимать человеческую форму ответа.** Требовать машинной и молча терять
ответ — дефект инструмента, а не читателя.
6. **Пере-эмиссия не имеет права трогать пару, которая уже прочитана.** Ключ ДОГРУЖАТЬ.
7. **Гейт, который не может упасть, ничего не сторожит.** Пустая панель в селфтесте — ПРОВАЛ,
а не пропуск.
8. **`git checkout` поверх грязного дерева запрещён** — владелец отказал в пермишене, и правильно.
13. **Обогащение промта ДЕШЁВОЙ модели перевооружает эхо-мину.** Замер Д17: мандат перевёрстки,
добавленный к черновику, дал 4 негодные клетки из 16 на zh (модель вернула исходник вместо
перевода) против 1 из 16 в базе. Причина документирована: черновик ходит с `reasoning_effort:
low`, а запрет D21.6 говорит не вносить языковые констрейнты в промты reasoning-ослабленных
путей без per-model замера. **Любое обогащение промта на дешёвой модели — только с эхо-гейтом
и ре-геном.**
14. **Идентичность судей и ЧИТАТЕЛЕЙ персистится ДО запуска.** Я закрыл её постфактум
(`READERS-z17.json`) — это слабее нормы. У прохода `tier` отсутствие такого файла сделало
причину расхождения в 12 раз НЕВОССТАНОВИМОЙ.
15. **Три инструмента зоны признаны негодными ВНУТРИ ревизии, а гейты числят их зелёными:**
`promptdiff.py` (расхождение матчится по префиксу строки; отсутствующий файл пар-пакета гейт
не роняет) · `canon.py` (снятая ревью классификация всё равно пишется в артефакт — отсюда
негодность Д5) · `material_ja.py` (фильтр AI-меток объявлен механическим, кода не существует).
Опираться на любой — только после вскрытия.
16. **Д17 отсужен ОДНИМ семейством.** Норма П-1 требует двух там, где возможно. Пакет для Sol по
заходу НЕ собирался. Все выводы Д17Д20 стоят на семействе claude плюс чтение владельца.
---
## 7. ЧЕМ ЗАКРЫВАЕТСЯ РАБОТА
1. Пре-рег ДО каждой покупки, зафризенный коммитом с основанием вслух.
2. Мощность (`power.py`) напечатана ЧИСЛОМ до денег — не словами. За это уже была девиация Э-17.2.
3. Гейты зелёные ИЛИ красные с диагнозом; константы под зелень не подгонять.
4. Секции в отчёте: следующая свободная — **Д21**.
5. Адверсариальная приёмка другим модельным семейством — она за эту сессию нашла 8 дефектов
замера и 4 неверных утверждения в моём же отчёте. Без неё не сдавать.
6. Дерево НЕ коммитить, кроме пре-рег-фризов; лендит оркестратор.