40 KiB
⚠⚠ СОСТОЯНИЕ НА 20.08 — читать ЭТО прежде плана ниже. Курс за день сдвинулся сильнее, чем написано в теле; тело оставлено как есть, потому что в нём основания решений.
1. СМЕНИЛСЯ ПРИБОР. Решение владельца: первичный — слепое чтение Fable-5, счёт ошибок — брак-скрин. Замерено: чтение согласно с владельцем +0.80 на ОБЕИХ парах, счёт +0.80 на китайской и −0.80 на английской. ⇒ все прежние вердикты об архитектурах вынесены прибором, который на английской паре смотрит в обратную сторону, и подлежат пере-суду. 16 пакетов на это уже собраны и проверены (см.
HANDOFF-21-08.md). 2. ШАГ 1 (Г5) ЗАКРЫТ, вердикт по H-1 устоял — секция отчёта Д21. 3. ШАГ 2 (подача входа критику) ОСТАНОВЛЕН владельцем после того, как замер показал: критик не видит удалённого абзаца ВООБЩЕ, поэтому «сохранил ли он бдительность» мерить не на чем. 4. Г1в/Г1 частично отвечены: фраза о параллельности срезает размышление на 55% и находки на 50%; «след в след» — неправда на ОБЕИХ парах (проверено позиционно), врать модели нельзя. 5. Г12 усилена до механизма: трейс показал, что 96% финального текста модель пишет ВНУТРИ размышления. Размышление у dspro — черновик, а не проверка. ⇒ двухстадийная связка дёшева БЛАГОДАРЯ топологии: она выносит черновик из дорогого канала размышления в дешёвый выход. 6. Появилась новая живая ветка, которой в плане нет: промт однопроходки как РОЛЬ. Лучшая редакция — формулировка ВЛАДЕЛЬЦА («брак = просвечивающий исходный язык»), она обошла обе мои и встала выше продакшена в слепом чтении, но при КРАСНОМ контроле шума и вчетверо дороже. 7. Г5-строка ниже была НЕВЕРНА ПО ЗНАКУ — исправлено в теле.
ПЛАН НОВОГО КУРСА — проверка живых гипотез (17.08)
Пишется после закрытия захода Д17 и архитектурного разговора с владельцем про V6. Предыдущие слои:
PLAN-16-08.md(прошлый курс, ВЫПОЛНЕН) ·SESSION2-LOG.md§12–§14 · отчётdocs/experiments/23-editor-tier.mdсекции Д17–Д20 · заказdocs/POLYGON_EXP2223_REDO_SESSION_PROMPT.md· хендоффdocs/POLYGON_PHASE_D_HANDOFF.md. Читать ЦЕЛИКОМ: прошлая передача теряла пункты именно из-за чтения грепом.
0. ГДЕ МЫ ОКАЗАЛИСЬ
Заход Д17 ответил на вопрос, ради которого затевался, и ответ сместил всю рамку.
- Второй проход нужен — голый черновик проигрывает всему и всегда, по всем приборам и трём парам. Единственное, что не пошатнулось за пять экспериментов.
- Какой именно второй проход — приборы не различают. Все схемы переписывания легли в неразличимую кучу под починенной рубрикой.
- Причина названа и подтверждена трижды независимо: собственный разброс ОДНОГО способа от прогона к прогону перекрывает разницу МЕЖДУ способами. Счёт на zh (sd 4.42 между двумя генерациями связки), машинные читатели на zh, владелец на en (опознал пару близнецов по тексту и развёл на два места: «один прогон приличный, второй сырой»).
- Счётчик — браковщик, а не выборщик. Он следит за читаемостью там, где у него есть диапазон (широкая шкала +0.68), и слепнет на чистом тексте (узкая +0.42). Формулировка владельца: «счётчиком отсеивать брак, чтением выбирать текст в книгу».
- Деньги конвейера — это размышление, и тратится оно на выравнивание двух текстов. 85% цены дорогой клетки. Перепис думает ×12 против однопроходки только потому, что ему дают черновик.
⇒ Курс меняется: раньше мы искали «лучшую архитектуру», теперь ищем условия, при которых архитектуры вообще становятся различимы, и чинить конвейер там, где он жжёт деньги впустую.
1. ЖИВЫЕ ГИПОТЕЗЫ — реестр
Каждая проверяема, у каждой назван замер и цена. Порядок в §2, не здесь.
| # | гипотеза | откуда | цена |
|---|---|---|---|
| Г1 | Выровненный вход схлопывает размышление сличающей стадии | ОДНО наблюдение: критик видел черновик 78 абзацев против 77 строк исходника (0.96:1) и думал 1084; en 8 против 1 — думал 9576 | ~$0.3 |
| Г1а | ⛔ После РЕДАКТОРА выравнивание исчезает (77 строк → 43 абзаца), значит критик V6 попадёт в дорогой режим даже на zh | замер 17.08 | считано: V6 на Гу ~$340 против $226 у связки |
| Г1в | ⭐ Достаточно СКАЗАТЬ критику, что тексты идут параллельно — размышление упадёт без всякой разметки | идея владельца 17.08; нынешний промт критика не говорит о связи текстов НИЧЕГО, кроме «исходник и его перевод» | ~$0.15 |
| Г1б | Разметку можно поручить ОТДЕЛЬНОМУ дешёвому вызову-экстрактору, не трогая переводчика | квирки :51 — эхо бьёт по переводу, не по JSON-выводу | ~$0.2 |
| Г1г | Локальное эмбеддинговое выравнивание (LaBSE/vecalign/BERTalign) даёт таблицу пар с приемлемой точностью на ХУДОЖЕСТВЕННОЙ прозе | идея владельца; модели уже в кэше машины | $0 за прогон, только CPU-время |
| Г2 | «Мало думает» = «плохо работает»: ленивый критик находит хуже | zh критик 1084 токена, 43 находки на 2 тыс. знаков, контур проиграл | в комплекте с Г1 |
| Г3 | Языковому критику исходник НЕ нужен — монолингвальная критика не хуже | ось ЯЗЫК решает, а она видна без оригинала | ~$0.4 |
| Г4 | Кэш префикса срезает вход многостадийного конвейера | используем 44.8% из возможного | $0, перекладка запросов |
| находка ревизии №1 | $0, потрачено | ||
| Г6 | Счётчик работает при широком диапазоне, слепнет на чистом | разбиение +0.68 против +0.42, но post-hoc | ~$1.5 (трудный en материал) |
| Г7 | Дорогая модель + ПОЛНЫЙ промт → точечная зачистка ≥ связки | пустая клетка; A6 был дорогой моделью с ТОЩИМ промтом |
~$1.2 |
| Г8 | Промт однопроходки, собранный как РОЛЬ, а не склейка, лучше нынешнего | нынешний несёт мета-фразу «редактора после тебя не будет» | ~$0.5 |
| Г9 | Банк, собранный из хороших переводов, лучше банка из дешёвых черновиков | никогда не мерилось; майнер режет исходник, черновики дают лишь drafts: |
~$0.3 |
| Г10 | Разделение типов сущностей (имена / титулы / предметы) улучшает банк | терминолог даёт одно правило на всех | ~$0.3 |
| Г11 | Сцена как единица нарезки лучше чанка | эксп-15: все эффекты когезии под порогом, сигнала нет | не считана |
| Г12 | Несколько прогонов на метод — УСЛОВИЕ любого сравнения архитектур | п.3 §0 | ×2 к любому замеру |
1а. ЧТО УЖЕ ЗАКРЫТО — НЕ ПЕРЕОТКРЫВАТЬ БЕЗ НОВОГО ОСНОВАНИЯ
Дописано при перечитывании: без этого списка следующая сессия честно потратит деньги на то, что уже куплено и отвечено.
| закрыто | чем | вердикт |
|---|---|---|
«критик → ПОЛНЫЙ перепис» (K1/Z1) |
Д17, обе пары | −0.06 по счёту, у владельца 3-е и 4-е места. ОТРИЦАТЕЛЬНО |
«обогащённый промт черновика» (K8/Z8) |
Д17, обе пары | хуже голого на en, эхо-мина на zh. ОТРИЦАТЕЛЬНО |
| «дешёвая модель в роли редактора» | эксп-22 Ф3 | −2.54 против боевого + 3 клетки сожгли бюджет. ОТРИЦАТЕЛЬНО |
| «дорогая модель черновиком» | эксп-22 Ф2 | ничья, побеждает дешёвый. ЗАКРЫТО |
| «какая модель лучше редактор» | 5 моделей zh, 2-я на en/ja, 3 «сильных тира» | dspro первый везде. ЗАКРЫТО устойчиво |
| «gemini — аутлаер прозы» (эксп-04) | Д1, 15 клеток | не подтверждается, цена ×30. ЗАКРЫТО |
| H-4 «перевес dspro — свойство китайской пары» | zh/en/ja | не подтверждается на всех трёх. ЗАКРЫТО |
| роутинг «платить дорого адресно» | эксп-21 | отборщики-монетки. ЗАКРЫТО |
| второй последовательный перепис | эксп-20/21 | итеративный дрейф. ЗАКРЫТО |
| дифф-контракт вместо переписа | эксп-19 | дороже на thinking-модели. ЗАКРЫТО |
⚠ Единственный ЖИВОЙ продуктовый кандидат из измеренного: «однопроходка + глоссарный проход». По судейской оси от связки не отличается, по банку ЛУЧШЕ неё на обеих парах (zh 1.38 против 2.88, en 0.31 против 0.56), стоит один полный вызов вместо двух, и владелец при слепом чтении поставил однопроходку первой на английском. Его слабое место — банк без черновика (см. Г9).
1б. РЕШЕНИЕ ВЛАДЕЛЬЦА, КОТОРОЕ ЖДЁТ ЕГО САМОГО (не гипотеза, а развилка)
Черновая роль по НАШЕМУ ЖЕ правилу должна уйти с DeepSeek. Правило D39.117 — «при равном качестве берём дешёвого», качество шести черновых моделей было ничьёй. После подорожания 16.08:
gpt-5.6-luna $0.00358/глава
gemini-3.1-flash-lite $0.00383
deepseek-v4-flash $0.00444 ← был 0.00097, в 3.7 раза дешевле следующего
На книге в 1500 глав: текущая связка $40 против $23 у пары flash-lite + glm-5.
⚠ Перед сменой — эхо-проба альтернатив: у flash эхо-мина есть и она перевооружается
ослабленным thinking; у остальных не мерена НИ РАЗУ. Владелец сказал «это разговор предстоит».
2. ПОРЯДОК РАБОТ. Он важнее содержания
✔ ШАГ 1 — Г5. ВЫПОЛНЕН 20.08, $0. Секция отчёта Д21
Вердикт «H-1 НЕ УСТАНОВЛЕНА» устоял. Инструмент — itog_d4.py --sens (режим в СВОДЕ, нового
файла не заводилось). Арифметика находки воспроизведена побайтно; переворот живёт только в
сценарии, который возвращает пачку аннулированной сессии и одновременно снимает пачки-валидации,
то есть применяет норму в одну сторону и отменяет в другую. На нынешнем дереве запас −0.0710.
Тем же заходом закрыты смежные находки: P12 (пачка 69de717f3f уже в карантине, строка
сверки устарела) · P07 (наклон наборов реален, вердиктов не двигает) · R73/P40 (калибровка
порога названа ПО ЗНАКУ: пол на Д4 честен, для H-1 контраста завышен в 1.5×).
⛔ Осталась открытой P42 и это ВОПРОС ВЛАДЕЛЬЦУ, не замер: два пре-рег-правила о маржевом гейте несовместимы, и от выбора между ними зависит, остаётся ли единственный CONFIRM фазы подтверждением или становится эскалацией. Объявлено девиацией в Д21.6.
Что вынес сверх задания: A6/A0 во всех пяти способах счёта стоит ВПЛОТНУЮ к порогу
(−0.62 · −0.07 · −0.51 · +0.002 · −0.007) при шаге шкалы в одну ошибку ⇒ это не «эффекта нет», а
«эффект ровно размером с шумом прибора» — та же болезнь, что Д17 намерил на новом материале.
И A6 испытывался ТОЩИМ промтом переводчика, поэтому клетка «дорогая модель + ПОЛНЫЙ промт»
(она же ядро V6) остаётся пустой — это шаг 4.
ШАГ 2 — Г1в + Г1 + Г2 ОДНИМ ЗАМЕРОМ (~$0.4). БЕЗ ВЫРАВНИВАНИЯ, БЕЗ РАЗМЕТКИ
⚠ Замер УРЕЗАН по итогам спора 17.08. Прежняя редакция предлагала подавать критику пронумерованные ПАРЫ, то есть требовала решить задачу выравнивания. Это преждевременно: вся ветка висит на ОДНОМ наблюдении, которое я же и объяснил. Сначала проверяем наблюдение, потом строим схемы — норма, заведённая этим разговором.
ПЕРВЫМ — вариант владельца (Г1в), он дешевле и чище. Меняется ТОЛЬКО ИНСТРУКЦИЯ, данные не трогаются вовсе. Сейчас промт критика говорит о связи двух текстов буквально одно: «тебе дан ИСХОДНИК и его ЧЕРНОВОЙ ПЕРЕВОД». Модель вынуждена сама выяснять, как они соотносятся, — и, похоже, именно на это уходят те 9 576 токенов.
Добавляем фразу о том, что тексты идут ПАРАЛЛЕЛЬНО. Образ владельца: два листа из разных тетрадей, наложенные друг на друга, — тексты идут рядом, а не строчка в строчку.
⚠ ФОРМУЛИРОВКА РЕШАЕТ, И ВРАТЬ НЕЛЬЗЯ. «Предложение за предложением» — НЕПРАВДА: наш же промт редактора обязывает сливать абзацы (77 строк исходника → 43 абзаца). Соврём — модель будет искать соответствие, не найдёт и потратит БОЛЬШЕ, а не меньше. Говорить только правду: порядок сохранён · перевод покрывает исходник целиком · членение может отличаться · читай оба параллельно и НЕ ищи точных пар предложений.
ВТОРЫМ — мой вариант: тот же кусок, но исходник разбит по предложению на строку (перевод НЕ трогаем, выравнивания НЕ делаем). Детерминированно, $0.
Гонять лучше все четыре комбинации (инструкция вкл/выкл × разбивка вкл/выкл) на одном материале: тогда видно, что решает — слова или форма подачи. Всё равно копейки.
⚠⚠ РИСК, КОТОРЫЙ ЗАМЕР ОБЯЗАН ПРОВЕРИТЬ НАРАВНЕ С ТОКЕНАМИ. Фраза «перевод покрывает исходник целиком» может заставить критика ПЕРЕСТАТЬ ИСКАТЬ ПРОПУСКИ, а потерянный факт — один из главных классов нашей рубрики. Выигрыш в токенах, купленный слепотой к целому классу дефектов, — это не выигрыш. Поэтому в пре-рег отдельной строкой: считать долю находок класса «пропущено/потеряно» до и после, и падение этой доли считать ПРОВАЛОМ варианта, даже если токены упали.
Смотрим ТРИ вещи:
- токены размышления — упали или нет (Г1в/Г1);
- находки в целом — те же, лучше или хуже (Г2);
- находки класса «пропущено» — не исчезли ли (риск выше).
Если упали при тех же находках — гипотеза жива, и тогда имеет смысл строить разметку (Г1б). Если нет — вся ветка закрывается, и мы экономим себе месяц проектирования. Это и есть цель шага: закрыть ветку дёшево, а не подтвердить её дорого.
⚠ Обещание «минус треть цены конвейера» СНЯТО: оно висело на неподтверждённом. ⚠ Пре-рег обязателен: что считаем «те же находки». Сравнение — по адъюдикации, а не на глаз.
ШАГ 2б — Г1г: ЭМБЕДДИНГОВОЕ ВЫРАВНИВАНИЕ, ЕСЛИ ДЕШЁВОЕ НЕ СРАБОТАЛО ($0)
Гонится ТОЛЬКО если шаги 2 и 2а не дали адресации. Инструмент локальный, вызовов к API нет вовсе.
Что уже есть на машине (проверено): sentence-transformers, torch+cpu, 16 ядер, GTX 1070;
в кэше лежат LaBSE, bge-m3, Qwen3-Embedding-0.6B. Кандидаты-алгоритмы: vecalign
(динамическое программирование по эмбеддингам, умеет МНОГИЕ-КО-МНОГИМ) и BERTalign (на LaBSE,
авторы целились в художественную прозу). Gale-Church по длинам для zh↔ru слабая.
⛔ ОГРАНИЧЕНИЕ ПРОДА: в облаке только CPU + диск, GPU нет. Поэтому:
- выравнивание — НЕ горячий путь, один раз на книгу, результат на диске;
- объём режется: эмбеддить смысловые ходы (43–78 на кусок), а не предложения · сперва ЯКОРЯ (термины банка, числа, реплики) прибивают опорные точки, эмбеддинги — только на промежутках · модель меньше + int8/ONNX;
- роли разведены: в лаборатории это ИЗМЕРИТЕЛЬ, в проде адреса берутся из номеров смысловых ходов по построению. Прод на эмбеддинги опираться НЕ должен.
Точность мерим БЕЗ ручной разметки, инструментами, которые у нас уже есть: банк терминов (термин в отрезке исходника обязан быть канонной формой в выровненном отрезке перевода) и маржевые посадки (мы сами знаем, куда вставили порчу). ⚠ Чужие цифры качества из статей НЕ переносить: их мерили там, где перевод следует за оригиналом близко, а у нас редактор обязан сливать абзацы.
ШАГ 2а — ЕСЛИ Г1 ПОДТВЕРДИЛАСЬ: РАЗМЕТКА ОТДЕЛЬНЫМ ВЫЗОВОМ (~$0.2)
⛔ Переводчику разметку НЕ поручать — это измеренный класс отказа. Обогащённый черновик получил ОДИН добавленный структурный блок и вернул исходник вместо перевода на 4 главах из 16; запрет D21.6 говорит то же про языковые констрейнты в reasoning-ослабленных путях (эхо 3/10 → 9/10).
Разметку делает отдельный дешёвый вызов-экстрактор: вход исходник + готовый перевод, выход ТОЛЬКО соответствие «номер смыслового хода → первые слова абзаца». Ни строчки текста не переписывает. Безопасно по квирк-бюллетеню (:51): эхо бьёт по переводу, не по JSON-выводу.
Алгоритма сопоставления при этом НЕТ и не нужно. Если ходы пронумерованы на шаге 1, а блоки несут те же номера, соответствие возникает по построению. Проверка разметки детерминированна: каждый номер ровно один раз · порядок монотонный · длина блока в разумном отношении к длине хода · термины банка хода N присутствуют в блоке N. Не сошлось — блок «без адреса», обрабатывается как сейчас.
ШАГ 3 — Г3 (~$0.4)
Монолингвальный языковой критик: только русский текст, исходника нет вовсе. Сравнить его находки по оси ЯЗЫК с находками нынешнего двуязычного. Если не хуже — сличение из этой стадии убирается целиком, а это самая дешёвая экономия из всех возможных.
ШАГ 4 — Г7 + Г8, ПУСТЫЕ КЛЕТКИ АРХИТЕКТУРЫ V6 (~$1.7)
Обе покупаются одним заходом, потому что делят базу:
- Г8: промт однопроходки, собранный НАЧИСТО как роль литературного переводчика с инжектом действий — без мета-фразы про отсутствующего редактора, без следов склейки.
- Г7: её выход + точечная зачистка по классифицированным замечаниям критика.
Это и есть урезанный V6 на одной паре. ⚠ Брать ОБЕ пары: разница zh/en в этой фазе оказалась не языковой, а структурной (выровненность исходника), и на одной паре вывод не встанет.
ШАГ 5 — Г9 + Г10, БАНК (~$0.6)
Пере-собрать банк из выходов однопроходки и из дорогих черновиков, сравнить с нынешним по составу и покрытию. Отдельно — терминолог с РАЗДЕЛЁННЫМИ типами сущностей.
Почему не раньше: банк определяет связность книги на тысячах глав, но эффект его качества наш прибор не видит вовсе — он сравнивает армы при ОДНОМ банке. Значит замер тут не судейский, а детерминированный (состав, покрытие, устойчивость формы), и его надо ставить отдельно от качественных шагов, чтобы не смешать.
ШАГ 6 — Г6, ТРУДНЫЙ АНГЛИЙСКИЙ МАТЕРИАЛ (~$1.5)
Длинные плотные английские главы вместо коротких и чистых. Проверяет, восстанавливается ли согласие счётчика с чтением при широком диапазоне. Разбиение +0.68/+0.42 сделано ПОСЛЕ данных — это разведка, и подтверждать её надо на новом материале, иначе это подгонка.
ШАГ 7 — Г4, КЭШ ($0)
Переложить порядок запросов так, чтобы исходник сцены был общим неизменным префиксом всех стадий.
Замер прямой: доля cached_tokens до и после. Сейчас 44.8%.
ШАГ 8 — ПЕРЕНОСИМОСТЬ ВЫВОДА НА ДРУГУЮ МОДЕЛЬ (~$0.5)
Всё измеренное получено при модели-константе deepseek-v4-pro. Вывод честно звучит «какая
архитектура лучше ДЛЯ ЭТОЙ модели». Прогнать победившую архитектуру на glm-5 и проверить, что
порядок не зависит от жильца. ⚠ Ставить ПОСЛЕ шагов 2–4: пока архитектура не выбрана, переносить
нечего.
ШАГ 9 — СЛЕПОЕ ЧТЕНИЕ ЧЕЛОВЕКОМ НА НОРМАЛЬНОМ n ($0)
Владелец прочёл 1 китайскую главу и 2 английских. Пре-рег П-6 просил 8–12 единиц на ось. Его чтение оказалось ТОЧНЕЕ машинных читателей (взял контроль там, где они провалили), поэтому расширение выборки — самый дешёвый способ усилить решающий эндпойнт. Ограничение известно и названо им самим: это его время.
3. ЧТО ПРОНИЗЫВАЕТ ВСЕ ШАГИ — Г12
Сравнение архитектур по ОДНОМУ прогону запрещено. Это вывод захода Д17, подтверждённый тремя приборами. Любой платный замер выше планируется в ДВУХ генерациях на метод, иначе он померяет шум.
Цена этого честная: ×2 к смете. Альтернатива — мерить и не знать, что померил.
4. ДОЛГИ ФАЗЫ Д — их надо закрыть, но они НЕ курс
Не двигают знание, но без них фаза не сдаётся. Порядок внутри — от того, что искажает выводы, к тому, что искажает отчётность.
- Адъюдикация английской оси — единственное, что блокирует единственный несущий вывод фазы
(H-3 в эскалации).
adjud.pyпрошит на zh, нужна параметризация. $0. - 65 находок ревизии — шаг 1 курса разбирает первую; остальные разобрать там же.
- Секция Д5 — ручная пере-классификация 24 мест. $0.
- Синхронизация отчёта: сводка Д9 противоречит Д15–Д20 в четырёх клетках · Д16 не отражает аннулирование японской пачки Sol её же контролями · деньги в Д17 протухли (напечатана смета $1.06 и потолки $0.65, факт $11.72 из $12.10) · тела эрраты Э-17.1 в отчёте нет.
- Реестр требований: строк на Д17–Д20 нет вовсе, 16 самореферентных улик, R64 красный.
- Пинг в
docs/PROGRESS.mdсекция «Полигон» — последняя запись 15.08. - Селфтесты
sud.pyкрасные на трёх осях (d3 — 4 провала, d6 — 1, d1 — 2), все настоящие, диагнозы в журнале. ⚠MIN_FLOOR["d6"]=3— константа, поставленная под зелень; НЕ править, это вопрос владельцу. E1побайтно равен черновику на 5 единицах из 16 — объявлено в Д14.4, панель без них не пере-считана.- Эррата zh-канона: поправка границы слова живёт в коде, в сохранённый банк не дошла (завышение покрытия +0.0039). Правка закрытой оси — ратифицирует оркестратор.
chtenie.py --score-calibне пере-считывает число −0.10, ради воспроизводимости которого объявлен: печатает только порядок читателя. Долг назван в докстринге, не закрыт.- Пакет второму семейству (Sol) по заходу Д17 — не собирался. Решение владельца нужно: отдавать или объявить заход односемейным явно.
5. ЧЕГО НЕ ДЕЛАТЬ
- Не строить V6 целиком. Пять стадий сразу — это замер, в котором нельзя понять, что сработало. Шаги 2–5 покупают его по кускам, и каждый кусок отвечает на свой вопрос.
- Не выбирать архитектуру по деньгам. Разброс между схемами 15–40%, между временем суток — ровно вдвое. Экономить надо расписанием прогона, решать — качеством.
- Не переносить отрицательные результаты по точечным контурам на V6. Там фиксер чинил дешёвый черновик; в V6 он чинит перевод хорошей модели. Другая работа.
- Не сравнивать числа разных проходов. Рубрика менялась (Д18), прогоны разной строгости.
- Не покупать до пере-снятия прайса, если вендор снова его двинет:
zakhod.price_gateотказывает автоматически, но проверять руками при первом запуске сессии.
6. ЛОВУШКИ, ДОБАВИВШИЕСЯ ЗА ЭТУ СЕССИЮ
- Файл клетки ≠ годная клетка. Считать СОДЕРЖИМОЕ и
finish=stop. Я на этом сел и доложил владельцу «80 клеток куплено», когда годных было 23. - Пред-полётная проба обязательна перед циклом на сотню клеток (
zakhod.preflight): 96 запросов ушли в402и выглядели как успешный прогон. - Оценивать цену клетки ПО СВОЕЙ ПАРЕ, а не по общему пулу: китайская глава впятеро длиннее английской, общая медиана врёт вдвое.
- Раскладка меток в пакете ЧЕЛОВЕКУ — одна на всю пару. Раскладка на отрывок сделала ответ владельца нерасшифровываемым, и его работа пропала.
- Разборщик обязан принимать человеческую форму ответа. Требовать машинной и молча терять ответ — дефект инструмента, а не читателя.
- Пере-эмиссия не имеет права трогать пару, которая уже прочитана. Ключ ДОГРУЖАТЬ.
- Гейт, который не может упасть, ничего не сторожит. Пустая панель в селфтесте — ПРОВАЛ, а не пропуск.
git checkoutповерх грязного дерева запрещён — владелец отказал в пермишене, и правильно.- Обогащение промта ДЕШЁВОЙ модели перевооружает эхо-мину. Замер Д17: мандат перевёрстки,
добавленный к черновику, дал 4 негодные клетки из 16 на zh (модель вернула исходник вместо
перевода) против 1 из 16 в базе. Причина документирована: черновик ходит с
reasoning_effort: low, а запрет D21.6 говорит не вносить языковые констрейнты в промты reasoning-ослабленных путей без per-model замера. Любое обогащение промта на дешёвой модели — только с эхо-гейтом и ре-геном. - Идентичность судей и ЧИТАТЕЛЕЙ персистится ДО запуска. Я закрыл её постфактум
(
READERS-z17.json) — это слабее нормы. У проходаtierотсутствие такого файла сделало причину расхождения в 12 раз НЕВОССТАНОВИМОЙ. - Три инструмента зоны признаны негодными ВНУТРИ ревизии, а гейты числят их зелёными:
promptdiff.py(расхождение матчится по префиксу строки; отсутствующий файл пар-пакета гейт не роняет) ·canon.py(снятая ревью классификация всё равно пишется в артефакт — отсюда негодность Д5) ·material_ja.py(фильтр AI-меток объявлен механическим, кода не существует). Опираться на любой — только после вскрытия. - Д17 отсужен ОДНИМ семейством. Норма П-1 требует двух там, где возможно. Пакет для Sol по заходу НЕ собирался. Все выводы Д17–Д20 стоят на семействе claude плюс чтение владельца.
7. ЧЕМ ЗАКРЫВАЕТСЯ РАБОТА
- Пре-рег ДО каждой покупки, зафризенный коммитом с основанием вслух.
- Мощность (
power.py) напечатана ЧИСЛОМ до денег — не словами. За это уже была девиация Э-17.2. - Гейты зелёные ИЛИ красные с диагнозом; константы под зелень не подгонять.
- Секции в отчёте: следующая свободная — Д21.
- Адверсариальная приёмка другим модельным семейством — она за эту сессию нашла 8 дефектов замера и 4 неверных утверждения в моём же отчёте. Без неё не сдавать.
- Дерево НЕ коммитить, кроме пре-рег-фризов; лендит оркестратор.