textmachine/docs/archive/PROGRESS-2026-08-10-15.md

26 KiB
Raw Permalink Blame History

Слайс хроники: полигон, фаза Д — записи 10.08 и 15.08 (сессии №1 и №2)

Архив. Инструкции отсюда НЕ исполнять, при онбординге НЕ читать — только по конкретной ссылке. Вынесено оркестратором №18 22.08 из docs/PROGRESS.md секции «Полигон» — исполнено предписание, которое эта же секция несла с 20.08: «запись ПРОТУХЛА трижды и её надо срезать».

Читать через три поправки, снятые аудитом доков 22.08 (тела ниже НЕ переписаны — D23.3):

  1. Потолок фазы. Числа $6.85 и $5.901 ниже — снимок одной журнальной записи, а не цепь. Фактическая цепь потолков и касса живут в коде зоны: eval/dovodka/money_d.py (PACK_CEILING, CEILINGS), и там же видны позднейшие санкции владельца. Сверять ТАМ, не здесь.
  2. «Открыто на владельце». Пункты про японскую ногу H-4 и про замену ja-книги ЗАКРЫТЫ: нога куплена и отсужена (тело — docs/experiments/23-editor-tier.md, Д16), СТОП снят владельцем 15.08 (D39.136). Живым из этого списка остаётся возражение Sol по проходу tier.
  3. «Долги сессии №2» и «Долги полигона». Список перечисляет как незакрытое то, что зона с тех пор сделала (гейт наклона живёт в eval/dovodka/naklon.py, часть контролей починена). Пере-проверять прежний список дороже, чем снять его заново: живые долги полигон объявляет при лендинге петель.

Живое состояние фазы Д — в зоне полигона (eval/dovodka/PLAN-22-08.md и соседние планы), приёмка фазы — у ПАРАЛЛЕЛЬНОГО оркестратора. Живые пинги по этой теме остались в ../PROGRESS.md.

ФАЗА Д — СТАТУС НА ВЕЧЕР 10.08 (сессия передана, хендофф /home/ubuntu/CONTINUATION_PROMPT.md).Запись ПРОТУХЛА трижды и её надо срезать при лендинге петель (свип доков 20.08): статус «на вечер 10.08» лежит поверх записей от 15.08, хендофф указывает ВНЕ репозитория (файл на месте, но от 10.08 и вне git — то есть не переживёт машину), а в дереве с 16.08 живёт незадокументированная работа (eval/dovodka/PLAN-16-08.md, PLAN-17-08.md, HANDOFF-21-08.md, ja6.py, naklon.py), которой в этой секции нет вовсе. Три поколения записей в одном месте — именно то, из-за чего состояние фазы Д сегодня нельзя прочитать. Куплено: арм A1 (флаговый edit-контур) 30/30 платных клеток, $0.226944; A3 (смысловой критик, ставка владельца H-2б) в работе. Пакет $0.234846 из $4.50. Четыре коммита: правки ригов 22/23 по приёмке №16 и трём линиям ревью · фриз пре-рега Д0 · фриз харнесса контура · починка тихого увода покупок в чужой каталог.

ГЛАВНОЕ ДЛЯ ОРКЕСТРАТОРА: несущий вывод пака 23 по проходу tier получил внешнее возражение и НЕ должен ратифицироваться в нынешнем виде. Владелец прогнал судью вне семьи Claude (Sol 5-6) по тем же заданиям: принято 16/16, декой пойман 16/16, и gpt-5.6-terra оказался ЛУЧШЕ боевого редактора на +8.69 при пороге 2.60 (p=0.0002), тогда как агенты Claude дали +0.50 при пороге 1.02. Расхождение переживает все три нормировки рига (контраст внутри единицы · порог из своего пола · декой как единица), то есть оно СОДЕРЖАТЕЛЬНОЕ, а не шкальное. Разбирательство восьми агентов: направление у обоих судей одинаковое; 74 из 100 находок Claude лежат ВНУТРИ находок Sol при случайном уровне 0.14 (p=0.0000) — Claude ⊂ Sol; чтение исходника показало в тексте боевого редактора реальные инверсии смысла, которым Claude поставил ноль с пустым обоснованием (箭在弦上,不得不发 → «Стрела уже слетела с тетивы»); 47 из 128 клеток Claude ровно нулевые, 31 из них без обоснования. Плюс два дефекта рига, задекларированные в коде самого пака 23: floorA побайтно равен арму T1 в 16/16 — то есть порог, которым судят контраст T1 vs R0, построен из клетки, которая и ЕСТЬ T1; донор декоя в tier во всех единицах — R0. Семейное предпочтение (разошёлся ровно арм OpenAI) не доказано и не опровергнуто. Свод — ~/books/dovodka/razbiratelstvo-sudi-10-08.txt. Решение «пере-судить починенным ригом или оставить с записанным возражением» — за владельцем.

Дефект кассы, который стоит знать всем пакам: eval/role_topology/buy.py — СИНГЛТОН в sys.modules, и побеждает тот, кто настроил его последним. Харнесс фазы ставил свой каталог, а грузившийся следом panel.py пака 23 перебивал обратно на свой — оплаченные клетки уходили в ЧУЖОЙ каталог, касса фазы показывала $0 при потраченных $0.0556, а цикл покупки 20 минут ждал файла, который в её каталоге не появился бы никогда. Починено ассертом BUY.OUT == касса в модуле и в селфтесте; всякий новый харнесс обязан нести этот ассерт.

ФАЗА Д «ДОВОДКА ЭКСП-22/23» — ИДЁТ (10.08). Заказ docs/POLYGON_EXP2223_REDO_SESSION_PROMPT.md, пре-рег Д0 в docs/experiments/23-editor-tier.md, код eval/dovodka/. ⚠ Потолок фазы ПОДНИМАЛСЯ владельцем по ходу напрямую полигону («мы с ним в синке», слово 15.08); последняя журнальная запись — $6.85, промт несёт свою цепь — ФАКТИЧЕСКУЮ цепь сверить при лендинге петель (приёмка фазы — параллельный оркестратор).

Три поправки к уже сданным числам, которые оркестратору надо знать при ратификации.

  1. Счёт агент-сессий эксп-23 = 58, не 50 — репликация §12а выпадала из счёта в §6 и §14 п.9; обе строки поправлены. Счётчик капа в паке 23 НЕ работал (на диске 20 записей против 58 фактических): log_run звался из --ingest, то есть после суб-агента. В фазе Д починено механизмом — eval/dovodka/runs.py пишет ДО запуска, атомарный замок с проверкой живости PID, селфтест 16/16.
  2. p эксп-23 пере-считаны ТОЧНО. При n>20 риг брал Монте-Карло, и одна величина печаталась как 0.1603 и как 0.1608. Перевесы целые ⇒ точный ответ берётся динамикой мгновенно: 0.1601 (боевой прогон и runA), 0.3339 (runB). Вердикты не двигаются.
  3. Регекс банка ловил корень в СЕРЕДИНЕ чужого слова («Го-РОд Цинчжоу» под канон «род Цинь») — 30 ложных из 2113 = 1.4%. Починено границей слова; печатные числа покрытия НЕ изменились (кап min(hits, n) их поглощал), и в verify22 заведён сторож покрытия — прежде эти 18 чисел не сторожил никто.

Адверсариальное ревью трёх линий (снизу вверх · сверху вниз · приёмка Fable-5 — разрешение D39.120 наконец использовано). 25 находок, 4 блокера, все подтверждены исполнением. Крупнейшие: MDE в пре-реге не нёс поправку Холма ⇒ две оси были объявлены несущими, будучи недомощными по построению (тот же класс, что en-ось эксп-22); done() журнала шла мимо замка и теряла 19 записей claim из 20; крючки судейского рига протекали между паками (эксп-22 молча читал каталоги эксп-23); счётчик «сам-себя» в conformance.py не срабатывал никогда. Всё исправлено до покупок.

Пробел заказа, найденный приёмкой другого семейства: дизайн фазы не отвечал на H-1 и H-4. Заведены армы A6 (dspro-черновик + контуры) и E6 (второй редактор на en); владелец поднял потолок под них. H-4 остаётся ОПИСАТЕЛЬНОЙ — при n=16 порядок жильцов не разрешается, объявлено до денег.

(Пинг о мёртвой ссылке ..._DOVODKA_... — ИСПОЛНЕН: все носители ведут на ..._REDO_....)

(СТОП по ja-оси — СНЯТ владельцем 15.08: книга заменена на enkan_no_hate_ja, D39.136.)

(Закрытые записи эксп-22/23 — хроника закрытия, инциденты приёмки, починки приборов — в archive/PROGRESS-2026-08-14-15.md; вынесено 16.08. ЖИВОЕ из них: CONFIRM/DENY-листы владельцу — ИТОГ отчёта 22 и §14 отчёта 23 (вход ратификации фазы Д) · предложения-в-норму АБСОРБИРОВАНЫ: «сверка с буквой заказа»/чек-листы — D39.141, «обязательство с адресатом вне зоны закрывается файлом ВНЕ зоны» — закон роли 16.08, «шумовой пол парой разных сессий» — норматив рига фазы Д в её промте.)

Запись оркестратора №16, 10.08 — ПРИЁМКА ЭКСП-22/23 ПРОВЕДЕНА, дерево залендено, фаза Д заказана. Верификация: 11 агентов, 105 проверок — все несущие числа обоих паков воспроизведены из сырья МИМО харнесса (деньги до цента, провенанс до секунд, leave-one-out по судейским сессиям устойчив), фальсификаций нет; находки приёмки и чек-лист поправок тел — §Д8 промта фазы Д (крупнейшая: интерпретация §15 эксп-22 опровергнута — 5 из 6 клеток суть пойманные гейтом эхо-первые-попытки, судились ре-гены). Поправки к пингу выше (чужой текст не редактирую): сессий по паку 23 = 58, не 50; декой-правило сессия применяла к себе дважды, не трижды; тир-абзац закрывает ограничение (1), не (2) — Резерв D39.22 сессией как раз не решён, отдан владельцу. Владелец 10.08: санкции/лимиты/мандат эксп-23 подтверждены задним числом; постановка признана неполной ⇒ выводы обоих паков НЕ ратифицированы, заморожены до фазы Д (добивка gemini ретрай-харнессом · внешняя подпись tier · несущие оси en/ja · edit-контур — ставка владельца · канон-вскрытие с вопросом судье · поправки тел). Декой-правило и обязательный кросс-семейный опровергатель приёмки одобрены владельцем — в D-ноту при ратификации. Гейт conformance.py аннулирован подтверждённо (реестр жил в scratchpad); в фазе Д реестры — только в git.

(Закрытые блоки полигона — экспы 18/19/20, эксп-21, банк-арбитраж — в archive/PROGRESS-2026-08-04-09.md, D39.125.)

(секция параллельной сессии — записи добавлять сюда)

15.08 · ФАЗА Д — сырьё снято, выводы ПОНИЖЕНЫ финальным аудитом. НЕ закрыта.

Куплено и отсужено: ось Д3 en→ru (7 армов × 16 ед., пол, банк 25 терминов, контам-проба жильцами) · ось Д6 ja→ru разведка (3 арма × 9 ед.) · Д1 добивка gemini 15/16 с журналом попыток · Д7 самооценка 6 клеток · Д5 канон-вскрытие 24 записи. Расход фазы $5.901 по фазам ФД-A…ФД-G (второй путь — сумма cost_usd по 563 клеткам dv-*.json, сходится). Агент-сессий 50 из 80. Отчёт — 23-editor-tier.md Д1/Д3/Д6/Д7/Д9/Д10/Д11.

Что аудит (адверсариальный, другое модельное семейство + свой пере-счёт) снял с фазы:

  1. Д2 БЫЛ ЗАКРЫТ ВАШИМИ РУКАМИ, а отчёт объявлял его открытым («каталог ответов пуст»). ~/books/editor-tier/sol-tier — 16 ответов Sol, sol-border — 32. Пере-счёт solscore.py tier: T2 vs R0 +8.69, p=0.0002, РАЗЛИЧИМ при пороге 2.60 — тогда как семейство Claude дало +0.50 ниже порога. Это и есть записанное возражение Sol, и оно ПРОТИВОРЕЧИТ несущему выводу пака 23. Требует вашего слова: пере-судить tier починенным ригом или оставить с записанным возражением.
  2. Ось Д4 пере-классифицирована в ОПИСАТЕЛЬНУЮ по её же пре-регу (свой пол 2.21 хуже прайора 2.12; правило Э-3/Д0.3 требовало пере-классификации «тогда же»). H-2а и H-2б больше не несущие выводы. Семейства при этом разошлись (claude 2.21 · sol 3.11, эскалация к адъюдикации с дефектными контролями).
  3. H-3 «на en перепис не нужен» — ОПРОВЕРГНУТА, вывод держится: E0/D0 +1.56, p=0.0059, выше порога и с поправкой на позиционный наклон.
  4. Загрязнения: E3 на 5 ед. из 16 = нетронутый черновик (пустые клетки критика), E4 побайтно равен эталону на 12 из 16; заявление «E4 вдвое дешевле» снято как ложное.
  5. Половины шумового пола совпадают побайтно (ja 3 из 6, en 1 из 10) — дефект «близнеца» воспроизведён, пороги были занижены.

15.08 ВЕЧЕР — ВТОРОЕ СЕМЕЙСТВО ЗАКРЫТО ПО ВСЕМ ТРЁМ ОСЯМ (Sol, прогон владельца): ja CONFIRM (claude +2.83 порог 2.10 · sol +3.28 порог 2.97 — оба перешли) · en ЭСКАЛАЦИЯ К АДЪЮДИКАЦИИ (claude перешёл, sol нет: его пол вдвое шире) · gemini не подтверждено ни одним (0.10 против +2.53, оба ниже порога). Контроли Sol чисты: 32/32 · 18/18 · 30/30. Единственное двухсемейное подтверждение фазы пришло с РАЗВЕДОЧНОЙ японской оси.

15.08 ВЕЧЕР · СЕССИЯ №2 — СКВОЗНОЙ АУДИТ ДУГИ 19→23 И ПЕРЕ-СУДЕЙСТВО tier.

Заказ владельца: пройти линию свежим взглядом, закрыть гипотезы качественно, задать вектор; плюс 15.08 «пересудить тир, но не подгонять — понять, кто ошибается из судей». Аудит: 6 карт документов + 8 лан пере-счёта МИМО харнесса + критик полноты; каждая находка пере-проверена исполнением, а не принята со слов. Новая оснастка eval/dovodka/gain.py, tier2.py, ja6.py.

ГЛАВНОЕ — прибор, а не модели.

  1. Строгость счёта судьи есть свойство ПРОГОНА. Тот же арм R0, те же 16 единиц, то же семейство, подписи текста совпадают 16/16: проход tier дал 0.69 ошибки/ед. при 9 нулях из 16, border — 4.31 при нуле нулей; по-единично ниже в 15 из 16. Размах внутри claude 1.41…6.47. ⇒ межпроходные сравнения абсолютных чисел недействительны (в т.ч. «дешёвая модель на японском проваливается сильнее» — разные прогоны) и заимствованные пороги тоже.
  2. Патология НЕ общая: нулей tier 38% · Д3 10% · Д6 3% · border 0 · Д4 zh 2 из 713 · Д1 0. По сессиям выбиваются ровно две (д-52 24%, д-55 21%). Выводы Д4/Д1/border чисты.
  3. tier ПЕРЕ-СУЖЕН починенным заданием (пре-рег зафризен a03ac66 ДО первого ответа; те же тексты, новый ключ, старый не тронут). Плотность 0.69→3.44 на R0, нулей 6% против 38%, пустых обоснований 0 против 31. Впервые есть гейт чувствительности: маржевый декой +2.50 против порога 1.84 — ПРОЙДЕН. Вердикт: T1 0.12 · T2 +1.06 · T3 +0.50 — все ниже порога; контроль R0 vs F 3.12 p=0.0042. ⇒ несущий вывод эксп-23 «сильный тир не отличим» ВОССТАНОВЛЕН и впервые стоит на приборе с доказанной чувствительностью.
  4. Возражение Sol снято, и владелец назвал причину: Sol = gpt-5.6-sol, семейство OpenAI; арм T2 = gpt-5.6-terraТА ЖЕ семья. Sol дал T1 +0.06 · T3 0.12 · T2 +8.12 — разницу нашёл только у своей семьи, что запрещено D13.3. На Д3/Д4/Д6/Д1/border армов OpenAI нет, судейство Sol там чистое. Заражён ровно один контраст дуги — спорный.

СОДЕРЖАТЕЛЬНОЕ — разложение контрастов ПО ОСЯМ, за всю дугу не делалось ни разу: A3/A0 1.87 = ВЕРНОСТЬ 0.26 + ЯЗЫК 1.61 · A6/A0 1.06 = ВЕРНОСТЬ +0.12 + ЯЗЫК 1.19 · E0/D0 +1.25 = ВЕРНОСТЬ +0.94 + ТЕРМИН +0.75 + ФОРМА +0.69 + ЯЗЫК +0.31 · J0/J2 ВЕРНОСТЬ 0.00. ⇒ контуры проигрывают переписи ПРОЗОЙ, а не смыслом; A6 (носитель H-1) по смыслу не хуже боевой связки; H-3 опровергнута только в слове «ТОЛЬКО» — больше половины того, что редактор покупает на en, есть синк глоссария и вёрстка, ровно как гипотеза и говорила. Вектор: решает ось ЯЗЫК, и её не вытягивает ни один точечный контур (трогает 0.23.7% знаков) — искать надо сплошную дешёвую переработку прозы. Такого арма в дуге 19→23 нет ни одного.

Починено: контроли адъюдикации (4 дефекта, включая необъявленный: окно резалось по norm(), без пунктуации и регистра; гейт adjud.py --controls) · селфтест sud.py перестал быть прибит к панели d4 и сразу поймал клетку finish=length, ушедшую судьям на оси Д1 (без неё claude 0.100 → +0.000, вердикт не двигается) · itog_d4.py --fam=sol снова считает несущую ось и печатает ПОЛНУЮ цену единицы (A3 0.01546 = 2.56× боевой связки, а не 0.00644; «кандидат в прод вдвое дешевле» ЛОЖНО — он в 1.52.4 раза дороже).

ДЕНЬГИ — ДЕФЕКТ ИЗМЕРИТЕЛЯ, найден по реплике владельца. roster.cost() ВЫЧИСЛЯЕТ cost_usd из зашитого пина (25.07), провайдер сумму не возвращает. DeepSeek подорожал, прайс не пере-снят ⇒ $6.05 — это «сколько стоило бы по июльскому прайсу», а не списанное; DeepSeek 61% расхода. Пере-счёт точен и бесплатен (в клетках лежат все токены). Владелец с оркестратором пере-снимают цены. Отдельно: последняя цифра потолка, приписанная слову владельца в файлах, была $4.50, а расход дошёл до $6.00 — цепь подъёмов прошла самопроверки, потому что фриз-гейт сверяет ПОКУПАЮЩИЙ файл, а не кассу. Санкция 15.08 «сколько нужно» записана числом $6.85.

Куплено: японская нога H-4 (J6 = glm-5 на ja, 9 клеток $0.046, все finish=stop) + свой пол ноги. Судейство ноги — следующим шагом, СНАЧАЛА своим семейством, потом пакет Sol (порядок по слову владельца).

Долги сессии №2: судейство ja-ноги · адъюдикация en (контроли починены, прогона нет) · гейт наклона · 19 улик реестра вида «греп своего отчёта» · 131 находка внутренней ревизии не сверена с телом отчёта · Д5 объявлена НЕИСПОЛНЕННОЙ (классификация мест оказалась мусором) · E1 побайтно равен черновику на 5 единицах из 16 и нигде не объявлен.

Открыто на владельце: решение по возражению Sol по tier (расхождение +8.69 против +0.50) · японская нога H-4 (второй редактор на ja не покупался, ~$0.05) · санкция замены ja-книги (enkan_no_hate_ja вместо isekai_majutsushi_jp; в CURRENT-STATE до сих пор висит как СТОП).

Долги полигона: селфтест sud.py падает на всех трёх новых осях · гейт наклона не построен · conformance красный (58 требований без улик, 3 провала) · ФД-C потрачено $0.3348 против закоммиченного потолка $0.300 (подъём до $0.360 не закоммичен) · дерево НЕ закоммичено, кроме фризов покупающего кода — лендит оркестратор.