Land the second circle: the finding repeats, so the cheap one-pass stays indistinguishable from both the expensive one-pass and the bundle

This commit is contained in:
heaven 2026-08-30 12:04:39 +03:00
parent 8326e35d07
commit 9586020052
2 changed files with 45 additions and 2 deletions

View file

@ -621,7 +621,7 @@
* ⭐⭐ **30.08, Д47 ЗАПУЩЕН ПО САНКЦИИ ВЛАДЕЛЬЦА И ОСТАНОВЛЕН ГАРДОМ ПОСЛЕ ПЕРВОЙ ПАРЫ — А КУПЛЕННОЕ ОКАЗАЛОСЬ ЦЕННЕЕ ЭНДПОЙНТА (Д47.6).** Списано **$0.134804**, ФД-N 3.187585 из 3.30, потолок НЕ поднимался. **Побайтно один промт, одна глава `b065a92dc0`, `reasoning_effort` не слался НИ РАЗУ: 21.08 модель думала 466 токенов, 30.08 — 17 757. ×38.** ⚠⚠ **ПОПРАВЛЕНО В ТОТ ЖЕ ДЕНЬ ПО ВОПРОСУ ВЛАДЕЛЬЦА (Д47.7): подавать ×38 как ЗАМЕРЕННЫЙ СДВИГ ВО ВРЕМЕНИ было нельзя** — это разность двух ОДИНОЧНЫХ розыгрышей у модели с большим разбросом. По лучшей имеющейся оценке (sd логарифма 0.82 ⇒ одно sd = ×2.3, шесть групп «тот же тег, разные розыгрыши», 18 вызовов, судейская роль) ×38 — это ≈3.1 sd: **редко, но возможно ⇒ причина НЕ УСТАНОВЛЕНА**, обе гипотезы живы, а чистых повторов одного промта на роли `onepass` в корпусе НЕТ ни одного. ⛔ **И первый заход к этой оценке был бы десятой ошибкой дня:** я сгруппировал вызовы по «модель·глава·роль», получил 100 групп и «разброс ×11» — а группы смешивают армы `RN`/`RC`/`RB` с РАЗНЫМИ промтами (на `27cb3a7e69`: 7 061 · 498 · 18 043), то есть мерили разницу инструкций, а не розыгрыша. ⇒ **Устояло то, что важнее причины: сравнивать одиночные розыгрыши нельзя ни при какой гипотезе — это осуждает и дизайн А, и МОЙ дизайн Д.** ⭐ Побочно Клейм 1 подтверждён на БОЕВОМ промте: `prompt_tokens` = **3256 и 21.08, и 30.08** (через девять дней и смену сервинга), а `low` двигает их ровно на **79**; гейт провенанса пройден (Δpt=79, кириллица 1.000, латиница 0). **Эндпойнт по правилу: внутри блока ручка дала ×1.40** (меньше ×2.52, полученных через девять дней — конфаунд эффект РАЗДУВАЛ), годных пар 1 из 8, знаковый тест p=1.0 ⇒ ⛔ **«НЕ УСТАНОВЛЕНО»**, добор глав после чисел запрещён. Носитель — `eval/dovodka/stupen.py`, написан ДО прихода клеток, селфтест стережёт, что порог достижим только единогласием. ⛔ **Смета ошиблась на порядок, и это моя восьмая ошибка того же класса:** $0.0780.133 объявлялись ценой ВОСЬМИ пар, одна пара стоила $0.1348 — **я оценил опыт по той самой базе, нестабильность которой опыт и должен был показать**. ⭐ **Цена ответов теперь СЧИТАЕТСЯ, а не угадывается (Д47.8):** при sd логарифма 0.82 парный дизайн ловит эффект ×2.5 за 13 пар (≈$1.1), ×2.0 за 22 (≈$1.8), ×1.4 за 93 (≈$7.6); отдельный дешёвый вопрос «модель сдвинулась или это кости» — четыре повтора без ручки на той же главе, **≈$0.31**. ⛔ **Но приоритет не здесь:** ручка даёт ×1.42.5, а рядом стоит рычаг ×711 — смена модели на `gpt-5.6-luna` (поглавно медиана ×7.1, по сумме ×11.4) — и он упирается НЕ в деньги, а в кап агент-сессий (нужно 16, свободно 14). Тратить доллары на ручку прежде, чем порядковый рычаг прочитан по КАЧЕСТВУ, — плохая экономика. ⚠ Операционное для чужих циклов: отказ гарда возвращает код 1, но в ФОНОВОМ shell `set -e` цикл не остановил — семь итераций вхолостую, $0.
* ⭐⭐ **30.08, ПАНЕЛЬ `luna1` ПРОЧИТАНА ВСЛЕПУЮ ПО САНКЦИИ ВЛАДЕЛЬЦА («Да, давай подниму кап»), $0 (Д48).** Кап 200 → 215, израсходовано 201. Читались ЧЕТЫРЕ арма на 15 главах (16-я выпала: клетка `RN` не прошла гейт годности, пропуск напечатан): однопроходка на `deepseek-v4-pro` · **та же однопроходка на `gpt-5.6-luna`** · боевая связка · **её вторая генерация как собственный шум прибора**. ⛔ **Сначала поправка к моему же предложению:** развилка владельца от 17.08 — про ЧЕРНОВУЮ роль, а её приз пере-считан в Д42.1 как **6%, а не разы** (редактор съедает 85% связки) ⇒ читать «луну как черновик» значило бы потратить кап на шестипроцентный рычаг; читался порядковый (×711). **Результат: средние места `Z0` 2.33 · `ZF` 2.33 · `RN` 2.53 · `RL` 2.80; близнецы расходятся на +0.00 при пороге 1.06 (прибор без смещения), якорь↔`RN` +0.20 при пороге 1.30 (p=0.79), якорь↔`RL` +0.47 при пороге 1.26 (p=0.58), очно `RL` против `Z0` — 6:9.** ⇒ ⭐ **дешёвая луна НЕ ОТЛИЧИМА по качеству ни от дорогого дипсика, ни от связки.**Но: разрешение прибора грубое — два прогона ОДНОГО конвейера расходятся на **1.33 места из 4**, то есть разрыв луны это треть собственного шума; направление, хоть и незначимое, **против** луны; панель не трогает банк/консистентность на всю книгу, цензур-ось жанра и перенос на zh. ⛔ **Это ПЕРВЫЙ круг, вердикта ещё нет — правило конъюнкции требует повтора.** Дисциплина: ключ закоммичен ДО ответов, обёртка — замороженный `15cfac60`, модель читателей сверена ИСПОЛНЕНИЕМ (во всех 15 транскриптах `claude-fable-5`). ⛔ **Второй круг упирается в ОДНУ сессию — моя арифметическая ошибка при подъёме капа** (осталось 14, нужно 15); резать панель до 14 глав решением сессии запрещено.
* ⭐⭐ **30.08, ПАНЕЛЬ `luna1` ПРОЧИТАНА ВСЛЕПУЮ ПО САНКЦИИ ВЛАДЕЛЬЦА («Да, давай подниму кап»), $0 (Д48).** Кап 200 → 215, израсходовано 201. Читались ЧЕТЫРЕ арма на 15 главах (16-я выпала: клетка `RN` не прошла гейт годности, пропуск напечатан): однопроходка на `deepseek-v4-pro` · **та же однопроходка на `gpt-5.6-luna`** · боевая связка · **её вторая генерация как собственный шум прибора**. ⛔ **Сначала поправка к моему же предложению:** развилка владельца от 17.08 — про ЧЕРНОВУЮ роль, а её приз пере-считан в Д42.1 как **6%, а не разы** (редактор съедает 85% связки) ⇒ читать «луну как черновик» значило бы потратить кап на шестипроцентный рычаг; читался порядковый (×711). **Результат: средние места `Z0` 2.33 · `ZF` 2.33 · `RN` 2.53 · `RL` 2.80; близнецы расходятся на +0.00 при пороге 1.06 (прибор без смещения), якорь↔`RN` +0.20 при пороге 1.30 (p=0.79), якорь↔`RL` +0.47 при пороге 1.26 (p=0.58), очно `RL` против `Z0` — 6:9.** ⇒ ⭐ **дешёвая луна НЕ ОТЛИЧИМА по качеству ни от дорогого дипсика, ни от связки.**Но: разрешение прибора грубое — два прогона ОДНОГО конвейера расходятся на **1.33 места из 4**, то есть разрыв луны это треть собственного шума; направление, хоть и незначимое, **против** луны; панель не трогает банк/консистентность на всю книгу, цензур-ось жанра и перенос на zh. ⛔ **Это ПЕРВЫЙ круг, вердикта ещё нет — правило конъюнкции требует повтора.** Дисциплина: ключ закоммичен ДО ответов, обёртка — замороженный `15cfac60`, модель читателей сверена ИСПОЛНЕНИЕМ (во всех 15 транскриптах `claude-fable-5`). ⛔ **Второй круг упирался в ОДНУ сессию — моя арифметическая ошибка при подъёме капа** (осталось 14, нужно 15); резать панель до 14 глав решением сессии запрещено. ⭐⭐ **ВТОРОЙ КРУГ ПРОЙДЕН (кап 215 → 220 по слову владельца, Д48.5): вывод ПОВТОРИЛСЯ, конъюнкция закрыта.** Средние места круг 1 → круг 2: `Z0` 2.33 → 2.20 · `ZF` 2.33 → 2.53 · `RN` 2.53 → 2.60 · `RL` **2.80 → 2.67**; якорь↔`RL` +0.47 (порог 1.26, p=0.58) → **+0.30** (порог 1.11, p=0.77), то есть отставание луны во втором круге даже СОКРАТИЛОСЬ. Круги разведены по норме рига (ответы первого унесены в `krug1/`, второй писал по ТЕМ ЖЕ пакетам; свод первого из подкаталога воспроизвёл прежние числа до сотой); модель всех 30 читателей сверена по транскриптам. ⚠ Регистратор отработал как сторож: пере-заявить те же главы отказался, пока сессии первого круга не закрыты (`ГОНКА СЕССИЙ`). ⇒ **однопроходка на `gpt-5.6-luna` неотличима по качеству от однопроходки на `deepseek-v4-pro` и от боевой связки на 30 слепых чтениях**, при цене ниже в 7.1× по медиане и 11.4× по сумме. ⛔ Переключение — решение владельца, и перед ним стоит незакрытый гейт, названный им самим 16.08: у однопроходки нет черновика, из которого терминолог добывает свидетельства для банка (Д42.3).
**📌 ПИНГ ПОЛИГОНУ от оркестратора №19 (28.08, D39.164) — вендор-вердикт по Gemini для `docs/experiments/00-provider-quirks.md`.**
Материал добыт бэкенд-сессией (curl по вендор-доке, не пересказ), но файл — ВАША зона, поэтому вписываете вы, а не я. Строка 157 сегодня

View file

@ -5217,7 +5217,7 @@ fable-5: медиана ρ +0.52 · среднее +0.55 · глав согла
из сырья больше НЕ ВЫВОДИМА ничем.
**R71 объявляется НЕ ПЕРЕ-СНИМАЕМЫМ на этой машине.** Гейт не правится под зелень (D39.121):
подгонка спрятала бы ровно тот факт, что провенанс покупок держался на файловой системе.
**Класс шире одного гейта:** `eval/dovodka/runs.py:172`=`def judge_of` и `eval/role_topology/absjudge.py:323`=`path.stat().st_mtime` атрибутируют
**Класс шире одного гейта:** `eval/dovodka/runs.py:176`=`def judge_of` и `eval/role_topology/absjudge.py:323`=`path.stat().st_mtime` атрибутируют
судью ответу тем же способом — по mtime файла ответа. Для БУДУЩИХ чтений это работает (файлы
пишутся сейчас), для исторических — атрибуция утрачена там же и тогда же.
**Норма на будущее: время покупки и время ответа писать ПОЛЕМ В АРТЕФАКТ.** Файловая система —
@ -7251,3 +7251,46 @@ ln 38 = 3.64, то есть **примерно 3.1 sd — событие ред
свободных, круг съел 15, осталось **14 — на одну меньше, чем нужно второму кругу**. ⇒ второй круг
требует **+1 сессии** (беру запас: +5). Резать панель до 14 глав решением сессии запрещено, и это
ровно тот случай, когда «подогнать под возможности» было бы подгонкой под результат.
### Д48.5 ⭐⭐ ВТОРОЙ КРУГ ПРОЙДЕН: КОНЪЮНКЦИЯ ЗАКРЫТА, РАЗЛИЧИЙ НЕТ И ВО ВТОРОМ ЧТЕНИИ
Кап поднят 215 → 220 по слову владельца («Ладно, давай»). **Круги разведены по норме рига:**
ответы первого унесены в `krug1/`, второй писал в чистое поле **по ТЕМ ЖЕ пакетам** — править
пакет ради нового пути запрещено, иначе замер сравнил бы разницу промтов, а не разброс прибора.
**Контроль переноса:** свод первого круга из подкаталога воспроизвёл прежние числа до сотой.
⚠ Регистратор при этом отработал как сторож: пере-заявить те же главы он **отказался**, пока
сессии первого круга не закрыты (`⛔ ГОНКА СЕССИЙ`) — гейт, поставленный после того, как пак 23
потерял соответствие голосов и сырья на пяти единицах.
| арм | круг 1 | круг 2 |
|---|---|---|
| `Z0` связка | 2.33 | **2.20** |
| `ZF` её близнец | 2.33 | **2.53** |
| `RN` однопроходка dspro | 2.53 | **2.60** |
| `RL` **однопроходка luna** | 2.80 | **2.67** |
| контраст | круг 1 | круг 2 |
|---|---|---|
| близнецы `Z0``ZF` (собственный шум) | +0.00 при пороге 1.06 | 0.33 при пороге 1.20 |
| якорь ↔ `RN` | +0.20 · порог 1.30 · p=0.79 | +0.23 · порог 1.29 · p=0.79 |
| якорь ↔ `RL` | +0.47 · порог 1.26 · p=0.58 | **+0.30** · порог 1.11 · p=0.77 |
| \|Z0ZF\| по главам | 1.33 из 4 мест | 1.53 из 4 мест |
⇒ ⭐⭐ **ВЫВОД ПОВТОРИЛСЯ, И ЭТО ЗАКРЫВАЕТ КОНЪЮНКЦИЮ: разницы нет ни в одном круге, ни по одному
контрасту.** Оба круга дают одно и то же и в знаке, и в порядке величины; отставание `luna`
во втором круге даже **сократилось** (0.47 → 0.30), то есть направление первого круга держится
слабее, чем сам разброс прибора. **Однопроходка на `gpt-5.6-luna` неотличима по качеству от
однопроходки на `deepseek-v4-pro` и от боевой связки — на 30 слепых чтениях, двумя независимыми
кругами.**
**Что по-прежнему НЕ доказано, и формулировка тут важнее вывода.** «Неразличимо» остаётся
утверждением о РАЗРЕШЕНИИ прибора: два прогона одного конвейера расходятся по главам на 1.331.53
места из четырёх, и всё, что тоньше ~1.11.3 места, невидимо. Ограничения Д48.3 (банк и
консистентность на всю книгу · цензур-ось жанра · перенос на zh · отсутствие грубого декоя) вторым
кругом НЕ сняты — он проверял воспроизводимость, а не расширял охват.
**Что это значит для денег.** По поглавным ценам панели `luna` дешевле `deepseek` в **7.1× по
медиане и 11.4× по сумме**, а боевая связка дороже однопроходки ещё кратно (редактор — 85% её
цены, Д42.1). ⛔ **Решение о переключении — владельца**, и перед ним стоит один незакрытый гейт,
названный им же 16.08: у однопроходки нет черновика, из которого терминолог добывает свидетельства
для банка (Д42.3). Замер качества этот гейт не отменяет и не трогает.