Retract the time-shift reading of the thirty-eight-fold gap: it is three sigma against the only spread estimate we have, and price the repeats that would settle it
This commit is contained in:
parent
8837a0aa02
commit
6d85a91b20
4 changed files with 70 additions and 16 deletions
|
|
@ -619,7 +619,7 @@
|
|||
|
||||
* ⭐⛔ **30.08, ПОСЛЕ КОМПАКТА: КЛЮЧИ ПОЧИНЕНЫ ВЛАДЕЛЬЦЕМ, ПРОБНАЯ КЛЕТКА КУПЛЕНА ($0.038276) — И ГЛАВНОЕ ОНА ОТДАЛА БЕСПЛАТНО (Д45.5, Д46).** Несущая улика — не размер размышления, а **входные токены**: при побайтно одинаковых `messages` (sha256 сверен исполнением) вызов без параметра дал `prompt_tokens` **3270**, вызов с `reasoning_effort:"low"` — **3191**, то есть **−79**. **Два контроля детерминизма:** замер 05.08 (дефолт и `low` вернули ОДИНАКОВЫЕ 2124) и пред-полётные пробы самого рига (`84 · 84 · 84 · 84` на одном тривиальном запросе, четвёртая куплена 30.08 — то есть **дефолтный счёт входа не сдвинулся через смену вендорского сервинга**). ⇒ **параметр `low` на `deepseek-v4-pro` ТЕПЕРЬ ДОХОДИТ ДО МОДЕЛИ**, статус квирк-бюллетеня «НЕ УСТАНОВЛЕНО» закрыт в части «доходит ли» (новая запись **3г**). ⛔ **ВЕЛИЧИНА среза — НЕТ, и это находка против моего же пре-рега:** `RN` куплен 21.08, `RNL` — 30.08, а между блоками лежит **документированная смена вендорского сервинга** (её же зафиксировала вахта Д44) — сравнение приписывает ручке всё, что вендор поменял за девять дней; дрейф из §3б — второй конфаунд и слабее (у него есть знак, и он работает против нуля). Раздел Д45.3 «чего замер не закроет» не назвал НИ ОДНОГО — **дефект найден пере-чтением ПОСЛЕ фриза `87dd124`, печатаю против себя**. ⇒ ⭐ **Лечение одно: оба арма в ОДНОМ блоке вперемежку — и такой замер КУПИТЬ МОЖНО, вчетверо дешевле замороженного:** дизайн Д (интерливинг `RN2` против `RNL` на восьми дешёвых главах) стоит **$0.078–0.133** при свободных $0.2472, n=8 пар, минимальный двусторонний p = 0.0078; гард кассы его пропускает (проверено по коду, гард не тронут). **Пре-регистрация — Д47, заморожена коммитом, ⛔ НЕ КУПЛЕНО: санкция владельца была на ДРУГОЙ дизайн, переносить её я не вправе.** Рекомендация: пятнадцать клеток по фризу Д45 (дизайн А) **не покупать ни при каком ответе**; Д47 — по его слову. ⚠ **Первая редакция Д46 утверждала обратное — «ни один неконфаундированный дизайн не влезает» — и это было НЕВЕРНО** (пропущена дешёвая восьмёрка, при том что бимодальность нашла та же секция); сломал адверсариальный проход, разбор и цена ошибки — **Д46.6**, там же единственная находка прохода, которую я ОТКЛОНИЛ (корреляция по порядку вызовов: у всех 16 клеток `RN` один mtime, порядка не существует). Боевая ступень редактора **не тронута** (`eval/tenant_panel/roster.py` — правлен только комментарий, который до сегодня объяснял выбор снятой посылкой; гейт пака пере-снят, расхождение то же единственное mtime-шное).
|
||||
|
||||
* ⭐⭐ **30.08, Д47 ЗАПУЩЕН ПО САНКЦИИ ВЛАДЕЛЬЦА И ОСТАНОВЛЕН ГАРДОМ ПОСЛЕ ПЕРВОЙ ПАРЫ — А КУПЛЕННОЕ ОКАЗАЛОСЬ ЦЕННЕЕ ЭНДПОЙНТА (Д47.6).** Списано **$0.134804**, ФД-N 3.187585 из 3.30, потолок НЕ поднимался. **Побайтно один промт, одна глава `b065a92dc0`, `reasoning_effort` не слался НИ РАЗУ: 21.08 модель думала 466 токенов, 30.08 — 17 757. ×38.** Конфаунд, которым я двумя часами раньше обосновывал отказ от дизайна А, теперь ЗАМЕРЕН, а не выведен: пятнадцать клеток, сравнённых с августовским `RN`, дали бы число, целиком утонувшее в этом сдвиге. ⚠ При n=1 «сдвиг во времени» и «разброс розыгрыша на побайтно одном входе» (квирк п.2) неразличимы — и **второе чтение обвиняет уже МОЙ дизайн**: один розыгрыш на главу такого шума не переиграет. ⭐ Побочно Клейм 1 подтверждён на БОЕВОМ промте: `prompt_tokens` = **3256 и 21.08, и 30.08** (через девять дней и смену сервинга), а `low` двигает их ровно на **−79**; гейт провенанса пройден (Δpt=79, кириллица 1.000, латиница 0). **Эндпойнт по правилу: внутри блока ручка дала ×1.40** (меньше ×2.52, полученных через девять дней — конфаунд эффект РАЗДУВАЛ), годных пар 1 из 8, знаковый тест p=1.0 ⇒ ⛔ **«НЕ УСТАНОВЛЕНО»**, добор глав после чисел запрещён. Носитель — `eval/dovodka/stupen.py`, написан ДО прихода клеток, селфтест стережёт, что порог достижим только единогласием. ⛔ **Смета ошиблась на порядок, и это моя восьмая ошибка того же класса:** $0.078–0.133 объявлялись ценой ВОСЬМИ пар, одна пара стоила $0.1348 — **я оценил опыт по той самой базе, нестабильность которой опыт и должен был показать**. Доделать дизайн сегодня ≈$0.94 (подъём ФД-N на ~$0.85, резерв пака $1.09 покрывает) — **не рекомендую**, нужен пак с несколькими розыгрышами на главу. ⚠ Операционное для чужих циклов: отказ гарда возвращает код 1, но в ФОНОВОМ shell `set -e` цикл не остановил — семь итераций вхолостую, $0.
|
||||
* ⭐⭐ **30.08, Д47 ЗАПУЩЕН ПО САНКЦИИ ВЛАДЕЛЬЦА И ОСТАНОВЛЕН ГАРДОМ ПОСЛЕ ПЕРВОЙ ПАРЫ — А КУПЛЕННОЕ ОКАЗАЛОСЬ ЦЕННЕЕ ЭНДПОЙНТА (Д47.6).** Списано **$0.134804**, ФД-N 3.187585 из 3.30, потолок НЕ поднимался. **Побайтно один промт, одна глава `b065a92dc0`, `reasoning_effort` не слался НИ РАЗУ: 21.08 модель думала 466 токенов, 30.08 — 17 757. ×38.** ⚠⚠ **ПОПРАВЛЕНО В ТОТ ЖЕ ДЕНЬ ПО ВОПРОСУ ВЛАДЕЛЬЦА (Д47.7): подавать ×38 как ЗАМЕРЕННЫЙ СДВИГ ВО ВРЕМЕНИ было нельзя** — это разность двух ОДИНОЧНЫХ розыгрышей у модели с большим разбросом. По лучшей имеющейся оценке (sd логарифма 0.82 ⇒ одно sd = ×2.3, шесть групп «тот же тег, разные розыгрыши», 18 вызовов, судейская роль) ×38 — это ≈3.1 sd: **редко, но возможно ⇒ причина НЕ УСТАНОВЛЕНА**, обе гипотезы живы, а чистых повторов одного промта на роли `onepass` в корпусе НЕТ ни одного. ⛔ **И первый заход к этой оценке был бы десятой ошибкой дня:** я сгруппировал вызовы по «модель·глава·роль», получил 100 групп и «разброс ×11» — а группы смешивают армы `RN`/`RC`/`RB` с РАЗНЫМИ промтами (на `27cb3a7e69`: 7 061 · 498 · 18 043), то есть мерили разницу инструкций, а не розыгрыша. ⇒ **Устояло то, что важнее причины: сравнивать одиночные розыгрыши нельзя ни при какой гипотезе — это осуждает и дизайн А, и МОЙ дизайн Д.** ⭐ Побочно Клейм 1 подтверждён на БОЕВОМ промте: `prompt_tokens` = **3256 и 21.08, и 30.08** (через девять дней и смену сервинга), а `low` двигает их ровно на **−79**; гейт провенанса пройден (Δpt=79, кириллица 1.000, латиница 0). **Эндпойнт по правилу: внутри блока ручка дала ×1.40** (меньше ×2.52, полученных через девять дней — конфаунд эффект РАЗДУВАЛ), годных пар 1 из 8, знаковый тест p=1.0 ⇒ ⛔ **«НЕ УСТАНОВЛЕНО»**, добор глав после чисел запрещён. Носитель — `eval/dovodka/stupen.py`, написан ДО прихода клеток, селфтест стережёт, что порог достижим только единогласием. ⛔ **Смета ошиблась на порядок, и это моя восьмая ошибка того же класса:** $0.078–0.133 объявлялись ценой ВОСЬМИ пар, одна пара стоила $0.1348 — **я оценил опыт по той самой базе, нестабильность которой опыт и должен был показать**. ⭐ **Цена ответов теперь СЧИТАЕТСЯ, а не угадывается (Д47.8):** при sd логарифма 0.82 парный дизайн ловит эффект ×2.5 за 13 пар (≈$1.1), ×2.0 за 22 (≈$1.8), ×1.4 за 93 (≈$7.6); отдельный дешёвый вопрос «модель сдвинулась или это кости» — четыре повтора без ручки на той же главе, **≈$0.31**. ⛔ **Но приоритет не здесь:** ручка даёт ×1.4–2.5, а рядом стоит рычаг ×7–11 — смена модели на `gpt-5.6-luna` (поглавно медиана ×7.1, по сумме ×11.4) — и он упирается НЕ в деньги, а в кап агент-сессий (нужно 16, свободно 14). Тратить доллары на ручку прежде, чем порядковый рычаг прочитан по КАЧЕСТВУ, — плохая экономика. ⚠ Операционное для чужих циклов: отказ гарда возвращает код 1, но в ФОНОВОМ shell `set -e` цикл не остановил — семь итераций вхолостую, $0.
|
||||
|
||||
**📌 ПИНГ ПОЛИГОНУ от оркестратора №19 (28.08, D39.164) — вендор-вердикт по Gemini для `docs/experiments/00-provider-quirks.md`.**
|
||||
Материал добыт бэкенд-сессией (curl по вендор-доке, не пересказ), но файл — ВАША зона, поэтому вписываете вы, а не я. Строка 157 сегодня
|
||||
|
|
|
|||
|
|
@ -82,7 +82,7 @@
|
|||
|
||||
**3г. ⭐ ПОВЕДЕНЧЕСКАЯ ПРОБА 2026-08-30 (полигон, фаза Д, $0.038276): ПАРАМЕТР `low` НА `pro` ТЕПЕРЬ ДОХОДИТ ДО МОДЕЛИ.** Дока 3а требовала живой пробы перед денежным решением — вот она. **Несущая улика — не размер размышления, а `prompt_tokens`:** при **побайтно одинаковых** `messages` (sha256 `51e7f427940cae15`, проверено исполнением) вызов без параметра дал **3270** входных токенов, вызов с `reasoning_effort:"low"` — **3191**, то есть **−79**. Тело вызова различалось РОВНО одним полем (`eval/dovodka/rol.py:668`=`def call_kwargs`), исходник главы приколот манифестом с гейтом остановки (`eval/role_topology/pair_en.py:132`=`def units`), шаблон промта не менялся с 20.08, кэш смещения не даёт (две клетки с `cached_tokens=0` дали остатки −31.8 и +10.4 при разбросе ±20–44). **ДВА контроля детерминизма.** (1) Замер 05.08 ниже: при побайтно одинаковых `messages` дефолт и `low` вернули ОДИНАКОВЫЕ 2124 — провайдер повторяет `prompt_tokens` в точности, когда параметр не действует; ⚠ но он снят ДО смены сервинга и на другом промте. (2) **Межэпохальный контроль — пред-полётные пробы того же рига:** один и тот же тривиальный запрос БЕЗ ручки дал `prompt_tokens` = **84 · 84 · 84 · 84**, причём четвёртая куплена 30.08 за две минуты до испытуемого вызова ⇒ **дефолтный счёт входа не сдвинулся ни на токен через смену вендорского сервинга**, и −79 принадлежит параметру, а не эпохе. ⚠ **Регулярность без объяснения:** 2203 − 2124 = **79** (05.08, `xhigh` над дефолтом) и 3270 − 3191 = **79** (30.08, дефолт над `low`) на совершенно разных промтах — похоже на серверную вставку фиксированного размера, но это догадка. ⇒ **Статус `low` на `pro` закрыт В ЧАСТИ «доходит ли»: ДОХОДИТ.** ⛔ **ВЕЛИЧИНА среза размышления ПО-ПРЕЖНЕМУ НЕ УСТАНОВЛЕНА:** наблюдённые ×2.52 (19 559 → 7 748 токенов) сняты БЛОКАМИ, разнесёнными на 9 дней. ⛔ **Несущий конфаунд здесь — НЕ дрейф, а сама смена сервинга, зафиксированная выше в 3а:** вендор переписал маппинг между двумя блоками, и сравнение «арм 21.08 против арма 30.08» приписывает ручке всё, что он поменял. Дрейф (строка в 3б) — второй и более слабый: у него есть ЗНАК (все шесть розыгрышей монотонно РАСТУТ), и при его продолжении ×2.52 было бы нижней границей среза. Чтобы величина стала известной, нужен интерливинг обоих армов в ОДНОМ блоке; пре-регистрация и цены — `docs/experiments/23-editor-tier.md` §Д46.3 и §Д47 (дорогая восьмёрка $0.565–0.620, дешёвая — $0.078–0.133). ⚠ **Эхо на `low` у `pro`: одна английская клетка дала кириллицу 1.000 и ноль латиницы — это НЕ снимает предупреждение «Не бесплатно» ниже**, эхо-мина живёт на плотном CJK, а проба была на английской паре.
|
||||
|
||||
**3д. ⭐⭐ ЗАМЕРЕНО 30.08 ($0.134804, интерливинг Д47): ДЕФОЛТНЫЙ ПУТЬ `deepseek-v4-pro` СДВИНУЛСЯ ×38 ЗА ДЕВЯТЬ ДНЕЙ — ИЛИ РАЗБРОС РОЗЫГРЫША ТАКОВ.** Побайтно один промт (sha256 сверен), одна и та же глава, `reasoning_effort` НЕ слался ни разу: 21.08 модель думала **466** токенов, 30.08 — **17 757**. Цена той же клетки $0.005034 → $0.076893. ⚠ При n=1 «сдвиг во времени» и «разброс на побайтно одном входе» (п.2 выше) неразличимы — но для практики это одно и то же предупреждение: **любая смета DeepSeek, снятая с прошлого прогона, может ошибиться на порядок, и денежные планы на неё ставить нельзя**. Проверено на себе: пре-регистрация оценила восемь пар в $0.078–0.133, одна пара стоила $0.1348. ⭐ **Зато счёт ВХОДА через тот же разрыв стабилен до токена:** `prompt_tokens` = 3 256 и 21.08, и 30.08 при не-присланной ручке, а `low` сдвигает его ровно на −79 (3 177) — то есть провенанс параметра читается по входу даже там, где выход уехал ×38. ⚠ Наблюдённый ВНУТРИ ОДНОГО БЛОКА эффект ручки — ×1.40 (17 757 → 12 676), заметно меньше ×2.52, полученных сравнением через девять дней: конфаунд эффект РАЗДУВАЛ. n=1, знаковый тест p=1.0 ⇒ величина по-прежнему **НЕ УСТАНОВЛЕНА**; разбор — `docs/experiments/23-editor-tier.md` §Д47.6.
|
||||
**3д. ⚠ 30.08 ($0.134804, интерливинг Д47): ДВА ОДИНОЧНЫХ РОЗЫГРЫША ДЕФОЛТНОГО ПУТИ `deepseek-v4-pro` РАЗОШЛИСЬ В 38 РАЗ. ⛔ ПРИЧИНА НЕ УСТАНОВЛЕНА — «модель сдвинулась» и «выпал хвост» ОБЕ ЖИВЫ.** (Первая редакция этой записи подавала ×38 как замеренный сдвиг во времени; поправлено в тот же день — по лучшей имеющейся оценке разброса это ≈3.1 sd, редкое событие, но не невозможное. Оценка разброса: sd логарифма 0.82, то есть одно sd = ×2.3, снята по шести группам «тот же тег, разные розыгрыши», 18 вызовов, СУДЕЙСКАЯ роль — на переводе чистых повторов в корпусе нет. Разбор — `docs/experiments/23-editor-tier.md` §Д47.7.) Побайтно один промт (sha256 сверен), одна и та же глава, `reasoning_effort` НЕ слался ни разу: 21.08 модель думала **466** токенов, 30.08 — **17 757**. Цена той же клетки $0.005034 → $0.076893. **Для практики обе гипотезы дают одно и то же предупреждение: любая смета DeepSeek, снятая с ОДИНОЧНОГО прошлого вызова, может ошибиться на порядок, и денежные планы на неё ставить нельзя.** ⭐ **Следствие, которое дороже самой записи: сметы и сравнения моделей по размышлению нужно строить на ПОВТОРАХ.** Считано: при sd логарифма 0.82 парный дизайн ловит эффект ×2.5 за 13 пар, ×2.0 за 22, ×1.4 за 93 (80% мощности, α=0.05). Проверено на себе: пре-регистрация оценила восемь пар в $0.078–0.133, одна пара стоила $0.1348. ⭐ **Зато счёт ВХОДА через тот же разрыв стабилен до токена:** `prompt_tokens` = 3 256 и 21.08, и 30.08 при не-присланной ручке, а `low` сдвигает его ровно на −79 (3 177) — то есть провенанс параметра читается по входу даже там, где выход уехал ×38. ⚠ Наблюдённый ВНУТРИ ОДНОГО БЛОКА эффект ручки — ×1.40 (17 757 → 12 676), заметно меньше ×2.52, полученных сравнением через девять дней: конфаунд эффект РАЗДУВАЛ. n=1, знаковый тест p=1.0 ⇒ величина по-прежнему **НЕ УСТАНОВЛЕНА**; разбор — `docs/experiments/23-editor-tier.md` §Д47.6.
|
||||
|
||||
**3в. ВАХТА D39.92 ИСПОЛНЕНА ПОВТОРНО 2026-08-10 (полигон, фаза Д; $0, `curl` HTTP 200).**
|
||||
Таблица маппинга 3а на `guides/thinking_mode` **побайтно та же** (снята разбором ячеек `<td>`:
|
||||
|
|
|
|||
|
|
@ -7095,15 +7095,18 @@ $0.134804** (клетки $0.133588 + две пред-полётные проб
|
|||
| `RN2` | 30.08 | не слалась | **3 256** | 18 332 | **17 757** | $0.076893 | 260.8 с |
|
||||
| `RNL` | 30.08 | `low` | **3 177** | 13 258 | **12 676** | $0.056695 | 173.0 с |
|
||||
|
||||
⭐⭐ **ГЛАВНОЕ И НЕ ТО, ЗА ЧЕМ ШЛИ. Побайтно один промт, одна глава, ручка не слалась НИ РАЗУ —
|
||||
и размышление 466 против 17 757, то есть ×38.** Конфаунд, названный в Д46.2 рассуждением, теперь
|
||||
**замерен**, и он огромен. Это ретроспективно решает судьбу дизайна А: пятнадцать клеток `RNL`,
|
||||
сравнённых с `RN` от 21.08, дали бы число, целиком утонувшее в этом сдвиге.
|
||||
**Побайтно один промт, одна глава, ручка не слалась НИ РАЗУ — и размышление 466 против 17 757,
|
||||
то есть ×38.**
|
||||
|
||||
⚠ **И приписать сдвиг нечему: при n=1 «время» и «разброс розыгрыша» неразличимы.** Квирк-бюллетень
|
||||
п.2 давно печатает разброс на побайтно одном входе; сегодня он же мог сработать. **Оба чтения
|
||||
обвиняют дизайн А — но второе обвиняет и МОЙ дизайн Д:** один розыгрыш на главу не переиграет шум
|
||||
такого размера, каким бы ни было n.
|
||||
⚠⚠ **ПОПРАВКА Д47.7, ВНЕСЕНА В ТОТ ЖЕ ДЕНЬ ПО ВОПРОСУ ВЛАДЕЛЬЦА.** Первая редакция этого абзаца
|
||||
подавала ×38 как **замеренный сдвиг во времени** («конфаунд теперь замерен, и он огромен») и вела
|
||||
им весь вывод. Так подавать было нельзя: ×38 — разность ДВУХ ОДИНОЧНЫХ розыгрышей у модели, чей
|
||||
разброс на побайтно одном входе давно известен и велик. Что именно ×38 значит — разобрано в **Д47.7**,
|
||||
и там же цена ответа. Ниже оставлено то, что от абзаца устояло:
|
||||
* ⛔ **дизайн А осуждён в любом чтении** — сравнивать одиночные розыгрыши, разнесённые на девять
|
||||
дней, у модели с таким разбросом нельзя ни при какой гипотезе о причине;
|
||||
* ⛔ **и МОЙ дизайн Д осуждён тем же** — один розыгрыш на главу шума не переиграет, каким бы ни было
|
||||
число глав. Это, а не «сдвиг сервинга», и есть настоящая причина остановиться.
|
||||
|
||||
⭐ **Побочно — усиление Клейма 1 на БОЕВОМ промте, а не на тривиальной пробе.** `prompt_tokens` у
|
||||
`RN` (21.08) и `RN2` (30.08) — **3 256 и 3 256, до токена**, через девять дней и смену вендорского
|
||||
|
|
@ -7132,3 +7135,50 @@ $0.1348. Класс ошибки тот же, что у семи прежних:
|
|||
фоновом shell `set -e` цикл не остановил — семь оставшихся итераций отработали вхолостую, печатая
|
||||
тот же отказ. Денег это не стоило ($0: гард отклонил и пред-полётную пробу), но цикл на сотню клеток
|
||||
в такой форме выглядел бы как прогон. Следующий цикл несёт `|| break` в теле, а не надежду на `set -e`.
|
||||
|
||||
### Д47.7 ⛔ ЧТО ЖЕ ЗНАЧИТ ×38 — И ПОЧЕМУ ПЕРВАЯ ПРИКИДКА ОТВЕТА БЫЛА БЫ ДЕСЯТОЙ ОШИБКОЙ ДНЯ
|
||||
|
||||
Владелец спросил прямо: закончил ли я с дипсиком, чтобы делать выводы. **Не закончил**, и вот
|
||||
разбор — весь на уже оплаченном сырье, $0.
|
||||
|
||||
**Первый заход был неверен, и это стоит напечатать.** Я сгруппировал все вызовы `deepseek-v4-pro`
|
||||
по «модель · глава · роль», получил 100 групп по 3+ вызова, вывел «медианный разброс на одном входе
|
||||
×11» и почти отдал это как ответ. **Группы смешивают РАЗНЫЕ АРМЫ:** внутри одной группы лежат `RN`,
|
||||
`RC` (промт минус рамка оценки) и `RB` (рамка перевёрнута) — то есть три РАЗНЫХ промта. Пример
|
||||
`27cb3a7e69`: RB 18 043 · RN 7 061 · RC 498 — это не разброс розыгрыша, это разница инструкций.
|
||||
⇒ **число ×11 недействительно, и вывод из него был бы ошибкой того же класса, что семь прежних.**
|
||||
|
||||
**Честная выборка — только «тот же тег, разные номера розыгрыша»** (`…-r1/-r2/-r3`): шесть групп,
|
||||
18 вызовов, судейская роль. Разброс внутри группы **×1.0 · ×1.5 · ×1.7 · ×3.7 · ×10.1 · ×11.3**;
|
||||
**sd логарифма 0.82, то есть одно стандартное отклонение = ×2.3.**
|
||||
|
||||
⇒ **Куда это ставит наши ×38.** Разность двух одиночных розыгрышей имеет sd около 1.16 в логарифме;
|
||||
ln 38 = 3.64, то есть **примерно 3.1 sd — событие редкое (порядка 1 из 500), но не невозможное**.
|
||||
⛔ **Вывод: НЕ УСТАНОВЛЕНО, сдвинулась модель или выпал хвост.** Обе гипотезы живы, и различить их
|
||||
имеющимся сырьём нельзя: у роли `onepass` **чистых повторов одного и того же промта в корпусе нет
|
||||
ни одного** — их место как раз и занимали армы с разными промтами.
|
||||
|
||||
**⚠ Границы этой оценки, чтобы её не переняли как истину:** 18 вызовов, ДРУГАЯ роль (судейство,
|
||||
не перевод), и настоящий разброс на переводе может быть и больше. Оценка — рабочая, не замер.
|
||||
|
||||
### Д47.8 ЦЕНА ОТВЕТОВ: ТЕПЕРЬ ОНА СЧИТАЕТСЯ, А НЕ УГАДЫВАЕТСЯ
|
||||
|
||||
При sd логарифма 0.82 парный дизайн требует (80% мощности, α=0.05 двусторонний):
|
||||
|
||||
| поймать эффект | вызовов на арм | ≈ цена обоих армов |
|
||||
|---|---|---|
|
||||
| **×2.5** | 13 пар | **≈$1.1** |
|
||||
| **×2.0** | 22 пары | **≈$1.8** |
|
||||
| **×1.4** (наблюдённый внутри блока) | **93 пары** | **≈$7.6** |
|
||||
|
||||
*(цена по средней клетке панели $0.0278 у арма без ручки и ~0.46 от неё у арма с ручкой)*
|
||||
|
||||
И отдельно, **дешёвый вопрос «модель сдвинулась или это кости»**: четыре повтора без ручки на той же
|
||||
главе сегодня — **≈$0.31**. Кучкуются около 17 757 ⇒ сдвиг реален; разлетаются, задевая сотни, ⇒
|
||||
это кости, и августовские 466 были хвостом.
|
||||
|
||||
⇒ **Что это меняет в стратегии.** Ручка даёт эффект порядка ×1.4–2.5, и его замер стоит $1–8 при
|
||||
шуме ×2.3 на розыгрыш. **Рядом стоит рычаг ×7–11 — смена модели на `gpt-5.6-luna`** (поглавно:
|
||||
медиана ×7.1, по сумме ×11.4), и он упирается НЕ в деньги, а в кап агент-сессий на слепое чтение
|
||||
(нужно 16, свободно 14). ⛔ **Тратить следующие доллары на ручку, пока порядковый рычаг не прочитан
|
||||
по качеству, — плохая экономика.** Приоритет: сначала качество луны, потом всё остальное.
|
||||
|
|
|
|||
|
|
@ -71,14 +71,18 @@ workaround, который канон запрещает («ошибка тих
|
|||
n=8, минимальный двусторонний p = 0.0078. Пре-регистрация — **Д47**, ⛔ **не куплено**.
|
||||
⛔⛔ **Д47 ЗАПУЩЕН ПО СЛОВУ ВЛАДЕЛЬЦА («Запускай») И ОСТАНОВЛЕН ГАРДОМ ПОСЛЕ ПЕРВОЙ ЖЕ ПАРЫ.**
|
||||
Списано **$0.134804**, ФД-N теперь 3.187585 из 3.30 (свободно $0.1124), потолок НЕ поднимался.
|
||||
**Результат крупнее эндпойнта:** побайтно один промт, одна глава, ручка не слалась ни разу — 21.08
|
||||
модель думала **466** токенов, 30.08 — **17 757**, то есть **×38**. Конфаунд из Д46.2 замерен, а не
|
||||
выведен. ⚠ При n=1 «время» и «разброс розыгрыша» неразличимы, и второе чтение обвиняет мой же
|
||||
дизайн Д. Внутри блока ручка дала ×1.40 (меньше, чем ×2.52 через девять дней — конфаунд эффект
|
||||
**Результат:** побайтно один промт, одна глава, ручка не слалась ни разу — 21.08 модель думала
|
||||
**466** токенов, 30.08 — **17 757**, то есть **×38**. ⚠⚠ **Причина НЕ УСТАНОВЛЕНА** (Д47.7): по
|
||||
лучшей оценке разброса (sd логарифма 0.82 ⇒ одно sd = ×2.3) это ≈3.1 sd — редко, но возможно;
|
||||
«модель сдвинулась» и «выпал хвост» обе живы, чистых повторов одного промта на роли `onepass` в
|
||||
корпусе НЕТ. ⛔ Устояло то, что важнее: **одиночные розыгрыши сравнивать нельзя ни при какой
|
||||
гипотезе** — это осуждает и дизайн А, и мой дизайн Д. Внутри блока ручка дала ×1.40 (меньше, чем ×2.52 через девять дней — конфаунд эффект
|
||||
РАЗДУВАЛ); годных пар 1 из 8, p=1.0 ⇒ **величина НЕ УСТАНОВЛЕНА**, добор глав запрещён. ⭐ Побочно:
|
||||
`prompt_tokens` = 3256 и 21.08, и 30.08, а `low` двигает их ровно на −79 — Клейм 1 подтверждён на
|
||||
боевом промте. Доделать дизайн стоило бы ≈$0.94 (подъём ФД-N на ~$0.85) — **не рекомендую**: эффект
|
||||
×1.40 против шума ×38, один розыгрыш на главу такого шума не переиграет. Разбор — **Д47.6**,
|
||||
боевом промте. ⭐ **Цена ответов посчитана (Д47.8):** эффект ×2.5 — 13 пар (≈$1.1), ×2.0 — 22 (≈$1.8),
|
||||
×1.4 — 93 (≈$7.6); «сдвиг или кости» — 4 повтора без ручки, ≈$0.31. ⛔ **Приоритет не сюда:**
|
||||
ручка даёт ×1.4–2.5, а смена модели на луну — ×7–11, и она упирается в кап сессий (нужно 16,
|
||||
свободно 14), а не в деньги. Разбор — **Д47.6**,
|
||||
носитель вывода — `eval/dovodka/stupen.py` (написан ДО клеток).
|
||||
⚠ **Операционное:** отказ гарда возвращает код 1, но в ФОНОВОМ shell `set -e` цикл не остановил —
|
||||
семь итераций отработали вхолостую ($0). Следующий цикл покупок несёт `|| break` в теле.
|
||||
|
|
|
|||
Loading…
Add table
Reference in a new issue