diff --git a/docs/experiments/00-provider-quirks.md b/docs/experiments/00-provider-quirks.md index ba1bcc47..9161014b 100644 --- a/docs/experiments/00-provider-quirks.md +++ b/docs/experiments/00-provider-quirks.md @@ -80,7 +80,7 @@ ⛔⛔ **ВАХТА D39.92 ПЕРЕ-СНЯТА 2026-08-30 (полигон; `curl`, HTTP 200, страница 108 336 байт, sha256 `f28c4324…`) — ТАБЛИЦА У ВЕНДОРА ИЗМЕНИЛАСЬ, И ЗАПИСЬ НИЖЕ БОЛЬШЕ НЕ ВЕРНА.** Вендор исполнил обещанное сноской обновление маппинга. Живая редакция, дословно: *«(2) The mapping between the effort set by the user and the model's actual reasoning effort is as follows (**identical for `deepseek-v4-flash` and `deepseek-v4-pro`**)»* — и таблица теперь ОДНА на обе модели: `low→low · medium→high · high→high · xhigh→high · max→max`. Плюс *«(1) Thinking mode is enabled by default, with the default effort being `high`»*, а тумблер `{"thinking":{"type":"enabled/disabled"}}` подан как общий для модели DeepSeek, без оговорки «только flash». ⇒ **(i) на `deepseek-v4-pro` ручка `low` ТЕПЕРЬ РАБОТАЕТ и даёт `low`; (ii) рычаг бюджета размышления существует У ОБЕИХ моделей; (iii) размышление у `pro` в принципе ВЫКЛЮЧАЕМО тумблером.** ⚠ Это ДОКА, а не поведенческая проба: по норме проекта («слаг ≠ модель, при аномалии — поведенческая проба, не листинг») клейм действителен как ВЕНДОРСКОЕ ЗАЯВЛЕНИЕ и требует живой пробы перед денежным решением (смета — единицы центов). ⚠ И цена рычага уже замерена с другой стороны: `effort:"low"` **пере-вооружает эхо-мину** (п.4 ниже), а «reasoning-off + плотный CJK-вход = зона эха». ⚠ ЕЩЁ ОДИН ЖИВОЙ ФАКТ С ТОЙ ЖЕ СТРАНИЦЫ, которого у нас не записано нигде: *«Thinking mode does not support the `temperature`, `top_p`, `presence_penalty`, or `frequency_penalty` parameters… setting these parameters will not trigger an error but will also have no effect»* ⇒ **наш `temperature: 0.3`, который ростер шлёт на `deepseek-v4-pro`, МОЛЧА ИГНОРИРУЕТСЯ** — параметр в проводе есть, эффекта нет. ~~⇒ (i) **не слать `reasoning_effort` = ехать на `high`** — вот почему боевая форма упирается в стену (п.10); (ii) на `deepseek-v4-pro` ручка `low` НЕ РАБОТАЕТ (маппится в `high`); рычаг бюджета размышления существует ТОЛЬКО у flash~~ — **редакция до 30.08, оставлена под зачёркиванием: на ней стоят все денежные выводы фазы Д и вся её арифметика размышления. Дефолт `high` при не-присланной ручке — В СИЛЕ и в новой редакции** — **строка В СИЛЕ**: её отзыв от 05.08 сам ОТОЗВАН адверсариальным ревью того же дня (см. 3б), замер §3б признан недиагностичным; (iii) `none` в OpenAI-формате у DeepSeek не существует вовсе (колонка `reasoning.effort:"none"` — Anthropic-формат), запись 04.07 «`none` → 400» в силе. - **3г. ⭐ ПОВЕДЕНЧЕСКАЯ ПРОБА 2026-08-30 (полигон, фаза Д, $0.038276): ПАРАМЕТР `low` НА `pro` ТЕПЕРЬ ДОХОДИТ ДО МОДЕЛИ.** Дока 3а требовала живой пробы перед денежным решением — вот она. **Несущая улика — не размер размышления, а `prompt_tokens`:** при **побайтно одинаковых** `messages` (sha256 `51e7f427940cae15`, проверено исполнением) вызов без параметра дал **3270** входных токенов, вызов с `reasoning_effort:"low"` — **3191**, то есть **−79**. Тело вызова различалось РОВНО одним полем (`eval/dovodka/rol.py:668-679`), исходник главы приколот манифестом с гейтом остановки (`eval/role_topology/pair_en.py:132-157`), шаблон промта не менялся с 20.08, кэш смещения не даёт (две клетки с `cached_tokens=0` дали остатки −31.8 и +10.4 при разбросе ±20–44). **ДВА контроля детерминизма.** (1) Замер 05.08 ниже: при побайтно одинаковых `messages` дефолт и `low` вернули ОДИНАКОВЫЕ 2124 — провайдер повторяет `prompt_tokens` в точности, когда параметр не действует; ⚠ но он снят ДО смены сервинга и на другом промте. (2) **Межэпохальный контроль — пред-полётные пробы того же рига:** один и тот же тривиальный запрос БЕЗ ручки дал `prompt_tokens` = **84 · 84 · 84 · 84**, причём четвёртая куплена 30.08 за две минуты до испытуемого вызова ⇒ **дефолтный счёт входа не сдвинулся ни на токен через смену вендорского сервинга**, и −79 принадлежит параметру, а не эпохе. ⚠ **Регулярность без объяснения:** 2203 − 2124 = **79** (05.08, `xhigh` над дефолтом) и 3270 − 3191 = **79** (30.08, дефолт над `low`) на совершенно разных промтах — похоже на серверную вставку фиксированного размера, но это догадка. ⇒ **Статус `low` на `pro` закрыт В ЧАСТИ «доходит ли»: ДОХОДИТ.** ⛔ **ВЕЛИЧИНА среза размышления ПО-ПРЕЖНЕМУ НЕ УСТАНОВЛЕНА:** наблюдённые ×2.52 (19 559 → 7 748 токенов) сняты БЛОКАМИ, разнесёнными на 9 дней. ⛔ **Несущий конфаунд здесь — НЕ дрейф, а сама смена сервинга, зафиксированная выше в 3а:** вендор переписал маппинг между двумя блоками, и сравнение «арм 21.08 против арма 30.08» приписывает ручке всё, что он поменял. Дрейф (строка в 3б) — второй и более слабый: у него есть ЗНАК (все шесть розыгрышей монотонно РАСТУТ), и при его продолжении ×2.52 было бы нижней границей среза. Чтобы величина стала известной, нужен интерливинг обоих армов в ОДНОМ блоке; пре-регистрация и цены — `docs/experiments/23-editor-tier.md` §Д46.3 и §Д47 (дорогая восьмёрка $0.565–0.620, дешёвая — $0.078–0.133). ⚠ **Эхо на `low` у `pro`: одна английская клетка дала кириллицу 1.000 и ноль латиницы — это НЕ снимает предупреждение «Не бесплатно» ниже**, эхо-мина живёт на плотном CJK, а проба была на английской паре. + **3г. ⭐ ПОВЕДЕНЧЕСКАЯ ПРОБА 2026-08-30 (полигон, фаза Д, $0.038276): ПАРАМЕТР `low` НА `pro` ТЕПЕРЬ ДОХОДИТ ДО МОДЕЛИ.** Дока 3а требовала живой пробы перед денежным решением — вот она. **Несущая улика — не размер размышления, а `prompt_tokens`:** при **побайтно одинаковых** `messages` (sha256 `51e7f427940cae15`, проверено исполнением) вызов без параметра дал **3270** входных токенов, вызов с `reasoning_effort:"low"` — **3191**, то есть **−79**. Тело вызова различалось РОВНО одним полем (`eval/dovodka/rol.py:668`=`def call_kwargs`), исходник главы приколот манифестом с гейтом остановки (`eval/role_topology/pair_en.py:132`=`def units`), шаблон промта не менялся с 20.08, кэш смещения не даёт (две клетки с `cached_tokens=0` дали остатки −31.8 и +10.4 при разбросе ±20–44). **ДВА контроля детерминизма.** (1) Замер 05.08 ниже: при побайтно одинаковых `messages` дефолт и `low` вернули ОДИНАКОВЫЕ 2124 — провайдер повторяет `prompt_tokens` в точности, когда параметр не действует; ⚠ но он снят ДО смены сервинга и на другом промте. (2) **Межэпохальный контроль — пред-полётные пробы того же рига:** один и тот же тривиальный запрос БЕЗ ручки дал `prompt_tokens` = **84 · 84 · 84 · 84**, причём четвёртая куплена 30.08 за две минуты до испытуемого вызова ⇒ **дефолтный счёт входа не сдвинулся ни на токен через смену вендорского сервинга**, и −79 принадлежит параметру, а не эпохе. ⚠ **Регулярность без объяснения:** 2203 − 2124 = **79** (05.08, `xhigh` над дефолтом) и 3270 − 3191 = **79** (30.08, дефолт над `low`) на совершенно разных промтах — похоже на серверную вставку фиксированного размера, но это догадка. ⇒ **Статус `low` на `pro` закрыт В ЧАСТИ «доходит ли»: ДОХОДИТ.** ⛔ **ВЕЛИЧИНА среза размышления ПО-ПРЕЖНЕМУ НЕ УСТАНОВЛЕНА:** наблюдённые ×2.52 (19 559 → 7 748 токенов) сняты БЛОКАМИ, разнесёнными на 9 дней. ⛔ **Несущий конфаунд здесь — НЕ дрейф, а сама смена сервинга, зафиксированная выше в 3а:** вендор переписал маппинг между двумя блоками, и сравнение «арм 21.08 против арма 30.08» приписывает ручке всё, что он поменял. Дрейф (строка в 3б) — второй и более слабый: у него есть ЗНАК (все шесть розыгрышей монотонно РАСТУТ), и при его продолжении ×2.52 было бы нижней границей среза. Чтобы величина стала известной, нужен интерливинг обоих армов в ОДНОМ блоке; пре-регистрация и цены — `docs/experiments/23-editor-tier.md` §Д46.3 и §Д47 (дорогая восьмёрка $0.565–0.620, дешёвая — $0.078–0.133). ⚠ **Эхо на `low` у `pro`: одна английская клетка дала кириллицу 1.000 и ноль латиницы — это НЕ снимает предупреждение «Не бесплатно» ниже**, эхо-мина живёт на плотном CJK, а проба была на английской паре. **3в. ВАХТА D39.92 ИСПОЛНЕНА ПОВТОРНО 2026-08-10 (полигон, фаза Д; $0, `curl` HTTP 200).** Таблица маппинга 3а на `guides/thinking_mode` **побайтно та же** (снята разбором ячеек ``: diff --git a/docs/experiments/23-editor-tier.md b/docs/experiments/23-editor-tier.md index 4a34f4da..3638234a 100644 --- a/docs/experiments/23-editor-tier.md +++ b/docs/experiments/23-editor-tier.md @@ -6842,13 +6842,13 @@ RL reasoning_tokens: 511 · 512 · 512 · 512 · 1005 · 1022 · 1023 · 1024 **Цепь, каждое звено снято исполнением, а не памятью:** 1. **промт побайтно один** — `rol.rol_msgs('en', src, 'RN')` и `…'RNL'` дают sha256 `51e7f427940cae15` у обоих армов (три сообщения 7525 · 310 · 1675 знаков); -2. **тело вызова различается ровно одним полем** — `call_kwargs` (`eval/dovodka/rol.py:668-706`, +2. **тело вызова различается ровно одним полем** — `call_kwargs` (`eval/dovodka/rol.py:668`=`def call_kwargs`, дописывание уровня — строка 701) берёт общий ростер и добавляет только `reasoning_effort`; модель, `max_tokens=32000`, `temperature` — общие; 3. **исходник главы тот же** — манифест единиц приколот, и чтение никогда не переотбирает: при смене текста uid меняется, приколотый исчезает из пересчитанных кандидатов и **покупка - останавливается** (`eval/role_topology/pair_en.py:132-157`). Покупка 30.08 прошла ⇒ текст не менялся. + останавливается** (`eval/role_topology/pair_en.py:132`=`def units`). Покупка 30.08 прошла ⇒ текст не менялся. ⚠ Это не рассуждение, а гейт, который обязан был сработать и не сработал; 4. **шаблон промта не менялся** — `onepass-core.md` последний раз тронут **20.08**, за день до покупки `RN`; пар-блоки и бриф с 20.08 не менялись вовсе (`git log --since=2026-08-20`, пусто); @@ -7057,7 +7057,7 @@ RN» переносила отношение с САМОЙ ДУМАЮЩЕЙ гл концу. **Как именно защищены деньги — по коду, а не по намерению.** Гард `money.Guarded.afford()` -(`eval/tenant_panel/money.py:149-159`) проверяется **перед КАЖДОЙ клеткой** и отказывает, когда +(`eval/tenant_panel/money.py:149`=`def afford`) проверяется **перед КАЖДОЙ клеткой** и отказывает, когда `потрачено + ожидание > потолок`; ожидание для `deepseek-v4-pro` — $0.0214. ⇒ покупка идёт, пока фактический расход не дойдёт до ≈$0.226 сверх нынешнего, и **дизайн Д укладывается в это с запасом**. ⚠ Отдельно: сводка `--dry` печатает «НЕ ВЛЕЗАЕТ» для ВСЕГО остатка замера ($1.03 на все незакрытые