diff --git a/docs/experiments/23-editor-tier.md b/docs/experiments/23-editor-tier.md index 9ab53410..c8d70f08 100644 --- a/docs/experiments/23-editor-tier.md +++ b/docs/experiments/23-editor-tier.md @@ -6610,3 +6610,100 @@ gpt-5.6-luna … extra_body {"reasoning_effort": "low"} * **`glm-5` с размышлением ВКЛЮЧЁННЫМ стоит $182 за книгу** (Д41.1) — дороже боевой связки. То есть «взять glm-5» без указания состояния выключателя — не решение, а его видимость. **Конфигурация модели есть часть арма** (норма Д28). + +### Д44.5 ⛔⛔ ЖИВАЯ ВАХТА В ТОТ ЖЕ ДЕНЬ: ВЕНДОР ИЗМЕНИЛ ТАБЛИЦУ, И Д44.1 УСТАРЕЛА ЧЕРЕЗ ЧАС ПОСЛЕ НАПИСАНИЯ + +Секция Д44.1 сама же и потребовала пере-снять вахту D39.92 перед денежным решением. Пере-снято +немедленно, `curl` HTTP 200, `api-docs.deepseek.com/guides/thinking_mode`, 108 336 байт, +sha256 `f28c4324…`, **30.08.2026**. **Страница ИЗМЕНИЛАСЬ.** Дословно: + +> **(1)** Thinking mode is enabled by default, with the default effort being **`high`**. +> **(2)** The mapping between the effort set by the user and the model's actual reasoning effort is +> as follows (**identical for `deepseek-v4-flash` and `deepseek-v4-pro`**): +> +> | Requested effort | Actual mapped effort | +> |---|---| +> | low | **low** | +> | medium | high | +> | high | high | +> | xhigh | high | +> | max | max | + +**Что изменилось против нашей записи от 10.08** (там таблица имела ДВЕ колонки, flash и pro +раздельно, и у `pro` было `low→high`, `xhigh→max`): + +| | было у нас (10.08) | живая страница (30.08) | +|---|---|---| +| колонок | две, flash и pro РАЗДЕЛЬНО | **одна, «identical for flash and pro»** | +| `low` на `pro` | ⛔ маппится в `high` | ✅ **`low`** | +| `xhigh` на `pro` | `max` | `high` | +| рычаг бюджета | «существует ТОЛЬКО у flash» | **существует у обеих** | +| тумблер `thinking: disabled` | подан как flash-овый | подан как общий для модели DeepSeek | + +⇒ **Вендор исполнил ровно то, что обещал сноской «We will update the actual mapped effort of +`deepseek-v4-pro` in early August 2026».** Наша вахта 10.08 застала старую редакцию; за двадцать +дней она сменилась, и никто не смотрел. + +⚠ **Замечание владельца 30.08 («дипсик не принимает уровень рассуждения, там либо xhigh, либо +high») описывает СТАРУЮ таблицу и по ней ВЕРНО**: у `pro` `low` уезжал в `high`, а `xhigh` — в +`max`, то есть реально доступны были только верхние ступени. По живой редакции это больше не так. + +⛔ **Но клейм остаётся ДОКОЙ, а не замером.** Норма проекта: «слаг ≠ модель; при аномалии — +поведенческая проба, а не листинг». ⇒ **прежде чем считать на этом деньги, нужна живая проба: +один вызов `pro` с `reasoning_effort:"low"` и сверка `reasoning_tokens` против дефолтного.** +Смета — единицы центов. **Сессия её не делает: покупок в этой сессии нет, и заводить их в конце +работы без слова владельца я не буду.** + +⚠ И цена рычага уже замерена с другой стороны: `effort:"low"` **пере-вооружает эхо-мину** +(квирк-бюллетень п.4: 1 чистый китайский выход из 16 базовых вызовов), а «reasoning-off + плотный +CJK-вход = зона эха». **Рычаг есть — бесплатным он не будет.** + +⚠ **ПОБОЧНЫЙ ЖИВОЙ ФАКТ С ТОЙ ЖЕ СТРАНИЦЫ, которого нет нигде в наших доках:** *«Thinking mode does +not support the `temperature`, `top_p`, `presence_penalty`, or `frequency_penalty` parameters… +setting these parameters will not trigger an error but will also have no effect»* ⇒ **`temperature: +0.3`, который ростер шлёт на `deepseek-v4-pro`, МОЛЧА ИГНОРИРУЕТСЯ.** Параметр в проводе есть, +эффекта нет; все наши «temperature уравнена» — про то, чего не было. + +### Д44.6 ⭐⭐ ЛУНА ПРОТИВ ЯКОРЯ В ОДНОПРОХОДКЕ: ЧИСЛА ПЕРЕ-СНЯТЫ ПОКЛЕТОЧНО, И ОНИ БОЛЬШЕ, ЧЕМ Я НАПЕЧАТАЛ + +Владелец 30.08: «мы сравнивали цены именно по однопроходкам, там луна чет разъебала». Пере-считано +из клеток, все 16 глав, один прайс, `finish=stop` 16/16 у обоих, модели сверены полем `model_returned`: + +``` +RN deepseek-v4-pro, промт-роль медиана $0.02011/клетка сумма по 16 главам $0.4938 +RL gpt-5.6-luna, ТОТ ЖЕ промт медиана $0.00248/клетка сумма по 16 главам $0.0392 + ⇒ 8.1× по медиане · 12.6× по сумме +``` + +**И вся разница — в размышлении, поглавно:** + +``` +RN reasoning_tokens: 466 · 532 · 575 · 588 · 639 · 857 · 910 · 931 · 5804 · 6514 · 7061 · 11204 · 11723 · 14221 · 16643 · 19559 +RL reasoning_tokens: 511 · 512 · 512 · 512 · 1005 · 1022 · 1023 · 1024 ×6 · 1535 ×3 +``` + +⇒ У якоря размышление **БИМОДАЛЬНО** (восемь дешёвых глав против восьми, где он пишет до 19 559 +токенов в ум) — это тот самый механизм «черновик в уме» из Д15.19. У `luna` оно прибито к ~1 000, +потому что ей мы шлём `reasoning_effort: "low"`, и **у неё эта ручка работает**. + +⛔⛔ **И ВОТ ГЛАВНОЕ, ЧЕГО НЕ ГОВОРИЛА НИ ОДНА МОЯ ПРЕЖНЯЯ СТРОКА: ЭТО СРАВНЕНИЕ КОНФИГУРАЦИЙ, А НЕ +МОДЕЛЕЙ.** Мы сравнили **`dspro` на `high`** (ручку ему не слали вовсе, а по обеим редакциям +вендор-таблицы «не слать = `high`») против **`luna` на явном `low`**. По собственной норме фазы +(Д28: «конфигурация модели — часть арма, вендор-дефолт, переопределённый ростером, называть в +пре-реге наравне с моделью») **это разные армы, и разрыв 8× частично куплен разницей ступеней, а +не разницей вендоров.** + +⇒ **Честная форма вывода:** +> **`gpt-5.6-luna` в роли однопроходки стоит в 8 раз меньше якоря при качестве, которого прибор не +> разрешил, — но якорь при этом шёл на максимальной доступной тогда ступени размышления, а +> испытуемый на низшей. Сколько из восьми крат принадлежит модели, а сколько ступени, НЕ РАЗВЕДЕНО.** + +⭐ **И ровно это теперь можно развести за копейки** — потому что по живой вендор-редакции (Д44.5) +у `pro` появился рабочий `low`. **Замер, который закрывает вопрос: те же 16 английских глав, тот же +промт, `deepseek-v4-pro` с `reasoning_effort:"low"`.** Смета по замеренным токенам `luna`-профиля — +**порядка $0.05–0.10 на все 16 клеток**. Это самая дешёвая и самая информативная покупка из всех, +что фаза может сейчас назвать: она либо снимает с луны 8-кратное преимущество (и тогда дефолт +письма остаётся дома), либо подтверждает его при уравненных ступенях (и тогда у продукта появляется +восьмикратная экономия на дорогой роли). +⚠ Перед покупкой — эхо-проба: `low` на DeepSeek пере-вооружает эхо-мину, и на китайской паре это +уже наблюдалось.