Verify the luna one-pass gap cell by cell and name the confound nobody had: we compared the anchor at high effort against the candidate at low
This commit is contained in:
parent
37446be4a4
commit
6fa67ad38c
1 changed files with 97 additions and 0 deletions
|
|
@ -6610,3 +6610,100 @@ gpt-5.6-luna … extra_body {"reasoning_effort": "low"}
|
|||
* **`glm-5` с размышлением ВКЛЮЧЁННЫМ стоит $182 за книгу** (Д41.1) — дороже боевой связки. То есть
|
||||
«взять glm-5» без указания состояния выключателя — не решение, а его видимость. **Конфигурация
|
||||
модели есть часть арма** (норма Д28).
|
||||
|
||||
### Д44.5 ⛔⛔ ЖИВАЯ ВАХТА В ТОТ ЖЕ ДЕНЬ: ВЕНДОР ИЗМЕНИЛ ТАБЛИЦУ, И Д44.1 УСТАРЕЛА ЧЕРЕЗ ЧАС ПОСЛЕ НАПИСАНИЯ
|
||||
|
||||
Секция Д44.1 сама же и потребовала пере-снять вахту D39.92 перед денежным решением. Пере-снято
|
||||
немедленно, `curl` HTTP 200, `api-docs.deepseek.com/guides/thinking_mode`, 108 336 байт,
|
||||
sha256 `f28c4324…`, **30.08.2026**. **Страница ИЗМЕНИЛАСЬ.** Дословно:
|
||||
|
||||
> **(1)** Thinking mode is enabled by default, with the default effort being **`high`**.
|
||||
> **(2)** The mapping between the effort set by the user and the model's actual reasoning effort is
|
||||
> as follows (**identical for `deepseek-v4-flash` and `deepseek-v4-pro`**):
|
||||
>
|
||||
> | Requested effort | Actual mapped effort |
|
||||
> |---|---|
|
||||
> | low | **low** |
|
||||
> | medium | high |
|
||||
> | high | high |
|
||||
> | xhigh | high |
|
||||
> | max | max |
|
||||
|
||||
**Что изменилось против нашей записи от 10.08** (там таблица имела ДВЕ колонки, flash и pro
|
||||
раздельно, и у `pro` было `low→high`, `xhigh→max`):
|
||||
|
||||
| | было у нас (10.08) | живая страница (30.08) |
|
||||
|---|---|---|
|
||||
| колонок | две, flash и pro РАЗДЕЛЬНО | **одна, «identical for flash and pro»** |
|
||||
| `low` на `pro` | ⛔ маппится в `high` | ✅ **`low`** |
|
||||
| `xhigh` на `pro` | `max` | `high` |
|
||||
| рычаг бюджета | «существует ТОЛЬКО у flash» | **существует у обеих** |
|
||||
| тумблер `thinking: disabled` | подан как flash-овый | подан как общий для модели DeepSeek |
|
||||
|
||||
⇒ **Вендор исполнил ровно то, что обещал сноской «We will update the actual mapped effort of
|
||||
`deepseek-v4-pro` in early August 2026».** Наша вахта 10.08 застала старую редакцию; за двадцать
|
||||
дней она сменилась, и никто не смотрел.
|
||||
|
||||
⚠ **Замечание владельца 30.08 («дипсик не принимает уровень рассуждения, там либо xhigh, либо
|
||||
high») описывает СТАРУЮ таблицу и по ней ВЕРНО**: у `pro` `low` уезжал в `high`, а `xhigh` — в
|
||||
`max`, то есть реально доступны были только верхние ступени. По живой редакции это больше не так.
|
||||
|
||||
⛔ **Но клейм остаётся ДОКОЙ, а не замером.** Норма проекта: «слаг ≠ модель; при аномалии —
|
||||
поведенческая проба, а не листинг». ⇒ **прежде чем считать на этом деньги, нужна живая проба:
|
||||
один вызов `pro` с `reasoning_effort:"low"` и сверка `reasoning_tokens` против дефолтного.**
|
||||
Смета — единицы центов. **Сессия её не делает: покупок в этой сессии нет, и заводить их в конце
|
||||
работы без слова владельца я не буду.**
|
||||
|
||||
⚠ И цена рычага уже замерена с другой стороны: `effort:"low"` **пере-вооружает эхо-мину**
|
||||
(квирк-бюллетень п.4: 1 чистый китайский выход из 16 базовых вызовов), а «reasoning-off + плотный
|
||||
CJK-вход = зона эха». **Рычаг есть — бесплатным он не будет.**
|
||||
|
||||
⚠ **ПОБОЧНЫЙ ЖИВОЙ ФАКТ С ТОЙ ЖЕ СТРАНИЦЫ, которого нет нигде в наших доках:** *«Thinking mode does
|
||||
not support the `temperature`, `top_p`, `presence_penalty`, or `frequency_penalty` parameters…
|
||||
setting these parameters will not trigger an error but will also have no effect»* ⇒ **`temperature:
|
||||
0.3`, который ростер шлёт на `deepseek-v4-pro`, МОЛЧА ИГНОРИРУЕТСЯ.** Параметр в проводе есть,
|
||||
эффекта нет; все наши «temperature уравнена» — про то, чего не было.
|
||||
|
||||
### Д44.6 ⭐⭐ ЛУНА ПРОТИВ ЯКОРЯ В ОДНОПРОХОДКЕ: ЧИСЛА ПЕРЕ-СНЯТЫ ПОКЛЕТОЧНО, И ОНИ БОЛЬШЕ, ЧЕМ Я НАПЕЧАТАЛ
|
||||
|
||||
Владелец 30.08: «мы сравнивали цены именно по однопроходкам, там луна чет разъебала». Пере-считано
|
||||
из клеток, все 16 глав, один прайс, `finish=stop` 16/16 у обоих, модели сверены полем `model_returned`:
|
||||
|
||||
```
|
||||
RN deepseek-v4-pro, промт-роль медиана $0.02011/клетка сумма по 16 главам $0.4938
|
||||
RL gpt-5.6-luna, ТОТ ЖЕ промт медиана $0.00248/клетка сумма по 16 главам $0.0392
|
||||
⇒ 8.1× по медиане · 12.6× по сумме
|
||||
```
|
||||
|
||||
**И вся разница — в размышлении, поглавно:**
|
||||
|
||||
```
|
||||
RN reasoning_tokens: 466 · 532 · 575 · 588 · 639 · 857 · 910 · 931 · 5804 · 6514 · 7061 · 11204 · 11723 · 14221 · 16643 · 19559
|
||||
RL reasoning_tokens: 511 · 512 · 512 · 512 · 1005 · 1022 · 1023 · 1024 ×6 · 1535 ×3
|
||||
```
|
||||
|
||||
⇒ У якоря размышление **БИМОДАЛЬНО** (восемь дешёвых глав против восьми, где он пишет до 19 559
|
||||
токенов в ум) — это тот самый механизм «черновик в уме» из Д15.19. У `luna` оно прибито к ~1 000,
|
||||
потому что ей мы шлём `reasoning_effort: "low"`, и **у неё эта ручка работает**.
|
||||
|
||||
⛔⛔ **И ВОТ ГЛАВНОЕ, ЧЕГО НЕ ГОВОРИЛА НИ ОДНА МОЯ ПРЕЖНЯЯ СТРОКА: ЭТО СРАВНЕНИЕ КОНФИГУРАЦИЙ, А НЕ
|
||||
МОДЕЛЕЙ.** Мы сравнили **`dspro` на `high`** (ручку ему не слали вовсе, а по обеим редакциям
|
||||
вендор-таблицы «не слать = `high`») против **`luna` на явном `low`**. По собственной норме фазы
|
||||
(Д28: «конфигурация модели — часть арма, вендор-дефолт, переопределённый ростером, называть в
|
||||
пре-реге наравне с моделью») **это разные армы, и разрыв 8× частично куплен разницей ступеней, а
|
||||
не разницей вендоров.**
|
||||
|
||||
⇒ **Честная форма вывода:**
|
||||
> **`gpt-5.6-luna` в роли однопроходки стоит в 8 раз меньше якоря при качестве, которого прибор не
|
||||
> разрешил, — но якорь при этом шёл на максимальной доступной тогда ступени размышления, а
|
||||
> испытуемый на низшей. Сколько из восьми крат принадлежит модели, а сколько ступени, НЕ РАЗВЕДЕНО.**
|
||||
|
||||
⭐ **И ровно это теперь можно развести за копейки** — потому что по живой вендор-редакции (Д44.5)
|
||||
у `pro` появился рабочий `low`. **Замер, который закрывает вопрос: те же 16 английских глав, тот же
|
||||
промт, `deepseek-v4-pro` с `reasoning_effort:"low"`.** Смета по замеренным токенам `luna`-профиля —
|
||||
**порядка $0.05–0.10 на все 16 клеток**. Это самая дешёвая и самая информативная покупка из всех,
|
||||
что фаза может сейчас назвать: она либо снимает с луны 8-кратное преимущество (и тогда дефолт
|
||||
письма остаётся дома), либо подтверждает его при уравненных ступенях (и тогда у продукта появляется
|
||||
восьмикратная экономия на дорогой роли).
|
||||
⚠ Перед покупкой — эхо-проба: `low` на DeepSeek пере-вооружает эхо-мину, и на китайской паре это
|
||||
уже наблюдалось.
|
||||
|
|
|
|||
Loading…
Add table
Reference in a new issue