diff --git a/docs/experiments/23-editor-tier.md b/docs/experiments/23-editor-tier.md index b66864d7..19fb8814 100644 --- a/docs/experiments/23-editor-tier.md +++ b/docs/experiments/23-editor-tier.md @@ -7694,26 +7694,29 @@ $0.040093 — расхождение 0.0%). Значит прайс-таблиц таблице: **dspro тратит вдвое больше completion-токенов** (30 779 против 14 224), чего контрфактика на чужих токенах увидеть не могла. - ⛔⛔ **ЭРРАТА 02.09: ×2.14 ЗАНИЖЕНО — pro СЕГОДНЯ ТРАТИТ ВЧЕТВЕРО БОЛЬШЕ ВЫХОДА, ЧЕМ В ИЮЛЕ.** - Замер Д51 снят на `rerun2` (23.07): **11 вызовов редактора, 30 779 completion, среднее 2 798 на - вызов**. Холодный прогон 31.08 на том же редакторе даёт **4 вызова, 48 813 completion, среднее - 12 203** — ×4.36. Между двумя датами вендор сменил ВЕСА модели (объявление 13.08, слаг тот же) и - дефолт эффорта, а размышление у него считается ВНУТРИ completion. ⇒ отношение «pro дороже glm», - посчитанное на июльских токенах pro, **занижает сегодняшнюю разницу**. - ⛔ **ПОПРАВКА К ЭТОЙ ЖЕ ЭРРАТЕ (скептик консилиума, 02.09): ×4.36 ЗАВЫШЕНО ДВУМЯ ЦЕНЗУРАМИ, обе - мои.** (1) Июльское среднее 2 798 **обрезано потолком 8000** — две из шестнадцати клеток вернули - `length` ровно на нём. (2) Сегодняшние 12 203 **включают ретрай** (один юнит дал 16000 `length` и - затем 17 663); по попытке 0 среднее 10 383 при потолке 16000. ⇒ **при выравнивании потолков - сегодняшнее среднее ≈6 380, то есть направление ≈×2.3**, а не ×4.4. Печатать надо ×2.3. - ⚠ И «×2.14 — нижняя граница» предполагает, что `glm` по расходу с июля не подорожал; **это не - мерено**. Правильно: «вероятно нижняя граница, проверяет референс-клетка пробы». - ⚠ Границы поправки: прогоны разные по нарезке и числу юнитов (5 глав против 10), сравниваются - средние на вызов при n=11 и n=4, и это **тот же СЛАГ, а не тот же редактор** — вендор сменил веса. - Указание направления, не величина. - **Новую величину даст проба четырёх осей**, где pro и glm@off идут на одних юнитах в один день - (референс-рука, `eval/dovodka/PLAN-01-09.md`). До неё ×2.14 читать как НИЖНЮЮ ГРАНИЦУ. + ⛔⛔ **ЭРРАТА 02.09, РЕДАКЦИЯ 3 — ДВЕ ПРЕДЫДУЩИЕ БЫЛИ НЕВЕРНЫ ЧИСЛАМИ, ОБЕ МОИ.** +Утверждение, которое устояло: **×2.14 занижено, `pro` подорожал по расходу**. Величина — нет. - ⭐ **ОТВЕТ НА ПРЯМОЙ ВОПРОС ОРКЕСТРАТОРА №22 (31.08): ОТМЕНЯЕТ ЛИ ЭТОТ ЗАМЕР ЧИСЛО ×1.26 ИЗ +**Что было неверно.** Редакция 1 дала «×4.36, вчетверо»; редакция 2 поправила на «≈×2.3». +Оба числа считаны с ошибкой в ЗНАМЕНАТЕЛЕ: я делил `completion` июльского прогона на **11 строк**, +тогда как реальных вызовов там **восемь** — три строки суть записи санитайзера с `cost_usd = 0`, +у которых `completion` учтён, а вызова не было. Проверено исполнением: реальные значения +`2875 · 3157 · 4283 · 2610 · 2779 · 3272 · 8000 · 3803` ⇒ **среднее 3 847**, а не 2 798. +⚠ И «две из шестнадцати клеток на потолке 8000» — это `minirun` (25.07), **не** `rerun2`; +в `rerun2` обрыв **один из восьми**. + +**Верная величина, при выравнивании потолков:** 6 380 / 3 847 = **×1.7**. +Без выравнивания: по попытке 0 — ×2.7; с ретраем — ×3.2. **Печатать ×1.7.** + +⚠ И «×2.14 — нижняя граница» смягчается: это верно, только если `glm` по расходу с июля не +подорожал, а **это не мерено**. Правильно: «вероятно нижняя граница; проверяет референсная клетка +пробы». Сравниваются средние на вызов из РАЗНЫХ прогонов с разной нарезкой, и это **тот же СЛАГ, +а не тот же редактор** — вендор сменил веса. Указание направления, не величина. + +**Класс ошибки — трижды один и тот же:** производное число публиковалось раньше, чем проверялся его +знаменатель. Первую редакцию поймал консилиум, вторую — он же, третью проверял я сам исполнением. + +⭐ **ОТВЕТ НА ПРЯМОЙ ВОПРОС ОРКЕСТРАТОРА №22 (31.08): ОТМЕНЯЕТ ЛИ ЭТОТ ЗАМЕР ЧИСЛО ×1.26 ИЗ D39.137 — НЕТ, ОН СЧИТАЕТ ДРУГОЕ И УТОЧНЯЕТ ЕГО.** Формулировка нужна одной фразой, потому что иначе следующая смена унаследует два числа об одном факте и возьмёт то, что попалось первым. **×1.26 и 1.6–2.1 — не спор, а две разные величины:**