From 6de6e954ef407e1b897bbce20728511495df10f1 Mon Sep 17 00:00:00 2001 From: heaven Date: Wed, 2 Sep 2026 00:32:23 +0300 Subject: [PATCH] Record that our price ratio understates: the editor now spends four times the output tokens it did in July, after the vendor swapped weights under an unchanged slug --- docs/experiments/23-editor-tier.md | 11 +++++++++++ 1 file changed, 11 insertions(+) diff --git a/docs/experiments/23-editor-tier.md b/docs/experiments/23-editor-tier.md index 669d14ae..1f0275b2 100644 --- a/docs/experiments/23-editor-tier.md +++ b/docs/experiments/23-editor-tier.md @@ -7694,6 +7694,17 @@ $0.040093 — расхождение 0.0%). Значит прайс-таблиц таблице: **dspro тратит вдвое больше completion-токенов** (30 779 против 14 224), чего контрфактика на чужих токенах увидеть не могла. + ⛔⛔ **ЭРРАТА 02.09: ×2.14 ЗАНИЖЕНО — pro СЕГОДНЯ ТРАТИТ ВЧЕТВЕРО БОЛЬШЕ ВЫХОДА, ЧЕМ В ИЮЛЕ.** + Замер Д51 снят на `rerun2` (23.07): **11 вызовов редактора, 30 779 completion, среднее 2 798 на + вызов**. Холодный прогон 31.08 на том же редакторе даёт **4 вызова, 48 813 completion, среднее + 12 203** — ×4.36. Между двумя датами вендор сменил ВЕСА модели (объявление 13.08, слаг тот же) и + дефолт эффорта, а размышление у него считается ВНУТРИ completion. ⇒ отношение «pro дороже glm», + посчитанное на июльских токенах pro, **занижает сегодняшнюю разницу**. + ⚠ Границы поправки, названные честно: прогоны разные по нарезке и числу юнитов (5 глав против 10), + сравниваются СРЕДНИЕ на вызов при n=11 и n=4 — это указание направления, а не новая величина. + **Новую величину даст проба четырёх осей**, где pro и glm@off идут на одних юнитах в один день + (референс-рука, `eval/dovodka/PLAN-01-09.md`). До неё ×2.14 читать как НИЖНЮЮ ГРАНИЦУ. + ⭐ **ОТВЕТ НА ПРЯМОЙ ВОПРОС ОРКЕСТРАТОРА №22 (31.08): ОТМЕНЯЕТ ЛИ ЭТОТ ЗАМЕР ЧИСЛО ×1.26 ИЗ D39.137 — НЕТ, ОН СЧИТАЕТ ДРУГОЕ И УТОЧНЯЕТ ЕГО.** Формулировка нужна одной фразой, потому что иначе следующая смена унаследует два числа об одном факте и возьмёт то, что попалось первым.