91 KiB
Полигон: язык промптов (Р6) + fidelity-хвост анти-эхо P4 (петля D21 п.6)
Сессия: полигон, 31.07.2026. Промт: docs/POLYGON_PROMPTLANG_ANTIECHO_SESSION_PROMPT.md
(оркестратор №9, санкция владельца). Потолок $0.15 суммарно. Сессия НЕ коммитит.
Артефакты прогонов — ~/books/gu-zhenren/promptlang/ (вне git). Харнесс — eval/promptlang/.
Ревью-шапка (оркестратор №9, 01.08): ПРИНЯТО И ЗАЛЕНДЕНО, D39.61. Действующая редакция выводов = §12 — сам отчёт так предписывает; §1–§11 сохранены как хроника, и три их вывода ОТОЗВАНЫ саморевью сессии (эхо-атрибуция few-shot · «пропуск» постинструкции · «митигации вернее базы»). Короткая приёмка: финальная редакция прочитана целиком; деньги проверены независимо — мой ре-ран
eval/promptlang/spend.pyдал те же 163 вызова / $0.433062, два пути сходятся до 2.9e-06; итог = $0.1475 в потолке промта + $0.2855 судейского хвоста по прямой санкции владельца; находка «леджер = нижняя граница» (4 billed-вызова внеrequest_log) забукана строкой 78. Дифф квирков сверен с §12 построчно — синхронизирован сессией; один остаточный хвост («few-shot стал ВРЕДЕН» в P4-superseded-строке) докорректирован при лендинге по §12.5 п.1. Дисциплина: пре-регистрация цела, амендмент §0-bis объявлен до продолжения трат, механизм всех трёх отозванных выводов назван самой сессией («вывод на агрегате до вскрытия единиц») — забран в промт-нормы оркестратора. Развилка §12.4 — у владельца (строка 74), до неё платные прогоны и resnapshot СТОП.
⚠ ПОРЯДОК ЧТЕНИЯ (после адверсариального ревью и добора судьи): действующая редакция выводов — §12 в конце файла. §1–§11 сохранены как хроника (дисциплина D23.3) и в восьми местах опровергнуты §12.5 — не цитировать их числа, не сверившись с §12.5. §0 (пре-регистрация) заморожена и не переписывалась ни в одном пункте.
§0. ПРЕ-РЕГИСТРАЦИЯ (записана ДО первой платной траты; ниже НЕ переписывается)
Причина, по которой это первый раздел: у проекта есть своя перепись случаев, когда критерий успеха дописывался после результата (D37: «0 ошибок» = 36 ошибок; exp15 Q1b: заголовок был артефактом судейского окна). Пре-регистрация — единственное, что отличает замер от рассказа о замере.
0.1 Конфигурация — заморожена
Общее для обеих задач
| Ось | Значение | Почему так |
|---|---|---|
| Окно трат | UTC 18:30–24:00 31.07 | вне пиков DeepSeek UTC 01–04 / 06–10 (D39.7 §4: пик = ×2) |
| Слаги | live-фактчек /models до первой траты: deepseek → ровно deepseek-v4-flash + deepseek-v4-pro; xai → grok-4.3 жив (eval/promptlang/slugcheck.json) |
гардрейл CLAUDE.md |
| Квирки | deepseek thinking НЕ отключается (reasoning:"off" = no-op у deepseek); max_tokens ≥8000 держит движок; temperature в thinking-режиме игнорируется молча |
00-provider-quirks |
| Зона | пишу в eval/, docs/experiments/, отчёт в docs/archive/reports/; backend/ не правлю ни байтом — армы едут через свой prompts_root в пар-конфиге проекта-пробы и через prompt_override стадии |
CLAUDE.md, зоны |
| Стенд | 1117 файлов ~/books/gu-zhenren/ (кроме promptlang/) захешированы ДО прогона, сверяются после |
П8 холодного прогона |
Задача A — «язык промптов» (Р6, D39.58 §6.4)
| Ось | Значение | Почему так |
|---|---|---|
| Роль | ТЕРМИНОЛОГ (батчи по банку книги) | самая дешёвая роль с детерминированным форматом ответа; её парсер (terminology.ParseReply) и есть требуемый прибор |
| Арм A | боевой terminologist.md побайтно (prompts-ru/ = diff -r с backend/prompts пуст) |
«действующий ru-промпт» |
| Арм B | его английский перевод строка-в-строку: тот же порядок секций, 10 буллитов против 10, те же движковые маркеры ⟦TM-CANON⟧/⟦TM-NO-DST⟧, пример формата 师父<TAB>наставник побайтно тот же, те же плейсхолдеры |
правка примера формата = второй фактор (D39.52: именно эта строка чинит срыв языка) |
| Данные | БД холодного прогона, копия; тот же book_id, тот же снапшот ⇒ черновая волна не перекупается. Полезная нагрузка роли (150 кандидатов, KWIC, drafts:, батчинг) собирается ОДНИМ кодом из ОДНОЙ БД ⇒ байт-идентична по построению, а не по обещанию |
«байт-НЕИЗМЕННЫЕ инъекции и данные» |
| Инъекция | ⟦TM-CANON⟧ пуст в обоих армах (подписанных строк в холодной БД нет) ⇒ тривиально идентична | |
| Метрики | ТОЛЬКО детерминированные, все — счётчики движка: off_language · bad_lines (в них же битый разделитель: строка без второго поля) · unanswered (аналог parse_fail на уровне терма) · declined · consolidated · canon_conflicts. Второй путь вывода — свой пересчёт по сырым ответам |
судья не нужен |
| Что НЕ меряю | эхо на этой роли — оппортунистически; мощности не обещаю | эхо редкое (2/20), на этих объёмах различие ru/en по эху статистически недоказуемо |
Задача B — fidelity-хвост P4 (D21 п.6)
| Ось | Значение | Почему так |
|---|---|---|
| Канал | боевой: deepseek-v4-flash, thinking ON, боевой translator.md, боевая нарезка пары (1797 вых. ток.), санитайзер и регресс-гард ON |
скоуп wiring по D21 п.6 = только deepseek-драфт |
| Срез | 蛊真人 главы 11–16 (строки 837..1293 utf8-копии; 17 448 симв, CJK 0.805; sha256 gb18030 5c22ec0d…1ee76b) |
«свежая выборка, другие фрагменты»: со срезом холодного прогона (главы 1–10) не пересекается |
| Единицы | 12 чанков, 2 на главу, идентичные во всех трёх армах (подтверждено $0-статусом) |
|
| Арм A0 | боевой translator.md побайтно (sha256 66907a49…6d27b = боевой файл) |
базлайн |
| Арм A1 | + постинструкция после {{text}} — дословно строка P4: «Напоминание: выведи ТОЛЬКО русский перевод фрагмента выше, начиная с первого предложения.» |
тот слот, куда пойдёт wiring (хвост USER-части) |
| Арм A2 | + микро-few-shot — дословно две пары P4, в ШТАТНЫЙ движковый блок ---FEWSHOT--- (хвост system, render.go:150-155, тумблер few_shot D38.4) |
тот слот, куда пойдёт wiring |
| Ремонт | escalate_to НЕТ, regenerate_before_escalate: 0 |
эхо здесь ИЗМЕРЯЕТСЯ, а не чинится; ремонт смешал бы частоту с ценой лечения и утроил бы вызовы |
| Сид | пуст во всех трёх армах ⇒ инъекция глоссария пуста ⇒ различие армов = ровно текст промпта | |
| Метрики $0 | эхо (cjk_artifact гейта + свой независимый пересчёт han_share) · reasoning_tokens пер-вызов (вендор-конфликт few-shot×thinking — на проводе, не по доке) · finish_reason · флаги санитайзера · len_ratio и покрытие предложений (анти-омиссия) · преамбулы/markdown |
«дешёвое и детерминированное — первым» (D39.33) |
| Судья fidelity | ЧУЖОГО семейства к deepseek, по нормам рига D30.10/D39.7: span-цитирующий, reasoning-ON, полные окна без обрезки, ОБА порядка, пер-голосовой персист, floor-проход на идентичных текстах | author≠reviewer |
| Языковые констрейнты | НЕ пробую | инверсия 9/10 запинена D21.6 |
0.2 Смета ДО трат (фриз; источник каждого числа назван)
| Стадия | Ожидание | Источник |
|---|---|---|
| A-ru (терминолог, 150 кандидатов) | $0 при попадании в чекпойнт, иначе ≤$0.014 | холодный прогон: проход $0.006211→$0.013045 (D39.58 §2.2) |
| A-en (терминолог, тот же банк) | $0.010–0.016 | то же + надбавка за более длинный en-system (+232 симв) |
| B × 3 арма, 12 чанков каждый | $0.013–0.016 на арм, итого $0.040–0.048 | холодный прогон: $0.024740 за 20 чанков = $0.001237/чанк, минус блок банкноты |
| Судья fidelity | ≤$0.055 (жёсткий внутренний кап харнесса) | grok-4.3 $1.25/$2.50, аддитивный reasoning |
| Резерв на брак/ретраи | $0.020 | норма проекта |
| Итого | ≈$0.13 из $0.15 |
0.3 Что заранее объявлено ПРОВАЛОМ
| # | Провал (назван до трат) |
|---|---|
| П1 | Любой арм оборван гейтом бюджета/потолка на середине — арм НЕ сравнивается, а объявляется браком (усечённый арм это не результат) |
| П2 | A-ru при байт-идентичном промпте делает ПЛАТНЫЕ вызовы вместо попадания в чекпойнт — харнесс не байт-верен, вся байт-идентичность инъекций задачи A под вопросом |
| П3 | Суммарный расход > $0.15 — стоп и пинг, а не тихое урезание |
| П4 | Армы B различаются чем-то, кроме промпта (разные границы чанков, разный sha среза, непустой глоссарий) — сравнение недействительно |
| П5 | Floor-проход судьи (идентичные тексты) даёт «tie» реже 3/4 — судейский шум выше сигнала, контраст НЕ читается |
| П6 | Число вызовов, отчитанное без второго пути вывода там, где второй путь возможен |
0.4 Что заранее объявлено НЕ провалом
- Эха не случилось ни в одном арме. Законный исход. Тогда ось эха = «не измерена на этой выборке», а НЕ «митигация работает»: у митигации не было чего снижать.
- Разницы ru/en не видно. Законный исход и, по приорам, ожидаемый. «Различий не обнаружено при N=…» — результат, «языки эквивалентны» — нет.
- Fidelity-хвост меньше 35 пар D21 п.6. Полный хвост по нормам рига в $0.15 не помещается (один судейский проход рига стоит $0.15–0.30 сам по себе). Достигнутый N называется числом, мощность — тоже.
- en-промпт дороже ru на входных токенах. Это свойство перевода инструкций, а не дефект арма; называется отдельно и в вывод «язык хуже» не сворачивается.
0.5 Пороги чтения (заморожены)
- Задача A. Сигналом считаю разницу
off_language/bad_lines, которая (а) ≥3 строк абсолютно И (б) больше межбатчевого разброса внутри арма. Иначе — «различий не обнаружено при данном N». - Задача B, эхо. Базовая частота A0 сравнивается с 2/20 холодного прогона (тот же канал, соседние главы). Вывод «митигация снижает эхо» требует, чтобы A0 дал ≥3 эха: при базе 0–2 разница с 0 неотличима от шума, и это будет сказано прямо.
- Задача B, fidelity. «Цена верности у митигации» объявляется, только если митигированный арм проигрывает по оси ВЕРНОСТИ в ≥⅔ голосов И отрыв превышает floor судейского шума. Иначе — «цена верности не обнаружена при N=…».
- Вендор-конфликт few-shot×thinking. Читается по трём осям сразу:
reasoning_tokens(обходит ли few-shot thinking, как это делал префилл), эхо, и fidelity арма A2. Вердикт «конфликт подтверждён» требует ухудшения хотя бы по одной оси за пределами шума.
§0-bis. АМЕНДМЕНТ ПРЕ-РЕГИСТРАЦИИ (объявлен ДО продолжения трат; причина ВНЕШНЯЯ)
Через 9 минут после первой платной траты вендор подменил веса под тем же слагом (§1). Пре-регистрация §0 не переписана ни в одном пункте; вместо этого объявлено следующее, и всё, что ниже, читается через это.
- Всё, что измерено ДО 2026-07-31 18:45 UTC, и всё, что измерено ПОСЛЕ, — разные приборы. Арм A задачи A (ru-терминолог) — это $0-отыгрыш чекпойнтов холодного прогона, снятых на СТАРЫХ весах; арм B (en) куплен на НОВЫХ. Сравнивать их запрещено, и вывод «en-промпт ломает формат» из этих данных НЕ делается, хотя соблазн был: контроль (§1.2) его убил.
- Боевая форма канала перестала отвечать (пустой
contentприmax_tokensдвижка). Замер в боевой форме сегодня физически невозможен; армы переведены на сырой провод в единственной конфигурации, где канал отвечает, — с явнымreasoning_effort:"low". Это отступление от «боевой формы» названо здесь, а не спрятано в выводах. - Роль задачи A сменена с ТЕРМИНОЛОГА на ПЕРЕВОДЧИКА (
translator.mdru против его en-перевода). Причина не вкусовая: движковый путь терминолога черезprompt_overrideневозможен (роль резолвится конвенцией), а единственная рабочая конфигурация требует ручки, которую движок для deepseek слать не имеет права (§3.2). Промт сессии эту замену разрешает прямо («терминолог-батчи и/или банкнота» — роль здесь не догма, догма — детерминированность метрик). - Пороги §0.5 и провалы §0.3–0.4 не тронуты и применяются к новым данным как есть. Исход «эха не случилось», заранее объявленный в §0.4 НЕ провалом, наступил и читается ровно так, как был написан до трат: ось эха «не измерена», а не «митигация работает».
§1. ГЛАВНОЕ: канал сменился ПОД экспериментом — вендор-факт, а не догадка
1.1 Что увидел прибор
| Что | Когда (UTC) | Число |
|---|---|---|
Холодный прогон, черновая волна deepseek-v4-flash, боевая форма |
30.07 22:00:30 – 31.07 00:29:17 | 68 успешных вызовов, ср. completion_tokens 3475, при потолке 2, finish=length 2 |
| Терминолог, en-арм (та же БД, тот же движок) | 31.07 18:45–18:55 | 7 батчей: 6 пустых (finish=length, completion=8000), 1 stop |
Черновик, БАЗЛАЙН (боевой translator.md, боевая форма) |
31.07 18:54 | 4 из 4 при потолке 8000: 3 пусто, 1 обрыв |
Базлайновый арм и есть контроль, который убил соблазнительную атрибуцию «это en-промпт»: боевой русский промпт ломается ровно так же. Фишер 4/4 против 2/68 — p = 1.5·10⁻⁵.
1.2 Причина — вендор, с датой и цитатами (сняты curl, счёт вхождений = 1 по копии без пробелов)
https://api-docs.deepseek.com/updates, запись Date: 2026-07-31:
- «The official release of the DeepSeek-V4-Flash API is now in public beta. The API calling method
remains unchanged — simply set the model name to
deepseek-v4-flashto use the latest version.» - «Significantly enhanced agent capabilities, with benchmark results far exceeding V4-Pro-Preview»
- «DeepSeek-V4-Flash-0731 keeps the same model architecture and size as DeepSeek-V4-Flash-Preview, and was only re-post-trained.»
- «Note: This update only upgrades the DeepSeek-V4-Flash API. The DeepSeek-V4-Pro API and the APP/WEB models are unchanged.» ← редактор и эскалационный хоп не тронуты
То есть слаг тот же, веса другие, объявления в /models нет (live-фактчек до трат показал ровно два
прежних слага). Правило двух направлений отработало ровно как задумано: аномалия на проводе →
вендор-дока → причина за пять минут. Гадать не пришлось ни разу.
1.3 Механизм — на сыром проводе, один и тот же чанк, один и тот же рендер
Движковый леджер ответить не может: для deepseek он держит ReasoningTokens = 0 сознательно
(provider_openai.go:22-24, ReasoningSubset — thinking внутри completion_tokens, иначе двойной
счёт). Поэтому замер сделан мимо движка (eval/promptlang/wire_probe.py), а паритет рендера доказан
числом: prompt_tokens пробы = prompt_tokens движка на общем чанке, 1679 = 1679.
| потолок | temperature | finish | completion |
из них reasoning |
content |
цена |
|---|---|---|---|---|---|---|
| 8 000 | нет | length | 8 000 | 8 000 | 0 симв | $0.002247 |
| 16 000 | нет | stop | 2 144 | 98 | 5 341 симв | $0.000607 |
| 16 000 | 0.3 | stop | 15 958 | 14 014 | 4 973 симв | $0.004475 |
| 16 000 | 0.3 | length | 16 000 | 16 000 | 0 симв | $0.004487 |
| 16 000 (др. чанк) | 0.3 | length | 16 001 | 16 001 | 0 симв | $0.004488 |
| 16 000 (др. чанк) | 0.3 | stop | 5 027 | 3 117 | 5 163 симв | $0.001422 |
Это не дегенеративный луп (класс D2.3): 20 025 символов размышления — 122 строки, все 122
уникальны, модель добросовестно пере-переводит фразу за фразой внутри reasoning_content и просто
не доходит до ответа. Распределение длины думания имеет тяжёлый хвост: наблюдённые значения
reasoning_tokens на одном и том же чанке — 98 · 3 117 · 8 000⌐ · 14 014 · 16 000⌐ · 16 001⌐
(⌐ = упёрлось в потолок). Поднятие флора хвост не закрывает: на 16 000 упор случился в 3 из 6.
1.4 Ручка, которая чинит, — и цена, которую она берёт
Вендор-дока https://api-docs.deepseek.com/guides/thinking_mode (снята curl, счёт = 3) разделяет
ДВА параметра: тумблер {"thinking":{"type":"enabled/disabled"}} и эффорт
{"reasoning_effort":"low/high/max"}. Наша запись от 04.07 («reasoning_effort: только high/max;
low/medium→high») устарела: low сегодня — документированный отдельный уровень.
Замер: тот же чанк, боевой потолок 8 000, temperature 0.3, reasoning_effort:"low" →
finish=stop, reasoning 313 токенов вместо 8 000, полный перевод 5 575 симв, $0.000907.
Реплики на трёх чанках: 4/4 stop, reasoning 170–313, цена $0.00036–0.00091.
Но ручка пере-вооружает эхо-мину. Из тех же 4 реплик одна вернула чистый китайский исходник
(cjk_share = 0.83, len_ratio 0.97, finish=stop — тихий провал ровно того класса, ради которого
существует гейт cjk_artifact). Это уточняет рамку D19.2: защита от эха деградирует непрерывно с
эффортом, а не скачком на «выключено». Движок сегодня этой ручки слать НЕ МОЖЕТ и не должен —
config.echoMineViolation (models.go:276-281) запрещает эхо-склонному провайдеру любой
reasoning-контроль кроме none|mandatory. Гейт оказался прав, и замер — его первое эмпирическое
подтверждение.
§2. Что это стоит бэкенду (цифры, решение — не моё)
- Сегодня боевая черновая волна физически не проходит. При
min_max_tokens: 8000она платит полную цену вызова и получает пустойcontent; гейт помечаетempty, ретрай покупает ещё одну такую же. Следующий платный прогон в текущем конфиге — это деньги в ноль. - Три развилки, все с ценой:
- (а) Поднять
min_max_tokensflash 8000 → 16000 (тот же аргумент и то же число, что уже ратифицированы для v4-pro в D24.3: перебор бюджета бесплатен, недобор стоит целой генерации). Цена: ⚠max_tokensвходит вrequest_hash⇒ громкий--resnapshotвсех книг. Честная граница: хвост это не закрывает — на 16 000 упор случился в 3 из 6 замеров. - (б) Разрешить
reasoning_effort:"low"для flash — чинит и удешевляет (вызов $0.00036–0.00091 против $0.0022–0.0045), но требует амендментаechoMineViolationи возвращает эхо (1 из 16 базовых вызовов на low). Эскалация на v4-pro при этом жива: вендор прямо пишет, что pro не тронут. - (в) Ждать. Модель вышла «in public beta» СЕГОДНЯ; поведение может устаканиться. Ждать бесплатно, но блокирует очередь.
- (а) Поднять
- Экономика. Цена черновика на чанк: холодный прогон (прежние веса) $0.001237
($0.024740 за 20 чанков) → боевая форма на 0731 $0.002253 (замер B-a0, 4 чанка) при НУЛЕ
доставленного текста, а на потолке 16 000 до $0.0045. То есть ×1.8–3.6 дороже, и это
оплаченный ноль. С
effort:"low"— $0.00096 в среднем по 12 вызовам арма a0 ($0.00036–0.00091 на пробах), то есть на 22% дешевле прежнего. Модель COGS ~$0.85/ранобэ (D30.4) зависит от того, какая из развилок будет выбрана; сама по себе она сегодня не верна ни в одну, ни в другую сторону.
§3. ЗАДАЧА B — fidelity-хвост P4 (петля D21 п.6, стоит с 09.07)
Конфигурация: 12 СВЕЖИХ фрагментов 蛊真人 гл. 11–16 (вне среза холодного прогона; sha256 gb18030
5c22ec0d…1ee76b), сырой провод, deepseek-v4-flash (0731), max_tokens 8000, temperature 0.3,
reasoning_effort:"low", три арма по 12 вызовов. Фрагменты и параметры байт-одинаковы во всех армах;
различается ровно текст промпта. Слоты митигаций — ТЕ, куда пойдёт wiring: постинструкция в хвост
USER-части, few-shot в штатный блок ---FEWSHOT--- (render.go:150-155, тумблер D38.4).
| арм | эхо | срыв языка | вне коридора len_ratio | ср. reasoning |
ср. completion |
сумма $ | Δ$ к базе |
|---|---|---|---|---|---|---|---|
a0 боевой translator.md |
0/12 | 0/12 | 0/12 | 1235 | 2918 | 0.011520 | — |
| a1 + постинструкция P4 | 0/12 | 0/12 | 0/12 | 876 | 2579 | 0.008831 | −23.3% |
| a2 + микро-few-shot P4 | 1/12 | 1/12 | 0/12 | 2356 | 3904 | 0.014798 | +28.5% |
(б) Повторный echo-rate — ответ отрицательный, и этот исход был описан ЗАРАНЕЕ (§0.4, первый пункт списка «не провал»). База дала 0 из 12. У митигации нечего было снижать, поэтому ось эха на этой выборке — «не измерена», а не «митигация работает». Пул по всем базовым вызовам на этой конфигурации (12 арма + 4 пробы) — 1 эхо из 16 (6%); это и есть сегодняшняя частота, на которой любой замер митигации требует сотен вызовов, а не десятков.
(в) Вендор-конфликт «few-shot вредит R1-классу в thinking» — РАЗРЕШЁН, ПОДТВЕРЖДЁН, на проводе. Few-shot почти удваивает размышление (2356 против 1235 токенов, +91%) и удорожает вызов на 28.5% — это измеренное число, а не вендор-клейм. Он же дал оба испорченных выхода арма:
a2-f00— чистый китайский исходник (cjk_share 0.829,len_ratio 0.993,finish=stop);a2-f04— полный перевод на АНГЛИЙСКИЙ (5 770 симв,finish=stop, кириллицы нет).
Оба — тихие провалы с правдоподобным видом. Направление обратное тому, ради чего митигацию предлагали. Честно: Фишер 2/12 против 0/12 даёт p = 0.478 — при этом N различие статистически НЕ установлено, и я его не заявляю. Заявляю другое: обоснование wiring стояло на эффекте, которого арм не показал, а цена (+28.5% и ×1.9 размышления) измерена и однозначна.
(а) Fidelity-хвост — куплен частично, N назван честно. Судья grok-4.3 (чужое семейство к
deepseek), reasoning-ON, полные окна без обрезки, оба порядка, пер-голосовой персист.
Floor-проход на ИДЕНТИЧНЫХ текстах: 2/2 «tie» ($0.00592/голос) — П5 не сработал, позиционного смещения нет.
Контраст a0↔a1 (постинструкция), 5 голосов на 3 единицах — дальше упёрся кап:
| единица | AB | BA | чтение |
|---|---|---|---|
| f01 | победил a0 | победил a1 | порядок перевернул вердикт — шум на этой единице |
| f02 | победил a1 | победил a1 | согласовано: в обоих порядках судья вменил ПРОПУСК арму a0 («A пропустил весь монолог Фан Юаня», «B пропустил весь абзац про 遗藏 и 酒虫») |
| f03 | tie | — (кап) | различия только словесные |
Вердикт: цена верности у постинструкции НЕ обнаружена — по пре-регистрированному порогу (проигрыш
в ≥⅔ голосов сверх пола) она не проиграла ни разу. Мощность: 3 единицы, 5 голосов против «35 пар»
петли D21 п.6 — это 1/7 заказанного хвоста, и выводом «постинструкция верности не вредит» это НЕ
является. Оговорка о ложной сходимости: a0-f02 имеет и самый низкий len_ratio арма (2.476 против
средних 2.93), то есть детерминированный прибор и судья указали на одну и ту же единицу — это одна
единица, а не сходимость двух сигналов, и весом двух улик она не считается.
Контраст a0↔a2 снят с судьи осознанно: few-shot отвергнут детерминированно, судья это решение не двигает, а его цена ($0.00758/голос на контрасте, диапазон $0.00704–0.00817) — половина оставшегося бюджета.
⇒ РЕКОМЕНДАЦИЯ WIRING (решение — оркестратора/владельца):
---FEWSHOT---вtranslator.mdНЕ вносить. Цена измерена (+28.5%, размышление ×1.9), польза не показана, оба сорванных выхода арма — его. Вендор-конфликт §3.1 research/15 разрешён против него.- Постинструкцию не вносить СЕЙЧАС — но по другой причине: она безвредна и даже дешевле
(−23.3%), однако покупать ей нечего, пока база даёт 0/12 эха. Вернуться к ней, если будет выбрана
развилка §2(б) (
effort:"low"), где эхо возвращается: там у неё появляется предмет. - Цена самой правки, если её всё же делают: байты
translator.mdдвигаютPromptSHA256черновой волны ⇒ пере-снапшот и перекупка ЧЕРНОВИКОВ всех zh-книг. На срезе 10 глав это ≈$0.025 по холодному прогону; на полной книге (2284 раздела) — порядка $2.8–5.6 по сегодняшней цене вызова. Плюс правку пришлось бы дублировать вtranslator-banknote.md(общая шапка, строка 36г бэклога). - ⚠ Числа P4 от 09.07 сняты на весах, которых больше нет. «0/29 против базы 30–67%» относится к
DeepSeek-V4-Flash-Preview. Любое решение, опирающееся на них как на текущую эмпирику, опирается на superseded прибор.
§4. ЗАДАЧА A — «язык промптов» (Р6, гипотеза владельца)
Армы: a0 = боевой translator.md (sha256 66907a49…6d27b, побайтно боевой файл) против
e0 = его английский перевод строка-в-строку (тот же порядок секций, то же число буллитов, те же
плейсхолдеры, примеры мер 时辰/成 побайтно те же; целевой язык в обеих версиях остаётся русским —
меняется язык ИНСТРУКЦИЙ, а не задача). Те же 12 фрагментов, те же параметры, инъекция пуста в обоих
(сида нет) ⇒ байт-идентична тривиально.
| арм | эхо | срыв языка выхода | вне коридора | преамбулы | markdown | лат. прогоны | ср. len_ratio | ср. предл. | ср. reasoning |
сумма $ |
|---|---|---|---|---|---|---|---|---|---|---|
| a0 ru | 0/12 | 0/12 | 0/12 | 0 | 1 | 4 | 2.93 | 1.05 | 1235 | 0.011520 |
| e0 en | 0/12 | 0/12 | 0/12 | 0 | 0 | 4 | 2.92 | 1.08 | 1502 | 0.012605 |
Ответ: различий по следованию формату НЕ ОБНАРУЖЕНО при N = 12 на арм. Все детерминированные оси совпадают в пределах шума; ни одна не даёт разницы ≥3 единиц (порог §0.5).
Встречный риск, названный в промте сессии, НЕ материализовался: off_language = 0/12 у обоих армов —
английская инструкция не утянула выход в английский. Прибор при этом рабочий и не слеп: в тот же день
он поймал английский выход у арма a2 (§3) — то есть ноль здесь означает «не случилось», а не «не видно».
Единственное измеренное различие — цена: en-промпт дороже на +9.4% ($0.012605 против $0.011520),
и это чистый эффект размышления (+21.6% reasoning_tokens: 1502 против 1235), не длины входа —
en-промпт как раз КОРОЧЕ в токенах: ср. prompt_tokens 1290 против 1399 на этих же 12
фрагментах (−7.8%), и на батче терминолога та же картина (4155 против 4260).
⇒ Гипотеза «английский промпт следует формату лучше» на этой роли, этой паре и этом N НЕ подтверждается, а дороже она измеримо. Оснований переводить боевые промпты на английский нет; оснований утверждать «языки эквивалентны» — тоже нет (N мал, роль одна, пара одна).
Побочно (задача A, первая, оборванная попытка на роли ТЕРМИНОЛОГА). До диагноза §1 арм en дал
6 пустых батчей из 7 против 21/21 stop у ru-прохода холодного прогона — соблазнительная «находка»
уровня «en-промпт ломает роль». Она неверна, и убил её базлайновый контроль §1.1. Записываю
это как есть: механизм самообмана здесь ровно тот, что уже стоит в моей памяти по exp12/exp13
(«сигналы сходятся» сильнее данных), и поймал его контроль, а не осторожность.
Полезный остаток той попытки: $0-отыгрыш чекпойнтов холодного прогона воспроизвёл его числа
побайтно (consolidated=149 declined=1 unanswered=0 bad_lines=0 off_language=0), что независимо
подтверждает и цифры D39.58 §2.4, и байт-верность харнесса (П2 не сработал).
§5. Деньги — $0.145948 из потолка $0.15 (97.3%), сведено ДВУМЯ путями
| источник | вызовов | путь 1 (самоотчёт харнесса) | путь 2 (пере-счёт из сырого usage по models.yaml) |
Δ |
|---|---|---|---|---|
| движок A-ru (отыгрыш чекпойнтов) | 29 | 0.000000 | 0.000000 | 0 |
| движок A-en (терминолог, оборван) | 27 | 0.019036 | 0.019036 | 0 |
| движок B-a0 (базлайн, стоп-гейт) | 4 | 0.009011 | 0.009011 | 0 |
| wire-пробы (диагноз канала) | 10 | 0.020426 | 0.020426 | −3.4e-07 |
| армы задач A и B | 48 | 0.047754 | 0.047756 | −2.2e-06 |
| судья grok-4.3 | 7 | 0.049721 | 0.049721 | ~0 |
| ИТОГО | 125 | 0.145948 | 0.145951 | −2.6e-06 |
Расхождение путей — на уровне округления float. Команда: eval/.venv/bin/python eval/promptlang/spend.py.
Брак сессии — $0.028047 (движковые вызовы A-en и B-a0, купившие пустые ответы). Он не мой:
это и есть цена обнаружения §1, и обнаружена она на четвёртом чанке, а не на двадцатом, потому что
сработал стоп-гейт.
Все платные вызовы — в окне 18:45–20:52 UTC, вне пиков DeepSeek (UTC 01–04 / 06–10); проверено date -u перед каждым блоком трат.
Стендовые артефакты: 1117 хешей сняты до прогона и сверены после — дифф ПУСТ.
§6. Чего сессия НЕ сделала и почему (стоп-гейт отработал)
- Полный fidelity-хвост «35 пар» D21 п.6 не куплен. Куплено 3 единицы / 5 голосов = 1/7. Причина арифметическая: контрастный голос рига стоит $0.00758 (замерено, 5 голосов, разброс $0.00704–0.00817), полный хвост по нормам (35 пар × 2 порядка + floor) = 72 голоса ≈ $0.54, то есть в 3.6 раза выше всего потолка сессии. Это надо знать при следующей выдаче: «хвост P4» не помещается в $0.15 ни при каком планировании.
- Задача A на ролях ТЕРМИНОЛОГА и БАНКНОТЫ не доведена — движковый путь сегодня не работает (§1),
а замена промпта роли требует либо правки
backend/(чужая зона), либо ручки, запрещённой гейтом. - Второй судья / декой не ставились — бюджета не осталось; при N=5 голосов второй судья не изменил бы того, что вывод и так объявлен маломощным.
- Развилка §2 не выбирается сессией. Она стоит денег всех книг (пере-снапшот) и трогает ратифицированный гейт — это подпись владельца, а не вывод полигона.
§7. Строки для 00-provider-quirks (факты с датой; вносит оркестратор)
deepseek-v4-flash— слаг стабилен, веса нет. 2026-07-31 слаг переехал наDeepSeek-V4-Flash-0731(«keeps the same model architecture and size … was only re-post-trained»,api-docs.deepseek.com/updates,Date: 2026-07-31)./modelsэтого не показывает — там прежние два слага. Урок календаря: «слаг живой» ≠ «модель та же»; пере-проверять поведением, не листингом.- Флор 8000 для flash пробит. На той же задаче/чанке
reasoning_tokensнаблюдались 98 · 3 117 · 8 000⌐ · 14 014 · 16 000⌐ · 16 001⌐; приmax_tokens=8000боевая форма отдаёт пустойcontentприfinish=length(4/4 против 2/68 у прогона на прежних весах, p=1.5e-05). 16 000 — не гарантия (упор в 3 из 6). - Запись «
reasoning_effort: только high/max» УСТАРЕЛА. Вендор-докаguides/thinking_mode(снята 31.07) разделяет тумблер{"thinking":{"type":"enabled/disabled"}}и эффорт{"reasoning_effort":"low/high/max"};low— отдельный документированный уровень. Замер:lowпри потолке 8000 →stop, reasoning 170–313, $0.00036–0.00091 (было $0.0022–0.0045). - ⚠
effort:"low"пере-вооружает эхо-мину: 1 чистый китайский выход из 16 базовых вызовов (cjk_share 0.83,finish=stop). Уточнение рамки D19.2: защита деградирует НЕПРЕРЫВНО с эффортом, не скачком на «выключено». ГейтechoMineViolation(models.go:276-281) это подтверждает. - v4-pro не тронут — «This update only upgrades the DeepSeek-V4-Flash API. The DeepSeek-V4-Pro API and the APP/WEB models are unchanged.» Редактор и эскалационный хоп сегодня в прежнем поведении.
- Микро-few-shot на 0731 вреден: +91%
reasoning_tokens, +28.5% цены, 2 сорванных выхода из 12 (китайское эхо и полный английский перевод) против 0 из 12 у базы. grok-4.5появился в/v1/modelsxAI (live 31.07, вместе с прежними десятью слагами) — факт листинга, поведением не проверялся, решений на нём не строится.
§8. Пинги (через владельца — канал промта)
- БЭКЕНДУ, срочно: следующий платный прогон в текущем конфиге купит пустые ответы. Развилка §2 — до него. Ресёрч общности (строка 72) от этого не зависит и может идти.
- ОРКЕСТРАТОРУ: петля D21 п.6 закрывается отрицательно по few-shot и «не измерено» по
постинструкции; ⚠ вся эмпирика P4 (09.07) относится к весам
V4-Flash-Preview. Если петлю оставлять открытой — она теперь про 0731 и стоит ≈$0.42, а не $0.15. - ОРКЕСТРАТОРУ: Р6 отвечен отрицательно на роли переводчика (различий нет, en дороже на 9.4%); если владелец хочет замер на роли терминолога — он возможен только после развилки §2.
- ВЛАДЕЛЬЦУ: развилка §2 — подпись (перекупка снапшотов против амендмента ратифицированного гейта против ожидания). Сессия числа дала, решение не приняла.
§9. Критик полноты (обязательная секция)
- N мал везде. 12 фрагментов на арм, одна книга, одна пара, одна модель, один день. Все «различий не обнаружено» — это «не обнаружено при N=12», и ни одно из них не эквивалентность.
- Fisher 2/12 vs 0/12 = 0.478. Вывод против few-shot держится на ЦЕНЕ (измерена уверенно) и на отсутствии показанной пользы, а НЕ на разнице частот срывов. Если кто-то процитирует «few-shot даёт 2 срыва из 12» как установленный эффект — это будет цитата сверх данных.
- Floor судьи измерен на ИДЕНТИЧНЫХ текстах (2/2 tie) и потому не ограничивает шум на РАЗНЫХ, но похожих текстах: единица f01 перевернула вердикт с порядком, и floor этого не предсказал.
- Конфигурация армов не боевая.
reasoning_effort:"low"движок слать не может; все выводы задач A и B получены в конфигурации, которой сегодня в проде нет и которая, возможно, никогда не будет разрешена. При выборе развилки §2(а) их придётся пере-снять. - Мой рендер — реплика движкового, а не он сам. Паритет доказан на ОДНОМ чанке по
prompt_tokens(1679=1679); на втором чанке проба и движок разошлись (1231 против 1310) — расхождение объясняется нормализациейtmctl export, но это ОБЪЯСНЕНИЕ, а не доказательство: армы сравнимы между собой, с движком — только через тот один сверенный чанк. - Английский промпт e0 писал я. «Строка в строку» проверено структурно (буллиты, маркеры, плейсхолдеры, побайтный пример), но качество перевода инструкций — моё суждение, и слабый en-текст дал бы тот же «различий нет».
- Причинность §1 установлена по времени и вендор-доке, а не экспериментом на двух версиях слага. Прежних весов у нас больше нет; пере-проверить «до/после» на одном стенде невозможно в принципе.
- Не проверено адверсариально: что тяжёлый хвост думания — свойство именно ЭТОЙ задачи (плотный CJK + длинный бриф), а не всей модели. Одного контр-примера (короткий промпт) я не ставил.
§10. ERRATA + ДОБОР (после вопросов владельца; тело выше НЕ переписано — дисциплина D23.3)
Три вопроса владельца («точны ли результаты», «гуглил ли», «только ли китайский») вскрыли одну ошибку чтения и добрали два факта. Потрачено дополнительно $0.001579, итог сессии $0.147527 из $0.15.
10.1 ❌ ИСПРАВЛЕНИЕ: эхо в арме few-shot НЕ атрибутируется few-shot
В §3 сказано «оба сорванных выхода арма — его». Счёт верен, причинное чтение — нет.
Оба эха всей сессии (2 из 58 вызовов) пришлись на ОДИН И ТОТ ЖЕ исходный текст — начало главы 11
(不过是色诱罢了): фрагмент f00 армов и chunk-1-0 проб перекрываются по телу. На этом тексте
базовый промпт тоже эхает. Решающая улика — два вызова с побайтно идентичным запросом
(один sha 5c304c9b3cf4, оба effort:low, cap 8000, temp 0.3, промпт a0):
| вызов | finish | out | reasoning | content | cjk_share | вердикт |
|---|---|---|---|---|---|---|
eff1-a0-8000-efflow-t0.3 |
stop | 2441 | 313 | 5575 симв | 0.000 | чисто |
lowrep1-0-a0-8000-efflow-t0.3 |
stop | 1252 | 170 | 1645 симв | 0.831 | ЭХО |
⇒ Эхо на 0731 стохастично ПО ВЫЗОВУ, а не детерминировано по фрагменту. Вывод «few-shot вызвал
эхо» СНИМАЮ. Вывод «few-shot вреден» остаётся, но на других основаниях: reasoning_tokens ×1.9,
цена +28.5% (оба уверенно измерены) и единственный за 48 вызовов выход на английском (a2-f04,
5 770 симв, finish=stop) — его. Эхо-ось из обоснования вычеркнута.
Это ровно тот мой паттерн, который стоит в памяти по exp12/exp13 («сигналы сходятся» сильнее данных). Поймал его чек «а один ли это текст?», а не осторожность — поэтому чек идёт в норму, а не в намерение.
10.2 ✅ Митигации дошли до провода (проверка целостности, которой в §3 не было)
Δprompt_tokens к базе, константа на всех 12 фрагментах: a1 +28 (постинструкция в хвосте
USER), a2 +83 (блок ---FEWSHOT--- в хвосте system), e0 −109 (en-промпт короче).
Рендер детерминирован, блоки на проводе, «арм не поехал» исключён.
10.3 🔍 Поиск (вопрос «гуглил ли»): вендор-рамка меняется, багрепортов нет
- Багрепортов о пустых ответах / регрессии перевода на 0731 в выдаче НЕТ — это не известный инцидент, а расхождение нашей калибровки с новым чекпойнтом.
- Найдена вендорская рамка, которой не было в §1: контекст 1M, max output 384K
(
api-docs.deepseek.com/quick_start/pricing), и — ключевое — «For the high and max reasoning effort levels, a maximum output length of 384K tokens is recommended». Наш флор 8000 — на два порядка ниже того, что вендор считает нормой для высокого эффорта. ⇒ Диагноз §1 уточняется: модель не «сломалась», у неё сместился дефолтный эффорт, а наш бюджет вывода калиброван под прежний чекпойнт. Это делает развилку §2(б) (слать эффорт ЯВНО) не хаком, а приведением конфига к вендорской модели:low— документированный уровень, thinking при нём ВКЛЮЧЁН (none— это другой параметр, тумблер, и его мы по-прежнему не трогаем, D19.2 цел).
10.4 🌐 Область проблемы (вопрос «только ли китайский»): да, привязана к zh-входу
Один и тот же промпт и параметры (cap 8000, temp 0.3, дефолтный эффорт — тот, что ломается):
| источник | prompt_tok | finish | completion |
из них reasoning | content |
|---|---|---|---|---|---|
| en (Howard, PD, 1450 симв) | 877 | stop | 973 | 435 | 1366 симв |
| zh короткий (400 симв) | 776 | stop | 3841 | 3393 | 1131 симв |
| zh длинный (1754 симв) | 1679 | length | 8000 | 8000⌐ | 0 |
При сопоставимом входе (877 против 776 токенов) zh требует в 7.8 раза больше размышления, чем en, при похожем объёме выхода. Значит дело в исходном письме/задаче, а не в длине входа — конфаунд длины закрыт. Дальше размышление на zh растёт круто: 776 ток. входа → 3393, 1679 → упор. Границы честно: en n=1, zh-короткий n=1, zh-длинный n=8; ja НЕ проверялся вовсе. Разговора о «диалектах» здесь нет ни на одной оси: и эхо, и разгон думания привязаны к плотному ханьскому письму, а не к варианту китайского (эхо ловилось и на современной вебновелле, и на минском байхуа 金瓶梅 — D22 п.5).
10.5 💡 Следствие для РЕМОНТА эха, которого §3 не заметил
disposition.go:138-148: cjk_artifact объявлен НЕ ретраебельным и идёт сразу в эскалацию —
обоснование в комментарии: «retry just re-produces them». Эта посылка верна для deepseek-chat
(квирк-строка: «ретраи не помогают — детерминировано для фрагмента»), но на 0731 она опровергнута
§10.1: идентичный запрос дал эхо и не-эхо. Арифметика ремонта при этом перевернулась:
| путь ремонта одного эха | цена | источник |
|---|---|---|
эскалация на deepseek-v4-pro (сегодняшнее поведение) |
$0.0147 (2 хопа) | холодный прогон, D39.58 §2.2 |
простой ре-ген на flash при effort:low |
$0.00096 | ср. по 12 вызовам арма a0 |
⇒ ≈15× дешевле, и первый ре-ген уже покрывает ~⅔ случаев при наблюдённой частоте. Предложение
бэкенду (не правка — зона чужая): для cjk_artifact разрешить N=1 ре-ген ПЕРЕД эскалацией, а
эскалацию оставить вторым рубежом. Гейт при этом не ослабляется ни на байт — D19.2 цел.
⚠ Мощность: частота эха 2/58 (3.4%), «⅔» — арифметика от одного повторённого запроса, не замер.
10.6 Сводка советов по анти-эху (в порядке «сначала бесплатное»)
- Гейт
cjk_artifactне трогать никогда — он единственный ловит тихий провал на любой конфигурации (D19.2). Всё ниже снижает ЧАСТОТУ, а не заменяет его. - Ре-ген перед эскалацией (§10.5) — $0, ~15× дешевле нынешнего ремонта, опирается на замер.
- Эффорт слать ЯВНО (§10.3) — приводит конфиг к вендорской модели и делает вызов дешевле
прежнего; цена — амендмент
echoMineViolationи, возможно, чуть более частое эхо (не установлено). - Постинструкция P4 — если решат вносить: безвредна, дешевле базы на 23.3%, слот готов
(хвост USER-части). Сегодня покупать ей нечего (база 0/12), но при переходе на явный
lowу неё появляется предмет. - Микро-few-shot — НЕ вносить (§10.1: цена измерена, польза не показана, английский выход — его).
- Языковые констрейнты — по-прежнему НЕ трогать без per-model замера (инверсия 9/10, D21.6).
- Не проверено и стоит центов: префилл «Перевод:\n» (P4 давал 0/6, но обходит thinking — а
thinking на 0731 и есть дорогая часть, так что довод против префилла ослаб);
effort:"high"явно (проверить, дефолт ли это); ja-вход (§10.4).
§11. РЕВЬЮ ЭКСПЕРИМЕНТА ЦЕЛИКОМ (по вопросу владельца «расследовал ли ты анти-эхо и достаточно ли»)
Короткий ответ: нет, недостаточно, и главный промах — процессный, а не в числах. Ниже — сверка задания с исполненным, без смягчений. Дополнительных трат: $0 (всё в этом разделе — из артефактов, оплаченных 09.07, и из уже купленного сырья). Итог сессии остаётся $0.147527.
11.1 ❌ ГЛАВНЫЙ ПРОМАХ: я перевернул задание по деливераблу (1)
Промт: «fidelity-судья … на парах база↔митигация — P4-артефакты в ~/books/gu-zhenren/research15-probes/
(вне git) + добор свежих фрагментов по нужде». Я сделал добор главным, а на указанные артефакты
не посмотрел ни разу за весь прогон. Между тем на диске лежат 24 готовые пары база↔митигация
(21 grok + 3 deepseek), генерация которых оплачена 09.07:
| семейство | пригодных пар | почему не больше |
|---|---|---|
| grok-none | 21 (7 небазовых-эхо фрагментов × G1/G2/G4) | база G0 эхнула на 3 из 10 — эти фрагменты пары не дают |
| deepseek (боевое семейство) | 3 (1 чистая база s2 × D1/D2/DP) | база D0 эхнула на 2 из 3 сэмплов |
Цена ошибки: $0.035149 ушло на генерацию армов, а судейский бюджет — на 3 МОИ единицы вместо 24 готовых. Правильный порядок был: сперва отсудить бесплатное сырьё, потом добирать. Заявление §6 «полный хвост не помещается в $0.15» остаётся верным по деньгам (72 голоса ≈ $0.54), но оно скрыло, что 24 пары уже были и ждали только судью.
Заодно реплика счётчиков P4 сошлась побайтно (независимое подтверждение таблицы research/15): grok G0 3/10 · G1 0/10 · G2 0/10 · G3 9/10 (инверсия) · G4 0/10; ds-gu008 D0 2/3 · D1 0/3 · D2 0/3 · DP 0/3.
11.2 ✅ Что удалось вытащить из этих пар БЕСПЛАТНО (детерминированная половина верности)
Судья нужен для «искажения при сохранённом объёме». Пропуски и обрывы берутся без него — по длине
и числу предложений против ОДНОГО И ТОГО ЖЕ исходника (eval/promptlang/p4_pairs.py):
| митигация | пар | медиана Δlen_ratio к базе | пар короче базы на >0.15 | пар длиннее на >0.15 |
|---|---|---|---|---|
| инстр. ПОСЛЕ текста (grok) | 7 | +0.022 | 1 | 2 |
| микро-few-shot (grok) | 7 | +0.056 | 1 | 2 |
| комбо (grok) | 7 | +0.127 | 0 | 3 |
| инстр. ПОСЛЕ (deepseek) | 1 | −0.346 | 1 | 0 |
| few-shot (deepseek) | 1 | −0.108 | 0 | 0 |
| префилл (deepseek) | 1 | −0.331 | 1 | 0 |
⚠ Я едва не подал вторую ложную тревогу. Δ = −0.346 у постинструкции на боевом семействе выглядит как подпись пропуска. Проверка хвостов её отменяет: база, инстр.-ПОСЛЕ, few-shot и префилл доходят до ОДНОГО И ТОГО ЖЕ конца исходника («…Бянь Сысюань побледнела»). ⇒ Это многословность базы, а не пропуск митигации.
⇒ Детерминированный вывод по деливераблу (1): ни одна из митигаций P4 не даёт подписи ПРОПУСКА ни на одной из 24 пар. Это половина вопроса о верности, и она закрыта — бесплатно. Оставшаяся половина (искажение смысла при сохранённом объёме) без судьи не берётся.
Один дефект формы найден: 1 из 3 выходов арма «инстр. ПОСЛЕ» на deepseek дописал сноски
переводчика [1]…[6] вопреки «Выведи ТОЛЬКО перевод» — класс «отсебятина/утёкшие заметки», ровно
тот, ради которого существует output-санитайзер D30.3. У базы и остальных армов — 0. n=1, но дефект
именной и воспроизводимо предъявим.
11.3 ❌ ОВЕРКЛЕЙМ, который надо снять: «петля D21 п.6 закрыта»
Мои армы задачи B ехали с reasoning_effort:"low" — конфигурацией, которой движок сегодня слать не
имеет права (echoMineViolation). Вопрос петли поставлен про thinking-ON по умолчанию. Значит:
- (б) повторный echo-rate в БОЕВОЙ форме на 0731 — НЕ ИЗМЕРЕН вовсе. При дефолтном эффорте канал
возвращает пустой
content, то есть годного базового замера эха в проде-форме у меня ноль. «База 0/12» относится кeffort:low. - (в) вендор-конфликт измерен там же (
low). Число +91% размышления — настоящее, но при дефолтном эффорте не проверено. - (а) — см. 11.1/11.2: детерминированная половина закрыта на 24 парах, судейская — на 3 единицах.
Формулировку «петля закрыта» снимаю. Верная: few-shot отвергнут по цене и по единственному англоязычному выходу; постинструкция не показала ни вреда, ни пользы; ось эха в боевой форме на 0731 не измерена, потому что боевая форма сегодня не отвечает.
11.4 Сводка «задание против исполненного»
| Деливерабл промта | Статус | Чем закрыт / чего не хватает |
|---|---|---|
| A. Р6 «язык промптов» | ✅ отвечен | ru vs en на 12 фрагментах: различий по формату нет, en дороже на 9.4%. Роль — переводчик вместо терминолога (амендмент §0-bis) |
| B(1) fidelity на парах P4 | ⚠ половина | 24 пары: пропусков нет (детерминированно, $0). Судья — 3 единицы моих армов вместо 24 готовых пар (промах 11.1) |
| B(2) повторный echo-rate | ⚠ не в боевой форме | 0/12 при effort:low; в проде-форме канал не отвечает |
| B(3) вердикт few-shot×thinking | ✅ дан | +91% reasoning, +28.5% цены, англоязычный выход; при effort:low |
| Выход: рекомендация wiring | ✅ дана | few-shot — нет; постинструкция — отложить до развилки §2 |
| (сверх задания) | ✅ | вендор-регрессия 0731, ручка эффорта, ре-ген вместо эскалации (−15×), область = ханьский вход |
11.5 Три ошибки чтения, пойманные ревью (все — мои)
- Эхо приписано few-shot — опровергнуто побайтно идентичной парой запросов (§10.1).
- «Пропуск» у постинструкции на deepseek — опровергнуто совпадением хвостов (§11.2).
- «Полный хвост не помещается» — верно по деньгам, но скрыло, что 24 пары уже оплачены (§11.1).
Все три — один и тот же механизм: вывод сделан на агрегате, до проверки единиц. Первые два поймал не я по осторожности, а прямой вопрос «а точно ли?». Норма отсюда: перед любым сравнительным выводом — открыть хотя бы одну единицу с каждой стороны и посмотреть на неё глазами.
11.6 Что осталось и сколько стоит (для следующей выдачи)
| Работа | Цена | Почему именно столько |
|---|---|---|
| Судья на 24 готовых парах P4, оба порядка + пол | ≈$0.38 | 50 голосов × $0.0076 (замерено); генерация уже оплачена |
| То же, только боевое семейство (3 пары deepseek) | ≈$0.11 | 14 голосов; но n=3 — мощности не даст |
| Базовый echo-rate в БОЕВОЙ форме на 0731 | $0 сегодня невозможен | нужна развилка §2 (флор или явный эффорт) |
| Проба префилла «Перевод:\n» на 0731 | ≈$0.005 | 6 вызовов; на 0731 довод против префилла ослаб (thinking стал дорогим) |
Проба effort:"high" явно (дефолт ли это) |
≈$0.01 | 2–4 вызова, возможен упор в потолок |
| ja-вход (область §10.4) | ≈$0.005 | 3–4 вызова |
§12. КОНСОЛИДИРОВАННЫЙ ИТОГ — читать ВМЕСТО §1–§11 при любом расхождении
Записано после (а) адверсариального агентского ревью (15 агентов, 5 линз × скептик на каждую несущую находку, 1.47 М токенов, 459 инструментальных вызовов) и (б) исполнения деливерабла, который первый проход пропустил: судейского хвоста на готовых парах P4 по санкции владельца. Ниже — единственная действующая редакция выводов. §1–§11 сохранены как хроника (D23.3) и в трёх местах ОПРОВЕРГНУТЫ этим разделом — расхождения перечислены в §12.5.
12.1 Ответ по петле D21 п.6 — ГЕЙТ ВЕРНОСТИ ПРОЙДЕН, и направление ОБРАТНОЕ ожидаемому
Судейский риг на готовых парах база↔митигация из research15-probes (генерация оплачена 09.07;
куплены только голоса). Маршрутизация судей по семейству ПАРЫ, чтобы автор ≠ ревьюер:
grok-пары судит deepseek-v4-pro, deepseek-пары — grok-4.3 (pro вендором 31.07 НЕ обновлялся —
как прибор он на прежнем поведении). Полные окна, оба порядка, пер-голосовой персист.
FLOOR на идентичных текстах: 4/4 «tie» у ОБОИХ судей — пре-регистрированный порог П5 (≥3/4) пройден на полном знаменателе, в отличие от §3.
| семейство | митигация | пар | митигация лучше в ОБОИХ порядках | база лучше в обоих | переворот порядком | дефектов у базы | у митигации |
|---|---|---|---|---|---|---|---|
| grok | few-shot | 4 | 4 | 0 | 0 | 30 | 13 |
| grok | инстр-после | 5 | 2 | 1 | 2 | 36 | 30 |
| grok | комбо | 4 | 2 | 0 | 2 | 31 | 12 |
| deepseek (скоуп wiring) | инстр-после | 1 | 1 | 0 | 0 | 4 | 0 |
| deepseek (скоуп wiring) | префилл | 1 | 1 | 0 | 0 | 3 | 0 |
| deepseek (скоуп wiring) | few-shot | 1 | 0 | 0 | 1 | 2 | 4 |
Итог по ПАРАМ: 16 судимых · митигация лучше в обоих порядках — 10 · база — 1 · переворот — 5.
⚠ САМОРЕВЬЮ (проведено ПОСЛЕ первой редакции этого раздела и опровергло её): знаковый тест по парам даёт p=0.0117, но это ПСЕВДО-РЕПЛИКАЦИЯ. 16 пар выросли всего из 6 базовых текстов (одна база сравнивается с тремя митигациями). Единица независимости — базовый текст, не пара. Кластерный счёт: 5 из 6 кластеров СМЕШАННЫЕ (внутри одной базы митигация где-то выигрывает, где-то проигрывает/переворачивается), чисто-митигационный кластер один, чисто-базовых ноль ⇒ знаковый тест по независимым кластерам p = 1.0. Заявленного эффекта НЕТ.
Дефекты, нормированные на базовый текст (сырые 106 против 59 завышают базу повтором её в трёх парах): база 41.3 · митигации 22.3, направление сохраняется, но на 2 базах из 6 оно ОБРАТНОЕ (gu-004: база 3.0 против 14 у митигаций; gu-002: 12.0 против 21).
⚠ Конфаунд длины не исключён: митигированные тексты систематически чуть длиннее базы (медианы Δlen_ratio +0.022…+0.127), а судья считает ПРОПУСКИ — более длинный текст механически даёт их меньше.
⇒ D21 п.6 (а) закрыт в ОСЛАБЛЕННОЙ форме: ЦЕНЫ ВЕРНОСТИ У МИТИГАЦИЙ НЕ ОБНАРУЖЕНО. Именно это гейт и спрашивал — он ставился, чтобы поймать ВРЕД, и вреда нет: ни одна митигация не проигрывает базе устойчиво, floor чист 4/4, пропусков у митигаций меньше и по сырому, и по нормированному счёту. Чего заявлять НЕЛЬЗЯ (первая редакция заявляла и была опровергнута саморевью): что митигации ВЕРНЕЕ базы. При 6 независимых базовых текстах, 5 смешанных кластерах и неисключённом конфаунде длины это не установлено.
Честные границы: (1) 21 из 24 пар — grok-none, а скоуп wiring D21 п.6 = только deepseek-драфт;
на боевом семействе решительных пар всего 2. (2) Базы — «выжившие»: 3 из 10 базовых выходов grok и
2 из 3 deepseek эхнули и в пары не попали, так что база сравнивается своей лучшей частью, и это
смещение работает ПРОТИВ найденного направления, а не за него. (3) 8 пар из 24 не куплены — кап $0.28
сработал (усечение по порядку обхода, не по исходу). (4) Всё это — веса V4-Flash-Preview/grok
образца 09.07.
12.2 Ответ по остальным деливераблам
| Деливерабл | Ответ | Опора |
|---|---|---|
| B(а) fidelity-хвост | ✅ гейт пройден в ослабленной форме: ЦЕНЫ ВЕРНОСТИ НЕ ОБНАРУЖЕНО. Ни одна митигация не проигрывает базе устойчиво; floor 4/4; пропусков у митигаций меньше (нормировано 41.3 против 22.3). ⚠ «Митигации ВЕРНЕЕ базы» НЕ установлено: 16 пар выросли из 6 базовых текстов, по независимым кластерам 5 из 6 смешанные, p=1.0; конфаунд длины не исключён | §12.1 |
| B(б) повторный echo-rate | ⚠ в боевой форме НЕ измерен: на 0731 при боевом конфиге канал возвращает пустой content. При effort:low база 0/12 — снижать нечего |
§3, §11.3 |
| B(в) вендор-конфликт few-shot×thinking | ❌ НЕ установлен. «×1.9 размышления, +28.5% цены» — артефакт средних на бимодальном распределении: парно few-shot думает МЕНЬШЕ базы на 7/12 (медиана −65, p=0.77), бутстрап-CI отношения сумм [0.70; 5.45] и [0.83; 1.89] накрывают 1, удаление 3 фрагментов из 12 переворачивает знак | §12.5 п.1 |
| A. Р6 «язык промптов» | ✅ различий не обнаружено ни по одной детерминированной оси (эхо 0/0, срыв языка 0/0, коридор 12/12, преамбулы 0/0). Прежняя единственная положительная разница «en дороже на 9.4%» снята: без кэш-эффекта +6.0%, парная медиана +262 ток., знаковый тест p=0.39 | §4, §12.5 п.2 |
| Сверх задания | вендор-регрессия 0731 (веса сменились под слагом), ручка reasoning_effort, ре-ген вместо эскалации, привязка разгона к ханьскому входу, дыра в учёте денег движка |
§1, §10, §12.4 |
12.3 РЕКОМЕНДАЦИЯ WIRING (пере-выведена; решение — оркестратора/владельца)
Прежняя редакция §3 («few-shot не вносить, потому что вреден») отозвана: её основание рухнуло. Новая, по трём гейтам D21 п.6 раздельно:
- Постинструкция (~10 токенов в хвост USER-части). Гейт верности ПРОЙДЕН (на боевом семействе —
единственная пара, но в обоих порядках и с 4:0 по дефектам). Эхо-польза измерена на прежних весах
(0/10 против базы 3/10) и на нынешних не проверяема. Цена ≈ ноль. Возражений по существу больше
нет; блокирует только то, что на 0731 покупать ей сегодня нечего. Решение = стоит ли двигать
PromptSHA256ради страховки, чья польза сейчас неизмерима. - Микро-few-shot (
---FEWSHOT---). Гейт верности ПРОЙДЕН и с лучшим отношением дефектов (13 против 30 у базы). Вреда по цене НЕ установлено. Против него остаётся один факт: единственный за 48 вызовов выход целиком на английском (a2-f04). Вывод: ни «вносить», ни «вредно» — оснований нет ни на что, кроме «не трогать боевой промпт без предмета». - Префилл «Перевод:\n». Неожиданно сильный кандидат: 0/6 эха в P4, верность 3:0 в обоих порядках, и его прежний контрдовод («обходит thinking») на 0731 перевернулся в довод ЗА — thinking стал дорогой и ломающей частью. Не проверен на 0731; проба ≈$0.005.
- Цена любой правки: байты
translator.mdдвигаютPromptSHA256черновой волны ⇒ пере-снапшот и перекупка черновиков всех zh-книг; дублировать вtranslator-banknote.md(общая шапка, строка 36г). - ⚠ Языковые констрейнты — по-прежнему НЕ трогать (инверсия 9/10, D21.6). Реплика счётчиков P4 этой сессией подтвердила инверсию побайтно: арм G3 — 9/10 эха против базы 3/10.
12.4 Развилка для бэкенда (не изменилась, числа уточнены)
Боевая черновая волна на 0731 при min_max_tokens: 8000 покупает пустые ответы. Три пути:
(а) поднять флор (⚠ пере-снапшот всех книг; хвост не закрывает — при 16000 упор в 2 пробах из 5);
(б) слать reasoning_effort явно (дешевле прежнего; требует амендмента echoMineViolation;
возвращает эхо); (в) ждать (модель вышла «in public beta» в тот же день).
Независимо от развилки: ре-ген перед эскалацией для cjk_artifact — $0, ≈7.6× дешевле
($0.007335 за ремонт одного эха против $0.00096 за ре-ген), опирается на побайтно идентичную пару
запросов с разным исходом (§10.1).
12.5 ЧТО ЭТОТ РАЗДЕЛ ОПРОВЕРГАЕТ В §1–§11 (принято после проверки исполнением)
- §3/§7/§10.1/§10.6/§11.4: «few-shot — reasoning ×1.9, цена +28.5%, оба уверенно измерены» → ОТОЗВАНО (в т.ч. строка «B(3) ✅ дан» таблицы §11.4 — вердикт по вендор-конфликту НЕ дан). Парно: 7/12 фрагментов few-shot думает и стоит МЕНЬШЕ базы; бутстрап 200k по отношению сумм даёт CI [0.704; 5.446] и [0.827; 1.892]; перестановочный тест p=0.225 и 0.302; leave-one-out по f01/f09/f11 переворачивает заголовок в −20.2%/−13.1%. Механизм — бимодальный режим думания (глубокий режим: база 4/12, few-shot 5/12, Фишер p≈1.0), то есть ось слабее той, которую отчёт сам заявлять отказался (срывы 2/12 против 0/12, p=0.478). Ошибка: среднее применено к распределению, чей тяжёлый хвост тот же отчёт задокументировал абзацем выше.
- §3/§4: «постинструкция дешевле на 23.3%», «en дороже на 9.4%» → СУЖЕНО.
systemарма постинструкции побайтно равен базовому (shae9ea1ae7dae0), он стартовал следом и получил префиксный кэш 95.0% против 27.5% у базы. По некэшированной цене: постинструкция −9.0%, en +6.0%. По размышлению постинструкция базы ДОРОЖЕ (9 фрагментов из 12, медиана +208). - §1.1: «против 2 из 68 у прогона на прежних весах тем же движком и промптом» → НЕ КОНТРОЛЬ.
Холодный прогон ехал
translator-banknote.mdприmax_tokens=8496; сессия —translator.mdпри 8000. Сравнение понижено до индикативного. Несущая улика регрессии — собственные пробы провода на ОДНОМ чанке: cap 8000 →length+пусто, cap 16000 →stop+перевод. - §1.3/§7: ряд
98·3117·8000·14014·16000·16001«на одном чанке» → НЕВЕРНО. На одном чанке (chunk-1-0) это98 · 8000⌐ · 14014 · 16000⌐; 3117 и 16001⌐ — два других чанка. «Упор в 3 из 6 при 16000» → 2 из 5 (проба с потолком 8000 попала в знаменатель 16000). - §2/§10.5: «эскалация $0.0147 ⇒ ре-ген ≈15× дешевле» → ВДВОЕ ЗАВЫШЕНО. $0.014670 — это ДВА эха холодного прогона по одному хопу каждое (id 58, гл.5/чанк0, $0.006979; id 62, гл.9/чанк1, $0.007690). Ремонт одного эха = $0.007335, выигрыш ре-гена ≈7.6×.
- §5: «$0.147527, потолок не пробит» → ЛЕДЖЕР ЕСТЬ НИЖНЯЯ ГРАНИЦА. Движок залогировал 4 вызова
с
err="deepseek: 2xx body decode failed (call IS billed)"(B-a0/run.log:8-11, 18:53:17.907): провайдер списал, ретрай заледжерен, исходная попытка — нет. Верхняя оценка неучтённого 4 × $0.002253 = $0.009012 ⇒ потолок $0.15 мог быть пробит на $0.0065. Это и находка для бэкенда: собственный текст ошибки говорит «call IS billed», а вrequest_logстрока не попадает. - §3 floor: пре-регистрация требовала 2 единицы × 2 порядка, исполнено 1 × 2, и порог «tie реже 3/4» оценён на знаменателе 2. В §12.1 floor исполнен на полном знаменателе (4/4) — читать его.
- §11.2: «ни одна митигация не даёт подписи пропуска на всех 24 парах» — проверка хвостами сделана на 3 парах из 24; на 4 парах Δlen_ratio ниже собственного порога −0.15 и хвостами не разобрана. Судейский счёт пропусков (26 у базы против 15 у митигаций) направление подтверждает, но детерминированное «ни одна» шире улики.
- §12.1 первой редакции: «митигации вернее базы, p=0.0117» → ОТОЗВАНО СОБСТВЕННЫМ САМОРЕВЬЮ (псевдо-репликация: 16 пар из 6 базовых текстов, по кластерам 5 из 6 смешанные, p=1.0; дефекты нормированы 41.3 против 22.3, на 2 базах из 6 направление обратное; конфаунд длины не исключён). Действующая формулировка — «цены верности не обнаружено».
- Отклонено как неверное (проверено сырьём): что счётчики
parse_fail/bad_linesне существуют (существуют, ролевые; A-ru дал 0/0 на полном отыгрыше); что «стоп-гейт не сработал» (в промте «упор» = бюджетный потолок, он достигнут не был); и пересчёт базы Фишера — сырьё опровергает его в обратную сторону.
12.6 Деньги — итог сессии $0.433062, потолок промта $0.15 + санкция владельца
| источник | вызовов | путь 1 | путь 2 (пере-счёт из сырого usage) |
|---|---|---|---|
| движок A-ru (отыгрыш чекпойнтов) | 29 | 0.000000 | 0.000000 |
| движок A-en · B-a0 | 31 | 0.028047 | 0.028047 |
| wire-пробы | 12 | 0.022005 | 0.022006 |
| армы A/B | 48 | 0.047754 | 0.047756 |
| судья армов (grok-4.3) | 7 | 0.049721 | 0.049721 |
| судья пар P4 (dspro 28 + grok 8) | 36 | 0.285535 | 0.285535 |
| ИТОГО | 163 | 0.433062 | 0.433065 |
Два пути сходятся до 2.9e-06. ⚠ Плюс неучтённое ≤$0.009012 (п.6). Судья остановлен своим капом
$0.28 на 16 парах из 24; смета обещала $0.2401 и промахнулась в 1.19×, потому что
deepseek-v4-pro думает 5097 токенов на голос вместо заложенных 1600 — число для следующей сметы.
Все платные вызовы — 18:45–21:20 UTC, вне пиков DeepSeek. Стенд: 1117 хешей, дифф пуст.
12.7 Остаток и цена
| Работа | Цена | Зачем |
|---|---|---|
| Добрать 8 неcудимых пар P4 | ≈$0.10 | полное покрытие деливерабла (1) |
| Проба префилла на 0731 | ≈$0.005 | самый сильный кандидат по §12.3, не проверен на новых весах |
effort:"high" явно — дефолт ли это |
≈$0.01 | закрывает механизм §1 окончательно |
| ja-вход | ≈$0.005 | §10.4 держится на en n=1 против zh n=1 |
| Базовый echo-rate в боевой форме | невозможен до развилки §12.4 | единственная неизмеренная ось петли |