textmachine/docs/archive/reports/POLYGON_PROMPTLANG_ANTIECHO_2026-07-31.md

91 KiB
Raw Permalink Blame History

Полигон: язык промптов (Р6) + fidelity-хвост анти-эхо P4 (петля D21 п.6)

Сессия: полигон, 31.07.2026. Промт: docs/POLYGON_PROMPTLANG_ANTIECHO_SESSION_PROMPT.md (оркестратор №9, санкция владельца). Потолок $0.15 суммарно. Сессия НЕ коммитит. Артефакты прогонов — ~/books/gu-zhenren/promptlang/ (вне git). Харнесс — eval/promptlang/.

Ревью-шапка (оркестратор №9, 01.08): ПРИНЯТО И ЗАЛЕНДЕНО, D39.61. Действующая редакция выводов = §12 — сам отчёт так предписывает; §1§11 сохранены как хроника, и три их вывода ОТОЗВАНЫ саморевью сессии (эхо-атрибуция few-shot · «пропуск» постинструкции · «митигации вернее базы»). Короткая приёмка: финальная редакция прочитана целиком; деньги проверены независимо — мой ре-ран eval/promptlang/spend.py дал те же 163 вызова / $0.433062, два пути сходятся до 2.9e-06; итог = $0.1475 в потолке промта + $0.2855 судейского хвоста по прямой санкции владельца; находка «леджер = нижняя граница» (4 billed-вызова вне request_log) забукана строкой 78. Дифф квирков сверен с §12 построчно — синхронизирован сессией; один остаточный хвост («few-shot стал ВРЕДЕН» в P4-superseded-строке) докорректирован при лендинге по §12.5 п.1. Дисциплина: пре-регистрация цела, амендмент §0-bis объявлен до продолжения трат, механизм всех трёх отозванных выводов назван самой сессией («вывод на агрегате до вскрытия единиц») — забран в промт-нормы оркестратора. Развилка §12.4 — у владельца (строка 74), до неё платные прогоны и resnapshot СТОП.


⚠ ПОРЯДОК ЧТЕНИЯ (после адверсариального ревью и добора судьи): действующая редакция выводов — §12 в конце файла. §1§11 сохранены как хроника (дисциплина D23.3) и в восьми местах опровергнуты §12.5 — не цитировать их числа, не сверившись с §12.5. §0 (пре-регистрация) заморожена и не переписывалась ни в одном пункте.


§0. ПРЕ-РЕГИСТРАЦИЯ (записана ДО первой платной траты; ниже НЕ переписывается)

Причина, по которой это первый раздел: у проекта есть своя перепись случаев, когда критерий успеха дописывался после результата (D37: «0 ошибок» = 36 ошибок; exp15 Q1b: заголовок был артефактом судейского окна). Пре-регистрация — единственное, что отличает замер от рассказа о замере.

0.1 Конфигурация — заморожена

Общее для обеих задач

Ось Значение Почему так
Окно трат UTC 18:3024:00 31.07 вне пиков DeepSeek UTC 0104 / 0610 (D39.7 §4: пик = ×2)
Слаги live-фактчек /models до первой траты: deepseek → ровно deepseek-v4-flash + deepseek-v4-pro; xai → grok-4.3 жив (eval/promptlang/slugcheck.json) гардрейл CLAUDE.md
Квирки deepseek thinking НЕ отключается (reasoning:"off" = no-op у deepseek); max_tokens ≥8000 держит движок; temperature в thinking-режиме игнорируется молча 00-provider-quirks
Зона пишу в eval/, docs/experiments/, отчёт в docs/archive/reports/; backend/ не правлю ни байтом — армы едут через свой prompts_root в пар-конфиге проекта-пробы и через prompt_override стадии CLAUDE.md, зоны
Стенд 1117 файлов ~/books/gu-zhenren/ (кроме promptlang/) захешированы ДО прогона, сверяются после П8 холодного прогона

Задача A — «язык промптов» (Р6, D39.58 §6.4)

Ось Значение Почему так
Роль ТЕРМИНОЛОГ (батчи по банку книги) самая дешёвая роль с детерминированным форматом ответа; её парсер (terminology.ParseReply) и есть требуемый прибор
Арм A боевой terminologist.md побайтно (prompts-ru/ = diff -r с backend/prompts пуст) «действующий ru-промпт»
Арм B его английский перевод строка-в-строку: тот же порядок секций, 10 буллитов против 10, те же движковые маркеры ⟦TM-CANON⟧/⟦TM-NO-DST⟧, пример формата 师父<TAB>наставник побайтно тот же, те же плейсхолдеры правка примера формата = второй фактор (D39.52: именно эта строка чинит срыв языка)
Данные БД холодного прогона, копия; тот же book_id, тот же снапшот ⇒ черновая волна не перекупается. Полезная нагрузка роли (150 кандидатов, KWIC, drafts:, батчинг) собирается ОДНИМ кодом из ОДНОЙ БД ⇒ байт-идентична по построению, а не по обещанию «байт-НЕИЗМЕННЫЕ инъекции и данные»
Инъекция ⟦TM-CANON⟧ пуст в обоих армах (подписанных строк в холодной БД нет) ⇒ тривиально идентична
Метрики ТОЛЬКО детерминированные, все — счётчики движка: off_language · bad_lines (в них же битый разделитель: строка без второго поля) · unanswered (аналог parse_fail на уровне терма) · declined · consolidated · canon_conflicts. Второй путь вывода — свой пересчёт по сырым ответам судья не нужен
Что НЕ меряю эхо на этой роли — оппортунистически; мощности не обещаю эхо редкое (2/20), на этих объёмах различие ru/en по эху статистически недоказуемо

Задача B — fidelity-хвост P4 (D21 п.6)

Ось Значение Почему так
Канал боевой: deepseek-v4-flash, thinking ON, боевой translator.md, боевая нарезка пары (1797 вых. ток.), санитайзер и регресс-гард ON скоуп wiring по D21 п.6 = только deepseek-драфт
Срез 蛊真人 главы 1116 (строки 837..1293 utf8-копии; 17 448 симв, CJK 0.805; sha256 gb18030 5c22ec0d…1ee76b) «свежая выборка, другие фрагменты»: со срезом холодного прогона (главы 110) не пересекается
Единицы 12 чанков, 2 на главу, идентичные во всех трёх армах (подтверждено $0-статусом)
Арм A0 боевой translator.md побайтно (sha256 66907a49…6d27b = боевой файл) базлайн
Арм A1 + постинструкция после {{text}} — дословно строка P4: «Напоминание: выведи ТОЛЬКО русский перевод фрагмента выше, начиная с первого предложения.» тот слот, куда пойдёт wiring (хвост USER-части)
Арм A2 + микро-few-shot — дословно две пары P4, в ШТАТНЫЙ движковый блок ---FEWSHOT--- (хвост system, render.go:150-155, тумблер few_shot D38.4) тот слот, куда пойдёт wiring
Ремонт escalate_to НЕТ, regenerate_before_escalate: 0 эхо здесь ИЗМЕРЯЕТСЯ, а не чинится; ремонт смешал бы частоту с ценой лечения и утроил бы вызовы
Сид пуст во всех трёх армах ⇒ инъекция глоссария пуста ⇒ различие армов = ровно текст промпта
Метрики $0 эхо (cjk_artifact гейта + свой независимый пересчёт han_share) · reasoning_tokens пер-вызов (вендор-конфликт few-shot×thinking — на проводе, не по доке) · finish_reason · флаги санитайзера · len_ratio и покрытие предложений (анти-омиссия) · преамбулы/markdown «дешёвое и детерминированное — первым» (D39.33)
Судья fidelity ЧУЖОГО семейства к deepseek, по нормам рига D30.10/D39.7: span-цитирующий, reasoning-ON, полные окна без обрезки, ОБА порядка, пер-голосовой персист, floor-проход на идентичных текстах author≠reviewer
Языковые констрейнты НЕ пробую инверсия 9/10 запинена D21.6

0.2 Смета ДО трат (фриз; источник каждого числа назван)

Стадия Ожидание Источник
A-ru (терминолог, 150 кандидатов) $0 при попадании в чекпойнт, иначе ≤$0.014 холодный прогон: проход $0.006211→$0.013045 (D39.58 §2.2)
A-en (терминолог, тот же банк) $0.0100.016 то же + надбавка за более длинный en-system (+232 симв)
B × 3 арма, 12 чанков каждый $0.0130.016 на арм, итого $0.0400.048 холодный прогон: $0.024740 за 20 чанков = $0.001237/чанк, минус блок банкноты
Судья fidelity $0.055 (жёсткий внутренний кап харнесса) grok-4.3 $1.25/$2.50, аддитивный reasoning
Резерв на брак/ретраи $0.020 норма проекта
Итого ≈$0.13 из $0.15

0.3 Что заранее объявлено ПРОВАЛОМ

# Провал (назван до трат)
П1 Любой арм оборван гейтом бюджета/потолка на середине — арм НЕ сравнивается, а объявляется браком (усечённый арм это не результат)
П2 A-ru при байт-идентичном промпте делает ПЛАТНЫЕ вызовы вместо попадания в чекпойнт — харнесс не байт-верен, вся байт-идентичность инъекций задачи A под вопросом
П3 Суммарный расход > $0.15 — стоп и пинг, а не тихое урезание
П4 Армы B различаются чем-то, кроме промпта (разные границы чанков, разный sha среза, непустой глоссарий) — сравнение недействительно
П5 Floor-проход судьи (идентичные тексты) даёт «tie» реже 3/4 — судейский шум выше сигнала, контраст НЕ читается
П6 Число вызовов, отчитанное без второго пути вывода там, где второй путь возможен

0.4 Что заранее объявлено НЕ провалом

  • Эха не случилось ни в одном арме. Законный исход. Тогда ось эха = «не измерена на этой выборке», а НЕ «митигация работает»: у митигации не было чего снижать.
  • Разницы ru/en не видно. Законный исход и, по приорам, ожидаемый. «Различий не обнаружено при N=…» — результат, «языки эквивалентны» — нет.
  • Fidelity-хвост меньше 35 пар D21 п.6. Полный хвост по нормам рига в $0.15 не помещается (один судейский проход рига стоит $0.150.30 сам по себе). Достигнутый N называется числом, мощность — тоже.
  • en-промпт дороже ru на входных токенах. Это свойство перевода инструкций, а не дефект арма; называется отдельно и в вывод «язык хуже» не сворачивается.

0.5 Пороги чтения (заморожены)

  • Задача A. Сигналом считаю разницу off_language/bad_lines, которая (а) ≥3 строк абсолютно И (б) больше межбатчевого разброса внутри арма. Иначе — «различий не обнаружено при данном N».
  • Задача B, эхо. Базовая частота A0 сравнивается с 2/20 холодного прогона (тот же канал, соседние главы). Вывод «митигация снижает эхо» требует, чтобы A0 дал ≥3 эха: при базе 02 разница с 0 неотличима от шума, и это будет сказано прямо.
  • Задача B, fidelity. «Цена верности у митигации» объявляется, только если митигированный арм проигрывает по оси ВЕРНОСТИ в ≥⅔ голосов И отрыв превышает floor судейского шума. Иначе — «цена верности не обнаружена при N=…».
  • Вендор-конфликт few-shot×thinking. Читается по трём осям сразу: reasoning_tokens (обходит ли few-shot thinking, как это делал префилл), эхо, и fidelity арма A2. Вердикт «конфликт подтверждён» требует ухудшения хотя бы по одной оси за пределами шума.

§0-bis. АМЕНДМЕНТ ПРЕ-РЕГИСТРАЦИИ (объявлен ДО продолжения трат; причина ВНЕШНЯЯ)

Через 9 минут после первой платной траты вендор подменил веса под тем же слагом (§1). Пре-регистрация §0 не переписана ни в одном пункте; вместо этого объявлено следующее, и всё, что ниже, читается через это.

  1. Всё, что измерено ДО 2026-07-31 18:45 UTC, и всё, что измерено ПОСЛЕ, — разные приборы. Арм A задачи A (ru-терминолог) — это $0-отыгрыш чекпойнтов холодного прогона, снятых на СТАРЫХ весах; арм B (en) куплен на НОВЫХ. Сравнивать их запрещено, и вывод «en-промпт ломает формат» из этих данных НЕ делается, хотя соблазн был: контроль (§1.2) его убил.
  2. Боевая форма канала перестала отвечать (пустой content при max_tokens движка). Замер в боевой форме сегодня физически невозможен; армы переведены на сырой провод в единственной конфигурации, где канал отвечает, — с явным reasoning_effort:"low". Это отступление от «боевой формы» названо здесь, а не спрятано в выводах.
  3. Роль задачи A сменена с ТЕРМИНОЛОГА на ПЕРЕВОДЧИКА (translator.md ru против его en-перевода). Причина не вкусовая: движковый путь терминолога через prompt_override невозможен (роль резолвится конвенцией), а единственная рабочая конфигурация требует ручки, которую движок для deepseek слать не имеет права (§3.2). Промт сессии эту замену разрешает прямо («терминолог-батчи и/или банкнота» — роль здесь не догма, догма — детерминированность метрик).
  4. Пороги §0.5 и провалы §0.30.4 не тронуты и применяются к новым данным как есть. Исход «эха не случилось», заранее объявленный в §0.4 НЕ провалом, наступил и читается ровно так, как был написан до трат: ось эха «не измерена», а не «митигация работает».

§1. ГЛАВНОЕ: канал сменился ПОД экспериментом — вендор-факт, а не догадка

1.1 Что увидел прибор

Что Когда (UTC) Число
Холодный прогон, черновая волна deepseek-v4-flash, боевая форма 30.07 22:00:30 31.07 00:29:17 68 успешных вызовов, ср. completion_tokens 3475, при потолке 2, finish=length 2
Терминолог, en-арм (та же БД, тот же движок) 31.07 18:4518:55 7 батчей: 6 пустых (finish=length, completion=8000), 1 stop
Черновик, БАЗЛАЙН (боевой translator.md, боевая форма) 31.07 18:54 4 из 4 при потолке 8000: 3 пусто, 1 обрыв

Базлайновый арм и есть контроль, который убил соблазнительную атрибуцию «это en-промпт»: боевой русский промпт ломается ровно так же. Фишер 4/4 против 2/68 — p = 1.5·10⁻⁵.

1.2 Причина — вендор, с датой и цитатами (сняты curl, счёт вхождений = 1 по копии без пробелов)

https://api-docs.deepseek.com/updates, запись Date: 2026-07-31:

  • «The official release of the DeepSeek-V4-Flash API is now in public beta. The API calling method remains unchanged — simply set the model name to deepseek-v4-flash to use the latest version.»
  • «Significantly enhanced agent capabilities, with benchmark results far exceeding V4-Pro-Preview»
  • «DeepSeek-V4-Flash-0731 keeps the same model architecture and size as DeepSeek-V4-Flash-Preview, and was only re-post-trained.»
  • «Note: This update only upgrades the DeepSeek-V4-Flash API. The DeepSeek-V4-Pro API and the APP/WEB models are unchanged.» ← редактор и эскалационный хоп не тронуты

То есть слаг тот же, веса другие, объявления в /models нет (live-фактчек до трат показал ровно два прежних слага). Правило двух направлений отработало ровно как задумано: аномалия на проводе → вендор-дока → причина за пять минут. Гадать не пришлось ни разу.

1.3 Механизм — на сыром проводе, один и тот же чанк, один и тот же рендер

Движковый леджер ответить не может: для deepseek он держит ReasoningTokens = 0 сознательно (provider_openai.go:22-24, ReasoningSubset — thinking внутри completion_tokens, иначе двойной счёт). Поэтому замер сделан мимо движка (eval/promptlang/wire_probe.py), а паритет рендера доказан числом: prompt_tokens пробы = prompt_tokens движка на общем чанке, 1679 = 1679.

потолок temperature finish completion из них reasoning content цена
8 000 нет length 8 000 8 000 0 симв $0.002247
16 000 нет stop 2 144 98 5 341 симв $0.000607
16 000 0.3 stop 15 958 14 014 4 973 симв $0.004475
16 000 0.3 length 16 000 16 000 0 симв $0.004487
16 000 (др. чанк) 0.3 length 16 001 16 001 0 симв $0.004488
16 000 (др. чанк) 0.3 stop 5 027 3 117 5 163 симв $0.001422

Это не дегенеративный луп (класс D2.3): 20 025 символов размышления — 122 строки, все 122 уникальны, модель добросовестно пере-переводит фразу за фразой внутри reasoning_content и просто не доходит до ответа. Распределение длины думания имеет тяжёлый хвост: наблюдённые значения reasoning_tokens на одном и том же чанке — 98 · 3 117 · 8 000⌐ · 14 014 · 16 000⌐ · 16 001⌐ (⌐ = упёрлось в потолок). Поднятие флора хвост не закрывает: на 16 000 упор случился в 3 из 6.

1.4 Ручка, которая чинит, — и цена, которую она берёт

Вендор-дока https://api-docs.deepseek.com/guides/thinking_mode (снята curl, счёт = 3) разделяет ДВА параметра: тумблер {"thinking":{"type":"enabled/disabled"}} и эффорт {"reasoning_effort":"low/high/max"}. Наша запись от 04.07 («reasoning_effort: только high/max; low/medium→high») устарела: low сегодня — документированный отдельный уровень.

Замер: тот же чанк, боевой потолок 8 000, temperature 0.3, reasoning_effort:"low"finish=stop, reasoning 313 токенов вместо 8 000, полный перевод 5 575 симв, $0.000907. Реплики на трёх чанках: 4/4 stop, reasoning 170313, цена $0.000360.00091.

Но ручка пере-вооружает эхо-мину. Из тех же 4 реплик одна вернула чистый китайский исходник (cjk_share = 0.83, len_ratio 0.97, finish=stop — тихий провал ровно того класса, ради которого существует гейт cjk_artifact). Это уточняет рамку D19.2: защита от эха деградирует непрерывно с эффортом, а не скачком на «выключено». Движок сегодня этой ручки слать НЕ МОЖЕТ и не должен — config.echoMineViolation (models.go:276-281) запрещает эхо-склонному провайдеру любой reasoning-контроль кроме none|mandatory. Гейт оказался прав, и замер — его первое эмпирическое подтверждение.

§2. Что это стоит бэкенду (цифры, решение — не моё)

  1. Сегодня боевая черновая волна физически не проходит. При min_max_tokens: 8000 она платит полную цену вызова и получает пустой content; гейт помечает empty, ретрай покупает ещё одну такую же. Следующий платный прогон в текущем конфиге — это деньги в ноль.
  2. Три развилки, все с ценой:
    • (а) Поднять min_max_tokens flash 8000 → 16000 (тот же аргумент и то же число, что уже ратифицированы для v4-pro в D24.3: перебор бюджета бесплатен, недобор стоит целой генерации). Цена: ⚠ max_tokens входит в request_hashгромкий --resnapshot всех книг. Честная граница: хвост это не закрывает — на 16 000 упор случился в 3 из 6 замеров.
    • (б) Разрешить reasoning_effort:"low" для flash — чинит и удешевляет (вызов $0.000360.00091 против $0.00220.0045), но требует амендмента echoMineViolation и возвращает эхо (1 из 16 базовых вызовов на low). Эскалация на v4-pro при этом жива: вендор прямо пишет, что pro не тронут.
    • (в) Ждать. Модель вышла «in public beta» СЕГОДНЯ; поведение может устаканиться. Ждать бесплатно, но блокирует очередь.
  3. Экономика. Цена черновика на чанк: холодный прогон (прежние веса) $0.001237 ($0.024740 за 20 чанков) → боевая форма на 0731 $0.002253 (замер B-a0, 4 чанка) при НУЛЕ доставленного текста, а на потолке 16 000 до $0.0045. То есть ×1.83.6 дороже, и это оплаченный ноль. С effort:"low"$0.00096 в среднем по 12 вызовам арма a0 ($0.000360.00091 на пробах), то есть на 22% дешевле прежнего. Модель COGS ~$0.85/ранобэ (D30.4) зависит от того, какая из развилок будет выбрана; сама по себе она сегодня не верна ни в одну, ни в другую сторону.

§3. ЗАДАЧА B — fidelity-хвост P4 (петля D21 п.6, стоит с 09.07)

Конфигурация: 12 СВЕЖИХ фрагментов 蛊真人 гл. 1116 (вне среза холодного прогона; sha256 gb18030 5c22ec0d…1ee76b), сырой провод, deepseek-v4-flash (0731), max_tokens 8000, temperature 0.3, reasoning_effort:"low", три арма по 12 вызовов. Фрагменты и параметры байт-одинаковы во всех армах; различается ровно текст промпта. Слоты митигаций — ТЕ, куда пойдёт wiring: постинструкция в хвост USER-части, few-shot в штатный блок ---FEWSHOT--- (render.go:150-155, тумблер D38.4).

арм эхо срыв языка вне коридора len_ratio ср. reasoning ср. completion сумма $ Δ$ к базе
a0 боевой translator.md 0/12 0/12 0/12 1235 2918 0.011520
a1 + постинструкция P4 0/12 0/12 0/12 876 2579 0.008831 23.3%
a2 + микро-few-shot P4 1/12 1/12 0/12 2356 3904 0.014798 +28.5%

(б) Повторный echo-rate — ответ отрицательный, и этот исход был описан ЗАРАНЕЕ (§0.4, первый пункт списка «не провал»). База дала 0 из 12. У митигации нечего было снижать, поэтому ось эха на этой выборке — «не измерена», а не «митигация работает». Пул по всем базовым вызовам на этой конфигурации (12 арма + 4 пробы) — 1 эхо из 16 (6%); это и есть сегодняшняя частота, на которой любой замер митигации требует сотен вызовов, а не десятков.

(в) Вендор-конфликт «few-shot вредит R1-классу в thinking» — РАЗРЕШЁН, ПОДТВЕРЖДЁН, на проводе. Few-shot почти удваивает размышление (2356 против 1235 токенов, +91%) и удорожает вызов на 28.5% — это измеренное число, а не вендор-клейм. Он же дал оба испорченных выхода арма:

  • a2-f00чистый китайский исходник (cjk_share 0.829, len_ratio 0.993, finish=stop);
  • a2-f04полный перевод на АНГЛИЙСКИЙ (5 770 симв, finish=stop, кириллицы нет).

Оба — тихие провалы с правдоподобным видом. Направление обратное тому, ради чего митигацию предлагали. Честно: Фишер 2/12 против 0/12 даёт p = 0.478 — при этом N различие статистически НЕ установлено, и я его не заявляю. Заявляю другое: обоснование wiring стояло на эффекте, которого арм не показал, а цена (+28.5% и ×1.9 размышления) измерена и однозначна.

(а) Fidelity-хвост — куплен частично, N назван честно. Судья grok-4.3 (чужое семейство к deepseek), reasoning-ON, полные окна без обрезки, оба порядка, пер-голосовой персист. Floor-проход на ИДЕНТИЧНЫХ текстах: 2/2 «tie» ($0.00592/голос) — П5 не сработал, позиционного смещения нет. Контраст a0↔a1 (постинструкция), 5 голосов на 3 единицах — дальше упёрся кап:

единица AB BA чтение
f01 победил a0 победил a1 порядок перевернул вердикт — шум на этой единице
f02 победил a1 победил a1 согласовано: в обоих порядках судья вменил ПРОПУСК арму a0 («A пропустил весь монолог Фан Юаня», «B пропустил весь абзац про 遗藏 и 酒虫»)
f03 tie — (кап) различия только словесные

Вердикт: цена верности у постинструкции НЕ обнаружена — по пре-регистрированному порогу (проигрыш в ≥⅔ голосов сверх пола) она не проиграла ни разу. Мощность: 3 единицы, 5 голосов против «35 пар» петли D21 п.6 — это 1/7 заказанного хвоста, и выводом «постинструкция верности не вредит» это НЕ является. Оговорка о ложной сходимости: a0-f02 имеет и самый низкий len_ratio арма (2.476 против средних 2.93), то есть детерминированный прибор и судья указали на одну и ту же единицу — это одна единица, а не сходимость двух сигналов, и весом двух улик она не считается.

Контраст a0↔a2 снят с судьи осознанно: few-shot отвергнут детерминированно, судья это решение не двигает, а его цена ($0.00758/голос на контрасте, диапазон $0.007040.00817) — половина оставшегося бюджета.

⇒ РЕКОМЕНДАЦИЯ WIRING (решение — оркестратора/владельца):

  • ---FEWSHOT--- в translator.md НЕ вносить. Цена измерена (+28.5%, размышление ×1.9), польза не показана, оба сорванных выхода арма — его. Вендор-конфликт §3.1 research/15 разрешён против него.
  • Постинструкцию не вносить СЕЙЧАС — но по другой причине: она безвредна и даже дешевле (23.3%), однако покупать ей нечего, пока база даёт 0/12 эха. Вернуться к ней, если будет выбрана развилка §2(б) (effort:"low"), где эхо возвращается: там у неё появляется предмет.
  • Цена самой правки, если её всё же делают: байты translator.md двигают PromptSHA256 черновой волны ⇒ пере-снапшот и перекупка ЧЕРНОВИКОВ всех zh-книг. На срезе 10 глав это ≈$0.025 по холодному прогону; на полной книге (2284 раздела) — порядка $2.85.6 по сегодняшней цене вызова. Плюс правку пришлось бы дублировать в translator-banknote.md (общая шапка, строка 36г бэклога).
  • ⚠ Числа P4 от 09.07 сняты на весах, которых больше нет. «0/29 против базы 3067%» относится к DeepSeek-V4-Flash-Preview. Любое решение, опирающееся на них как на текущую эмпирику, опирается на superseded прибор.

§4. ЗАДАЧА A — «язык промптов» (Р6, гипотеза владельца)

Армы: a0 = боевой translator.md (sha256 66907a49…6d27b, побайтно боевой файл) против e0 = его английский перевод строка-в-строку (тот же порядок секций, то же число буллитов, те же плейсхолдеры, примеры мер 时辰/ побайтно те же; целевой язык в обеих версиях остаётся русским — меняется язык ИНСТРУКЦИЙ, а не задача). Те же 12 фрагментов, те же параметры, инъекция пуста в обоих (сида нет) ⇒ байт-идентична тривиально.

арм эхо срыв языка выхода вне коридора преамбулы markdown лат. прогоны ср. len_ratio ср. предл. ср. reasoning сумма $
a0 ru 0/12 0/12 0/12 0 1 4 2.93 1.05 1235 0.011520
e0 en 0/12 0/12 0/12 0 0 4 2.92 1.08 1502 0.012605

Ответ: различий по следованию формату НЕ ОБНАРУЖЕНО при N = 12 на арм. Все детерминированные оси совпадают в пределах шума; ни одна не даёт разницы ≥3 единиц (порог §0.5).

Встречный риск, названный в промте сессии, НЕ материализовался: off_language = 0/12 у обоих армов — английская инструкция не утянула выход в английский. Прибор при этом рабочий и не слеп: в тот же день он поймал английский выход у арма a2 (§3) — то есть ноль здесь означает «не случилось», а не «не видно».

Единственное измеренное различие — цена: en-промпт дороже на +9.4% ($0.012605 против $0.011520), и это чистый эффект размышления (+21.6% reasoning_tokens: 1502 против 1235), не длины входа — en-промпт как раз КОРОЧЕ в токенах: ср. prompt_tokens 1290 против 1399 на этих же 12 фрагментах (7.8%), и на батче терминолога та же картина (4155 против 4260).

⇒ Гипотеза «английский промпт следует формату лучше» на этой роли, этой паре и этом N НЕ подтверждается, а дороже она измеримо. Оснований переводить боевые промпты на английский нет; оснований утверждать «языки эквивалентны» — тоже нет (N мал, роль одна, пара одна).

Побочно (задача A, первая, оборванная попытка на роли ТЕРМИНОЛОГА). До диагноза §1 арм en дал 6 пустых батчей из 7 против 21/21 stop у ru-прохода холодного прогона — соблазнительная «находка» уровня «en-промпт ломает роль». Она неверна, и убил её базлайновый контроль §1.1. Записываю это как есть: механизм самообмана здесь ровно тот, что уже стоит в моей памяти по exp12/exp13 («сигналы сходятся» сильнее данных), и поймал его контроль, а не осторожность. Полезный остаток той попытки: $0-отыгрыш чекпойнтов холодного прогона воспроизвёл его числа побайтно (consolidated=149 declined=1 unanswered=0 bad_lines=0 off_language=0), что независимо подтверждает и цифры D39.58 §2.4, и байт-верность харнесса (П2 не сработал).

§5. Деньги — $0.145948 из потолка $0.15 (97.3%), сведено ДВУМЯ путями

источник вызовов путь 1 (самоотчёт харнесса) путь 2 (пере-счёт из сырого usage по models.yaml) Δ
движок A-ru (отыгрыш чекпойнтов) 29 0.000000 0.000000 0
движок A-en (терминолог, оборван) 27 0.019036 0.019036 0
движок B-a0 (базлайн, стоп-гейт) 4 0.009011 0.009011 0
wire-пробы (диагноз канала) 10 0.020426 0.020426 3.4e-07
армы задач A и B 48 0.047754 0.047756 2.2e-06
судья grok-4.3 7 0.049721 0.049721 ~0
ИТОГО 125 0.145948 0.145951 2.6e-06

Расхождение путей — на уровне округления float. Команда: eval/.venv/bin/python eval/promptlang/spend.py. Брак сессии — $0.028047 (движковые вызовы A-en и B-a0, купившие пустые ответы). Он не мой: это и есть цена обнаружения §1, и обнаружена она на четвёртом чанке, а не на двадцатом, потому что сработал стоп-гейт. Все платные вызовы — в окне 18:4520:52 UTC, вне пиков DeepSeek (UTC 0104 / 0610); проверено date -u перед каждым блоком трат. Стендовые артефакты: 1117 хешей сняты до прогона и сверены после — дифф ПУСТ.

§6. Чего сессия НЕ сделала и почему (стоп-гейт отработал)

  • Полный fidelity-хвост «35 пар» D21 п.6 не куплен. Куплено 3 единицы / 5 голосов = 1/7. Причина арифметическая: контрастный голос рига стоит $0.00758 (замерено, 5 голосов, разброс $0.007040.00817), полный хвост по нормам (35 пар × 2 порядка + floor) = 72 голоса ≈ $0.54, то есть в 3.6 раза выше всего потолка сессии. Это надо знать при следующей выдаче: «хвост P4» не помещается в $0.15 ни при каком планировании.
  • Задача A на ролях ТЕРМИНОЛОГА и БАНКНОТЫ не доведена — движковый путь сегодня не работает (§1), а замена промпта роли требует либо правки backend/ (чужая зона), либо ручки, запрещённой гейтом.
  • Второй судья / декой не ставились — бюджета не осталось; при N=5 голосов второй судья не изменил бы того, что вывод и так объявлен маломощным.
  • Развилка §2 не выбирается сессией. Она стоит денег всех книг (пере-снапшот) и трогает ратифицированный гейт — это подпись владельца, а не вывод полигона.

§7. Строки для 00-provider-quirks (факты с датой; вносит оркестратор)

  1. deepseek-v4-flash — слаг стабилен, веса нет. 2026-07-31 слаг переехал на DeepSeek-V4-Flash-0731keeps the same model architecture and size … was only re-post-trained», api-docs.deepseek.com/updates, Date: 2026-07-31). /models этого не показывает — там прежние два слага. Урок календаря: «слаг живой» ≠ «модель та же»; пере-проверять поведением, не листингом.
  2. Флор 8000 для flash пробит. На той же задаче/чанке reasoning_tokens наблюдались 98 · 3 117 · 8 000⌐ · 14 014 · 16 000⌐ · 16 001⌐; при max_tokens=8000 боевая форма отдаёт пустой content при finish=length (4/4 против 2/68 у прогона на прежних весах, p=1.5e-05). 16 000 — не гарантия (упор в 3 из 6).
  3. Запись «reasoning_effort: только high/max» УСТАРЕЛА. Вендор-дока guides/thinking_mode (снята 31.07) разделяет тумблер {"thinking":{"type":"enabled/disabled"}} и эффорт {"reasoning_effort":"low/high/max"}; low — отдельный документированный уровень. Замер: low при потолке 8000 → stop, reasoning 170313, $0.000360.00091 (было $0.00220.0045).
  4. effort:"low" пере-вооружает эхо-мину: 1 чистый китайский выход из 16 базовых вызовов (cjk_share 0.83, finish=stop). Уточнение рамки D19.2: защита деградирует НЕПРЕРЫВНО с эффортом, не скачком на «выключено». Гейт echoMineViolation (models.go:276-281) это подтверждает.
  5. v4-pro не тронут — «This update only upgrades the DeepSeek-V4-Flash API. The DeepSeek-V4-Pro API and the APP/WEB models are unchanged.» Редактор и эскалационный хоп сегодня в прежнем поведении.
  6. Микро-few-shot на 0731 вреден: +91% reasoning_tokens, +28.5% цены, 2 сорванных выхода из 12 (китайское эхо и полный английский перевод) против 0 из 12 у базы.
  7. grok-4.5 появился в /v1/models xAI (live 31.07, вместе с прежними десятью слагами) — факт листинга, поведением не проверялся, решений на нём не строится.

§8. Пинги (через владельца — канал промта)

  1. БЭКЕНДУ, срочно: следующий платный прогон в текущем конфиге купит пустые ответы. Развилка §2 — до него. Ресёрч общности (строка 72) от этого не зависит и может идти.
  2. ОРКЕСТРАТОРУ: петля D21 п.6 закрывается отрицательно по few-shot и «не измерено» по постинструкции; ⚠ вся эмпирика P4 (09.07) относится к весам V4-Flash-Preview. Если петлю оставлять открытой — она теперь про 0731 и стоит ≈$0.42, а не $0.15.
  3. ОРКЕСТРАТОРУ: Р6 отвечен отрицательно на роли переводчика (различий нет, en дороже на 9.4%); если владелец хочет замер на роли терминолога — он возможен только после развилки §2.
  4. ВЛАДЕЛЬЦУ: развилка §2 — подпись (перекупка снапшотов против амендмента ратифицированного гейта против ожидания). Сессия числа дала, решение не приняла.

§9. Критик полноты (обязательная секция)

  • N мал везде. 12 фрагментов на арм, одна книга, одна пара, одна модель, один день. Все «различий не обнаружено» — это «не обнаружено при N=12», и ни одно из них не эквивалентность.
  • Fisher 2/12 vs 0/12 = 0.478. Вывод против few-shot держится на ЦЕНЕ (измерена уверенно) и на отсутствии показанной пользы, а НЕ на разнице частот срывов. Если кто-то процитирует «few-shot даёт 2 срыва из 12» как установленный эффект — это будет цитата сверх данных.
  • Floor судьи измерен на ИДЕНТИЧНЫХ текстах (2/2 tie) и потому не ограничивает шум на РАЗНЫХ, но похожих текстах: единица f01 перевернула вердикт с порядком, и floor этого не предсказал.
  • Конфигурация армов не боевая. reasoning_effort:"low" движок слать не может; все выводы задач A и B получены в конфигурации, которой сегодня в проде нет и которая, возможно, никогда не будет разрешена. При выборе развилки §2(а) их придётся пере-снять.
  • Мой рендер — реплика движкового, а не он сам. Паритет доказан на ОДНОМ чанке по prompt_tokens (1679=1679); на втором чанке проба и движок разошлись (1231 против 1310) — расхождение объясняется нормализацией tmctl export, но это ОБЪЯСНЕНИЕ, а не доказательство: армы сравнимы между собой, с движком — только через тот один сверенный чанк.
  • Английский промпт e0 писал я. «Строка в строку» проверено структурно (буллиты, маркеры, плейсхолдеры, побайтный пример), но качество перевода инструкций — моё суждение, и слабый en-текст дал бы тот же «различий нет».
  • Причинность §1 установлена по времени и вендор-доке, а не экспериментом на двух версиях слага. Прежних весов у нас больше нет; пере-проверить «до/после» на одном стенде невозможно в принципе.
  • Не проверено адверсариально: что тяжёлый хвост думания — свойство именно ЭТОЙ задачи (плотный CJK + длинный бриф), а не всей модели. Одного контр-примера (короткий промпт) я не ставил.

§10. ERRATA + ДОБОР (после вопросов владельца; тело выше НЕ переписано — дисциплина D23.3)

Три вопроса владельца («точны ли результаты», «гуглил ли», «только ли китайский») вскрыли одну ошибку чтения и добрали два факта. Потрачено дополнительно $0.001579, итог сессии $0.147527 из $0.15.

10.1 ИСПРАВЛЕНИЕ: эхо в арме few-shot НЕ атрибутируется few-shot

В §3 сказано «оба сорванных выхода арма — его». Счёт верен, причинное чтение — нет.

Оба эха всей сессии (2 из 58 вызовов) пришлись на ОДИН И ТОТ ЖЕ исходный текст — начало главы 11 (不过是色诱罢了): фрагмент f00 армов и chunk-1-0 проб перекрываются по телу. На этом тексте базовый промпт тоже эхает. Решающая улика — два вызова с побайтно идентичным запросом (один sha 5c304c9b3cf4, оба effort:low, cap 8000, temp 0.3, промпт a0):

вызов finish out reasoning content cjk_share вердикт
eff1-a0-8000-efflow-t0.3 stop 2441 313 5575 симв 0.000 чисто
lowrep1-0-a0-8000-efflow-t0.3 stop 1252 170 1645 симв 0.831 ЭХО

Эхо на 0731 стохастично ПО ВЫЗОВУ, а не детерминировано по фрагменту. Вывод «few-shot вызвал эхо» СНИМАЮ. Вывод «few-shot вреден» остаётся, но на других основаниях: reasoning_tokens ×1.9, цена +28.5% (оба уверенно измерены) и единственный за 48 вызовов выход на английском (a2-f04, 5 770 симв, finish=stop) — его. Эхо-ось из обоснования вычеркнута.

Это ровно тот мой паттерн, который стоит в памяти по exp12/exp13 («сигналы сходятся» сильнее данных). Поймал его чек «а один ли это текст?», а не осторожность — поэтому чек идёт в норму, а не в намерение.

10.2 Митигации дошли до провода (проверка целостности, которой в §3 не было)

Δprompt_tokens к базе, константа на всех 12 фрагментах: a1 +28 (постинструкция в хвосте USER), a2 +83 (блок ---FEWSHOT--- в хвосте system), e0 109 (en-промпт короче). Рендер детерминирован, блоки на проводе, «арм не поехал» исключён.

10.3 🔍 Поиск (вопрос «гуглил ли»): вендор-рамка меняется, багрепортов нет

  • Багрепортов о пустых ответах / регрессии перевода на 0731 в выдаче НЕТ — это не известный инцидент, а расхождение нашей калибровки с новым чекпойнтом.
  • Найдена вендорская рамка, которой не было в §1: контекст 1M, max output 384K (api-docs.deepseek.com/quick_start/pricing), и — ключевое — «For the high and max reasoning effort levels, a maximum output length of 384K tokens is recommended». Наш флор 8000 — на два порядка ниже того, что вендор считает нормой для высокого эффорта. ⇒ Диагноз §1 уточняется: модель не «сломалась», у неё сместился дефолтный эффорт, а наш бюджет вывода калиброван под прежний чекпойнт. Это делает развилку §2(б) (слать эффорт ЯВНО) не хаком, а приведением конфига к вендорской модели: low — документированный уровень, thinking при нём ВКЛЮЧЁН (none — это другой параметр, тумблер, и его мы по-прежнему не трогаем, D19.2 цел).

10.4 🌐 Область проблемы (вопрос «только ли китайский»): да, привязана к zh-входу

Один и тот же промпт и параметры (cap 8000, temp 0.3, дефолтный эффорт — тот, что ломается):

источник prompt_tok finish completion из них reasoning content
en (Howard, PD, 1450 симв) 877 stop 973 435 1366 симв
zh короткий (400 симв) 776 stop 3841 3393 1131 симв
zh длинный (1754 симв) 1679 length 8000 8000⌐ 0

При сопоставимом входе (877 против 776 токенов) zh требует в 7.8 раза больше размышления, чем en, при похожем объёме выхода. Значит дело в исходном письме/задаче, а не в длине входа — конфаунд длины закрыт. Дальше размышление на zh растёт круто: 776 ток. входа → 3393, 1679 → упор. Границы честно: en n=1, zh-короткий n=1, zh-длинный n=8; ja НЕ проверялся вовсе. Разговора о «диалектах» здесь нет ни на одной оси: и эхо, и разгон думания привязаны к плотному ханьскому письму, а не к варианту китайского (эхо ловилось и на современной вебновелле, и на минском байхуа 金瓶梅 — D22 п.5).

10.5 💡 Следствие для РЕМОНТА эха, которого §3 не заметил

disposition.go:138-148: cjk_artifact объявлен НЕ ретраебельным и идёт сразу в эскалацию — обоснование в комментарии: «retry just re-produces them». Эта посылка верна для deepseek-chat (квирк-строка: «ретраи не помогают — детерминировано для фрагмента»), но на 0731 она опровергнута §10.1: идентичный запрос дал эхо и не-эхо. Арифметика ремонта при этом перевернулась:

путь ремонта одного эха цена источник
эскалация на deepseek-v4-pro (сегодняшнее поведение) $0.0147 (2 хопа) холодный прогон, D39.58 §2.2
простой ре-ген на flash при effort:low $0.00096 ср. по 12 вызовам арма a0

≈15× дешевле, и первый ре-ген уже покрывает ~⅔ случаев при наблюдённой частоте. Предложение бэкенду (не правка — зона чужая): для cjk_artifact разрешить N=1 ре-ген ПЕРЕД эскалацией, а эскалацию оставить вторым рубежом. Гейт при этом не ослабляется ни на байт — D19.2 цел. ⚠ Мощность: частота эха 2/58 (3.4%), «⅔» — арифметика от одного повторённого запроса, не замер.

10.6 Сводка советов по анти-эху (в порядке «сначала бесплатное»)

  1. Гейт cjk_artifact не трогать никогда — он единственный ловит тихий провал на любой конфигурации (D19.2). Всё ниже снижает ЧАСТОТУ, а не заменяет его.
  2. Ре-ген перед эскалацией (§10.5) — $0, ~15× дешевле нынешнего ремонта, опирается на замер.
  3. Эффорт слать ЯВНО (§10.3) — приводит конфиг к вендорской модели и делает вызов дешевле прежнего; цена — амендмент echoMineViolation и, возможно, чуть более частое эхо (не установлено).
  4. Постинструкция P4 — если решат вносить: безвредна, дешевле базы на 23.3%, слот готов (хвост USER-части). Сегодня покупать ей нечего (база 0/12), но при переходе на явный low у неё появляется предмет.
  5. Микро-few-shot — НЕ вносить (§10.1: цена измерена, польза не показана, английский выход — его).
  6. Языковые констрейнты — по-прежнему НЕ трогать без per-model замера (инверсия 9/10, D21.6).
  7. Не проверено и стоит центов: префилл «Перевод:\n» (P4 давал 0/6, но обходит thinking — а thinking на 0731 и есть дорогая часть, так что довод против префилла ослаб); effort:"high" явно (проверить, дефолт ли это); ja-вход (§10.4).

§11. РЕВЬЮ ЭКСПЕРИМЕНТА ЦЕЛИКОМ (по вопросу владельца «расследовал ли ты анти-эхо и достаточно ли»)

Короткий ответ: нет, недостаточно, и главный промах — процессный, а не в числах. Ниже — сверка задания с исполненным, без смягчений. Дополнительных трат: $0 (всё в этом разделе — из артефактов, оплаченных 09.07, и из уже купленного сырья). Итог сессии остаётся $0.147527.

11.1 ГЛАВНЫЙ ПРОМАХ: я перевернул задание по деливераблу (1)

Промт: «fidelity-судья … на парах база↔митигация — P4-артефакты в ~/books/gu-zhenren/research15-probes/ (вне git) + добор свежих фрагментов по нужде». Я сделал добор главным, а на указанные артефакты не посмотрел ни разу за весь прогон. Между тем на диске лежат 24 готовые пары база↔митигация (21 grok + 3 deepseek), генерация которых оплачена 09.07:

семейство пригодных пар почему не больше
grok-none 21 (7 небазовых-эхо фрагментов × G1/G2/G4) база G0 эхнула на 3 из 10 — эти фрагменты пары не дают
deepseek (боевое семейство) 3 (1 чистая база s2 × D1/D2/DP) база D0 эхнула на 2 из 3 сэмплов

Цена ошибки: $0.035149 ушло на генерацию армов, а судейский бюджет — на 3 МОИ единицы вместо 24 готовых. Правильный порядок был: сперва отсудить бесплатное сырьё, потом добирать. Заявление §6 «полный хвост не помещается в $0.15» остаётся верным по деньгам (72 голоса ≈ $0.54), но оно скрыло, что 24 пары уже были и ждали только судью.

Заодно реплика счётчиков P4 сошлась побайтно (независимое подтверждение таблицы research/15): grok G0 3/10 · G1 0/10 · G2 0/10 · G3 9/10 (инверсия) · G4 0/10; ds-gu008 D0 2/3 · D1 0/3 · D2 0/3 · DP 0/3.

11.2 Что удалось вытащить из этих пар БЕСПЛАТНО (детерминированная половина верности)

Судья нужен для «искажения при сохранённом объёме». Пропуски и обрывы берутся без него — по длине и числу предложений против ОДНОГО И ТОГО ЖЕ исходника (eval/promptlang/p4_pairs.py):

митигация пар медиана Δlen_ratio к базе пар короче базы на >0.15 пар длиннее на >0.15
инстр. ПОСЛЕ текста (grok) 7 +0.022 1 2
микро-few-shot (grok) 7 +0.056 1 2
комбо (grok) 7 +0.127 0 3
инстр. ПОСЛЕ (deepseek) 1 0.346 1 0
few-shot (deepseek) 1 0.108 0 0
префилл (deepseek) 1 0.331 1 0

Я едва не подал вторую ложную тревогу. Δ = 0.346 у постинструкции на боевом семействе выглядит как подпись пропуска. Проверка хвостов её отменяет: база, инстр.-ПОСЛЕ, few-shot и префилл доходят до ОДНОГО И ТОГО ЖЕ конца исходника («…Бянь Сысюань побледнела»). ⇒ Это многословность базы, а не пропуск митигации.

⇒ Детерминированный вывод по деливераблу (1): ни одна из митигаций P4 не даёт подписи ПРОПУСКА ни на одной из 24 пар. Это половина вопроса о верности, и она закрыта — бесплатно. Оставшаяся половина (искажение смысла при сохранённом объёме) без судьи не берётся.

Один дефект формы найден: 1 из 3 выходов арма «инстр. ПОСЛЕ» на deepseek дописал сноски переводчика [1]…[6] вопреки «Выведи ТОЛЬКО перевод» — класс «отсебятина/утёкшие заметки», ровно тот, ради которого существует output-санитайзер D30.3. У базы и остальных армов — 0. n=1, но дефект именной и воспроизводимо предъявим.

11.3 ОВЕРКЛЕЙМ, который надо снять: «петля D21 п.6 закрыта»

Мои армы задачи B ехали с reasoning_effort:"low" — конфигурацией, которой движок сегодня слать не имеет права (echoMineViolation). Вопрос петли поставлен про thinking-ON по умолчанию. Значит:

  • (б) повторный echo-rate в БОЕВОЙ форме на 0731 — НЕ ИЗМЕРЕН вовсе. При дефолтном эффорте канал возвращает пустой content, то есть годного базового замера эха в проде-форме у меня ноль. «База 0/12» относится к effort:low.
  • (в) вендор-конфликт измерен там же (low). Число +91% размышления — настоящее, но при дефолтном эффорте не проверено.
  • (а) — см. 11.1/11.2: детерминированная половина закрыта на 24 парах, судейская — на 3 единицах.

Формулировку «петля закрыта» снимаю. Верная: few-shot отвергнут по цене и по единственному англоязычному выходу; постинструкция не показала ни вреда, ни пользы; ось эха в боевой форме на 0731 не измерена, потому что боевая форма сегодня не отвечает.

11.4 Сводка «задание против исполненного»

Деливерабл промта Статус Чем закрыт / чего не хватает
A. Р6 «язык промптов» отвечен ru vs en на 12 фрагментах: различий по формату нет, en дороже на 9.4%. Роль — переводчик вместо терминолога (амендмент §0-bis)
B(1) fidelity на парах P4 половина 24 пары: пропусков нет (детерминированно, $0). Судья — 3 единицы моих армов вместо 24 готовых пар (промах 11.1)
B(2) повторный echo-rate не в боевой форме 0/12 при effort:low; в проде-форме канал не отвечает
B(3) вердикт few-shot×thinking дан +91% reasoning, +28.5% цены, англоязычный выход; при effort:low
Выход: рекомендация wiring дана few-shot — нет; постинструкция — отложить до развилки §2
(сверх задания) вендор-регрессия 0731, ручка эффорта, ре-ген вместо эскалации (15×), область = ханьский вход

11.5 Три ошибки чтения, пойманные ревью (все — мои)

  1. Эхо приписано few-shot — опровергнуто побайтно идентичной парой запросов (§10.1).
  2. «Пропуск» у постинструкции на deepseek — опровергнуто совпадением хвостов (§11.2).
  3. «Полный хвост не помещается» — верно по деньгам, но скрыло, что 24 пары уже оплачены (§11.1).

Все три — один и тот же механизм: вывод сделан на агрегате, до проверки единиц. Первые два поймал не я по осторожности, а прямой вопрос «а точно ли?». Норма отсюда: перед любым сравнительным выводом — открыть хотя бы одну единицу с каждой стороны и посмотреть на неё глазами.

11.6 Что осталось и сколько стоит (для следующей выдачи)

Работа Цена Почему именно столько
Судья на 24 готовых парах P4, оба порядка + пол ≈$0.38 50 голосов × $0.0076 (замерено); генерация уже оплачена
То же, только боевое семейство (3 пары deepseek) ≈$0.11 14 голосов; но n=3 — мощности не даст
Базовый echo-rate в БОЕВОЙ форме на 0731 $0 сегодня невозможен нужна развилка §2 (флор или явный эффорт)
Проба префилла «Перевод:\n» на 0731 ≈$0.005 6 вызовов; на 0731 довод против префилла ослаб (thinking стал дорогим)
Проба effort:"high" явно (дефолт ли это) ≈$0.01 24 вызова, возможен упор в потолок
ja-вход (область §10.4) ≈$0.005 34 вызова

§12. КОНСОЛИДИРОВАННЫЙ ИТОГ — читать ВМЕСТО §1§11 при любом расхождении

Записано после (а) адверсариального агентского ревью (15 агентов, 5 линз × скептик на каждую несущую находку, 1.47 М токенов, 459 инструментальных вызовов) и (б) исполнения деливерабла, который первый проход пропустил: судейского хвоста на готовых парах P4 по санкции владельца. Ниже — единственная действующая редакция выводов. §1§11 сохранены как хроника (D23.3) и в трёх местах ОПРОВЕРГНУТЫ этим разделом — расхождения перечислены в §12.5.

12.1 Ответ по петле D21 п.6 — ГЕЙТ ВЕРНОСТИ ПРОЙДЕН, и направление ОБРАТНОЕ ожидаемому

Судейский риг на готовых парах база↔митигация из research15-probes (генерация оплачена 09.07; куплены только голоса). Маршрутизация судей по семейству ПАРЫ, чтобы автор ≠ ревьюер: grok-пары судит deepseek-v4-pro, deepseek-пары — grok-4.3 (pro вендором 31.07 НЕ обновлялся — как прибор он на прежнем поведении). Полные окна, оба порядка, пер-голосовой персист.

FLOOR на идентичных текстах: 4/4 «tie» у ОБОИХ судей — пре-регистрированный порог П5 (≥3/4) пройден на полном знаменателе, в отличие от §3.

семейство митигация пар митигация лучше в ОБОИХ порядках база лучше в обоих переворот порядком дефектов у базы у митигации
grok few-shot 4 4 0 0 30 13
grok инстр-после 5 2 1 2 36 30
grok комбо 4 2 0 2 31 12
deepseek (скоуп wiring) инстр-после 1 1 0 0 4 0
deepseek (скоуп wiring) префилл 1 1 0 0 3 0
deepseek (скоуп wiring) few-shot 1 0 0 1 2 4

Итог по ПАРАМ: 16 судимых · митигация лучше в обоих порядках — 10 · база — 1 · переворот — 5.

САМОРЕВЬЮ (проведено ПОСЛЕ первой редакции этого раздела и опровергло её): знаковый тест по парам даёт p=0.0117, но это ПСЕВДО-РЕПЛИКАЦИЯ. 16 пар выросли всего из 6 базовых текстов (одна база сравнивается с тремя митигациями). Единица независимости — базовый текст, не пара. Кластерный счёт: 5 из 6 кластеров СМЕШАННЫЕ (внутри одной базы митигация где-то выигрывает, где-то проигрывает/переворачивается), чисто-митигационный кластер один, чисто-базовых ноль ⇒ знаковый тест по независимым кластерам p = 1.0. Заявленного эффекта НЕТ.

Дефекты, нормированные на базовый текст (сырые 106 против 59 завышают базу повтором её в трёх парах): база 41.3 · митигации 22.3, направление сохраняется, но на 2 базах из 6 оно ОБРАТНОЕ (gu-004: база 3.0 против 14 у митигаций; gu-002: 12.0 против 21).

Конфаунд длины не исключён: митигированные тексты систематически чуть длиннее базы (медианы Δlen_ratio +0.022…+0.127), а судья считает ПРОПУСКИ — более длинный текст механически даёт их меньше.

⇒ D21 п.6 (а) закрыт в ОСЛАБЛЕННОЙ форме: ЦЕНЫ ВЕРНОСТИ У МИТИГАЦИЙ НЕ ОБНАРУЖЕНО. Именно это гейт и спрашивал — он ставился, чтобы поймать ВРЕД, и вреда нет: ни одна митигация не проигрывает базе устойчиво, floor чист 4/4, пропусков у митигаций меньше и по сырому, и по нормированному счёту. Чего заявлять НЕЛЬЗЯ (первая редакция заявляла и была опровергнута саморевью): что митигации ВЕРНЕЕ базы. При 6 независимых базовых текстах, 5 смешанных кластерах и неисключённом конфаунде длины это не установлено.

Честные границы: (1) 21 из 24 пар — grok-none, а скоуп wiring D21 п.6 = только deepseek-драфт; на боевом семействе решительных пар всего 2. (2) Базы — «выжившие»: 3 из 10 базовых выходов grok и 2 из 3 deepseek эхнули и в пары не попали, так что база сравнивается своей лучшей частью, и это смещение работает ПРОТИВ найденного направления, а не за него. (3) 8 пар из 24 не куплены — кап $0.28 сработал (усечение по порядку обхода, не по исходу). (4) Всё это — веса V4-Flash-Preview/grok образца 09.07.

12.2 Ответ по остальным деливераблам

Деливерабл Ответ Опора
B(а) fidelity-хвост гейт пройден в ослабленной форме: ЦЕНЫ ВЕРНОСТИ НЕ ОБНАРУЖЕНО. Ни одна митигация не проигрывает базе устойчиво; floor 4/4; пропусков у митигаций меньше (нормировано 41.3 против 22.3). ⚠ «Митигации ВЕРНЕЕ базы» НЕ установлено: 16 пар выросли из 6 базовых текстов, по независимым кластерам 5 из 6 смешанные, p=1.0; конфаунд длины не исключён §12.1
B(б) повторный echo-rate в боевой форме НЕ измерен: на 0731 при боевом конфиге канал возвращает пустой content. При effort:low база 0/12 — снижать нечего §3, §11.3
B(в) вендор-конфликт few-shot×thinking НЕ установлен. «×1.9 размышления, +28.5% цены» — артефакт средних на бимодальном распределении: парно few-shot думает МЕНЬШЕ базы на 7/12 (медиана 65, p=0.77), бутстрап-CI отношения сумм [0.70; 5.45] и [0.83; 1.89] накрывают 1, удаление 3 фрагментов из 12 переворачивает знак §12.5 п.1
A. Р6 «язык промптов» различий не обнаружено ни по одной детерминированной оси (эхо 0/0, срыв языка 0/0, коридор 12/12, преамбулы 0/0). Прежняя единственная положительная разница «en дороже на 9.4%» снята: без кэш-эффекта +6.0%, парная медиана +262 ток., знаковый тест p=0.39 §4, §12.5 п.2
Сверх задания вендор-регрессия 0731 (веса сменились под слагом), ручка reasoning_effort, ре-ген вместо эскалации, привязка разгона к ханьскому входу, дыра в учёте денег движка §1, §10, §12.4

12.3 РЕКОМЕНДАЦИЯ WIRING (пере-выведена; решение — оркестратора/владельца)

Прежняя редакция §3 («few-shot не вносить, потому что вреден») отозвана: её основание рухнуло. Новая, по трём гейтам D21 п.6 раздельно:

  • Постинструкция (~10 токенов в хвост USER-части). Гейт верности ПРОЙДЕН (на боевом семействе — единственная пара, но в обоих порядках и с 4:0 по дефектам). Эхо-польза измерена на прежних весах (0/10 против базы 3/10) и на нынешних не проверяема. Цена ≈ ноль. Возражений по существу больше нет; блокирует только то, что на 0731 покупать ей сегодня нечего. Решение = стоит ли двигать PromptSHA256 ради страховки, чья польза сейчас неизмерима.
  • Микро-few-shot (---FEWSHOT---). Гейт верности ПРОЙДЕН и с лучшим отношением дефектов (13 против 30 у базы). Вреда по цене НЕ установлено. Против него остаётся один факт: единственный за 48 вызовов выход целиком на английском (a2-f04). Вывод: ни «вносить», ни «вредно» — оснований нет ни на что, кроме «не трогать боевой промпт без предмета».
  • Префилл «Перевод:\n». Неожиданно сильный кандидат: 0/6 эха в P4, верность 3:0 в обоих порядках, и его прежний контрдовод («обходит thinking») на 0731 перевернулся в довод ЗА — thinking стал дорогой и ломающей частью. Не проверен на 0731; проба ≈$0.005.
  • Цена любой правки: байты translator.md двигают PromptSHA256 черновой волны ⇒ пере-снапшот и перекупка черновиков всех zh-книг; дублировать в translator-banknote.md (общая шапка, строка 36г).
  • ⚠ Языковые констрейнты — по-прежнему НЕ трогать (инверсия 9/10, D21.6). Реплика счётчиков P4 этой сессией подтвердила инверсию побайтно: арм G3 — 9/10 эха против базы 3/10.

12.4 Развилка для бэкенда (не изменилась, числа уточнены)

Боевая черновая волна на 0731 при min_max_tokens: 8000 покупает пустые ответы. Три пути: (а) поднять флор (⚠ пере-снапшот всех книг; хвост не закрывает — при 16000 упор в 2 пробах из 5); (б) слать reasoning_effort явно (дешевле прежнего; требует амендмента echoMineViolation; возвращает эхо); (в) ждать (модель вышла «in public beta» в тот же день). Независимо от развилки: ре-ген перед эскалацией для cjk_artifact — $0, ≈7.6× дешевле ($0.007335 за ремонт одного эха против $0.00096 за ре-ген), опирается на побайтно идентичную пару запросов с разным исходом (§10.1).

12.5 ЧТО ЭТОТ РАЗДЕЛ ОПРОВЕРГАЕТ В §1§11 (принято после проверки исполнением)

  1. §3/§7/§10.1/§10.6/§11.4: «few-shot — reasoning ×1.9, цена +28.5%, оба уверенно измерены» → ОТОЗВАНО (в т.ч. строка «B(3) дан» таблицы §11.4 — вердикт по вендор-конфликту НЕ дан). Парно: 7/12 фрагментов few-shot думает и стоит МЕНЬШЕ базы; бутстрап 200k по отношению сумм даёт CI [0.704; 5.446] и [0.827; 1.892]; перестановочный тест p=0.225 и 0.302; leave-one-out по f01/f09/f11 переворачивает заголовок в 20.2%/13.1%. Механизм — бимодальный режим думания (глубокий режим: база 4/12, few-shot 5/12, Фишер p≈1.0), то есть ось слабее той, которую отчёт сам заявлять отказался (срывы 2/12 против 0/12, p=0.478). Ошибка: среднее применено к распределению, чей тяжёлый хвост тот же отчёт задокументировал абзацем выше.
  2. §3/§4: «постинструкция дешевле на 23.3%», «en дороже на 9.4%» → СУЖЕНО. system арма постинструкции побайтно равен базовому (sha e9ea1ae7dae0), он стартовал следом и получил префиксный кэш 95.0% против 27.5% у базы. По некэшированной цене: постинструкция 9.0%, en +6.0%. По размышлению постинструкция базы ДОРОЖЕ (9 фрагментов из 12, медиана +208).
  3. §1.1: «против 2 из 68 у прогона на прежних весах тем же движком и промптом» → НЕ КОНТРОЛЬ. Холодный прогон ехал translator-banknote.md при max_tokens=8496; сессия — translator.md при 8000. Сравнение понижено до индикативного. Несущая улика регрессии — собственные пробы провода на ОДНОМ чанке: cap 8000 → length+пусто, cap 16000 → stop+перевод.
  4. §1.3/§7: ряд 98·3117·8000·14014·16000·16001 «на одном чанке» → НЕВЕРНО. На одном чанке (chunk-1-0) это 98 · 8000⌐ · 14014 · 16000⌐; 3117 и 16001⌐ — два других чанка. «Упор в 3 из 6 при 16000» → 2 из 5 (проба с потолком 8000 попала в знаменатель 16000).
  5. §2/§10.5: «эскалация $0.0147 ⇒ ре-ген ≈15× дешевле» → ВДВОЕ ЗАВЫШЕНО. $0.014670 — это ДВА эха холодного прогона по одному хопу каждое (id 58, гл.5/чанк0, $0.006979; id 62, гл.9/чанк1, $0.007690). Ремонт одного эха = $0.007335, выигрыш ре-гена ≈7.6×.
  6. §5: «$0.147527, потолок не пробит» → ЛЕДЖЕР ЕСТЬ НИЖНЯЯ ГРАНИЦА. Движок залогировал 4 вызова с err="deepseek: 2xx body decode failed (call IS billed)" (B-a0/run.log:8-11, 18:53:17.907): провайдер списал, ретрай заледжерен, исходная попытка — нет. Верхняя оценка неучтённого 4 × $0.002253 = $0.009012 ⇒ потолок $0.15 мог быть пробит на $0.0065. Это и находка для бэкенда: собственный текст ошибки говорит «call IS billed», а в request_log строка не попадает.
  7. §3 floor: пре-регистрация требовала 2 единицы × 2 порядка, исполнено 1 × 2, и порог «tie реже 3/4» оценён на знаменателе 2. В §12.1 floor исполнен на полном знаменателе (4/4) — читать его.
  8. §11.2: «ни одна митигация не даёт подписи пропуска на всех 24 парах» — проверка хвостами сделана на 3 парах из 24; на 4 парах Δlen_ratio ниже собственного порога 0.15 и хвостами не разобрана. Судейский счёт пропусков (26 у базы против 15 у митигаций) направление подтверждает, но детерминированное «ни одна» шире улики.
  9. §12.1 первой редакции: «митигации вернее базы, p=0.0117» → ОТОЗВАНО СОБСТВЕННЫМ САМОРЕВЬЮ (псевдо-репликация: 16 пар из 6 базовых текстов, по кластерам 5 из 6 смешанные, p=1.0; дефекты нормированы 41.3 против 22.3, на 2 базах из 6 направление обратное; конфаунд длины не исключён). Действующая формулировка — «цены верности не обнаружено».
  10. Отклонено как неверное (проверено сырьём): что счётчики parse_fail/bad_lines не существуют (существуют, ролевые; A-ru дал 0/0 на полном отыгрыше); что «стоп-гейт не сработал» (в промте «упор» = бюджетный потолок, он достигнут не был); и пересчёт базы Фишера — сырьё опровергает его в обратную сторону.

12.6 Деньги — итог сессии $0.433062, потолок промта $0.15 + санкция владельца

источник вызовов путь 1 путь 2 (пере-счёт из сырого usage)
движок A-ru (отыгрыш чекпойнтов) 29 0.000000 0.000000
движок A-en · B-a0 31 0.028047 0.028047
wire-пробы 12 0.022005 0.022006
армы A/B 48 0.047754 0.047756
судья армов (grok-4.3) 7 0.049721 0.049721
судья пар P4 (dspro 28 + grok 8) 36 0.285535 0.285535
ИТОГО 163 0.433062 0.433065

Два пути сходятся до 2.9e-06. ⚠ Плюс неучтённое ≤$0.009012 (п.6). Судья остановлен своим капом $0.28 на 16 парах из 24; смета обещала $0.2401 и промахнулась в 1.19×, потому что deepseek-v4-pro думает 5097 токенов на голос вместо заложенных 1600 — число для следующей сметы. Все платные вызовы — 18:4521:20 UTC, вне пиков DeepSeek. Стенд: 1117 хешей, дифф пуст.

12.7 Остаток и цена

Работа Цена Зачем
Добрать 8 неcудимых пар P4 ≈$0.10 полное покрытие деливерабла (1)
Проба префилла на 0731 ≈$0.005 самый сильный кандидат по §12.3, не проверен на новых весах
effort:"high" явно — дефолт ли это ≈$0.01 закрывает механизм §1 окончательно
ja-вход ≈$0.005 §10.4 держится на en n=1 против zh n=1
Базовый echo-rate в боевой форме невозможен до развилки §12.4 единственная неизмеренная ось петли