# research/24 — Арбитраж банка памяти: консилиум · уверенность · инжект/фетч · кросс-пары > **РЕВЬЮ-ШАПКА ПРИЁМКИ (оркестратор №13, 04.08.2026).** Статус: **ПРИНЯТ**, залендено этим коммитом (D39.102). Метод — адверсариальная приёмка тремя контурами. **(1) Пере-раны:** 12-агентный воркфлоу пере-ранил ВСЕ строки таблицы «заявление = команда» ($0, офлайн по сырью) — 8/8 CONFIRMED, ни одного расхождения чисел (голд 53/45/8/34 · базисы 12/18/27/5 · формы S1/SC/C3/C3conf/E1/C4 · AUC с CI · химеры B4 по сырью батчей · инжект-таблица · 18/149 · 1/75 · §E/§F по сырью); все 23 адреса §A подтверждены по HEAD `7f6270a` (3 уточнения координат: сброс sticky живёт в `wave.go:84-86`; фикстура A8 — дистилл `testdata/bankfull-surfaces.txt`; механизм series до ~:76); байт-сверка инжект-пробы с движком: заголовок/маркер/«src → dst»/второй system байт-идентичны (gender-нота не моделируется — для безгендерного глоссария рендер совпадает). **(2) Харнесс и деньги:** независимый пересчёт из сырья $0.107334 против записанных $0.107335 (округление на записи); цены = `models.yaml`; 84/84 finish=stop; слаг-дрейфа нет; голд 53/53 против сида, пере-сборка детерминистична байт-в-байт. **(3) Слепое ревью кода банка** (author≠reviewer, без чтения этого отчёта) + 12 опровергателей: находки СВЕРХ §A заведены строками 128–132 (главные: банкнота-парсер теряет хвост многословного dst против клейма A10 «дефектов нет»; emitRankCap×writeAutoBank молча стирает термы из авто-банка; кап инъекции не считает маркер/гендер-ноты). > **Оговорки приёмки (выводов не двигают):** (а) в скоринге армов C/D — regex-конфаунд: голд-rx 真元 матчится внутри верного перевода 元海 ⇒ «верные строки» C/D завышены до 2 ячеек; выводы «wrong принят 6/6 · Δ=0 · вытеснение 5/6» стоят на другой метрике и не задеты; (б) C4=20/45 хрупок — 2-2-тай в 7/45 термов решается порядком голосов; вывод «совет закрыть» стоит на C3−SC=+3 (один кластер) и glm-соло 25>23, не на C4; (в) фоллбек C3 несимметричен (сработал 5/45, эффект мал); SC при temp=0 меряет недетерминизм провайдера, не сэмплинг; (г) иллюстративные пары A4 склеены не как печатает скрипт (см. аннотацию в §A4); (д) «точность 44–56%» — числовые пассы; словесный dsw = 40.0%; (е) 18 оплаченных доп-поверхностей ростера кодом почти не скорятся — выводы по ним ручные по сырью; (ж) атрибуция литературы уверенности поправлена аннотацией в §D (Xiong et al. 2023, не Kadavath/Tian); DelTA first-wins и WMT25 подтверждены первоисточниками; (з) «потолок $1.00 — слово владельца 04.08» — со слов сессии (ратифицированный потолок $1.20, D39.90 п.5); при факте $0.107 беспредметно; арифметика ПИНГА в PROGRESS («+$0.0161») — склейка инкрементов C+E, леджер отчёта чист. > **→ Тот же день (04.08): все 4 вопроса владельцу ЗАКРЫТЫ.** (1) мини-голд алиасов — отложен до первого длинного прогона (D39.103); (2) «Гуюэ» — не чинить, канал сида (D39.104 п.3); (3) проба редакторского провода санкционирована — промт выдан, отчёт будет `../experiments/18-editor-wire-probe.md` (D39.103); (4) фикс-пак §G санкционирован строкой 128 — промт выдан (D39.103). Поверх §C ратифицирована доктрина инжекта D39.104 (закон на проводе для всех ролей; маркер снимается — строка 134). **Ресёрч+полигон сессия, 04.08.2026.** Исполнение `docs/archive/prompts/BANK_ARBITRATION_RESEARCH_SESSION_PROMPT.md` (заархивирован D39.101) (D39.89; пере-запуск — артефактов захода 02.08 в дереве не было, D39.90 п.5; подрезка учтена: B2 свёрнута в под-пробу B3, C сокращена). Плюс прямой вопрос владельца 04.08: общий взгляд на алгоритм банка — хватает ли текущего, не пропущен ли индустриальный стандарт (ответ — §D); и достройки того же дня: мультиязычность (§E), кросс-пары и художественность (§F), дизайн-направления (§G). Потолок владельца 04.08 **$1.00**, факт **$0.107335**. Зона записи: этот файл + `eval/bank_arbitration/` + секция «Полигон» PROGRESS; сырьё durable `~/books/gu-zhenren/bank-arbitration/` (84 json). Пробы — своим харнессом против API (в `backend/` незакоммиченный пак чужой сессии); `coldrun-a` — только чтение; базлайн качества банка = coldrun-a (D39.86). Не закоммичено — лендит оркестратор. Кода бэкенда не правлено. --- ## §0. ПРЕ-РЕГИСТРАЦИЯ ПРОБ (записано ДО первого платного вызова; норма D39.46) Дата/время фиксации: 2026-08-04, до каких-либо платных вызовов этой сессии. Голд (§B1) собран ДО пре-регистрации ($0), его числа: 53 approved сида → 45 в BANK-FULL coldrun-a, из них 34 со spread≥2. ### Пассы (все — полный голд-набор одним батч-протоколом, engine-faithful RenderBatch): | Пасс | Модель | Режим | Что несёт | |---|---|---|---| | ds1..ds3 | deepseek-v4-flash | `reasoning_effort:"low"`, temp 0 | S1 (свежий одиночный) + SC (само-согласованность N=3) + числовая уверенность 0–100 | | dsw | deepseek-v4-flash | то же | словесная шкала уверенности (точно/скорее да/не уверен/не знаю) | | glm1 | glm-5 | thinking disabled (форма движка) | второе семейство + числовая уверенность | | mis1 | mistral-large-2512 | без reasoning | третье семейство + числовая уверенность | | gro1 (опция при остатке бюджета) | grok-4.3 | дефолт (low) | четвёртое семейство, чувствительность состава совета | Эффорты каждого пасса печатаются в отчёте (иначе числа несравнимы — §7 промта). ### Формы арбитража (агрегация офлайн, $0): - **P0 — бесплатный базис §C2-3:** топ-вариант ранжирования движка (колонка вариантов BANK-FULL, bankStopRows рендерит best-ranked first). Термы без вариантов → P0 пуст (честный отказ базиса). - **P1 — прод-референс:** сведённый dst coldrun-a (терминолог на до-катоверных весах). - **S1** = ds1. **SC** = большинство(ds1,ds2,ds3), при 3-стороннем расхождении → ds1. - **C3 — равноправный совет:** большинство(ds1, glm1, mis1) по нормализованному совпадению; полное расхождение → P0-топ, если хоть один голос совпал с ним, иначе ds1. - **C3conf — взвешенный:** argmax по сумме заявленных уверенностей проголосовавших за вариант моделей. - **E1 — улики-первым:** P0 стоит; «спорный» терм := (spread≥2 И разрыв top1−top2 по чанкам ≤1) ИЛИ singleton-улика (top1 предложен 1 чанком) → на спорных решает C3. Цена печатается долей от полного совета. ### Метрики: - Точность против голда: нормализованное точное совпадение (casefold · ё→е · схлоп пробелов · срез «»/кавычек). Промахи вскрываются глазами; спорные эквивалентности печатаются отдельно, автоматом НЕ засчитываются. - Парные сравнения форм: счёт термов «A прав ∧ B неправ» против обратного (не голые проценты). - **Кластерная связность:** семьи 古月-* (7 поверхностей, РАЗНОЙ длины — DetectSeries её не видит), 蛊-* (蛊师/蛊虫/月光蛊 + голова 蛊 вне банка), серии 等/转 (равнодлинные — детектируются). Метрика: консистентность конвенции внутри семьи у каждой формы (одна голова/конвенция у всех членов — да/нет), и отдельно: даёт ли по-терминный агрегатор химеру там, где одиночная модель консистентна. - **B2-под-проба (уверенность):** AUC(уверенность → верно/неверно по голду) per-model (bootstrap 90% CI); устойчивость: медиана |Δconf| ds1↔ds2↔ds3 и доля флипов ответа; сравнимость шкал: |Δ средних conf| между моделями на одном наборе; канал отказа: счёт ⟦TM-NO-DST⟧ и его стабильность между ds1..ds3. ### Критерии (успех/провал, зафиксированы ДО запуска): 1. **БАР (в):** форма «бьёт базис P0», если парное преимущество (термы A-прав-P0-неправ минус обратные) ≥ **+5** на 45 голд-термах. Меньше — «не бьёт» (на N=45 меньшее неотличимо от шума). 2. **Q2 (окупаются ли семейства):** C3 против SC парное преимущество ≥ **+3**; меньше ⇒ «разные семейства не окупаются, хватает N прогонов одной модели» (легитимный исход). 3. **Уверенность разделяет**, если AUC ≥ 0.70 и нижняя граница CI > 0.5 минимум у 2 моделей из 3; иначе — «уверенность как арбитр закрыта по нужности». Числа против слов: |ΔAUC| ≥ 0.05 решает форму. Шкалы несравнимы, если |Δ средних conf| > 20 п. ⇒ сырой кросс-модельный скор как решающее правило запрещён. 4. **Кластеры:** ≥1 новая химера у C3 там, где SC/P1 консистентны ⇒ возражение §4 промта подтверждено (единица арбитража обязана быть кластером). 5. **Проба C (инжект, формат RenderGlossaryBlock/RenderEditorConstraintBlock байт-близко):** 6 чанков × 4 арма (без инъекции · верный закон · НЕВЕРНАЯ строка законом · та же неверная строка с маркером ⟨проверить⟩), deepseek-v4-flash low, temp 0. Критерии: маркер «читается мягче закона», если послушание(закон-неверный) − послушание(⟨проверить⟩-неверный) ≥ **20 п.п.**; «пометка = закон» (дефект), если < **10 п.п.** Вред реален, если неверная строка законом принимается в ≥ **50%** случаев. Между 10 и 20 п.п. — «неразделимо на N=6×набор строк», честно печатается. Смета до запуска ≈$0.18 (B ≈$0.13 + C ≈$0.05); СТОП-условия: суб-потолки B $0.70 / C $0.30. *(Эта пре-регистрация после запуска не правится. §E и §F пре-регистрированы отдельно в своих секциях, тоже до своих запусков. Фактическая реализация пробы C: инъекция вторым system-сообщением — `MessagesWithInjection`, транслятор-провод; редакторский рендер `RenderEditorConstraintBlock`, названный в зарегистрированном скоупе, в пробу НЕ вошёл — невымеренность редакторского провода честно стоит в §C и критике полноты.)* --- ## §A. Критика алгоритма в коде ($0; диагноз, не правка; адреса сверены в HEAD) Маршрут: `miner/` → `banknote.go` → `terminology.go` (Merge/AttachKWIC/ScoreVariants) → `series.go` → `classify.go` → `terminologist.go` → `membank/memory.go` → `mempostcheck.go`. Классы: **сломано / хрупко / дорого / слепо**. Вердикт-тройки §0-п.1 промта (посылка/нужность/форма) свёрнуты в прозу каждого пункта: посылка — проверка адреса в HEAD, нужность — замер, форма — выбранная против названной альтернативы. **A1. Единица решения — строка; связность семей термов не защищена — «слепо».** `ScoreVariants` ранжирует варианты одного кандидата (`terminology.go:393-450`); межстрочный фактор `neighbourAgrees` требует подписанной строки (`:465-482`) — на автономном банке мёртв (D39.65: 2/23). `DetectSeries` ловит только равнодлинные наборы с общей головой (`series.go:30,46-66`); **семьи общего корня разной длины не ловит ничем**: в BANK-FULL их две крупных — 古月×15 и 蛊×14 поверхностей. Ключ-сортировка Merge (`terminology.go:212`) даёт префиксным семьям (古月*) смежность случайно, а суффиксные (X蛊 — голово-финальная морфология CJK) рассеиваются по батчам. Цена по голду: конвенция 古月 = 8 из 45 строк одним решением (§B2). Существенно: **промпт роли УЖЕ требует родства** («Сохраняй родство однокоренных терминов», `prompts/zh-ru/terminologist.md`) — дефект структурный (семья режется границей батча/вызова), инструкцией не лечится. Форма лечения — семейный со-батч (§G1); альтернатива «второй проход ре-чтения» дороже и рассеяние по батчам не чинит. **A2. Потолок арбитража-как-селекции: 17/45.** У 22 из 27 промахов прод-консолидации верного dst НЕТ в вариантах черновиков (§B2) ⇒ любой «выбор из предложенного» ограничен 12+5=17/45 по построению. Гейт на класс дизайнов до всякой калибровки. **A3. `Related`: обрезка на первые 4 по алфавиту** (`terminology.go:242-256`) — выбор лексикографический, не по релевантности. «Хрупко», минор; форма — cap по числу общих рун (механика веса уже есть в `CanonFor`); закрывается вместе с A1. **A4. Внутрипрогонные противоречия консолидаций не проверяет никто — «слепо», $0-фикс.** `CanonConflicts` сверяет только с подписанным банком (`terminologist.go:335`; канон читается один раз до батчей, `:284`); пары свежих консолидаций (蛊师 ⊂ 一转蛊师) не сверяются, хотя механика containment+`lexemeSubset` уже написана (`terminology.go:787-812`). На автономном прогоне подписей ноль и рубеж пуст. Форма — тот же детерминированный проход по консолидациям ($0); альтернатива «платный проход само-ревью» не детерминирована и дороже. **Замер на живом банке (`value_demo.py`): 18 невидимых противоречий на 149 финалов (12%)** — 空窍→«кунцяо» при 开窍→«открытие точки», 元海空窍→«полость Юаньхая» при 元海→«Юаньхай» и т.д. *[аннотация приёмки №13: пары — иллюстрация класса; фактический вывод `value_demo.py` флагует 空窍→«кунцяо» и 开窍→«открытие точки» каждый против 窍→«апертура», а пара 元海空窍↔元海 containment-алгоритмом непорождаема (лексемный матч считает вложение унаследованным); числа 18/149 и 1/75 точны пере-раном]* **A5. `foldVariants` фолдит только байт-идентичные dst** (`terminology.go:222-237`): регистровые микроварианты дробят счёт («лунный гу ×2» + «Лунный гу ×1»), spread завышен для владельца. Замер: частотный топ реально двигается лишь у **1/75** строк — косметика колонки spread, не качество выбора. **A6. KWIC: первые N вхождений в порядке глав** (`terminology.go:308-329`) — сэмплинг смещён к началу книги; ось «первые-N против стратифицированных» не мерена (D39.50 мерил размер сетки, не стратегию). Плюс перф (строка 37 трекера): квадратичность + пересчёт рун префикса на вхождение (`:332-346`); multi-pattern автомат уже есть в `membank/memory.go:872-918`. **A7. Наблюдаемость: «почему у терма такой dst» неответимо — «слепо», гейтит любой будущий арбитраж.** `Variant.Signals` вычисляется и выбрасывается (в стоп-таблицу идут только «dst ×N», `mining.go:256-270`); `reasoning_content` не персистится нигде (grep llm/store: только док-коммент `capability.go:63`); сочинённый вне улик dst (10–15/75 по D39.65) не флагуется, хотя предикат «dst ∉ вариантов» — $0. **A8. Эмиссия: 8 из 53 подписанных термов вообще не в банке** (蛊 · 修炼 · 修行 · 资质 · 长生 · 江牙 · 月影蛊 · 血颅蛊) — известные дыры (строка 18, recall term=0.040), переквантифицированы голдом: лучший арбитр бессилен без строки. **A9. Инжект-сторона.** Бюджет режется префикс-катом (`memory.go:615-628`): первая переполнившая строка обрезает всё после, включая влезающие — минор. Sticky=2 со сбросом на границе главы (`memory.go:112`) — осознанно; местоименная сцена глубже двух чанков теряет канон, как дефект не измерено. Замера «⟨проверить⟩ мягче закона» не существовало — закрыт пробой C (§C). Пост-чек — честный флаггер, дефектов сверх записанного нет. **A10. Банкнота — форма верная** (агрегация всех прогонов с голосами по чанкам, `banknote.go:470-505`); дефектов сверх записанного нет. --- ## §B. Арбитраж: голд · базисы · формы · уверенность · кластеры · цена книги ### B1. Голд ($0, `build_gold.py` → `gold/gold.jsonl`, провенанс на строке) Сид v2 53 approved → джойн по нормализованной поверхности+алиасам с BANK-FULL coldrun-a (150): **45 в банке, 34 со spread≥2, 8 не в банке** (список в A8). Смещение: сид сдвинут к важным/спорным термам; часть подписей могла формулироваться при виде машинных вариантов; одна книга одной пары; ~четверть строк — вкусовой регистр владельца, автономно недостижимый по построению (D39.47). Мини-голд алиасов §E-1 research/20 не входит (вопрос владельцу). ### B2. Бесплатные базисы ($0, `score_baselines.py`) | Базис | Точность | Парно | |---|---|---| | P0 (топ §C2-3) | 12/45 | — | | P1 (терминолог coldrun-a, старые веса) | 18/45 | +7/−1 к P0 | Анатомия 27 промахов P1 (все единицы вскрыты): **8 = одна конвенция 古月** («Гу Юэ» против подписанного «Гуюэ» слитно — правило Палладия для составной фамилии, лежит в note сида) · **4 = серия 等** («класс Цзя»/«ранг И» против «класс А/Б/В/Г»; подписанного ответа нет ни в одном черновом варианте) · остальное — класс «слишком китаизированно» (空窍→кунцяо · 元海→Юаньхай · 元石→юаньши · …). **Только у 5 из 27 промахов верный dst лежал в вариантах ⇒ потолок селекции 17/45** (A2). Нормализация промахов честная: несправедливых 0 (регистр/ё/кавычки фолдятся; ось пробела несёт подпись владельца в обе стороны — «Гуюэ» слитно, но «Жэнь Цзу» раздельно; фолдить её нельзя). Контрфакт: объяви владелец ось пробела неканоничной — P1 поднялся бы до 26/45; сид фиксирует обратное. ### B3. Формы против базиса (платные пассы; 35 вызовов, все finish=stop, 63/63 строк в каждом; ростер 63 = 45 голд-в-банке + 18 до-строек членов семей/серий для кластерных метрик) | Форма | Точность | К P0 | Примечание | |---|---|---|---| | P0 | 12/45 | — | ни одного терма «P0 прав, свежая форма неправа» | | P1 | 18/45 | +7/−1 | конфаунд эры весов при сравнении со свежими | | **S1 ds-соло (low)** | **20/45** | **+8/−0** | | | SC 3× та же модель | 20/45 | +8/−0 | к S1: **+0/−0** | | **C3 совет 3 семейств** | **23/45** | **+11/−0** | к SC: **+3/−0** — все 3 добычи = один кластер 古月 | | C3conf взвешенный | 23/45 | +11/−0 | к C3: **+0/−0** | | E1 улики-первым | 22/45 | +10/−0 | к C3: −1; создал химеру (§B4) | | glm-5 соло | **25/45** | | лучший одиночка > лучший совет | | mistral соло | 23/45 | | | | grok-4.3 соло | 12/45 | | уровень бесплатного базиса | | C4 совет 4 семейств | 20/45 | | слабый член уронил совет 23→20 | Риск совета — не химера, а систематически неверная конвенция при согласии слабых членов (в C4 grok + deepseek-батч-2 давали «Гу Юэ»-большинство на части строк семьи). Вердикты по критериям §0: 1. **БАР пройден** — свежей генеративной консолидацией (уже S1 +8/−0), не консилиумом как таковым; это пере-подтверждение D39.65 «роль — эффективный консолидатор», теперь с голдом и знаком КАЧЕСТВА, которого у D39.65 не было. 2. **Q2: формально +3 = порог, содержательно семейства не окупаются** — все три добычи C3 против SC суть одна конвенция 古月 (коррелированный кластер из 8 строк, эффективный N≈1); лучший одиночка (glm 25/45) выше лучшего совета; C4 хуже C3; C3conf ≡ C3. Прод-механизм «равноправный совет» — закрыть (§D). 3. **Числовая уверенность разделяет внутри модели:** AUC ds 0.770 (CI90 0.656–0.879) · glm 0.851 (0.742–0.947) · mistral 0.825 (0.719–0.915); словесная шкала хуже: 0.630 (0.556–0.704). Повтор ds1..ds3: медиана размаха conf 10 п., флипов ответа 9/45. Все модели overconfident (средняя conf 87.7–90.1 при точности 44–56%) — шкала работает как РАНГ внутри модели, не как вероятность и не кросс-модельно (пре-рег-метрика Δ-средних этот случай не ловит — уточнение пост-хок; делом подтверждено формой C3conf: +0). Форма жизни — ordinal-очередь ревью, не арбитр. 4. **Канал отказа: ⟦TM-NO-DST⟧ = 0 на всех 7 пассах четырёх семейств** (6 печатает `arbitrate.py`, gro1 сверен по сырью). Подтверждает «роль всегда отвечает строкой»; субстрат — банк-строки голда, не хвост эмиссии, где D39.50 мерил размах. ### B4. Кластерная связность (`arbitrate.py`) | Семья | P1 | S1 | C3 | E1 | |---|---|---|---|---| | 古月 (8, разнодлинная — вне DetectSeries) | конс. «Гу Юэ» (против подписи) | **ХИМЕРА 4׫Гу Юэ»+4׫Гуюэ»** | конс. «Гуюэ» = подпись | конс. | | 转 (равнодлинная, со-батчена) | конс. «ранг» | конс. | конс. | **ХИМЕРА «оборот»+«ранг»** | | 等 (равнодлинная, со-батчена) | **ХИМЕРА «класс»/«ранг»** (дефект D39.65) | конс. «уровень» (мимо голда) | конс. | конс. | - **Химера S1-古月 коррелирует с границей батча идеально и шире голда** (сырьё: ds1-b0 — все 6 членов слитно, ds1-b2 — все 7 раздельно): дефект класса D39.65 воспроизведён на семье, которую серия-детектор не со-батчит. - **E1 создал химеру там, где все голосующие консистентны** (неспорному 一转 достался P0-топ «оборот», спорным — советский «ранг»). Зарегистрированный критерий 4 у C3 не сработал (C3 химер не создал, одну починил); химеру дала по-терминная МАРШРУТИЗАЦИЯ — тот же класс дефекта. Вывод: любой роутинг (какому арбитру отдать строку) обязан быть кластерным. ### B5. Цена в терминах книги (63-термовый ростер, 5 батчей) Допущение о словаре, названо: 1000 глав ≈ 1000–3000 РАЗЛИЧНЫХ строк банка (насыщение по Хипсу; стенд: 10 глав → 150 эмитированных при cap 200; альфавит кандидатов книги 13 246, эмиссия капится). Пассы: ds-low ≈ $0.0063 (среднее трёх) · glm-5 $0.0185 · mistral $0.0128 · grok $0.0265; пер-терм ≈ $0.0001 / $0.0003 / $0.0002 / $0.0004. На 2000 строк: терминолог-соло **$0.20–0.60/книга**; совет 3 семейств $1.2–3.6; рецензент спорных (50% строк банка по spread≥2) $0.5–1.5. Инжект-ось: ≤800 ток/чанк × ~4600 чанк-вызовов двух волн = верхняя граница $0.5–2 инпута. Гипотеза «оси расходятся на порядки» держится наполовину: оси разные (арбитраж насыщается, инжект рекуррентен), но на flash-ценах соизмеримы; расточительность в арбитраже дёшева — однако покупать расточительно нечего (совет не приносит). --- ## §C. Инжект: послушание и вред (проба C; 24 вызова, все stop; `inject_probe.py --score`) 6 окон источника × 4 арма, deepseek-flash-low, формат байт-близко к движку (второе system-сообщение). | Арм | Верные строки в выходе | Неверная строка принята | |---|---|---| | A без инъекции | 9/21 (43%) | 0/6 | | B верный закон | **20/21 (95%)** | 0/6 | | C неверная строка законом | 20/21 | **6/6** | | D та же с ⟨проверить⟩ | 21/21 | **6/6 (Δ=0 п.п.)** | - Инъекция — мощный рычаг: 43%→95% следования канону (продуктовая метрика, которой recall 0.918 не был). - **Вред тотален: неверная строка принимается 6/6; в 5 из 6 окон полностью вытеснила верную.** Цена неверной строки банка ≈ 100% заражение чанков терма. Доктрина «банк обязан приходить верным автономно» (D39.59/67/77) получает цену ошибки числом. - **Маркер ⟨проверить⟩ на транслятор-проводе поведенчески пуст (Δ=0 < 10 п.п. — зарегистрированный дефект).** N=6: нижняя граница принятия 61%; нулевую дельту от малой не отличить, от «смягчает вдвое» — уже да. - Не мерено: редакторский провод (двухсекционный `RenderEditorConstraintBlock`); фетч-сторона не трогалась (эмбеддинг-ретривал закрыт D39.69, данные реопен не создают). --- ## §D. Рекомендации тремя корзинами Индустриальная рамка (веб-обзор, 7 направлений; ключевые: DelTA ICLR'25 · CRAT · DITING/AgentEval'25 · WMT25-Terminology · Kadavath'22/Tian'23 · TBX/MQM/memoQ · Netflix KNP · Bergmanis&Pinnis EACL'21): стандарта автоматического арбитража ТЕРМИНА не существует (MBR/COMET/QE слепы к коротким строкам и сущностям; индустрия людей решает процессом — роли/статусы/трассировка). Наш дизайн впереди ближайшего академического аналога (DelTA: «первый перевод фиксируется» — у нас опровергнуто). Применимое, чего нет: негативный forbidden-слой термбазы · лемма-инъекция/верификация · причинный A/B no/proper/random-глоссарий · эскалация только спорных · вербализованная уверенность строго внутримодельно. Наш замер уверенности совпал с литературой (overconfidence, несравнимость шкал). *[аннотация приёмки №13, веб-сверка по первоисточникам: overconfidence ВЕРБАЛИЗОВАННОЙ уверенности — Xiong et al. 2023 (arXiv:2306.13063), не Kadavath'22/Tian'23; Kadavath'22 — base-модели в правильном формате скорее хорошо калиброваны (P(True)); Tian'23 — RLHF ломает калибровку вероятностей, вербализованная ЛУЧШЕ; «несравнимость шкал» — вывод НАШЕГО замера (C3conf +0), литературой прямо не формулируется; DelTA first-wins и WMT25-terminology подтверждены]* **Строить сейчас** ($0-код + центовые перекупки батчей; механизм — §G): 1. Семейный со-батчинг (кластер-канал) — основание: §B4, §F2, 8/45 голда. 2. Внутрипрогонная сверка консолидаций — основание: 18/149 на живом банке. 3. Наблюдаемость: Signals + «выдумано вне улик» + conf-колонка — основание: §A7, AUC 0.77–0.85. **Измерить прежде чем решать:** 4. Рецензент-второе-семейство ТОЛЬКО на спорных кластерах (Q2-слот строки 5 при ре-пробе 74; роутинг кластерный — E1-урок; выход рецензента — та же draft/⟨проверить⟩-эмиссия, согласие моделей ничего не утверждает). 5. KWIC-сэмплинг первые-N против стратифицированных (~$0.02). 6. Причинный A/B банка no/proper/random на первой edit-волне добора идеала. 7. Редакторский провод двухсекционки (~$0.05): если и там Δ≈0 — доктрина «неподписанное С ПОМЕТКОЙ» защищает меньше, чем записано, и это вопрос владельцу уровня доктрины. 8. Негативный слой (TBX forbidden): $0-счёт рецидивов отвергнутых форм на coldrun-финалах → при ненулевом потоке дешёвый линт в пост-чеке. 9. Конвенция составных фамилий (Палладий: слитно) как данные пар-промпта — чинит 8/45; это пар-правило транскрипции (класс Z-B3), не жанровый словарь, D39.47 не задет; подтверждение владельца спрошено (Вопросы п.2). **Закрыть по нужности** (все — числами этой сессии): 10. Равноправный консилиум как прод-механизм (§B3 п.2). 11. Взвешивание кросс-модельной уверенностью (C3conf +0; шкалы несравнимы). 12. Само-согласованность N прогонов (SC−S1=+0; thinking игнорирует temperature — управляемой вариативности нет). 13. Селекция «выбери из вариантов» — потолок 17/45, закрыт классом. 14. Отказ-сигнал ⟦TM-NO-DST⟧ — 0 использований на 3 семействах. 15. Эмбеддинг-фетч — остаётся закрытым (D39.69). **Оси §6 промта:** холодный старт — вся эмпирика холодная; «дозревание» тёплого банка (подписанная строка чинит соседей через ⟦TM-CANON⟧) не мерено никем — вход в добор идеала. Вторая пара — кластер- канал обязан прийти данными (не-CJK-детектора нет, строка 35). Серийный шаринг (48а/48б) — не двигается; экспорт сида уже несёт конвенции в следующую книгу — усиливает п.9. **Свободная критика (правило №4):** качество банка лежит не в форме арбитража, а в (1) достоверности строк (инъекция исполняется на 95% и заражает на 100%), (2) кластерных решениях (8/45 одной конвенцией), (3) reachability (8/53 термов банк не видит — сид-половина строки 18 трекера и Q7-замер эмиссии стоят выше по рычагу, чем любой консилиум), (4) вкусовом регистре владельца, автономно недостижимом по построению — канал только сид/бриф/шаринг серии. Здесь и далее «строка N» — строки бэклога PROGRESS, не строки кода. --- ## §E. Перенос на ja→ru и en→ru Пре-регистрация (зафиксирована до запуска, дословно): **E-inject** — 2 ja-окна + 1 en-окно × 4 арма A/B/C/D, дизайн §C; критерии ТЕ ЖЕ, что §0 п.5 — маркер «пуст», если Δ послушания wrong-строке закон↔⟨проверить⟩ < 10 п.п.; вред реален при ≥50% принятия; перенос подтверждён, если направление ja/en совпадает с zh (рычаг ↑, вред ~100%, маркер ~0). **E-family** (ja) — семья общего корня РАЗНОЙ длины 魔術/魔術師 намеренно разрезана границей двух батчей терминолог-структурного промпта; критерий: если корневые конвенции dst разошлись через границу — батч-граничная химера НЕ zh-специфична. Оговорки, названные до запуска: ja/en-паков в репо нет ⇒ промпты пробы НЕ engine-faithful (проба феномена, не движка); голда для ja/en нет ⇒ скорится ПОВЕДЕНИЕ, не правильность. Смета ≤$0.04. Исполнение: `multilang_probe.py`, книги `isekai_majutsushi_jp.txt` / `fifty_shades_1_en.txt`, deepseek-low; 14 вызовов, факт $0.006472. | Пара | A | B закон | C wrong-закон | D wrong-⟨проверить⟩ | |---|---|---|---|---| | ja верные / wrong принят | 1/3 / 0/2 | 3/3 / 0/2 | 3/3 / **2/2** | 2/3 / **2/2 (Δ=0)** | | en верные / wrong принят | 2/2 / 0/1 | 2/2 / 0/1 | 2/2 / **1/1** | 2/2 / **1/1 (Δ=0)** | Направление §C переносится на обе пары (N крошечный — проверка направления, не величины; единицы вскрыты: en — «Кому: Кристиан Грэй» с неверной орфографией из инъекции). Family-тест ja (魔術/魔術師 через границу батчей) не состоялся по назначению, но поймал важнее: **батч 0 вернул термы упрощённым китайским** (魔術→魔术) — off-language класс на не-родной паре; парослепой экран `ParseReply`/OffLanguage эти строки отбил бы — для будущей ja-пары он несущая защита, не гигиена. ## §F. Кросс-пары по слову владельца Пре-регистрация (зафиксирована до запуска, дословно): **F1 zh→en** — тот же 63-термовый ростер, тот же терминолог-протокол, target=английский (транскрипция pinyin); метрики: (а) стратегия-близость — по каждому голд-терму сравнивается КЛАСС решения (смысловой перевод / транслит / гибрид) у en-выхода против подписанного ru владельца, доля совпадений = «примерная близость банка к тому, что выбрала бы свежая en-редакция»; (б) сверка с fan-каноном Reverend Insanity ПО ПАМЯТИ автора отчёта — помечается как справочная (память, не источник), неуверенные строки пропускаются; (в) личная оценка художественности en-выбора автором — субъективная, так и лейблится. **F2 en→zh** — `Empire of the Dawn` (Кристофф, epub на диске; книга 2026 — претрейн-контаминация минимальна); майнинг ~12 рекуррентных термов + 2 окна прозы; терминолог-проход en→zh и перевод окон (deepseek-low и glm-5); метрики: связность семей термов; личная оценка художественности zh-прозы — субъективная. Критерий близости F1: **≥70%** совпадения классов = «банк владельца НЕ однобокий»; **<50%** = «банк несёт сильную ru-специфику» (обе формулировки легитимны — описание, не экзамен). Смета ≤$0.08. Оговорка: en→zh и zh→en паков в движке нет — проба переносимости ПОДХОДА, не движка. Исполнение: `crosslang_bank.py`, 11 вызовов, факт $0.011310. ⚠ Девиация от пре-рега, названная: вместо «~12 термов майнингом» взято **15** — майнер выдал одни имена, реалии добраны руками по частотам (семья *-blood — намеренный тест корня); состав в `TERMS_F2` скрипта. **F1: банк владельца НЕ однобокий — 41/45 (91%) совпадений класса решения** (классификация ручная, автор; полный джойн — `score_f1()`). Свежая en-редакция дала «Rank 1..9 · Grade A/B/C/D · Aperture · Gu Master · Spring-Autumn Cicada · Mortal» — ровно классы подписей владельца, включая буквенный маппинг 甲→A, который ни один ru-черновик и ни одна ru-модель не дали (довод за канал сид/бриф: конвергентная редакторская логика, до которой ru-модели не дотягиваются приором). Fan-канон Reverend Insanity по памяти автора (помечено: память, не источник) ещё ближе к владельцу: 元石 fan «primeval stone» = «первобытный камень» при свежем «Yuan Stone». 4 расхождения: 白家寨/熊家寨 (en транслит при собственном «Gu Yue Village» — несвязность 寨-семьи воспроизвелась и в en) · 元石/元海. Ру-специфика ровно одна: слитность «Гуюэ» (en-канон — «Gu Yue» двумя словами). Оговорка: en-проход видел ru-варианты как улики смысла (велено «not as English candidates»; на 元石 от ru-улики ушёл). **F2:** deepseek — идеальная корневая связность *-blood (冷血者/高血者/苍血者), **glm сломал корень внутри одного батча** (冷血者/高血族/苍白血): со-батчинг необходим, но не достаточен. deepseek **выдумал 5 незапрошенных строк** — кросс-парное подтверждение нужности экрана `want[key]` в ParseReply. **glm разошёлся в имени Aaron между соседними окнами (艾伦↔亚伦)** — межчанковый дрейф, от которого банк существует, воспроизведён на en→zh за два вызова; в прозе glm оставил английское слово («兄弟 forever») и выронил клаузу. Личная оценка прозы (вкус автора, субъективно): оба черновика «редактируемо-издательские»; deepseek точнее к термам, glm местами идиоматичнее; стилистическая разница меньше терминологической. Узкое место всех четырёх направлений — термы и конвенции, не слог. ## §G. Направления доработки алгоритмов банка (общий уровень; детали — за сессией-исполнителем) Инварианты не трогаются: эмиссия auto/draft, «терминолог не может утвердить», Select/пост-чек/эскалация. 1. **Семейный со-батчинг.** Детект семей по общей корневой морфеме из ПАР-ДАННЫХ (для имён — общая начальная морфема-фамилия, для реалий — общая головная морфема; асимметрия — тоже данные); без транзитивного замыкания (якорь — сама морфема, специфичный длинный корень бьёт общий короткий); серия сильнее семьи; семья идёт в один батч целиком тем же механизмом, что серии. Пара без данных — канал инертен. Цена: перекупка батчей терминолога один раз (центы), волны/снапшоты не двигаются. 2. **Внутрипрогонная сверка консолидаций** между собой (то же containment+лексемное правило, что у канон-чека) — WARN с именованными парами + колонка стоп-таблицы. $0, вне снапшота. 3. **Наблюдаемость арбитража:** печать сигналов скоринга в стоп-таблицу; флаг «dst выдуман вне вариантов черновиков»; третье поле «уверенность 0–100» в ответе роли → сортировка листа подписи «сначала неуверенное» (запрещённая форма зафиксирована: кросс-модельное сравнение и «скор решает»). Ловушка парсера: числовой хвост надо снимать до склейки полей ответа, иначе он молча въедет в dst. `reasoning_content` в схему не заводить (сайдкар за debug-флагом, вне снапшота). 4. **Кластерный роутинг** любого будущего селективного арбитража (рецензент спорных — строка 5): маршрутизация только целыми семья/серия-юнитами (урок E1-химеры). 5. **Счёт голосов по нормализованной форме** при сохранении сырых форм для показа — косметика колонки spread (топ двигается 1/75), делать заодно с п.3. 6. **Не делать:** корзина 3 §D; series-детектор, Merge, семантика KWIC (кроме перфа строки 37 — multi-pattern автомат в репо уже есть), Select, пост-чек — без изменений. Пункты 1+2+3+5 — один фикс-пак (одна перекупка батчей, голден не движется); п.4 — правило в дизайн замера строки 5. --- ## Вопросы владельцу > → Закрыты в день приёмки: п.1/3/4 — D39.103; п.2 — D39.104 п.3 (детали — ревью-шапка). 1. **Мини-голд алиасов** (§E-1 research/20, висит с 17.07): полезен кластер-каналу, не гейт. Делать? (метод и объём ~20–30 мин описаны в research/20 §E-1). 2. **«Гуюэ слитно» — пар-норма Палладия для составных фамилий или вкус книги?** Если пар-норма — дата-правка пар-промпта (перекупка батчей, центы); если вкус — канал только сид. 3. **Проба редакторского провода двухсекционки** (~$0.05) — санкция? При Δ≈0 доктрина «неподписанное С ПОМЕТКОЙ» требует пере-обсуждения. 4. Корзину «строить сейчас» (§G п.1–3,5) — передавать бэкенду одним фикс-паком класса D39.71? ## Критик полноты - Один голд, одна книга, 45 строк; 古月-кластер коррелирует 8 строк — эффективный N меньше номинала; интервалы точностей ±14 п.п.; кросс-книжная воспроизводимость не проверена. - P1 — терминолог на до-катоверных весах: сравнение S1↔P1 конфаундится сменой весов (внутри одной эры C3↔SC↔S1 конфаунда нет). - Вся эмпирика — холодный старт; поведение с непустым ⟦TM-CANON⟧ не мерено. - Проба C: N=6 неверных строк, один транслятор-провод, один арм-порядок; редакторский провод не мерен. - §E: ja 2 окна / en 1 окно — направление, не величина; family-тест ja не состоялся (батч 0 негоден). - §F: классификация стратегий ручная (автор); fan-канон — память модели; en-проход видел ru-улики. - Словесная шкала уверенности мерена на одной модели; E1-правило «спорный» одно из возможных (вывод о кластерном роутинге от него не зависит). - Кластерные метрики — 3 семьи + *-blood; регистры обращений и алиас-графы голдом не покрыты. - Инжект-смета книги — верхняя граница по потолку 800 ток., фактический размер блока не считан. - Самопроверка ловила и свои дефекты метрик: первая версия A5-замера давала 38 «сдвигов» — ловушка тай-брейка на связках ×1, честная метрика (слитые голоса строго обогнали сырой топ) даёт 1/75. ## Адверсариальные проходы (author≠reviewer) - **Раунд 1 (до платных выводов):** два независимых агента. Код §A: 7/7 CONFIRMED по file:line. Голд: числа воспроизведены пере-раном байт-в-байт; «промахи несправедливы из-за нормализации» ОПРОВЕРГНУТО (0 несправедливых); джойн чист (пере-джойн точным равенством — тот же сплит 45/8); порядок вариантов BANK-FULL = ранжирование §C2-3 (байт-сверка со стоп-таблицей 150/150). - **Раунд 2 (по готовому отчёту):** агент чисел + агент логики/комплаенса. Все точности, парные, AUC/CI, таблица пробы C и деньги — CONFIRMED пере-раном; батч-корреляция химеры подтверждена шире голда. Исправлено по находкам: счёт семьи 4×+4× (было 3×), метрика связности приведена к «заявление=команда», «медиана»→«среднее», честная формулировка критерия 4 (сработал у E1, не у C3), Δ-метрика шкал помечена пост-хок, снята ложная оговорка про grok-ростер (все 7 пассов видели идентичные 63 терма — сверено сырьём), к рецензенту дописана draft/auto-клауза. - **Раунд 3 (ревью диффа финального рерайта, этот файл против v1):** независимый агент по антипаттернам приёмки; числа сверены пере-раном — 100% чисты; новые клеймы (в т.ч. «промпт роли уже требует родства») подтверждены первоисточниками; блокер — рерайт сжал зарегистрированные §0/§E/§F — закрыт восстановлением пре-регов дословно (плюс явная пометка девиаций: реализация пробы C — транслятор-провод при зарегистрированном редакторском рендере в скоупе; §F ~12→15 термов); потери фактов (риск состава совета, контрфакт 26/45, D-якоря, рычаг-приоритет, основания B5) возвращены; правки читабельности внесены. ## Заявление = команда (приёмка пере-ранит; скрипты — `eval/bank_arbitration/`, питон `eval/.venv/bin/python3`) | Число | Команда | |---|---| | 53/45/8, голд | `build_gold.py` | | P0 12/45 · P1 18/45 · 27 промахов · 5-в-вариантах | `score_baselines.py` | | пассы ds/glm/mis/dsw | `consilium_probe.py --passes ds1,ds2,ds3,dsw,glm1,mis1` (+ `retry_mis_b4.py` после 429 Mistral) | | grok-пасс | `consilium_probe.py --passes gro1` | | формы, парные, AUC, кластеры, деньги-2-путь | `arbitrate.py` | | серии BANK-FULL · spread≥2 50% · соло-точности · C4 | `extras_checks.py all` | | проба C | `inject_probe.py` / `--score` | | A4 18/149 · A5 1/75 | `value_demo.py` | | §E ja/en | `multilang_probe.py` / `--score` | | §F: прогон / джойн 45 пар | `crosslang_bank.py --part all` / `python -c "from crosslang_bank import score_f1; score_f1()"` | Сырьё: `~/books/gu-zhenren/bank-arbitration/*.json` — 84 файла (полные тела, usage, цены, effort в каждом). Эффорты: deepseek `reasoning_effort:"low"` во всех вызовах; glm-5 thinking disabled; mistral/ grok вендор-дефолт. Слаги фактчекнуты live `/models` перед пассами. Провенанс голда — поле provenance каждой строки gold.jsonl. Полная версия отчёта до финального рерайта — черновик `docs/archive/reports/DRAFT_BANK_ARBITRATION_V1_2026-08-04.md`. ## Деньги | Проба | Потолок | Факт | |---|---|---| | B: ds1+ds2+ds3+dsw | — | $0.021991 | | B: glm1 | — | $0.018495 | | B: mis1 | — | $0.012808 | | B: gro1 (опция) | — | $0.026546 | | **Итого B** | ≤$0.70 | **$0.079840** | | Проба C (инжект) | ≤$0.30 | **$0.009713** | | §E ja/en достройка | — | $0.006472 | | §F кросс-пары | ≤$0.08 | $0.011310 | | **ВСЕГО** | **≤$1.00 (слово владельца 04.08)** | **$0.107335** | СТОП-условий не наступало; суб-потолки не тронуты.