59 KiB
research/24 — Арбитраж банка памяти: консилиум · уверенность · инжект/фетч · кросс-пары
РЕВЬЮ-ШАПКА ПРИЁМКИ (оркестратор №13, 04.08.2026). Статус: ПРИНЯТ, залендено этим коммитом (D39.102). Метод — адверсариальная приёмка тремя контурами. (1) Пере-раны: 12-агентный воркфлоу пере-ранил ВСЕ строки таблицы «заявление = команда» ($0, офлайн по сырью) — 8/8 CONFIRMED, ни одного расхождения чисел (голд 53/45/8/34 · базисы 12/18/27/5 · формы S1/SC/C3/C3conf/E1/C4 · AUC с CI · химеры B4 по сырью батчей · инжект-таблица · 18/149 · 1/75 · §E/§F по сырью); все 23 адреса §A подтверждены по HEAD
7f6270a(3 уточнения координат: сброс sticky живёт вwave.go:84-86; фикстура A8 — дистиллtestdata/bankfull-surfaces.txt; механизм series до ~:76); байт-сверка инжект-пробы с движком: заголовок/маркер/«src → dst»/второй system байт-идентичны (gender-нота не моделируется — для безгендерного глоссария рендер совпадает). (2) Харнесс и деньги: независимый пересчёт из сырья $0.107334 против записанных $0.107335 (округление на записи); цены =models.yaml; 84/84 finish=stop; слаг-дрейфа нет; голд 53/53 против сида, пере-сборка детерминистична байт-в-байт. (3) Слепое ревью кода банка (author≠reviewer, без чтения этого отчёта) + 12 опровергателей: находки СВЕРХ §A заведены строками 128–132 (главные: банкнота-парсер теряет хвост многословного dst против клейма A10 «дефектов нет»; emitRankCap×writeAutoBank молча стирает термы из авто-банка; кап инъекции не считает маркер/гендер-ноты). Оговорки приёмки (выводов не двигают): (а) в скоринге армов C/D — regex-конфаунд: голд-rx 真元 матчится внутри верного перевода 元海 ⇒ «верные строки» C/D завышены до 2 ячеек; выводы «wrong принят 6/6 · Δ=0 · вытеснение 5/6» стоят на другой метрике и не задеты; (б) C4=20/45 хрупок — 2-2-тай в 7/45 термов решается порядком голосов; вывод «совет закрыть» стоит на C3−SC=+3 (один кластер) и glm-соло 25>23, не на C4; (в) фоллбек C3 несимметричен (сработал 5/45, эффект мал); SC при temp=0 меряет недетерминизм провайдера, не сэмплинг; (г) иллюстративные пары A4 склеены не как печатает скрипт (см. аннотацию в §A4); (д) «точность 44–56%» — числовые пассы; словесный dsw = 40.0%; (е) 18 оплаченных доп-поверхностей ростера кодом почти не скорятся — выводы по ним ручные по сырью; (ж) атрибуция литературы уверенности поправлена аннотацией в §D (Xiong et al. 2023, не Kadavath/Tian); DelTA first-wins и WMT25 подтверждены первоисточниками; (з) «потолок $1.00 — слово владельца 04.08» — со слов сессии (ратифицированный потолок $1.20, D39.90 п.5); при факте $0.107 беспредметно; арифметика ПИНГА в PROGRESS («+$0.0161») — склейка инкрементов C+E, леджер отчёта чист. → Тот же день (04.08): все 4 вопроса владельцу ЗАКРЫТЫ. (1) мини-голд алиасов — отложен до первого длинного прогона (D39.103); (2) «Гуюэ» — не чинить, канал сида (D39.104 п.3); (3) проба редакторского провода санкционирована — промт выдан, отчёт будет../experiments/18-editor-wire-probe.md(D39.103); (4) фикс-пак §G санкционирован строкой 128 — промт выдан (D39.103). Поверх §C ратифицирована доктрина инжекта D39.104 (закон на проводе для всех ролей; маркер снимается — строка 134).
Ресёрч+полигон сессия, 04.08.2026. Исполнение docs/archive/prompts/BANK_ARBITRATION_RESEARCH_SESSION_PROMPT.md (заархивирован D39.101)
(D39.89; пере-запуск — артефактов захода 02.08 в дереве не было, D39.90 п.5; подрезка учтена: B2
свёрнута в под-пробу B3, C сокращена). Плюс прямой вопрос владельца 04.08: общий взгляд на алгоритм
банка — хватает ли текущего, не пропущен ли индустриальный стандарт (ответ — §D); и достройки того же
дня: мультиязычность (§E), кросс-пары и художественность (§F), дизайн-направления (§G).
Потолок владельца 04.08 $1.00, факт $0.107335.
Зона записи: этот файл + eval/bank_arbitration/ + секция «Полигон» PROGRESS; сырьё durable
~/books/gu-zhenren/bank-arbitration/ (84 json). Пробы — своим харнессом против API (в backend/
незакоммиченный пак чужой сессии); coldrun-a — только чтение; базлайн качества банка = coldrun-a
(D39.86). Не закоммичено — лендит оркестратор. Кода бэкенда не правлено.
§0. ПРЕ-РЕГИСТРАЦИЯ ПРОБ (записано ДО первого платного вызова; норма D39.46)
Дата/время фиксации: 2026-08-04, до каких-либо платных вызовов этой сессии. Голд (§B1) собран ДО пре-регистрации ($0), его числа: 53 approved сида → 45 в BANK-FULL coldrun-a, из них 34 со spread≥2.
Пассы (все — полный голд-набор одним батч-протоколом, engine-faithful RenderBatch):
| Пасс | Модель | Режим | Что несёт |
|---|---|---|---|
| ds1..ds3 | deepseek-v4-flash | reasoning_effort:"low", temp 0 |
S1 (свежий одиночный) + SC (само-согласованность N=3) + числовая уверенность 0–100 |
| dsw | deepseek-v4-flash | то же | словесная шкала уверенности (точно/скорее да/не уверен/не знаю) |
| glm1 | glm-5 | thinking disabled (форма движка) | второе семейство + числовая уверенность |
| mis1 | mistral-large-2512 | без reasoning | третье семейство + числовая уверенность |
| gro1 (опция при остатке бюджета) | grok-4.3 | дефолт (low) | четвёртое семейство, чувствительность состава совета |
Эффорты каждого пасса печатаются в отчёте (иначе числа несравнимы — §7 промта).
Формы арбитража (агрегация офлайн, $0):
- P0 — бесплатный базис §C2-3: топ-вариант ранжирования движка (колонка вариантов BANK-FULL, bankStopRows рендерит best-ranked first). Термы без вариантов → P0 пуст (честный отказ базиса).
- P1 — прод-референс: сведённый dst coldrun-a (терминолог на до-катоверных весах).
- S1 = ds1. SC = большинство(ds1,ds2,ds3), при 3-стороннем расхождении → ds1.
- C3 — равноправный совет: большинство(ds1, glm1, mis1) по нормализованному совпадению; полное расхождение → P0-топ, если хоть один голос совпал с ним, иначе ds1.
- C3conf — взвешенный: argmax по сумме заявленных уверенностей проголосовавших за вариант моделей.
- E1 — улики-первым: P0 стоит; «спорный» терм := (spread≥2 И разрыв top1−top2 по чанкам ≤1) ИЛИ singleton-улика (top1 предложен 1 чанком) → на спорных решает C3. Цена печатается долей от полного совета.
Метрики:
- Точность против голда: нормализованное точное совпадение (casefold · ё→е · схлоп пробелов · срез «»/кавычек). Промахи вскрываются глазами; спорные эквивалентности печатаются отдельно, автоматом НЕ засчитываются.
- Парные сравнения форм: счёт термов «A прав ∧ B неправ» против обратного (не голые проценты).
- Кластерная связность: семьи 古月-* (7 поверхностей, РАЗНОЙ длины — DetectSeries её не видит), 蛊-* (蛊师/蛊虫/月光蛊 + голова 蛊 вне банка), серии 等/转 (равнодлинные — детектируются). Метрика: консистентность конвенции внутри семьи у каждой формы (одна голова/конвенция у всех членов — да/нет), и отдельно: даёт ли по-терминный агрегатор химеру там, где одиночная модель консистентна.
- B2-под-проба (уверенность): AUC(уверенность → верно/неверно по голду) per-model (bootstrap 90% CI); устойчивость: медиана |Δconf| ds1↔ds2↔ds3 и доля флипов ответа; сравнимость шкал: |Δ средних conf| между моделями на одном наборе; канал отказа: счёт ⟦TM-NO-DST⟧ и его стабильность между ds1..ds3.
Критерии (успех/провал, зафиксированы ДО запуска):
- БАР (в): форма «бьёт базис P0», если парное преимущество (термы A-прав-P0-неправ минус обратные) ≥ +5 на 45 голд-термах. Меньше — «не бьёт» (на N=45 меньшее неотличимо от шума).
- Q2 (окупаются ли семейства): C3 против SC парное преимущество ≥ +3; меньше ⇒ «разные семейства не окупаются, хватает N прогонов одной модели» (легитимный исход).
- Уверенность разделяет, если AUC ≥ 0.70 и нижняя граница CI > 0.5 минимум у 2 моделей из 3; иначе — «уверенность как арбитр закрыта по нужности». Числа против слов: |ΔAUC| ≥ 0.05 решает форму. Шкалы несравнимы, если |Δ средних conf| > 20 п. ⇒ сырой кросс-модельный скор как решающее правило запрещён.
- Кластеры: ≥1 новая химера у C3 там, где SC/P1 консистентны ⇒ возражение §4 промта подтверждено (единица арбитража обязана быть кластером).
- Проба C (инжект, формат RenderGlossaryBlock/RenderEditorConstraintBlock байт-близко): 6 чанков × 4 арма (без инъекции · верный закон · НЕВЕРНАЯ строка законом · та же неверная строка с маркером ⟨проверить⟩), deepseek-v4-flash low, temp 0. Критерии: маркер «читается мягче закона», если послушание(закон-неверный) − послушание(⟨проверить⟩-неверный) ≥ 20 п.п.; «пометка = закон» (дефект), если < 10 п.п. Вред реален, если неверная строка законом принимается в ≥ 50% случаев. Между 10 и 20 п.п. — «неразделимо на N=6×набор строк», честно печатается.
Смета до запуска ≈$0.18 (B ≈$0.13 + C ≈$0.05); СТОП-условия: суб-потолки B $0.70 / C $0.30.
(Эта пре-регистрация после запуска не правится. §E и §F пре-регистрированы отдельно в своих секциях,
тоже до своих запусков. Фактическая реализация пробы C: инъекция вторым system-сообщением —
MessagesWithInjection, транслятор-провод; редакторский рендер RenderEditorConstraintBlock, названный
в зарегистрированном скоупе, в пробу НЕ вошёл — невымеренность редакторского провода честно стоит в §C
и критике полноты.)
§A. Критика алгоритма в коде ($0; диагноз, не правка; адреса сверены в HEAD)
Маршрут: miner/ → banknote.go → terminology.go (Merge/AttachKWIC/ScoreVariants) → series.go →
classify.go → terminologist.go → membank/memory.go → mempostcheck.go. Классы: сломано /
хрупко / дорого / слепо.
Вердикт-тройки §0-п.1 промта (посылка/нужность/форма) свёрнуты в прозу каждого пункта: посылка — проверка адреса в HEAD, нужность — замер, форма — выбранная против названной альтернативы.
A1. Единица решения — строка; связность семей термов не защищена — «слепо».
ScoreVariants ранжирует варианты одного кандидата (terminology.go:393-450); межстрочный фактор
neighbourAgrees требует подписанной строки (:465-482) — на автономном банке мёртв (D39.65: 2/23).
DetectSeries ловит только равнодлинные наборы с общей головой (series.go:30,46-66); семьи общего
корня разной длины не ловит ничем: в BANK-FULL их две крупных — 古月×15 и 蛊×14 поверхностей.
Ключ-сортировка Merge (terminology.go:212) даёт префиксным семьям (古月*) смежность случайно, а
суффиксные (X蛊 — голово-финальная морфология CJK) рассеиваются по батчам. Цена по голду: конвенция
古月 = 8 из 45 строк одним решением (§B2). Существенно: промпт роли УЖЕ требует родства
(«Сохраняй родство однокоренных терминов», prompts/zh-ru/terminologist.md) — дефект структурный
(семья режется границей батча/вызова), инструкцией не лечится. Форма лечения — семейный со-батч (§G1);
альтернатива «второй проход ре-чтения» дороже и рассеяние по батчам не чинит.
A2. Потолок арбитража-как-селекции: 17/45. У 22 из 27 промахов прод-консолидации верного dst НЕТ в вариантах черновиков (§B2) ⇒ любой «выбор из предложенного» ограничен 12+5=17/45 по построению. Гейт на класс дизайнов до всякой калибровки.
A3. Related: обрезка на первые 4 по алфавиту (terminology.go:242-256) — выбор лексикографический,
не по релевантности. «Хрупко», минор; форма — cap по числу общих рун (механика веса уже есть в
CanonFor); закрывается вместе с A1.
A4. Внутрипрогонные противоречия консолидаций не проверяет никто — «слепо», $0-фикс.
CanonConflicts сверяет только с подписанным банком (terminologist.go:335; канон читается один раз
до батчей, :284); пары свежих консолидаций (蛊师 ⊂ 一转蛊师) не сверяются, хотя механика
containment+lexemeSubset уже написана (terminology.go:787-812). На автономном прогоне подписей ноль
и рубеж пуст. Форма — тот же детерминированный проход по консолидациям ($0); альтернатива «платный
проход само-ревью» не детерминирована и дороже. Замер на живом банке (value_demo.py): 18 невидимых
противоречий на 149 финалов (12%) — 空窍→«кунцяо» при 开窍→«открытие точки», 元海空窍→«полость Юаньхая» при 元海→«Юаньхай» и т.д. [аннотация приёмки №13: пары — иллюстрация класса; фактический вывод value_demo.py флагует 空窍→«кунцяо» и 开窍→«открытие точки» каждый против 窍→«апертура», а пара 元海空窍↔元海 containment-алгоритмом непорождаема (лексемный матч считает вложение унаследованным); числа 18/149 и 1/75 точны пере-раном]
A5. foldVariants фолдит только байт-идентичные dst (terminology.go:222-237): регистровые
микроварианты дробят счёт («лунный гу ×2» + «Лунный гу ×1»), spread завышен для владельца. Замер:
частотный топ реально двигается лишь у 1/75 строк — косметика колонки spread, не качество выбора.
A6. KWIC: первые N вхождений в порядке глав (terminology.go:308-329) — сэмплинг смещён к началу
книги; ось «первые-N против стратифицированных» не мерена (D39.50 мерил размер сетки, не стратегию).
Плюс перф (строка 37 трекера): квадратичность + пересчёт рун префикса на вхождение (:332-346);
multi-pattern автомат уже есть в membank/memory.go:872-918.
A7. Наблюдаемость: «почему у терма такой dst» неответимо — «слепо», гейтит любой будущий арбитраж.
Variant.Signals вычисляется и выбрасывается (в стоп-таблицу идут только «dst ×N», mining.go:256-270);
reasoning_content не персистится нигде (grep llm/store: только док-коммент capability.go:63);
сочинённый вне улик dst (10–15/75 по D39.65) не флагуется, хотя предикат «dst ∉ вариантов» — $0.
A8. Эмиссия: 8 из 53 подписанных термов вообще не в банке (蛊 · 修炼 · 修行 · 资质 · 长生 · 江牙 · 月影蛊 · 血颅蛊) — известные дыры (строка 18, recall term=0.040), переквантифицированы голдом: лучший арбитр бессилен без строки.
A9. Инжект-сторона. Бюджет режется префикс-катом (memory.go:615-628): первая переполнившая
строка обрезает всё после, включая влезающие — минор. Sticky=2 со сбросом на границе главы
(memory.go:112) — осознанно; местоименная сцена глубже двух чанков теряет канон, как дефект не
измерено. Замера «⟨проверить⟩ мягче закона» не существовало — закрыт пробой C
(§C). Пост-чек — честный флаггер, дефектов сверх записанного нет.
A10. Банкнота — форма верная (агрегация всех прогонов с голосами по чанкам, banknote.go:470-505);
дефектов сверх записанного нет.
§B. Арбитраж: голд · базисы · формы · уверенность · кластеры · цена книги
B1. Голд ($0, build_gold.py → gold/gold.jsonl, провенанс на строке)
Сид v2 53 approved → джойн по нормализованной поверхности+алиасам с BANK-FULL coldrun-a (150): 45 в банке, 34 со spread≥2, 8 не в банке (список в A8). Смещение: сид сдвинут к важным/спорным термам; часть подписей могла формулироваться при виде машинных вариантов; одна книга одной пары; ~четверть строк — вкусовой регистр владельца, автономно недостижимый по построению (D39.47). Мини-голд алиасов §E-1 research/20 не входит (вопрос владельцу).
B2. Бесплатные базисы ($0, score_baselines.py)
| Базис | Точность | Парно |
|---|---|---|
| P0 (топ §C2-3) | 12/45 | — |
| P1 (терминолог coldrun-a, старые веса) | 18/45 | +7/−1 к P0 |
Анатомия 27 промахов P1 (все единицы вскрыты): 8 = одна конвенция 古月 («Гу Юэ» против подписанного «Гуюэ» слитно — правило Палладия для составной фамилии, лежит в note сида) · 4 = серия 等 («класс Цзя»/«ранг И» против «класс А/Б/В/Г»; подписанного ответа нет ни в одном черновом варианте) · остальное — класс «слишком китаизированно» (空窍→кунцяо · 元海→Юаньхай · 元石→юаньши · …). Только у 5 из 27 промахов верный dst лежал в вариантах ⇒ потолок селекции 17/45 (A2). Нормализация промахов честная: несправедливых 0 (регистр/ё/кавычки фолдятся; ось пробела несёт подпись владельца в обе стороны — «Гуюэ» слитно, но «Жэнь Цзу» раздельно; фолдить её нельзя). Контрфакт: объяви владелец ось пробела неканоничной — P1 поднялся бы до 26/45; сид фиксирует обратное.
B3. Формы против базиса (платные пассы; 35 вызовов, все finish=stop, 63/63 строк в каждом;
ростер 63 = 45 голд-в-банке + 18 до-строек членов семей/серий для кластерных метрик)
| Форма | Точность | К P0 | Примечание |
|---|---|---|---|
| P0 | 12/45 | — | ни одного терма «P0 прав, свежая форма неправа» |
| P1 | 18/45 | +7/−1 | конфаунд эры весов при сравнении со свежими |
| S1 ds-соло (low) | 20/45 | +8/−0 | |
| SC 3× та же модель | 20/45 | +8/−0 | к S1: +0/−0 |
| C3 совет 3 семейств | 23/45 | +11/−0 | к SC: +3/−0 — все 3 добычи = один кластер 古月 |
| C3conf взвешенный | 23/45 | +11/−0 | к C3: +0/−0 |
| E1 улики-первым | 22/45 | +10/−0 | к C3: −1; создал химеру (§B4) |
| glm-5 соло | 25/45 | лучший одиночка > лучший совет | |
| mistral соло | 23/45 | ||
| grok-4.3 соло | 12/45 | уровень бесплатного базиса | |
| C4 совет 4 семейств | 20/45 | слабый член уронил совет 23→20 |
Риск совета — не химера, а систематически неверная конвенция при согласии слабых членов (в C4 grok + deepseek-батч-2 давали «Гу Юэ»-большинство на части строк семьи).
Вердикты по критериям §0:
- БАР пройден — свежей генеративной консолидацией (уже S1 +8/−0), не консилиумом как таковым; это пере-подтверждение D39.65 «роль — эффективный консолидатор», теперь с голдом и знаком КАЧЕСТВА, которого у D39.65 не было.
- Q2: формально +3 = порог, содержательно семейства не окупаются — все три добычи C3 против SC суть одна конвенция 古月 (коррелированный кластер из 8 строк, эффективный N≈1); лучший одиночка (glm 25/45) выше лучшего совета; C4 хуже C3; C3conf ≡ C3. Прод-механизм «равноправный совет» — закрыть (§D).
- Числовая уверенность разделяет внутри модели: AUC ds 0.770 (CI90 0.656–0.879) · glm 0.851 (0.742–0.947) · mistral 0.825 (0.719–0.915); словесная шкала хуже: 0.630 (0.556–0.704). Повтор ds1..ds3: медиана размаха conf 10 п., флипов ответа 9/45. Все модели overconfident (средняя conf 87.7–90.1 при точности 44–56%) — шкала работает как РАНГ внутри модели, не как вероятность и не кросс-модельно (пре-рег-метрика Δ-средних этот случай не ловит — уточнение пост-хок; делом подтверждено формой C3conf: +0). Форма жизни — ordinal-очередь ревью, не арбитр.
- Канал отказа: ⟦TM-NO-DST⟧ = 0 на всех 7 пассах четырёх семейств (6 печатает
arbitrate.py, gro1 сверен по сырью). Подтверждает «роль всегда отвечает строкой»; субстрат — банк-строки голда, не хвост эмиссии, где D39.50 мерил размах.
B4. Кластерная связность (arbitrate.py)
| Семья | P1 | S1 | C3 | E1 |
|---|---|---|---|---|
| 古月 (8, разнодлинная — вне DetectSeries) | конс. «Гу Юэ» (против подписи) | ХИМЕРА 4׫Гу Юэ»+4׫Гуюэ» | конс. «Гуюэ» = подпись | конс. |
| 转 (равнодлинная, со-батчена) | конс. «ранг» | конс. | конс. | ХИМЕРА «оборот»+«ранг» |
| 等 (равнодлинная, со-батчена) | ХИМЕРА «класс»/«ранг» (дефект D39.65) | конс. «уровень» (мимо голда) | конс. | конс. |
- Химера S1-古月 коррелирует с границей батча идеально и шире голда (сырьё: ds1-b0 — все 6 членов слитно, ds1-b2 — все 7 раздельно): дефект класса D39.65 воспроизведён на семье, которую серия-детектор не со-батчит.
- E1 создал химеру там, где все голосующие консистентны (неспорному 一转 достался P0-топ «оборот», спорным — советский «ранг»). Зарегистрированный критерий 4 у C3 не сработал (C3 химер не создал, одну починил); химеру дала по-терминная МАРШРУТИЗАЦИЯ — тот же класс дефекта. Вывод: любой роутинг (какому арбитру отдать строку) обязан быть кластерным.
B5. Цена в терминах книги (63-термовый ростер, 5 батчей)
Допущение о словаре, названо: 1000 глав ≈ 1000–3000 РАЗЛИЧНЫХ строк банка (насыщение по Хипсу; стенд: 10 глав → 150 эмитированных при cap 200; альфавит кандидатов книги 13 246, эмиссия капится). Пассы: ds-low ≈ $0.0063 (среднее трёх) · glm-5 $0.0185 · mistral $0.0128 · grok $0.0265; пер-терм ≈ $0.0001 / $0.0003 / $0.0002 / $0.0004. На 2000 строк: терминолог-соло $0.20–0.60/книга; совет 3 семейств $1.2–3.6; рецензент спорных (50% строк банка по spread≥2) $0.5–1.5. Инжект-ось: ≤800 ток/чанк × ~4600 чанк-вызовов двух волн = верхняя граница $0.5–2 инпута. Гипотеза «оси расходятся на порядки» держится наполовину: оси разные (арбитраж насыщается, инжект рекуррентен), но на flash-ценах соизмеримы; расточительность в арбитраже дёшева — однако покупать расточительно нечего (совет не приносит).
§C. Инжект: послушание и вред (проба C; 24 вызова, все stop; inject_probe.py --score)
6 окон источника × 4 арма, deepseek-flash-low, формат байт-близко к движку (второе system-сообщение).
| Арм | Верные строки в выходе | Неверная строка принята |
|---|---|---|
| A без инъекции | 9/21 (43%) | 0/6 |
| B верный закон | 20/21 (95%) | 0/6 |
| C неверная строка законом | 20/21 | 6/6 |
| D та же с ⟨проверить⟩ | 21/21 | 6/6 (Δ=0 п.п.) |
- Инъекция — мощный рычаг: 43%→95% следования канону (продуктовая метрика, которой recall 0.918 не был).
- Вред тотален: неверная строка принимается 6/6; в 5 из 6 окон полностью вытеснила верную. Цена неверной строки банка ≈ 100% заражение чанков терма. Доктрина «банк обязан приходить верным автономно» (D39.59/67/77) получает цену ошибки числом.
- Маркер ⟨проверить⟩ на транслятор-проводе поведенчески пуст (Δ=0 < 10 п.п. — зарегистрированный дефект). N=6: нижняя граница принятия 61%; нулевую дельту от малой не отличить, от «смягчает вдвое» — уже да.
- Не мерено: редакторский провод (двухсекционный
RenderEditorConstraintBlock); фетч-сторона не трогалась (эмбеддинг-ретривал закрыт D39.69, данные реопен не создают).
§D. Рекомендации тремя корзинами
Индустриальная рамка (веб-обзор, 7 направлений; ключевые: DelTA ICLR'25 · CRAT · DITING/AgentEval'25 · WMT25-Terminology · Kadavath'22/Tian'23 · TBX/MQM/memoQ · Netflix KNP · Bergmanis&Pinnis EACL'21): стандарта автоматического арбитража ТЕРМИНА не существует (MBR/COMET/QE слепы к коротким строкам и сущностям; индустрия людей решает процессом — роли/статусы/трассировка). Наш дизайн впереди ближайшего академического аналога (DelTA: «первый перевод фиксируется» — у нас опровергнуто). Применимое, чего нет: негативный forbidden-слой термбазы · лемма-инъекция/верификация · причинный A/B no/proper/random-глоссарий · эскалация только спорных · вербализованная уверенность строго внутримодельно. Наш замер уверенности совпал с литературой (overconfidence, несравнимость шкал). [аннотация приёмки №13, веб-сверка по первоисточникам: overconfidence ВЕРБАЛИЗОВАННОЙ уверенности — Xiong et al. 2023 (arXiv:2306.13063), не Kadavath'22/Tian'23; Kadavath'22 — base-модели в правильном формате скорее хорошо калиброваны (P(True)); Tian'23 — RLHF ломает калибровку вероятностей, вербализованная ЛУЧШЕ; «несравнимость шкал» — вывод НАШЕГО замера (C3conf +0), литературой прямо не формулируется; DelTA first-wins и WMT25-terminology подтверждены]
Строить сейчас ($0-код + центовые перекупки батчей; механизм — §G):
- Семейный со-батчинг (кластер-канал) — основание: §B4, §F2, 8/45 голда.
- Внутрипрогонная сверка консолидаций — основание: 18/149 на живом банке.
- Наблюдаемость: Signals + «выдумано вне улик» + conf-колонка — основание: §A7, AUC 0.77–0.85.
Измерить прежде чем решать:
4. Рецензент-второе-семейство ТОЛЬКО на спорных кластерах (Q2-слот строки 5 при ре-пробе 74; роутинг
кластерный — E1-урок; выход рецензента — та же draft/⟨проверить⟩-эмиссия, согласие моделей ничего
не утверждает).
5. KWIC-сэмплинг первые-N против стратифицированных ($0.02).
6. Причинный A/B банка no/proper/random на первой edit-волне добора идеала.
7. Редакторский провод двухсекционки ($0.05): если и там Δ≈0 — доктрина «неподписанное С ПОМЕТКОЙ»
защищает меньше, чем записано, и это вопрос владельцу уровня доктрины.
8. Негативный слой (TBX forbidden): $0-счёт рецидивов отвергнутых форм на coldrun-финалах → при
ненулевом потоке дешёвый линт в пост-чеке.
9. Конвенция составных фамилий (Палладий: слитно) как данные пар-промпта — чинит 8/45; это
пар-правило транскрипции (класс Z-B3), не жанровый словарь, D39.47 не задет; подтверждение
владельца спрошено (Вопросы п.2).
Закрыть по нужности (все — числами этой сессии): 10. Равноправный консилиум как прод-механизм (§B3 п.2). 11. Взвешивание кросс-модельной уверенностью (C3conf +0; шкалы несравнимы). 12. Само-согласованность N прогонов (SC−S1=+0; thinking игнорирует temperature — управляемой вариативности нет). 13. Селекция «выбери из вариантов» — потолок 17/45, закрыт классом. 14. Отказ-сигнал ⟦TM-NO-DST⟧ — 0 использований на 3 семействах. 15. Эмбеддинг-фетч — остаётся закрытым (D39.69).
Оси §6 промта: холодный старт — вся эмпирика холодная; «дозревание» тёплого банка (подписанная строка чинит соседей через ⟦TM-CANON⟧) не мерено никем — вход в добор идеала. Вторая пара — кластер- канал обязан прийти данными (не-CJK-детектора нет, строка 35). Серийный шаринг (48а/48б) — не двигается; экспорт сида уже несёт конвенции в следующую книгу — усиливает п.9.
Свободная критика (правило №4): качество банка лежит не в форме арбитража, а в (1) достоверности строк (инъекция исполняется на 95% и заражает на 100%), (2) кластерных решениях (8/45 одной конвенцией), (3) reachability (8/53 термов банк не видит — сид-половина строки 18 трекера и Q7-замер эмиссии стоят выше по рычагу, чем любой консилиум), (4) вкусовом регистре владельца, автономно недостижимом по построению — канал только сид/бриф/шаринг серии. Здесь и далее «строка N» — строки бэклога PROGRESS, не строки кода.
§E. Перенос на ja→ru и en→ru
Пре-регистрация (зафиксирована до запуска, дословно): E-inject — 2 ja-окна + 1 en-окно × 4 арма A/B/C/D, дизайн §C; критерии ТЕ ЖЕ, что §0 п.5 — маркер «пуст», если Δ послушания wrong-строке закон↔⟨проверить⟩ < 10 п.п.; вред реален при ≥50% принятия; перенос подтверждён, если направление ja/en совпадает с zh (рычаг ↑, вред ~100%, маркер ~0). E-family (ja) — семья общего корня РАЗНОЙ длины 魔術/魔術師 намеренно разрезана границей двух батчей терминолог-структурного промпта; критерий: если корневые конвенции dst разошлись через границу — батч-граничная химера НЕ zh-специфична. Оговорки, названные до запуска: ja/en-паков в репо нет ⇒ промпты пробы НЕ engine-faithful (проба феномена, не движка); голда для ja/en нет ⇒ скорится ПОВЕДЕНИЕ, не правильность. Смета ≤$0.04.
Исполнение: multilang_probe.py, книги isekai_majutsushi_jp.txt / fifty_shades_1_en.txt,
deepseek-low; 14 вызовов, факт $0.006472.
| Пара | A | B закон | C wrong-закон | D wrong-⟨проверить⟩ |
|---|---|---|---|---|
| ja верные / wrong принят | 1/3 / 0/2 | 3/3 / 0/2 | 3/3 / 2/2 | 2/3 / 2/2 (Δ=0) |
| en верные / wrong принят | 2/2 / 0/1 | 2/2 / 0/1 | 2/2 / 1/1 | 2/2 / 1/1 (Δ=0) |
Направление §C переносится на обе пары (N крошечный — проверка направления, не величины; единицы
вскрыты: en — «Кому: Кристиан Грэй» с неверной орфографией из инъекции). Family-тест ja (魔術/魔術師
через границу батчей) не состоялся по назначению, но поймал важнее: батч 0 вернул термы упрощённым
китайским (魔術→魔术) — off-language класс на не-родной паре; парослепой экран
ParseReply/OffLanguage эти строки отбил бы — для будущей ja-пары он несущая защита, не гигиена.
§F. Кросс-пары по слову владельца
Пре-регистрация (зафиксирована до запуска, дословно): F1 zh→en — тот же 63-термовый ростер, тот же
терминолог-протокол, target=английский (транскрипция pinyin); метрики: (а) стратегия-близость — по
каждому голд-терму сравнивается КЛАСС решения (смысловой перевод / транслит / гибрид) у en-выхода
против подписанного ru владельца, доля совпадений = «примерная близость банка к тому, что выбрала бы
свежая en-редакция»; (б) сверка с fan-каноном Reverend Insanity ПО ПАМЯТИ автора отчёта — помечается
как справочная (память, не источник), неуверенные строки пропускаются; (в) личная оценка
художественности en-выбора автором — субъективная, так и лейблится. F2 en→zh — Empire of the Dawn (Кристофф, epub на диске; книга 2026 — претрейн-контаминация минимальна); майнинг ~12
рекуррентных термов + 2 окна прозы; терминолог-проход en→zh и перевод окон (deepseek-low и glm-5);
метрики: связность семей термов; личная оценка художественности zh-прозы — субъективная. Критерий
близости F1: ≥70% совпадения классов = «банк владельца НЕ однобокий»; <50% = «банк несёт
сильную ru-специфику» (обе формулировки легитимны — описание, не экзамен). Смета ≤$0.08. Оговорка:
en→zh и zh→en паков в движке нет — проба переносимости ПОДХОДА, не движка.
Исполнение: crosslang_bank.py, 11 вызовов, факт $0.011310. ⚠ Девиация от пре-рега, названная:
вместо «~12 термов майнингом» взято 15 — майнер выдал одни имена, реалии добраны руками по
частотам (семья *-blood — намеренный тест корня); состав в TERMS_F2 скрипта.
F1: банк владельца НЕ однобокий — 41/45 (91%) совпадений класса решения (классификация ручная,
автор; полный джойн — score_f1()). Свежая en-редакция дала «Rank 1..9 · Grade A/B/C/D · Aperture ·
Gu Master · Spring-Autumn Cicada · Mortal» — ровно классы подписей владельца, включая буквенный маппинг
甲→A, который ни один ru-черновик и ни одна ru-модель не дали (довод за канал сид/бриф: конвергентная
редакторская логика, до которой ru-модели не дотягиваются приором). Fan-канон Reverend Insanity по
памяти автора (помечено: память, не источник) ещё ближе к владельцу: 元石 fan «primeval stone» =
«первобытный камень» при свежем «Yuan Stone». 4 расхождения: 白家寨/熊家寨 (en транслит при
собственном «Gu Yue Village» — несвязность 寨-семьи воспроизвелась и в en) · 元石/元海. Ру-специфика
ровно одна: слитность «Гуюэ» (en-канон — «Gu Yue» двумя словами). Оговорка: en-проход видел
ru-варианты как улики смысла (велено «not as English candidates»; на 元石 от ru-улики ушёл).
F2: deepseek — идеальная корневая связность *-blood (冷血者/高血者/苍血者), glm сломал корень
внутри одного батча (冷血者/高血族/苍白血): со-батчинг необходим, но не достаточен. deepseek
выдумал 5 незапрошенных строк — кросс-парное подтверждение нужности экрана want[key] в
ParseReply. glm разошёлся в имени Aaron между соседними окнами (艾伦↔亚伦) — межчанковый дрейф,
от которого банк существует, воспроизведён на en→zh за два вызова; в прозе glm оставил английское
слово («兄弟 forever») и выронил клаузу. Личная оценка прозы (вкус автора, субъективно): оба черновика
«редактируемо-издательские»; deepseek точнее к термам, glm местами идиоматичнее; стилистическая
разница меньше терминологической. Узкое место всех четырёх направлений — термы и конвенции, не слог.
§G. Направления доработки алгоритмов банка (общий уровень; детали — за сессией-исполнителем)
Инварианты не трогаются: эмиссия auto/draft, «терминолог не может утвердить», Select/пост-чек/эскалация.
- Семейный со-батчинг. Детект семей по общей корневой морфеме из ПАР-ДАННЫХ (для имён — общая начальная морфема-фамилия, для реалий — общая головная морфема; асимметрия — тоже данные); без транзитивного замыкания (якорь — сама морфема, специфичный длинный корень бьёт общий короткий); серия сильнее семьи; семья идёт в один батч целиком тем же механизмом, что серии. Пара без данных — канал инертен. Цена: перекупка батчей терминолога один раз (центы), волны/снапшоты не двигаются.
- Внутрипрогонная сверка консолидаций между собой (то же containment+лексемное правило, что у канон-чека) — WARN с именованными парами + колонка стоп-таблицы. $0, вне снапшота.
- Наблюдаемость арбитража: печать сигналов скоринга в стоп-таблицу; флаг «dst выдуман вне
вариантов черновиков»; третье поле «уверенность 0–100» в ответе роли → сортировка листа подписи
«сначала неуверенное» (запрещённая форма зафиксирована: кросс-модельное сравнение и «скор решает»).
Ловушка парсера: числовой хвост надо снимать до склейки полей ответа, иначе он молча въедет в dst.
reasoning_contentв схему не заводить (сайдкар за debug-флагом, вне снапшота). - Кластерный роутинг любого будущего селективного арбитража (рецензент спорных — строка 5): маршрутизация только целыми семья/серия-юнитами (урок E1-химеры).
- Счёт голосов по нормализованной форме при сохранении сырых форм для показа — косметика колонки spread (топ двигается 1/75), делать заодно с п.3.
- Не делать: корзина 3 §D; series-детектор, Merge, семантика KWIC (кроме перфа строки 37 — multi-pattern автомат в репо уже есть), Select, пост-чек — без изменений.
Пункты 1+2+3+5 — один фикс-пак (одна перекупка батчей, голден не движется); п.4 — правило в дизайн замера строки 5.
Вопросы владельцу
→ Закрыты в день приёмки: п.1/3/4 — D39.103; п.2 — D39.104 п.3 (детали — ревью-шапка).
- Мини-голд алиасов (§E-1 research/20, висит с 17.07): полезен кластер-каналу, не гейт. Делать? (метод и объём ~20–30 мин описаны в research/20 §E-1).
- «Гуюэ слитно» — пар-норма Палладия для составных фамилий или вкус книги? Если пар-норма — дата-правка пар-промпта (перекупка батчей, центы); если вкус — канал только сид.
- Проба редакторского провода двухсекционки (~$0.05) — санкция? При Δ≈0 доктрина «неподписанное С ПОМЕТКОЙ» требует пере-обсуждения.
- Корзину «строить сейчас» (§G п.1–3,5) — передавать бэкенду одним фикс-паком класса D39.71?
Критик полноты
- Один голд, одна книга, 45 строк; 古月-кластер коррелирует 8 строк — эффективный N меньше номинала; интервалы точностей ±14 п.п.; кросс-книжная воспроизводимость не проверена.
- P1 — терминолог на до-катоверных весах: сравнение S1↔P1 конфаундится сменой весов (внутри одной эры C3↔SC↔S1 конфаунда нет).
- Вся эмпирика — холодный старт; поведение с непустым ⟦TM-CANON⟧ не мерено.
- Проба C: N=6 неверных строк, один транслятор-провод, один арм-порядок; редакторский провод не мерен.
- §E: ja 2 окна / en 1 окно — направление, не величина; family-тест ja не состоялся (батч 0 негоден).
- §F: классификация стратегий ручная (автор); fan-канон — память модели; en-проход видел ru-улики.
- Словесная шкала уверенности мерена на одной модели; E1-правило «спорный» одно из возможных (вывод о кластерном роутинге от него не зависит).
- Кластерные метрики — 3 семьи + *-blood; регистры обращений и алиас-графы голдом не покрыты.
- Инжект-смета книги — верхняя граница по потолку 800 ток., фактический размер блока не считан.
- Самопроверка ловила и свои дефекты метрик: первая версия A5-замера давала 38 «сдвигов» — ловушка тай-брейка на связках ×1, честная метрика (слитые голоса строго обогнали сырой топ) даёт 1/75.
Адверсариальные проходы (author≠reviewer)
- Раунд 1 (до платных выводов): два независимых агента. Код §A: 7/7 CONFIRMED по file:line. Голд: числа воспроизведены пере-раном байт-в-байт; «промахи несправедливы из-за нормализации» ОПРОВЕРГНУТО (0 несправедливых); джойн чист (пере-джойн точным равенством — тот же сплит 45/8); порядок вариантов BANK-FULL = ранжирование §C2-3 (байт-сверка со стоп-таблицей 150/150).
- Раунд 2 (по готовому отчёту): агент чисел + агент логики/комплаенса. Все точности, парные, AUC/CI, таблица пробы C и деньги — CONFIRMED пере-раном; батч-корреляция химеры подтверждена шире голда. Исправлено по находкам: счёт семьи 4×+4× (было 3×), метрика связности приведена к «заявление=команда», «медиана»→«среднее», честная формулировка критерия 4 (сработал у E1, не у C3), Δ-метрика шкал помечена пост-хок, снята ложная оговорка про grok-ростер (все 7 пассов видели идентичные 63 терма — сверено сырьём), к рецензенту дописана draft/auto-клауза.
- Раунд 3 (ревью диффа финального рерайта, этот файл против v1): независимый агент по антипаттернам приёмки; числа сверены пере-раном — 100% чисты; новые клеймы (в т.ч. «промпт роли уже требует родства») подтверждены первоисточниками; блокер — рерайт сжал зарегистрированные §0/§E/§F — закрыт восстановлением пре-регов дословно (плюс явная пометка девиаций: реализация пробы C — транслятор-провод при зарегистрированном редакторском рендере в скоупе; §F ~12→15 термов); потери фактов (риск состава совета, контрфакт 26/45, D-якоря, рычаг-приоритет, основания B5) возвращены; правки читабельности внесены.
Заявление = команда (приёмка пере-ранит; скрипты — eval/bank_arbitration/, питон eval/.venv/bin/python3)
| Число | Команда |
|---|---|
| 53/45/8, голд | build_gold.py |
| P0 12/45 · P1 18/45 · 27 промахов · 5-в-вариантах | score_baselines.py |
| пассы ds/glm/mis/dsw | consilium_probe.py --passes ds1,ds2,ds3,dsw,glm1,mis1 (+ retry_mis_b4.py после 429 Mistral) |
| grok-пасс | consilium_probe.py --passes gro1 |
| формы, парные, AUC, кластеры, деньги-2-путь | arbitrate.py |
| серии BANK-FULL · spread≥2 50% · соло-точности · C4 | extras_checks.py all |
| проба C | inject_probe.py / --score |
| A4 18/149 · A5 1/75 | value_demo.py |
| §E ja/en | multilang_probe.py / --score |
| §F: прогон / джойн 45 пар | crosslang_bank.py --part all / python -c "from crosslang_bank import score_f1; score_f1()" |
Сырьё: ~/books/gu-zhenren/bank-arbitration/*.json — 84 файла (полные тела, usage, цены, effort в
каждом). Эффорты: deepseek reasoning_effort:"low" во всех вызовах; glm-5 thinking disabled; mistral/
grok вендор-дефолт. Слаги фактчекнуты live /models перед пассами. Провенанс голда — поле provenance
каждой строки gold.jsonl. Полная версия отчёта до финального рерайта — черновик
docs/archive/reports/DRAFT_BANK_ARBITRATION_V1_2026-08-04.md.
Деньги
| Проба | Потолок | Факт |
|---|---|---|
| B: ds1+ds2+ds3+dsw | — | $0.021991 |
| B: glm1 | — | $0.018495 |
| B: mis1 | — | $0.012808 |
| B: gro1 (опция) | — | $0.026546 |
| Итого B | ≤$0.70 | $0.079840 |
| Проба C (инжект) | ≤$0.30 | $0.009713 |
| §E ja/en достройка | — | $0.006472 |
| §F кросс-пары | ≤$0.08 | $0.011310 |
| ВСЕГО | ≤$1.00 (слово владельца 04.08) | $0.107335 |
СТОП-условий не наступало; суб-потолки не тронуты.