textmachine/docs/research/24-bank-arbitration.md

59 KiB
Raw Permalink Blame History

research/24 — Арбитраж банка памяти: консилиум · уверенность · инжект/фетч · кросс-пары

РЕВЬЮ-ШАПКА ПРИЁМКИ (оркестратор №13, 04.08.2026). Статус: ПРИНЯТ, залендено этим коммитом (D39.102). Метод — адверсариальная приёмка тремя контурами. (1) Пере-раны: 12-агентный воркфлоу пере-ранил ВСЕ строки таблицы «заявление = команда» ($0, офлайн по сырью) — 8/8 CONFIRMED, ни одного расхождения чисел (голд 53/45/8/34 · базисы 12/18/27/5 · формы S1/SC/C3/C3conf/E1/C4 · AUC с CI · химеры B4 по сырью батчей · инжект-таблица · 18/149 · 1/75 · §E/§F по сырью); все 23 адреса §A подтверждены по HEAD 7f6270a (3 уточнения координат: сброс sticky живёт в wave.go:84-86; фикстура A8 — дистилл testdata/bankfull-surfaces.txt; механизм series до ~:76); байт-сверка инжект-пробы с движком: заголовок/маркер/«src → dst»/второй system байт-идентичны (gender-нота не моделируется — для безгендерного глоссария рендер совпадает). (2) Харнесс и деньги: независимый пересчёт из сырья $0.107334 против записанных $0.107335 (округление на записи); цены = models.yaml; 84/84 finish=stop; слаг-дрейфа нет; голд 53/53 против сида, пере-сборка детерминистична байт-в-байт. (3) Слепое ревью кода банка (author≠reviewer, без чтения этого отчёта) + 12 опровергателей: находки СВЕРХ §A заведены строками 128132 (главные: банкнота-парсер теряет хвост многословного dst против клейма A10 «дефектов нет»; emitRankCap×writeAutoBank молча стирает термы из авто-банка; кап инъекции не считает маркер/гендер-ноты). Оговорки приёмки (выводов не двигают): (а) в скоринге армов C/D — regex-конфаунд: голд-rx 真元 матчится внутри верного перевода 元海 ⇒ «верные строки» C/D завышены до 2 ячеек; выводы «wrong принят 6/6 · Δ=0 · вытеснение 5/6» стоят на другой метрике и не задеты; (б) C4=20/45 хрупок — 2-2-тай в 7/45 термов решается порядком голосов; вывод «совет закрыть» стоит на C3SC=+3 (один кластер) и glm-соло 25>23, не на C4; (в) фоллбек C3 несимметричен (сработал 5/45, эффект мал); SC при temp=0 меряет недетерминизм провайдера, не сэмплинг; (г) иллюстративные пары A4 склеены не как печатает скрипт (см. аннотацию в §A4); (д) «точность 4456%» — числовые пассы; словесный dsw = 40.0%; (е) 18 оплаченных доп-поверхностей ростера кодом почти не скорятся — выводы по ним ручные по сырью; (ж) атрибуция литературы уверенности поправлена аннотацией в §D (Xiong et al. 2023, не Kadavath/Tian); DelTA first-wins и WMT25 подтверждены первоисточниками; (з) «потолок $1.00 — слово владельца 04.08» — со слов сессии (ратифицированный потолок $1.20, D39.90 п.5); при факте $0.107 беспредметно; арифметика ПИНГА в PROGRESS («+$0.0161») — склейка инкрементов C+E, леджер отчёта чист. → Тот же день (04.08): все 4 вопроса владельцу ЗАКРЫТЫ. (1) мини-голд алиасов — отложен до первого длинного прогона (D39.103); (2) «Гуюэ» — не чинить, канал сида (D39.104 п.3); (3) проба редакторского провода санкционирована — промт выдан, отчёт будет ../experiments/18-editor-wire-probe.md (D39.103); (4) фикс-пак §G санкционирован строкой 128 — промт выдан (D39.103). Поверх §C ратифицирована доктрина инжекта D39.104 (закон на проводе для всех ролей; маркер снимается — строка 134).

Ресёрч+полигон сессия, 04.08.2026. Исполнение docs/archive/prompts/BANK_ARBITRATION_RESEARCH_SESSION_PROMPT.md (заархивирован D39.101) (D39.89; пере-запуск — артефактов захода 02.08 в дереве не было, D39.90 п.5; подрезка учтена: B2 свёрнута в под-пробу B3, C сокращена). Плюс прямой вопрос владельца 04.08: общий взгляд на алгоритм банка — хватает ли текущего, не пропущен ли индустриальный стандарт (ответ — §D); и достройки того же дня: мультиязычность (§E), кросс-пары и художественность (§F), дизайн-направления (§G). Потолок владельца 04.08 $1.00, факт $0.107335. Зона записи: этот файл + eval/bank_arbitration/ + секция «Полигон» PROGRESS; сырьё durable ~/books/gu-zhenren/bank-arbitration/ (84 json). Пробы — своим харнессом против API (в backend/ незакоммиченный пак чужой сессии); coldrun-a — только чтение; базлайн качества банка = coldrun-a (D39.86). Не закоммичено — лендит оркестратор. Кода бэкенда не правлено.


§0. ПРЕ-РЕГИСТРАЦИЯ ПРОБ (записано ДО первого платного вызова; норма D39.46)

Дата/время фиксации: 2026-08-04, до каких-либо платных вызовов этой сессии. Голд (§B1) собран ДО пре-регистрации ($0), его числа: 53 approved сида → 45 в BANK-FULL coldrun-a, из них 34 со spread≥2.

Пассы (все — полный голд-набор одним батч-протоколом, engine-faithful RenderBatch):

Пасс Модель Режим Что несёт
ds1..ds3 deepseek-v4-flash reasoning_effort:"low", temp 0 S1 (свежий одиночный) + SC (само-согласованность N=3) + числовая уверенность 0100
dsw deepseek-v4-flash то же словесная шкала уверенности (точно/скорее да/не уверен/не знаю)
glm1 glm-5 thinking disabled (форма движка) второе семейство + числовая уверенность
mis1 mistral-large-2512 без reasoning третье семейство + числовая уверенность
gro1 (опция при остатке бюджета) grok-4.3 дефолт (low) четвёртое семейство, чувствительность состава совета

Эффорты каждого пасса печатаются в отчёте (иначе числа несравнимы — §7 промта).

Формы арбитража (агрегация офлайн, $0):

  • P0 — бесплатный базис §C2-3: топ-вариант ранжирования движка (колонка вариантов BANK-FULL, bankStopRows рендерит best-ranked first). Термы без вариантов → P0 пуст (честный отказ базиса).
  • P1 — прод-референс: сведённый dst coldrun-a (терминолог на до-катоверных весах).
  • S1 = ds1. SC = большинство(ds1,ds2,ds3), при 3-стороннем расхождении → ds1.
  • C3 — равноправный совет: большинство(ds1, glm1, mis1) по нормализованному совпадению; полное расхождение → P0-топ, если хоть один голос совпал с ним, иначе ds1.
  • C3conf — взвешенный: argmax по сумме заявленных уверенностей проголосовавших за вариант моделей.
  • E1 — улики-первым: P0 стоит; «спорный» терм := (spread≥2 И разрыв top1top2 по чанкам ≤1) ИЛИ singleton-улика (top1 предложен 1 чанком) → на спорных решает C3. Цена печатается долей от полного совета.

Метрики:

  • Точность против голда: нормализованное точное совпадение (casefold · ё→е · схлоп пробелов · срез «»/кавычек). Промахи вскрываются глазами; спорные эквивалентности печатаются отдельно, автоматом НЕ засчитываются.
  • Парные сравнения форм: счёт термов «A прав ∧ B неправ» против обратного (не голые проценты).
  • Кластерная связность: семьи 古月-* (7 поверхностей, РАЗНОЙ длины — DetectSeries её не видит), 蛊-* (蛊师/蛊虫/月光蛊 + голова 蛊 вне банка), серии 等/转 (равнодлинные — детектируются). Метрика: консистентность конвенции внутри семьи у каждой формы (одна голова/конвенция у всех членов — да/нет), и отдельно: даёт ли по-терминный агрегатор химеру там, где одиночная модель консистентна.
  • B2-под-проба (уверенность): AUC(уверенность → верно/неверно по голду) per-model (bootstrap 90% CI); устойчивость: медиана |Δconf| ds1↔ds2↔ds3 и доля флипов ответа; сравнимость шкал: |Δ средних conf| между моделями на одном наборе; канал отказа: счёт ⟦TM-NO-DST⟧ и его стабильность между ds1..ds3.

Критерии (успех/провал, зафиксированы ДО запуска):

  1. БАР (в): форма «бьёт базис P0», если парное преимущество (термы A-прав-P0-неправ минус обратные) ≥ +5 на 45 голд-термах. Меньше — «не бьёт» (на N=45 меньшее неотличимо от шума).
  2. Q2 (окупаются ли семейства): C3 против SC парное преимущество ≥ +3; меньше ⇒ «разные семейства не окупаются, хватает N прогонов одной модели» (легитимный исход).
  3. Уверенность разделяет, если AUC ≥ 0.70 и нижняя граница CI > 0.5 минимум у 2 моделей из 3; иначе — «уверенность как арбитр закрыта по нужности». Числа против слов: |ΔAUC| ≥ 0.05 решает форму. Шкалы несравнимы, если |Δ средних conf| > 20 п. ⇒ сырой кросс-модельный скор как решающее правило запрещён.
  4. Кластеры: ≥1 новая химера у C3 там, где SC/P1 консистентны ⇒ возражение §4 промта подтверждено (единица арбитража обязана быть кластером).
  5. Проба C (инжект, формат RenderGlossaryBlock/RenderEditorConstraintBlock байт-близко): 6 чанков × 4 арма (без инъекции · верный закон · НЕВЕРНАЯ строка законом · та же неверная строка с маркером ⟨проверить⟩), deepseek-v4-flash low, temp 0. Критерии: маркер «читается мягче закона», если послушание(закон-неверный) послушание(⟨проверить⟩-неверный) ≥ 20 п.п.; «пометка = закон» (дефект), если < 10 п.п. Вред реален, если неверная строка законом принимается в ≥ 50% случаев. Между 10 и 20 п.п. — «неразделимо на N=6×набор строк», честно печатается.

Смета до запуска ≈$0.18 (B ≈$0.13 + C ≈$0.05); СТОП-условия: суб-потолки B $0.70 / C $0.30.

(Эта пре-регистрация после запуска не правится. §E и §F пре-регистрированы отдельно в своих секциях, тоже до своих запусков. Фактическая реализация пробы C: инъекция вторым system-сообщением — MessagesWithInjection, транслятор-провод; редакторский рендер RenderEditorConstraintBlock, названный в зарегистрированном скоупе, в пробу НЕ вошёл — невымеренность редакторского провода честно стоит в §C и критике полноты.)


§A. Критика алгоритма в коде ($0; диагноз, не правка; адреса сверены в HEAD)

Маршрут: miner/banknote.goterminology.go (Merge/AttachKWIC/ScoreVariants) → series.goclassify.goterminologist.gomembank/memory.gomempostcheck.go. Классы: сломано / хрупко / дорого / слепо.

Вердикт-тройки §0-п.1 промта (посылка/нужность/форма) свёрнуты в прозу каждого пункта: посылка — проверка адреса в HEAD, нужность — замер, форма — выбранная против названной альтернативы.

A1. Единица решения — строка; связность семей термов не защищена — «слепо». ScoreVariants ранжирует варианты одного кандидата (terminology.go:393-450); межстрочный фактор neighbourAgrees требует подписанной строки (:465-482) — на автономном банке мёртв (D39.65: 2/23). DetectSeries ловит только равнодлинные наборы с общей головой (series.go:30,46-66); семьи общего корня разной длины не ловит ничем: в BANK-FULL их две крупных — 古月×15 и 蛊×14 поверхностей. Ключ-сортировка Merge (terminology.go:212) даёт префиксным семьям (古月*) смежность случайно, а суффиксные (X蛊 — голово-финальная морфология CJK) рассеиваются по батчам. Цена по голду: конвенция 古月 = 8 из 45 строк одним решением (§B2). Существенно: промпт роли УЖЕ требует родства («Сохраняй родство однокоренных терминов», prompts/zh-ru/terminologist.md) — дефект структурный (семья режется границей батча/вызова), инструкцией не лечится. Форма лечения — семейный со-батч (§G1); альтернатива «второй проход ре-чтения» дороже и рассеяние по батчам не чинит.

A2. Потолок арбитража-как-селекции: 17/45. У 22 из 27 промахов прод-консолидации верного dst НЕТ в вариантах черновиков (§B2) ⇒ любой «выбор из предложенного» ограничен 12+5=17/45 по построению. Гейт на класс дизайнов до всякой калибровки.

A3. Related: обрезка на первые 4 по алфавиту (terminology.go:242-256) — выбор лексикографический, не по релевантности. «Хрупко», минор; форма — cap по числу общих рун (механика веса уже есть в CanonFor); закрывается вместе с A1.

A4. Внутрипрогонные противоречия консолидаций не проверяет никто — «слепо», $0-фикс. CanonConflicts сверяет только с подписанным банком (terminologist.go:335; канон читается один раз до батчей, :284); пары свежих консолидаций (蛊师 ⊂ 一转蛊师) не сверяются, хотя механика containment+lexemeSubset уже написана (terminology.go:787-812). На автономном прогоне подписей ноль и рубеж пуст. Форма — тот же детерминированный проход по консолидациям ($0); альтернатива «платный проход само-ревью» не детерминирована и дороже. Замер на живом банке (value_demo.py): 18 невидимых противоречий на 149 финалов (12%) — 空窍→«кунцяо» при 开窍→«открытие точки», 元海空窍→«полость Юаньхая» при 元海→«Юаньхай» и т.д. [аннотация приёмки №13: пары — иллюстрация класса; фактический вывод value_demo.py флагует 空窍→«кунцяо» и 开窍→«открытие точки» каждый против 窍→«апертура», а пара 元海空窍↔元海 containment-алгоритмом непорождаема (лексемный матч считает вложение унаследованным); числа 18/149 и 1/75 точны пере-раном]

A5. foldVariants фолдит только байт-идентичные dst (terminology.go:222-237): регистровые микроварианты дробят счёт («лунный гу ×2» + «Лунный гу ×1»), spread завышен для владельца. Замер: частотный топ реально двигается лишь у 1/75 строк — косметика колонки spread, не качество выбора.

A6. KWIC: первые N вхождений в порядке глав (terminology.go:308-329) — сэмплинг смещён к началу книги; ось «первые-N против стратифицированных» не мерена (D39.50 мерил размер сетки, не стратегию). Плюс перф (строка 37 трекера): квадратичность + пересчёт рун префикса на вхождение (:332-346); multi-pattern автомат уже есть в membank/memory.go:872-918.

A7. Наблюдаемость: «почему у терма такой dst» неответимо — «слепо», гейтит любой будущий арбитраж. Variant.Signals вычисляется и выбрасывается (в стоп-таблицу идут только «dst ×N», mining.go:256-270); reasoning_content не персистится нигде (grep llm/store: только док-коммент capability.go:63); сочинённый вне улик dst (1015/75 по D39.65) не флагуется, хотя предикат «dst ∉ вариантов» — $0.

A8. Эмиссия: 8 из 53 подписанных термов вообще не в банке (蛊 · 修炼 · 修行 · 资质 · 长生 · 江牙 · 月影蛊 · 血颅蛊) — известные дыры (строка 18, recall term=0.040), переквантифицированы голдом: лучший арбитр бессилен без строки.

A9. Инжект-сторона. Бюджет режется префикс-катом (memory.go:615-628): первая переполнившая строка обрезает всё после, включая влезающие — минор. Sticky=2 со сбросом на границе главы (memory.go:112) — осознанно; местоименная сцена глубже двух чанков теряет канон, как дефект не измерено. Замера «⟨проверить⟩ мягче закона» не существовало — закрыт пробой C (§C). Пост-чек — честный флаггер, дефектов сверх записанного нет.

A10. Банкнота — форма верная (агрегация всех прогонов с голосами по чанкам, banknote.go:470-505); дефектов сверх записанного нет.


§B. Арбитраж: голд · базисы · формы · уверенность · кластеры · цена книги

B1. Голд ($0, build_gold.pygold/gold.jsonl, провенанс на строке)

Сид v2 53 approved → джойн по нормализованной поверхности+алиасам с BANK-FULL coldrun-a (150): 45 в банке, 34 со spread≥2, 8 не в банке (список в A8). Смещение: сид сдвинут к важным/спорным термам; часть подписей могла формулироваться при виде машинных вариантов; одна книга одной пары; ~четверть строк — вкусовой регистр владельца, автономно недостижимый по построению (D39.47). Мини-голд алиасов §E-1 research/20 не входит (вопрос владельцу).

B2. Бесплатные базисы ($0, score_baselines.py)

Базис Точность Парно
P0 (топ §C2-3) 12/45
P1 (терминолог coldrun-a, старые веса) 18/45 +7/1 к P0

Анатомия 27 промахов P1 (все единицы вскрыты): 8 = одна конвенция 古月 («Гу Юэ» против подписанного «Гуюэ» слитно — правило Палладия для составной фамилии, лежит в note сида) · 4 = серия 等 («класс Цзя»/«ранг И» против «класс А/Б/В/Г»; подписанного ответа нет ни в одном черновом варианте) · остальное — класс «слишком китаизированно» (空窍→кунцяо · 元海→Юаньхай · 元石→юаньши · …). Только у 5 из 27 промахов верный dst лежал в вариантах ⇒ потолок селекции 17/45 (A2). Нормализация промахов честная: несправедливых 0 (регистр/ё/кавычки фолдятся; ось пробела несёт подпись владельца в обе стороны — «Гуюэ» слитно, но «Жэнь Цзу» раздельно; фолдить её нельзя). Контрфакт: объяви владелец ось пробела неканоничной — P1 поднялся бы до 26/45; сид фиксирует обратное.

B3. Формы против базиса (платные пассы; 35 вызовов, все finish=stop, 63/63 строк в каждом;

ростер 63 = 45 голд-в-банке + 18 до-строек членов семей/серий для кластерных метрик)

Форма Точность К P0 Примечание
P0 12/45 ни одного терма «P0 прав, свежая форма неправа»
P1 18/45 +7/1 конфаунд эры весов при сравнении со свежими
S1 ds-соло (low) 20/45 +8/0
SC 3× та же модель 20/45 +8/0 к S1: +0/0
C3 совет 3 семейств 23/45 +11/0 к SC: +3/0 — все 3 добычи = один кластер 古月
C3conf взвешенный 23/45 +11/0 к C3: +0/0
E1 улики-первым 22/45 +10/0 к C3: 1; создал химеру (§B4)
glm-5 соло 25/45 лучший одиночка > лучший совет
mistral соло 23/45
grok-4.3 соло 12/45 уровень бесплатного базиса
C4 совет 4 семейств 20/45 слабый член уронил совет 23→20

Риск совета — не химера, а систематически неверная конвенция при согласии слабых членов (в C4 grok + deepseek-батч-2 давали «Гу Юэ»-большинство на части строк семьи).

Вердикты по критериям §0:

  1. БАР пройден — свежей генеративной консолидацией (уже S1 +8/0), не консилиумом как таковым; это пере-подтверждение D39.65 «роль — эффективный консолидатор», теперь с голдом и знаком КАЧЕСТВА, которого у D39.65 не было.
  2. Q2: формально +3 = порог, содержательно семейства не окупаются — все три добычи C3 против SC суть одна конвенция 古月 (коррелированный кластер из 8 строк, эффективный N≈1); лучший одиночка (glm 25/45) выше лучшего совета; C4 хуже C3; C3conf ≡ C3. Прод-механизм «равноправный совет» — закрыть (§D).
  3. Числовая уверенность разделяет внутри модели: AUC ds 0.770 (CI90 0.6560.879) · glm 0.851 (0.7420.947) · mistral 0.825 (0.7190.915); словесная шкала хуже: 0.630 (0.5560.704). Повтор ds1..ds3: медиана размаха conf 10 п., флипов ответа 9/45. Все модели overconfident (средняя conf 87.790.1 при точности 4456%) — шкала работает как РАНГ внутри модели, не как вероятность и не кросс-модельно (пре-рег-метрика Δ-средних этот случай не ловит — уточнение пост-хок; делом подтверждено формой C3conf: +0). Форма жизни — ordinal-очередь ревью, не арбитр.
  4. Канал отказа: ⟦TM-NO-DST⟧ = 0 на всех 7 пассах четырёх семейств (6 печатает arbitrate.py, gro1 сверен по сырью). Подтверждает «роль всегда отвечает строкой»; субстрат — банк-строки голда, не хвост эмиссии, где D39.50 мерил размах.

B4. Кластерная связность (arbitrate.py)

Семья P1 S1 C3 E1
古月 (8, разнодлинная — вне DetectSeries) конс. «Гу Юэ» (против подписи) ХИМЕРА 4׫Гу Юэ»+4׫Гуюэ» конс. «Гуюэ» = подпись конс.
转 (равнодлинная, со-батчена) конс. «ранг» конс. конс. ХИМЕРА «оборот»+«ранг»
等 (равнодлинная, со-батчена) ХИМЕРА «класс»/«ранг» (дефект D39.65) конс. «уровень» (мимо голда) конс. конс.
  • Химера S1-古月 коррелирует с границей батча идеально и шире голда (сырьё: ds1-b0 — все 6 членов слитно, ds1-b2 — все 7 раздельно): дефект класса D39.65 воспроизведён на семье, которую серия-детектор не со-батчит.
  • E1 создал химеру там, где все голосующие консистентны (неспорному 一转 достался P0-топ «оборот», спорным — советский «ранг»). Зарегистрированный критерий 4 у C3 не сработал (C3 химер не создал, одну починил); химеру дала по-терминная МАРШРУТИЗАЦИЯ — тот же класс дефекта. Вывод: любой роутинг (какому арбитру отдать строку) обязан быть кластерным.

B5. Цена в терминах книги (63-термовый ростер, 5 батчей)

Допущение о словаре, названо: 1000 глав ≈ 10003000 РАЗЛИЧНЫХ строк банка (насыщение по Хипсу; стенд: 10 глав → 150 эмитированных при cap 200; альфавит кандидатов книги 13 246, эмиссия капится). Пассы: ds-low ≈ $0.0063 (среднее трёх) · glm-5 $0.0185 · mistral $0.0128 · grok $0.0265; пер-терм ≈ $0.0001 / $0.0003 / $0.0002 / $0.0004. На 2000 строк: терминолог-соло $0.200.60/книга; совет 3 семейств $1.23.6; рецензент спорных (50% строк банка по spread≥2) $0.51.5. Инжект-ось: ≤800 ток/чанк × ~4600 чанк-вызовов двух волн = верхняя граница $0.52 инпута. Гипотеза «оси расходятся на порядки» держится наполовину: оси разные (арбитраж насыщается, инжект рекуррентен), но на flash-ценах соизмеримы; расточительность в арбитраже дёшева — однако покупать расточительно нечего (совет не приносит).


§C. Инжект: послушание и вред (проба C; 24 вызова, все stop; inject_probe.py --score)

6 окон источника × 4 арма, deepseek-flash-low, формат байт-близко к движку (второе system-сообщение).

Арм Верные строки в выходе Неверная строка принята
A без инъекции 9/21 (43%) 0/6
B верный закон 20/21 (95%) 0/6
C неверная строка законом 20/21 6/6
D та же с ⟨проверить⟩ 21/21 6/6 (Δ=0 п.п.)
  • Инъекция — мощный рычаг: 43%→95% следования канону (продуктовая метрика, которой recall 0.918 не был).
  • Вред тотален: неверная строка принимается 6/6; в 5 из 6 окон полностью вытеснила верную. Цена неверной строки банка ≈ 100% заражение чанков терма. Доктрина «банк обязан приходить верным автономно» (D39.59/67/77) получает цену ошибки числом.
  • Маркер ⟨проверить⟩ на транслятор-проводе поведенчески пуст (Δ=0 < 10 п.п. — зарегистрированный дефект). N=6: нижняя граница принятия 61%; нулевую дельту от малой не отличить, от «смягчает вдвое» — уже да.
  • Не мерено: редакторский провод (двухсекционный RenderEditorConstraintBlock); фетч-сторона не трогалась (эмбеддинг-ретривал закрыт D39.69, данные реопен не создают).

§D. Рекомендации тремя корзинами

Индустриальная рамка (веб-обзор, 7 направлений; ключевые: DelTA ICLR'25 · CRAT · DITING/AgentEval'25 · WMT25-Terminology · Kadavath'22/Tian'23 · TBX/MQM/memoQ · Netflix KNP · Bergmanis&Pinnis EACL'21): стандарта автоматического арбитража ТЕРМИНА не существует (MBR/COMET/QE слепы к коротким строкам и сущностям; индустрия людей решает процессом — роли/статусы/трассировка). Наш дизайн впереди ближайшего академического аналога (DelTA: «первый перевод фиксируется» — у нас опровергнуто). Применимое, чего нет: негативный forbidden-слой термбазы · лемма-инъекция/верификация · причинный A/B no/proper/random-глоссарий · эскалация только спорных · вербализованная уверенность строго внутримодельно. Наш замер уверенности совпал с литературой (overconfidence, несравнимость шкал). [аннотация приёмки №13, веб-сверка по первоисточникам: overconfidence ВЕРБАЛИЗОВАННОЙ уверенности — Xiong et al. 2023 (arXiv:2306.13063), не Kadavath'22/Tian'23; Kadavath'22 — base-модели в правильном формате скорее хорошо калиброваны (P(True)); Tian'23 — RLHF ломает калибровку вероятностей, вербализованная ЛУЧШЕ; «несравнимость шкал» — вывод НАШЕГО замера (C3conf +0), литературой прямо не формулируется; DelTA first-wins и WMT25-terminology подтверждены]

Строить сейчас ($0-код + центовые перекупки батчей; механизм — §G):

  1. Семейный со-батчинг (кластер-канал) — основание: §B4, §F2, 8/45 голда.
  2. Внутрипрогонная сверка консолидаций — основание: 18/149 на живом банке.
  3. Наблюдаемость: Signals + «выдумано вне улик» + conf-колонка — основание: §A7, AUC 0.770.85.

Измерить прежде чем решать: 4. Рецензент-второе-семейство ТОЛЬКО на спорных кластерах (Q2-слот строки 5 при ре-пробе 74; роутинг кластерный — E1-урок; выход рецензента — та же draft/⟨проверить⟩-эмиссия, согласие моделей ничего не утверждает). 5. KWIC-сэмплинг первые-N против стратифицированных ($0.02). 6. Причинный A/B банка no/proper/random на первой edit-волне добора идеала. 7. Редакторский провод двухсекционки ($0.05): если и там Δ≈0 — доктрина «неподписанное С ПОМЕТКОЙ» защищает меньше, чем записано, и это вопрос владельцу уровня доктрины. 8. Негативный слой (TBX forbidden): $0-счёт рецидивов отвергнутых форм на coldrun-финалах → при ненулевом потоке дешёвый линт в пост-чеке. 9. Конвенция составных фамилий (Палладий: слитно) как данные пар-промпта — чинит 8/45; это пар-правило транскрипции (класс Z-B3), не жанровый словарь, D39.47 не задет; подтверждение владельца спрошено (Вопросы п.2).

Закрыть по нужности (все — числами этой сессии): 10. Равноправный консилиум как прод-механизм (§B3 п.2). 11. Взвешивание кросс-модельной уверенностью (C3conf +0; шкалы несравнимы). 12. Само-согласованность N прогонов (SCS1=+0; thinking игнорирует temperature — управляемой вариативности нет). 13. Селекция «выбери из вариантов» — потолок 17/45, закрыт классом. 14. Отказ-сигнал ⟦TM-NO-DST⟧ — 0 использований на 3 семействах. 15. Эмбеддинг-фетч — остаётся закрытым (D39.69).

Оси §6 промта: холодный старт — вся эмпирика холодная; «дозревание» тёплого банка (подписанная строка чинит соседей через ⟦TM-CANON⟧) не мерено никем — вход в добор идеала. Вторая пара — кластер- канал обязан прийти данными (не-CJK-детектора нет, строка 35). Серийный шаринг (48а/48б) — не двигается; экспорт сида уже несёт конвенции в следующую книгу — усиливает п.9.

Свободная критика (правило №4): качество банка лежит не в форме арбитража, а в (1) достоверности строк (инъекция исполняется на 95% и заражает на 100%), (2) кластерных решениях (8/45 одной конвенцией), (3) reachability (8/53 термов банк не видит — сид-половина строки 18 трекера и Q7-замер эмиссии стоят выше по рычагу, чем любой консилиум), (4) вкусовом регистре владельца, автономно недостижимом по построению — канал только сид/бриф/шаринг серии. Здесь и далее «строка N» — строки бэклога PROGRESS, не строки кода.


§E. Перенос на ja→ru и en→ru

Пре-регистрация (зафиксирована до запуска, дословно): E-inject — 2 ja-окна + 1 en-окно × 4 арма A/B/C/D, дизайн §C; критерии ТЕ ЖЕ, что §0 п.5 — маркер «пуст», если Δ послушания wrong-строке закон↔⟨проверить⟩ < 10 п.п.; вред реален при ≥50% принятия; перенос подтверждён, если направление ja/en совпадает с zh (рычаг ↑, вред ~100%, маркер ~0). E-family (ja) — семья общего корня РАЗНОЙ длины 魔術/魔術師 намеренно разрезана границей двух батчей терминолог-структурного промпта; критерий: если корневые конвенции dst разошлись через границу — батч-граничная химера НЕ zh-специфична. Оговорки, названные до запуска: ja/en-паков в репо нет ⇒ промпты пробы НЕ engine-faithful (проба феномена, не движка); голда для ja/en нет ⇒ скорится ПОВЕДЕНИЕ, не правильность. Смета ≤$0.04.

Исполнение: multilang_probe.py, книги isekai_majutsushi_jp.txt / fifty_shades_1_en.txt, deepseek-low; 14 вызовов, факт $0.006472.

Пара A B закон C wrong-закон D wrong-⟨проверить⟩
ja верные / wrong принят 1/3 / 0/2 3/3 / 0/2 3/3 / 2/2 2/3 / 2/2 (Δ=0)
en верные / wrong принят 2/2 / 0/1 2/2 / 0/1 2/2 / 1/1 2/2 / 1/1 (Δ=0)

Направление §C переносится на обе пары (N крошечный — проверка направления, не величины; единицы вскрыты: en — «Кому: Кристиан Грэй» с неверной орфографией из инъекции). Family-тест ja (魔術/魔術師 через границу батчей) не состоялся по назначению, но поймал важнее: батч 0 вернул термы упрощённым китайским (魔術→魔术) — off-language класс на не-родной паре; парослепой экран ParseReply/OffLanguage эти строки отбил бы — для будущей ja-пары он несущая защита, не гигиена.

§F. Кросс-пары по слову владельца

Пре-регистрация (зафиксирована до запуска, дословно): F1 zh→en — тот же 63-термовый ростер, тот же терминолог-протокол, target=английский (транскрипция pinyin); метрики: (а) стратегия-близость — по каждому голд-терму сравнивается КЛАСС решения (смысловой перевод / транслит / гибрид) у en-выхода против подписанного ru владельца, доля совпадений = «примерная близость банка к тому, что выбрала бы свежая en-редакция»; (б) сверка с fan-каноном Reverend Insanity ПО ПАМЯТИ автора отчёта — помечается как справочная (память, не источник), неуверенные строки пропускаются; (в) личная оценка художественности en-выбора автором — субъективная, так и лейблится. F2 en→zhEmpire of the Dawn (Кристофф, epub на диске; книга 2026 — претрейн-контаминация минимальна); майнинг ~12 рекуррентных термов + 2 окна прозы; терминолог-проход en→zh и перевод окон (deepseek-low и glm-5); метрики: связность семей термов; личная оценка художественности zh-прозы — субъективная. Критерий близости F1: ≥70% совпадения классов = «банк владельца НЕ однобокий»; <50% = «банк несёт сильную ru-специфику» (обе формулировки легитимны — описание, не экзамен). Смета ≤$0.08. Оговорка: en→zh и zh→en паков в движке нет — проба переносимости ПОДХОДА, не движка.

Исполнение: crosslang_bank.py, 11 вызовов, факт $0.011310. ⚠ Девиация от пре-рега, названная: вместо «~12 термов майнингом» взято 15 — майнер выдал одни имена, реалии добраны руками по частотам (семья *-blood — намеренный тест корня); состав в TERMS_F2 скрипта.

F1: банк владельца НЕ однобокий — 41/45 (91%) совпадений класса решения (классификация ручная, автор; полный джойн — score_f1()). Свежая en-редакция дала «Rank 1..9 · Grade A/B/C/D · Aperture · Gu Master · Spring-Autumn Cicada · Mortal» — ровно классы подписей владельца, включая буквенный маппинг 甲→A, который ни один ru-черновик и ни одна ru-модель не дали (довод за канал сид/бриф: конвергентная редакторская логика, до которой ru-модели не дотягиваются приором). Fan-канон Reverend Insanity по памяти автора (помечено: память, не источник) ещё ближе к владельцу: 元石 fan «primeval stone» = «первобытный камень» при свежем «Yuan Stone». 4 расхождения: 白家寨/熊家寨 (en транслит при собственном «Gu Yue Village» — несвязность 寨-семьи воспроизвелась и в en) · 元石/元海. Ру-специфика ровно одна: слитность «Гуюэ» (en-канон — «Gu Yue» двумя словами). Оговорка: en-проход видел ru-варианты как улики смысла (велено «not as English candidates»; на 元石 от ru-улики ушёл).

F2: deepseek — идеальная корневая связность *-blood (冷血者/高血者/苍血者), glm сломал корень внутри одного батча (冷血者/高血族/苍白血): со-батчинг необходим, но не достаточен. deepseek выдумал 5 незапрошенных строк — кросс-парное подтверждение нужности экрана want[key] в ParseReply. glm разошёлся в имени Aaron между соседними окнами (艾伦↔亚伦) — межчанковый дрейф, от которого банк существует, воспроизведён на en→zh за два вызова; в прозе glm оставил английское слово («兄弟 forever») и выронил клаузу. Личная оценка прозы (вкус автора, субъективно): оба черновика «редактируемо-издательские»; deepseek точнее к термам, glm местами идиоматичнее; стилистическая разница меньше терминологической. Узкое место всех четырёх направлений — термы и конвенции, не слог.

§G. Направления доработки алгоритмов банка (общий уровень; детали — за сессией-исполнителем)

Инварианты не трогаются: эмиссия auto/draft, «терминолог не может утвердить», Select/пост-чек/эскалация.

  1. Семейный со-батчинг. Детект семей по общей корневой морфеме из ПАР-ДАННЫХ (для имён — общая начальная морфема-фамилия, для реалий — общая головная морфема; асимметрия — тоже данные); без транзитивного замыкания (якорь — сама морфема, специфичный длинный корень бьёт общий короткий); серия сильнее семьи; семья идёт в один батч целиком тем же механизмом, что серии. Пара без данных — канал инертен. Цена: перекупка батчей терминолога один раз (центы), волны/снапшоты не двигаются.
  2. Внутрипрогонная сверка консолидаций между собой (то же containment+лексемное правило, что у канон-чека) — WARN с именованными парами + колонка стоп-таблицы. $0, вне снапшота.
  3. Наблюдаемость арбитража: печать сигналов скоринга в стоп-таблицу; флаг «dst выдуман вне вариантов черновиков»; третье поле «уверенность 0100» в ответе роли → сортировка листа подписи «сначала неуверенное» (запрещённая форма зафиксирована: кросс-модельное сравнение и «скор решает»). Ловушка парсера: числовой хвост надо снимать до склейки полей ответа, иначе он молча въедет в dst. reasoning_content в схему не заводить (сайдкар за debug-флагом, вне снапшота).
  4. Кластерный роутинг любого будущего селективного арбитража (рецензент спорных — строка 5): маршрутизация только целыми семья/серия-юнитами (урок E1-химеры).
  5. Счёт голосов по нормализованной форме при сохранении сырых форм для показа — косметика колонки spread (топ двигается 1/75), делать заодно с п.3.
  6. Не делать: корзина 3 §D; series-детектор, Merge, семантика KWIC (кроме перфа строки 37 — multi-pattern автомат в репо уже есть), Select, пост-чек — без изменений.

Пункты 1+2+3+5 — один фикс-пак (одна перекупка батчей, голден не движется); п.4 — правило в дизайн замера строки 5.


Вопросы владельцу

→ Закрыты в день приёмки: п.1/3/4 — D39.103; п.2 — D39.104 п.3 (детали — ревью-шапка).

  1. Мини-голд алиасов (§E-1 research/20, висит с 17.07): полезен кластер-каналу, не гейт. Делать? (метод и объём ~2030 мин описаны в research/20 §E-1).
  2. «Гуюэ слитно» — пар-норма Палладия для составных фамилий или вкус книги? Если пар-норма — дата-правка пар-промпта (перекупка батчей, центы); если вкус — канал только сид.
  3. Проба редакторского провода двухсекционки (~$0.05) — санкция? При Δ≈0 доктрина «неподписанное С ПОМЕТКОЙ» требует пере-обсуждения.
  4. Корзину «строить сейчас» (§G п.13,5) — передавать бэкенду одним фикс-паком класса D39.71?

Критик полноты

  • Один голд, одна книга, 45 строк; 古月-кластер коррелирует 8 строк — эффективный N меньше номинала; интервалы точностей ±14 п.п.; кросс-книжная воспроизводимость не проверена.
  • P1 — терминолог на до-катоверных весах: сравнение S1↔P1 конфаундится сменой весов (внутри одной эры C3↔SC↔S1 конфаунда нет).
  • Вся эмпирика — холодный старт; поведение с непустым ⟦TM-CANON⟧ не мерено.
  • Проба C: N=6 неверных строк, один транслятор-провод, один арм-порядок; редакторский провод не мерен.
  • §E: ja 2 окна / en 1 окно — направление, не величина; family-тест ja не состоялся (батч 0 негоден).
  • §F: классификация стратегий ручная (автор); fan-канон — память модели; en-проход видел ru-улики.
  • Словесная шкала уверенности мерена на одной модели; E1-правило «спорный» одно из возможных (вывод о кластерном роутинге от него не зависит).
  • Кластерные метрики — 3 семьи + *-blood; регистры обращений и алиас-графы голдом не покрыты.
  • Инжект-смета книги — верхняя граница по потолку 800 ток., фактический размер блока не считан.
  • Самопроверка ловила и свои дефекты метрик: первая версия A5-замера давала 38 «сдвигов» — ловушка тай-брейка на связках ×1, честная метрика (слитые голоса строго обогнали сырой топ) даёт 1/75.

Адверсариальные проходы (author≠reviewer)

  • Раунд 1 (до платных выводов): два независимых агента. Код §A: 7/7 CONFIRMED по file:line. Голд: числа воспроизведены пере-раном байт-в-байт; «промахи несправедливы из-за нормализации» ОПРОВЕРГНУТО (0 несправедливых); джойн чист (пере-джойн точным равенством — тот же сплит 45/8); порядок вариантов BANK-FULL = ранжирование §C2-3 (байт-сверка со стоп-таблицей 150/150).
  • Раунд 2 (по готовому отчёту): агент чисел + агент логики/комплаенса. Все точности, парные, AUC/CI, таблица пробы C и деньги — CONFIRMED пере-раном; батч-корреляция химеры подтверждена шире голда. Исправлено по находкам: счёт семьи 4×+4× (было 3×), метрика связности приведена к «заявление=команда», «медиана»→«среднее», честная формулировка критерия 4 (сработал у E1, не у C3), Δ-метрика шкал помечена пост-хок, снята ложная оговорка про grok-ростер (все 7 пассов видели идентичные 63 терма — сверено сырьём), к рецензенту дописана draft/auto-клауза.
  • Раунд 3 (ревью диффа финального рерайта, этот файл против v1): независимый агент по антипаттернам приёмки; числа сверены пере-раном — 100% чисты; новые клеймы (в т.ч. «промпт роли уже требует родства») подтверждены первоисточниками; блокер — рерайт сжал зарегистрированные §0/§E/§F — закрыт восстановлением пре-регов дословно (плюс явная пометка девиаций: реализация пробы C — транслятор-провод при зарегистрированном редакторском рендере в скоупе; §F ~12→15 термов); потери фактов (риск состава совета, контрфакт 26/45, D-якоря, рычаг-приоритет, основания B5) возвращены; правки читабельности внесены.

Заявление = команда (приёмка пере-ранит; скрипты — eval/bank_arbitration/, питон eval/.venv/bin/python3)

Число Команда
53/45/8, голд build_gold.py
P0 12/45 · P1 18/45 · 27 промахов · 5-в-вариантах score_baselines.py
пассы ds/glm/mis/dsw consilium_probe.py --passes ds1,ds2,ds3,dsw,glm1,mis1 (+ retry_mis_b4.py после 429 Mistral)
grok-пасс consilium_probe.py --passes gro1
формы, парные, AUC, кластеры, деньги-2-путь arbitrate.py
серии BANK-FULL · spread≥2 50% · соло-точности · C4 extras_checks.py all
проба C inject_probe.py / --score
A4 18/149 · A5 1/75 value_demo.py
§E ja/en multilang_probe.py / --score
§F: прогон / джойн 45 пар crosslang_bank.py --part all / python -c "from crosslang_bank import score_f1; score_f1()"

Сырьё: ~/books/gu-zhenren/bank-arbitration/*.json — 84 файла (полные тела, usage, цены, effort в каждом). Эффорты: deepseek reasoning_effort:"low" во всех вызовах; glm-5 thinking disabled; mistral/ grok вендор-дефолт. Слаги фактчекнуты live /models перед пассами. Провенанс голда — поле provenance каждой строки gold.jsonl. Полная версия отчёта до финального рерайта — черновик docs/archive/reports/DRAFT_BANK_ARBITRATION_V1_2026-08-04.md.

Деньги

Проба Потолок Факт
B: ds1+ds2+ds3+dsw $0.021991
B: glm1 $0.018495
B: mis1 $0.012808
B: gro1 (опция) $0.026546
Итого B ≤$0.70 $0.079840
Проба C (инжект) ≤$0.30 $0.009713
§E ja/en достройка $0.006472
§F кросс-пары ≤$0.08 $0.011310
ВСЕГО ≤$1.00 (слово владельца 04.08) $0.107335

СТОП-условий не наступало; суб-потолки не тронуты.