textmachine/docs/research/29-harness-topology-survey-codex.md

109 KiB
Raw Blame History

research/29-harness-topology-survey-codex — архитектура харнесса художественного перевода

СТАТУС (проставлен 05.09): ФАКТУРА, НЕ РАТИФИЦИРОВАНА. Файл в main с a7951a7 (мержем ветки полигона — это и есть верный маршрут). ⚠ Различение, без которого замеры топологии выбрасывают: судья как СТАДИЯ ДВИЖКА не построен и не вызывался (0 вызовов), но судьи в ПОЛИГОНЕ были и есть. РЕВЬЮ-ШАПКА НАПИСАНА оркестратором №22, 05.09 (у 29-harness-topology-survey.md её по-прежнему НЕТ). Ратифицированным отсюда не становится ничего без собственной D-ноты; ниже — что можно цитировать и как.

ЧТО ЗДЕСЬ ЗНАЧИТ «ИЗМЕРЕНО». Слово означает ровно одно: число стоит в таблице первоисточника. Оно НЕ означает переносимости на наш конвейер, и сам отчёт это оговаривает первым же абзацем §2.0.

ЧТО ДОКАЗАНО (как внешний факт, с уликой в теле): F1 — при ОДНОЙ И ТОЙ ЖЕ модели в обеих схемах (то есть изолирован workflow, а не жилец роли) многоагентная топология обыграла человека только по беглости (r=.71), по точности — ноль (r=.02), и та же схема дала систематические ДОБАВЛЕНИЯ, которых в источнике нет; судили 30 коротких отрывков, а не книгу · F2 — устойчивее прочих документ на вход → правка сегментом; правка целым документом трогает <5% токенов и даёт нестабильный прирост; уверенность модели НЕ предсказывает, где нужна правка (ROC AUC ≈0.503 на 43 631 слове) — то есть это широкая проекция, а не «найди и почини» · C1 — «diff в 1.52 раза дороже» из задания полигона ПРОТУХЛО: первоисточник даёт 2.913 / 1.677 / 2.468, а поздняя поправка сужает до модель×цель (ru 2.83, en 0.67).

ЧТО СНЯТО — и снято САМИМ отчётом в §5, где каждая ошибка названа вместе с командой, которой поймана: «Please Translate Again» как новая ось (дубль) · F2 как новая топология (дубль в ВОСЬМИ файлах) · «плохой контекст хуже пустого» (плечи спутаны: политика обучения и политика контекста менялись вместе) · «все признаки translationese — детекторы машинности» (подмена конструкта: там отличают ЧЕЛОВЕЧЕСКИЙ перевод от оригинальной прозы) · «составной измерительный стек» (оверклейм, снят обоими ревизорами) · LTCR и стилевые эмбеддинги как единый канон-скор (устойчивость ≠ правильность: формула даёт 100% и на стабильно НЕВЕРНОЙ форме) · «F1/F2 показывают ухудшение голоса» (голос там не мерили вовсе) · три «рыночные новинки» (старше среза research/22) · «edit contract» F4 ≈ наш diff (там редактор возвращает ПОЛНЫЙ текст) · «код Loong выложен» (в репозитории только README) · заявление F4 о согласии с человеческой оценкой (в Methods/Results человеческого исследования НЕТ).

ЧТО НЕ ПРОВЕРЕНО — и это главная ценность файла, потому что закрывает соблазн опереться: matched-замера «список исполнимых правок против полного переписывания» на литературе НЕ СУЩЕСТВУЕТу нашего Q4b-формата нет ни внешнего подтверждения, ни внешнего опровержения · человеческого сравнения топологий на длине книги нет ни у кого (F1 судит отрывки, F2 — смежные куски, F3 — только автометрики) · измеренной памяти через сотни глав нет · thinking: качество и цена ни разу не закрыты вместе · long-form детектора «машинности» нет ни на одной подходящей паре — и пробел именно в held-out точности и доле ложных срабатываний, а не в русском языке · единого reference-free канон-скора нет, есть несоставленные частичные приборы · валидированного прибора сохранения ГОЛОСА персонажа при переводе нет · поправка на множественность у большинства находок не заявлена · стоимость вызовов F1/F2/F3 не опубликована — поэтому число стадий здесь НЕ превращено в выдуманный COGS.

ОТДЕЛЬНО — О ФОРМЕ, а не о содержании. §5 этого отчёта («что я напутал») — двадцать с лишним ошибок, каждая с классом и с КОМАНДОЙ, которой поймана, плюс артефакт открытия ссылок и артефакт двух независимых ревизоров с явно заданной моделью. Это ровно та норма, которую смена ратифицировала 05.09 отдельно и по другому поводу (D39.207 п.5: утверждение о замере или о причине непроверки обязано цитировать команду) — здесь она уже исполнена, и как образец формы отчёта файл ценен независимо от находок.

Независимая research-сессия Codex, 31.08.2026. Дельта-срез относительно репозитория на 31.08.2026. Пишется отдельным файлом с суффиксом -codex по прямому указанию владельца, поскольку параллельная сессия независимо готовит 29-harness-topology-survey.md. Это исследование не меняет код, не ратифицирует архитектуру и не рекомендует внедрение: ниже только факты, измерения и границы переноса.

1. УЖЕ ПОКРЫТО

Блокирующий синк выполнен до первого интернет-запроса. Команды снятия инвентаря:

find docs/research -maxdepth 1 -type f | sort | wc -l
for f in $(find docs/research -maxdepth 1 -type f | sort); do rg -n '^#{1,3} ' "$f"; done
sed -n '1,360p' docs/experiments/README.md

Поправка владельца 31.08 выполнена исполнением: исходный синк по экспериментам был неполон — он читал только README и структурно не видел docs/experiments/*.md. Перед повторной оценкой находок весь дельта-фильтр переснят командами вида:

rg -n -i --glob '*.md' --glob '!29-harness-topology-survey*.md' \
  'ТОЧНЫЙ_ID|НАЗВАНИЕ|КОНЦЕПТУАЛЬНЫЙ_СИНОНИМ' docs/research docs/experiments

Точные неплейсхолдерные patterns и фактические результаты приведены per-finding в §2.0. Оба текущих 29-файла исключены: собственный отчёт иначе находил бы сам себя, параллельный отчёт другого агента нарушил бы независимость исследования.

Дата в таблице — дата создания файла по git log --follow --diff-filter=A --format=%as; это не означает свежесть всех его фактов. Вердикт учитывает ревью-шапку, если она есть.

Тема Файл Дата Вердикт одной строкой
Рынок и спрос research/01-market.md 04.07 Фактура сегментов жива; прежний SAM снят как завышенный.
Конкуренты research/02-competitors.md 04.07 Ландшафт продуктов/OSS до июля; тезис о пустом ru-рынке снят.
Agentic/doc/literary MT research/03-academic-agentic-mt.md 04.07 Уже покрыты TransAgents, DelTA, DRT, TEaR, selection/synthesis и literary-eval; вывод «generate-then-select — ядро» superseded.
Провайдеры research/04-api-providers.md 04.07 Цены/модели/роли быстро устаревают; архитектурной дельтой не считаю.
Память и глоссарий research/05-memory-glossary.md 04.07 Уже покрыты lorebook, иерархические summary/RAG, DelTA и токен-бюджет.
Локальные модели research/06-local-models.md 04.07 Роли и экономика моделей под малую VRAM; не топология харнесса.
Методология литперевода research/07-translation-methodology.md 04.07 Уже покрыты профпроцесс, series bible, редактура и анти-translationese.
Юридическое/ToS research/08-legal.md 04.07 Юридическая рамка жива, провайдерская часть superseded.
Go-прайор-арт транспорта research/10-vojo-ai-bot-review.md 04.07 Адаптеры/роутинг/телеметрия, вне предмета топологий качества.
18+ маршрутизация research/11-gap-2.md 04.07 Enforcement-факты, но состав канала пересобран; не дублирую.
Selection vs refinement research/11-gap-3.md 04.07 Развилка и пилот уже спроектированы; собственного книжного вердикта нет.
Ru-экосистема research/11-gap-4.md 04.07 Опровергает «ru никто не обслуживает»; рынок не пуст.
Спрос/прайсинг research/11-gap-5.md 04.07 SAM/SOM снизу вверх; вне архитектурной дельты.
Общие режимы отказа research/12-common-failures.md 09.07 Непрозрачный LLM-провенанс, числа без источников не наследуются.
Отзывы читателей research/12-consumer-feedback.md 04.07 Каталог жалоб и похвал; не измерение топологии.
Академические таксономии research/12-error-taxonomies.md 04.07 DITING/BlonDe/MQM/LitEval/LAIT уже разложены по механизмам.
Ошибки ja→ru research/12-failure-modes-ja.md 04.07 Языковые отказы уже каталогизированы; не пересказываю.
Ошибки →ru research/12-failure-modes-ru-target.md 04.07 Русская целевая сторона уже каталогизирована; не пересказываю.
Ошибки zh→ru research/12-failure-modes-zh.md 04.07 Китайская исходная сторона уже каталогизирована; не пересказываю.
Валидация банка research/13-memory-bank-validation.md 04.07 Dense/hybrid retrieval, детерминизм и режимы отказа банка уже проверены; ревью-шапка первична.
Адаптивная память research/14-adaptive-memory.md 05.07 ICL-демонстрации, LoRA/kNN и adaptive retrieval уже разобраны; ревью-шапка первична.
Голос и scene-state research/15-voice-and-state.md 09.07 Профили голоса, exemplars, scene/reader state и pre-pass уже покрыты.
Ридер-IDE/HITL research/16-reader-ide-alignment.md 11.07 Выравнивание, доверие и ручная редактура; не повторяю как топологию.
Независимая критика research/17-external-critique.md 11.07 Уже есть чистый-лист по состоянию, верности, литературности, цене и судье.
Рычаги качества (GPT) research/18-quality-levers-chatgpt.md 11.07 Гранулярность, discourse-reflow и двухступенчатый замер уже отработаны.
Рычаги качества research/18-quality-levers.md 11.07 Независимая карта сведена с проектом и построена; не источник новых идей.
Нарезка/когезия research/19-chunking-cohesion.md 16.07 Chunking, STM/carryover, волны и t/e-контракт уже исследованы и измерены exp15.
Майнинг банка research/20-bank-mining.md 17.07 Термы, алиасы, консолидация и слепые зоны уже покрыты и измерены exp16.
Транспорт харнессов research/21-llm-transport-survey.md 23.07 Wire/API-квирки уже разобраны; явно вне этого обзора.
Доменные харнессы research/22-domain-harness-survey.md 24.07 AiNiee/GalTransl/LinguaGacha и др. разобраны по коду; critique-loop отмечен, публичных quality-замеров почти нет.
Engine↔platform research/23-engine-platform-seam.md 02.08 Интеграционный шов, не топология перевода; transport-часть superseded.
Арбитраж банка research/24-bank-arbitration.md 04.08 Консилиум, self-consistency, селекция и confidence проверены на банк-термах; не переносить молча на прозу.
Холодное ревью шва research/25-seam-cold-review.md 05.08 Ратифицированная форма платформенного шва; вне предмета.
Agent-harness guidance research/26-anthropic-guidance-digest.md 09.08 Общие правила долгих агентных сессий уже абсорбированы; не MT-замер.
Детекция глав research/27-chapter-detection.md 09.08 Структура ingest книги; дизайн не ратифицирован, но не переводческая топология.
API-контракт research/28-contract-review.md 16.08 Контракт фронт↔платформа; вне предмета.
Провайдерские/архитектурные эксперименты experiments/0314b 0415.07 Модель черновика не дала эффекта; промпт/редактор/смысловые ловушки уже измерены на интерим-материале.
Нарезка и банк experiments/1516 2224.07 Когезия ниже floor; майнинг WHICH подтверждён, WHAT отправлен человеку/банкноте.
Редакторский провод/контракт/роль experiments/1820 0408.08 Закон-блок нужен; diff-контракт исправен, но дорог/опасен; поиск дефекта дороже идеального ремонта.
Топология ролей experiments/21 08.08 Закрытый замер: на его tested slice draft→editor сильнее голого черновика; точечный repair/feedback/routing отклонены.
Жильцы редактора experiments/22 16.08 Закрыт с поздними errata: en-эффект редактора жив, исходный широкий клейм второго прохода сужен.
Тир и промежуточные схемы experiments/23 29.08 ИДЁТ: --final красный, acceptance параллельна; порядок arm-ов и price-выводы пока позиционно confounded.

Следствие дельта-фильтра: находкой ниже может стать только (а) первичная работа новее тематического локального среза либо (б) отсутствующая здесь ось/новое измерение. Повтор известного допустим только как внешний контрсигнал с явно указанной дельтой.

2. Находки

2.0 Реестр дельт и исполняемая проверка

Статус измерено ниже означает только то, что число есть в таблице/рисунке первоисточника; это не означает переносимость на наш конвейер. Команды запускались из корня репозитория 31.08.2026. Ø означает нулевой вывод; «есть» — найденный локальный предшественник, относительно которого ниже названа более узкая дельта.

ID Ось Статус Дельта относительно репозитория Чем проверено
F1 смысловой скелет → стиль, multi-agent topology измерено людьми research/17:243,287 уже знал статью и направление; новое — ставший доступным full text, точный дизайн, выборка и эффекты после прежнего 403. rg -l -i --glob '*.md' --glob '!29-harness-topology-survey*.md' 'target\.25081|Workflow matters|stylistic lift|LCD-MAS|PD-MAS' docs/research docs/experiments → только research/17
F2 гранулярность и раунды refinement дубль результата; верификация библиографии Полный grep показал результат в восьми старых файлах; вместе с первоначальной строкой этого отчёта он действительно оказался девятым местом. Новое — лишь закрытый состав пар и exact human tables/границы. rg -l -i --glob '*.md' --glob '!29-harness-topology-survey*.md' '2605\.13368|acl-long\.268|What Does LLM Refinement Actually Improve' docs/research docs/experimentsresearch/{03,11,14,17,18} + experiments/{09,12,23}
F3 память через длинный документ измерено автоматически; код только заявлен DelTA и adaptive retrieval покрыты, но translation-specific 3E-памяти с обученным выбором контекста Loong нет. Частный тезис «плохой контекст хуже пустого» уже есть в research/13,14 и находкой не считается. rg -l -i --glob '*.md' --glob '!29-harness-topology-survey*.md' 'LoongDocMT|2605\.30274|3E memory|observe.{0,8}and.{0,8}act' docs/research docs/experiments → Ø; широкий grep near.?miss|лучше (ничего|пуст)research/13,14
F4 отдельный диагност → редактор; число раундов измерено автоматическими метриками и latency В локальных файлах нет этой ACL-работы; это внешний контрсигнал к отклонённой нами feedback/repair-схеме, но на e-commerce. rg -l -i --glob '*.md' --glob '!29-harness-topology-survey*.md' '2026\.acl-industry\.115|Diagnose.{0,15}Then Repair|two-stage MQM' docs/research docs/experiments → Ø
F5 thinking и creative prompting измерено людьми + автоматически Нет paired-task Beyond Reproduction: 23 модели, thinking-варианты и четыре creative-промпта на UCP. rg -l -i --glob '*.md' --glob '!29-harness-topology-survey*.md' 'Beyond Reproduction|2026\.findings-acl\.2030|2604\.18169' docs/research docs/experiments → Ø
F6 валидность литературного судьи измерено людьми + автоматически Creativity Bias в research/18 только названа; controlled source-visible/source-hidden sentence-pair опыта и точных modality/genre таблиц там нет. rg -l -i --glob '*.md' --glob '!29-harness-topology-survey*.md' '2026\.unlp-1\.8|Semantic Fidelity Versus Literary Quality|source.?hidden|2605\.13596|2026\.eamt-1\.43|Creativity Bias' docs/research docs/experiments → только research/18 (Creativity Bias)
F7 бесплатные сигналы «машинности» частично валидировано на русском Локально уже перечислены MTLD/distinct-n/длины/повторы/пассив; новое — отделение machine detection от human translationese и русский RuATD baseline. rg -l -i --glob '*.md' --glob '!29-harness-topology-survey*.md' 'MTLD|distinct-[nN]|уменьшитель|translationese|машинност' docs/research docs/experimentsresearch/{03,07,12-consumer,12-taxonomies,12-ja,12-zh,15,18-chatgpt,18,22,28} + experiments/{21,23}
F8 измеритель «не отходит от канона» частичные метрики; единого прибора нет LTCR, BlonDe, BWB, SEGALE, mStyleDistance и поздний D50/canon_gaps уже лежат локально. Первый проход, ошибочно переоценив ru-specificity, пропустил zh→en L-Anno, source-grounded TRANSGRAPH cohesion judge и англоязычный CONSTORY-CHECKER; CoTERM и MetaDocEval также новые для локального корпуса. Полный rg -n -i --glob '*.md' --glob '!29-harness-topology-survey*.md' '2024\.lrec-main\.583|true consistency|false consistency|TRANSGRAPH|2026\.eacl-long\.75|ConStory|CONSTORY|2026\.findings-acl\.410|CoTERM|MetaDocEval' docs/research docs/experiments → Ø; старые `LTCR

F1. Full text уточняет известный контрсигнал: fluency выросла вместе с добавлениями

Источник. Lulu Wang, Sanjun Sun, Xing Wang, Jinghang Gu, Kanglong Liu, 01.06.2026, Workflow matters: Comparing human translators and multi-agent LLMs in literary translation, Target 38:3, pp. 422453. Это одна GPT-4o-версия (gpt-4o-2024-11-20) в обеих схемах, то есть изолирован именно workflow, а не жилец роли.

Что сравнили. PD-MAS имитирует ISO-процесс: анализ/термы → переводчик → reviser → reviewer → proofreader. LCD-MAS режет главу на смысловые блоки примерно по 300 китайских знаков и делает: глобальные summary+strategy → для каждого блока перевод смысла → accuracy-revision → style guide → стилистический rewrite → после склейки ещё global style-guide и editor. Исходный корпус — 28 глав примерно по 3 000 китайских знаков из 15 опубликованных произведений 14 авторов и пяти поджанров; это Methods §§3.13.2/Table 1. Оценка — 30 слепо рандомизированных отрывков, средняя длина источника 166 знаков (Table 1), zh→en fiction.

Измерено (Results 4.14.3, Table 2). Два профессора перевода оценивали accuracy, два native English writing experts — fluency. По accuracy медиана у всех трёх вариантов равна 8, Friedman χ²(2)=0.37, p=.832; LCD против human p=.920, r=.02. По fluency LCD имеет медиану 8 против 7 у human и 7.5 у PD; LCDhuman p<.001, r=.71, LCDPD p=.024, r=.49. Для трёх парных сравнений применена поправка Bonferroni. В отдельном preference-голосовании n=120 (30 фрагментов × четыре эксперта) LCD получил 52/120 (43.33%), PD 39/120 (32.50%), human 29/120 (24.17%); для этих долей инференциального теста нет.

Что ограничивает клейм. LCD был существенно длиннее: 149.5 английских слова против 113.4 у human и 99 у PD (Table 1). Сами эксперты назвали систематические добавления главным дефектом; пример включает отсутствующие в источнике «quiet beauty», «molten fire» и «fragile sense of hope». Планировщик распознавал культурные реалии, но обещанные пояснения иногда не доходили до финала. Следовательно, измерено превосходство по fluency, а не по точности или авторскому голосу. Книга целиком не оценивалась, стоимость, токены и число API-вызовов не опубликованы.

Дельта. research/17:243,287 уже ссылался на эту работу как на counter-signal и знал «stylistic lift with occasional additions»; исходный full text тогда был недоступен. Здесь новое только на уровне восстановленной улики: точная LCD-/PD-MAS topology, human sample, effect sizes и failure межагентной передачи плана. Общая идея «разделить смысл и стиль» новой не является.

F2. В WMT24-Literary наиболее устойчивой была full-document input → local rewrite emission

Статус после полного дедупа: не самостоятельная находка. Тот же paper/result уже находился в восьми старых файлах (research/03,11,14,17,18, experiments/09,12,23); первоначальная запись здесь делала его девятым местом. Пункт оставлен только как проверка первоисточника и закрытие локального TODO о составе языковых пар, а не как новая архитектурная дельта.

Источник. Shaomu Tan et al., июль 2026, What Does LLM Refinement Actually Improve? A Systematic Study on Document-Level Literary Translation, ACL 2026 Long Paper, Tables 1, 37. Девять моделей; WMT24-Literary, семь направлений: en→{cs,de,es,ja,ru,zh} и ja→zh. Документ около 2 048 слов; полный source и initial translation видны refiner при любой единице эмиссии, температура 0, до четырёх раундов.

Измерено автоматически. MQM-FSP judge в этом блоке — Claude-3.5-Sonnet (§3). Из девяти комбинаций granularities наиболее устойчивой оказалась document MT → segment refinement: segment-rewrite менял обычно 2540% токенов, тогда как whole-document refinement у большинства моделей менял менее 5% и давал ограниченный/нестабильный прирост (Table 1, §4.2). На DeepSeek-V3 simple general rewrite дал +3.6 MQM-FSP, а step-by-step — +1.4; у step-by-step accuracy/fluency/style+term равны 0.9/1.3/0.4 (Table 3). Confidence исходных слов не предсказывал места правок: 43 631 слово, средний ROC AUC 0.503 по log-prob и 0.504 по entropy (Table 7). Это broad projection в распределение редактора, не locate-and-fix.

Измерено людьми. Профессиональный vendor покрыл outputs полного WMT24-Literary: 16 систем (4 модели × 4 стратегии), семь направлений, свыше 1 млн переведённых слов, human MQM и DA (Table 4). Но annotators видели contiguous chunks, а не целый документ (Appendix A.5): это полное покрытие test set, не whole-document human judgment. General был лучшим для всех четырёх моделей; его MQM/DA дельты: GPT-OSS-120B +12.2/+3.7, Qwen3-235B +4.4/+1.3, DeepSeek-V3 +7.8/+3.1, GPT-5.2 +5.6/+2.0. Step-by-step у тех же моделей дал MQM 3.3, 1.5, 4.2, 7.2. В targeted A/B на n=102 200300-словных chunks en→de/en→es (размер восстанавливается из процентов Table 5: 16/35/51 = 15.7/34.3/50.0%) refined DeepSeek-V3 выиграл без ничьих 76.1% по accuracy, 97.5% по fluency и 93.1% по style+term; во всех трёх строках p<10⁻⁴ (Table 5). Поправка на три эти теста в статье не указана; для большой Table 4 доверительные интервалы/поправка также не даны.

Перенос. Это литературный документ и среди пар есть en→ru и en→zh, но числа Table 4 агрегированы по направлениям; отдельного human-эффекта для en→ru нет. Segment-level здесь означает локальную полную перегенерацию блока при полном документе в контексте, а не список правок.

Дельта. research/11 уже правильно пересказал механизм по майскому препринту, а research/17 уже отметил ACL-final. Реальная дельта этого пункта — снятие явного TODO о составе пар и exact human tables вместе с chunk-level границей их чтения; архитектурной новинкой результат не считаю.

F3. Loong обучает не саму память, а выбор полезного контекста; литературная улика пока автоматическая

Источник. Yutong Wang, Xuebo Liu, Derek F. Wong et al., 28.05.2026, Loong: A Human-Like Long Document Translation Agent with Observe-and-Act Adaptive Context Selection, arXiv:2605.30274; заявленный код — YutongWang1216/LoongDocMT.

Заявлено. После каждого сегмента 3E-memory пополняет (1) Essence — LLM-summary, (2) Exemplars — все предыдущие sourcetarget пары, (3) Entities — структурные записи. Encoder сначала достаёт top-K summary/exemplars и все упомянутые entities; observe-and-act агент последовательно фильтрует три типа. Политика выбора обучена SFT/DPO на предпочтениях из собственных траекторий. В inference псевдокод делает три reasoning-шага выбора (Algorithm 1), translation, summary и entity update; поэтому это не «один переводческий вызов с RAG». Размер сегмента в самом источнике внутренне противоречив: §4.1 задаёт l=5 предложений, Limitations — десять. Ни одно из двух значений нельзя выдавать как однозначно установленное.

Измерено (автоматически). Основное обучение — примерно 500 news-документов на каждую пару en↔{zh,de,fr} (§4.1/A.4); human-eval нет. В OOD GuoFengV1 zh→en webnovel (12 документов, средняя длина 1 445 слов, Table 4/A.4) Loong против DelTA дал sCOMET 76.2 vs 74.2, dCOMET 73.1 vs 70.5, GPT-4.1 judge 67.3 vs 63.0 (Table 4). Ablation Table 3 — News Commentary V18.1, En→{zh,de,fr} aggregate, Llama3.1-8B, sCOMET+dCOMET+GPT-4.1 judge: средний score Loong 80.2, без контекста 77.4, без tuning 75.4. Поправка на множественные сравнения не указана. Отдельная демонстрация перевела первые 12 глав известного Journey to the West zh→pt (51 854 слова), но Figure 1 даёт только автоматические кумулятивные curves; известный классический текст и отсутствие человека делают это предварительной stability-уликой, не книжным quality-тестом.

Цена и воспроизводимость. Авторы прямо признают дополнительный computational overhead, но не дают токены, latency, API calls или деньги. На 31.08.2026 открытое дерево linked-репозитория содержит только README.md, а не implementation: фраза статьи «code is released» фактически не подтверждена кодом.

Дельта. research/05 знает multi-level memory DelTA, research/14 — adaptive retrieval, а research/15 — exemplars. Новое их пересечение: обученный translation-specific выбор между summary/exemplar/entity с OOD-webnovel таблицей. На сотни глав, zh→ru и человеческий голос перенос не измерен.

Проверка тезиса «плохо отобранный контекст хуже пустого»

Вердикт: подтверждён внутри Loong, но не является нашей новой находкой. Чистая улика — не сравнение w/o Tuning=75.4 с w/o Context=77.4 в Table 3: эти arms различаются и обучением, и политикой контекста, поэтому такое сравнение confounded. Прямее §4.4/Figure 4: авторам удалось впрыснуть 3050 предложений из других документов; у двух selection-free baselines sCOMET, dCOMET и GPT-4.1-score последовательно падали относительно pseudo-context length 0, тогда как Loong оставался почти стабильным. Figure 4 не печатает точные значения и significance test; основа — News Commentary/WMT24++, не книга и не human judge.

Полный локальный grep вернул research/13:42 с буквальным принципом «лучше ничего, чем мусор» и research/14:75 с near-miss-дистрактором; поэтому это внешняя репликация уже известного вывода, не F3-дельта. Более ранние Power of Noise и Yoran et al. там относятся к QA/RAG, а не к MT; Loong впервые в этом наборе даёт прямой MT-тест, но только автоматический.

F4. Отдельный evaluator→post-editor выигрывает на e-commerce, но это не наш diff-контракт

Источник. Ji Hun Wang, Siyu Wu, июль 2026, Diagnose, Then Repair: A Two-Stage MQM-Guided Post-Editing Framework for Domain-Specific Machine Translation, ACL Industry 2026, Tables 14, 710.

Топология. Claude Opus 4.5 один раз выдаёт MQM issue_id/span/category/severity/suggested_fix с retrieved TM-exemplars; отдельный post-editor получает report и обязан минимально исправить только диагностированные места. Важно: post-editor возвращает полную новую hypothesis плюс edit log (§3.4), не исполнимый список search/replace-операций.

Измерено. Внутренний e-commerce test — 5 000 сегментов для каждого из en→de/it/es/fr/zh/ja; KB 135184 тыс. пар (Table 10), initial MT Claude 3.5 Sonnet, семь post-editor моделей. На en→de no-edit COMET/CometKiwi 86.39/82.66; one-stage Opus 89.38/82.84; two-stage P3+Sonnet 4.5 89.93/84.50. На en→zh соответственно 87.76/81.60, 88.70/79.57, 90.80/83.19 (Table 1). Two-stage COMET выше one-stage у 4/7 моделей en→de и 6/7 en→zh, но CometKiwi у ряда моделей падает (complete Table 5), поэтому фраза абстракта «consistently improves both» шире тела. Статзначимость/поправка на множественность не приведены; judge результата — только COMET-22 и CometKiwi.

На en→de второй repair-round ухудшил COMET в 6/7 клеток; единственный плюс Sonnet 4.5 равен +0.14, а GPT-OSS-120B дал 1.86 (Table 4). Latency на n=50: evaluator mean/median/p95 14.34/7.80/54.38 s, post-editor 3.30/3.10/5.04 s, end-to-end 17.64/10.90/59.41 s (Table 8; языковая пара для latency source не указана). Прайс-лист моделей дан, но фактические токены и dollar cost прогона не даны.

Перенос под вопросом. Короткие повторяющиеся товарные сегменты и automatic metrics — другой класс, чем глава прозы. Более того, заявленные в abstract «agreement with human MQM» и «human editor preferences» не имеют в полном тексте методики или таблицы human study; их здесь не считаю измеренными.

Дельта. Это не опровергает наш дорогой list-of-edits: формы выхода различны. Оно даёт лишь внешний контрсигнал к локально отклонённой топологии «diagnose отдельно → repair отдельно» и измерение того, что второй раунд чаще регрессирует.

F5. Source-comprehension thinking и translation prompting дают неоднородные эффекты

Источник. Ran Zhang, Steffen Eger, Arda Tezcan, Wei Zhao, Simone Paolo Ponzetto, Lieve Macken, июль 2026, Beyond Reproduction: A Paired-Task Framework for Assessing LLM Comprehension and Creativity in Literary Translation, Findings ACL 2026; код/данные заявлены в NL2G/Beyond-Reproduction. Проверяемые пути репозитория: task2_ucp/task2_evaluator.py, task2_ucp/step2_batch_task2_translation.py, prompt_openrouter.py.

Две разные задачи и судьи. Task 1 — n=299 English claimreasoning items из 11 классических романов разных жанров, средний excerpt 186 tokens; языковой пары нет, это source comprehension (§3.1). Gold прошёл трёх Prolific-аннотаторов на item, затем проблемные случаи — первого автора и двух trained annotators; всего участвовали 33 Prolific и два expert annotators (§3.1, §3.3). Task 2 — по 20 UCP-rich excerpts из восьми романов для en→zh и en→nl, 78/76 target-текстов, 398/374 размеченных units of creative potential (Table 1). Human gold создали один опытный Chinese и один Dutch annotator; масштабируемый judge — Qwen3-Next-80B, F1=.710 на en→zh validation subset из 12.8% human-annotated paragraphs (§3.2). Затем сравниваются 23 модели × четыре prompts; поправка на множество model/prompt сравнений не указана.

Измерено. На Task 1 thinking-пары немонотонны: Qwen3-235B-Thinking лучше обычного, Qwen3-30B-Thinking хуже, Claude 3.7 Thinking даёт лишь небольшой эффект (§5.1); это результат о понимании источника, не о качестве перевода. Масштаб модели связан с macro-F1 слабо и незначимо (ρ=.311, p=.149, Figure 2). На Task 2 прямые пары также расходятся: Qwen3-235B avg/max .065/.036, Thinking .048/.108; Qwen3-30B .045/.060, Thinking .033/.024 (Table 13). Распределения четырёх prompts сильно перекрываются; лишь 7/23 систем достигают личного максимума на самом explicit P3. Только Mistral-Large (0.167), Mistral-Small-Creative (0.107) и Qwen3-235B-Thinking (0.108) вообще превысили creativity 0.1 при human baseline 0.246 (Figure 3, Table 13). У DeepSeek-V3.2, Jamba-Large и Llama3.1-405B больше creative freedom снизило score.

Цена отдельно. Статья не сообщает reasoning tokens, latency или dollar cost; следовательно, она отвечает на quality-ось, но не на cost-ось thinking. Отрывки в среднем около 218 source-токенов, не главы; перенос на книгу и →ru под вопросом.

Дельта. Локально уже есть DRT и отрицательный результат decomposition/translate again. Здесь новое — прямой paired benchmark «понимание не равно creative transfer», thinking-варианты и четыре уровня creative prompting на литературных UCP, а не общая MT-метрика.

F6. Два новых контроля показывают, что «литературный judge» меняет сам конструкт

F6a. На sentence pairs одной книги тот же judge переворачивает рейтинг, если скрыть источник

Dmytro Chaplynskyi, Ivan Kulynych, Maria Shvedova, Lesia Ivashkevych, май 2026, Semantic Fidelity Versus Literary Quality, UNLP 2026, Tables 24. Корпус покрывает одну целую известную книгу, Animal Farm, en→uk: семь human-переводов и GPT-5.2/DeepL/Lapa, 1 367 aligned sentences, из них 1 128 valid. Единица автоматической и pairwise оценки — выровненные предложения, не book-level чтение. Семь neural MT metrics поставили все три AI в top-3. AIAI против humanhuman: LaBSE 0.941/0.711, XCOMET round-robin 0.886/0.627, COMET-22 0.881/0.750 (Table 2); одновременно AI имели MTLD 311 против 377 у людей (18%) и 0.47 против 1.23 diminutives на тысячу токенов (2.6× меньше).

Контроль удерживал GPT-5.2-judge неизменным: около 750 pairwise сравнений с source и 750 без него; ещё 1 034 judgments дали четыре профессиональных en→uk переводчика с source, A/B порядок рандомизирован (Table 3). При source-visible AI ranks были GPT-5.2 #1, DeepL #3, Lapa #4; без source все три упали ровно на пять позиций — #6/#8/#9 (Table 4), а top-5 заняли люди. Формальных significance tests/поправки для rank reversal нет, GPT-5.2 одновременно кандидат и judge, книга известна pretraining. Поэтому это сильный within-judge construct-control, но лишь одна пара/книга.

F6b. Профессиональная creativity-аннотация не совпадает с MQM-judge

Kyo Gerrits, Rik van Noord, Ana Guerberof Arenas, июнь 2026, Creativity Bias: How Machine Evaluation Struggles with Creativity in Literary Translations, EAMT 2026, Tables 45, 1112; протоколы — INCREC/Creativity_bias, каталоги Evaluations/, MT/, Statistical analysis/. Шесть коротких текстов 97182 слова, три жанра (poem/short story/thriller), en→nl, en→ca, ru→nl; три modalities HT/PE/MT. Четыре профессиональных литературных переводчика создали HT/PE и MQM errors, три doctoral translator-annotators разметили creative shifts. GPT-5.2 high-reasoning — LLM judge.

Профессиональный creativity index HT/PE/MT равен 62.2/28.9/15.9 для en→nl, 30.0/15.2/31.6 для en→ca и 60.1/32.2/50.8 для ru→nl (Table 4). Среди девяти automatic metrics максимальная корреляция с creative shifts всего 0.20, с errors 0.39, с combined CI 0.35 (Figure 2). GPT-5.2 часто нашёл другие errors: например, по агрегату Table 5 его match означает совпавший span, не совпавшую категорию; 15/38 professional Kudos он назвал ошибкой. GLM показал, что judge чаще человека ставит ошибки HT (z=2.07, p=.038) и реже — MT (z=6.16, p<.001). Для различий professional modalities применён post-hoc HolmBonferroni (Table 12); для сетки metric-correlations отдельная поправка не заявлена.

Общая дельта F6. research/03 и 18 уже знают, что literary metrics/LLM judges расходятся с читателем; тезис не новый. Новые измерения — controlled source-visibility на sentence pairs, покрывающих одну книгу, и genre×modality creativity annotation, включая русский источник. Они объясняют, почему внешний F1 может одновременно иметь высокий fluency/preference и систематические добавления, но book-level голос/когезию F6a не измеряет.

F7. Бесплатные детекторы «машинности»: книжные сигналы есть, надёжного long-form прибора нет

Здесь важно не смешать три разных конструкта: (а) machine-generated vs human-written, (б) переводной vs оригинальный русский (translationese) и (в) бедность/сжатие литературного стиля. Один и тот же бесплатный признак может разделять один конструкт и инвертироваться на другом. «Бесплатный» ниже означает без платного LLM/API-вызова; локальные tokenizers, taggers и classifiers всё равно требуют вычислений и, для supervised detector, обучающих данных.

Бесплатный сигнал/прибор Где проверен Что реально доказано Граница
Dist-{1,2,4}, Ent-{1,2,4}, TTR, CTTR, длина; открытый TF-IDF→SVD→logistic baseline Shamardina et al., 03.06.2022, RuATD-2022, русский; весь split 130k/21k/32k/32k, MT-часть 35 860 samples Private-test accuracy TF-IDF 0.64223, BERT 0.79666, top 0.82995, crowd 0.66666 (Table 5). Значит, открытый русский ATD benchmark и работающие classifiers существуют. MT-тексты от OPUS-MT/M-BART50/M2M-100 имеют в среднем 11.5 tokens и фильтр 525; это не современный LLM-литперевод и не книга. TTR для MT: human .98, machine .97; CTTR 2.08/1.97 (Table 4) — малый сдвиг.
Lexical richness, perplexity, число символов/предложений, POS-TF-IDF, пунктуация, sentiment, readability Та же RuATD, анализ решений §5 Эти дополнительные признаки давали лишь ограниченную пользу; ни одна top-3 система их не использовала. Это не валидация отдельного порога: выигрыш принадлежит обученному classifier, а не «MTLD ниже X».
MTLD, hapax/top-100, частицы, уменьшительные, function-word Cosine Delta, dispersion ratio длины, попарный chrF Chaplynskyi et al., UNLP 2026, одна en→uk книга, 7 human + 3 AI На этом корпусе AI: MTLD 311 против 377, частицы примерно до 2× реже, уменьшительные 0.47 против 1.23/1k tokens; AI outputs также сильнее сходятся между собой. Это релевантная книжная проверка класса сигналов, хотя не нашей пары. Не classifier и нет held-out threshold/accuracy. Языково-зависимые признаки вроде частиц/уменьшительных требуют переопределения для English target; MTLD, dispersion и межсистемная сходимость переносятся как конструкты напрямую.
45 структурных/лексических частот: пассив, non-finite/deverbal forms, pronoun classes, connectives, clause types, lexical density/TTR, dependency distance, sentence/clauses statistics Kunilovskaya, Lapshinova-Koltunski, Mitkov, сентябрь 2021, Russian fiction translationese: оригинальная русская проза vs человеческие переводы на русский из 11 языков, RNC Binary classification 8292%; structural features стабильнее lexical (Results/abstract, Appendix Table 2). Значит, бесплатная морфосинтаксическая панель на русской художке валидировалась. Она распознаёт в том числе живой человеческий перевод как переводной русский; использовать её как machine-detector означает ложноположительно штрафовать сам объект работы.

Исполнительный вердикт. Кроме уже локально названных MTLD/distinct-n/дисперсии длин/повторов, существуют n-gram entropy, function-word distance, частицы, lexical density, морфологические классы, связки, типы клауз, dependency distance, expansion dispersion и простые обучаемые TF-IDF/POS classifiers. RuATD и русский translationese-классификатор подтверждают работоспособность семейства, а en→uk book experiment — применимость части сигналов на книжном переводе. Главный пробел не в языковой паре: не найден пороговый detector с held-out quality/false-positive validation на длинном современном LLM-литпереводе вообще. Поэтому эти числа — диагностические оси/регрессия внутри одной книги, а не доказательство «текст машинный».

F8. «Не отходит от канона»: есть частичные приборы, но единого long-range score нет

Вопрос не о механизме памяти, а о наблюдаемом результате. По первоисточникам приборы распадаются на три несовместимые задачи: (1) одинаково ли переведены повторные сущности/термы; (2) совпадает ли выбор с утверждённым каноном; (3) остаётся ли различимым голос персонажа.

Прибор Что нужно на входе На чём валидирован Что доказывает / не доказывает
Наш canon_gaps / D50 bank.py (exp23 §Д32.4, §Д50) source triggers + подписанный bank dst decl.forms + candidate output; полный reference не нужен Частичные zh→ru webnovel runs: 375548 (term, chunk) пар; presence 96.998.9%, weighted misses 0.231.29%, effective consistency 99.3100% (§Д50.2). Exp23 в целом ещё ИДЁТ. Это уже прямой измеритель adherence к явному канону терминов. Но ручное чтение поймало 古月方源 → «Гу Юэ Фан Юань» вместо «Гуюэ», невидимое обоим автоматам из-за fullname-alias (§Д50.3). Следовательно, даже наш самый близкий прибор — монитор с известным blind spot, не proof книги.
LTCR — доля совпавших пар переводов повторного source-word среди C(k,2) (Lyu et al., EMNLP 2021) source + candidate + word alignment; полный reference не нужен Gold-aligned ZHEN: 268 docs/6 741 sentences; tests: zh↔en news 509 docs/5 146 sentences, TED zh↔en/en→fr 46 docs/4 632 sentences. Human test n=500 сравнивал системы в целом, а не валидировал LTCR против ручной term-consistency. Это прямо релевантное zh→en свидетельство внутренней лексической самосогласованности. Ограничение конструкта, а не языка: стабильно неверная форма получает 100%, identity/aliases/coreference не строятся. Уже подробно покрыто research/05,13,14,15,19,20 и experiments/15,16.
L-Anno / true-consistency test set — LTCR только на повторных словах, которые действительно обязаны совпадать (Lei et al., LREC-COLING 2024) Для released test-set: source + candidate + alignment + gold-разметка source-position pairs «вариативность допустима/недопустима»; target reference при scoring не нужен. Но создание такой разметки для новой книги требует bilingual source/reference и людей. Формально zh→en: 310 news documents/5 051 sentences, avg 16; статьи были изначально написаны по-английски и профессионально переведены на китайский, то есть тест делает reverse translation Chinese translationese→English original. 2 bilingual linguistics students, overlap 42 docs, IAA F1 .96. Из 30 667 пар повторных source words, одинаково переведённых в human target, 17 292 (56.4%) были true consistency, 13 375 (43.6%) — false consistency; 49.8% true pairs разнесены на ≥5 предложений. Исправляет conceptual defect LTCR: не штрафует всякую допустимую вариативность. Но это короткие reverse-origin news-документы, четыре старых NMT systems, без LLM/романов; score проверяет одинаковость требуемых pairs, а не правильность английской формы. В локальном корпусе точного источника не было.
SemenovBojar terminology consistency (WMT 2022) source + candidate; terms/alignments; pseudo-reference = первое или самое частое candidate-употребление. Полного reference нет. cs→en, 33 коротких legal agreements ELITR; WMT21/22 systems. Корреляция с human DA лишь косвенная: DA взята на другом news dataset; авторы называют оценку preliminary. Ловит one-to-many drift без эталона, но превращает first/majority error в «канон» и не знает правильности. Это ровно известная локально опасность LTCR-first-wins.
CoTERM — HHI для accuracy + consistency + допустимой вариативности (Hazem & Kageura, LREC 2026) Для CoTERM+ достаточно annotated source terms + term-only canon допустимых targets + candidate; полный framework и CoTERM дополнительно предполагают sentence references. en→fr TICO-19 (30 docs, 2 100 annotated sentences) и en→ja ASPEC (1 300); 1 250 system sentences/309 term pairs оценили 3 native Japanese specialists. Correlation с людьми умеренная: Kendall .41.47, Pearson .46.57 (Table 6), хотя abstract говорит “strongly”. Может отличить допустимые варианты от ошибок, то есть ближе всего к «держит утверждённый термин». Языковая пара не мешает перенести формулу на zh→en при наличии term list; реальный предел — sentence/term-level human validation, тогда как document/corpus validation оставлена будущей работой.
BlonDe — F1 по ENTITY/TENSE/PRONOUN/discourse categories (Jiang et al., NAACL 2022) candidate + полный human reference, English NER/POS/rules BWB zh→en webnovels: 384 книги; train 377, printed test 80 chapters/2 632 sentences, dev 79; chapter 1846 sentences, median 30. Error study: 8 professional translators; correlation study: 4 translators + 4 native-English revisers, 5-sentence blocks. BlonDe.F1 r=.417 adequacy/.358 fluency. Это наиболее прямо релевантный найденный zh→en literary benchmark, и для English target его инструменты подходят без языкового порта. Но score остаётся reference-based category-count overlap, не book-level identity/coreference/alias tracking и не автономный контроль 2 000 глав. Уже покрыта research/03,11,12,15,22.
BWB gold discourse benchmark/protocol (Jiang et al., ACL 2023) source + full target reference с entity IDs, term-span flags, coreference chains и quotation structure; system output; ручная либо task-specific automatic сверка. Term flag — категория, не готовый список допустимых canonical strings. Zh→en webnovels: test 80 chapters/2 633 sentences из 6 novels; 8 professional translators. §3 печатает 8 585 EN + 6 070 ZH = 14 655 mentions, тогда как abstract конфликтно заявляет 15 095; бесспорным считаю разложенное число. Отдельно 4 zh→en experts размечали document errors; ENTITY 43.3%, COREF 34.0%, TERM 19.2%, ZEROPRO 17.3%, QUOTE 1.1% (категории пересекаются). Это gold bilingual resource/protocol для отдельных entity/term/coreference/quotation audits, не один воспроизводимый production canon score. Нужны annotated source/reference и task-specific evaluator либо человек; межглавная дистанция и character voice не покрыты. Полный локальный дубль research/17,18-chatgpt и семейств BlonDe; дельты источника нет, была ошибка моей интерпретации.
MetaDocEval — contrastive тест самих метрик (Dahan, Bawden, Yvon, EAMT 2026) perturbations + source/reference/system outputs; это meta-evaluation, не production score en→fr/es/de WMT24++, 59150 docs на perturbation/pair, average 11.3 sentences. Document-quality human scores не собирались; один annotator проверил лишь perturbation validity en→fr: n=31/26/19/40 для tense/lexical/conjunction/pronoun (Appendix A.6). Отрицательный результат: ни одна текущая метрика не ловит document coherence надёжно; reference-free COMETKiwi/MetricX-QE к w=9 едва около chance, LLM scorers деградируют, лучший компромисс ≈3 предложения. Style/register и deep coreference не покрыты.
TRANSGRAPH source-grounded cohesion probe (Pham et al., EACL 2026, §3.3.5) English source + candidate; Gemini-2.5-Flash ставит tags только source pronouns/coreferents и conjunctions, затем отмечает корректность target realization; полный reference для score не нужен ACL 60/60: 5 technical talks, 6 en→de/fr/ja/pt/ru/zh directions; avg 84.2 sentences/1 746 tokens, max 101/2 031. Spot-check — только docs 111/410, без числа tags, annotators и IAA: coreference annotation 97.2/98.8%, evaluation 100/100%; conjunction annotation 98/100%, evaluation 93.9/98.4%. Новый reference-free LLM probe для English-source pronoun coreference/conjunction внутри system paper, не отдельно meta-validated metric; human-quality correlation нет. На zh→en не проверен: нужна валидация Chinese source tagging/prompts. Терминология и произвольные entity names этим probe не оцениваются.
mStyleDistance (Qiu et al., Findings ACL 2025) + character-quote verification (Michel et al., LaTeCH-CLfL 2024) target-only quote aggregates с известным speaker; reference не нужен, но для preservation нужен baseline/profile, которого статьи не валидируют mStyleDistance обучен на 9 языках; AV — Greek/Spanish/Dutch (avg ROC-AUC .66). Fictional Voices особенно релевантен English target: 28 English novels, 1 606 chapterwise queries; LUAR character-character AUC .816, но quote attribution .536 против semantic .551. Это style/distinguishability proxy, не human-correlated character voice fidelity. Ни одна работа не валидирует сохранение голоса при переводе или через сотни глав; именно это, а не отсутствие русского, остаётся пробелом. Локально ось уже есть в research/15; боевые first_person/speech пусты 0/49 (experiments/23:4355).
CONSTORY-CHECKER / Consistency Error Density (Huang et al., Findings ACL 2026) только целевая длинная история; o4-mini извлекает и попарно проверяет противоречащие цитаты по 5 dimensions/19 subtypes; external reference/canon не нужен English fiction, prompted на 810k words; фактическая длина diagnostic отдельно не дана. Diagnostic: 200 stories, 1 000 injected errors от Qwen3-235B-A22B-Thinking; 2 professional webnovel writers выступали competing detectors против injected ground truth. Checker: precision .884, recall .550, F1 .678; character F1 .742, factual .718, narrative/style .507; union людей F1 .374. Target-only internal-contradiction detector, валидированный на синтетически внедрённых, не естественных ошибках; human correlation нет. Он не доказывает adherence к source/canon и пропускает последовательный, но неверный перевод. English/Western fiction, одна judge model, не multi-chapter. В локальном корпусе работы не было.

Два близких названия не надо ошибочно превращать в дополнительные canon-scores. SEGALE (Wang et al., EMNLP 2025) переносит COMET/MetricX на неразмеченный поток произвольной длины через cross-lingual segmentation/alignment и допускает reference-free QE. В book experiment модели переводили отдельные 1k/2k/4k/8k-token inputs, нарезанные из одной zh→en книги; MetricX/null-alignment trends там не перепроверялись людьми. Это полезный транспорт оценки, но не проверка межсегментной когерентности, сущностей, фактов или голоса; основная validation — WMT24 en→de/en→es/ja→zh с synthetic 10% deletions/merges и segment-level MQM, где annotators не просили учитывать discourse. Источник уже есть в research/19. S-VoCAL (Berthe-Pardo et al., LREC 2026) действительно имеет 952 characterbook pairs из 192 English books и восемь voice-related attributes, но измеряет вывод age/gender/origin для выбора акустического голоса аудиокниги, а не устойчивость речевого стиля персонажа в переводе. Это book-wide static character-attribute inference benchmark, не voice/style/temporal stability metric; концептуально он повторяет audiobook-passport donor из research/15. Поэтому оба источника очерчивают инфраструктуру, но не закрывают искомый конструкт.

Отдельной family-wise multiplicity correction для перечисленных model/metric grids в просмотренных Results не заявлено; там, где даны correlations/accuracy, они не превращались здесь в более широкий клейм, чем конкретный corpus/task.

Ответ на вопрос о reference-free. Узкий прибор у нас уже есть: D50 считает соблюдение подписанного term/name bank без полного эталона, но известный fullname-alias drift прошёл сквозь него. После повторного поиска без ru-фильтра найден набор частичных, пока не скомпонованных диагностик, а не готовый стек: D50/CoTERM проверяют заданный term canon; L-Anno — lexical sameness на заранее размеченных обязательных pairs; TRANSGRAPH — две English-source discourse relations; CONSTORY-CHECKER — target self-consistency; BWB — отдельные gold-аудиты на zh→en chapters. Эти приборы имеют разные inputs, направления, домены и units и совместно на одной zh→en книге не валидировались. LTCR и SemenovBojar без канона доказывают только самосогласованность.

Следовательно, на 31.08.2026 нет одной валидированной метрики «канон держится на сотнях глав» и нельзя заявить, что перечисленные компоненты уже доказательно складываются. Есть эмпирические части для отдельной проверки терминов, обязательного единообразия, некоторых source relations и внутренних narrative contradictions. Самые слабые места — стабильно неверный относительно source факт, межглавная identity/alias resolution и сохранение именно речевого голоса персонажа при переводе: CONSTORY-CHECKER имеет narrative/style F1 .507 только на injected internal shifts, а не на сходстве с голосом китайского оригинала.

Контрольная сводка четырёх клеймов из запроса

Клейм Вердикт после исполнения Насколько широко можно говорить
Бесплатные detectors по diversity/diminutives Частично. ATD classifiers и structural translationese-панели валидированы; MTLD/diminutive signals проверены на одной en→uk книге. Язык не обнуляет класс сигналов, но языково-зависимые features надо переопределять. Нет held-out detector для длинного современного LLM-литперевода; отдельный scalar не годится как machine label.
Source visibility переворачивает systems ranking Да, по Table 34 F6a: один и тот же GPT-5.2 judge, те же pairs; все AI systems падают ровно на 5 ranks без source. Одна en→uk книга, sentence pairs, self-judge, без significance test; не универсальный закон.
LLM чаще человека объявляет ошибкой human translation Да, F6b: GLM z=2.07, p=.038 для HT; одновременно judge реже ставит ошибки MT (z=6.16, p<.001). Один GPT-5.2 judge, 6 текстов по 97182 слова, en→nl/en→ca/ru→nl; без →ru и без книги.
Плохо отобранный context хуже пустого Да для injected distractors, Loong §4.4/Figure 4; нет для наивного сравнения w/o Tuning vs w/o Context из-за confound. Automatic metrics на News/WMT; точных figure-values/significance нет. Локально это уже прямой дубль research/13,14, поэтому не новая находка.

3. Противоречия нашим выводам

C1. Прямая внутренняя коллизия: цена diff в промте устарела относительно review-header

Жёсткий контур задания пересказывает локальный diff как «1.52 раза дороже». Первичный артефакт experiments/19-editor-contract-q4b.md в принятой review-header даёт три реплики отношения diff/full: 2.913, 1.677, 2.468, а позднейшая поправка сужает взаимодействие до model×target: dspro ru 2.83, en 0.67. Команда проверки:

rg -n '2\.913|1\.677|2\.468|ru 2\.83|en 0\.67|1\.52' \
  eval/dovodka/PROMPT-RESEARCH-HARNESS.md docs/experiments/19-editor-contract-q4b.md

Это не меняет локальный вердикт для боевой ru-клетки («full-regen остаётся»), но опровергает упрощённую универсальную магнитуду и особенно важно рядом с F4: его «edit contract» нельзя считать внешней репликацией нашего формата.

C2. Внешний counter-signal к «feedback/point repair отклонены», но не опровержение

experiments/21-role-topology отклонил точечный ремонт, обратную связку и routing на нашей прозе/нашем риге. Более близкий аналог — critic→full rewrite Z1 в experiments/23-editor-tier: ставка semantic critic→fixer не подтверждена и схема оказалась самой дорогой среди проверенных, но exp23 ещё идёт, а rank-order позиционно confounded. Внешний F4-paper получил рост two-stage evaluator→repair в 4/7 en→de и 6/7 en→zh COMET-сравнениях и регрессию второго раунда в 6/7 en→de клеток (Tables 5, 4). Условия не изоморфны: F4 — e-commerce segments, RAG из 135184k TM, full-hypothesis output, automatic metrics, без significance. Поэтому закрытый вывод exp21 не снят, а exp23 не ратифицирован; внешний результат лишь показывает, что направление первого repair-step не является универсальным MT-законом.

C3. «Архитектура улучшает качество» расщепляется по измеряемой оси

Закрытый exp21 показывает преимущество draft→whole-chapter rewriter по локальному прибору; exp23 здесь не используется как ратифицированная улика. F1 на той же модели показывает эффект другой topology лишь по fluency (r=.71 LCDhuman), ноль по accuracy (r=.02) и одновременно систематические additions. F2 также находит основной выигрыш refinement во fluency/style, а accuracy — слабой/неоднородной. Это не опровергает локальную дельту, но противоречит её широкой трактовке как единого scalar «качества»: topology может улучшать fluency без доказанного улучшения accuracy; fidelity-эффект неоднороден, а voice в F1/F2 не измерен.

4. ЧЕГО НАЙТИ НЕ УДАЛОСЬ и ЧТО НЕ ПРОВЕРЕНО

  1. Нет matched-замера «список исполнимых правок vs полный переписанный текст» на литературе. F4 оказался ложным кандидатом: structured list выдаёт evaluator, но editor возвращает full hypothesis. F2 тоже делает rewrite сегмента. Внешнего подтверждения/опровержения нашему Q4b-формату не найдено.
  2. Нет human book-length сравнения topology. F1 переводит главы, но судит 30 коротких отрывков; F2 генерирует документы примерно по 2 048 слов, но human annotators судят contiguous chunks; F3 имеет 12 глав классики, но только automatic curves; F6a покрывает корпус одной книги, но сравнивает отдельные sentence pairs, не читает книгу/голос/когезию. Перенос «отрывок/глава → 1 5002 300 глав» не проверен.
  3. Нет измеренной памяти через сотни глав. Ни retention имён/обращений/голоса на поздних главах, ни окупаемости whole-book pre-pass/series bible с человеческим судьёй не найдено. Loong — ближайший прототип, но его literary human-eval и опубликованный код отсутствуют.
  4. Thinking: quality и cost одновременно не закрыты. F5 измеряет quality кратких literary UCP, но не reasoning tokens/деньги; Loong признаёт overhead без чисел. Локальный DRT даёт token multiplier, однако новой литературной pricequality frontier после нашего среза не найдено.
  5. Pair-specific →ru calibration не найдена, но это не блокирует архитектурный вывод. F2 включает en→ru, однако human Table 4 агрегирует семь направлений; F6b имеет ru→nl, не →ru. Для проверки самих constructs данные zh→en/en→uk/en→ja засчитываются; отдельная пара нужна лишь для калибровки языково-зависимых extractors, morphology и thresholds.
  6. Не найдены debates/jury топологии с книжным human-замером. Selection/synthesis/debate уже покрыты локально; свежего более сильного literary evidence дельта-фильтр не дал.
  7. Market/OSS-поиск не дал хронологической или измерительной дельты. Три пропуска research/22 оказались старше его среза 24.07, а их механизмы повторяют уже известные слои: Balint Taborski, 07.06.2026, BookTranslate Copilot заявляет Finalizer→Naturalizer→ThreadWeaver→reviewable edits; неподписанная BookFoundry company page с live-total stamp 17.07.2026 — book brief→chunk translation→native-voice rewrite; GitHub OYcedar/novel-translator — stable IDs, glossary, summary, resumability и guards (main.py, prompts/novel_translation_system.md, skills/novel-translator/SKILL.md). Ни один не публикует comparative literary quality corpus, пары, human judge и статистику. Поэтому отсутствие имён в research/22 — omission старого среза, не основание выдавать их за новую находку.
  8. Multiplicity часто отсутствует. Она есть у F1 pairwise fluency/accuracy (Bonferroni) и у F6b modality post-hoc (HolmBonferroni); не заявлена у F2 Table 4/трёх Table 5 tests, F3, F4, F5 model×prompt grid и F6a rank reversal. Значимость там не достраивалась мной из процентов.
  9. Цена вызовов F1/F2/F3 не опубликована. Поэтому число стадий не превращалось в выдуманный COGS: F1 не даёт calls/tokens; F2 — токены/cost; F3 — overhead/call count в агрегате.
  10. Платных закрытых источников, несущих уникальную таблицу, в итог не включено. HTML print F1 отдавал 403 при финальной перепроверке; официальный publisher PDF открылся после redirect с HTTP 200. Остальным несущим источникам доступны официальные PDF/HTML.
  11. Два claims первоисточников остались неподтверждёнными телом. Loong пишет «code is released», но linked repo на 31.08 содержит только README. F4 abstract заявляет agreement с human MQM/preferences, но в Methods/Results нет human-study/table. Это source self-contradictions, не противоречия локальному выводу; claims выше не считаются measured.
  12. Не найден long-form literary machine-detector ни на одной подходящей паре. RuATD валидирует short-form ATD, RANLP-2021 — human translationese, а en→uk book study даёт сигналы, но не classifier. Пробел — held-out accuracy, threshold и false-positive rate на длинных переводах современных LLM, а не конкретно русский язык.
  13. Не найден единый reference-free canon score; найдены нескомпонованные частичные приборы. D50/CoTERM закрывают term-only canon, L-Anno — обязательность единообразия на gold subset, TRANSGRAPH — две English-source relations, CONSTORY-CHECKER — внутренние contradictions, BWB — дорогую gold-разметку четырёх discourse-осей. Не валидированы их совместное применение на одной zh→en книге, межглавная identity/alias resolution и работа на сотнях глав.
  14. Не найден валидированный MT character-voice preservation score. CONSTORY-CHECKER уже распознаёт внутренние POV/tone/style shifts на English fiction (narrative/style F1 .507), а style/authorship embeddings различают персонажей. Но ни один прибор не проверен как source-character voice → translated-character voice; MetaDocEval также показывает размывание общих document metrics на коротких окнах.

Отдельно исключён как дубль Wu, Aycock, Monz, Please Translate Again: research/15:158,272 уже содержит его главную дельту (decomposition не помогает, первый простой refinement даёт основной выигрыш). Повтор не стал находкой.

5. ЧТО Я НАПУТАЛ

Ниже журнал не косметических правок, а ошибок, которые могли изменить вывод.

Ошибка до самопроверки Класс Как поймана Что стало в отчёте
Сначала счёл Please Translate Again новой осью reasoning. дубль rg -n -i '2506\.04521|translate again' docs/research нашёл research/15:158,272. Источник вынесен в §4 как осознанно исключённый дубль.
Сначала счёл refinement-paper новой topology. дубль/overclaim Первичный grep смотрел docs/research и только docs/experiments/README.md. Полный rg -l ... docs/research docs/experiments нашёл 8 старых файлов: research/{03,11,14,17,18} и experiments/{09,12,23}; эта запись была девятым местом. F2 понижен до библиографической верификации/закрытия TODO; все delta-команды переведены на полный корпус и исключают оба параллельных 29-файла.
Записал Loong как однозначно 10-sentence segmentation. внутреннее противоречие source §4.1 задаёт l=5, Limitations — 10. Число снято из описания topology; обе несовместимые величины и их секции названы явно.
Принял w/o Tuning=75.4 < w/o Context=77.4 за доказательство «плохой context хуже пустого». confounded arms §4.3 меняет training/context policy одновременно; §4.4 отдельно инъецирует 3050 чужих предложений и имеет baseline length 0. Клейм опирается только на Figure 4; Table 3 прямо исключена как чистая проверка. Сам клейм отмечен дублем research/13,14.
Был готов назвать все translationese-признаки machine-detectors. construct mismatch RANLP-2021 обучен отличать человеческие переводы от оригинальной русской прозы; RuATD — другой target. F7 разделяет ATD, translationese и stylistic compression; порогового long-form literary LLM detector не заявляет.
Использовал отсутствие русского как слишком сильный отрицательный фильтр. неверная граница переноса В контуре проекта zh→en — приоритетная пара; LTCR проверен на zh↔en, а BlonDe — прямо на zh→en webnovels. Для entity/term-consistency язык меняет инструменты извлечения, но не сам измеряемый конструкт. F7/F8 и §4 переписаны: zh→en evidence засчитывается полностью; caveat оставлен только для morphology/NER/alignment/thresholds и действительно отсутствующей long-range validation.
Сначала исправил только формулировки, не перезапустив discovery без языкового фильтра. неполная коррекция search scope После прямого вопроса владельца выполнен новый primary-source поиск и полный дедуп по обоим деревьям. Он нашёл отсутствующие локально zh→en L-Anno, TRANSGRAPH cohesion probe и CONSTORY-CHECKER; BWB был локально известен, но не распознан мной как gold audit resource. F8 переисследован: добавлены точные inputs, samples, human validation и границы; итог расширен от одних term monitors до нескольких частичных диагностик.
После пере-поиска преждевременно назвал несовместимые диагностики «составным измерительным стеком». композиционный overclaim Оба повторных reviewer-а независимо указали: L-Anno — reverse-origin news/gold subset; TRANSGRAPH — English-source technical probe; CONSTORY — target-only injected contradictions; BWB — reference benchmark и локальный дубль. Совместной zh→en book validation нет. «Готовый стек» снят. F8 теперь говорит о нескомпонованных частичных приборах; уточнены direction/reference/validation, конфликт BWB 14 655 vs 15 095 и segment-only book experiment SEGALE.
Почти назвал LTCR/стилевые embeddings единым canon score. consistency≠correctness / proxy≠validation Формула LTCR даёт 100% стабильно неверной форме; mStyleDistance AV не валидирован на переводе; MetaDocEval показывает collapse с длиной. F8 разделён на internal consistency, term-only correctness и unvalidated character-voice proxy; итог — единого прибора нет.
В первом ответе на вопрос о каноне сказал только «внешнего единого прибора нет» и пропустил наш D50. тот же дефект неполного experiments-grep Полный поиск `canon_gaps effective consistencyподнялexperiments/23` §Д32.4/Д50: 375548 пар и известный невидимый fullname drift.
Сначала слишком грубо описал CoTERM как обязательно требующий полного перевода-эталона и перенёс 79 dev chapters BlonDe в test. неточная граница reference-free / ошибка split Повторный evidence_audit: CoTERM+ использует source terms и набор допустимых целевых терминов без полного sentence reference; Table 1 BlonDe печатает 80 test / 79 dev chapters. В F8 разведены CoTERM+, CoTERM и полный framework; split и human-correlation BlonDe исправлены по таблице.
Сжал результат F7-grep до research/12-* и не перечислил research/28. неточная запись дедупа Финальный буквальный повтор той же команды дал 13 файлов: 11 research и 2 experiments; из семейства 12 — только consumer/taxonomies/ja/zh. Реестр F7 заменён точным списком вывода, команда переключена с -n на согласованный с результатом -l.
По названию «edit contract» почти приравнял F4 к нашему diff. construct mismatch Полный PDF §3.4: editor outputs new hypothesis и edit log. В F4 и §4 явно записано: это full output, matched diff-vs-full замера нет.
Перенёс из задания «diff 1.52× дороже». stale summary / позднее противоречие Review-header experiments/19 первична: 2.913/1.677/2.468; позднее ru 2.83/en 0.67. Исправлено и вынесено отдельным C1.
Был готов повторить F4 abstract про human MQM agreement/preferences. abstract вместо таблицы find/поиск human по 16-страничному PDF не нашёл human-study в Methods/Results. Claim помечен неподтверждённым и не используется как measured evidence.
Принял фразу Loong «code is released» за наличие реализации. claim/code mismatch Открыто дерево linked GitHub: только README, implementation отсутствует. F3 разделяет paper algorithm и фактически отсутствующий public code.
Счёл Creativity Bias целиком новой. частичный дубль grep нашёл ссылку и общий вывод в research/18:326. F6b оставлен только ради отсутствующих локально точных modality/genre/human таблиц.
Почти выдал 12 глав Journey to the West за книжную проверку качества. перенос/слабый judge Table/Figure и Limitations Loong: известная классика, automatic metrics, без human eval. В F3 это только preliminary stability evidence; в §4 book-length human gap остаётся открытым.
Title-only grep ошибочно объявил F1 полностью новой. ложная дельта/дубль Adversarial delta_transfer_audit нашёл DOI и «stylistic lift with occasional additions» в research/17:243,287. F1 сужен до восстановленного full text, exact design/sample/effects; grep расширен DOI/авторами.
Назвал F2 human-оценку документной. перенос единицы оценки delta_transfer_audit проверил Appendix A.5: outputs document-level, annotators видели contiguous chunks. В F2 и §4 разделены document generation и chunk-level human judgment.
Назвал F6a контролем «на целой книге». перенос corpus→unit delta_transfer_audit проверил Methods §4: corpus покрывает книгу, pairwise unit — два предложения. F6a понижен до sentence-pair construct-control; voice/cohesion не приписываются.
Слил статус exp2123 и выдал exp23 price/rank за готовый. поздняя review-header Adversarial-аудит поднял experiments/README: exp23 ИДЁТ, --final красный; D48.5 нашёл position confound. §1 разделяет exp21/22/23; C2/C3 не используют exp23 как ратифицированный результат.
Сравнил F4 только с exp21 point repair. неверный ближайший аналог delta_transfer_audit нашёл более близкий exp23 Z1 critic→full rewrite. C2 сравнивает обе формы и явно помечает exp23 provisional.
Выдал три рыночных пропуска research/22 за новинки после его среза. хронологическая ложная дельта Adversarial-аудит сопоставил даты BookTranslate/BookFoundry/OYcedar со срезом 24.07. F7 удалён из находок; источники оставлены в §4 как старые omissions без quality baseline.
Приписал F1/F2 возможное ухудшение voice. construct overclaim Оба агента указали: voice не мерили; F1 accuracy равна, additions качественные. C3 теперь говорит только о fluency без доказанного accuracy-gain; fidelity неоднородна, voice unmeasured.
В F5 смешал Task 1 comprehension с Task 2 translation. task/judge conflation evidence_audit развёл §3.1/§5.1 и Table 1/13. Добавлены n=299, отдельные judges/пары и прямые thinking-сравнения Task 2 из Table 13.
Ссылка F1 print оказалась нестабильной (403). URL verification evidence_audit повторил запрос; затем curl -s -I -L publisher PDF дал redirect→200. Все F1-ссылки заменены открывшимся publisher PDF; 403 записан в §4.
Delta-grep после создания файла находил сам отчёт. невоспроизводимый артефакт Повторный запуск вернул строки 29-…-codex.md вместо ожидаемого Ø. Во все команды добавлен --glob '!29-harness-topology-survey-codex.md', результаты пересняты.

Исполнимая финальная сверка

Ссылки в F1F8 и §4 были открыты по одной; числа сверены не с abstract, а с названными Tables/Results/Methods. Механические проверки артефакта перед сдачей:

# ровно пять требуемых разделов верхнего уровня
rg -n '^## [1-5]\.' docs/research/29-harness-topology-survey-codex.md
# запрет placeholder и прескриптивного языка до самого технического блока; ожидается Ø
awk '/^### Исполнимая финальная сверка/{exit}{print}' \
  docs/research/29-harness-topology-survey-codex.md | \
  rg -n -i 'Заполняется|TBD|PLACEHOLDER|рекомендую внедрить|надо внедрить|нужно внедрить|следует внедрить|стоит внедрить|лучший выбор|robust.?рецепт'
# все внешние URL до этого технического блока (список для повторного открытия)
awk '/^### Исполнимая финальная сверка/{exit}{print}' \
  docs/research/29-harness-topology-survey-codex.md | rg -o 'https?://[^ )]+' | sort -u

Артефакт открытия ссылок

Проверено 31.08.2026; 200 означает, что открылось тело, а не только search result.

URL Фактический результат
publisher PDF F1 curl -s -I -L: 301→200, content-type: application/pdf; прежний HTML print — 403.
F2 ACL PDF 200; открыты §3, Tables 1, 37, Appendix A.5.
F3 arXiv HTML 200; открыты Algorithm 1, Tables 14/A.4.
F3 GitHub 200; public tree содержал только README.
F4 ACL PDF 200; открыты §3.4, Tables 15, 8, 10.
F5 ACL PDF 200; открыты §§35, Tables 1, 13.
F5 GitHub 200; открыты root и task2_ucp/ paths.
F6a ACL PDF 200; открыты Methods §4, Tables 24.
F6b ACL PDF 200; открыты Tables 45, 1112.
F6b GitHub 200; открыты каталоги protocols/data/statistics.
RuATD 2022 200; открыты Tables 25 и §§4.45.
Russian fiction translationese 200; открыты Results и Appendix Table 2.
LTCR 200; открыты формула (1), Tables 1, 4, 7, 9.
SemenovBojar 200; открыты algorithm, Tables 13, Limitations.
CoTERM 200; открыты §§3, 4, 69, Tables 2, 56.
BlonDe 200; открыты BWB/Table 1, formula, human study.
L-Anno zh→en 200; открыты §§23, Tables 16, Appendix A.
BWB discourse protocol 200; открыты §§25, Tables 17, Appendix E; зафиксирован конфликт abstract 15 095 vs §3 8 585+6 070=14 655.
TRANSGRAPH cohesion judge 200; открыты §§3.13.3.5, Tables 2, 7, 9.
CONSTORY-CHECKER 200; открыты §§23, Tables 17, Limitations и prompts.
SEGALE 200; открыты §§3, 56, Tables 13, Figure 3 и Limitations.
S-VoCAL 200; проверены task, 8 attributes, 952 characterbook pairs и scope аудиокниг.
MetaDocEval 200; открыты §§3, 57, Table 1/Figures.
mStyleDistance 200; открыты language list, Tables 12, ru dataset appendix.
Distinguishing Fictional Voices 200; открыты §3 and Table 2.
BookTranslate 200; author/date/topology проверены в body.
BookFoundry 200; неподписанная company page, stamp и topology проверены в body.
OYcedar 200; root paths/README открыты.
Please Translate Again 200; удалён из находок как локальный дубль.

Артефакт adversarial-review

Одновременно работали два read-only reviewer-а, кроме основной сессии; модель обоим задана явно: gpt-5.6-sol, reasoning high. evidence_audit проверял claimed/measured, tables, judges, URLs и обязательную форму; delta_transfer_audit — дубли, short→book, поздние review-header и переносимость. Оба запретили себе правки файлов и вернули нумерованные вердикты.

Принято и исправлено: скрытый дубль F1 в research/17; ACL-final F2 уже там же; chunk-level human unit F2; sentence-pair unit F6a; смешение двух задач F5; нестабильная ссылка F1; неполные judge/pair metadata F2F4; source-vs-itself C4 перенесён из §3; обе ссылки добавлены C1C3; provisional/position-confounded статус exp23; ближайший локальный аналог F4; ложная рыночная хронология F7; voice-overclaim C3; self-matching delta-grep и неисполняемая вторая F6-команда. Каждая содержательная ошибка имеет отдельную строку в таблице выше.

Принято частично: reviewer предлагал удалить либо полностью демотировать F2 как дубль. Архитектурный клейм демотирован, но запись сохранена, потому что она закрывает явный локальный TODO о составе пар и добавляет exact human tables/границу chunk-level judging. Иных содержательных замечаний не отклонено. Оба reviewer-а отдельно подтвердили пять разделов в нужном порядке, transfer caveats, отсутствие рекомендации внедрения и корректность n=102 F2/6 из 7 F4.

Для отдельного вопроса №8 обоим reviewer-ам был независимо отправлен второй, одинаково сформулированный запрос именно про измеритель канона, а не про память. delta_transfer_audit повторил полный локальный поиск одновременно по docs/research/*.md и docs/experiments/*.md и нашёл пропущенный D50 вместе с его false negative 古月方源 → «Гу Юэ Фан Юань» вместо Гуюэ. evidence_audit независимо пересчитал формулы, выборки и human-validation LTCR, CoTERM, BlonDe, MetaDocEval, mStyleDistance и Fictional Voices. Приняты его поправки о term-only reference CoTERM+, умеренных, а не универсально сильных корреляциях CoTERM, split 80 test / 79 dev BlonDe и крайне узкой ручной проверке perturbations MetaDocEval. Совместный отрицательный итог обоих аудитов сохранён в F8: есть несколько частичных приборов, включая наш reference-free D50, но ни один не валидирован как единая мера сохранения сущностей, терминов, фактов и голоса на сотнях глав без полного эталонного перевода. Reviewer-ы файлов не изменяли.

После замечания владельца о допустимости zh→en выполнен новый discovery-pass без языкового фильтра, а затем оба reviewer-а получили третий независимый запрос уже по новым источникам. Они подтвердили числа L-Anno, TRANSGRAPH, CONSTORY-CHECKER, SEGALE и S-VoCAL, но независимо сняли мою формулировку «составной измерительный стек». Приняты все их существенные поправки: reverse-origin/reference-dependent construction L-Anno; только en→XX technical validation TRANSGRAPH; target-only/injected-error nature CONSTORY; BWB как полный локальный дубль и gold resource, а не canon scalar; SEGALE как segment wrapper, не межглавный book meter; S-VoCAL как static TTS-attribute extraction. Дополнительно evidence_audit нашёл внутренний конфликт BWB: abstract сообщает 15 095 mentions, тогда как §3 печатает 8 585+6 070=14 655; в F8 оставлено разложенное число и записано противоречие. Reviewer-ы файлов не изменяли.