textmachine/docs/research/18-quality-levers.md

345 lines
77 KiB
Markdown
Raw Permalink Blame History

This file contains invisible Unicode characters

This file contains invisible Unicode characters that are indistinguishable to humans but may be processed differently by a computer. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

# research/18 — Рычаги качества: как дотянуть текущую фазу до минимально-художественного zh→ru
<!-- ─────────────────────────────────────────────────────────────────────────
ОРКЕСТРАТОР — РЕВЬЮ-ШАПКА (лендинг, D36, 12.07 №4). Тело §A НЕ тронуто (заморожено;
sha256 44f90364… СВЕРЕН побайтно из закоммиченных байтов между BEGIN/END → MATCH →
§A доказуемо не редактировалась после заморозки). Поправки — в этой шапке и в §E
(«испр. оркестратором»). Полный разбор — PROGRESS §лендинг D36 + D-лог D36.
ВЕРДИКТ: **ACCEPT_WITH_FIXES.** Более ценный из двух входов: единственный отвечает на
вопрос владельца «конвенция vs стиль» с zh→ru источниками; строгость по COGS; честные
само-поправки; каждый §C-арм привязан к D-номерам и re-gate D34.3. Несущий диагноз и
набор §C-армов подтверждены; дефекты — цитатно-рамочные, ядро не рушат.
НЕЗАВИСИМАЯ ВЕРИФИКАЦИЯ (мультиагентный воркфлоу, 26 агентов, первоисточники + реплика
сырья, $0, refute-by-default; author≠reviewer к отчёту):
- **Источники: 57/57 несущих цитат СУЩЕСТВУЮТ — 0 сфабрикованных.** Проверены ВСЕ «2026»-
препринты (2601.08070 / 2605.31056 / 2605.29800 / 2605.13596 / 2605.13368 / 2511.09796
и др. резолвятся на arXiv к заявленным заголовкам). 50/57 — claim-fidelity полная; 7 —
«частично» (источник реален, атрибуция переисчерпана; поправки 13 ниже).
- **Эмпирика воспроизведена на сырье:** ch5.0 (draft 5425 симв.→финал ПУСТ, `sanitizer_defect`)
и ch20.0 — ТОЧНО; CJK-утечка **13 финалов — точно** (draft-«21» включает U+3000-отступ —
настоящих иероглифов в draft = 9); 41/51 ~1:1 — в допуске (знаменатель точен, числитель
толеранс-чувствителен, вывод устойчив); gl.7-инверсия (没有一个不知道→«никто не знал») и
gl.8-сплющивание (物是人非→«всё изменилось») — фактически ПРИСУТСТВУЮТ (тяжесть — на
fidelity re-gate полигона, не здесь).
- **Ван Цуй (несущий вклад) — ПОДТВЕРЖДЁН по ТЕЛУ статьи:** скептик-агент декодировал
CID/Identity-H шрифт PDF (~42к симв., 7 ToUnicode-CMap) → 5 техник verbatim + причастные/
деепричастные обороты + подчинение как инструмент слияния + прескриптивная необходимость.
Вестник МГУ Сер.22, 2024 №3, с.86105, DOI 10.55959/MSU2074-6636-22-2024-17-3-86-105,
рецензирован — реальный peer-reviewed источник (не экстраполяция).
- **Анти-анкоринг:** гардрейлов не нарушено; ни один D-номер не течёт в §A; книжные цитаты
≤15 слов. Минор-провенанс: «(идея владельца)» на слое конвенций пары (§A4.4) не
прослеживается к разрешённым фазе-1 входам (возможна устная вводная — не задокументирована).
ПОПРАВКИ К ЛЕНДИНГУ (§A заморожена → корректны здесь; §E дополнена ниже):
1. **[цитата] DocRepair-числа** (deixis 50.0→91.8 / когезия 45.9→80.6 / эллипсис 53.0→86.4 /
73% предпочтения; §A4.8, §B2.4) — числа ВСЕ верны, но принадлежат ОТДЕЛЬНОЙ статье DocRepair
«Context-Aware Monolingual Repair for NMT» (EMNLP-IJCNLP 2019, aclanthology **D19-1081** /
arXiv **1909.01383**), НЕ процитированной ACL-2019 **P19-1116** (там CADec 50.0→81.6). Обе
Voita/Sennrich/Titov 2019. Вывод (монолингв. RU repair-пасс работает, EN→RU, с этими
магнитудами) СТОИТ; правка — расщепить две цитаты (сделано в §E).
2. **[цитата] TransAgents** — §A зовёт «TACL-версия» (arXiv 2405.11804, «To appear at TACL» —
подтверждено), §E зовёт «PP 2024-05»: выбрать одно (accepted-but-preprint точнее). Это
ДРУГАЯ статья, чем EMNLP-demo `2024.emnlp-demo.14` в ChatGPT-отчёте — не конфликт, две
реальные статьи об одной системе (см. §E).
3. **[цитата] Z5 «Li & Thompson»** (RG 235852523) — на деле Dingxu Shi, «Topic and Topic-Comment
Constructions in Mandarin» (Language 76(2), 2000); клейм топик-комментария верен, автор-метка
ошибочна. **Z8 «96% чэнъюй»** — числа НЕТ на процитированной Wikipedia (там «most»); суть
(подавляющее большинство четырёхзнаковые) верна, «96%» не источено.
4. **[рамка] Ван Цуй = прескрипция переводческой ТЕХНИКИ zh→ru, не «связующая норма языка».**
Рамка §A4.4/A5 «обязательная дискурс-операция наравне с нормой» слегка пере-возвышена: это
сильнейший маргинальный вклад отчёта (peer-reviewed техника: паратаксис→гипотаксис), но
ответ владельцу «конвенция, не стиль автора» несут в первую очередь Розенталь/Правила-1956
(нормы абзаца/диалога — CONFIRMED), а Ван Цуй — КАК их технически исполнить.
5. **[рамка] «Пост-черновая регрессия > многих качественных проблем»** (§A4.1/A2 headline) —
переоценено: ярчайший кейс (ch5.0-void) сам же исправлен в §B3 как ЭКСПОРТ-баг (не порча
смысла редактором); остаток = реальные, но узкие CJK-утечки + НЕподтверждённые инверсии (§A
помечает PLAUSIBLE). «Класс пост-черновой порчи существует» — честен; ранг «выше 2 претензий
владельца» — нет. Guard §C#5 всё равно дёшев → строить.
6. **[рамка] «Тройная сходимость»** (§B0) — оговорка про общую внешне-лит-ногу ПРИСУТСТВУЕТ и
честна (планка D25.10 взята). Уточнения оркестратора: (а) есть ВТОРАЯ необъявленная общая нога
оба §A читали одно сырьё/код (совпадение по «изоляции чанков / инертному reflow» тоже не
независимо); (б) цитатные базы двух отчётов почти НЕ пересекаются (~3 общие статьи) → там, где
литература всё же расходится, совпадение вывода СИЛЬНЕЕ, чем оговорка допускает; (в)
ChatGPT-заморозку класть в вес сходимости с дисконтом — её sha256 НЕ воспроизводится из
документа (внешний прогон владельца; см. шапку ChatGPT-отчёта).
───────────────────────────────────────────────────────────────────────────── -->
> Ресёрч-доклад независимой сессии-ресёрчера (D35.5). Вход эмпирической сессии полигона.
> Протокол — трёхфазный анти-анкоринг: §A построена ДО чтения наших решений (только две претензии владельца + сырьё пере-прогона + механизм-как-есть + собственный внешний ресёрч). §B/§C/§D — после чтения нашего стека.
> Каждый несущий клейм: вердикт **CONFIRMED / PLAUSIBLE / REFUTED** + источник (тип/дата). Препринт ≠ peer-review; вендор-клейм ≠ независимый замер; результат «в английский» ≠ доказательство «в русский» (помечаю экстраполяцию явно). Отчёт пройдёт адверсариальную верификацию оркестратора по первоисточникам.
---
<!-- BEGIN §A FROZEN — не редактировать после заморозки; sha256 ниже в маркере -->
## §A — «Чистый лист» (заморожено)
### A0. Метод и границы
Прочитано в фазе 1 (разрешённое): две претензии владельца; сырьё пере-прогона — исходник `guzhenren-slice25.gb18030.txt`, `rerun/records.json` (по-чанково: source/draft/final/флаги), `rerun/rerun-ru.txt`; механизм-как-есть — `backend/internal/pipeline/chunker.go`, `backend/prompts/{translator,editor}.md`. Плюс собственный внешний веб-ресёрч (52-агентный фан-аут с адверсариальной верификацией).
НЕ читалось (анти-анкоринг): `05-decisions-log.md`, хендоффы (`ORCHESTRATOR_HANDOFF.md`, `FIDELITY_REGATE_HANDOFF.md`), `rootcause_auto.json`, glossary-signoff, `diag/arms/*`, выводы приёмки. Заголовки последних коммитов присутствовали в среде сессии ambient — на содержание §A не опирался.
### A1. Механизм как есть (из кода и промптов)
- **Нарезка** (`chunker.go`): жадно пакует ЦЕЛЫЕ абзацы до `targetChunkTokens=1500` (код-конст, версионируется `chunkerVersion`, фолдится в снапшот); абзац сверх бюджета спускается к границам ПРЕДЛОЖЕНИЙ (предложение не рвётся). Детерминированно, чисто. Фактически ~2 чанка на главу (57 чанков / 25 глав), медиана исходного чанка ~1639 zh-символов.
- **Пайплайн**: по-чанково ПЕРЕВОД (draft) → по-чанково РЕДАКТУРА (bilingual, source+draft). Каждый чанк — в ИЗОЛЯЦИИ. НЕТ overlap между чанками, НЕТ running-summary, НЕТ контекста прошлых глав. Единственная кросс-чанковая память — термин-ГЛОССАРИЙ, добавляемый редактору.
- **translator.md**: только `{{text}}`; инструкции — «живой литературный русский», верстать по нормам РЯ (НЕ копировать построчную разбивку), прямая речь через тире.
- **editor.md**: bilingual, `{{text}}`(src)+`{{draft}}`; сверять смысл с исходником, убирать кальки, глоссарий СТРОГО; «собирай повествование в естественные русские абзацы (не копируя построчную разбивку)»; полнота — не выбрасывать/не добавлять.
### A2. Замеренная слабость (сырьё)
**Претензия 1 (рубленость) — ПОДТВЕРЖДЕНА замером.** 41/51 нарративных чанков дают ~1:1 отношение «финальных абзацев к строкам исходника»; 58% ненарративных абзацев — одно предложение; медиана предложений/нарративный-абзац = 1.0. Инструкция reflow, присутствующая в ОБОИХ промптах, практически инертна.
**Локализация reflow-провала.** Черновик уже рубленый в 43/49 чанков (переводчик зеркалит построчную разбивку). Редактор СОХРАНЯЕТ структуру черновика в 37/49, СЛИВАЕТ лишь в 1/49 → редактор структуро-сохраняющий, НЕ работает layout-пассом. Вариативность reflow живёт в основном на стадии черновика (гл.11 черновик 25 абз., гл.13 — 14: переводчик там СЛИЛ). Оформление диалогов через тире — работает.
**Претензия 2 (связность/смысл) — ПОДТВЕРЖДЕНА чтением zh↔ru гл.512.** На уровне ПРЕДЛОЖЕНИЯ голос в целом приемлем, редактура часто улучшает (внутренний монолог в кавычках, разбивка атрибуции, лексические апгрейды). «Слабая художественность» идёт не от предложенческой translationese, а от кластера сбоев связности/полноты/терминологии. Конкретика:
- гл.7: инверсия двойного отрицания 没有一个不知道 («все знали») → «никто не знал» (противоречит главе). [дефект в черновике, редактура не починила]
- гл.8: 物是人非 (заглавие-ключ) сплющено до «всё изменилось», теряя контраст «вещи те же — люди иные».
- Терминология grade-системы 甲乙丙丁 — дрейф между разряд А/Б/В/Г, числовым «первого/третьего ранга» (коллизия с 转-рангом гу-мастера) и точечными сырыми глифами.
**Третья ось, НЕ входившая в претензии владельца (самое ценное наблюдение):** значимая доля «слабой художественности» — это РЕГРЕССИЯ ПОСЛЕ ЧЕРНОВИКА, а не качество перевода. Финал местами ХУЖЕ черновика:
- **гл.5.0: полный черновик 5425 симв. → финал ПУСТ, `edit_flag='sanitizer_defect'`** (собственный флаг пайплайна). Санитайзер обнулил целый чанк — миф об основании (Жэнь-цзу и три гу, метафора-ядро книги). Один из 2 пустых финалов на книгу. **[CONFIRMED — проверено мной по records.json.]**
- **Утечка CJK-глифов в вывод**: 13 строк финалов (и 21 строка черновиков) содержат сырые zh/полноширинные глифы; часть внесена редактурой (напр. гл.8 特产, гл.4.1 资质乙等 — в черновике корректно). **[CONFIRMED — проверено мной.]**
- Правки, ломающие смысл: гл.9 (переворот разряда В→Б у Фан Юаня, против всей его сюжетной линии низкого разряда), гл.10 (перекройка процентов восстановления в противоречивые «десятые/сотые») — **[PLAUSIBLE — наблюдение чтения; требует адверсариальной re-проверки оркестратором.]**
Вывод A2: перед постройкой машинерии связности имеет смысл СНАЧАЛА не давать пост-черновым стадиям (edit/sanitizer) разрушать уже годный черновик.
### A3. Карта «проблема → механизм» по осям
#### Ось 1. Дискурс-гранулярность zh→ru: где потолок — в моделях или в организации?
- **Абзац — эмпирически лучшая единица перевода, чем предложение** (меньше mistranslation/грамматики/несогласованности, естественнее верстается). **[CONFIRMED]** — Karpinska & Iyyer, *LLMs Effectively Leverage Document-level Context for Literary Translation* (WMT 2023, peer-reviewed, ACL 2023.wmt-1.41; arXiv 2304.03245). **Экстраполяция для нас:** мишени в статье — англ./польск./яп., zh как ИСТОЧНИК; направление «в русский» напрямую не мерено (польский — славянский прокси). Единственная модель — GPT-3.5.
- **Но у нас единица УЖЕ ~1600 симв. (много абзацев)** — то есть «апсайд от добавления контекста в единицу» в основном ПОТРАЧЕН; дальнейший рост единицы не даёт бесплатного качества. **[PLAUSIBLE]**
- **Потолок связности — в ОРГАНИЗАЦИИ (изоляция чанков), а не в сырой модели.** Кросс-предложенческий контекст даёт большой прирост на именно тех дискурс-феноменах, что суть претензии 2. **[CONFIRMED для направления в русский]** — Voita et al., *When a Good Translation is Wrong in Context* (ACL 2019, peer-reviewed, EN→RU OpenSubtitles): 7% индивидуально-верных пар неверны в контексте; окно 3 предложений поднимает deixis 50.0→81.6, лексич. когезию 45.9→58.1, VP-эллипсис — существенно. Домен — субтитры (разговорный), не проза; магнитуды индикативны.
- **«Потерянное в середине» ограничивает лишь ВЕРХНИЙ конец кривой** (целая глава / много чанков); на нашем ~1500-ток чанке эффект мягкий и НЕ объясняет текущие дефекты — это довод не прыгать к «глава целиком», а не диагноз. **[CONFIRMED]** — Liu et al., *Lost in the Middle* (TACL 2024; arXiv 2307.03172).
- **Ближайший индустриальный аналог нашего пайплайна** — TransAgents (мультиагентная «переводческая компания», zh→en вебновеллы): работает ПО ГЛАВАМ с персистентной Translation Guideline (глоссарий+резюме+тон+стиль), роли Senior/Junior Editor + Proofreader сверх голого translate→edit. **[CONFIRMED]** — TransAgents (TACL; arXiv 2405.11804). Оговорка: под капотом GPT-4-Turbo (фронтир), не дешёвая модель; человеко-предпочтение — монолингвально (слепо к верности).
#### Претензия 1. Абзацы/конвенции — это КОНВЕНЦИЯ ЯЗЫКА, академически кодифицированная, а не авторский стиль
Прямой ответ на вопрос владельца — **ДА, это норма русского языка, а не стиль одного автора:**
- **Русский абзац — логико-смысловая единица**, группирующая несколько предложений вокруг завершённой мысли; новый абзац — при логическом завершении мысли / смене темы-времени-места-говорящего. Построчно-однопредложенческое тело — по определению НЕ русское абзацирование. **[CONFIRMED]** — Текстология.ру, «Абзац как часть текста»; корпус-норма подтверждена независимо.
- **Диалог: каждая реплика — с красной строки через тире; кавычки для бегущего диалога не используются.** Слова автора — строго кодифицированная пунктуация (двоеточие/запятая-тире и т.д.). **[CONFIRMED]** — Розенталь, «Справочник», §47/§50 (Оформление прямой речи); Правила-1956 §195. (Источники — веб-зеркала Розенталя; нумерация разнится по изданиям.)
- **Китайская вебновелльная вёрстка расходится с РЯ по всем осям**: отступ    (U+3000×2, правило Ху Ши 1919), полноширинная пунктуация, диалог в 引号 «“ ”», привычка очень коротких абзацев (часто одно предложение / 自然段 для мобильного ритма). **[CONFIRMED]** — Wikipedia «Chinese punctuation» + история.
**Ключевой синтез:** корректный zh→ru reflow — это структурный трансформ из ЧЕТЫРЁХ операций, а не одна инструкция «не копируй разбивку»: (a) СЛИЯНИЕ подряд идущих коротких нарративных строк в многопредложенческие логические абзацы; (b) КОНВЕРСИЯ 引号-диалога в тире-абзацы по репликам; (c) НОРМАЛИЗАЦИЯ глифов (полн.→полуширинные, “ ”→« », — для речи); (d) СНЯТИЕ   -отступа. Операции (b),(c),(d) — **ДЕТЕРМИНИРОВАННЫЕ (код, без модели)**; операция (a) требует ДИСКУРСНОГО понимания, чем **сцепляет претензию 1 с претензией 2**. **[CONFIRMED как рамка]**
Почему инструкция игнорируется и чем чинить:
- **LLM surface-копирует построчную структуру входа** (переводы строк — высокосалиентные, near-синтаксические признаки; структурная персистенция), поэтому bilingual-редактор зеркалит one-sentence-per-line черновика. **[PLAUSIBLE]** — Sclar et al. (2024, 2310.11324, format-sensitivity) — аналогия, не прямой замер layout.
- **Гипотеза «негативный констрейнт («не копируй») сам по себе — главная причина» — REFUTED**: доказательства backfire негативных констрейнтов — слабые препринты про подавление англ. СЛОВ, не про zh→ru layout. **[PLAUSIBLE→REFUTED]**
- **Самый надёжный рычаг — few-shot экземпляры** (рубленый источник/черновик → слитый многопредложенческий целевой абзац), и особенно **target-side якорь** (реальный русский литературный абзац в контексте), т.к. модель копирует структурные решения из демонстраций. **[PLAUSIBLE]** — FollowBench (2024, 2310.20410) — смежная опора.
- **Отделить «дать верную русскую прозу» от «разложить в абзацы»** (отдельный reflow/layout-пасс или plan-then-write): инлайн-энфорсмент формата конкурирует с контент-целью; прирост измеримый, но скромный, +1 LLM-вызов. **[PLAUSIBLE]** — 2510.03595 (препринт).
- **Осторожно**: слияние предложений и укрупнение контекста ПОВЫШАЮТ риск ОПУЩЕНИЙ и путаницы атрибуции — агрессивный reflow сам может терять/скремблить смысл; нужен guard полноты. **[CONFIRMED]** — Karpinska & Iyyer (WMT 2023).
#### Претензия 2. Понимание связей/смысла на дистанции
- **Корневая причина — кросс-чанковая ИЗОЛЯЦИЯ.** Впрыск даже малого контекста (предыдущий src/tgt-хвост + running bilingual summary + реестр имён/антецедентов) даёт большие замеренные приросты consistency и дискурса — на ТОМ ЖЕ домене (китайские вебновеллы). **[CONFIRMED ядро]** — DelTA (ICLR 2025, peer-reviewed; arXiv 2410.08143): память-тиры (Proper-Noun Records, running summary), GuoFeng zh→en; средний прирост согласованности +4.58 (заголовочный +48.5 — единичный best-case). Оговорка: не →ru; часть опор — препринты.
- **zh-специфика: нулевые/опущенные местоимения и субъекты (zero anaphora)** — доминирующий драйвер провала на дистанции; русский (non-pro-drop, согласование род/число) требует ЭКСПЛИЦИТАЦИИ, а антецедент часто в ПРЕДЫДУЩЕМ предложении → корректное восстановление структурно НЕВОЗМОЖНО при поч-чанковой изоляции. **[CONFIRMED, что это архитектурный, а не только «дешёвая модель», баг]**. Голая инструкция «будь внимателен» почти не помогает; чинит только явный контекст/аннотация. **[PLAUSIBLE]** — препринт 2605.31056 (zh→en: <50% ZP базово, oracle-разметка +40 пт); экстраполяция на ru.
- **Глоссарий слабейшая кросс-чанковая память**: адресует только лексическую когезию (~14% русских дискурс-ошибок), мимо deixis (~37%) и эллипсиса/морфологии (~29%). **[CONFIRMED]** производно от Voita et al. (ACL 2019). Значит от глоссария в одиночку прироста связности ждать мало.
**Ранжирование лекарств претензии 2 (эффект / стройка):**
1. **Running bilingual summary + previous-chunk carryover** лучший НЕистраченный рычаг: замерен прямо на китайских вебновеллах (DelTA), стоит ~1 малый вспом-вызов на ~20 предложений; source-primed контекст предпочтительнее переиспользования прошлого МАШИННОГО перевода (последнее роняет качество из-за накопления ошибок). **[CONFIRMED направление / PLAUSIBLE магнитуда для ru]**
2. **Document/paragraph-level контекст** лучший по доказательности, но у нас уже ПОТРАЧЕН (единица крупная).
3. **Аннотатор (MAPS-класс: ключевые слова/тема/демо)** снижает локальную mistranslation, но SENTENCE-level, требует 3-4 кандидата + QE-выбор (3-4× цена), бьёт по локальной адекватности, не по дальней связности. **[PLAUSIBLE]**
4. **Сильнее модель** крупнейший одиночный рычаг на дискурс, но лобовой конфликт с дешёвым COGS; контекст+память дают дешёвой модели закрыть бóльшую часть разрыва. **[PLAUSIBLE]**
5. **Self-refine / итеративный пост-эдит — СПОРНО для MT**: полирует fluency/translationese, даёт скромный прирост и лишь при внешнем error/QE-сигнале, смещён «в английский», может деградировать/галлюцинировать на итерациях; связность, к которой модель НЕ имела доступа, не восстановит. **[CONFIRMED, что спорно]** Chen et al. (EAMT 2024, TEaR) + др.
#### Ось 4. Кривая chunk ↔ качество ↔ биллинг ↔ ретраи (рамка для пре-регистрации)
- **Форма перевёрнутая U**: снизу ограничена потерей когезии у слишком мелкой единицы (Karpinska), сверху базово-модельной/позиционной деградацией у слишком крупной (Lost-in-Middle; для НЕ-дообученных инструкт-моделей качество ПАДАЕТ с ростом единицы 2504.12140, препринт, малые модели). **[PLAUSIBLE]**
- **COGS доминируется ВЫХОДНЫМИ токенами**, + «фертильность» русского/кириллицы на англо-центричных токенизаторах (~22.5× англ.). Значит КАЖДЫЙ добавленный русско-генерящий LLM-пасс множит доминирующую статью; префикс-кэш скидывает лишь дешёвый ВХОД. **[CONFIRMED]** Petrov et al. (NeurIPS 2023, tokenizer fairness) для фертильности.
- **Префикс-кэш делает пере-слание system+glossary почти бесплатным** НО только если статику класть ПЕРВОЙ, а volatile-контекст (running summary, меняющийся каждый чанк) ПОСЛЕ неё (любой volatile-префикс инвалидирует кэш ниже). Тогда worry «глоссарий шлётся каждый чанк» почти не-проблема. **[CONFIRMED для наших провайдеров с оговоркой ordering]**
- **Retry blast radius тянет оптимум к МЕНЬШЕЙ единице** (переген всего чанка при мисматче) центральное напряжение против качественного тяготения к крупной; оптимизировать надо на RETRY-ADJUSTED output-cost, а связность подавать глубиной кэшированного carryover, а НЕ размером единицы. **[PLAUSIBLE]**
- **Вывод оси 4:** ОТВЯЗАТЬ дискурс-единицу от биллинг-единицы: держать чанк небольшим (дёшево, малый blast radius, меньше output-деградации), а когезию давать кэшированным summary/carryover.
### A4. Оси, которые команда могла не увидеть (приоритетно)
1. **Пост-черновая регрессия > многих «качественных» проблем.** Санитайзер/редактура местами уничтожают годный черновик (гл.5 обнулён; CJK-утечки; правки-перевороты смысла). Дешевле всего: гейт «финал не должен быть пустым/короче черновика на X%», «нет сырых CJK-глифов в выводе», «числа/термины из черновика не переворачиваются». Это адресует «слабую художественность» БЕЗ новой машинерии. **[CONFIRMED наблюдение]**
2. **Reflow ЧАСТИЧНО БЕСПЛАТЕН.** Операции (b)/(c)/(d) 4-операционного трансформа детерминированные (код-нормализация глифов/диалога/отступа); только (a) слияние дискурсная. Отделить дешёвое-детерминированное от дорогого-модельного. **[CONFIRMED рамка]**
3. **Метрика-инверсия для zh→ru — конкретно, не абстрактно.** На WMT24 zhru простой Google-NMT обошёл ВСЕ LLM/мультиагентные системы по d-BLEU (human-eval отсутствовал) прямая same-pair демонстрация, что гейтинг художественности на авто-метрике ИНВЕРТИРУЕТ ранжирование. Следствие: претензию 1 сложить в дешёвый ДЕТЕРМИНИРОВАННЫЙ структурный KPI; художественность/связность не на BLEU/COMET. **[PLAUSIBLE источник WMT24 zhru; точный URL к сверке оркестратором]**
4. **Пара-конвенции как переиспользуемый ВЕРСИОНИРУЕМЫЙ слой** (идея владельца). Отделить (a) конвенции ПАРЫ ±жанр [zhru: паратаксисгипотаксис, красная строка, тире, эксплицитация опущенных местоимений, политика 成语] глобальный версионируемый ассет, ключ (srctgt[×регистр]); (b) память КНИГИ (глоссарий/голоса) как сейчас; (c) ручки прогона (venuti/honorifics). Грузонесущее свойство версионирование+снапшот-фолд (смена = громкая ре-трансляция, как `chunkerVersion`), а не носитель (config-ассет или таблица БД). Есть **прямая zh→ru (не экстраполяция) peer-reviewed прескрипция**: 5 техник передачи китайских паратактических предложений в русский (1) построить иерархию в русском, (2) сегментировать по смысловым единицам, (3) промаркировать вид/время предикатов по нормам РЯ, (4) варьировать лексику, (5) добавлять связки по контексту. **[CONFIRMED]** Ван Цуй, «Анализ китайских паратактических предложений и их перевода на русский язык», Вестник МГУ Сер. 22 (Теория перевода). Русский-специфичный инструментарий слияния причастные/деепричастные обороты + подчинительные союзы.
- Открытая развилка (к замеру, не приговор): РАЗМЕР/ФОРМА пакета = вопрос «способность vs активация»; большой правилник может жечь токены и размывать внимание, если знание латентно; возможно, короткий указатель или 12 few-shot экземпляра бьют точнее. Ключ может быть пара×жанр. Пакет должен нести ОГРАНИЧИТЕЛИ против коллизии с инвариантом полноты (слияние/эксплицитация на грани «добавления»).
5. **Способность vs активация — диагностический арм.** Один и тот же reflow-промпт × дешёвая vs фронтир-модель: фронтир верстает, дешёвая нет gap способности; ни та ни другая недоспецифицированный промпт; краткое правило/пример чинит дешёвую это была активация. Разводит «модель не умеет» от «модель недоактивирована».
6. **Бюджет чанка — в ВЫХОДНЫХ токенах на реальном токенизаторе (DeepSeek/GLM), а не в zh-символах**; пере-калибровать под фертильность кириллицы и стабильный output-потолок модели (~34k ток у мелких раньше). **[CONFIRMED довод]** Petrov et al. (NeurIPS 2023).
7. **Разметка нулевых местоимений/кореференции исходника** как дешёвый препроцесс перед переводом (zh zero-pronoun явная маркировка): oracle-разметка стоит +40 пт там, где инструкции ~ничего. **[PLAUSIBLE, zhen, экстраполяция на ru]**
8. **DocRepair-класс: монолингвальный РУССКИЙ reflow/repair-пасс**, который НЕ видит китайский, а чинит связность/абзацы уже переведённого + контекст соседей (это шаг Найды «реструктуризация»). ENRU: deixis 50.091.8, лексич. когезия 45.980.6, эллипсис-флексия 53.086.4; аннотаторы предпочли 73%. **[CONFIRMED для ENRU]** Voita et al. (ACL 2019, DocRepair). Это отделяет fluency/layout-работу от fidelity-работы.
### A5. Гипотеза-резюме §A (моя карта до чтения нашего стека)
1. «Слабая художественность» = сумма ТРЁХ, не двух, слоёв: (i) **пост-черновая регрессия** (санитайзер/редактура ломают годный черновик) вероятно, самый дешёвый и недооценённый; (ii) **рубленость** = source-mirroring + инертная инструкция, чинится дёшево смесью детерминированной нормализации + few-shot/target-anchor + (возможно) отдельного layout-пасса; часть рубленостей (слияние) дискурсная и сцеплена с (iii); (iii) **связность на дистанции** = архитектурный баг изоляции чанков + zh zero-anaphora; лучший дешёвый рычаг running bilingual summary + prev-chunk carryover (кэш-дружественно), НЕ глоссарий и НЕ self-refine.
2. Потолок текущей фазы в ОРГАНИЗАЦИИ (контекст/память/промпт/нарезка/пост-обработка), не в сырой дешёвой модели; переход на фронтир рычаг, но не первый по эффективности-на-стройку.
3. Измерять: претензию 1 дешёвым ДЕТЕРМИНИРОВАННЫМ структурным KPI (без судьи); претензию 2 судья/QA-стиль (TREQA) или дешёвый человеко-протокол (ESA); НИКОГДА не гейтить художественность на BLEU/COMET (для zhru доказана инверсия); беречься «сфабрикованной сходимости» судей (устанавливать независимость до агрегации).
<!-- END §A FROZEN -->
<!-- FREEZE-MARKER §A: sha256=44f90364c786e86bf12e977b8a6712e9e2e89e7cd53d92540def624d842cce6f (хеш байтов между маркерами BEGIN..END; оркестратор: сверить перед фазой 2; ресёрчер §A после заморозки не редактировал — §B/§C/§D только ниже) -->
---
## §B — Дифф: §A против нашего стека (и параллельного ChatGPT-отчёта)
### B0. Метод и главный результат диффа
§A заморожена (sha256 `44f90364…`) ДО чтения: `05-decisions-log` (D1D35), `research/07/15/16`, exp04/09/12/13, и параллельного `research/18-quality-levers-chatgpt.md`. Главный результат: **тройная независимая сходимость.** Три пути — (i) моя §A (сырьё+внешняя литература), (ii) ChatGPT-§A (тоже заморожена до стека, sha256 `b42c6f6e…`), (iii) эмпирический стек команды (D26→D35) — сошлись на диагнозе и на большинстве рычагов. Это сильное подтверждение. **Оговорка против сфабрикованной сходимости (D25.10/D32.4):** независимы попарно ПУТИ (я не читал ChatGPT до заморозки; обе §A заморожены до стека; команда пришла эмпирикой), но нога «внешняя MT-литература» ОБЩАЯ у меня и ChatGPT — совпадения там ≠ три независимых голоса. Поэтому ценность §A не в «ещё раз то же», а в остатке: где я расхожусь и что добавляю (B2), плюс честные само-поправки (B3).
### B1. Где §A СОШЛАСЬ с командой (команда угадала — не дублировать, подтвердить)
| §A-ось | У команды уже есть | Статус |
|---|---|---|
| Reflow зеркалит рубленость исходника = промпт-рычаг | D35.1 дословно; D30.2 снял «сохраняй разбивку», мандат репараграфизации | ✅ угадано |
| Within-chunk (промпт-фиксимо) vs cross-chunk (Ф2) | D35.1 (чанк пакует ~34 абз. / ~1.28 стыка на главу) | ✅ угадано |
| Ось «нарезка × промпт» — ключевой невыжатый рычаг | D35.3 (exp04/12/13 крутили только МОДЕЛЬ) | ✅ угадано |
| Source-line strip как рычаг претензии 1 | **exp12:174 уже предлагает** снять построчную разбивку | ✅ угадано (моя §A НЕ первая) |
| Русские нормы абзаца/диалога с первоисточниками | **research/16 §2.3: Розенталь §52-53, Лопатин ПАС §138, Правила-1956 §51**; тире-flagger | ✅ угадано (полнее, чем §A знала — см. B3) |
| Running summary / annotator / межглавные резюме | Ф2: DelTA-обоснован (D21, D30.8); **exp09-M2 = «глоссарий+скользящее резюме» уже арм** | ✅ угадано (как Ф2/пилот-арм) |
| Output-санитайзер / пост-черновые порчи | D30.3/D33/D33.1 (утёкшие преамбулы, латиница, markdown) | ✅ угадано |
| Пустые финалы ch5/ch20 (моя «третья ось») | **D35.4a: известный экспорт-баг** (санитайзер флагает ведущий `###`, экспорт дропает) | ✅ угадано (см. B3) |
| Сырой китайский 甲乙丙丁/资质 в глоссарий | D35.4c (глоссарий-адресуемая часть претензии 2) | ✅ угадано |
| Декаплинг дискурс-единицы от биллинг-единицы | D35.7 (`draft=чанк/edit=глава`, runner-уровень) | ✅ угадано |
| Метрика: детерминированный структурный KPI + judge-дисциплина | D29.1d диалог-flagger; 07:86 translationese-метрики; D13.3 панель; D25.10/D32.4 анти-сходимость; D30.1 span-судья | ✅ угадано (команда МЕТОДИЧЕСКИ впереди) |
| Frontier-арм как диагностика потолка ≈ capability-vs-activation | D35.3 | ✅ угадано |
| Промптинг литперевода (task-framing, few-shot по классам, sandwich, no manual CoT, «plan+translate в одном вызове не армить») | research/15 §1.2/§3 обширно | ✅ угадано (АУГМЕНТИРОВАТЬ, не дублировать) |
Вывод B1: команда угадала правильно почти всю карту. Диагноз D35 = моя §A. Это повышает доверие, что «строить» надо по этой карте — но и снижает новизну §A; реальная ценность — в B2.
### B2. Где §A РАСХОДИТСЯ / команда недостроила (несущий остаток)
1. **zh→ru ДИСКУРС-ТРАНСФОРМ как переводческая теория — самая тонкая ось стека.** research/16 grounds РУССКУЮ сторону (нормы абзаца/диалога) и на уровне ВЫРАВНИВАНИЯ отмечает китайский паратаксис (Xue&Yang ACL 2011, ~16.6% запятых — границы), но **нет переводоведческой рамки zh→ru**: паратаксис→гипотаксис (意合/形合), 流水句, обязательность сращивания. Критично: research/16 §2.3 считает слияние (N:1) «дискреционным стилем, не нормой» — а **прямая zh→ru peer-reviewed прескрипция (Ван Цуй, Вестник МГУ Сер.22) говорит: пересборка паратактической цепи в русскую иерархию ОБЯЗАТЕЛЬНА** (5 техник: иерархия / сегментация по смыслу / вид-время / лексика / добавление связок), а инструмент — причастные/деепричастные обороты + подчинение. **Это апгрейдит «слияние дискреционно» → «слияние — требуемая дискурс-операция, и вот КАК».** Даёт reflow-промпту реальный zh→ru СОДЕРЖАНИЕ, а не «не копируй разбивку». **[CONFIRMED; прямой источник, не экстраполяция]** — самый сильный вклад §A, прямо отвечает на вопрос владельца «это конвенция языка, а не стиль автора».
2. **Слой «пакет конвенций пары» как ВЕРСИОНИРУЕМЫЙ артефакт (идея владельца) — структурный пробел.** research/07 держит конвенции пары как КОНТЕНТ (Палладий/Поливанов, Venuti, Нора Галь), но **«разбросаны как brief/config-политики, отдельного слоя нет»** (вывод фазы-2). Отделить (пара±жанр) от (книга) от (прогон); ключ (src→tgt[×регистр]); снапшот-фолд как `chunkerVersion`. Не носитель, а версионирование — грузонесущее. → §C-архитектура.
3. **Running summary — переоценить для near-term, не только пилот.** Команда СОЗНАТЕЛЬНО не строит LLM-резюме (research/15: «DelTA платит вызовами — мы нет», COGS-козырь); имеет лишь детерминированную инъекцию срезов памяти (Aho-Corasick) + M2-арм в пилоте. Но DelTA даёт бенефит именно бегущим резюме на ТОМ ЖЕ домене (вебновеллы), а COGS-возражение слабеет при кэш-дружественном ordering (резюме — 1 малый вызов на ~20 предложений, вход near-free при префикс-кэше). → предлагаю мерить running summary как near-term рычаг претензии-2-кросс-чанк, не хоронить на COGS до замера.
4. **DocRepair-класс (монолингвальный РУССКИЙ repair-пасс) с числами В РУССКИЙ.** ChatGPT тоже флоатит «отдельный target-only пасс», но без into-ru доказательств; у меня Voita 2019 EN→RU: deixis 50→91.8, когезия 45.9→80.6. Опция для op(a)+связность отдельно от билингв-fidelity-редактуры (editor-mono.md существует, но DORMANT — D33.4a). **[CONFIRMED для EN→RU]**
5. **Стоимостная строгость: фертильность-налог + cache-ordering + перевёрнутая-U.** ChatGPT имеет формулу+retry-множитель; команда — exp08+чанкер-конст+D35.6-арм. Добавляю: COGS output-доминирован + **кириллица-фертильность ~22.5× (Petrov NeurIPS 2023)** → бюджет чанка в ВЫХОДНЫХ токенах на реальном токенизаторе, не zh-символах; **cache-ordering** (статик первым, volatile-summary после — иначе кэш бьётся); перевёрнутая-U (когезия снизу, позиционная деградация сверху).
6. **Метрика-инверсия zh→ru — конкретный датапоинт.** WMT24 zh→ru: Google-NMT обошёл все LLM/мультиагент по d-BLEU без human-eval → не гейтить художественность на авто-метрике (у команды дисциплина есть, конкретного zh→ru датапоинта — нет). **[PLAUSIBLE — URL к сверке]**
### B3. Само-поправки §A после чтения стека (честно)
- **ch5.0 «санитайзер обнулил чанк» → НЕТ: экспорт-баг D35.4a.** Санитайзер ФЛАГАЕТ ведущий `###`, а экспорт дропает флагнутый чанк в пустоту вместо strip/fallback; текст правки ЦЕЛ. Класс тот же (пост-черновая порча), но механизм — экспорт, не санитайзер-void. Команда уже поймала (полигон обязан починить ch5/ch20 до слепых пакетов).
- **«команда не заземлила reflow в Розенталя» → неверно.** research/16 заземлила РУССКУЮ сторону (Розенталь §52-53, Лопатин, Правила-1956). Точный пробел уже — zh→ru ТРАНСФОРМ-сторона (B2.1), не русские нормы.
- **source-line strip как «новый рычаг» → не новый:** exp12:174 уже предлагает. §A-статус «оси, что могли не увидеть» для этого пункта снимаю.
### B4. Дифф против параллельного ChatGPT-отчёта (чтобы не дублировать)
Сходятся (обе независимые §A): source-strip, discourse-move few-shot, look-behind/look-ahead (особ. для zh нулевого подлежащего), chapter-card, декаплинг трёх единиц (coverage-atom ≠ generation-unit ≠ reference-span), perturbation-тест (correct vs random context) как центральная метрика, детерминированный структурный KPI, model-floor 2×2, «whole-chapter только как диагностический потолок», retry-adjusted cost. **Совпадение двух независимо-замороженных §A — корроборация** (с оговоркой общей лит-ноги B0).
Мой маргинальный вклад СВЕРХ ChatGPT: (1) zh→ru академ-грунтинг Ван Цуй/паратаксис-гипотаксис — ChatGPT ЯВНО пишет «zh→ru якорей нет»; (2) версионируемый слой пары; (3) DocRepair into-ru числа; (4) фертильность-налог + cache-ordering; (5) метрика-инверсия zh→ru. ChatGPT сверх меня: развёрнутая two-stage eval-схема (Stage I причинная проба на 68 ловушках / Stage II слепые 3 финалиста), «дискурсный пакет» как generation-unit, трёх-единичная факторизация — ценно, рекомендую взять в §C (не переизобретаю, ссылаюсь).
---
## §C — Рекомендации для полигона (таблица-вход эмпирической сессии D35.6)
Формат: {механизм → как измерить → цена → эффект на претензию → фаза}. Явно разведено: **СЕЙЧАС** (промпт/нарезка/глоссарий/детерминированный код, без Ф2-машинерии) vs **Ф2** (память/аннотатор/reference-тома). Строки согласованы с осями D35.6 (нарезка×промпт, frontier-арм, кривая размер↔качество↔биллинг↔ретраи, fidelity re-gate, слепые пакеты) и с методик-guard D32.4 (fidelity-first, leave-one-out, катастроф-скрин, per-call кап, независимость сигналов).
### C1. СЕЙЧАС — промпт/нарезка/глоссарий/детерминированный код
| # | Механизм | Как измерить (арм/проба) | Цена | Эффект → претензия | Фаза |
|---|---|---|---|---|---|
| 1 | **Дискурс-reflow промпт с zh→ru СОДЕРЖАНИЕМ** (5 техник Ван Цуй: иерархия/сегментация/вид-время/лексика/связки; причастные-деепричастные обороты; Розенталь-диалог) вместо «не копируй разбивку» | Структурный KPI (распределение предложений/нарратив-абзац vs русский референс) + слепое чтение; арм × (чанк\|глава) — ось нарезка×промпт | ~0 (промпт) | Претензия 1 (+сцеплённая часть 2) | Сейчас |
| 2 | **Discourse-move few-shot** (рубленый→слитый; target-side русский якорь; diversity-подбор ≤5 — research/15 few-shot-дисциплина) | Тот же KPI + fidelity re-gate (omission-guard: слияние повышает опущения) | +вход-токены (кэшируемо) | Претензия 1 | Сейчас |
| 3 | **Source-line strip / deformat черновика** до редактора (убрать зеркалящий cue) | A/B тот же KPI — изолирует построчный cue (exp12:174) | ~0 (детерм.) | Претензия 1 | Сейчас |
| 4 | **Детерминированный reflow-постпроцессор** ops (b)+(c)+(d): тире-диалог + нормализация глифов (полн.→полу, “”→«», —) + снятие    + strip markdown-`###` | CJK-глиф=0 гейт; диалог-парность-flagger (D29.1d) | ~0 (код) | Претензия 1 + утечка CJK-глифов | Сейчас |
| 5 | **Guard пост-черновой регрессии**: финал не пуст / не короче черновика на X% / нет сырых CJK / числа-разряды не переворачиваются vs черновик | Детерм. гейт + fidelity re-gate (D34.3) | ~0 (код) | «Третья ось» (вкл. экспорт-баг ch5/ch20 D35.4a) | Сейчас |
| 6 | **Глоссарий: засев сырых 甲乙丙丁/资质** (D35.4c) | Term-coverage post-check | ~0 | Претензия 2 (глоссарий-адресуемый срез) | Сейчас |
| 7 | **±1 reference-контекст** (хвост пред-target + пред-source + след-source до границы сцены, НЕ переводится) | Кросс-граница trap-accuracy + **perturbation** (correct vs random context не должен совпасть); факторить prev-target/prev-source/next-source ОТДЕЛЬНО | +вход-токены (кэш); вопрос рендера (§D-7) | Претензия 2 near-term | Сейчас-ish |
| 8 | **Кривая нарезки**: (0.75k/1.5k/3k/глава) × (жадная упаковка \| сцен-граница) на **retry-adjusted output-token cost**; бюджет в ВЫХОДНЫХ токенах (кириллица-фертильность Petrov) | Пре-регистрация: in/out/reasoning-токены, латентность, retry-rate ПО ПРИЧИНАМ, re-billed доля, coverage, слепое предпочтение, KPI-абзацы, trap-теги | Эксперимент | Обе + стоимость | Сейчас (диагностика) |
| 9 | **Capability-vs-activation / model-floor 2×2** (слабая/сильная × текущий/дискурс-промпт) + **арм краткой инъекции правил** | Trap-closure на 2×2; фронтир-арм = диагностика потолка (модели vs организация); гарды D22.5 (эхо-скрин, self-family exclusion) | Фронтир $ (владелец согласовал) | Диагностика (потолок) | Сейчас |
| 10 | **Автоматическая оценка качества (запрос владельца)**: претензия 1 = детерм. KPI (без судьи); претензия 2 = span-цитирующий билингв-судья + comprehension-QA (TREQA) + perturbation | Guard: leave-one-out, family-exclusion, per-call кап, **НИКОГДА не гейтить художественность на BLEU/COMET** (zh→ru инверсия WMT24); владелец кросс-чек ChatGPT+вручную | Судья-вызовы (кэш) | Инфра замера обеих | Сейчас |
### C2. НУЖНА Ф2-машинерия
| # | Механизм | Как измерить | Цена | Эффект → претензия | Фаза |
|---|---|---|---|---|---|
| 11 | **Running bilingual summary + реестр сущностей/антецедентов** (DelTA-класс) | exp09-memory-eval M2 + кросс-чанк trap; cache-friendly ordering | +1 малый вызов/~20 предл. (вход near-free при кэше) | Претензия 2 кросс-чанк | Ф2 (пере-взвесить vs COGS-депри research/15 — B2.3) |
| 12 | **Chapter card** (сущности/связи/цель/место/время/нерешённые ссылки из 1 пред-чтения главы) | Кросс-чанк trap; сравнить с #11 (компактная ручная карта должна доказать лифт ДО авто-памяти) | 1 пред-чтение/глава | Претензия 2 | Ф2-lite (сходится с ChatGPT) |
| 13 | **Пре-аннотация нулевых местоимений/кореференции** исходника | Trap-accuracy на ZP-кейсах | Аннотатор-пасс | Претензия 2 (zh-специфика) | Ф2 |
| 14 | **Отдельный монолингв. РУССКИЙ reflow/repair-пасс** (DocRepair) vs комбинированный редактор | A/B: один редактор vs (билингв-семантика→target-only-reflow) под coverage-гейтом | +1 пасс (target-only дешевле) | Претензия 1 op(a) + связность | Ф2 / арм сейчас |
### C3. Архитектура (зона оркестратора/бэкенда — предложение, не приговор)
| # | Механизм | Как измерить/решить | Фаза |
|---|---|---|---|
| 15 | **Слой «пакет конвенций пары»** (идея владельца): контент = 5 ops Ван Цуй + русские нормы + Палладий; ключ (src→tgt[×жанр]); снапшот-фолд; **несёт ОГРАНИЧИТЕЛИ против инварианта полноты**; РАЗМЕР/ФОРМА (короткий указатель vs правилник vs few-shot) = исход арма #9/#1-2 | Reflow-промпт-армы #1-2 И ЕСТЬ проба размера/формы пакета; финальное размещение — оркестратор/бэкенд под доказанный ROI (Р2/D30.7) | Дизайн сейчас, стройка под ROI |
Рекомендую взять из ChatGPT-отчёта (не переизобретаю): two-stage eval (Stage I причинная проба на 68 ЛОВУШКАХ вместо «средних глав» / Stage II слепые 3 финалиста), «дискурсный пакет» как generation-unit, факторизацию трёх единиц.
---
## §D — Вопросы, на которые не хватило данных
1. **Где именно живёт опорный контекст провалов связности владельца** — в-чанке / пред / след / вся-глава / мир-знание? D35 даёт ~1.28 стыка/глава, но НЕ размечено. Без размеченного trap-набора нельзя выбрать между #7/#11/#12. (Флагаю и я, и ChatGPT.) — первично для полигона.
2. **Магнитуда в РУССКИЙ.** Вся несущая внешняя эмпирика (Karpinska, DelTA, DocRepair, zero-pronoun) — into-English/EN→RU-экстраполяция; единственный zh→ru замер даст полигон (фронтир+дешёвый армы). Пометка обязательна на каждом клейме.
3. **Размер/форма пакета конвенций (#15) = вопрос «способность vs активация»** — не решён до 2×2 (#9) + инъекц-армов (#1-2).
4. **Коллизия слияния/эксплицитации с инвариантом полноты** на практике — semantic-atom-coverage vs sentence-count; нужен omission-guard-замер (#2/#5).
5. **COGS running-summary при кэше** — стоит ли бенефит DelTA доп-вызова на наших ценах при cache-ordering (пере-взвесить депри research/15).
6. **Retry-rate q(c) по типам провала на размер чанка** на живых дешёвых моделях — не замерено; нужно для retry-adjusted-кривой (#8).
7. **Рендер: может ли runner подать соседний src/tgt как non-output reference** без нового persistent-домена? Определяет, #7 — это PROD-MINOR или Ф2 (вопрос бэкенду).
8. **Владельцу:** допустимая степень синтакс-слияния/дробления; считается ли front-matter в художественную приёмку (из ChatGPT §D — решение владельца).
---
## §E — Источники (URL + дата + тип), несущие клеймы
Тип: **PR** peer-reviewed · **PP** preprint (не peer-review) · **STD** норм.-стандарт · **DOC** офиц./вендор-дока · **BLOG/OTH** блог/вторичное. Дата — публикация/доступ. Верификатор открывал ключевые (WebFetch); часть zh-источников по 403 — сверена сниппетами (помечено в §A/§B).
**Дискурс-гранулярность / doc-level (Ось 1):**
- [PR 2023] Karpinska & Iyyer, *LLMs Effectively Leverage Document-level Context for Literary Translation*, WMT2023 — https://aclanthology.org/2023.wmt-1.41/ · arXiv https://arxiv.org/abs/2304.03245
- [PR 2019] Voita et al., *When a Good Translation is Wrong in Context* (context-aware EN→RU; спутник DocRepair) — https://aclanthology.org/P19-1116/
- [PR 2024] Liu et al., *Lost in the Middle* (TACL) — https://aclanthology.org/2024.tacl-1.9/
- [PR 2021] G-Transformer for Doc-Level MT (ACL) — https://aclanthology.org/2021.acl-long.267/
- [PP 2024-07] *Towards Chapter-to-Chapter Context-Aware Literary Translation* — https://arxiv.org/html/2407.08978
- [PP 2025-04] *Multilingual Contextualization of LLMs for Doc-Level MT* (2504.12140; inverted-U, N=3 контекст) — https://arxiv.org/abs/2504.12140
- [PP 2024-12] *Investigating Length Issues in Doc-Level MT* — https://arxiv.org/abs/2412.17592
- [PP 2025-06] *Beyond the Sentence: Survey on Context-Aware MT with LLMs* — https://arxiv.org/abs/2506.07583
**Мультиагент/прайор-арт + fan/commercial:**
- [PP 2024-05] TransAgents, *(Perhaps) Beyond Human Translation* (TACL-версия) — https://arxiv.org/abs/2405.11804
- [PR 2024-10] DelTA (ICLR 2025; multi-level memory, running summary) — https://arxiv.org/abs/2410.08143 · https://openreview.net/forum?id=hoYFLRNbhc
- [PP 2024-12] DRT, *Deep Reasoning Translation via long CoT* — https://arxiv.org/abs/2412.17498
- [PR 2023] GuoFeng-Webnovel (zh↔ru/de, V2 без sent-align) — https://github.com/longyuewangdcu/GuoFeng-Webnovel
- [DOC 2024] py3TranslateLLM (LLM=paragraph, NMT=line) — https://github.com/gdiaz384/py3TranslateLLM · [DOC 2026-07] DeepL split_sentences — https://developers.deepl.com/api-reference/translate · [VEND 2023] DeepL context param — https://www.deepl.com/en/blog/deepl-api-context-parameter · [VEND 2026] TeaNovel (consistency drift; full-chapter) — https://read.teanovel.com/blog/how-to-translate-chinese-novels-with-ai
**Претензия 1 — русские нормы + reflow-механика:**
- [DOC 2026-07] Розенталь §47 прямая речь — http://old-rozental.ru/punctuatio.php?sid=155 · §52 диалог — http://old-rozental.ru/punctuatio.php?sid=160 · §50 слова автора — https://evartist.narod.ru/text1/52.htm
- [STD 1956] Правила русской орфографии и пунктуации, знаки при прямой речи — https://gramota.ru/biblioteka/spravochniki/pravila-russkoj-orfografii-i-punktuacii/znaki-pri-pryamoj-rechi · [DOC 2026-07] Грамота, оформление диалога — https://gramota.ru/uchebnik/pravila/oformlenie-dilaoga
- [OTH 2026-07] Абзац как логико-смысловая единица — Текстология.ру — https://www.textologia.ru/russkiy/sintaksis/stroenie-texta/abzac-kak-chast-teksta-i-ego-funkcii/646/ · Абзац (по Мильчину) — https://rus-stylistics-dict.slovaronline.com/1-%D0%90%D0%B1%D0%B7%D0%B0%D1%86
- [OTH 2026-07] Chinese punctuation (полн. пунктуация, 引号,   -отступ) — https://en.wikipedia.org/wiki/Chinese_punctuation
- [PR 2022] Structural Persistence in LMs (priming) — https://aclanthology.org/2022.tacl-1.60/ · [PR 2024] Sensitivity to Spurious Prompt Features (Sclar) — https://arxiv.org/abs/2310.11324 · [PR 2024] FollowBench — https://arxiv.org/abs/2310.20410
- [PP 2026-01] *Semantic Gravity Wells: Why Negative Constraints Backfire* (опора гипотезы негатив-констрейнта — REFUTED как главная причина) — https://arxiv.org/abs/2601.08070
- [PP 2025-10] *Decoupling Task-Solving and Output Formatting* — https://arxiv.org/abs/2510.03595
**Претензия 2 — связность/zh-специфика + лекарства:**
- [PP 2026-05] *How Much Do LLMs Know About Chinese Zero Pronouns?* (zh→en, <50% ZP базово, oracle +40) https://arxiv.org/abs/2605.31056 · [PP 2023] Survey on Zero Pronoun Translation https://arxiv.org/abs/2305.10196
- [PR 2024] MAPS, *Exploring Human-Like Translation Strategy* (аннотатор) https://arxiv.org/abs/2305.04118
- [PR 2025] TEaR self-refine https://aclanthology.org/2025.findings-naacl.218/ · [PP 2026-05] *What Does LLM Refinement Actually Improve? Doc-Level* (2605.13368; моно 2.2…−5.6 MQM) https://arxiv.org/abs/2605.13368 · [PP 2024-02] *LLM Amplifies Self-Bias in Self-Refinement* https://arxiv.org/abs/2402.11436
- [PP 2025-03] *Source-primed Multi-turn Conversation Helps LLMs Translate Documents* https://arxiv.org/abs/2503.10494
**zh↔ru контрастивная лингвистика (прямые/близкие):**
- [PR 2024] **Ван Цуй, «Анализ китайских паратактических предложений и их перевода на русский язык», Вестник (Теория перевода)** 5 техник https://vestnik-translation.ru/articles/article/20081/ · [PR 2023] интерференция при переводе кит. лит-ры на русский (De Gruyter, cjss-2023-0017) https://www.degruyterbrill.com/document/doi/10.1515/cjss-2023-0017/html
- [OTH 2022] Application of Hypotaxis/Parataxis in C-E Translation (意合/形合, Lian Shuneng) https://www.davidpublisher.com/Public/uploads/Contribute/620da97031d45.pdf · [OTH 2023] English Translation Strategies for Chinese Run-on (流水句) https://www.davidpublisher.com/Public/uploads/Contribute/654354525d198.pdf · [PR 2011] xinghe/yihe (Perspectives) https://www.tandfonline.com/doi/abs/10.1080/0907676X.2010.514347
- [PR 2011] Topic-Comment in Mandarin (Li & Thompson) https://www.researchgate.net/publication/235852523 · [OTH 2005] Курдюмов, теор. грамматика (топик-комментарий) https://www.studmed.ru/kurdyumov-v-a-kurs-kitayskogo-yazyka-teoreticheskaya-grammatika_1d9fe4a728b.html
- [PP 2025-11] *Predicate-Argument Divergences in Chinese-English* (кит. +24% глаголов) https://arxiv.org/abs/2511.09796 · [OTH 2026-07] Chengyu (96% четырёхзнак.) https://en.wikipedia.org/wiki/Chengyu
**Измерение качества:**
- [PP 2025-04] TREQA (comprehension-QA eval) https://arxiv.org/html/2504.07583v3 · [PR 2025] LITEVAL-CORPUS (MQM плох, BWS/SQ лучше) NAACL https://aclanthology.org/2025.naacl-long.548/ · [PR 2023] GEMBA-MQM https://aclanthology.org/2023.wmt-1.64/ · [PR 2024] xCOMET https://aclanthology.org/2024.tacl-1.54/ · [PR 2024] ESA https://aclanthology.org/2024.wmt-1.131/
- [PP 2026-05] *Nine Judges, Two Effective Votes* (корр. судьи) https://arxiv.org/pdf/2605.29800 · [PP 2026-05] *Creativity Bias* (метрики против художественности) https://arxiv.org/html/2605.13596 · [BLOG 2026-04] LLM-judge length/position/format bias https://tianpan.co/blog/2026-04-27-llm-judge-bias-audit-length-position-format
**Стоимость / нарезка:**
- [PR 2023] Petrov et al., *LM Tokenizers Introduce Unfairness Between Languages* (кириллица-фертильность) https://arxiv.org/pdf/2305.15425 · [BLOG 2023] интерактив https://aleksandarpetrov.github.io/tokenization-fairness/
- [DOC 2024] DeepSeek Context Caching (cache-hit ~2% miss) https://api-docs.deepseek.com/guides/kv_cache/ · pricing https://api-docs.deepseek.com/quick_start/pricing
- [PP 2024-09] LongGenBench (output ~34k стабилен) https://arxiv.org/html/2409.02076v7
**Метрика-инверсия zh→ru (§A4.3 — теперь с URL):**
- [PR 2024-12] *Findings of WMT24 Discourse-Level Literary Translation* https://arxiv.org/abs/2412.11732 · task page https://www2.statmt.org/wmt24/literary-translation-task.html · [BLOG 2025] разбор d-BLEU/стоимости https://gonzoml.substack.com/p/perhaps-beyond-human-translation
*(Полный список 125 верифицированных URL — в артефактах ресёрч-воркфлоу сессии; здесь — несущее подмножество.)*
**Errata источников (испр. оркестратором, D36):**
- **DocRepair расщепить с P19-1116.** Числа §A4.8B2.4 (deixis 50.091.8, когезия 45.980.6, эллипсис 53.086.4, 73% предпочтения) из [PR 2019] Voita, Sennrich, Titov, *Context-Aware Monolingual Repair for NMT* (DocRepair), EMNLP-IJCNLP 2019 https://aclanthology.org/D19-1081/ · arXiv https://arxiv.org/abs/1909.01383. Процитированная выше P19-1116 (ACL 2019) статья-спутник, из неё число CADec 50.081.6 A3). Обе авторства одного трио; числа верны, атрибуция расщеплена.
- **TransAgents** arXiv 2405.11804 = *(Perhaps) Beyond Human Translation* (accepted-but-preprint, «To appear at TACL»; §A-метка «TACL-версия» и §E-метка «PP 2024-05» об одной статье, оставить одну). Это ОТДЕЛЬНАЯ статья от EMNLP-Demo 2024 `2024.emnlp-demo.14` (*Build Your Translation Company…*), процитированной параллельным ChatGPT-отчётом не конфликт, две реальные статьи об одной системе.
- **Z5** RG 235852523 = Dingxu Shi, *Topic and Topic-Comment Constructions in Mandarin Chinese* (Language 76(2), 2000), НЕ Li & Thompson (их канон *Subject and Topic* 1976 / *A Functional Reference Grammar* 1981). Клейм топик-комментария верен; автор-метка исправлена.
- **Z8 / R4 / R5 / P2 / CO5** источники реальны, атрибуция частична: «96% чэнъюй» на цит. Wikipedia отсутствует (там «most»);   -отступкороткие абзацы» не на цит. Chinese-punctuation-стр. (конвенции реальны, стр. неточна); Structural-Persistence (TACL 2022) изучает СИНТАКСИЧЕСКИй прайминг, не копирование line-структуры (экстраполяция, отчёт помечает PLAUSIBLE); FollowBench (ACL 2024, не просто препринт) документирует ДЕГРАДАЦИю следования при накоплении констрейнтов не «надёжный рычаг few-shot»; 2504.12140 подтверждает «мелкие инстракт-модели деградируют с ростом чанка», но «перевёрнутая-U / N=3-оптимум» переформулировка (N=3 фикс-конфиг, не найденный оптимум). Ни одна не рушит §C-арм все меряются полигоном эмпирически.
---
<!-- Отчёт готов к адверсариальной верификации оркестратора по первоисточникам. §A заморожена (sha256 44f90364…); §BCDE пост-дифф. Не коммитить лендит оркестратор (как research/15/16/17). -->