Land research/18 both quality-lever reports with orchestrator review headers after verifying all cited sources exist and §A freeze reproduces

This commit is contained in:
Claude (backend session) 2026-07-11 21:14:00 +03:00
parent 2606714eb0
commit 38736b27b5
2 changed files with 633 additions and 0 deletions

View file

@ -0,0 +1,288 @@
# Рычаги минимально-художественного zh→ru: независимый доклад ChatGPT
<!-- ─────────────────────────────────────────────────────────────────────────
ОРКЕСТРАТОР — РЕВЬЮ-ШАПКА (лендинг, D36, 12.07 №4). Тело не переписано. Полный разбор —
PROGRESS §лендинг D36 + D-лог D36.
ВЕРДИКТ: **ACCEPT** (одна минорная привязка при графтинге в промт полигона).
НЕЗАВИСИМАЯ ВЕРИФИКАЦИЯ (тот же 26-агентный воркфлоу, первоисточники, $0):
- **Цитатно-чист на всех спот-чеках** — Thai/Par3 (EMNLP 2022, `2022.emnlp-main.672`),
Mohammed & Niculae (Findings EACL 2024, `2024.findings-eacl.113` — perturbation
correct-vs-random), Herold & Ney, Hu & Wan, Jiang/BWB, Jwalapuram, DelTA, TransAgents
(EMNLP-Demo `2024.emnlp-demo.14`) — все существуют, атрибуция аккуратна.
- **Хеджирование дисциплинировано** — внешняя эмпирика последовательно помечена «не zh→ru»;
инженерные клеймы — PLAUSIBLE; 80%-порог ловушек — «предложение для пре-регистрации, не факт».
Ни одного CONFIRMED-который-на-деле-экстраполяция не найдено. Самый скептичный из двух
отчётов к системным клеймам (TransAgents прямо назван «vendor-like»).
- **§C — наиболее прямо-исполнимый скелет полигон-сессии** из двух: явный P0 чистый baseline
→ армы с фаза-тегами P0P4 → C4 пре-регистрированные метрики/гейты → C5 дерево решений →
C3 точное ядро дискурс-reflow-промпта. Покрывает ВСЕ мандатные оси D35.6.
ДВЕ ОГОВОРКИ ПРИ ГРАФТИНГЕ (учтены в промте полигона D36):
1. **§A-заморозка НЕ воспроизводима из документа.** sha256 `b42c6f6e…` заявлен только в прозе
§B0; в файле — плейсхолдер `<!-- A_SHA256_PLACEHOLDER -->` без BEGIN/END байт-маркеров →
пересчитать нельзя. Прогон внешний (владелец) → заморозка **аттестована, но не крипто-
верифицируема** (в отличие от Claude-отчёта, чей хеш сверен MATCH). На вес «двойной заморозки
сходимости» — дисконт; содержательное качество/самосогласованность отчёта этим НЕ затронуты.
2. **Свежий fidelity-гейт §C4 не ссылается на мандатный re-gate D34.3** (`rerun/FIDELITY_REGATE_HANDOFF.md`
+ `rerun-parallel.txt`) — сессия его не читала. При графтинге брать D34.3-пакет как канон
верности, §C4-гейт — как совместимую детализацию.
РЕКОМЕНДАЦИЯ ЛЕНДИНГА (обе стороны сами это предлагают): §C ChatGPT = скелет протокола +
графт zh→ru-контента Ван Цуй в reflow-промпт + COGS-модель + привязка D34.3 из Claude-отчёта.
Реализовано в `POLYGON_QUALITY_EMPIRICS_SESSION_PROMPT.md`.
───────────────────────────────────────────────────────────────────────────── -->
Дата исследования: 2026-07-11. Роль: независимый ресёрчер; код и общие документы репозитория не изменялись.
Статусы доказательности:
- **CONFIRMED** — утверждение прямо поддержано первичным источником или наблюдением над разрешённым сырьём;
- **PLAUSIBLE** — инженерная гипотеза, совместимая с данными, но требующая локального A/B-замера;
- **REFUTED** — локальные данные или первичный источник противоречат утверждению.
## §A. Чистый лист: независимая карта «проблема → механизм»
> **FREEZE MARKER A — 2026-07-11.** Этот раздел составлен до чтения `05-decisions-log.md`, `research/07`, `research/15`, `research/16` и материалов exp04/12/13. После фиксации SHA-256 раздел не редактируется. Все дальнейшие сопоставления находятся только в §B§D.
### A1. Что непосредственно видно в текущем прогоне
**CONFIRMED.** Текущий сегментатор жадно упаковывает целые исходные абзацы примерно до 1 500 оценочных токенов; только сверхдлинный абзац делится по предложениям. Контекст предыдущего/следующего чанка в `Chunk` не переносится. Переводчик получает один `{{text}}`; редактор — тот же исходный чанк и его черновик. Источник: локальные `backend/internal/pipeline/chunker.go`, `backend/prompts/translator.md`, `backend/prompts/editor.md`, прочитаны 2026-07-11.
**CONFIRMED.** Оба промпта уже требуют русской вёрстки, запрещают копировать построчную разбивку и предписывают начинать прямую речь с нового абзаца. Следовательно, версия «достаточно добавить одну инструкцию про абзацы» опровергается текущей конфигурацией: такая инструкция уже есть, а претензия владельца сохранилась. Источник: локальные промпты выше и вердикт владельца в сессионном задании, 2026-07-11.
**CONFIRMED (описательная метрика, не оценка качества).** В `rerun-ru.txt` грубое разбиение по пустым строкам даёт 1 754 блока, из которых 1 671, или около 95,3%, состоят из одной непустой строки. Выборочная проверка начала, середины и конца показывает устойчивую дробность повествования наряду с корректным выделением многих реплик. Метрика намеренно не объявляется нормой художественности: короткий абзац может быть стилистически оправдан. Источники: локальные `/home/ubuntu/books/gu-zhenren/rerun/rerun-ru.txt` и `/home/ubuntu/books/gu-zhenren/rerun/records.json`, только чтение, 2026-07-11.
**PLAUSIBLE.** Основная ошибка организации — не «слишком маленький чанк» как таковой, а смешение трёх разных единиц: (1) единицы покрытия, (2) единицы смыслового контекста, (3) единицы целевой композиции. Нынешний фиксированный бюджет определяет все три сразу. Это объясняет, почему полнота может быть хорошей, а русская макрокомпозиция и дальние связи — слабее. Нужен факторный эксперимент, потому что наблюдение одного прогона причинность не устанавливает.
### A2. На какой гранулярности переводить
**CONFIRMED.** Для литературного LLM-перевода перевод целого исходного абзаца за один вызов превосходил перевод предложение-за-предложением по человеческой разметке на 18 языковых парах: было меньше смысловых, грамматических и стилистических ошибок. Это peer-reviewed WMT 2023, но не zh→ru и не тест текущих дешёвых моделей, поэтому переносимость результата ограничена. Источник: Karpinska & Iyyer, [Large Language Models Effectively Leverage Document-level Context for Literary Translation, but Critical Errors Persist](https://aclanthology.org/2023.wmt-1.41/), опубликовано 2023-12, доступ 2026-07-11.
**CONFIRMED.** В литературном MT абзац является практически значимой единицей данных и оценки: корпус Par3 выровнен по абзацам; эксперты предпочитали человеческие варианты машинным в 84% сравнений, а обученный post-editor — обычному MT в 69%. Автоматические метрики не коррелировали с экспертными предпочтениями. Это аргумент за абзац/микросцену и человеческий blind preference как минимум, но не доказательство конкретной схемы zh→ru. Источник: Thai et al., [Exploring Document-Level Literary Machine Translation with Parallel Paragraphs from World Literature](https://aclanthology.org/2022.emnlp-main.672/), EMNLP 2022, доступ 2026-07-11.
**CONFIRMED.** Простое увеличение контекста до всего документа не является монотонным улучшением: работа по long-context DocMT указывает и рост памяти, и деградацию качества при расширении контекста; типичный локальный контекст — одно-два предыдущих предложения, чего может не хватать для темы и стиля. Источник: Herold & Ney, [Improving Long Context Document-Level Machine Translation](https://aclanthology.org/2023.codi-1.15/), CODI/ACL 2023, доступ 2026-07-11.
**CONFIRMED.** Фиксированная длина плохо отражает дискурсную структуру. Paragraph-to-paragraph режим и явная RST-структура дали улучшения над прежними DocMT-подходами в peer-reviewed исследовании, хотя архитектурные результаты NMT нельзя напрямую переносить на prompting закрытой LLM. Источник: Hu & Wan, [Exploring Discourse Structure in Document-level Machine Translation](https://aclanthology.org/2023.emnlp-main.857/), EMNLP 2023, доступ 2026-07-11.
**Вывод A2 — PLAUSIBLE.** Для текущей фазы минимальная разумная единица генерации — не предложение и не глава, а **дискурсный пакет**: один или несколько смежных исходных абзацев, образующих локальный ход/эпизод, с защищёнными границами сцены. Основной текст пакета переводится целиком; вокруг него подаётся компактный reference-context, который не надо переводить. Глава нужна как область предварительного чтения и извлечения опор, а не обязательно как единый output-вызов. Оптимум размера следует измерять, а не объявлять заранее.
### A3. Претензия 1: русские абзацы и литературные конвенции
**CONFIRMED.** Исходная и целевая дискурсные структуры у человеческих и машинных переводов различаются, а предложение-уровневые метрики не покрывают сущности, терминологию, кореференцию и кавычки. Источник — размеченный корпус китайско-английских романов BWB; это близкий по исходному языку, но не русскому, evidence. Jiang et al., [Discourse-Centric Evaluation of Document-level Machine Translation with a New Densely Annotated Parallel Corpus of Novels](https://aclanthology.org/2023.acl-long.435/), ACL 2023, доступ 2026-07-11.
**PLAUSIBLE.** Нужна не ещё одна абстрактная команда «собери естественные абзацы», а наблюдаемая целевая операция:
1. сначала определить внутри пакета дискурсные ходы (кто воспринимает/говорит, действие, реакция, смена времени/места/фокала);
2. затем сформировать русские абзацы вокруг этих ходов, отдельно соблюдая оформление диалога;
3. только потом провести проверку покрытия по исходным атомам.
Эту операцию можно реализовать одним вызовом через краткий скрытый план и финальный текст либо отдельным layout/polish-проходом. Какой вариант лучше для дешёвой модели — вопрос A/B, а не установленный факт.
**PLAUSIBLE.** Few-shot должен показывать именно требуемое преобразование структуры: 23 коротких zh→ru примера «много однофразовых исходных строк → один естественный повествовательный абзац», «повествование → отдельная реплика → авторская ремарка», «смена фокала → новый абзац». Простой положительный пример проверяется отдельно от длинного списка negative constraints. Причина: текущая словесная инструкция не сработала; демонстрация задаёт форму результата. Прямого peer-reviewed замера именно русской перевёрстки в найденных источниках нет.
**PLAUSIBLE.** Отдельный target-only layout-пасс потенциально дешевле повторного bilingual editor-пасса: он получает только русский текст и задачу укрупнить/разделить абзацы без перефразирования. Но он не исправляет причинную связность и может закрепить смысловую ошибку; поэтому это узкий рычаг для претензии 1, не универсальное лечение.
**PLAUSIBLE.** Одновременный мандат редактора «сверить смысл + исправить реалии + выдержать глоссарий + улучшить стиль + реконструировать абзацы + ничего не добавить/удалить» создаёт конкуренцию критериев у слабой модели. Дешёвый тест — разделить semantic revision и target-language paragraph/style polish; дорогой — оставить один сильный editor. Ни «CoT всегда помогает», ни «negative constraints всегда вредят» без локального замера не утверждается.
### A4. Претензия 2: связи и смысл на дистанции
**CONFIRMED.** Контекстные ошибки требуют специальных измерений: sentence-level BLEU может почти не замечать анафору, связность и лексическую когезию. Литература предлагает отдельные тесты для местоимений/кореференции и документные метрики когезии. Источники: Jwalapuram et al., [Evaluating Pronominal Anaphora in Machine Translation](https://aclanthology.org/D19-1294/), EMNLP 2019; Libovický et al., [Machine Translation Evaluation beyond the Sentence Level](https://aclanthology.org/2018.eamt-main.18/), EAMT 2018; доступ 2026-07-11.
**CONFIRMED.** DelTA использует не «всю книгу в промпте», а четыре специализированные памяти: записи имён, двуязычное резюме, long-term retrieval и short-term контекст. В ICLR 2025 заявлены средние улучшения до 3,16 COMET и до 4,58 процентного пункта consistency; система переводит по предложениям ради полноты. Это peer-reviewed DocMT, но не литературная zh→ru оценка и не доказательство необходимости всех четырёх компонентов. Источник: Wang et al., [DelTA: An Online Document-Level Translation Agent Based on Multi-Level Memory](https://proceedings.iclr.cc/paper_files/paper/2025/hash/285149554f6fbed6e2f9ec72d131bd23-Abstract-Conference.html), ICLR 2025, доступ 2026-07-11.
**CONFIRMED, но vendor-like/системный claim.** TransAgents организует литературный перевод как роли редактора, переводчика, локализатора и корректора с циклом проверки; опубликованный demo-paper сообщает человеческие предпочтения и низкую относительно человека цену. Это prior art организации, но его сильные маркетинговые формулировки нельзя считать независимым доказательством превосходства, а многоагентность сама по себе не изолирована как причина. Источник: Wu et al., [TransAgents: Build Your Translation Company with Language Agents](https://aclanthology.org/2024.emnlp-demo.14/), EMNLP Demo 2024, доступ 2026-07-11.
**PLAUSIBLE.** Максимум эффекта при минимуме стройки даст не полноценная агентная память, а следующий порядок армов:
1. **look-behind:** предыдущий русский абзац + соответствующий китайский хвост как read-only reference;
2. **look-ahead:** следующий китайский абзац/до границы сцены, помеченный «не переводить», чтобы снять катафору и неоднозначность текущей фразы;
3. **chapter card:** краткие сущности, отношения, текущая цель/локация/время и нерешённые референсы, извлечённые одним предварительным чтением главы;
4. только затем retrieval/долгая память и отдельный аннотатор связей.
Порядок — инженерная гипотеза по цене строительства. Look-ahead особенно важен для китайского нулевого подлежащего, но величина эффекта именно zh→ru не подтверждена найденным контролируемым исследованием.
**PLAUSIBLE.** Глоссарий лечит стабильность именования, но не заменяет модель ситуации: одинаково написанное имя не разрешает, кто что сделал, почему персонаж реагирует и к чему относится опущенное подлежащее. Поэтому в полигоне терминологическая consistency и causal/coreference comprehension должны быть разными исходами.
**PLAUSIBLE.** Сильная модель может одновременно улучшить локальный русский и рассуждение, но arm «модель сильнее» без одинакового контекста не отвечает, где потолок — в модели или организации. Нужен 2×2: слабая/сильная модель × текущий/дискурсный контекст. Если контекст помогает обеим, проблема частично организационная; если только сильная проходит смысловые ловушки, есть model floor.
### A5. Кривая «размер чанка ↔ качество ↔ биллинг ↔ ретраи»
**CONFIRMED как бухгалтерская рамка, не как эмпирическая кривая.** Для главы из `S` исходных токенов, чанка полезной длины `c`, фиксированного prompt/reference overhead `h`, коэффициента выходных токенов `r` и цен `p_in`, `p_out` ожидаемая цена без ретраев грубо равна:
`C(c) ≈ ceil(S/c) · h · p_in + S · p_in + rS · p_out`.
Значит, при прочих равных рост `c` уменьшает повторяемый overhead. Это арифметика; она не говорит, что качество растёт.
**PLAUSIBLE.** С ретраями цена становится нелинейной. Если вероятность неуспеха чанка `q(c)` и весь вызов повторяется до успеха, множитель ожидаемых попыток — `1/(1-q(c))`; ожидаемо повторно оплачивается весь `h+c+rc`. Даже если число вызовов падает, большие чанки дороже терять при timeout/refusal/excision. Реальная `q(c)` должна быть измерена по типам отказа, а не подогнана общей долей retry.
**PLAUSIBLE.** Качество вероятно имеет внутренний оптимум: слишком малый `c` режет дискурс и размножает prompt overhead; слишком большой `c` размывает релевантный контекст, затрудняет контроль полноты и повышает ущерб одного сбоя. Исследование long-context DocMT подтверждает возможность деградации при расширении контекста, но форму кривой для этого пайплайна надо пререгистрировать и измерить. Источник: Herold & Ney 2023, ссылка в A2, доступ 2026-07-11.
**Предрегистрация A5 — PLAUSIBLE.** Сравнить не только размеры 0,75k / 1,5k / 3k / «глава», но и две политики границ при сопоставимом бюджете: фиксированная упаковка против scene/discourse-aware упаковки. На каждом арме сохранять: вход/выход токены, latency, долю и причину ретраев, долю повторно оплаченных токенов, полноту, blind reader preference, paragraph score и размеченные coreference/causal traps. Иначе размер будет спутан с качеством границ.
### A6. Оси, которые легко пропустить
**PLAUSIBLE — структурная утечка через черновик.** Редактор видит дробный черновик, который становится сильной формальной подсказкой, тогда как абстрактная инструкция просит его форму разрушить. Arm «редактор видит тот же текст без пустых строк/с ID смысловых атомов» отделит якорение на layout черновика от неспособности модели к русской композиции.
**PLAUSIBLE — конфликт полноты и естественной композиции.** Формула «не выбрасывай и не добавляй предложения» полезна для покрытия, но может восприниматься как требование сохранять предложение-к-предложению и мешать слиянию/членению русских предложений. Следует сохранять **смысловые атомы**, а не число предложений: пронумеровать атомы только для внутренней проверки, разрешив объединять и делить предложения в финале. Это должно пройти отдельный coverage gate.
**PLAUSIBLE — мусор до романа портит style prior.** Первый чанк содержит метаданные, обзор, интернет-ссылку и предисловие, а не однородную художественную сцену. Общий genre prompt не различает front matter, авторское предисловие и роман. Классификация типа блока до перевода может предотвратить перенос регистров и бессмысленную «литературизацию» служебного текста.
**PLAUSIBLE — направление контекста важно.** Только прошлое помогает последовательности, но не всегда пониманию текущей китайской эллиптики; только будущее рискует спойлерным перефразированием. Поэтому previous-target, previous-source и next-source надо факторизовать, а не объединять сразу в один «context arm».
**CONFIRMED.** Правильность контекстного метода нельзя заключать из общего score: perturbation test с корректным против случайного контекста показывает, использует ли система именно опорный контекст. Источник: Mohammed & Niculae, [On Measuring Context Utilization in Document-Level MT Systems](https://aclanthology.org/2024.findings-eacl.113/), Findings of EACL 2024, доступ 2026-07-11.
**PLAUSIBLE — оценщик должен разделять читателя и билингва.** Русскоязычный читатель способен оценить ритм, абзацы и естественность, но не диагностирует тихое искажение; билингв — смысл и связи, но может терпеть translationese. Минимальный полигон требует двух независимых рубрик и запрета показывать arm/model judge-у.
**REFUTED как универсальный тезис.** «Больше агентов автоматически означает лучше» не следует из prior art: TransAgents демонстрирует целую систему, DelTA — специализированную память, а paragraph-level LLM уже улучшал результат без агентного оркестра. Сначала следует покупать информацию (границы, соседний контекст, chapter card), затем роли и циклы.
### A7. Независимая карта причин и минимальных вмешательств
| Наблюдаемая проблема | Вероятный механизм | Самый дешёвый различающий тест | Что не считать доказательством |
|---|---|---|---|
| Почти каждый ход остаётся отдельным абзацем | Якорение на layout исходника/черновика; инструкция без демонстрации; перегруженный editor mandate | layout few-shot; draft без пустых строк; отдельный target-only reflow | Снижение числа абзацев само по себе |
| Связь ломается внутри чанка | Модель не строит локальную ситуацию; противоречивый/перегруженный мандат | semantic-first editor с явными entity/action/reason checks | Более гладкий русский без сверки смысла |
| Связь ломается на границе чанков | Нет previous/next reference; граница не совпадает со сценой | ±1 абзац reference и scene-aware boundary | Увеличение токенов без релевантного контекста |
| Теряются дальние сущности/цели | Нет chapter/book state | краткая chapter card против glossary-only | Единообразное имя при неверной кореференции |
| Сильный стиль ценой пропуска | Свободный polish без атомарного coverage | atom IDs + post-check, разрешив русское split/merge | Совпадение числа предложений |
| Большие чанки нестабильны/дороги | Растёт payload одного сбоя и нерелевантный контекст | size sweep с раздельным учётом retry causes | Средняя цена успешного вызова без ретраев |
| Непонятно, виновата модель или пайплайн | Model/context confounding | 2×2 model strength × discourse context | Сравнение разных моделей на разных промптах |
**Итог §A — PLAUSIBLE.** Наиболее вероятный короткий путь к «минимально художественно» — не перевод всей главы и не многоагентная стройка, а дискурсно ограниченный пакет + небольшой соседний reference-context + few-shot русской перекомпоновки + раздельная смысловая и монолингвальная оценка. Первый полигон должен определить, достаточна ли текущая модель; не предполагать это заранее.
<!-- A_SHA256_PLACEHOLDER -->
## §B. Дифф после чтения внутреннего стека
### B0. Целостность анти-анкоринга
§A был записан отдельным снимком до чтения командных гипотез. SHA-256 этого A-only снимка: `b42c6f6e6dc06ec48f3472714ac2b9ca5eba0135fba204113e2628a36eacee99`. После этого прочитаны карта актуальности и D26/D30D35 в `docs/architecture/05-decisions-log.md`, раздел «Промптинг литперевода» в `docs/research/15-voice-and-state.md`, `docs/research/07-translation-methodology.md`, exp04/12/13 и `docs/research/16-reader-ide-alignment.md`. §A после чтения не изменялся.
### B1. Где независимая карта сошлась с командой
**CONFIRMED — команда угадала корень первого слоя.** §A независимо установил, что словесная reflow-инструкция уже есть, но результата не гарантирует; D35 независимо подтверждает на боевом снимке, что reflow действительно применялся, редактор был активен, а выход всё равно зеркалил рубленость источника. Значит, это не stale-конфиг и не пассивный mono-editor. Источники: локальный `docs/architecture/05-decisions-log.md`, D35.1, и текущие промпты, прочитаны 2026-07-11.
**CONFIRMED — команда уже сделала верный флип mono→bilingual.** Exp12 показал механическую пассивность mono-режима и структурную невозможность исправить 磕头/派/时辰 без исходника; D30 ратифицировал bilingual editor. Это полностью совпало с §A4: target-only polish не лечит смысл. Источники: локальные `docs/experiments/12-quality-diagnosis.md` §2.2/§2.5 и `docs/architecture/05-decisions-log.md` D30.1, прочитаны 2026-07-11.
**CONFIRMED — команда уже развела глоссарий и понимание ситуации.** D30.8/D35.4 различают термины, которые можно засидить сейчас, и «модель не следит за сюжетом», относимое к состоянию/памяти. Это совпадает с §A4. Источники: локальный D-лог, D30.8/D35.4, 2026-07-11.
**CONFIRMED — команда уже не считает жёсткую 1:1 структуру целью.** Research/16 показывает легитимный N:M, русскую норму тире-абзацев и рекомендует детектировать, а не форсировать парность. Это совместимо с §A3/A6: проверять смысловые атомы, не число предложений/абзацев. Источник: локальный `docs/research/16-reader-ide-alignment.md` §2.1§2.5, прочитан 2026-07-11; внешний якорь: Karpinska & Iyyer, [WMT 2023](https://aclanthology.org/2023.wmt-1.41/), доступ 2026-07-11.
**CONFIRMED — команда уже знает, что модель/промпт нельзя оценивать общим скаляром.** Exp12/13 разделили стиль и верность, но ревью D30/D32 вскрыло ложные «единогласия», коррелированные сигналы и катастрофы победителей. Предлагаемый в §A 2×2 и отдельные traps продолжают именно эту исправленную методику. Источники: локальный D-лог D30/D32 и exp12/13, прочитаны 2026-07-11.
**CONFIRMED — prompt-format prior art уже покрыт research/15.** Формат, позиция, сэндвич, few-shot-раскол по моделям, lost-in-middle и опасность ручного CoT уже исследованы. Поэтому данный доклад не рекомендует универсальный XML/CoT-рецепт и не дублирует этот обзор. Источник: локальный `docs/research/15-voice-and-state.md` §3.1§3.3, прочитан 2026-07-11.
### B2. Что в §A есть сверх текущей карты команды
**PLAUSIBLE — независимое разведение трёх единиц.** В D35 главная ось сформулирована как «нарезка × промпт» и кандидаты `draft=чанк/edit=глава`. §A добавляет обязательное различение: coverage atom ≠ generation unit ≠ reference-context span. Глава может быть областью чтения/извлечения опор, не единым completion. Это предотвращает ложный выбор «1,5k или вся глава».
**PLAUSIBLE — якорение редактора на форме draft как отдельная причина.** Командные документы обсуждают исходную построчность и ненадёжность reflow, но не изолируют arm, где редактор получает тот же черновик без пустых строк/с нейтральными атомарными ID. Если такой arm резко улучшит абзацы при той же модели и промпте, менять размер чанка преждевременно.
**PLAUSIBLE — look-ahead как дешёвый самостоятельный arm.** D21/research15 проектируют scene-state/Annotator для Ф2; D35 говорит о cross-chunk. В прочитанных экспериментах не изолирован следующий китайский абзац как read-only reference. Для катафоры, нулевых субъектов и поздно раскрываемого отношения это дешевле полноценной памяти. Доказанного эффекта zh→ru нет — именно поэтому arm нужен.
**PLAUSIBLE — discourse-move reflow вместо общего «русские абзацы».** Текущий reflow-промпт содержит результатное требование, но не операциональную рубрику «фокал/действие/реакция/смена времени/места/говорящего». Few-shot должен показывать структурное преобразование, а не только красивый стиль. Research/15 покрывает общую форму few-shot, но не этот тип примера.
**PLAUSIBLE — факторный model-floor тест.** D35 разрешает фронтир-арм, но без 2×2 сильная модель на ином промпте/размере оставит прежний конфаунд. Нужны одна и та же слабая и сильная модели на текущей и дискурсной организации. Это отвечает именно на вопрос владельца «модель не понимает» против «мы не дали ей опоры».
**PLAUSIBLE — тип блока/front matter.** Сырьё первой главы смешивает метаданные, интернет-обзор, авторское предисловие и роман. Во внутренних качественных экспериментах эта ось не выделена. Она не объясняет все 25 глав, но способна портить локальный style prior и оценку главы 1.
**PLAUSIBLE — retry-cost надо считать повторно оплаченными токенами, а не только retry-rate.** D35 запросил кривую размера, но формула §A5 делает явным ущерб одного крупного сбоя. Это важно при сравнении главы с чанком: одинаковая доля отказов не означает одинаковую цену.
### B3. Где §A разошёлся с командными гипотезами
**Расхождение 1 — глава целиком не должна быть привилегированным кандидатом.** D35 справедливо хочет arm «глава целиком», но prior art поддерживает paragraph/discourse units и предупреждает о деградации длинного контекста. Глава нужна как диагностический потолок и область read-ahead; прод-кандидатом по умолчанию её считать нельзя. Источники: [Hu & Wan 2023](https://aclanthology.org/2023.emnlp-main.857/), [Herold & Ney 2023](https://aclanthology.org/2023.codi-1.15/), доступ 2026-07-11.
**Расхождение 2 — `draft=чанк/edit=глава` слишком рано превращать в архитектурную лестницу.** Она может победить, но смешивает три изменения: больше source context, больше draft context и иной масштаб reflow. Сначала нужны прямые ручные армы, разделяющие эти факторы. Лишь затем runner-изменение.
**Расхождение 3 — «cross-chunk = Ф2» слишком жёсткая граница.** Полноценная долговременная память, Annotator и retrieval действительно Ф2. Но ±1 source paragraph, previous target tail и статичная chapter card можно измерить и даже рендерить без обученной памяти. Это near-term context engineering; продовая автоматизация может потребовать небольшую машинерию, но не весь Ф2-стек.
**Расхождение 4 — отдельный layout-пасс не обязан быть детерминированным.** Exp12 рассматривает «детерминированный reflow-пасс» как вариант, но логическое слияние повествования семантично; чистая пунктуационная эвристика надёжно оформит реплики, но не решит, где кончается мысль. Детерминированным должен быть валидатор/аварийная механика, а сам reflow — LLM или ручная редактура, если нужны смысловые абзацы.
### B4. Что команда сделала лучше независимой карты
**CONFIRMED.** Research/16 дал точные русские нормы диалога и сильное различение legit N:M против структурного дефекта; §A был грубее. Источник: локальный research/16 §2.3, 2026-07-11.
**CONFIRMED.** Exp12/13 и D30/D32 дали локальную причинную эмпирику по конкретным моделям: mono no-op, active bilingual, ошибочные инверсии редактора, flash-vs-pro trade-off и ложная независимость судей. Внешняя литература этого заменить не может. Источники: локальные exp12/13 и D30/D32, 2026-07-11.
**CONFIRMED.** D35 измерил боевой прогон: reflow применён, draft→final similarity 0,643, 34/55 чанков сильно правлены, около 1,28 стыка чанков на главу. Это сдвигает приоритет к внутри-чанковой организации абзацев: cross-chunk нельзя объявлять главным виновником без trap-разметки. Источник: локальный D35.1, 2026-07-11.
## §C. Рекомендации — вход полигону
### C1. Главный дизайн: не один bake-off, а две короткие ступени
**Ступень I — причинная проба на 68 ловушках, а не на «средних главах».** Взять места владельца плюс независимо размеченные случаи четырёх типов: (a) повествовательные предложения, которые должны стать одним русским абзацем; (b) диалог с 1:N; (c) связь, разрешимая внутри текущего чанка; (d) связь, для которой опора находится только за его границей. Разметить до генерации: supporting span и допустимый смысл. Это согласуется с выводом, что общие sentence-level метрики не видят дискурс. Источники: [Jiang et al. 2023](https://aclanthology.org/2023.acl-long.435/), [Mohammed & Niculae 2024](https://aclanthology.org/2024.findings-eacl.113/), доступ 2026-07-11.
**Ступень II — blind chapter reading только трёх финалистов.** Не давать владельцу 8 почти одинаковых вариантов, как в exp12. После trap-гейта оставить baseline, лучший near-term arm и frontier diagnostic. Главный исход — бинарное закрытие двух претензий + ранжирование, вторичный — размеченные ошибки.
### C2. Армы и порядок
Обозначения фазы: **СЕЙЧАС** — прямые вызовы/ручная упаковка, без Ф2; **ПРОД-МИНОР** — после доказанного ROI нужна небольшая правка рендера/сегментации; **Ф2** — долговременное состояние, Annotator, retrieval или новый per-stage runner-контракт.
| Приоритет / механизм | Как измерить: arm и проба | Цена | Ожидаемый эффект | Фаза |
|---|---|---|---|---|
| **P0. Чистый baseline** | Точный текущий prod prompt+инъекция+1,5k chunk на тех же traps; исключить экспорт-пустоты ch5/ch20 по D35.4 | Уже известна | Нулевая точка обеих претензий | СЕЙЧАС |
| **P1. Discourse-reflow prompt** | Тот же source/draft/chunk/model; добавить 23 структурных few-shot и рубрику ходов: фокал/действие/реакция/смена места-времени/говорящего; финал без плана | +кэшируемый префикс; почти $0 относительно generation | Главным образом абзацы; возможно локальная связность | СЕЙЧАС |
| **P1. Draft-layout ablation** | Повтор P1, но перед editor заменить пустые строки draft на нейтральные separators или пронумерованные смысловые атомы; финал должен удалить ID | Токены ≈ те же; ручная подготовка | Проверяет якорение на форме черновика | СЕЙЧАС; ПРОД-МИНОР при победе |
| **P1. Semantic-first vs combined** | На том же P1 сравнить один combined editor с двумя узкими проходами: bilingual semantic repair → target-only literary reflow; одинаковый coverage gate | Примерно +1 output-пасс; потенциально до ~2× editor-output, измерить | Первый проход — смысл, второй — абзацы/русский; снимает конкуренцию мандатов | СЕЙЧАС; ПРОД-МИНОР |
| **P1. Reference ±1** | К P1 дать previous source+target tail и next source paragraph, явно `REFERENCE — НЕ ПЕРЕВОДИТЬ`; три отдельные абляции prev / next / both | +сотни input-токенов, без нового output | Coreference/ellipsis/cataphora около стыков | СЕЙЧАС; ПРОД-МИНОР |
| **P2. Chapter card** | Один раз вручную/LLM извлечь для главы сущности, отношения, локацию, время, цель и unresolved refs; подать только релевантную компактную карточку каждому trap | Один pre-pass/глава + ~100300 input-ток./чанк; точный COGS замерить | Дальние связи без полной главы | СЕЙЧАС как ручной arm; Ф2 для durable auto-state |
| **P2. Whole-chapter editor diagnostic** | Склеить lossless source и drafts главы, один bilingual edit; те же prompt/few-shot; строгий atom coverage и sanitizer | Меньше fixed overhead, но большой input/output и дорогой retry | Верхняя диагностическая граница reflow/связности; не prod-фаворит | СЕЙЧАС диагностика; Ф2 runner при победе |
| **P2. Discourse packet** | Ручные пакеты по сцене/ходу при сопоставимом 1,5k и 3k бюджете; сравнить с fixed packing | Ручная разметка; API цена близка size-matched | Изолирует качество границ от размера | СЕЙЧАС диагностика; ПРОД-МИНОР/Ф2 для сегментатора |
| **P2. Model floor 2×2** | Текущая дешёвая и согласованная frontier-модель × baseline и лучший P1/P2 context. Одинаковые тексты/brief/output cap | 4 клетки; per-call cap; frontier только на traps+1 главе | Отделяет потолок модели от организации | СЕЙЧАС |
| **P3. Size/retry curve** | 0,75k / 1,5k / 3k / глава, но отдельно fixed vs discourse boundary; ≥3 repeats только для операционной стохастики, не для «перерисовать качество» | Сохранять input/output/reasoning/retry токены и $ | Находит внутренний оптимум и цену отказа | СЕЙЧАС диагностика |
| **P3. Proper-noun/genre gap cleanup** | До blind-пакета закрыть известные 甲乙丙丁/资质 и иные однозначные gaps, но не менять спорные формы между arms | Дешёвая курация; один resnapshot только после решения | Локальные смысл/жанр-дефекты, не дискурс | СЕЙЧАС |
| **P4. Auto scene-state / retrieval** | Только если compact manual card даёт лифт: автоматический annotator + long/short memory; отдельная проверка ошибок карточки | Новый pre-pass, хранение, retrieval, versioning | Дальняя связность/последовательность | Ф2 |
| **P4. Voice/address/reveal memory** | Не смешивать с текущим полигоном двух претензий; отдельные заранее размеченные случаи | Уже спроектированный дополнительный слой | Голос, отношения, спойлеры; не основная абзацность | Ф2 |
### C3. Что именно писать в сильном discourse-reflow prompt
Это не готовый «оптимальный промпт», а **арм для замера**. Не добавлять ручной verbose CoT reasoning-модели. Операционное ядро:
1. «Сначала молча определи смысловые ходы: единый фокал/наблюдатель; действие и непосредственная реакция; одна тема рассуждения; смена говорящего, времени, места или фокала».
2. «Один повествовательный ход обычно оформляй одним русским абзацем, даже если китайский исходник разбит на однофразовые строки. Не объединяй только ради длины».
3. «Каждую новую реплику — с нового абзаца через тире; слова автора при той же реплике оставляй в её абзаце».
4. «Разрешено объединять и делить русские предложения; запрещено терять смысловые атомы. Число предложений и абзацев не обязано совпадать».
5. «REFERENCE-блоки нужны только для разрешения связей; не переводи и не пересказывай их в выходе».
Few-shot должны быть минимальными и ортогональными: narrative N:1, dialogue 1:N, focal-shift boundary. Для DeepSeek thinking-arm сначала проверить zero-shot против few-shot из-за уже задокументированной модельной специфики research/15; не переносить результат между моделями.
### C4. Метрики и гейты — пререгистрировать
| Ось | Первичный показатель | Аварийный гейт |
|---|---|---|
| Русская абзацность | Blind preference русскоязычного читателя + доля заранее размеченных paragraph traps, решённых правильно | Нельзя побеждать только меньшим числом абзацев |
| Смысл внутри чанка | Билингвальная trap accuracy с обязательным supporting span | Любая инверсия действия/участника = catastrophe независимо от среднего ранга |
| Смысл через границу | Accuracy отдельно по prev-supported / next-supported / chapter-supported | Random-context perturbation не должен давать тот же результат, иначе context не используется |
| Полнота | Покрытие смысловых атомов, не совпадение числа предложений | Любой пропуск заголовка/события дисквалифицирует arm на этом фрагменте |
| Операционность | `$`, input/output/reasoning tokens, latency, retries по причинам, **повторно оплаченные токены** | Per-call predicted-cost cap до запуска; не group-level cap (урок exp13) |
| Робастность | Leave-one-judge-out + отдельный catastrophe screen | Коррелированные колонки одного судьи не считаются независимыми сигналами |
**CONFIRMED.** Контекстный arm должен иметь correct-context vs shuffled-context perturbation: иначе улучшение нельзя приписать использованию опоры. Источник: [Mohammed & Niculae 2024](https://aclanthology.org/2024.findings-eacl.113/), доступ 2026-07-11.
### C5. Критерии решения после полигона
- Если **P1 discourse prompt** закрывает абзацы без падения fidelity — катить prompt/few-shot; размер не менять.
- Если помогает только **draft-layout ablation** — проблема в формальном якоре, строить deformat/atom rendering, не chapter editor.
- Если **±1 reference** закрывает большинство смысловых traps — строить малое context-window rendering до Ф2-памяти.
- Если нужна **chapter card**, но whole chapter не лучше — строить state extraction/retrieval в Ф2.
- Если **whole chapter** выигрывает и по fidelity, и по абзацам, и по retry-adjusted COGS — только тогда проектировать per-stage granularity; повторить на более длинной главе до решения.
- Если сильная модель выигрывает в обеих колонках 2×2, а организация почти не помогает — зафиксирован model floor; не строить сложную память ради слабой модели.
- Если организация помогает обеим моделям, а сильная+организация даёт дополнительный лифт — разделить near-term context fix и premium model tier.
## §D. Вопросы, на которые не хватило данных
1. **Где именно supporting context у мест владельца?** D35 сообщает около 1,28 стыка чанков на главу, но нет разметки: какой процент смысловых провалов разрешается внутри чанка, предыдущим абзацем, следующим абзацем, всей главой или знанием мира.
2. **Какова реальная длина/токенизация главы в выбранных traps?** Без распределения нельзя заранее оценить whole-chapter retry exposure и lost-in-middle.
3. **Какой frontend/model будет «ChatGPT-arm» полигона?** Эффект prompt format и few-shot модель-специфичен; нельзя честно выдать единый prompt winner без точного model ID/posture.
4. **Сохраняются ли source paragraph IDs до editor rendering?** Это определяет, можно ли сделать atom coverage/deformat без runner-изменения.
5. **Можно ли дать editor соседний source/target как non-output reference текущим renderer-ом?** Если нет, ручной полигон всё равно возможен, но production-оценка стройки меняется с ПРОД-МИНОР на Ф2 runner work.
6. **Каковы retry causes по размеру на боевых моделях?** Нужны отдельно timeout, refusal, length, echo, sanitizer и decode; общий retry-rate скрывает разные зависимости от `c`.
7. **Есть ли канонический человеческий/фанатский zh→ru фрагмент с хорошей русской репараграфизацией?** Он нужен как calibration/few-shot, но не как единственный reference style. В репозиторий книжный текст переносить нельзя.
8. **Как owner оценивает допустимую степень синтаксического split/merge?** Текущий запрет «не выбрасывай и не добавляй предложения» двусмыслен; нужно подтвердить, что сохраняется содержание, а не sentence count.
9. **Насколько front matter должен входить в приёмку художественности?** Его регистр отличается от романа и может искажать итог главы 1.
10. **Какой порог успеха «минимально художественно»?** Предлагается операционализировать: обе претензии закрыты на ≥80% заранее размеченных traps, 0 катастроф смысла, и blind majority предпочитает arm baseline на каждой из трёх регистровых глав. Число 80% — предложение для пререгистрации, не внешний факт.
### Финальный вердикт
**PLAUSIBLE.** Самый дешёвый следующий ход — не ещё один общий model bake-off и не немедленная Ф2-память. Это короткий причинный полигон: текущий baseline → discourse/few-shot reflow → deformatted draft → ±1 reference, затем 2×2 с frontier-моделью. Whole-chapter arm нужен как диагностическая граница, но не как заранее выбранная архитектура. Автоматический scene-state/DelTA-класс оправдан только если компактная ручная chapter card сначала докажет лифт.

View file

@ -0,0 +1,345 @@
# research/18 — Рычаги качества: как дотянуть текущую фазу до минимально-художественного zh→ru
<!-- ─────────────────────────────────────────────────────────────────────────
ОРКЕСТРАТОР — РЕВЬЮ-ШАПКА (лендинг, D36, 12.07 №4). Тело §A НЕ тронуто (заморожено;
sha256 44f90364… СВЕРЕН побайтно из закоммиченных байтов между BEGIN/END → MATCH →
§A доказуемо не редактировалась после заморозки). Поправки — в этой шапке и в §E
(«испр. оркестратором»). Полный разбор — PROGRESS §лендинг D36 + D-лог D36.
ВЕРДИКТ: **ACCEPT_WITH_FIXES.** Более ценный из двух входов: единственный отвечает на
вопрос владельца «конвенция vs стиль» с zh→ru источниками; строгость по COGS; честные
само-поправки; каждый §C-арм привязан к D-номерам и re-gate D34.3. Несущий диагноз и
набор §C-армов подтверждены; дефекты — цитатно-рамочные, ядро не рушат.
НЕЗАВИСИМАЯ ВЕРИФИКАЦИЯ (мультиагентный воркфлоу, 26 агентов, первоисточники + реплика
сырья, $0, refute-by-default; author≠reviewer к отчёту):
- **Источники: 57/57 несущих цитат СУЩЕСТВУЮТ — 0 сфабрикованных.** Проверены ВСЕ «2026»-
препринты (2601.08070 / 2605.31056 / 2605.29800 / 2605.13596 / 2605.13368 / 2511.09796
и др. резолвятся на arXiv к заявленным заголовкам). 50/57 — claim-fidelity полная; 7 —
«частично» (источник реален, атрибуция переисчерпана; поправки 13 ниже).
- **Эмпирика воспроизведена на сырье:** ch5.0 (draft 5425 симв.→финал ПУСТ, `sanitizer_defect`)
и ch20.0 — ТОЧНО; CJK-утечка **13 финалов — точно** (draft-«21» включает U+3000-отступ —
настоящих иероглифов в draft = 9); 41/51 ~1:1 — в допуске (знаменатель точен, числитель
толеранс-чувствителен, вывод устойчив); gl.7-инверсия (没有一个不知道→«никто не знал») и
gl.8-сплющивание (物是人非→«всё изменилось») — фактически ПРИСУТСТВУЮТ (тяжесть — на
fidelity re-gate полигона, не здесь).
- **Ван Цуй (несущий вклад) — ПОДТВЕРЖДЁН по ТЕЛУ статьи:** скептик-агент декодировал
CID/Identity-H шрифт PDF (~42к симв., 7 ToUnicode-CMap) → 5 техник verbatim + причастные/
деепричастные обороты + подчинение как инструмент слияния + прескриптивная необходимость.
Вестник МГУ Сер.22, 2024 №3, с.86105, DOI 10.55959/MSU2074-6636-22-2024-17-3-86-105,
рецензирован — реальный peer-reviewed источник (не экстраполяция).
- **Анти-анкоринг:** гардрейлов не нарушено; ни один D-номер не течёт в §A; книжные цитаты
≤15 слов. Минор-провенанс: «(идея владельца)» на слое конвенций пары (§A4.4) не
прослеживается к разрешённым фазе-1 входам (возможна устная вводная — не задокументирована).
ПОПРАВКИ К ЛЕНДИНГУ (§A заморожена → корректны здесь; §E дополнена ниже):
1. **[цитата] DocRepair-числа** (deixis 50.0→91.8 / когезия 45.9→80.6 / эллипсис 53.0→86.4 /
73% предпочтения; §A4.8, §B2.4) — числа ВСЕ верны, но принадлежат ОТДЕЛЬНОЙ статье DocRepair
«Context-Aware Monolingual Repair for NMT» (EMNLP-IJCNLP 2019, aclanthology **D19-1081** /
arXiv **1909.01383**), НЕ процитированной ACL-2019 **P19-1116** (там CADec 50.0→81.6). Обе
Voita/Sennrich/Titov 2019. Вывод (монолингв. RU repair-пасс работает, EN→RU, с этими
магнитудами) СТОИТ; правка — расщепить две цитаты (сделано в §E).
2. **[цитата] TransAgents** — §A зовёт «TACL-версия» (arXiv 2405.11804, «To appear at TACL» —
подтверждено), §E зовёт «PP 2024-05»: выбрать одно (accepted-but-preprint точнее). Это
ДРУГАЯ статья, чем EMNLP-demo `2024.emnlp-demo.14` в ChatGPT-отчёте — не конфликт, две
реальные статьи об одной системе (см. §E).
3. **[цитата] Z5 «Li & Thompson»** (RG 235852523) — на деле Dingxu Shi, «Topic and Topic-Comment
Constructions in Mandarin» (Language 76(2), 2000); клейм топик-комментария верен, автор-метка
ошибочна. **Z8 «96% чэнъюй»** — числа НЕТ на процитированной Wikipedia (там «most»); суть
(подавляющее большинство четырёхзнаковые) верна, «96%» не источено.
4. **[рамка] Ван Цуй = прескрипция переводческой ТЕХНИКИ zh→ru, не «связующая норма языка».**
Рамка §A4.4/A5 «обязательная дискурс-операция наравне с нормой» слегка пере-возвышена: это
сильнейший маргинальный вклад отчёта (peer-reviewed техника: паратаксис→гипотаксис), но
ответ владельцу «конвенция, не стиль автора» несут в первую очередь Розенталь/Правила-1956
(нормы абзаца/диалога — CONFIRMED), а Ван Цуй — КАК их технически исполнить.
5. **[рамка] «Пост-черновая регрессия > многих качественных проблем»** (§A4.1/A2 headline) —
переоценено: ярчайший кейс (ch5.0-void) сам же исправлен в §B3 как ЭКСПОРТ-баг (не порча
смысла редактором); остаток = реальные, но узкие CJK-утечки + НЕподтверждённые инверсии (§A
помечает PLAUSIBLE). «Класс пост-черновой порчи существует» — честен; ранг «выше 2 претензий
владельца» — нет. Guard §C#5 всё равно дёшев → строить.
6. **[рамка] «Тройная сходимость»** (§B0) — оговорка про общую внешне-лит-ногу ПРИСУТСТВУЕТ и
честна (планка D25.10 взята). Уточнения оркестратора: (а) есть ВТОРАЯ необъявленная общая нога
оба §A читали одно сырьё/код (совпадение по «изоляции чанков / инертному reflow» тоже не
независимо); (б) цитатные базы двух отчётов почти НЕ пересекаются (~3 общие статьи) → там, где
литература всё же расходится, совпадение вывода СИЛЬНЕЕ, чем оговорка допускает; (в)
ChatGPT-заморозку класть в вес сходимости с дисконтом — её sha256 НЕ воспроизводится из
документа (внешний прогон владельца; см. шапку ChatGPT-отчёта).
───────────────────────────────────────────────────────────────────────────── -->
> Ресёрч-доклад независимой сессии-ресёрчера (D35.5). Вход эмпирической сессии полигона.
> Протокол — трёхфазный анти-анкоринг: §A построена ДО чтения наших решений (только две претензии владельца + сырьё пере-прогона + механизм-как-есть + собственный внешний ресёрч). §B/§C/§D — после чтения нашего стека.
> Каждый несущий клейм: вердикт **CONFIRMED / PLAUSIBLE / REFUTED** + источник (тип/дата). Препринт ≠ peer-review; вендор-клейм ≠ независимый замер; результат «в английский» ≠ доказательство «в русский» (помечаю экстраполяцию явно). Отчёт пройдёт адверсариальную верификацию оркестратора по первоисточникам.
---
<!-- BEGIN §A FROZEN — не редактировать после заморозки; sha256 ниже в маркере -->
## §A — «Чистый лист» (заморожено)
### A0. Метод и границы
Прочитано в фазе 1 (разрешённое): две претензии владельца; сырьё пере-прогона — исходник `guzhenren-slice25.gb18030.txt`, `rerun/records.json` (по-чанково: source/draft/final/флаги), `rerun/rerun-ru.txt`; механизм-как-есть — `backend/internal/pipeline/chunker.go`, `backend/prompts/{translator,editor}.md`. Плюс собственный внешний веб-ресёрч (52-агентный фан-аут с адверсариальной верификацией).
НЕ читалось (анти-анкоринг): `05-decisions-log.md`, хендоффы (`ORCHESTRATOR_HANDOFF.md`, `FIDELITY_REGATE_HANDOFF.md`), `rootcause_auto.json`, glossary-signoff, `diag/arms/*`, выводы приёмки. Заголовки последних коммитов присутствовали в среде сессии ambient — на содержание §A не опирался.
### A1. Механизм как есть (из кода и промптов)
- **Нарезка** (`chunker.go`): жадно пакует ЦЕЛЫЕ абзацы до `targetChunkTokens=1500` (код-конст, версионируется `chunkerVersion`, фолдится в снапшот); абзац сверх бюджета спускается к границам ПРЕДЛОЖЕНИЙ (предложение не рвётся). Детерминированно, чисто. Фактически ~2 чанка на главу (57 чанков / 25 глав), медиана исходного чанка ~1639 zh-символов.
- **Пайплайн**: по-чанково ПЕРЕВОД (draft) → по-чанково РЕДАКТУРА (bilingual, source+draft). Каждый чанк — в ИЗОЛЯЦИИ. НЕТ overlap между чанками, НЕТ running-summary, НЕТ контекста прошлых глав. Единственная кросс-чанковая память — термин-ГЛОССАРИЙ, добавляемый редактору.
- **translator.md**: только `{{text}}`; инструкции — «живой литературный русский», верстать по нормам РЯ (НЕ копировать построчную разбивку), прямая речь через тире.
- **editor.md**: bilingual, `{{text}}`(src)+`{{draft}}`; сверять смысл с исходником, убирать кальки, глоссарий СТРОГО; «собирай повествование в естественные русские абзацы (не копируя построчную разбивку)»; полнота — не выбрасывать/не добавлять.
### A2. Замеренная слабость (сырьё)
**Претензия 1 (рубленость) — ПОДТВЕРЖДЕНА замером.** 41/51 нарративных чанков дают ~1:1 отношение «финальных абзацев к строкам исходника»; 58% ненарративных абзацев — одно предложение; медиана предложений/нарративный-абзац = 1.0. Инструкция reflow, присутствующая в ОБОИХ промптах, практически инертна.
**Локализация reflow-провала.** Черновик уже рубленый в 43/49 чанков (переводчик зеркалит построчную разбивку). Редактор СОХРАНЯЕТ структуру черновика в 37/49, СЛИВАЕТ лишь в 1/49 → редактор структуро-сохраняющий, НЕ работает layout-пассом. Вариативность reflow живёт в основном на стадии черновика (гл.11 черновик 25 абз., гл.13 — 14: переводчик там СЛИЛ). Оформление диалогов через тире — работает.
**Претензия 2 (связность/смысл) — ПОДТВЕРЖДЕНА чтением zh↔ru гл.512.** На уровне ПРЕДЛОЖЕНИЯ голос в целом приемлем, редактура часто улучшает (внутренний монолог в кавычках, разбивка атрибуции, лексические апгрейды). «Слабая художественность» идёт не от предложенческой translationese, а от кластера сбоев связности/полноты/терминологии. Конкретика:
- гл.7: инверсия двойного отрицания 没有一个不知道 («все знали») → «никто не знал» (противоречит главе). [дефект в черновике, редактура не починила]
- гл.8: 物是人非 (заглавие-ключ) сплющено до «всё изменилось», теряя контраст «вещи те же — люди иные».
- Терминология grade-системы 甲乙丙丁 — дрейф между разряд А/Б/В/Г, числовым «первого/третьего ранга» (коллизия с 转-рангом гу-мастера) и точечными сырыми глифами.
**Третья ось, НЕ входившая в претензии владельца (самое ценное наблюдение):** значимая доля «слабой художественности» — это РЕГРЕССИЯ ПОСЛЕ ЧЕРНОВИКА, а не качество перевода. Финал местами ХУЖЕ черновика:
- **гл.5.0: полный черновик 5425 симв. → финал ПУСТ, `edit_flag='sanitizer_defect'`** (собственный флаг пайплайна). Санитайзер обнулил целый чанк — миф об основании (Жэнь-цзу и три гу, метафора-ядро книги). Один из 2 пустых финалов на книгу. **[CONFIRMED — проверено мной по records.json.]**
- **Утечка CJK-глифов в вывод**: 13 строк финалов (и 21 строка черновиков) содержат сырые zh/полноширинные глифы; часть внесена редактурой (напр. гл.8 特产, гл.4.1 资质乙等 — в черновике корректно). **[CONFIRMED — проверено мной.]**
- Правки, ломающие смысл: гл.9 (переворот разряда В→Б у Фан Юаня, против всей его сюжетной линии низкого разряда), гл.10 (перекройка процентов восстановления в противоречивые «десятые/сотые») — **[PLAUSIBLE — наблюдение чтения; требует адверсариальной re-проверки оркестратором.]**
Вывод A2: перед постройкой машинерии связности имеет смысл СНАЧАЛА не давать пост-черновым стадиям (edit/sanitizer) разрушать уже годный черновик.
### A3. Карта «проблема → механизм» по осям
#### Ось 1. Дискурс-гранулярность zh→ru: где потолок — в моделях или в организации?
- **Абзац — эмпирически лучшая единица перевода, чем предложение** (меньше mistranslation/грамматики/несогласованности, естественнее верстается). **[CONFIRMED]** — Karpinska & Iyyer, *LLMs Effectively Leverage Document-level Context for Literary Translation* (WMT 2023, peer-reviewed, ACL 2023.wmt-1.41; arXiv 2304.03245). **Экстраполяция для нас:** мишени в статье — англ./польск./яп., zh как ИСТОЧНИК; направление «в русский» напрямую не мерено (польский — славянский прокси). Единственная модель — GPT-3.5.
- **Но у нас единица УЖЕ ~1600 симв. (много абзацев)** — то есть «апсайд от добавления контекста в единицу» в основном ПОТРАЧЕН; дальнейший рост единицы не даёт бесплатного качества. **[PLAUSIBLE]**
- **Потолок связности — в ОРГАНИЗАЦИИ (изоляция чанков), а не в сырой модели.** Кросс-предложенческий контекст даёт большой прирост на именно тех дискурс-феноменах, что суть претензии 2. **[CONFIRMED для направления в русский]** — Voita et al., *When a Good Translation is Wrong in Context* (ACL 2019, peer-reviewed, EN→RU OpenSubtitles): 7% индивидуально-верных пар неверны в контексте; окно 3 предложений поднимает deixis 50.0→81.6, лексич. когезию 45.9→58.1, VP-эллипсис — существенно. Домен — субтитры (разговорный), не проза; магнитуды индикативны.
- **«Потерянное в середине» ограничивает лишь ВЕРХНИЙ конец кривой** (целая глава / много чанков); на нашем ~1500-ток чанке эффект мягкий и НЕ объясняет текущие дефекты — это довод не прыгать к «глава целиком», а не диагноз. **[CONFIRMED]** — Liu et al., *Lost in the Middle* (TACL 2024; arXiv 2307.03172).
- **Ближайший индустриальный аналог нашего пайплайна** — TransAgents (мультиагентная «переводческая компания», zh→en вебновеллы): работает ПО ГЛАВАМ с персистентной Translation Guideline (глоссарий+резюме+тон+стиль), роли Senior/Junior Editor + Proofreader сверх голого translate→edit. **[CONFIRMED]** — TransAgents (TACL; arXiv 2405.11804). Оговорка: под капотом GPT-4-Turbo (фронтир), не дешёвая модель; человеко-предпочтение — монолингвально (слепо к верности).
#### Претензия 1. Абзацы/конвенции — это КОНВЕНЦИЯ ЯЗЫКА, академически кодифицированная, а не авторский стиль
Прямой ответ на вопрос владельца — **ДА, это норма русского языка, а не стиль одного автора:**
- **Русский абзац — логико-смысловая единица**, группирующая несколько предложений вокруг завершённой мысли; новый абзац — при логическом завершении мысли / смене темы-времени-места-говорящего. Построчно-однопредложенческое тело — по определению НЕ русское абзацирование. **[CONFIRMED]** — Текстология.ру, «Абзац как часть текста»; корпус-норма подтверждена независимо.
- **Диалог: каждая реплика — с красной строки через тире; кавычки для бегущего диалога не используются.** Слова автора — строго кодифицированная пунктуация (двоеточие/запятая-тире и т.д.). **[CONFIRMED]** — Розенталь, «Справочник», §47/§50 (Оформление прямой речи); Правила-1956 §195. (Источники — веб-зеркала Розенталя; нумерация разнится по изданиям.)
- **Китайская вебновелльная вёрстка расходится с РЯ по всем осям**: отступ    (U+3000×2, правило Ху Ши 1919), полноширинная пунктуация, диалог в 引号 «“ ”», привычка очень коротких абзацев (часто одно предложение / 自然段 для мобильного ритма). **[CONFIRMED]** — Wikipedia «Chinese punctuation» + история.
**Ключевой синтез:** корректный zh→ru reflow — это структурный трансформ из ЧЕТЫРЁХ операций, а не одна инструкция «не копируй разбивку»: (a) СЛИЯНИЕ подряд идущих коротких нарративных строк в многопредложенческие логические абзацы; (b) КОНВЕРСИЯ 引号-диалога в тире-абзацы по репликам; (c) НОРМАЛИЗАЦИЯ глифов (полн.→полуширинные, “ ”→« », — для речи); (d) СНЯТИЕ   -отступа. Операции (b),(c),(d) — **ДЕТЕРМИНИРОВАННЫЕ (код, без модели)**; операция (a) требует ДИСКУРСНОГО понимания, чем **сцепляет претензию 1 с претензией 2**. **[CONFIRMED как рамка]**
Почему инструкция игнорируется и чем чинить:
- **LLM surface-копирует построчную структуру входа** (переводы строк — высокосалиентные, near-синтаксические признаки; структурная персистенция), поэтому bilingual-редактор зеркалит one-sentence-per-line черновика. **[PLAUSIBLE]** — Sclar et al. (2024, 2310.11324, format-sensitivity) — аналогия, не прямой замер layout.
- **Гипотеза «негативный констрейнт («не копируй») сам по себе — главная причина» — REFUTED**: доказательства backfire негативных констрейнтов — слабые препринты про подавление англ. СЛОВ, не про zh→ru layout. **[PLAUSIBLE→REFUTED]**
- **Самый надёжный рычаг — few-shot экземпляры** (рубленый источник/черновик → слитый многопредложенческий целевой абзац), и особенно **target-side якорь** (реальный русский литературный абзац в контексте), т.к. модель копирует структурные решения из демонстраций. **[PLAUSIBLE]** — FollowBench (2024, 2310.20410) — смежная опора.
- **Отделить «дать верную русскую прозу» от «разложить в абзацы»** (отдельный reflow/layout-пасс или plan-then-write): инлайн-энфорсмент формата конкурирует с контент-целью; прирост измеримый, но скромный, +1 LLM-вызов. **[PLAUSIBLE]** — 2510.03595 (препринт).
- **Осторожно**: слияние предложений и укрупнение контекста ПОВЫШАЮТ риск ОПУЩЕНИЙ и путаницы атрибуции — агрессивный reflow сам может терять/скремблить смысл; нужен guard полноты. **[CONFIRMED]** — Karpinska & Iyyer (WMT 2023).
#### Претензия 2. Понимание связей/смысла на дистанции
- **Корневая причина — кросс-чанковая ИЗОЛЯЦИЯ.** Впрыск даже малого контекста (предыдущий src/tgt-хвост + running bilingual summary + реестр имён/антецедентов) даёт большие замеренные приросты consistency и дискурса — на ТОМ ЖЕ домене (китайские вебновеллы). **[CONFIRMED ядро]** — DelTA (ICLR 2025, peer-reviewed; arXiv 2410.08143): память-тиры (Proper-Noun Records, running summary), GuoFeng zh→en; средний прирост согласованности +4.58 (заголовочный +48.5 — единичный best-case). Оговорка: не →ru; часть опор — препринты.
- **zh-специфика: нулевые/опущенные местоимения и субъекты (zero anaphora)** — доминирующий драйвер провала на дистанции; русский (non-pro-drop, согласование род/число) требует ЭКСПЛИЦИТАЦИИ, а антецедент часто в ПРЕДЫДУЩЕМ предложении → корректное восстановление структурно НЕВОЗМОЖНО при поч-чанковой изоляции. **[CONFIRMED, что это архитектурный, а не только «дешёвая модель», баг]**. Голая инструкция «будь внимателен» почти не помогает; чинит только явный контекст/аннотация. **[PLAUSIBLE]** — препринт 2605.31056 (zh→en: <50% ZP базово, oracle-разметка +40 пт); экстраполяция на ru.
- **Глоссарий — слабейшая кросс-чанковая память**: адресует только лексическую когезию (~14% русских дискурс-ошибок), мимо deixis (~37%) и эллипсиса/морфологии (~29%). **[CONFIRMED]** — производно от Voita et al. (ACL 2019). Значит от глоссария в одиночку прироста связности ждать мало.
**Ранжирование лекарств претензии 2 (эффект / стройка):**
1. **Running bilingual summary + previous-chunk carryover** — лучший НЕистраченный рычаг: замерен прямо на китайских вебновеллах (DelTA), стоит ~1 малый вспом-вызов на ~20 предложений; source-primed контекст предпочтительнее переиспользования прошлого МАШИННОГО перевода (последнее роняет качество из-за накопления ошибок). **[CONFIRMED направление / PLAUSIBLE магнитуда для →ru]**
2. **Document/paragraph-level контекст** — лучший по доказательности, но у нас уже ПОТРАЧЕН (единица крупная).
3. **Аннотатор (MAPS-класс: ключевые слова/тема/демо)** — снижает локальную mistranslation, но SENTENCE-level, требует 3-4 кандидата + QE-выбор (3-4× цена), бьёт по локальной адекватности, не по дальней связности. **[PLAUSIBLE]**
4. **Сильнее модель** — крупнейший одиночный рычаг на дискурс, но лобовой конфликт с дешёвым COGS; контекст+память дают дешёвой модели закрыть бóльшую часть разрыва. **[PLAUSIBLE]**
5. **Self-refine / итеративный пост-эдит — СПОРНО для MT**: полирует fluency/translationese, даёт скромный прирост и лишь при внешнем error/QE-сигнале, смещён «в английский», может деградировать/галлюцинировать на итерациях; связность, к которой модель НЕ имела доступа, не восстановит. **[CONFIRMED, что спорно]** — Chen et al. (EAMT 2024, TEaR) + др.
#### Ось 4. Кривая chunk ↔ качество ↔ биллинг ↔ ретраи (рамка для пре-регистрации)
- **Форма — перевёрнутая U**: снизу ограничена потерей когезии у слишком мелкой единицы (Karpinska), сверху — базово-модельной/позиционной деградацией у слишком крупной (Lost-in-Middle; для НЕ-дообученных инструкт-моделей качество ПАДАЕТ с ростом единицы — 2504.12140, препринт, малые модели). **[PLAUSIBLE]**
- **COGS доминируется ВЫХОДНЫМИ токенами**, + «фертильность» русского/кириллицы на англо-центричных токенизаторах (~22.5× англ.). Значит КАЖДЫЙ добавленный русско-генерящий LLM-пасс множит доминирующую статью; префикс-кэш скидывает лишь дешёвый ВХОД. **[CONFIRMED]** — Petrov et al. (NeurIPS 2023, tokenizer fairness) для фертильности.
- **Префикс-кэш делает пере-слание system+glossary почти бесплатным**НО только если статику класть ПЕРВОЙ, а volatile-контекст (running summary, меняющийся каждый чанк) ПОСЛЕ неё (любой volatile-префикс инвалидирует кэш ниже). Тогда worry «глоссарий шлётся каждый чанк» — почти не-проблема. **[CONFIRMED для наших провайдеров с оговоркой ordering]**
- **Retry blast radius тянет оптимум к МЕНЬШЕЙ единице** (переген всего чанка при мисматче) — центральное напряжение против качественного тяготения к крупной; оптимизировать надо на RETRY-ADJUSTED output-cost, а связность подавать глубиной кэшированного carryover, а НЕ размером единицы. **[PLAUSIBLE]**
- **Вывод оси 4:** ОТВЯЗАТЬ дискурс-единицу от биллинг-единицы: держать чанк небольшим (дёшево, малый blast radius, меньше output-деградации), а когезию давать кэшированным summary/carryover.
### A4. Оси, которые команда могла не увидеть (приоритетно)
1. **Пост-черновая регрессия > многих «качественных» проблем.** Санитайзер/редактура местами уничтожают годный черновик (гл.5 обнулён; CJK-утечки; правки-перевороты смысла). Дешевле всего: гейт «финал не должен быть пустым/короче черновика на X%», «нет сырых CJK-глифов в выводе», «числа/термины из черновика не переворачиваются». Это адресует «слабую художественность» БЕЗ новой машинерии. **[CONFIRMED наблюдение]**
2. **Reflow ЧАСТИЧНО БЕСПЛАТЕН.** Операции (b)/(c)/(d) 4-операционного трансформа — детерминированные (код-нормализация глифов/диалога/отступа); только (a) слияние — дискурсная. Отделить дешёвое-детерминированное от дорогого-модельного. **[CONFIRMED рамка]**
3. **Метрика-инверсия для zh→ru — конкретно, не абстрактно.** На WMT24 zh→ru простой Google-NMT обошёл ВСЕ LLM/мультиагентные системы по d-BLEU (human-eval отсутствовал) — прямая same-pair демонстрация, что гейтинг художественности на авто-метрике ИНВЕРТИРУЕТ ранжирование. Следствие: претензию 1 сложить в дешёвый ДЕТЕРМИНИРОВАННЫЙ структурный KPI; художественность/связность — не на BLEU/COMET. **[PLAUSIBLE — источник WMT24 zh→ru; точный URL — к сверке оркестратором]**
4. **Пара-конвенции как переиспользуемый ВЕРСИОНИРУЕМЫЙ слой** (идея владельца). Отделить (a) конвенции ПАРЫ ±жанр [zh→ru: паратаксис→гипотаксис, красная строка, тире, эксплицитация опущенных местоимений, политика 成语] — глобальный версионируемый ассет, ключ (src→tgt[×регистр]); (b) память КНИГИ (глоссарий/голоса) — как сейчас; (c) ручки прогона (venuti/honorifics). Грузонесущее свойство — версионирование+снапшот-фолд (смена = громкая ре-трансляция, как `chunkerVersion`), а не носитель (config-ассет или таблица БД). Есть **прямая zh→ru (не экстраполяция) peer-reviewed прескрипция**: 5 техник передачи китайских паратактических предложений в русский — (1) построить иерархию в русском, (2) сегментировать по смысловым единицам, (3) промаркировать вид/время предикатов по нормам РЯ, (4) варьировать лексику, (5) добавлять связки по контексту. **[CONFIRMED]** — Ван Цуй, «Анализ китайских паратактических предложений и их перевода на русский язык», Вестник МГУ Сер. 22 (Теория перевода). Русский-специфичный инструментарий слияния — причастные/деепричастные обороты + подчинительные союзы.
- Открытая развилка (к замеру, не приговор): РАЗМЕР/ФОРМА пакета = вопрос «способность vs активация»; большой правилник может жечь токены и размывать внимание, если знание латентно; возможно, короткий указатель или 12 few-shot экземпляра бьют точнее. Ключ может быть пара×жанр. Пакет должен нести ОГРАНИЧИТЕЛИ против коллизии с инвариантом полноты (слияние/эксплицитация — на грани «добавления»).
5. **Способность vs активация — диагностический арм.** Один и тот же reflow-промпт × дешёвая vs фронтир-модель: фронтир верстает, дешёвая нет → gap способности; ни та ни другая → недоспецифицированный промпт; краткое правило/пример чинит дешёвую → это была активация. Разводит «модель не умеет» от «модель недоактивирована».
6. **Бюджет чанка — в ВЫХОДНЫХ токенах на реальном токенизаторе (DeepSeek/GLM), а не в zh-символах**; пере-калибровать под фертильность кириллицы и стабильный output-потолок модели (~34k ток у мелких — раньше). **[CONFIRMED довод]** — Petrov et al. (NeurIPS 2023).
7. **Разметка нулевых местоимений/кореференции исходника** как дешёвый препроцесс перед переводом (zh zero-pronoun → явная маркировка): oracle-разметка стоит +40 пт там, где инструкции ~ничего. **[PLAUSIBLE, zh→en, экстраполяция на →ru]**
8. **DocRepair-класс: монолингвальный РУССКИЙ reflow/repair-пасс**, который НЕ видит китайский, а чинит связность/абзацы уже переведённого + контекст соседей (это шаг Найды «реструктуризация»). EN→RU: deixis 50.0→91.8, лексич. когезия 45.9→80.6, эллипсис-флексия 53.0→86.4; аннотаторы предпочли 73%. **[CONFIRMED для EN→RU]** — Voita et al. (ACL 2019, DocRepair). Это отделяет fluency/layout-работу от fidelity-работы.
### A5. Гипотеза-резюме §A (моя карта до чтения нашего стека)
1. «Слабая художественность» = сумма ТРЁХ, не двух, слоёв: (i) **пост-черновая регрессия** (санитайзер/редактура ломают годный черновик) — вероятно, самый дешёвый и недооценённый; (ii) **рубленость** = source-mirroring + инертная инструкция, чинится дёшево смесью детерминированной нормализации + few-shot/target-anchor + (возможно) отдельного layout-пасса; часть рубленостей (слияние) — дискурсная и сцеплена с (iii); (iii) **связность на дистанции** = архитектурный баг изоляции чанков + zh zero-anaphora; лучший дешёвый рычаг — running bilingual summary + prev-chunk carryover (кэш-дружественно), НЕ глоссарий и НЕ self-refine.
2. Потолок текущей фазы — в ОРГАНИЗАЦИИ (контекст/память/промпт/нарезка/пост-обработка), не в сырой дешёвой модели; переход на фронтир — рычаг, но не первый по эффективности-на-стройку.
3. Измерять: претензию 1 — дешёвым ДЕТЕРМИНИРОВАННЫМ структурным KPI (без судьи); претензию 2 — судья/QA-стиль (TREQA) или дешёвый человеко-протокол (ESA); НИКОГДА не гейтить художественность на BLEU/COMET (для zh→ru доказана инверсия); беречься «сфабрикованной сходимости» судей (устанавливать независимость до агрегации).
<!-- END §A FROZEN -->
<!-- FREEZE-MARKER §A: sha256=44f90364c786e86bf12e977b8a6712e9e2e89e7cd53d92540def624d842cce6f (хеш байтов между маркерами BEGIN..END; оркестратор: сверить перед фазой 2; ресёрчер §A после заморозки не редактировал — §B/§C/§D только ниже) -->
---
## §B — Дифф: §A против нашего стека (и параллельного ChatGPT-отчёта)
### B0. Метод и главный результат диффа
§A заморожена (sha256 `44f90364…`) ДО чтения: `05-decisions-log` (D1D35), `research/07/15/16`, exp04/09/12/13, и параллельного `research/18-quality-levers-chatgpt.md`. Главный результат: **тройная независимая сходимость.** Три пути — (i) моя §A (сырьё+внешняя литература), (ii) ChatGPT-§A (тоже заморожена до стека, sha256 `b42c6f6e…`), (iii) эмпирический стек команды (D26→D35) — сошлись на диагнозе и на большинстве рычагов. Это сильное подтверждение. **Оговорка против сфабрикованной сходимости (D25.10/D32.4):** независимы попарно ПУТИ (я не читал ChatGPT до заморозки; обе §A заморожены до стека; команда пришла эмпирикой), но нога «внешняя MT-литература» ОБЩАЯ у меня и ChatGPT — совпадения там ≠ три независимых голоса. Поэтому ценность §A не в «ещё раз то же», а в остатке: где я расхожусь и что добавляю (B2), плюс честные само-поправки (B3).
### B1. Где §A СОШЛАСЬ с командой (команда угадала — не дублировать, подтвердить)
| §A-ось | У команды уже есть | Статус |
|---|---|---|
| Reflow зеркалит рубленость исходника = промпт-рычаг | D35.1 дословно; D30.2 снял «сохраняй разбивку», мандат репараграфизации | ✅ угадано |
| Within-chunk (промпт-фиксимо) vs cross-chunk (Ф2) | D35.1 (чанк пакует ~34 абз. / ~1.28 стыка на главу) | ✅ угадано |
| Ось «нарезка × промпт» — ключевой невыжатый рычаг | D35.3 (exp04/12/13 крутили только МОДЕЛЬ) | ✅ угадано |
| Source-line strip как рычаг претензии 1 | **exp12:174 уже предлагает** снять построчную разбивку | ✅ угадано (моя §A НЕ первая) |
| Русские нормы абзаца/диалога с первоисточниками | **research/16 §2.3: Розенталь §52-53, Лопатин ПАС §138, Правила-1956 §51**; тире-flagger | ✅ угадано (полнее, чем §A знала — см. B3) |
| Running summary / annotator / межглавные резюме | Ф2: DelTA-обоснован (D21, D30.8); **exp09-M2 = «глоссарий+скользящее резюме» уже арм** | ✅ угадано (как Ф2/пилот-арм) |
| Output-санитайзер / пост-черновые порчи | D30.3/D33/D33.1 (утёкшие преамбулы, латиница, markdown) | ✅ угадано |
| Пустые финалы ch5/ch20 (моя «третья ось») | **D35.4a: известный экспорт-баг** (санитайзер флагает ведущий `###`, экспорт дропает) | ✅ угадано (см. B3) |
| Сырой китайский 甲乙丙丁/资质 в глоссарий | D35.4c (глоссарий-адресуемая часть претензии 2) | ✅ угадано |
| Декаплинг дискурс-единицы от биллинг-единицы | D35.7 (`draft=чанк/edit=глава`, runner-уровень) | ✅ угадано |
| Метрика: детерминированный структурный KPI + judge-дисциплина | D29.1d диалог-flagger; 07:86 translationese-метрики; D13.3 панель; D25.10/D32.4 анти-сходимость; D30.1 span-судья | ✅ угадано (команда МЕТОДИЧЕСКИ впереди) |
| Frontier-арм как диагностика потолка ≈ capability-vs-activation | D35.3 | ✅ угадано |
| Промптинг литперевода (task-framing, few-shot по классам, sandwich, no manual CoT, «plan+translate в одном вызове не армить») | research/15 §1.2/§3 обширно | ✅ угадано (АУГМЕНТИРОВАТЬ, не дублировать) |
Вывод B1: команда угадала правильно почти всю карту. Диагноз D35 = моя §A. Это повышает доверие, что «строить» надо по этой карте — но и снижает новизну §A; реальная ценность — в B2.
### B2. Где §A РАСХОДИТСЯ / команда недостроила (несущий остаток)
1. **zh→ru ДИСКУРС-ТРАНСФОРМ как переводческая теория — самая тонкая ось стека.** research/16 grounds РУССКУЮ сторону (нормы абзаца/диалога) и на уровне ВЫРАВНИВАНИЯ отмечает китайский паратаксис (Xue&Yang ACL 2011, ~16.6% запятых — границы), но **нет переводоведческой рамки zh→ru**: паратаксис→гипотаксис (意合/形合), 流水句, обязательность сращивания. Критично: research/16 §2.3 считает слияние (N:1) «дискреционным стилем, не нормой» — а **прямая zh→ru peer-reviewed прескрипция (Ван Цуй, Вестник МГУ Сер.22) говорит: пересборка паратактической цепи в русскую иерархию ОБЯЗАТЕЛЬНА** (5 техник: иерархия / сегментация по смыслу / вид-время / лексика / добавление связок), а инструмент — причастные/деепричастные обороты + подчинение. **Это апгрейдит «слияние дискреционно» → «слияние — требуемая дискурс-операция, и вот КАК».** Даёт reflow-промпту реальный zh→ru СОДЕРЖАНИЕ, а не «не копируй разбивку». **[CONFIRMED; прямой источник, не экстраполяция]** — самый сильный вклад §A, прямо отвечает на вопрос владельца «это конвенция языка, а не стиль автора».
2. **Слой «пакет конвенций пары» как ВЕРСИОНИРУЕМЫЙ артефакт (идея владельца) — структурный пробел.** research/07 держит конвенции пары как КОНТЕНТ (Палладий/Поливанов, Venuti, Нора Галь), но **«разбросаны как brief/config-политики, отдельного слоя нет»** (вывод фазы-2). Отделить (пара±жанр) от (книга) от (прогон); ключ (src→tgt[×регистр]); снапшот-фолд как `chunkerVersion`. Не носитель, а версионирование — грузонесущее. → §C-архитектура.
3. **Running summary — переоценить для near-term, не только пилот.** Команда СОЗНАТЕЛЬНО не строит LLM-резюме (research/15: «DelTA платит вызовами — мы нет», COGS-козырь); имеет лишь детерминированную инъекцию срезов памяти (Aho-Corasick) + M2-арм в пилоте. Но DelTA даёт бенефит именно бегущим резюме на ТОМ ЖЕ домене (вебновеллы), а COGS-возражение слабеет при кэш-дружественном ordering (резюме — 1 малый вызов на ~20 предложений, вход near-free при префикс-кэше). → предлагаю мерить running summary как near-term рычаг претензии-2-кросс-чанк, не хоронить на COGS до замера.
4. **DocRepair-класс (монолингвальный РУССКИЙ repair-пасс) с числами В РУССКИЙ.** ChatGPT тоже флоатит «отдельный target-only пасс», но без into-ru доказательств; у меня Voita 2019 EN→RU: deixis 50→91.8, когезия 45.9→80.6. Опция для op(a)+связность отдельно от билингв-fidelity-редактуры (editor-mono.md существует, но DORMANT — D33.4a). **[CONFIRMED для EN→RU]**
5. **Стоимостная строгость: фертильность-налог + cache-ordering + перевёрнутая-U.** ChatGPT имеет формулу+retry-множитель; команда — exp08+чанкер-конст+D35.6-арм. Добавляю: COGS output-доминирован + **кириллица-фертильность ~22.5× (Petrov NeurIPS 2023)** → бюджет чанка в ВЫХОДНЫХ токенах на реальном токенизаторе, не zh-символах; **cache-ordering** (статик первым, volatile-summary после — иначе кэш бьётся); перевёрнутая-U (когезия снизу, позиционная деградация сверху).
6. **Метрика-инверсия zh→ru — конкретный датапоинт.** WMT24 zh→ru: Google-NMT обошёл все LLM/мультиагент по d-BLEU без human-eval → не гейтить художественность на авто-метрике (у команды дисциплина есть, конкретного zh→ru датапоинта — нет). **[PLAUSIBLE — URL к сверке]**
### B3. Само-поправки §A после чтения стека (честно)
- **ch5.0 «санитайзер обнулил чанк» → НЕТ: экспорт-баг D35.4a.** Санитайзер ФЛАГАЕТ ведущий `###`, а экспорт дропает флагнутый чанк в пустоту вместо strip/fallback; текст правки ЦЕЛ. Класс тот же (пост-черновая порча), но механизм — экспорт, не санитайзер-void. Команда уже поймала (полигон обязан починить ch5/ch20 до слепых пакетов).
- **«команда не заземлила reflow в Розенталя» → неверно.** research/16 заземлила РУССКУЮ сторону (Розенталь §52-53, Лопатин, Правила-1956). Точный пробел уже — zh→ru ТРАНСФОРМ-сторона (B2.1), не русские нормы.
- **source-line strip как «новый рычаг» → не новый:** exp12:174 уже предлагает. §A-статус «оси, что могли не увидеть» для этого пункта снимаю.
### B4. Дифф против параллельного ChatGPT-отчёта (чтобы не дублировать)
Сходятся (обе независимые §A): source-strip, discourse-move few-shot, look-behind/look-ahead (особ. для zh нулевого подлежащего), chapter-card, декаплинг трёх единиц (coverage-atom ≠ generation-unit ≠ reference-span), perturbation-тест (correct vs random context) как центральная метрика, детерминированный структурный KPI, model-floor 2×2, «whole-chapter только как диагностический потолок», retry-adjusted cost. **Совпадение двух независимо-замороженных §A — корроборация** (с оговоркой общей лит-ноги B0).
Мой маргинальный вклад СВЕРХ ChatGPT: (1) zh→ru академ-грунтинг Ван Цуй/паратаксис-гипотаксис — ChatGPT ЯВНО пишет «zh→ru якорей нет»; (2) версионируемый слой пары; (3) DocRepair into-ru числа; (4) фертильность-налог + cache-ordering; (5) метрика-инверсия zh→ru. ChatGPT сверх меня: развёрнутая two-stage eval-схема (Stage I причинная проба на 68 ловушках / Stage II слепые 3 финалиста), «дискурсный пакет» как generation-unit, трёх-единичная факторизация — ценно, рекомендую взять в §C (не переизобретаю, ссылаюсь).
---
## §C — Рекомендации для полигона (таблица-вход эмпирической сессии D35.6)
Формат: {механизм → как измерить → цена → эффект на претензию → фаза}. Явно разведено: **СЕЙЧАС** (промпт/нарезка/глоссарий/детерминированный код, без Ф2-машинерии) vs **Ф2** (память/аннотатор/reference-тома). Строки согласованы с осями D35.6 (нарезка×промпт, frontier-арм, кривая размер↔качество↔биллинг↔ретраи, fidelity re-gate, слепые пакеты) и с методик-guard D32.4 (fidelity-first, leave-one-out, катастроф-скрин, per-call кап, независимость сигналов).
### C1. СЕЙЧАС — промпт/нарезка/глоссарий/детерминированный код
| # | Механизм | Как измерить (арм/проба) | Цена | Эффект → претензия | Фаза |
|---|---|---|---|---|---|
| 1 | **Дискурс-reflow промпт с zh→ru СОДЕРЖАНИЕМ** (5 техник Ван Цуй: иерархия/сегментация/вид-время/лексика/связки; причастные-деепричастные обороты; Розенталь-диалог) вместо «не копируй разбивку» | Структурный KPI (распределение предложений/нарратив-абзац vs русский референс) + слепое чтение; арм × (чанк\|глава) — ось нарезка×промпт | ~0 (промпт) | Претензия 1 (+сцеплённая часть 2) | Сейчас |
| 2 | **Discourse-move few-shot** (рубленый→слитый; target-side русский якорь; diversity-подбор ≤5 — research/15 few-shot-дисциплина) | Тот же KPI + fidelity re-gate (omission-guard: слияние повышает опущения) | +вход-токены (кэшируемо) | Претензия 1 | Сейчас |
| 3 | **Source-line strip / deformat черновика** до редактора (убрать зеркалящий cue) | A/B тот же KPI — изолирует построчный cue (exp12:174) | ~0 (детерм.) | Претензия 1 | Сейчас |
| 4 | **Детерминированный reflow-постпроцессор** ops (b)+(c)+(d): тире-диалог + нормализация глифов (полн.→полу, “”→«», —) + снятие    + strip markdown-`###` | CJK-глиф=0 гейт; диалог-парность-flagger (D29.1d) | ~0 (код) | Претензия 1 + утечка CJK-глифов | Сейчас |
| 5 | **Guard пост-черновой регрессии**: финал не пуст / не короче черновика на X% / нет сырых CJK / числа-разряды не переворачиваются vs черновик | Детерм. гейт + fidelity re-gate (D34.3) | ~0 (код) | «Третья ось» (вкл. экспорт-баг ch5/ch20 D35.4a) | Сейчас |
| 6 | **Глоссарий: засев сырых 甲乙丙丁/资质** (D35.4c) | Term-coverage post-check | ~0 | Претензия 2 (глоссарий-адресуемый срез) | Сейчас |
| 7 | **±1 reference-контекст** (хвост пред-target + пред-source + след-source до границы сцены, НЕ переводится) | Кросс-граница trap-accuracy + **perturbation** (correct vs random context не должен совпасть); факторить prev-target/prev-source/next-source ОТДЕЛЬНО | +вход-токены (кэш); вопрос рендера (§D-7) | Претензия 2 near-term | Сейчас-ish |
| 8 | **Кривая нарезки**: (0.75k/1.5k/3k/глава) × (жадная упаковка \| сцен-граница) на **retry-adjusted output-token cost**; бюджет в ВЫХОДНЫХ токенах (кириллица-фертильность Petrov) | Пре-регистрация: in/out/reasoning-токены, латентность, retry-rate ПО ПРИЧИНАМ, re-billed доля, coverage, слепое предпочтение, KPI-абзацы, trap-теги | Эксперимент | Обе + стоимость | Сейчас (диагностика) |
| 9 | **Capability-vs-activation / model-floor 2×2** (слабая/сильная × текущий/дискурс-промпт) + **арм краткой инъекции правил** | Trap-closure на 2×2; фронтир-арм = диагностика потолка (модели vs организация); гарды D22.5 (эхо-скрин, self-family exclusion) | Фронтир $ (владелец согласовал) | Диагностика (потолок) | Сейчас |
| 10 | **Автоматическая оценка качества (запрос владельца)**: претензия 1 = детерм. KPI (без судьи); претензия 2 = span-цитирующий билингв-судья + comprehension-QA (TREQA) + perturbation | Guard: leave-one-out, family-exclusion, per-call кап, **НИКОГДА не гейтить художественность на BLEU/COMET** (zh→ru инверсия WMT24); владелец кросс-чек ChatGPT+вручную | Судья-вызовы (кэш) | Инфра замера обеих | Сейчас |
### C2. НУЖНА Ф2-машинерия
| # | Механизм | Как измерить | Цена | Эффект → претензия | Фаза |
|---|---|---|---|---|---|
| 11 | **Running bilingual summary + реестр сущностей/антецедентов** (DelTA-класс) | exp09-memory-eval M2 + кросс-чанк trap; cache-friendly ordering | +1 малый вызов/~20 предл. (вход near-free при кэше) | Претензия 2 кросс-чанк | Ф2 (пере-взвесить vs COGS-депри research/15 — B2.3) |
| 12 | **Chapter card** (сущности/связи/цель/место/время/нерешённые ссылки из 1 пред-чтения главы) | Кросс-чанк trap; сравнить с #11 (компактная ручная карта должна доказать лифт ДО авто-памяти) | 1 пред-чтение/глава | Претензия 2 | Ф2-lite (сходится с ChatGPT) |
| 13 | **Пре-аннотация нулевых местоимений/кореференции** исходника | Trap-accuracy на ZP-кейсах | Аннотатор-пасс | Претензия 2 (zh-специфика) | Ф2 |
| 14 | **Отдельный монолингв. РУССКИЙ reflow/repair-пасс** (DocRepair) vs комбинированный редактор | A/B: один редактор vs (билингв-семантика→target-only-reflow) под coverage-гейтом | +1 пасс (target-only дешевле) | Претензия 1 op(a) + связность | Ф2 / арм сейчас |
### C3. Архитектура (зона оркестратора/бэкенда — предложение, не приговор)
| # | Механизм | Как измерить/решить | Фаза |
|---|---|---|---|
| 15 | **Слой «пакет конвенций пары»** (идея владельца): контент = 5 ops Ван Цуй + русские нормы + Палладий; ключ (src→tgt[×жанр]); снапшот-фолд; **несёт ОГРАНИЧИТЕЛИ против инварианта полноты**; РАЗМЕР/ФОРМА (короткий указатель vs правилник vs few-shot) = исход арма #9/#1-2 | Reflow-промпт-армы #1-2 И ЕСТЬ проба размера/формы пакета; финальное размещение — оркестратор/бэкенд под доказанный ROI (Р2/D30.7) | Дизайн сейчас, стройка под ROI |
Рекомендую взять из ChatGPT-отчёта (не переизобретаю): two-stage eval (Stage I причинная проба на 68 ЛОВУШКАХ вместо «средних глав» / Stage II слепые 3 финалиста), «дискурсный пакет» как generation-unit, факторизацию трёх единиц.
---
## §D — Вопросы, на которые не хватило данных
1. **Где именно живёт опорный контекст провалов связности владельца** — в-чанке / пред / след / вся-глава / мир-знание? D35 даёт ~1.28 стыка/глава, но НЕ размечено. Без размеченного trap-набора нельзя выбрать между #7/#11/#12. (Флагаю и я, и ChatGPT.) — первично для полигона.
2. **Магнитуда в РУССКИЙ.** Вся несущая внешняя эмпирика (Karpinska, DelTA, DocRepair, zero-pronoun) — into-English/EN→RU-экстраполяция; единственный zh→ru замер даст полигон (фронтир+дешёвый армы). Пометка обязательна на каждом клейме.
3. **Размер/форма пакета конвенций (#15) = вопрос «способность vs активация»** — не решён до 2×2 (#9) + инъекц-армов (#1-2).
4. **Коллизия слияния/эксплицитации с инвариантом полноты** на практике — semantic-atom-coverage vs sentence-count; нужен omission-guard-замер (#2/#5).
5. **COGS running-summary при кэше** — стоит ли бенефит DelTA доп-вызова на наших ценах при cache-ordering (пере-взвесить депри research/15).
6. **Retry-rate q(c) по типам провала на размер чанка** на живых дешёвых моделях — не замерено; нужно для retry-adjusted-кривой (#8).
7. **Рендер: может ли runner подать соседний src/tgt как non-output reference** без нового persistent-домена? Определяет, #7 — это PROD-MINOR или Ф2 (вопрос бэкенду).
8. **Владельцу:** допустимая степень синтакс-слияния/дробления; считается ли front-matter в художественную приёмку (из ChatGPT §D — решение владельца).
---
## §E — Источники (URL + дата + тип), несущие клеймы
Тип: **PR** peer-reviewed · **PP** preprint (не peer-review) · **STD** норм.-стандарт · **DOC** офиц./вендор-дока · **BLOG/OTH** блог/вторичное. Дата — публикация/доступ. Верификатор открывал ключевые (WebFetch); часть zh-источников по 403 — сверена сниппетами (помечено в §A/§B).
**Дискурс-гранулярность / doc-level (Ось 1):**
- [PR 2023] Karpinska & Iyyer, *LLMs Effectively Leverage Document-level Context for Literary Translation*, WMT2023 — https://aclanthology.org/2023.wmt-1.41/ · arXiv https://arxiv.org/abs/2304.03245
- [PR 2019] Voita et al., *When a Good Translation is Wrong in Context* (context-aware EN→RU; спутник DocRepair) — https://aclanthology.org/P19-1116/
- [PR 2024] Liu et al., *Lost in the Middle* (TACL) — https://aclanthology.org/2024.tacl-1.9/
- [PR 2021] G-Transformer for Doc-Level MT (ACL) — https://aclanthology.org/2021.acl-long.267/
- [PP 2024-07] *Towards Chapter-to-Chapter Context-Aware Literary Translation* — https://arxiv.org/html/2407.08978
- [PP 2025-04] *Multilingual Contextualization of LLMs for Doc-Level MT* (2504.12140; inverted-U, N=3 контекст) — https://arxiv.org/abs/2504.12140
- [PP 2024-12] *Investigating Length Issues in Doc-Level MT* — https://arxiv.org/abs/2412.17592
- [PP 2025-06] *Beyond the Sentence: Survey on Context-Aware MT with LLMs* — https://arxiv.org/abs/2506.07583
**Мультиагент/прайор-арт + fan/commercial:**
- [PP 2024-05] TransAgents, *(Perhaps) Beyond Human Translation* (TACL-версия) — https://arxiv.org/abs/2405.11804
- [PR 2024-10] DelTA (ICLR 2025; multi-level memory, running summary) — https://arxiv.org/abs/2410.08143 · https://openreview.net/forum?id=hoYFLRNbhc
- [PP 2024-12] DRT, *Deep Reasoning Translation via long CoT* — https://arxiv.org/abs/2412.17498
- [PR 2023] GuoFeng-Webnovel (zh↔ru/de, V2 без sent-align) — https://github.com/longyuewangdcu/GuoFeng-Webnovel
- [DOC 2024] py3TranslateLLM (LLM=paragraph, NMT=line) — https://github.com/gdiaz384/py3TranslateLLM · [DOC 2026-07] DeepL split_sentences — https://developers.deepl.com/api-reference/translate · [VEND 2023] DeepL context param — https://www.deepl.com/en/blog/deepl-api-context-parameter · [VEND 2026] TeaNovel (consistency drift; full-chapter) — https://read.teanovel.com/blog/how-to-translate-chinese-novels-with-ai
**Претензия 1 — русские нормы + reflow-механика:**
- [DOC 2026-07] Розенталь §47 прямая речь — http://old-rozental.ru/punctuatio.php?sid=155 · §52 диалог — http://old-rozental.ru/punctuatio.php?sid=160 · §50 слова автора — https://evartist.narod.ru/text1/52.htm
- [STD 1956] Правила русской орфографии и пунктуации, знаки при прямой речи — https://gramota.ru/biblioteka/spravochniki/pravila-russkoj-orfografii-i-punktuacii/znaki-pri-pryamoj-rechi · [DOC 2026-07] Грамота, оформление диалога — https://gramota.ru/uchebnik/pravila/oformlenie-dilaoga
- [OTH 2026-07] Абзац как логико-смысловая единица — Текстология.ру — https://www.textologia.ru/russkiy/sintaksis/stroenie-texta/abzac-kak-chast-teksta-i-ego-funkcii/646/ · Абзац (по Мильчину) — https://rus-stylistics-dict.slovaronline.com/1-%D0%90%D0%B1%D0%B7%D0%B0%D1%86
- [OTH 2026-07] Chinese punctuation (полн. пунктуация, 引号,   -отступ) — https://en.wikipedia.org/wiki/Chinese_punctuation
- [PR 2022] Structural Persistence in LMs (priming) — https://aclanthology.org/2022.tacl-1.60/ · [PR 2024] Sensitivity to Spurious Prompt Features (Sclar) — https://arxiv.org/abs/2310.11324 · [PR 2024] FollowBench — https://arxiv.org/abs/2310.20410
- [PP 2026-01] *Semantic Gravity Wells: Why Negative Constraints Backfire* (опора гипотезы негатив-констрейнта — REFUTED как главная причина) — https://arxiv.org/abs/2601.08070
- [PP 2025-10] *Decoupling Task-Solving and Output Formatting* — https://arxiv.org/abs/2510.03595
**Претензия 2 — связность/zh-специфика + лекарства:**
- [PP 2026-05] *How Much Do LLMs Know About Chinese Zero Pronouns?* (zh→en, <50% ZP базово, oracle +40) https://arxiv.org/abs/2605.31056 · [PP 2023] Survey on Zero Pronoun Translation https://arxiv.org/abs/2305.10196
- [PR 2024] MAPS, *Exploring Human-Like Translation Strategy* (аннотатор) — https://arxiv.org/abs/2305.04118
- [PR 2025] TEaR self-refine — https://aclanthology.org/2025.findings-naacl.218/ · [PP 2026-05] *What Does LLM Refinement Actually Improve? Doc-Level* (2605.13368; моно 2.2…5.6 MQM) — https://arxiv.org/abs/2605.13368 · [PP 2024-02] *LLM Amplifies Self-Bias in Self-Refinement* — https://arxiv.org/abs/2402.11436
- [PP 2025-03] *Source-primed Multi-turn Conversation Helps LLMs Translate Documents* — https://arxiv.org/abs/2503.10494
**zh↔ru контрастивная лингвистика (прямые/близкие):**
- [PR 2024] **Ван Цуй, «Анализ китайских паратактических предложений и их перевода на русский язык», Вестник (Теория перевода)** — 5 техник — https://vestnik-translation.ru/articles/article/20081/ · [PR 2023] интерференция при переводе кит. лит-ры на русский (De Gruyter, cjss-2023-0017) — https://www.degruyterbrill.com/document/doi/10.1515/cjss-2023-0017/html
- [OTH 2022] Application of Hypotaxis/Parataxis in C-E Translation (意合/形合, Lian Shuneng) — https://www.davidpublisher.com/Public/uploads/Contribute/620da97031d45.pdf · [OTH 2023] English Translation Strategies for Chinese Run-on (流水句) — https://www.davidpublisher.com/Public/uploads/Contribute/654354525d198.pdf · [PR 2011] xinghe/yihe (Perspectives) — https://www.tandfonline.com/doi/abs/10.1080/0907676X.2010.514347
- [PR 2011] Topic-Comment in Mandarin (Li & Thompson) — https://www.researchgate.net/publication/235852523 · [OTH 2005] Курдюмов, теор. грамматика (топик-комментарий) — https://www.studmed.ru/kurdyumov-v-a-kurs-kitayskogo-yazyka-teoreticheskaya-grammatika_1d9fe4a728b.html
- [PP 2025-11] *Predicate-Argument Divergences in Chinese-English* (кит. +24% глаголов) — https://arxiv.org/abs/2511.09796 · [OTH 2026-07] Chengyu (96% четырёхзнак.) — https://en.wikipedia.org/wiki/Chengyu
**Измерение качества:**
- [PP 2025-04] TREQA (comprehension-QA eval) — https://arxiv.org/html/2504.07583v3 · [PR 2025] LITEVAL-CORPUS (MQM плох, BWS/SQ лучше) NAACL — https://aclanthology.org/2025.naacl-long.548/ · [PR 2023] GEMBA-MQM — https://aclanthology.org/2023.wmt-1.64/ · [PR 2024] xCOMET — https://aclanthology.org/2024.tacl-1.54/ · [PR 2024] ESA — https://aclanthology.org/2024.wmt-1.131/
- [PP 2026-05] *Nine Judges, Two Effective Votes* (корр. судьи) — https://arxiv.org/pdf/2605.29800 · [PP 2026-05] *Creativity Bias* (метрики против художественности) — https://arxiv.org/html/2605.13596 · [BLOG 2026-04] LLM-judge length/position/format bias — https://tianpan.co/blog/2026-04-27-llm-judge-bias-audit-length-position-format
**Стоимость / нарезка:**
- [PR 2023] Petrov et al., *LM Tokenizers Introduce Unfairness Between Languages* (кириллица-фертильность) — https://arxiv.org/pdf/2305.15425 · [BLOG 2023] интерактив — https://aleksandarpetrov.github.io/tokenization-fairness/
- [DOC 2024] DeepSeek Context Caching (cache-hit ~2% miss) — https://api-docs.deepseek.com/guides/kv_cache/ · pricing — https://api-docs.deepseek.com/quick_start/pricing
- [PP 2024-09] LongGenBench (output ~34k стабилен) — https://arxiv.org/html/2409.02076v7
**Метрика-инверсия zh→ru (§A4.3 — теперь с URL):**
- [PR 2024-12] *Findings of WMT24 Discourse-Level Literary Translation* — https://arxiv.org/abs/2412.11732 · task page — https://www2.statmt.org/wmt24/literary-translation-task.html · [BLOG 2025] разбор d-BLEU/стоимости — https://gonzoml.substack.com/p/perhaps-beyond-human-translation
*(Полный список 125 верифицированных URL — в артефактах ресёрч-воркфлоу сессии; здесь — несущее подмножество.)*
**Errata источников (испр. оркестратором, D36):**
- **DocRepair — расщепить с P19-1116.** Числа §A4.8/§B2.4 (deixis 50.0→91.8, когезия 45.9→80.6, эллипсис 53.0→86.4, 73% предпочтения) — из [PR 2019] Voita, Sennrich, Titov, *Context-Aware Monolingual Repair for NMT* (DocRepair), EMNLP-IJCNLP 2019 — https://aclanthology.org/D19-1081/ · arXiv https://arxiv.org/abs/1909.01383. Процитированная выше P19-1116 (ACL 2019) — статья-спутник, из неё число CADec 50.0→81.6 (§A3). Обе авторства одного трио; числа верны, атрибуция расщеплена.
- **TransAgents** — arXiv 2405.11804 = *(Perhaps) Beyond Human Translation* (accepted-but-preprint, «To appear at TACL»; §A-метка «TACL-версия» и §E-метка «PP 2024-05» — об одной статье, оставить одну). Это ОТДЕЛЬНАЯ статья от EMNLP-Demo 2024 `2024.emnlp-demo.14` (*Build Your Translation Company…*), процитированной параллельным ChatGPT-отчётом — не конфликт, две реальные статьи об одной системе.
- **Z5** — RG 235852523 = Dingxu Shi, *Topic and Topic-Comment Constructions in Mandarin Chinese* (Language 76(2), 2000), НЕ Li & Thompson (их канон — *Subject and Topic* 1976 / *A Functional Reference Grammar* 1981). Клейм топик-комментария верен; автор-метка исправлена.
- **Z8 / R4 / R5 / P2 / CO5** — источники реальны, атрибуция частична: «96% чэнъюй» на цит. Wikipedia отсутствует (там «most»);   -отступ/«короткие абзацы» — не на цит. Chinese-punctuation-стр. (конвенции реальны, стр. неточна); Structural-Persistence (TACL 2022) изучает СИНТАКСИЧЕСКИй прайминг, не копирование line-структуры (экстраполяция, отчёт помечает PLAUSIBLE); FollowBench (ACL 2024, не просто препринт) документирует ДЕГРАДАЦИю следования при накоплении констрейнтов — не «надёжный рычаг few-shot»; 2504.12140 подтверждает «мелкие инстракт-модели деградируют с ростом чанка», но «перевёрнутая-U / N=3-оптимум» — переформулировка (N=3 — фикс-конфиг, не найденный оптимум). Ни одна не рушит §C-арм — все меряются полигоном эмпирически.
---
<!-- Отчёт готов к адверсариальной верификации оркестратора по первоисточникам. §A заморожена (sha256 44f90364…); §B/§C/§D/§E — пост-дифф. Не коммитить — лендит оркестратор (как research/15/16/17). -->