Land research/18 both quality-lever reports with orchestrator review headers after verifying all cited sources exist and §A freeze reproduces
This commit is contained in:
parent
2606714eb0
commit
38736b27b5
2 changed files with 633 additions and 0 deletions
288
docs/research/18-quality-levers-chatgpt.md
Normal file
288
docs/research/18-quality-levers-chatgpt.md
Normal file
|
|
@ -0,0 +1,288 @@
|
|||
# Рычаги минимально-художественного zh→ru: независимый доклад ChatGPT
|
||||
|
||||
<!-- ─────────────────────────────────────────────────────────────────────────
|
||||
ОРКЕСТРАТОР — РЕВЬЮ-ШАПКА (лендинг, D36, 12.07 №4). Тело не переписано. Полный разбор —
|
||||
PROGRESS §лендинг D36 + D-лог D36.
|
||||
|
||||
ВЕРДИКТ: **ACCEPT** (одна минорная привязка при графтинге в промт полигона).
|
||||
|
||||
НЕЗАВИСИМАЯ ВЕРИФИКАЦИЯ (тот же 26-агентный воркфлоу, первоисточники, $0):
|
||||
- **Цитатно-чист на всех спот-чеках** — Thai/Par3 (EMNLP 2022, `2022.emnlp-main.672`),
|
||||
Mohammed & Niculae (Findings EACL 2024, `2024.findings-eacl.113` — perturbation
|
||||
correct-vs-random), Herold & Ney, Hu & Wan, Jiang/BWB, Jwalapuram, DelTA, TransAgents
|
||||
(EMNLP-Demo `2024.emnlp-demo.14`) — все существуют, атрибуция аккуратна.
|
||||
- **Хеджирование дисциплинировано** — внешняя эмпирика последовательно помечена «не zh→ru»;
|
||||
инженерные клеймы — PLAUSIBLE; 80%-порог ловушек — «предложение для пре-регистрации, не факт».
|
||||
Ни одного CONFIRMED-который-на-деле-экстраполяция не найдено. Самый скептичный из двух
|
||||
отчётов к системным клеймам (TransAgents прямо назван «vendor-like»).
|
||||
- **§C — наиболее прямо-исполнимый скелет полигон-сессии** из двух: явный P0 чистый baseline
|
||||
→ армы с фаза-тегами P0–P4 → C4 пре-регистрированные метрики/гейты → C5 дерево решений →
|
||||
C3 точное ядро дискурс-reflow-промпта. Покрывает ВСЕ мандатные оси D35.6.
|
||||
|
||||
ДВЕ ОГОВОРКИ ПРИ ГРАФТИНГЕ (учтены в промте полигона D36):
|
||||
1. **§A-заморозка НЕ воспроизводима из документа.** sha256 `b42c6f6e…` заявлен только в прозе
|
||||
§B0; в файле — плейсхолдер `<!-- A_SHA256_PLACEHOLDER -->` без BEGIN/END байт-маркеров →
|
||||
пересчитать нельзя. Прогон внешний (владелец) → заморозка **аттестована, но не крипто-
|
||||
верифицируема** (в отличие от Claude-отчёта, чей хеш сверен MATCH). На вес «двойной заморозки
|
||||
сходимости» — дисконт; содержательное качество/самосогласованность отчёта этим НЕ затронуты.
|
||||
2. **Свежий fidelity-гейт §C4 не ссылается на мандатный re-gate D34.3** (`rerun/FIDELITY_REGATE_HANDOFF.md`
|
||||
+ `rerun-parallel.txt`) — сессия его не читала. При графтинге брать D34.3-пакет как канон
|
||||
верности, §C4-гейт — как совместимую детализацию.
|
||||
|
||||
РЕКОМЕНДАЦИЯ ЛЕНДИНГА (обе стороны сами это предлагают): §C ChatGPT = скелет протокола +
|
||||
графт zh→ru-контента Ван Цуй в reflow-промпт + COGS-модель + привязка D34.3 из Claude-отчёта.
|
||||
Реализовано в `POLYGON_QUALITY_EMPIRICS_SESSION_PROMPT.md`.
|
||||
───────────────────────────────────────────────────────────────────────────── -->
|
||||
|
||||
Дата исследования: 2026-07-11. Роль: независимый ресёрчер; код и общие документы репозитория не изменялись.
|
||||
|
||||
Статусы доказательности:
|
||||
|
||||
- **CONFIRMED** — утверждение прямо поддержано первичным источником или наблюдением над разрешённым сырьём;
|
||||
- **PLAUSIBLE** — инженерная гипотеза, совместимая с данными, но требующая локального A/B-замера;
|
||||
- **REFUTED** — локальные данные или первичный источник противоречат утверждению.
|
||||
|
||||
## §A. Чистый лист: независимая карта «проблема → механизм»
|
||||
|
||||
> **FREEZE MARKER A — 2026-07-11.** Этот раздел составлен до чтения `05-decisions-log.md`, `research/07`, `research/15`, `research/16` и материалов exp04/12/13. После фиксации SHA-256 раздел не редактируется. Все дальнейшие сопоставления находятся только в §B–§D.
|
||||
|
||||
### A1. Что непосредственно видно в текущем прогоне
|
||||
|
||||
**CONFIRMED.** Текущий сегментатор жадно упаковывает целые исходные абзацы примерно до 1 500 оценочных токенов; только сверхдлинный абзац делится по предложениям. Контекст предыдущего/следующего чанка в `Chunk` не переносится. Переводчик получает один `{{text}}`; редактор — тот же исходный чанк и его черновик. Источник: локальные `backend/internal/pipeline/chunker.go`, `backend/prompts/translator.md`, `backend/prompts/editor.md`, прочитаны 2026-07-11.
|
||||
|
||||
**CONFIRMED.** Оба промпта уже требуют русской вёрстки, запрещают копировать построчную разбивку и предписывают начинать прямую речь с нового абзаца. Следовательно, версия «достаточно добавить одну инструкцию про абзацы» опровергается текущей конфигурацией: такая инструкция уже есть, а претензия владельца сохранилась. Источник: локальные промпты выше и вердикт владельца в сессионном задании, 2026-07-11.
|
||||
|
||||
**CONFIRMED (описательная метрика, не оценка качества).** В `rerun-ru.txt` грубое разбиение по пустым строкам даёт 1 754 блока, из которых 1 671, или около 95,3%, состоят из одной непустой строки. Выборочная проверка начала, середины и конца показывает устойчивую дробность повествования наряду с корректным выделением многих реплик. Метрика намеренно не объявляется нормой художественности: короткий абзац может быть стилистически оправдан. Источники: локальные `/home/ubuntu/books/gu-zhenren/rerun/rerun-ru.txt` и `/home/ubuntu/books/gu-zhenren/rerun/records.json`, только чтение, 2026-07-11.
|
||||
|
||||
**PLAUSIBLE.** Основная ошибка организации — не «слишком маленький чанк» как таковой, а смешение трёх разных единиц: (1) единицы покрытия, (2) единицы смыслового контекста, (3) единицы целевой композиции. Нынешний фиксированный бюджет определяет все три сразу. Это объясняет, почему полнота может быть хорошей, а русская макрокомпозиция и дальние связи — слабее. Нужен факторный эксперимент, потому что наблюдение одного прогона причинность не устанавливает.
|
||||
|
||||
### A2. На какой гранулярности переводить
|
||||
|
||||
**CONFIRMED.** Для литературного LLM-перевода перевод целого исходного абзаца за один вызов превосходил перевод предложение-за-предложением по человеческой разметке на 18 языковых парах: было меньше смысловых, грамматических и стилистических ошибок. Это peer-reviewed WMT 2023, но не zh→ru и не тест текущих дешёвых моделей, поэтому переносимость результата ограничена. Источник: Karpinska & Iyyer, [Large Language Models Effectively Leverage Document-level Context for Literary Translation, but Critical Errors Persist](https://aclanthology.org/2023.wmt-1.41/), опубликовано 2023-12, доступ 2026-07-11.
|
||||
|
||||
**CONFIRMED.** В литературном MT абзац является практически значимой единицей данных и оценки: корпус Par3 выровнен по абзацам; эксперты предпочитали человеческие варианты машинным в 84% сравнений, а обученный post-editor — обычному MT в 69%. Автоматические метрики не коррелировали с экспертными предпочтениями. Это аргумент за абзац/микросцену и человеческий blind preference как минимум, но не доказательство конкретной схемы zh→ru. Источник: Thai et al., [Exploring Document-Level Literary Machine Translation with Parallel Paragraphs from World Literature](https://aclanthology.org/2022.emnlp-main.672/), EMNLP 2022, доступ 2026-07-11.
|
||||
|
||||
**CONFIRMED.** Простое увеличение контекста до всего документа не является монотонным улучшением: работа по long-context DocMT указывает и рост памяти, и деградацию качества при расширении контекста; типичный локальный контекст — одно-два предыдущих предложения, чего может не хватать для темы и стиля. Источник: Herold & Ney, [Improving Long Context Document-Level Machine Translation](https://aclanthology.org/2023.codi-1.15/), CODI/ACL 2023, доступ 2026-07-11.
|
||||
|
||||
**CONFIRMED.** Фиксированная длина плохо отражает дискурсную структуру. Paragraph-to-paragraph режим и явная RST-структура дали улучшения над прежними DocMT-подходами в peer-reviewed исследовании, хотя архитектурные результаты NMT нельзя напрямую переносить на prompting закрытой LLM. Источник: Hu & Wan, [Exploring Discourse Structure in Document-level Machine Translation](https://aclanthology.org/2023.emnlp-main.857/), EMNLP 2023, доступ 2026-07-11.
|
||||
|
||||
**Вывод A2 — PLAUSIBLE.** Для текущей фазы минимальная разумная единица генерации — не предложение и не глава, а **дискурсный пакет**: один или несколько смежных исходных абзацев, образующих локальный ход/эпизод, с защищёнными границами сцены. Основной текст пакета переводится целиком; вокруг него подаётся компактный reference-context, который не надо переводить. Глава нужна как область предварительного чтения и извлечения опор, а не обязательно как единый output-вызов. Оптимум размера следует измерять, а не объявлять заранее.
|
||||
|
||||
### A3. Претензия 1: русские абзацы и литературные конвенции
|
||||
|
||||
**CONFIRMED.** Исходная и целевая дискурсные структуры у человеческих и машинных переводов различаются, а предложение-уровневые метрики не покрывают сущности, терминологию, кореференцию и кавычки. Источник — размеченный корпус китайско-английских романов BWB; это близкий по исходному языку, но не русскому, evidence. Jiang et al., [Discourse-Centric Evaluation of Document-level Machine Translation with a New Densely Annotated Parallel Corpus of Novels](https://aclanthology.org/2023.acl-long.435/), ACL 2023, доступ 2026-07-11.
|
||||
|
||||
**PLAUSIBLE.** Нужна не ещё одна абстрактная команда «собери естественные абзацы», а наблюдаемая целевая операция:
|
||||
|
||||
1. сначала определить внутри пакета дискурсные ходы (кто воспринимает/говорит, действие, реакция, смена времени/места/фокала);
|
||||
2. затем сформировать русские абзацы вокруг этих ходов, отдельно соблюдая оформление диалога;
|
||||
3. только потом провести проверку покрытия по исходным атомам.
|
||||
|
||||
Эту операцию можно реализовать одним вызовом через краткий скрытый план и финальный текст либо отдельным layout/polish-проходом. Какой вариант лучше для дешёвой модели — вопрос A/B, а не установленный факт.
|
||||
|
||||
**PLAUSIBLE.** Few-shot должен показывать именно требуемое преобразование структуры: 2–3 коротких zh→ru примера «много однофразовых исходных строк → один естественный повествовательный абзац», «повествование → отдельная реплика → авторская ремарка», «смена фокала → новый абзац». Простой положительный пример проверяется отдельно от длинного списка negative constraints. Причина: текущая словесная инструкция не сработала; демонстрация задаёт форму результата. Прямого peer-reviewed замера именно русской перевёрстки в найденных источниках нет.
|
||||
|
||||
**PLAUSIBLE.** Отдельный target-only layout-пасс потенциально дешевле повторного bilingual editor-пасса: он получает только русский текст и задачу укрупнить/разделить абзацы без перефразирования. Но он не исправляет причинную связность и может закрепить смысловую ошибку; поэтому это узкий рычаг для претензии 1, не универсальное лечение.
|
||||
|
||||
**PLAUSIBLE.** Одновременный мандат редактора «сверить смысл + исправить реалии + выдержать глоссарий + улучшить стиль + реконструировать абзацы + ничего не добавить/удалить» создаёт конкуренцию критериев у слабой модели. Дешёвый тест — разделить semantic revision и target-language paragraph/style polish; дорогой — оставить один сильный editor. Ни «CoT всегда помогает», ни «negative constraints всегда вредят» без локального замера не утверждается.
|
||||
|
||||
### A4. Претензия 2: связи и смысл на дистанции
|
||||
|
||||
**CONFIRMED.** Контекстные ошибки требуют специальных измерений: sentence-level BLEU может почти не замечать анафору, связность и лексическую когезию. Литература предлагает отдельные тесты для местоимений/кореференции и документные метрики когезии. Источники: Jwalapuram et al., [Evaluating Pronominal Anaphora in Machine Translation](https://aclanthology.org/D19-1294/), EMNLP 2019; Libovický et al., [Machine Translation Evaluation beyond the Sentence Level](https://aclanthology.org/2018.eamt-main.18/), EAMT 2018; доступ 2026-07-11.
|
||||
|
||||
**CONFIRMED.** DelTA использует не «всю книгу в промпте», а четыре специализированные памяти: записи имён, двуязычное резюме, long-term retrieval и short-term контекст. В ICLR 2025 заявлены средние улучшения до 3,16 COMET и до 4,58 процентного пункта consistency; система переводит по предложениям ради полноты. Это peer-reviewed DocMT, но не литературная zh→ru оценка и не доказательство необходимости всех четырёх компонентов. Источник: Wang et al., [DelTA: An Online Document-Level Translation Agent Based on Multi-Level Memory](https://proceedings.iclr.cc/paper_files/paper/2025/hash/285149554f6fbed6e2f9ec72d131bd23-Abstract-Conference.html), ICLR 2025, доступ 2026-07-11.
|
||||
|
||||
**CONFIRMED, но vendor-like/системный claim.** TransAgents организует литературный перевод как роли редактора, переводчика, локализатора и корректора с циклом проверки; опубликованный demo-paper сообщает человеческие предпочтения и низкую относительно человека цену. Это prior art организации, но его сильные маркетинговые формулировки нельзя считать независимым доказательством превосходства, а многоагентность сама по себе не изолирована как причина. Источник: Wu et al., [TransAgents: Build Your Translation Company with Language Agents](https://aclanthology.org/2024.emnlp-demo.14/), EMNLP Demo 2024, доступ 2026-07-11.
|
||||
|
||||
**PLAUSIBLE.** Максимум эффекта при минимуме стройки даст не полноценная агентная память, а следующий порядок армов:
|
||||
|
||||
1. **look-behind:** предыдущий русский абзац + соответствующий китайский хвост как read-only reference;
|
||||
2. **look-ahead:** следующий китайский абзац/до границы сцены, помеченный «не переводить», чтобы снять катафору и неоднозначность текущей фразы;
|
||||
3. **chapter card:** краткие сущности, отношения, текущая цель/локация/время и нерешённые референсы, извлечённые одним предварительным чтением главы;
|
||||
4. только затем retrieval/долгая память и отдельный аннотатор связей.
|
||||
|
||||
Порядок — инженерная гипотеза по цене строительства. Look-ahead особенно важен для китайского нулевого подлежащего, но величина эффекта именно zh→ru не подтверждена найденным контролируемым исследованием.
|
||||
|
||||
**PLAUSIBLE.** Глоссарий лечит стабильность именования, но не заменяет модель ситуации: одинаково написанное имя не разрешает, кто что сделал, почему персонаж реагирует и к чему относится опущенное подлежащее. Поэтому в полигоне терминологическая consistency и causal/coreference comprehension должны быть разными исходами.
|
||||
|
||||
**PLAUSIBLE.** Сильная модель может одновременно улучшить локальный русский и рассуждение, но arm «модель сильнее» без одинакового контекста не отвечает, где потолок — в модели или организации. Нужен 2×2: слабая/сильная модель × текущий/дискурсный контекст. Если контекст помогает обеим, проблема частично организационная; если только сильная проходит смысловые ловушки, есть model floor.
|
||||
|
||||
### A5. Кривая «размер чанка ↔ качество ↔ биллинг ↔ ретраи»
|
||||
|
||||
**CONFIRMED как бухгалтерская рамка, не как эмпирическая кривая.** Для главы из `S` исходных токенов, чанка полезной длины `c`, фиксированного prompt/reference overhead `h`, коэффициента выходных токенов `r` и цен `p_in`, `p_out` ожидаемая цена без ретраев грубо равна:
|
||||
|
||||
`C(c) ≈ ceil(S/c) · h · p_in + S · p_in + rS · p_out`.
|
||||
|
||||
Значит, при прочих равных рост `c` уменьшает повторяемый overhead. Это арифметика; она не говорит, что качество растёт.
|
||||
|
||||
**PLAUSIBLE.** С ретраями цена становится нелинейной. Если вероятность неуспеха чанка `q(c)` и весь вызов повторяется до успеха, множитель ожидаемых попыток — `1/(1-q(c))`; ожидаемо повторно оплачивается весь `h+c+rc`. Даже если число вызовов падает, большие чанки дороже терять при timeout/refusal/excision. Реальная `q(c)` должна быть измерена по типам отказа, а не подогнана общей долей retry.
|
||||
|
||||
**PLAUSIBLE.** Качество вероятно имеет внутренний оптимум: слишком малый `c` режет дискурс и размножает prompt overhead; слишком большой `c` размывает релевантный контекст, затрудняет контроль полноты и повышает ущерб одного сбоя. Исследование long-context DocMT подтверждает возможность деградации при расширении контекста, но форму кривой для этого пайплайна надо пререгистрировать и измерить. Источник: Herold & Ney 2023, ссылка в A2, доступ 2026-07-11.
|
||||
|
||||
**Предрегистрация A5 — PLAUSIBLE.** Сравнить не только размеры 0,75k / 1,5k / 3k / «глава», но и две политики границ при сопоставимом бюджете: фиксированная упаковка против scene/discourse-aware упаковки. На каждом арме сохранять: вход/выход токены, latency, долю и причину ретраев, долю повторно оплаченных токенов, полноту, blind reader preference, paragraph score и размеченные coreference/causal traps. Иначе размер будет спутан с качеством границ.
|
||||
|
||||
### A6. Оси, которые легко пропустить
|
||||
|
||||
**PLAUSIBLE — структурная утечка через черновик.** Редактор видит дробный черновик, который становится сильной формальной подсказкой, тогда как абстрактная инструкция просит его форму разрушить. Arm «редактор видит тот же текст без пустых строк/с ID смысловых атомов» отделит якорение на layout черновика от неспособности модели к русской композиции.
|
||||
|
||||
**PLAUSIBLE — конфликт полноты и естественной композиции.** Формула «не выбрасывай и не добавляй предложения» полезна для покрытия, но может восприниматься как требование сохранять предложение-к-предложению и мешать слиянию/членению русских предложений. Следует сохранять **смысловые атомы**, а не число предложений: пронумеровать атомы только для внутренней проверки, разрешив объединять и делить предложения в финале. Это должно пройти отдельный coverage gate.
|
||||
|
||||
**PLAUSIBLE — мусор до романа портит style prior.** Первый чанк содержит метаданные, обзор, интернет-ссылку и предисловие, а не однородную художественную сцену. Общий genre prompt не различает front matter, авторское предисловие и роман. Классификация типа блока до перевода может предотвратить перенос регистров и бессмысленную «литературизацию» служебного текста.
|
||||
|
||||
**PLAUSIBLE — направление контекста важно.** Только прошлое помогает последовательности, но не всегда пониманию текущей китайской эллиптики; только будущее рискует спойлерным перефразированием. Поэтому previous-target, previous-source и next-source надо факторизовать, а не объединять сразу в один «context arm».
|
||||
|
||||
**CONFIRMED.** Правильность контекстного метода нельзя заключать из общего score: perturbation test с корректным против случайного контекста показывает, использует ли система именно опорный контекст. Источник: Mohammed & Niculae, [On Measuring Context Utilization in Document-Level MT Systems](https://aclanthology.org/2024.findings-eacl.113/), Findings of EACL 2024, доступ 2026-07-11.
|
||||
|
||||
**PLAUSIBLE — оценщик должен разделять читателя и билингва.** Русскоязычный читатель способен оценить ритм, абзацы и естественность, но не диагностирует тихое искажение; билингв — смысл и связи, но может терпеть translationese. Минимальный полигон требует двух независимых рубрик и запрета показывать arm/model judge-у.
|
||||
|
||||
**REFUTED как универсальный тезис.** «Больше агентов автоматически означает лучше» не следует из prior art: TransAgents демонстрирует целую систему, DelTA — специализированную память, а paragraph-level LLM уже улучшал результат без агентного оркестра. Сначала следует покупать информацию (границы, соседний контекст, chapter card), затем роли и циклы.
|
||||
|
||||
### A7. Независимая карта причин и минимальных вмешательств
|
||||
|
||||
| Наблюдаемая проблема | Вероятный механизм | Самый дешёвый различающий тест | Что не считать доказательством |
|
||||
|---|---|---|---|
|
||||
| Почти каждый ход остаётся отдельным абзацем | Якорение на layout исходника/черновика; инструкция без демонстрации; перегруженный editor mandate | layout few-shot; draft без пустых строк; отдельный target-only reflow | Снижение числа абзацев само по себе |
|
||||
| Связь ломается внутри чанка | Модель не строит локальную ситуацию; противоречивый/перегруженный мандат | semantic-first editor с явными entity/action/reason checks | Более гладкий русский без сверки смысла |
|
||||
| Связь ломается на границе чанков | Нет previous/next reference; граница не совпадает со сценой | ±1 абзац reference и scene-aware boundary | Увеличение токенов без релевантного контекста |
|
||||
| Теряются дальние сущности/цели | Нет chapter/book state | краткая chapter card против glossary-only | Единообразное имя при неверной кореференции |
|
||||
| Сильный стиль ценой пропуска | Свободный polish без атомарного coverage | atom IDs + post-check, разрешив русское split/merge | Совпадение числа предложений |
|
||||
| Большие чанки нестабильны/дороги | Растёт payload одного сбоя и нерелевантный контекст | size sweep с раздельным учётом retry causes | Средняя цена успешного вызова без ретраев |
|
||||
| Непонятно, виновата модель или пайплайн | Model/context confounding | 2×2 model strength × discourse context | Сравнение разных моделей на разных промптах |
|
||||
|
||||
**Итог §A — PLAUSIBLE.** Наиболее вероятный короткий путь к «минимально художественно» — не перевод всей главы и не многоагентная стройка, а дискурсно ограниченный пакет + небольшой соседний reference-context + few-shot русской перекомпоновки + раздельная смысловая и монолингвальная оценка. Первый полигон должен определить, достаточна ли текущая модель; не предполагать это заранее.
|
||||
|
||||
<!-- A_SHA256_PLACEHOLDER -->
|
||||
|
||||
## §B. Дифф после чтения внутреннего стека
|
||||
|
||||
### B0. Целостность анти-анкоринга
|
||||
|
||||
§A был записан отдельным снимком до чтения командных гипотез. SHA-256 этого A-only снимка: `b42c6f6e6dc06ec48f3472714ac2b9ca5eba0135fba204113e2628a36eacee99`. После этого прочитаны карта актуальности и D26/D30–D35 в `docs/architecture/05-decisions-log.md`, раздел «Промптинг литперевода» в `docs/research/15-voice-and-state.md`, `docs/research/07-translation-methodology.md`, exp04/12/13 и `docs/research/16-reader-ide-alignment.md`. §A после чтения не изменялся.
|
||||
|
||||
### B1. Где независимая карта сошлась с командой
|
||||
|
||||
**CONFIRMED — команда угадала корень первого слоя.** §A независимо установил, что словесная reflow-инструкция уже есть, но результата не гарантирует; D35 независимо подтверждает на боевом снимке, что reflow действительно применялся, редактор был активен, а выход всё равно зеркалил рубленость источника. Значит, это не stale-конфиг и не пассивный mono-editor. Источники: локальный `docs/architecture/05-decisions-log.md`, D35.1, и текущие промпты, прочитаны 2026-07-11.
|
||||
|
||||
**CONFIRMED — команда уже сделала верный флип mono→bilingual.** Exp12 показал механическую пассивность mono-режима и структурную невозможность исправить 磕头/派/时辰 без исходника; D30 ратифицировал bilingual editor. Это полностью совпало с §A4: target-only polish не лечит смысл. Источники: локальные `docs/experiments/12-quality-diagnosis.md` §2.2/§2.5 и `docs/architecture/05-decisions-log.md` D30.1, прочитаны 2026-07-11.
|
||||
|
||||
**CONFIRMED — команда уже развела глоссарий и понимание ситуации.** D30.8/D35.4 различают термины, которые можно засидить сейчас, и «модель не следит за сюжетом», относимое к состоянию/памяти. Это совпадает с §A4. Источники: локальный D-лог, D30.8/D35.4, 2026-07-11.
|
||||
|
||||
**CONFIRMED — команда уже не считает жёсткую 1:1 структуру целью.** Research/16 показывает легитимный N:M, русскую норму тире-абзацев и рекомендует детектировать, а не форсировать парность. Это совместимо с §A3/A6: проверять смысловые атомы, не число предложений/абзацев. Источник: локальный `docs/research/16-reader-ide-alignment.md` §2.1–§2.5, прочитан 2026-07-11; внешний якорь: Karpinska & Iyyer, [WMT 2023](https://aclanthology.org/2023.wmt-1.41/), доступ 2026-07-11.
|
||||
|
||||
**CONFIRMED — команда уже знает, что модель/промпт нельзя оценивать общим скаляром.** Exp12/13 разделили стиль и верность, но ревью D30/D32 вскрыло ложные «единогласия», коррелированные сигналы и катастрофы победителей. Предлагаемый в §A 2×2 и отдельные traps продолжают именно эту исправленную методику. Источники: локальный D-лог D30/D32 и exp12/13, прочитаны 2026-07-11.
|
||||
|
||||
**CONFIRMED — prompt-format prior art уже покрыт research/15.** Формат, позиция, сэндвич, few-shot-раскол по моделям, lost-in-middle и опасность ручного CoT уже исследованы. Поэтому данный доклад не рекомендует универсальный XML/CoT-рецепт и не дублирует этот обзор. Источник: локальный `docs/research/15-voice-and-state.md` §3.1–§3.3, прочитан 2026-07-11.
|
||||
|
||||
### B2. Что в §A есть сверх текущей карты команды
|
||||
|
||||
**PLAUSIBLE — независимое разведение трёх единиц.** В D35 главная ось сформулирована как «нарезка × промпт» и кандидаты `draft=чанк/edit=глава`. §A добавляет обязательное различение: coverage atom ≠ generation unit ≠ reference-context span. Глава может быть областью чтения/извлечения опор, не единым completion. Это предотвращает ложный выбор «1,5k или вся глава».
|
||||
|
||||
**PLAUSIBLE — якорение редактора на форме draft как отдельная причина.** Командные документы обсуждают исходную построчность и ненадёжность reflow, но не изолируют arm, где редактор получает тот же черновик без пустых строк/с нейтральными атомарными ID. Если такой arm резко улучшит абзацы при той же модели и промпте, менять размер чанка преждевременно.
|
||||
|
||||
**PLAUSIBLE — look-ahead как дешёвый самостоятельный arm.** D21/research15 проектируют scene-state/Annotator для Ф2; D35 говорит о cross-chunk. В прочитанных экспериментах не изолирован следующий китайский абзац как read-only reference. Для катафоры, нулевых субъектов и поздно раскрываемого отношения это дешевле полноценной памяти. Доказанного эффекта zh→ru нет — именно поэтому arm нужен.
|
||||
|
||||
**PLAUSIBLE — discourse-move reflow вместо общего «русские абзацы».** Текущий reflow-промпт содержит результатное требование, но не операциональную рубрику «фокал/действие/реакция/смена времени/места/говорящего». Few-shot должен показывать структурное преобразование, а не только красивый стиль. Research/15 покрывает общую форму few-shot, но не этот тип примера.
|
||||
|
||||
**PLAUSIBLE — факторный model-floor тест.** D35 разрешает фронтир-арм, но без 2×2 сильная модель на ином промпте/размере оставит прежний конфаунд. Нужны одна и та же слабая и сильная модели на текущей и дискурсной организации. Это отвечает именно на вопрос владельца «модель не понимает» против «мы не дали ей опоры».
|
||||
|
||||
**PLAUSIBLE — тип блока/front matter.** Сырьё первой главы смешивает метаданные, интернет-обзор, авторское предисловие и роман. Во внутренних качественных экспериментах эта ось не выделена. Она не объясняет все 25 глав, но способна портить локальный style prior и оценку главы 1.
|
||||
|
||||
**PLAUSIBLE — retry-cost надо считать повторно оплаченными токенами, а не только retry-rate.** D35 запросил кривую размера, но формула §A5 делает явным ущерб одного крупного сбоя. Это важно при сравнении главы с чанком: одинаковая доля отказов не означает одинаковую цену.
|
||||
|
||||
### B3. Где §A разошёлся с командными гипотезами
|
||||
|
||||
**Расхождение 1 — глава целиком не должна быть привилегированным кандидатом.** D35 справедливо хочет arm «глава целиком», но prior art поддерживает paragraph/discourse units и предупреждает о деградации длинного контекста. Глава нужна как диагностический потолок и область read-ahead; прод-кандидатом по умолчанию её считать нельзя. Источники: [Hu & Wan 2023](https://aclanthology.org/2023.emnlp-main.857/), [Herold & Ney 2023](https://aclanthology.org/2023.codi-1.15/), доступ 2026-07-11.
|
||||
|
||||
**Расхождение 2 — `draft=чанк/edit=глава` слишком рано превращать в архитектурную лестницу.** Она может победить, но смешивает три изменения: больше source context, больше draft context и иной масштаб reflow. Сначала нужны прямые ручные армы, разделяющие эти факторы. Лишь затем runner-изменение.
|
||||
|
||||
**Расхождение 3 — «cross-chunk = Ф2» слишком жёсткая граница.** Полноценная долговременная память, Annotator и retrieval действительно Ф2. Но ±1 source paragraph, previous target tail и статичная chapter card можно измерить и даже рендерить без обученной памяти. Это near-term context engineering; продовая автоматизация может потребовать небольшую машинерию, но не весь Ф2-стек.
|
||||
|
||||
**Расхождение 4 — отдельный layout-пасс не обязан быть детерминированным.** Exp12 рассматривает «детерминированный reflow-пасс» как вариант, но логическое слияние повествования семантично; чистая пунктуационная эвристика надёжно оформит реплики, но не решит, где кончается мысль. Детерминированным должен быть валидатор/аварийная механика, а сам reflow — LLM или ручная редактура, если нужны смысловые абзацы.
|
||||
|
||||
### B4. Что команда сделала лучше независимой карты
|
||||
|
||||
**CONFIRMED.** Research/16 дал точные русские нормы диалога и сильное различение legit N:M против структурного дефекта; §A был грубее. Источник: локальный research/16 §2.3, 2026-07-11.
|
||||
|
||||
**CONFIRMED.** Exp12/13 и D30/D32 дали локальную причинную эмпирику по конкретным моделям: mono no-op, active bilingual, ошибочные инверсии редактора, flash-vs-pro trade-off и ложная независимость судей. Внешняя литература этого заменить не может. Источники: локальные exp12/13 и D30/D32, 2026-07-11.
|
||||
|
||||
**CONFIRMED.** D35 измерил боевой прогон: reflow применён, draft→final similarity 0,643, 34/55 чанков сильно правлены, около 1,28 стыка чанков на главу. Это сдвигает приоритет к внутри-чанковой организации абзацев: cross-chunk нельзя объявлять главным виновником без trap-разметки. Источник: локальный D35.1, 2026-07-11.
|
||||
|
||||
## §C. Рекомендации — вход полигону
|
||||
|
||||
### C1. Главный дизайн: не один bake-off, а две короткие ступени
|
||||
|
||||
**Ступень I — причинная проба на 6–8 ловушках, а не на «средних главах».** Взять места владельца плюс независимо размеченные случаи четырёх типов: (a) повествовательные предложения, которые должны стать одним русским абзацем; (b) диалог с 1:N; (c) связь, разрешимая внутри текущего чанка; (d) связь, для которой опора находится только за его границей. Разметить до генерации: supporting span и допустимый смысл. Это согласуется с выводом, что общие sentence-level метрики не видят дискурс. Источники: [Jiang et al. 2023](https://aclanthology.org/2023.acl-long.435/), [Mohammed & Niculae 2024](https://aclanthology.org/2024.findings-eacl.113/), доступ 2026-07-11.
|
||||
|
||||
**Ступень II — blind chapter reading только трёх финалистов.** Не давать владельцу 8 почти одинаковых вариантов, как в exp12. После trap-гейта оставить baseline, лучший near-term arm и frontier diagnostic. Главный исход — бинарное закрытие двух претензий + ранжирование, вторичный — размеченные ошибки.
|
||||
|
||||
### C2. Армы и порядок
|
||||
|
||||
Обозначения фазы: **СЕЙЧАС** — прямые вызовы/ручная упаковка, без Ф2; **ПРОД-МИНОР** — после доказанного ROI нужна небольшая правка рендера/сегментации; **Ф2** — долговременное состояние, Annotator, retrieval или новый per-stage runner-контракт.
|
||||
|
||||
| Приоритет / механизм | Как измерить: arm и проба | Цена | Ожидаемый эффект | Фаза |
|
||||
|---|---|---|---|---|
|
||||
| **P0. Чистый baseline** | Точный текущий prod prompt+инъекция+1,5k chunk на тех же traps; исключить экспорт-пустоты ch5/ch20 по D35.4 | Уже известна | Нулевая точка обеих претензий | СЕЙЧАС |
|
||||
| **P1. Discourse-reflow prompt** | Тот же source/draft/chunk/model; добавить 2–3 структурных few-shot и рубрику ходов: фокал/действие/реакция/смена места-времени/говорящего; финал без плана | +кэшируемый префикс; почти $0 относительно generation | Главным образом абзацы; возможно локальная связность | СЕЙЧАС |
|
||||
| **P1. Draft-layout ablation** | Повтор P1, но перед editor заменить пустые строки draft на нейтральные separators или пронумерованные смысловые атомы; финал должен удалить ID | Токены ≈ те же; ручная подготовка | Проверяет якорение на форме черновика | СЕЙЧАС; ПРОД-МИНОР при победе |
|
||||
| **P1. Semantic-first vs combined** | На том же P1 сравнить один combined editor с двумя узкими проходами: bilingual semantic repair → target-only literary reflow; одинаковый coverage gate | Примерно +1 output-пасс; потенциально до ~2× editor-output, измерить | Первый проход — смысл, второй — абзацы/русский; снимает конкуренцию мандатов | СЕЙЧАС; ПРОД-МИНОР |
|
||||
| **P1. Reference ±1** | К P1 дать previous source+target tail и next source paragraph, явно `REFERENCE — НЕ ПЕРЕВОДИТЬ`; три отдельные абляции prev / next / both | +сотни input-токенов, без нового output | Coreference/ellipsis/cataphora около стыков | СЕЙЧАС; ПРОД-МИНОР |
|
||||
| **P2. Chapter card** | Один раз вручную/LLM извлечь для главы сущности, отношения, локацию, время, цель и unresolved refs; подать только релевантную компактную карточку каждому trap | Один pre-pass/глава + ~100–300 input-ток./чанк; точный COGS замерить | Дальние связи без полной главы | СЕЙЧАС как ручной arm; Ф2 для durable auto-state |
|
||||
| **P2. Whole-chapter editor diagnostic** | Склеить lossless source и drafts главы, один bilingual edit; те же prompt/few-shot; строгий atom coverage и sanitizer | Меньше fixed overhead, но большой input/output и дорогой retry | Верхняя диагностическая граница reflow/связности; не prod-фаворит | СЕЙЧАС диагностика; Ф2 runner при победе |
|
||||
| **P2. Discourse packet** | Ручные пакеты по сцене/ходу при сопоставимом 1,5k и 3k бюджете; сравнить с fixed packing | Ручная разметка; API цена близка size-matched | Изолирует качество границ от размера | СЕЙЧАС диагностика; ПРОД-МИНОР/Ф2 для сегментатора |
|
||||
| **P2. Model floor 2×2** | Текущая дешёвая и согласованная frontier-модель × baseline и лучший P1/P2 context. Одинаковые тексты/brief/output cap | 4 клетки; per-call cap; frontier только на traps+1 главе | Отделяет потолок модели от организации | СЕЙЧАС |
|
||||
| **P3. Size/retry curve** | 0,75k / 1,5k / 3k / глава, но отдельно fixed vs discourse boundary; ≥3 repeats только для операционной стохастики, не для «перерисовать качество» | Сохранять input/output/reasoning/retry токены и $ | Находит внутренний оптимум и цену отказа | СЕЙЧАС диагностика |
|
||||
| **P3. Proper-noun/genre gap cleanup** | До blind-пакета закрыть известные 甲乙丙丁/资质 и иные однозначные gaps, но не менять спорные формы между arms | Дешёвая курация; один resnapshot только после решения | Локальные смысл/жанр-дефекты, не дискурс | СЕЙЧАС |
|
||||
| **P4. Auto scene-state / retrieval** | Только если compact manual card даёт лифт: автоматический annotator + long/short memory; отдельная проверка ошибок карточки | Новый pre-pass, хранение, retrieval, versioning | Дальняя связность/последовательность | Ф2 |
|
||||
| **P4. Voice/address/reveal memory** | Не смешивать с текущим полигоном двух претензий; отдельные заранее размеченные случаи | Уже спроектированный дополнительный слой | Голос, отношения, спойлеры; не основная абзацность | Ф2 |
|
||||
|
||||
### C3. Что именно писать в сильном discourse-reflow prompt
|
||||
|
||||
Это не готовый «оптимальный промпт», а **арм для замера**. Не добавлять ручной verbose CoT reasoning-модели. Операционное ядро:
|
||||
|
||||
1. «Сначала молча определи смысловые ходы: единый фокал/наблюдатель; действие и непосредственная реакция; одна тема рассуждения; смена говорящего, времени, места или фокала».
|
||||
2. «Один повествовательный ход обычно оформляй одним русским абзацем, даже если китайский исходник разбит на однофразовые строки. Не объединяй только ради длины».
|
||||
3. «Каждую новую реплику — с нового абзаца через тире; слова автора при той же реплике оставляй в её абзаце».
|
||||
4. «Разрешено объединять и делить русские предложения; запрещено терять смысловые атомы. Число предложений и абзацев не обязано совпадать».
|
||||
5. «REFERENCE-блоки нужны только для разрешения связей; не переводи и не пересказывай их в выходе».
|
||||
|
||||
Few-shot должны быть минимальными и ортогональными: narrative N:1, dialogue 1:N, focal-shift boundary. Для DeepSeek thinking-arm сначала проверить zero-shot против few-shot из-за уже задокументированной модельной специфики research/15; не переносить результат между моделями.
|
||||
|
||||
### C4. Метрики и гейты — пререгистрировать
|
||||
|
||||
| Ось | Первичный показатель | Аварийный гейт |
|
||||
|---|---|---|
|
||||
| Русская абзацность | Blind preference русскоязычного читателя + доля заранее размеченных paragraph traps, решённых правильно | Нельзя побеждать только меньшим числом абзацев |
|
||||
| Смысл внутри чанка | Билингвальная trap accuracy с обязательным supporting span | Любая инверсия действия/участника = catastrophe независимо от среднего ранга |
|
||||
| Смысл через границу | Accuracy отдельно по prev-supported / next-supported / chapter-supported | Random-context perturbation не должен давать тот же результат, иначе context не используется |
|
||||
| Полнота | Покрытие смысловых атомов, не совпадение числа предложений | Любой пропуск заголовка/события дисквалифицирует arm на этом фрагменте |
|
||||
| Операционность | `$`, input/output/reasoning tokens, latency, retries по причинам, **повторно оплаченные токены** | Per-call predicted-cost cap до запуска; не group-level cap (урок exp13) |
|
||||
| Робастность | Leave-one-judge-out + отдельный catastrophe screen | Коррелированные колонки одного судьи не считаются независимыми сигналами |
|
||||
|
||||
**CONFIRMED.** Контекстный arm должен иметь correct-context vs shuffled-context perturbation: иначе улучшение нельзя приписать использованию опоры. Источник: [Mohammed & Niculae 2024](https://aclanthology.org/2024.findings-eacl.113/), доступ 2026-07-11.
|
||||
|
||||
### C5. Критерии решения после полигона
|
||||
|
||||
- Если **P1 discourse prompt** закрывает абзацы без падения fidelity — катить prompt/few-shot; размер не менять.
|
||||
- Если помогает только **draft-layout ablation** — проблема в формальном якоре, строить deformat/atom rendering, не chapter editor.
|
||||
- Если **±1 reference** закрывает большинство смысловых traps — строить малое context-window rendering до Ф2-памяти.
|
||||
- Если нужна **chapter card**, но whole chapter не лучше — строить state extraction/retrieval в Ф2.
|
||||
- Если **whole chapter** выигрывает и по fidelity, и по абзацам, и по retry-adjusted COGS — только тогда проектировать per-stage granularity; повторить на более длинной главе до решения.
|
||||
- Если сильная модель выигрывает в обеих колонках 2×2, а организация почти не помогает — зафиксирован model floor; не строить сложную память ради слабой модели.
|
||||
- Если организация помогает обеим моделям, а сильная+организация даёт дополнительный лифт — разделить near-term context fix и premium model tier.
|
||||
|
||||
## §D. Вопросы, на которые не хватило данных
|
||||
|
||||
1. **Где именно supporting context у мест владельца?** D35 сообщает около 1,28 стыка чанков на главу, но нет разметки: какой процент смысловых провалов разрешается внутри чанка, предыдущим абзацем, следующим абзацем, всей главой или знанием мира.
|
||||
2. **Какова реальная длина/токенизация главы в выбранных traps?** Без распределения нельзя заранее оценить whole-chapter retry exposure и lost-in-middle.
|
||||
3. **Какой frontend/model будет «ChatGPT-arm» полигона?** Эффект prompt format и few-shot модель-специфичен; нельзя честно выдать единый prompt winner без точного model ID/posture.
|
||||
4. **Сохраняются ли source paragraph IDs до editor rendering?** Это определяет, можно ли сделать atom coverage/deformat без runner-изменения.
|
||||
5. **Можно ли дать editor соседний source/target как non-output reference текущим renderer-ом?** Если нет, ручной полигон всё равно возможен, но production-оценка стройки меняется с ПРОД-МИНОР на Ф2 runner work.
|
||||
6. **Каковы retry causes по размеру на боевых моделях?** Нужны отдельно timeout, refusal, length, echo, sanitizer и decode; общий retry-rate скрывает разные зависимости от `c`.
|
||||
7. **Есть ли канонический человеческий/фанатский zh→ru фрагмент с хорошей русской репараграфизацией?** Он нужен как calibration/few-shot, но не как единственный reference style. В репозиторий книжный текст переносить нельзя.
|
||||
8. **Как owner оценивает допустимую степень синтаксического split/merge?** Текущий запрет «не выбрасывай и не добавляй предложения» двусмыслен; нужно подтвердить, что сохраняется содержание, а не sentence count.
|
||||
9. **Насколько front matter должен входить в приёмку художественности?** Его регистр отличается от романа и может искажать итог главы 1.
|
||||
10. **Какой порог успеха «минимально художественно»?** Предлагается операционализировать: обе претензии закрыты на ≥80% заранее размеченных traps, 0 катастроф смысла, и blind majority предпочитает arm baseline на каждой из трёх регистровых глав. Число 80% — предложение для пререгистрации, не внешний факт.
|
||||
|
||||
### Финальный вердикт
|
||||
|
||||
**PLAUSIBLE.** Самый дешёвый следующий ход — не ещё один общий model bake-off и не немедленная Ф2-память. Это короткий причинный полигон: текущий baseline → discourse/few-shot reflow → deformatted draft → ±1 reference, затем 2×2 с frontier-моделью. Whole-chapter arm нужен как диагностическая граница, но не как заранее выбранная архитектура. Автоматический scene-state/DelTA-класс оправдан только если компактная ручная chapter card сначала докажет лифт.
|
||||
345
docs/research/18-quality-levers.md
Normal file
345
docs/research/18-quality-levers.md
Normal file
|
|
@ -0,0 +1,345 @@
|
|||
# research/18 — Рычаги качества: как дотянуть текущую фазу до минимально-художественного zh→ru
|
||||
|
||||
<!-- ─────────────────────────────────────────────────────────────────────────
|
||||
ОРКЕСТРАТОР — РЕВЬЮ-ШАПКА (лендинг, D36, 12.07 №4). Тело §A НЕ тронуто (заморожено;
|
||||
sha256 44f90364… СВЕРЕН побайтно из закоммиченных байтов между BEGIN/END → MATCH →
|
||||
§A доказуемо не редактировалась после заморозки). Поправки — в этой шапке и в §E
|
||||
(«испр. оркестратором»). Полный разбор — PROGRESS §лендинг D36 + D-лог D36.
|
||||
|
||||
ВЕРДИКТ: **ACCEPT_WITH_FIXES.** Более ценный из двух входов: единственный отвечает на
|
||||
вопрос владельца «конвенция vs стиль» с zh→ru источниками; строгость по COGS; честные
|
||||
само-поправки; каждый §C-арм привязан к D-номерам и re-gate D34.3. Несущий диагноз и
|
||||
набор §C-армов подтверждены; дефекты — цитатно-рамочные, ядро не рушат.
|
||||
|
||||
НЕЗАВИСИМАЯ ВЕРИФИКАЦИЯ (мультиагентный воркфлоу, 26 агентов, первоисточники + реплика
|
||||
сырья, $0, refute-by-default; author≠reviewer к отчёту):
|
||||
- **Источники: 57/57 несущих цитат СУЩЕСТВУЮТ — 0 сфабрикованных.** Проверены ВСЕ «2026»-
|
||||
препринты (2601.08070 / 2605.31056 / 2605.29800 / 2605.13596 / 2605.13368 / 2511.09796
|
||||
и др. резолвятся на arXiv к заявленным заголовкам). 50/57 — claim-fidelity полная; 7 —
|
||||
«частично» (источник реален, атрибуция переисчерпана; поправки 1–3 ниже).
|
||||
- **Эмпирика воспроизведена на сырье:** ch5.0 (draft 5425 симв.→финал ПУСТ, `sanitizer_defect`)
|
||||
и ch20.0 — ТОЧНО; CJK-утечка **13 финалов — точно** (draft-«21» включает U+3000-отступ —
|
||||
настоящих иероглифов в draft = 9); 41/51 ~1:1 — в допуске (знаменатель точен, числитель
|
||||
толеранс-чувствителен, вывод устойчив); gl.7-инверсия (没有一个不知道→«никто не знал») и
|
||||
gl.8-сплющивание (物是人非→«всё изменилось») — фактически ПРИСУТСТВУЮТ (тяжесть — на
|
||||
fidelity re-gate полигона, не здесь).
|
||||
- **Ван Цуй (несущий вклад) — ПОДТВЕРЖДЁН по ТЕЛУ статьи:** скептик-агент декодировал
|
||||
CID/Identity-H шрифт PDF (~42к симв., 7 ToUnicode-CMap) → 5 техник verbatim + причастные/
|
||||
деепричастные обороты + подчинение как инструмент слияния + прескриптивная необходимость.
|
||||
Вестник МГУ Сер.22, 2024 №3, с.86–105, DOI 10.55959/MSU2074-6636-22-2024-17-3-86-105,
|
||||
рецензирован — реальный peer-reviewed источник (не экстраполяция).
|
||||
- **Анти-анкоринг:** гардрейлов не нарушено; ни один D-номер не течёт в §A; книжные цитаты
|
||||
≤15 слов. Минор-провенанс: «(идея владельца)» на слое конвенций пары (§A4.4) не
|
||||
прослеживается к разрешённым фазе-1 входам (возможна устная вводная — не задокументирована).
|
||||
|
||||
ПОПРАВКИ К ЛЕНДИНГУ (§A заморожена → корректны здесь; §E дополнена ниже):
|
||||
1. **[цитата] DocRepair-числа** (deixis 50.0→91.8 / когезия 45.9→80.6 / эллипсис 53.0→86.4 /
|
||||
73% предпочтения; §A4.8, §B2.4) — числа ВСЕ верны, но принадлежат ОТДЕЛЬНОЙ статье DocRepair
|
||||
«Context-Aware Monolingual Repair for NMT» (EMNLP-IJCNLP 2019, aclanthology **D19-1081** /
|
||||
arXiv **1909.01383**), НЕ процитированной ACL-2019 **P19-1116** (там CADec 50.0→81.6). Обе —
|
||||
Voita/Sennrich/Titov 2019. Вывод (монолингв. RU repair-пасс работает, EN→RU, с этими
|
||||
магнитудами) СТОИТ; правка — расщепить две цитаты (сделано в §E).
|
||||
2. **[цитата] TransAgents** — §A зовёт «TACL-версия» (arXiv 2405.11804, «To appear at TACL» —
|
||||
подтверждено), §E зовёт «PP 2024-05»: выбрать одно (accepted-but-preprint точнее). Это
|
||||
ДРУГАЯ статья, чем EMNLP-demo `2024.emnlp-demo.14` в ChatGPT-отчёте — не конфликт, две
|
||||
реальные статьи об одной системе (см. §E).
|
||||
3. **[цитата] Z5 «Li & Thompson»** (RG 235852523) — на деле Dingxu Shi, «Topic and Topic-Comment
|
||||
Constructions in Mandarin» (Language 76(2), 2000); клейм топик-комментария верен, автор-метка
|
||||
ошибочна. **Z8 «96% чэнъюй»** — числа НЕТ на процитированной Wikipedia (там «most»); суть
|
||||
(подавляющее большинство четырёхзнаковые) верна, «96%» не источено.
|
||||
4. **[рамка] Ван Цуй = прескрипция переводческой ТЕХНИКИ zh→ru, не «связующая норма языка».**
|
||||
Рамка §A4.4/A5 «обязательная дискурс-операция наравне с нормой» слегка пере-возвышена: это
|
||||
сильнейший маргинальный вклад отчёта (peer-reviewed техника: паратаксис→гипотаксис), но
|
||||
ответ владельцу «конвенция, не стиль автора» несут в первую очередь Розенталь/Правила-1956
|
||||
(нормы абзаца/диалога — CONFIRMED), а Ван Цуй — КАК их технически исполнить.
|
||||
5. **[рамка] «Пост-черновая регрессия > многих качественных проблем»** (§A4.1/A2 headline) —
|
||||
переоценено: ярчайший кейс (ch5.0-void) сам же исправлен в §B3 как ЭКСПОРТ-баг (не порча
|
||||
смысла редактором); остаток = реальные, но узкие CJK-утечки + НЕподтверждённые инверсии (§A
|
||||
помечает PLAUSIBLE). «Класс пост-черновой порчи существует» — честен; ранг «выше 2 претензий
|
||||
владельца» — нет. Guard §C#5 всё равно дёшев → строить.
|
||||
6. **[рамка] «Тройная сходимость»** (§B0) — оговорка про общую внешне-лит-ногу ПРИСУТСТВУЕТ и
|
||||
честна (планка D25.10 взята). Уточнения оркестратора: (а) есть ВТОРАЯ необъявленная общая нога
|
||||
— оба §A читали одно сырьё/код (совпадение по «изоляции чанков / инертному reflow» тоже не
|
||||
независимо); (б) цитатные базы двух отчётов почти НЕ пересекаются (~3 общие статьи) → там, где
|
||||
литература всё же расходится, совпадение вывода СИЛЬНЕЕ, чем оговорка допускает; (в)
|
||||
ChatGPT-заморозку класть в вес сходимости с дисконтом — её sha256 НЕ воспроизводится из
|
||||
документа (внешний прогон владельца; см. шапку ChatGPT-отчёта).
|
||||
───────────────────────────────────────────────────────────────────────────── -->
|
||||
|
||||
> Ресёрч-доклад независимой сессии-ресёрчера (D35.5). Вход эмпирической сессии полигона.
|
||||
> Протокол — трёхфазный анти-анкоринг: §A построена ДО чтения наших решений (только две претензии владельца + сырьё пере-прогона + механизм-как-есть + собственный внешний ресёрч). §B/§C/§D — после чтения нашего стека.
|
||||
> Каждый несущий клейм: вердикт **CONFIRMED / PLAUSIBLE / REFUTED** + источник (тип/дата). Препринт ≠ peer-review; вендор-клейм ≠ независимый замер; результат «в английский» ≠ доказательство «в русский» (помечаю экстраполяцию явно). Отчёт пройдёт адверсариальную верификацию оркестратора по первоисточникам.
|
||||
|
||||
---
|
||||
|
||||
<!-- BEGIN §A FROZEN — не редактировать после заморозки; sha256 ниже в маркере -->
|
||||
|
||||
## §A — «Чистый лист» (заморожено)
|
||||
|
||||
### A0. Метод и границы
|
||||
|
||||
Прочитано в фазе 1 (разрешённое): две претензии владельца; сырьё пере-прогона — исходник `guzhenren-slice25.gb18030.txt`, `rerun/records.json` (по-чанково: source/draft/final/флаги), `rerun/rerun-ru.txt`; механизм-как-есть — `backend/internal/pipeline/chunker.go`, `backend/prompts/{translator,editor}.md`. Плюс собственный внешний веб-ресёрч (52-агентный фан-аут с адверсариальной верификацией).
|
||||
|
||||
НЕ читалось (анти-анкоринг): `05-decisions-log.md`, хендоффы (`ORCHESTRATOR_HANDOFF.md`, `FIDELITY_REGATE_HANDOFF.md`), `rootcause_auto.json`, glossary-signoff, `diag/arms/*`, выводы приёмки. Заголовки последних коммитов присутствовали в среде сессии ambient — на содержание §A не опирался.
|
||||
|
||||
### A1. Механизм как есть (из кода и промптов)
|
||||
|
||||
- **Нарезка** (`chunker.go`): жадно пакует ЦЕЛЫЕ абзацы до `targetChunkTokens=1500` (код-конст, версионируется `chunkerVersion`, фолдится в снапшот); абзац сверх бюджета спускается к границам ПРЕДЛОЖЕНИЙ (предложение не рвётся). Детерминированно, чисто. Фактически ~2 чанка на главу (57 чанков / 25 глав), медиана исходного чанка ~1639 zh-символов.
|
||||
- **Пайплайн**: по-чанково ПЕРЕВОД (draft) → по-чанково РЕДАКТУРА (bilingual, source+draft). Каждый чанк — в ИЗОЛЯЦИИ. НЕТ overlap между чанками, НЕТ running-summary, НЕТ контекста прошлых глав. Единственная кросс-чанковая память — термин-ГЛОССАРИЙ, добавляемый редактору.
|
||||
- **translator.md**: только `{{text}}`; инструкции — «живой литературный русский», верстать по нормам РЯ (НЕ копировать построчную разбивку), прямая речь через тире.
|
||||
- **editor.md**: bilingual, `{{text}}`(src)+`{{draft}}`; сверять смысл с исходником, убирать кальки, глоссарий СТРОГО; «собирай повествование в естественные русские абзацы (не копируя построчную разбивку)»; полнота — не выбрасывать/не добавлять.
|
||||
|
||||
### A2. Замеренная слабость (сырьё)
|
||||
|
||||
**Претензия 1 (рубленость) — ПОДТВЕРЖДЕНА замером.** 41/51 нарративных чанков дают ~1:1 отношение «финальных абзацев к строкам исходника»; 58% ненарративных абзацев — одно предложение; медиана предложений/нарративный-абзац = 1.0. Инструкция reflow, присутствующая в ОБОИХ промптах, практически инертна.
|
||||
|
||||
**Локализация reflow-провала.** Черновик уже рубленый в 43/49 чанков (переводчик зеркалит построчную разбивку). Редактор СОХРАНЯЕТ структуру черновика в 37/49, СЛИВАЕТ лишь в 1/49 → редактор структуро-сохраняющий, НЕ работает layout-пассом. Вариативность reflow живёт в основном на стадии черновика (гл.11 черновик 25 абз., гл.13 — 14: переводчик там СЛИЛ). Оформление диалогов через тире — работает.
|
||||
|
||||
**Претензия 2 (связность/смысл) — ПОДТВЕРЖДЕНА чтением zh↔ru гл.5–12.** На уровне ПРЕДЛОЖЕНИЯ голос в целом приемлем, редактура часто улучшает (внутренний монолог в кавычках, разбивка атрибуции, лексические апгрейды). «Слабая художественность» идёт не от предложенческой translationese, а от кластера сбоев связности/полноты/терминологии. Конкретика:
|
||||
- гл.7: инверсия двойного отрицания 没有一个不知道 («все знали») → «никто не знал» (противоречит главе). [дефект в черновике, редактура не починила]
|
||||
- гл.8: 物是人非 (заглавие-ключ) сплющено до «всё изменилось», теряя контраст «вещи те же — люди иные».
|
||||
- Терминология grade-системы 甲乙丙丁 — дрейф между разряд А/Б/В/Г, числовым «первого/третьего ранга» (коллизия с 转-рангом гу-мастера) и точечными сырыми глифами.
|
||||
|
||||
**Третья ось, НЕ входившая в претензии владельца (самое ценное наблюдение):** значимая доля «слабой художественности» — это РЕГРЕССИЯ ПОСЛЕ ЧЕРНОВИКА, а не качество перевода. Финал местами ХУЖЕ черновика:
|
||||
- **гл.5.0: полный черновик 5425 симв. → финал ПУСТ, `edit_flag='sanitizer_defect'`** (собственный флаг пайплайна). Санитайзер обнулил целый чанк — миф об основании (Жэнь-цзу и три гу, метафора-ядро книги). Один из 2 пустых финалов на книгу. **[CONFIRMED — проверено мной по records.json.]**
|
||||
- **Утечка CJK-глифов в вывод**: 13 строк финалов (и 21 строка черновиков) содержат сырые zh/полноширинные глифы; часть внесена редактурой (напр. гл.8 特产, гл.4.1 资质乙等 — в черновике корректно). **[CONFIRMED — проверено мной.]**
|
||||
- Правки, ломающие смысл: гл.9 (переворот разряда В→Б у Фан Юаня, против всей его сюжетной линии низкого разряда), гл.10 (перекройка процентов восстановления в противоречивые «десятые/сотые») — **[PLAUSIBLE — наблюдение чтения; требует адверсариальной re-проверки оркестратором.]**
|
||||
|
||||
Вывод A2: перед постройкой машинерии связности имеет смысл СНАЧАЛА не давать пост-черновым стадиям (edit/sanitizer) разрушать уже годный черновик.
|
||||
|
||||
### A3. Карта «проблема → механизм» по осям
|
||||
|
||||
#### Ось 1. Дискурс-гранулярность zh→ru: где потолок — в моделях или в организации?
|
||||
|
||||
- **Абзац — эмпирически лучшая единица перевода, чем предложение** (меньше mistranslation/грамматики/несогласованности, естественнее верстается). **[CONFIRMED]** — Karpinska & Iyyer, *LLMs Effectively Leverage Document-level Context for Literary Translation* (WMT 2023, peer-reviewed, ACL 2023.wmt-1.41; arXiv 2304.03245). **Экстраполяция для нас:** мишени в статье — англ./польск./яп., zh как ИСТОЧНИК; направление «в русский» напрямую не мерено (польский — славянский прокси). Единственная модель — GPT-3.5.
|
||||
- **Но у нас единица УЖЕ ~1600 симв. (много абзацев)** — то есть «апсайд от добавления контекста в единицу» в основном ПОТРАЧЕН; дальнейший рост единицы не даёт бесплатного качества. **[PLAUSIBLE]**
|
||||
- **Потолок связности — в ОРГАНИЗАЦИИ (изоляция чанков), а не в сырой модели.** Кросс-предложенческий контекст даёт большой прирост на именно тех дискурс-феноменах, что суть претензии 2. **[CONFIRMED для направления в русский]** — Voita et al., *When a Good Translation is Wrong in Context* (ACL 2019, peer-reviewed, EN→RU OpenSubtitles): 7% индивидуально-верных пар неверны в контексте; окно 3 предложений поднимает deixis 50.0→81.6, лексич. когезию 45.9→58.1, VP-эллипсис — существенно. Домен — субтитры (разговорный), не проза; магнитуды индикативны.
|
||||
- **«Потерянное в середине» ограничивает лишь ВЕРХНИЙ конец кривой** (целая глава / много чанков); на нашем ~1500-ток чанке эффект мягкий и НЕ объясняет текущие дефекты — это довод не прыгать к «глава целиком», а не диагноз. **[CONFIRMED]** — Liu et al., *Lost in the Middle* (TACL 2024; arXiv 2307.03172).
|
||||
- **Ближайший индустриальный аналог нашего пайплайна** — TransAgents (мультиагентная «переводческая компания», zh→en вебновеллы): работает ПО ГЛАВАМ с персистентной Translation Guideline (глоссарий+резюме+тон+стиль), роли Senior/Junior Editor + Proofreader сверх голого translate→edit. **[CONFIRMED]** — TransAgents (TACL; arXiv 2405.11804). Оговорка: под капотом GPT-4-Turbo (фронтир), не дешёвая модель; человеко-предпочтение — монолингвально (слепо к верности).
|
||||
|
||||
#### Претензия 1. Абзацы/конвенции — это КОНВЕНЦИЯ ЯЗЫКА, академически кодифицированная, а не авторский стиль
|
||||
|
||||
Прямой ответ на вопрос владельца — **ДА, это норма русского языка, а не стиль одного автора:**
|
||||
- **Русский абзац — логико-смысловая единица**, группирующая несколько предложений вокруг завершённой мысли; новый абзац — при логическом завершении мысли / смене темы-времени-места-говорящего. Построчно-однопредложенческое тело — по определению НЕ русское абзацирование. **[CONFIRMED]** — Текстология.ру, «Абзац как часть текста»; корпус-норма подтверждена независимо.
|
||||
- **Диалог: каждая реплика — с красной строки через тире; кавычки для бегущего диалога не используются.** Слова автора — строго кодифицированная пунктуация (двоеточие/запятая-тире и т.д.). **[CONFIRMED]** — Розенталь, «Справочник», §47/§50 (Оформление прямой речи); Правила-1956 §195. (Источники — веб-зеркала Розенталя; нумерация разнится по изданиям.)
|
||||
- **Китайская вебновелльная вёрстка расходится с РЯ по всем осям**: отступ (U+3000×2, правило Ху Ши 1919), полноширинная пунктуация, диалог в 引号 «“ ”», привычка очень коротких абзацев (часто одно предложение / 自然段 для мобильного ритма). **[CONFIRMED]** — Wikipedia «Chinese punctuation» + история.
|
||||
|
||||
**Ключевой синтез:** корректный zh→ru reflow — это структурный трансформ из ЧЕТЫРЁХ операций, а не одна инструкция «не копируй разбивку»: (a) СЛИЯНИЕ подряд идущих коротких нарративных строк в многопредложенческие логические абзацы; (b) КОНВЕРСИЯ 引号-диалога в тире-абзацы по репликам; (c) НОРМАЛИЗАЦИЯ глифов (полн.→полуширинные, “ ”→« », — для речи); (d) СНЯТИЕ -отступа. Операции (b),(c),(d) — **ДЕТЕРМИНИРОВАННЫЕ (код, без модели)**; операция (a) требует ДИСКУРСНОГО понимания, чем **сцепляет претензию 1 с претензией 2**. **[CONFIRMED как рамка]**
|
||||
|
||||
Почему инструкция игнорируется и чем чинить:
|
||||
- **LLM surface-копирует построчную структуру входа** (переводы строк — высокосалиентные, near-синтаксические признаки; структурная персистенция), поэтому bilingual-редактор зеркалит one-sentence-per-line черновика. **[PLAUSIBLE]** — Sclar et al. (2024, 2310.11324, format-sensitivity) — аналогия, не прямой замер layout.
|
||||
- **Гипотеза «негативный констрейнт («не копируй») сам по себе — главная причина» — REFUTED**: доказательства backfire негативных констрейнтов — слабые препринты про подавление англ. СЛОВ, не про zh→ru layout. **[PLAUSIBLE→REFUTED]**
|
||||
- **Самый надёжный рычаг — few-shot экземпляры** (рубленый источник/черновик → слитый многопредложенческий целевой абзац), и особенно **target-side якорь** (реальный русский литературный абзац в контексте), т.к. модель копирует структурные решения из демонстраций. **[PLAUSIBLE]** — FollowBench (2024, 2310.20410) — смежная опора.
|
||||
- **Отделить «дать верную русскую прозу» от «разложить в абзацы»** (отдельный reflow/layout-пасс или plan-then-write): инлайн-энфорсмент формата конкурирует с контент-целью; прирост измеримый, но скромный, +1 LLM-вызов. **[PLAUSIBLE]** — 2510.03595 (препринт).
|
||||
- **Осторожно**: слияние предложений и укрупнение контекста ПОВЫШАЮТ риск ОПУЩЕНИЙ и путаницы атрибуции — агрессивный reflow сам может терять/скремблить смысл; нужен guard полноты. **[CONFIRMED]** — Karpinska & Iyyer (WMT 2023).
|
||||
|
||||
#### Претензия 2. Понимание связей/смысла на дистанции
|
||||
|
||||
- **Корневая причина — кросс-чанковая ИЗОЛЯЦИЯ.** Впрыск даже малого контекста (предыдущий src/tgt-хвост + running bilingual summary + реестр имён/антецедентов) даёт большие замеренные приросты consistency и дискурса — на ТОМ ЖЕ домене (китайские вебновеллы). **[CONFIRMED ядро]** — DelTA (ICLR 2025, peer-reviewed; arXiv 2410.08143): память-тиры (Proper-Noun Records, running summary), GuoFeng zh→en; средний прирост согласованности +4.58 (заголовочный +48.5 — единичный best-case). Оговорка: не →ru; часть опор — препринты.
|
||||
- **zh-специфика: нулевые/опущенные местоимения и субъекты (zero anaphora)** — доминирующий драйвер провала на дистанции; русский (non-pro-drop, согласование род/число) требует ЭКСПЛИЦИТАЦИИ, а антецедент часто в ПРЕДЫДУЩЕМ предложении → корректное восстановление структурно НЕВОЗМОЖНО при поч-чанковой изоляции. **[CONFIRMED, что это архитектурный, а не только «дешёвая модель», баг]**. Голая инструкция «будь внимателен» почти не помогает; чинит только явный контекст/аннотация. **[PLAUSIBLE]** — препринт 2605.31056 (zh→en: <50% ZP базово, oracle-разметка +40 пт); экстраполяция на →ru.
|
||||
- **Глоссарий — слабейшая кросс-чанковая память**: адресует только лексическую когезию (~14% русских дискурс-ошибок), мимо deixis (~37%) и эллипсиса/морфологии (~29%). **[CONFIRMED]** — производно от Voita et al. (ACL 2019). Значит от глоссария в одиночку прироста связности ждать мало.
|
||||
|
||||
**Ранжирование лекарств претензии 2 (эффект / стройка):**
|
||||
1. **Running bilingual summary + previous-chunk carryover** — лучший НЕистраченный рычаг: замерен прямо на китайских вебновеллах (DelTA), стоит ~1 малый вспом-вызов на ~20 предложений; source-primed контекст предпочтительнее переиспользования прошлого МАШИННОГО перевода (последнее роняет качество из-за накопления ошибок). **[CONFIRMED направление / PLAUSIBLE магнитуда для →ru]**
|
||||
2. **Document/paragraph-level контекст** — лучший по доказательности, но у нас уже ПОТРАЧЕН (единица крупная).
|
||||
3. **Аннотатор (MAPS-класс: ключевые слова/тема/демо)** — снижает локальную mistranslation, но SENTENCE-level, требует 3-4 кандидата + QE-выбор (3-4× цена), бьёт по локальной адекватности, не по дальней связности. **[PLAUSIBLE]**
|
||||
4. **Сильнее модель** — крупнейший одиночный рычаг на дискурс, но лобовой конфликт с дешёвым COGS; контекст+память дают дешёвой модели закрыть бóльшую часть разрыва. **[PLAUSIBLE]**
|
||||
5. **Self-refine / итеративный пост-эдит — СПОРНО для MT**: полирует fluency/translationese, даёт скромный прирост и лишь при внешнем error/QE-сигнале, смещён «в английский», может деградировать/галлюцинировать на итерациях; связность, к которой модель НЕ имела доступа, не восстановит. **[CONFIRMED, что спорно]** — Chen et al. (EAMT 2024, TEaR) + др.
|
||||
|
||||
#### Ось 4. Кривая chunk ↔ качество ↔ биллинг ↔ ретраи (рамка для пре-регистрации)
|
||||
|
||||
- **Форма — перевёрнутая U**: снизу ограничена потерей когезии у слишком мелкой единицы (Karpinska), сверху — базово-модельной/позиционной деградацией у слишком крупной (Lost-in-Middle; для НЕ-дообученных инструкт-моделей качество ПАДАЕТ с ростом единицы — 2504.12140, препринт, малые модели). **[PLAUSIBLE]**
|
||||
- **COGS доминируется ВЫХОДНЫМИ токенами**, + «фертильность» русского/кириллицы на англо-центричных токенизаторах (~2–2.5× англ.). Значит КАЖДЫЙ добавленный русско-генерящий LLM-пасс множит доминирующую статью; префикс-кэш скидывает лишь дешёвый ВХОД. **[CONFIRMED]** — Petrov et al. (NeurIPS 2023, tokenizer fairness) для фертильности.
|
||||
- **Префикс-кэш делает пере-слание system+glossary почти бесплатным** — НО только если статику класть ПЕРВОЙ, а volatile-контекст (running summary, меняющийся каждый чанк) ПОСЛЕ неё (любой volatile-префикс инвалидирует кэш ниже). Тогда worry «глоссарий шлётся каждый чанк» — почти не-проблема. **[CONFIRMED для наших провайдеров с оговоркой ordering]**
|
||||
- **Retry blast radius тянет оптимум к МЕНЬШЕЙ единице** (переген всего чанка при мисматче) — центральное напряжение против качественного тяготения к крупной; оптимизировать надо на RETRY-ADJUSTED output-cost, а связность подавать глубиной кэшированного carryover, а НЕ размером единицы. **[PLAUSIBLE]**
|
||||
- **Вывод оси 4:** ОТВЯЗАТЬ дискурс-единицу от биллинг-единицы: держать чанк небольшим (дёшево, малый blast radius, меньше output-деградации), а когезию давать кэшированным summary/carryover.
|
||||
|
||||
### A4. Оси, которые команда могла не увидеть (приоритетно)
|
||||
|
||||
1. **Пост-черновая регрессия > многих «качественных» проблем.** Санитайзер/редактура местами уничтожают годный черновик (гл.5 обнулён; CJK-утечки; правки-перевороты смысла). Дешевле всего: гейт «финал не должен быть пустым/короче черновика на X%», «нет сырых CJK-глифов в выводе», «числа/термины из черновика не переворачиваются». Это адресует «слабую художественность» БЕЗ новой машинерии. **[CONFIRMED наблюдение]**
|
||||
2. **Reflow ЧАСТИЧНО БЕСПЛАТЕН.** Операции (b)/(c)/(d) 4-операционного трансформа — детерминированные (код-нормализация глифов/диалога/отступа); только (a) слияние — дискурсная. Отделить дешёвое-детерминированное от дорогого-модельного. **[CONFIRMED рамка]**
|
||||
3. **Метрика-инверсия для zh→ru — конкретно, не абстрактно.** На WMT24 zh→ru простой Google-NMT обошёл ВСЕ LLM/мультиагентные системы по d-BLEU (human-eval отсутствовал) — прямая same-pair демонстрация, что гейтинг художественности на авто-метрике ИНВЕРТИРУЕТ ранжирование. Следствие: претензию 1 сложить в дешёвый ДЕТЕРМИНИРОВАННЫЙ структурный KPI; художественность/связность — не на BLEU/COMET. **[PLAUSIBLE — источник WMT24 zh→ru; точный URL — к сверке оркестратором]**
|
||||
4. **Пара-конвенции как переиспользуемый ВЕРСИОНИРУЕМЫЙ слой** (идея владельца). Отделить (a) конвенции ПАРЫ ±жанр [zh→ru: паратаксис→гипотаксис, красная строка, тире, эксплицитация опущенных местоимений, политика 成语] — глобальный версионируемый ассет, ключ (src→tgt[×регистр]); (b) память КНИГИ (глоссарий/голоса) — как сейчас; (c) ручки прогона (venuti/honorifics). Грузонесущее свойство — версионирование+снапшот-фолд (смена = громкая ре-трансляция, как `chunkerVersion`), а не носитель (config-ассет или таблица БД). Есть **прямая zh→ru (не экстраполяция) peer-reviewed прескрипция**: 5 техник передачи китайских паратактических предложений в русский — (1) построить иерархию в русском, (2) сегментировать по смысловым единицам, (3) промаркировать вид/время предикатов по нормам РЯ, (4) варьировать лексику, (5) добавлять связки по контексту. **[CONFIRMED]** — Ван Цуй, «Анализ китайских паратактических предложений и их перевода на русский язык», Вестник МГУ Сер. 22 (Теория перевода). Русский-специфичный инструментарий слияния — причастные/деепричастные обороты + подчинительные союзы.
|
||||
- Открытая развилка (к замеру, не приговор): РАЗМЕР/ФОРМА пакета = вопрос «способность vs активация»; большой правилник может жечь токены и размывать внимание, если знание латентно; возможно, короткий указатель или 1–2 few-shot экземпляра бьют точнее. Ключ может быть пара×жанр. Пакет должен нести ОГРАНИЧИТЕЛИ против коллизии с инвариантом полноты (слияние/эксплицитация — на грани «добавления»).
|
||||
5. **Способность vs активация — диагностический арм.** Один и тот же reflow-промпт × дешёвая vs фронтир-модель: фронтир верстает, дешёвая нет → gap способности; ни та ни другая → недоспецифицированный промпт; краткое правило/пример чинит дешёвую → это была активация. Разводит «модель не умеет» от «модель недоактивирована».
|
||||
6. **Бюджет чанка — в ВЫХОДНЫХ токенах на реальном токенизаторе (DeepSeek/GLM), а не в zh-символах**; пере-калибровать под фертильность кириллицы и стабильный output-потолок модели (~3–4k ток у мелких — раньше). **[CONFIRMED довод]** — Petrov et al. (NeurIPS 2023).
|
||||
7. **Разметка нулевых местоимений/кореференции исходника** как дешёвый препроцесс перед переводом (zh zero-pronoun → явная маркировка): oracle-разметка стоит +40 пт там, где инструкции ~ничего. **[PLAUSIBLE, zh→en, экстраполяция на →ru]**
|
||||
8. **DocRepair-класс: монолингвальный РУССКИЙ reflow/repair-пасс**, который НЕ видит китайский, а чинит связность/абзацы уже переведённого + контекст соседей (это шаг Найды «реструктуризация»). EN→RU: deixis 50.0→91.8, лексич. когезия 45.9→80.6, эллипсис-флексия 53.0→86.4; аннотаторы предпочли 73%. **[CONFIRMED для EN→RU]** — Voita et al. (ACL 2019, DocRepair). Это отделяет fluency/layout-работу от fidelity-работы.
|
||||
|
||||
### A5. Гипотеза-резюме §A (моя карта до чтения нашего стека)
|
||||
|
||||
1. «Слабая художественность» = сумма ТРЁХ, не двух, слоёв: (i) **пост-черновая регрессия** (санитайзер/редактура ломают годный черновик) — вероятно, самый дешёвый и недооценённый; (ii) **рубленость** = source-mirroring + инертная инструкция, чинится дёшево смесью детерминированной нормализации + few-shot/target-anchor + (возможно) отдельного layout-пасса; часть рубленостей (слияние) — дискурсная и сцеплена с (iii); (iii) **связность на дистанции** = архитектурный баг изоляции чанков + zh zero-anaphora; лучший дешёвый рычаг — running bilingual summary + prev-chunk carryover (кэш-дружественно), НЕ глоссарий и НЕ self-refine.
|
||||
2. Потолок текущей фазы — в ОРГАНИЗАЦИИ (контекст/память/промпт/нарезка/пост-обработка), не в сырой дешёвой модели; переход на фронтир — рычаг, но не первый по эффективности-на-стройку.
|
||||
3. Измерять: претензию 1 — дешёвым ДЕТЕРМИНИРОВАННЫМ структурным KPI (без судьи); претензию 2 — судья/QA-стиль (TREQA) или дешёвый человеко-протокол (ESA); НИКОГДА не гейтить художественность на BLEU/COMET (для zh→ru доказана инверсия); беречься «сфабрикованной сходимости» судей (устанавливать независимость до агрегации).
|
||||
|
||||
<!-- END §A FROZEN -->
|
||||
<!-- FREEZE-MARKER §A: sha256=44f90364c786e86bf12e977b8a6712e9e2e89e7cd53d92540def624d842cce6f (хеш байтов между маркерами BEGIN..END; оркестратор: сверить перед фазой 2; ресёрчер §A после заморозки не редактировал — §B/§C/§D только ниже) -->
|
||||
|
||||
---
|
||||
|
||||
## §B — Дифф: §A против нашего стека (и параллельного ChatGPT-отчёта)
|
||||
|
||||
### B0. Метод и главный результат диффа
|
||||
|
||||
§A заморожена (sha256 `44f90364…`) ДО чтения: `05-decisions-log` (D1–D35), `research/07/15/16`, exp04/09/12/13, и параллельного `research/18-quality-levers-chatgpt.md`. Главный результат: **тройная независимая сходимость.** Три пути — (i) моя §A (сырьё+внешняя литература), (ii) ChatGPT-§A (тоже заморожена до стека, sha256 `b42c6f6e…`), (iii) эмпирический стек команды (D26→D35) — сошлись на диагнозе и на большинстве рычагов. Это сильное подтверждение. **Оговорка против сфабрикованной сходимости (D25.10/D32.4):** независимы попарно ПУТИ (я не читал ChatGPT до заморозки; обе §A заморожены до стека; команда пришла эмпирикой), но нога «внешняя MT-литература» ОБЩАЯ у меня и ChatGPT — совпадения там ≠ три независимых голоса. Поэтому ценность §A не в «ещё раз то же», а в остатке: где я расхожусь и что добавляю (B2), плюс честные само-поправки (B3).
|
||||
|
||||
### B1. Где §A СОШЛАСЬ с командой (команда угадала — не дублировать, подтвердить)
|
||||
|
||||
| §A-ось | У команды уже есть | Статус |
|
||||
|---|---|---|
|
||||
| Reflow зеркалит рубленость исходника = промпт-рычаг | D35.1 дословно; D30.2 снял «сохраняй разбивку», мандат репараграфизации | ✅ угадано |
|
||||
| Within-chunk (промпт-фиксимо) vs cross-chunk (Ф2) | D35.1 (чанк пакует ~34 абз. / ~1.28 стыка на главу) | ✅ угадано |
|
||||
| Ось «нарезка × промпт» — ключевой невыжатый рычаг | D35.3 (exp04/12/13 крутили только МОДЕЛЬ) | ✅ угадано |
|
||||
| Source-line strip как рычаг претензии 1 | **exp12:174 уже предлагает** снять построчную разбивку | ✅ угадано (моя §A НЕ первая) |
|
||||
| Русские нормы абзаца/диалога с первоисточниками | **research/16 §2.3: Розенталь §52-53, Лопатин ПАС §138, Правила-1956 §51**; тире-flagger | ✅ угадано (полнее, чем §A знала — см. B3) |
|
||||
| Running summary / annotator / межглавные резюме | Ф2: DelTA-обоснован (D21, D30.8); **exp09-M2 = «глоссарий+скользящее резюме» уже арм** | ✅ угадано (как Ф2/пилот-арм) |
|
||||
| Output-санитайзер / пост-черновые порчи | D30.3/D33/D33.1 (утёкшие преамбулы, латиница, markdown) | ✅ угадано |
|
||||
| Пустые финалы ch5/ch20 (моя «третья ось») | **D35.4a: известный экспорт-баг** (санитайзер флагает ведущий `###`, экспорт дропает) | ✅ угадано (см. B3) |
|
||||
| Сырой китайский 甲乙丙丁/资质 в глоссарий | D35.4c (глоссарий-адресуемая часть претензии 2) | ✅ угадано |
|
||||
| Декаплинг дискурс-единицы от биллинг-единицы | D35.7 (`draft=чанк/edit=глава`, runner-уровень) | ✅ угадано |
|
||||
| Метрика: детерминированный структурный KPI + judge-дисциплина | D29.1d диалог-flagger; 07:86 translationese-метрики; D13.3 панель; D25.10/D32.4 анти-сходимость; D30.1 span-судья | ✅ угадано (команда МЕТОДИЧЕСКИ впереди) |
|
||||
| Frontier-арм как диагностика потолка ≈ capability-vs-activation | D35.3 | ✅ угадано |
|
||||
| Промптинг литперевода (task-framing, few-shot по классам, sandwich, no manual CoT, «plan+translate в одном вызове не армить») | research/15 §1.2/§3 обширно | ✅ угадано (АУГМЕНТИРОВАТЬ, не дублировать) |
|
||||
|
||||
Вывод B1: команда угадала правильно почти всю карту. Диагноз D35 = моя §A. Это повышает доверие, что «строить» надо по этой карте — но и снижает новизну §A; реальная ценность — в B2.
|
||||
|
||||
### B2. Где §A РАСХОДИТСЯ / команда недостроила (несущий остаток)
|
||||
|
||||
1. **zh→ru ДИСКУРС-ТРАНСФОРМ как переводческая теория — самая тонкая ось стека.** research/16 grounds РУССКУЮ сторону (нормы абзаца/диалога) и на уровне ВЫРАВНИВАНИЯ отмечает китайский паратаксис (Xue&Yang ACL 2011, ~16.6% запятых — границы), но **нет переводоведческой рамки zh→ru**: паратаксис→гипотаксис (意合/形合), 流水句, обязательность сращивания. Критично: research/16 §2.3 считает слияние (N:1) «дискреционным стилем, не нормой» — а **прямая zh→ru peer-reviewed прескрипция (Ван Цуй, Вестник МГУ Сер.22) говорит: пересборка паратактической цепи в русскую иерархию ОБЯЗАТЕЛЬНА** (5 техник: иерархия / сегментация по смыслу / вид-время / лексика / добавление связок), а инструмент — причастные/деепричастные обороты + подчинение. **Это апгрейдит «слияние дискреционно» → «слияние — требуемая дискурс-операция, и вот КАК».** Даёт reflow-промпту реальный zh→ru СОДЕРЖАНИЕ, а не «не копируй разбивку». **[CONFIRMED; прямой источник, не экстраполяция]** — самый сильный вклад §A, прямо отвечает на вопрос владельца «это конвенция языка, а не стиль автора».
|
||||
2. **Слой «пакет конвенций пары» как ВЕРСИОНИРУЕМЫЙ артефакт (идея владельца) — структурный пробел.** research/07 держит конвенции пары как КОНТЕНТ (Палладий/Поливанов, Venuti, Нора Галь), но **«разбросаны как brief/config-политики, отдельного слоя нет»** (вывод фазы-2). Отделить (пара±жанр) от (книга) от (прогон); ключ (src→tgt[×регистр]); снапшот-фолд как `chunkerVersion`. Не носитель, а версионирование — грузонесущее. → §C-архитектура.
|
||||
3. **Running summary — переоценить для near-term, не только пилот.** Команда СОЗНАТЕЛЬНО не строит LLM-резюме (research/15: «DelTA платит вызовами — мы нет», COGS-козырь); имеет лишь детерминированную инъекцию срезов памяти (Aho-Corasick) + M2-арм в пилоте. Но DelTA даёт бенефит именно бегущим резюме на ТОМ ЖЕ домене (вебновеллы), а COGS-возражение слабеет при кэш-дружественном ordering (резюме — 1 малый вызов на ~20 предложений, вход near-free при префикс-кэше). → предлагаю мерить running summary как near-term рычаг претензии-2-кросс-чанк, не хоронить на COGS до замера.
|
||||
4. **DocRepair-класс (монолингвальный РУССКИЙ repair-пасс) с числами В РУССКИЙ.** ChatGPT тоже флоатит «отдельный target-only пасс», но без into-ru доказательств; у меня Voita 2019 EN→RU: deixis 50→91.8, когезия 45.9→80.6. Опция для op(a)+связность отдельно от билингв-fidelity-редактуры (editor-mono.md существует, но DORMANT — D33.4a). **[CONFIRMED для EN→RU]**
|
||||
5. **Стоимостная строгость: фертильность-налог + cache-ordering + перевёрнутая-U.** ChatGPT имеет формулу+retry-множитель; команда — exp08+чанкер-конст+D35.6-арм. Добавляю: COGS output-доминирован + **кириллица-фертильность ~2–2.5× (Petrov NeurIPS 2023)** → бюджет чанка в ВЫХОДНЫХ токенах на реальном токенизаторе, не zh-символах; **cache-ordering** (статик первым, volatile-summary после — иначе кэш бьётся); перевёрнутая-U (когезия снизу, позиционная деградация сверху).
|
||||
6. **Метрика-инверсия zh→ru — конкретный датапоинт.** WMT24 zh→ru: Google-NMT обошёл все LLM/мультиагент по d-BLEU без human-eval → не гейтить художественность на авто-метрике (у команды дисциплина есть, конкретного zh→ru датапоинта — нет). **[PLAUSIBLE — URL к сверке]**
|
||||
|
||||
### B3. Само-поправки §A после чтения стека (честно)
|
||||
|
||||
- **ch5.0 «санитайзер обнулил чанк» → НЕТ: экспорт-баг D35.4a.** Санитайзер ФЛАГАЕТ ведущий `###`, а экспорт дропает флагнутый чанк в пустоту вместо strip/fallback; текст правки ЦЕЛ. Класс тот же (пост-черновая порча), но механизм — экспорт, не санитайзер-void. Команда уже поймала (полигон обязан починить ch5/ch20 до слепых пакетов).
|
||||
- **«команда не заземлила reflow в Розенталя» → неверно.** research/16 заземлила РУССКУЮ сторону (Розенталь §52-53, Лопатин, Правила-1956). Точный пробел уже — zh→ru ТРАНСФОРМ-сторона (B2.1), не русские нормы.
|
||||
- **source-line strip как «новый рычаг» → не новый:** exp12:174 уже предлагает. §A-статус «оси, что могли не увидеть» для этого пункта снимаю.
|
||||
|
||||
### B4. Дифф против параллельного ChatGPT-отчёта (чтобы не дублировать)
|
||||
|
||||
Сходятся (обе независимые §A): source-strip, discourse-move few-shot, look-behind/look-ahead (особ. для zh нулевого подлежащего), chapter-card, декаплинг трёх единиц (coverage-atom ≠ generation-unit ≠ reference-span), perturbation-тест (correct vs random context) как центральная метрика, детерминированный структурный KPI, model-floor 2×2, «whole-chapter только как диагностический потолок», retry-adjusted cost. **Совпадение двух независимо-замороженных §A — корроборация** (с оговоркой общей лит-ноги B0).
|
||||
|
||||
Мой маргинальный вклад СВЕРХ ChatGPT: (1) zh→ru академ-грунтинг Ван Цуй/паратаксис-гипотаксис — ChatGPT ЯВНО пишет «zh→ru якорей нет»; (2) версионируемый слой пары; (3) DocRepair into-ru числа; (4) фертильность-налог + cache-ordering; (5) метрика-инверсия zh→ru. ChatGPT сверх меня: развёрнутая two-stage eval-схема (Stage I причинная проба на 6–8 ловушках / Stage II слепые 3 финалиста), «дискурсный пакет» как generation-unit, трёх-единичная факторизация — ценно, рекомендую взять в §C (не переизобретаю, ссылаюсь).
|
||||
|
||||
---
|
||||
|
||||
## §C — Рекомендации для полигона (таблица-вход эмпирической сессии D35.6)
|
||||
|
||||
Формат: {механизм → как измерить → цена → эффект на претензию → фаза}. Явно разведено: **СЕЙЧАС** (промпт/нарезка/глоссарий/детерминированный код, без Ф2-машинерии) vs **Ф2** (память/аннотатор/reference-тома). Строки согласованы с осями D35.6 (нарезка×промпт, frontier-арм, кривая размер↔качество↔биллинг↔ретраи, fidelity re-gate, слепые пакеты) и с методик-guard D32.4 (fidelity-first, leave-one-out, катастроф-скрин, per-call кап, независимость сигналов).
|
||||
|
||||
### C1. СЕЙЧАС — промпт/нарезка/глоссарий/детерминированный код
|
||||
|
||||
| # | Механизм | Как измерить (арм/проба) | Цена | Эффект → претензия | Фаза |
|
||||
|---|---|---|---|---|---|
|
||||
| 1 | **Дискурс-reflow промпт с zh→ru СОДЕРЖАНИЕМ** (5 техник Ван Цуй: иерархия/сегментация/вид-время/лексика/связки; причастные-деепричастные обороты; Розенталь-диалог) вместо «не копируй разбивку» | Структурный KPI (распределение предложений/нарратив-абзац vs русский референс) + слепое чтение; арм × (чанк\|глава) — ось нарезка×промпт | ~0 (промпт) | Претензия 1 (+сцеплённая часть 2) | Сейчас |
|
||||
| 2 | **Discourse-move few-shot** (рубленый→слитый; target-side русский якорь; diversity-подбор ≤5 — research/15 few-shot-дисциплина) | Тот же KPI + fidelity re-gate (omission-guard: слияние повышает опущения) | +вход-токены (кэшируемо) | Претензия 1 | Сейчас |
|
||||
| 3 | **Source-line strip / deformat черновика** до редактора (убрать зеркалящий cue) | A/B тот же KPI — изолирует построчный cue (exp12:174) | ~0 (детерм.) | Претензия 1 | Сейчас |
|
||||
| 4 | **Детерминированный reflow-постпроцессор** ops (b)+(c)+(d): тире-диалог + нормализация глифов (полн.→полу, “”→«», —) + снятие + strip markdown-`###` | CJK-глиф=0 гейт; диалог-парность-flagger (D29.1d) | ~0 (код) | Претензия 1 + утечка CJK-глифов | Сейчас |
|
||||
| 5 | **Guard пост-черновой регрессии**: финал не пуст / не короче черновика на X% / нет сырых CJK / числа-разряды не переворачиваются vs черновик | Детерм. гейт + fidelity re-gate (D34.3) | ~0 (код) | «Третья ось» (вкл. экспорт-баг ch5/ch20 D35.4a) | Сейчас |
|
||||
| 6 | **Глоссарий: засев сырых 甲乙丙丁/资质** (D35.4c) | Term-coverage post-check | ~0 | Претензия 2 (глоссарий-адресуемый срез) | Сейчас |
|
||||
| 7 | **±1 reference-контекст** (хвост пред-target + пред-source + след-source до границы сцены, НЕ переводится) | Кросс-граница trap-accuracy + **perturbation** (correct vs random context не должен совпасть); факторить prev-target/prev-source/next-source ОТДЕЛЬНО | +вход-токены (кэш); вопрос рендера (§D-7) | Претензия 2 near-term | Сейчас-ish |
|
||||
| 8 | **Кривая нарезки**: (0.75k/1.5k/3k/глава) × (жадная упаковка \| сцен-граница) на **retry-adjusted output-token cost**; бюджет в ВЫХОДНЫХ токенах (кириллица-фертильность Petrov) | Пре-регистрация: in/out/reasoning-токены, латентность, retry-rate ПО ПРИЧИНАМ, re-billed доля, coverage, слепое предпочтение, KPI-абзацы, trap-теги | Эксперимент | Обе + стоимость | Сейчас (диагностика) |
|
||||
| 9 | **Capability-vs-activation / model-floor 2×2** (слабая/сильная × текущий/дискурс-промпт) + **арм краткой инъекции правил** | Trap-closure на 2×2; фронтир-арм = диагностика потолка (модели vs организация); гарды D22.5 (эхо-скрин, self-family exclusion) | Фронтир $ (владелец согласовал) | Диагностика (потолок) | Сейчас |
|
||||
| 10 | **Автоматическая оценка качества (запрос владельца)**: претензия 1 = детерм. KPI (без судьи); претензия 2 = span-цитирующий билингв-судья + comprehension-QA (TREQA) + perturbation | Guard: leave-one-out, family-exclusion, per-call кап, **НИКОГДА не гейтить художественность на BLEU/COMET** (zh→ru инверсия WMT24); владелец кросс-чек ChatGPT+вручную | Судья-вызовы (кэш) | Инфра замера обеих | Сейчас |
|
||||
|
||||
### C2. НУЖНА Ф2-машинерия
|
||||
|
||||
| # | Механизм | Как измерить | Цена | Эффект → претензия | Фаза |
|
||||
|---|---|---|---|---|---|
|
||||
| 11 | **Running bilingual summary + реестр сущностей/антецедентов** (DelTA-класс) | exp09-memory-eval M2 + кросс-чанк trap; cache-friendly ordering | +1 малый вызов/~20 предл. (вход near-free при кэше) | Претензия 2 кросс-чанк | Ф2 (пере-взвесить vs COGS-депри research/15 — B2.3) |
|
||||
| 12 | **Chapter card** (сущности/связи/цель/место/время/нерешённые ссылки из 1 пред-чтения главы) | Кросс-чанк trap; сравнить с #11 (компактная ручная карта должна доказать лифт ДО авто-памяти) | 1 пред-чтение/глава | Претензия 2 | Ф2-lite (сходится с ChatGPT) |
|
||||
| 13 | **Пре-аннотация нулевых местоимений/кореференции** исходника | Trap-accuracy на ZP-кейсах | Аннотатор-пасс | Претензия 2 (zh-специфика) | Ф2 |
|
||||
| 14 | **Отдельный монолингв. РУССКИЙ reflow/repair-пасс** (DocRepair) vs комбинированный редактор | A/B: один редактор vs (билингв-семантика→target-only-reflow) под coverage-гейтом | +1 пасс (target-only дешевле) | Претензия 1 op(a) + связность | Ф2 / арм сейчас |
|
||||
|
||||
### C3. Архитектура (зона оркестратора/бэкенда — предложение, не приговор)
|
||||
|
||||
| # | Механизм | Как измерить/решить | Фаза |
|
||||
|---|---|---|---|
|
||||
| 15 | **Слой «пакет конвенций пары»** (идея владельца): контент = 5 ops Ван Цуй + русские нормы + Палладий; ключ (src→tgt[×жанр]); снапшот-фолд; **несёт ОГРАНИЧИТЕЛИ против инварианта полноты**; РАЗМЕР/ФОРМА (короткий указатель vs правилник vs few-shot) = исход арма #9/#1-2 | Reflow-промпт-армы #1-2 И ЕСТЬ проба размера/формы пакета; финальное размещение — оркестратор/бэкенд под доказанный ROI (Р2/D30.7) | Дизайн сейчас, стройка под ROI |
|
||||
|
||||
Рекомендую взять из ChatGPT-отчёта (не переизобретаю): two-stage eval (Stage I причинная проба на 6–8 ЛОВУШКАХ вместо «средних глав» / Stage II слепые 3 финалиста), «дискурсный пакет» как generation-unit, факторизацию трёх единиц.
|
||||
|
||||
---
|
||||
|
||||
## §D — Вопросы, на которые не хватило данных
|
||||
|
||||
1. **Где именно живёт опорный контекст провалов связности владельца** — в-чанке / пред / след / вся-глава / мир-знание? D35 даёт ~1.28 стыка/глава, но НЕ размечено. Без размеченного trap-набора нельзя выбрать между #7/#11/#12. (Флагаю и я, и ChatGPT.) — первично для полигона.
|
||||
2. **Магнитуда в РУССКИЙ.** Вся несущая внешняя эмпирика (Karpinska, DelTA, DocRepair, zero-pronoun) — into-English/EN→RU-экстраполяция; единственный zh→ru замер даст полигон (фронтир+дешёвый армы). Пометка обязательна на каждом клейме.
|
||||
3. **Размер/форма пакета конвенций (#15) = вопрос «способность vs активация»** — не решён до 2×2 (#9) + инъекц-армов (#1-2).
|
||||
4. **Коллизия слияния/эксплицитации с инвариантом полноты** на практике — semantic-atom-coverage vs sentence-count; нужен omission-guard-замер (#2/#5).
|
||||
5. **COGS running-summary при кэше** — стоит ли бенефит DelTA доп-вызова на наших ценах при cache-ordering (пере-взвесить депри research/15).
|
||||
6. **Retry-rate q(c) по типам провала на размер чанка** на живых дешёвых моделях — не замерено; нужно для retry-adjusted-кривой (#8).
|
||||
7. **Рендер: может ли runner подать соседний src/tgt как non-output reference** без нового persistent-домена? Определяет, #7 — это PROD-MINOR или Ф2 (вопрос бэкенду).
|
||||
8. **Владельцу:** допустимая степень синтакс-слияния/дробления; считается ли front-matter в художественную приёмку (из ChatGPT §D — решение владельца).
|
||||
|
||||
---
|
||||
|
||||
## §E — Источники (URL + дата + тип), несущие клеймы
|
||||
|
||||
Тип: **PR** peer-reviewed · **PP** preprint (не peer-review) · **STD** норм.-стандарт · **DOC** офиц./вендор-дока · **BLOG/OTH** блог/вторичное. Дата — публикация/доступ. Верификатор открывал ключевые (WebFetch); часть zh-источников по 403 — сверена сниппетами (помечено в §A/§B).
|
||||
|
||||
**Дискурс-гранулярность / doc-level (Ось 1):**
|
||||
- [PR 2023] Karpinska & Iyyer, *LLMs Effectively Leverage Document-level Context for Literary Translation*, WMT2023 — https://aclanthology.org/2023.wmt-1.41/ · arXiv https://arxiv.org/abs/2304.03245
|
||||
- [PR 2019] Voita et al., *When a Good Translation is Wrong in Context* (context-aware EN→RU; спутник DocRepair) — https://aclanthology.org/P19-1116/
|
||||
- [PR 2024] Liu et al., *Lost in the Middle* (TACL) — https://aclanthology.org/2024.tacl-1.9/
|
||||
- [PR 2021] G-Transformer for Doc-Level MT (ACL) — https://aclanthology.org/2021.acl-long.267/
|
||||
- [PP 2024-07] *Towards Chapter-to-Chapter Context-Aware Literary Translation* — https://arxiv.org/html/2407.08978
|
||||
- [PP 2025-04] *Multilingual Contextualization of LLMs for Doc-Level MT* (2504.12140; inverted-U, N=3 контекст) — https://arxiv.org/abs/2504.12140
|
||||
- [PP 2024-12] *Investigating Length Issues in Doc-Level MT* — https://arxiv.org/abs/2412.17592
|
||||
- [PP 2025-06] *Beyond the Sentence: Survey on Context-Aware MT with LLMs* — https://arxiv.org/abs/2506.07583
|
||||
|
||||
**Мультиагент/прайор-арт + fan/commercial:**
|
||||
- [PP 2024-05] TransAgents, *(Perhaps) Beyond Human Translation* (TACL-версия) — https://arxiv.org/abs/2405.11804
|
||||
- [PR 2024-10] DelTA (ICLR 2025; multi-level memory, running summary) — https://arxiv.org/abs/2410.08143 · https://openreview.net/forum?id=hoYFLRNbhc
|
||||
- [PP 2024-12] DRT, *Deep Reasoning Translation via long CoT* — https://arxiv.org/abs/2412.17498
|
||||
- [PR 2023] GuoFeng-Webnovel (zh↔ru/de, V2 без sent-align) — https://github.com/longyuewangdcu/GuoFeng-Webnovel
|
||||
- [DOC 2024] py3TranslateLLM (LLM=paragraph, NMT=line) — https://github.com/gdiaz384/py3TranslateLLM · [DOC 2026-07] DeepL split_sentences — https://developers.deepl.com/api-reference/translate · [VEND 2023] DeepL context param — https://www.deepl.com/en/blog/deepl-api-context-parameter · [VEND 2026] TeaNovel (consistency drift; full-chapter) — https://read.teanovel.com/blog/how-to-translate-chinese-novels-with-ai
|
||||
|
||||
**Претензия 1 — русские нормы + reflow-механика:**
|
||||
- [DOC 2026-07] Розенталь §47 прямая речь — http://old-rozental.ru/punctuatio.php?sid=155 · §52 диалог — http://old-rozental.ru/punctuatio.php?sid=160 · §50 слова автора — https://evartist.narod.ru/text1/52.htm
|
||||
- [STD 1956] Правила русской орфографии и пунктуации, знаки при прямой речи — https://gramota.ru/biblioteka/spravochniki/pravila-russkoj-orfografii-i-punktuacii/znaki-pri-pryamoj-rechi · [DOC 2026-07] Грамота, оформление диалога — https://gramota.ru/uchebnik/pravila/oformlenie-dilaoga
|
||||
- [OTH 2026-07] Абзац как логико-смысловая единица — Текстология.ру — https://www.textologia.ru/russkiy/sintaksis/stroenie-texta/abzac-kak-chast-teksta-i-ego-funkcii/646/ · Абзац (по Мильчину) — https://rus-stylistics-dict.slovaronline.com/1-%D0%90%D0%B1%D0%B7%D0%B0%D1%86
|
||||
- [OTH 2026-07] Chinese punctuation (полн. пунктуация, 引号, -отступ) — https://en.wikipedia.org/wiki/Chinese_punctuation
|
||||
- [PR 2022] Structural Persistence in LMs (priming) — https://aclanthology.org/2022.tacl-1.60/ · [PR 2024] Sensitivity to Spurious Prompt Features (Sclar) — https://arxiv.org/abs/2310.11324 · [PR 2024] FollowBench — https://arxiv.org/abs/2310.20410
|
||||
- [PP 2026-01] *Semantic Gravity Wells: Why Negative Constraints Backfire* (опора гипотезы негатив-констрейнта — REFUTED как главная причина) — https://arxiv.org/abs/2601.08070
|
||||
- [PP 2025-10] *Decoupling Task-Solving and Output Formatting* — https://arxiv.org/abs/2510.03595
|
||||
|
||||
**Претензия 2 — связность/zh-специфика + лекарства:**
|
||||
- [PP 2026-05] *How Much Do LLMs Know About Chinese Zero Pronouns?* (zh→en, <50% ZP базово, oracle +40) — https://arxiv.org/abs/2605.31056 · [PP 2023] Survey on Zero Pronoun Translation — https://arxiv.org/abs/2305.10196
|
||||
- [PR 2024] MAPS, *Exploring Human-Like Translation Strategy* (аннотатор) — https://arxiv.org/abs/2305.04118
|
||||
- [PR 2025] TEaR self-refine — https://aclanthology.org/2025.findings-naacl.218/ · [PP 2026-05] *What Does LLM Refinement Actually Improve? Doc-Level* (2605.13368; моно −2.2…−5.6 MQM) — https://arxiv.org/abs/2605.13368 · [PP 2024-02] *LLM Amplifies Self-Bias in Self-Refinement* — https://arxiv.org/abs/2402.11436
|
||||
- [PP 2025-03] *Source-primed Multi-turn Conversation Helps LLMs Translate Documents* — https://arxiv.org/abs/2503.10494
|
||||
|
||||
**zh↔ru контрастивная лингвистика (прямые/близкие):**
|
||||
- [PR 2024] **Ван Цуй, «Анализ китайских паратактических предложений и их перевода на русский язык», Вестник (Теория перевода)** — 5 техник — https://vestnik-translation.ru/articles/article/20081/ · [PR 2023] интерференция при переводе кит. лит-ры на русский (De Gruyter, cjss-2023-0017) — https://www.degruyterbrill.com/document/doi/10.1515/cjss-2023-0017/html
|
||||
- [OTH 2022] Application of Hypotaxis/Parataxis in C-E Translation (意合/形合, Lian Shuneng) — https://www.davidpublisher.com/Public/uploads/Contribute/620da97031d45.pdf · [OTH 2023] English Translation Strategies for Chinese Run-on (流水句) — https://www.davidpublisher.com/Public/uploads/Contribute/654354525d198.pdf · [PR 2011] xinghe/yihe (Perspectives) — https://www.tandfonline.com/doi/abs/10.1080/0907676X.2010.514347
|
||||
- [PR 2011] Topic-Comment in Mandarin (Li & Thompson) — https://www.researchgate.net/publication/235852523 · [OTH 2005] Курдюмов, теор. грамматика (топик-комментарий) — https://www.studmed.ru/kurdyumov-v-a-kurs-kitayskogo-yazyka-teoreticheskaya-grammatika_1d9fe4a728b.html
|
||||
- [PP 2025-11] *Predicate-Argument Divergences in Chinese-English* (кит. +24% глаголов) — https://arxiv.org/abs/2511.09796 · [OTH 2026-07] Chengyu (96% четырёхзнак.) — https://en.wikipedia.org/wiki/Chengyu
|
||||
|
||||
**Измерение качества:**
|
||||
- [PP 2025-04] TREQA (comprehension-QA eval) — https://arxiv.org/html/2504.07583v3 · [PR 2025] LITEVAL-CORPUS (MQM плох, BWS/SQ лучше) NAACL — https://aclanthology.org/2025.naacl-long.548/ · [PR 2023] GEMBA-MQM — https://aclanthology.org/2023.wmt-1.64/ · [PR 2024] xCOMET — https://aclanthology.org/2024.tacl-1.54/ · [PR 2024] ESA — https://aclanthology.org/2024.wmt-1.131/
|
||||
- [PP 2026-05] *Nine Judges, Two Effective Votes* (корр. судьи) — https://arxiv.org/pdf/2605.29800 · [PP 2026-05] *Creativity Bias* (метрики против художественности) — https://arxiv.org/html/2605.13596 · [BLOG 2026-04] LLM-judge length/position/format bias — https://tianpan.co/blog/2026-04-27-llm-judge-bias-audit-length-position-format
|
||||
|
||||
**Стоимость / нарезка:**
|
||||
- [PR 2023] Petrov et al., *LM Tokenizers Introduce Unfairness Between Languages* (кириллица-фертильность) — https://arxiv.org/pdf/2305.15425 · [BLOG 2023] интерактив — https://aleksandarpetrov.github.io/tokenization-fairness/
|
||||
- [DOC 2024] DeepSeek Context Caching (cache-hit ~2% miss) — https://api-docs.deepseek.com/guides/kv_cache/ · pricing — https://api-docs.deepseek.com/quick_start/pricing
|
||||
- [PP 2024-09] LongGenBench (output ~3–4k стабилен) — https://arxiv.org/html/2409.02076v7
|
||||
|
||||
**Метрика-инверсия zh→ru (§A4.3 — теперь с URL):**
|
||||
- [PR 2024-12] *Findings of WMT24 Discourse-Level Literary Translation* — https://arxiv.org/abs/2412.11732 · task page — https://www2.statmt.org/wmt24/literary-translation-task.html · [BLOG 2025] разбор d-BLEU/стоимости — https://gonzoml.substack.com/p/perhaps-beyond-human-translation
|
||||
|
||||
*(Полный список 125 верифицированных URL — в артефактах ресёрч-воркфлоу сессии; здесь — несущее подмножество.)*
|
||||
|
||||
**Errata источников (испр. оркестратором, D36):**
|
||||
- **DocRepair — расщепить с P19-1116.** Числа §A4.8/§B2.4 (deixis 50.0→91.8, когезия 45.9→80.6, эллипсис 53.0→86.4, 73% предпочтения) — из [PR 2019] Voita, Sennrich, Titov, *Context-Aware Monolingual Repair for NMT* (DocRepair), EMNLP-IJCNLP 2019 — https://aclanthology.org/D19-1081/ · arXiv https://arxiv.org/abs/1909.01383. Процитированная выше P19-1116 (ACL 2019) — статья-спутник, из неё число CADec 50.0→81.6 (§A3). Обе авторства одного трио; числа верны, атрибуция расщеплена.
|
||||
- **TransAgents** — arXiv 2405.11804 = *(Perhaps) Beyond Human Translation* (accepted-but-preprint, «To appear at TACL»; §A-метка «TACL-версия» и §E-метка «PP 2024-05» — об одной статье, оставить одну). Это ОТДЕЛЬНАЯ статья от EMNLP-Demo 2024 `2024.emnlp-demo.14` (*Build Your Translation Company…*), процитированной параллельным ChatGPT-отчётом — не конфликт, две реальные статьи об одной системе.
|
||||
- **Z5** — RG 235852523 = Dingxu Shi, *Topic and Topic-Comment Constructions in Mandarin Chinese* (Language 76(2), 2000), НЕ Li & Thompson (их канон — *Subject and Topic* 1976 / *A Functional Reference Grammar* 1981). Клейм топик-комментария верен; автор-метка исправлена.
|
||||
- **Z8 / R4 / R5 / P2 / CO5** — источники реальны, атрибуция частична: «96% чэнъюй» на цит. Wikipedia отсутствует (там «most»); -отступ/«короткие абзацы» — не на цит. Chinese-punctuation-стр. (конвенции реальны, стр. неточна); Structural-Persistence (TACL 2022) изучает СИНТАКСИЧЕСКИй прайминг, не копирование line-структуры (экстраполяция, отчёт помечает PLAUSIBLE); FollowBench (ACL 2024, не просто препринт) документирует ДЕГРАДАЦИю следования при накоплении констрейнтов — не «надёжный рычаг few-shot»; 2504.12140 подтверждает «мелкие инстракт-модели деградируют с ростом чанка», но «перевёрнутая-U / N=3-оптимум» — переформулировка (N=3 — фикс-конфиг, не найденный оптимум). Ни одна не рушит §C-арм — все меряются полигоном эмпирически.
|
||||
|
||||
---
|
||||
|
||||
<!-- Отчёт готов к адверсариальной верификации оркестратора по первоисточникам. §A заморожена (sha256 44f90364…); §B/§C/§D/§E — пост-дифф. Не коммитить — лендит оркестратор (как research/15/16/17). -->
|
||||
|
||||
Loading…
Add table
Reference in a new issue