288 lines
61 KiB
Markdown
288 lines
61 KiB
Markdown
# Рычаги минимально-художественного zh→ru: независимый доклад ChatGPT
|
||
|
||
<!-- ─────────────────────────────────────────────────────────────────────────
|
||
ОРКЕСТРАТОР — РЕВЬЮ-ШАПКА (лендинг, D36, 12.07 №4). Тело не переписано. Полный разбор —
|
||
PROGRESS §лендинг D36 + D-лог D36.
|
||
|
||
ВЕРДИКТ: **ACCEPT** (одна минорная привязка при графтинге в промт полигона).
|
||
|
||
НЕЗАВИСИМАЯ ВЕРИФИКАЦИЯ (тот же 26-агентный воркфлоу, первоисточники, $0):
|
||
- **Цитатно-чист на всех спот-чеках** — Thai/Par3 (EMNLP 2022, `2022.emnlp-main.672`),
|
||
Mohammed & Niculae (Findings EACL 2024, `2024.findings-eacl.113` — perturbation
|
||
correct-vs-random), Herold & Ney, Hu & Wan, Jiang/BWB, Jwalapuram, DelTA, TransAgents
|
||
(EMNLP-Demo `2024.emnlp-demo.14`) — все существуют, атрибуция аккуратна.
|
||
- **Хеджирование дисциплинировано** — внешняя эмпирика последовательно помечена «не zh→ru»;
|
||
инженерные клеймы — PLAUSIBLE; 80%-порог ловушек — «предложение для пре-регистрации, не факт».
|
||
Ни одного CONFIRMED-который-на-деле-экстраполяция не найдено. Самый скептичный из двух
|
||
отчётов к системным клеймам (TransAgents прямо назван «vendor-like»).
|
||
- **§C — наиболее прямо-исполнимый скелет полигон-сессии** из двух: явный P0 чистый baseline
|
||
→ армы с фаза-тегами P0–P4 → C4 пре-регистрированные метрики/гейты → C5 дерево решений →
|
||
C3 точное ядро дискурс-reflow-промпта. Покрывает ВСЕ мандатные оси D35.6.
|
||
|
||
ДВЕ ОГОВОРКИ ПРИ ГРАФТИНГЕ (учтены в промте полигона D36):
|
||
1. **§A-заморозка НЕ воспроизводима из документа.** sha256 `b42c6f6e…` заявлен только в прозе
|
||
§B0; в файле — плейсхолдер `<!-- A_SHA256_PLACEHOLDER -->` без BEGIN/END байт-маркеров →
|
||
пересчитать нельзя. Прогон внешний (владелец) → заморозка **аттестована, но не крипто-
|
||
верифицируема** (в отличие от Claude-отчёта, чей хеш сверен MATCH). На вес «двойной заморозки
|
||
сходимости» — дисконт; содержательное качество/самосогласованность отчёта этим НЕ затронуты.
|
||
2. **Свежий fidelity-гейт §C4 не ссылается на мандатный re-gate D34.3** (`rerun/FIDELITY_REGATE_HANDOFF.md`
|
||
+ `rerun-parallel.txt`) — сессия его не читала. При графтинге брать D34.3-пакет как канон
|
||
верности, §C4-гейт — как совместимую детализацию.
|
||
|
||
РЕКОМЕНДАЦИЯ ЛЕНДИНГА (обе стороны сами это предлагают): §C ChatGPT = скелет протокола +
|
||
графт zh→ru-контента Ван Цуй в reflow-промпт + COGS-модель + привязка D34.3 из Claude-отчёта.
|
||
Реализовано в `POLYGON_QUALITY_EMPIRICS_SESSION_PROMPT.md`.
|
||
───────────────────────────────────────────────────────────────────────────── -->
|
||
|
||
Дата исследования: 2026-07-11. Роль: независимый ресёрчер; код и общие документы репозитория не изменялись.
|
||
|
||
Статусы доказательности:
|
||
|
||
- **CONFIRMED** — утверждение прямо поддержано первичным источником или наблюдением над разрешённым сырьём;
|
||
- **PLAUSIBLE** — инженерная гипотеза, совместимая с данными, но требующая локального A/B-замера;
|
||
- **REFUTED** — локальные данные или первичный источник противоречат утверждению.
|
||
|
||
## §A. Чистый лист: независимая карта «проблема → механизм»
|
||
|
||
> **FREEZE MARKER A — 2026-07-11.** Этот раздел составлен до чтения `05-decisions-log.md`, `research/07`, `research/15`, `research/16` и материалов exp04/12/13. После фиксации SHA-256 раздел не редактируется. Все дальнейшие сопоставления находятся только в §B–§D.
|
||
|
||
### A1. Что непосредственно видно в текущем прогоне
|
||
|
||
**CONFIRMED.** Текущий сегментатор жадно упаковывает целые исходные абзацы примерно до 1 500 оценочных токенов; только сверхдлинный абзац делится по предложениям. Контекст предыдущего/следующего чанка в `Chunk` не переносится. Переводчик получает один `{{text}}`; редактор — тот же исходный чанк и его черновик. Источник: локальные `backend/internal/pipeline/chunker.go`, `backend/prompts/translator.md`, `backend/prompts/editor.md`, прочитаны 2026-07-11.
|
||
|
||
**CONFIRMED.** Оба промпта уже требуют русской вёрстки, запрещают копировать построчную разбивку и предписывают начинать прямую речь с нового абзаца. Следовательно, версия «достаточно добавить одну инструкцию про абзацы» опровергается текущей конфигурацией: такая инструкция уже есть, а претензия владельца сохранилась. Источник: локальные промпты выше и вердикт владельца в сессионном задании, 2026-07-11.
|
||
|
||
**CONFIRMED (описательная метрика, не оценка качества).** В `rerun-ru.txt` грубое разбиение по пустым строкам даёт 1 754 блока, из которых 1 671, или около 95,3%, состоят из одной непустой строки. Выборочная проверка начала, середины и конца показывает устойчивую дробность повествования наряду с корректным выделением многих реплик. Метрика намеренно не объявляется нормой художественности: короткий абзац может быть стилистически оправдан. Источники: локальные `/home/ubuntu/books/gu-zhenren/rerun/rerun-ru.txt` и `/home/ubuntu/books/gu-zhenren/rerun/records.json`, только чтение, 2026-07-11.
|
||
|
||
**PLAUSIBLE.** Основная ошибка организации — не «слишком маленький чанк» как таковой, а смешение трёх разных единиц: (1) единицы покрытия, (2) единицы смыслового контекста, (3) единицы целевой композиции. Нынешний фиксированный бюджет определяет все три сразу. Это объясняет, почему полнота может быть хорошей, а русская макрокомпозиция и дальние связи — слабее. Нужен факторный эксперимент, потому что наблюдение одного прогона причинность не устанавливает.
|
||
|
||
### A2. На какой гранулярности переводить
|
||
|
||
**CONFIRMED.** Для литературного LLM-перевода перевод целого исходного абзаца за один вызов превосходил перевод предложение-за-предложением по человеческой разметке на 18 языковых парах: было меньше смысловых, грамматических и стилистических ошибок. Это peer-reviewed WMT 2023, но не zh→ru и не тест текущих дешёвых моделей, поэтому переносимость результата ограничена. Источник: Karpinska & Iyyer, [Large Language Models Effectively Leverage Document-level Context for Literary Translation, but Critical Errors Persist](https://aclanthology.org/2023.wmt-1.41/), опубликовано 2023-12, доступ 2026-07-11.
|
||
|
||
**CONFIRMED.** В литературном MT абзац является практически значимой единицей данных и оценки: корпус Par3 выровнен по абзацам; эксперты предпочитали человеческие варианты машинным в 84% сравнений, а обученный post-editor — обычному MT в 69%. Автоматические метрики не коррелировали с экспертными предпочтениями. Это аргумент за абзац/микросцену и человеческий blind preference как минимум, но не доказательство конкретной схемы zh→ru. Источник: Thai et al., [Exploring Document-Level Literary Machine Translation with Parallel Paragraphs from World Literature](https://aclanthology.org/2022.emnlp-main.672/), EMNLP 2022, доступ 2026-07-11.
|
||
|
||
**CONFIRMED.** Простое увеличение контекста до всего документа не является монотонным улучшением: работа по long-context DocMT указывает и рост памяти, и деградацию качества при расширении контекста; типичный локальный контекст — одно-два предыдущих предложения, чего может не хватать для темы и стиля. Источник: Herold & Ney, [Improving Long Context Document-Level Machine Translation](https://aclanthology.org/2023.codi-1.15/), CODI/ACL 2023, доступ 2026-07-11.
|
||
|
||
**CONFIRMED.** Фиксированная длина плохо отражает дискурсную структуру. Paragraph-to-paragraph режим и явная RST-структура дали улучшения над прежними DocMT-подходами в peer-reviewed исследовании, хотя архитектурные результаты NMT нельзя напрямую переносить на prompting закрытой LLM. Источник: Hu & Wan, [Exploring Discourse Structure in Document-level Machine Translation](https://aclanthology.org/2023.emnlp-main.857/), EMNLP 2023, доступ 2026-07-11.
|
||
|
||
**Вывод A2 — PLAUSIBLE.** Для текущей фазы минимальная разумная единица генерации — не предложение и не глава, а **дискурсный пакет**: один или несколько смежных исходных абзацев, образующих локальный ход/эпизод, с защищёнными границами сцены. Основной текст пакета переводится целиком; вокруг него подаётся компактный reference-context, который не надо переводить. Глава нужна как область предварительного чтения и извлечения опор, а не обязательно как единый output-вызов. Оптимум размера следует измерять, а не объявлять заранее.
|
||
|
||
### A3. Претензия 1: русские абзацы и литературные конвенции
|
||
|
||
**CONFIRMED.** Исходная и целевая дискурсные структуры у человеческих и машинных переводов различаются, а предложение-уровневые метрики не покрывают сущности, терминологию, кореференцию и кавычки. Источник — размеченный корпус китайско-английских романов BWB; это близкий по исходному языку, но не русскому, evidence. Jiang et al., [Discourse-Centric Evaluation of Document-level Machine Translation with a New Densely Annotated Parallel Corpus of Novels](https://aclanthology.org/2023.acl-long.435/), ACL 2023, доступ 2026-07-11.
|
||
|
||
**PLAUSIBLE.** Нужна не ещё одна абстрактная команда «собери естественные абзацы», а наблюдаемая целевая операция:
|
||
|
||
1. сначала определить внутри пакета дискурсные ходы (кто воспринимает/говорит, действие, реакция, смена времени/места/фокала);
|
||
2. затем сформировать русские абзацы вокруг этих ходов, отдельно соблюдая оформление диалога;
|
||
3. только потом провести проверку покрытия по исходным атомам.
|
||
|
||
Эту операцию можно реализовать одним вызовом через краткий скрытый план и финальный текст либо отдельным layout/polish-проходом. Какой вариант лучше для дешёвой модели — вопрос A/B, а не установленный факт.
|
||
|
||
**PLAUSIBLE.** Few-shot должен показывать именно требуемое преобразование структуры: 2–3 коротких zh→ru примера «много однофразовых исходных строк → один естественный повествовательный абзац», «повествование → отдельная реплика → авторская ремарка», «смена фокала → новый абзац». Простой положительный пример проверяется отдельно от длинного списка negative constraints. Причина: текущая словесная инструкция не сработала; демонстрация задаёт форму результата. Прямого peer-reviewed замера именно русской перевёрстки в найденных источниках нет.
|
||
|
||
**PLAUSIBLE.** Отдельный target-only layout-пасс потенциально дешевле повторного bilingual editor-пасса: он получает только русский текст и задачу укрупнить/разделить абзацы без перефразирования. Но он не исправляет причинную связность и может закрепить смысловую ошибку; поэтому это узкий рычаг для претензии 1, не универсальное лечение.
|
||
|
||
**PLAUSIBLE.** Одновременный мандат редактора «сверить смысл + исправить реалии + выдержать глоссарий + улучшить стиль + реконструировать абзацы + ничего не добавить/удалить» создаёт конкуренцию критериев у слабой модели. Дешёвый тест — разделить semantic revision и target-language paragraph/style polish; дорогой — оставить один сильный editor. Ни «CoT всегда помогает», ни «negative constraints всегда вредят» без локального замера не утверждается.
|
||
|
||
### A4. Претензия 2: связи и смысл на дистанции
|
||
|
||
**CONFIRMED.** Контекстные ошибки требуют специальных измерений: sentence-level BLEU может почти не замечать анафору, связность и лексическую когезию. Литература предлагает отдельные тесты для местоимений/кореференции и документные метрики когезии. Источники: Jwalapuram et al., [Evaluating Pronominal Anaphora in Machine Translation](https://aclanthology.org/D19-1294/), EMNLP 2019; Libovický et al., [Machine Translation Evaluation beyond the Sentence Level](https://aclanthology.org/2018.eamt-main.18/), EAMT 2018; доступ 2026-07-11.
|
||
|
||
**CONFIRMED.** DelTA использует не «всю книгу в промпте», а четыре специализированные памяти: записи имён, двуязычное резюме, long-term retrieval и short-term контекст. В ICLR 2025 заявлены средние улучшения до 3,16 COMET и до 4,58 процентного пункта consistency; система переводит по предложениям ради полноты. Это peer-reviewed DocMT, но не литературная zh→ru оценка и не доказательство необходимости всех четырёх компонентов. Источник: Wang et al., [DelTA: An Online Document-Level Translation Agent Based on Multi-Level Memory](https://proceedings.iclr.cc/paper_files/paper/2025/hash/285149554f6fbed6e2f9ec72d131bd23-Abstract-Conference.html), ICLR 2025, доступ 2026-07-11.
|
||
|
||
**CONFIRMED, но vendor-like/системный claim.** TransAgents организует литературный перевод как роли редактора, переводчика, локализатора и корректора с циклом проверки; опубликованный demo-paper сообщает человеческие предпочтения и низкую относительно человека цену. Это prior art организации, но его сильные маркетинговые формулировки нельзя считать независимым доказательством превосходства, а многоагентность сама по себе не изолирована как причина. Источник: Wu et al., [TransAgents: Build Your Translation Company with Language Agents](https://aclanthology.org/2024.emnlp-demo.14/), EMNLP Demo 2024, доступ 2026-07-11.
|
||
|
||
**PLAUSIBLE.** Максимум эффекта при минимуме стройки даст не полноценная агентная память, а следующий порядок армов:
|
||
|
||
1. **look-behind:** предыдущий русский абзац + соответствующий китайский хвост как read-only reference;
|
||
2. **look-ahead:** следующий китайский абзац/до границы сцены, помеченный «не переводить», чтобы снять катафору и неоднозначность текущей фразы;
|
||
3. **chapter card:** краткие сущности, отношения, текущая цель/локация/время и нерешённые референсы, извлечённые одним предварительным чтением главы;
|
||
4. только затем retrieval/долгая память и отдельный аннотатор связей.
|
||
|
||
Порядок — инженерная гипотеза по цене строительства. Look-ahead особенно важен для китайского нулевого подлежащего, но величина эффекта именно zh→ru не подтверждена найденным контролируемым исследованием.
|
||
|
||
**PLAUSIBLE.** Глоссарий лечит стабильность именования, но не заменяет модель ситуации: одинаково написанное имя не разрешает, кто что сделал, почему персонаж реагирует и к чему относится опущенное подлежащее. Поэтому в полигоне терминологическая consistency и causal/coreference comprehension должны быть разными исходами.
|
||
|
||
**PLAUSIBLE.** Сильная модель может одновременно улучшить локальный русский и рассуждение, но arm «модель сильнее» без одинакового контекста не отвечает, где потолок — в модели или организации. Нужен 2×2: слабая/сильная модель × текущий/дискурсный контекст. Если контекст помогает обеим, проблема частично организационная; если только сильная проходит смысловые ловушки, есть model floor.
|
||
|
||
### A5. Кривая «размер чанка ↔ качество ↔ биллинг ↔ ретраи»
|
||
|
||
**CONFIRMED как бухгалтерская рамка, не как эмпирическая кривая.** Для главы из `S` исходных токенов, чанка полезной длины `c`, фиксированного prompt/reference overhead `h`, коэффициента выходных токенов `r` и цен `p_in`, `p_out` ожидаемая цена без ретраев грубо равна:
|
||
|
||
`C(c) ≈ ceil(S/c) · h · p_in + S · p_in + rS · p_out`.
|
||
|
||
Значит, при прочих равных рост `c` уменьшает повторяемый overhead. Это арифметика; она не говорит, что качество растёт.
|
||
|
||
**PLAUSIBLE.** С ретраями цена становится нелинейной. Если вероятность неуспеха чанка `q(c)` и весь вызов повторяется до успеха, множитель ожидаемых попыток — `1/(1-q(c))`; ожидаемо повторно оплачивается весь `h+c+rc`. Даже если число вызовов падает, большие чанки дороже терять при timeout/refusal/excision. Реальная `q(c)` должна быть измерена по типам отказа, а не подогнана общей долей retry.
|
||
|
||
**PLAUSIBLE.** Качество вероятно имеет внутренний оптимум: слишком малый `c` режет дискурс и размножает prompt overhead; слишком большой `c` размывает релевантный контекст, затрудняет контроль полноты и повышает ущерб одного сбоя. Исследование long-context DocMT подтверждает возможность деградации при расширении контекста, но форму кривой для этого пайплайна надо пререгистрировать и измерить. Источник: Herold & Ney 2023, ссылка в A2, доступ 2026-07-11.
|
||
|
||
**Предрегистрация A5 — PLAUSIBLE.** Сравнить не только размеры 0,75k / 1,5k / 3k / «глава», но и две политики границ при сопоставимом бюджете: фиксированная упаковка против scene/discourse-aware упаковки. На каждом арме сохранять: вход/выход токены, latency, долю и причину ретраев, долю повторно оплаченных токенов, полноту, blind reader preference, paragraph score и размеченные coreference/causal traps. Иначе размер будет спутан с качеством границ.
|
||
|
||
### A6. Оси, которые легко пропустить
|
||
|
||
**PLAUSIBLE — структурная утечка через черновик.** Редактор видит дробный черновик, который становится сильной формальной подсказкой, тогда как абстрактная инструкция просит его форму разрушить. Arm «редактор видит тот же текст без пустых строк/с ID смысловых атомов» отделит якорение на layout черновика от неспособности модели к русской композиции.
|
||
|
||
**PLAUSIBLE — конфликт полноты и естественной композиции.** Формула «не выбрасывай и не добавляй предложения» полезна для покрытия, но может восприниматься как требование сохранять предложение-к-предложению и мешать слиянию/членению русских предложений. Следует сохранять **смысловые атомы**, а не число предложений: пронумеровать атомы только для внутренней проверки, разрешив объединять и делить предложения в финале. Это должно пройти отдельный coverage gate.
|
||
|
||
**PLAUSIBLE — мусор до романа портит style prior.** Первый чанк содержит метаданные, обзор, интернет-ссылку и предисловие, а не однородную художественную сцену. Общий genre prompt не различает front matter, авторское предисловие и роман. Классификация типа блока до перевода может предотвратить перенос регистров и бессмысленную «литературизацию» служебного текста.
|
||
|
||
**PLAUSIBLE — направление контекста важно.** Только прошлое помогает последовательности, но не всегда пониманию текущей китайской эллиптики; только будущее рискует спойлерным перефразированием. Поэтому previous-target, previous-source и next-source надо факторизовать, а не объединять сразу в один «context arm».
|
||
|
||
**CONFIRMED.** Правильность контекстного метода нельзя заключать из общего score: perturbation test с корректным против случайного контекста показывает, использует ли система именно опорный контекст. Источник: Mohammed & Niculae, [On Measuring Context Utilization in Document-Level MT Systems](https://aclanthology.org/2024.findings-eacl.113/), Findings of EACL 2024, доступ 2026-07-11.
|
||
|
||
**PLAUSIBLE — оценщик должен разделять читателя и билингва.** Русскоязычный читатель способен оценить ритм, абзацы и естественность, но не диагностирует тихое искажение; билингв — смысл и связи, но может терпеть translationese. Минимальный полигон требует двух независимых рубрик и запрета показывать arm/model judge-у.
|
||
|
||
**REFUTED как универсальный тезис.** «Больше агентов автоматически означает лучше» не следует из prior art: TransAgents демонстрирует целую систему, DelTA — специализированную память, а paragraph-level LLM уже улучшал результат без агентного оркестра. Сначала следует покупать информацию (границы, соседний контекст, chapter card), затем роли и циклы.
|
||
|
||
### A7. Независимая карта причин и минимальных вмешательств
|
||
|
||
| Наблюдаемая проблема | Вероятный механизм | Самый дешёвый различающий тест | Что не считать доказательством |
|
||
|---|---|---|---|
|
||
| Почти каждый ход остаётся отдельным абзацем | Якорение на layout исходника/черновика; инструкция без демонстрации; перегруженный editor mandate | layout few-shot; draft без пустых строк; отдельный target-only reflow | Снижение числа абзацев само по себе |
|
||
| Связь ломается внутри чанка | Модель не строит локальную ситуацию; противоречивый/перегруженный мандат | semantic-first editor с явными entity/action/reason checks | Более гладкий русский без сверки смысла |
|
||
| Связь ломается на границе чанков | Нет previous/next reference; граница не совпадает со сценой | ±1 абзац reference и scene-aware boundary | Увеличение токенов без релевантного контекста |
|
||
| Теряются дальние сущности/цели | Нет chapter/book state | краткая chapter card против glossary-only | Единообразное имя при неверной кореференции |
|
||
| Сильный стиль ценой пропуска | Свободный polish без атомарного coverage | atom IDs + post-check, разрешив русское split/merge | Совпадение числа предложений |
|
||
| Большие чанки нестабильны/дороги | Растёт payload одного сбоя и нерелевантный контекст | size sweep с раздельным учётом retry causes | Средняя цена успешного вызова без ретраев |
|
||
| Непонятно, виновата модель или пайплайн | Model/context confounding | 2×2 model strength × discourse context | Сравнение разных моделей на разных промптах |
|
||
|
||
**Итог §A — PLAUSIBLE.** Наиболее вероятный короткий путь к «минимально художественно» — не перевод всей главы и не многоагентная стройка, а дискурсно ограниченный пакет + небольшой соседний reference-context + few-shot русской перекомпоновки + раздельная смысловая и монолингвальная оценка. Первый полигон должен определить, достаточна ли текущая модель; не предполагать это заранее.
|
||
|
||
<!-- A_SHA256_PLACEHOLDER -->
|
||
|
||
## §B. Дифф после чтения внутреннего стека
|
||
|
||
### B0. Целостность анти-анкоринга
|
||
|
||
§A был записан отдельным снимком до чтения командных гипотез. SHA-256 этого A-only снимка: `b42c6f6e6dc06ec48f3472714ac2b9ca5eba0135fba204113e2628a36eacee99`. После этого прочитаны карта актуальности и D26/D30–D35 в `docs/architecture/05-decisions-log.md`, раздел «Промптинг литперевода» в `docs/research/15-voice-and-state.md`, `docs/research/07-translation-methodology.md`, exp04/12/13 и `docs/research/16-reader-ide-alignment.md`. §A после чтения не изменялся.
|
||
|
||
### B1. Где независимая карта сошлась с командой
|
||
|
||
**CONFIRMED — команда угадала корень первого слоя.** §A независимо установил, что словесная reflow-инструкция уже есть, но результата не гарантирует; D35 независимо подтверждает на боевом снимке, что reflow действительно применялся, редактор был активен, а выход всё равно зеркалил рубленость источника. Значит, это не stale-конфиг и не пассивный mono-editor. Источники: локальный `docs/architecture/05-decisions-log.md`, D35.1, и текущие промпты, прочитаны 2026-07-11.
|
||
|
||
**CONFIRMED — команда уже сделала верный флип mono→bilingual.** Exp12 показал механическую пассивность mono-режима и структурную невозможность исправить 磕头/派/时辰 без исходника; D30 ратифицировал bilingual editor. Это полностью совпало с §A4: target-only polish не лечит смысл. Источники: локальные `docs/experiments/12-quality-diagnosis.md` §2.2/§2.5 и `docs/architecture/05-decisions-log.md` D30.1, прочитаны 2026-07-11.
|
||
|
||
**CONFIRMED — команда уже развела глоссарий и понимание ситуации.** D30.8/D35.4 различают термины, которые можно засидить сейчас, и «модель не следит за сюжетом», относимое к состоянию/памяти. Это совпадает с §A4. Источники: локальный D-лог, D30.8/D35.4, 2026-07-11.
|
||
|
||
**CONFIRMED — команда уже не считает жёсткую 1:1 структуру целью.** Research/16 показывает легитимный N:M, русскую норму тире-абзацев и рекомендует детектировать, а не форсировать парность. Это совместимо с §A3/A6: проверять смысловые атомы, не число предложений/абзацев. Источник: локальный `docs/research/16-reader-ide-alignment.md` §2.1–§2.5, прочитан 2026-07-11; внешний якорь: Karpinska & Iyyer, [WMT 2023](https://aclanthology.org/2023.wmt-1.41/), доступ 2026-07-11.
|
||
|
||
**CONFIRMED — команда уже знает, что модель/промпт нельзя оценивать общим скаляром.** Exp12/13 разделили стиль и верность, но ревью D30/D32 вскрыло ложные «единогласия», коррелированные сигналы и катастрофы победителей. Предлагаемый в §A 2×2 и отдельные traps продолжают именно эту исправленную методику. Источники: локальный D-лог D30/D32 и exp12/13, прочитаны 2026-07-11.
|
||
|
||
**CONFIRMED — prompt-format prior art уже покрыт research/15.** Формат, позиция, сэндвич, few-shot-раскол по моделям, lost-in-middle и опасность ручного CoT уже исследованы. Поэтому данный доклад не рекомендует универсальный XML/CoT-рецепт и не дублирует этот обзор. Источник: локальный `docs/research/15-voice-and-state.md` §3.1–§3.3, прочитан 2026-07-11.
|
||
|
||
### B2. Что в §A есть сверх текущей карты команды
|
||
|
||
**PLAUSIBLE — независимое разведение трёх единиц.** В D35 главная ось сформулирована как «нарезка × промпт» и кандидаты `draft=чанк/edit=глава`. §A добавляет обязательное различение: coverage atom ≠ generation unit ≠ reference-context span. Глава может быть областью чтения/извлечения опор, не единым completion. Это предотвращает ложный выбор «1,5k или вся глава».
|
||
|
||
**PLAUSIBLE — якорение редактора на форме draft как отдельная причина.** Командные документы обсуждают исходную построчность и ненадёжность reflow, но не изолируют arm, где редактор получает тот же черновик без пустых строк/с нейтральными атомарными ID. Если такой arm резко улучшит абзацы при той же модели и промпте, менять размер чанка преждевременно.
|
||
|
||
**PLAUSIBLE — look-ahead как дешёвый самостоятельный arm.** D21/research15 проектируют scene-state/Annotator для Ф2; D35 говорит о cross-chunk. В прочитанных экспериментах не изолирован следующий китайский абзац как read-only reference. Для катафоры, нулевых субъектов и поздно раскрываемого отношения это дешевле полноценной памяти. Доказанного эффекта zh→ru нет — именно поэтому arm нужен.
|
||
|
||
**PLAUSIBLE — discourse-move reflow вместо общего «русские абзацы».** Текущий reflow-промпт содержит результатное требование, но не операциональную рубрику «фокал/действие/реакция/смена времени/места/говорящего». Few-shot должен показывать структурное преобразование, а не только красивый стиль. Research/15 покрывает общую форму few-shot, но не этот тип примера.
|
||
|
||
**PLAUSIBLE — факторный model-floor тест.** D35 разрешает фронтир-арм, но без 2×2 сильная модель на ином промпте/размере оставит прежний конфаунд. Нужны одна и та же слабая и сильная модели на текущей и дискурсной организации. Это отвечает именно на вопрос владельца «модель не понимает» против «мы не дали ей опоры».
|
||
|
||
**PLAUSIBLE — тип блока/front matter.** Сырьё первой главы смешивает метаданные, интернет-обзор, авторское предисловие и роман. Во внутренних качественных экспериментах эта ось не выделена. Она не объясняет все 25 глав, но способна портить локальный style prior и оценку главы 1.
|
||
|
||
**PLAUSIBLE — retry-cost надо считать повторно оплаченными токенами, а не только retry-rate.** D35 запросил кривую размера, но формула §A5 делает явным ущерб одного крупного сбоя. Это важно при сравнении главы с чанком: одинаковая доля отказов не означает одинаковую цену.
|
||
|
||
### B3. Где §A разошёлся с командными гипотезами
|
||
|
||
**Расхождение 1 — глава целиком не должна быть привилегированным кандидатом.** D35 справедливо хочет arm «глава целиком», но prior art поддерживает paragraph/discourse units и предупреждает о деградации длинного контекста. Глава нужна как диагностический потолок и область read-ahead; прод-кандидатом по умолчанию её считать нельзя. Источники: [Hu & Wan 2023](https://aclanthology.org/2023.emnlp-main.857/), [Herold & Ney 2023](https://aclanthology.org/2023.codi-1.15/), доступ 2026-07-11.
|
||
|
||
**Расхождение 2 — `draft=чанк/edit=глава` слишком рано превращать в архитектурную лестницу.** Она может победить, но смешивает три изменения: больше source context, больше draft context и иной масштаб reflow. Сначала нужны прямые ручные армы, разделяющие эти факторы. Лишь затем runner-изменение.
|
||
|
||
**Расхождение 3 — «cross-chunk = Ф2» слишком жёсткая граница.** Полноценная долговременная память, Annotator и retrieval действительно Ф2. Но ±1 source paragraph, previous target tail и статичная chapter card можно измерить и даже рендерить без обученной памяти. Это near-term context engineering; продовая автоматизация может потребовать небольшую машинерию, но не весь Ф2-стек.
|
||
|
||
**Расхождение 4 — отдельный layout-пасс не обязан быть детерминированным.** Exp12 рассматривает «детерминированный reflow-пасс» как вариант, но логическое слияние повествования семантично; чистая пунктуационная эвристика надёжно оформит реплики, но не решит, где кончается мысль. Детерминированным должен быть валидатор/аварийная механика, а сам reflow — LLM или ручная редактура, если нужны смысловые абзацы.
|
||
|
||
### B4. Что команда сделала лучше независимой карты
|
||
|
||
**CONFIRMED.** Research/16 дал точные русские нормы диалога и сильное различение legit N:M против структурного дефекта; §A был грубее. Источник: локальный research/16 §2.3, 2026-07-11.
|
||
|
||
**CONFIRMED.** Exp12/13 и D30/D32 дали локальную причинную эмпирику по конкретным моделям: mono no-op, active bilingual, ошибочные инверсии редактора, flash-vs-pro trade-off и ложная независимость судей. Внешняя литература этого заменить не может. Источники: локальные exp12/13 и D30/D32, 2026-07-11.
|
||
|
||
**CONFIRMED.** D35 измерил боевой прогон: reflow применён, draft→final similarity 0,643, 34/55 чанков сильно правлены, около 1,28 стыка чанков на главу. Это сдвигает приоритет к внутри-чанковой организации абзацев: cross-chunk нельзя объявлять главным виновником без trap-разметки. Источник: локальный D35.1, 2026-07-11.
|
||
|
||
## §C. Рекомендации — вход полигону
|
||
|
||
### C1. Главный дизайн: не один bake-off, а две короткие ступени
|
||
|
||
**Ступень I — причинная проба на 6–8 ловушках, а не на «средних главах».** Взять места владельца плюс независимо размеченные случаи четырёх типов: (a) повествовательные предложения, которые должны стать одним русским абзацем; (b) диалог с 1:N; (c) связь, разрешимая внутри текущего чанка; (d) связь, для которой опора находится только за его границей. Разметить до генерации: supporting span и допустимый смысл. Это согласуется с выводом, что общие sentence-level метрики не видят дискурс. Источники: [Jiang et al. 2023](https://aclanthology.org/2023.acl-long.435/), [Mohammed & Niculae 2024](https://aclanthology.org/2024.findings-eacl.113/), доступ 2026-07-11.
|
||
|
||
**Ступень II — blind chapter reading только трёх финалистов.** Не давать владельцу 8 почти одинаковых вариантов, как в exp12. После trap-гейта оставить baseline, лучший near-term arm и frontier diagnostic. Главный исход — бинарное закрытие двух претензий + ранжирование, вторичный — размеченные ошибки.
|
||
|
||
### C2. Армы и порядок
|
||
|
||
Обозначения фазы: **СЕЙЧАС** — прямые вызовы/ручная упаковка, без Ф2; **ПРОД-МИНОР** — после доказанного ROI нужна небольшая правка рендера/сегментации; **Ф2** — долговременное состояние, Annotator, retrieval или новый per-stage runner-контракт.
|
||
|
||
| Приоритет / механизм | Как измерить: arm и проба | Цена | Ожидаемый эффект | Фаза |
|
||
|---|---|---|---|---|
|
||
| **P0. Чистый baseline** | Точный текущий prod prompt+инъекция+1,5k chunk на тех же traps; исключить экспорт-пустоты ch5/ch20 по D35.4 | Уже известна | Нулевая точка обеих претензий | СЕЙЧАС |
|
||
| **P1. Discourse-reflow prompt** | Тот же source/draft/chunk/model; добавить 2–3 структурных few-shot и рубрику ходов: фокал/действие/реакция/смена места-времени/говорящего; финал без плана | +кэшируемый префикс; почти $0 относительно generation | Главным образом абзацы; возможно локальная связность | СЕЙЧАС |
|
||
| **P1. Draft-layout ablation** | Повтор P1, но перед editor заменить пустые строки draft на нейтральные separators или пронумерованные смысловые атомы; финал должен удалить ID | Токены ≈ те же; ручная подготовка | Проверяет якорение на форме черновика | СЕЙЧАС; ПРОД-МИНОР при победе |
|
||
| **P1. Semantic-first vs combined** | На том же P1 сравнить один combined editor с двумя узкими проходами: bilingual semantic repair → target-only literary reflow; одинаковый coverage gate | Примерно +1 output-пасс; потенциально до ~2× editor-output, измерить | Первый проход — смысл, второй — абзацы/русский; снимает конкуренцию мандатов | СЕЙЧАС; ПРОД-МИНОР |
|
||
| **P1. Reference ±1** | К P1 дать previous source+target tail и next source paragraph, явно `REFERENCE — НЕ ПЕРЕВОДИТЬ`; три отдельные абляции prev / next / both | +сотни input-токенов, без нового output | Coreference/ellipsis/cataphora около стыков | СЕЙЧАС; ПРОД-МИНОР |
|
||
| **P2. Chapter card** | Один раз вручную/LLM извлечь для главы сущности, отношения, локацию, время, цель и unresolved refs; подать только релевантную компактную карточку каждому trap | Один pre-pass/глава + ~100–300 input-ток./чанк; точный COGS замерить | Дальние связи без полной главы | СЕЙЧАС как ручной arm; Ф2 для durable auto-state |
|
||
| **P2. Whole-chapter editor diagnostic** | Склеить lossless source и drafts главы, один bilingual edit; те же prompt/few-shot; строгий atom coverage и sanitizer | Меньше fixed overhead, но большой input/output и дорогой retry | Верхняя диагностическая граница reflow/связности; не prod-фаворит | СЕЙЧАС диагностика; Ф2 runner при победе |
|
||
| **P2. Discourse packet** | Ручные пакеты по сцене/ходу при сопоставимом 1,5k и 3k бюджете; сравнить с fixed packing | Ручная разметка; API цена близка size-matched | Изолирует качество границ от размера | СЕЙЧАС диагностика; ПРОД-МИНОР/Ф2 для сегментатора |
|
||
| **P2. Model floor 2×2** | Текущая дешёвая и согласованная frontier-модель × baseline и лучший P1/P2 context. Одинаковые тексты/brief/output cap | 4 клетки; per-call cap; frontier только на traps+1 главе | Отделяет потолок модели от организации | СЕЙЧАС |
|
||
| **P3. Size/retry curve** | 0,75k / 1,5k / 3k / глава, но отдельно fixed vs discourse boundary; ≥3 repeats только для операционной стохастики, не для «перерисовать качество» | Сохранять input/output/reasoning/retry токены и $ | Находит внутренний оптимум и цену отказа | СЕЙЧАС диагностика |
|
||
| **P3. Proper-noun/genre gap cleanup** | До blind-пакета закрыть известные 甲乙丙丁/资质 и иные однозначные gaps, но не менять спорные формы между arms | Дешёвая курация; один resnapshot только после решения | Локальные смысл/жанр-дефекты, не дискурс | СЕЙЧАС |
|
||
| **P4. Auto scene-state / retrieval** | Только если compact manual card даёт лифт: автоматический annotator + long/short memory; отдельная проверка ошибок карточки | Новый pre-pass, хранение, retrieval, versioning | Дальняя связность/последовательность | Ф2 |
|
||
| **P4. Voice/address/reveal memory** | Не смешивать с текущим полигоном двух претензий; отдельные заранее размеченные случаи | Уже спроектированный дополнительный слой | Голос, отношения, спойлеры; не основная абзацность | Ф2 |
|
||
|
||
### C3. Что именно писать в сильном discourse-reflow prompt
|
||
|
||
Это не готовый «оптимальный промпт», а **арм для замера**. Не добавлять ручной verbose CoT reasoning-модели. Операционное ядро:
|
||
|
||
1. «Сначала молча определи смысловые ходы: единый фокал/наблюдатель; действие и непосредственная реакция; одна тема рассуждения; смена говорящего, времени, места или фокала».
|
||
2. «Один повествовательный ход обычно оформляй одним русским абзацем, даже если китайский исходник разбит на однофразовые строки. Не объединяй только ради длины».
|
||
3. «Каждую новую реплику — с нового абзаца через тире; слова автора при той же реплике оставляй в её абзаце».
|
||
4. «Разрешено объединять и делить русские предложения; запрещено терять смысловые атомы. Число предложений и абзацев не обязано совпадать».
|
||
5. «REFERENCE-блоки нужны только для разрешения связей; не переводи и не пересказывай их в выходе».
|
||
|
||
Few-shot должны быть минимальными и ортогональными: narrative N:1, dialogue 1:N, focal-shift boundary. Для DeepSeek thinking-arm сначала проверить zero-shot против few-shot из-за уже задокументированной модельной специфики research/15; не переносить результат между моделями.
|
||
|
||
### C4. Метрики и гейты — пререгистрировать
|
||
|
||
| Ось | Первичный показатель | Аварийный гейт |
|
||
|---|---|---|
|
||
| Русская абзацность | Blind preference русскоязычного читателя + доля заранее размеченных paragraph traps, решённых правильно | Нельзя побеждать только меньшим числом абзацев |
|
||
| Смысл внутри чанка | Билингвальная trap accuracy с обязательным supporting span | Любая инверсия действия/участника = catastrophe независимо от среднего ранга |
|
||
| Смысл через границу | Accuracy отдельно по prev-supported / next-supported / chapter-supported | Random-context perturbation не должен давать тот же результат, иначе context не используется |
|
||
| Полнота | Покрытие смысловых атомов, не совпадение числа предложений | Любой пропуск заголовка/события дисквалифицирует arm на этом фрагменте |
|
||
| Операционность | `$`, input/output/reasoning tokens, latency, retries по причинам, **повторно оплаченные токены** | Per-call predicted-cost cap до запуска; не group-level cap (урок exp13) |
|
||
| Робастность | Leave-one-judge-out + отдельный catastrophe screen | Коррелированные колонки одного судьи не считаются независимыми сигналами |
|
||
|
||
**CONFIRMED.** Контекстный arm должен иметь correct-context vs shuffled-context perturbation: иначе улучшение нельзя приписать использованию опоры. Источник: [Mohammed & Niculae 2024](https://aclanthology.org/2024.findings-eacl.113/), доступ 2026-07-11.
|
||
|
||
### C5. Критерии решения после полигона
|
||
|
||
- Если **P1 discourse prompt** закрывает абзацы без падения fidelity — катить prompt/few-shot; размер не менять.
|
||
- Если помогает только **draft-layout ablation** — проблема в формальном якоре, строить deformat/atom rendering, не chapter editor.
|
||
- Если **±1 reference** закрывает большинство смысловых traps — строить малое context-window rendering до Ф2-памяти.
|
||
- Если нужна **chapter card**, но whole chapter не лучше — строить state extraction/retrieval в Ф2.
|
||
- Если **whole chapter** выигрывает и по fidelity, и по абзацам, и по retry-adjusted COGS — только тогда проектировать per-stage granularity; повторить на более длинной главе до решения.
|
||
- Если сильная модель выигрывает в обеих колонках 2×2, а организация почти не помогает — зафиксирован model floor; не строить сложную память ради слабой модели.
|
||
- Если организация помогает обеим моделям, а сильная+организация даёт дополнительный лифт — разделить near-term context fix и premium model tier.
|
||
|
||
## §D. Вопросы, на которые не хватило данных
|
||
|
||
1. **Где именно supporting context у мест владельца?** D35 сообщает около 1,28 стыка чанков на главу, но нет разметки: какой процент смысловых провалов разрешается внутри чанка, предыдущим абзацем, следующим абзацем, всей главой или знанием мира.
|
||
2. **Какова реальная длина/токенизация главы в выбранных traps?** Без распределения нельзя заранее оценить whole-chapter retry exposure и lost-in-middle.
|
||
3. **Какой frontend/model будет «ChatGPT-arm» полигона?** Эффект prompt format и few-shot модель-специфичен; нельзя честно выдать единый prompt winner без точного model ID/posture.
|
||
4. **Сохраняются ли source paragraph IDs до editor rendering?** Это определяет, можно ли сделать atom coverage/deformat без runner-изменения.
|
||
5. **Можно ли дать editor соседний source/target как non-output reference текущим renderer-ом?** Если нет, ручной полигон всё равно возможен, но production-оценка стройки меняется с ПРОД-МИНОР на Ф2 runner work.
|
||
6. **Каковы retry causes по размеру на боевых моделях?** Нужны отдельно timeout, refusal, length, echo, sanitizer и decode; общий retry-rate скрывает разные зависимости от `c`.
|
||
7. **Есть ли канонический человеческий/фанатский zh→ru фрагмент с хорошей русской репараграфизацией?** Он нужен как calibration/few-shot, но не как единственный reference style. В репозиторий книжный текст переносить нельзя.
|
||
8. **Как owner оценивает допустимую степень синтаксического split/merge?** Текущий запрет «не выбрасывай и не добавляй предложения» двусмыслен; нужно подтвердить, что сохраняется содержание, а не sentence count.
|
||
9. **Насколько front matter должен входить в приёмку художественности?** Его регистр отличается от романа и может искажать итог главы 1.
|
||
10. **Какой порог успеха «минимально художественно»?** Предлагается операционализировать: обе претензии закрыты на ≥80% заранее размеченных traps, 0 катастроф смысла, и blind majority предпочитает arm baseline на каждой из трёх регистровых глав. Число 80% — предложение для пререгистрации, не внешний факт.
|
||
|
||
### Финальный вердикт
|
||
|
||
**PLAUSIBLE.** Самый дешёвый следующий ход — не ещё один общий model bake-off и не немедленная Ф2-память. Это короткий причинный полигон: текущий baseline → discourse/few-shot reflow → deformatted draft → ±1 reference, затем 2×2 с frontier-моделью. Whole-chapter arm нужен как диагностическая граница, но не как заранее выбранная архитектура. Автоматический scene-state/DelTA-класс оправдан только если компактная ручная chapter card сначала докажет лифт.
|