61 KiB
Рычаги минимально-художественного zh→ru: независимый доклад ChatGPT
` без BEGIN/END байт-маркеров →пересчитать нельзя. Прогон внешний (владелец) → заморозка аттестована, но не крипто-
верифицируема (в отличие от Claude-отчёта, чей хеш сверен MATCH). На вес «двойной заморозки
сходимости» — дисконт; содержательное качество/самосогласованность отчёта этим НЕ затронуты.
2. Свежий fidelity-гейт §C4 не ссылается на мандатный re-gate D34.3 (rerun/FIDELITY_REGATE_HANDOFF.md
rerun-parallel.txt) — сессия его не читала. При графтинге брать D34.3-пакет как канон верности, §C4-гейт — как совместимую детализацию.
РЕКОМЕНДАЦИЯ ЛЕНДИНГА (обе стороны сами это предлагают): §C ChatGPT = скелет протокола +
графт zh→ru-контента Ван Цуй в reflow-промпт + COGS-модель + привязка D34.3 из Claude-отчёта.
Реализовано в POLYGON_QUALITY_EMPIRICS_SESSION_PROMPT.md.
───────────────────────────────────────────────────────────────────────────── -->
Дата исследования: 2026-07-11. Роль: независимый ресёрчер; код и общие документы репозитория не изменялись.
Статусы доказательности:
- CONFIRMED — утверждение прямо поддержано первичным источником или наблюдением над разрешённым сырьём;
- PLAUSIBLE — инженерная гипотеза, совместимая с данными, но требующая локального A/B-замера;
- REFUTED — локальные данные или первичный источник противоречат утверждению.
§A. Чистый лист: независимая карта «проблема → механизм»
FREEZE MARKER A — 2026-07-11. Этот раздел составлен до чтения
05-decisions-log.md,research/07,research/15,research/16и материалов exp04/12/13. После фиксации SHA-256 раздел не редактируется. Все дальнейшие сопоставления находятся только в §B–§D.
A1. Что непосредственно видно в текущем прогоне
CONFIRMED. Текущий сегментатор жадно упаковывает целые исходные абзацы примерно до 1 500 оценочных токенов; только сверхдлинный абзац делится по предложениям. Контекст предыдущего/следующего чанка в Chunk не переносится. Переводчик получает один {{text}}; редактор — тот же исходный чанк и его черновик. Источник: локальные backend/internal/pipeline/chunker.go, backend/prompts/translator.md, backend/prompts/editor.md, прочитаны 2026-07-11.
CONFIRMED. Оба промпта уже требуют русской вёрстки, запрещают копировать построчную разбивку и предписывают начинать прямую речь с нового абзаца. Следовательно, версия «достаточно добавить одну инструкцию про абзацы» опровергается текущей конфигурацией: такая инструкция уже есть, а претензия владельца сохранилась. Источник: локальные промпты выше и вердикт владельца в сессионном задании, 2026-07-11.
CONFIRMED (описательная метрика, не оценка качества). В rerun-ru.txt грубое разбиение по пустым строкам даёт 1 754 блока, из которых 1 671, или около 95,3%, состоят из одной непустой строки. Выборочная проверка начала, середины и конца показывает устойчивую дробность повествования наряду с корректным выделением многих реплик. Метрика намеренно не объявляется нормой художественности: короткий абзац может быть стилистически оправдан. Источники: локальные /home/ubuntu/books/gu-zhenren/rerun/rerun-ru.txt и /home/ubuntu/books/gu-zhenren/rerun/records.json, только чтение, 2026-07-11.
PLAUSIBLE. Основная ошибка организации — не «слишком маленький чанк» как таковой, а смешение трёх разных единиц: (1) единицы покрытия, (2) единицы смыслового контекста, (3) единицы целевой композиции. Нынешний фиксированный бюджет определяет все три сразу. Это объясняет, почему полнота может быть хорошей, а русская макрокомпозиция и дальние связи — слабее. Нужен факторный эксперимент, потому что наблюдение одного прогона причинность не устанавливает.
A2. На какой гранулярности переводить
CONFIRMED. Для литературного LLM-перевода перевод целого исходного абзаца за один вызов превосходил перевод предложение-за-предложением по человеческой разметке на 18 языковых парах: было меньше смысловых, грамматических и стилистических ошибок. Это peer-reviewed WMT 2023, но не zh→ru и не тест текущих дешёвых моделей, поэтому переносимость результата ограничена. Источник: Karpinska & Iyyer, Large Language Models Effectively Leverage Document-level Context for Literary Translation, but Critical Errors Persist, опубликовано 2023-12, доступ 2026-07-11.
CONFIRMED. В литературном MT абзац является практически значимой единицей данных и оценки: корпус Par3 выровнен по абзацам; эксперты предпочитали человеческие варианты машинным в 84% сравнений, а обученный post-editor — обычному MT в 69%. Автоматические метрики не коррелировали с экспертными предпочтениями. Это аргумент за абзац/микросцену и человеческий blind preference как минимум, но не доказательство конкретной схемы zh→ru. Источник: Thai et al., Exploring Document-Level Literary Machine Translation with Parallel Paragraphs from World Literature, EMNLP 2022, доступ 2026-07-11.
CONFIRMED. Простое увеличение контекста до всего документа не является монотонным улучшением: работа по long-context DocMT указывает и рост памяти, и деградацию качества при расширении контекста; типичный локальный контекст — одно-два предыдущих предложения, чего может не хватать для темы и стиля. Источник: Herold & Ney, Improving Long Context Document-Level Machine Translation, CODI/ACL 2023, доступ 2026-07-11.
CONFIRMED. Фиксированная длина плохо отражает дискурсную структуру. Paragraph-to-paragraph режим и явная RST-структура дали улучшения над прежними DocMT-подходами в peer-reviewed исследовании, хотя архитектурные результаты NMT нельзя напрямую переносить на prompting закрытой LLM. Источник: Hu & Wan, Exploring Discourse Structure in Document-level Machine Translation, EMNLP 2023, доступ 2026-07-11.
Вывод A2 — PLAUSIBLE. Для текущей фазы минимальная разумная единица генерации — не предложение и не глава, а дискурсный пакет: один или несколько смежных исходных абзацев, образующих локальный ход/эпизод, с защищёнными границами сцены. Основной текст пакета переводится целиком; вокруг него подаётся компактный reference-context, который не надо переводить. Глава нужна как область предварительного чтения и извлечения опор, а не обязательно как единый output-вызов. Оптимум размера следует измерять, а не объявлять заранее.
A3. Претензия 1: русские абзацы и литературные конвенции
CONFIRMED. Исходная и целевая дискурсные структуры у человеческих и машинных переводов различаются, а предложение-уровневые метрики не покрывают сущности, терминологию, кореференцию и кавычки. Источник — размеченный корпус китайско-английских романов BWB; это близкий по исходному языку, но не русскому, evidence. Jiang et al., Discourse-Centric Evaluation of Document-level Machine Translation with a New Densely Annotated Parallel Corpus of Novels, ACL 2023, доступ 2026-07-11.
PLAUSIBLE. Нужна не ещё одна абстрактная команда «собери естественные абзацы», а наблюдаемая целевая операция:
- сначала определить внутри пакета дискурсные ходы (кто воспринимает/говорит, действие, реакция, смена времени/места/фокала);
- затем сформировать русские абзацы вокруг этих ходов, отдельно соблюдая оформление диалога;
- только потом провести проверку покрытия по исходным атомам.
Эту операцию можно реализовать одним вызовом через краткий скрытый план и финальный текст либо отдельным layout/polish-проходом. Какой вариант лучше для дешёвой модели — вопрос A/B, а не установленный факт.
PLAUSIBLE. Few-shot должен показывать именно требуемое преобразование структуры: 2–3 коротких zh→ru примера «много однофразовых исходных строк → один естественный повествовательный абзац», «повествование → отдельная реплика → авторская ремарка», «смена фокала → новый абзац». Простой положительный пример проверяется отдельно от длинного списка negative constraints. Причина: текущая словесная инструкция не сработала; демонстрация задаёт форму результата. Прямого peer-reviewed замера именно русской перевёрстки в найденных источниках нет.
PLAUSIBLE. Отдельный target-only layout-пасс потенциально дешевле повторного bilingual editor-пасса: он получает только русский текст и задачу укрупнить/разделить абзацы без перефразирования. Но он не исправляет причинную связность и может закрепить смысловую ошибку; поэтому это узкий рычаг для претензии 1, не универсальное лечение.
PLAUSIBLE. Одновременный мандат редактора «сверить смысл + исправить реалии + выдержать глоссарий + улучшить стиль + реконструировать абзацы + ничего не добавить/удалить» создаёт конкуренцию критериев у слабой модели. Дешёвый тест — разделить semantic revision и target-language paragraph/style polish; дорогой — оставить один сильный editor. Ни «CoT всегда помогает», ни «negative constraints всегда вредят» без локального замера не утверждается.
A4. Претензия 2: связи и смысл на дистанции
CONFIRMED. Контекстные ошибки требуют специальных измерений: sentence-level BLEU может почти не замечать анафору, связность и лексическую когезию. Литература предлагает отдельные тесты для местоимений/кореференции и документные метрики когезии. Источники: Jwalapuram et al., Evaluating Pronominal Anaphora in Machine Translation, EMNLP 2019; Libovický et al., Machine Translation Evaluation beyond the Sentence Level, EAMT 2018; доступ 2026-07-11.
CONFIRMED. DelTA использует не «всю книгу в промпте», а четыре специализированные памяти: записи имён, двуязычное резюме, long-term retrieval и short-term контекст. В ICLR 2025 заявлены средние улучшения до 3,16 COMET и до 4,58 процентного пункта consistency; система переводит по предложениям ради полноты. Это peer-reviewed DocMT, но не литературная zh→ru оценка и не доказательство необходимости всех четырёх компонентов. Источник: Wang et al., DelTA: An Online Document-Level Translation Agent Based on Multi-Level Memory, ICLR 2025, доступ 2026-07-11.
CONFIRMED, но vendor-like/системный claim. TransAgents организует литературный перевод как роли редактора, переводчика, локализатора и корректора с циклом проверки; опубликованный demo-paper сообщает человеческие предпочтения и низкую относительно человека цену. Это prior art организации, но его сильные маркетинговые формулировки нельзя считать независимым доказательством превосходства, а многоагентность сама по себе не изолирована как причина. Источник: Wu et al., TransAgents: Build Your Translation Company with Language Agents, EMNLP Demo 2024, доступ 2026-07-11.
PLAUSIBLE. Максимум эффекта при минимуме стройки даст не полноценная агентная память, а следующий порядок армов:
- look-behind: предыдущий русский абзац + соответствующий китайский хвост как read-only reference;
- look-ahead: следующий китайский абзац/до границы сцены, помеченный «не переводить», чтобы снять катафору и неоднозначность текущей фразы;
- chapter card: краткие сущности, отношения, текущая цель/локация/время и нерешённые референсы, извлечённые одним предварительным чтением главы;
- только затем retrieval/долгая память и отдельный аннотатор связей.
Порядок — инженерная гипотеза по цене строительства. Look-ahead особенно важен для китайского нулевого подлежащего, но величина эффекта именно zh→ru не подтверждена найденным контролируемым исследованием.
PLAUSIBLE. Глоссарий лечит стабильность именования, но не заменяет модель ситуации: одинаково написанное имя не разрешает, кто что сделал, почему персонаж реагирует и к чему относится опущенное подлежащее. Поэтому в полигоне терминологическая consistency и causal/coreference comprehension должны быть разными исходами.
PLAUSIBLE. Сильная модель может одновременно улучшить локальный русский и рассуждение, но arm «модель сильнее» без одинакового контекста не отвечает, где потолок — в модели или организации. Нужен 2×2: слабая/сильная модель × текущий/дискурсный контекст. Если контекст помогает обеим, проблема частично организационная; если только сильная проходит смысловые ловушки, есть model floor.
A5. Кривая «размер чанка ↔ качество ↔ биллинг ↔ ретраи»
CONFIRMED как бухгалтерская рамка, не как эмпирическая кривая. Для главы из S исходных токенов, чанка полезной длины c, фиксированного prompt/reference overhead h, коэффициента выходных токенов r и цен p_in, p_out ожидаемая цена без ретраев грубо равна:
C(c) ≈ ceil(S/c) · h · p_in + S · p_in + rS · p_out.
Значит, при прочих равных рост c уменьшает повторяемый overhead. Это арифметика; она не говорит, что качество растёт.
PLAUSIBLE. С ретраями цена становится нелинейной. Если вероятность неуспеха чанка q(c) и весь вызов повторяется до успеха, множитель ожидаемых попыток — 1/(1-q(c)); ожидаемо повторно оплачивается весь h+c+rc. Даже если число вызовов падает, большие чанки дороже терять при timeout/refusal/excision. Реальная q(c) должна быть измерена по типам отказа, а не подогнана общей долей retry.
PLAUSIBLE. Качество вероятно имеет внутренний оптимум: слишком малый c режет дискурс и размножает prompt overhead; слишком большой c размывает релевантный контекст, затрудняет контроль полноты и повышает ущерб одного сбоя. Исследование long-context DocMT подтверждает возможность деградации при расширении контекста, но форму кривой для этого пайплайна надо пререгистрировать и измерить. Источник: Herold & Ney 2023, ссылка в A2, доступ 2026-07-11.
Предрегистрация A5 — PLAUSIBLE. Сравнить не только размеры 0,75k / 1,5k / 3k / «глава», но и две политики границ при сопоставимом бюджете: фиксированная упаковка против scene/discourse-aware упаковки. На каждом арме сохранять: вход/выход токены, latency, долю и причину ретраев, долю повторно оплаченных токенов, полноту, blind reader preference, paragraph score и размеченные coreference/causal traps. Иначе размер будет спутан с качеством границ.
A6. Оси, которые легко пропустить
PLAUSIBLE — структурная утечка через черновик. Редактор видит дробный черновик, который становится сильной формальной подсказкой, тогда как абстрактная инструкция просит его форму разрушить. Arm «редактор видит тот же текст без пустых строк/с ID смысловых атомов» отделит якорение на layout черновика от неспособности модели к русской композиции.
PLAUSIBLE — конфликт полноты и естественной композиции. Формула «не выбрасывай и не добавляй предложения» полезна для покрытия, но может восприниматься как требование сохранять предложение-к-предложению и мешать слиянию/членению русских предложений. Следует сохранять смысловые атомы, а не число предложений: пронумеровать атомы только для внутренней проверки, разрешив объединять и делить предложения в финале. Это должно пройти отдельный coverage gate.
PLAUSIBLE — мусор до романа портит style prior. Первый чанк содержит метаданные, обзор, интернет-ссылку и предисловие, а не однородную художественную сцену. Общий genre prompt не различает front matter, авторское предисловие и роман. Классификация типа блока до перевода может предотвратить перенос регистров и бессмысленную «литературизацию» служебного текста.
PLAUSIBLE — направление контекста важно. Только прошлое помогает последовательности, но не всегда пониманию текущей китайской эллиптики; только будущее рискует спойлерным перефразированием. Поэтому previous-target, previous-source и next-source надо факторизовать, а не объединять сразу в один «context arm».
CONFIRMED. Правильность контекстного метода нельзя заключать из общего score: perturbation test с корректным против случайного контекста показывает, использует ли система именно опорный контекст. Источник: Mohammed & Niculae, On Measuring Context Utilization in Document-Level MT Systems, Findings of EACL 2024, доступ 2026-07-11.
PLAUSIBLE — оценщик должен разделять читателя и билингва. Русскоязычный читатель способен оценить ритм, абзацы и естественность, но не диагностирует тихое искажение; билингв — смысл и связи, но может терпеть translationese. Минимальный полигон требует двух независимых рубрик и запрета показывать arm/model judge-у.
REFUTED как универсальный тезис. «Больше агентов автоматически означает лучше» не следует из prior art: TransAgents демонстрирует целую систему, DelTA — специализированную память, а paragraph-level LLM уже улучшал результат без агентного оркестра. Сначала следует покупать информацию (границы, соседний контекст, chapter card), затем роли и циклы.
A7. Независимая карта причин и минимальных вмешательств
| Наблюдаемая проблема | Вероятный механизм | Самый дешёвый различающий тест | Что не считать доказательством |
|---|---|---|---|
| Почти каждый ход остаётся отдельным абзацем | Якорение на layout исходника/черновика; инструкция без демонстрации; перегруженный editor mandate | layout few-shot; draft без пустых строк; отдельный target-only reflow | Снижение числа абзацев само по себе |
| Связь ломается внутри чанка | Модель не строит локальную ситуацию; противоречивый/перегруженный мандат | semantic-first editor с явными entity/action/reason checks | Более гладкий русский без сверки смысла |
| Связь ломается на границе чанков | Нет previous/next reference; граница не совпадает со сценой | ±1 абзац reference и scene-aware boundary | Увеличение токенов без релевантного контекста |
| Теряются дальние сущности/цели | Нет chapter/book state | краткая chapter card против glossary-only | Единообразное имя при неверной кореференции |
| Сильный стиль ценой пропуска | Свободный polish без атомарного coverage | atom IDs + post-check, разрешив русское split/merge | Совпадение числа предложений |
| Большие чанки нестабильны/дороги | Растёт payload одного сбоя и нерелевантный контекст | size sweep с раздельным учётом retry causes | Средняя цена успешного вызова без ретраев |
| Непонятно, виновата модель или пайплайн | Model/context confounding | 2×2 model strength × discourse context | Сравнение разных моделей на разных промптах |
Итог §A — PLAUSIBLE. Наиболее вероятный короткий путь к «минимально художественно» — не перевод всей главы и не многоагентная стройка, а дискурсно ограниченный пакет + небольшой соседний reference-context + few-shot русской перекомпоновки + раздельная смысловая и монолингвальная оценка. Первый полигон должен определить, достаточна ли текущая модель; не предполагать это заранее.
§B. Дифф после чтения внутреннего стека
B0. Целостность анти-анкоринга
§A был записан отдельным снимком до чтения командных гипотез. SHA-256 этого A-only снимка: b42c6f6e6dc06ec48f3472714ac2b9ca5eba0135fba204113e2628a36eacee99. После этого прочитаны карта актуальности и D26/D30–D35 в docs/architecture/05-decisions-log.md, раздел «Промптинг литперевода» в docs/research/15-voice-and-state.md, docs/research/07-translation-methodology.md, exp04/12/13 и docs/research/16-reader-ide-alignment.md. §A после чтения не изменялся.
B1. Где независимая карта сошлась с командой
CONFIRMED — команда угадала корень первого слоя. §A независимо установил, что словесная reflow-инструкция уже есть, но результата не гарантирует; D35 независимо подтверждает на боевом снимке, что reflow действительно применялся, редактор был активен, а выход всё равно зеркалил рубленость источника. Значит, это не stale-конфиг и не пассивный mono-editor. Источники: локальный docs/architecture/05-decisions-log.md, D35.1, и текущие промпты, прочитаны 2026-07-11.
CONFIRMED — команда уже сделала верный флип mono→bilingual. Exp12 показал механическую пассивность mono-режима и структурную невозможность исправить 磕头/派/时辰 без исходника; D30 ратифицировал bilingual editor. Это полностью совпало с §A4: target-only polish не лечит смысл. Источники: локальные docs/experiments/12-quality-diagnosis.md §2.2/§2.5 и docs/architecture/05-decisions-log.md D30.1, прочитаны 2026-07-11.
CONFIRMED — команда уже развела глоссарий и понимание ситуации. D30.8/D35.4 различают термины, которые можно засидить сейчас, и «модель не следит за сюжетом», относимое к состоянию/памяти. Это совпадает с §A4. Источники: локальный D-лог, D30.8/D35.4, 2026-07-11.
CONFIRMED — команда уже не считает жёсткую 1:1 структуру целью. Research/16 показывает легитимный N:M, русскую норму тире-абзацев и рекомендует детектировать, а не форсировать парность. Это совместимо с §A3/A6: проверять смысловые атомы, не число предложений/абзацев. Источник: локальный docs/research/16-reader-ide-alignment.md §2.1–§2.5, прочитан 2026-07-11; внешний якорь: Karpinska & Iyyer, WMT 2023, доступ 2026-07-11.
CONFIRMED — команда уже знает, что модель/промпт нельзя оценивать общим скаляром. Exp12/13 разделили стиль и верность, но ревью D30/D32 вскрыло ложные «единогласия», коррелированные сигналы и катастрофы победителей. Предлагаемый в §A 2×2 и отдельные traps продолжают именно эту исправленную методику. Источники: локальный D-лог D30/D32 и exp12/13, прочитаны 2026-07-11.
CONFIRMED — prompt-format prior art уже покрыт research/15. Формат, позиция, сэндвич, few-shot-раскол по моделям, lost-in-middle и опасность ручного CoT уже исследованы. Поэтому данный доклад не рекомендует универсальный XML/CoT-рецепт и не дублирует этот обзор. Источник: локальный docs/research/15-voice-and-state.md §3.1–§3.3, прочитан 2026-07-11.
B2. Что в §A есть сверх текущей карты команды
PLAUSIBLE — независимое разведение трёх единиц. В D35 главная ось сформулирована как «нарезка × промпт» и кандидаты draft=чанк/edit=глава. §A добавляет обязательное различение: coverage atom ≠ generation unit ≠ reference-context span. Глава может быть областью чтения/извлечения опор, не единым completion. Это предотвращает ложный выбор «1,5k или вся глава».
PLAUSIBLE — якорение редактора на форме draft как отдельная причина. Командные документы обсуждают исходную построчность и ненадёжность reflow, но не изолируют arm, где редактор получает тот же черновик без пустых строк/с нейтральными атомарными ID. Если такой arm резко улучшит абзацы при той же модели и промпте, менять размер чанка преждевременно.
PLAUSIBLE — look-ahead как дешёвый самостоятельный arm. D21/research15 проектируют scene-state/Annotator для Ф2; D35 говорит о cross-chunk. В прочитанных экспериментах не изолирован следующий китайский абзац как read-only reference. Для катафоры, нулевых субъектов и поздно раскрываемого отношения это дешевле полноценной памяти. Доказанного эффекта zh→ru нет — именно поэтому arm нужен.
PLAUSIBLE — discourse-move reflow вместо общего «русские абзацы». Текущий reflow-промпт содержит результатное требование, но не операциональную рубрику «фокал/действие/реакция/смена времени/места/говорящего». Few-shot должен показывать структурное преобразование, а не только красивый стиль. Research/15 покрывает общую форму few-shot, но не этот тип примера.
PLAUSIBLE — факторный model-floor тест. D35 разрешает фронтир-арм, но без 2×2 сильная модель на ином промпте/размере оставит прежний конфаунд. Нужны одна и та же слабая и сильная модели на текущей и дискурсной организации. Это отвечает именно на вопрос владельца «модель не понимает» против «мы не дали ей опоры».
PLAUSIBLE — тип блока/front matter. Сырьё первой главы смешивает метаданные, интернет-обзор, авторское предисловие и роман. Во внутренних качественных экспериментах эта ось не выделена. Она не объясняет все 25 глав, но способна портить локальный style prior и оценку главы 1.
PLAUSIBLE — retry-cost надо считать повторно оплаченными токенами, а не только retry-rate. D35 запросил кривую размера, но формула §A5 делает явным ущерб одного крупного сбоя. Это важно при сравнении главы с чанком: одинаковая доля отказов не означает одинаковую цену.
B3. Где §A разошёлся с командными гипотезами
Расхождение 1 — глава целиком не должна быть привилегированным кандидатом. D35 справедливо хочет arm «глава целиком», но prior art поддерживает paragraph/discourse units и предупреждает о деградации длинного контекста. Глава нужна как диагностический потолок и область read-ahead; прод-кандидатом по умолчанию её считать нельзя. Источники: Hu & Wan 2023, Herold & Ney 2023, доступ 2026-07-11.
Расхождение 2 — draft=чанк/edit=глава слишком рано превращать в архитектурную лестницу. Она может победить, но смешивает три изменения: больше source context, больше draft context и иной масштаб reflow. Сначала нужны прямые ручные армы, разделяющие эти факторы. Лишь затем runner-изменение.
Расхождение 3 — «cross-chunk = Ф2» слишком жёсткая граница. Полноценная долговременная память, Annotator и retrieval действительно Ф2. Но ±1 source paragraph, previous target tail и статичная chapter card можно измерить и даже рендерить без обученной памяти. Это near-term context engineering; продовая автоматизация может потребовать небольшую машинерию, но не весь Ф2-стек.
Расхождение 4 — отдельный layout-пасс не обязан быть детерминированным. Exp12 рассматривает «детерминированный reflow-пасс» как вариант, но логическое слияние повествования семантично; чистая пунктуационная эвристика надёжно оформит реплики, но не решит, где кончается мысль. Детерминированным должен быть валидатор/аварийная механика, а сам reflow — LLM или ручная редактура, если нужны смысловые абзацы.
B4. Что команда сделала лучше независимой карты
CONFIRMED. Research/16 дал точные русские нормы диалога и сильное различение legit N:M против структурного дефекта; §A был грубее. Источник: локальный research/16 §2.3, 2026-07-11.
CONFIRMED. Exp12/13 и D30/D32 дали локальную причинную эмпирику по конкретным моделям: mono no-op, active bilingual, ошибочные инверсии редактора, flash-vs-pro trade-off и ложная независимость судей. Внешняя литература этого заменить не может. Источники: локальные exp12/13 и D30/D32, 2026-07-11.
CONFIRMED. D35 измерил боевой прогон: reflow применён, draft→final similarity 0,643, 34/55 чанков сильно правлены, около 1,28 стыка чанков на главу. Это сдвигает приоритет к внутри-чанковой организации абзацев: cross-chunk нельзя объявлять главным виновником без trap-разметки. Источник: локальный D35.1, 2026-07-11.
§C. Рекомендации — вход полигону
C1. Главный дизайн: не один bake-off, а две короткие ступени
Ступень I — причинная проба на 6–8 ловушках, а не на «средних главах». Взять места владельца плюс независимо размеченные случаи четырёх типов: (a) повествовательные предложения, которые должны стать одним русским абзацем; (b) диалог с 1:N; (c) связь, разрешимая внутри текущего чанка; (d) связь, для которой опора находится только за его границей. Разметить до генерации: supporting span и допустимый смысл. Это согласуется с выводом, что общие sentence-level метрики не видят дискурс. Источники: Jiang et al. 2023, Mohammed & Niculae 2024, доступ 2026-07-11.
Ступень II — blind chapter reading только трёх финалистов. Не давать владельцу 8 почти одинаковых вариантов, как в exp12. После trap-гейта оставить baseline, лучший near-term arm и frontier diagnostic. Главный исход — бинарное закрытие двух претензий + ранжирование, вторичный — размеченные ошибки.
C2. Армы и порядок
Обозначения фазы: СЕЙЧАС — прямые вызовы/ручная упаковка, без Ф2; ПРОД-МИНОР — после доказанного ROI нужна небольшая правка рендера/сегментации; Ф2 — долговременное состояние, Annotator, retrieval или новый per-stage runner-контракт.
| Приоритет / механизм | Как измерить: arm и проба | Цена | Ожидаемый эффект | Фаза |
|---|---|---|---|---|
| P0. Чистый baseline | Точный текущий prod prompt+инъекция+1,5k chunk на тех же traps; исключить экспорт-пустоты ch5/ch20 по D35.4 | Уже известна | Нулевая точка обеих претензий | СЕЙЧАС |
| P1. Discourse-reflow prompt | Тот же source/draft/chunk/model; добавить 2–3 структурных few-shot и рубрику ходов: фокал/действие/реакция/смена места-времени/говорящего; финал без плана | +кэшируемый префикс; почти $0 относительно generation | Главным образом абзацы; возможно локальная связность | СЕЙЧАС |
| P1. Draft-layout ablation | Повтор P1, но перед editor заменить пустые строки draft на нейтральные separators или пронумерованные смысловые атомы; финал должен удалить ID | Токены ≈ те же; ручная подготовка | Проверяет якорение на форме черновика | СЕЙЧАС; ПРОД-МИНОР при победе |
| P1. Semantic-first vs combined | На том же P1 сравнить один combined editor с двумя узкими проходами: bilingual semantic repair → target-only literary reflow; одинаковый coverage gate | Примерно +1 output-пасс; потенциально до ~2× editor-output, измерить | Первый проход — смысл, второй — абзацы/русский; снимает конкуренцию мандатов | СЕЙЧАС; ПРОД-МИНОР |
| P1. Reference ±1 | К P1 дать previous source+target tail и next source paragraph, явно REFERENCE — НЕ ПЕРЕВОДИТЬ; три отдельные абляции prev / next / both |
+сотни input-токенов, без нового output | Coreference/ellipsis/cataphora около стыков | СЕЙЧАС; ПРОД-МИНОР |
| P2. Chapter card | Один раз вручную/LLM извлечь для главы сущности, отношения, локацию, время, цель и unresolved refs; подать только релевантную компактную карточку каждому trap | Один pre-pass/глава + ~100–300 input-ток./чанк; точный COGS замерить | Дальние связи без полной главы | СЕЙЧАС как ручной arm; Ф2 для durable auto-state |
| P2. Whole-chapter editor diagnostic | Склеить lossless source и drafts главы, один bilingual edit; те же prompt/few-shot; строгий atom coverage и sanitizer | Меньше fixed overhead, но большой input/output и дорогой retry | Верхняя диагностическая граница reflow/связности; не prod-фаворит | СЕЙЧАС диагностика; Ф2 runner при победе |
| P2. Discourse packet | Ручные пакеты по сцене/ходу при сопоставимом 1,5k и 3k бюджете; сравнить с fixed packing | Ручная разметка; API цена близка size-matched | Изолирует качество границ от размера | СЕЙЧАС диагностика; ПРОД-МИНОР/Ф2 для сегментатора |
| P2. Model floor 2×2 | Текущая дешёвая и согласованная frontier-модель × baseline и лучший P1/P2 context. Одинаковые тексты/brief/output cap | 4 клетки; per-call cap; frontier только на traps+1 главе | Отделяет потолок модели от организации | СЕЙЧАС |
| P3. Size/retry curve | 0,75k / 1,5k / 3k / глава, но отдельно fixed vs discourse boundary; ≥3 repeats только для операционной стохастики, не для «перерисовать качество» | Сохранять input/output/reasoning/retry токены и $ | Находит внутренний оптимум и цену отказа | СЕЙЧАС диагностика |
| P3. Proper-noun/genre gap cleanup | До blind-пакета закрыть известные 甲乙丙丁/资质 и иные однозначные gaps, но не менять спорные формы между arms | Дешёвая курация; один resnapshot только после решения | Локальные смысл/жанр-дефекты, не дискурс | СЕЙЧАС |
| P4. Auto scene-state / retrieval | Только если compact manual card даёт лифт: автоматический annotator + long/short memory; отдельная проверка ошибок карточки | Новый pre-pass, хранение, retrieval, versioning | Дальняя связность/последовательность | Ф2 |
| P4. Voice/address/reveal memory | Не смешивать с текущим полигоном двух претензий; отдельные заранее размеченные случаи | Уже спроектированный дополнительный слой | Голос, отношения, спойлеры; не основная абзацность | Ф2 |
C3. Что именно писать в сильном discourse-reflow prompt
Это не готовый «оптимальный промпт», а арм для замера. Не добавлять ручной verbose CoT reasoning-модели. Операционное ядро:
- «Сначала молча определи смысловые ходы: единый фокал/наблюдатель; действие и непосредственная реакция; одна тема рассуждения; смена говорящего, времени, места или фокала».
- «Один повествовательный ход обычно оформляй одним русским абзацем, даже если китайский исходник разбит на однофразовые строки. Не объединяй только ради длины».
- «Каждую новую реплику — с нового абзаца через тире; слова автора при той же реплике оставляй в её абзаце».
- «Разрешено объединять и делить русские предложения; запрещено терять смысловые атомы. Число предложений и абзацев не обязано совпадать».
- «REFERENCE-блоки нужны только для разрешения связей; не переводи и не пересказывай их в выходе».
Few-shot должны быть минимальными и ортогональными: narrative N:1, dialogue 1:N, focal-shift boundary. Для DeepSeek thinking-arm сначала проверить zero-shot против few-shot из-за уже задокументированной модельной специфики research/15; не переносить результат между моделями.
C4. Метрики и гейты — пререгистрировать
| Ось | Первичный показатель | Аварийный гейт |
|---|---|---|
| Русская абзацность | Blind preference русскоязычного читателя + доля заранее размеченных paragraph traps, решённых правильно | Нельзя побеждать только меньшим числом абзацев |
| Смысл внутри чанка | Билингвальная trap accuracy с обязательным supporting span | Любая инверсия действия/участника = catastrophe независимо от среднего ранга |
| Смысл через границу | Accuracy отдельно по prev-supported / next-supported / chapter-supported | Random-context perturbation не должен давать тот же результат, иначе context не используется |
| Полнота | Покрытие смысловых атомов, не совпадение числа предложений | Любой пропуск заголовка/события дисквалифицирует arm на этом фрагменте |
| Операционность | $, input/output/reasoning tokens, latency, retries по причинам, повторно оплаченные токены |
Per-call predicted-cost cap до запуска; не group-level cap (урок exp13) |
| Робастность | Leave-one-judge-out + отдельный catastrophe screen | Коррелированные колонки одного судьи не считаются независимыми сигналами |
CONFIRMED. Контекстный arm должен иметь correct-context vs shuffled-context perturbation: иначе улучшение нельзя приписать использованию опоры. Источник: Mohammed & Niculae 2024, доступ 2026-07-11.
C5. Критерии решения после полигона
- Если P1 discourse prompt закрывает абзацы без падения fidelity — катить prompt/few-shot; размер не менять.
- Если помогает только draft-layout ablation — проблема в формальном якоре, строить deformat/atom rendering, не chapter editor.
- Если ±1 reference закрывает большинство смысловых traps — строить малое context-window rendering до Ф2-памяти.
- Если нужна chapter card, но whole chapter не лучше — строить state extraction/retrieval в Ф2.
- Если whole chapter выигрывает и по fidelity, и по абзацам, и по retry-adjusted COGS — только тогда проектировать per-stage granularity; повторить на более длинной главе до решения.
- Если сильная модель выигрывает в обеих колонках 2×2, а организация почти не помогает — зафиксирован model floor; не строить сложную память ради слабой модели.
- Если организация помогает обеим моделям, а сильная+организация даёт дополнительный лифт — разделить near-term context fix и premium model tier.
§D. Вопросы, на которые не хватило данных
- Где именно supporting context у мест владельца? D35 сообщает около 1,28 стыка чанков на главу, но нет разметки: какой процент смысловых провалов разрешается внутри чанка, предыдущим абзацем, следующим абзацем, всей главой или знанием мира.
- Какова реальная длина/токенизация главы в выбранных traps? Без распределения нельзя заранее оценить whole-chapter retry exposure и lost-in-middle.
- Какой frontend/model будет «ChatGPT-arm» полигона? Эффект prompt format и few-shot модель-специфичен; нельзя честно выдать единый prompt winner без точного model ID/posture.
- Сохраняются ли source paragraph IDs до editor rendering? Это определяет, можно ли сделать atom coverage/deformat без runner-изменения.
- Можно ли дать editor соседний source/target как non-output reference текущим renderer-ом? Если нет, ручной полигон всё равно возможен, но production-оценка стройки меняется с ПРОД-МИНОР на Ф2 runner work.
- Каковы retry causes по размеру на боевых моделях? Нужны отдельно timeout, refusal, length, echo, sanitizer и decode; общий retry-rate скрывает разные зависимости от
c. - Есть ли канонический человеческий/фанатский zh→ru фрагмент с хорошей русской репараграфизацией? Он нужен как calibration/few-shot, но не как единственный reference style. В репозиторий книжный текст переносить нельзя.
- Как owner оценивает допустимую степень синтаксического split/merge? Текущий запрет «не выбрасывай и не добавляй предложения» двусмыслен; нужно подтвердить, что сохраняется содержание, а не sentence count.
- Насколько front matter должен входить в приёмку художественности? Его регистр отличается от романа и может искажать итог главы 1.
- Какой порог успеха «минимально художественно»? Предлагается операционализировать: обе претензии закрыты на ≥80% заранее размеченных traps, 0 катастроф смысла, и blind majority предпочитает arm baseline на каждой из трёх регистровых глав. Число 80% — предложение для пререгистрации, не внешний факт.
Финальный вердикт
PLAUSIBLE. Самый дешёвый следующий ход — не ещё один общий model bake-off и не немедленная Ф2-память. Это короткий причинный полигон: текущий baseline → discourse/few-shot reflow → deformatted draft → ±1 reference, затем 2×2 с frontier-моделью. Whole-chapter arm нужен как диагностическая граница, но не как заранее выбранная архитектура. Автоматический scene-state/DelTA-класс оправдан только если компактная ручная chapter card сначала докажет лифт.