textmachine/docs/research/18-quality-levers-chatgpt.md

61 KiB
Raw Permalink Blame History

Рычаги минимально-художественного zh→ru: независимый доклад ChatGPT

` без BEGIN/END байт-маркеров →

пересчитать нельзя. Прогон внешний (владелец) → заморозка аттестована, но не крипто- верифицируема (в отличие от Claude-отчёта, чей хеш сверен MATCH). На вес «двойной заморозки сходимости» — дисконт; содержательное качество/самосогласованность отчёта этим НЕ затронуты. 2. Свежий fidelity-гейт §C4 не ссылается на мандатный re-gate D34.3 (rerun/FIDELITY_REGATE_HANDOFF.md

  • rerun-parallel.txt) — сессия его не читала. При графтинге брать D34.3-пакет как канон верности, §C4-гейт — как совместимую детализацию.

РЕКОМЕНДАЦИЯ ЛЕНДИНГА (обе стороны сами это предлагают): §C ChatGPT = скелет протокола + графт zh→ru-контента Ван Цуй в reflow-промпт + COGS-модель + привязка D34.3 из Claude-отчёта. Реализовано в POLYGON_QUALITY_EMPIRICS_SESSION_PROMPT.md. ───────────────────────────────────────────────────────────────────────────── -->

Дата исследования: 2026-07-11. Роль: независимый ресёрчер; код и общие документы репозитория не изменялись.

Статусы доказательности:

  • CONFIRMED — утверждение прямо поддержано первичным источником или наблюдением над разрешённым сырьём;
  • PLAUSIBLE — инженерная гипотеза, совместимая с данными, но требующая локального A/B-замера;
  • REFUTED — локальные данные или первичный источник противоречат утверждению.

§A. Чистый лист: независимая карта «проблема → механизм»

FREEZE MARKER A — 2026-07-11. Этот раздел составлен до чтения 05-decisions-log.md, research/07, research/15, research/16 и материалов exp04/12/13. После фиксации SHA-256 раздел не редактируется. Все дальнейшие сопоставления находятся только в §B§D.

A1. Что непосредственно видно в текущем прогоне

CONFIRMED. Текущий сегментатор жадно упаковывает целые исходные абзацы примерно до 1 500 оценочных токенов; только сверхдлинный абзац делится по предложениям. Контекст предыдущего/следующего чанка в Chunk не переносится. Переводчик получает один {{text}}; редактор — тот же исходный чанк и его черновик. Источник: локальные backend/internal/pipeline/chunker.go, backend/prompts/translator.md, backend/prompts/editor.md, прочитаны 2026-07-11.

CONFIRMED. Оба промпта уже требуют русской вёрстки, запрещают копировать построчную разбивку и предписывают начинать прямую речь с нового абзаца. Следовательно, версия «достаточно добавить одну инструкцию про абзацы» опровергается текущей конфигурацией: такая инструкция уже есть, а претензия владельца сохранилась. Источник: локальные промпты выше и вердикт владельца в сессионном задании, 2026-07-11.

CONFIRMED (описательная метрика, не оценка качества). В rerun-ru.txt грубое разбиение по пустым строкам даёт 1 754 блока, из которых 1 671, или около 95,3%, состоят из одной непустой строки. Выборочная проверка начала, середины и конца показывает устойчивую дробность повествования наряду с корректным выделением многих реплик. Метрика намеренно не объявляется нормой художественности: короткий абзац может быть стилистически оправдан. Источники: локальные /home/ubuntu/books/gu-zhenren/rerun/rerun-ru.txt и /home/ubuntu/books/gu-zhenren/rerun/records.json, только чтение, 2026-07-11.

PLAUSIBLE. Основная ошибка организации — не «слишком маленький чанк» как таковой, а смешение трёх разных единиц: (1) единицы покрытия, (2) единицы смыслового контекста, (3) единицы целевой композиции. Нынешний фиксированный бюджет определяет все три сразу. Это объясняет, почему полнота может быть хорошей, а русская макрокомпозиция и дальние связи — слабее. Нужен факторный эксперимент, потому что наблюдение одного прогона причинность не устанавливает.

A2. На какой гранулярности переводить

CONFIRMED. Для литературного LLM-перевода перевод целого исходного абзаца за один вызов превосходил перевод предложение-за-предложением по человеческой разметке на 18 языковых парах: было меньше смысловых, грамматических и стилистических ошибок. Это peer-reviewed WMT 2023, но не zh→ru и не тест текущих дешёвых моделей, поэтому переносимость результата ограничена. Источник: Karpinska & Iyyer, Large Language Models Effectively Leverage Document-level Context for Literary Translation, but Critical Errors Persist, опубликовано 2023-12, доступ 2026-07-11.

CONFIRMED. В литературном MT абзац является практически значимой единицей данных и оценки: корпус Par3 выровнен по абзацам; эксперты предпочитали человеческие варианты машинным в 84% сравнений, а обученный post-editor — обычному MT в 69%. Автоматические метрики не коррелировали с экспертными предпочтениями. Это аргумент за абзац/микросцену и человеческий blind preference как минимум, но не доказательство конкретной схемы zh→ru. Источник: Thai et al., Exploring Document-Level Literary Machine Translation with Parallel Paragraphs from World Literature, EMNLP 2022, доступ 2026-07-11.

CONFIRMED. Простое увеличение контекста до всего документа не является монотонным улучшением: работа по long-context DocMT указывает и рост памяти, и деградацию качества при расширении контекста; типичный локальный контекст — одно-два предыдущих предложения, чего может не хватать для темы и стиля. Источник: Herold & Ney, Improving Long Context Document-Level Machine Translation, CODI/ACL 2023, доступ 2026-07-11.

CONFIRMED. Фиксированная длина плохо отражает дискурсную структуру. Paragraph-to-paragraph режим и явная RST-структура дали улучшения над прежними DocMT-подходами в peer-reviewed исследовании, хотя архитектурные результаты NMT нельзя напрямую переносить на prompting закрытой LLM. Источник: Hu & Wan, Exploring Discourse Structure in Document-level Machine Translation, EMNLP 2023, доступ 2026-07-11.

Вывод A2 — PLAUSIBLE. Для текущей фазы минимальная разумная единица генерации — не предложение и не глава, а дискурсный пакет: один или несколько смежных исходных абзацев, образующих локальный ход/эпизод, с защищёнными границами сцены. Основной текст пакета переводится целиком; вокруг него подаётся компактный reference-context, который не надо переводить. Глава нужна как область предварительного чтения и извлечения опор, а не обязательно как единый output-вызов. Оптимум размера следует измерять, а не объявлять заранее.

A3. Претензия 1: русские абзацы и литературные конвенции

CONFIRMED. Исходная и целевая дискурсные структуры у человеческих и машинных переводов различаются, а предложение-уровневые метрики не покрывают сущности, терминологию, кореференцию и кавычки. Источник — размеченный корпус китайско-английских романов BWB; это близкий по исходному языку, но не русскому, evidence. Jiang et al., Discourse-Centric Evaluation of Document-level Machine Translation with a New Densely Annotated Parallel Corpus of Novels, ACL 2023, доступ 2026-07-11.

PLAUSIBLE. Нужна не ещё одна абстрактная команда «собери естественные абзацы», а наблюдаемая целевая операция:

  1. сначала определить внутри пакета дискурсные ходы (кто воспринимает/говорит, действие, реакция, смена времени/места/фокала);
  2. затем сформировать русские абзацы вокруг этих ходов, отдельно соблюдая оформление диалога;
  3. только потом провести проверку покрытия по исходным атомам.

Эту операцию можно реализовать одним вызовом через краткий скрытый план и финальный текст либо отдельным layout/polish-проходом. Какой вариант лучше для дешёвой модели — вопрос A/B, а не установленный факт.

PLAUSIBLE. Few-shot должен показывать именно требуемое преобразование структуры: 23 коротких zh→ru примера «много однофразовых исходных строк → один естественный повествовательный абзац», «повествование → отдельная реплика → авторская ремарка», «смена фокала → новый абзац». Простой положительный пример проверяется отдельно от длинного списка negative constraints. Причина: текущая словесная инструкция не сработала; демонстрация задаёт форму результата. Прямого peer-reviewed замера именно русской перевёрстки в найденных источниках нет.

PLAUSIBLE. Отдельный target-only layout-пасс потенциально дешевле повторного bilingual editor-пасса: он получает только русский текст и задачу укрупнить/разделить абзацы без перефразирования. Но он не исправляет причинную связность и может закрепить смысловую ошибку; поэтому это узкий рычаг для претензии 1, не универсальное лечение.

PLAUSIBLE. Одновременный мандат редактора «сверить смысл + исправить реалии + выдержать глоссарий + улучшить стиль + реконструировать абзацы + ничего не добавить/удалить» создаёт конкуренцию критериев у слабой модели. Дешёвый тест — разделить semantic revision и target-language paragraph/style polish; дорогой — оставить один сильный editor. Ни «CoT всегда помогает», ни «negative constraints всегда вредят» без локального замера не утверждается.

A4. Претензия 2: связи и смысл на дистанции

CONFIRMED. Контекстные ошибки требуют специальных измерений: sentence-level BLEU может почти не замечать анафору, связность и лексическую когезию. Литература предлагает отдельные тесты для местоимений/кореференции и документные метрики когезии. Источники: Jwalapuram et al., Evaluating Pronominal Anaphora in Machine Translation, EMNLP 2019; Libovický et al., Machine Translation Evaluation beyond the Sentence Level, EAMT 2018; доступ 2026-07-11.

CONFIRMED. DelTA использует не «всю книгу в промпте», а четыре специализированные памяти: записи имён, двуязычное резюме, long-term retrieval и short-term контекст. В ICLR 2025 заявлены средние улучшения до 3,16 COMET и до 4,58 процентного пункта consistency; система переводит по предложениям ради полноты. Это peer-reviewed DocMT, но не литературная zh→ru оценка и не доказательство необходимости всех четырёх компонентов. Источник: Wang et al., DelTA: An Online Document-Level Translation Agent Based on Multi-Level Memory, ICLR 2025, доступ 2026-07-11.

CONFIRMED, но vendor-like/системный claim. TransAgents организует литературный перевод как роли редактора, переводчика, локализатора и корректора с циклом проверки; опубликованный demo-paper сообщает человеческие предпочтения и низкую относительно человека цену. Это prior art организации, но его сильные маркетинговые формулировки нельзя считать независимым доказательством превосходства, а многоагентность сама по себе не изолирована как причина. Источник: Wu et al., TransAgents: Build Your Translation Company with Language Agents, EMNLP Demo 2024, доступ 2026-07-11.

PLAUSIBLE. Максимум эффекта при минимуме стройки даст не полноценная агентная память, а следующий порядок армов:

  1. look-behind: предыдущий русский абзац + соответствующий китайский хвост как read-only reference;
  2. look-ahead: следующий китайский абзац/до границы сцены, помеченный «не переводить», чтобы снять катафору и неоднозначность текущей фразы;
  3. chapter card: краткие сущности, отношения, текущая цель/локация/время и нерешённые референсы, извлечённые одним предварительным чтением главы;
  4. только затем retrieval/долгая память и отдельный аннотатор связей.

Порядок — инженерная гипотеза по цене строительства. Look-ahead особенно важен для китайского нулевого подлежащего, но величина эффекта именно zh→ru не подтверждена найденным контролируемым исследованием.

PLAUSIBLE. Глоссарий лечит стабильность именования, но не заменяет модель ситуации: одинаково написанное имя не разрешает, кто что сделал, почему персонаж реагирует и к чему относится опущенное подлежащее. Поэтому в полигоне терминологическая consistency и causal/coreference comprehension должны быть разными исходами.

PLAUSIBLE. Сильная модель может одновременно улучшить локальный русский и рассуждение, но arm «модель сильнее» без одинакового контекста не отвечает, где потолок — в модели или организации. Нужен 2×2: слабая/сильная модель × текущий/дискурсный контекст. Если контекст помогает обеим, проблема частично организационная; если только сильная проходит смысловые ловушки, есть model floor.

A5. Кривая «размер чанка ↔ качество ↔ биллинг ↔ ретраи»

CONFIRMED как бухгалтерская рамка, не как эмпирическая кривая. Для главы из S исходных токенов, чанка полезной длины c, фиксированного prompt/reference overhead h, коэффициента выходных токенов r и цен p_in, p_out ожидаемая цена без ретраев грубо равна:

C(c) ≈ ceil(S/c) · h · p_in + S · p_in + rS · p_out.

Значит, при прочих равных рост c уменьшает повторяемый overhead. Это арифметика; она не говорит, что качество растёт.

PLAUSIBLE. С ретраями цена становится нелинейной. Если вероятность неуспеха чанка q(c) и весь вызов повторяется до успеха, множитель ожидаемых попыток — 1/(1-q(c)); ожидаемо повторно оплачивается весь h+c+rc. Даже если число вызовов падает, большие чанки дороже терять при timeout/refusal/excision. Реальная q(c) должна быть измерена по типам отказа, а не подогнана общей долей retry.

PLAUSIBLE. Качество вероятно имеет внутренний оптимум: слишком малый c режет дискурс и размножает prompt overhead; слишком большой c размывает релевантный контекст, затрудняет контроль полноты и повышает ущерб одного сбоя. Исследование long-context DocMT подтверждает возможность деградации при расширении контекста, но форму кривой для этого пайплайна надо пререгистрировать и измерить. Источник: Herold & Ney 2023, ссылка в A2, доступ 2026-07-11.

Предрегистрация A5 — PLAUSIBLE. Сравнить не только размеры 0,75k / 1,5k / 3k / «глава», но и две политики границ при сопоставимом бюджете: фиксированная упаковка против scene/discourse-aware упаковки. На каждом арме сохранять: вход/выход токены, latency, долю и причину ретраев, долю повторно оплаченных токенов, полноту, blind reader preference, paragraph score и размеченные coreference/causal traps. Иначе размер будет спутан с качеством границ.

A6. Оси, которые легко пропустить

PLAUSIBLE — структурная утечка через черновик. Редактор видит дробный черновик, который становится сильной формальной подсказкой, тогда как абстрактная инструкция просит его форму разрушить. Arm «редактор видит тот же текст без пустых строк/с ID смысловых атомов» отделит якорение на layout черновика от неспособности модели к русской композиции.

PLAUSIBLE — конфликт полноты и естественной композиции. Формула «не выбрасывай и не добавляй предложения» полезна для покрытия, но может восприниматься как требование сохранять предложение-к-предложению и мешать слиянию/членению русских предложений. Следует сохранять смысловые атомы, а не число предложений: пронумеровать атомы только для внутренней проверки, разрешив объединять и делить предложения в финале. Это должно пройти отдельный coverage gate.

PLAUSIBLE — мусор до романа портит style prior. Первый чанк содержит метаданные, обзор, интернет-ссылку и предисловие, а не однородную художественную сцену. Общий genre prompt не различает front matter, авторское предисловие и роман. Классификация типа блока до перевода может предотвратить перенос регистров и бессмысленную «литературизацию» служебного текста.

PLAUSIBLE — направление контекста важно. Только прошлое помогает последовательности, но не всегда пониманию текущей китайской эллиптики; только будущее рискует спойлерным перефразированием. Поэтому previous-target, previous-source и next-source надо факторизовать, а не объединять сразу в один «context arm».

CONFIRMED. Правильность контекстного метода нельзя заключать из общего score: perturbation test с корректным против случайного контекста показывает, использует ли система именно опорный контекст. Источник: Mohammed & Niculae, On Measuring Context Utilization in Document-Level MT Systems, Findings of EACL 2024, доступ 2026-07-11.

PLAUSIBLE — оценщик должен разделять читателя и билингва. Русскоязычный читатель способен оценить ритм, абзацы и естественность, но не диагностирует тихое искажение; билингв — смысл и связи, но может терпеть translationese. Минимальный полигон требует двух независимых рубрик и запрета показывать arm/model judge-у.

REFUTED как универсальный тезис. «Больше агентов автоматически означает лучше» не следует из prior art: TransAgents демонстрирует целую систему, DelTA — специализированную память, а paragraph-level LLM уже улучшал результат без агентного оркестра. Сначала следует покупать информацию (границы, соседний контекст, chapter card), затем роли и циклы.

A7. Независимая карта причин и минимальных вмешательств

Наблюдаемая проблема Вероятный механизм Самый дешёвый различающий тест Что не считать доказательством
Почти каждый ход остаётся отдельным абзацем Якорение на layout исходника/черновика; инструкция без демонстрации; перегруженный editor mandate layout few-shot; draft без пустых строк; отдельный target-only reflow Снижение числа абзацев само по себе
Связь ломается внутри чанка Модель не строит локальную ситуацию; противоречивый/перегруженный мандат semantic-first editor с явными entity/action/reason checks Более гладкий русский без сверки смысла
Связь ломается на границе чанков Нет previous/next reference; граница не совпадает со сценой ±1 абзац reference и scene-aware boundary Увеличение токенов без релевантного контекста
Теряются дальние сущности/цели Нет chapter/book state краткая chapter card против glossary-only Единообразное имя при неверной кореференции
Сильный стиль ценой пропуска Свободный polish без атомарного coverage atom IDs + post-check, разрешив русское split/merge Совпадение числа предложений
Большие чанки нестабильны/дороги Растёт payload одного сбоя и нерелевантный контекст size sweep с раздельным учётом retry causes Средняя цена успешного вызова без ретраев
Непонятно, виновата модель или пайплайн Model/context confounding 2×2 model strength × discourse context Сравнение разных моделей на разных промптах

Итог §A — PLAUSIBLE. Наиболее вероятный короткий путь к «минимально художественно» — не перевод всей главы и не многоагентная стройка, а дискурсно ограниченный пакет + небольшой соседний reference-context + few-shot русской перекомпоновки + раздельная смысловая и монолингвальная оценка. Первый полигон должен определить, достаточна ли текущая модель; не предполагать это заранее.

§B. Дифф после чтения внутреннего стека

B0. Целостность анти-анкоринга

§A был записан отдельным снимком до чтения командных гипотез. SHA-256 этого A-only снимка: b42c6f6e6dc06ec48f3472714ac2b9ca5eba0135fba204113e2628a36eacee99. После этого прочитаны карта актуальности и D26/D30D35 в docs/architecture/05-decisions-log.md, раздел «Промптинг литперевода» в docs/research/15-voice-and-state.md, docs/research/07-translation-methodology.md, exp04/12/13 и docs/research/16-reader-ide-alignment.md. §A после чтения не изменялся.

B1. Где независимая карта сошлась с командой

CONFIRMED — команда угадала корень первого слоя. §A независимо установил, что словесная reflow-инструкция уже есть, но результата не гарантирует; D35 независимо подтверждает на боевом снимке, что reflow действительно применялся, редактор был активен, а выход всё равно зеркалил рубленость источника. Значит, это не stale-конфиг и не пассивный mono-editor. Источники: локальный docs/architecture/05-decisions-log.md, D35.1, и текущие промпты, прочитаны 2026-07-11.

CONFIRMED — команда уже сделала верный флип mono→bilingual. Exp12 показал механическую пассивность mono-режима и структурную невозможность исправить 磕头/派/时辰 без исходника; D30 ратифицировал bilingual editor. Это полностью совпало с §A4: target-only polish не лечит смысл. Источники: локальные docs/experiments/12-quality-diagnosis.md §2.2/§2.5 и docs/architecture/05-decisions-log.md D30.1, прочитаны 2026-07-11.

CONFIRMED — команда уже развела глоссарий и понимание ситуации. D30.8/D35.4 различают термины, которые можно засидить сейчас, и «модель не следит за сюжетом», относимое к состоянию/памяти. Это совпадает с §A4. Источники: локальный D-лог, D30.8/D35.4, 2026-07-11.

CONFIRMED — команда уже не считает жёсткую 1:1 структуру целью. Research/16 показывает легитимный N:M, русскую норму тире-абзацев и рекомендует детектировать, а не форсировать парность. Это совместимо с §A3/A6: проверять смысловые атомы, не число предложений/абзацев. Источник: локальный docs/research/16-reader-ide-alignment.md §2.1§2.5, прочитан 2026-07-11; внешний якорь: Karpinska & Iyyer, WMT 2023, доступ 2026-07-11.

CONFIRMED — команда уже знает, что модель/промпт нельзя оценивать общим скаляром. Exp12/13 разделили стиль и верность, но ревью D30/D32 вскрыло ложные «единогласия», коррелированные сигналы и катастрофы победителей. Предлагаемый в §A 2×2 и отдельные traps продолжают именно эту исправленную методику. Источники: локальный D-лог D30/D32 и exp12/13, прочитаны 2026-07-11.

CONFIRMED — prompt-format prior art уже покрыт research/15. Формат, позиция, сэндвич, few-shot-раскол по моделям, lost-in-middle и опасность ручного CoT уже исследованы. Поэтому данный доклад не рекомендует универсальный XML/CoT-рецепт и не дублирует этот обзор. Источник: локальный docs/research/15-voice-and-state.md §3.1§3.3, прочитан 2026-07-11.

B2. Что в §A есть сверх текущей карты команды

PLAUSIBLE — независимое разведение трёх единиц. В D35 главная ось сформулирована как «нарезка × промпт» и кандидаты draft=чанк/edit=глава. §A добавляет обязательное различение: coverage atom ≠ generation unit ≠ reference-context span. Глава может быть областью чтения/извлечения опор, не единым completion. Это предотвращает ложный выбор «1,5k или вся глава».

PLAUSIBLE — якорение редактора на форме draft как отдельная причина. Командные документы обсуждают исходную построчность и ненадёжность reflow, но не изолируют arm, где редактор получает тот же черновик без пустых строк/с нейтральными атомарными ID. Если такой arm резко улучшит абзацы при той же модели и промпте, менять размер чанка преждевременно.

PLAUSIBLE — look-ahead как дешёвый самостоятельный arm. D21/research15 проектируют scene-state/Annotator для Ф2; D35 говорит о cross-chunk. В прочитанных экспериментах не изолирован следующий китайский абзац как read-only reference. Для катафоры, нулевых субъектов и поздно раскрываемого отношения это дешевле полноценной памяти. Доказанного эффекта zh→ru нет — именно поэтому arm нужен.

PLAUSIBLE — discourse-move reflow вместо общего «русские абзацы». Текущий reflow-промпт содержит результатное требование, но не операциональную рубрику «фокал/действие/реакция/смена времени/места/говорящего». Few-shot должен показывать структурное преобразование, а не только красивый стиль. Research/15 покрывает общую форму few-shot, но не этот тип примера.

PLAUSIBLE — факторный model-floor тест. D35 разрешает фронтир-арм, но без 2×2 сильная модель на ином промпте/размере оставит прежний конфаунд. Нужны одна и та же слабая и сильная модели на текущей и дискурсной организации. Это отвечает именно на вопрос владельца «модель не понимает» против «мы не дали ей опоры».

PLAUSIBLE — тип блока/front matter. Сырьё первой главы смешивает метаданные, интернет-обзор, авторское предисловие и роман. Во внутренних качественных экспериментах эта ось не выделена. Она не объясняет все 25 глав, но способна портить локальный style prior и оценку главы 1.

PLAUSIBLE — retry-cost надо считать повторно оплаченными токенами, а не только retry-rate. D35 запросил кривую размера, но формула §A5 делает явным ущерб одного крупного сбоя. Это важно при сравнении главы с чанком: одинаковая доля отказов не означает одинаковую цену.

B3. Где §A разошёлся с командными гипотезами

Расхождение 1 — глава целиком не должна быть привилегированным кандидатом. D35 справедливо хочет arm «глава целиком», но prior art поддерживает paragraph/discourse units и предупреждает о деградации длинного контекста. Глава нужна как диагностический потолок и область read-ahead; прод-кандидатом по умолчанию её считать нельзя. Источники: Hu & Wan 2023, Herold & Ney 2023, доступ 2026-07-11.

Расхождение 2 — draft=чанк/edit=глава слишком рано превращать в архитектурную лестницу. Она может победить, но смешивает три изменения: больше source context, больше draft context и иной масштаб reflow. Сначала нужны прямые ручные армы, разделяющие эти факторы. Лишь затем runner-изменение.

Расхождение 3 — «cross-chunk = Ф2» слишком жёсткая граница. Полноценная долговременная память, Annotator и retrieval действительно Ф2. Но ±1 source paragraph, previous target tail и статичная chapter card можно измерить и даже рендерить без обученной памяти. Это near-term context engineering; продовая автоматизация может потребовать небольшую машинерию, но не весь Ф2-стек.

Расхождение 4 — отдельный layout-пасс не обязан быть детерминированным. Exp12 рассматривает «детерминированный reflow-пасс» как вариант, но логическое слияние повествования семантично; чистая пунктуационная эвристика надёжно оформит реплики, но не решит, где кончается мысль. Детерминированным должен быть валидатор/аварийная механика, а сам reflow — LLM или ручная редактура, если нужны смысловые абзацы.

B4. Что команда сделала лучше независимой карты

CONFIRMED. Research/16 дал точные русские нормы диалога и сильное различение legit N:M против структурного дефекта; §A был грубее. Источник: локальный research/16 §2.3, 2026-07-11.

CONFIRMED. Exp12/13 и D30/D32 дали локальную причинную эмпирику по конкретным моделям: mono no-op, active bilingual, ошибочные инверсии редактора, flash-vs-pro trade-off и ложная независимость судей. Внешняя литература этого заменить не может. Источники: локальные exp12/13 и D30/D32, 2026-07-11.

CONFIRMED. D35 измерил боевой прогон: reflow применён, draft→final similarity 0,643, 34/55 чанков сильно правлены, около 1,28 стыка чанков на главу. Это сдвигает приоритет к внутри-чанковой организации абзацев: cross-chunk нельзя объявлять главным виновником без trap-разметки. Источник: локальный D35.1, 2026-07-11.

§C. Рекомендации — вход полигону

C1. Главный дизайн: не один bake-off, а две короткие ступени

Ступень I — причинная проба на 68 ловушках, а не на «средних главах». Взять места владельца плюс независимо размеченные случаи четырёх типов: (a) повествовательные предложения, которые должны стать одним русским абзацем; (b) диалог с 1:N; (c) связь, разрешимая внутри текущего чанка; (d) связь, для которой опора находится только за его границей. Разметить до генерации: supporting span и допустимый смысл. Это согласуется с выводом, что общие sentence-level метрики не видят дискурс. Источники: Jiang et al. 2023, Mohammed & Niculae 2024, доступ 2026-07-11.

Ступень II — blind chapter reading только трёх финалистов. Не давать владельцу 8 почти одинаковых вариантов, как в exp12. После trap-гейта оставить baseline, лучший near-term arm и frontier diagnostic. Главный исход — бинарное закрытие двух претензий + ранжирование, вторичный — размеченные ошибки.

C2. Армы и порядок

Обозначения фазы: СЕЙЧАС — прямые вызовы/ручная упаковка, без Ф2; ПРОД-МИНОР — после доказанного ROI нужна небольшая правка рендера/сегментации; Ф2 — долговременное состояние, Annotator, retrieval или новый per-stage runner-контракт.

Приоритет / механизм Как измерить: arm и проба Цена Ожидаемый эффект Фаза
P0. Чистый baseline Точный текущий prod prompt+инъекция+1,5k chunk на тех же traps; исключить экспорт-пустоты ch5/ch20 по D35.4 Уже известна Нулевая точка обеих претензий СЕЙЧАС
P1. Discourse-reflow prompt Тот же source/draft/chunk/model; добавить 23 структурных few-shot и рубрику ходов: фокал/действие/реакция/смена места-времени/говорящего; финал без плана +кэшируемый префикс; почти $0 относительно generation Главным образом абзацы; возможно локальная связность СЕЙЧАС
P1. Draft-layout ablation Повтор P1, но перед editor заменить пустые строки draft на нейтральные separators или пронумерованные смысловые атомы; финал должен удалить ID Токены ≈ те же; ручная подготовка Проверяет якорение на форме черновика СЕЙЧАС; ПРОД-МИНОР при победе
P1. Semantic-first vs combined На том же P1 сравнить один combined editor с двумя узкими проходами: bilingual semantic repair → target-only literary reflow; одинаковый coverage gate Примерно +1 output-пасс; потенциально до ~2× editor-output, измерить Первый проход — смысл, второй — абзацы/русский; снимает конкуренцию мандатов СЕЙЧАС; ПРОД-МИНОР
P1. Reference ±1 К P1 дать previous source+target tail и next source paragraph, явно REFERENCE — НЕ ПЕРЕВОДИТЬ; три отдельные абляции prev / next / both +сотни input-токенов, без нового output Coreference/ellipsis/cataphora около стыков СЕЙЧАС; ПРОД-МИНОР
P2. Chapter card Один раз вручную/LLM извлечь для главы сущности, отношения, локацию, время, цель и unresolved refs; подать только релевантную компактную карточку каждому trap Один pre-pass/глава + ~100300 input-ток./чанк; точный COGS замерить Дальние связи без полной главы СЕЙЧАС как ручной arm; Ф2 для durable auto-state
P2. Whole-chapter editor diagnostic Склеить lossless source и drafts главы, один bilingual edit; те же prompt/few-shot; строгий atom coverage и sanitizer Меньше fixed overhead, но большой input/output и дорогой retry Верхняя диагностическая граница reflow/связности; не prod-фаворит СЕЙЧАС диагностика; Ф2 runner при победе
P2. Discourse packet Ручные пакеты по сцене/ходу при сопоставимом 1,5k и 3k бюджете; сравнить с fixed packing Ручная разметка; API цена близка size-matched Изолирует качество границ от размера СЕЙЧАС диагностика; ПРОД-МИНОР/Ф2 для сегментатора
P2. Model floor 2×2 Текущая дешёвая и согласованная frontier-модель × baseline и лучший P1/P2 context. Одинаковые тексты/brief/output cap 4 клетки; per-call cap; frontier только на traps+1 главе Отделяет потолок модели от организации СЕЙЧАС
P3. Size/retry curve 0,75k / 1,5k / 3k / глава, но отдельно fixed vs discourse boundary; ≥3 repeats только для операционной стохастики, не для «перерисовать качество» Сохранять input/output/reasoning/retry токены и $ Находит внутренний оптимум и цену отказа СЕЙЧАС диагностика
P3. Proper-noun/genre gap cleanup До blind-пакета закрыть известные 甲乙丙丁/资质 и иные однозначные gaps, но не менять спорные формы между arms Дешёвая курация; один resnapshot только после решения Локальные смысл/жанр-дефекты, не дискурс СЕЙЧАС
P4. Auto scene-state / retrieval Только если compact manual card даёт лифт: автоматический annotator + long/short memory; отдельная проверка ошибок карточки Новый pre-pass, хранение, retrieval, versioning Дальняя связность/последовательность Ф2
P4. Voice/address/reveal memory Не смешивать с текущим полигоном двух претензий; отдельные заранее размеченные случаи Уже спроектированный дополнительный слой Голос, отношения, спойлеры; не основная абзацность Ф2

C3. Что именно писать в сильном discourse-reflow prompt

Это не готовый «оптимальный промпт», а арм для замера. Не добавлять ручной verbose CoT reasoning-модели. Операционное ядро:

  1. «Сначала молча определи смысловые ходы: единый фокал/наблюдатель; действие и непосредственная реакция; одна тема рассуждения; смена говорящего, времени, места или фокала».
  2. «Один повествовательный ход обычно оформляй одним русским абзацем, даже если китайский исходник разбит на однофразовые строки. Не объединяй только ради длины».
  3. «Каждую новую реплику — с нового абзаца через тире; слова автора при той же реплике оставляй в её абзаце».
  4. «Разрешено объединять и делить русские предложения; запрещено терять смысловые атомы. Число предложений и абзацев не обязано совпадать».
  5. «REFERENCE-блоки нужны только для разрешения связей; не переводи и не пересказывай их в выходе».

Few-shot должны быть минимальными и ортогональными: narrative N:1, dialogue 1:N, focal-shift boundary. Для DeepSeek thinking-arm сначала проверить zero-shot против few-shot из-за уже задокументированной модельной специфики research/15; не переносить результат между моделями.

C4. Метрики и гейты — пререгистрировать

Ось Первичный показатель Аварийный гейт
Русская абзацность Blind preference русскоязычного читателя + доля заранее размеченных paragraph traps, решённых правильно Нельзя побеждать только меньшим числом абзацев
Смысл внутри чанка Билингвальная trap accuracy с обязательным supporting span Любая инверсия действия/участника = catastrophe независимо от среднего ранга
Смысл через границу Accuracy отдельно по prev-supported / next-supported / chapter-supported Random-context perturbation не должен давать тот же результат, иначе context не используется
Полнота Покрытие смысловых атомов, не совпадение числа предложений Любой пропуск заголовка/события дисквалифицирует arm на этом фрагменте
Операционность $, input/output/reasoning tokens, latency, retries по причинам, повторно оплаченные токены Per-call predicted-cost cap до запуска; не group-level cap (урок exp13)
Робастность Leave-one-judge-out + отдельный catastrophe screen Коррелированные колонки одного судьи не считаются независимыми сигналами

CONFIRMED. Контекстный arm должен иметь correct-context vs shuffled-context perturbation: иначе улучшение нельзя приписать использованию опоры. Источник: Mohammed & Niculae 2024, доступ 2026-07-11.

C5. Критерии решения после полигона

  • Если P1 discourse prompt закрывает абзацы без падения fidelity — катить prompt/few-shot; размер не менять.
  • Если помогает только draft-layout ablation — проблема в формальном якоре, строить deformat/atom rendering, не chapter editor.
  • Если ±1 reference закрывает большинство смысловых traps — строить малое context-window rendering до Ф2-памяти.
  • Если нужна chapter card, но whole chapter не лучше — строить state extraction/retrieval в Ф2.
  • Если whole chapter выигрывает и по fidelity, и по абзацам, и по retry-adjusted COGS — только тогда проектировать per-stage granularity; повторить на более длинной главе до решения.
  • Если сильная модель выигрывает в обеих колонках 2×2, а организация почти не помогает — зафиксирован model floor; не строить сложную память ради слабой модели.
  • Если организация помогает обеим моделям, а сильная+организация даёт дополнительный лифт — разделить near-term context fix и premium model tier.

§D. Вопросы, на которые не хватило данных

  1. Где именно supporting context у мест владельца? D35 сообщает около 1,28 стыка чанков на главу, но нет разметки: какой процент смысловых провалов разрешается внутри чанка, предыдущим абзацем, следующим абзацем, всей главой или знанием мира.
  2. Какова реальная длина/токенизация главы в выбранных traps? Без распределения нельзя заранее оценить whole-chapter retry exposure и lost-in-middle.
  3. Какой frontend/model будет «ChatGPT-arm» полигона? Эффект prompt format и few-shot модель-специфичен; нельзя честно выдать единый prompt winner без точного model ID/posture.
  4. Сохраняются ли source paragraph IDs до editor rendering? Это определяет, можно ли сделать atom coverage/deformat без runner-изменения.
  5. Можно ли дать editor соседний source/target как non-output reference текущим renderer-ом? Если нет, ручной полигон всё равно возможен, но production-оценка стройки меняется с ПРОД-МИНОР на Ф2 runner work.
  6. Каковы retry causes по размеру на боевых моделях? Нужны отдельно timeout, refusal, length, echo, sanitizer и decode; общий retry-rate скрывает разные зависимости от c.
  7. Есть ли канонический человеческий/фанатский zh→ru фрагмент с хорошей русской репараграфизацией? Он нужен как calibration/few-shot, но не как единственный reference style. В репозиторий книжный текст переносить нельзя.
  8. Как owner оценивает допустимую степень синтаксического split/merge? Текущий запрет «не выбрасывай и не добавляй предложения» двусмыслен; нужно подтвердить, что сохраняется содержание, а не sentence count.
  9. Насколько front matter должен входить в приёмку художественности? Его регистр отличается от романа и может искажать итог главы 1.
  10. Какой порог успеха «минимально художественно»? Предлагается операционализировать: обе претензии закрыты на ≥80% заранее размеченных traps, 0 катастроф смысла, и blind majority предпочитает arm baseline на каждой из трёх регистровых глав. Число 80% — предложение для пререгистрации, не внешний факт.

Финальный вердикт

PLAUSIBLE. Самый дешёвый следующий ход — не ещё один общий model bake-off и не немедленная Ф2-память. Это короткий причинный полигон: текущий baseline → discourse/few-shot reflow → deformatted draft → ±1 reference, затем 2×2 с frontier-моделью. Whole-chapter arm нужен как диагностическая граница, но не как заранее выбранная архитектура. Автоматический scene-state/DelTA-класс оправдан только если компактная ручная chapter card сначала докажет лифт.