77 KiB
research/18 — Рычаги качества: как дотянуть текущую фазу до минимально-художественного zh→ru
Ресёрч-доклад независимой сессии-ресёрчера (D35.5). Вход эмпирической сессии полигона. Протокол — трёхфазный анти-анкоринг: §A построена ДО чтения наших решений (только две претензии владельца + сырьё пере-прогона + механизм-как-есть + собственный внешний ресёрч). §B/§C/§D — после чтения нашего стека. Каждый несущий клейм: вердикт CONFIRMED / PLAUSIBLE / REFUTED + источник (тип/дата). Препринт ≠ peer-review; вендор-клейм ≠ независимый замер; результат «в английский» ≠ доказательство «в русский» (помечаю экстраполяцию явно). Отчёт пройдёт адверсариальную верификацию оркестратора по первоисточникам.
§A — «Чистый лист» (заморожено)
A0. Метод и границы
Прочитано в фазе 1 (разрешённое): две претензии владельца; сырьё пере-прогона — исходник guzhenren-slice25.gb18030.txt, rerun/records.json (по-чанково: source/draft/final/флаги), rerun/rerun-ru.txt; механизм-как-есть — backend/internal/pipeline/chunker.go, backend/prompts/{translator,editor}.md. Плюс собственный внешний веб-ресёрч (52-агентный фан-аут с адверсариальной верификацией).
НЕ читалось (анти-анкоринг): 05-decisions-log.md, хендоффы (ORCHESTRATOR_HANDOFF.md, FIDELITY_REGATE_HANDOFF.md), rootcause_auto.json, glossary-signoff, diag/arms/*, выводы приёмки. Заголовки последних коммитов присутствовали в среде сессии ambient — на содержание §A не опирался.
A1. Механизм как есть (из кода и промптов)
- Нарезка (
chunker.go): жадно пакует ЦЕЛЫЕ абзацы доtargetChunkTokens=1500(код-конст, версионируетсяchunkerVersion, фолдится в снапшот); абзац сверх бюджета спускается к границам ПРЕДЛОЖЕНИЙ (предложение не рвётся). Детерминированно, чисто. Фактически ~2 чанка на главу (57 чанков / 25 глав), медиана исходного чанка ~1639 zh-символов. - Пайплайн: по-чанково ПЕРЕВОД (draft) → по-чанково РЕДАКТУРА (bilingual, source+draft). Каждый чанк — в ИЗОЛЯЦИИ. НЕТ overlap между чанками, НЕТ running-summary, НЕТ контекста прошлых глав. Единственная кросс-чанковая память — термин-ГЛОССАРИЙ, добавляемый редактору.
- translator.md: только
{{text}}; инструкции — «живой литературный русский», верстать по нормам РЯ (НЕ копировать построчную разбивку), прямая речь через тире. - editor.md: bilingual,
{{text}}(src)+{{draft}}; сверять смысл с исходником, убирать кальки, глоссарий СТРОГО; «собирай повествование в естественные русские абзацы (не копируя построчную разбивку)»; полнота — не выбрасывать/не добавлять.
A2. Замеренная слабость (сырьё)
Претензия 1 (рубленость) — ПОДТВЕРЖДЕНА замером. 41/51 нарративных чанков дают ~1:1 отношение «финальных абзацев к строкам исходника»; 58% ненарративных абзацев — одно предложение; медиана предложений/нарративный-абзац = 1.0. Инструкция reflow, присутствующая в ОБОИХ промптах, практически инертна.
Локализация reflow-провала. Черновик уже рубленый в 43/49 чанков (переводчик зеркалит построчную разбивку). Редактор СОХРАНЯЕТ структуру черновика в 37/49, СЛИВАЕТ лишь в 1/49 → редактор структуро-сохраняющий, НЕ работает layout-пассом. Вариативность reflow живёт в основном на стадии черновика (гл.11 черновик 25 абз., гл.13 — 14: переводчик там СЛИЛ). Оформление диалогов через тире — работает.
Претензия 2 (связность/смысл) — ПОДТВЕРЖДЕНА чтением zh↔ru гл.5–12. На уровне ПРЕДЛОЖЕНИЯ голос в целом приемлем, редактура часто улучшает (внутренний монолог в кавычках, разбивка атрибуции, лексические апгрейды). «Слабая художественность» идёт не от предложенческой translationese, а от кластера сбоев связности/полноты/терминологии. Конкретика:
- гл.7: инверсия двойного отрицания 没有一个不知道 («все знали») → «никто не знал» (противоречит главе). [дефект в черновике, редактура не починила]
- гл.8: 物是人非 (заглавие-ключ) сплющено до «всё изменилось», теряя контраст «вещи те же — люди иные».
- Терминология grade-системы 甲乙丙丁 — дрейф между разряд А/Б/В/Г, числовым «первого/третьего ранга» (коллизия с 转-рангом гу-мастера) и точечными сырыми глифами.
Третья ось, НЕ входившая в претензии владельца (самое ценное наблюдение): значимая доля «слабой художественности» — это РЕГРЕССИЯ ПОСЛЕ ЧЕРНОВИКА, а не качество перевода. Финал местами ХУЖЕ черновика:
- гл.5.0: полный черновик 5425 симв. → финал ПУСТ,
edit_flag='sanitizer_defect'(собственный флаг пайплайна). Санитайзер обнулил целый чанк — миф об основании (Жэнь-цзу и три гу, метафора-ядро книги). Один из 2 пустых финалов на книгу. [CONFIRMED — проверено мной по records.json.] - Утечка CJK-глифов в вывод: 13 строк финалов (и 21 строка черновиков) содержат сырые zh/полноширинные глифы; часть внесена редактурой (напр. гл.8 特产, гл.4.1 资质乙等 — в черновике корректно). [CONFIRMED — проверено мной.]
- Правки, ломающие смысл: гл.9 (переворот разряда В→Б у Фан Юаня, против всей его сюжетной линии низкого разряда), гл.10 (перекройка процентов восстановления в противоречивые «десятые/сотые») — [PLAUSIBLE — наблюдение чтения; требует адверсариальной re-проверки оркестратором.]
Вывод A2: перед постройкой машинерии связности имеет смысл СНАЧАЛА не давать пост-черновым стадиям (edit/sanitizer) разрушать уже годный черновик.
A3. Карта «проблема → механизм» по осям
Ось 1. Дискурс-гранулярность zh→ru: где потолок — в моделях или в организации?
- Абзац — эмпирически лучшая единица перевода, чем предложение (меньше mistranslation/грамматики/несогласованности, естественнее верстается). [CONFIRMED] — Karpinska & Iyyer, LLMs Effectively Leverage Document-level Context for Literary Translation (WMT 2023, peer-reviewed, ACL 2023.wmt-1.41; arXiv 2304.03245). Экстраполяция для нас: мишени в статье — англ./польск./яп., zh как ИСТОЧНИК; направление «в русский» напрямую не мерено (польский — славянский прокси). Единственная модель — GPT-3.5.
- Но у нас единица УЖЕ ~1600 симв. (много абзацев) — то есть «апсайд от добавления контекста в единицу» в основном ПОТРАЧЕН; дальнейший рост единицы не даёт бесплатного качества. [PLAUSIBLE]
- Потолок связности — в ОРГАНИЗАЦИИ (изоляция чанков), а не в сырой модели. Кросс-предложенческий контекст даёт большой прирост на именно тех дискурс-феноменах, что суть претензии 2. [CONFIRMED для направления в русский] — Voita et al., When a Good Translation is Wrong in Context (ACL 2019, peer-reviewed, EN→RU OpenSubtitles): 7% индивидуально-верных пар неверны в контексте; окно 3 предложений поднимает deixis 50.0→81.6, лексич. когезию 45.9→58.1, VP-эллипсис — существенно. Домен — субтитры (разговорный), не проза; магнитуды индикативны.
- «Потерянное в середине» ограничивает лишь ВЕРХНИЙ конец кривой (целая глава / много чанков); на нашем ~1500-ток чанке эффект мягкий и НЕ объясняет текущие дефекты — это довод не прыгать к «глава целиком», а не диагноз. [CONFIRMED] — Liu et al., Lost in the Middle (TACL 2024; arXiv 2307.03172).
- Ближайший индустриальный аналог нашего пайплайна — TransAgents (мультиагентная «переводческая компания», zh→en вебновеллы): работает ПО ГЛАВАМ с персистентной Translation Guideline (глоссарий+резюме+тон+стиль), роли Senior/Junior Editor + Proofreader сверх голого translate→edit. [CONFIRMED] — TransAgents (TACL; arXiv 2405.11804). Оговорка: под капотом GPT-4-Turbo (фронтир), не дешёвая модель; человеко-предпочтение — монолингвально (слепо к верности).
Претензия 1. Абзацы/конвенции — это КОНВЕНЦИЯ ЯЗЫКА, академически кодифицированная, а не авторский стиль
Прямой ответ на вопрос владельца — ДА, это норма русского языка, а не стиль одного автора:
- Русский абзац — логико-смысловая единица, группирующая несколько предложений вокруг завершённой мысли; новый абзац — при логическом завершении мысли / смене темы-времени-места-говорящего. Построчно-однопредложенческое тело — по определению НЕ русское абзацирование. [CONFIRMED] — Текстология.ру, «Абзац как часть текста»; корпус-норма подтверждена независимо.
- Диалог: каждая реплика — с красной строки через тире; кавычки для бегущего диалога не используются. Слова автора — строго кодифицированная пунктуация (двоеточие/запятая-тире и т.д.). [CONFIRMED] — Розенталь, «Справочник», §47/§50 (Оформление прямой речи); Правила-1956 §195. (Источники — веб-зеркала Розенталя; нумерация разнится по изданиям.)
- Китайская вебновелльная вёрстка расходится с РЯ по всем осям: отступ (U+3000×2, правило Ху Ши 1919), полноширинная пунктуация, диалог в 引号 «“ ”», привычка очень коротких абзацев (часто одно предложение / 自然段 для мобильного ритма). [CONFIRMED] — Wikipedia «Chinese punctuation» + история.
Ключевой синтез: корректный zh→ru reflow — это структурный трансформ из ЧЕТЫРЁХ операций, а не одна инструкция «не копируй разбивку»: (a) СЛИЯНИЕ подряд идущих коротких нарративных строк в многопредложенческие логические абзацы; (b) КОНВЕРСИЯ 引号-диалога в тире-абзацы по репликам; (c) НОРМАЛИЗАЦИЯ глифов (полн.→полуширинные, “ ”→« », — для речи); (d) СНЯТИЕ -отступа. Операции (b),(c),(d) — ДЕТЕРМИНИРОВАННЫЕ (код, без модели); операция (a) требует ДИСКУРСНОГО понимания, чем сцепляет претензию 1 с претензией 2. [CONFIRMED как рамка]
Почему инструкция игнорируется и чем чинить:
- LLM surface-копирует построчную структуру входа (переводы строк — высокосалиентные, near-синтаксические признаки; структурная персистенция), поэтому bilingual-редактор зеркалит one-sentence-per-line черновика. [PLAUSIBLE] — Sclar et al. (2024, 2310.11324, format-sensitivity) — аналогия, не прямой замер layout.
- Гипотеза «негативный констрейнт («не копируй») сам по себе — главная причина» — REFUTED: доказательства backfire негативных констрейнтов — слабые препринты про подавление англ. СЛОВ, не про zh→ru layout. [PLAUSIBLE→REFUTED]
- Самый надёжный рычаг — few-shot экземпляры (рубленый источник/черновик → слитый многопредложенческий целевой абзац), и особенно target-side якорь (реальный русский литературный абзац в контексте), т.к. модель копирует структурные решения из демонстраций. [PLAUSIBLE] — FollowBench (2024, 2310.20410) — смежная опора.
- Отделить «дать верную русскую прозу» от «разложить в абзацы» (отдельный reflow/layout-пасс или plan-then-write): инлайн-энфорсмент формата конкурирует с контент-целью; прирост измеримый, но скромный, +1 LLM-вызов. [PLAUSIBLE] — 2510.03595 (препринт).
- Осторожно: слияние предложений и укрупнение контекста ПОВЫШАЮТ риск ОПУЩЕНИЙ и путаницы атрибуции — агрессивный reflow сам может терять/скремблить смысл; нужен guard полноты. [CONFIRMED] — Karpinska & Iyyer (WMT 2023).
Претензия 2. Понимание связей/смысла на дистанции
- Корневая причина — кросс-чанковая ИЗОЛЯЦИЯ. Впрыск даже малого контекста (предыдущий src/tgt-хвост + running bilingual summary + реестр имён/антецедентов) даёт большие замеренные приросты consistency и дискурса — на ТОМ ЖЕ домене (китайские вебновеллы). [CONFIRMED ядро] — DelTA (ICLR 2025, peer-reviewed; arXiv 2410.08143): память-тиры (Proper-Noun Records, running summary), GuoFeng zh→en; средний прирост согласованности +4.58 (заголовочный +48.5 — единичный best-case). Оговорка: не →ru; часть опор — препринты.
- zh-специфика: нулевые/опущенные местоимения и субъекты (zero anaphora) — доминирующий драйвер провала на дистанции; русский (non-pro-drop, согласование род/число) требует ЭКСПЛИЦИТАЦИИ, а антецедент часто в ПРЕДЫДУЩЕМ предложении → корректное восстановление структурно НЕВОЗМОЖНО при поч-чанковой изоляции. [CONFIRMED, что это архитектурный, а не только «дешёвая модель», баг]. Голая инструкция «будь внимателен» почти не помогает; чинит только явный контекст/аннотация. [PLAUSIBLE] — препринт 2605.31056 (zh→en: <50% ZP базово, oracle-разметка +40 пт); экстраполяция на →ru.
- Глоссарий — слабейшая кросс-чанковая память: адресует только лексическую когезию (~14% русских дискурс-ошибок), мимо deixis (~37%) и эллипсиса/морфологии (~29%). [CONFIRMED] — производно от Voita et al. (ACL 2019). Значит от глоссария в одиночку прироста связности ждать мало.
Ранжирование лекарств претензии 2 (эффект / стройка):
- Running bilingual summary + previous-chunk carryover — лучший НЕистраченный рычаг: замерен прямо на китайских вебновеллах (DelTA), стоит ~1 малый вспом-вызов на ~20 предложений; source-primed контекст предпочтительнее переиспользования прошлого МАШИННОГО перевода (последнее роняет качество из-за накопления ошибок). [CONFIRMED направление / PLAUSIBLE магнитуда для →ru]
- Document/paragraph-level контекст — лучший по доказательности, но у нас уже ПОТРАЧЕН (единица крупная).
- Аннотатор (MAPS-класс: ключевые слова/тема/демо) — снижает локальную mistranslation, но SENTENCE-level, требует 3-4 кандидата + QE-выбор (3-4× цена), бьёт по локальной адекватности, не по дальней связности. [PLAUSIBLE]
- Сильнее модель — крупнейший одиночный рычаг на дискурс, но лобовой конфликт с дешёвым COGS; контекст+память дают дешёвой модели закрыть бóльшую часть разрыва. [PLAUSIBLE]
- Self-refine / итеративный пост-эдит — СПОРНО для MT: полирует fluency/translationese, даёт скромный прирост и лишь при внешнем error/QE-сигнале, смещён «в английский», может деградировать/галлюцинировать на итерациях; связность, к которой модель НЕ имела доступа, не восстановит. [CONFIRMED, что спорно] — Chen et al. (EAMT 2024, TEaR) + др.
Ось 4. Кривая chunk ↔ качество ↔ биллинг ↔ ретраи (рамка для пре-регистрации)
- Форма — перевёрнутая U: снизу ограничена потерей когезии у слишком мелкой единицы (Karpinska), сверху — базово-модельной/позиционной деградацией у слишком крупной (Lost-in-Middle; для НЕ-дообученных инструкт-моделей качество ПАДАЕТ с ростом единицы — 2504.12140, препринт, малые модели). [PLAUSIBLE]
- COGS доминируется ВЫХОДНЫМИ токенами, + «фертильность» русского/кириллицы на англо-центричных токенизаторах (~2–2.5× англ.). Значит КАЖДЫЙ добавленный русско-генерящий LLM-пасс множит доминирующую статью; префикс-кэш скидывает лишь дешёвый ВХОД. [CONFIRMED] — Petrov et al. (NeurIPS 2023, tokenizer fairness) для фертильности.
- Префикс-кэш делает пере-слание system+glossary почти бесплатным — НО только если статику класть ПЕРВОЙ, а volatile-контекст (running summary, меняющийся каждый чанк) ПОСЛЕ неё (любой volatile-префикс инвалидирует кэш ниже). Тогда worry «глоссарий шлётся каждый чанк» — почти не-проблема. [CONFIRMED для наших провайдеров с оговоркой ordering]
- Retry blast radius тянет оптимум к МЕНЬШЕЙ единице (переген всего чанка при мисматче) — центральное напряжение против качественного тяготения к крупной; оптимизировать надо на RETRY-ADJUSTED output-cost, а связность подавать глубиной кэшированного carryover, а НЕ размером единицы. [PLAUSIBLE]
- Вывод оси 4: ОТВЯЗАТЬ дискурс-единицу от биллинг-единицы: держать чанк небольшим (дёшево, малый blast radius, меньше output-деградации), а когезию давать кэшированным summary/carryover.
A4. Оси, которые команда могла не увидеть (приоритетно)
- Пост-черновая регрессия > многих «качественных» проблем. Санитайзер/редактура местами уничтожают годный черновик (гл.5 обнулён; CJK-утечки; правки-перевороты смысла). Дешевле всего: гейт «финал не должен быть пустым/короче черновика на X%», «нет сырых CJK-глифов в выводе», «числа/термины из черновика не переворачиваются». Это адресует «слабую художественность» БЕЗ новой машинерии. [CONFIRMED наблюдение]
- Reflow ЧАСТИЧНО БЕСПЛАТЕН. Операции (b)/(c)/(d) 4-операционного трансформа — детерминированные (код-нормализация глифов/диалога/отступа); только (a) слияние — дискурсная. Отделить дешёвое-детерминированное от дорогого-модельного. [CONFIRMED рамка]
- Метрика-инверсия для zh→ru — конкретно, не абстрактно. На WMT24 zh→ru простой Google-NMT обошёл ВСЕ LLM/мультиагентные системы по d-BLEU (human-eval отсутствовал) — прямая same-pair демонстрация, что гейтинг художественности на авто-метрике ИНВЕРТИРУЕТ ранжирование. Следствие: претензию 1 сложить в дешёвый ДЕТЕРМИНИРОВАННЫЙ структурный KPI; художественность/связность — не на BLEU/COMET. [PLAUSIBLE — источник WMT24 zh→ru; точный URL — к сверке оркестратором]
- Пара-конвенции как переиспользуемый ВЕРСИОНИРУЕМЫЙ слой (идея владельца). Отделить (a) конвенции ПАРЫ ±жанр [zh→ru: паратаксис→гипотаксис, красная строка, тире, эксплицитация опущенных местоимений, политика 成语] — глобальный версионируемый ассет, ключ (src→tgt[×регистр]); (b) память КНИГИ (глоссарий/голоса) — как сейчас; (c) ручки прогона (venuti/honorifics). Грузонесущее свойство — версионирование+снапшот-фолд (смена = громкая ре-трансляция, как
chunkerVersion), а не носитель (config-ассет или таблица БД). Есть прямая zh→ru (не экстраполяция) peer-reviewed прескрипция: 5 техник передачи китайских паратактических предложений в русский — (1) построить иерархию в русском, (2) сегментировать по смысловым единицам, (3) промаркировать вид/время предикатов по нормам РЯ, (4) варьировать лексику, (5) добавлять связки по контексту. [CONFIRMED] — Ван Цуй, «Анализ китайских паратактических предложений и их перевода на русский язык», Вестник МГУ Сер. 22 (Теория перевода). Русский-специфичный инструментарий слияния — причастные/деепричастные обороты + подчинительные союзы.- Открытая развилка (к замеру, не приговор): РАЗМЕР/ФОРМА пакета = вопрос «способность vs активация»; большой правилник может жечь токены и размывать внимание, если знание латентно; возможно, короткий указатель или 1–2 few-shot экземпляра бьют точнее. Ключ может быть пара×жанр. Пакет должен нести ОГРАНИЧИТЕЛИ против коллизии с инвариантом полноты (слияние/эксплицитация — на грани «добавления»).
- Способность vs активация — диагностический арм. Один и тот же reflow-промпт × дешёвая vs фронтир-модель: фронтир верстает, дешёвая нет → gap способности; ни та ни другая → недоспецифицированный промпт; краткое правило/пример чинит дешёвую → это была активация. Разводит «модель не умеет» от «модель недоактивирована».
- Бюджет чанка — в ВЫХОДНЫХ токенах на реальном токенизаторе (DeepSeek/GLM), а не в zh-символах; пере-калибровать под фертильность кириллицы и стабильный output-потолок модели (~3–4k ток у мелких — раньше). [CONFIRMED довод] — Petrov et al. (NeurIPS 2023).
- Разметка нулевых местоимений/кореференции исходника как дешёвый препроцесс перед переводом (zh zero-pronoun → явная маркировка): oracle-разметка стоит +40 пт там, где инструкции ~ничего. [PLAUSIBLE, zh→en, экстраполяция на →ru]
- DocRepair-класс: монолингвальный РУССКИЙ reflow/repair-пасс, который НЕ видит китайский, а чинит связность/абзацы уже переведённого + контекст соседей (это шаг Найды «реструктуризация»). EN→RU: deixis 50.0→91.8, лексич. когезия 45.9→80.6, эллипсис-флексия 53.0→86.4; аннотаторы предпочли 73%. [CONFIRMED для EN→RU] — Voita et al. (ACL 2019, DocRepair). Это отделяет fluency/layout-работу от fidelity-работы.
A5. Гипотеза-резюме §A (моя карта до чтения нашего стека)
- «Слабая художественность» = сумма ТРЁХ, не двух, слоёв: (i) пост-черновая регрессия (санитайзер/редактура ломают годный черновик) — вероятно, самый дешёвый и недооценённый; (ii) рубленость = source-mirroring + инертная инструкция, чинится дёшево смесью детерминированной нормализации + few-shot/target-anchor + (возможно) отдельного layout-пасса; часть рубленостей (слияние) — дискурсная и сцеплена с (iii); (iii) связность на дистанции = архитектурный баг изоляции чанков + zh zero-anaphora; лучший дешёвый рычаг — running bilingual summary + prev-chunk carryover (кэш-дружественно), НЕ глоссарий и НЕ self-refine.
- Потолок текущей фазы — в ОРГАНИЗАЦИИ (контекст/память/промпт/нарезка/пост-обработка), не в сырой дешёвой модели; переход на фронтир — рычаг, но не первый по эффективности-на-стройку.
- Измерять: претензию 1 — дешёвым ДЕТЕРМИНИРОВАННЫМ структурным KPI (без судьи); претензию 2 — судья/QA-стиль (TREQA) или дешёвый человеко-протокол (ESA); НИКОГДА не гейтить художественность на BLEU/COMET (для zh→ru доказана инверсия); беречься «сфабрикованной сходимости» судей (устанавливать независимость до агрегации).
§B — Дифф: §A против нашего стека (и параллельного ChatGPT-отчёта)
B0. Метод и главный результат диффа
§A заморожена (sha256 44f90364…) ДО чтения: 05-decisions-log (D1–D35), research/07/15/16, exp04/09/12/13, и параллельного research/18-quality-levers-chatgpt.md. Главный результат: тройная независимая сходимость. Три пути — (i) моя §A (сырьё+внешняя литература), (ii) ChatGPT-§A (тоже заморожена до стека, sha256 b42c6f6e…), (iii) эмпирический стек команды (D26→D35) — сошлись на диагнозе и на большинстве рычагов. Это сильное подтверждение. Оговорка против сфабрикованной сходимости (D25.10/D32.4): независимы попарно ПУТИ (я не читал ChatGPT до заморозки; обе §A заморожены до стека; команда пришла эмпирикой), но нога «внешняя MT-литература» ОБЩАЯ у меня и ChatGPT — совпадения там ≠ три независимых голоса. Поэтому ценность §A не в «ещё раз то же», а в остатке: где я расхожусь и что добавляю (B2), плюс честные само-поправки (B3).
B1. Где §A СОШЛАСЬ с командой (команда угадала — не дублировать, подтвердить)
| §A-ось | У команды уже есть | Статус |
|---|---|---|
| Reflow зеркалит рубленость исходника = промпт-рычаг | D35.1 дословно; D30.2 снял «сохраняй разбивку», мандат репараграфизации | ✅ угадано |
| Within-chunk (промпт-фиксимо) vs cross-chunk (Ф2) | D35.1 (чанк пакует ~34 абз. / ~1.28 стыка на главу) | ✅ угадано |
| Ось «нарезка × промпт» — ключевой невыжатый рычаг | D35.3 (exp04/12/13 крутили только МОДЕЛЬ) | ✅ угадано |
| Source-line strip как рычаг претензии 1 | exp12:174 уже предлагает снять построчную разбивку | ✅ угадано (моя §A НЕ первая) |
| Русские нормы абзаца/диалога с первоисточниками | research/16 §2.3: Розенталь §52-53, Лопатин ПАС §138, Правила-1956 §51; тире-flagger | ✅ угадано (полнее, чем §A знала — см. B3) |
| Running summary / annotator / межглавные резюме | Ф2: DelTA-обоснован (D21, D30.8); exp09-M2 = «глоссарий+скользящее резюме» уже арм | ✅ угадано (как Ф2/пилот-арм) |
| Output-санитайзер / пост-черновые порчи | D30.3/D33/D33.1 (утёкшие преамбулы, латиница, markdown) | ✅ угадано |
| Пустые финалы ch5/ch20 (моя «третья ось») | D35.4a: известный экспорт-баг (санитайзер флагает ведущий ###, экспорт дропает) |
✅ угадано (см. B3) |
| Сырой китайский 甲乙丙丁/资质 в глоссарий | D35.4c (глоссарий-адресуемая часть претензии 2) | ✅ угадано |
| Декаплинг дискурс-единицы от биллинг-единицы | D35.7 (draft=чанк/edit=глава, runner-уровень) |
✅ угадано |
| Метрика: детерминированный структурный KPI + judge-дисциплина | D29.1d диалог-flagger; 07:86 translationese-метрики; D13.3 панель; D25.10/D32.4 анти-сходимость; D30.1 span-судья | ✅ угадано (команда МЕТОДИЧЕСКИ впереди) |
| Frontier-арм как диагностика потолка ≈ capability-vs-activation | D35.3 | ✅ угадано |
| Промптинг литперевода (task-framing, few-shot по классам, sandwich, no manual CoT, «plan+translate в одном вызове не армить») | research/15 §1.2/§3 обширно | ✅ угадано (АУГМЕНТИРОВАТЬ, не дублировать) |
Вывод B1: команда угадала правильно почти всю карту. Диагноз D35 = моя §A. Это повышает доверие, что «строить» надо по этой карте — но и снижает новизну §A; реальная ценность — в B2.
B2. Где §A РАСХОДИТСЯ / команда недостроила (несущий остаток)
- zh→ru ДИСКУРС-ТРАНСФОРМ как переводческая теория — самая тонкая ось стека. research/16 grounds РУССКУЮ сторону (нормы абзаца/диалога) и на уровне ВЫРАВНИВАНИЯ отмечает китайский паратаксис (Xue&Yang ACL 2011, ~16.6% запятых — границы), но нет переводоведческой рамки zh→ru: паратаксис→гипотаксис (意合/形合), 流水句, обязательность сращивания. Критично: research/16 §2.3 считает слияние (N:1) «дискреционным стилем, не нормой» — а прямая zh→ru peer-reviewed прескрипция (Ван Цуй, Вестник МГУ Сер.22) говорит: пересборка паратактической цепи в русскую иерархию ОБЯЗАТЕЛЬНА (5 техник: иерархия / сегментация по смыслу / вид-время / лексика / добавление связок), а инструмент — причастные/деепричастные обороты + подчинение. Это апгрейдит «слияние дискреционно» → «слияние — требуемая дискурс-операция, и вот КАК». Даёт reflow-промпту реальный zh→ru СОДЕРЖАНИЕ, а не «не копируй разбивку». [CONFIRMED; прямой источник, не экстраполяция] — самый сильный вклад §A, прямо отвечает на вопрос владельца «это конвенция языка, а не стиль автора».
- Слой «пакет конвенций пары» как ВЕРСИОНИРУЕМЫЙ артефакт (идея владельца) — структурный пробел. research/07 держит конвенции пары как КОНТЕНТ (Палладий/Поливанов, Venuti, Нора Галь), но «разбросаны как brief/config-политики, отдельного слоя нет» (вывод фазы-2). Отделить (пара±жанр) от (книга) от (прогон); ключ (src→tgt[×регистр]); снапшот-фолд как
chunkerVersion. Не носитель, а версионирование — грузонесущее. → §C-архитектура. - Running summary — переоценить для near-term, не только пилот. Команда СОЗНАТЕЛЬНО не строит LLM-резюме (research/15: «DelTA платит вызовами — мы нет», COGS-козырь); имеет лишь детерминированную инъекцию срезов памяти (Aho-Corasick) + M2-арм в пилоте. Но DelTA даёт бенефит именно бегущим резюме на ТОМ ЖЕ домене (вебновеллы), а COGS-возражение слабеет при кэш-дружественном ordering (резюме — 1 малый вызов на ~20 предложений, вход near-free при префикс-кэше). → предлагаю мерить running summary как near-term рычаг претензии-2-кросс-чанк, не хоронить на COGS до замера.
- DocRepair-класс (монолингвальный РУССКИЙ repair-пасс) с числами В РУССКИЙ. ChatGPT тоже флоатит «отдельный target-only пасс», но без into-ru доказательств; у меня Voita 2019 EN→RU: deixis 50→91.8, когезия 45.9→80.6. Опция для op(a)+связность отдельно от билингв-fidelity-редактуры (editor-mono.md существует, но DORMANT — D33.4a). [CONFIRMED для EN→RU]
- Стоимостная строгость: фертильность-налог + cache-ordering + перевёрнутая-U. ChatGPT имеет формулу+retry-множитель; команда — exp08+чанкер-конст+D35.6-арм. Добавляю: COGS output-доминирован + кириллица-фертильность ~2–2.5× (Petrov NeurIPS 2023) → бюджет чанка в ВЫХОДНЫХ токенах на реальном токенизаторе, не zh-символах; cache-ordering (статик первым, volatile-summary после — иначе кэш бьётся); перевёрнутая-U (когезия снизу, позиционная деградация сверху).
- Метрика-инверсия zh→ru — конкретный датапоинт. WMT24 zh→ru: Google-NMT обошёл все LLM/мультиагент по d-BLEU без human-eval → не гейтить художественность на авто-метрике (у команды дисциплина есть, конкретного zh→ru датапоинта — нет). [PLAUSIBLE — URL к сверке]
B3. Само-поправки §A после чтения стека (честно)
- ch5.0 «санитайзер обнулил чанк» → НЕТ: экспорт-баг D35.4a. Санитайзер ФЛАГАЕТ ведущий
###, а экспорт дропает флагнутый чанк в пустоту вместо strip/fallback; текст правки ЦЕЛ. Класс тот же (пост-черновая порча), но механизм — экспорт, не санитайзер-void. Команда уже поймала (полигон обязан починить ch5/ch20 до слепых пакетов). - «команда не заземлила reflow в Розенталя» → неверно. research/16 заземлила РУССКУЮ сторону (Розенталь §52-53, Лопатин, Правила-1956). Точный пробел уже — zh→ru ТРАНСФОРМ-сторона (B2.1), не русские нормы.
- source-line strip как «новый рычаг» → не новый: exp12:174 уже предлагает. §A-статус «оси, что могли не увидеть» для этого пункта снимаю.
B4. Дифф против параллельного ChatGPT-отчёта (чтобы не дублировать)
Сходятся (обе независимые §A): source-strip, discourse-move few-shot, look-behind/look-ahead (особ. для zh нулевого подлежащего), chapter-card, декаплинг трёх единиц (coverage-atom ≠ generation-unit ≠ reference-span), perturbation-тест (correct vs random context) как центральная метрика, детерминированный структурный KPI, model-floor 2×2, «whole-chapter только как диагностический потолок», retry-adjusted cost. Совпадение двух независимо-замороженных §A — корроборация (с оговоркой общей лит-ноги B0).
Мой маргинальный вклад СВЕРХ ChatGPT: (1) zh→ru академ-грунтинг Ван Цуй/паратаксис-гипотаксис — ChatGPT ЯВНО пишет «zh→ru якорей нет»; (2) версионируемый слой пары; (3) DocRepair into-ru числа; (4) фертильность-налог + cache-ordering; (5) метрика-инверсия zh→ru. ChatGPT сверх меня: развёрнутая two-stage eval-схема (Stage I причинная проба на 6–8 ловушках / Stage II слепые 3 финалиста), «дискурсный пакет» как generation-unit, трёх-единичная факторизация — ценно, рекомендую взять в §C (не переизобретаю, ссылаюсь).
§C — Рекомендации для полигона (таблица-вход эмпирической сессии D35.6)
Формат: {механизм → как измерить → цена → эффект на претензию → фаза}. Явно разведено: СЕЙЧАС (промпт/нарезка/глоссарий/детерминированный код, без Ф2-машинерии) vs Ф2 (память/аннотатор/reference-тома). Строки согласованы с осями D35.6 (нарезка×промпт, frontier-арм, кривая размер↔качество↔биллинг↔ретраи, fidelity re-gate, слепые пакеты) и с методик-guard D32.4 (fidelity-first, leave-one-out, катастроф-скрин, per-call кап, независимость сигналов).
C1. СЕЙЧАС — промпт/нарезка/глоссарий/детерминированный код
| # | Механизм | Как измерить (арм/проба) | Цена | Эффект → претензия | Фаза |
|---|---|---|---|---|---|
| 1 | Дискурс-reflow промпт с zh→ru СОДЕРЖАНИЕМ (5 техник Ван Цуй: иерархия/сегментация/вид-время/лексика/связки; причастные-деепричастные обороты; Розенталь-диалог) вместо «не копируй разбивку» | Структурный KPI (распределение предложений/нарратив-абзац vs русский референс) + слепое чтение; арм × (чанк|глава) — ось нарезка×промпт | ~0 (промпт) | Претензия 1 (+сцеплённая часть 2) | Сейчас |
| 2 | Discourse-move few-shot (рубленый→слитый; target-side русский якорь; diversity-подбор ≤5 — research/15 few-shot-дисциплина) | Тот же KPI + fidelity re-gate (omission-guard: слияние повышает опущения) | +вход-токены (кэшируемо) | Претензия 1 | Сейчас |
| 3 | Source-line strip / deformat черновика до редактора (убрать зеркалящий cue) | A/B тот же KPI — изолирует построчный cue (exp12:174) | ~0 (детерм.) | Претензия 1 | Сейчас |
| 4 | Детерминированный reflow-постпроцессор ops (b)+(c)+(d): тире-диалог + нормализация глифов (полн.→полу, “”→«», —) + снятие + strip markdown-### |
CJK-глиф=0 гейт; диалог-парность-flagger (D29.1d) | ~0 (код) | Претензия 1 + утечка CJK-глифов | Сейчас |
| 5 | Guard пост-черновой регрессии: финал не пуст / не короче черновика на X% / нет сырых CJK / числа-разряды не переворачиваются vs черновик | Детерм. гейт + fidelity re-gate (D34.3) | ~0 (код) | «Третья ось» (вкл. экспорт-баг ch5/ch20 D35.4a) | Сейчас |
| 6 | Глоссарий: засев сырых 甲乙丙丁/资质 (D35.4c) | Term-coverage post-check | ~0 | Претензия 2 (глоссарий-адресуемый срез) | Сейчас |
| 7 | ±1 reference-контекст (хвост пред-target + пред-source + след-source до границы сцены, НЕ переводится) | Кросс-граница trap-accuracy + perturbation (correct vs random context не должен совпасть); факторить prev-target/prev-source/next-source ОТДЕЛЬНО | +вход-токены (кэш); вопрос рендера (§D-7) | Претензия 2 near-term | Сейчас-ish |
| 8 | Кривая нарезки: (0.75k/1.5k/3k/глава) × (жадная упаковка | сцен-граница) на retry-adjusted output-token cost; бюджет в ВЫХОДНЫХ токенах (кириллица-фертильность Petrov) | Пре-регистрация: in/out/reasoning-токены, латентность, retry-rate ПО ПРИЧИНАМ, re-billed доля, coverage, слепое предпочтение, KPI-абзацы, trap-теги | Эксперимент | Обе + стоимость | Сейчас (диагностика) |
| 9 | Capability-vs-activation / model-floor 2×2 (слабая/сильная × текущий/дискурс-промпт) + арм краткой инъекции правил | Trap-closure на 2×2; фронтир-арм = диагностика потолка (модели vs организация); гарды D22.5 (эхо-скрин, self-family exclusion) | Фронтир $ (владелец согласовал) | Диагностика (потолок) | Сейчас |
| 10 | Автоматическая оценка качества (запрос владельца): претензия 1 = детерм. KPI (без судьи); претензия 2 = span-цитирующий билингв-судья + comprehension-QA (TREQA) + perturbation | Guard: leave-one-out, family-exclusion, per-call кап, НИКОГДА не гейтить художественность на BLEU/COMET (zh→ru инверсия WMT24); владелец кросс-чек ChatGPT+вручную | Судья-вызовы (кэш) | Инфра замера обеих | Сейчас |
C2. НУЖНА Ф2-машинерия
| # | Механизм | Как измерить | Цена | Эффект → претензия | Фаза |
|---|---|---|---|---|---|
| 11 | Running bilingual summary + реестр сущностей/антецедентов (DelTA-класс) | exp09-memory-eval M2 + кросс-чанк trap; cache-friendly ordering | +1 малый вызов/~20 предл. (вход near-free при кэше) | Претензия 2 кросс-чанк | Ф2 (пере-взвесить vs COGS-депри research/15 — B2.3) |
| 12 | Chapter card (сущности/связи/цель/место/время/нерешённые ссылки из 1 пред-чтения главы) | Кросс-чанк trap; сравнить с #11 (компактная ручная карта должна доказать лифт ДО авто-памяти) | 1 пред-чтение/глава | Претензия 2 | Ф2-lite (сходится с ChatGPT) |
| 13 | Пре-аннотация нулевых местоимений/кореференции исходника | Trap-accuracy на ZP-кейсах | Аннотатор-пасс | Претензия 2 (zh-специфика) | Ф2 |
| 14 | Отдельный монолингв. РУССКИЙ reflow/repair-пасс (DocRepair) vs комбинированный редактор | A/B: один редактор vs (билингв-семантика→target-only-reflow) под coverage-гейтом | +1 пасс (target-only дешевле) | Претензия 1 op(a) + связность | Ф2 / арм сейчас |
C3. Архитектура (зона оркестратора/бэкенда — предложение, не приговор)
| # | Механизм | Как измерить/решить | Фаза |
|---|---|---|---|
| 15 | Слой «пакет конвенций пары» (идея владельца): контент = 5 ops Ван Цуй + русские нормы + Палладий; ключ (src→tgt[×жанр]); снапшот-фолд; несёт ОГРАНИЧИТЕЛИ против инварианта полноты; РАЗМЕР/ФОРМА (короткий указатель vs правилник vs few-shot) = исход арма #9/#1-2 | Reflow-промпт-армы #1-2 И ЕСТЬ проба размера/формы пакета; финальное размещение — оркестратор/бэкенд под доказанный ROI (Р2/D30.7) | Дизайн сейчас, стройка под ROI |
Рекомендую взять из ChatGPT-отчёта (не переизобретаю): two-stage eval (Stage I причинная проба на 6–8 ЛОВУШКАХ вместо «средних глав» / Stage II слепые 3 финалиста), «дискурсный пакет» как generation-unit, факторизацию трёх единиц.
§D — Вопросы, на которые не хватило данных
- Где именно живёт опорный контекст провалов связности владельца — в-чанке / пред / след / вся-глава / мир-знание? D35 даёт ~1.28 стыка/глава, но НЕ размечено. Без размеченного trap-набора нельзя выбрать между #7/#11/#12. (Флагаю и я, и ChatGPT.) — первично для полигона.
- Магнитуда в РУССКИЙ. Вся несущая внешняя эмпирика (Karpinska, DelTA, DocRepair, zero-pronoun) — into-English/EN→RU-экстраполяция; единственный zh→ru замер даст полигон (фронтир+дешёвый армы). Пометка обязательна на каждом клейме.
- Размер/форма пакета конвенций (#15) = вопрос «способность vs активация» — не решён до 2×2 (#9) + инъекц-армов (#1-2).
- Коллизия слияния/эксплицитации с инвариантом полноты на практике — semantic-atom-coverage vs sentence-count; нужен omission-guard-замер (#2/#5).
- COGS running-summary при кэше — стоит ли бенефит DelTA доп-вызова на наших ценах при cache-ordering (пере-взвесить депри research/15).
- Retry-rate q(c) по типам провала на размер чанка на живых дешёвых моделях — не замерено; нужно для retry-adjusted-кривой (#8).
- Рендер: может ли runner подать соседний src/tgt как non-output reference без нового persistent-домена? Определяет, #7 — это PROD-MINOR или Ф2 (вопрос бэкенду).
- Владельцу: допустимая степень синтакс-слияния/дробления; считается ли front-matter в художественную приёмку (из ChatGPT §D — решение владельца).
§E — Источники (URL + дата + тип), несущие клеймы
Тип: PR peer-reviewed · PP preprint (не peer-review) · STD норм.-стандарт · DOC офиц./вендор-дока · BLOG/OTH блог/вторичное. Дата — публикация/доступ. Верификатор открывал ключевые (WebFetch); часть zh-источников по 403 — сверена сниппетами (помечено в §A/§B).
Дискурс-гранулярность / doc-level (Ось 1):
- [PR 2023] Karpinska & Iyyer, LLMs Effectively Leverage Document-level Context for Literary Translation, WMT2023 — https://aclanthology.org/2023.wmt-1.41/ · arXiv https://arxiv.org/abs/2304.03245
- [PR 2019] Voita et al., When a Good Translation is Wrong in Context (context-aware EN→RU; спутник DocRepair) — https://aclanthology.org/P19-1116/
- [PR 2024] Liu et al., Lost in the Middle (TACL) — https://aclanthology.org/2024.tacl-1.9/
- [PR 2021] G-Transformer for Doc-Level MT (ACL) — https://aclanthology.org/2021.acl-long.267/
- [PP 2024-07] Towards Chapter-to-Chapter Context-Aware Literary Translation — https://arxiv.org/html/2407.08978
- [PP 2025-04] Multilingual Contextualization of LLMs for Doc-Level MT (2504.12140; inverted-U, N=3 контекст) — https://arxiv.org/abs/2504.12140
- [PP 2024-12] Investigating Length Issues in Doc-Level MT — https://arxiv.org/abs/2412.17592
- [PP 2025-06] Beyond the Sentence: Survey on Context-Aware MT with LLMs — https://arxiv.org/abs/2506.07583
Мультиагент/прайор-арт + fan/commercial:
- [PP 2024-05] TransAgents, (Perhaps) Beyond Human Translation (TACL-версия) — https://arxiv.org/abs/2405.11804
- [PR 2024-10] DelTA (ICLR 2025; multi-level memory, running summary) — https://arxiv.org/abs/2410.08143 · https://openreview.net/forum?id=hoYFLRNbhc
- [PP 2024-12] DRT, Deep Reasoning Translation via long CoT — https://arxiv.org/abs/2412.17498
- [PR 2023] GuoFeng-Webnovel (zh↔ru/de, V2 без sent-align) — https://github.com/longyuewangdcu/GuoFeng-Webnovel
- [DOC 2024] py3TranslateLLM (LLM=paragraph, NMT=line) — https://github.com/gdiaz384/py3TranslateLLM · [DOC 2026-07] DeepL split_sentences — https://developers.deepl.com/api-reference/translate · [VEND 2023] DeepL context param — https://www.deepl.com/en/blog/deepl-api-context-parameter · [VEND 2026] TeaNovel (consistency drift; full-chapter) — https://read.teanovel.com/blog/how-to-translate-chinese-novels-with-ai
Претензия 1 — русские нормы + reflow-механика:
- [DOC 2026-07] Розенталь §47 прямая речь — http://old-rozental.ru/punctuatio.php?sid=155 · §52 диалог — http://old-rozental.ru/punctuatio.php?sid=160 · §50 слова автора — https://evartist.narod.ru/text1/52.htm
- [STD 1956] Правила русской орфографии и пунктуации, знаки при прямой речи — https://gramota.ru/biblioteka/spravochniki/pravila-russkoj-orfografii-i-punktuacii/znaki-pri-pryamoj-rechi · [DOC 2026-07] Грамота, оформление диалога — https://gramota.ru/uchebnik/pravila/oformlenie-dilaoga
- [OTH 2026-07] Абзац как логико-смысловая единица — Текстология.ру — https://www.textologia.ru/russkiy/sintaksis/stroenie-texta/abzac-kak-chast-teksta-i-ego-funkcii/646/ · Абзац (по Мильчину) — https://rus-stylistics-dict.slovaronline.com/1-%D0%90%D0%B1%D0%B7%D0%B0%D1%86
- [OTH 2026-07] Chinese punctuation (полн. пунктуация, 引号, -отступ) — https://en.wikipedia.org/wiki/Chinese_punctuation
- [PR 2022] Structural Persistence in LMs (priming) — https://aclanthology.org/2022.tacl-1.60/ · [PR 2024] Sensitivity to Spurious Prompt Features (Sclar) — https://arxiv.org/abs/2310.11324 · [PR 2024] FollowBench — https://arxiv.org/abs/2310.20410
- [PP 2026-01] Semantic Gravity Wells: Why Negative Constraints Backfire (опора гипотезы негатив-констрейнта — REFUTED как главная причина) — https://arxiv.org/abs/2601.08070
- [PP 2025-10] Decoupling Task-Solving and Output Formatting — https://arxiv.org/abs/2510.03595
Претензия 2 — связность/zh-специфика + лекарства:
- [PP 2026-05] How Much Do LLMs Know About Chinese Zero Pronouns? (zh→en, <50% ZP базово, oracle +40) — https://arxiv.org/abs/2605.31056 · [PP 2023] Survey on Zero Pronoun Translation — https://arxiv.org/abs/2305.10196
- [PR 2024] MAPS, Exploring Human-Like Translation Strategy (аннотатор) — https://arxiv.org/abs/2305.04118
- [PR 2025] TEaR self-refine — https://aclanthology.org/2025.findings-naacl.218/ · [PP 2026-05] What Does LLM Refinement Actually Improve? Doc-Level (2605.13368; моно −2.2…−5.6 MQM) — https://arxiv.org/abs/2605.13368 · [PP 2024-02] LLM Amplifies Self-Bias in Self-Refinement — https://arxiv.org/abs/2402.11436
- [PP 2025-03] Source-primed Multi-turn Conversation Helps LLMs Translate Documents — https://arxiv.org/abs/2503.10494
zh↔ru контрастивная лингвистика (прямые/близкие):
- [PR 2024] Ван Цуй, «Анализ китайских паратактических предложений и их перевода на русский язык», Вестник (Теория перевода) — 5 техник — https://vestnik-translation.ru/articles/article/20081/ · [PR 2023] интерференция при переводе кит. лит-ры на русский (De Gruyter, cjss-2023-0017) — https://www.degruyterbrill.com/document/doi/10.1515/cjss-2023-0017/html
- [OTH 2022] Application of Hypotaxis/Parataxis in C-E Translation (意合/形合, Lian Shuneng) — https://www.davidpublisher.com/Public/uploads/Contribute/620da97031d45.pdf · [OTH 2023] English Translation Strategies for Chinese Run-on (流水句) — https://www.davidpublisher.com/Public/uploads/Contribute/654354525d198.pdf · [PR 2011] xinghe/yihe (Perspectives) — https://www.tandfonline.com/doi/abs/10.1080/0907676X.2010.514347
- [PR 2011] Topic-Comment in Mandarin (Li & Thompson) — https://www.researchgate.net/publication/235852523 · [OTH 2005] Курдюмов, теор. грамматика (топик-комментарий) — https://www.studmed.ru/kurdyumov-v-a-kurs-kitayskogo-yazyka-teoreticheskaya-grammatika_1d9fe4a728b.html
- [PP 2025-11] Predicate-Argument Divergences in Chinese-English (кит. +24% глаголов) — https://arxiv.org/abs/2511.09796 · [OTH 2026-07] Chengyu (96% четырёхзнак.) — https://en.wikipedia.org/wiki/Chengyu
Измерение качества:
- [PP 2025-04] TREQA (comprehension-QA eval) — https://arxiv.org/html/2504.07583v3 · [PR 2025] LITEVAL-CORPUS (MQM плох, BWS/SQ лучше) NAACL — https://aclanthology.org/2025.naacl-long.548/ · [PR 2023] GEMBA-MQM — https://aclanthology.org/2023.wmt-1.64/ · [PR 2024] xCOMET — https://aclanthology.org/2024.tacl-1.54/ · [PR 2024] ESA — https://aclanthology.org/2024.wmt-1.131/
- [PP 2026-05] Nine Judges, Two Effective Votes (корр. судьи) — https://arxiv.org/pdf/2605.29800 · [PP 2026-05] Creativity Bias (метрики против художественности) — https://arxiv.org/html/2605.13596 · [BLOG 2026-04] LLM-judge length/position/format bias — https://tianpan.co/blog/2026-04-27-llm-judge-bias-audit-length-position-format
Стоимость / нарезка:
- [PR 2023] Petrov et al., LM Tokenizers Introduce Unfairness Between Languages (кириллица-фертильность) — https://arxiv.org/pdf/2305.15425 · [BLOG 2023] интерактив — https://aleksandarpetrov.github.io/tokenization-fairness/
- [DOC 2024] DeepSeek Context Caching (cache-hit ~2% miss) — https://api-docs.deepseek.com/guides/kv_cache/ · pricing — https://api-docs.deepseek.com/quick_start/pricing
- [PP 2024-09] LongGenBench (output ~3–4k стабилен) — https://arxiv.org/html/2409.02076v7
Метрика-инверсия zh→ru (§A4.3 — теперь с URL):
- [PR 2024-12] Findings of WMT24 Discourse-Level Literary Translation — https://arxiv.org/abs/2412.11732 · task page — https://www2.statmt.org/wmt24/literary-translation-task.html · [BLOG 2025] разбор d-BLEU/стоимости — https://gonzoml.substack.com/p/perhaps-beyond-human-translation
(Полный список 125 верифицированных URL — в артефактах ресёрч-воркфлоу сессии; здесь — несущее подмножество.)
Errata источников (испр. оркестратором, D36):
- DocRepair — расщепить с P19-1116. Числа §A4.8/§B2.4 (deixis 50.0→91.8, когезия 45.9→80.6, эллипсис 53.0→86.4, 73% предпочтения) — из [PR 2019] Voita, Sennrich, Titov, Context-Aware Monolingual Repair for NMT (DocRepair), EMNLP-IJCNLP 2019 — https://aclanthology.org/D19-1081/ · arXiv https://arxiv.org/abs/1909.01383. Процитированная выше P19-1116 (ACL 2019) — статья-спутник, из неё число CADec 50.0→81.6 (§A3). Обе авторства одного трио; числа верны, атрибуция расщеплена.
- TransAgents — arXiv 2405.11804 = (Perhaps) Beyond Human Translation (accepted-but-preprint, «To appear at TACL»; §A-метка «TACL-версия» и §E-метка «PP 2024-05» — об одной статье, оставить одну). Это ОТДЕЛЬНАЯ статья от EMNLP-Demo 2024
2024.emnlp-demo.14(Build Your Translation Company…), процитированной параллельным ChatGPT-отчётом — не конфликт, две реальные статьи об одной системе. - Z5 — RG 235852523 = Dingxu Shi, Topic and Topic-Comment Constructions in Mandarin Chinese (Language 76(2), 2000), НЕ Li & Thompson (их канон — Subject and Topic 1976 / A Functional Reference Grammar 1981). Клейм топик-комментария верен; автор-метка исправлена.
- Z8 / R4 / R5 / P2 / CO5 — источники реальны, атрибуция частична: «96% чэнъюй» на цит. Wikipedia отсутствует (там «most»); -отступ/«короткие абзацы» — не на цит. Chinese-punctuation-стр. (конвенции реальны, стр. неточна); Structural-Persistence (TACL 2022) изучает СИНТАКСИЧЕСКИй прайминг, не копирование line-структуры (экстраполяция, отчёт помечает PLAUSIBLE); FollowBench (ACL 2024, не просто препринт) документирует ДЕГРАДАЦИю следования при накоплении констрейнтов — не «надёжный рычаг few-shot»; 2504.12140 подтверждает «мелкие инстракт-модели деградируют с ростом чанка», но «перевёрнутая-U / N=3-оптимум» — переформулировка (N=3 — фикс-конфиг, не найденный оптимум). Ни одна не рушит §C-арм — все меряются полигоном эмпирически.