TextMachine project repository (AI translation of literary books). Includes: v2 architecture decisions, MVP plan, research 01-12, polygon experiments 01-03, backend-session revalidation verdict (03-implementation-notes.md). Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
36 KiB
Готовые академические таксономии ошибок литературного MT → гейты, судья, телеметрия
Дата: 2026-07-04. Исследование для TextMachine (мультиагентный перевод zh/ja/en→ru). Цель — не изобретать классификацию ошибок: взять готовые таксономии (DITING, BlonDe, MQM/LitEval, LAIT, Karpinska & Iyyer, MTPE-типологии), извлечь определения и частоты и разложить каждую категорию по нашим механизмам: детерминированный гейт / поле банка памяти / LLM-судья / человек — с привязкой к фазам MVP (02-mvp-plan.md).
TL;DR
- DITING (arXiv:2510.09116) — единственный бенчмарк именно вебновелл (zh→en, 18 745 экспертных пар): 6 измерений — идиомы, лексическая многозначность, локализация терминов, согласованность времён, нулевые местоимения, культурная безопасность. Самое трудное для всех 14 моделей — восстановление нулевых местоимений; самое лёгкое — времена. Схема оценки 0–2 на метрику даёт κ=0.94 у «специфических» метрик против 0.84 у «общих» — узкие бинарные вопросы судье надёжнее просьб «оцени стиль».
- BlonDe (arXiv:2103.11878, NAACL 2022) даёт и метрику, и главную статистику: в document-level ошибках MT вебновелл 64.4% — инконсистентность (имена 43.3%, времена 38.7%), 20.3% — эллипсис (местоимения 17.3%), 7.3% — амбигуальность; три категории покрывают 86.7% дискурсивных ошибок. Категории BlonDe (entity/tense/pronoun/discourse markers) считаются детерминированно и портируются на русскую морфологию.
- MQM core (веса minor=1, major=5, non-translation=25, пунктуация=0.1; Freitag et al.) — стандарт индустрии, но LitEval (arXiv:2410.18697) показал: для литературы MQM работает только с экспертами (студенты «не отличили» 60% человеческих переводов от MT), а попарное сравнение (BWS) ловит человеческий перевод в 80–100% случаев. Категория Terminology в MQM-оценках коррелирует с итоговым качеством около нуля — консистентность терминов надо мерить отдельным детерминированным гейтом, а не судьёй.
- LAIT (arXiv:2606.26040, 2026) — читатели предпочитают человеческий перевод (67.6% чанков) за «гладкость» (28.2% причин), ясность атрибуции диалогов и естественный синтаксис; MT проигрывает на рваных/бесконечных предложениях и словарных кальках. Критично для нас: в переводе НЕ на английский человеческий перевод предпочтён в 92.8% — качество en-выхода LLM не переносится на ru автоматически. Все автометрики (COMETKiwi, MetricX-QE, LLM-судьи) предпочитали MT, τ до −0.318 — сырой LLM-судья без якорей врёт в пользу машины.
- Karpinska & Iyyer (arXiv:2304.03245): перевод абзацами вместо предложений снижает mistranslation на ~23%, грамматику на ~40%, инконсистентность в 12 раз — но пропуски контента остаются и требуют отдельного coverage-гейта. Mistranslation — крупнейшая категория по счёту ошибок во всех исследованиях (480–757 случаев против ~100 грамматических).
- MTPE-типологии (Daems & Macken: два измерения — acceptability/adequacy, веса 0–4; TAUS DQF-MQM: 8 ветвей) добавляют главное для экономики: разные типы ошибок стоят редактору по-разному — coherence-ошибки дороже всего по времени правки, meaning shifts — по когнитивной нагрузке. Приоритизация гейтов = приоритизация по стоимости постредактуры.
a) DITING: таксономия вебновелл zh→en
Первый фреймворк оценки именно жанра вебновелл: 18 745 экспертно аннотированных пар zh→en, 14 моделей, плюс мета-датасет MetricAlign (300 пар с MQM-лейблами) и мультиагентный оценщик AgentEval (arXiv:2510.09116, GitHub).
Шесть измерений (объём выборки; определение; наш механизм):
| # | Измерение | Пар | Суть | Детекция у нас | Фаза |
|---|---|---|---|---|---|
| 1 | Idiom translation | 2 844 | Чэнъюй/сленг: передан образный смысл, а не буквальный. Пример DITING: 挡枪 = «служить прикрытием», а не «принять пулю» | LLM-судья (билингв.) + глоссарий идиом-прецедентов | 2 |
| 2 | Lexical ambiguity | 4 576 | Выбор верного значения полисемии, включая интернет-неологизмы | LLM-судья; частично глоссарий (закреплённые значения) | 2 |
| 3 | Terminology localization | 1 836 | Жанровые термины без прямого эквивалента: 金丹 — «Золотое ядро» (духовный концепт), не «золотая пилюля/шарик» | Глоссарий + детерминированный гейт консистентности | 1 |
| 4 | Tense consistency | 4 982 | Когерентность времён при флешбеках/монологах (в zh время не грамматикализовано) | Морфогейт (профиль времени сцены) + судья | 2 |
| 5 | Zero-pronoun resolution | 4 407 | Восстановление опущенных подлежащих/местоимений | Гейт рода по series bible + судья | 1–2 |
| 6 | Cultural safety | 100 | Отсутствие оскорбительных/неуместных формулировок при сохранении верности | Политика brief + NSFW-роутер; судья | 2 |
Оценка: на каждое измерение 1 «специфическая» метрика + 2 «общие» (беглость/стиль/безопасность), каждая 0–2, итог 0–6. Ключевые численные результаты: лидеры — DeepSeek-V3 (5.16) и GPT-4o (5.09); китайско-обученные модели систематически бьют более крупные западные (Qwen3-8B 3.96 > LLaMA3-70B 3.58). Труднейшее измерение — нулевые местоимения (максимальный разрыв между моделями: LLaMA3-70B 3.82), лёгкое — времена (≥4.6 у большинства). Согласие аннотаторов: специфические метрики κ=0.94, общие 0.84–0.85 — узко сформулированные бинарные вопросы надёжнее общих оценок стиля; это прямой аргумент проектировать промпт судьи как набор конкретных вопросов, а не «оцени 1–10». AgentEval (два оценщика + арбитр, дебаты до консенсуса) даёт Spearman 0.669 с людьми против 0.472 у BLEU/BLEURT; конкурирующий M-MAD ушёл в отрицательную корреляцию (−0.316) — мультиагентный судья работает только с доменными рубриками и эталонными примерами на каждое измерение.
Применимость к zh/ja→ru. Все шесть измерений переносимы, но №5 для ru усиливается: русский глагол в прошедшем времени маркирует род («сказал/сказала»), поэтому ошибка восстановления нулевого местоимения из zh/ja проявляется не только в «он/она», но и в глагольных окончаниях — детектится pymorphy-парсером против поля gender series bible (гейт Фазы 2 уже в плане). №4 для ru проще (вид+время морфологичны), №6 у нас превращается в политику 18+ бриф-конфига, а не «безопасность».
b) BlonDe: дискурсивные категории и их портирование на русский
BlonDe (arXiv:2103.11878) — автометрика document-level MT: F1 по «категоризованным спанам» вместо n-грамм. Категории: entity (NER, консистентность имён по документу), tense (наборы глагольных форм MD/VBD/VBN/…), pronoun (4 класса рода: masculine/feminine/neuter/epicene), discourse markers (4 типа связок: contingency/temporal/expansion/comparison); BlonDe+ добавляет размеченные вручную амбигуальные слова и пропущенный контент.
Главная ценность — статистика ошибок на корпусе BWB (вебновеллы zh→en, 80 документов, 8 профессиональных переводчиков-аннотаторов): среди document-level ошибок инконсистентность — 64.4% (внутри неё имена 43.3%, времена 38.7%), эллипсис — 20.3% (из них местоимения 17.3%), амбигуальность — 7.3%; вместе 86.7% всех дискурсивных ошибок. Вывод: на длинной дистанции книги главный враг — не «неправильное слово», а дрейф (имя, время, род), и он детектируется дёшево и детерминированно.
Портирование на русскую морфологию (Python-сайдкар Фазы 2):
- entity → уже запланированный глоссарный гейт (Р7): точное совпадение форм из глоссария с учётом склонения (
decl-поле). Детерминированно, Фаза 1. - pronoun → «он/она/оно/они» + род в глагольных окончаниях прошедшего времени и кратких прилагательных («устал/устала») — pymorphy против
genderв series bible. Русский даёт больше поверхности для проверки, чем английский. Фаза 2. - tense → английские POS-теги не переносятся; для ru — профиль «нарративного времени» сцены (прош./наст.) по доле глагольных форм, алерт при скачке внутри сцены. Фаза 2.
- discourse markers → словарь русских коннективов (однако/зато/впрочем/поэтому…): сравнение наличия связки в оригинале и переводе — слабый, но дешёвый сигнал потери логики. Фаза 3 (низкий приоритет: всего ~7% ошибок и ниже по impact).
c) MQM core + LitEval: что оставить судье, а что забрать у него
MQM core — отраслевой стандарт: измерения Accuracy (mistranslation, omission, addition, untranslated), Fluency/Linguistic conventions (grammar, spelling, punctuation, register, inconsistency), Terminology, Style, Locale conventions, плюс Non-translation (themqm.org, Freitag et al., arXiv:2104.14478). Веса: minor=1, major=5, non-translation=25, minor-пунктуация=0.1; счёт = −Σ(весов)/объём. Два факта из WMT-практики: (1) большинство major-ошибок MT — Accuracy/Mistranslation, т.е. без билингвального судьи не обойтись; (2) краудсорс-оценка почти не коррелирует с экспертной MQM — дешёвые «оценщики» (и неоткалиброванные LLM) систематически завышают машину.
LitEval-Corpus (arXiv:2410.18697; >2 000 переводов, 13 000 предложений, пары de↔en, de↔zh/en↔zh, 9 систем + изданные человеческие переводы) адаптировал MQM для литературы: категории Terminology, Accuracy, Fluency, Style, Locale-convention, Non-translation; штраф −(25·C_nontrans + 5·C_major + 1·C_minor)/число предложений. Результаты, важные нам:
- MQM работает только в руках экспертов: студенты-аннотаторы по MQM «не отличили или занизили» ~60% человеческих переводов; попарный Best-Worst Scaling у экспертов находит человеческий перевод в 80–100% случаев, автометрики — максимум 20%.
- По категориям: корреляция с итоговым качеством сильная только у Accuracy; Fluency/Style — слабая; Terminology — около нуля. То есть судью надо спрашивать про точность и цельные сравнения, а терминологию мерить детерминированным гейтом — LLM-оценка терминов не добавляет сигнала.
- У GPT-4o лишь 16.6% выходов без ошибок, и даже безошибочные «проседают в подборе слов и общем стиле» — подтверждение «пассa обогащения» из 07-документа.
- Эксперты отмечали: намеренные переводческие решения (опущение, перестройка смысла ради языка) неэксперты помечали как ошибки — судье нужен слот вердикта «расхождение оправдано» (шкала Комиссарова из 07-док уже это закрывает).
Механизм для TextMachine: MQM-подмножество как схема телеметрии (единый словарь тегов ошибок в request_log и отчётах, Фаза 1), севèрити-веса MQM для агрегатного скоринга глав; судья Фазы 2 — двухступенчатый: попарное сравнение (BWS-стиль, черновик vs ревизия) + точечные MQM-теги только Accuracy-ветви.
d) LAIT: на чём именно MT проигрывает читателю
LAIT (arXiv:2606.26040, Karpinska и соавт., 2026): 15 «запойных» читателей, 15 свежих романов fr/pl/ja→en, агентный пайплайн (Claude Opus 4.6 + Claude Code препроцессинг → GPT‑5.4/Codex почанковый перевод с гейтами ревизий; $400 на всё), 30 сравнений целых отрывков ~8k слов + 772 сравнения чанков, 7.2K спановых аннотаций «хорошо/плохо».
Что нашли:
- HT предпочтён в 19/30 отрывков и 522/772 (67.6%) чанков; при этом читатели не отличают MT от HT (угадали 17/30) и предпочитают то, что считают человеческим. MT «нормальный», но: у MT 100.7 негативно выделенных слов на 1k против 42.9 у HT; 41.7% MT-чанков имеют ≥100 негативных слов/1k (у HT — 11.9%) — качество MT нестабильно от чанка к чанку (разброс предпочтений по книгам 4–88%).
- Причины выбора HT: гладкость 28.2%, понимание 10.3%, естественный выбор слов 7.7%. Конкретные провалы MT: (1) непонятно, кто говорит в диалогах; (2) синтаксис — «рубленые» фразы и «бесконечные run-on предложения», заставляющие перечитывать; (3) «словарные» кальки вместо конкретики (читатели хвалили «bento containers» против родового слова).
- Мультиязычный кейс (перевод на es/fr/pl/ja): HT предпочтён в 103/111 чанков (92.8%), читатели уверенно опознают MT (4/5, уверенность 4.4/5) по конкретному translationese: висящие кальки грамматики источника, неидиоматичная лексика («prasowe artykuły pośmiertne» вместо «nekrolog»). Для ru-выхода это главный вывод исследования: паритет LLM с человеком на английском выходе не переносится на другие целевые языки — рынок ru-перевода дольше останется незакрытым сырыми LLM, а наш анти-translationese-пасс — реальный дифференциатор.
- Автометрики провалились все: LiTransProQA (судья Gemini 3.1 Pro) τ=−0.124, MetricX-QE τ=−0.075, COMETKiwi τ=−0.318 — все предпочитали MT, когда люди предпочитали HT. LLM-судья без человеческого якоря систематически хвалит машинный текст; калибровка панели судей на пилоте Фазы 2.5 (человеческий перевод как якорь — уже в плане) обязательна.
Механизмы: атрибуция диалогов — судья с вопросом «однозначен ли говорящий каждой реплики» + структурный гейт диалоговых тире; run-on/рубленость — не-LLM метрики дисперсии длин предложений (Фаза 2, анти-translationese); нестабильность по чанкам — телеметрия качества на чанк и эскалация худших, а не равномерная трата бюджета.
e) Karpinska & Iyyer и документный уровень: частоты и то, что не лечится контекстом
(arXiv:2304.03245): GPT-3.5, 18 языковых пар (источники en/pl/ru/cs/fr/de/ja/zh; цели en/pl/ja), художественные тексты, спановая разметка билингвами по MQM-подмножеству: mistranslation, grammar, untranslated, inconsistency, register (только для ja), format + бинарные omission/addition.
Суммарные счётчики ошибок (Para = перевод абзацем / Sent = по предложениям / GTr = Google Translate): mistranslation 480/622/757, grammar 102/156/140, inconsistency 2/25/15, untranslated 59/52/34, register 7/25/71, format 0/–/125. Переводчики предпочли Para против Sent в 71.1%, против GTr в 82.8%. Т.е. документный контекст даёт −29.5% mistranslation, −65% grammar (в относительном выражении Sent к Para), инконсистентность ×12 меньше — чанкинг 1–2k токенов с контекстом, как у нас в Фазе 1, воспроизводит главный «бесплатный» выигрыш. Грамматика по языкам: ja — частицы (21–22 ошибки на систему), pl — род/падеж/вид: флективные цели (и русский) страдают там, где en «прощает».
Но: «критические ошибки остаются» — прежде всего пропуски контента; контекст их не устраняет. Вместе с BlonDe-статистикой картина такая: по счёту доминирует mistranslation (нужен билингвальный судья), но на дистанции книги читателя убивает инконсистентность (64% док-ошибок) и пропуски — обе категории детерминированно детектируемы (глоссарный гейт + coverage-гейт v1 Фазы 1 — подтверждается их приоритет в плане).
Категории, где документный контекст решает (их список у K&I): местоимения, культурные конвенции референции (ja: третье лицо вместо «ты»), эллипсис, субъектный эллипсис pro-drop, консистентность, полисемия, регистр — совпадает с осями DITING; это «оглавление» для контекстной инъекции банка памяти.
f) MTPE-типологии: чем ошибка дороже, тем раньше гейт
Daems & Macken (LREC 2014, Frontiers in Psychology 2017) — двумерная типология: acceptability (нормы целевого языка: грамматика/синтаксис — порядок слов, формы глагола, согласование; лексика — коллокации; когерентность — логика, связки; стиль, регистр, орфография) и adequacy (верность источнику: meaning shifts, word sense, удаления/добавления). Веса 0–4 (0 — «не ошибка, но интересно», 4 — критично: противоречия). Эмпирика по усилию постредактора: coherence-ошибки → максимум временнóго усилия; meaning shifts → максимум когнитивного (фиксации глаз); структурно-грамматические → максимум технического (правки); в их MT-выборке acceptability-ошибок вдвое больше adequacy (201 против 86). Для нас это функция стоимости: гейты и эскалацию приоритизировать не по частоте, а по цене правки — когерентность и смысловые сдвиги эскалируются на дорогую модель, грамматика чинится дешёвой.
TAUS DQF-MQM (TAUS, гармонизация 2014–15): 8 ветвей — Accuracy, Fluency, Terminology, Locale convention, Style, Verity (соответствие фактов реалиям локали), Design, Internationalization; севèрити neutral/minor/major/critical; используется в CAT-инструментах для замера производительности постредактуры. Практика DQF «выбери 2–20 подкатегорий под проект» легитимизирует наш подход: фиксируем подмножество ~12 тегов и не тащим полную иерархию. Verity и Design для художки почти не нужны (Design → экспорт epub), Internationalization — не наш случай.
Сводный каталог режимов отказа (кросс-таксономический)
Формат: пример (оригинал → типичный MTL → верно); почему падает; детекция; фаза.
- Нулевое подлежащее → род (zh/ja pro-drop). ja: «行かないと» (без субъекта, говорит героиня) → MTL «Я должен идти» → верно «Мне пора» / «Я должна идти». Модель не удерживает пол говорящего вне окна. Детекция: гейт pymorphy: род глаголов/местоимений реплики vs
genderспикера в series bible. Фаза 2. [DITING; K&I] - Дрейф имени/термина. zh: 金丹期 → гл. 3 «стадия Золотого ядра», гл. 47 «этап Цзиньдань». Стохастичность выбора при каждом вызове. Детекция: глоссарный гейт (Р7, с
decl-склонениями). Фаза 1. [BlonDe: имена = 43% инконсистентностей; DITING] - Пропуск предложения/абзаца. Тихое сжатие длинного описания. Детекция: coverage-гейт (соотношение длин, сегментация). Фаза 1; молчаливые вырезания цензуры — детектор Фазы 2. [K&I: «критические ошибки остаются»; LAIT]
- Буквализация идиомы. zh: 挡枪 → «принял пулю» → верно «послужил прикрытием». Частотная поверхностная форма побеждает смысл. Детекция: судья (билингв., вопрос «образный смысл сохранён?») + идиомы-прецеденты в памяти. Фаза 2. [DITING]
- Полисемия/сленг. zh-интернет-неологизмы, ja-омофоны: выбрано «словарное» значение. Детекция: судья; закреплённые значения — в глоссарий. Фаза 2. [DITING; K&I]
- Дрейф времени повествования. Прошедшее → настоящее внутри сцены при флешбеке. Детекция: морфогейт (профиль времени сцены) + судья на флешбеках. Фаза 2. [BlonDe: времена = 39% инконсистентностей; DITING — но «лёгкая» ось для топ-моделей]
- Сбой регистра/ты-вы. ja: смена кэйго при сближении персонажей не отражена; или «вы» → «ты» → «вы» хаотично. Детекция: гейт по матрице ты/вы series bible; сюжетные переключения — судья/человек. Фаза 2. [K&I: register только для ja; 07-док]
- Непереведённые осколки. Иероглифы/ромадзи/pinyin в ru-тексте; у Para-режимов частота даже выше (K&I: 59–72 случая). Детекция: гейт CJK-артефактов (уже в Фазе 1). [K&I; MQM: untranslated]
- Смысловой сдвиг (mistranslation). Крупнейшая категория по счёту (480–757 у K&I; большинство major в WMT-MQM). Ловится только билингвальным судьёй (Accuracy-ветвь MQM, севèрити major/minor), выборочно человеком (пилот 2.5). Фаза 2.
- Синтаксический translationese. Run-on «нанизанные» предложения или рубленость; кальки структур источника («висящие» обороты). Детекция: не-LLM метрики (дисперсия длин, доля деепричастных калек) → анти-translationese-пасс; финально — монолингвальный судья. Фаза 2. [LAIT — главная причина проигрыша MT; LitEval — «literal and less diverse»]
- Потеря атрибуции диалога. Цепочка реплик без атрибуции: читатель теряет, кто говорит (в ru — диалоговые тире усугубляют). Детекция: структурный гейт чередования реплик + судья («кто говорит в каждой реплике?»). Фаза 2. [LAIT]
- Родовое слово вместо конкретного. ja: 弁当箱 → «контейнер с едой» → верно «бэнто». Сглаживание к частотной лексике. Детекция: судья + глоссарий реалий; политика Venuti в brief. Фаза 2. [LAIT; Галь — 07-док]
Выводы для TextMachine
- Словарь тегов ошибок фиксируем сейчас (Фаза 1, телеметрия): подмножество MQM + оси DITING ≈ 12 тегов из каталога выше; каждый вердикт гейта/судьи пишется в request_log этим словарём. Севèрити-веса MQM (1/5/25) — готовый агрегат для сравнения глав/конфигов C0–C3 на пилоте.
- Частоты подтверждают приоритеты плана: детерминированные гейты Фазы 1 (глоссарий, coverage, CJK-осколки) закрывают категории, дающие 64%+ документных ошибок и все «критические» пропуски; гейт рода/ты-вы Фазы 2 бьёт по самой трудной оси DITING (zero-pronoun) — и в ru она детектится лучше, чем в en, за счёт глагольной морфологии.
- Судью строить как анкету, а не как эссе: узкие бинарные/тринарные вопросы по осям (κ=0.94 против 0.84 у DITING), Accuracy-ветвь — билингвально, стиль — попарным сравнением (BWS: 80–100% точности у LitEval против ≤20% у метрик). Терминологию у судьи не спрашивать (корреляция ~0) — только гейт.
- LLM-судьи по умолчанию хвалят MT (LAIT: τ до −0.318; M-MAD −0.316) — без калибровки на человеческом якоре (пилот 2.5) вердикты судьи нельзя использовать для go/no-go; в проде держать «золотые» главы с человеческим переводом как контрольные точки дрейфа судьи.
- Ru-выход — не en-выход: 92.8% предпочтения человеку на не-английских целях (LAIT) означает, что (а) наш рынок дольше защищён от «сырых» LLM, (б) анти-translationese-пасс и морфогейты — ядро ценности, (в) бенчмаркать пайплайн только на ru-выходе, en-результаты конкурентов не экстраполировать.
- Эскалацию приоритизировать по стоимости правки (Daems/Frontiers): когерентность и meaning shifts → дорогая модель/человек; грамматика/пунктуация → дешёвая модель или детерминированная правка. Телеметрия по тегам позволит посчитать реальную «цену» каждой категории в нашем пайплайне.
- Нестабильность по чанкам — метрика первого класса (LAIT: 42% плохих MT-чанков против 12% у HT): считать распределение вердиктов по чанкам главы и эскалировать хвост, а не среднее.
Источники
- DITING: arXiv:2510.09116, HTML v2, GitHub WHUNextGen/DITING, HuggingFace
- BlonDe: arXiv:2103.11878 (NAACL 2022), разбор категорий/статистики BWB — ar5iv
- MQM: MQM Core Typology, scoring models, Freitag et al. «Experts, Errors, and Context» — arXiv:2104.14478
- LitEval-Corpus: arXiv:2410.18697, HTML v2
- LAIT: arXiv:2606.26040
- Karpinska & Iyyer: arXiv:2304.03245, ar5iv
- MTPE: Daems, Vandepitte, Hartsuiker, Macken — Frontiers in Psychology 2017, PMC, LREC 2014 (L14-1441), MT Summit WPTP 2015
- TAUS DQF: Measuring Content Quality with Error Typology, TAUS Quality Dashboard (ACL), DQF-MQM обзор