# Готовые академические таксономии ошибок литературного MT → гейты, судья, телеметрия Дата: 2026-07-04. Исследование для TextMachine (мультиагентный перевод zh/ja/en→ru). Цель — **не изобретать классификацию ошибок**: взять готовые таксономии (DITING, BlonDe, MQM/LitEval, LAIT, Karpinska & Iyyer, MTPE-типологии), извлечь определения и частоты и разложить каждую категорию по нашим механизмам: детерминированный гейт / поле банка памяти / LLM-судья / человек — с привязкой к фазам MVP (02-mvp-plan.md). ## TL;DR 1. **DITING** ([arXiv:2510.09116](https://arxiv.org/abs/2510.09116)) — единственный бенчмарк именно вебновелл (zh→en, 18 745 экспертных пар): 6 измерений — идиомы, лексическая многозначность, локализация терминов, согласованность времён, нулевые местоимения, культурная безопасность. Самое трудное для всех 14 моделей — **восстановление нулевых местоимений**; самое лёгкое — времена. Схема оценки 0–2 на метрику даёт κ=0.94 у «специфических» метрик против 0.84 у «общих» — узкие бинарные вопросы судье надёжнее просьб «оцени стиль». 2. **BlonDe** ([arXiv:2103.11878](https://arxiv.org/abs/2103.11878), NAACL 2022) даёт и метрику, и главную статистику: в document-level ошибках MT вебновелл **64.4% — инконсистентность** (имена 43.3%, времена 38.7%), 20.3% — эллипсис (местоимения 17.3%), 7.3% — амбигуальность; три категории покрывают 86.7% дискурсивных ошибок. Категории BlonDe (entity/tense/pronoun/discourse markers) считаются детерминированно и портируются на русскую морфологию. 3. **MQM core** (веса minor=1, major=5, non-translation=25, пунктуация=0.1; [Freitag et al.](https://arxiv.org/abs/2104.14478)) — стандарт индустрии, но **LitEval** ([arXiv:2410.18697](https://arxiv.org/abs/2410.18697)) показал: для литературы MQM работает только с экспертами (студенты «не отличили» 60% человеческих переводов от MT), а попарное сравнение (BWS) ловит человеческий перевод в 80–100% случаев. Категория Terminology в MQM-оценках коррелирует с итоговым качеством **около нуля** — консистентность терминов надо мерить отдельным детерминированным гейтом, а не судьёй. 4. **LAIT** ([arXiv:2606.26040](https://arxiv.org/html/2606.26040v1), 2026) — читатели предпочитают человеческий перевод (67.6% чанков) за «гладкость» (28.2% причин), ясность атрибуции диалогов и естественный синтаксис; MT проигрывает на рваных/бесконечных предложениях и словарных кальках. Критично для нас: **в переводе НЕ на английский человеческий перевод предпочтён в 92.8%** — качество en-выхода LLM не переносится на ru автоматически. Все автометрики (COMETKiwi, MetricX-QE, LLM-судьи) предпочитали MT, τ до −0.318 — сырой LLM-судья без якорей врёт в пользу машины. 5. **Karpinska & Iyyer** ([arXiv:2304.03245](https://arxiv.org/abs/2304.03245)): перевод абзацами вместо предложений снижает mistranslation на ~23%, грамматику на ~40%, инконсистентность в 12 раз — но **пропуски контента остаются** и требуют отдельного coverage-гейта. Mistranslation — крупнейшая категория по счёту ошибок во всех исследованиях (480–757 случаев против ~100 грамматических). 6. **MTPE-типологии** (Daems & Macken: два измерения — acceptability/adequacy, веса 0–4; TAUS DQF-MQM: 8 ветвей) добавляют главное для экономики: разные типы ошибок стоят редактору по-разному — **coherence-ошибки дороже всего по времени** правки, meaning shifts — по когнитивной нагрузке. Приоритизация гейтов = приоритизация по стоимости постредактуры. --- ## a) DITING: таксономия вебновелл zh→en Первый фреймворк оценки именно жанра вебновелл: 18 745 экспертно аннотированных пар zh→en, 14 моделей, плюс мета-датасет MetricAlign (300 пар с MQM-лейблами) и мультиагентный оценщик AgentEval ([arXiv:2510.09116](https://arxiv.org/abs/2510.09116), [GitHub](https://github.com/WHUNextGen/DITING)). Шесть измерений (объём выборки; определение; наш механизм): | # | Измерение | Пар | Суть | Детекция у нас | Фаза | |---|-----------|-----|------|----------------|------| | 1 | Idiom translation | 2 844 | Чэнъюй/сленг: передан образный смысл, а не буквальный. Пример DITING: 挡枪 = «служить прикрытием», а не «принять пулю» | LLM-судья (билингв.) + глоссарий идиом-прецедентов | 2 | | 2 | Lexical ambiguity | 4 576 | Выбор верного значения полисемии, включая интернет-неологизмы | LLM-судья; частично глоссарий (закреплённые значения) | 2 | | 3 | Terminology localization | 1 836 | Жанровые термины без прямого эквивалента: 金丹 — «Золотое ядро» (духовный концепт), не «золотая пилюля/шарик» | Глоссарий + детерминированный гейт консистентности | 1 | | 4 | Tense consistency | 4 982 | Когерентность времён при флешбеках/монологах (в zh время не грамматикализовано) | Морфогейт (профиль времени сцены) + судья | 2 | | 5 | Zero-pronoun resolution | 4 407 | Восстановление опущенных подлежащих/местоимений | Гейт рода по series bible + судья | 1–2 | | 6 | Cultural safety | 100 | Отсутствие оскорбительных/неуместных формулировок при сохранении верности | Политика brief + NSFW-роутер; судья | 2 | Оценка: на каждое измерение 1 «специфическая» метрика + 2 «общие» (беглость/стиль/безопасность), каждая 0–2, итог 0–6. Ключевые численные результаты: **лидеры — DeepSeek-V3 (5.16) и GPT-4o (5.09)**; китайско-обученные модели систематически бьют более крупные западные (Qwen3-8B 3.96 > LLaMA3-70B 3.58). **Труднейшее измерение — нулевые местоимения** (максимальный разрыв между моделями: LLaMA3-70B 3.82), лёгкое — времена (≥4.6 у большинства). Согласие аннотаторов: специфические метрики κ=0.94, общие 0.84–0.85 — **узко сформулированные бинарные вопросы надёжнее общих оценок стиля**; это прямой аргумент проектировать промпт судьи как набор конкретных вопросов, а не «оцени 1–10». AgentEval (два оценщика + арбитр, дебаты до консенсуса) даёт Spearman 0.669 с людьми против 0.472 у BLEU/BLEURT; конкурирующий M-MAD ушёл в **отрицательную** корреляцию (−0.316) — мультиагентный судья работает только с доменными рубриками и эталонными примерами на каждое измерение. **Применимость к zh/ja→ru.** Все шесть измерений переносимы, но №5 для ru усиливается: русский глагол в прошедшем времени маркирует род («сказал/сказала»), поэтому ошибка восстановления нулевого местоимения из zh/ja проявляется не только в «он/она», но и в глагольных окончаниях — детектится pymorphy-парсером против поля `gender` series bible (гейт Фазы 2 уже в плане). №4 для ru проще (вид+время морфологичны), №6 у нас превращается в политику 18+ бриф-конфига, а не «безопасность». ## b) BlonDe: дискурсивные категории и их портирование на русский BlonDe ([arXiv:2103.11878](https://arxiv.org/abs/2103.11878)) — автометрика document-level MT: F1 по «категоризованным спанам» вместо n-грамм. Категории: **entity** (NER, консистентность имён по документу), **tense** (наборы глагольных форм MD/VBD/VBN/…), **pronoun** (4 класса рода: masculine/feminine/neuter/epicene), **discourse markers** (4 типа связок: contingency/temporal/expansion/comparison); BlonDe+ добавляет размеченные вручную амбигуальные слова и пропущенный контент. Главная ценность — статистика ошибок на корпусе BWB (вебновеллы zh→en, 80 документов, 8 профессиональных переводчиков-аннотаторов): среди document-level ошибок **инконсистентность — 64.4%** (внутри неё имена 43.3%, времена 38.7%), **эллипсис — 20.3%** (из них местоимения 17.3%), **амбигуальность — 7.3%**; вместе 86.7% всех дискурсивных ошибок. Вывод: на длинной дистанции книги главный враг — не «неправильное слово», а **дрейф** (имя, время, род), и он детектируется дёшево и детерминированно. **Портирование на русскую морфологию** (Python-сайдкар Фазы 2): - *entity* → уже запланированный глоссарный гейт (Р7): точное совпадение форм из глоссария с учётом склонения (`decl`-поле). Детерминированно, Фаза 1. - *pronoun* → «он/она/оно/они» + **род в глагольных окончаниях прошедшего времени и кратких прилагательных** («устал/устала») — pymorphy против `gender` в series bible. Русский даёт больше поверхности для проверки, чем английский. Фаза 2. - *tense* → английские POS-теги не переносятся; для ru — профиль «нарративного времени» сцены (прош./наст.) по доле глагольных форм, алерт при скачке внутри сцены. Фаза 2. - *discourse markers* → словарь русских коннективов (однако/зато/впрочем/поэтому…): сравнение наличия связки в оригинале и переводе — слабый, но дешёвый сигнал потери логики. Фаза 3 (низкий приоритет: всего ~7% ошибок и ниже по impact). ## c) MQM core + LitEval: что оставить судье, а что забрать у него **MQM core** — отраслевой стандарт: измерения Accuracy (mistranslation, omission, addition, untranslated), Fluency/Linguistic conventions (grammar, spelling, punctuation, register, inconsistency), Terminology, Style, Locale conventions, плюс Non-translation ([themqm.org](https://themqm.org/the-mqm-typology/), [Freitag et al., arXiv:2104.14478](https://arxiv.org/abs/2104.14478)). Веса: minor=1, major=5, non-translation=25, minor-пунктуация=0.1; счёт = −Σ(весов)/объём. Два факта из WMT-практики: (1) **большинство major-ошибок MT — Accuracy/Mistranslation**, т.е. без билингвального судьи не обойтись; (2) краудсорс-оценка почти не коррелирует с экспертной MQM — дешёвые «оценщики» (и неоткалиброванные LLM) систематически завышают машину. **LitEval-Corpus** ([arXiv:2410.18697](https://arxiv.org/abs/2410.18697); >2 000 переводов, 13 000 предложений, пары de↔en, de↔zh/en↔zh, 9 систем + изданные человеческие переводы) адаптировал MQM для литературы: категории Terminology, Accuracy, Fluency, Style, Locale-convention, Non-translation; штраф −(25·C_nontrans + 5·C_major + 1·C_minor)/число предложений. Результаты, важные нам: - **MQM работает только в руках экспертов**: студенты-аннотаторы по MQM «не отличили или занизили» ~60% человеческих переводов; попарный Best-Worst Scaling у экспертов находит человеческий перевод в 80–100% случаев, автометрики — максимум 20%. - По категориям: корреляция с итоговым качеством сильная только у **Accuracy**; Fluency/Style — слабая; **Terminology — около нуля**. То есть судью надо спрашивать про точность и цельные сравнения, а терминологию мерить детерминированным гейтом — LLM-оценка терминов не добавляет сигнала. - У GPT-4o лишь 16.6% выходов без ошибок, и даже безошибочные «проседают в подборе слов и общем стиле» — подтверждение «пассa обогащения» из 07-документа. - Эксперты отмечали: **намеренные переводческие решения** (опущение, перестройка смысла ради языка) неэксперты помечали как ошибки — судье нужен слот вердикта «расхождение оправдано» (шкала Комиссарова из 07-док уже это закрывает). **Механизм для TextMachine:** MQM-подмножество как схема телеметрии (единый словарь тегов ошибок в request_log и отчётах, Фаза 1), севèрити-веса MQM для агрегатного скоринга глав; судья Фазы 2 — двухступенчатый: попарное сравнение (BWS-стиль, черновик vs ревизия) + точечные MQM-теги только Accuracy-ветви. ## d) LAIT: на чём именно MT проигрывает читателю LAIT ([arXiv:2606.26040](https://arxiv.org/html/2606.26040v1), Karpinska и соавт., 2026): 15 «запойных» читателей, 15 свежих романов fr/pl/ja→en, агентный пайплайн (Claude Opus 4.6 + Claude Code препроцессинг → GPT‑5.4/Codex почанковый перевод с гейтами ревизий; $400 на всё), 30 сравнений целых отрывков ~8k слов + 772 сравнения чанков, 7.2K спановых аннотаций «хорошо/плохо». Что нашли: - HT предпочтён в 19/30 отрывков и **522/772 (67.6%) чанков**; при этом читатели **не отличают** MT от HT (угадали 17/30) и предпочитают то, что считают человеческим. MT «нормальный», но: у MT 100.7 негативно выделенных слов на 1k против 42.9 у HT; 41.7% MT-чанков имеют ≥100 негативных слов/1k (у HT — 11.9%) — **качество MT нестабильно от чанка к чанку** (разброс предпочтений по книгам 4–88%). - Причины выбора HT: **гладкость 28.2%**, понимание 10.3%, естественный выбор слов 7.7%. Конкретные провалы MT: (1) **непонятно, кто говорит** в диалогах; (2) синтаксис — «рубленые» фразы и «бесконечные run-on предложения», заставляющие перечитывать; (3) «словарные» кальки вместо конкретики (читатели хвалили «bento containers» против родового слова). - **Мультиязычный кейс** (перевод на es/fr/pl/ja): HT предпочтён в **103/111 чанков (92.8%)**, читатели уверенно опознают MT (4/5, уверенность 4.4/5) по конкретному translationese: висящие кальки грамматики источника, неидиоматичная лексика («prasowe artykuły pośmiertne» вместо «nekrolog»). **Для ru-выхода это главный вывод исследования: паритет LLM с человеком на английском выходе не переносится на другие целевые языки** — рынок ru-перевода дольше останется незакрытым сырыми LLM, а наш анти-translationese-пасс — реальный дифференциатор. - Автометрики провалились все: LiTransProQA (судья Gemini 3.1 Pro) τ=−0.124, MetricX-QE τ=−0.075, COMETKiwi τ=−0.318 — **все предпочитали MT**, когда люди предпочитали HT. LLM-судья без человеческого якоря систематически хвалит машинный текст; калибровка панели судей на пилоте Фазы 2.5 (человеческий перевод как якорь — уже в плане) обязательна. Механизмы: атрибуция диалогов — судья с вопросом «однозначен ли говорящий каждой реплики» + структурный гейт диалоговых тире; run-on/рубленость — не-LLM метрики дисперсии длин предложений (Фаза 2, анти-translationese); нестабильность по чанкам — телеметрия качества на чанк и эскалация худших, а не равномерная трата бюджета. ## e) Karpinska & Iyyer и документный уровень: частоты и то, что не лечится контекстом ([arXiv:2304.03245](https://arxiv.org/abs/2304.03245)): GPT-3.5, 18 языковых пар (источники en/pl/ru/cs/fr/de/ja/zh; цели en/pl/ja), художественные тексты, спановая разметка билингвами по MQM-подмножеству: mistranslation, grammar, untranslated, inconsistency, register (только для ja), format + бинарные omission/addition. Суммарные счётчики ошибок (Para = перевод абзацем / Sent = по предложениям / GTr = Google Translate): mistranslation **480/622/757**, grammar **102/156/140**, inconsistency **2/25/15**, untranslated 59/52/34, register 7/25/71, format 0/–/125. Переводчики предпочли Para против Sent в 71.1%, против GTr в 82.8%. Т.е. документный контекст даёт −29.5% mistranslation, −65% grammar (в относительном выражении Sent к Para), инконсистентность ×12 меньше — **чанкинг 1–2k токенов с контекстом, как у нас в Фазе 1, воспроизводит главный «бесплатный» выигрыш**. Грамматика по языкам: ja — частицы (21–22 ошибки на систему), pl — род/падеж/вид: флективные цели (и русский) страдают там, где en «прощает». Но: «критические ошибки остаются» — прежде всего **пропуски контента**; контекст их не устраняет. Вместе с BlonDe-статистикой картина такая: по счёту доминирует mistranslation (нужен билингвальный судья), но на дистанции книги читателя убивает инконсистентность (64% док-ошибок) и пропуски — обе категории детерминированно детектируемы (глоссарный гейт + coverage-гейт v1 Фазы 1 — подтверждается их приоритет в плане). Категории, где документный контекст решает (их список у K&I): местоимения, культурные конвенции референции (ja: третье лицо вместо «ты»), эллипсис, субъектный эллипсис pro-drop, консистентность, полисемия, регистр — совпадает с осями DITING; это «оглавление» для контекстной инъекции банка памяти. ## f) MTPE-типологии: чем ошибка дороже, тем раньше гейт **Daems & Macken** ([LREC 2014](https://aclanthology.org/L14-1441/), [Frontiers in Psychology 2017](https://www.frontiersin.org/journals/psychology/articles/10.3389/fpsyg.2017.01282/full)) — двумерная типология: **acceptability** (нормы целевого языка: грамматика/синтаксис — порядок слов, формы глагола, согласование; лексика — коллокации; когерентность — логика, связки; стиль, регистр, орфография) и **adequacy** (верность источнику: meaning shifts, word sense, удаления/добавления). Веса 0–4 (0 — «не ошибка, но интересно», 4 — критично: противоречия). Эмпирика по усилию постредактора: **coherence-ошибки → максимум временнóго усилия; meaning shifts → максимум когнитивного (фиксации глаз); структурно-грамматические → максимум технического (правки)**; в их MT-выборке acceptability-ошибок вдвое больше adequacy (201 против 86). Для нас это функция стоимости: гейты и эскалацию приоритизировать не по частоте, а по цене правки — когерентность и смысловые сдвиги эскалируются на дорогую модель, грамматика чинится дешёвой. **TAUS DQF-MQM** ([TAUS](https://www.taus.net/resources/blog/measuring-content-quality-with-error-typology-step-by-step-guide), гармонизация 2014–15): 8 ветвей — Accuracy, Fluency, Terminology, Locale convention, Style, **Verity** (соответствие фактов реалиям локали), Design, Internationalization; севèрити neutral/minor/major/critical; используется в CAT-инструментах для замера производительности постредактуры. Практика DQF «выбери 2–20 подкатегорий под проект» легитимизирует наш подход: **фиксируем подмножество ~12 тегов** и не тащим полную иерархию. Verity и Design для художки почти не нужны (Design → экспорт epub), Internationalization — не наш случай. ## Сводный каталог режимов отказа (кросс-таксономический) Формат: пример (оригинал → типичный MTL → верно); почему падает; детекция; фаза. 1. **Нулевое подлежащее → род (zh/ja pro-drop).** ja: «行かないと» (без субъекта, говорит героиня) → MTL «Я должен идти» → верно «Мне пора» / «Я должна идти». Модель не удерживает пол говорящего вне окна. Детекция: **гейт** pymorphy: род глаголов/местоимений реплики vs `gender` спикера в series bible. Фаза 2. [DITING; K&I] 2. **Дрейф имени/термина.** zh: 金丹期 → гл. 3 «стадия Золотого ядра», гл. 47 «этап Цзиньдань». Стохастичность выбора при каждом вызове. Детекция: **глоссарный гейт** (Р7, с `decl`-склонениями). Фаза 1. [BlonDe: имена = 43% инконсистентностей; DITING] 3. **Пропуск предложения/абзаца.** Тихое сжатие длинного описания. Детекция: **coverage-гейт** (соотношение длин, сегментация). Фаза 1; молчаливые вырезания цензуры — детектор Фазы 2. [K&I: «критические ошибки остаются»; LAIT] 4. **Буквализация идиомы.** zh: 挡枪 → «принял пулю» → верно «послужил прикрытием». Частотная поверхностная форма побеждает смысл. Детекция: **судья** (билингв., вопрос «образный смысл сохранён?») + идиомы-прецеденты в памяти. Фаза 2. [DITING] 5. **Полисемия/сленг.** zh-интернет-неологизмы, ja-омофоны: выбрано «словарное» значение. Детекция: **судья**; закреплённые значения — в глоссарий. Фаза 2. [DITING; K&I] 6. **Дрейф времени повествования.** Прошедшее → настоящее внутри сцены при флешбеке. Детекция: **морфогейт** (профиль времени сцены) + судья на флешбеках. Фаза 2. [BlonDe: времена = 39% инконсистентностей; DITING — но «лёгкая» ось для топ-моделей] 7. **Сбой регистра/ты-вы.** ja: смена кэйго при сближении персонажей не отражена; или «вы» → «ты» → «вы» хаотично. Детекция: **гейт** по матрице ты/вы series bible; сюжетные переключения — судья/человек. Фаза 2. [K&I: register только для ja; 07-док] 8. **Непереведённые осколки.** Иероглифы/ромадзи/pinyin в ru-тексте; у Para-режимов частота даже выше (K&I: 59–72 случая). Детекция: **гейт** CJK-артефактов (уже в Фазе 1). [K&I; MQM: untranslated] 9. **Смысловой сдвиг (mistranslation).** Крупнейшая категория по счёту (480–757 у K&I; большинство major в WMT-MQM). Ловится только **билингвальным судьёй** (Accuracy-ветвь MQM, севèрити major/minor), выборочно человеком (пилот 2.5). Фаза 2. 10. **Синтаксический translationese.** Run-on «нанизанные» предложения или рубленость; кальки структур источника («висящие» обороты). Детекция: **не-LLM метрики** (дисперсия длин, доля деепричастных калек) → анти-translationese-пасс; финально — монолингвальный судья. Фаза 2. [LAIT — главная причина проигрыша MT; LitEval — «literal and less diverse»] 11. **Потеря атрибуции диалога.** Цепочка реплик без атрибуции: читатель теряет, кто говорит (в ru — диалоговые тире усугубляют). Детекция: структурный **гейт** чередования реплик + **судья** («кто говорит в каждой реплике?»). Фаза 2. [LAIT] 12. **Родовое слово вместо конкретного.** ja: 弁当箱 → «контейнер с едой» → верно «бэнто». Сглаживание к частотной лексике. Детекция: судья + глоссарий реалий; политика Venuti в brief. Фаза 2. [LAIT; Галь — 07-док] ## Выводы для TextMachine 1. **Словарь тегов ошибок фиксируем сейчас** (Фаза 1, телеметрия): подмножество MQM + оси DITING ≈ 12 тегов из каталога выше; каждый вердикт гейта/судьи пишется в request_log этим словарём. Севèрити-веса MQM (1/5/25) — готовый агрегат для сравнения глав/конфигов C0–C3 на пилоте. 2. **Частоты подтверждают приоритеты плана**: детерминированные гейты Фазы 1 (глоссарий, coverage, CJK-осколки) закрывают категории, дающие 64%+ документных ошибок и все «критические» пропуски; гейт рода/ты-вы Фазы 2 бьёт по самой трудной оси DITING (zero-pronoun) — и в ru она детектится лучше, чем в en, за счёт глагольной морфологии. 3. **Судью строить как анкету, а не как эссе**: узкие бинарные/тринарные вопросы по осям (κ=0.94 против 0.84 у DITING), Accuracy-ветвь — билингвально, стиль — попарным сравнением (BWS: 80–100% точности у LitEval против ≤20% у метрик). Терминологию у судьи **не спрашивать** (корреляция ~0) — только гейт. 4. **LLM-судьи по умолчанию хвалят MT** (LAIT: τ до −0.318; M-MAD −0.316) — без калибровки на человеческом якоре (пилот 2.5) вердикты судьи нельзя использовать для go/no-go; в проде держать «золотые» главы с человеческим переводом как контрольные точки дрейфа судьи. 5. **Ru-выход — не en-выход**: 92.8% предпочтения человеку на не-английских целях (LAIT) означает, что (а) наш рынок дольше защищён от «сырых» LLM, (б) анти-translationese-пасс и морфогейты — ядро ценности, (в) бенчмаркать пайплайн только на ru-выходе, en-результаты конкурентов не экстраполировать. 6. **Эскалацию приоритизировать по стоимости правки** (Daems/Frontiers): когерентность и meaning shifts → дорогая модель/человек; грамматика/пунктуация → дешёвая модель или детерминированная правка. Телеметрия по тегам позволит посчитать реальную «цену» каждой категории в нашем пайплайне. 7. **Нестабильность по чанкам — метрика первого класса** (LAIT: 42% плохих MT-чанков против 12% у HT): считать распределение вердиктов по чанкам главы и эскалировать хвост, а не среднее. ## Источники - DITING: [arXiv:2510.09116](https://arxiv.org/abs/2510.09116), [HTML v2](https://arxiv.org/html/2510.09116v2), [GitHub WHUNextGen/DITING](https://github.com/WHUNextGen/DITING), [HuggingFace](https://huggingface.co/papers/2510.09116) - BlonDe: [arXiv:2103.11878](https://arxiv.org/abs/2103.11878) (NAACL 2022), разбор категорий/статистики BWB — [ar5iv](https://ar5iv.labs.arxiv.org/html/2103.11878) - MQM: [MQM Core Typology](https://themqm.org/the-mqm-typology/), [scoring models](https://themqm.org/error-types-2/the-mqm-scoring-models/), Freitag et al. «Experts, Errors, and Context» — [arXiv:2104.14478](https://arxiv.org/abs/2104.14478) - LitEval-Corpus: [arXiv:2410.18697](https://arxiv.org/abs/2410.18697), [HTML v2](https://arxiv.org/html/2410.18697v2) - LAIT: [arXiv:2606.26040](https://arxiv.org/html/2606.26040v1) - Karpinska & Iyyer: [arXiv:2304.03245](https://arxiv.org/abs/2304.03245), [ar5iv](https://ar5iv.labs.arxiv.org/html/2304.03245) - MTPE: Daems, Vandepitte, Hartsuiker, Macken — [Frontiers in Psychology 2017](https://www.frontiersin.org/journals/psychology/articles/10.3389/fpsyg.2017.01282/full), [PMC](https://pmc.ncbi.nlm.nih.gov/articles/PMC5539081/), [LREC 2014 (L14-1441)](https://aclanthology.org/L14-1441/), [MT Summit WPTP 2015](https://aclanthology.org/2015.mtsummit-wptp.3.pdf) - TAUS DQF: [Measuring Content Quality with Error Typology](https://www.taus.net/resources/blog/measuring-content-quality-with-error-typology-step-by-step-guide), [TAUS Quality Dashboard (ACL)](https://aclanthology.org/2015.tc-1.17.pdf), [DQF-MQM обзор](https://chatscontrol.com/blog/translation-quality-metrics-mqm-dqf-error-typology)