textmachine/docs/research/12-error-taxonomies.md
Claude (backend session) 9bb00d49f2 Initial commit: documentation, eval polygon, backend step 0 verdict
TextMachine project repository (AI translation of literary books).
Includes: v2 architecture decisions, MVP plan, research 01-12,
polygon experiments 01-03, backend-session revalidation verdict
(03-implementation-notes.md).

Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
2026-07-04 06:50:59 +03:00

123 lines
36 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

# Готовые академические таксономии ошибок литературного MT → гейты, судья, телеметрия
Дата: 2026-07-04. Исследование для TextMachine (мультиагентный перевод zh/ja/en→ru). Цель — **не изобретать классификацию ошибок**: взять готовые таксономии (DITING, BlonDe, MQM/LitEval, LAIT, Karpinska & Iyyer, MTPE-типологии), извлечь определения и частоты и разложить каждую категорию по нашим механизмам: детерминированный гейт / поле банка памяти / LLM-судья / человек — с привязкой к фазам MVP (02-mvp-plan.md).
## TL;DR
1. **DITING** ([arXiv:2510.09116](https://arxiv.org/abs/2510.09116)) — единственный бенчмарк именно вебновелл (zh→en, 18 745 экспертных пар): 6 измерений — идиомы, лексическая многозначность, локализация терминов, согласованность времён, нулевые местоимения, культурная безопасность. Самое трудное для всех 14 моделей — **восстановление нулевых местоимений**; самое лёгкое — времена. Схема оценки 02 на метрику даёт κ=0.94 у «специфических» метрик против 0.84 у «общих» — узкие бинарные вопросы судье надёжнее просьб «оцени стиль».
2. **BlonDe** ([arXiv:2103.11878](https://arxiv.org/abs/2103.11878), NAACL 2022) даёт и метрику, и главную статистику: в document-level ошибках MT вебновелл **64.4% — инконсистентность** (имена 43.3%, времена 38.7%), 20.3% — эллипсис (местоимения 17.3%), 7.3% — амбигуальность; три категории покрывают 86.7% дискурсивных ошибок. Категории BlonDe (entity/tense/pronoun/discourse markers) считаются детерминированно и портируются на русскую морфологию.
3. **MQM core** (веса minor=1, major=5, non-translation=25, пунктуация=0.1; [Freitag et al.](https://arxiv.org/abs/2104.14478)) — стандарт индустрии, но **LitEval** ([arXiv:2410.18697](https://arxiv.org/abs/2410.18697)) показал: для литературы MQM работает только с экспертами (студенты «не отличили» 60% человеческих переводов от MT), а попарное сравнение (BWS) ловит человеческий перевод в 80100% случаев. Категория Terminology в MQM-оценках коррелирует с итоговым качеством **около нуля** — консистентность терминов надо мерить отдельным детерминированным гейтом, а не судьёй.
4. **LAIT** ([arXiv:2606.26040](https://arxiv.org/html/2606.26040v1), 2026) — читатели предпочитают человеческий перевод (67.6% чанков) за «гладкость» (28.2% причин), ясность атрибуции диалогов и естественный синтаксис; MT проигрывает на рваных/бесконечных предложениях и словарных кальках. Критично для нас: **в переводе НЕ на английский человеческий перевод предпочтён в 92.8%** — качество en-выхода LLM не переносится на ru автоматически. Все автометрики (COMETKiwi, MetricX-QE, LLM-судьи) предпочитали MT, τ до 0.318 — сырой LLM-судья без якорей врёт в пользу машины.
5. **Karpinska & Iyyer** ([arXiv:2304.03245](https://arxiv.org/abs/2304.03245)): перевод абзацами вместо предложений снижает mistranslation на ~23%, грамматику на ~40%, инконсистентность в 12 раз — но **пропуски контента остаются** и требуют отдельного coverage-гейта. Mistranslation — крупнейшая категория по счёту ошибок во всех исследованиях (480757 случаев против ~100 грамматических).
6. **MTPE-типологии** (Daems & Macken: два измерения — acceptability/adequacy, веса 04; TAUS DQF-MQM: 8 ветвей) добавляют главное для экономики: разные типы ошибок стоят редактору по-разному — **coherence-ошибки дороже всего по времени** правки, meaning shifts — по когнитивной нагрузке. Приоритизация гейтов = приоритизация по стоимости постредактуры.
---
## a) DITING: таксономия вебновелл zh→en
Первый фреймворк оценки именно жанра вебновелл: 18 745 экспертно аннотированных пар zh→en, 14 моделей, плюс мета-датасет MetricAlign (300 пар с MQM-лейблами) и мультиагентный оценщик AgentEval ([arXiv:2510.09116](https://arxiv.org/abs/2510.09116), [GitHub](https://github.com/WHUNextGen/DITING)).
Шесть измерений (объём выборки; определение; наш механизм):
| # | Измерение | Пар | Суть | Детекция у нас | Фаза |
|---|-----------|-----|------|----------------|------|
| 1 | Idiom translation | 2 844 | Чэнъюй/сленг: передан образный смысл, а не буквальный. Пример DITING: 挡枪 = «служить прикрытием», а не «принять пулю» | LLM-судья (билингв.) + глоссарий идиом-прецедентов | 2 |
| 2 | Lexical ambiguity | 4 576 | Выбор верного значения полисемии, включая интернет-неологизмы | LLM-судья; частично глоссарий (закреплённые значения) | 2 |
| 3 | Terminology localization | 1 836 | Жанровые термины без прямого эквивалента: 金丹 — «Золотое ядро» (духовный концепт), не «золотая пилюля/шарик» | Глоссарий + детерминированный гейт консистентности | 1 |
| 4 | Tense consistency | 4 982 | Когерентность времён при флешбеках/монологах (в zh время не грамматикализовано) | Морфогейт (профиль времени сцены) + судья | 2 |
| 5 | Zero-pronoun resolution | 4 407 | Восстановление опущенных подлежащих/местоимений | Гейт рода по series bible + судья | 12 |
| 6 | Cultural safety | 100 | Отсутствие оскорбительных/неуместных формулировок при сохранении верности | Политика brief + NSFW-роутер; судья | 2 |
Оценка: на каждое измерение 1 «специфическая» метрика + 2 «общие» (беглость/стиль/безопасность), каждая 02, итог 06. Ключевые численные результаты: **лидеры — DeepSeek-V3 (5.16) и GPT-4o (5.09)**; китайско-обученные модели систематически бьют более крупные западные (Qwen3-8B 3.96 > LLaMA3-70B 3.58). **Труднейшее измерение — нулевые местоимения** (максимальный разрыв между моделями: LLaMA3-70B 3.82), лёгкое — времена (≥4.6 у большинства). Согласие аннотаторов: специфические метрики κ=0.94, общие 0.840.85 — **узко сформулированные бинарные вопросы надёжнее общих оценок стиля**; это прямой аргумент проектировать промпт судьи как набор конкретных вопросов, а не «оцени 110». AgentEval (два оценщика + арбитр, дебаты до консенсуса) даёт Spearman 0.669 с людьми против 0.472 у BLEU/BLEURT; конкурирующий M-MAD ушёл в **отрицательную** корреляцию (0.316) — мультиагентный судья работает только с доменными рубриками и эталонными примерами на каждое измерение.
**Применимость к zh/ja→ru.** Все шесть измерений переносимы, но №5 для ru усиливается: русский глагол в прошедшем времени маркирует род («сказал/сказала»), поэтому ошибка восстановления нулевого местоимения из zh/ja проявляется не только в «он/она», но и в глагольных окончаниях — детектится pymorphy-парсером против поля `gender` series bible (гейт Фазы 2 уже в плане). №4 для ru проще (вид+время морфологичны), №6 у нас превращается в политику 18+ бриф-конфига, а не «безопасность».
## b) BlonDe: дискурсивные категории и их портирование на русский
BlonDe ([arXiv:2103.11878](https://arxiv.org/abs/2103.11878)) — автометрика document-level MT: F1 по «категоризованным спанам» вместо n-грамм. Категории: **entity** (NER, консистентность имён по документу), **tense** (наборы глагольных форм MD/VBD/VBN/…), **pronoun** (4 класса рода: masculine/feminine/neuter/epicene), **discourse markers** (4 типа связок: contingency/temporal/expansion/comparison); BlonDe+ добавляет размеченные вручную амбигуальные слова и пропущенный контент.
Главная ценность — статистика ошибок на корпусе BWB (вебновеллы zh→en, 80 документов, 8 профессиональных переводчиков-аннотаторов): среди document-level ошибок **инконсистентность — 64.4%** (внутри неё имена 43.3%, времена 38.7%), **эллипсис — 20.3%** (из них местоимения 17.3%), **амбигуальность — 7.3%**; вместе 86.7% всех дискурсивных ошибок. Вывод: на длинной дистанции книги главный враг — не «неправильное слово», а **дрейф** (имя, время, род), и он детектируется дёшево и детерминированно.
**Портирование на русскую морфологию** (Python-сайдкар Фазы 2):
- *entity* → уже запланированный глоссарный гейт (Р7): точное совпадение форм из глоссария с учётом склонения (`decl`-поле). Детерминированно, Фаза 1.
- *pronoun* → «он/она/оно/они» + **род в глагольных окончаниях прошедшего времени и кратких прилагательных** («устал/устала») — pymorphy против `gender` в series bible. Русский даёт больше поверхности для проверки, чем английский. Фаза 2.
- *tense* → английские POS-теги не переносятся; для ru — профиль «нарративного времени» сцены (прош./наст.) по доле глагольных форм, алерт при скачке внутри сцены. Фаза 2.
- *discourse markers* → словарь русских коннективов (однако/зато/впрочем/поэтому…): сравнение наличия связки в оригинале и переводе — слабый, но дешёвый сигнал потери логики. Фаза 3 (низкий приоритет: всего ~7% ошибок и ниже по impact).
## c) MQM core + LitEval: что оставить судье, а что забрать у него
**MQM core** — отраслевой стандарт: измерения Accuracy (mistranslation, omission, addition, untranslated), Fluency/Linguistic conventions (grammar, spelling, punctuation, register, inconsistency), Terminology, Style, Locale conventions, плюс Non-translation ([themqm.org](https://themqm.org/the-mqm-typology/), [Freitag et al., arXiv:2104.14478](https://arxiv.org/abs/2104.14478)). Веса: minor=1, major=5, non-translation=25, minor-пунктуация=0.1; счёт = −Σ(весов)/объём. Два факта из WMT-практики: (1) **большинство major-ошибок MT — Accuracy/Mistranslation**, т.е. без билингвального судьи не обойтись; (2) краудсорс-оценка почти не коррелирует с экспертной MQM — дешёвые «оценщики» (и неоткалиброванные LLM) систематически завышают машину.
**LitEval-Corpus** ([arXiv:2410.18697](https://arxiv.org/abs/2410.18697); >2 000 переводов, 13 000 предложений, пары de↔en, de↔zh/en↔zh, 9 систем + изданные человеческие переводы) адаптировал MQM для литературы: категории Terminology, Accuracy, Fluency, Style, Locale-convention, Non-translation; штраф (25·C_nontrans + 5·C_major + 1·C_minor)/число предложений. Результаты, важные нам:
- **MQM работает только в руках экспертов**: студенты-аннотаторы по MQM «не отличили или занизили» ~60% человеческих переводов; попарный Best-Worst Scaling у экспертов находит человеческий перевод в 80100% случаев, автометрики — максимум 20%.
- По категориям: корреляция с итоговым качеством сильная только у **Accuracy**; Fluency/Style — слабая; **Terminology — около нуля**. То есть судью надо спрашивать про точность и цельные сравнения, а терминологию мерить детерминированным гейтом — LLM-оценка терминов не добавляет сигнала.
- У GPT-4o лишь 16.6% выходов без ошибок, и даже безошибочные «проседают в подборе слов и общем стиле» — подтверждение «пассa обогащения» из 07-документа.
- Эксперты отмечали: **намеренные переводческие решения** (опущение, перестройка смысла ради языка) неэксперты помечали как ошибки — судье нужен слот вердикта «расхождение оправдано» (шкала Комиссарова из 07-док уже это закрывает).
**Механизм для TextMachine:** MQM-подмножество как схема телеметрии (единый словарь тегов ошибок в request_log и отчётах, Фаза 1), севèрити-веса MQM для агрегатного скоринга глав; судья Фазы 2 — двухступенчатый: попарное сравнение (BWS-стиль, черновик vs ревизия) + точечные MQM-теги только Accuracy-ветви.
## d) LAIT: на чём именно MT проигрывает читателю
LAIT ([arXiv:2606.26040](https://arxiv.org/html/2606.26040v1), Karpinska и соавт., 2026): 15 «запойных» читателей, 15 свежих романов fr/pl/ja→en, агентный пайплайн (Claude Opus 4.6 + Claude Code препроцессинг → GPT5.4/Codex почанковый перевод с гейтами ревизий; $400 на всё), 30 сравнений целых отрывков ~8k слов + 772 сравнения чанков, 7.2K спановых аннотаций «хорошо/плохо».
Что нашли:
- HT предпочтён в 19/30 отрывков и **522/772 (67.6%) чанков**; при этом читатели **не отличают** MT от HT (угадали 17/30) и предпочитают то, что считают человеческим. MT «нормальный», но: у MT 100.7 негативно выделенных слов на 1k против 42.9 у HT; 41.7% MT-чанков имеют ≥100 негативных слов/1k (у HT — 11.9%) — **качество MT нестабильно от чанка к чанку** (разброс предпочтений по книгам 488%).
- Причины выбора HT: **гладкость 28.2%**, понимание 10.3%, естественный выбор слов 7.7%. Конкретные провалы MT: (1) **непонятно, кто говорит** в диалогах; (2) синтаксис — «рубленые» фразы и «бесконечные run-on предложения», заставляющие перечитывать; (3) «словарные» кальки вместо конкретики (читатели хвалили «bento containers» против родового слова).
- **Мультиязычный кейс** (перевод на es/fr/pl/ja): HT предпочтён в **103/111 чанков (92.8%)**, читатели уверенно опознают MT (4/5, уверенность 4.4/5) по конкретному translationese: висящие кальки грамматики источника, неидиоматичная лексика («prasowe artykuły pośmiertne» вместо «nekrolog»). **Для ru-выхода это главный вывод исследования: паритет LLM с человеком на английском выходе не переносится на другие целевые языки** — рынок ru-перевода дольше останется незакрытым сырыми LLM, а наш анти-translationese-пасс — реальный дифференциатор.
- Автометрики провалились все: LiTransProQA (судья Gemini 3.1 Pro) τ=0.124, MetricX-QE τ=0.075, COMETKiwi τ=0.318 — **все предпочитали MT**, когда люди предпочитали HT. LLM-судья без человеческого якоря систематически хвалит машинный текст; калибровка панели судей на пилоте Фазы 2.5 (человеческий перевод как якорь — уже в плане) обязательна.
Механизмы: атрибуция диалогов — судья с вопросом «однозначен ли говорящий каждой реплики» + структурный гейт диалоговых тире; run-on/рубленость — не-LLM метрики дисперсии длин предложений (Фаза 2, анти-translationese); нестабильность по чанкам — телеметрия качества на чанк и эскалация худших, а не равномерная трата бюджета.
## e) Karpinska & Iyyer и документный уровень: частоты и то, что не лечится контекстом
([arXiv:2304.03245](https://arxiv.org/abs/2304.03245)): GPT-3.5, 18 языковых пар (источники en/pl/ru/cs/fr/de/ja/zh; цели en/pl/ja), художественные тексты, спановая разметка билингвами по MQM-подмножеству: mistranslation, grammar, untranslated, inconsistency, register (только для ja), format + бинарные omission/addition.
Суммарные счётчики ошибок (Para = перевод абзацем / Sent = по предложениям / GTr = Google Translate): mistranslation **480/622/757**, grammar **102/156/140**, inconsistency **2/25/15**, untranslated 59/52/34, register 7/25/71, format 0//125. Переводчики предпочли Para против Sent в 71.1%, против GTr в 82.8%. Т.е. документный контекст даёт 29.5% mistranslation, 65% grammar (в относительном выражении Sent к Para), инконсистентность ×12 меньше — **чанкинг 12k токенов с контекстом, как у нас в Фазе 1, воспроизводит главный «бесплатный» выигрыш**. Грамматика по языкам: ja — частицы (2122 ошибки на систему), pl — род/падеж/вид: флективные цели (и русский) страдают там, где en «прощает».
Но: «критические ошибки остаются» — прежде всего **пропуски контента**; контекст их не устраняет. Вместе с BlonDe-статистикой картина такая: по счёту доминирует mistranslation (нужен билингвальный судья), но на дистанции книги читателя убивает инконсистентность (64% док-ошибок) и пропуски — обе категории детерминированно детектируемы (глоссарный гейт + coverage-гейт v1 Фазы 1 — подтверждается их приоритет в плане).
Категории, где документный контекст решает (их список у K&I): местоимения, культурные конвенции референции (ja: третье лицо вместо «ты»), эллипсис, субъектный эллипсис pro-drop, консистентность, полисемия, регистр — совпадает с осями DITING; это «оглавление» для контекстной инъекции банка памяти.
## f) MTPE-типологии: чем ошибка дороже, тем раньше гейт
**Daems & Macken** ([LREC 2014](https://aclanthology.org/L14-1441/), [Frontiers in Psychology 2017](https://www.frontiersin.org/journals/psychology/articles/10.3389/fpsyg.2017.01282/full)) — двумерная типология: **acceptability** (нормы целевого языка: грамматика/синтаксис — порядок слов, формы глагола, согласование; лексика — коллокации; когерентность — логика, связки; стиль, регистр, орфография) и **adequacy** (верность источнику: meaning shifts, word sense, удаления/добавления). Веса 04 (0 — «не ошибка, но интересно», 4 — критично: противоречия). Эмпирика по усилию постредактора: **coherence-ошибки → максимум временнóго усилия; meaning shifts → максимум когнитивного (фиксации глаз); структурно-грамматические → максимум технического (правки)**; в их MT-выборке acceptability-ошибок вдвое больше adequacy (201 против 86). Для нас это функция стоимости: гейты и эскалацию приоритизировать не по частоте, а по цене правки — когерентность и смысловые сдвиги эскалируются на дорогую модель, грамматика чинится дешёвой.
**TAUS DQF-MQM** ([TAUS](https://www.taus.net/resources/blog/measuring-content-quality-with-error-typology-step-by-step-guide), гармонизация 201415): 8 ветвей — Accuracy, Fluency, Terminology, Locale convention, Style, **Verity** (соответствие фактов реалиям локали), Design, Internationalization; севèрити neutral/minor/major/critical; используется в CAT-инструментах для замера производительности постредактуры. Практика DQF «выбери 220 подкатегорий под проект» легитимизирует наш подход: **фиксируем подмножество ~12 тегов** и не тащим полную иерархию. Verity и Design для художки почти не нужны (Design → экспорт epub), Internationalization — не наш случай.
## Сводный каталог режимов отказа (кросс-таксономический)
Формат: пример (оригинал → типичный MTL → верно); почему падает; детекция; фаза.
1. **Нулевое подлежащее → род (zh/ja pro-drop).** ja: «行かないと» (без субъекта, говорит героиня) → MTL «Я должен идти» → верно «Мне пора» / «Я должна идти». Модель не удерживает пол говорящего вне окна. Детекция: **гейт** pymorphy: род глаголов/местоимений реплики vs `gender` спикера в series bible. Фаза 2. [DITING; K&I]
2. **Дрейф имени/термина.** zh: 金丹期 → гл. 3 «стадия Золотого ядра», гл. 47 «этап Цзиньдань». Стохастичность выбора при каждом вызове. Детекция: **глоссарный гейт** (Р7, с `decl`-склонениями). Фаза 1. [BlonDe: имена = 43% инконсистентностей; DITING]
3. **Пропуск предложения/абзаца.** Тихое сжатие длинного описания. Детекция: **coverage-гейт** (соотношение длин, сегментация). Фаза 1; молчаливые вырезания цензуры — детектор Фазы 2. [K&I: «критические ошибки остаются»; LAIT]
4. **Буквализация идиомы.** zh: 挡枪 → «принял пулю» → верно «послужил прикрытием». Частотная поверхностная форма побеждает смысл. Детекция: **судья** (билингв., вопрос «образный смысл сохранён?») + идиомы-прецеденты в памяти. Фаза 2. [DITING]
5. **Полисемия/сленг.** zh-интернет-неологизмы, ja-омофоны: выбрано «словарное» значение. Детекция: **судья**; закреплённые значения — в глоссарий. Фаза 2. [DITING; K&I]
6. **Дрейф времени повествования.** Прошедшее → настоящее внутри сцены при флешбеке. Детекция: **морфогейт** (профиль времени сцены) + судья на флешбеках. Фаза 2. [BlonDe: времена = 39% инконсистентностей; DITING — но «лёгкая» ось для топ-моделей]
7. **Сбой регистра/ты-вы.** ja: смена кэйго при сближении персонажей не отражена; или «вы» → «ты» → «вы» хаотично. Детекция: **гейт** по матрице ты/вы series bible; сюжетные переключения — судья/человек. Фаза 2. [K&I: register только для ja; 07-док]
8. **Непереведённые осколки.** Иероглифы/ромадзи/pinyin в ru-тексте; у Para-режимов частота даже выше (K&I: 5972 случая). Детекция: **гейт** CJK-артефактов (уже в Фазе 1). [K&I; MQM: untranslated]
9. **Смысловой сдвиг (mistranslation).** Крупнейшая категория по счёту (480757 у K&I; большинство major в WMT-MQM). Ловится только **билингвальным судьёй** (Accuracy-ветвь MQM, севèрити major/minor), выборочно человеком (пилот 2.5). Фаза 2.
10. **Синтаксический translationese.** Run-on «нанизанные» предложения или рубленость; кальки структур источника («висящие» обороты). Детекция: **не-LLM метрики** (дисперсия длин, доля деепричастных калек) → анти-translationese-пасс; финально — монолингвальный судья. Фаза 2. [LAIT — главная причина проигрыша MT; LitEval — «literal and less diverse»]
11. **Потеря атрибуции диалога.** Цепочка реплик без атрибуции: читатель теряет, кто говорит (в ru — диалоговые тире усугубляют). Детекция: структурный **гейт** чередования реплик + **судья** («кто говорит в каждой реплике?»). Фаза 2. [LAIT]
12. **Родовое слово вместо конкретного.** ja: 弁当箱 → «контейнер с едой» → верно «бэнто». Сглаживание к частотной лексике. Детекция: судья + глоссарий реалий; политика Venuti в brief. Фаза 2. [LAIT; Галь — 07-док]
## Выводы для TextMachine
1. **Словарь тегов ошибок фиксируем сейчас** (Фаза 1, телеметрия): подмножество MQM + оси DITING ≈ 12 тегов из каталога выше; каждый вердикт гейта/судьи пишется в request_log этим словарём. Севèрити-веса MQM (1/5/25) — готовый агрегат для сравнения глав/конфигов C0C3 на пилоте.
2. **Частоты подтверждают приоритеты плана**: детерминированные гейты Фазы 1 (глоссарий, coverage, CJK-осколки) закрывают категории, дающие 64%+ документных ошибок и все «критические» пропуски; гейт рода/ты-вы Фазы 2 бьёт по самой трудной оси DITING (zero-pronoun) — и в ru она детектится лучше, чем в en, за счёт глагольной морфологии.
3. **Судью строить как анкету, а не как эссе**: узкие бинарные/тринарные вопросы по осям (κ=0.94 против 0.84 у DITING), Accuracy-ветвь — билингвально, стиль — попарным сравнением (BWS: 80100% точности у LitEval против ≤20% у метрик). Терминологию у судьи **не спрашивать** (корреляция ~0) — только гейт.
4. **LLM-судьи по умолчанию хвалят MT** (LAIT: τ до 0.318; M-MAD 0.316) — без калибровки на человеческом якоре (пилот 2.5) вердикты судьи нельзя использовать для go/no-go; в проде держать «золотые» главы с человеческим переводом как контрольные точки дрейфа судьи.
5. **Ru-выход — не en-выход**: 92.8% предпочтения человеку на не-английских целях (LAIT) означает, что (а) наш рынок дольше защищён от «сырых» LLM, (б) анти-translationese-пасс и морфогейты — ядро ценности, (в) бенчмаркать пайплайн только на ru-выходе, en-результаты конкурентов не экстраполировать.
6. **Эскалацию приоритизировать по стоимости правки** (Daems/Frontiers): когерентность и meaning shifts → дорогая модель/человек; грамматика/пунктуация → дешёвая модель или детерминированная правка. Телеметрия по тегам позволит посчитать реальную «цену» каждой категории в нашем пайплайне.
7. **Нестабильность по чанкам — метрика первого класса** (LAIT: 42% плохих MT-чанков против 12% у HT): считать распределение вердиктов по чанкам главы и эскалировать хвост, а не среднее.
## Источники
- DITING: [arXiv:2510.09116](https://arxiv.org/abs/2510.09116), [HTML v2](https://arxiv.org/html/2510.09116v2), [GitHub WHUNextGen/DITING](https://github.com/WHUNextGen/DITING), [HuggingFace](https://huggingface.co/papers/2510.09116)
- BlonDe: [arXiv:2103.11878](https://arxiv.org/abs/2103.11878) (NAACL 2022), разбор категорий/статистики BWB — [ar5iv](https://ar5iv.labs.arxiv.org/html/2103.11878)
- MQM: [MQM Core Typology](https://themqm.org/the-mqm-typology/), [scoring models](https://themqm.org/error-types-2/the-mqm-scoring-models/), Freitag et al. «Experts, Errors, and Context» — [arXiv:2104.14478](https://arxiv.org/abs/2104.14478)
- LitEval-Corpus: [arXiv:2410.18697](https://arxiv.org/abs/2410.18697), [HTML v2](https://arxiv.org/html/2410.18697v2)
- LAIT: [arXiv:2606.26040](https://arxiv.org/html/2606.26040v1)
- Karpinska & Iyyer: [arXiv:2304.03245](https://arxiv.org/abs/2304.03245), [ar5iv](https://ar5iv.labs.arxiv.org/html/2304.03245)
- MTPE: Daems, Vandepitte, Hartsuiker, Macken — [Frontiers in Psychology 2017](https://www.frontiersin.org/journals/psychology/articles/10.3389/fpsyg.2017.01282/full), [PMC](https://pmc.ncbi.nlm.nih.gov/articles/PMC5539081/), [LREC 2014 (L14-1441)](https://aclanthology.org/L14-1441/), [MT Summit WPTP 2015](https://aclanthology.org/2015.mtsummit-wptp.3.pdf)
- TAUS DQF: [Measuring Content Quality with Error Typology](https://www.taus.net/resources/blog/measuring-content-quality-with-error-typology-step-by-step-guide), [TAUS Quality Dashboard (ACL)](https://aclanthology.org/2015.tc-1.17.pdf), [DQF-MQM обзор](https://chatscontrol.com/blog/translation-quality-metrics-mqm-dqf-error-typology)