textmachine/docs/research/03-academic-agentic-mt.md
Claude (backend session) 9bb00d49f2 Initial commit: documentation, eval polygon, backend step 0 verdict
TextMachine project repository (AI translation of literary books).
Includes: v2 architecture decisions, MVP plan, research 01-12,
polygon experiments 01-03, backend-session revalidation verdict
(03-implementation-notes.md).

Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
2026-07-04 06:50:59 +03:00

137 lines
36 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

# Научное состояние мультиагентного и документного художественного машинного перевода (20232026)
Дата обзора: 2026-07-04. Охват: arXiv, ACL/EMNLP/NAACL, ICLR, TACL, WMT.
## TL;DR
1. **Generate-then-select — валидированная архитектура.** Свежая работа "When Agents Disagree" (arXiv:2603.20324, март 2026) показывает: разнородная команда генераторов + судья-селектор даёт win rate 0.810 против 0.512 у однородной команды, а команда с включением дешёвой модели (mixed-capability) + судья достигает WR 0.929 при стоимости 1.0x от одиночной дорогой модели. Синтез (Mixture-of-Agents) проигрывает селекции с разгромным отрывом (0.631 WR). Оговорка: перевод в задачах этой статьи отсутствует.
2. **TransAgents** (arXiv:2405.11804, TACL 2025) — эталонная ролевая архитектура для книг: CEO / Senior Editor / Junior Editor / Translator / Localization Specialist / Proofreader на GPT-4-turbo; ~$2.08 за главу против $168.48 у человека (~81x дешевле); переводы предпочитаются людьми и LLM даже против человеческих референсов, но система теряет куски текста (content omission) и проигрывает в жанрах Contemporary Romance / Sci-Fi / Horror.
3. **DelTA** (arXiv:2410.08143, ICLR 2025) — рабочий образец банка памяти для книг: 4 уровня памяти (Proper Noun Records, Bilingual Summary, Long-Term/Short-Term Memory), перевод sentence-by-sentence без пропусков; +4.58 п.п. консистентности имён и +3.16 COMET в среднем.
4. **DRT** (arXiv:2412.17498, ACL 2025 Findings) доказывает: long-CoT «размышление» над метафорами/сравнениями поднимает 714B-модели до уровня 32B reasoning-моделей в литпереводе en→zh; данные синтезированы мультиагентной петлёй translatoradvisorevaluator.
5. **Метрики:** COMET/CometKiwi и MQM ненадёжны на литературных текстах — автометрики отличают человеческий перевод от машинного максимум в 20% случаев (arXiv:2410.18697); лучше работают Best-Worst Scaling с профессионалами и LLM-judge с error spans (GEMBA-MQM, arXiv:2310.13988). Для документного уровня есть BlonDe (NAACL 2022).
6. **Translationese — измеримый враг №1:** >40% переводов даже GPT-4 содержат выраженные кальки; лечится полировкой референсов и фильтрацией обучающих данных (arXiv:2503.04369). Читатели в слепом тесте (июнь 2026, arXiv:2606.26040) всё ещё предпочитают человеческий перевод (522 из 772 фрагментов), но отличить не могут (17/30 угадываний).
7. **Температура:** для одиночного перевода лучше T≈0 (влияние температуры на MT у малых моделей до 192% по качеству, arXiv:2506.07295), но для генерации кандидатов под селектор умеренно повышенная температура даёт более качественный пул, чем детерминированная генерация (arXiv:2601.13729; arXiv:2310.11430).
8. Точной статьи «март 2026, мультиагентный **перевод** с судьёй-селектором» не найдено — ближайшее точное совпадение по дате/методу/выводам — общезадачная arXiv:2603.20324 (см. п.1), а по литпереводу — SAMAS (arXiv:2602.19840, февраль 2026). Детали в разделе 5.
---
## 1. TransAgents: ролевая «переводческая компания»
**Wu, Yuan, Haffari, Wang. "(Perhaps) Beyond Human Translation: Harnessing Multi-Agent Collaboration for Translating Ultra-Long Literary Texts"** — [arXiv:2405.11804](https://arxiv.org/abs/2405.11804), принята в [TACL](https://direct.mit.edu/tacl/article/doi/10.1162/TACL.a.25/132121/Perhaps-Beyond-Human-Translation-Harnessing-Multi), код: [github.com/minghao-wu/transagents](https://github.com/minghao-wu/transagents).
- **Архитектура:** имитация издательства. Роли: CEO (подбирает команду под книгу), Senior Editor (глоссарий и стайлгайд), Junior Editor, Translator, Localization Specialist, Proofreader. Все агенты — GPT-4-turbo (gpt-4-1106-preview) с разными «биографиями».
- **Два паттерна взаимодействия:** *Addition-by-Subtraction* (один агент максимально полно добавляет информацию, второй вычищает избыточное — так строятся глоссарий и стайлгайд) и *Trilateral Collaboration* (Action-агент делает, Critique-агент критикует, **Judgment-агент решает, принять или итерировать** — прото-«судья» в переводном пайплайне).
- **Двухфазный процесс:** preparation (команда + переводческие гайдлайны на всю книгу) → execution (перевод → локализация → вычитка → финальный QC).
- **Оценка:** авторы отказались от référence-based метрик и ввели MHP (Monolingual Human Preference — читатели целевого языка сравнивают фрагменты) и BLP (Bilingual LLM Preference — GPT-4 сравнивает с оригиналом). d-BLEU у TransAgents **ниже** всех бейзлайнов — при этом в MHP переводы предпочитают чаще, чем человеческий референс, а в BLP — ~66% против ~30% у референса ([разбор](https://gonzoml.substack.com/p/perhaps-beyond-human-translation)). Лексическое разнообразие (MATTR, MTLD) выше, чем у GPT-4 и референсов.
- **Стоимость:** ~$2.08/глава против $168.48/глава у профперевода — **в ~81 раза дешевле**.
- **Слабости (важно для нас):** документированные пропуски содержимого; выигрывает в жанрах, требующих домен-знаний (исторические, культурно-нагруженные), проигрывает в Contemporary Romance, Sci-Fi, Horror & Thriller. Вывод авторов честен: «perhaps» — предпочтения оценщиков ≠ строгое превосходство.
## 2. DelTA: документный агент с многоуровневой памятью
**Wang et al. "DelTA: An Online Document-Level Translation Agent Based on Multi-Level Memory"** — [arXiv:2410.08143](https://arxiv.org/abs/2410.08143), **ICLR 2025**, код: [github.com/YutongWang1216/DocMTAgent](https://github.com/YutongWang1216/DocMTAgent).
- **Память 4 уровней:** (1) Proper Noun Records — глоссарий имён собственных с зафиксированными переводами; (2) Bilingual Summary — двуязычное резюме документа; (3) Long-Term Memory — уплотнённая история; (4) Short-Term Memory — последние предложения. Все уровни поддерживаются вспомогательными LLM-компонентами (извлечение/обновление/ретрив).
- **Перевод строго sentence-by-sentence** с подмешиванием памяти — это гарантирует отсутствие пропусков предложений (прямой ответ на болезнь TransAgents) и экономит память/контекст.
- **Результаты:** консистентность перевода имён +4.58 п.п., COMET +3.16 в среднем поверх 4 LLM (открытых и закрытых) на двух doc-датасетах; работает «онлайн» — не требует всего документа заранее (совместимо со стримингом глав вебновеллы).
## 3. DRT: long-CoT для метафор
**Wang et al. "DRT: Deep Reasoning Translation via Long Chain-of-Thought"** (ранее DRT-o1) — [arXiv:2412.17498](https://arxiv.org/abs/2412.17498), [ACL 2025 Findings](https://aclanthology.org/2025.findings-acl.351/).
- Из художественных книг намайнены предложения с метафорами и сравнениями; **мультиагентная петля translator → advisor → evaluator** итеративно переводит их и записывает весь ход рассуждений как long-CoT (среднe 500+ токенов «мыслей»); получено ~1922K обучающих примеров (en→zh).
- SFT на этих данных поверх Qwen2.5-7B/14B и Llama-3.1-8B: DRT-модели обходят и ванильные LLM, и SFT без «мыслей»; DRT-14B обходит QwQ-32B-preview и DeepSeek-R1-Distill-Qwen-32B ([HF paper page](https://huggingface.co/papers/2412.17498)).
- **Смысл для нас:** «глубокое обдумывание» образного языка — обучаемый навык; дорогую reasoning-модель можно дистиллировать в дешёвую 714B специально под художку. Модели DRT-o1-7B выложены (есть GGUF-кванты — влезает в 8GB VRAM).
## 4. Другие agentic-MT работы 20242026
- **CRAT** — [arXiv:2410.21067](https://arxiv.org/abs/2410.21067) (WeChat AI): мультиагентный RAG-перевод с каузальной саморефлексией. Агенты: Unknown Terms Identification (детект незнакомых/контекстно-зависимых терминов), KG Constructor (внутренние знания + двуязычный ретрив), causality-enhanced judge для валидации извлечённого, переводчик. Прямой прототип «консультанта по терминам/поп-культуре».
- **TACTIC** — [arXiv:2506.08403](https://arxiv.org/abs/2506.08403): мультиагентный фреймворк, явно построенный на когнитивной теории перевода (баланс буквального/вольного, итеративная переоценка); заявляет SOTA на разных парах.
- **TEaR** — [arXiv:2402.16379](https://arxiv.org/abs/2402.16379), NAACL 2025 Findings: минимальный цикл Translate → Estimate → Refine; систематическое самоисправление стабильно улучшает качество на высоко- и низкоресурсных языках. Дешёвый паттерн «редактора» из одного LLM.
- **GenTranslate** — [arXiv:2402.06894](https://arxiv.org/abs/2402.06894): вместо выбора top-1 из N-best LLM **синтезирует** финальный перевод из всех гипотез; датасет HypoTranslate (592K пар) для файнтюна; бьёт SOTA на WMT/FLEURS/CoVoST-2. Внимание: это synthesis-подход, который в общезадачной работе 2603.20324 проигрывает селекции — на сегодня противоречие открыто (у GenTranslate синтезатор специально дообучен, что, видимо, критично).
- **SAMAS** — [arXiv:2602.19840](https://arxiv.org/pdf/2602.19840) (февраль 2026): «спектр стилевых признаков» (wavelet packet transform) как управляющий сигнал для динамической сборки агентов под структуру текста; статистически значимое преимущество в стилевой верности при конкурентной семантической точности. Свежая идея квантификации «стиля» как параметра пайплайна.
- **Better Literary Translation / LitMT** — [arXiv:2606.05924](https://arxiv.org/html/2606.05924) (июнь 2026): мультиаспектная генерация данных; LitMT-8B/14B (из Qwen3-Base) достигают 67.25/69.07 CEA100 на MetaphorTrans — на уровне Claude Sonnet 4.5 (68.43). Ещё одно подтверждение: маленькая специализированная модель ≈ фронтир в литпереводе.
- **Agentic AI Translate** — [arXiv:2605.17041](https://arxiv.org/html/2605.17041) (май 2026): прототип агентного переводчика в парадигме «перевод как коммуникационный дизайн» (не проверено детально).
- **Farinhas et al., "An Empirical Study of Translation Hypothesis Ensembling with LLMs"** — [arXiv:2310.11430](https://arxiv.org/abs/2310.11430), EMNLP 2023: MBR-декодирование — самый эффективный способ выбора из пула гипотез; хватает малого числа сэмплов; instruction tuning сильно меняет связь «температура ↔ разнообразие гипотез».
- **QE-fusion "Don't Rank, Combine!"** — [arXiv:2401.06688](https://arxiv.org/pdf/2401.06688): слияние фрагментов гипотез по quality estimation обходит и MBR, и QE-reranking; повышенная температура помогает до определённого порога.
## 5. Судья-селектор: что именно нашлось (запрошенная статья ~март 2026)
Статья, **точно** описывающая «мультиагентный ПЕРЕВОД с судьёй-селектором, поднимающий дешёвые модели до уровня дорогих», в переводной литературе марта 2026 **не обнаружена** (искал по multi-agent translation judge/selector/ensemble, literary multi-agent, LLM ensemble selection translation). Ближайшее совпадение по дате, механике и главному выводу:
**"When Agents Disagree: The Selection Bottleneck in Multi-Agent LLM Pipelines"** (Artem Maryanskyy) — [arXiv:2603.20324](https://arxiv.org/abs/2603.20324), подана 20 марта 2026. Вероятно, это и есть упомянутая статья — с оговоркой, что она **общезадачная, перевода среди её 42 задач нет** (7 категорий: coding, creative writing, ethics/policy, math/logic, reasoning, science, summarization).
Метод и цифры ([полный текст](https://arxiv.org/html/2603.20324)):
- Пайплайн generate-then-select: 3 генератора → панель судей (Claude Sonnet, GPT-5-mini, DeepSeek-V3p2) с попарным сравнением и BradleyTerry-скорингом.
- **Diverse-команда (Opus + GPT-5.4 + Gemini 2.5 Pro) + судья: WR 0.810** против одиночного бейзлайна; однородная команда (Opus x3) + судья: WR 0.512 (уровень случайности); Glass's Δ = 2.07.
- **Mixed-capability (Opus + Gemini 2.5 Pro + дешёвый Haiku) + судья: WR 0.929 при относительной стоимости 1.0x** — добавление слабой модели одновременно улучшило качество и срезало цену (p < 10⁻⁴).
- Судейская селекция > синтеза (MoA) на **всех 42 задачах без исключений** (Δ = +0.631 WR); majority vote тоже проваливается (0.496).
- Концепт «selection bottleneck»: существует порог качества селектора s*, ниже которого разнообразие генераторов **вредит**; «качество селектора — более значимый рычаг дизайна, чем разнообразие генераторов».
- Ограничения: LLM-as-judge как прокси (валидация людьми снизила win rates на 5367%, но сохранила ранжирование), одна итерация, только текущие фронтир-модели.
Смежные подтверждения из перевода: judge-оркестрированный ансамбль 7 LLM с GPT-4o-mini-судьёй занял 1-е место из 26 команд на SemEval-2026 Task 8 ([arXiv:2605.04523](https://arxiv.org/pdf/2605.04523)); в MT selection-семейство представлено MBR/QE-reranking/QE-fusion (раздел 4) и «Judgment-агентом» Trilateral Collaboration в TransAgents. Также «When KV Cache Reuse Fails in Multi-Agent Systems» ([arXiv:2601.08343](https://arxiv.org/pdf/2601.08343)) — про то, что LLM-судье критично видеть кандидатов совместно (cross-candidate interaction), важно для реализации судьи.
## 6. Метрики качества литературного перевода
- **COMET / CometKiwi.** COMET — нейрометрика с референсом; CometKiwi — reference-free QE ([WMT22 submission](https://aclanthology.org/2022.wmt-1.60/), упоминается как бейзлайн в [GEMBA-MQM](https://arxiv.org/abs/2310.13988)). Для **онлайн-телеметрии** (нет референса) кандидаты — CometKiwi и LLM-judge. Но на литтекстах надёжность ограничена (см. ниже).
- **GEMBA-MQM** ([arXiv:2310.13988](https://arxiv.org/abs/2310.13988), Kocmi & Federmann, WMT 2023): GPT-4 с фиксированным 3-shot промптом размечает error spans в MQM-таксономии, reference-free, языконезависимый промпт; SOTA по system ranking; авторы предупреждают о зависимости от закрытой модели.
- **BlonDe** ([arXiv:2103.11878](https://arxiv.org/abs/2103.11878), NAACL 2022): документная метрика — F1 по категоризированным дискурсивным спанам (консистентность имён, времена, род, эллипсис); валидирована на BWB — корпусе **вебновелл**; значительно выше корреляция с людьми на doc-уровне, чем BLEU. Хороший кандидат для оффлайн-регрессионных тестов консистентности.
- **LitEval-Corpus / "How Good Are LLMs for Literary Translation, Really?"** ([arXiv:2410.18697](https://arxiv.org/html/2410.18697v1), Zhang, Zhao, Eger): 2K+ параграфов, 13K размеченных предложений, 4 пары (de↔en, en↔zh и др.), 9 систем + верифицированные человеческие переводы. Выводы: человеческие переводы стабильно лучше LLM; LLM буквальнее и лексически беднее; **автометрики распознают человеческий перевод максимум в 20% случаев**; сложная MQM-схема не работает на литтексте (студенты «проваливают» ~60% человеческих переводов), простая **Best-Worst Scaling с профессионалами работает (80100%)**.
- **LiTransProQA** ([arXiv:2505.05423](https://arxiv.org/html/2505.05423v4), EMNLP 2025): LLM-метрика в форме профессионального QA (вопросы, которые задал бы литпереводчик) — специализированная literary-метрика.
- **MAS-LitEval** ([arXiv:2506.14199](https://arxiv.org/html/2506.14199)): мультиагентная система оценки литперевода (terminology/style/coherence-агенты) — судейство тоже становится мультиагентным.
- **DITING** ([arXiv:2510.09116](https://arxiv.org/pdf/2510.09116)): мультиагентный фреймворк оценки именно **перевода вебновелл** по шести измерениям — максимально близко к домену TextMachine.
- **WMT Discourse-Level Literary Translation** (20232024): [findings WMT24](https://aclanthology.org/2024.wmt-1.58/), корпус [GuoFeng Webnovel V2](https://github.com/longyuewangdcu/GuoFeng-Webnovel) — 22,567 глав из 179 вебновелл, 14 жанров, пары zh→en/de/**ru**; официальный рейтинг — по человеческой оценке, автометрики вспомогательны. Готовые данные и протокол оценки для наших пар.
- **Практический итог:** для онлайн-телеметрии — CometKiwi (дёшево, грубо) + LLM-judge по MQM-спанам (точнее, дороже); для оффлайн-評ки релизов — BWS-сравнения людьми/панелью судей и BlonDe-подобные проверки консистентности; сырому COMET на художке доверять нельзя.
## 7. LLM в литпереводе, translationese, восприятие читателями
- **Karpinska & Iyyer, "LLMs effectively leverage document-level context for literary translation, but critical errors persist"** ([arXiv:2304.03245](https://arxiv.org/abs/2304.03245), [WMT 2023](https://aclanthology.org/2023.wmt-1.41/)): перевод **целым параграфом** качественно лучше по-предложенческого у GPT-3.5 на 18 разнообразных парах (вкл. ja, pl); но остаются критические ошибки — смысловые искажения, дискурсивные сбои. Фундамент тезиса «контекст обязателен».
- **"Lost in Literalism"** ([arXiv:2503.04369](https://arxiv.org/abs/2503.04369), [ACL 2025](https://aclanthology.org/2025.acl-long.630/)): систематическая оценка translationese; **>40% переводов GPT-4 имеют выраженные признаки кальки**; корень — SFT на «слишком буквальных» референсах; митигции: полировка золотых референсов LLM-ом и фильтрация неестественных обучающих примеров ([код](https://github.com/yafuly/LLM_Translationese)).
- **"AI translation of literary texts is 'fine', but readers still prefer human translations"** ([arXiv:2606.26040](https://arxiv.org/html/2606.26040v1), июнь 2026, соавтор — Karpinska): 15 читателей, 15 современных романов fr/pl/ja→en, агентный LLM-пайплайн (chunk-уровневые и полнодрафтовые ревизии; конфигурации с GPT-5.4, Gemini 3.1 Pro, Claude Code/Codex). Итог: MT «приемлем», но HT предпочитают в 19/30 отрывков и **522/772 фрагментов**; отличить HT от MT читатели не могут (17/30); ценят в HT «лёгкость, ясность, погружение»; качество MT **нестабильно внутри книги**; автометрики и LLM-судьи разошлись с живыми читателями (favоризировали MT). Выпущен датасет LAIT (7,200 span-аннотаций).
- Вывод: разрыв с человеком сузился до статистически заметного, но не фатального; главные рычаги — борьба с буквальностью, стабильность качества вдоль книги, дискурсивная консистентность.
## 8. Память и глоссарии: agentic memory для книг
- **DelTA** (раздел 2) — единственный из рассмотренных дизайн памяти, созданный именно под документный перевод: связка «глоссарий имён + резюме + LTM/STM» напрямую переносится в банк памяти TextMachine.
- **MemGPT/Letta** ([arXiv:2310.08560](https://arxiv.org/abs/2310.08560)): виртуальное управление контекстом по образцу иерархии памяти ОС; агент сам решает, что переместить между контекстом и внешним хранилищем через tool-calls; риск — качество ретрива зависит от качества решений агента.
- **A-MEM** ([arXiv:2502.12110](https://arxiv.org/html/2502.12110v1)): «Zettelkasten»-заметки (контекст, теги, связи), автосвязывание и эволюция памяти; на multi-hop задачах LoCoMo ≥2x лучше MemGPT.
- **Mem0** ([arXiv:2504.19413](https://arxiv.org/pdf/2504.19413)): экстракция/консолидация фактов + опциональный граф; заявлено +26% (LLM-judge) против памяти OpenAI, ~91% ниже p95-латентность и >90% экономия токенов против full-context (цифры из материалов самих Mem0 — [блог](https://mem0.ai/blog/benchmarked-openai-memory-vs-langmem-vs-memgpt-vs-mem0-for-long-term-memory-here-s-how-they-stacked-up); независимая репликация — не проверено).
- Для книг важно: диалоговые бенчмарки памяти (LoCoMo) не эквивалентны задаче «40 глав вебновеллы»; специализированная структура DelTA (жёсткий глоссарий имён + резюме) на переводе била генерические подходы. Разумная стратегия: жёсткий детерминированный глоссарий (SQL/KV) + мягкая семантическая память (эмбеддинги резюме глав), а не универсальный memory-фреймворк.
## 9. Температура и сэмплинг
- **"Exploring the Impact of Temperature on LLMs: Hot or Cold?"** ([arXiv:2506.07295](https://arxiv.org/html/2506.07295v1)): у малых моделей температура меняет качество MT до **192.32%**; для MT в целом лучший результат при **T=0.0**; высокие T бьют по малым моделям сильнее всего.
- **"On Temperature-Constrained Non-Deterministic MT"** ([arXiv:2601.13729](https://arxiv.org/abs/2601.13729), янв. 2026): недетерминированный MT при ограниченной температуре даёт **более качественные кандидаты**, чем детерминированный, и помогает против multi-modality; открыт «Buckets Effect» — ранжирование ND-систем автометриками доминируется худшим кандидатом, поэтому нужны специальные протоколы оценки (ExpectoSample).
- **Farinhas et al.** ([arXiv:2310.11430](https://arxiv.org/abs/2310.11430)): связь «температура → разнообразие гипотез» сильно зависит от instruction tuning; для ансамблирования достаточно малого числа сэмплов. **QE-fusion** ([arXiv:2401.06688](https://arxiv.org/html/2401.06688v1)): рост температуры улучшает QE-слияние до порога, затем качество падает.
- Практика: T≈00.3 для одиночного «точного» прохода и для судьи; T≈0.61.0 (подбирать на своих парах) для генерации разнообразных кандидатов под селектор; adaptive/selective sampling ([arXiv:2510.01218](https://arxiv.org/abs/2510.01218)) — перспективно, но пока исследовательская стадия.
## Выводы для TextMachine
1. **Ядро пайплайна — generate-then-select, не synthesis.** N разнородных дешёвых переводчиков (разные семейства моделей и/или промпт-стратегии) + сильный судья с попарным сравнением (BradleyTerry) — это лучшая по науке точка соотношения качество/цена (WR 0.929 при 1.0x стоимости в 2603.20324). Вкладываться в качество судьи выгоднее, чем в число/силу генераторов; слабый судья делает разнообразие вредным — нужен evals-гейт на самого судью.
2. **Судья должен видеть кандидатов совместно** (cross-candidate prompt), а не скорить поодиночке (2601.08343); дешёвая альтернатива LLM-судьи для отсева — CometKiwi/MBR-прескрининг пула перед финальным LLM-сравнением (2310.11430, 2401.06688).
3. **Роли из TransAgents брать выборочно:** Senior Editor (глоссарий+стайлгайд на этапе preparation) и Trilateral Collaboration (Action/Critique/Judgment) доказали пользу; но обязателен анти-omission контроль — DelTA-стиль по-предложенческого/по-абзацного покрытия с проверкой полноты.
4. **Банк памяти делать по образцу DelTA:** жёсткий Proper Noun Records (детерминированный глоссарий), Bilingual Summary по главам, STM последних абзацев. Генерические memory-фреймворки (Mem0/A-MEM/Letta) — вторичны; их ценность для перевода книг не доказана.
5. **Температурная политика:** переводчики-кандидаты — умеренно повышенная T (пул разнообразных гипотез качественнее детерминированного), судья/редактор/глоссарий — T≈0. У маленьких локальных моделей (8GB VRAM) высоких T избегать особенно.
6. **Телеметрия качества:** онлайн — CometKiwi (дёшево) + периодический GEMBA-MQM-подобный LLM-judge с error spans; оффлайн-релизы — BWS-пары с людьми и проверки консистентности имён/времён (BlonDe/DITING-подобные). Сырой COMET/BLEU как KPI художественности — запрещён (распознают человеческий уровень ≤20%).
7. **Анти-translationese как отдельная роль:** пост-редактор «натуральности» на целевом языке + фильтрация буквализмов; >40% калькированных переводов даже у топ-моделей — это главная художественная болезнь, а не редкие смысловые ошибки.
8. **Дистилляция под нишу:** DRT и LitMT показывают, что 714B, дообученные на синтетике из собственного мультиагентного пайплайна (петля translatoradvisorevaluator), догоняют фронтир на литпереводе — путь к локальной модели на GPU владельца и радикальному снижению себестоимости. Датасеты GuoFeng (zh→ru/en вебновеллы) и LAIT — готовое сырьё для evals.
## Открытые вопросы
- Существует ли всё-таки переводо-специфичная статья марта 2026 про судью-селектора (возможно, не проиндексирована в использованных поисках или пользователь имел в виду 2603.20324)?
- Переносится ли порог «selection bottleneck» на литперевод zh/ja→ru — нужен собственный эксперимент.
- Насколько CometKiwi/GEMBA-MQM устойчивы на 18+ контенте (риск отказов судейских моделей провайдеров).
## Источники
- TransAgents: https://arxiv.org/abs/2405.11804 ; TACL: https://direct.mit.edu/tacl/article/doi/10.1162/TACL.a.25/132121 ; https://github.com/minghao-wu/transagents ; разбор: https://gonzoml.substack.com/p/perhaps-beyond-human-translation
- DelTA: https://arxiv.org/abs/2410.08143 ; https://github.com/YutongWang1216/DocMTAgent
- DRT: https://arxiv.org/abs/2412.17498 ; https://aclanthology.org/2025.findings-acl.351/ ; https://huggingface.co/papers/2412.17498
- CRAT: https://arxiv.org/abs/2410.21067 ; TACTIC: https://arxiv.org/abs/2506.08403 ; TEaR: https://arxiv.org/abs/2402.16379 ; GenTranslate: https://arxiv.org/abs/2402.06894
- When Agents Disagree: https://arxiv.org/abs/2603.20324 ; KV-cache/judge: https://arxiv.org/pdf/2601.08343 ; SemEval-2026 judge-ensemble: https://arxiv.org/pdf/2605.04523
- SAMAS: https://arxiv.org/pdf/2602.19840 ; LitMT: https://arxiv.org/html/2606.05924 ; Agentic AI Translate: https://arxiv.org/html/2605.17041
- Ансамбли/селекция MT: https://arxiv.org/abs/2310.11430 ; https://arxiv.org/pdf/2401.06688
- Метрики: GEMBA-MQM: https://arxiv.org/abs/2310.13988 ; BlonDe: https://arxiv.org/abs/2103.11878 ; LitEval: https://arxiv.org/html/2410.18697v1 ; LiTransProQA: https://arxiv.org/html/2505.05423v4 ; MAS-LitEval: https://arxiv.org/html/2506.14199 ; DITING: https://arxiv.org/pdf/2510.09116 ; CometKiwi: https://aclanthology.org/2022.wmt-1.60/
- WMT literary: https://aclanthology.org/2024.wmt-1.58/ ; https://github.com/longyuewangdcu/GuoFeng-Webnovel ; https://www2.statmt.org/wmt24/literary-translation-task.html
- Литперевод/translationese: https://arxiv.org/abs/2304.03245 ; https://arxiv.org/abs/2503.04369 ; https://arxiv.org/html/2606.26040v1
- Память: MemGPT: https://arxiv.org/abs/2310.08560 ; A-MEM: https://arxiv.org/html/2502.12110v1 ; Mem0: https://arxiv.org/pdf/2504.19413 ; https://mem0.ai/blog/benchmarked-openai-memory-vs-langmem-vs-memgpt-vs-mem0-for-long-term-memory-here-s-how-they-stacked-up
- Температура: https://arxiv.org/html/2506.07295v1 ; https://arxiv.org/abs/2601.13729 ; https://arxiv.org/abs/2510.01218