# Научное состояние мультиагентного и документного художественного машинного перевода (2023–2026) Дата обзора: 2026-07-04. Охват: arXiv, ACL/EMNLP/NAACL, ICLR, TACL, WMT. ## TL;DR 1. **Generate-then-select — валидированная архитектура.** Свежая работа "When Agents Disagree" (arXiv:2603.20324, март 2026) показывает: разнородная команда генераторов + судья-селектор даёт win rate 0.810 против 0.512 у однородной команды, а команда с включением дешёвой модели (mixed-capability) + судья достигает WR 0.929 при стоимости 1.0x от одиночной дорогой модели. Синтез (Mixture-of-Agents) проигрывает селекции с разгромным отрывом (−0.631 WR). Оговорка: перевод в задачах этой статьи отсутствует. 2. **TransAgents** (arXiv:2405.11804, TACL 2025) — эталонная ролевая архитектура для книг: CEO / Senior Editor / Junior Editor / Translator / Localization Specialist / Proofreader на GPT-4-turbo; ~$2.08 за главу против $168.48 у человека (~81x дешевле); переводы предпочитаются людьми и LLM даже против человеческих референсов, но система теряет куски текста (content omission) и проигрывает в жанрах Contemporary Romance / Sci-Fi / Horror. 3. **DelTA** (arXiv:2410.08143, ICLR 2025) — рабочий образец банка памяти для книг: 4 уровня памяти (Proper Noun Records, Bilingual Summary, Long-Term/Short-Term Memory), перевод sentence-by-sentence без пропусков; +4.58 п.п. консистентности имён и +3.16 COMET в среднем. 4. **DRT** (arXiv:2412.17498, ACL 2025 Findings) доказывает: long-CoT «размышление» над метафорами/сравнениями поднимает 7–14B-модели до уровня 32B reasoning-моделей в литпереводе en→zh; данные синтезированы мультиагентной петлёй translator–advisor–evaluator. 5. **Метрики:** COMET/CometKiwi и MQM ненадёжны на литературных текстах — автометрики отличают человеческий перевод от машинного максимум в 20% случаев (arXiv:2410.18697); лучше работают Best-Worst Scaling с профессионалами и LLM-judge с error spans (GEMBA-MQM, arXiv:2310.13988). Для документного уровня есть BlonDe (NAACL 2022). 6. **Translationese — измеримый враг №1:** >40% переводов даже GPT-4 содержат выраженные кальки; лечится полировкой референсов и фильтрацией обучающих данных (arXiv:2503.04369). Читатели в слепом тесте (июнь 2026, arXiv:2606.26040) всё ещё предпочитают человеческий перевод (522 из 772 фрагментов), но отличить не могут (17/30 угадываний). 7. **Температура:** для одиночного перевода лучше T≈0 (влияние температуры на MT у малых моделей до 192% по качеству, arXiv:2506.07295), но для генерации кандидатов под селектор умеренно повышенная температура даёт более качественный пул, чем детерминированная генерация (arXiv:2601.13729; arXiv:2310.11430). 8. Точной статьи «март 2026, мультиагентный **перевод** с судьёй-селектором» не найдено — ближайшее точное совпадение по дате/методу/выводам — общезадачная arXiv:2603.20324 (см. п.1), а по литпереводу — SAMAS (arXiv:2602.19840, февраль 2026). Детали в разделе 5. --- ## 1. TransAgents: ролевая «переводческая компания» **Wu, Yuan, Haffari, Wang. "(Perhaps) Beyond Human Translation: Harnessing Multi-Agent Collaboration for Translating Ultra-Long Literary Texts"** — [arXiv:2405.11804](https://arxiv.org/abs/2405.11804), принята в [TACL](https://direct.mit.edu/tacl/article/doi/10.1162/TACL.a.25/132121/Perhaps-Beyond-Human-Translation-Harnessing-Multi), код: [github.com/minghao-wu/transagents](https://github.com/minghao-wu/transagents). - **Архитектура:** имитация издательства. Роли: CEO (подбирает команду под книгу), Senior Editor (глоссарий и стайлгайд), Junior Editor, Translator, Localization Specialist, Proofreader. Все агенты — GPT-4-turbo (gpt-4-1106-preview) с разными «биографиями». - **Два паттерна взаимодействия:** *Addition-by-Subtraction* (один агент максимально полно добавляет информацию, второй вычищает избыточное — так строятся глоссарий и стайлгайд) и *Trilateral Collaboration* (Action-агент делает, Critique-агент критикует, **Judgment-агент решает, принять или итерировать** — прото-«судья» в переводном пайплайне). - **Двухфазный процесс:** preparation (команда + переводческие гайдлайны на всю книгу) → execution (перевод → локализация → вычитка → финальный QC). - **Оценка:** авторы отказались от référence-based метрик и ввели MHP (Monolingual Human Preference — читатели целевого языка сравнивают фрагменты) и BLP (Bilingual LLM Preference — GPT-4 сравнивает с оригиналом). d-BLEU у TransAgents **ниже** всех бейзлайнов — при этом в MHP переводы предпочитают чаще, чем человеческий референс, а в BLP — ~66% против ~30% у референса ([разбор](https://gonzoml.substack.com/p/perhaps-beyond-human-translation)). Лексическое разнообразие (MATTR, MTLD) выше, чем у GPT-4 и референсов. - **Стоимость:** ~$2.08/глава против $168.48/глава у профперевода — **в ~81 раза дешевле**. - **Слабости (важно для нас):** документированные пропуски содержимого; выигрывает в жанрах, требующих домен-знаний (исторические, культурно-нагруженные), проигрывает в Contemporary Romance, Sci-Fi, Horror & Thriller. Вывод авторов честен: «perhaps» — предпочтения оценщиков ≠ строгое превосходство. ## 2. DelTA: документный агент с многоуровневой памятью **Wang et al. "DelTA: An Online Document-Level Translation Agent Based on Multi-Level Memory"** — [arXiv:2410.08143](https://arxiv.org/abs/2410.08143), **ICLR 2025**, код: [github.com/YutongWang1216/DocMTAgent](https://github.com/YutongWang1216/DocMTAgent). - **Память 4 уровней:** (1) Proper Noun Records — глоссарий имён собственных с зафиксированными переводами; (2) Bilingual Summary — двуязычное резюме документа; (3) Long-Term Memory — уплотнённая история; (4) Short-Term Memory — последние предложения. Все уровни поддерживаются вспомогательными LLM-компонентами (извлечение/обновление/ретрив). - **Перевод строго sentence-by-sentence** с подмешиванием памяти — это гарантирует отсутствие пропусков предложений (прямой ответ на болезнь TransAgents) и экономит память/контекст. - **Результаты:** консистентность перевода имён +4.58 п.п., COMET +3.16 в среднем поверх 4 LLM (открытых и закрытых) на двух doc-датасетах; работает «онлайн» — не требует всего документа заранее (совместимо со стримингом глав вебновеллы). ## 3. DRT: long-CoT для метафор **Wang et al. "DRT: Deep Reasoning Translation via Long Chain-of-Thought"** (ранее DRT-o1) — [arXiv:2412.17498](https://arxiv.org/abs/2412.17498), [ACL 2025 Findings](https://aclanthology.org/2025.findings-acl.351/). - Из художественных книг намайнены предложения с метафорами и сравнениями; **мультиагентная петля translator → advisor → evaluator** итеративно переводит их и записывает весь ход рассуждений как long-CoT (среднe 500+ токенов «мыслей»); получено ~19–22K обучающих примеров (en→zh). - SFT на этих данных поверх Qwen2.5-7B/14B и Llama-3.1-8B: DRT-модели обходят и ванильные LLM, и SFT без «мыслей»; DRT-14B обходит QwQ-32B-preview и DeepSeek-R1-Distill-Qwen-32B ([HF paper page](https://huggingface.co/papers/2412.17498)). - **Смысл для нас:** «глубокое обдумывание» образного языка — обучаемый навык; дорогую reasoning-модель можно дистиллировать в дешёвую 7–14B специально под художку. Модели DRT-o1-7B выложены (есть GGUF-кванты — влезает в 8GB VRAM). ## 4. Другие agentic-MT работы 2024–2026 - **CRAT** — [arXiv:2410.21067](https://arxiv.org/abs/2410.21067) (WeChat AI): мультиагентный RAG-перевод с каузальной саморефлексией. Агенты: Unknown Terms Identification (детект незнакомых/контекстно-зависимых терминов), KG Constructor (внутренние знания + двуязычный ретрив), causality-enhanced judge для валидации извлечённого, переводчик. Прямой прототип «консультанта по терминам/поп-культуре». - **TACTIC** — [arXiv:2506.08403](https://arxiv.org/abs/2506.08403): мультиагентный фреймворк, явно построенный на когнитивной теории перевода (баланс буквального/вольного, итеративная переоценка); заявляет SOTA на разных парах. - **TEaR** — [arXiv:2402.16379](https://arxiv.org/abs/2402.16379), NAACL 2025 Findings: минимальный цикл Translate → Estimate → Refine; систематическое самоисправление стабильно улучшает качество на высоко- и низкоресурсных языках. Дешёвый паттерн «редактора» из одного LLM. - **GenTranslate** — [arXiv:2402.06894](https://arxiv.org/abs/2402.06894): вместо выбора top-1 из N-best LLM **синтезирует** финальный перевод из всех гипотез; датасет HypoTranslate (592K пар) для файнтюна; бьёт SOTA на WMT/FLEURS/CoVoST-2. Внимание: это synthesis-подход, который в общезадачной работе 2603.20324 проигрывает селекции — на сегодня противоречие открыто (у GenTranslate синтезатор специально дообучен, что, видимо, критично). - **SAMAS** — [arXiv:2602.19840](https://arxiv.org/pdf/2602.19840) (февраль 2026): «спектр стилевых признаков» (wavelet packet transform) как управляющий сигнал для динамической сборки агентов под структуру текста; статистически значимое преимущество в стилевой верности при конкурентной семантической точности. Свежая идея квантификации «стиля» как параметра пайплайна. - **Better Literary Translation / LitMT** — [arXiv:2606.05924](https://arxiv.org/html/2606.05924) (июнь 2026): мультиаспектная генерация данных; LitMT-8B/14B (из Qwen3-Base) достигают 67.25/69.07 CEA100 на MetaphorTrans — на уровне Claude Sonnet 4.5 (68.43). Ещё одно подтверждение: маленькая специализированная модель ≈ фронтир в литпереводе. - **Agentic AI Translate** — [arXiv:2605.17041](https://arxiv.org/html/2605.17041) (май 2026): прототип агентного переводчика в парадигме «перевод как коммуникационный дизайн» (не проверено детально). - **Farinhas et al., "An Empirical Study of Translation Hypothesis Ensembling with LLMs"** — [arXiv:2310.11430](https://arxiv.org/abs/2310.11430), EMNLP 2023: MBR-декодирование — самый эффективный способ выбора из пула гипотез; хватает малого числа сэмплов; instruction tuning сильно меняет связь «температура ↔ разнообразие гипотез». - **QE-fusion "Don't Rank, Combine!"** — [arXiv:2401.06688](https://arxiv.org/pdf/2401.06688): слияние фрагментов гипотез по quality estimation обходит и MBR, и QE-reranking; повышенная температура помогает до определённого порога. ## 5. Судья-селектор: что именно нашлось (запрошенная статья ~март 2026) Статья, **точно** описывающая «мультиагентный ПЕРЕВОД с судьёй-селектором, поднимающий дешёвые модели до уровня дорогих», в переводной литературе марта 2026 **не обнаружена** (искал по multi-agent translation judge/selector/ensemble, literary multi-agent, LLM ensemble selection translation). Ближайшее совпадение по дате, механике и главному выводу: **"When Agents Disagree: The Selection Bottleneck in Multi-Agent LLM Pipelines"** (Artem Maryanskyy) — [arXiv:2603.20324](https://arxiv.org/abs/2603.20324), подана 20 марта 2026. Вероятно, это и есть упомянутая статья — с оговоркой, что она **общезадачная, перевода среди её 42 задач нет** (7 категорий: coding, creative writing, ethics/policy, math/logic, reasoning, science, summarization). Метод и цифры ([полный текст](https://arxiv.org/html/2603.20324)): - Пайплайн generate-then-select: 3 генератора → панель судей (Claude Sonnet, GPT-5-mini, DeepSeek-V3p2) с попарным сравнением и Bradley–Terry-скорингом. - **Diverse-команда (Opus + GPT-5.4 + Gemini 2.5 Pro) + судья: WR 0.810** против одиночного бейзлайна; однородная команда (Opus x3) + судья: WR 0.512 (уровень случайности); Glass's Δ = 2.07. - **Mixed-capability (Opus + Gemini 2.5 Pro + дешёвый Haiku) + судья: WR 0.929 при относительной стоимости 1.0x** — добавление слабой модели одновременно улучшило качество и срезало цену (p < 10⁻⁴). - Судейская селекция > синтеза (MoA) на **всех 42 задачах без исключений** (Δ = +0.631 WR); majority vote тоже проваливается (0.496). - Концепт «selection bottleneck»: существует порог качества селектора s*, ниже которого разнообразие генераторов **вредит**; «качество селектора — более значимый рычаг дизайна, чем разнообразие генераторов». - Ограничения: LLM-as-judge как прокси (валидация людьми снизила win rates на 53–67%, но сохранила ранжирование), одна итерация, только текущие фронтир-модели. Смежные подтверждения из перевода: judge-оркестрированный ансамбль 7 LLM с GPT-4o-mini-судьёй занял 1-е место из 26 команд на SemEval-2026 Task 8 ([arXiv:2605.04523](https://arxiv.org/pdf/2605.04523)); в MT selection-семейство представлено MBR/QE-reranking/QE-fusion (раздел 4) и «Judgment-агентом» Trilateral Collaboration в TransAgents. Также «When KV Cache Reuse Fails in Multi-Agent Systems» ([arXiv:2601.08343](https://arxiv.org/pdf/2601.08343)) — про то, что LLM-судье критично видеть кандидатов совместно (cross-candidate interaction), важно для реализации судьи. ## 6. Метрики качества литературного перевода - **COMET / CometKiwi.** COMET — нейрометрика с референсом; CometKiwi — reference-free QE ([WMT22 submission](https://aclanthology.org/2022.wmt-1.60/), упоминается как бейзлайн в [GEMBA-MQM](https://arxiv.org/abs/2310.13988)). Для **онлайн-телеметрии** (нет референса) кандидаты — CometKiwi и LLM-judge. Но на литтекстах надёжность ограничена (см. ниже). - **GEMBA-MQM** ([arXiv:2310.13988](https://arxiv.org/abs/2310.13988), Kocmi & Federmann, WMT 2023): GPT-4 с фиксированным 3-shot промптом размечает error spans в MQM-таксономии, reference-free, языконезависимый промпт; SOTA по system ranking; авторы предупреждают о зависимости от закрытой модели. - **BlonDe** ([arXiv:2103.11878](https://arxiv.org/abs/2103.11878), NAACL 2022): документная метрика — F1 по категоризированным дискурсивным спанам (консистентность имён, времена, род, эллипсис); валидирована на BWB — корпусе **вебновелл**; значительно выше корреляция с людьми на doc-уровне, чем BLEU. Хороший кандидат для оффлайн-регрессионных тестов консистентности. - **LitEval-Corpus / "How Good Are LLMs for Literary Translation, Really?"** ([arXiv:2410.18697](https://arxiv.org/html/2410.18697v1), Zhang, Zhao, Eger): 2K+ параграфов, 13K размеченных предложений, 4 пары (de↔en, en↔zh и др.), 9 систем + верифицированные человеческие переводы. Выводы: человеческие переводы стабильно лучше LLM; LLM буквальнее и лексически беднее; **автометрики распознают человеческий перевод максимум в 20% случаев**; сложная MQM-схема не работает на литтексте (студенты «проваливают» ~60% человеческих переводов), простая **Best-Worst Scaling с профессионалами работает (80–100%)**. - **LiTransProQA** ([arXiv:2505.05423](https://arxiv.org/html/2505.05423v4), EMNLP 2025): LLM-метрика в форме профессионального QA (вопросы, которые задал бы литпереводчик) — специализированная literary-метрика. - **MAS-LitEval** ([arXiv:2506.14199](https://arxiv.org/html/2506.14199)): мультиагентная система оценки литперевода (terminology/style/coherence-агенты) — судейство тоже становится мультиагентным. - **DITING** ([arXiv:2510.09116](https://arxiv.org/pdf/2510.09116)): мультиагентный фреймворк оценки именно **перевода вебновелл** по шести измерениям — максимально близко к домену TextMachine. - **WMT Discourse-Level Literary Translation** (2023–2024): [findings WMT24](https://aclanthology.org/2024.wmt-1.58/), корпус [GuoFeng Webnovel V2](https://github.com/longyuewangdcu/GuoFeng-Webnovel) — 22,567 глав из 179 вебновелл, 14 жанров, пары zh→en/de/**ru**; официальный рейтинг — по человеческой оценке, автометрики вспомогательны. Готовые данные и протокол оценки для наших пар. - **Практический итог:** для онлайн-телеметрии — CometKiwi (дёшево, грубо) + LLM-judge по MQM-спанам (точнее, дороже); для оффлайн-評ки релизов — BWS-сравнения людьми/панелью судей и BlonDe-подобные проверки консистентности; сырому COMET на художке доверять нельзя. ## 7. LLM в литпереводе, translationese, восприятие читателями - **Karpinska & Iyyer, "LLMs effectively leverage document-level context for literary translation, but critical errors persist"** ([arXiv:2304.03245](https://arxiv.org/abs/2304.03245), [WMT 2023](https://aclanthology.org/2023.wmt-1.41/)): перевод **целым параграфом** качественно лучше по-предложенческого у GPT-3.5 на 18 разнообразных парах (вкл. ja, pl); но остаются критические ошибки — смысловые искажения, дискурсивные сбои. Фундамент тезиса «контекст обязателен». - **"Lost in Literalism"** ([arXiv:2503.04369](https://arxiv.org/abs/2503.04369), [ACL 2025](https://aclanthology.org/2025.acl-long.630/)): систематическая оценка translationese; **>40% переводов GPT-4 имеют выраженные признаки кальки**; корень — SFT на «слишком буквальных» референсах; митигции: полировка золотых референсов LLM-ом и фильтрация неестественных обучающих примеров ([код](https://github.com/yafuly/LLM_Translationese)). - **"AI translation of literary texts is 'fine', but readers still prefer human translations"** ([arXiv:2606.26040](https://arxiv.org/html/2606.26040v1), июнь 2026, соавтор — Karpinska): 15 читателей, 15 современных романов fr/pl/ja→en, агентный LLM-пайплайн (chunk-уровневые и полнодрафтовые ревизии; конфигурации с GPT-5.4, Gemini 3.1 Pro, Claude Code/Codex). Итог: MT «приемлем», но HT предпочитают в 19/30 отрывков и **522/772 фрагментов**; отличить HT от MT читатели не могут (17/30); ценят в HT «лёгкость, ясность, погружение»; качество MT **нестабильно внутри книги**; автометрики и LLM-судьи разошлись с живыми читателями (favоризировали MT). Выпущен датасет LAIT (7,200 span-аннотаций). - Вывод: разрыв с человеком сузился до статистически заметного, но не фатального; главные рычаги — борьба с буквальностью, стабильность качества вдоль книги, дискурсивная консистентность. ## 8. Память и глоссарии: agentic memory для книг - **DelTA** (раздел 2) — единственный из рассмотренных дизайн памяти, созданный именно под документный перевод: связка «глоссарий имён + резюме + LTM/STM» напрямую переносится в банк памяти TextMachine. - **MemGPT/Letta** ([arXiv:2310.08560](https://arxiv.org/abs/2310.08560)): виртуальное управление контекстом по образцу иерархии памяти ОС; агент сам решает, что переместить между контекстом и внешним хранилищем через tool-calls; риск — качество ретрива зависит от качества решений агента. - **A-MEM** ([arXiv:2502.12110](https://arxiv.org/html/2502.12110v1)): «Zettelkasten»-заметки (контекст, теги, связи), автосвязывание и эволюция памяти; на multi-hop задачах LoCoMo ≥2x лучше MemGPT. - **Mem0** ([arXiv:2504.19413](https://arxiv.org/pdf/2504.19413)): экстракция/консолидация фактов + опциональный граф; заявлено +26% (LLM-judge) против памяти OpenAI, ~91% ниже p95-латентность и >90% экономия токенов против full-context (цифры из материалов самих Mem0 — [блог](https://mem0.ai/blog/benchmarked-openai-memory-vs-langmem-vs-memgpt-vs-mem0-for-long-term-memory-here-s-how-they-stacked-up); независимая репликация — не проверено). - Для книг важно: диалоговые бенчмарки памяти (LoCoMo) не эквивалентны задаче «40 глав вебновеллы»; специализированная структура DelTA (жёсткий глоссарий имён + резюме) на переводе била генерические подходы. Разумная стратегия: жёсткий детерминированный глоссарий (SQL/KV) + мягкая семантическая память (эмбеддинги резюме глав), а не универсальный memory-фреймворк. ## 9. Температура и сэмплинг - **"Exploring the Impact of Temperature on LLMs: Hot or Cold?"** ([arXiv:2506.07295](https://arxiv.org/html/2506.07295v1)): у малых моделей температура меняет качество MT до **192.32%**; для MT в целом лучший результат при **T=0.0**; высокие T бьют по малым моделям сильнее всего. - **"On Temperature-Constrained Non-Deterministic MT"** ([arXiv:2601.13729](https://arxiv.org/abs/2601.13729), янв. 2026): недетерминированный MT при ограниченной температуре даёт **более качественные кандидаты**, чем детерминированный, и помогает против multi-modality; открыт «Buckets Effect» — ранжирование ND-систем автометриками доминируется худшим кандидатом, поэтому нужны специальные протоколы оценки (ExpectoSample). - **Farinhas et al.** ([arXiv:2310.11430](https://arxiv.org/abs/2310.11430)): связь «температура → разнообразие гипотез» сильно зависит от instruction tuning; для ансамблирования достаточно малого числа сэмплов. **QE-fusion** ([arXiv:2401.06688](https://arxiv.org/html/2401.06688v1)): рост температуры улучшает QE-слияние до порога, затем качество падает. - Практика: T≈0–0.3 для одиночного «точного» прохода и для судьи; T≈0.6–1.0 (подбирать на своих парах) для генерации разнообразных кандидатов под селектор; adaptive/selective sampling ([arXiv:2510.01218](https://arxiv.org/abs/2510.01218)) — перспективно, но пока исследовательская стадия. ## Выводы для TextMachine 1. **Ядро пайплайна — generate-then-select, не synthesis.** N разнородных дешёвых переводчиков (разные семейства моделей и/или промпт-стратегии) + сильный судья с попарным сравнением (Bradley–Terry) — это лучшая по науке точка соотношения качество/цена (WR 0.929 при 1.0x стоимости в 2603.20324). Вкладываться в качество судьи выгоднее, чем в число/силу генераторов; слабый судья делает разнообразие вредным — нужен evals-гейт на самого судью. 2. **Судья должен видеть кандидатов совместно** (cross-candidate prompt), а не скорить поодиночке (2601.08343); дешёвая альтернатива LLM-судьи для отсева — CometKiwi/MBR-прескрининг пула перед финальным LLM-сравнением (2310.11430, 2401.06688). 3. **Роли из TransAgents брать выборочно:** Senior Editor (глоссарий+стайлгайд на этапе preparation) и Trilateral Collaboration (Action/Critique/Judgment) доказали пользу; но обязателен анти-omission контроль — DelTA-стиль по-предложенческого/по-абзацного покрытия с проверкой полноты. 4. **Банк памяти делать по образцу DelTA:** жёсткий Proper Noun Records (детерминированный глоссарий), Bilingual Summary по главам, STM последних абзацев. Генерические memory-фреймворки (Mem0/A-MEM/Letta) — вторичны; их ценность для перевода книг не доказана. 5. **Температурная политика:** переводчики-кандидаты — умеренно повышенная T (пул разнообразных гипотез качественнее детерминированного), судья/редактор/глоссарий — T≈0. У маленьких локальных моделей (8GB VRAM) высоких T избегать особенно. 6. **Телеметрия качества:** онлайн — CometKiwi (дёшево) + периодический GEMBA-MQM-подобный LLM-judge с error spans; оффлайн-релизы — BWS-пары с людьми и проверки консистентности имён/времён (BlonDe/DITING-подобные). Сырой COMET/BLEU как KPI художественности — запрещён (распознают человеческий уровень ≤20%). 7. **Анти-translationese как отдельная роль:** пост-редактор «натуральности» на целевом языке + фильтрация буквализмов; >40% калькированных переводов даже у топ-моделей — это главная художественная болезнь, а не редкие смысловые ошибки. 8. **Дистилляция под нишу:** DRT и LitMT показывают, что 7–14B, дообученные на синтетике из собственного мультиагентного пайплайна (петля translator–advisor–evaluator), догоняют фронтир на литпереводе — путь к локальной модели на GPU владельца и радикальному снижению себестоимости. Датасеты GuoFeng (zh→ru/en вебновеллы) и LAIT — готовое сырьё для evals. ## Открытые вопросы - Существует ли всё-таки переводо-специфичная статья марта 2026 про судью-селектора (возможно, не проиндексирована в использованных поисках или пользователь имел в виду 2603.20324)? - Переносится ли порог «selection bottleneck» на литперевод zh/ja→ru — нужен собственный эксперимент. - Насколько CometKiwi/GEMBA-MQM устойчивы на 18+ контенте (риск отказов судейских моделей провайдеров). ## Источники - TransAgents: https://arxiv.org/abs/2405.11804 ; TACL: https://direct.mit.edu/tacl/article/doi/10.1162/TACL.a.25/132121 ; https://github.com/minghao-wu/transagents ; разбор: https://gonzoml.substack.com/p/perhaps-beyond-human-translation - DelTA: https://arxiv.org/abs/2410.08143 ; https://github.com/YutongWang1216/DocMTAgent - DRT: https://arxiv.org/abs/2412.17498 ; https://aclanthology.org/2025.findings-acl.351/ ; https://huggingface.co/papers/2412.17498 - CRAT: https://arxiv.org/abs/2410.21067 ; TACTIC: https://arxiv.org/abs/2506.08403 ; TEaR: https://arxiv.org/abs/2402.16379 ; GenTranslate: https://arxiv.org/abs/2402.06894 - When Agents Disagree: https://arxiv.org/abs/2603.20324 ; KV-cache/judge: https://arxiv.org/pdf/2601.08343 ; SemEval-2026 judge-ensemble: https://arxiv.org/pdf/2605.04523 - SAMAS: https://arxiv.org/pdf/2602.19840 ; LitMT: https://arxiv.org/html/2606.05924 ; Agentic AI Translate: https://arxiv.org/html/2605.17041 - Ансамбли/селекция MT: https://arxiv.org/abs/2310.11430 ; https://arxiv.org/pdf/2401.06688 - Метрики: GEMBA-MQM: https://arxiv.org/abs/2310.13988 ; BlonDe: https://arxiv.org/abs/2103.11878 ; LitEval: https://arxiv.org/html/2410.18697v1 ; LiTransProQA: https://arxiv.org/html/2505.05423v4 ; MAS-LitEval: https://arxiv.org/html/2506.14199 ; DITING: https://arxiv.org/pdf/2510.09116 ; CometKiwi: https://aclanthology.org/2022.wmt-1.60/ - WMT literary: https://aclanthology.org/2024.wmt-1.58/ ; https://github.com/longyuewangdcu/GuoFeng-Webnovel ; https://www2.statmt.org/wmt24/literary-translation-task.html - Литперевод/translationese: https://arxiv.org/abs/2304.03245 ; https://arxiv.org/abs/2503.04369 ; https://arxiv.org/html/2606.26040v1 - Память: MemGPT: https://arxiv.org/abs/2310.08560 ; A-MEM: https://arxiv.org/html/2502.12110v1 ; Mem0: https://arxiv.org/pdf/2504.19413 ; https://mem0.ai/blog/benchmarked-openai-memory-vs-langmem-vs-memgpt-vs-mem0-for-long-term-memory-here-s-how-they-stacked-up - Температура: https://arxiv.org/html/2506.07295v1 ; https://arxiv.org/abs/2601.13729 ; https://arxiv.org/abs/2510.01218