textmachine/docs/research/03-academic-agentic-mt.md

37 KiB
Raw Permalink Blame History

Научное состояние мультиагентного и документного художественного машинного перевода (20232026)

SUPERSEDED ЧАСТИЧНО (09.07.2026). Вывод №1 «ядро — generate-then-select» переопределён: Р2/11-gap-3 («решает пилот»), и наука-2026 контрсигналит — LitMT (2606.05924): селекция ПОСЛЕДНЯЯ на гомогенных кандидатах; 2603.20324 верифицирована по первоисточнику — перевода в задачах НЕТ, «валидация людьми» — на деле независимыми LLM-судьями. Свежий срез (рефайнмент 2605.13368, судьи, память) — ../architecture/07-strategic-review.md §45 и D13 в ../architecture/05-decisions-log.md.

Дата обзора: 2026-07-04. Охват: arXiv, ACL/EMNLP/NAACL, ICLR, TACL, WMT.

TL;DR

  1. Generate-then-select — валидированная архитектура. Свежая работа "When Agents Disagree" (arXiv:2603.20324, март 2026) показывает: разнородная команда генераторов + судья-селектор даёт win rate 0.810 против 0.512 у однородной команды, а команда с включением дешёвой модели (mixed-capability) + судья достигает WR 0.929 при стоимости 1.0x от одиночной дорогой модели. Синтез (Mixture-of-Agents) проигрывает селекции с разгромным отрывом (0.631 WR). Оговорка: перевод в задачах этой статьи отсутствует.
  2. TransAgents (arXiv:2405.11804, TACL 2025) — эталонная ролевая архитектура для книг: CEO / Senior Editor / Junior Editor / Translator / Localization Specialist / Proofreader на GPT-4-turbo; ~$2.08 за главу против $168.48 у человека (~81x дешевле); переводы предпочитаются людьми и LLM даже против человеческих референсов, но система теряет куски текста (content omission) и проигрывает в жанрах Contemporary Romance / Sci-Fi / Horror.
  3. DelTA (arXiv:2410.08143, ICLR 2025) — рабочий образец банка памяти для книг: 4 уровня памяти (Proper Noun Records, Bilingual Summary, Long-Term/Short-Term Memory), перевод sentence-by-sentence без пропусков; +4.58 п.п. консистентности имён и +3.16 COMET в среднем.
  4. DRT (arXiv:2412.17498, ACL 2025 Findings) доказывает: long-CoT «размышление» над метафорами/сравнениями поднимает 714B-модели до уровня 32B reasoning-моделей в литпереводе en→zh; данные синтезированы мультиагентной петлёй translatoradvisorevaluator.
  5. Метрики: COMET/CometKiwi и MQM ненадёжны на литературных текстах — автометрики отличают человеческий перевод от машинного максимум в 20% случаев (arXiv:2410.18697); лучше работают Best-Worst Scaling с профессионалами и LLM-judge с error spans (GEMBA-MQM, arXiv:2310.13988). Для документного уровня есть BlonDe (NAACL 2022).
  6. Translationese — измеримый враг №1: >40% переводов даже GPT-4 содержат выраженные кальки; лечится полировкой референсов и фильтрацией обучающих данных (arXiv:2503.04369). Читатели в слепом тесте (июнь 2026, arXiv:2606.26040) всё ещё предпочитают человеческий перевод (522 из 772 фрагментов), но отличить не могут (17/30 угадываний).
  7. Температура: для одиночного перевода лучше T≈0 (влияние температуры на MT у малых моделей до 192% по качеству, arXiv:2506.07295), но для генерации кандидатов под селектор умеренно повышенная температура даёт более качественный пул, чем детерминированная генерация (arXiv:2601.13729; arXiv:2310.11430).
  8. Точной статьи «март 2026, мультиагентный перевод с судьёй-селектором» не найдено — ближайшее точное совпадение по дате/методу/выводам — общезадачная arXiv:2603.20324 (см. п.1), а по литпереводу — SAMAS (arXiv:2602.19840, февраль 2026). Детали в разделе 5.

1. TransAgents: ролевая «переводческая компания»

Wu, Yuan, Haffari, Wang. "(Perhaps) Beyond Human Translation: Harnessing Multi-Agent Collaboration for Translating Ultra-Long Literary Texts"arXiv:2405.11804, принята в TACL, код: github.com/minghao-wu/transagents.

  • Архитектура: имитация издательства. Роли: CEO (подбирает команду под книгу), Senior Editor (глоссарий и стайлгайд), Junior Editor, Translator, Localization Specialist, Proofreader. Все агенты — GPT-4-turbo (gpt-4-1106-preview) с разными «биографиями».
  • Два паттерна взаимодействия: Addition-by-Subtraction (один агент максимально полно добавляет информацию, второй вычищает избыточное — так строятся глоссарий и стайлгайд) и Trilateral Collaboration (Action-агент делает, Critique-агент критикует, Judgment-агент решает, принять или итерировать — прото-«судья» в переводном пайплайне).
  • Двухфазный процесс: preparation (команда + переводческие гайдлайны на всю книгу) → execution (перевод → локализация → вычитка → финальный QC).
  • Оценка: авторы отказались от référence-based метрик и ввели MHP (Monolingual Human Preference — читатели целевого языка сравнивают фрагменты) и BLP (Bilingual LLM Preference — GPT-4 сравнивает с оригиналом). d-BLEU у TransAgents ниже всех бейзлайнов — при этом в MHP переводы предпочитают чаще, чем человеческий референс, а в BLP — ~66% против ~30% у референса (разбор). Лексическое разнообразие (MATTR, MTLD) выше, чем у GPT-4 и референсов.
  • Стоимость: ~$2.08/глава против $168.48/глава у профперевода — в ~81 раза дешевле.
  • Слабости (важно для нас): документированные пропуски содержимого; выигрывает в жанрах, требующих домен-знаний (исторические, культурно-нагруженные), проигрывает в Contemporary Romance, Sci-Fi, Horror & Thriller. Вывод авторов честен: «perhaps» — предпочтения оценщиков ≠ строгое превосходство.

2. DelTA: документный агент с многоуровневой памятью

Wang et al. "DelTA: An Online Document-Level Translation Agent Based on Multi-Level Memory"arXiv:2410.08143, ICLR 2025, код: github.com/YutongWang1216/DocMTAgent.

  • Память 4 уровней: (1) Proper Noun Records — глоссарий имён собственных с зафиксированными переводами; (2) Bilingual Summary — двуязычное резюме документа; (3) Long-Term Memory — уплотнённая история; (4) Short-Term Memory — последние предложения. Все уровни поддерживаются вспомогательными LLM-компонентами (извлечение/обновление/ретрив).
  • Перевод строго sentence-by-sentence с подмешиванием памяти — это гарантирует отсутствие пропусков предложений (прямой ответ на болезнь TransAgents) и экономит память/контекст.
  • Результаты: консистентность перевода имён +4.58 п.п., COMET +3.16 в среднем поверх 4 LLM (открытых и закрытых) на двух doc-датасетах; работает «онлайн» — не требует всего документа заранее (совместимо со стримингом глав вебновеллы).

3. DRT: long-CoT для метафор

Wang et al. "DRT: Deep Reasoning Translation via Long Chain-of-Thought" (ранее DRT-o1) — arXiv:2412.17498, ACL 2025 Findings.

  • Из художественных книг намайнены предложения с метафорами и сравнениями; мультиагентная петля translator → advisor → evaluator итеративно переводит их и записывает весь ход рассуждений как long-CoT (среднe 500+ токенов «мыслей»); получено ~1922K обучающих примеров (en→zh).
  • SFT на этих данных поверх Qwen2.5-7B/14B и Llama-3.1-8B: DRT-модели обходят и ванильные LLM, и SFT без «мыслей»; DRT-14B обходит QwQ-32B-preview и DeepSeek-R1-Distill-Qwen-32B (HF paper page).
  • Смысл для нас: «глубокое обдумывание» образного языка — обучаемый навык; дорогую reasoning-модель можно дистиллировать в дешёвую 714B специально под художку. Модели DRT-o1-7B выложены (есть GGUF-кванты — влезает в 8GB VRAM).

4. Другие agentic-MT работы 20242026

  • CRATarXiv:2410.21067 (WeChat AI): мультиагентный RAG-перевод с каузальной саморефлексией. Агенты: Unknown Terms Identification (детект незнакомых/контекстно-зависимых терминов), KG Constructor (внутренние знания + двуязычный ретрив), causality-enhanced judge для валидации извлечённого, переводчик. Прямой прототип «консультанта по терминам/поп-культуре».
  • TACTICarXiv:2506.08403: мультиагентный фреймворк, явно построенный на когнитивной теории перевода (баланс буквального/вольного, итеративная переоценка); заявляет SOTA на разных парах.
  • TEaRarXiv:2402.16379, NAACL 2025 Findings: минимальный цикл Translate → Estimate → Refine; систематическое самоисправление стабильно улучшает качество на высоко- и низкоресурсных языках. Дешёвый паттерн «редактора» из одного LLM.
  • GenTranslatearXiv:2402.06894: вместо выбора top-1 из N-best LLM синтезирует финальный перевод из всех гипотез; датасет HypoTranslate (592K пар) для файнтюна; бьёт SOTA на WMT/FLEURS/CoVoST-2. Внимание: это synthesis-подход, который в общезадачной работе 2603.20324 проигрывает селекции — на сегодня противоречие открыто (у GenTranslate синтезатор специально дообучен, что, видимо, критично).
  • SAMASarXiv:2602.19840 (февраль 2026): «спектр стилевых признаков» (wavelet packet transform) как управляющий сигнал для динамической сборки агентов под структуру текста; статистически значимое преимущество в стилевой верности при конкурентной семантической точности. Свежая идея квантификации «стиля» как параметра пайплайна.
  • Better Literary Translation / LitMTarXiv:2606.05924 (июнь 2026): мультиаспектная генерация данных; LitMT-8B/14B (из Qwen3-Base) достигают 67.25/69.07 CEA100 на MetaphorTrans — на уровне Claude Sonnet 4.5 (68.43). Ещё одно подтверждение: маленькая специализированная модель ≈ фронтир в литпереводе.
  • Agentic AI TranslatearXiv:2605.17041 (май 2026): прототип агентного переводчика в парадигме «перевод как коммуникационный дизайн» (не проверено детально).
  • Farinhas et al., "An Empirical Study of Translation Hypothesis Ensembling with LLMs"arXiv:2310.11430, EMNLP 2023: MBR-декодирование — самый эффективный способ выбора из пула гипотез; хватает малого числа сэмплов; instruction tuning сильно меняет связь «температура ↔ разнообразие гипотез».
  • QE-fusion "Don't Rank, Combine!"arXiv:2401.06688: слияние фрагментов гипотез по quality estimation обходит и MBR, и QE-reranking; повышенная температура помогает до определённого порога.

5. Судья-селектор: что именно нашлось (запрошенная статья ~март 2026)

Статья, точно описывающая «мультиагентный ПЕРЕВОД с судьёй-селектором, поднимающий дешёвые модели до уровня дорогих», в переводной литературе марта 2026 не обнаружена (искал по multi-agent translation judge/selector/ensemble, literary multi-agent, LLM ensemble selection translation). Ближайшее совпадение по дате, механике и главному выводу:

"When Agents Disagree: The Selection Bottleneck in Multi-Agent LLM Pipelines" (Artem Maryanskyy) — arXiv:2603.20324, подана 20 марта 2026. Вероятно, это и есть упомянутая статья — с оговоркой, что она общезадачная, перевода среди её 42 задач нет (7 категорий: coding, creative writing, ethics/policy, math/logic, reasoning, science, summarization).

Метод и цифры (полный текст):

  • Пайплайн generate-then-select: 3 генератора → панель судей (Claude Sonnet, GPT-5-mini, DeepSeek-V3p2) с попарным сравнением и BradleyTerry-скорингом.
  • Diverse-команда (Opus + GPT-5.4 + Gemini 2.5 Pro) + судья: WR 0.810 против одиночного бейзлайна; однородная команда (Opus x3) + судья: WR 0.512 (уровень случайности); Glass's Δ = 2.07.
  • Mixed-capability (Opus + Gemini 2.5 Pro + дешёвый Haiku) + судья: WR 0.929 при относительной стоимости 1.0x — добавление слабой модели одновременно улучшило качество и срезало цену (p < 10⁻⁴).
  • Судейская селекция > синтеза (MoA) на всех 42 задачах без исключений (Δ = +0.631 WR); majority vote тоже проваливается (0.496).
  • Концепт «selection bottleneck»: существует порог качества селектора s*, ниже которого разнообразие генераторов вредит; «качество селектора — более значимый рычаг дизайна, чем разнообразие генераторов».
  • Ограничения: LLM-as-judge как прокси (валидация людьми снизила win rates на 5367%, но сохранила ранжирование), одна итерация, только текущие фронтир-модели.

Смежные подтверждения из перевода: judge-оркестрированный ансамбль 7 LLM с GPT-4o-mini-судьёй занял 1-е место из 26 команд на SemEval-2026 Task 8 (arXiv:2605.04523); в MT selection-семейство представлено MBR/QE-reranking/QE-fusion (раздел 4) и «Judgment-агентом» Trilateral Collaboration в TransAgents. Также «When KV Cache Reuse Fails in Multi-Agent Systems» (arXiv:2601.08343) — про то, что LLM-судье критично видеть кандидатов совместно (cross-candidate interaction), важно для реализации судьи.

6. Метрики качества литературного перевода

  • COMET / CometKiwi. COMET — нейрометрика с референсом; CometKiwi — reference-free QE (WMT22 submission, упоминается как бейзлайн в GEMBA-MQM). Для онлайн-телеметрии (нет референса) кандидаты — CometKiwi и LLM-judge. Но на литтекстах надёжность ограничена (см. ниже).
  • GEMBA-MQM (arXiv:2310.13988, Kocmi & Federmann, WMT 2023): GPT-4 с фиксированным 3-shot промптом размечает error spans в MQM-таксономии, reference-free, языконезависимый промпт; SOTA по system ranking; авторы предупреждают о зависимости от закрытой модели.
  • BlonDe (arXiv:2103.11878, NAACL 2022): документная метрика — F1 по категоризированным дискурсивным спанам (консистентность имён, времена, род, эллипсис); валидирована на BWB — корпусе вебновелл; значительно выше корреляция с людьми на doc-уровне, чем BLEU. Хороший кандидат для оффлайн-регрессионных тестов консистентности.
  • LitEval-Corpus / "How Good Are LLMs for Literary Translation, Really?" (arXiv:2410.18697, Zhang, Zhao, Eger): 2K+ параграфов, 13K размеченных предложений, 4 пары (de↔en, en↔zh и др.), 9 систем + верифицированные человеческие переводы. Выводы: человеческие переводы стабильно лучше LLM; LLM буквальнее и лексически беднее; автометрики распознают человеческий перевод максимум в 20% случаев; сложная MQM-схема не работает на литтексте (студенты «проваливают» ~60% человеческих переводов), простая Best-Worst Scaling с профессионалами работает (80100%).
  • LiTransProQA (arXiv:2505.05423, EMNLP 2025): LLM-метрика в форме профессионального QA (вопросы, которые задал бы литпереводчик) — специализированная literary-метрика.
  • MAS-LitEval (arXiv:2506.14199): мультиагентная система оценки литперевода (terminology/style/coherence-агенты) — судейство тоже становится мультиагентным.
  • DITING (arXiv:2510.09116): мультиагентный фреймворк оценки именно перевода вебновелл по шести измерениям — максимально близко к домену TextMachine.
  • WMT Discourse-Level Literary Translation (20232024): findings WMT24, корпус GuoFeng Webnovel V2 — 22,567 глав из 179 вебновелл, 14 жанров, пары zh→en/de/ru; официальный рейтинг — по человеческой оценке, автометрики вспомогательны. Готовые данные и протокол оценки для наших пар.
  • Практический итог: для онлайн-телеметрии — CometKiwi (дёшево, грубо) + LLM-judge по MQM-спанам (точнее, дороже); для оффлайн-評ки релизов — BWS-сравнения людьми/панелью судей и BlonDe-подобные проверки консистентности; сырому COMET на художке доверять нельзя.

7. LLM в литпереводе, translationese, восприятие читателями

  • Karpinska & Iyyer, "LLMs effectively leverage document-level context for literary translation, but critical errors persist" (arXiv:2304.03245, WMT 2023): перевод целым параграфом качественно лучше по-предложенческого у GPT-3.5 на 18 разнообразных парах (вкл. ja, pl); но остаются критические ошибки — смысловые искажения, дискурсивные сбои. Фундамент тезиса «контекст обязателен».
  • "Lost in Literalism" (arXiv:2503.04369, ACL 2025): систематическая оценка translationese; >40% переводов GPT-4 имеют выраженные признаки кальки; корень — SFT на «слишком буквальных» референсах; митигции: полировка золотых референсов LLM-ом и фильтрация неестественных обучающих примеров (код).
  • "AI translation of literary texts is 'fine', but readers still prefer human translations" (arXiv:2606.26040, июнь 2026, соавтор — Karpinska): 15 читателей, 15 современных романов fr/pl/ja→en, агентный LLM-пайплайн (chunk-уровневые и полнодрафтовые ревизии; конфигурации с GPT-5.4, Gemini 3.1 Pro, Claude Code/Codex). Итог: MT «приемлем», но HT предпочитают в 19/30 отрывков и 522/772 фрагментов; отличить HT от MT читатели не могут (17/30); ценят в HT «лёгкость, ясность, погружение»; качество MT нестабильно внутри книги; автометрики и LLM-судьи разошлись с живыми читателями (favоризировали MT). Выпущен датасет LAIT (7,200 span-аннотаций).
  • Вывод: разрыв с человеком сузился до статистически заметного, но не фатального; главные рычаги — борьба с буквальностью, стабильность качества вдоль книги, дискурсивная консистентность.

8. Память и глоссарии: agentic memory для книг

  • DelTA (раздел 2) — единственный из рассмотренных дизайн памяти, созданный именно под документный перевод: связка «глоссарий имён + резюме + LTM/STM» напрямую переносится в банк памяти TextMachine.
  • MemGPT/Letta (arXiv:2310.08560): виртуальное управление контекстом по образцу иерархии памяти ОС; агент сам решает, что переместить между контекстом и внешним хранилищем через tool-calls; риск — качество ретрива зависит от качества решений агента.
  • A-MEM (arXiv:2502.12110): «Zettelkasten»-заметки (контекст, теги, связи), автосвязывание и эволюция памяти; на multi-hop задачах LoCoMo ≥2x лучше MemGPT.
  • Mem0 (arXiv:2504.19413): экстракция/консолидация фактов + опциональный граф; заявлено +26% (LLM-judge) против памяти OpenAI, ~91% ниже p95-латентность и >90% экономия токенов против full-context (цифры из материалов самих Mem0 — блог; независимая репликация — не проверено).
  • Для книг важно: диалоговые бенчмарки памяти (LoCoMo) не эквивалентны задаче «40 глав вебновеллы»; специализированная структура DelTA (жёсткий глоссарий имён + резюме) на переводе била генерические подходы. Разумная стратегия: жёсткий детерминированный глоссарий (SQL/KV) + мягкая семантическая память (эмбеддинги резюме глав), а не универсальный memory-фреймворк.

9. Температура и сэмплинг

  • "Exploring the Impact of Temperature on LLMs: Hot or Cold?" (arXiv:2506.07295): у малых моделей температура меняет качество MT до 192.32%; для MT в целом лучший результат при T=0.0; высокие T бьют по малым моделям сильнее всего.
  • "On Temperature-Constrained Non-Deterministic MT" (arXiv:2601.13729, янв. 2026): недетерминированный MT при ограниченной температуре даёт более качественные кандидаты, чем детерминированный, и помогает против multi-modality; открыт «Buckets Effect» — ранжирование ND-систем автометриками доминируется худшим кандидатом, поэтому нужны специальные протоколы оценки (ExpectoSample).
  • Farinhas et al. (arXiv:2310.11430): связь «температура → разнообразие гипотез» сильно зависит от instruction tuning; для ансамблирования достаточно малого числа сэмплов. QE-fusion (arXiv:2401.06688): рост температуры улучшает QE-слияние до порога, затем качество падает.
  • Практика: T≈00.3 для одиночного «точного» прохода и для судьи; T≈0.61.0 (подбирать на своих парах) для генерации разнообразных кандидатов под селектор; adaptive/selective sampling (arXiv:2510.01218) — перспективно, но пока исследовательская стадия.

Выводы для TextMachine

  1. Ядро пайплайна — generate-then-select, не synthesis. N разнородных дешёвых переводчиков (разные семейства моделей и/или промпт-стратегии) + сильный судья с попарным сравнением (BradleyTerry) — это лучшая по науке точка соотношения качество/цена (WR 0.929 при 1.0x стоимости в 2603.20324). Вкладываться в качество судьи выгоднее, чем в число/силу генераторов; слабый судья делает разнообразие вредным — нужен evals-гейт на самого судью.
  2. Судья должен видеть кандидатов совместно (cross-candidate prompt), а не скорить поодиночке (2601.08343); дешёвая альтернатива LLM-судьи для отсева — CometKiwi/MBR-прескрининг пула перед финальным LLM-сравнением (2310.11430, 2401.06688).
  3. Роли из TransAgents брать выборочно: Senior Editor (глоссарий+стайлгайд на этапе preparation) и Trilateral Collaboration (Action/Critique/Judgment) доказали пользу; но обязателен анти-omission контроль — DelTA-стиль по-предложенческого/по-абзацного покрытия с проверкой полноты.
  4. Банк памяти делать по образцу DelTA: жёсткий Proper Noun Records (детерминированный глоссарий), Bilingual Summary по главам, STM последних абзацев. Генерические memory-фреймворки (Mem0/A-MEM/Letta) — вторичны; их ценность для перевода книг не доказана.
  5. Температурная политика: переводчики-кандидаты — умеренно повышенная T (пул разнообразных гипотез качественнее детерминированного), судья/редактор/глоссарий — T≈0. У маленьких локальных моделей (8GB VRAM) высоких T избегать особенно.
  6. Телеметрия качества: онлайн — CometKiwi (дёшево) + периодический GEMBA-MQM-подобный LLM-judge с error spans; оффлайн-релизы — BWS-пары с людьми и проверки консистентности имён/времён (BlonDe/DITING-подобные). Сырой COMET/BLEU как KPI художественности — запрещён (распознают человеческий уровень ≤20%).
  7. Анти-translationese как отдельная роль: пост-редактор «натуральности» на целевом языке + фильтрация буквализмов; >40% калькированных переводов даже у топ-моделей — это главная художественная болезнь, а не редкие смысловые ошибки.
  8. Дистилляция под нишу: DRT и LitMT показывают, что 714B, дообученные на синтетике из собственного мультиагентного пайплайна (петля translatoradvisorevaluator), догоняют фронтир на литпереводе — путь к локальной модели на GPU владельца и радикальному снижению себестоимости. Датасеты GuoFeng (zh→ru/en вебновеллы) и LAIT — готовое сырьё для evals.

Открытые вопросы

  • Существует ли всё-таки переводо-специфичная статья марта 2026 про судью-селектора (возможно, не проиндексирована в использованных поисках или пользователь имел в виду 2603.20324)?
  • Переносится ли порог «selection bottleneck» на литперевод zh/ja→ru — нужен собственный эксперимент.
  • Насколько CometKiwi/GEMBA-MQM устойчивы на 18+ контенте (риск отказов судейских моделей провайдеров).

Источники