37 KiB
Научное состояние мультиагентного и документного художественного машинного перевода (2023–2026)
⚠ SUPERSEDED ЧАСТИЧНО (09.07.2026). Вывод №1 «ядро — generate-then-select» переопределён: Р2/
11-gap-3(«решает пилот»), и наука-2026 контрсигналит — LitMT (2606.05924): селекция ПОСЛЕДНЯЯ на гомогенных кандидатах; 2603.20324 верифицирована по первоисточнику — перевода в задачах НЕТ, «валидация людьми» — на деле независимыми LLM-судьями. Свежий срез (рефайнмент 2605.13368, судьи, память) —../architecture/07-strategic-review.md§4–5 и D13 в../architecture/05-decisions-log.md.
Дата обзора: 2026-07-04. Охват: arXiv, ACL/EMNLP/NAACL, ICLR, TACL, WMT.
TL;DR
- Generate-then-select — валидированная архитектура. Свежая работа "When Agents Disagree" (arXiv:2603.20324, март 2026) показывает: разнородная команда генераторов + судья-селектор даёт win rate 0.810 против 0.512 у однородной команды, а команда с включением дешёвой модели (mixed-capability) + судья достигает WR 0.929 при стоимости 1.0x от одиночной дорогой модели. Синтез (Mixture-of-Agents) проигрывает селекции с разгромным отрывом (−0.631 WR). Оговорка: перевод в задачах этой статьи отсутствует.
- TransAgents (arXiv:2405.11804, TACL 2025) — эталонная ролевая архитектура для книг: CEO / Senior Editor / Junior Editor / Translator / Localization Specialist / Proofreader на GPT-4-turbo; ~$2.08 за главу против $168.48 у человека (~81x дешевле); переводы предпочитаются людьми и LLM даже против человеческих референсов, но система теряет куски текста (content omission) и проигрывает в жанрах Contemporary Romance / Sci-Fi / Horror.
- DelTA (arXiv:2410.08143, ICLR 2025) — рабочий образец банка памяти для книг: 4 уровня памяти (Proper Noun Records, Bilingual Summary, Long-Term/Short-Term Memory), перевод sentence-by-sentence без пропусков; +4.58 п.п. консистентности имён и +3.16 COMET в среднем.
- DRT (arXiv:2412.17498, ACL 2025 Findings) доказывает: long-CoT «размышление» над метафорами/сравнениями поднимает 7–14B-модели до уровня 32B reasoning-моделей в литпереводе en→zh; данные синтезированы мультиагентной петлёй translator–advisor–evaluator.
- Метрики: COMET/CometKiwi и MQM ненадёжны на литературных текстах — автометрики отличают человеческий перевод от машинного максимум в 20% случаев (arXiv:2410.18697); лучше работают Best-Worst Scaling с профессионалами и LLM-judge с error spans (GEMBA-MQM, arXiv:2310.13988). Для документного уровня есть BlonDe (NAACL 2022).
- Translationese — измеримый враг №1: >40% переводов даже GPT-4 содержат выраженные кальки; лечится полировкой референсов и фильтрацией обучающих данных (arXiv:2503.04369). Читатели в слепом тесте (июнь 2026, arXiv:2606.26040) всё ещё предпочитают человеческий перевод (522 из 772 фрагментов), но отличить не могут (17/30 угадываний).
- Температура: для одиночного перевода лучше T≈0 (влияние температуры на MT у малых моделей до 192% по качеству, arXiv:2506.07295), но для генерации кандидатов под селектор умеренно повышенная температура даёт более качественный пул, чем детерминированная генерация (arXiv:2601.13729; arXiv:2310.11430).
- Точной статьи «март 2026, мультиагентный перевод с судьёй-селектором» не найдено — ближайшее точное совпадение по дате/методу/выводам — общезадачная arXiv:2603.20324 (см. п.1), а по литпереводу — SAMAS (arXiv:2602.19840, февраль 2026). Детали в разделе 5.
1. TransAgents: ролевая «переводческая компания»
Wu, Yuan, Haffari, Wang. "(Perhaps) Beyond Human Translation: Harnessing Multi-Agent Collaboration for Translating Ultra-Long Literary Texts" — arXiv:2405.11804, принята в TACL, код: github.com/minghao-wu/transagents.
- Архитектура: имитация издательства. Роли: CEO (подбирает команду под книгу), Senior Editor (глоссарий и стайлгайд), Junior Editor, Translator, Localization Specialist, Proofreader. Все агенты — GPT-4-turbo (gpt-4-1106-preview) с разными «биографиями».
- Два паттерна взаимодействия: Addition-by-Subtraction (один агент максимально полно добавляет информацию, второй вычищает избыточное — так строятся глоссарий и стайлгайд) и Trilateral Collaboration (Action-агент делает, Critique-агент критикует, Judgment-агент решает, принять или итерировать — прото-«судья» в переводном пайплайне).
- Двухфазный процесс: preparation (команда + переводческие гайдлайны на всю книгу) → execution (перевод → локализация → вычитка → финальный QC).
- Оценка: авторы отказались от référence-based метрик и ввели MHP (Monolingual Human Preference — читатели целевого языка сравнивают фрагменты) и BLP (Bilingual LLM Preference — GPT-4 сравнивает с оригиналом). d-BLEU у TransAgents ниже всех бейзлайнов — при этом в MHP переводы предпочитают чаще, чем человеческий референс, а в BLP — ~66% против ~30% у референса (разбор). Лексическое разнообразие (MATTR, MTLD) выше, чем у GPT-4 и референсов.
- Стоимость: ~$2.08/глава против $168.48/глава у профперевода — в ~81 раза дешевле.
- Слабости (важно для нас): документированные пропуски содержимого; выигрывает в жанрах, требующих домен-знаний (исторические, культурно-нагруженные), проигрывает в Contemporary Romance, Sci-Fi, Horror & Thriller. Вывод авторов честен: «perhaps» — предпочтения оценщиков ≠ строгое превосходство.
2. DelTA: документный агент с многоуровневой памятью
Wang et al. "DelTA: An Online Document-Level Translation Agent Based on Multi-Level Memory" — arXiv:2410.08143, ICLR 2025, код: github.com/YutongWang1216/DocMTAgent.
- Память 4 уровней: (1) Proper Noun Records — глоссарий имён собственных с зафиксированными переводами; (2) Bilingual Summary — двуязычное резюме документа; (3) Long-Term Memory — уплотнённая история; (4) Short-Term Memory — последние предложения. Все уровни поддерживаются вспомогательными LLM-компонентами (извлечение/обновление/ретрив).
- Перевод строго sentence-by-sentence с подмешиванием памяти — это гарантирует отсутствие пропусков предложений (прямой ответ на болезнь TransAgents) и экономит память/контекст.
- Результаты: консистентность перевода имён +4.58 п.п., COMET +3.16 в среднем поверх 4 LLM (открытых и закрытых) на двух doc-датасетах; работает «онлайн» — не требует всего документа заранее (совместимо со стримингом глав вебновеллы).
3. DRT: long-CoT для метафор
Wang et al. "DRT: Deep Reasoning Translation via Long Chain-of-Thought" (ранее DRT-o1) — arXiv:2412.17498, ACL 2025 Findings.
- Из художественных книг намайнены предложения с метафорами и сравнениями; мультиагентная петля translator → advisor → evaluator итеративно переводит их и записывает весь ход рассуждений как long-CoT (среднe 500+ токенов «мыслей»); получено ~19–22K обучающих примеров (en→zh).
- SFT на этих данных поверх Qwen2.5-7B/14B и Llama-3.1-8B: DRT-модели обходят и ванильные LLM, и SFT без «мыслей»; DRT-14B обходит QwQ-32B-preview и DeepSeek-R1-Distill-Qwen-32B (HF paper page).
- Смысл для нас: «глубокое обдумывание» образного языка — обучаемый навык; дорогую reasoning-модель можно дистиллировать в дешёвую 7–14B специально под художку. Модели DRT-o1-7B выложены (есть GGUF-кванты — влезает в 8GB VRAM).
4. Другие agentic-MT работы 2024–2026
- CRAT — arXiv:2410.21067 (WeChat AI): мультиагентный RAG-перевод с каузальной саморефлексией. Агенты: Unknown Terms Identification (детект незнакомых/контекстно-зависимых терминов), KG Constructor (внутренние знания + двуязычный ретрив), causality-enhanced judge для валидации извлечённого, переводчик. Прямой прототип «консультанта по терминам/поп-культуре».
- TACTIC — arXiv:2506.08403: мультиагентный фреймворк, явно построенный на когнитивной теории перевода (баланс буквального/вольного, итеративная переоценка); заявляет SOTA на разных парах.
- TEaR — arXiv:2402.16379, NAACL 2025 Findings: минимальный цикл Translate → Estimate → Refine; систематическое самоисправление стабильно улучшает качество на высоко- и низкоресурсных языках. Дешёвый паттерн «редактора» из одного LLM.
- GenTranslate — arXiv:2402.06894: вместо выбора top-1 из N-best LLM синтезирует финальный перевод из всех гипотез; датасет HypoTranslate (592K пар) для файнтюна; бьёт SOTA на WMT/FLEURS/CoVoST-2. Внимание: это synthesis-подход, который в общезадачной работе 2603.20324 проигрывает селекции — на сегодня противоречие открыто (у GenTranslate синтезатор специально дообучен, что, видимо, критично).
- SAMAS — arXiv:2602.19840 (февраль 2026): «спектр стилевых признаков» (wavelet packet transform) как управляющий сигнал для динамической сборки агентов под структуру текста; статистически значимое преимущество в стилевой верности при конкурентной семантической точности. Свежая идея квантификации «стиля» как параметра пайплайна.
- Better Literary Translation / LitMT — arXiv:2606.05924 (июнь 2026): мультиаспектная генерация данных; LitMT-8B/14B (из Qwen3-Base) достигают 67.25/69.07 CEA100 на MetaphorTrans — на уровне Claude Sonnet 4.5 (68.43). Ещё одно подтверждение: маленькая специализированная модель ≈ фронтир в литпереводе.
- Agentic AI Translate — arXiv:2605.17041 (май 2026): прототип агентного переводчика в парадигме «перевод как коммуникационный дизайн» (не проверено детально).
- Farinhas et al., "An Empirical Study of Translation Hypothesis Ensembling with LLMs" — arXiv:2310.11430, EMNLP 2023: MBR-декодирование — самый эффективный способ выбора из пула гипотез; хватает малого числа сэмплов; instruction tuning сильно меняет связь «температура ↔ разнообразие гипотез».
- QE-fusion "Don't Rank, Combine!" — arXiv:2401.06688: слияние фрагментов гипотез по quality estimation обходит и MBR, и QE-reranking; повышенная температура помогает до определённого порога.
5. Судья-селектор: что именно нашлось (запрошенная статья ~март 2026)
Статья, точно описывающая «мультиагентный ПЕРЕВОД с судьёй-селектором, поднимающий дешёвые модели до уровня дорогих», в переводной литературе марта 2026 не обнаружена (искал по multi-agent translation judge/selector/ensemble, literary multi-agent, LLM ensemble selection translation). Ближайшее совпадение по дате, механике и главному выводу:
"When Agents Disagree: The Selection Bottleneck in Multi-Agent LLM Pipelines" (Artem Maryanskyy) — arXiv:2603.20324, подана 20 марта 2026. Вероятно, это и есть упомянутая статья — с оговоркой, что она общезадачная, перевода среди её 42 задач нет (7 категорий: coding, creative writing, ethics/policy, math/logic, reasoning, science, summarization).
Метод и цифры (полный текст):
- Пайплайн generate-then-select: 3 генератора → панель судей (Claude Sonnet, GPT-5-mini, DeepSeek-V3p2) с попарным сравнением и Bradley–Terry-скорингом.
- Diverse-команда (Opus + GPT-5.4 + Gemini 2.5 Pro) + судья: WR 0.810 против одиночного бейзлайна; однородная команда (Opus x3) + судья: WR 0.512 (уровень случайности); Glass's Δ = 2.07.
- Mixed-capability (Opus + Gemini 2.5 Pro + дешёвый Haiku) + судья: WR 0.929 при относительной стоимости 1.0x — добавление слабой модели одновременно улучшило качество и срезало цену (p < 10⁻⁴).
- Судейская селекция > синтеза (MoA) на всех 42 задачах без исключений (Δ = +0.631 WR); majority vote тоже проваливается (0.496).
- Концепт «selection bottleneck»: существует порог качества селектора s*, ниже которого разнообразие генераторов вредит; «качество селектора — более значимый рычаг дизайна, чем разнообразие генераторов».
- Ограничения: LLM-as-judge как прокси (валидация людьми снизила win rates на 53–67%, но сохранила ранжирование), одна итерация, только текущие фронтир-модели.
Смежные подтверждения из перевода: judge-оркестрированный ансамбль 7 LLM с GPT-4o-mini-судьёй занял 1-е место из 26 команд на SemEval-2026 Task 8 (arXiv:2605.04523); в MT selection-семейство представлено MBR/QE-reranking/QE-fusion (раздел 4) и «Judgment-агентом» Trilateral Collaboration в TransAgents. Также «When KV Cache Reuse Fails in Multi-Agent Systems» (arXiv:2601.08343) — про то, что LLM-судье критично видеть кандидатов совместно (cross-candidate interaction), важно для реализации судьи.
6. Метрики качества литературного перевода
- COMET / CometKiwi. COMET — нейрометрика с референсом; CometKiwi — reference-free QE (WMT22 submission, упоминается как бейзлайн в GEMBA-MQM). Для онлайн-телеметрии (нет референса) кандидаты — CometKiwi и LLM-judge. Но на литтекстах надёжность ограничена (см. ниже).
- GEMBA-MQM (arXiv:2310.13988, Kocmi & Federmann, WMT 2023): GPT-4 с фиксированным 3-shot промптом размечает error spans в MQM-таксономии, reference-free, языконезависимый промпт; SOTA по system ranking; авторы предупреждают о зависимости от закрытой модели.
- BlonDe (arXiv:2103.11878, NAACL 2022): документная метрика — F1 по категоризированным дискурсивным спанам (консистентность имён, времена, род, эллипсис); валидирована на BWB — корпусе вебновелл; значительно выше корреляция с людьми на doc-уровне, чем BLEU. Хороший кандидат для оффлайн-регрессионных тестов консистентности.
- LitEval-Corpus / "How Good Are LLMs for Literary Translation, Really?" (arXiv:2410.18697, Zhang, Zhao, Eger): 2K+ параграфов, 13K размеченных предложений, 4 пары (de↔en, en↔zh и др.), 9 систем + верифицированные человеческие переводы. Выводы: человеческие переводы стабильно лучше LLM; LLM буквальнее и лексически беднее; автометрики распознают человеческий перевод максимум в 20% случаев; сложная MQM-схема не работает на литтексте (студенты «проваливают» ~60% человеческих переводов), простая Best-Worst Scaling с профессионалами работает (80–100%).
- LiTransProQA (arXiv:2505.05423, EMNLP 2025): LLM-метрика в форме профессионального QA (вопросы, которые задал бы литпереводчик) — специализированная literary-метрика.
- MAS-LitEval (arXiv:2506.14199): мультиагентная система оценки литперевода (terminology/style/coherence-агенты) — судейство тоже становится мультиагентным.
- DITING (arXiv:2510.09116): мультиагентный фреймворк оценки именно перевода вебновелл по шести измерениям — максимально близко к домену TextMachine.
- WMT Discourse-Level Literary Translation (2023–2024): findings WMT24, корпус GuoFeng Webnovel V2 — 22,567 глав из 179 вебновелл, 14 жанров, пары zh→en/de/ru; официальный рейтинг — по человеческой оценке, автометрики вспомогательны. Готовые данные и протокол оценки для наших пар.
- Практический итог: для онлайн-телеметрии — CometKiwi (дёшево, грубо) + LLM-judge по MQM-спанам (точнее, дороже); для оффлайн-評ки релизов — BWS-сравнения людьми/панелью судей и BlonDe-подобные проверки консистентности; сырому COMET на художке доверять нельзя.
7. LLM в литпереводе, translationese, восприятие читателями
- Karpinska & Iyyer, "LLMs effectively leverage document-level context for literary translation, but critical errors persist" (arXiv:2304.03245, WMT 2023): перевод целым параграфом качественно лучше по-предложенческого у GPT-3.5 на 18 разнообразных парах (вкл. ja, pl); но остаются критические ошибки — смысловые искажения, дискурсивные сбои. Фундамент тезиса «контекст обязателен».
- "Lost in Literalism" (arXiv:2503.04369, ACL 2025): систематическая оценка translationese; >40% переводов GPT-4 имеют выраженные признаки кальки; корень — SFT на «слишком буквальных» референсах; митигции: полировка золотых референсов LLM-ом и фильтрация неестественных обучающих примеров (код).
- "AI translation of literary texts is 'fine', but readers still prefer human translations" (arXiv:2606.26040, июнь 2026, соавтор — Karpinska): 15 читателей, 15 современных романов fr/pl/ja→en, агентный LLM-пайплайн (chunk-уровневые и полнодрафтовые ревизии; конфигурации с GPT-5.4, Gemini 3.1 Pro, Claude Code/Codex). Итог: MT «приемлем», но HT предпочитают в 19/30 отрывков и 522/772 фрагментов; отличить HT от MT читатели не могут (17/30); ценят в HT «лёгкость, ясность, погружение»; качество MT нестабильно внутри книги; автометрики и LLM-судьи разошлись с живыми читателями (favоризировали MT). Выпущен датасет LAIT (7,200 span-аннотаций).
- Вывод: разрыв с человеком сузился до статистически заметного, но не фатального; главные рычаги — борьба с буквальностью, стабильность качества вдоль книги, дискурсивная консистентность.
8. Память и глоссарии: agentic memory для книг
- DelTA (раздел 2) — единственный из рассмотренных дизайн памяти, созданный именно под документный перевод: связка «глоссарий имён + резюме + LTM/STM» напрямую переносится в банк памяти TextMachine.
- MemGPT/Letta (arXiv:2310.08560): виртуальное управление контекстом по образцу иерархии памяти ОС; агент сам решает, что переместить между контекстом и внешним хранилищем через tool-calls; риск — качество ретрива зависит от качества решений агента.
- A-MEM (arXiv:2502.12110): «Zettelkasten»-заметки (контекст, теги, связи), автосвязывание и эволюция памяти; на multi-hop задачах LoCoMo ≥2x лучше MemGPT.
- Mem0 (arXiv:2504.19413): экстракция/консолидация фактов + опциональный граф; заявлено +26% (LLM-judge) против памяти OpenAI, ~91% ниже p95-латентность и >90% экономия токенов против full-context (цифры из материалов самих Mem0 — блог; независимая репликация — не проверено).
- Для книг важно: диалоговые бенчмарки памяти (LoCoMo) не эквивалентны задаче «40 глав вебновеллы»; специализированная структура DelTA (жёсткий глоссарий имён + резюме) на переводе била генерические подходы. Разумная стратегия: жёсткий детерминированный глоссарий (SQL/KV) + мягкая семантическая память (эмбеддинги резюме глав), а не универсальный memory-фреймворк.
9. Температура и сэмплинг
- "Exploring the Impact of Temperature on LLMs: Hot or Cold?" (arXiv:2506.07295): у малых моделей температура меняет качество MT до 192.32%; для MT в целом лучший результат при T=0.0; высокие T бьют по малым моделям сильнее всего.
- "On Temperature-Constrained Non-Deterministic MT" (arXiv:2601.13729, янв. 2026): недетерминированный MT при ограниченной температуре даёт более качественные кандидаты, чем детерминированный, и помогает против multi-modality; открыт «Buckets Effect» — ранжирование ND-систем автометриками доминируется худшим кандидатом, поэтому нужны специальные протоколы оценки (ExpectoSample).
- Farinhas et al. (arXiv:2310.11430): связь «температура → разнообразие гипотез» сильно зависит от instruction tuning; для ансамблирования достаточно малого числа сэмплов. QE-fusion (arXiv:2401.06688): рост температуры улучшает QE-слияние до порога, затем качество падает.
- Практика: T≈0–0.3 для одиночного «точного» прохода и для судьи; T≈0.6–1.0 (подбирать на своих парах) для генерации разнообразных кандидатов под селектор; adaptive/selective sampling (arXiv:2510.01218) — перспективно, но пока исследовательская стадия.
Выводы для TextMachine
- Ядро пайплайна — generate-then-select, не synthesis. N разнородных дешёвых переводчиков (разные семейства моделей и/или промпт-стратегии) + сильный судья с попарным сравнением (Bradley–Terry) — это лучшая по науке точка соотношения качество/цена (WR 0.929 при 1.0x стоимости в 2603.20324). Вкладываться в качество судьи выгоднее, чем в число/силу генераторов; слабый судья делает разнообразие вредным — нужен evals-гейт на самого судью.
- Судья должен видеть кандидатов совместно (cross-candidate prompt), а не скорить поодиночке (2601.08343); дешёвая альтернатива LLM-судьи для отсева — CometKiwi/MBR-прескрининг пула перед финальным LLM-сравнением (2310.11430, 2401.06688).
- Роли из TransAgents брать выборочно: Senior Editor (глоссарий+стайлгайд на этапе preparation) и Trilateral Collaboration (Action/Critique/Judgment) доказали пользу; но обязателен анти-omission контроль — DelTA-стиль по-предложенческого/по-абзацного покрытия с проверкой полноты.
- Банк памяти делать по образцу DelTA: жёсткий Proper Noun Records (детерминированный глоссарий), Bilingual Summary по главам, STM последних абзацев. Генерические memory-фреймворки (Mem0/A-MEM/Letta) — вторичны; их ценность для перевода книг не доказана.
- Температурная политика: переводчики-кандидаты — умеренно повышенная T (пул разнообразных гипотез качественнее детерминированного), судья/редактор/глоссарий — T≈0. У маленьких локальных моделей (8GB VRAM) высоких T избегать особенно.
- Телеметрия качества: онлайн — CometKiwi (дёшево) + периодический GEMBA-MQM-подобный LLM-judge с error spans; оффлайн-релизы — BWS-пары с людьми и проверки консистентности имён/времён (BlonDe/DITING-подобные). Сырой COMET/BLEU как KPI художественности — запрещён (распознают человеческий уровень ≤20%).
- Анти-translationese как отдельная роль: пост-редактор «натуральности» на целевом языке + фильтрация буквализмов; >40% калькированных переводов даже у топ-моделей — это главная художественная болезнь, а не редкие смысловые ошибки.
- Дистилляция под нишу: DRT и LitMT показывают, что 7–14B, дообученные на синтетике из собственного мультиагентного пайплайна (петля translator–advisor–evaluator), догоняют фронтир на литпереводе — путь к локальной модели на GPU владельца и радикальному снижению себестоимости. Датасеты GuoFeng (zh→ru/en вебновеллы) и LAIT — готовое сырьё для evals.
Открытые вопросы
- Существует ли всё-таки переводо-специфичная статья марта 2026 про судью-селектора (возможно, не проиндексирована в использованных поисках или пользователь имел в виду 2603.20324)?
- Переносится ли порог «selection bottleneck» на литперевод zh/ja→ru — нужен собственный эксперимент.
- Насколько CometKiwi/GEMBA-MQM устойчивы на 18+ контенте (риск отказов судейских моделей провайдеров).
Источники
- TransAgents: https://arxiv.org/abs/2405.11804 ; TACL: https://direct.mit.edu/tacl/article/doi/10.1162/TACL.a.25/132121 ; https://github.com/minghao-wu/transagents ; разбор: https://gonzoml.substack.com/p/perhaps-beyond-human-translation
- DelTA: https://arxiv.org/abs/2410.08143 ; https://github.com/YutongWang1216/DocMTAgent
- DRT: https://arxiv.org/abs/2412.17498 ; https://aclanthology.org/2025.findings-acl.351/ ; https://huggingface.co/papers/2412.17498
- CRAT: https://arxiv.org/abs/2410.21067 ; TACTIC: https://arxiv.org/abs/2506.08403 ; TEaR: https://arxiv.org/abs/2402.16379 ; GenTranslate: https://arxiv.org/abs/2402.06894
- When Agents Disagree: https://arxiv.org/abs/2603.20324 ; KV-cache/judge: https://arxiv.org/pdf/2601.08343 ; SemEval-2026 judge-ensemble: https://arxiv.org/pdf/2605.04523
- SAMAS: https://arxiv.org/pdf/2602.19840 ; LitMT: https://arxiv.org/html/2606.05924 ; Agentic AI Translate: https://arxiv.org/html/2605.17041
- Ансамбли/селекция MT: https://arxiv.org/abs/2310.11430 ; https://arxiv.org/pdf/2401.06688
- Метрики: GEMBA-MQM: https://arxiv.org/abs/2310.13988 ; BlonDe: https://arxiv.org/abs/2103.11878 ; LitEval: https://arxiv.org/html/2410.18697v1 ; LiTransProQA: https://arxiv.org/html/2505.05423v4 ; MAS-LitEval: https://arxiv.org/html/2506.14199 ; DITING: https://arxiv.org/pdf/2510.09116 ; CometKiwi: https://aclanthology.org/2022.wmt-1.60/
- WMT literary: https://aclanthology.org/2024.wmt-1.58/ ; https://github.com/longyuewangdcu/GuoFeng-Webnovel ; https://www2.statmt.org/wmt24/literary-translation-task.html
- Литперевод/translationese: https://arxiv.org/abs/2304.03245 ; https://arxiv.org/abs/2503.04369 ; https://arxiv.org/html/2606.26040v1
- Память: MemGPT: https://arxiv.org/abs/2310.08560 ; A-MEM: https://arxiv.org/html/2502.12110v1 ; Mem0: https://arxiv.org/pdf/2504.19413 ; https://mem0.ai/blog/benchmarked-openai-memory-vs-langmem-vs-memgpt-vs-mem0-for-long-term-memory-here-s-how-they-stacked-up
- Температура: https://arxiv.org/html/2506.07295v1 ; https://arxiv.org/abs/2601.13729 ; https://arxiv.org/abs/2510.01218