# 11. Gap 3: Валидация ядра архитектуры (selection vs refinement) и моделей на парах zh→ru / ja→ru Дата: 2026-07-04. Статус: закрытие пробела из doc 03/04/07/09 — свод данных, свидетельств и дизайн пилотного бенчмарка до написания кода MVP. ## TL;DR 1. **Публичной валидации литературного zh→ru не существует.** Единственный релевантный трек — WMT24 Literary zh→ru: 2 участника, оценка только автоматическая (d-BLEU), и **бейзлайн Google (25.2) обошёл обе поданные системы (22.7 / 21.5)**. Человеческой оценки литературного zh→ru никто публично не проводил ([WMT24 Findings](https://arxiv.org/abs/2412.11732)). ja→ru не представлен нигде вообще. 2. **GuoFeng Webnovel V2 zh-ru реально существует и большой** (122 книги, ~20K глав, 23.5M русских слов), но: (а) русские референсы — **перевод GPT-4 с человеческим пост-эдитом**, т.е. это «золото» уровня MTPE, а не художественный перевод; (б) выравнивания нет; (в) лицензия — только некоммерческие исследования, редистрибуция запрещена ([GitHub](https://github.com/longyuewangdcu/GuoFeng-Webnovel)). Для пилота годится как dev-набор, но НЕ как эталон «художественности». 3. **Свежая литература 2025–2026 не подтверждает монополию selection.** Против «selection > synthesis» из arXiv:2603.20324 (не содержащей перевода) стоят: Fusion-of-N (Cohere) — судья-синтезатор **обыгрывает Best-of-N на 11 языках, включая MT** ([arXiv:2510.00931](https://arxiv.org/abs/2510.00931)); систематическое исследование Amazon (май 2026): **doc-level перевод + segment-level refinement даёт стабильный прирост**, а правки уходят в fluency/style/terminology — ровно наша цель ([arXiv:2605.13368](https://arxiv.org/abs/2605.13368)). Вопрос «(а) vs (б)» академически ОТКРЫТ — решается только собственным пилотом. 4. Ключевой механизм из 2605.13368: **refinement «проецирует текст в распределение редактора»**, а не чинит конкретные ошибки → финальный стиль задаёт МОДЕЛЬ-РЕДАКТОР, а не черновик. Следствие: дешевизна черновика почти не важна, вкладываться нужно в лучшую «русскую» модель на позиции редактора/стилиста. 5. **Прямых свидетельств качества кандидатов на русском литературном выходе нет ни в одном бенчмарке.** Косвенные: WMT25 en→ru выиграл Gemini 2.5 Pro ([machinetranslate.org/wmt25](https://machinetranslate.org/wmt25)); в независимом ru-тесте генерации длинных текстов (Хабр, 18 моделей) топ: GPT-5.4 (97), Claude Opus/Sonnet (96/95), Qwen3.6+ (94), GLM-5.1 (91), а **7 из 18 моделей вставляли иероглифы в русский текст** ([habr](https://habr.com/ru/articles/1021388/)); на вебновеллах zh→en лучшим по верности и стилю признан DeepSeek-V3, китайские модели обходят более крупные западные ([DITING, arXiv:2510.09116](https://arxiv.org/abs/2510.09116)). MERA/llmarena/POLLUX задач литперевода не содержат. 6. **Метрики для ru-таргета есть, но только как вспомогательные:** CometKiwi/xCOMET покрывают ru/zh/ja (XLM-R/InfoXLM, 90+ языков); GEMBA изначально тестировалась в т.ч. на en→ru, промпт GEMBA-MQM языконезависим; BlonDe заточена под zh→en (BWB) и требует портирования на русскую морфологию. Решающая метрика пилота — попарный LLM-судья + человеческий BWS: автометрики отличают человеческий перевод от MT ≤20% случаев ([LitEval](https://arxiv.org/html/2410.18697v1)). 7. **Потолок реалистичен, но не достигнут:** свежее ридерское исследование (июнь 2026, LAIT): агентный MT-пайплайн читатели не отличают от человека вслепую (17/30 угадываний), но при пристальном сравнении предпочитают человеческий перевод в **522 из 772** фрагментов ([arXiv:2606.26040](https://arxiv.org/html/2606.26040v1)). Гипотеза «SemEval-2026 Task 8 — про перевод» опровергнута: Task 8 = MTRAGEval (RAG), MT-задач в SemEval-2026 нет ([tasks](https://semeval.github.io/SemEval2026/tasks.html)). 8. **Пилот реализуем за ~2–3 недели и <$50 API + 20–40 ч редакторского времени**: 4 конфигурации (baseline / draft→editor / generate-then-select / гибрид select-then-refine) на ~200K токенов исходников zh/ja/en с приватными эталонами из лицензионных изданий. Дизайн — в разделе 5. --- ## 1. Данные для пилотного бенчмарка ### 1.1 GuoFeng Webnovel V2 (zh→ru) — проверено Состав ([GitHub longyuewangdcu/GuoFeng-Webnovel](https://github.com/longyuewangdcu/GuoFeng-Webnovel), [WMT24 Findings](https://arxiv.org/html/2412.11732v1)): - **zh-ru: 122 книги, ~19 971 глава, 23.5M русских слов / 39M китайских иероглифов**; уровень документа, БЕЗ пофразового выравнивания (в отличие от zh-en V1). - Официальный тест WMT24 zh-ru: **13 глав, 15.6K слов** — крошечный. - Происхождение русской стороны: китайские вебновеллы **переведены GPT-4 на уровне документа, затем человеческий пост-эдит/ревью**. Это критично: референс несёт «акцент» GPT-4, и метрики с таким референсом будут штрафовать более смелые художественные решения. - Лицензия: copyright Tencent AI Lab + China Literature Ltd.; доступ по регистрационной форме; **только некоммерческое исследование, модификация и редистрибуция запрещены**. Для внутреннего пилота — приемлемо; встраивать в коммерческий продукт/обучение — нельзя. Вывод: GuoFeng V2 — тренировочно-отладочный материал и источник согласованной терминологии жанров, но «золотом художественности» для zh→ru быть не может. ### 1.2 WMT: что реально было по нашим парам - **WMT24 Literary zh→ru**: участвовали только NLP2CT-UM (d-BLEU 22.7) и SJTU-LoveFiction (21.5); бейзлайн Google — 25.2; из-за 2 участников **человеческой оценки не проводили** ([Findings](https://arxiv.org/abs/2412.11732)). Т.е. лучший публичный результат литературного zh→ru — ниже Google Translate по d-BLEU (сам d-BLEU на литтексте малоинформативен, что признают организаторы). - **WMT25 General MT**: en→ru присутствует (оценка людьми, протокол ESA); победитель unconstrained — Gemini 2.5 Pro (топ-кластер в 14/15 пар), constrained — Shy-hunyuan-MT; zh→ru и ja→ru отсутствуют; человеческие референсы попали в кластер победителей лишь в 6/15 пар ([machinetranslate.org/wmt25](https://machinetranslate.org/wmt25)). Продолжение литературного трека в 2025–2026 не найдено (не проверено — сайт statmt по WMT26 не даёт списка). ### 1.3 LAIT — свежий ридерский датасет литперевода (fr/pl/ja→en) Из пары статей июня 2026 ([reader study, arXiv:2606.26040](https://arxiv.org/html/2606.26040v1); [Fluency and Faithfulness, arXiv:2605.15282](https://arxiv.org/pdf/2605.15282)): - 31 отрывок-открытие романов (~8K слов каждый), fr/pl/**ja**→en; 1K комментариев читателей, 2K суждений, 7.2K span-аннотаций; dev-набор: 1.7K выровненных абзацев по 5 MT-пайплайнам. - Сравнивался **агентный многошаговый LLM-пайплайн** против опубликованного человеческого перевода: вслепую читатели не отличают (17/30), при чтении с полным погружением предпочтение HT — 19/30 отрывков, при попарном пристальном чтении — **522/772 фрагментов за человека**; автометрики с предпочтениями читателей не коррелируют. - Для нас: готовая методология (immersive reading + chunk-pair comparison) и ja→en-часть как прокси для ja-исходника; ru-таргета нет. ### 1.4 ja-ресурсы: VNTL, JP-TL-Bench - **VNTL Leaderboard** — перевод японских визуальных новелл в en: 256 пар, ранжирование по косинусной близости эмбеддингов (chrF справочно) ([HF dataset](https://huggingface.co/datasets/lmg-anon/vntl-leaderboard), [GitHub](https://github.com/lmg-anon/vntl-benchmark)). Методологически слабый (сами авторы признают), но это единственный лидерборд именно по художественному ja-диалоговому тексту; его данные/промпты переиспользуемы для нашего ja-пилота. ru-таргета нет. - **JP-TL-Bench** ([arXiv:2601.00223](https://arxiv.org/pdf/2601.00223), янв 2026) — двунаправленный ja↔en бенчмарк с **anchored pairwise LLM-оценкой** (Bradley–Terry, референс как якорь) — готовый шаблон протокола судьи для нашего пилота (не литературный домен). - **Nejumi Leaderboard 4** (W&B Japan): включает категорию «перевод» среди подзадач, обновление 28.04.2026; конкретный топ по переводу из статического HTML не извлекается — **нужен ручной срез с [nejumi.ai](https://nejumi.ai/)** (не проверено). [Swallow Leaderboard](https://swallow-llm.github.io/leaderboard/about.en.html) — аналогично. ### 1.5 Параллельные ru-корпуса художественных текстов - **Русско-китайский параллельный корпус НКРЯ** ([ruzhcorp.ruscorpora.ru](https://ruzhcorp.ruscorpora.ru/)): >1000 текстов, в основном классика XIX–XXI вв. и новости; единственный развиваемый в РФ ru-zh корпус. Жанрово далёк от вебновелл — годится для вспомогательной проверки (термины, идиомы), не для основного eval. Публичного ja-ru литературного корпуса не найдено. - **Лицензионные издания как приватный eval** (главный ресурс): официальные русские издания вебновелл/ранобэ — АСТ/Freedom и Комильфо (Мосян Тунсю и др. zh-новеллы), Истари Комикс, XL Media, Alt Graph (ja-ранобэ). Оригинал + официальный перевод выравниваются по главам/сценам вручную (13–20 глав достаточно). Юридически: внутреннее использование купленных копий для приватной оценки без публикации текстов — низкорисковое (см. doc 08); публиковать можно только агрегированные метрики. (не проверено: позиция правообладателей по TDM-исключениям в РФ) - Фан-переводы (tl.rulate.ru, ranobelib) — большой объём, но нестабильное качество и правовой статус; использовать только как «нижний якорь» качества в BWS, не как референс. --- ## 2. Свидетельства качества кандидатов: ru-выход и ja-исходник **Прямых публичных оценок «литературный перевод на русский» нет ни для одной модели-кандидата.** Что есть: | Источник | Что меряет | Результат для нашего стека | |---|---|---| | [WMT25 General](https://machinetranslate.org/wmt25) | en→ru, документы, ESA-люди | Gemini 2.5 Pro — топ; линия Gemini Pro — обоснованный судья/эскалация | | [Хабр: 18 моделей, ru-контент](https://habr.com/ru/articles/1021388/) (2026) | длинные ru-тексты, судья Opus 4.6 | GPT-5.4 97 > Opus 4.6 96* > Sonnet 4.6 95* > **Qwen3.6+ 94** > GPT-5.2 93 > **GLM-5.1 91**; Qwen3-235B: 88/100 при цене в ~130 раз ниже GPT-5.4. **7/18 моделей вставляют CJK-иероглифы в русский текст** | | [DITING](https://arxiv.org/abs/2510.09116) (18K экспертных аннотаций) | вебновеллы zh→en, 6 измерений (идиомы, полисемия, локализация терминов, времена, нулевые местоимения, культурная безопасность) | **DeepSeek-V3 — самый верный и стилистически связный**; китайские LLM обходят более крупные западные; AgentEval (мультиагентный судья) — лучшая корреляция с людьми из 7 метрик | | [BenchLM zh-лидерборд](https://benchlm.ai/blog/posts/best-chinese-llm) (июнь 2026) | китайский язык в целом | DeepSeek V4 Pro 87 > GLM-5.1 83 > Kimi K2.6 / GLM-5 81 > Qwen3.5 79 | | [MERA](https://mera.a-ai.ru/ru/text) / [llmarena.ru](https://llmarena.ru/) / [POLLUX](https://arxiv.org/abs/2505.24616) | ru-задачи / Elo / 35 генеративных типов | литперевода нет; POLLUX даёт **открытые ru-судейские модели 7B/32B с критериальной оценкой** — кандидат в дешёвый локальный судья-фильтр (влезает в 8GB VRAM в кванте — 7B) | | [Nejumi 4](https://nejumi.ai/) / [Swallow](https://swallow-llm.github.io/leaderboard/about.en.html) | ja-задачи, вкл. перевод | срез не снят (JS-дашборд), задача на пилот (не проверено) | Интерпретация для стека: (1) черновик zh→ru — DeepSeek/Qwen оправданы доменом (DITING) и ценой, но их ru-выход требует обязательного **детектора CJK-артефактов и калек**; (2) редактор ru — по косвенным данным сильнейшие «дешёвые» на русском — Qwen3.x-крупные и GLM-5.x, а Claude/GPT — премиум-эскалация; (3) судья — Gemini Pro (WMT25 en→ru) или панель из чужих семейств. Всё это — гипотезы уровня «косвенно подтверждено», пилот обязателен. --- ## 3. Метрики для ru-таргета - **CometKiwi** (reference-free QE): [wmt22-cometkiwi-da](https://huggingface.co/Unbabel/wmt22-cometkiwi-da) на InfoXLM и [wmt23-cometkiwi-da-xxl](https://huggingface.co/Unbabel/wmt23-cometkiwi-da-xxl) на XLM-R XXL — ru, zh, ja входят в покрытие (90+ языков). Лицензия CC-BY-NC — для внутреннего eval ок. - **xCOMET-XL/XXL** (3.5B/10.7B): скор + error spans, мультиязычный (XLM-R), референсный и безреференсный режимы ([TACL](https://direct.mit.edu/tacl/article/doi/10.1162/tacl_a_00683/124263/), [Unbabel/COMET](https://github.com/Unbabel/COMET)). XL запускается на 8GB VRAM в fp16 с оффлоадом (медленно) или на CPU/32GB RAM. - **GEMBA / GEMBA-MQM**: оригинальная GEMBA валидировалась в т.ч. на en→ru ([arXiv:2302.14520](https://arxiv.org/abs/2302.14520)); GEMBA-MQM — языконезависимый 3-shot промпт с error spans ([arXiv:2310.13988](https://arxiv.org/abs/2310.13988)). Для ru-таргета применим без модификаций. - **BlonDe** ([arXiv:2103.11878](https://arxiv.org/abs/2103.11878)): дискурсивные категории (имена, времена, род, эллипсис) построены на zh→en BWB; **на ru «из коробки» не работает** — нужен порт на русскую морфологию (pymorphy/Natasha), зато в русском род/вид глагола дают даже больше сигнала. Реализовать свой «BlonDe-ru» как набор детерминированных проверок — дёшево. - **Чего метрики не решают:** на литтекстах автометрики отличают HT от MT ≤20% случаев ([LitEval, arXiv:2410.18697](https://arxiv.org/html/2410.18697v1)), а в LAIT-исследовании они не согласуются с предпочтениями читателей ([2606.26040](https://arxiv.org/html/2606.26040v1)). WMT24 для zh→ru использовал только d-BLEU — и это антипример. **Решающая метрика пилота — попарные сравнения (LLM-панель + человеческий BWS), автометрики — только телеметрия и фильтры.** --- ## 4. Selection vs iterative refinement: состояние на июль 2026 Свод свидетельств по обе стороны (перевод-специфичных): **За refinement (черновик→редактор):** - [arXiv:2605.13368](https://arxiv.org/abs/2605.13368) (Amazon, май 2026; 9 моделей, 7 языковых пар, доклевел литперевод): «document-level MT followed by **segment-level refinement** yields strong and stable improvements»; doc-level refinement целиком — мало правок и нестабильно; **простой общий промпт редактуры стабильно лучше error-specific**; человеческая оценка: прирост в fluency/style/terminology, не в adequacy; refinement «проецирует выход в распределение рефайнера». Состав пар (есть ли ru/zh/ja) — уточнить по полному тексту (не проверено). - TEaR ([arXiv:2402.16379](https://arxiv.org/abs/2402.16379)): систематический self-refine (Translate→Estimate→Refine) улучшает MT; слепые «улучши перевод» итерации без диагностики — почти не работают. - Наша cost-модель (doc 09): draft→editor ≈ 2 output-прохода, дёшево и кэшируемо. **За selection (N кандидатов→судья):** - [arXiv:2603.20324](https://arxiv.org/abs/2603.20324): WR 0.929 у mixed-capability команды с судьёй при стоимости 1.0x — но **среди 42 задач нет перевода** (признано в doc 03). - MBR/QE-реранкинг: sMBR ([arXiv:2406.11632](https://arxiv.org/abs/2406.11632), ACL 2025) обходит QE-rerank и классический MBR; известна метрик-предвзятость MBR (галлюцинации метрики-утилиты, [arXiv:2411.03524](https://arxiv.org/pdf/2411.03524)) — на литтекстах, где метрики слабы (LitEval), MBR-селекция по автометрике рискованна. **За синтез/гибрид (против чистой селекции):** - **Fusion-of-N** ([arXiv:2510.00931](https://arxiv.org/abs/2510.00931), Cohere, окт 2025): судья-СИНТЕЗАТОР обыгрывает Best-of-N на 11 языках и 3 задачах, включая MT, и на test-time scaling, и на дистилляции. Прямо противоречит переносу «synthesis проигрывает селекции» из 2603.20324 на перевод. - QE-fusion ([arXiv:2401.06688](https://arxiv.org/pdf/2401.06688)): комбинирование фрагментов гипотез по QE-сигналу лучше реранкинга. - GenTranslate ([arXiv:2402.06894](https://arxiv.org/abs/2402.06894)): дообученный синтезатор из N-best бьёт SOTA. **Итог:** в переводном домене свидетельства скорее в пользу «draft→segment-level editor» и гибридов «select/fuse затем refine», чем чистого generate-then-select; но НИ ОДНА работа не сравнивала эти архитектуры на литературном ru-таргете. Пробел закрывается только пилотом. --- ## 5. Дизайн пилотного эксперимента **Цель:** выбрать архитектуру MVP (и пары моделей) по критерию «человеческое предпочтение на zh→ru/ja→ru за $/главу», до написания продакшен-кода. ### 5.1 Данные (готовим 1 неделю) | Набор | Состав | Роль | |---|---|---| | A. zh→ru приватный | 5 вебновелл × 2–3 главы с **официальным ru-переводом** (АСТ/Комильфо и др.), ~50K токенов zh | основной eval, «человеческий якорь» | | B. ja→ru приватный | 4–5 ранобэ × 2 главы с официальным ru-переводом (Истари/XL Media), ~40K токенов ja | основной eval | | C. GuoFeng V2 test | 13 глав zh-ru (регистрация, non-commercial) | dev/отладка промптов, НЕ финальный отчёт | | D. en→ru | 3–4 фрагмента совр. жанровой прозы с изданным переводом, ~20K токенов | дешёвый sanity | | Всего | ~25–35 глав, ~150–200K токенов исходников | | Подготовка: выравнивание по сценам (1–3K токенов), общий глоссарий на книгу (имена/термины) строится один раз и подаётся во все конфигурации одинаково — изолируем эффект архитектуры от эффекта памяти. ### 5.2 Конфигурации (4 руки) - **C0 (baseline):** один doc-level проход DeepSeek V4 Flash, T≈0.3, с глоссарием. Второй бейзлайн C0': Gemini Flash (западная дешёвая) — по тем же входам. - **C1 (draft→editor):** черновик DeepSeek V4 Flash → **segment-level редактор** GLM-5 или Kimi K2.6 с общим (не error-specific) промптом редактуры по чек-листу Галь (doc 07) → дешёвый судья-гейт (CometKiwi + POLLUX-judge-7B локально) → флагованные сегменты (~10–15%) эскалируются на Claude Sonnet. Точно по выводам 2605.13368. - **C2 (generate-then-select):** 3 разнородных черновика (DeepSeek V4 Flash T0.7, Qwen3.7, Gemini Flash) → судья-селектор Gemini Pro (batch), попарно с Bradley–Terry, cross-candidate промпт → победитель без правок. Точно по 2603.20324. - **C3 (гибрид select-then-refine):** победитель C2 → тот же segment-level редактор, что в C1. (Опционально C3': Fusion-of-N — судья-синтезатор вместо селектора, если бюджет позволит.) Фиксируем: одинаковый глоссарий, чанкование, число вызовов логируем, все дорогие вызовы — batch. ### 5.3 Метрики и объём - **Первичная:** anchored pairwise сравнения конфигураций (протокол JP-TL-Bench): панель LLM-судей из семейств, не участвующих в пайплайнах-кандидатах (GPT-5.x + Claude + Gemini Pro, большинство голосов), плюс якорь — официальный человеческий перевод. **~300 попарных чанк-сравнений на пару конфигураций** → биномиальный тест обнаруживает разницу WR ≥8 п.п. при α=0.05, power≈0.8. - **Человеческая:** BWS/попарные сравнения 2–3 русскоязычными редакторами на стратифицированной подвыборке **100–150 пар** для топ-2 конфигураций + якорь HT (методика LAIT: пристальное чтение пар фрагментов). Это главный критерий решения. - **Вторичные (телеметрия):** xCOMET-XL error spans, CometKiwi; скрипт консистентности глоссария; **детектор CJK-артефактов** (обязателен: 7/18 моделей грешат) и морфодетектор канцелярита (doc 07); доля отказов/цензурных срывов на 18+ фрагментах (заложить 2–3 таких главы). - Отчёт: WR с доверительными интервалами (bootstrap по книгам, не только по чанкам — кластеризация внутри книги), $/глава и латентность на конфигурацию. ### 5.4 Бюджет и сроки - API: 200K токенов исходника × 4 конфигурации; по тарифам doc 09 (DeepSeek V4 Flash $0.14/$0.28; Gemini Pro-судья $2/$12 batch→50%): C0≈$0.5, C1≈$1.5–2, C2≈$3–5, C3≈$4–6, панель судей ≈$10–20. **Итого API < $50.** - Люди: 20–40 ч редакторов (≈$300–800 на фрилансе) — главная статья затрат и главный источник достоверности. - Сроки: 1 нед. данные + 1 нед. прогоны/судейство + 3–5 дней человеческая оценка и анализ. ### 5.5 Критерии решения 1. Если WR(C2 или C3 vs C1) < +5 п.п. по человеческой оценке → **берём C1** (draft→editor): она в 2–3 раза дешевле и проще в инкрементальной доработке. 2. Если C3 > C1 и C3 > C2 значимо → гибрид: селекция на «трудных» сегментах (по сигналу судьи-гейта), редактура везде. 3. Отсекающие условия для любых конфигураций: CJK-артефакты >0.1% сегментов после пайплайна; консистентность глоссария <98%; провал 18+ фрагментов у провайдера — модель вылетает из роли. 4. Побочный выход пилота: калиброванный порог судьи-гейта (какой % сегментов эскалировать) — прямой вход в cost-модель doc 09. --- ## Выводы для TextMachine 1. **Ставку «WR 0.929 ⇒ selection лучший для перевода» считать недоказанной.** Переводная литература 2025–2026 (FusioN, Amazon-refinement, QE-fusion) склоняет к «draft → segment-level editor» и гибридам; чистый generate-then-select дороже (3× черновиков + судья) без доказанного выигрыша на литтексте. До пилота проектировать интерфейсы пайплайна так, чтобы обе топологии были конфигурацией, а не кодом. 2. **Редактор важнее черновика.** Refinement тянет текст в распределение модели-редактора → позицию редактора отдаём сильнейшей по русскому стилю модели пула (по косвенным данным: Qwen3.x-крупный / GLM-5.x; эскалация — Sonnet), а черновик оптимизируем только по цене и верности (DeepSeek — подтверждён DITING на вебновеллах zh→en). 3. **GuoFeng V2 zh-ru использовать как dev, не как gold**: референсы — пост-эдит GPT-4, лицензия некоммерческая. Художественный эталон строим сами из лицензионных изданий (приватно, без публикации текстов). 4. **ja→ru — полностью слепая зона** (нет ни корпусов, ни лидербордов с ru-таргетом): пилотная ja-часть на официальных изданиях ранобэ обязательна; параллельно снять ручной срез Nejumi 4 (категория «перевод») и Swallow. 5. **Обязательные детерминированные фильтры ru-выхода** до всякого судейства: CJK-артефакты (7/18 моделей!), кальки/канцелярит (морфология), консистентность глоссария. Дёшево и снимает главные позоры дешёвых моделей. 6. **Решающая оценка — только попарная** (LLM-панель чужих семейств + человеческий BWS); d-BLEU/COMET — телеметрия. Порт BlonDe на русскую морфологию — маленький и ценный внутренний актив. 7. POLLUX-judge 7B — кандидат в **локальный** дешёвый судья-гейт на GPU 8GB (квант) — снижает COGS гейта до нуля. 8. Пилот стоит <$50 API + оплата редакторов и закрывает самый большой технический риск MVP; до его результатов не фиксировать в коде ни архитектуру, ни состав моделей. ## Открытые вопросы - Состав 7 языковых пар в arXiv:2605.13368 (есть ли CJK/ru) — вытащить из полного текста. - Актуальный топ Nejumi 4 / Swallow по подзадаче перевода (JS-дашборды, нужен ручной срез). - Действующий состав/цены моделей на июль 2026 (DeepSeek V4 Flash/Pro, Qwen3.7, GLM-5, Kimi K2.6, Gemini 3.x, GPT-5.4-mini) — сверить в момент запуска пилота (см. doc 09, депрекации имён). - Продолжится ли WMT Literary в 2026 и добавят ли человеческую оценку zh→ru. - Юридическая рамка приватного eval на лицензионных изданиях в РФ (TDM/цитирование) — уточнить у юриста (связ. doc 08). ## Источники - GuoFeng Webnovel: https://github.com/longyuewangdcu/GuoFeng-Webnovel ; WMT24 Findings: https://arxiv.org/abs/2412.11732 (html: https://arxiv.org/html/2412.11732v1) ; задача: https://www2.statmt.org/wmt24/literary-translation-task.html ; NovelTrans: https://aclanthology.org/2024.wmt-1.98/ - WMT25 General MT: https://machinetranslate.org/wmt25 - LAIT / ридерское исследование: https://arxiv.org/html/2606.26040v1 ; https://arxiv.org/pdf/2605.15282 - Refinement (Amazon, 2026): https://arxiv.org/abs/2605.13368 ; TEaR: https://arxiv.org/abs/2402.16379 ; post-edit с аннотациями ошибок: https://arxiv.org/html/2404.07851v1 - Selection/synthesis: When Agents Disagree: https://arxiv.org/abs/2603.20324 ; Fusion-of-N: https://arxiv.org/abs/2510.00931 ; QE-fusion: https://arxiv.org/pdf/2401.06688 ; GenTranslate: https://arxiv.org/abs/2402.06894 ; sMBR: https://arxiv.org/abs/2406.11632 ; MBR bias: https://arxiv.org/pdf/2411.03524 - DITING (вебновеллы zh→en): https://arxiv.org/abs/2510.09116 - Модели на ru: https://habr.com/ru/articles/1021388/ ; MERA: https://mera.a-ai.ru/ru/text ; llmarena: https://llmarena.ru/ ; POLLUX: https://arxiv.org/abs/2505.24616 , https://github.com/ai-forever/POLLUX ; BenchLM zh: https://benchlm.ai/blog/posts/best-chinese-llm - ja: VNTL: https://huggingface.co/datasets/lmg-anon/vntl-leaderboard , https://github.com/lmg-anon/vntl-benchmark ; JP-TL-Bench: https://arxiv.org/pdf/2601.00223 ; Nejumi 4: https://nejumi.ai/ , https://wandb.ai/llm-leaderboard/nejumi-leaderboard4 ; Swallow: https://swallow-llm.github.io/leaderboard/about.en.html - Метрики: CometKiwi: https://huggingface.co/Unbabel/wmt22-cometkiwi-da , https://huggingface.co/Unbabel/wmt23-cometkiwi-da-xxl ; xCOMET: https://direct.mit.edu/tacl/article/doi/10.1162/tacl_a_00683/124263/ , https://github.com/Unbabel/COMET ; GEMBA: https://arxiv.org/abs/2302.14520 ; GEMBA-MQM: https://arxiv.org/abs/2310.13988 ; BlonDe: https://arxiv.org/abs/2103.11878 ; LitEval: https://arxiv.org/html/2410.18697v1 - ru-zh корпус НКРЯ: https://ruzhcorp.ruscorpora.ru/ ; SemEval-2026 tasks: https://semeval.github.io/SemEval2026/tasks.html