textmachine/docs/research/11-gap-3.md
Claude (backend session) 9bb00d49f2 Initial commit: documentation, eval polygon, backend step 0 verdict
TextMachine project repository (AI translation of literary books).
Includes: v2 architecture decisions, MVP plan, research 01-12,
polygon experiments 01-03, backend-session revalidation verdict
(03-implementation-notes.md).

Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
2026-07-04 06:50:59 +03:00

182 lines
36 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

# 11. Gap 3: Валидация ядра архитектуры (selection vs refinement) и моделей на парах zh→ru / ja→ru
Дата: 2026-07-04. Статус: закрытие пробела из doc 03/04/07/09 — свод данных, свидетельств и дизайн пилотного бенчмарка до написания кода MVP.
## TL;DR
1. **Публичной валидации литературного zh→ru не существует.** Единственный релевантный трек — WMT24 Literary zh→ru: 2 участника, оценка только автоматическая (d-BLEU), и **бейзлайн Google (25.2) обошёл обе поданные системы (22.7 / 21.5)**. Человеческой оценки литературного zh→ru никто публично не проводил ([WMT24 Findings](https://arxiv.org/abs/2412.11732)). ja→ru не представлен нигде вообще.
2. **GuoFeng Webnovel V2 zh-ru реально существует и большой** (122 книги, ~20K глав, 23.5M русских слов), но: (а) русские референсы — **перевод GPT-4 с человеческим пост-эдитом**, т.е. это «золото» уровня MTPE, а не художественный перевод; (б) выравнивания нет; (в) лицензия — только некоммерческие исследования, редистрибуция запрещена ([GitHub](https://github.com/longyuewangdcu/GuoFeng-Webnovel)). Для пилота годится как dev-набор, но НЕ как эталон «художественности».
3. **Свежая литература 20252026 не подтверждает монополию selection.** Против «selection > synthesis» из arXiv:2603.20324 (не содержащей перевода) стоят: Fusion-of-N (Cohere) — судья-синтезатор **обыгрывает Best-of-N на 11 языках, включая MT** ([arXiv:2510.00931](https://arxiv.org/abs/2510.00931)); систематическое исследование Amazon (май 2026): **doc-level перевод + segment-level refinement даёт стабильный прирост**, а правки уходят в fluency/style/terminology — ровно наша цель ([arXiv:2605.13368](https://arxiv.org/abs/2605.13368)). Вопрос «(а) vs (б)» академически ОТКРЫТ — решается только собственным пилотом.
4. Ключевой механизм из 2605.13368: **refinement «проецирует текст в распределение редактора»**, а не чинит конкретные ошибки → финальный стиль задаёт МОДЕЛЬ-РЕДАКТОР, а не черновик. Следствие: дешевизна черновика почти не важна, вкладываться нужно в лучшую «русскую» модель на позиции редактора/стилиста.
5. **Прямых свидетельств качества кандидатов на русском литературном выходе нет ни в одном бенчмарке.** Косвенные: WMT25 en→ru выиграл Gemini 2.5 Pro ([machinetranslate.org/wmt25](https://machinetranslate.org/wmt25)); в независимом ru-тесте генерации длинных текстов (Хабр, 18 моделей) топ: GPT-5.4 (97), Claude Opus/Sonnet (96/95), Qwen3.6+ (94), GLM-5.1 (91), а **7 из 18 моделей вставляли иероглифы в русский текст** ([habr](https://habr.com/ru/articles/1021388/)); на вебновеллах zh→en лучшим по верности и стилю признан DeepSeek-V3, китайские модели обходят более крупные западные ([DITING, arXiv:2510.09116](https://arxiv.org/abs/2510.09116)). MERA/llmarena/POLLUX задач литперевода не содержат.
6. **Метрики для ru-таргета есть, но только как вспомогательные:** CometKiwi/xCOMET покрывают ru/zh/ja (XLM-R/InfoXLM, 90+ языков); GEMBA изначально тестировалась в т.ч. на en→ru, промпт GEMBA-MQM языконезависим; BlonDe заточена под zh→en (BWB) и требует портирования на русскую морфологию. Решающая метрика пилота — попарный LLM-судья + человеческий BWS: автометрики отличают человеческий перевод от MT ≤20% случаев ([LitEval](https://arxiv.org/html/2410.18697v1)).
7. **Потолок реалистичен, но не достигнут:** свежее ридерское исследование (июнь 2026, LAIT): агентный MT-пайплайн читатели не отличают от человека вслепую (17/30 угадываний), но при пристальном сравнении предпочитают человеческий перевод в **522 из 772** фрагментов ([arXiv:2606.26040](https://arxiv.org/html/2606.26040v1)). Гипотеза «SemEval-2026 Task 8 — про перевод» опровергнута: Task 8 = MTRAGEval (RAG), MT-задач в SemEval-2026 нет ([tasks](https://semeval.github.io/SemEval2026/tasks.html)).
8. **Пилот реализуем за ~23 недели и <$50 API + 2040 ч редакторского времени**: 4 конфигурации (baseline / draft→editor / generate-then-select / гибрид select-then-refine) на ~200K токенов исходников zh/ja/en с приватными эталонами из лицензионных изданий. Дизайн — в разделе 5.
---
## 1. Данные для пилотного бенчмарка
### 1.1 GuoFeng Webnovel V2 (zh→ru) — проверено
Состав ([GitHub longyuewangdcu/GuoFeng-Webnovel](https://github.com/longyuewangdcu/GuoFeng-Webnovel), [WMT24 Findings](https://arxiv.org/html/2412.11732v1)):
- **zh-ru: 122 книги, ~19 971 глава, 23.5M русских слов / 39M китайских иероглифов**; уровень документа, БЕЗ пофразового выравнивания (в отличие от zh-en V1).
- Официальный тест WMT24 zh-ru: **13 глав, 15.6K слов** — крошечный.
- Происхождение русской стороны: китайские вебновеллы **переведены GPT-4 на уровне документа, затем человеческий пост-эдит/ревью**. Это критично: референс несёт «акцент» GPT-4, и метрики с таким референсом будут штрафовать более смелые художественные решения.
- Лицензия: copyright Tencent AI Lab + China Literature Ltd.; доступ по регистрационной форме; **только некоммерческое исследование, модификация и редистрибуция запрещены**. Для внутреннего пилота — приемлемо; встраивать в коммерческий продукт/обучение — нельзя.
Вывод: GuoFeng V2 — тренировочно-отладочный материал и источник согласованной терминологии жанров, но «золотом художественности» для zh→ru быть не может.
### 1.2 WMT: что реально было по нашим парам
- **WMT24 Literary zh→ru**: участвовали только NLP2CT-UM (d-BLEU 22.7) и SJTU-LoveFiction (21.5); бейзлайн Google — 25.2; из-за 2 участников **человеческой оценки не проводили** ([Findings](https://arxiv.org/abs/2412.11732)). Т.е. лучший публичный результат литературного zh→ru — ниже Google Translate по d-BLEU (сам d-BLEU на литтексте малоинформативен, что признают организаторы).
- **WMT25 General MT**: en→ru присутствует (оценка людьми, протокол ESA); победитель unconstrained — Gemini 2.5 Pro (топ-кластер в 14/15 пар), constrained — Shy-hunyuan-MT; zh→ru и ja→ru отсутствуют; человеческие референсы попали в кластер победителей лишь в 6/15 пар ([machinetranslate.org/wmt25](https://machinetranslate.org/wmt25)). Продолжение литературного трека в 20252026 не найдено (не проверено — сайт statmt по WMT26 не даёт списка).
### 1.3 LAIT — свежий ридерский датасет литперевода (fr/pl/ja→en)
Из пары статей июня 2026 ([reader study, arXiv:2606.26040](https://arxiv.org/html/2606.26040v1); [Fluency and Faithfulness, arXiv:2605.15282](https://arxiv.org/pdf/2605.15282)):
- 31 отрывок-открытие романов (~8K слов каждый), fr/pl/**ja**→en; 1K комментариев читателей, 2K суждений, 7.2K span-аннотаций; dev-набор: 1.7K выровненных абзацев по 5 MT-пайплайнам.
- Сравнивался **агентный многошаговый LLM-пайплайн** против опубликованного человеческого перевода: вслепую читатели не отличают (17/30), при чтении с полным погружением предпочтение HT — 19/30 отрывков, при попарном пристальном чтении — **522/772 фрагментов за человека**; автометрики с предпочтениями читателей не коррелируют.
- Для нас: готовая методология (immersive reading + chunk-pair comparison) и ja→en-часть как прокси для ja-исходника; ru-таргета нет.
### 1.4 ja-ресурсы: VNTL, JP-TL-Bench
- **VNTL Leaderboard** — перевод японских визуальных новелл в en: 256 пар, ранжирование по косинусной близости эмбеддингов (chrF справочно) ([HF dataset](https://huggingface.co/datasets/lmg-anon/vntl-leaderboard), [GitHub](https://github.com/lmg-anon/vntl-benchmark)). Методологически слабый (сами авторы признают), но это единственный лидерборд именно по художественному ja-диалоговому тексту; его данные/промпты переиспользуемы для нашего ja-пилота. ru-таргета нет.
- **JP-TL-Bench** ([arXiv:2601.00223](https://arxiv.org/pdf/2601.00223), янв 2026) — двунаправленный ja↔en бенчмарк с **anchored pairwise LLM-оценкой** (BradleyTerry, референс как якорь) — готовый шаблон протокола судьи для нашего пилота (не литературный домен).
- **Nejumi Leaderboard 4** (W&B Japan): включает категорию «перевод» среди подзадач, обновление 28.04.2026; конкретный топ по переводу из статического HTML не извлекается — **нужен ручной срез с [nejumi.ai](https://nejumi.ai/)** (не проверено). [Swallow Leaderboard](https://swallow-llm.github.io/leaderboard/about.en.html) — аналогично.
### 1.5 Параллельные ru-корпуса художественных текстов
- **Русско-китайский параллельный корпус НКРЯ** ([ruzhcorp.ruscorpora.ru](https://ruzhcorp.ruscorpora.ru/)): >1000 текстов, в основном классика XIXXXI вв. и новости; единственный развиваемый в РФ ru-zh корпус. Жанрово далёк от вебновелл — годится для вспомогательной проверки (термины, идиомы), не для основного eval. Публичного ja-ru литературного корпуса не найдено.
- **Лицензионные издания как приватный eval** (главный ресурс): официальные русские издания вебновелл/ранобэ — АСТ/Freedom и Комильфо (Мосян Тунсю и др. zh-новеллы), Истари Комикс, XL Media, Alt Graph (ja-ранобэ). Оригинал + официальный перевод выравниваются по главам/сценам вручную (1320 глав достаточно). Юридически: внутреннее использование купленных копий для приватной оценки без публикации текстов — низкорисковое (см. doc 08); публиковать можно только агрегированные метрики. (не проверено: позиция правообладателей по TDM-исключениям в РФ)
- Фан-переводы (tl.rulate.ru, ranobelib) — большой объём, но нестабильное качество и правовой статус; использовать только как «нижний якорь» качества в BWS, не как референс.
---
## 2. Свидетельства качества кандидатов: ru-выход и ja-исходник
**Прямых публичных оценок «литературный перевод на русский» нет ни для одной модели-кандидата.** Что есть:
| Источник | Что меряет | Результат для нашего стека |
|---|---|---|
| [WMT25 General](https://machinetranslate.org/wmt25) | en→ru, документы, ESA-люди | Gemini 2.5 Pro — топ; линия Gemini Pro — обоснованный судья/эскалация |
| [Хабр: 18 моделей, ru-контент](https://habr.com/ru/articles/1021388/) (2026) | длинные ru-тексты, судья Opus 4.6 | GPT-5.4 97 > Opus 4.6 96* > Sonnet 4.6 95* > **Qwen3.6+ 94** > GPT-5.2 93 > **GLM-5.1 91**; Qwen3-235B: 88/100 при цене в ~130 раз ниже GPT-5.4. **7/18 моделей вставляют CJK-иероглифы в русский текст** |
| [DITING](https://arxiv.org/abs/2510.09116) (18K экспертных аннотаций) | вебновеллы zh→en, 6 измерений (идиомы, полисемия, локализация терминов, времена, нулевые местоимения, культурная безопасность) | **DeepSeek-V3 — самый верный и стилистически связный**; китайские LLM обходят более крупные западные; AgentEval (мультиагентный судья) — лучшая корреляция с людьми из 7 метрик |
| [BenchLM zh-лидерборд](https://benchlm.ai/blog/posts/best-chinese-llm) (июнь 2026) | китайский язык в целом | DeepSeek V4 Pro 87 > GLM-5.1 83 > Kimi K2.6 / GLM-5 81 > Qwen3.5 79 |
| [MERA](https://mera.a-ai.ru/ru/text) / [llmarena.ru](https://llmarena.ru/) / [POLLUX](https://arxiv.org/abs/2505.24616) | ru-задачи / Elo / 35 генеративных типов | литперевода нет; POLLUX даёт **открытые ru-судейские модели 7B/32B с критериальной оценкой** — кандидат в дешёвый локальный судья-фильтр (влезает в 8GB VRAM в кванте — 7B) |
| [Nejumi 4](https://nejumi.ai/) / [Swallow](https://swallow-llm.github.io/leaderboard/about.en.html) | ja-задачи, вкл. перевод | срез не снят (JS-дашборд), задача на пилот (не проверено) |
Интерпретация для стека: (1) черновик zh→ru — DeepSeek/Qwen оправданы доменом (DITING) и ценой, но их ru-выход требует обязательного **детектора CJK-артефактов и калек**; (2) редактор ru — по косвенным данным сильнейшие «дешёвые» на русском — Qwen3.x-крупные и GLM-5.x, а Claude/GPT — премиум-эскалация; (3) судья — Gemini Pro (WMT25 en→ru) или панель из чужих семейств. Всё это — гипотезы уровня «косвенно подтверждено», пилот обязателен.
---
## 3. Метрики для ru-таргета
- **CometKiwi** (reference-free QE): [wmt22-cometkiwi-da](https://huggingface.co/Unbabel/wmt22-cometkiwi-da) на InfoXLM и [wmt23-cometkiwi-da-xxl](https://huggingface.co/Unbabel/wmt23-cometkiwi-da-xxl) на XLM-R XXL — ru, zh, ja входят в покрытие (90+ языков). Лицензия CC-BY-NC — для внутреннего eval ок.
- **xCOMET-XL/XXL** (3.5B/10.7B): скор + error spans, мультиязычный (XLM-R), референсный и безреференсный режимы ([TACL](https://direct.mit.edu/tacl/article/doi/10.1162/tacl_a_00683/124263/), [Unbabel/COMET](https://github.com/Unbabel/COMET)). XL запускается на 8GB VRAM в fp16 с оффлоадом (медленно) или на CPU/32GB RAM.
- **GEMBA / GEMBA-MQM**: оригинальная GEMBA валидировалась в т.ч. на en→ru ([arXiv:2302.14520](https://arxiv.org/abs/2302.14520)); GEMBA-MQM — языконезависимый 3-shot промпт с error spans ([arXiv:2310.13988](https://arxiv.org/abs/2310.13988)). Для ru-таргета применим без модификаций.
- **BlonDe** ([arXiv:2103.11878](https://arxiv.org/abs/2103.11878)): дискурсивные категории (имена, времена, род, эллипсис) построены на zh→en BWB; **на ru «из коробки» не работает** — нужен порт на русскую морфологию (pymorphy/Natasha), зато в русском род/вид глагола дают даже больше сигнала. Реализовать свой «BlonDe-ru» как набор детерминированных проверок — дёшево.
- **Чего метрики не решают:** на литтекстах автометрики отличают HT от MT ≤20% случаев ([LitEval, arXiv:2410.18697](https://arxiv.org/html/2410.18697v1)), а в LAIT-исследовании они не согласуются с предпочтениями читателей ([2606.26040](https://arxiv.org/html/2606.26040v1)). WMT24 для zh→ru использовал только d-BLEU — и это антипример. **Решающая метрика пилота — попарные сравнения (LLM-панель + человеческий BWS), автометрики — только телеметрия и фильтры.**
---
## 4. Selection vs iterative refinement: состояние на июль 2026
Свод свидетельств по обе стороны (перевод-специфичных):
**За refinement (черновик→редактор):**
- [arXiv:2605.13368](https://arxiv.org/abs/2605.13368) (Amazon, май 2026; 9 моделей, 7 языковых пар, доклевел литперевод): «document-level MT followed by **segment-level refinement** yields strong and stable improvements»; doc-level refinement целиком — мало правок и нестабильно; **простой общий промпт редактуры стабильно лучше error-specific**; человеческая оценка: прирост в fluency/style/terminology, не в adequacy; refinement «проецирует выход в распределение рефайнера». Состав пар (есть ли ru/zh/ja) — уточнить по полному тексту (не проверено).
- TEaR ([arXiv:2402.16379](https://arxiv.org/abs/2402.16379)): систематический self-refine (Translate→Estimate→Refine) улучшает MT; слепые «улучши перевод» итерации без диагностики — почти не работают.
- Наша cost-модель (doc 09): draft→editor ≈ 2 output-прохода, дёшево и кэшируемо.
**За selection (N кандидатов→судья):**
- [arXiv:2603.20324](https://arxiv.org/abs/2603.20324): WR 0.929 у mixed-capability команды с судьёй при стоимости 1.0x — но **среди 42 задач нет перевода** (признано в doc 03).
- MBR/QE-реранкинг: sMBR ([arXiv:2406.11632](https://arxiv.org/abs/2406.11632), ACL 2025) обходит QE-rerank и классический MBR; известна метрик-предвзятость MBR (галлюцинации метрики-утилиты, [arXiv:2411.03524](https://arxiv.org/pdf/2411.03524)) — на литтекстах, где метрики слабы (LitEval), MBR-селекция по автометрике рискованна.
**За синтез/гибрид (против чистой селекции):**
- **Fusion-of-N** ([arXiv:2510.00931](https://arxiv.org/abs/2510.00931), Cohere, окт 2025): судья-СИНТЕЗАТОР обыгрывает Best-of-N на 11 языках и 3 задачах, включая MT, и на test-time scaling, и на дистилляции. Прямо противоречит переносу «synthesis проигрывает селекции» из 2603.20324 на перевод.
- QE-fusion ([arXiv:2401.06688](https://arxiv.org/pdf/2401.06688)): комбинирование фрагментов гипотез по QE-сигналу лучше реранкинга.
- GenTranslate ([arXiv:2402.06894](https://arxiv.org/abs/2402.06894)): дообученный синтезатор из N-best бьёт SOTA.
**Итог:** в переводном домене свидетельства скорее в пользу «draft→segment-level editor» и гибридов «select/fuse затем refine», чем чистого generate-then-select; но НИ ОДНА работа не сравнивала эти архитектуры на литературном ru-таргете. Пробел закрывается только пилотом.
---
## 5. Дизайн пилотного эксперимента
**Цель:** выбрать архитектуру MVP (и пары моделей) по критерию «человеческое предпочтение на zh→ru/ja→ru за $/главу», до написания продакшен-кода.
### 5.1 Данные (готовим 1 неделю)
| Набор | Состав | Роль |
|---|---|---|
| A. zh→ru приватный | 5 вебновелл × 23 главы с **официальным ru-переводом** (АСТ/Комильфо и др.), ~50K токенов zh | основной eval, «человеческий якорь» |
| B. ja→ru приватный | 45 ранобэ × 2 главы с официальным ru-переводом (Истари/XL Media), ~40K токенов ja | основной eval |
| C. GuoFeng V2 test | 13 глав zh-ru (регистрация, non-commercial) | dev/отладка промптов, НЕ финальный отчёт |
| D. en→ru | 34 фрагмента совр. жанровой прозы с изданным переводом, ~20K токенов | дешёвый sanity |
| Всего | ~2535 глав, ~150200K токенов исходников | |
Подготовка: выравнивание по сценам (13K токенов), общий глоссарий на книгу (имена/термины) строится один раз и подаётся во все конфигурации одинаково — изолируем эффект архитектуры от эффекта памяти.
### 5.2 Конфигурации (4 руки)
- **C0 (baseline):** один doc-level проход DeepSeek V4 Flash, T≈0.3, с глоссарием. Второй бейзлайн C0': Gemini Flash (западная дешёвая) — по тем же входам.
- **C1 (draft→editor):** черновик DeepSeek V4 Flash → **segment-level редактор** GLM-5 или Kimi K2.6 с общим (не error-specific) промптом редактуры по чек-листу Галь (doc 07) → дешёвый судья-гейт (CometKiwi + POLLUX-judge-7B локально) → флагованные сегменты (~1015%) эскалируются на Claude Sonnet. Точно по выводам 2605.13368.
- **C2 (generate-then-select):** 3 разнородных черновика (DeepSeek V4 Flash T0.7, Qwen3.7, Gemini Flash) → судья-селектор Gemini Pro (batch), попарно с BradleyTerry, cross-candidate промпт → победитель без правок. Точно по 2603.20324.
- **C3 (гибрид select-then-refine):** победитель C2 → тот же segment-level редактор, что в C1. (Опционально C3': Fusion-of-N — судья-синтезатор вместо селектора, если бюджет позволит.)
Фиксируем: одинаковый глоссарий, чанкование, число вызовов логируем, все дорогие вызовы — batch.
### 5.3 Метрики и объём
- **Первичная:** anchored pairwise сравнения конфигураций (протокол JP-TL-Bench): панель LLM-судей из семейств, не участвующих в пайплайнах-кандидатах (GPT-5.x + Claude + Gemini Pro, большинство голосов), плюс якорь — официальный человеческий перевод. **~300 попарных чанк-сравнений на пару конфигураций** → биномиальный тест обнаруживает разницу WR ≥8 п.п. при α=0.05, power≈0.8.
- **Человеческая:** BWS/попарные сравнения 23 русскоязычными редакторами на стратифицированной подвыборке **100150 пар** для топ-2 конфигураций + якорь HT (методика LAIT: пристальное чтение пар фрагментов). Это главный критерий решения.
- **Вторичные (телеметрия):** xCOMET-XL error spans, CometKiwi; скрипт консистентности глоссария; **детектор CJK-артефактов** (обязателен: 7/18 моделей грешат) и морфодетектор канцелярита (doc 07); доля отказов/цензурных срывов на 18+ фрагментах (заложить 23 таких главы).
- Отчёт: WR с доверительными интервалами (bootstrap по книгам, не только по чанкам — кластеризация внутри книги), $/глава и латентность на конфигурацию.
### 5.4 Бюджет и сроки
- API: 200K токенов исходника × 4 конфигурации; по тарифам doc 09 (DeepSeek V4 Flash $0.14/$0.28; Gemini Pro-судья $2/$12 batch→50%): C0≈$0.5, C1≈$1.52, C2≈$35, C3≈$46, панель судей ≈$1020. **Итого API < $50.**
- Люди: 2040 ч редакторов (≈$300800 на фрилансе) — главная статья затрат и главный источник достоверности.
- Сроки: 1 нед. данные + 1 нед. прогоны/судейство + 35 дней человеческая оценка и анализ.
### 5.5 Критерии решения
1. Если WR(C2 или C3 vs C1) < +5 п.п. по человеческой оценке → **берём C1** (draft→editor): она в 23 раза дешевле и проще в инкрементальной доработке.
2. Если C3 > C1 и C3 > C2 значимо → гибрид: селекция на «трудных» сегментах (по сигналу судьи-гейта), редактура везде.
3. Отсекающие условия для любых конфигураций: CJK-артефакты >0.1% сегментов после пайплайна; консистентность глоссария <98%; провал 18+ фрагментов у провайдера модель вылетает из роли.
4. Побочный выход пилота: калиброванный порог судьи-гейта (какой % сегментов эскалировать) прямой вход в cost-модель doc 09.
---
## Выводы для TextMachine
1. **Ставку «WR 0.929 ⇒ selection лучший для перевода» считать недоказанной.** Переводная литература 20252026 (FusioN, Amazon-refinement, QE-fusion) склоняет к «draft segment-level editor» и гибридам; чистый generate-then-select дороже (3× черновиков + судья) без доказанного выигрыша на литтексте. До пилота проектировать интерфейсы пайплайна так, чтобы обе топологии были конфигурацией, а не кодом.
2. **Редактор важнее черновика.** Refinement тянет текст в распределение модели-редактора позицию редактора отдаём сильнейшей по русскому стилю модели пула (по косвенным данным: Qwen3.x-крупный / GLM-5.x; эскалация Sonnet), а черновик оптимизируем только по цене и верности (DeepSeek подтверждён DITING на вебновеллах zhen).
3. **GuoFeng V2 zh-ru использовать как dev, не как gold**: референсы пост-эдит GPT-4, лицензия некоммерческая. Художественный эталон строим сами из лицензионных изданий (приватно, без публикации текстов).
4. **ja→ru — полностью слепая зона** (нет ни корпусов, ни лидербордов с ru-таргетом): пилотная ja-часть на официальных изданиях ранобэ обязательна; параллельно снять ручной срез Nejumi 4 (категория «перевод») и Swallow.
5. **Обязательные детерминированные фильтры ru-выхода** до всякого судейства: CJK-артефакты (7/18 моделей!), кальки/канцелярит (морфология), консистентность глоссария. Дёшево и снимает главные позоры дешёвых моделей.
6. **Решающая оценка — только попарная** (LLM-панель чужих семейств + человеческий BWS); d-BLEU/COMET телеметрия. Порт BlonDe на русскую морфологию маленький и ценный внутренний актив.
7. POLLUX-judge 7B кандидат в **локальный** дешёвый судья-гейт на GPU 8GB (квант) снижает COGS гейта до нуля.
8. Пилот стоит <$50 API + оплата редакторов и закрывает самый большой технический риск MVP; до его результатов не фиксировать в коде ни архитектуру, ни состав моделей.
## Открытые вопросы
- Состав 7 языковых пар в arXiv:2605.13368 (есть ли CJK/ru) вытащить из полного текста.
- Актуальный топ Nejumi 4 / Swallow по подзадаче перевода (JS-дашборды, нужен ручной срез).
- Действующий состав/цены моделей на июль 2026 (DeepSeek V4 Flash/Pro, Qwen3.7, GLM-5, Kimi K2.6, Gemini 3.x, GPT-5.4-mini) сверить в момент запуска пилота (см. doc 09, депрекации имён).
- Продолжится ли WMT Literary в 2026 и добавят ли человеческую оценку zhru.
- Юридическая рамка приватного eval на лицензионных изданиях в РФ (TDM/цитирование) уточнить у юриста (связ. doc 08).
## Источники
- GuoFeng Webnovel: https://github.com/longyuewangdcu/GuoFeng-Webnovel ; WMT24 Findings: https://arxiv.org/abs/2412.11732 (html: https://arxiv.org/html/2412.11732v1) ; задача: https://www2.statmt.org/wmt24/literary-translation-task.html ; NovelTrans: https://aclanthology.org/2024.wmt-1.98/
- WMT25 General MT: https://machinetranslate.org/wmt25
- LAIT / ридерское исследование: https://arxiv.org/html/2606.26040v1 ; https://arxiv.org/pdf/2605.15282
- Refinement (Amazon, 2026): https://arxiv.org/abs/2605.13368 ; TEaR: https://arxiv.org/abs/2402.16379 ; post-edit с аннотациями ошибок: https://arxiv.org/html/2404.07851v1
- Selection/synthesis: When Agents Disagree: https://arxiv.org/abs/2603.20324 ; Fusion-of-N: https://arxiv.org/abs/2510.00931 ; QE-fusion: https://arxiv.org/pdf/2401.06688 ; GenTranslate: https://arxiv.org/abs/2402.06894 ; sMBR: https://arxiv.org/abs/2406.11632 ; MBR bias: https://arxiv.org/pdf/2411.03524
- DITING (вебновеллы zhen): https://arxiv.org/abs/2510.09116
- Модели на ru: https://habr.com/ru/articles/1021388/ ; MERA: https://mera.a-ai.ru/ru/text ; llmarena: https://llmarena.ru/ ; POLLUX: https://arxiv.org/abs/2505.24616 , https://github.com/ai-forever/POLLUX ; BenchLM zh: https://benchlm.ai/blog/posts/best-chinese-llm
- ja: VNTL: https://huggingface.co/datasets/lmg-anon/vntl-leaderboard , https://github.com/lmg-anon/vntl-benchmark ; JP-TL-Bench: https://arxiv.org/pdf/2601.00223 ; Nejumi 4: https://nejumi.ai/ , https://wandb.ai/llm-leaderboard/nejumi-leaderboard4 ; Swallow: https://swallow-llm.github.io/leaderboard/about.en.html
- Метрики: CometKiwi: https://huggingface.co/Unbabel/wmt22-cometkiwi-da , https://huggingface.co/Unbabel/wmt23-cometkiwi-da-xxl ; xCOMET: https://direct.mit.edu/tacl/article/doi/10.1162/tacl_a_00683/124263/ , https://github.com/Unbabel/COMET ; GEMBA: https://arxiv.org/abs/2302.14520 ; GEMBA-MQM: https://arxiv.org/abs/2310.13988 ; BlonDe: https://arxiv.org/abs/2103.11878 ; LitEval: https://arxiv.org/html/2410.18697v1
- ru-zh корпус НКРЯ: https://ruzhcorp.ruscorpora.ru/ ; SemEval-2026 tasks: https://semeval.github.io/SemEval2026/tasks.html