TextMachine project repository (AI translation of literary books). Includes: v2 architecture decisions, MVP plan, research 01-12, polygon experiments 01-03, backend-session revalidation verdict (03-implementation-notes.md). Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
36 KiB
11. Gap 3: Валидация ядра архитектуры (selection vs refinement) и моделей на парах zh→ru / ja→ru
Дата: 2026-07-04. Статус: закрытие пробела из doc 03/04/07/09 — свод данных, свидетельств и дизайн пилотного бенчмарка до написания кода MVP.
TL;DR
- Публичной валидации литературного zh→ru не существует. Единственный релевантный трек — WMT24 Literary zh→ru: 2 участника, оценка только автоматическая (d-BLEU), и бейзлайн Google (25.2) обошёл обе поданные системы (22.7 / 21.5). Человеческой оценки литературного zh→ru никто публично не проводил (WMT24 Findings). ja→ru не представлен нигде вообще.
- GuoFeng Webnovel V2 zh-ru реально существует и большой (122 книги, ~20K глав, 23.5M русских слов), но: (а) русские референсы — перевод GPT-4 с человеческим пост-эдитом, т.е. это «золото» уровня MTPE, а не художественный перевод; (б) выравнивания нет; (в) лицензия — только некоммерческие исследования, редистрибуция запрещена (GitHub). Для пилота годится как dev-набор, но НЕ как эталон «художественности».
- Свежая литература 2025–2026 не подтверждает монополию selection. Против «selection > synthesis» из arXiv:2603.20324 (не содержащей перевода) стоят: Fusion-of-N (Cohere) — судья-синтезатор обыгрывает Best-of-N на 11 языках, включая MT (arXiv:2510.00931); систематическое исследование Amazon (май 2026): doc-level перевод + segment-level refinement даёт стабильный прирост, а правки уходят в fluency/style/terminology — ровно наша цель (arXiv:2605.13368). Вопрос «(а) vs (б)» академически ОТКРЫТ — решается только собственным пилотом.
- Ключевой механизм из 2605.13368: refinement «проецирует текст в распределение редактора», а не чинит конкретные ошибки → финальный стиль задаёт МОДЕЛЬ-РЕДАКТОР, а не черновик. Следствие: дешевизна черновика почти не важна, вкладываться нужно в лучшую «русскую» модель на позиции редактора/стилиста.
- Прямых свидетельств качества кандидатов на русском литературном выходе нет ни в одном бенчмарке. Косвенные: WMT25 en→ru выиграл Gemini 2.5 Pro (machinetranslate.org/wmt25); в независимом ru-тесте генерации длинных текстов (Хабр, 18 моделей) топ: GPT-5.4 (97), Claude Opus/Sonnet (96/95), Qwen3.6+ (94), GLM-5.1 (91), а 7 из 18 моделей вставляли иероглифы в русский текст (habr); на вебновеллах zh→en лучшим по верности и стилю признан DeepSeek-V3, китайские модели обходят более крупные западные (DITING, arXiv:2510.09116). MERA/llmarena/POLLUX задач литперевода не содержат.
- Метрики для ru-таргета есть, но только как вспомогательные: CometKiwi/xCOMET покрывают ru/zh/ja (XLM-R/InfoXLM, 90+ языков); GEMBA изначально тестировалась в т.ч. на en→ru, промпт GEMBA-MQM языконезависим; BlonDe заточена под zh→en (BWB) и требует портирования на русскую морфологию. Решающая метрика пилота — попарный LLM-судья + человеческий BWS: автометрики отличают человеческий перевод от MT ≤20% случаев (LitEval).
- Потолок реалистичен, но не достигнут: свежее ридерское исследование (июнь 2026, LAIT): агентный MT-пайплайн читатели не отличают от человека вслепую (17/30 угадываний), но при пристальном сравнении предпочитают человеческий перевод в 522 из 772 фрагментов (arXiv:2606.26040). Гипотеза «SemEval-2026 Task 8 — про перевод» опровергнута: Task 8 = MTRAGEval (RAG), MT-задач в SemEval-2026 нет (tasks).
- Пилот реализуем за ~2–3 недели и <$50 API + 20–40 ч редакторского времени: 4 конфигурации (baseline / draft→editor / generate-then-select / гибрид select-then-refine) на ~200K токенов исходников zh/ja/en с приватными эталонами из лицензионных изданий. Дизайн — в разделе 5.
1. Данные для пилотного бенчмарка
1.1 GuoFeng Webnovel V2 (zh→ru) — проверено
Состав (GitHub longyuewangdcu/GuoFeng-Webnovel, WMT24 Findings):
- zh-ru: 122 книги, ~19 971 глава, 23.5M русских слов / 39M китайских иероглифов; уровень документа, БЕЗ пофразового выравнивания (в отличие от zh-en V1).
- Официальный тест WMT24 zh-ru: 13 глав, 15.6K слов — крошечный.
- Происхождение русской стороны: китайские вебновеллы переведены GPT-4 на уровне документа, затем человеческий пост-эдит/ревью. Это критично: референс несёт «акцент» GPT-4, и метрики с таким референсом будут штрафовать более смелые художественные решения.
- Лицензия: copyright Tencent AI Lab + China Literature Ltd.; доступ по регистрационной форме; только некоммерческое исследование, модификация и редистрибуция запрещены. Для внутреннего пилота — приемлемо; встраивать в коммерческий продукт/обучение — нельзя.
Вывод: GuoFeng V2 — тренировочно-отладочный материал и источник согласованной терминологии жанров, но «золотом художественности» для zh→ru быть не может.
1.2 WMT: что реально было по нашим парам
- WMT24 Literary zh→ru: участвовали только NLP2CT-UM (d-BLEU 22.7) и SJTU-LoveFiction (21.5); бейзлайн Google — 25.2; из-за 2 участников человеческой оценки не проводили (Findings). Т.е. лучший публичный результат литературного zh→ru — ниже Google Translate по d-BLEU (сам d-BLEU на литтексте малоинформативен, что признают организаторы).
- WMT25 General MT: en→ru присутствует (оценка людьми, протокол ESA); победитель unconstrained — Gemini 2.5 Pro (топ-кластер в 14/15 пар), constrained — Shy-hunyuan-MT; zh→ru и ja→ru отсутствуют; человеческие референсы попали в кластер победителей лишь в 6/15 пар (machinetranslate.org/wmt25). Продолжение литературного трека в 2025–2026 не найдено (не проверено — сайт statmt по WMT26 не даёт списка).
1.3 LAIT — свежий ридерский датасет литперевода (fr/pl/ja→en)
Из пары статей июня 2026 (reader study, arXiv:2606.26040; Fluency and Faithfulness, arXiv:2605.15282):
- 31 отрывок-открытие романов (~8K слов каждый), fr/pl/ja→en; 1K комментариев читателей, 2K суждений, 7.2K span-аннотаций; dev-набор: 1.7K выровненных абзацев по 5 MT-пайплайнам.
- Сравнивался агентный многошаговый LLM-пайплайн против опубликованного человеческого перевода: вслепую читатели не отличают (17/30), при чтении с полным погружением предпочтение HT — 19/30 отрывков, при попарном пристальном чтении — 522/772 фрагментов за человека; автометрики с предпочтениями читателей не коррелируют.
- Для нас: готовая методология (immersive reading + chunk-pair comparison) и ja→en-часть как прокси для ja-исходника; ru-таргета нет.
1.4 ja-ресурсы: VNTL, JP-TL-Bench
- VNTL Leaderboard — перевод японских визуальных новелл в en: 256 пар, ранжирование по косинусной близости эмбеддингов (chrF справочно) (HF dataset, GitHub). Методологически слабый (сами авторы признают), но это единственный лидерборд именно по художественному ja-диалоговому тексту; его данные/промпты переиспользуемы для нашего ja-пилота. ru-таргета нет.
- JP-TL-Bench (arXiv:2601.00223, янв 2026) — двунаправленный ja↔en бенчмарк с anchored pairwise LLM-оценкой (Bradley–Terry, референс как якорь) — готовый шаблон протокола судьи для нашего пилота (не литературный домен).
- Nejumi Leaderboard 4 (W&B Japan): включает категорию «перевод» среди подзадач, обновление 28.04.2026; конкретный топ по переводу из статического HTML не извлекается — нужен ручной срез с nejumi.ai (не проверено). Swallow Leaderboard — аналогично.
1.5 Параллельные ru-корпуса художественных текстов
- Русско-китайский параллельный корпус НКРЯ (ruzhcorp.ruscorpora.ru): >1000 текстов, в основном классика XIX–XXI вв. и новости; единственный развиваемый в РФ ru-zh корпус. Жанрово далёк от вебновелл — годится для вспомогательной проверки (термины, идиомы), не для основного eval. Публичного ja-ru литературного корпуса не найдено.
- Лицензионные издания как приватный eval (главный ресурс): официальные русские издания вебновелл/ранобэ — АСТ/Freedom и Комильфо (Мосян Тунсю и др. zh-новеллы), Истари Комикс, XL Media, Alt Graph (ja-ранобэ). Оригинал + официальный перевод выравниваются по главам/сценам вручную (13–20 глав достаточно). Юридически: внутреннее использование купленных копий для приватной оценки без публикации текстов — низкорисковое (см. doc 08); публиковать можно только агрегированные метрики. (не проверено: позиция правообладателей по TDM-исключениям в РФ)
- Фан-переводы (tl.rulate.ru, ranobelib) — большой объём, но нестабильное качество и правовой статус; использовать только как «нижний якорь» качества в BWS, не как референс.
2. Свидетельства качества кандидатов: ru-выход и ja-исходник
Прямых публичных оценок «литературный перевод на русский» нет ни для одной модели-кандидата. Что есть:
| Источник | Что меряет | Результат для нашего стека |
|---|---|---|
| WMT25 General | en→ru, документы, ESA-люди | Gemini 2.5 Pro — топ; линия Gemini Pro — обоснованный судья/эскалация |
| Хабр: 18 моделей, ru-контент (2026) | длинные ru-тексты, судья Opus 4.6 | GPT-5.4 97 > Opus 4.6 96* > Sonnet 4.6 95* > Qwen3.6+ 94 > GPT-5.2 93 > GLM-5.1 91; Qwen3-235B: 88/100 при цене в ~130 раз ниже GPT-5.4. 7/18 моделей вставляют CJK-иероглифы в русский текст |
| DITING (18K экспертных аннотаций) | вебновеллы zh→en, 6 измерений (идиомы, полисемия, локализация терминов, времена, нулевые местоимения, культурная безопасность) | DeepSeek-V3 — самый верный и стилистически связный; китайские LLM обходят более крупные западные; AgentEval (мультиагентный судья) — лучшая корреляция с людьми из 7 метрик |
| BenchLM zh-лидерборд (июнь 2026) | китайский язык в целом | DeepSeek V4 Pro 87 > GLM-5.1 83 > Kimi K2.6 / GLM-5 81 > Qwen3.5 79 |
| MERA / llmarena.ru / POLLUX | ru-задачи / Elo / 35 генеративных типов | литперевода нет; POLLUX даёт открытые ru-судейские модели 7B/32B с критериальной оценкой — кандидат в дешёвый локальный судья-фильтр (влезает в 8GB VRAM в кванте — 7B) |
| Nejumi 4 / Swallow | ja-задачи, вкл. перевод | срез не снят (JS-дашборд), задача на пилот (не проверено) |
Интерпретация для стека: (1) черновик zh→ru — DeepSeek/Qwen оправданы доменом (DITING) и ценой, но их ru-выход требует обязательного детектора CJK-артефактов и калек; (2) редактор ru — по косвенным данным сильнейшие «дешёвые» на русском — Qwen3.x-крупные и GLM-5.x, а Claude/GPT — премиум-эскалация; (3) судья — Gemini Pro (WMT25 en→ru) или панель из чужих семейств. Всё это — гипотезы уровня «косвенно подтверждено», пилот обязателен.
3. Метрики для ru-таргета
- CometKiwi (reference-free QE): wmt22-cometkiwi-da на InfoXLM и wmt23-cometkiwi-da-xxl на XLM-R XXL — ru, zh, ja входят в покрытие (90+ языков). Лицензия CC-BY-NC — для внутреннего eval ок.
- xCOMET-XL/XXL (3.5B/10.7B): скор + error spans, мультиязычный (XLM-R), референсный и безреференсный режимы (TACL, Unbabel/COMET). XL запускается на 8GB VRAM в fp16 с оффлоадом (медленно) или на CPU/32GB RAM.
- GEMBA / GEMBA-MQM: оригинальная GEMBA валидировалась в т.ч. на en→ru (arXiv:2302.14520); GEMBA-MQM — языконезависимый 3-shot промпт с error spans (arXiv:2310.13988). Для ru-таргета применим без модификаций.
- BlonDe (arXiv:2103.11878): дискурсивные категории (имена, времена, род, эллипсис) построены на zh→en BWB; на ru «из коробки» не работает — нужен порт на русскую морфологию (pymorphy/Natasha), зато в русском род/вид глагола дают даже больше сигнала. Реализовать свой «BlonDe-ru» как набор детерминированных проверок — дёшево.
- Чего метрики не решают: на литтекстах автометрики отличают HT от MT ≤20% случаев (LitEval, arXiv:2410.18697), а в LAIT-исследовании они не согласуются с предпочтениями читателей (2606.26040). WMT24 для zh→ru использовал только d-BLEU — и это антипример. Решающая метрика пилота — попарные сравнения (LLM-панель + человеческий BWS), автометрики — только телеметрия и фильтры.
4. Selection vs iterative refinement: состояние на июль 2026
Свод свидетельств по обе стороны (перевод-специфичных):
За refinement (черновик→редактор):
- arXiv:2605.13368 (Amazon, май 2026; 9 моделей, 7 языковых пар, доклевел литперевод): «document-level MT followed by segment-level refinement yields strong and stable improvements»; doc-level refinement целиком — мало правок и нестабильно; простой общий промпт редактуры стабильно лучше error-specific; человеческая оценка: прирост в fluency/style/terminology, не в adequacy; refinement «проецирует выход в распределение рефайнера». Состав пар (есть ли ru/zh/ja) — уточнить по полному тексту (не проверено).
- TEaR (arXiv:2402.16379): систематический self-refine (Translate→Estimate→Refine) улучшает MT; слепые «улучши перевод» итерации без диагностики — почти не работают.
- Наша cost-модель (doc 09): draft→editor ≈ 2 output-прохода, дёшево и кэшируемо.
За selection (N кандидатов→судья):
- arXiv:2603.20324: WR 0.929 у mixed-capability команды с судьёй при стоимости 1.0x — но среди 42 задач нет перевода (признано в doc 03).
- MBR/QE-реранкинг: sMBR (arXiv:2406.11632, ACL 2025) обходит QE-rerank и классический MBR; известна метрик-предвзятость MBR (галлюцинации метрики-утилиты, arXiv:2411.03524) — на литтекстах, где метрики слабы (LitEval), MBR-селекция по автометрике рискованна.
За синтез/гибрид (против чистой селекции):
- Fusion-of-N (arXiv:2510.00931, Cohere, окт 2025): судья-СИНТЕЗАТОР обыгрывает Best-of-N на 11 языках и 3 задачах, включая MT, и на test-time scaling, и на дистилляции. Прямо противоречит переносу «synthesis проигрывает селекции» из 2603.20324 на перевод.
- QE-fusion (arXiv:2401.06688): комбинирование фрагментов гипотез по QE-сигналу лучше реранкинга.
- GenTranslate (arXiv:2402.06894): дообученный синтезатор из N-best бьёт SOTA.
Итог: в переводном домене свидетельства скорее в пользу «draft→segment-level editor» и гибридов «select/fuse затем refine», чем чистого generate-then-select; но НИ ОДНА работа не сравнивала эти архитектуры на литературном ru-таргете. Пробел закрывается только пилотом.
5. Дизайн пилотного эксперимента
Цель: выбрать архитектуру MVP (и пары моделей) по критерию «человеческое предпочтение на zh→ru/ja→ru за $/главу», до написания продакшен-кода.
5.1 Данные (готовим 1 неделю)
| Набор | Состав | Роль |
|---|---|---|
| A. zh→ru приватный | 5 вебновелл × 2–3 главы с официальным ru-переводом (АСТ/Комильфо и др.), ~50K токенов zh | основной eval, «человеческий якорь» |
| B. ja→ru приватный | 4–5 ранобэ × 2 главы с официальным ru-переводом (Истари/XL Media), ~40K токенов ja | основной eval |
| C. GuoFeng V2 test | 13 глав zh-ru (регистрация, non-commercial) | dev/отладка промптов, НЕ финальный отчёт |
| D. en→ru | 3–4 фрагмента совр. жанровой прозы с изданным переводом, ~20K токенов | дешёвый sanity |
| Всего | ~25–35 глав, ~150–200K токенов исходников |
Подготовка: выравнивание по сценам (1–3K токенов), общий глоссарий на книгу (имена/термины) строится один раз и подаётся во все конфигурации одинаково — изолируем эффект архитектуры от эффекта памяти.
5.2 Конфигурации (4 руки)
- C0 (baseline): один doc-level проход DeepSeek V4 Flash, T≈0.3, с глоссарием. Второй бейзлайн C0': Gemini Flash (западная дешёвая) — по тем же входам.
- C1 (draft→editor): черновик DeepSeek V4 Flash → segment-level редактор GLM-5 или Kimi K2.6 с общим (не error-specific) промптом редактуры по чек-листу Галь (doc 07) → дешёвый судья-гейт (CometKiwi + POLLUX-judge-7B локально) → флагованные сегменты (~10–15%) эскалируются на Claude Sonnet. Точно по выводам 2605.13368.
- C2 (generate-then-select): 3 разнородных черновика (DeepSeek V4 Flash T0.7, Qwen3.7, Gemini Flash) → судья-селектор Gemini Pro (batch), попарно с Bradley–Terry, cross-candidate промпт → победитель без правок. Точно по 2603.20324.
- C3 (гибрид select-then-refine): победитель C2 → тот же segment-level редактор, что в C1. (Опционально C3': Fusion-of-N — судья-синтезатор вместо селектора, если бюджет позволит.)
Фиксируем: одинаковый глоссарий, чанкование, число вызовов логируем, все дорогие вызовы — batch.
5.3 Метрики и объём
- Первичная: anchored pairwise сравнения конфигураций (протокол JP-TL-Bench): панель LLM-судей из семейств, не участвующих в пайплайнах-кандидатах (GPT-5.x + Claude + Gemini Pro, большинство голосов), плюс якорь — официальный человеческий перевод. ~300 попарных чанк-сравнений на пару конфигураций → биномиальный тест обнаруживает разницу WR ≥8 п.п. при α=0.05, power≈0.8.
- Человеческая: BWS/попарные сравнения 2–3 русскоязычными редакторами на стратифицированной подвыборке 100–150 пар для топ-2 конфигураций + якорь HT (методика LAIT: пристальное чтение пар фрагментов). Это главный критерий решения.
- Вторичные (телеметрия): xCOMET-XL error spans, CometKiwi; скрипт консистентности глоссария; детектор CJK-артефактов (обязателен: 7/18 моделей грешат) и морфодетектор канцелярита (doc 07); доля отказов/цензурных срывов на 18+ фрагментах (заложить 2–3 таких главы).
- Отчёт: WR с доверительными интервалами (bootstrap по книгам, не только по чанкам — кластеризация внутри книги), $/глава и латентность на конфигурацию.
5.4 Бюджет и сроки
- API: 200K токенов исходника × 4 конфигурации; по тарифам doc 09 (DeepSeek V4 Flash $0.14/$0.28; Gemini Pro-судья $2/$12 batch→50%): C0≈$0.5, C1≈$1.5–2, C2≈$3–5, C3≈$4–6, панель судей ≈$10–20. Итого API < $50.
- Люди: 20–40 ч редакторов (≈$300–800 на фрилансе) — главная статья затрат и главный источник достоверности.
- Сроки: 1 нед. данные + 1 нед. прогоны/судейство + 3–5 дней человеческая оценка и анализ.
5.5 Критерии решения
- Если WR(C2 или C3 vs C1) < +5 п.п. по человеческой оценке → берём C1 (draft→editor): она в 2–3 раза дешевле и проще в инкрементальной доработке.
- Если C3 > C1 и C3 > C2 значимо → гибрид: селекция на «трудных» сегментах (по сигналу судьи-гейта), редактура везде.
- Отсекающие условия для любых конфигураций: CJK-артефакты >0.1% сегментов после пайплайна; консистентность глоссария <98%; провал 18+ фрагментов у провайдера — модель вылетает из роли.
- Побочный выход пилота: калиброванный порог судьи-гейта (какой % сегментов эскалировать) — прямой вход в cost-модель doc 09.
Выводы для TextMachine
- Ставку «WR 0.929 ⇒ selection лучший для перевода» считать недоказанной. Переводная литература 2025–2026 (FusioN, Amazon-refinement, QE-fusion) склоняет к «draft → segment-level editor» и гибридам; чистый generate-then-select дороже (3× черновиков + судья) без доказанного выигрыша на литтексте. До пилота проектировать интерфейсы пайплайна так, чтобы обе топологии были конфигурацией, а не кодом.
- Редактор важнее черновика. Refinement тянет текст в распределение модели-редактора → позицию редактора отдаём сильнейшей по русскому стилю модели пула (по косвенным данным: Qwen3.x-крупный / GLM-5.x; эскалация — Sonnet), а черновик оптимизируем только по цене и верности (DeepSeek — подтверждён DITING на вебновеллах zh→en).
- GuoFeng V2 zh-ru использовать как dev, не как gold: референсы — пост-эдит GPT-4, лицензия некоммерческая. Художественный эталон строим сами из лицензионных изданий (приватно, без публикации текстов).
- ja→ru — полностью слепая зона (нет ни корпусов, ни лидербордов с ru-таргетом): пилотная ja-часть на официальных изданиях ранобэ обязательна; параллельно снять ручной срез Nejumi 4 (категория «перевод») и Swallow.
- Обязательные детерминированные фильтры ru-выхода до всякого судейства: CJK-артефакты (7/18 моделей!), кальки/канцелярит (морфология), консистентность глоссария. Дёшево и снимает главные позоры дешёвых моделей.
- Решающая оценка — только попарная (LLM-панель чужих семейств + человеческий BWS); d-BLEU/COMET — телеметрия. Порт BlonDe на русскую морфологию — маленький и ценный внутренний актив.
- POLLUX-judge 7B — кандидат в локальный дешёвый судья-гейт на GPU 8GB (квант) — снижает COGS гейта до нуля.
- Пилот стоит <$50 API + оплата редакторов и закрывает самый большой технический риск MVP; до его результатов не фиксировать в коде ни архитектуру, ни состав моделей.
Открытые вопросы
- Состав 7 языковых пар в arXiv:2605.13368 (есть ли CJK/ru) — вытащить из полного текста.
- Актуальный топ Nejumi 4 / Swallow по подзадаче перевода (JS-дашборды, нужен ручной срез).
- Действующий состав/цены моделей на июль 2026 (DeepSeek V4 Flash/Pro, Qwen3.7, GLM-5, Kimi K2.6, Gemini 3.x, GPT-5.4-mini) — сверить в момент запуска пилота (см. doc 09, депрекации имён).
- Продолжится ли WMT Literary в 2026 и добавят ли человеческую оценку zh→ru.
- Юридическая рамка приватного eval на лицензионных изданиях в РФ (TDM/цитирование) — уточнить у юриста (связ. doc 08).
Источники
- GuoFeng Webnovel: https://github.com/longyuewangdcu/GuoFeng-Webnovel ; WMT24 Findings: https://arxiv.org/abs/2412.11732 (html: https://arxiv.org/html/2412.11732v1) ; задача: https://www2.statmt.org/wmt24/literary-translation-task.html ; NovelTrans: https://aclanthology.org/2024.wmt-1.98/
- WMT25 General MT: https://machinetranslate.org/wmt25
- LAIT / ридерское исследование: https://arxiv.org/html/2606.26040v1 ; https://arxiv.org/pdf/2605.15282
- Refinement (Amazon, 2026): https://arxiv.org/abs/2605.13368 ; TEaR: https://arxiv.org/abs/2402.16379 ; post-edit с аннотациями ошибок: https://arxiv.org/html/2404.07851v1
- Selection/synthesis: When Agents Disagree: https://arxiv.org/abs/2603.20324 ; Fusion-of-N: https://arxiv.org/abs/2510.00931 ; QE-fusion: https://arxiv.org/pdf/2401.06688 ; GenTranslate: https://arxiv.org/abs/2402.06894 ; sMBR: https://arxiv.org/abs/2406.11632 ; MBR bias: https://arxiv.org/pdf/2411.03524
- DITING (вебновеллы zh→en): https://arxiv.org/abs/2510.09116
- Модели на ru: https://habr.com/ru/articles/1021388/ ; MERA: https://mera.a-ai.ru/ru/text ; llmarena: https://llmarena.ru/ ; POLLUX: https://arxiv.org/abs/2505.24616 , https://github.com/ai-forever/POLLUX ; BenchLM zh: https://benchlm.ai/blog/posts/best-chinese-llm
- ja: VNTL: https://huggingface.co/datasets/lmg-anon/vntl-leaderboard , https://github.com/lmg-anon/vntl-benchmark ; JP-TL-Bench: https://arxiv.org/pdf/2601.00223 ; Nejumi 4: https://nejumi.ai/ , https://wandb.ai/llm-leaderboard/nejumi-leaderboard4 ; Swallow: https://swallow-llm.github.io/leaderboard/about.en.html
- Метрики: CometKiwi: https://huggingface.co/Unbabel/wmt22-cometkiwi-da , https://huggingface.co/Unbabel/wmt23-cometkiwi-da-xxl ; xCOMET: https://direct.mit.edu/tacl/article/doi/10.1162/tacl_a_00683/124263/ , https://github.com/Unbabel/COMET ; GEMBA: https://arxiv.org/abs/2302.14520 ; GEMBA-MQM: https://arxiv.org/abs/2310.13988 ; BlonDe: https://arxiv.org/abs/2103.11878 ; LitEval: https://arxiv.org/html/2410.18697v1
- ru-zh корпус НКРЯ: https://ruzhcorp.ruscorpora.ru/ ; SemEval-2026 tasks: https://semeval.github.io/SemEval2026/tasks.html