textmachine/docs/research/11-gap-3.md
Claude (backend session) 9bb00d49f2 Initial commit: documentation, eval polygon, backend step 0 verdict
TextMachine project repository (AI translation of literary books).
Includes: v2 architecture decisions, MVP plan, research 01-12,
polygon experiments 01-03, backend-session revalidation verdict
(03-implementation-notes.md).

Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
2026-07-04 06:50:59 +03:00

36 KiB
Raw Permalink Blame History

11. Gap 3: Валидация ядра архитектуры (selection vs refinement) и моделей на парах zh→ru / ja→ru

Дата: 2026-07-04. Статус: закрытие пробела из doc 03/04/07/09 — свод данных, свидетельств и дизайн пилотного бенчмарка до написания кода MVP.

TL;DR

  1. Публичной валидации литературного zh→ru не существует. Единственный релевантный трек — WMT24 Literary zh→ru: 2 участника, оценка только автоматическая (d-BLEU), и бейзлайн Google (25.2) обошёл обе поданные системы (22.7 / 21.5). Человеческой оценки литературного zh→ru никто публично не проводил (WMT24 Findings). ja→ru не представлен нигде вообще.
  2. GuoFeng Webnovel V2 zh-ru реально существует и большой (122 книги, ~20K глав, 23.5M русских слов), но: (а) русские референсы — перевод GPT-4 с человеческим пост-эдитом, т.е. это «золото» уровня MTPE, а не художественный перевод; (б) выравнивания нет; (в) лицензия — только некоммерческие исследования, редистрибуция запрещена (GitHub). Для пилота годится как dev-набор, но НЕ как эталон «художественности».
  3. Свежая литература 20252026 не подтверждает монополию selection. Против «selection > synthesis» из arXiv:2603.20324 (не содержащей перевода) стоят: Fusion-of-N (Cohere) — судья-синтезатор обыгрывает Best-of-N на 11 языках, включая MT (arXiv:2510.00931); систематическое исследование Amazon (май 2026): doc-level перевод + segment-level refinement даёт стабильный прирост, а правки уходят в fluency/style/terminology — ровно наша цель (arXiv:2605.13368). Вопрос «(а) vs (б)» академически ОТКРЫТ — решается только собственным пилотом.
  4. Ключевой механизм из 2605.13368: refinement «проецирует текст в распределение редактора», а не чинит конкретные ошибки → финальный стиль задаёт МОДЕЛЬ-РЕДАКТОР, а не черновик. Следствие: дешевизна черновика почти не важна, вкладываться нужно в лучшую «русскую» модель на позиции редактора/стилиста.
  5. Прямых свидетельств качества кандидатов на русском литературном выходе нет ни в одном бенчмарке. Косвенные: WMT25 en→ru выиграл Gemini 2.5 Pro (machinetranslate.org/wmt25); в независимом ru-тесте генерации длинных текстов (Хабр, 18 моделей) топ: GPT-5.4 (97), Claude Opus/Sonnet (96/95), Qwen3.6+ (94), GLM-5.1 (91), а 7 из 18 моделей вставляли иероглифы в русский текст (habr); на вебновеллах zh→en лучшим по верности и стилю признан DeepSeek-V3, китайские модели обходят более крупные западные (DITING, arXiv:2510.09116). MERA/llmarena/POLLUX задач литперевода не содержат.
  6. Метрики для ru-таргета есть, но только как вспомогательные: CometKiwi/xCOMET покрывают ru/zh/ja (XLM-R/InfoXLM, 90+ языков); GEMBA изначально тестировалась в т.ч. на en→ru, промпт GEMBA-MQM языконезависим; BlonDe заточена под zh→en (BWB) и требует портирования на русскую морфологию. Решающая метрика пилота — попарный LLM-судья + человеческий BWS: автометрики отличают человеческий перевод от MT ≤20% случаев (LitEval).
  7. Потолок реалистичен, но не достигнут: свежее ридерское исследование (июнь 2026, LAIT): агентный MT-пайплайн читатели не отличают от человека вслепую (17/30 угадываний), но при пристальном сравнении предпочитают человеческий перевод в 522 из 772 фрагментов (arXiv:2606.26040). Гипотеза «SemEval-2026 Task 8 — про перевод» опровергнута: Task 8 = MTRAGEval (RAG), MT-задач в SemEval-2026 нет (tasks).
  8. Пилот реализуем за ~23 недели и <$50 API + 2040 ч редакторского времени: 4 конфигурации (baseline / draft→editor / generate-then-select / гибрид select-then-refine) на ~200K токенов исходников zh/ja/en с приватными эталонами из лицензионных изданий. Дизайн — в разделе 5.

1. Данные для пилотного бенчмарка

1.1 GuoFeng Webnovel V2 (zh→ru) — проверено

Состав (GitHub longyuewangdcu/GuoFeng-Webnovel, WMT24 Findings):

  • zh-ru: 122 книги, ~19 971 глава, 23.5M русских слов / 39M китайских иероглифов; уровень документа, БЕЗ пофразового выравнивания (в отличие от zh-en V1).
  • Официальный тест WMT24 zh-ru: 13 глав, 15.6K слов — крошечный.
  • Происхождение русской стороны: китайские вебновеллы переведены GPT-4 на уровне документа, затем человеческий пост-эдит/ревью. Это критично: референс несёт «акцент» GPT-4, и метрики с таким референсом будут штрафовать более смелые художественные решения.
  • Лицензия: copyright Tencent AI Lab + China Literature Ltd.; доступ по регистрационной форме; только некоммерческое исследование, модификация и редистрибуция запрещены. Для внутреннего пилота — приемлемо; встраивать в коммерческий продукт/обучение — нельзя.

Вывод: GuoFeng V2 — тренировочно-отладочный материал и источник согласованной терминологии жанров, но «золотом художественности» для zh→ru быть не может.

1.2 WMT: что реально было по нашим парам

  • WMT24 Literary zh→ru: участвовали только NLP2CT-UM (d-BLEU 22.7) и SJTU-LoveFiction (21.5); бейзлайн Google — 25.2; из-за 2 участников человеческой оценки не проводили (Findings). Т.е. лучший публичный результат литературного zh→ru — ниже Google Translate по d-BLEU (сам d-BLEU на литтексте малоинформативен, что признают организаторы).
  • WMT25 General MT: en→ru присутствует (оценка людьми, протокол ESA); победитель unconstrained — Gemini 2.5 Pro (топ-кластер в 14/15 пар), constrained — Shy-hunyuan-MT; zh→ru и ja→ru отсутствуют; человеческие референсы попали в кластер победителей лишь в 6/15 пар (machinetranslate.org/wmt25). Продолжение литературного трека в 20252026 не найдено (не проверено — сайт statmt по WMT26 не даёт списка).

1.3 LAIT — свежий ридерский датасет литперевода (fr/pl/ja→en)

Из пары статей июня 2026 (reader study, arXiv:2606.26040; Fluency and Faithfulness, arXiv:2605.15282):

  • 31 отрывок-открытие романов (~8K слов каждый), fr/pl/ja→en; 1K комментариев читателей, 2K суждений, 7.2K span-аннотаций; dev-набор: 1.7K выровненных абзацев по 5 MT-пайплайнам.
  • Сравнивался агентный многошаговый LLM-пайплайн против опубликованного человеческого перевода: вслепую читатели не отличают (17/30), при чтении с полным погружением предпочтение HT — 19/30 отрывков, при попарном пристальном чтении — 522/772 фрагментов за человека; автометрики с предпочтениями читателей не коррелируют.
  • Для нас: готовая методология (immersive reading + chunk-pair comparison) и ja→en-часть как прокси для ja-исходника; ru-таргета нет.

1.4 ja-ресурсы: VNTL, JP-TL-Bench

  • VNTL Leaderboard — перевод японских визуальных новелл в en: 256 пар, ранжирование по косинусной близости эмбеддингов (chrF справочно) (HF dataset, GitHub). Методологически слабый (сами авторы признают), но это единственный лидерборд именно по художественному ja-диалоговому тексту; его данные/промпты переиспользуемы для нашего ja-пилота. ru-таргета нет.
  • JP-TL-Bench (arXiv:2601.00223, янв 2026) — двунаправленный ja↔en бенчмарк с anchored pairwise LLM-оценкой (BradleyTerry, референс как якорь) — готовый шаблон протокола судьи для нашего пилота (не литературный домен).
  • Nejumi Leaderboard 4 (W&B Japan): включает категорию «перевод» среди подзадач, обновление 28.04.2026; конкретный топ по переводу из статического HTML не извлекается — нужен ручной срез с nejumi.ai (не проверено). Swallow Leaderboard — аналогично.

1.5 Параллельные ru-корпуса художественных текстов

  • Русско-китайский параллельный корпус НКРЯ (ruzhcorp.ruscorpora.ru): >1000 текстов, в основном классика XIXXXI вв. и новости; единственный развиваемый в РФ ru-zh корпус. Жанрово далёк от вебновелл — годится для вспомогательной проверки (термины, идиомы), не для основного eval. Публичного ja-ru литературного корпуса не найдено.
  • Лицензионные издания как приватный eval (главный ресурс): официальные русские издания вебновелл/ранобэ — АСТ/Freedom и Комильфо (Мосян Тунсю и др. zh-новеллы), Истари Комикс, XL Media, Alt Graph (ja-ранобэ). Оригинал + официальный перевод выравниваются по главам/сценам вручную (1320 глав достаточно). Юридически: внутреннее использование купленных копий для приватной оценки без публикации текстов — низкорисковое (см. doc 08); публиковать можно только агрегированные метрики. (не проверено: позиция правообладателей по TDM-исключениям в РФ)
  • Фан-переводы (tl.rulate.ru, ranobelib) — большой объём, но нестабильное качество и правовой статус; использовать только как «нижний якорь» качества в BWS, не как референс.

2. Свидетельства качества кандидатов: ru-выход и ja-исходник

Прямых публичных оценок «литературный перевод на русский» нет ни для одной модели-кандидата. Что есть:

Источник Что меряет Результат для нашего стека
WMT25 General en→ru, документы, ESA-люди Gemini 2.5 Pro — топ; линия Gemini Pro — обоснованный судья/эскалация
Хабр: 18 моделей, ru-контент (2026) длинные ru-тексты, судья Opus 4.6 GPT-5.4 97 > Opus 4.6 96* > Sonnet 4.6 95* > Qwen3.6+ 94 > GPT-5.2 93 > GLM-5.1 91; Qwen3-235B: 88/100 при цене в ~130 раз ниже GPT-5.4. 7/18 моделей вставляют CJK-иероглифы в русский текст
DITING (18K экспертных аннотаций) вебновеллы zh→en, 6 измерений (идиомы, полисемия, локализация терминов, времена, нулевые местоимения, культурная безопасность) DeepSeek-V3 — самый верный и стилистически связный; китайские LLM обходят более крупные западные; AgentEval (мультиагентный судья) — лучшая корреляция с людьми из 7 метрик
BenchLM zh-лидерборд (июнь 2026) китайский язык в целом DeepSeek V4 Pro 87 > GLM-5.1 83 > Kimi K2.6 / GLM-5 81 > Qwen3.5 79
MERA / llmarena.ru / POLLUX ru-задачи / Elo / 35 генеративных типов литперевода нет; POLLUX даёт открытые ru-судейские модели 7B/32B с критериальной оценкой — кандидат в дешёвый локальный судья-фильтр (влезает в 8GB VRAM в кванте — 7B)
Nejumi 4 / Swallow ja-задачи, вкл. перевод срез не снят (JS-дашборд), задача на пилот (не проверено)

Интерпретация для стека: (1) черновик zh→ru — DeepSeek/Qwen оправданы доменом (DITING) и ценой, но их ru-выход требует обязательного детектора CJK-артефактов и калек; (2) редактор ru — по косвенным данным сильнейшие «дешёвые» на русском — Qwen3.x-крупные и GLM-5.x, а Claude/GPT — премиум-эскалация; (3) судья — Gemini Pro (WMT25 en→ru) или панель из чужих семейств. Всё это — гипотезы уровня «косвенно подтверждено», пилот обязателен.


3. Метрики для ru-таргета

  • CometKiwi (reference-free QE): wmt22-cometkiwi-da на InfoXLM и wmt23-cometkiwi-da-xxl на XLM-R XXL — ru, zh, ja входят в покрытие (90+ языков). Лицензия CC-BY-NC — для внутреннего eval ок.
  • xCOMET-XL/XXL (3.5B/10.7B): скор + error spans, мультиязычный (XLM-R), референсный и безреференсный режимы (TACL, Unbabel/COMET). XL запускается на 8GB VRAM в fp16 с оффлоадом (медленно) или на CPU/32GB RAM.
  • GEMBA / GEMBA-MQM: оригинальная GEMBA валидировалась в т.ч. на en→ru (arXiv:2302.14520); GEMBA-MQM — языконезависимый 3-shot промпт с error spans (arXiv:2310.13988). Для ru-таргета применим без модификаций.
  • BlonDe (arXiv:2103.11878): дискурсивные категории (имена, времена, род, эллипсис) построены на zh→en BWB; на ru «из коробки» не работает — нужен порт на русскую морфологию (pymorphy/Natasha), зато в русском род/вид глагола дают даже больше сигнала. Реализовать свой «BlonDe-ru» как набор детерминированных проверок — дёшево.
  • Чего метрики не решают: на литтекстах автометрики отличают HT от MT ≤20% случаев (LitEval, arXiv:2410.18697), а в LAIT-исследовании они не согласуются с предпочтениями читателей (2606.26040). WMT24 для zh→ru использовал только d-BLEU — и это антипример. Решающая метрика пилота — попарные сравнения (LLM-панель + человеческий BWS), автометрики — только телеметрия и фильтры.

4. Selection vs iterative refinement: состояние на июль 2026

Свод свидетельств по обе стороны (перевод-специфичных):

За refinement (черновик→редактор):

  • arXiv:2605.13368 (Amazon, май 2026; 9 моделей, 7 языковых пар, доклевел литперевод): «document-level MT followed by segment-level refinement yields strong and stable improvements»; doc-level refinement целиком — мало правок и нестабильно; простой общий промпт редактуры стабильно лучше error-specific; человеческая оценка: прирост в fluency/style/terminology, не в adequacy; refinement «проецирует выход в распределение рефайнера». Состав пар (есть ли ru/zh/ja) — уточнить по полному тексту (не проверено).
  • TEaR (arXiv:2402.16379): систематический self-refine (Translate→Estimate→Refine) улучшает MT; слепые «улучши перевод» итерации без диагностики — почти не работают.
  • Наша cost-модель (doc 09): draft→editor ≈ 2 output-прохода, дёшево и кэшируемо.

За selection (N кандидатов→судья):

  • arXiv:2603.20324: WR 0.929 у mixed-capability команды с судьёй при стоимости 1.0x — но среди 42 задач нет перевода (признано в doc 03).
  • MBR/QE-реранкинг: sMBR (arXiv:2406.11632, ACL 2025) обходит QE-rerank и классический MBR; известна метрик-предвзятость MBR (галлюцинации метрики-утилиты, arXiv:2411.03524) — на литтекстах, где метрики слабы (LitEval), MBR-селекция по автометрике рискованна.

За синтез/гибрид (против чистой селекции):

  • Fusion-of-N (arXiv:2510.00931, Cohere, окт 2025): судья-СИНТЕЗАТОР обыгрывает Best-of-N на 11 языках и 3 задачах, включая MT, и на test-time scaling, и на дистилляции. Прямо противоречит переносу «synthesis проигрывает селекции» из 2603.20324 на перевод.
  • QE-fusion (arXiv:2401.06688): комбинирование фрагментов гипотез по QE-сигналу лучше реранкинга.
  • GenTranslate (arXiv:2402.06894): дообученный синтезатор из N-best бьёт SOTA.

Итог: в переводном домене свидетельства скорее в пользу «draft→segment-level editor» и гибридов «select/fuse затем refine», чем чистого generate-then-select; но НИ ОДНА работа не сравнивала эти архитектуры на литературном ru-таргете. Пробел закрывается только пилотом.


5. Дизайн пилотного эксперимента

Цель: выбрать архитектуру MVP (и пары моделей) по критерию «человеческое предпочтение на zh→ru/ja→ru за $/главу», до написания продакшен-кода.

5.1 Данные (готовим 1 неделю)

Набор Состав Роль
A. zh→ru приватный 5 вебновелл × 23 главы с официальным ru-переводом (АСТ/Комильфо и др.), ~50K токенов zh основной eval, «человеческий якорь»
B. ja→ru приватный 45 ранобэ × 2 главы с официальным ru-переводом (Истари/XL Media), ~40K токенов ja основной eval
C. GuoFeng V2 test 13 глав zh-ru (регистрация, non-commercial) dev/отладка промптов, НЕ финальный отчёт
D. en→ru 34 фрагмента совр. жанровой прозы с изданным переводом, ~20K токенов дешёвый sanity
Всего ~2535 глав, ~150200K токенов исходников

Подготовка: выравнивание по сценам (13K токенов), общий глоссарий на книгу (имена/термины) строится один раз и подаётся во все конфигурации одинаково — изолируем эффект архитектуры от эффекта памяти.

5.2 Конфигурации (4 руки)

  • C0 (baseline): один doc-level проход DeepSeek V4 Flash, T≈0.3, с глоссарием. Второй бейзлайн C0': Gemini Flash (западная дешёвая) — по тем же входам.
  • C1 (draft→editor): черновик DeepSeek V4 Flash → segment-level редактор GLM-5 или Kimi K2.6 с общим (не error-specific) промптом редактуры по чек-листу Галь (doc 07) → дешёвый судья-гейт (CometKiwi + POLLUX-judge-7B локально) → флагованные сегменты (~1015%) эскалируются на Claude Sonnet. Точно по выводам 2605.13368.
  • C2 (generate-then-select): 3 разнородных черновика (DeepSeek V4 Flash T0.7, Qwen3.7, Gemini Flash) → судья-селектор Gemini Pro (batch), попарно с BradleyTerry, cross-candidate промпт → победитель без правок. Точно по 2603.20324.
  • C3 (гибрид select-then-refine): победитель C2 → тот же segment-level редактор, что в C1. (Опционально C3': Fusion-of-N — судья-синтезатор вместо селектора, если бюджет позволит.)

Фиксируем: одинаковый глоссарий, чанкование, число вызовов логируем, все дорогие вызовы — batch.

5.3 Метрики и объём

  • Первичная: anchored pairwise сравнения конфигураций (протокол JP-TL-Bench): панель LLM-судей из семейств, не участвующих в пайплайнах-кандидатах (GPT-5.x + Claude + Gemini Pro, большинство голосов), плюс якорь — официальный человеческий перевод. ~300 попарных чанк-сравнений на пару конфигураций → биномиальный тест обнаруживает разницу WR ≥8 п.п. при α=0.05, power≈0.8.
  • Человеческая: BWS/попарные сравнения 23 русскоязычными редакторами на стратифицированной подвыборке 100150 пар для топ-2 конфигураций + якорь HT (методика LAIT: пристальное чтение пар фрагментов). Это главный критерий решения.
  • Вторичные (телеметрия): xCOMET-XL error spans, CometKiwi; скрипт консистентности глоссария; детектор CJK-артефактов (обязателен: 7/18 моделей грешат) и морфодетектор канцелярита (doc 07); доля отказов/цензурных срывов на 18+ фрагментах (заложить 23 таких главы).
  • Отчёт: WR с доверительными интервалами (bootstrap по книгам, не только по чанкам — кластеризация внутри книги), $/глава и латентность на конфигурацию.

5.4 Бюджет и сроки

  • API: 200K токенов исходника × 4 конфигурации; по тарифам doc 09 (DeepSeek V4 Flash $0.14/$0.28; Gemini Pro-судья $2/$12 batch→50%): C0≈$0.5, C1≈$1.52, C2≈$35, C3≈$46, панель судей ≈$1020. Итого API < $50.
  • Люди: 2040 ч редакторов (≈$300800 на фрилансе) — главная статья затрат и главный источник достоверности.
  • Сроки: 1 нед. данные + 1 нед. прогоны/судейство + 35 дней человеческая оценка и анализ.

5.5 Критерии решения

  1. Если WR(C2 или C3 vs C1) < +5 п.п. по человеческой оценке → берём C1 (draft→editor): она в 23 раза дешевле и проще в инкрементальной доработке.
  2. Если C3 > C1 и C3 > C2 значимо → гибрид: селекция на «трудных» сегментах (по сигналу судьи-гейта), редактура везде.
  3. Отсекающие условия для любых конфигураций: CJK-артефакты >0.1% сегментов после пайплайна; консистентность глоссария <98%; провал 18+ фрагментов у провайдера — модель вылетает из роли.
  4. Побочный выход пилота: калиброванный порог судьи-гейта (какой % сегментов эскалировать) — прямой вход в cost-модель doc 09.

Выводы для TextMachine

  1. Ставку «WR 0.929 ⇒ selection лучший для перевода» считать недоказанной. Переводная литература 20252026 (FusioN, Amazon-refinement, QE-fusion) склоняет к «draft → segment-level editor» и гибридам; чистый generate-then-select дороже (3× черновиков + судья) без доказанного выигрыша на литтексте. До пилота проектировать интерфейсы пайплайна так, чтобы обе топологии были конфигурацией, а не кодом.
  2. Редактор важнее черновика. Refinement тянет текст в распределение модели-редактора → позицию редактора отдаём сильнейшей по русскому стилю модели пула (по косвенным данным: Qwen3.x-крупный / GLM-5.x; эскалация — Sonnet), а черновик оптимизируем только по цене и верности (DeepSeek — подтверждён DITING на вебновеллах zh→en).
  3. GuoFeng V2 zh-ru использовать как dev, не как gold: референсы — пост-эдит GPT-4, лицензия некоммерческая. Художественный эталон строим сами из лицензионных изданий (приватно, без публикации текстов).
  4. ja→ru — полностью слепая зона (нет ни корпусов, ни лидербордов с ru-таргетом): пилотная ja-часть на официальных изданиях ранобэ обязательна; параллельно снять ручной срез Nejumi 4 (категория «перевод») и Swallow.
  5. Обязательные детерминированные фильтры ru-выхода до всякого судейства: CJK-артефакты (7/18 моделей!), кальки/канцелярит (морфология), консистентность глоссария. Дёшево и снимает главные позоры дешёвых моделей.
  6. Решающая оценка — только попарная (LLM-панель чужих семейств + человеческий BWS); d-BLEU/COMET — телеметрия. Порт BlonDe на русскую морфологию — маленький и ценный внутренний актив.
  7. POLLUX-judge 7B — кандидат в локальный дешёвый судья-гейт на GPU 8GB (квант) — снижает COGS гейта до нуля.
  8. Пилот стоит <$50 API + оплата редакторов и закрывает самый большой технический риск MVP; до его результатов не фиксировать в коде ни архитектуру, ни состав моделей.

Открытые вопросы

  • Состав 7 языковых пар в arXiv:2605.13368 (есть ли CJK/ru) — вытащить из полного текста.
  • Актуальный топ Nejumi 4 / Swallow по подзадаче перевода (JS-дашборды, нужен ручной срез).
  • Действующий состав/цены моделей на июль 2026 (DeepSeek V4 Flash/Pro, Qwen3.7, GLM-5, Kimi K2.6, Gemini 3.x, GPT-5.4-mini) — сверить в момент запуска пилота (см. doc 09, депрекации имён).
  • Продолжится ли WMT Literary в 2026 и добавят ли человеческую оценку zh→ru.
  • Юридическая рамка приватного eval на лицензионных изданиях в РФ (TDM/цитирование) — уточнить у юриста (связ. doc 08).

Источники