textmachine/docs/research/07-translation-methodology.md
Claude (backend session) 9bb00d49f2 Initial commit: documentation, eval polygon, backend step 0 verdict
TextMachine project repository (AI translation of literary books).
Includes: v2 architecture decisions, MVP plan, research 01-12,
polygon experiments 01-03, backend-session revalidation verdict
(03-implementation-notes.md).

Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
2026-07-04 06:50:59 +03:00

42 KiB
Raw Permalink Blame History

Методология профессионального художественного перевода → дизайн агентов TextMachine

Дата: 2026-07-04. Исследование для проекта TextMachine (мультиагентный пайплайн художественного перевода zh/ja/en/ru).

TL;DR

  1. Профессиональный литературный перевод — это не «один проход», а конвейер: анализ книги → глоссарий/style sheet → быстрый черновик → 24 круга саморедактуры → внешний редактор (часто не знающий язык оригинала!) → корректор. Переводчик прочитывает книгу минимум ~4 раза за проект (Booker Prizes).
  2. Скопос-теория даёт готовую абстракцию «translation brief» — конфиг проекта (аудитория, цель, регистр); шкала Venuti (domestication↔foreignization) и дихотомия Nida (formal↔dynamic equivalence) превращаются в слайдеры-параметры промптов.
  3. Пять уровней эквивалентности Комиссарова — готовая диагностическая шкала для агента-судьи: «на каком уровне перевод разошёлся с оригиналом и оправданно ли это».
  4. Чек-лист Норы Галь против канцелярита (отглагольные существительные, пассив, цепочки родительных падежей, кальки) — почти дословно готовый промпт агента-редактора ru-выхода; часть признаков детектится дёшево морфологией без LLM.
  5. Наука о translationese подтверждает: MT-текст беднее лексически, однообразнее синтаксически, «нормализованнее»; постредактированный литературный MT остаётся более упрощённым и интерферированным, чем перевод «с нуля» — значит, нужен отдельный «пасс обогащения», а не только исправление ошибок.
  6. CJK-специфика (хонорифики, yakuwarigo, ономатопея, счётные слова, транскрипция Поливанова/Палладия vs фанатские нормы) — это не «краевые случаи», а ядро продукта для ранобэ/вебновелл; каждая позиция — настраиваемая политика проекта.
  7. Советская модель «подстрочник + поэт» (Пастернак и др. переводили по подстрочникам) — прямой прототип пайплайна draft(дешёвая модель) + stylist(дорогая модель).
  8. Прецедент TransAgents (Tencent, 2024) показал: мультиагентная «виртуальная переводческая компания» на GPT-4 предпочитается читателями человеческим референсам при стоимости в ~80 раз ниже — но их методика оценки спорна, что для нас и риск, и возможность.

a) Рабочий процесс профессионального литературного переводчика

Собранные описания практиков (интервью переводчиков Букеровской премии, справочник Translation in Practice, симпозиум BCLT/Dalkey Archive 2008) дают устойчивую картину этапов:

  1. Знакомство с текстом. Практики расходятся: часть читает книгу целиком до начала (выявить арки персонажей, тон, «голос»), часть сознательно переводит «вслепую» с первой страницы, зная, что прочтёт текст ещё минимум четырежды в ходе ревизий (Booker Prizes). Для машинного пайплайна дилеммы нет: «прочтение всей книги» — дешёвый аналитический пре-пасс.
  2. Подготовка ресурсов: анализ исходного текста, решения по стилю, глоссарий имён и реалий, дизайн рабочего процесса — исследователи выделяют это в отдельную фазу «инициации» книжного перевода (IJRAH).
  3. Черновик. Первый драфт делается быстро и намеренно грубо («intentionally rough»), т.к. впереди много итераций; часть переводчиков любит именно стадию «из плохого черновика — в хороший» (Booker Prizes).
  4. Саморедактура (несколько кругов) с фокусами: лексика, тон, регистр, цитаты, повторы, топонимы; финальный круг часто — чтение вслух («слух переводчика» у Чуковского).
  5. Внешняя редактура. Ключевой факт из Translation in Practice (BCLT/Dalkey Archive, 2009): редактор издательства обычно не знает языка оригинала и редактирует целевой текст как самостоятельную английскую прозу, задавая переводчику вопросы; спорные места решаются переговорами «кто имеет последнее слово» (Dalkey Archive, обзор ArabLit). Это легитимизирует монолингвального агента-редактора, работающего только по целевому тексту.
  6. Корректура — отдельный проход на опечатки, пунктуацию, форматирование, сверку со style sheet.
  7. Опционально — сверка с автором (полный драфт отправляется автору, читающему целевой язык).

Практика ревизии чужих переводов («translators revising translators») — тоже устоявшийся жанр работы (Academia.edu) — прямой аналог пары translator-agent → reviser-agent.

Перенос в агентов: пайплайн = Analyst (вся книга → book brief) → Terminologist (глоссарий) → Translator (быстрый черновик) → Self-reviser (2 фокусных прохода: смысловая сверка с оригиналом; стилистика без оригинала) → Editor (монолингвальный, по чек-листам) → Proofreader (механика + сверка style sheet).

b) Теория перевода → параметры и промпты агентов

Скопос-теория (Reiss/Vermeer). Перевод «адекватен», если выполняет свою цель (skopos), заданную инициатором; цель фиксируется в «translation brief» (Academy Publication, PDF). Для TextMachine это буквально project config: целевая аудитория (фанаты жанра / широкий читатель), носитель (веб-релиз / печать), допустимость сносок, политика реалий. Один и тот же оригинал при разных brief даёт разные «правильные» переводы — значит, судья должен оценивать соответствие brief, а не абстрактную верность.

Venuti: domestication vs foreignization. Доместикация — прозрачный, беглый стиль, минимизирующий чужеродность; форенизация — сознательное сохранение чужого (Academy Publication, PDF). Стратегии дополняют друг друга, а не исключают. Для CJK-новелл это центральный продуктовый слайдер: фанатская аудитория ждёт форенизации (хонорифики, «Jindan», сноски), массовая — доместикации. Слайдер должен быть пофасетным: имена / обращения / реалии / идиомы / единицы измерения настраиваются отдельно.

Nida: формальная vs динамическая эквивалентность. Формальная ориентирована на форму и содержание сообщения, динамическая — на эквивалентную реакцию читателя (Tyndale Bulletin, PDF). Операционализация для судьи: вопрос-промпт «вызовет ли этот фрагмент у русского читателя ту же реакцию (смех/жуть/неловкость), что оригинал у японского?» — это иная и более полезная метрика, чем «точность».

Комиссаров: пять уровней эквивалентности — (1) цель коммуникации, (2) идентификация ситуации, (3) способ описания ситуации, (4) значения синтаксических структур, (5) значения словесных знаков (перевододоведческий словарь, конспект). Это готовая шкала диагностики для судьи: буквализм = перевод держит уровни 45, но теряет 1 (цель); отсебятина = держит 1, необоснованно бросив 23. Формат вердикта судьи: «расхождение на уровне N, оправдано/не оправдано, потому что…» — структурированнее и дешевле в токенах, чем свободное эссе.

c) Русская школа: Нора Галь и Чуковский → чек-листы редактора

Нора Галь, «Слово живое и мёртвое» (полный текст: lib.ru, vavilon.ru). Признаки канцелярита из главы «Берегись канцелярита!» (vavilon.ru) — конвертируются в детекторы:

  • Отглагольные существительные вместо глаголов («осуществление проверки» → «проверить») — детектится морфологией (суффиксы -ение/-ание/-ация + глагол-связка «производить/осуществлять»).
  • Пассив и безличность там, где возможен активный залог.
  • Цепочки родительных падежей («результаты исследования обработки данных…») — детектится парсером: ≥3 генитивов подряд.
  • Нагромождение придаточных, причастных и деепричастных оборотов — заменять простыми глаголами.
  • Иностранные слова там, где есть живое русское (кальки: «абсолютно» вместо «совсем», «момент» вместо «миг»).
  • Родовые слова вместо конкретных («головной убор», «осадки» вместо «шляпа», «дождь»).
  • Вытеснение глагола — главный симптом: живая фраза строится на глаголе.
  • Отдельные главы — про буквализм в идиомах, мёртвые кальки синтаксиса английского («он был высокий мужчина» ← "he was a tall man"), про звуковые стыки («слух»).

Чуковский, «Высокое искусство» (gumer.info, Wikipedia). Структура книги — фактически рубрикатор ошибок: «Словарные ошибки»; «Перевод — это автопортрет переводчика» (переводчик навязывает свой стиль всем авторам — для LLM это риск «одноголосости» модели!); «Неточная точность» (пословная точность убивает смысл); «Бедный словарь — и богатый» (обеднение синонимики — ровно то, чем болеет MT); «Стиль»; «Слух переводчика» (ритм, благозвучие). Ключевой тезис Чуковского: судить перевод надо не по отдельным словарным ошибкам, а по передаче стиля и «духа»; словарные ляпы — наименее страшная категория.

Готовый чек-лист агента-редактора (ru-выход): (1) канцелярит по списку Галь; (2) кальки синтаксиса исходного языка; (3) бедность синонимов/повторы в соседних предложениях; (4) неестественная для русского частота притяжательных местоимений и подлежащих-местоимений («он… он… он»; «своей рукой»); (5) ритм и звук — чтение «вслух»; (6) конкретика vs родовые слова; (7) живой глагол vs именные конструкции.

d) Специфика CJK → ru/en

Хонорифики и вежливость (ja). Кэйго трёхчастен: sonkeigo (почтительный), kenjougo (скромный), teineigo (нейтрально-вежливый) (Coto Academy, Wikipedia). Суффиксы (-san/-kun/-chan/-sama/senpai) кодируют дистанцию и иерархию; в фан-переводах их принято сохранять, в издательских — чаще передавать средствами целевого языка (выбор ты/вы, имя/фамилия, тон). Спор «сохранять vs адаптировать» — постоянная тема сообществ (J-Novel Club forums, CU Boulder). Для русского языка мощный дополнительный инструмент — матрица ты/вы между парами персонажей: она должна храниться в банке памяти и меняться в сюжетных точках сближения (классический признак профперевода).

Yakuwarigo (役割語, «ролевая речь») — термин Сатоси Кинсуя (2003): стереотипизированные речевые маски персонажей (местоимения ore/boku/watashi/atashi, финальные частицы わ/ぜ/のじゃ, «речь старика», «речь одзё-самы») (Wikipedia). В en/ru эти маркеры отсутствуют, поэтому переводчик строит речевой профиль персонажа другими средствами (лексика, синтаксис, сленг/архаика). Для агентов: в series bible хранить карту голосов — по персонажу: местоимение, регистр, тики речи, чем передаём в целевом языке.

Ономатопея. Японский — сотни гисэйго/гитайго (в т.ч. «звуки состояний»: しーん «звук тишины»); каламбуры на них непереводимы напрямую (TV Tropes: Lost in Translation). Стандартная практика — передавать глаголом/наречием, а не транслитом.

Счётные слова (ja: 本/枚/匹…, zh: 个/条/张…) в ru/en просто исчезают, но порождают у MT артефакты типа «три штуки людей» — дешёвый пункт чек-листа.

Транскрипция имён. Для ja→ru профессиональный стандарт — система Поливанова (её придерживаются издательства, лингвисты, официальные стриминги), тогда как фанатские сообщества массово используют русифицированный Хэпбёрн («ши/чи»: Шинджи vs Синдзи) — это многолетний холивар (Neolurk, teletype). Для zh→ru стандарт — транскрипция Палладия. Практический вывод: транскрипция — политика проекта (Polivanov | fan-Hepburn | per-name overrides), с автопроверкой консистентности по глоссарию; для устоявшихся имён (Токио, суши как блюдо) — словарь исключений.

Жанровая терминология (zh webnovels). Для сянься/уся выигравшая практика — семантический перевод ступеней культивации (Foundation Establishment, Golden Core, Nascent Soul), пиньинь — только для уникальных имён собственных/сект/артефактов; главный убийца читаемости — не выбор варианта, а непоследовательность («Golden Core» внезапно становится «Jindan» в 47-й главе) (TeaNovel, Artlangs, справочный глоссарий жанра: Immortal Mountain). Глоссарий должен покрывать шесть категорий: ступени/под-ступени, техники, пилюли, артефакты, типы энергии, концепты.

Культурные реалии решаются по слайдеру Venuti: сноска / внутритекстовая глосса («онигири — рисовый колобок») / замена функциональным аналогом — политика фиксируется в brief.

e) Что делает MTL «нехудожественным»: translationese и лечащие пассы

Термин translationese (Gellerstam, 1986) описывает системные отличия переводного текста от нативного (arXiv:2404.08661). Эмпирика по MT и литературе:

  • Лексическое и синтаксическое упрощение: переводные и особенно машинные тексты лексически беднее и конвенциональнее; художка — жанр с наибольшей синтаксической сложностью, и именно там упрощение заметнее всего (Nature HSSC 2024, Nature HSSC 2025, entropy-анализ, PMC: ChatGPT vs NMT vs HT).
  • Меньшая структурная вариативность и потеря лексико-морфологического богатства у MT vs человеческого перевода (arXiv:2412.18707).
  • Постредактирование не спасает до конца: постредактированные литературные переводы остаются более упрощёнными, нормализованными и интерферированными источником, чем перевод «с нуля» (проект PiPeNovel, Toral et al.; Frontiers 2018).
  • Читательский опыт: у HT выше креативность, вовлечённость в нарратив и общий приём; у постредактуры — маргинально выше «enjoyment», у сырого MT всё хуже (Guerberof-Arenas & Toral; arXiv:2101.06125, Benjamins).

Следствия для пайплайна. «Нехудожественность» — это не ошибки, а статистическое сглаживание: перевод верен, но сер. Лечится не bugfix-пассом, а отдельным пассом обогащения/де-нормализации: (1) вариативность длины и структуры предложений; (2) синонимическое разнообразие (замер MTLD/distinct-n до и после); (3) намеренная передача авторских странностей, а не их «починка» (Чуковский: не приглаживать стиль); (4) анти-интерференция: перефразировать с закрытым оригиналом, потом сверить смысл. Часть сигналов (type-token ratio, повторы лемм в окне, распределение длин предложений, доля пассива) считается бесплатно без LLM и может служить gate'ом: вызывать дорогую модель только на «серых» фрагментах.

f) Серии: reference-переводы и series bible

Редакторская индустрия работает с двумя артефактами:

  • Style sheet (обязателен в художественной корректуре): написания имён, дефисация, курсивы, числа, диалектизмы, список персонажей с приметами, тайм-лайн (CIEP, BookEnds). При редактуре серии копирайтер обязан сверять детали с «библией книги» и предыдущими томами (DIY MFA).
  • Series bible: персонажи (внешность, отношения), география/карты, тайм-лайн событий, законы магии/системы сил, валюта и календарь, глоссарий придуманных терминов (Tasha L. Harrison, Atmosphere Press).

Переводчики серий дополнительно опираются на переводы предыдущих томов (даже чужие) как нормативный референс: устоявшиеся имена и термины не пересматриваются без крайней нужды — консистентность ценнее локального улучшения. Для TextMachine банк памяти = машинно-читаемый series bible: сущности (имя-оригинал, транскрипция, перевод, пол, титулы), матрица обращений (ты/вы, хонорифики) с версионированием по главам, терминосистема жанра, речевые профили, факты мира. Плюс механизм ретроспективных решений: если термин пересмотрен, фиксировать «с тома N — так», а не молча менять.

g) Чек-листы качества редактора/корректора → промпты

Индустриальная рамка «5 C's of copyediting»: clear, correct, concise, consistent, coherent (BubbleCow). Синтез практических чек-листов (DIY MFA, CIEP) в три агентских промпта:

  • Line editor (стиль, без оригинала): повторы слов/корней в окне 23 предложений; монотонный ритм (серии предложений одной длины/структуры); канцелярит (список Галь); клише; «сказал» vs пёстрые глаголы говорения — по политике проекта; фильтр-слова («он увидел, что…»); логика диалоговых атрибуций.
  • Continuity editor (по series bible): имена/термины строго по глоссарию; ты/вы-матрица; титулы и обращения; факты (цвет глаз, ранги, география); тайм-лайн.
  • Proofreader: пунктуация прямой речи по нормам целевого языка (— тире-диалоги в ru vs кавычки в en!), ё/е-политика, числа, разметка, опечатки, непереведённые фрагменты и «осколки» оригинала (иероглифы, ромадзи), дубли строк.

Важное правило из издательской практики: у каждого пасса — узкий мандат («корректор не переписывает стиль»), иначе поздние пассы разрушают работу ранних. Для агентов это значит: жёсткие инструкции «что менять нельзя» + диффы вместо полной перегенерации.

h) Исторические и нестандартные модели, воспроизводимые агентами

  • Подстрочник + поэт (советская школа). Подстрочник считался «полуфабрикатом»; по подстрочникам национальных литератур переводили Пастернак, Тихонов, Заболоцкий и др. (КЛЭ, статья «Подстрочник»). Известная слабость метода — потеря стилистики оригинала при переводе прозы. Это прямой прототип пайплайна: дешёвая модель делает семантически плотный подстрочник с аннотациями (грамматика, регистр, аллюзии), дорогая модель-«поэт» пишет художественный текст, не тратя мощность на декодирование CJK. Аннотированный подстрочник решает главный исторический дефект метода — потерю стилистической информации.
  • Буквалисты vs школа Кашкина. Спор 193050-х: точность формы (Ланн, Шенгели) против «творческого» перевода духом (кашкинцы); буквалистов разгромили административно, но спор по сути — про положение слайдера Venuti (Горький (URL по памяти поиска), КиберЛенинка). Урок: оба режима — легитимные продукты; дать пользователю выбор, а не спорить за него.
  • Ревизия чужого перевода (translator revising translator, Academia.edu) — дешёвый паттерн: вторая модель другой архитектуры ревизует первую, снижая «одноголосость» (риск «автопортрета переводчика» по Чуковскому).
  • Конкурс переводов + судья: генерация N вариантов ключевых фрагментов (первая глава, кульминации) разными temperature/моделями и выбор судьёй — имитация издательского отбора по пробному переводу (sample translation — стандартная практика из Translation in Practice).
  • TransAgents (Tencent AI Lab, 2024) — важнейший прецедент: виртуальная «компания» из GPT-4-агентов (senior/junior editor, translator, localization specialist, proofreader) переводила ультрадлинные вебновеллы; в оценках Monolingual Human Preference читатели предпочитали её выводы человеческим референсам, стоимость — в ~80 раз ниже человеческой ($500 на весь тест-сет против $168.48 за главу у людей) (arXiv:2405.11804, GitHub, Slator). Оговорка: d-BLEU у системы низкий, методика MHP критикуется (читатель без оригинала не видит смысловых потерь) — TextMachine стоит строить оценку из пары судей: монолингвальный (читабельность) + билингвальный (верность).

Выводы для TextMachine

  1. Пайплайн копирует издательство: Analyst(вся книга → brief) → Terminologist(глоссарий+style sheet) → Translator(черновик/подстрочник) → Stylist(дорогая модель, «поэт») → Line Editor(чек-лист Галь) → Continuity Editor(series bible) → Proofreader. У каждого пасса узкий мандат и запрет трогать чужую зону.
  2. Translation brief как конфиг (скопос): аудитория, слайдер Venuti по фасетам (имена/обращения/реалии/идиомы), политика хонорификов, политика транскрипции (Поливанов/Палладий по умолчанию, «фанатский» пресет опционально), политика сносок, политика 18+.
  3. Судья-вердикт по Комиссарову: структурированный выход «уровень расхождения (15) + оправданность», плюс Nida-вопрос про эквивалентную реакцию читателя. Двойная оценка: монолингвальный судья (художественность) + билингвальный (верность).
  4. Анти-translationese как отдельный пасс и как метрики: MTLD/distinct-n, дисперсия длин предложений, повторы лемм, доля пассива и отглагольных существительных — дешёвые не-LLM сигналы для gate'а дорогих моделей и для регрессионного контроля качества.
  5. Series bible — первоклассная сущность БД: сущности, ты/вы-матрица с версионированием по главам, речевые профили персонажей (замена yakuwarigo), терминосистема жанра (6 категорий для сянься), решения-прецеденты. Ни один вызов переводчика без релевантного среза bible.
  6. Модель «подстрочник+поэт» — главная ставка на дешевизну: дешёвая модель производит аннотированный подстрочник (грамматика, регистр, культурные пометы), дорогая пишет прозу по нему; исторический дефект метода закрывается аннотациями.
  7. Русскоязычный редакторский пасс промптится напрямую цитатами принципов Галь/Чуковского — это редкий случай, когда «учебник» конвертируется в промпт почти без переработки; часть проверок реализуется детерминированно (морфопарсер) до/вместо LLM.

Источники