TextMachine project repository (AI translation of literary books). Includes: v2 architecture decisions, MVP plan, research 01-12, polygon experiments 01-03, backend-session revalidation verdict (03-implementation-notes.md). Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
42 KiB
Методология профессионального художественного перевода → дизайн агентов TextMachine
Дата: 2026-07-04. Исследование для проекта TextMachine (мультиагентный пайплайн художественного перевода zh/ja/en/ru).
TL;DR
- Профессиональный литературный перевод — это не «один проход», а конвейер: анализ книги → глоссарий/style sheet → быстрый черновик → 2–4 круга саморедактуры → внешний редактор (часто не знающий язык оригинала!) → корректор. Переводчик прочитывает книгу минимум ~4 раза за проект (Booker Prizes).
- Скопос-теория даёт готовую абстракцию «translation brief» — конфиг проекта (аудитория, цель, регистр); шкала Venuti (domestication↔foreignization) и дихотомия Nida (formal↔dynamic equivalence) превращаются в слайдеры-параметры промптов.
- Пять уровней эквивалентности Комиссарова — готовая диагностическая шкала для агента-судьи: «на каком уровне перевод разошёлся с оригиналом и оправданно ли это».
- Чек-лист Норы Галь против канцелярита (отглагольные существительные, пассив, цепочки родительных падежей, кальки) — почти дословно готовый промпт агента-редактора ru-выхода; часть признаков детектится дёшево морфологией без LLM.
- Наука о translationese подтверждает: MT-текст беднее лексически, однообразнее синтаксически, «нормализованнее»; постредактированный литературный MT остаётся более упрощённым и интерферированным, чем перевод «с нуля» — значит, нужен отдельный «пасс обогащения», а не только исправление ошибок.
- CJK-специфика (хонорифики, yakuwarigo, ономатопея, счётные слова, транскрипция Поливанова/Палладия vs фанатские нормы) — это не «краевые случаи», а ядро продукта для ранобэ/вебновелл; каждая позиция — настраиваемая политика проекта.
- Советская модель «подстрочник + поэт» (Пастернак и др. переводили по подстрочникам) — прямой прототип пайплайна draft(дешёвая модель) + stylist(дорогая модель).
- Прецедент TransAgents (Tencent, 2024) показал: мультиагентная «виртуальная переводческая компания» на GPT-4 предпочитается читателями человеческим референсам при стоимости в ~80 раз ниже — но их методика оценки спорна, что для нас и риск, и возможность.
a) Рабочий процесс профессионального литературного переводчика
Собранные описания практиков (интервью переводчиков Букеровской премии, справочник Translation in Practice, симпозиум BCLT/Dalkey Archive 2008) дают устойчивую картину этапов:
- Знакомство с текстом. Практики расходятся: часть читает книгу целиком до начала (выявить арки персонажей, тон, «голос»), часть сознательно переводит «вслепую» с первой страницы, зная, что прочтёт текст ещё минимум четырежды в ходе ревизий (Booker Prizes). Для машинного пайплайна дилеммы нет: «прочтение всей книги» — дешёвый аналитический пре-пасс.
- Подготовка ресурсов: анализ исходного текста, решения по стилю, глоссарий имён и реалий, дизайн рабочего процесса — исследователи выделяют это в отдельную фазу «инициации» книжного перевода (IJRAH).
- Черновик. Первый драфт делается быстро и намеренно грубо («intentionally rough»), т.к. впереди много итераций; часть переводчиков любит именно стадию «из плохого черновика — в хороший» (Booker Prizes).
- Саморедактура (несколько кругов) с фокусами: лексика, тон, регистр, цитаты, повторы, топонимы; финальный круг часто — чтение вслух («слух переводчика» у Чуковского).
- Внешняя редактура. Ключевой факт из Translation in Practice (BCLT/Dalkey Archive, 2009): редактор издательства обычно не знает языка оригинала и редактирует целевой текст как самостоятельную английскую прозу, задавая переводчику вопросы; спорные места решаются переговорами «кто имеет последнее слово» (Dalkey Archive, обзор ArabLit). Это легитимизирует монолингвального агента-редактора, работающего только по целевому тексту.
- Корректура — отдельный проход на опечатки, пунктуацию, форматирование, сверку со style sheet.
- Опционально — сверка с автором (полный драфт отправляется автору, читающему целевой язык).
Практика ревизии чужих переводов («translators revising translators») — тоже устоявшийся жанр работы (Academia.edu) — прямой аналог пары translator-agent → reviser-agent.
Перенос в агентов: пайплайн = Analyst (вся книга → book brief) → Terminologist (глоссарий) → Translator (быстрый черновик) → Self-reviser (2 фокусных прохода: смысловая сверка с оригиналом; стилистика без оригинала) → Editor (монолингвальный, по чек-листам) → Proofreader (механика + сверка style sheet).
b) Теория перевода → параметры и промпты агентов
Скопос-теория (Reiss/Vermeer). Перевод «адекватен», если выполняет свою цель (skopos), заданную инициатором; цель фиксируется в «translation brief» (Academy Publication, PDF). Для TextMachine это буквально project config: целевая аудитория (фанаты жанра / широкий читатель), носитель (веб-релиз / печать), допустимость сносок, политика реалий. Один и тот же оригинал при разных brief даёт разные «правильные» переводы — значит, судья должен оценивать соответствие brief, а не абстрактную верность.
Venuti: domestication vs foreignization. Доместикация — прозрачный, беглый стиль, минимизирующий чужеродность; форенизация — сознательное сохранение чужого (Academy Publication, PDF). Стратегии дополняют друг друга, а не исключают. Для CJK-новелл это центральный продуктовый слайдер: фанатская аудитория ждёт форенизации (хонорифики, «Jindan», сноски), массовая — доместикации. Слайдер должен быть пофасетным: имена / обращения / реалии / идиомы / единицы измерения настраиваются отдельно.
Nida: формальная vs динамическая эквивалентность. Формальная ориентирована на форму и содержание сообщения, динамическая — на эквивалентную реакцию читателя (Tyndale Bulletin, PDF). Операционализация для судьи: вопрос-промпт «вызовет ли этот фрагмент у русского читателя ту же реакцию (смех/жуть/неловкость), что оригинал у японского?» — это иная и более полезная метрика, чем «точность».
Комиссаров: пять уровней эквивалентности — (1) цель коммуникации, (2) идентификация ситуации, (3) способ описания ситуации, (4) значения синтаксических структур, (5) значения словесных знаков (перевододоведческий словарь, конспект). Это готовая шкала диагностики для судьи: буквализм = перевод держит уровни 4–5, но теряет 1 (цель); отсебятина = держит 1, необоснованно бросив 2–3. Формат вердикта судьи: «расхождение на уровне N, оправдано/не оправдано, потому что…» — структурированнее и дешевле в токенах, чем свободное эссе.
c) Русская школа: Нора Галь и Чуковский → чек-листы редактора
Нора Галь, «Слово живое и мёртвое» (полный текст: lib.ru, vavilon.ru). Признаки канцелярита из главы «Берегись канцелярита!» (vavilon.ru) — конвертируются в детекторы:
- Отглагольные существительные вместо глаголов («осуществление проверки» → «проверить») — детектится морфологией (суффиксы -ение/-ание/-ация + глагол-связка «производить/осуществлять»).
- Пассив и безличность там, где возможен активный залог.
- Цепочки родительных падежей («результаты исследования обработки данных…») — детектится парсером: ≥3 генитивов подряд.
- Нагромождение придаточных, причастных и деепричастных оборотов — заменять простыми глаголами.
- Иностранные слова там, где есть живое русское (кальки: «абсолютно» вместо «совсем», «момент» вместо «миг»).
- Родовые слова вместо конкретных («головной убор», «осадки» вместо «шляпа», «дождь»).
- Вытеснение глагола — главный симптом: живая фраза строится на глаголе.
- Отдельные главы — про буквализм в идиомах, мёртвые кальки синтаксиса английского («он был высокий мужчина» ← "he was a tall man"), про звуковые стыки («слух»).
Чуковский, «Высокое искусство» (gumer.info, Wikipedia). Структура книги — фактически рубрикатор ошибок: «Словарные ошибки»; «Перевод — это автопортрет переводчика» (переводчик навязывает свой стиль всем авторам — для LLM это риск «одноголосости» модели!); «Неточная точность» (пословная точность убивает смысл); «Бедный словарь — и богатый» (обеднение синонимики — ровно то, чем болеет MT); «Стиль»; «Слух переводчика» (ритм, благозвучие). Ключевой тезис Чуковского: судить перевод надо не по отдельным словарным ошибкам, а по передаче стиля и «духа»; словарные ляпы — наименее страшная категория.
Готовый чек-лист агента-редактора (ru-выход): (1) канцелярит по списку Галь; (2) кальки синтаксиса исходного языка; (3) бедность синонимов/повторы в соседних предложениях; (4) неестественная для русского частота притяжательных местоимений и подлежащих-местоимений («он… он… он»; «своей рукой»); (5) ритм и звук — чтение «вслух»; (6) конкретика vs родовые слова; (7) живой глагол vs именные конструкции.
d) Специфика CJK → ru/en
Хонорифики и вежливость (ja). Кэйго трёхчастен: sonkeigo (почтительный), kenjougo (скромный), teineigo (нейтрально-вежливый) (Coto Academy, Wikipedia). Суффиксы (-san/-kun/-chan/-sama/senpai) кодируют дистанцию и иерархию; в фан-переводах их принято сохранять, в издательских — чаще передавать средствами целевого языка (выбор ты/вы, имя/фамилия, тон). Спор «сохранять vs адаптировать» — постоянная тема сообществ (J-Novel Club forums, CU Boulder). Для русского языка мощный дополнительный инструмент — матрица ты/вы между парами персонажей: она должна храниться в банке памяти и меняться в сюжетных точках сближения (классический признак профперевода).
Yakuwarigo (役割語, «ролевая речь») — термин Сатоси Кинсуя (2003): стереотипизированные речевые маски персонажей (местоимения ore/boku/watashi/atashi, финальные частицы わ/ぜ/のじゃ, «речь старика», «речь одзё-самы») (Wikipedia). В en/ru эти маркеры отсутствуют, поэтому переводчик строит речевой профиль персонажа другими средствами (лексика, синтаксис, сленг/архаика). Для агентов: в series bible хранить карту голосов — по персонажу: местоимение, регистр, тики речи, чем передаём в целевом языке.
Ономатопея. Японский — сотни гисэйго/гитайго (в т.ч. «звуки состояний»: しーん «звук тишины»); каламбуры на них непереводимы напрямую (TV Tropes: Lost in Translation). Стандартная практика — передавать глаголом/наречием, а не транслитом.
Счётные слова (ja: 本/枚/匹…, zh: 个/条/张…) в ru/en просто исчезают, но порождают у MT артефакты типа «три штуки людей» — дешёвый пункт чек-листа.
Транскрипция имён. Для ja→ru профессиональный стандарт — система Поливанова (её придерживаются издательства, лингвисты, официальные стриминги), тогда как фанатские сообщества массово используют русифицированный Хэпбёрн («ши/чи»: Шинджи vs Синдзи) — это многолетний холивар (Neolurk, teletype). Для zh→ru стандарт — транскрипция Палладия. Практический вывод: транскрипция — политика проекта (Polivanov | fan-Hepburn | per-name overrides), с автопроверкой консистентности по глоссарию; для устоявшихся имён (Токио, суши как блюдо) — словарь исключений.
Жанровая терминология (zh webnovels). Для сянься/уся выигравшая практика — семантический перевод ступеней культивации (Foundation Establishment, Golden Core, Nascent Soul), пиньинь — только для уникальных имён собственных/сект/артефактов; главный убийца читаемости — не выбор варианта, а непоследовательность («Golden Core» внезапно становится «Jindan» в 47-й главе) (TeaNovel, Artlangs, справочный глоссарий жанра: Immortal Mountain). Глоссарий должен покрывать шесть категорий: ступени/под-ступени, техники, пилюли, артефакты, типы энергии, концепты.
Культурные реалии решаются по слайдеру Venuti: сноска / внутритекстовая глосса («онигири — рисовый колобок») / замена функциональным аналогом — политика фиксируется в brief.
e) Что делает MTL «нехудожественным»: translationese и лечащие пассы
Термин translationese (Gellerstam, 1986) описывает системные отличия переводного текста от нативного (arXiv:2404.08661). Эмпирика по MT и литературе:
- Лексическое и синтаксическое упрощение: переводные и особенно машинные тексты лексически беднее и конвенциональнее; художка — жанр с наибольшей синтаксической сложностью, и именно там упрощение заметнее всего (Nature HSSC 2024, Nature HSSC 2025, entropy-анализ, PMC: ChatGPT vs NMT vs HT).
- Меньшая структурная вариативность и потеря лексико-морфологического богатства у MT vs человеческого перевода (arXiv:2412.18707).
- Постредактирование не спасает до конца: постредактированные литературные переводы остаются более упрощёнными, нормализованными и интерферированными источником, чем перевод «с нуля» (проект PiPeNovel, Toral et al.; Frontiers 2018).
- Читательский опыт: у HT выше креативность, вовлечённость в нарратив и общий приём; у постредактуры — маргинально выше «enjoyment», у сырого MT всё хуже (Guerberof-Arenas & Toral; arXiv:2101.06125, Benjamins).
Следствия для пайплайна. «Нехудожественность» — это не ошибки, а статистическое сглаживание: перевод верен, но сер. Лечится не bugfix-пассом, а отдельным пассом обогащения/де-нормализации: (1) вариативность длины и структуры предложений; (2) синонимическое разнообразие (замер MTLD/distinct-n до и после); (3) намеренная передача авторских странностей, а не их «починка» (Чуковский: не приглаживать стиль); (4) анти-интерференция: перефразировать с закрытым оригиналом, потом сверить смысл. Часть сигналов (type-token ratio, повторы лемм в окне, распределение длин предложений, доля пассива) считается бесплатно без LLM и может служить gate'ом: вызывать дорогую модель только на «серых» фрагментах.
f) Серии: reference-переводы и series bible
Редакторская индустрия работает с двумя артефактами:
- Style sheet (обязателен в художественной корректуре): написания имён, дефисация, курсивы, числа, диалектизмы, список персонажей с приметами, тайм-лайн (CIEP, BookEnds). При редактуре серии копирайтер обязан сверять детали с «библией книги» и предыдущими томами (DIY MFA).
- Series bible: персонажи (внешность, отношения), география/карты, тайм-лайн событий, законы магии/системы сил, валюта и календарь, глоссарий придуманных терминов (Tasha L. Harrison, Atmosphere Press).
Переводчики серий дополнительно опираются на переводы предыдущих томов (даже чужие) как нормативный референс: устоявшиеся имена и термины не пересматриваются без крайней нужды — консистентность ценнее локального улучшения. Для TextMachine банк памяти = машинно-читаемый series bible: сущности (имя-оригинал, транскрипция, перевод, пол, титулы), матрица обращений (ты/вы, хонорифики) с версионированием по главам, терминосистема жанра, речевые профили, факты мира. Плюс механизм ретроспективных решений: если термин пересмотрен, фиксировать «с тома N — так», а не молча менять.
g) Чек-листы качества редактора/корректора → промпты
Индустриальная рамка «5 C's of copyediting»: clear, correct, concise, consistent, coherent (BubbleCow). Синтез практических чек-листов (DIY MFA, CIEP) в три агентских промпта:
- Line editor (стиль, без оригинала): повторы слов/корней в окне 2–3 предложений; монотонный ритм (серии предложений одной длины/структуры); канцелярит (список Галь); клише; «сказал» vs пёстрые глаголы говорения — по политике проекта; фильтр-слова («он увидел, что…»); логика диалоговых атрибуций.
- Continuity editor (по series bible): имена/термины строго по глоссарию; ты/вы-матрица; титулы и обращения; факты (цвет глаз, ранги, география); тайм-лайн.
- Proofreader: пунктуация прямой речи по нормам целевого языка (— тире-диалоги в ru vs кавычки в en!), ё/е-политика, числа, разметка, опечатки, непереведённые фрагменты и «осколки» оригинала (иероглифы, ромадзи), дубли строк.
Важное правило из издательской практики: у каждого пасса — узкий мандат («корректор не переписывает стиль»), иначе поздние пассы разрушают работу ранних. Для агентов это значит: жёсткие инструкции «что менять нельзя» + диффы вместо полной перегенерации.
h) Исторические и нестандартные модели, воспроизводимые агентами
- Подстрочник + поэт (советская школа). Подстрочник считался «полуфабрикатом»; по подстрочникам национальных литератур переводили Пастернак, Тихонов, Заболоцкий и др. (КЛЭ, статья «Подстрочник»). Известная слабость метода — потеря стилистики оригинала при переводе прозы. Это прямой прототип пайплайна: дешёвая модель делает семантически плотный подстрочник с аннотациями (грамматика, регистр, аллюзии), дорогая модель-«поэт» пишет художественный текст, не тратя мощность на декодирование CJK. Аннотированный подстрочник решает главный исторический дефект метода — потерю стилистической информации.
- Буквалисты vs школа Кашкина. Спор 1930–50-х: точность формы (Ланн, Шенгели) против «творческого» перевода духом (кашкинцы); буквалистов разгромили административно, но спор по сути — про положение слайдера Venuti (Горький (URL по памяти поиска), КиберЛенинка). Урок: оба режима — легитимные продукты; дать пользователю выбор, а не спорить за него.
- Ревизия чужого перевода (translator revising translator, Academia.edu) — дешёвый паттерн: вторая модель другой архитектуры ревизует первую, снижая «одноголосость» (риск «автопортрета переводчика» по Чуковскому).
- Конкурс переводов + судья: генерация N вариантов ключевых фрагментов (первая глава, кульминации) разными temperature/моделями и выбор судьёй — имитация издательского отбора по пробному переводу (sample translation — стандартная практика из Translation in Practice).
- TransAgents (Tencent AI Lab, 2024) — важнейший прецедент: виртуальная «компания» из GPT-4-агентов (senior/junior editor, translator, localization specialist, proofreader) переводила ультрадлинные вебновеллы; в оценках Monolingual Human Preference читатели предпочитали её выводы человеческим референсам, стоимость — в ~80 раз ниже человеческой ($500 на весь тест-сет против $168.48 за главу у людей) (arXiv:2405.11804, GitHub, Slator). Оговорка: d-BLEU у системы низкий, методика MHP критикуется (читатель без оригинала не видит смысловых потерь) — TextMachine стоит строить оценку из пары судей: монолингвальный (читабельность) + билингвальный (верность).
Выводы для TextMachine
- Пайплайн копирует издательство: Analyst(вся книга → brief) → Terminologist(глоссарий+style sheet) → Translator(черновик/подстрочник) → Stylist(дорогая модель, «поэт») → Line Editor(чек-лист Галь) → Continuity Editor(series bible) → Proofreader. У каждого пасса узкий мандат и запрет трогать чужую зону.
- Translation brief как конфиг (скопос): аудитория, слайдер Venuti по фасетам (имена/обращения/реалии/идиомы), политика хонорификов, политика транскрипции (Поливанов/Палладий по умолчанию, «фанатский» пресет опционально), политика сносок, политика 18+.
- Судья-вердикт по Комиссарову: структурированный выход «уровень расхождения (1–5) + оправданность», плюс Nida-вопрос про эквивалентную реакцию читателя. Двойная оценка: монолингвальный судья (художественность) + билингвальный (верность).
- Анти-translationese как отдельный пасс и как метрики: MTLD/distinct-n, дисперсия длин предложений, повторы лемм, доля пассива и отглагольных существительных — дешёвые не-LLM сигналы для gate'а дорогих моделей и для регрессионного контроля качества.
- Series bible — первоклассная сущность БД: сущности, ты/вы-матрица с версионированием по главам, речевые профили персонажей (замена yakuwarigo), терминосистема жанра (6 категорий для сянься), решения-прецеденты. Ни один вызов переводчика без релевантного среза bible.
- Модель «подстрочник+поэт» — главная ставка на дешевизну: дешёвая модель производит аннотированный подстрочник (грамматика, регистр, культурные пометы), дорогая пишет прозу по нему; исторический дефект метода закрывается аннотациями.
- Русскоязычный редакторский пасс промптится напрямую цитатами принципов Галь/Чуковского — это редкий случай, когда «учебник» конвертируется в промпт почти без переработки; часть проверок реализуется детерминированно (морфопарсер) до/вместо LLM.
Источники
- Booker Prizes — What exactly do literary translators do
- BCLT/Dalkey Archive — Translation in Practice: A Symposium; обзор ArabLit
- Initiating the Literary Translation Process, IJRAH; Translators revising translators
- Скопос/Venuti/Nida: Academy Publication TPLS; JLTR; Tyndale Bulletin
- Комиссаров: перевододоведческий словарь; конспект теории уровней
- Нора Галь — «Слово живое и мёртвое», полный текст; глава «Берегись канцелярита!»
- Чуковский — «Высокое искусство»; Wikipedia
- CJK: Keigo, Coto Academy; Honorific speech in Japanese, Wikipedia; Yakuwarigo, Wikipedia; CU Boulder о хонорификах и MT; J-Novel Club forums; TV Tropes: Lost in Translation
- Транскрипция: Система Поливанова, Neolurk; teletype: Поливанов vs Хэпбёрн
- Сянься-терминология: TeaNovel; Artlangs; Immortal Mountain glossary
- Translationese/MT: Nature HSSC 2024; Nature HSSC 2025; PMC (entropy, ChatGPT vs NMT vs HT); arXiv:2404.08661; arXiv:2412.18707; Frontiers: PE effort of a novel; arXiv:2101.06125 (creativity & reading experience); Benjamins ts.20035.gue
- Series bible / style sheet / чек-листы: CIEP; BookEnds; Tasha L. Harrison; Atmosphere Press; DIY MFA copyediting checklist; BubbleCow 5 C's
- Советская школа: КЛЭ «Подстрочник»; КиберЛенинка: дискуссия о типах худперевода; Горький: переводчики-буквалисты
- TransAgents: arXiv:2405.11804; GitHub; Slator; The Batch