44 KiB
Режимы отказа MTL на русской стороне (en/zh/ja → ru)
Дата: 2026-07-04. Дополняет doc 07 (канцелярит/кальки/Галь/Чуковский там уже покрыты — здесь не повторяются). Каждый режим описан как заготовка тест-кейса и механизма бэкенда: пример (оригинал → типичный неверный MTL → верный), причина отказа, способ детекции, источник.
TL;DR
- Свежий WMT 2025 test-suite по en→ru (465 заданий, 55 явлений, 13 категорий, 10 топ-систем) подтверждает: даже лучшие LLM-системы систематически дают «literal word order carry-overs, misused verb forms, rigid phrase translations» — т.е. три наших режима (тема-рема, вид глагола, кальки конструкций) — это измеренная, а не гипотетическая проблема (ACL 2025.wmt-1.61).
- Русский — уникально «неудобный» целевой язык по роду: прошедшее время и согласования принудительно требуют решения о роде там, где en/zh/ja молчат (TACL: Gender Bias in MT). (Правка верификатора: ранее тезис ссылался и на WMT 2020 — там у русского действительно наибольшая доля «unknown»-случаев (12.9–13.5% против 1.3–1.8% у cs/de/pl), но статья объясняет её пробелами морфоанализатора, а не грамматикой, поэтому как опору для этого тезиса ссылку сняли.)
- Существует проверенный арсенал стратегий письма «без рода» (перестройка фразы, настоящее время, безличные/номинативные конструкции) — формализован в гайдах ООН по гендерно-нейтральному русскому; он конвертируется в протокол «gender: unknown» для переводчика-агента (UN Russian guidelines).
- Самый дешёвый и самый заметный читателю класс отказов — механика: английские кавычки вместо тире-диалогов, дефис вместо тире, транслит-междометия («Ауч!», «Упс»), непоследовательная ё. Всё это детектится и чинится детерминированно, без LLM (Розенталь §47–52, Лопатин, правила ё на Грамоте.ру).
- Мат — двусторонний отказ: LLM-санитайзинг даёт «недожим» (злодей ругается «чёрт возьми»), буквализм — «пережим» (мат там, где в оригинале бытовое shit). Русская обсценная лексика табуированнее английских four-letter words, а закон 2014 г. требует маркировки 18+ — это и политика проекта, и двусторонний детерминированный гейт по лексиконам (Habr/EnglishDom).
- Переход ты↔вы внутри сцены — сюжетное событие (сближение, оскорбление, дистанцирование), а не вариант перевода you; главная жалоба на DeepL-класс систем — случайные перескоки. Решение: матрица пар + журнал «событий перехода» + детерминированный детектор несанкционированных перескоков.
- Наименее автоматизируемые режимы — вид глагола в нарративных цепочках, тема-рема и несобственно-прямая речь: они требуют дискурсивного понимания, детектируются только целевыми LLM-судьями с узкими промптами и контрастивными регрессионными наборами (по образцу WMT fine-grained suite).
Каталог режимов отказа
1. Обязательный род: прошедшее время и согласования при неизвестном поле источника
Проблема. Русский принуждает к выбору рода в прошедшем времени («пришёл/пришла»), кратких прилагательных, причастиях. En «I»/«you» рода не несут; в zh 他/她 различаются лишь на письме, а имена пола не выдают; в ja пол говорящего часто маркирован лишь косвенно (boku/ore/atashi) и намеренно скрывается автором (классический троп 女扮男装 «девушка, переодетая мужчиной» в китайских новеллах; «реверс-трапы» в ранобэ).
Пример. ja: 「昨日、あの店に行った」 (пол говорящего не выражен, персонаж-загадка) → MTL: «Вчера я ходил в тот магазин» (мужской род по умолчанию; в главе 30 персонаж оказывается девушкой — весь тираж «спойлерит» или противоречит) → верно: «Вчера мне довелось заглянуть в тот магазин» / «Вчера я туда заходила», если series bible фиксирует истинный род и политику раскрытия.
Почему падают. Модели статистически дефолтят в мужской род (гендер-биас измерен: TACL, WMT 2020); окно контекста не содержит главу с раскрытием пола; при zh→ru через en-пивот род теряется дважды. Известны и обратные «трансформации» пола персонажей переводчиками (Багира у Киплинга — самец; APNI).
Стратегии при истинно неизвестном/скрытом поле (формализованы в гайдах ООН по русскому): (а) перестройка фразы — «Мне удалось войти» вместо «Я вошёл/вошла»; (б) настоящее историческое — «Захожу в лавку, оглядываюсь…» (о повествовательном времени: Литинститут); (в) безличные/пассивные конструкции — «Дверь поддалась не сразу»; (г) номинативные предложения и обращение к описаниям («незнакомый голос», «фигура в плаще»).
Детекция. Комбинированная: (1) поле глоссария gender у каждой сущности с тремя значениями m/f/hidden(до главы N) + «заявленный род» по диапазонам глав; (2) детерминированный гейт: морфопарсер (pymorphy/UD) находит все формы прошедшего времени и согласований, привязывает к референту через атрибуцию, сверяет с глоссарием; при hidden — любые родовые формы про этого референта = блокер; (3) LLM-судья только для спорной атрибуции референта.
2. Ты/вы-динамика внутри сцены: переход как событие
Проблема. У en «you» нет регистра; выбор ты/вы — интерпретация. Doc 07 покрывает матрицу пар на уровне книги; здесь — внутрисценовая динамика: переход ты↔вы это сюжетное событие (сближение, ссора, издёвка через ледяное «вы», интимность через внезапное «ты»). Известная слабость MT: DeepL непоследовательно скачет du/Sie внутри одного текста (см. doc 02); у LLM то же на длинной дистанции.
Пример. en (ссора супругов): "Don't you dare. — Or what? What will you do?" → MTL: реплика 1 на «ты», реплика 2 внезапно на «вы» без мотивировки (перескок) → верно: вся сцена на «ты»; а вот намеренный ход — «Не смейте. Слышите — не смейте» (переход на «вы» как знак разрыва) — допустим, только если зафиксирован как событие. Обратный кейс: en "Just call me Sam" — конвенциональный англоязычный аналог «перейдём на ты» и легитимный триггер смены регистра (Яндекс Кью; теория thou/you: КиберЛенинка).
Почему падают. Каждый вызов модели решает «you локально»; сигналы регистра (имя vs фамилия, титул, тон) рассеяны по главам и не попадают в промпт.
Детекция. Детерминированный гейт: парсер извлекает 2-е лицо (местоимения + глагольные формы «-ешь/-ете», императивы) по репликам, атрибуция реплик → пары говорящих; любой флип внутри пары, не записанный в журнале «ty/vy-событий» series bible, — флаг. LLM-судья классифицирует флаги: ошибка / мотивированный переход (и тогда предлагает записать событие в журнал).
3. Вид глагола: perfective/imperfective в нарративных цепочках
Проблема. Категория вида — главная грамматическая ловушка русского как целевого: en Past Simple совместим и с «прочитал», и с «читал»; ja/zh маркируют аспект иначе (〜ていた, 了/过/着) и не изоморфно. В нарративе вид кодирует фон (имперфектив) vs продвижение сюжета (перфектив); ошибка ломает темп сцены. WMT 2025 фиксирует «misused verb forms» у топ-систем (ACL 2025.wmt-1.61); теория соответствий: Progressive → всегда несов. вид, обратное неверно (Linguisticus, DelightEnglish).
Пример. en: "She read the letter and smiled." (цепочка событий) → MTL: «Она читала письмо и улыбалась» (превращает события в фон: сцена «зависает») → верно: «Она прочитала письмо и улыбнулась». Зеркальный отказ: ja 「彼は一年間タバコを吸っていた」 → MTL «Он покурил год» → верно «Он курил год» (длительность несовместима с перфективом). Ещё частный случай — хабитуалис: "Every morning he drank coffee" → MTL «выпил» → верно «пил».
Почему падают. Выбор вида требует решения «событие или фон» на уровне дискурса, а модель оптимизирует локальную адекватность предложения; в обучающих данных оба вида частотны в похожих контекстах.
Детекция. Детерминированно ловятся только маркеры-конфликты (обстоятельства длительности «весь день/год/долго» + перфектив; «каждое утро/обычно» + перфектив в прошедшем) — дешёвый морфо-гейт с высокой точностью. Основная масса — целевой LLM-судья с узким промптом («проверь цепочки действий в прошедшем: фон/событие») + контрастивный регрессионный набор пар предложений по образцу WMT-suite.
4. Порядок слов и тема-рема: MTL копирует английскую информационную структуру
Проблема. В русском нет артиклей — новизна референта выражается порядком слов: рема тяготеет к концу. Английский держит SVO, новизну несут артикли. MTL сохраняет порядок оригинала → русский текст грамматичен, но информационная структура перевёрнута: новое подаётся как известное. WMT 2025 называет «literal word order carry-overs» типовой ошибкой даже лидеров (ACL 2025.wmt-1.61); классика переводоведения: «A book was lying on the table» — подлежащее-рема требует инверсии в русском (КиберЛенинка: тема и рема в русском и английском, Linguisticus).
Пример. en: "A girl entered the room." (ввод нового персонажа) → MTL: «Девушка вошла в комнату» (читается как «та самая девушка», о которой уже шла речь) → верно: «В комнату вошла девушка». Накопленный эффект сотен таких предложений — то самое «складно, но нечитаемо», на которое жалуются читатели MTL.
Почему падают. Порядок слов оригинала — сильнейший прайминг; информационная структура нигде не размечена; ошибка не наказывается метриками adequacy.
Детекция. Полудетерминированный гейт высокой точности для частного случая: неопределённый артикль у подлежащего в источнике + это же существительное на первом месте в целевом предложении + первое упоминание сущности в главе → флаг «рема в позиции темы». Остальное — монолингвальный редактор-судья (промпт «новое — в конец фразы») + метрика доли предложений, дословно повторяющих порядок источника.
5. Деепричастные обороты с висячим субъектом
Проблема. Русская норма: субъект деепричастия обязан совпадать с подлежащим главного предложения. Английские -ing-обороты, японские тэ-формы и китайские сериальные конструкции такого ограничения не имеют — прямой перенос порождает чеховское «Подъезжая к сией станции… у меня слетела шляпа» (popravilam.com, licey.net).
Пример. en: "Walking down the street, an idea struck him." → MTL: «Идя по улице, ему в голову пришла идея» (субъект «идя» — не «идея») → верно: «Когда он шёл по улице, ему пришла в голову идея» / «По дороге его осенило».
Почему падают. Структурный перенос: модель сохраняет конструкцию оборота, не проверяя кореферентность субъектов; в безличных главных предложениях («ему пришлось», «у меня слетела») ошибка гарантирована.
Детекция. Почти полностью детерминированная — редкий подарок: UD-парсер находит деепричастный оборот; флаг, если главное предложение безличное, либо его подлежащее не кореферентно агенсу деепричастия. Точность правила высокая, автофикс — перестройка в придаточное («когда/пока…») силами дешёвой модели.
6. Несобственно-прямая речь: перенос английского согласования времён
Проблема. Английская несобственно-прямая речь (free indirect discourse) сдвигает времена назад ("Tomorrow was Monday. She would have to face him."). В русском согласования времён нет: внутренняя речь персонажа передаётся «его» временем — настоящим/будущим (Purdue CLCWeb: Indirect Discourse in German, Russian, and English — русский дискурс «untransposed»). MTL переносит бэкшифт буквально → временной хаос и потеря «внутреннего голоса».
Пример. en: "Tomorrow was Monday. She would have to face him." → MTL: «Завтра был понедельник. Ей придётся встретиться с ним» (грамматическая бессмыслица «завтра был» + рваный вид) → верно: «Завтра понедельник. Придётся встретиться с ним».
Почему падают. FID не имеет поверхностных маркеров (ни кавычек, ни «подумала, что»); распознание, что абзац — мысль персонажа, требует нарративного анализа.
Детекция. Дешёвая эвристика-детектор кандидатов: дейксис «завтра/сегодня/вчера/сейчас» + прошедшее время связки/модальность в повествовании → флаг «возможная НПР». Разбор флага — LLM-судья («это мысль персонажа? перепиши в непереносённом времени»). Полная проверка — только человек на выборке.
7. Pidgin, акценты и диалекты персонажей: нормализация или гротеск
Проблема. Речевые отклонения (иностранный акцент, деревенский говор, кансай-бэн, ломаный язык) — часть характеризации. MTL либо нормализует всё в гладкий литературный русский (персонажи неразличимы; это персонажный уровень тех же «normalization bias», что описаны в doc 07), либо буквально коверкает фонетику до нечитаемости. Русская школа решает компенсацией: просторечная лексика, синтаксис, словечки — а не фонетическое письмо (КиберЛенинка: компенсация при переводе диалектизмов в «Пигмалионе», способы передачи просторечий, на материале Акунина, ТГУ: передача акцентов английского).
Пример. en: "Ah ain't never seen nothin' like it." → MTL: «Я никогда не видел ничего подобного» (нормализовано, деревенщина заговорил как профессор) → верно: «Отродясь такого не видал». ja (кансай): 「なんでやねん!」 → MTL: «Почему это!» → по речевому профилю: «Да ты гонишь!» (компенсация разговорностью, политика проекта).
Почему падают. Нестандартная орфография источника токенизируется плохо; модель обучена «чистить» шум; удержать один и тот же идиолект на протяжении 500 глав без внешней памяти невозможно.
Детекция. (1) Поле речевого профиля персонажа в series bible: marked_speech: тип (диалект/акцент/пиджин), стратегия компенсации, лексикон-якоря; (2) детерминированный сигнал: в источнике у реплики есть орфографические девиации/диалект-маркеры, а реплика в целевом тексте — 100% нормативна → флаг «стёрта характеризация»; (3) судья сравнивает реплики персонажа с его профилем.
8. Мат и грубость: недожим и пережим регистров
Проблема. Регистры не изоморфны: английский mat-аналог легитимен в дружеской речи и в разговоре с начальством, русский мат — жёсткое табу и с 2014 г. законодательно ограничен в литературе (маркировка 18+/плёнка) (Habr/EnglishDom: почему fuck переводится как «чёрт», КиберЛенинка: ненормативная лексика в «Дневнике Бриджит Джонс»). Отказы двух полюсов: недожим — safety-tuned LLM самовольно санирует («беззубый» наёмник); пережим — буквальный мат там, где в оригинале почти нейтральное shit/damn или японское くそ.
Пример. en (жёсткий криминальный триллер): "What the fuck is this?" → MTL-недожим: «Что за чёрт?» → по политике «грубость без мата»: «Это что ещё за херня?»; по политике «18+, мат разрешён» — жёстче. Обратный кейс: ja くそっ (досада школьника) → MTL-пережим: мат → верно: «Чёрт!/Блин!».
Почему падают. RLHF-санитайзинг + отсутствие в промпте политики регистра + незнание модели, что русская обсценная шкала сдвинута относительно английской.
Детекция. Детерминированный двусторонний гейт: лексиконы обсценности источника и цели с грубой шкалой силы (0–3); скор реплики в оригинале vs в переводе; расхождение >1 ступени → флаг. Политика в translation brief: profanity: запрещён/эвфемизация/разрешён (18+) + допустимый максимум по персонажу (профиль грубости в series bible). Судья решает только флаги.
9. Звукоподражания и междометия: транслит-англицизмы
Проблема. У русского собственная система междометий (ой, ай, ух ты, ого, фу, тьфу, эх, ба!); MTL тащит транслит английских/японских: «Ауч!», «Упс!», «Вау!», «Угх», «Хах», «Ара?» (яп. あら). Единичные — допустимая разговорность (для современного YA «вау» легитимен), системные — маркер машинного перевода. Словарные соответствия тривиальны: ouch → «ой!/ай!» (Cambridge Dictionary, обзор функций междометий: YES Center).
Пример. en: "Ouch! That hurt!" → MTL: «Ауч! Это было больно!» (двойной отказ: транслит + калька-перфект) → верно: «Ай! Больно же!». ja: 「えっ?」 → MTL: «Э?» приемлемо, «Эх?» — нет (смешение с русским «эх» = сожаление).
Почему падают. Токен-уровневая близость транслита; в веб-корпусах фанперевода транслит частотен — модель считает его нормой.
Детекция. Полностью детерминированная: блок-лист транслит-междометий (ауч, упс, воу, угх, хах, мда-а по паттернам…) с per-project allowlist; regex на латиницу и «осколки» ромадзи в целевом тексте. Автозамена по словарю соответствий + подтверждение дешёвой моделью по контексту (боль/удивление/досада).
10. Оформление диалогов и прямой речи: английская пунктуация
Проблема. Русская норма: реплики с абзаца вводятся тире, кавычки для реплик не используются; авторские слова внутри реплики оформляются по жёстким схемам (запятая/точка + тире, строчная у «сказал») — Розенталь §47–52 (old-rozental.ru §47, §52 диалог), академический Лопатин (orthographia.ru), свод на Грамоте.ру. MTL воспроизводит английское: "…," she said — кавычки, запятая внутри кавычек, дефис вместо тире, прописная после атрибуции. Для читателя это сигнал «машинный текст» с первой страницы; жалобы на оформление диалогов — в числе типовых у читателей нейропереводов (Фантлаб, тред «Переводы и переводчики. Нейроэнтузиасты»).
Пример. en: "I'm tired," she said. "Let's go home." → MTL: «"Я устала," - сказала она. "Пойдем домой."» → верно: «— Я устала, — сказала она. — Пойдём домой.»
Почему падают. Пунктуационная схема — самый частотный паттерн обучающих данных (англоязычных); правила Розенталя составные (регистр букв + знак + тире) и модель их знает «в среднем», но не выдерживает на объёме.
Детекция. Стопроцентно детерминированная: линтер прямой речи (regex + конечный автомат): запрет " и “ в диалогах, em-dash (—, U+2014) + пробел в начале реплики, паттерны «, — сказал» / «. — Сказал» по схемам Розенталя, знак вопроса/восклицания перед тире без запятой. Автофикс без LLM; это обязательный post-pass Proofreader-а из doc 07, вынесенный в код.
11. Буква ё: политика и консистентность
Проблема. По правилам ё факультативна, но обязательна: где возможно неверное чтение (все/всё, узнаем/узнаём, совершенный/совершённый, небо/нёбо), в редких словах и в именах собственных; в детских книгах — последовательно везде (Грамота.ру: употребление ё; Минпросвещения в 2022 предлагало закрепить необязательность — РБК). LLM выдаёт смесь: половина слов с ё, половина без, в т.ч. в одном и том же имени (Пётр/Петр, Сюэ/Сюе) — непоследовательность хуже любой из двух политик.
Пример. MTL: «Он понял, что все пропало» (все или всё?); в гл. 3 «Ким Ёнхо», в гл. 7 «Ким Енхо». Верно: политика проекта ё: везде | только обязательные + единая форма имён по глоссарию.
Почему падают. В корпусах оба написания; модель не удерживает выбор между сэмплами/главами.
Детекция. Полностью детерминированная: ёфикатор по словарю (существующие open-source словари ёфикации) + режим проекта; консистентность имён — сверка с глоссарием (транскрипционные поля уже есть в doc 07); отдельный флаг на омографы (все/всё, узнаем/узнаём) — там ё обязательна при любой политике.
12. Феминитивы: регистровая маркированность и жанровая уместность
Проблема. Традиционные феминитивы (учительница, актриса, княжна) нейтральны; «новые» (авторка, докторка, блогерка) идеологически маркированы — положительно их воспринимают лишь ~9% россиян (Sostav/ВЦИОМ-опрос, обзор словообразования: Лайфхакер, дискуссия: Коммерсантъ). MTL то вставляет маркированный феминитив в псевдосредневековое фэнтези («докторка осмотрела рану»), то теряет род в согласовании («врач сказал» о героине, которую читатель знает как женщину).
Пример. en: "The doctor entered. She looked tired." → MTL-вариант 1: «Вошла докторка» (регистровый сбой для большинства жанров) → верно: «Вошла врач. Вид у неё был усталый» (норма «врач сказала» допустима) или жанровое «лекарка/целительница» для фэнтези по глоссарию.
Почему падают. Модель усредняет конфликтующие узусы (соцсети vs издательская норма) и не знает жанровой политики проекта.
Детекция. Лексикон маркированных неофеминитивов (детерминированный флаг) + политика в brief (феминитивы: традиционные | новые | избегать) + поле глоссария: для каждой профессии/титула женского персонажа — выбранная форма («воительница», «магичка» vs «женщина-маг» vs общий род). Согласование пола референта с глагольными формами проверяет тот же морфо-гейт, что в режиме 1.
Выводы для TextMachine
- Три яруса детекции ложатся на архитектуру напрямую. Детерминированные гейты (почти бесплатно, до/вместо LLM): линтер прямой речи (реж. 10), ёфикатор + омографы (11), блок-лист транслит-междометий (9), парсер висячих деепричастий (5), двусторонний скорер обсценности (8), детектор ты/вы-флипов (2), морфо-контроль рода по глоссарию (1, 12), маркеры-конфликты вида (3, частично). Поля глоссария/series bible: род с состоянием
hidden(до гл. N), журнал ты/вы-событий, речевой профиль + стратегия компенсации (7), профиль грубости персонажа (8), формы феминитивов по профессиям (12). LLM-судьи с узким мандатом: цепочки вида (3), тема-рема (4), несобственно-прямая речь (6), «стёртая характеризация» (7). - Протокол «неизвестный род» — уникальная фича для zh/ja-новелл с сокрытием пола: пометка
hiddenв глоссарии переключает переводчика-агента в режим безродовых конструкций (перестройка/настоящее время/безличность по гайду ООН), а морфо-гейт делает утечку рода блокером сборки главы. Ни один конкурент из doc 02 этого не делает. - Дешёвый пост-пасс «механика» (реж. 9–11) убирает самые узнаваемые читателем признаки MTL без единого вызова LLM — его стоит включить даже в самый дешёвый тариф: это максимум воспринимаемого качества за минимум денег.
- Контрастивный регрессионный набор по образцу WMT fine-grained suite (465 заданий / 55 явлений): каждый режим выше даёт шаблон тест-кейсов «оригинал → ловушка → эталон» для пар en/zh/ja→ru; прогонять при смене моделей/промптов. Приоритет по частоте×заметности: 10, 1, 3, 4, 2.
- Наименее решаемые LLM-ом режимы (3, 4, 6) — аргумент за пайплайн doc 07 «подстрочник + стилист»: аннотированный подстрочник должен нести пометы
[событие|фон]для глагольных цепочек,[новый референт]для тема-ремы и[внутренняя речь]для НПР — тогда стилист получает информационную структуру явно, а не угадывает её.
Источники
- WMT 2025 fine-grained en→ru test suite: ACL Anthology 2025.wmt-1.61
- Гендер в MT: Savoldi et al., TACL; WMT 2020 Gender Coreference (ru «unknowns»); UN: гендерно-нейтральный русский; APNI: трансформация гендера персонажей; Литинститут: повествовательное время
- Ты/вы: КиберЛенинка: thou/you в художественных текстах; Яндекс Кью: «давай перейдём на ты» в переводах
- Вид и порядок слов: КиберЛенинка: тема и рема в русском и английском; Linguisticus: актуальное членение; DelightEnglish: вид в английском
- Деепричастия: popravilam.com; licey.net
- НПР: Purdue CLCWeb: Indirect Discourse in German, Russian, and English
- Диалекты/компенсация: КиберЛенинка: компенсация («Пигмалион»); Филологические науки: просторечия (Акунин); ТГУ: передача акцентов
- Мат: Habr/EnglishDom: fuck → «чёрт»; КиберЛенинка: «Дневник Бриджит Джонс»
- Междометия: Cambridge Dictionary: wow; YES Center: междометия
- Прямая речь: Розенталь §47, §52; Лопатин/orthographia.ru; Грамота.ру
- Буква ё: Грамота.ру: употребление ё; РБК
- Феминитивы: Sostav: отношение россиян; Лайфхакер; Коммерсантъ
- Жалобы читателей: Фантлаб: «Переводы и переводчики. Нейроэнтузиасты, объединяйтесь!»