Commit owner's V1-V3 brief additions and two externally sourced failure-mode notes with provenance headers pending origin confirmation
This commit is contained in:
parent
b1d54b6103
commit
f14eff45dc
14 changed files with 1509 additions and 5 deletions
|
|
@ -1,10 +1,11 @@
|
|||
Стартуем новый проект. Идея у меня такая: реализовать бэкенд c фронтендом переводов крупных текстов, то есть книг (прицелюсь пока что в японские/китайские/английские ранобэ и вебновеллы), который будет ходить в ИИ апи для того чтобы переводить поп культурный текст.
|
||||
Идея у меня такая: реализовать бэкенд c фронтендом переводов крупных текстов, то есть книг (прицелюсь пока что в японские/китайские/английские ранобэ и вебновеллы), который будет ходить в ИИ апи для того чтобы переводить поп культурный текст.
|
||||
|
||||
Значит я хочу в целом анализ этого рынка отдельно, чтобы понять перспективы, мои идеи, возможность продать такой софт и нужен ли он вообще хоть кому-то и какой на него спрос.
|
||||
Я хочу в целом анализ этого рынка отдельно, чтобы понять перспективы моих идеи, возможность продать такой софт и нужен ли он вообще хоть кому-то и какой на него спрос, ну и понять маржинальность.
|
||||
|
||||
Главная цель -- максимальное качество и решение проблемы "нехудожественности" ИИ-переводов, стоит подойти креативно к вопросу, возможно применить какие-то мльные математические подходы дообучения под конкретную книгу, интернет ресерча для перевеода конкретной книги, сосдених бэкендов которые будут выполнять какую то совсем другую работу и тп.
|
||||
Главная цель проекта -- максимальное качество и решение проблемы "нехудожественности" ИИ-переводов используя ИИ-перевод (вот так противоречиво, да), стоит подойти креативно к вопросу, возможно применить какие-то мльные математические подходы дообучения под конкретную книгу, интернет ресерча для перевеода конкретной книги, соседних бэкенду тулзов, которые будут выполнять какую то совсем другую работу по переводу, возможно вызов каких-то скиллов как у агентов и тп.
|
||||
|
||||
Набор немного разрозненных идей V0
|
||||
|
||||
Набор немного разрозненных идей таков:
|
||||
1) построить пайплайн из разных агентов
|
||||
2) агенты будут выступать в разных ролях: судьи, переводчики, редакторы, консультанты поп культуры, писатели, языковые анализаторы и другие возможны роли если ты понимаешь в этом лучше меня
|
||||
3) построить пайплайн из дешевых агентов, чтоб перевод книги не превращался в дикую стоимость по цене
|
||||
|
|
@ -46,4 +47,37 @@ hello my dear
|
|||
36) я за переиспользуемые решения, по тому же решению банка памяти или глоссария использовать что то готовое или перетянуть готовое решение вроде MemPalace или его форкнуть, допилить, оценить
|
||||
37) тебе доступны вообще все тулзы на этом компьютере: вебфетч, gh, просмотр репозиториев, клонирование в /tmp и так далее, делай что захочешь чтоб достигнуть цели
|
||||
|
||||
Мысли получились довольно сумбурные, плюс я накидывал по мере вдохновения, возможно я где-то мог ошибиться, можешь меня поправлять. В целом я тебя нигде и ни в чем не ограничиваю, полная творческая свобода с учетом задачи, выслушаю предложения, гипотезы, твои сомнения и критику, можешь сам дополнить перечисленные пункты, перефразировать их, синтезировать и придумать свои, так же я думаю стоит выделать некоторые пункты жирным курсивом и уделить им максимум внимания, потому что какие-то из них будут определять или могут неожиданным образом определить качество таких переводов. Сам промт у меня получился довольно большой и очень много задач, которые возможно будут решаться аж несколькими сессиями воркфлоу, которые я могу в принципе запустить и отдельно в отдельных окнах vs code. Ты на данный момент центральный судья с которого вообще весь проект стартует как гипотеза. Думаю по мере исследований стоит завести в проекте отдельную папку где будет сохранятся какой-то прогресс аля документация, возможно первое форкфлоу стоит отдать приоритетным пунктам MVP а по ходу мне ты можешь выдать промт где я в другом окне стартану другую сессию которая будет в эти же доки параллельно контрибьютить или последовательно можем передать эти дела, в общем как тебе удобно чтоб не забивать контекст так как он у тебя ограничен. Но в целом у нас тут стартует для начала такая MVP-сессия прицел в подобное приложение и перспективы его продажи на рынки ru/en переводчиков, копирайтеров и редакторов.
|
||||
Мысли получились довольно сумбурные, плюс я накидывал по мере вдохновения, возможно я где-то мог ошибиться, можешь меня поправлять. В целом я тебя нигде и ни в чем не ограничиваю, полная творческая свобода с учетом задачи, выслушаю предложения, гипотезы, твои сомнения и критику, можешь сам дополнить перечисленные пункты, перефразировать их, синтезировать и придумать свои, так же я думаю стоит выделать некоторые пункты жирным курсивом и уделить им максимум внимания, потому что какие-то из них будут определять или могут неожиданным образом определить качество таких переводов. Сам промт у меня получился довольно большой и очень много задач, которые возможно будут решаться аж несколькими сессиями воркфлоу, которые я могу в принципе запустить и отдельно в отдельных окнах vs code. Ты на данный момент центральный судья с которого вообще весь проект стартует как гипотеза. Думаю по мере исследований стоит завести в проекте отдельную папку где будет сохранятся какой-то прогресс аля документация, возможно первое форкфлоу стоит отдать приоритетным пунктам MVP а по ходу мне ты можешь выдать промт где я в другом окне стартану другую сессию которая будет в эти же доки параллельно контрибьютить или последовательно можем передать эти дела, в общем как тебе удобно чтоб не забивать контекст так как он у тебя ограничен. Но в целом у нас тут стартует для начала такая MVP-сессия прицел в подобное приложение и перспективы его продажи на рынки ru/en переводчиков, копирайтеров и редакторов.
|
||||
|
||||
Идеи которые возникли постфактум V1, 06.07.2025
|
||||
|
||||
1) что человечество и академическая среда знает об математическом и лингвистическом анализе книг? Например поможет ли нам какой-то без ллмный анализатор книги перевод? Для банка памяти? Что мы тут обсчитать можем, например количество слов, глав, абзацев. Можем посчитать количество повторяемых слов например сколько упоминается раз то или иное имя. Могут ли нам помочь эти данные в переводе (банк памяти)? В валидации перевода когда бэкенд полностью отработал? Не пропустили ли мы какую то главу? И так далее, это всего лишь примеры, если тут можно найти какое-то совершенно другое применения или другие примеры -- то стоит попробовать
|
||||
2) как лучше всего промтить в модели? При переводе будет залетать наверное в модель сам оригинальный текст, какие-то референсы из банка памяти и так далее. Так вот как лучше всего составить промт чтоб модель не галлюцинировала, все запомнила и ничего не выкинула? Возможно стоит исследовать фронтир промтинга, рекомендации конкретных провайдеров, гайды и находки юзеров. Опять же академические исследования промтинга в большие модели? Для перевода текста? Ну вот например в модель загружают чанк для перевода монолог рассказчика, возможно какие-то диалоги между персонажами, в целом из куска который загружен в модель довольно трудно понять как перевести соблюдая контекст, который есть у читателя (те же голоса персонажей), стоит вот тут как либо определять личность персонажа в банке памяти, вызывать нейросеть с этой метадатой, короче говоря банк памяти -- это просто словарь переведенных слов? или уже нечто большее для качественного перевода при чанковании?
|
||||
3) как валидировать качество перевода и его художественность? Очевидно нужно как-то понимать влияние технических решений, например того же промтинга или занесения в банк памяти на само качество перевода. Что если какое то техническое решение наоборот ухудшает, а не улучшает качество?
|
||||
4) что академия знает и что мы от них перетащили в качестве знаний о языках и их стиле письма? Ну привожу пример: часто в китайских новеллах главы пишутся короткими и в особенности абзацы, у европейских языков такой традиции нет, европейские книги пишутся не построчно как китайские иероглифы, а нормальными крупными абзацами и структурироваными диалогами. Что мы тут должны делать и как переводить так чтобы текст становился более читаемым для привычных структур и языковых кострукций других языковых культур?
|
||||
5) что делать если сам оригинальный текст написан очень слабо с художественной точки зрения и мысли? Стоил ли ее подправлять и справятся ли с этим модели?
|
||||
6) тест моделей на редактуру и художественный стиль бы уже проведен. Но есть вопрос: сравнивались популярные тексты, что если эти крупные модели уже его и так знали, видели и понимали как переводить? Как разные модели будут переводить и редактировать совершенно им незнакомый текст? Но самое интересное как они переведут какое-нибудь вообще новое выдуманное или составленное слово самим автором? Или соединенное из разных других слов? Может быть взятые из другого языка? Или которое является исковерконным словом другого языка, скажем более древнего? Этот пункт возможно стоит занести в документацию где юзеры жалуются на ИИ перевод.
|
||||
7) какие филосовские исследования есть на тему ответов модели и промтинга в нее? Это в тему решения проблемы художественной составляющей перевода. Как заставить модель сотворить что-то что подобно человеческой мысли и пониманию. Есть ли тут лингвофилосовские исследования последние?
|
||||
8) что насчет параметров моделей при запросе? В текущей вариации реализации eval сессия тестировала разные параметры и как они влияют главным образом на художественность перевода? Хватило ли нам тестов?
|
||||
9) что мы знаем насчет эры до ии перевода и его качества? до этого многие текста переводились обычными алгоритмами, можем ли мы применить оттуда какое-то решение? только за этим нужно внимательно следить, чтобы оно не уронило качество
|
||||
|
||||
Выше дополненые пукнты содержат много примеров. На примерах не надо зацикливаться и это крайне важный поинт всего проекта и затеи. Понятное дело что сложные системы состоят из многих решений, которые закрывают конкретные проблемы и пробелы друг друга. Но речь о том чтобы не зацикливаться на конкретных примерах потому что их вспомнил я, а есть куча других примеров которых я не вспомнил, не понимаю или не вижу еще пачку другую проблем и поэтому не могу привести по ним примеры. Поэтому было бы неплохо если бы ты помог мне в классификации или сам додумался до проблемных мест перевода меж двумя языками. Считаю это приоритетом идей V1. Так же насчет научных исследований -- научные статьи это хорошо, но мы практики, и нам нужны практические решения, которые работают, так что возможно академия для нас может быть вредна, но это надо еще доказать или проверить гипотезы которые они выдвигают, возможно уже в планах строить бэкенд так, чтобы иметь возможность проводить АБ тесты (но это наверное на сильное будущее)
|
||||
|
||||
Идеи V2 не касающиеся самого перевода
|
||||
|
||||
1) что касается бэкенда у нас планируется какая-то функциональность которая предотвращает абъюз моделей? Очевидно что у нас цель переводить книги и текста на другие языки, будет досадно если в книгу кто-то вставит абузивный промт или атаку. Особенно досадно если прямо под самый конец, жечь токены ради абъюза не хочется. Есть ли какой то вариант не тратя токены понять что нас миссюзают (делают что-то заточенное не на перевод, например написать код) или атакуют? Желательно дешевый и крайне точный с минимум false positive.
|
||||
2) ну и насчет генерации книги, думаю стоит так же предусмотреть вариант остановки всего пайплайна, не знаю предусмотрено это где то в планах по бэкенду. по разным причинам, будь то команда от юзера или сигнал какой-то изнутри самого пайплайна перевода. и как остановка так и кнопка продолжения (разумеется абъзивный промт нельзя продолжить)
|
||||
3) так же есть ли у нас ограничения по входу? очевидно что загружать 4 тома войны и мир, хотя это не много наверное, в общем тут надо в бэкенде какую то настроечку сделать, может котороая будет считать входные токены для книги
|
||||
|
||||
Идеи V3 пайплайна перевода
|
||||
|
||||
1) как мы можем понять что вышеперечисленные идеи и пункты или приемы в ходе реализации улучшают, а не ухудшают качество перевода? стоит ли что-нибудь пересмотреть или кардинально протестировать чтобы отсеять мусор? docs/research/12-architecture-as-antipattern.md
|
||||
2) как мы будем самоулучшаться? очевидно что при переводах больших книг количество текстов просто огромно, и разбираться в нем и тратить редакторский ресурс человека дорого, может приводить к ошибкам и так далее
|
||||
3) из пункта 2 у меня следует крайнее радикальное предложение: так как бэкенд ориентирован в основном на дешевые модели и судью среднего качество, что если мы встроем в часть пайплайна фронтир модель которая очень много знает? вероятным кандидатом мне видится или дорогой гемини или чатгпт, сами модели в переводе учавствовать не будут, но вот возможно проанализировать перевод и просигнализировать нам в лог или отдельный отчет по генерации книги вполне себе могут, из этого отчета можно вытаскивать буллеты и точечно понимать фиксы для пайплайна, тут я думаю остается только маневр для выбора модели и режима ее размышлений (chathpt 5.5?), плюс промт ей нужен качественный который погрузит в основные механизмы, так чтобы она понимала что и откуда идет. поэтому это будет не модель судья, а модель судья над судьей и пайплайном в целом. оцени эту идею, как тебе она?
|
||||
4) Отдельно стоит отметить распространенные проблемы docs/research/12-common-failures.md ИИ-перевода, нужно придумать какими
|
||||
|
||||
Выводы проекта. Считаю что надо отметить две центральные ранее озвученные не просто идеи к которым мы стремимся, а это считай все ради чего мы затеяли это все.
|
||||
1) устранить потерю контекста при переводе, с этим нам поможет банк памяти (тут на самом деле вообще не важно что нам поможет в этом), так вот решение вокруг "банка памяти" должно быть крайне точным, так как даже 1 ошибка в переводе текста может быть для читателя фатальной чтоб закрыть перевод перевод книги и сочти решение не зрелым
|
||||
2) художественность и смыслы, понятное дело что оценить художественность довольно трудно, но неполноценность ИИ-переводов обосновать можно: у ИИ просто напросто нет всего контекста, модели не могут додумать то чего не знаю или попытаться понять, иногда написанное в книге лежит за пределами самой книги и модель не может сложить воедино паззл, так вот помимо валидатора пайплайна который вызывается редко чтоб оценить перевод, возможно стоит так же редко вызывать модель на крайне узком специализированном участке перевода который и будет решать 1 раз за книгу эту диллему. но это лишь предложение и примеры, всегда к ним можно критически отнестись или предложить что то другое более эффективное
|
||||
Возможно две перечисленные основные задачи стоит поставить eval сессии чтоб она точками выдернула механизмы пайплайна и верифицировала их и оценила влияние, так же нужно чтоб валидировалось не только положительное но и пагубное влияние каких то решений.
|
||||
|
||||
|
|
|
|||
1077
docs/research/12-architecture-as-antipattern.md
Normal file
1077
docs/research/12-architecture-as-antipattern.md
Normal file
File diff suppressed because it is too large
Load diff
393
docs/research/12-common-failures.md
Normal file
393
docs/research/12-common-failures.md
Normal file
|
|
@ -0,0 +1,393 @@
|
|||
# 12-common-failures. Классы ошибок автоматического перевода больших текстов (внешний материал)
|
||||
|
||||
> ⚠ **ПРОВЕНАНС НЕ ЗАФИКСИРОВАН (шапка добавлена оркестратором 09.07.2026).** Текст ниже — вставленный ответ внешней LLM, полученный владельцем (модель/промпт/дан ли контекст проекта — не записано; **владельцу: уточнить**). Ноль ссылок на источники — числа и категоричные формулировки НЕ абсорбировать как факты без верификации. Разбор против нашей карты отказов — `../architecture/07-strategic-review.md` §4.1: ~85% дублирует заземлённые каталоги `12-failure-modes-*`; уникально ценное: §16 «особо опасные для публикации» (готовый чек-лист golden-кейсов регрессионного сьюта — принят в план Ф2) и §13 (структурные потери EPUB: сноски/стихи/ссылки).
|
||||
|
||||
Ниже именно **конкретные классы ошибок**, которые возникают при полностью автоматическом переводе больших художественных текстов.
|
||||
|
||||
## 1. Потеря смысла
|
||||
|
||||
* **Пропуск фразы или части предложения.**
|
||||
Модель может не перевести короткое уточнение, отрицание, вводную конструкцию или реплику внутри длинного абзаца.
|
||||
|
||||
* **Потеря отрицания.**
|
||||
`He did not seem surprised` превращается в «Он, кажется, удивился».
|
||||
|
||||
* **Ослабление или усиление утверждения.**
|
||||
`might`, `perhaps`, `almost`, `barely`, `apparently` переводятся как уверенные факты.
|
||||
|
||||
* **Подмена причинно-следственной связи.**
|
||||
«Он ушёл, потому что испугался» может превратиться в «Он испугался после того, как ушёл».
|
||||
|
||||
* **Неверное разрешение местоимений.**
|
||||
Модель неправильно определяет, к кому относятся `he`, `she`, `it`, `they`, особенно если в сцене несколько персонажей.
|
||||
|
||||
* **Перепутанный субъект действия.**
|
||||
В оригинале ударил Иван, а в переводе — Пётр.
|
||||
|
||||
* **Перепутанная последовательность действий.**
|
||||
Особенно часто в сценах боя, погони, секса, сложной хореографии или флешбэках.
|
||||
|
||||
* **Потеря двойного смысла.**
|
||||
Модель выбирает одно толкование там, где автор намеренно оставляет двусмысленность.
|
||||
|
||||
* **«Исправление» сюжетной нелогичности.**
|
||||
Если автор намеренно вводит читателя в заблуждение, модель может сделать текст более логичным и тем самым раньше времени раскрыть интригу.
|
||||
|
||||
## 2. Несогласованность на дистанции книги
|
||||
|
||||
* **Имя переводится по-разному в разных главах.**
|
||||
Например: Джон Сноу / Джон Сно / Иоанн Сноу.
|
||||
|
||||
* **Меняется транслитерация.**
|
||||
`Xia` становится то «Ся», то «Сиа», то «Ксиа».
|
||||
|
||||
* **Плавают титулы и обращения.**
|
||||
Один персонаж называется «господин», «сэр», «мастер», «учитель» без сюжетной причины.
|
||||
|
||||
* **Меняется род персонажа.**
|
||||
Особенно в языках, где пол долго не указан явно.
|
||||
|
||||
* **Персонажи внезапно переходят с «ты» на «вы» и обратно.**
|
||||
|
||||
* **Термины мира переводятся по-разному.**
|
||||
Название заклинания, организации или артефакта в каждой главе получает новый вариант.
|
||||
|
||||
* **Забывается ранее принятое решение.**
|
||||
В первой главе прозвище оставили без перевода, в пятой начали переводить.
|
||||
|
||||
* **Нарушается терминология серии.**
|
||||
В новом томе используются названия, несовместимые с предыдущими переводами.
|
||||
|
||||
* **Путаются родственные связи.**
|
||||
Дядя становится братом, сводная сестра — двоюродной.
|
||||
|
||||
* **Путается хронология.**
|
||||
«Три года назад» в одной главе и «два года назад» в другой, хотя в оригинале значение одинаковое.
|
||||
|
||||
## 3. Потеря голосов персонажей
|
||||
|
||||
* **Все персонажи начинают говорить одинаково.**
|
||||
Старик, ребёнок, солдат и аристократ получают один нейтрально-литературный голос.
|
||||
|
||||
* **Исчезают речевые дефекты.**
|
||||
Заикание, просторечие, ошибки, обрывки фраз и неправильная грамматика «исправляются».
|
||||
|
||||
* **Стираются социальные различия.**
|
||||
Бедный рабочий и университетский профессор используют одинаковую лексику.
|
||||
|
||||
* **Пропадает индивидуальная манера речи.**
|
||||
Один персонаж всегда говорит коротко, другой многословно — перевод это усредняет.
|
||||
|
||||
* **Меняется степень грубости.**
|
||||
Резкая реплика становится вежливой или, наоборот, нейтральная — агрессивной.
|
||||
|
||||
* **Неправильно передаётся субтекст.**
|
||||
Сарказм переводится как искреннее утверждение.
|
||||
|
||||
* **Ирония объясняется напрямую.**
|
||||
Там, где читатель должен догадаться, перевод делает смысл явным.
|
||||
|
||||
## 4. «Сглаживание» авторского стиля
|
||||
|
||||
* **Сложный текст становится проще.**
|
||||
|
||||
* **Короткие рубленые фразы объединяются в нормальные предложения.**
|
||||
|
||||
* **Длинные тяжёлые предложения разбиваются и становятся удобнее для чтения.**
|
||||
|
||||
* **Намеренные повторы удаляются как стилистическая ошибка.**
|
||||
|
||||
* **Необычный порядок слов нормализуется.**
|
||||
|
||||
* **Грубый или неуклюжий авторский стиль становится красивым.**
|
||||
|
||||
* **Исчезает ритм прозы.**
|
||||
|
||||
* **Метафоры заменяются более очевидными.**
|
||||
|
||||
* **Редкие слова заменяются распространёнными.**
|
||||
|
||||
* **Слишком часто добавляются стандартные связки:**
|
||||
«тем временем», «однако», «внезапно», «поэтому», которых не было в оригинале.
|
||||
|
||||
Итог — текст звучит гладко, но **не как конкретный автор**, а как качественная усреднённая LLM-проза.
|
||||
|
||||
## 5. Галлюцинации
|
||||
|
||||
* **Добавляется объяснение, отсутствующее в оригинале.**
|
||||
|
||||
* **Модель вставляет эмоцию:**
|
||||
«сердито сказал он», хотя в оригинале только `he said`.
|
||||
|
||||
* **Добавляется причина действия.**
|
||||
|
||||
* **Добавляется субъект, которого автор намеренно не назвал.**
|
||||
|
||||
* **Восстанавливается якобы пропущенная информация.**
|
||||
|
||||
* **Неизвестная реалия заменяется выдуманной.**
|
||||
|
||||
* **Непонятная фраза переводится правдоподобно, но фактически неверно.**
|
||||
|
||||
Особенно опасно, что такие ошибки обычно **грамматически идеальны** и не выглядят подозрительно.
|
||||
|
||||
## 6. Диалоги
|
||||
|
||||
* **Теряется информация о том, кто говорит.**
|
||||
|
||||
* **Неправильно расставляется прямая речь.**
|
||||
|
||||
* **Реплики двух персонажей объединяются.**
|
||||
|
||||
* **Одна реплика разбивается на две.**
|
||||
|
||||
* **Меняются тире, кавычки и абзацы так, что нарушается структура сцены.**
|
||||
|
||||
* **Внутренняя речь превращается в произнесённую вслух.**
|
||||
|
||||
* **Авторская ремарка включается в реплику.**
|
||||
|
||||
* **Прерывание речи переводится как законченное предложение.**
|
||||
|
||||
* **Многоточие, паузы и недоговорённость исчезают.**
|
||||
|
||||
## 7. Юмор, каламбуры и культурные отсылки
|
||||
|
||||
* **Каламбур переводится буквально и перестаёт быть шуткой.**
|
||||
|
||||
* **Шутка сохраняется по смыслу, но не работает на целевом языке.**
|
||||
|
||||
* **Модель придумывает новую шутку, которая меняет характеристику персонажа.**
|
||||
|
||||
* **Теряется отсылка к фильму, книге, песне или политическому событию.**
|
||||
|
||||
* **Отсылка ошибочно воспринимается как обычная фраза.**
|
||||
|
||||
* **Локальная реалия заменяется неподходящим аналогом.**
|
||||
|
||||
* **Слишком агрессивная локализация.**
|
||||
Американский школьный контекст вдруг становится российским.
|
||||
|
||||
* **Недостаточная локализация.**
|
||||
Формально правильная фраза остаётся непонятной читателю другого языка.
|
||||
|
||||
* **Идиома переводится дословно.**
|
||||
|
||||
* **Придумывается несуществующая идиома целевого языка.**
|
||||
|
||||
## 8. Диалекты и нестандартная речь
|
||||
|
||||
* **Диалект полностью исчезает.**
|
||||
|
||||
* **Диалект заменяется случайным просторечием.**
|
||||
|
||||
* **Региональный говор передаётся как речь малообразованного человека, хотя это не одно и то же.**
|
||||
|
||||
* **Историческая речь становится современной.**
|
||||
|
||||
* **Архаическая речь превращается в карикатурное «сударь, извольте».**
|
||||
|
||||
* **Сленг быстро устаревает или не соответствует возрасту героя.**
|
||||
|
||||
* **Подросток разговаривает как сорокалетний переводчик.**
|
||||
|
||||
* **Неудачная передача акцента выглядит оскорбительно или комично.**
|
||||
|
||||
## 9. Мир, лор и терминология
|
||||
|
||||
* **Говорящее имя переводится без понимания будущего сюжетного значения.**
|
||||
|
||||
* **Название переводится, хотя позднее выясняется, что это имя собственное.**
|
||||
|
||||
* **Имя собственное оставляется без перевода, хотя оно является важной метафорой.**
|
||||
|
||||
* **Модель не замечает систему образования терминов.**
|
||||
Например, все названия орденов образованы по одному шаблону, а перевод делает их разнородными.
|
||||
|
||||
* **Разрушается связь между родственными словами.**
|
||||
В оригинале `Dreamer`, `Dreaming`, `Dreamborn` связаны, а в переводе — три несвязанных термина.
|
||||
|
||||
* **Не учитывается информация из будущих глав.**
|
||||
Термин в начале книги переводится так, что позднее его смысл уже невозможно корректно раскрыть.
|
||||
|
||||
* **Смешиваются официальные и разговорные названия.**
|
||||
|
||||
* **Не сохраняется намеренная неопределённость пола, природы или статуса существа.**
|
||||
|
||||
## 10. Имена, пол и формы обращения
|
||||
|
||||
* **Неверно определяется пол по имени.**
|
||||
|
||||
* **Нейтральное местоимение насильно превращается в мужское или женское.**
|
||||
|
||||
* **Неправильно склоняются иностранные имена.**
|
||||
|
||||
* **Непоследовательно передаются фамилии и отчества.**
|
||||
|
||||
* **Не распознаётся, что два варианта имени относятся к одному человеку.**
|
||||
|
||||
* **Прозвище принимается за отдельного персонажа.**
|
||||
|
||||
* **Титул принимается за имя.**
|
||||
|
||||
* **Фамильярное обращение становится официальным.**
|
||||
|
||||
* **Исчезает социальная дистанция между героями.**
|
||||
|
||||
## 11. Модальность, эмоции и психология
|
||||
|
||||
* **Предположение превращается в факт.**
|
||||
|
||||
* **Внутреннее сомнение превращается в уверенность.**
|
||||
|
||||
* **Раздражение переводится как гнев.**
|
||||
|
||||
* **Страх — как паника.**
|
||||
|
||||
* **Сдержанная симпатия — как любовь.**
|
||||
|
||||
* **Намеренно холодный тон становится эмоциональным.**
|
||||
|
||||
* **Ненадёжный рассказчик начинает звучать объективно.**
|
||||
|
||||
* **Непрямое описание психологии заменяется прямым:**
|
||||
вместо поведения героя модель пишет, что он «почувствовал тревогу».
|
||||
|
||||
Это способно изменить восприятие персонажа и всей сцены без единой очевидной фактической ошибки.
|
||||
|
||||
## 12. Цензура и смещение регистра
|
||||
|
||||
* **Мат смягчается.**
|
||||
|
||||
* **Сексуальные сцены становятся менее прямыми.**
|
||||
|
||||
* **Жестокость описывается эвфемистически.**
|
||||
|
||||
* **Оскорбления заменяются нейтральными словами.**
|
||||
|
||||
* **Наоборот, нейтральная грубость может стать чрезмерно вульгарной.**
|
||||
|
||||
* **Политически или культурно чувствительные фразы переформулируются.**
|
||||
|
||||
* **Неприятные взгляды персонажа смягчаются так, будто это позиция переводчика.**
|
||||
|
||||
## 13. Технические ошибки больших документов
|
||||
|
||||
* **Пропускаются сноски.**
|
||||
|
||||
* **Сноска прикрепляется не к тому месту.**
|
||||
|
||||
* **Теряется курсив, который обозначал мысли или интонационное ударение.**
|
||||
|
||||
* **Исчезают разделители сцен.**
|
||||
|
||||
* **Смешиваются текст главы и колонтитулы PDF.**
|
||||
|
||||
* **Номера страниц попадают в текст.**
|
||||
|
||||
* **Подписи к иллюстрациям переводятся как часть повествования.**
|
||||
|
||||
* **Таблицы ломаются.**
|
||||
|
||||
* **Стихи внутри романа превращаются в обычный абзац.**
|
||||
|
||||
* **Письма, дневники и документы теряют особое форматирование.**
|
||||
|
||||
* **Не сохраняются внутренние ссылки EPUB.**
|
||||
|
||||
* **Повторно переводится уже переведённый фрагмент.**
|
||||
|
||||
* **Из-за ошибки chunking одна фраза переводится дважды или не переводится вообще.**
|
||||
|
||||
## 14. Проблемы многоэтапной ИИ-редактуры
|
||||
|
||||
* **Второй агент исправляет правильный перевод.**
|
||||
|
||||
* **Каждый проход немного удаляет текст от оригинала.**
|
||||
|
||||
* **Редактор предпочитает более красивый, но менее точный вариант.**
|
||||
|
||||
* **Один агент восстанавливает ошибку, которую другой уже исправил.**
|
||||
|
||||
* **Разные агенты используют несовместимые словари.**
|
||||
|
||||
* **Глобальная редактура ломает локальный контекст.**
|
||||
|
||||
* **Модель заменяет редкое слово только ради разнообразия.**
|
||||
|
||||
* **При повторной генерации исправляется один дефект, но появляются два новых.**
|
||||
|
||||
* **Финальный polish стирает различия голосов персонажей.**
|
||||
|
||||
То есть много проходов не гарантируют качество. Без детерминированных проверок они могут просто увеличить количество изменений.
|
||||
|
||||
## 15. Проблемы автоматической оценки качества
|
||||
|
||||
* **Гладкий неправильный перевод получает высокую оценку.**
|
||||
|
||||
* **Буквальный перевод оценивается выше литературно точного.**
|
||||
|
||||
* **LLM-критик предпочитает стиль, похожий на собственный.**
|
||||
|
||||
* **Оценщик не замечает пропуск маленького, но сюжетно важного слова.**
|
||||
|
||||
* **Проверка отдельного абзаца не видит противоречия с предыдущей главой.**
|
||||
|
||||
* **Модель может уверенно заявить, что ошибки нет.**
|
||||
|
||||
* **Два оценщика могут согласиться между собой и оба ошибиться.**
|
||||
|
||||
* **Автоматическая метрика не измеряет голос, ритм, юмор и авторскую интонацию.**
|
||||
|
||||
* **Нет надёжного единого числа вида «перевод готов на 97%».**
|
||||
|
||||
## 16. Особо опасные ошибки для публикации
|
||||
|
||||
Наиболее критичны не корявые предложения, а следующие случаи:
|
||||
|
||||
* пропущено отрицание;
|
||||
* перепутан действующий персонаж;
|
||||
* раскрыт сюжетный секрет;
|
||||
* изменена мотивация героя;
|
||||
* потеряна двусмысленность;
|
||||
* перепутаны родственные связи;
|
||||
* изменён пол или титул;
|
||||
* не переведён абзац;
|
||||
* добавлен факт, которого нет в оригинале;
|
||||
* нарушена хронология;
|
||||
* термин переведён несовместимо с финалом книги;
|
||||
* внутренняя речь стала прямой;
|
||||
* сарказм стал искренней репликой;
|
||||
* авторская намеренная ошибка была «исправлена»;
|
||||
* в серии изменили уже устоявшийся канон.
|
||||
|
||||
## 17. Где ИИ обычно справляется лучше
|
||||
|
||||
Относительно безопасные категории:
|
||||
|
||||
* простое линейное повествование;
|
||||
* современный нейтральный язык;
|
||||
* небольшой состав персонажей;
|
||||
* отсутствие сложной игры слов;
|
||||
* прикладной нон-фикшн;
|
||||
* типовая жанровая проза;
|
||||
* повторяющаяся терминология при наличии словаря;
|
||||
* книги с простой структурой EPUB/DOCX.
|
||||
|
||||
## 18. Где полностью автоматический перевод особенно рискован
|
||||
|
||||
* поэзия;
|
||||
* экспериментальная проза;
|
||||
* сложный юмор;
|
||||
* постмодернистская литература;
|
||||
* поток сознания;
|
||||
* диалекты;
|
||||
* историческая стилизация;
|
||||
* книги с ненадёжным рассказчиком;
|
||||
* детективы с языковыми подсказками;
|
||||
* произведения с большим количеством вымышленных терминов;
|
||||
* длинные циклы;
|
||||
* книги, где важны ритм и синтаксис;
|
||||
* тексты с большим количеством цитат и аллюзий.
|
||||
|
||||
Главная проблема ИИ-перевода сегодня: **он чаще производит не плохой текст, а хороший текст с незаметно изменённым смыслом**. Именно поэтому поверхностная вычитка носителем языка недостаточна — проверяющему нужен доступ к оригиналу и инструменты сопоставления фрагментов.
|
||||
Loading…
Add table
Reference in a new issue