# Промт ресёрч-сессии: доменные харнессы перевода / конкуренты (research/22) **Статус: ВЫДАН 23.07.2026, оркестратор №7.** Роль — ресёрч (полигон-профиль), $0: **не запускать чужие тулзы, ни одного вызова моделей, ключи не трогать**; `backend/` read-only. Сиквел research/21 (там — транспорт агент-CLI; здесь — ПРЯМЫЕ доменные конкуренты: харнессы перевода длинных CJK-текстов). Идёт параллельно пакам-12/13 — зоны не пересекаются. ## Материал (склонировано в `/home/ubuntu/projects/tmp/`, лицензии сверены 23.07) `translation-agent` (Andrew Ng, MIT — reflection-workflow перевода) · `bilingual_book_maker` (MIT — epub-пайплайн книг) · `TransAgents` (Apache-2.0 — мульти-агентная «переводческая компания» для литперевода, CUHK) · `AiNiee` (**AGPL-3.0** — зрелый zh-комьюнити харнесс перевода игр/новелл: словари, батчинг, правила) · `GalTransl` (**GPL-3.0** — VN-харнесс с глоссарий-системой) · `LunaTranslator` (**GPL-3.0** — реалтайм-переводчик с терм-таблицами). **Лицензионная дисциплина:** GPL/AGPL-репо — читать и описывать паттерны МОЖНО, копировать код в textmachine **НЕЛЬЗЯ НИ СТРОЧКИ** (заражение лицензией коммерческого продукта); MIT/Apache — тоже только описание паттернов (наш стандарт research/21). `KeywordGacha` (LLM-экстракция терм-таблиц) — **БЕЗ лицензии, клон удалён**: код НЕ открывать; допустим только онлайн-обзор README/issues на GitHub. **Фаза 0 — веб-свип новичков:** поиском (2025–2026) найти до 3 незамеченных прямых конкурентов (LLM-харнессы перевода веб-новелл/книг, включая коммерческие с открытым кодом); клонировать ТОЛЬКО после проверки лицензии (без лицензии — не клонировать); дополнить материал. ## Наш контекст (читать ДО чужого кода) `CLAUDE.md` → CURRENT-STATE `PROGRESS.md` → `05-decisions-log.md` D39–D39.22 (волны, банк W1.5, майнер, дефект-классы чтения) → `research/19` §волны + `research/20` (банк-майнинг) → `backend/internal/pipeline/{memory,miner_*,chunker,checkers_zh_ru}.go` → `research/16` (ридер-IDE, для Q4). ## Вопросы (каждый — «что берём / что не берём и почему», с маппингом на НАШ механизм) **Q1 — Глоссарий/терминология-системы.** Как AiNiee/GalTransl/LunaTranslator ведут словари: формат записей (род/склонение/скоуп?), приоритеты/конфликты, инъекция в промпт (все термы? релевантные? как отбирают под бюджет?), UX наполнения. Маппинг: наш банк (сид+mined, trust-gate, инъекция под токен-бюджет, editor-constraint). Особо: есть ли у кого пер-термовый РОД/грамматика для флективных языков (наша D39.21-боль) и скоуп-правила (since/until-глава — наш спойлер-блок). **Q2 — Автодобыча терминов.** Чем конкуренты добывают новые термы из текста (LLM-NER? частотка? словари имён?) vs наш детерминированный V-C майнер (n-граммы×c-value×Палладий, recall 0.97, $0). KeywordGacha — ТОЛЬКО по README/issues онлайн. Вопрос-острие: precision-планки и UX подписи у них (наша боль — 13618 кандидатов на полной книге при emitRankCap 200). **Q3 — Длинный текст: батчинг и связность.** Что конкуренты несут между кусками (rolling-контекст? предыдущий перевод? ничего?), размер батча, обработка глав/структуры. Маппинг: наши волны + чанкер output-бюджета + edit-единицы + отвергнутый carryover (exp15: эффекты под шум-полом — проверить, нет ли у них ЭМПИРИКИ, а не веры). **Q4 — Выпуск/форматы.** bilingual_book_maker и др.: epub/билингв-вёрстка, сноски, оглавление. Маппинг: наш `tmctl export` + ридер-IDE (research/16, Ф3) — что пригодится для выпускного формата. **Q5 — Мульти-агентные литературные конвейеры.** TransAgents (роли: senior/junior/localization/proofreader), translation-agent (reflection: translate→critique→improve). Их ЭМПИРИКА качества (что в статьях/README заявлено и чем подтверждено) vs наш draft→edit→judge + Q4a-вывод «слабое звено = редактор». Что в их ролях реально добавляет качество, а что — цирк агентности. **Q6 — Выпускной QA конкурентов.** Правила/чекеры AiNiee/GalTransl (битые плейсхолдеры, обрывы, непереведённые куски, повторы) vs наш пак-13 набор — какие классы дефектов у них есть, а у нас нет. **Q7 — Жалобы пользователей = дефект-классы.** Issue-трекеры всех + KeywordGacha онлайн: на что жалуются люди в LLM-переводах длинных текстов (терм-дрейф? потери? стиль?) — датированный список классов, которых нет в нашем дефект-леджере D39.8/D39.20. ## Метод (жёстко) `repo/file:line` для каждого утверждения о коде; README ≠ код; спорное — вторым местом (call-site/тест); confidence-пометки; мандат самопроверки 12.07 (заглушки синтеза research/21 — живой прецедент). Лицензии в шапке отчёта. НИКАКОГО копирования кода. ## Выход `docs/research/22-domain-harness-survey.md` — НЕ коммитить (лендит оркестратор): (1) топ-рекомендации по импакту с «какая наша метрика двинется»; (2) таблица «есть у них / нет у нас» по Q1/Q2/Q6; (3) per-question разборы; (4) appendix per-repo (лицензия, смотрели/пропустили). + короткое сообщение оркестратору.