39 lines
7.5 KiB
Markdown
39 lines
7.5 KiB
Markdown
# Промт ресёрч-сессии: доменные харнессы перевода / конкуренты (research/22)
|
||
|
||
**Статус: ВЫДАН 23.07.2026, оркестратор №7.** Роль — ресёрч (полигон-профиль), $0: **не запускать чужие тулзы, ни одного вызова моделей, ключи не трогать**; `backend/` read-only. Сиквел research/21 (там — транспорт агент-CLI; здесь — ПРЯМЫЕ доменные конкуренты: харнессы перевода длинных CJK-текстов). Идёт параллельно пакам-12/13 — зоны не пересекаются.
|
||
|
||
## Материал (склонировано в `/home/ubuntu/projects/tmp/`, лицензии сверены 23.07)
|
||
|
||
`translation-agent` (Andrew Ng, MIT — reflection-workflow перевода) · `bilingual_book_maker` (MIT — epub-пайплайн книг) · `TransAgents` (Apache-2.0 — мульти-агентная «переводческая компания» для литперевода, CUHK) · `AiNiee` (**AGPL-3.0** — зрелый zh-комьюнити харнесс перевода игр/новелл: словари, батчинг, правила) · `GalTransl` (**GPL-3.0** — VN-харнесс с глоссарий-системой) · `LunaTranslator` (**GPL-3.0** — реалтайм-переводчик с терм-таблицами).
|
||
|
||
**Лицензионная дисциплина:** GPL/AGPL-репо — читать и описывать паттерны МОЖНО, копировать код в textmachine **НЕЛЬЗЯ НИ СТРОЧКИ** (заражение лицензией коммерческого продукта); MIT/Apache — тоже только описание паттернов (наш стандарт research/21). `KeywordGacha` (LLM-экстракция терм-таблиц) — **БЕЗ лицензии, клон удалён**: код НЕ открывать; допустим только онлайн-обзор README/issues на GitHub.
|
||
|
||
**Фаза 0 — веб-свип новичков:** поиском (2025–2026) найти до 3 незамеченных прямых конкурентов (LLM-харнессы перевода веб-новелл/книг, включая коммерческие с открытым кодом); клонировать ТОЛЬКО после проверки лицензии (без лицензии — не клонировать); дополнить материал.
|
||
|
||
## Наш контекст (читать ДО чужого кода)
|
||
|
||
`CLAUDE.md` → CURRENT-STATE `PROGRESS.md` → `05-decisions-log.md` D39–D39.22 (волны, банк W1.5, майнер, дефект-классы чтения) → `research/19` §волны + `research/20` (банк-майнинг) → `backend/internal/pipeline/{memory,miner_*,chunker,checkers_zh_ru}.go` → `research/16` (ридер-IDE, для Q4).
|
||
|
||
## Вопросы (каждый — «что берём / что не берём и почему», с маппингом на НАШ механизм)
|
||
|
||
**Q1 — Глоссарий/терминология-системы.** Как AiNiee/GalTransl/LunaTranslator ведут словари: формат записей (род/склонение/скоуп?), приоритеты/конфликты, инъекция в промпт (все термы? релевантные? как отбирают под бюджет?), UX наполнения. Маппинг: наш банк (сид+mined, trust-gate, инъекция под токен-бюджет, editor-constraint). Особо: есть ли у кого пер-термовый РОД/грамматика для флективных языков (наша D39.21-боль) и скоуп-правила (since/until-глава — наш спойлер-блок).
|
||
|
||
**Q2 — Автодобыча терминов.** Чем конкуренты добывают новые термы из текста (LLM-NER? частотка? словари имён?) vs наш детерминированный V-C майнер (n-граммы×c-value×Палладий, recall 0.97, $0). KeywordGacha — ТОЛЬКО по README/issues онлайн. Вопрос-острие: precision-планки и UX подписи у них (наша боль — 13618 кандидатов на полной книге при emitRankCap 200).
|
||
|
||
**Q3 — Длинный текст: батчинг и связность.** Что конкуренты несут между кусками (rolling-контекст? предыдущий перевод? ничего?), размер батча, обработка глав/структуры. Маппинг: наши волны + чанкер output-бюджета + edit-единицы + отвергнутый carryover (exp15: эффекты под шум-полом — проверить, нет ли у них ЭМПИРИКИ, а не веры).
|
||
|
||
**Q4 — Выпуск/форматы.** bilingual_book_maker и др.: epub/билингв-вёрстка, сноски, оглавление. Маппинг: наш `tmctl export` + ридер-IDE (research/16, Ф3) — что пригодится для выпускного формата.
|
||
|
||
**Q5 — Мульти-агентные литературные конвейеры.** TransAgents (роли: senior/junior/localization/proofreader), translation-agent (reflection: translate→critique→improve). Их ЭМПИРИКА качества (что в статьях/README заявлено и чем подтверждено) vs наш draft→edit→judge + Q4a-вывод «слабое звено = редактор». Что в их ролях реально добавляет качество, а что — цирк агентности.
|
||
|
||
**Q6 — Выпускной QA конкурентов.** Правила/чекеры AiNiee/GalTransl (битые плейсхолдеры, обрывы, непереведённые куски, повторы) vs наш пак-13 набор — какие классы дефектов у них есть, а у нас нет.
|
||
|
||
**Q7 — Жалобы пользователей = дефект-классы.** Issue-трекеры всех + KeywordGacha онлайн: на что жалуются люди в LLM-переводах длинных текстов (терм-дрейф? потери? стиль?) — датированный список классов, которых нет в нашем дефект-леджере D39.8/D39.20.
|
||
|
||
## Метод (жёстко)
|
||
|
||
`repo/file:line` для каждого утверждения о коде; README ≠ код; спорное — вторым местом (call-site/тест); confidence-пометки; мандат самопроверки 12.07 (заглушки синтеза research/21 — живой прецедент). Лицензии в шапке отчёта. НИКАКОГО копирования кода.
|
||
|
||
## Выход
|
||
|
||
`docs/research/22-domain-harness-survey.md` — НЕ коммитить (лендит оркестратор): (1) топ-рекомендации по импакту с «какая наша метрика двинется»; (2) таблица «есть у них / нет у нас» по Q1/Q2/Q6; (3) per-question разборы; (4) appendix per-repo (лицензия, смотрели/пропустили). + короткое сообщение оркестратору.
|