Revert "Land both parallel harness-topology research reports with review headers, after the author retracted four of five false open-debt labels that I re-verified by command"
This reverts commit 12dedd6414.
This commit is contained in:
parent
12dedd6414
commit
162ab9b24d
3 changed files with 1 additions and 3381 deletions
|
|
@ -38,7 +38,7 @@
|
||||||
2. **Промт холодного прогона движка** (очередь п.2) — НЕ написан; гейт ключей снят словом владельца 30.08.
|
2. **Промт холодного прогона движка** (очередь п.2) — НЕ написан; гейт ключей снят словом владельца 30.08.
|
||||||
3. **`PD-425`** — денежный `major`, взят первым пунктом P12: при приёмке закрыть или пере-диспозиционировать.
|
3. **`PD-425`** — денежный `major`, взят первым пунктом P12: при приёмке закрыть или пере-диспозиционировать.
|
||||||
4. **Вопрос владельцу открыт:** путь к файлу провайдерских ключей ДЛЯ ПЛАТФОРМЫ (`TM_PLATFORM_ENGINE_KEYS_PATH`); формат совпадает с движковым, лечение операционное, проверять прогоном (файлы ключей оркестратор не открывает).
|
4. **Вопрос владельцу открыт:** путь к файлу провайдерских ключей ДЛЯ ПЛАТФОРМЫ (`TM_PLATFORM_ENGINE_KEYS_PATH`); формат совпадает с движковым, лечение операционное, проверять прогоном (файлы ключей оркестратор не открывает).
|
||||||
5. **Ресёрч-сессия `textmachine-36`** написала `docs/research/29-harness-topology-survey.md` (топологии харнесса) — ✅ **ЗАЛЕНДЖЕНО 01.09 оркестратором №22 вместе с парным отчётом Codex `29-harness-topology-survey-codex.md`**; обязательство ЗАКРЫТО. Ратифицировано НИЧЕГО (ресёрч-фактура). Оба файла несут ревью-шапку оркестратора; во второй прямо объявлено, что по существу он НЕ вычитан. ⚠ Что приёмка добыла сверх лендинга: сессия по запросу выгрузила в §9 своего файла ВСЕ 66 неотработанных находок приёмки (49 ВАЖНОЕ + 17 мелочей) — иначе они умерли бы с сессией, как ~161 минор смены №21; и сама же нашла в этой выгрузке ЧЕТЫРЕ ЛОЖНЫЕ метки «не отработано» из пяти (скрипт диспозиций падал в дефолт там, где в поле «где» не было шаблона `§N`) — снятия пере-проверены мной командой, открытой осталась ОДНА запись м7. §9 читать как НАРЯД НА ПЕРЕПРОВЕРКУ, не как список долга. ⚠ §7.3 файла («модель `claude-fable-5` на аккаунте недоступна») ПРОТУХ за сутки — 01.09 проверено исполнением, агент отвечает как `claude-fable-5-1`; помечено point-in-time. Открытые хвосты: м7 · сплошной обход индекса GitHub по оси 6 · эрратум `research/15` (взят оркестратором, разобран в ревью-шапке — верен лишь наполовину, оговорка уже стоит на `research/15:260`).
|
5. **Ресёрч-сессия `textmachine-36`** написала `docs/research/29-harness-topology-survey.md` (топологии харнесса), НЕ коммитит — ⚠ **лендинг на №22, обязательство ПЕРЕАДРЕСОВАНО 01.09** (№21 закрыт, не успел). Состояние на 01.09: файл лежит в СОСЕДНЕМ worktree `/home/ubuntu/projects/textmachine/docs/research/` (незакоммиченное между worktree НЕ ВИДНО — `git status` в main-дереве пуст по построению), вырос до ~302 КБ, сессия idle и «готово» не прислала. ⚠ Условия лендинга, согласованные с ней: ратифицировать НЕЧЕГО (ресёрч-фактура, не решение) · нужна ревью-шапка (что доказано / что СНЯТО / что не проверено) · её §4 и §5 остаются obstacle-секциями · её собственный адверсариальный проход дал 86 находок и 20 записей класса блокер, из которых 15 РАЗЛИЧНЫХ и все исправлены (5 были дублями разных рецензентов) · незакрытый долг назван ею самой: 49 находок класса ВАЖНОЕ и 17 мелочей. ⚠ Формулировка для шапки, точнее оркестраторской: судья как СТАДИЯ ДВИЖКА не построен и не вызывался (0 вызовов), но судьи в ПОЛИГОНЕ были и есть — без этого различения следующая сессия выбросит замеры топологии.
|
||||||
⚠ **В дереве ЛЕЖИТ НЕЗАКОММИЧЕННОЕ И ЭТО НОРМА:** код пака P12 + записка-план сессии в зонном журнале + ПИНГ оркестратора №20 в том же журнале (аудит доков нашёл три места зоны, ставших ложными). Коммитить их ОДНИМ лендингом при приёмке P12; №20 не коммитил, чтобы не унести чужую работу под своим сообщением.
|
⚠ **В дереве ЛЕЖИТ НЕЗАКОММИЧЕННОЕ И ЭТО НОРМА:** код пака P12 + записка-план сессии в зонном журнале + ПИНГ оркестратора №20 в том же журнале (аудит доков нашёл три места зоны, ставших ложными). Коммитить их ОДНИМ лендингом при приёмке P12; №20 не коммитил, чтобы не унести чужую работу под своим сообщением.
|
||||||
|
|
||||||
**НОРМЫ, ЗАРАБОТАННЫЕ ЭТИМИ ПРИЁМКАМИ:**
|
**НОРМЫ, ЗАРАБОТАННЫЕ ЭТИМИ ПРИЁМКАМИ:**
|
||||||
|
|
|
||||||
|
|
@ -1,704 +0,0 @@
|
||||||
# research/29-harness-topology-survey-codex — архитектура харнесса художественного перевода
|
|
||||||
|
|
||||||
> **⟶ РЕВЬЮ-ШАПКА ОРКЕСТРАТОРА №22 (лендинг 01.09.2026).** Второй, НЕЗАВИСИМЫЙ отчёт по тому же
|
|
||||||
> заказу — прямое указание владельца: две сессии работали параллельно и друг друга не читали.
|
|
||||||
> Принят и заленджен КАК ФАКТУРА; **ратифицировать здесь нечего**, при конфликте с журналом решений
|
|
||||||
> побеждает журнал.
|
|
||||||
>
|
|
||||||
> ⚠ **ЧЕСТНАЯ ГРАНИЦА МОЕЙ ПРИЁМКИ: этот файл я НЕ вычитывал по существу.** Проверены только
|
|
||||||
> комплектность (пять требуемых разделов верхнего уровня на месте), происхождение и байты. Фактура
|
|
||||||
> раздела 2 мной не пере-открывалась. Это «не проверено», а НЕ «подтверждено» — разница существенная,
|
|
||||||
> и я её называю, чтобы никто не прочёл лендинг как знак качества.
|
|
||||||
>
|
|
||||||
> **Почему всё равно лендится:** заказ владельца был именно на два независимых прохода, и ценность
|
|
||||||
> здесь в РАСХОЖДЕНИЯХ с парным файлом `29-harness-topology-survey.md`, а не в каждом отчёте
|
|
||||||
> по отдельности. Сверку двух отчётов между собой не делал никто — она не заказывалась и остаётся
|
|
||||||
> открытой работой; кто за неё возьмётся, начинает с разделов «Находки» обоих файлов.
|
|
||||||
>
|
|
||||||
> **Парный файл прошёл приёмку сильнее:** у него четыре веера самопроверки, выгрузка неотработанных
|
|
||||||
> находок приёмки в §9 и разобранная ревью-шапка. Отсутствие того же здесь — свойство ЗАКАЗА
|
|
||||||
> (сессии ставились по-разному), а не оценка качества этого текста.
|
|
||||||
|
|
||||||
**Независимая research-сессия Codex, 31.08.2026.** Дельта-срез относительно репозитория на
|
|
||||||
31.08.2026. Пишется отдельным файлом с суффиксом `-codex` по прямому указанию владельца, поскольку
|
|
||||||
параллельная сессия независимо готовит `29-harness-topology-survey.md`. Это исследование не меняет
|
|
||||||
код, не ратифицирует архитектуру и не рекомендует внедрение: ниже только факты, измерения и границы
|
|
||||||
переноса.
|
|
||||||
|
|
||||||
## 1. УЖЕ ПОКРЫТО
|
|
||||||
|
|
||||||
Блокирующий синк выполнен **до первого интернет-запроса**. Команды снятия инвентаря:
|
|
||||||
|
|
||||||
```bash
|
|
||||||
find docs/research -maxdepth 1 -type f | sort | wc -l
|
|
||||||
for f in $(find docs/research -maxdepth 1 -type f | sort); do rg -n '^#{1,3} ' "$f"; done
|
|
||||||
sed -n '1,360p' docs/experiments/README.md
|
|
||||||
```
|
|
||||||
|
|
||||||
**Поправка владельца 31.08 выполнена исполнением:** исходный синк по экспериментам был неполон —
|
|
||||||
он читал только README и структурно не видел `docs/experiments/*.md`. Перед повторной оценкой
|
|
||||||
находок весь дельта-фильтр переснят командами вида:
|
|
||||||
|
|
||||||
```bash
|
|
||||||
rg -n -i --glob '*.md' --glob '!29-harness-topology-survey*.md' \
|
|
||||||
'ТОЧНЫЙ_ID|НАЗВАНИЕ|КОНЦЕПТУАЛЬНЫЙ_СИНОНИМ' docs/research docs/experiments
|
|
||||||
```
|
|
||||||
|
|
||||||
Точные неплейсхолдерные patterns и фактические результаты приведены per-finding в §2.0. Оба
|
|
||||||
текущих 29-файла исключены: собственный отчёт иначе находил бы сам себя, параллельный отчёт другого
|
|
||||||
агента нарушил бы независимость исследования.
|
|
||||||
|
|
||||||
Дата в таблице — дата создания файла по `git log --follow --diff-filter=A --format=%as`; это не
|
|
||||||
означает свежесть всех его фактов. Вердикт учитывает ревью-шапку, если она есть.
|
|
||||||
|
|
||||||
| Тема | Файл | Дата | Вердикт одной строкой |
|
|
||||||
|---|---|---:|---|
|
|
||||||
| Рынок и спрос | `research/01-market.md` | 04.07 | Фактура сегментов жива; прежний SAM снят как завышенный. |
|
|
||||||
| Конкуренты | `research/02-competitors.md` | 04.07 | Ландшафт продуктов/OSS до июля; тезис о пустом ru-рынке снят. |
|
|
||||||
| Agentic/doc/literary MT | `research/03-academic-agentic-mt.md` | 04.07 | Уже покрыты TransAgents, DelTA, DRT, TEaR, selection/synthesis и literary-eval; вывод «generate-then-select — ядро» superseded. |
|
|
||||||
| Провайдеры | `research/04-api-providers.md` | 04.07 | Цены/модели/роли быстро устаревают; архитектурной дельтой не считаю. |
|
|
||||||
| Память и глоссарий | `research/05-memory-glossary.md` | 04.07 | Уже покрыты lorebook, иерархические summary/RAG, DelTA и токен-бюджет. |
|
|
||||||
| Локальные модели | `research/06-local-models.md` | 04.07 | Роли и экономика моделей под малую VRAM; не топология харнесса. |
|
|
||||||
| Методология литперевода | `research/07-translation-methodology.md` | 04.07 | Уже покрыты профпроцесс, series bible, редактура и анти-translationese. |
|
|
||||||
| Юридическое/ToS | `research/08-legal.md` | 04.07 | Юридическая рамка жива, провайдерская часть superseded. |
|
|
||||||
| Go-прайор-арт транспорта | `research/10-vojo-ai-bot-review.md` | 04.07 | Адаптеры/роутинг/телеметрия, вне предмета топологий качества. |
|
|
||||||
| 18+ маршрутизация | `research/11-gap-2.md` | 04.07 | Enforcement-факты, но состав канала пересобран; не дублирую. |
|
|
||||||
| Selection vs refinement | `research/11-gap-3.md` | 04.07 | Развилка и пилот уже спроектированы; собственного книжного вердикта нет. |
|
|
||||||
| Ru-экосистема | `research/11-gap-4.md` | 04.07 | Опровергает «ru никто не обслуживает»; рынок не пуст. |
|
|
||||||
| Спрос/прайсинг | `research/11-gap-5.md` | 04.07 | SAM/SOM снизу вверх; вне архитектурной дельты. |
|
|
||||||
| Общие режимы отказа | `research/12-common-failures.md` | 09.07 | Непрозрачный LLM-провенанс, числа без источников не наследуются. |
|
|
||||||
| Отзывы читателей | `research/12-consumer-feedback.md` | 04.07 | Каталог жалоб и похвал; не измерение топологии. |
|
|
||||||
| Академические таксономии | `research/12-error-taxonomies.md` | 04.07 | DITING/BlonDe/MQM/LitEval/LAIT уже разложены по механизмам. |
|
|
||||||
| Ошибки ja→ru | `research/12-failure-modes-ja.md` | 04.07 | Языковые отказы уже каталогизированы; не пересказываю. |
|
|
||||||
| Ошибки →ru | `research/12-failure-modes-ru-target.md` | 04.07 | Русская целевая сторона уже каталогизирована; не пересказываю. |
|
|
||||||
| Ошибки zh→ru | `research/12-failure-modes-zh.md` | 04.07 | Китайская исходная сторона уже каталогизирована; не пересказываю. |
|
|
||||||
| Валидация банка | `research/13-memory-bank-validation.md` | 04.07 | Dense/hybrid retrieval, детерминизм и режимы отказа банка уже проверены; ревью-шапка первична. |
|
|
||||||
| Адаптивная память | `research/14-adaptive-memory.md` | 05.07 | ICL-демонстрации, LoRA/kNN и adaptive retrieval уже разобраны; ревью-шапка первична. |
|
|
||||||
| Голос и scene-state | `research/15-voice-and-state.md` | 09.07 | Профили голоса, exemplars, scene/reader state и pre-pass уже покрыты. |
|
|
||||||
| Ридер-IDE/HITL | `research/16-reader-ide-alignment.md` | 11.07 | Выравнивание, доверие и ручная редактура; не повторяю как топологию. |
|
|
||||||
| Независимая критика | `research/17-external-critique.md` | 11.07 | Уже есть чистый-лист по состоянию, верности, литературности, цене и судье. |
|
|
||||||
| Рычаги качества (GPT) | `research/18-quality-levers-chatgpt.md` | 11.07 | Гранулярность, discourse-reflow и двухступенчатый замер уже отработаны. |
|
|
||||||
| Рычаги качества | `research/18-quality-levers.md` | 11.07 | Независимая карта сведена с проектом и построена; не источник новых идей. |
|
|
||||||
| Нарезка/когезия | `research/19-chunking-cohesion.md` | 16.07 | Chunking, STM/carryover, волны и t/e-контракт уже исследованы и измерены exp15. |
|
|
||||||
| Майнинг банка | `research/20-bank-mining.md` | 17.07 | Термы, алиасы, консолидация и слепые зоны уже покрыты и измерены exp16. |
|
|
||||||
| Транспорт харнессов | `research/21-llm-transport-survey.md` | 23.07 | Wire/API-квирки уже разобраны; явно вне этого обзора. |
|
|
||||||
| Доменные харнессы | `research/22-domain-harness-survey.md` | 24.07 | AiNiee/GalTransl/LinguaGacha и др. разобраны по коду; critique-loop отмечен, публичных quality-замеров почти нет. |
|
|
||||||
| Engine↔platform | `research/23-engine-platform-seam.md` | 02.08 | Интеграционный шов, не топология перевода; transport-часть superseded. |
|
|
||||||
| Арбитраж банка | `research/24-bank-arbitration.md` | 04.08 | Консилиум, self-consistency, селекция и confidence проверены на банк-термах; не переносить молча на прозу. |
|
|
||||||
| Холодное ревью шва | `research/25-seam-cold-review.md` | 05.08 | Ратифицированная форма платформенного шва; вне предмета. |
|
|
||||||
| Agent-harness guidance | `research/26-anthropic-guidance-digest.md` | 09.08 | Общие правила долгих агентных сессий уже абсорбированы; не MT-замер. |
|
|
||||||
| Детекция глав | `research/27-chapter-detection.md` | 09.08 | Структура ingest книги; дизайн не ратифицирован, но не переводческая топология. |
|
|
||||||
| API-контракт | `research/28-contract-review.md` | 16.08 | Контракт фронт↔платформа; вне предмета. |
|
|
||||||
| Провайдерские/архитектурные эксперименты | `experiments/03–14b` | 04–15.07 | Модель черновика не дала эффекта; промпт/редактор/смысловые ловушки уже измерены на интерим-материале. |
|
|
||||||
| Нарезка и банк | `experiments/15–16` | 22–24.07 | Когезия ниже floor; майнинг WHICH подтверждён, WHAT отправлен человеку/банкноте. |
|
|
||||||
| Редакторский провод/контракт/роль | `experiments/18–20` | 04–08.08 | Закон-блок нужен; diff-контракт исправен, но дорог/опасен; поиск дефекта дороже идеального ремонта. |
|
|
||||||
| Топология ролей | `experiments/21` | 08.08 | Закрытый замер: на его tested slice draft→editor сильнее голого черновика; точечный repair/feedback/routing отклонены. |
|
|
||||||
| Жильцы редактора | `experiments/22` | 16.08 | Закрыт с поздними errata: en-эффект редактора жив, исходный широкий клейм второго прохода сужен. |
|
|
||||||
| Тир и промежуточные схемы | `experiments/23` | 29.08 | **ИДЁТ**: `--final` красный, acceptance параллельна; порядок arm-ов и price-выводы пока позиционно confounded. |
|
|
||||||
|
|
||||||
Следствие дельта-фильтра: находкой ниже может стать только (а) первичная работа новее тематического
|
|
||||||
локального среза либо (б) отсутствующая здесь ось/новое измерение. Повтор известного допустим только
|
|
||||||
как внешний контрсигнал с явно указанной дельтой.
|
|
||||||
|
|
||||||
## 2. Находки
|
|
||||||
|
|
||||||
### 2.0 Реестр дельт и исполняемая проверка
|
|
||||||
|
|
||||||
Статус **измерено** ниже означает только то, что число есть в таблице/рисунке первоисточника;
|
|
||||||
это не означает переносимость на наш конвейер. Команды запускались из корня репозитория 31.08.2026.
|
|
||||||
`Ø` означает нулевой вывод; «есть» — найденный локальный предшественник, относительно которого ниже
|
|
||||||
названа более узкая дельта.
|
|
||||||
|
|
||||||
| ID | Ось | Статус | Дельта относительно репозитория | Чем проверено |
|
|
||||||
|---|---|---|---|---|
|
|
||||||
| F1 | смысловой скелет → стиль, multi-agent topology | измерено людьми | `research/17:243,287` уже знал статью и направление; новое — ставший доступным full text, точный дизайн, выборка и эффекты после прежнего 403. | `rg -l -i --glob '*.md' --glob '!29-harness-topology-survey*.md' 'target\.25081\|Workflow matters\|stylistic lift\|LCD-MAS\|PD-MAS' docs/research docs/experiments` → только `research/17` |
|
|
||||||
| F2 | гранулярность и раунды refinement | **дубль результата; верификация библиографии** | Полный grep показал результат в восьми старых файлах; вместе с первоначальной строкой этого отчёта он действительно оказался девятым местом. Новое — лишь закрытый состав пар и exact human tables/границы. | `rg -l -i --glob '*.md' --glob '!29-harness-topology-survey*.md' '2605\.13368\|acl-long\.268\|What Does LLM Refinement Actually Improve' docs/research docs/experiments` → `research/{03,11,14,17,18}` + `experiments/{09,12,23}` |
|
|
||||||
| F3 | память через длинный документ | измерено автоматически; код только заявлен | DelTA и adaptive retrieval покрыты, но translation-specific 3E-памяти с обученным выбором контекста Loong нет. Частный тезис «плохой контекст хуже пустого» уже есть в `research/13,14` и находкой не считается. | `rg -l -i --glob '*.md' --glob '!29-harness-topology-survey*.md' 'LoongDocMT\|2605\.30274\|3E memory\|observe.{0,8}and.{0,8}act' docs/research docs/experiments` → Ø; широкий grep `near.?miss\|лучше (ничего\|пуст)` → `research/13,14` |
|
|
||||||
| F4 | отдельный диагност → редактор; число раундов | измерено автоматическими метриками и latency | В локальных файлах нет этой ACL-работы; это внешний контрсигнал к отклонённой нами feedback/repair-схеме, но на e-commerce. | `rg -l -i --glob '*.md' --glob '!29-harness-topology-survey*.md' '2026\.acl-industry\.115\|Diagnose.{0,15}Then Repair\|two-stage MQM' docs/research docs/experiments` → Ø |
|
|
||||||
| F5 | thinking и creative prompting | измерено людьми + автоматически | Нет paired-task `Beyond Reproduction`: 23 модели, thinking-варианты и четыре creative-промпта на UCP. | `rg -l -i --glob '*.md' --glob '!29-harness-topology-survey*.md' 'Beyond Reproduction\|2026\.findings-acl\.2030\|2604\.18169' docs/research docs/experiments` → Ø |
|
|
||||||
| F6 | валидность литературного судьи | измерено людьми + автоматически | `Creativity Bias` в `research/18` только названа; controlled source-visible/source-hidden sentence-pair опыта и точных modality/genre таблиц там нет. | `rg -l -i --glob '*.md' --glob '!29-harness-topology-survey*.md' '2026\.unlp-1\.8\|Semantic Fidelity Versus Literary Quality\|source.?hidden\|2605\.13596\|2026\.eamt-1\.43\|Creativity Bias' docs/research docs/experiments` → только `research/18` (Creativity Bias) |
|
|
||||||
| F7 | бесплатные сигналы «машинности» | частично валидировано на русском | Локально уже перечислены MTLD/distinct-n/длины/повторы/пассив; новое — отделение machine detection от human translationese и русский RuATD baseline. | `rg -l -i --glob '*.md' --glob '!29-harness-topology-survey*.md' 'MTLD\|distinct-[nN]\|уменьшитель\|translationese\|машинност' docs/research docs/experiments` → `research/{03,07,12-consumer,12-taxonomies,12-ja,12-zh,15,18-chatgpt,18,22,28}` + `experiments/{21,23}` |
|
|
||||||
| F8 | измеритель «не отходит от канона» | частичные метрики; единого прибора нет | LTCR, BlonDe, BWB, SEGALE, mStyleDistance и поздний D50/`canon_gaps` уже лежат локально. Первый проход, ошибочно переоценив ru-specificity, пропустил zh→en L-Anno, source-grounded TRANSGRAPH cohesion judge и англоязычный CONSTORY-CHECKER; CoTERM и MetaDocEval также новые для локального корпуса. | Полный `rg -n -i --glob '*.md' --glob '!29-harness-topology-survey*.md' '2024\.lrec-main\.583\|true consistency\|false consistency\|TRANSGRAPH\|2026\.eacl-long\.75\|ConStory\|CONSTORY\|2026\.findings-acl\.410\|CoTERM\|MetaDocEval' docs/research docs/experiments` → Ø; старые `LTCR|BlonDe|BWB|SEGALE|mStyleDistance|canon_gaps|effective consistency` найдены в обоих деревьях |
|
|
||||||
|
|
||||||
### F1. Full text уточняет известный контрсигнал: fluency выросла вместе с добавлениями
|
|
||||||
|
|
||||||
**Источник.** Lulu Wang, Sanjun Sun, Xing Wang, Jinghang Gu, Kanglong Liu, 01.06.2026,
|
|
||||||
[*Workflow matters: Comparing human translators and multi-agent LLMs in literary translation*](http://www.jbe-platform.com/deliver/fulltext/10.1075/target.25081.wan/target.25081.wan.pdf),
|
|
||||||
`Target` 38:3, pp. 422–453. Это одна GPT-4o-версия (`gpt-4o-2024-11-20`) в обеих схемах, то есть
|
|
||||||
изолирован именно workflow, а не жилец роли.
|
|
||||||
|
|
||||||
**Что сравнили.** PD-MAS имитирует ISO-процесс: анализ/термы → переводчик → reviser → reviewer →
|
|
||||||
proofreader. LCD-MAS режет главу на смысловые блоки примерно по 300 китайских знаков и делает:
|
|
||||||
глобальные summary+strategy → для каждого блока перевод смысла → accuracy-revision → style guide →
|
|
||||||
стилистический rewrite → после склейки ещё global style-guide и editor. Исходный корпус — 28 глав
|
|
||||||
примерно по 3 000 китайских знаков из 15 опубликованных произведений 14 авторов и пяти поджанров;
|
|
||||||
это Methods §§3.1–3.2/Table 1. Оценка — 30 слепо рандомизированных отрывков, средняя длина
|
|
||||||
источника 166 знаков (Table 1),
|
|
||||||
zh→en fiction.
|
|
||||||
|
|
||||||
**Измерено (Results 4.1–4.3, Table 2).** Два профессора перевода оценивали accuracy, два native
|
|
||||||
English writing experts — fluency. По accuracy медиана у всех трёх вариантов равна 8, Friedman
|
|
||||||
`χ²(2)=0.37, p=.832`; LCD против human `p=.920, r=.02`. По fluency LCD имеет медиану 8 против 7 у
|
|
||||||
human и 7.5 у PD; LCD–human `p<.001, r=.71`, LCD–PD `p=.024, r=.49`. Для трёх парных сравнений
|
|
||||||
применена поправка Bonferroni. В отдельном preference-голосовании `n=120` (30 фрагментов × четыре
|
|
||||||
эксперта) LCD получил 52/120 (43.33%), PD 39/120 (32.50%), human 29/120 (24.17%); для этих долей
|
|
||||||
инференциального теста нет.
|
|
||||||
|
|
||||||
**Что ограничивает клейм.** LCD был существенно длиннее: 149.5 английских слова против 113.4 у
|
|
||||||
human и 99 у PD (Table 1). Сами эксперты назвали систематические добавления главным дефектом;
|
|
||||||
пример включает отсутствующие в источнике «quiet beauty», «molten fire» и «fragile sense of hope».
|
|
||||||
Планировщик распознавал культурные реалии, но обещанные пояснения иногда не доходили до финала.
|
|
||||||
Следовательно, измерено превосходство по **fluency**, а не по точности или авторскому голосу.
|
|
||||||
Книга целиком не оценивалась, стоимость, токены и число API-вызовов не опубликованы.
|
|
||||||
|
|
||||||
**Дельта.** `research/17:243,287` уже ссылался на эту работу как на counter-signal и знал
|
|
||||||
«stylistic lift with occasional additions»; исходный full text тогда был недоступен. Здесь новое
|
|
||||||
только на уровне восстановленной улики: точная LCD-/PD-MAS topology, human sample, effect sizes и
|
|
||||||
failure межагентной передачи плана. Общая идея «разделить смысл и стиль» новой не является.
|
|
||||||
|
|
||||||
### F2. В WMT24-Literary наиболее устойчивой была full-document input → local rewrite emission
|
|
||||||
|
|
||||||
**Статус после полного дедупа: не самостоятельная находка.** Тот же paper/result уже находился в
|
|
||||||
восьми старых файлах (`research/03,11,14,17,18`, `experiments/09,12,23`); первоначальная запись
|
|
||||||
здесь делала его девятым местом. Пункт оставлен только как проверка первоисточника и закрытие
|
|
||||||
локального TODO о составе языковых пар, а не как новая архитектурная дельта.
|
|
||||||
|
|
||||||
**Источник.** Shaomu Tan et al., июль 2026,
|
|
||||||
[*What Does LLM Refinement Actually Improve? A Systematic Study on Document-Level Literary Translation*](https://aclanthology.org/2026.acl-long.268.pdf),
|
|
||||||
ACL 2026 Long Paper, Tables 1, 3–7. Девять моделей; WMT24-Literary, семь направлений:
|
|
||||||
en→{cs,de,es,ja,ru,zh} и ja→zh. Документ около 2 048 слов; полный source и initial translation
|
|
||||||
видны refiner при любой единице эмиссии, температура 0, до четырёх раундов.
|
|
||||||
|
|
||||||
**Измерено автоматически.** MQM-FSP judge в этом блоке — Claude-3.5-Sonnet (§3). Из девяти
|
|
||||||
комбинаций granularities наиболее устойчивой оказалась
|
|
||||||
`document MT → segment refinement`: segment-rewrite менял обычно 25–40% токенов, тогда как
|
|
||||||
whole-document refinement у большинства моделей менял менее 5% и давал ограниченный/нестабильный
|
|
||||||
прирост (Table 1, §4.2). На DeepSeek-V3 simple general rewrite дал `+3.6 MQM-FSP`, а
|
|
||||||
step-by-step — `+1.4`; у step-by-step accuracy/fluency/style+term равны `−0.9/−1.3/−0.4`
|
|
||||||
(Table 3). Confidence исходных слов не предсказывал места правок: 43 631 слово, средний ROC AUC
|
|
||||||
0.503 по log-prob и 0.504 по entropy (Table 7). Это broad projection в распределение редактора,
|
|
||||||
не locate-and-fix.
|
|
||||||
|
|
||||||
**Измерено людьми.** Профессиональный vendor покрыл outputs полного WMT24-Literary: 16 систем
|
|
||||||
(4 модели × 4 стратегии), семь направлений, свыше 1 млн переведённых слов, human MQM и DA
|
|
||||||
(Table 4). Но annotators видели contiguous chunks, а не целый документ (Appendix A.5): это полное
|
|
||||||
покрытие test set, не whole-document human judgment. General был лучшим для всех четырёх моделей;
|
|
||||||
его MQM/DA дельты: GPT-OSS-120B
|
|
||||||
`+12.2/+3.7`, Qwen3-235B `+4.4/+1.3`, DeepSeek-V3 `+7.8/+3.1`, GPT-5.2 `+5.6/+2.0`.
|
|
||||||
Step-by-step у тех же моделей дал MQM `−3.3, −1.5, −4.2, −7.2`. В targeted A/B на `n=102`
|
|
||||||
200–300-словных chunks en→de/en→es (размер восстанавливается из процентов Table 5:
|
|
||||||
16/35/51 = 15.7/34.3/50.0%) refined DeepSeek-V3 выиграл без ничьих 76.1% по accuracy,
|
|
||||||
97.5% по fluency и 93.1% по style+term; во всех трёх строках `p<10⁻⁴` (Table 5). Поправка на три
|
|
||||||
эти теста в статье не указана; для большой Table 4 доверительные интервалы/поправка также не
|
|
||||||
даны.
|
|
||||||
|
|
||||||
**Перенос.** Это литературный документ и среди пар есть en→ru и en→zh, но числа Table 4
|
|
||||||
агрегированы по направлениям; отдельного human-эффекта для en→ru нет. Segment-level здесь означает
|
|
||||||
локальную **полную перегенерацию блока при полном документе в контексте**, а не список правок.
|
|
||||||
|
|
||||||
**Дельта.** `research/11` уже правильно пересказал механизм по майскому препринту, а `research/17`
|
|
||||||
уже отметил ACL-final. Реальная дельта этого пункта — снятие явного TODO о составе пар и exact
|
|
||||||
human tables вместе с chunk-level границей их чтения; архитектурной новинкой результат не считаю.
|
|
||||||
|
|
||||||
### F3. Loong обучает не саму память, а выбор полезного контекста; литературная улика пока автоматическая
|
|
||||||
|
|
||||||
**Источник.** Yutong Wang, Xuebo Liu, Derek F. Wong et al., 28.05.2026,
|
|
||||||
[*Loong: A Human-Like Long Document Translation Agent with Observe-and-Act Adaptive Context Selection*](https://arxiv.org/html/2605.30274),
|
|
||||||
arXiv:2605.30274; заявленный код —
|
|
||||||
[`YutongWang1216/LoongDocMT`](https://github.com/YutongWang1216/LoongDocMT).
|
|
||||||
|
|
||||||
**Заявлено.** После каждого сегмента 3E-memory пополняет (1) Essence —
|
|
||||||
LLM-summary, (2) Exemplars — все предыдущие source–target пары, (3) Entities — структурные записи.
|
|
||||||
Encoder сначала достаёт top-K summary/exemplars и все упомянутые entities; observe-and-act агент
|
|
||||||
последовательно фильтрует три типа. Политика выбора обучена SFT/DPO на предпочтениях из собственных
|
|
||||||
траекторий. В inference псевдокод делает три reasoning-шага выбора (Algorithm 1), translation, summary и entity
|
|
||||||
update; поэтому это не «один переводческий вызов с RAG». Размер сегмента в самом источнике
|
|
||||||
**внутренне противоречив**: §4.1 задаёт `l=5` предложений, Limitations — десять. Ни одно из двух
|
|
||||||
значений нельзя выдавать как однозначно установленное.
|
|
||||||
|
|
||||||
**Измерено (автоматически).** Основное обучение — примерно 500 news-документов на каждую пару
|
|
||||||
en↔{zh,de,fr} (§4.1/A.4); human-eval нет. В OOD GuoFengV1 zh→en webnovel (12 документов, средняя длина 1 445
|
|
||||||
слов, Table 4/A.4) Loong против DelTA дал sCOMET `76.2 vs 74.2`, dCOMET `73.1 vs 70.5`,
|
|
||||||
GPT-4.1 judge `67.3 vs 63.0` (Table 4). Ablation Table 3 — News Commentary V18.1,
|
|
||||||
En→{zh,de,fr} aggregate, Llama3.1-8B, sCOMET+dCOMET+GPT-4.1 judge: средний score Loong 80.2,
|
|
||||||
без контекста 77.4, без tuning 75.4. Поправка на множественные сравнения не указана.
|
|
||||||
Отдельная демонстрация перевела первые 12 глав известного *Journey to the West* zh→pt
|
|
||||||
(51 854 слова), но Figure 1 даёт только автоматические кумулятивные curves; известный классический
|
|
||||||
текст и отсутствие человека делают это предварительной stability-уликой, не книжным quality-тестом.
|
|
||||||
|
|
||||||
**Цена и воспроизводимость.** Авторы прямо признают дополнительный computational overhead, но не
|
|
||||||
дают токены, latency, API calls или деньги. На 31.08.2026 открытое дерево linked-репозитория
|
|
||||||
содержит только `README.md`, а не implementation: фраза статьи «code is released» фактически не
|
|
||||||
подтверждена кодом.
|
|
||||||
|
|
||||||
**Дельта.** `research/05` знает multi-level memory DelTA, `research/14` — adaptive retrieval, а
|
|
||||||
`research/15` — exemplars. Новое их пересечение: обученный translation-specific выбор между
|
|
||||||
summary/exemplar/entity с OOD-webnovel таблицей. На сотни глав, zh→ru и человеческий голос перенос
|
|
||||||
не измерен.
|
|
||||||
|
|
||||||
#### Проверка тезиса «плохо отобранный контекст хуже пустого»
|
|
||||||
|
|
||||||
**Вердикт: подтверждён внутри Loong, но не является нашей новой находкой.** Чистая улика — не
|
|
||||||
сравнение `w/o Tuning=75.4` с `w/o Context=77.4` в Table 3: эти arms различаются и обучением, и
|
|
||||||
политикой контекста, поэтому такое сравнение confounded. Прямее §4.4/Figure 4: авторам удалось
|
|
||||||
впрыснуть 30–50 предложений из других документов; у двух selection-free baselines sCOMET, dCOMET
|
|
||||||
и GPT-4.1-score последовательно падали относительно pseudo-context length `0`, тогда как Loong
|
|
||||||
оставался почти стабильным. Figure 4 не печатает точные значения и significance test; основа —
|
|
||||||
News Commentary/WMT24++, не книга и не human judge.
|
|
||||||
|
|
||||||
Полный локальный grep вернул [`research/13:42`](13-memory-bank-validation.md) с буквальным принципом
|
|
||||||
«лучше ничего, чем мусор» и [`research/14:75`](14-adaptive-memory.md) с `near-miss`-дистрактором;
|
|
||||||
поэтому это внешняя репликация уже известного вывода, не F3-дельта. Более ранние Power of Noise и
|
|
||||||
Yoran et al. там относятся к QA/RAG, а не к MT; Loong впервые в этом наборе даёт прямой MT-тест,
|
|
||||||
но только автоматический.
|
|
||||||
|
|
||||||
### F4. Отдельный evaluator→post-editor выигрывает на e-commerce, но это не наш diff-контракт
|
|
||||||
|
|
||||||
**Источник.** Ji Hun Wang, Siyu Wu, июль 2026,
|
|
||||||
[*Diagnose, Then Repair: A Two-Stage MQM-Guided Post-Editing Framework for Domain-Specific Machine Translation*](https://aclanthology.org/2026.acl-industry.115.pdf),
|
|
||||||
ACL Industry 2026, Tables 1–4, 7–10.
|
|
||||||
|
|
||||||
**Топология.** Claude Opus 4.5 один раз выдаёт MQM `issue_id/span/category/severity/suggested_fix`
|
|
||||||
с retrieved TM-exemplars; отдельный post-editor получает report и обязан минимально исправить
|
|
||||||
только диагностированные места. Важно: post-editor возвращает **полную новую hypothesis плюс edit
|
|
||||||
log** (§3.4), не исполнимый список search/replace-операций.
|
|
||||||
|
|
||||||
**Измерено.** Внутренний e-commerce test — 5 000 сегментов для каждого из en→de/it/es/fr/zh/ja;
|
|
||||||
KB 135–184 тыс. пар (Table 10), initial MT Claude 3.5 Sonnet, семь post-editor моделей. На en→de
|
|
||||||
no-edit COMET/CometKiwi `86.39/82.66`; one-stage Opus `89.38/82.84`; two-stage P3+Sonnet 4.5
|
|
||||||
`89.93/84.50`. На en→zh соответственно `87.76/81.60`, `88.70/79.57`, `90.80/83.19`
|
|
||||||
(Table 1). Two-stage COMET выше one-stage у 4/7 моделей en→de и 6/7 en→zh, но CometKiwi у ряда
|
|
||||||
моделей падает (complete Table 5), поэтому фраза абстракта «consistently improves both» шире тела.
|
|
||||||
Статзначимость/поправка на множественность не приведены; judge результата — только COMET-22 и
|
|
||||||
CometKiwi.
|
|
||||||
|
|
||||||
На en→de второй repair-round ухудшил COMET в 6/7 клеток; единственный плюс Sonnet 4.5 равен +0.14, а
|
|
||||||
GPT-OSS-120B дал −1.86 (Table 4). Latency на `n=50`: evaluator mean/median/p95
|
|
||||||
14.34/7.80/54.38 s, post-editor 3.30/3.10/5.04 s, end-to-end 17.64/10.90/59.41 s (Table 8;
|
|
||||||
языковая пара для latency source не указана).
|
|
||||||
Прайс-лист моделей дан, но фактические токены и dollar cost прогона не даны.
|
|
||||||
|
|
||||||
**Перенос под вопросом.** Короткие повторяющиеся товарные сегменты и automatic metrics — другой
|
|
||||||
класс, чем глава прозы. Более того, заявленные в abstract «agreement with human MQM» и «human
|
|
||||||
editor preferences» не имеют в полном тексте методики или таблицы human study; их здесь не считаю
|
|
||||||
измеренными.
|
|
||||||
|
|
||||||
**Дельта.** Это не опровергает наш дорогой list-of-edits: формы выхода различны. Оно даёт лишь
|
|
||||||
внешний контрсигнал к локально отклонённой топологии «diagnose отдельно → repair отдельно» и
|
|
||||||
измерение того, что второй раунд чаще регрессирует.
|
|
||||||
|
|
||||||
### F5. Source-comprehension thinking и translation prompting дают неоднородные эффекты
|
|
||||||
|
|
||||||
**Источник.** Ran Zhang, Steffen Eger, Arda Tezcan, Wei Zhao, Simone Paolo Ponzetto, Lieve Macken,
|
|
||||||
июль 2026, [*Beyond Reproduction: A Paired-Task Framework for Assessing LLM Comprehension and
|
|
||||||
Creativity in Literary Translation*](https://aclanthology.org/2026.findings-acl.2030.pdf), Findings
|
|
||||||
ACL 2026; код/данные заявлены в [`NL2G/Beyond-Reproduction`](https://github.com/NL2G/Beyond-Reproduction).
|
|
||||||
Проверяемые пути репозитория: `task2_ucp/task2_evaluator.py`,
|
|
||||||
`task2_ucp/step2_batch_task2_translation.py`, `prompt_openrouter.py`.
|
|
||||||
|
|
||||||
**Две разные задачи и судьи.** Task 1 — `n=299` English claim–reasoning items из 11 классических
|
|
||||||
романов разных жанров, средний excerpt 186 tokens; языковой пары нет, это source comprehension
|
|
||||||
(§3.1). Gold прошёл трёх Prolific-аннотаторов на item, затем проблемные случаи — первого автора и
|
|
||||||
двух trained annotators; всего участвовали 33 Prolific и два expert annotators (§3.1, §3.3).
|
|
||||||
Task 2 — по 20 UCP-rich excerpts из восьми романов для en→zh и en→nl, 78/76 target-текстов,
|
|
||||||
398/374 размеченных units of creative potential (Table 1). Human gold создали один опытный
|
|
||||||
Chinese и один Dutch annotator; масштабируемый judge — Qwen3-Next-80B, `F1=.710` на en→zh
|
|
||||||
validation subset из 12.8% human-annotated paragraphs (§3.2). Затем сравниваются 23 модели ×
|
|
||||||
четыре prompts; поправка на множество model/prompt сравнений не указана.
|
|
||||||
|
|
||||||
**Измерено.** На Task 1 thinking-пары немонотонны: Qwen3-235B-Thinking лучше обычного,
|
|
||||||
Qwen3-30B-Thinking хуже, Claude 3.7 Thinking даёт лишь небольшой эффект (§5.1); это результат о
|
|
||||||
понимании источника, не о качестве перевода. Масштаб модели связан с macro-F1 слабо и незначимо
|
|
||||||
(`ρ=.311, p=.149`, Figure 2). На Task 2 прямые пары также расходятся: Qwen3-235B avg/max
|
|
||||||
`−.065/−.036`, Thinking `.048/.108`; Qwen3-30B `.045/.060`, Thinking `−.033/.024` (Table 13).
|
|
||||||
Распределения четырёх prompts сильно перекрываются; лишь 7/23 систем достигают личного максимума
|
|
||||||
на самом explicit P3. Только Mistral-Large (0.167), Mistral-Small-Creative (0.107) и
|
|
||||||
Qwen3-235B-Thinking (0.108) вообще превысили creativity 0.1 при human baseline 0.246 (Figure 3,
|
|
||||||
Table 13). У DeepSeek-V3.2, Jamba-Large и Llama3.1-405B больше creative freedom снизило score.
|
|
||||||
|
|
||||||
**Цена отдельно.** Статья не сообщает reasoning tokens, latency или dollar cost; следовательно,
|
|
||||||
она отвечает на quality-ось, но не на cost-ось thinking. Отрывки в среднем около 218 source-токенов,
|
|
||||||
не главы; перенос на книгу и →ru под вопросом.
|
|
||||||
|
|
||||||
**Дельта.** Локально уже есть DRT и отрицательный результат decomposition/`translate again`.
|
|
||||||
Здесь новое — прямой paired benchmark «понимание не равно creative transfer», thinking-варианты и
|
|
||||||
четыре уровня creative prompting на литературных UCP, а не общая MT-метрика.
|
|
||||||
|
|
||||||
### F6. Два новых контроля показывают, что «литературный judge» меняет сам конструкт
|
|
||||||
|
|
||||||
#### F6a. На sentence pairs одной книги тот же judge переворачивает рейтинг, если скрыть источник
|
|
||||||
|
|
||||||
Dmytro Chaplynskyi, Ivan Kulynych, Maria Shvedova, Lesia Ivashkevych, май 2026,
|
|
||||||
[*Semantic Fidelity Versus Literary Quality*](https://aclanthology.org/2026.unlp-1.8.pdf), UNLP
|
|
||||||
2026, Tables 2–4. Корпус покрывает одну целую известную книгу, *Animal Farm*, en→uk: семь
|
|
||||||
human-переводов и GPT-5.2/DeepL/Lapa, 1 367 aligned sentences, из них 1 128 valid. Единица
|
|
||||||
автоматической и pairwise оценки — выровненные предложения, не book-level чтение. Семь neural MT
|
|
||||||
metrics поставили
|
|
||||||
все три AI в top-3. AI–AI против human–human: LaBSE 0.941/0.711, XCOMET round-robin 0.886/0.627,
|
|
||||||
COMET-22 0.881/0.750 (Table 2); одновременно AI имели MTLD 311 против 377 у людей (−18%) и 0.47
|
|
||||||
против 1.23 diminutives на тысячу токенов (2.6× меньше).
|
|
||||||
|
|
||||||
Контроль удерживал GPT-5.2-judge неизменным: около 750 pairwise сравнений с source и 750 без него;
|
|
||||||
ещё 1 034 judgments дали четыре профессиональных en→uk переводчика с source, A/B порядок
|
|
||||||
рандомизирован (Table 3). При source-visible AI ranks были GPT-5.2 #1, DeepL #3, Lapa #4; без
|
|
||||||
source все три упали ровно на пять позиций — #6/#8/#9 (Table 4), а top-5 заняли люди. Формальных
|
|
||||||
significance tests/поправки для rank reversal нет, GPT-5.2 одновременно кандидат и judge, книга
|
|
||||||
известна pretraining. Поэтому это сильный within-judge construct-control, но лишь одна пара/книга.
|
|
||||||
|
|
||||||
#### F6b. Профессиональная creativity-аннотация не совпадает с MQM-judge
|
|
||||||
|
|
||||||
Kyo Gerrits, Rik van Noord, Ana Guerberof Arenas, июнь 2026,
|
|
||||||
[*Creativity Bias: How Machine Evaluation Struggles with Creativity in Literary Translations*](https://aclanthology.org/2026.eamt-1.43.pdf),
|
|
||||||
EAMT 2026, Tables 4–5, 11–12; протоколы —
|
|
||||||
[`INCREC/Creativity_bias`](https://github.com/INCREC/Creativity_bias), каталоги `Evaluations/`,
|
|
||||||
`MT/`, `Statistical analysis/`. Шесть коротких текстов
|
|
||||||
97–182 слова, три жанра (poem/short story/thriller), en→nl, en→ca, ru→nl; три modalities HT/PE/MT.
|
|
||||||
Четыре профессиональных литературных переводчика создали HT/PE и MQM errors, три doctoral
|
|
||||||
translator-annotators разметили creative shifts. GPT-5.2 high-reasoning — LLM judge.
|
|
||||||
|
|
||||||
Профессиональный creativity index HT/PE/MT равен 62.2/28.9/−15.9 для en→nl,
|
|
||||||
30.0/15.2/−31.6 для en→ca и 60.1/32.2/−50.8 для ru→nl (Table 4). Среди девяти automatic metrics
|
|
||||||
максимальная корреляция с creative shifts всего 0.20, с errors 0.39, с combined CI 0.35
|
|
||||||
(Figure 2). GPT-5.2 часто нашёл другие errors: например, по агрегату Table 5 его match означает
|
|
||||||
совпавший span, не совпавшую категорию; 15/38 professional Kudos он назвал ошибкой. GLM показал,
|
|
||||||
что judge чаще человека ставит ошибки HT (`z=2.07, p=.038`) и реже — MT (`z=6.16, p<.001`). Для
|
|
||||||
различий professional modalities применён post-hoc Holm–Bonferroni (Table 12); для сетки
|
|
||||||
metric-correlations отдельная поправка не заявлена.
|
|
||||||
|
|
||||||
**Общая дельта F6.** `research/03` и `18` уже знают, что literary metrics/LLM judges расходятся с
|
|
||||||
читателем; тезис не новый. Новые измерения — controlled source-visibility на sentence pairs,
|
|
||||||
покрывающих одну книгу, и genre×modality creativity annotation, включая русский источник. Они
|
|
||||||
объясняют, почему внешний F1 может одновременно иметь высокий fluency/preference и систематические
|
|
||||||
добавления, но book-level голос/когезию F6a не измеряет.
|
|
||||||
|
|
||||||
### F7. Бесплатные детекторы «машинности»: книжные сигналы есть, надёжного long-form прибора нет
|
|
||||||
|
|
||||||
Здесь важно не смешать три разных конструкта: (а) **machine-generated vs human-written**,
|
|
||||||
(б) **переводной vs оригинальный русский** (`translationese`) и (в) бедность/сжатие литературного
|
|
||||||
стиля. Один и тот же бесплатный признак может разделять один конструкт и инвертироваться на другом.
|
|
||||||
«Бесплатный» ниже означает без платного LLM/API-вызова; локальные tokenizers, taggers и classifiers
|
|
||||||
всё равно требуют вычислений и, для supervised detector, обучающих данных.
|
|
||||||
|
|
||||||
| Бесплатный сигнал/прибор | Где проверен | Что реально доказано | Граница |
|
|
||||||
|---|---|---|---|
|
|
||||||
| Dist-{1,2,4}, Ent-{1,2,4}, TTR, CTTR, длина; открытый TF-IDF→SVD→logistic baseline | Shamardina et al., 03.06.2022, [RuATD-2022](https://arxiv.org/html/2206.01583), русский; весь split 130k/21k/32k/32k, MT-часть 35 860 samples | Private-test accuracy TF-IDF `0.64223`, BERT `0.79666`, top `0.82995`, crowd `0.66666` (Table 5). Значит, открытый русский ATD benchmark и работающие classifiers существуют. | MT-тексты от OPUS-MT/M-BART50/M2M-100 имеют в среднем 11.5 tokens и фильтр 5–25; это не современный LLM-литперевод и не книга. TTR для MT: human `.98`, machine `.97`; CTTR `2.08/1.97` (Table 4) — малый сдвиг. |
|
|
||||||
| Lexical richness, perplexity, число символов/предложений, POS-TF-IDF, пунктуация, sentiment, readability | Та же RuATD, анализ решений §5 | Эти дополнительные признаки давали лишь ограниченную пользу; ни одна top-3 система их не использовала. | Это не валидация отдельного порога: выигрыш принадлежит обученному classifier, а не «MTLD ниже X». |
|
|
||||||
| MTLD, hapax/top-100, частицы, уменьшительные, function-word Cosine Delta, dispersion ratio длины, попарный chrF | Chaplynskyi et al., [UNLP 2026](https://aclanthology.org/2026.unlp-1.8.pdf), одна en→uk книга, 7 human + 3 AI | На этом корпусе AI: MTLD `311` против `377`, частицы примерно до 2× реже, уменьшительные `0.47` против `1.23`/1k tokens; AI outputs также сильнее сходятся между собой. Это релевантная книжная проверка класса сигналов, хотя не нашей пары. | Не classifier и нет held-out threshold/accuracy. Языково-зависимые признаки вроде частиц/уменьшительных требуют переопределения для English target; MTLD, dispersion и межсистемная сходимость переносятся как конструкты напрямую. |
|
|
||||||
| 45 структурных/лексических частот: пассив, non-finite/deverbal forms, pronoun classes, connectives, clause types, lexical density/TTR, dependency distance, sentence/clauses statistics | Kunilovskaya, Lapshinova-Koltunski, Mitkov, сентябрь 2021, [Russian fiction translationese](https://aclanthology.org/2021.ranlp-1.84/): оригинальная русская проза vs человеческие переводы на русский из 11 языков, RNC | Binary classification `82–92%`; structural features стабильнее lexical (Results/abstract, Appendix Table 2). Значит, бесплатная морфосинтаксическая панель на русской художке валидировалась. | Она распознаёт **в том числе живой человеческий перевод** как переводной русский; использовать её как machine-detector означает ложноположительно штрафовать сам объект работы. |
|
|
||||||
|
|
||||||
**Исполнительный вердикт.** Кроме уже локально названных MTLD/distinct-n/дисперсии длин/повторов,
|
|
||||||
существуют n-gram entropy, function-word distance, частицы, lexical density, морфологические классы,
|
|
||||||
связки, типы клауз, dependency distance, expansion dispersion и простые обучаемые TF-IDF/POS
|
|
||||||
classifiers. RuATD и русский translationese-классификатор подтверждают работоспособность семейства,
|
|
||||||
а en→uk book experiment — применимость части сигналов на книжном переводе. Главный пробел не в
|
|
||||||
языковой паре: **не найден пороговый detector с held-out quality/false-positive validation на
|
|
||||||
длинном современном LLM-литпереводе вообще**. Поэтому эти числа — диагностические оси/регрессия
|
|
||||||
внутри одной книги, а не доказательство «текст машинный».
|
|
||||||
|
|
||||||
### F8. «Не отходит от канона»: есть частичные приборы, но единого long-range score нет
|
|
||||||
|
|
||||||
Вопрос не о механизме памяти, а о наблюдаемом результате. По первоисточникам приборы распадаются
|
|
||||||
на три несовместимые задачи: (1) одинаково ли переведены повторные сущности/термы; (2) совпадает ли
|
|
||||||
выбор с утверждённым каноном; (3) остаётся ли различимым голос персонажа.
|
|
||||||
|
|
||||||
| Прибор | Что нужно на входе | На чём валидирован | Что доказывает / не доказывает |
|
|
||||||
|---|---|---|---|
|
|
||||||
| **Наш `canon_gaps` / D50 `bank.py`** ([exp23 §Д32.4, §Д50](../experiments/23-editor-tier.md)) | source triggers + подписанный bank `dst ∪ decl.forms` + candidate output; полный reference не нужен | Частичные zh→ru webnovel runs: 375–548 (term, chunk) пар; presence `96.9–98.9%`, weighted misses `0.23–1.29%`, effective consistency `99.3–100%` (§Д50.2). Exp23 в целом ещё **ИДЁТ**. | Это уже прямой измеритель adherence к явному канону терминов. Но ручное чтение поймало `古月方源 → «Гу Юэ Фан Юань»` вместо «Гуюэ», невидимое обоим автоматам из-за fullname-alias (§Д50.3). Следовательно, даже наш самый близкий прибор — монитор с известным blind spot, не proof книги. |
|
|
||||||
| **LTCR** — доля совпавших пар переводов повторного source-word среди `C(k,2)` ([Lyu et al., EMNLP 2021](https://aclanthology.org/2021.emnlp-main.262/)) | source + candidate + word alignment; полный reference не нужен | Gold-aligned ZH–EN: 268 docs/6 741 sentences; tests: zh↔en news 509 docs/5 146 sentences, TED zh↔en/en→fr 46 docs/4 632 sentences. Human test `n=500` сравнивал системы в целом, а не валидировал LTCR против ручной term-consistency. | Это прямо релевантное zh→en свидетельство внутренней лексической самосогласованности. Ограничение конструкта, а не языка: стабильно неверная форма получает 100%, identity/aliases/coreference не строятся. Уже подробно покрыто `research/05,13,14,15,19,20` и `experiments/15,16`. |
|
|
||||||
| **L-Anno / true-consistency test set** — LTCR только на повторных словах, которые действительно обязаны совпадать ([Lei et al., LREC-COLING 2024](https://aclanthology.org/2024.lrec-main.583.pdf)) | Для released test-set: source + candidate + alignment + gold-разметка source-position pairs «вариативность допустима/недопустима»; target reference при scoring не нужен. Но создание такой разметки для новой книги требует bilingual source/reference и людей. | Формально zh→en: 310 news documents/5 051 sentences, avg 16; статьи были изначально написаны по-английски и профессионально переведены на китайский, то есть тест делает reverse translation Chinese translationese→English original. 2 bilingual linguistics students, overlap 42 docs, IAA F1 `.96`. Из 30 667 пар повторных source words, одинаково переведённых в human target, 17 292 (`56.4%`) были true consistency, 13 375 (`43.6%`) — false consistency; `49.8%` true pairs разнесены на ≥5 предложений. | Исправляет conceptual defect LTCR: не штрафует всякую допустимую вариативность. Но это короткие reverse-origin news-документы, четыре старых NMT systems, без LLM/романов; score проверяет одинаковость требуемых pairs, а не правильность английской формы. В локальном корпусе точного источника не было. |
|
|
||||||
| **Semenov–Bojar terminology consistency** ([WMT 2022](https://aclanthology.org/2022.wmt-1.41/)) | source + candidate; terms/alignments; pseudo-reference = первое или самое частое candidate-употребление. Полного reference нет. | cs→en, 33 коротких legal agreements ELITR; WMT21/22 systems. Корреляция с human DA лишь косвенная: DA взята на **другом news dataset**; авторы называют оценку preliminary. | Ловит one-to-many drift без эталона, но превращает first/majority error в «канон» и не знает правильности. Это ровно известная локально опасность LTCR-first-wins. |
|
|
||||||
| **CoTERM** — HHI для accuracy + consistency + допустимой вариативности ([Hazem & Kageura, LREC 2026](https://aclanthology.org/2026.lrec-1.682/)) | Для `CoTERM+` достаточно annotated source terms + term-only canon допустимых targets + candidate; полный framework и `CoTERM−` дополнительно предполагают sentence references. | en→fr TICO-19 (30 docs, 2 100 annotated sentences) и en→ja ASPEC (1 300); 1 250 system sentences/309 term pairs оценили 3 native Japanese specialists. Correlation с людьми умеренная: Kendall `.41–.47`, Pearson `.46–.57` (Table 6), хотя abstract говорит “strongly”. | Может отличить допустимые варианты от ошибок, то есть ближе всего к «держит утверждённый термин». Языковая пара не мешает перенести формулу на zh→en при наличии term list; реальный предел — sentence/term-level human validation, тогда как document/corpus validation оставлена будущей работой. |
|
|
||||||
| **BlonDe** — F1 по ENTITY/TENSE/PRONOUN/discourse categories ([Jiang et al., NAACL 2022](https://aclanthology.org/2022.naacl-main.111/)) | candidate + **полный human reference**, English NER/POS/rules | BWB zh→en webnovels: 384 книги; train 377, printed test 80 chapters/2 632 sentences, dev 79; chapter 18–46 sentences, median 30. Error study: 8 professional translators; correlation study: 4 translators + 4 native-English revisers, 5-sentence blocks. BlonDe.F1 `r=.417` adequacy/`.358` fluency. | Это наиболее прямо релевантный найденный zh→en literary benchmark, и для English target его инструменты подходят без языкового порта. Но score остаётся reference-based category-count overlap, не book-level identity/coreference/alias tracking и не автономный контроль 2 000 глав. Уже покрыта `research/03,11,12,15,22`. |
|
|
||||||
| **BWB gold discourse benchmark/protocol** ([Jiang et al., ACL 2023](https://aclanthology.org/2023.acl-long.435.pdf)) | source + full target reference с entity IDs, term-span flags, coreference chains и quotation structure; system output; ручная либо task-specific automatic сверка. Term flag — категория, не готовый список допустимых canonical strings. | Zh→en webnovels: test 80 chapters/2 633 sentences из 6 novels; 8 professional translators. §3 печатает 8 585 EN + 6 070 ZH = **14 655** mentions, тогда как abstract конфликтно заявляет 15 095; бесспорным считаю разложенное число. Отдельно 4 zh→en experts размечали document errors; ENTITY `43.3%`, COREF `34.0%`, TERM `19.2%`, ZEROPRO `17.3%`, QUOTE `1.1%` (категории пересекаются). | Это gold bilingual resource/protocol для отдельных entity/term/coreference/quotation audits, не один воспроизводимый production canon score. Нужны annotated source/reference и task-specific evaluator либо человек; межглавная дистанция и character voice не покрыты. Полный локальный дубль `research/17,18-chatgpt` и семейств BlonDe; дельты источника нет, была ошибка моей интерпретации. |
|
|
||||||
| **MetaDocEval** — contrastive тест самих метрик ([Dahan, Bawden, Yvon, EAMT 2026](https://aclanthology.org/2026.eamt-1.19/)) | perturbations + source/reference/system outputs; это meta-evaluation, не production score | en→fr/es/de WMT24++, 59–150 docs на perturbation/pair, average 11.3 sentences. Document-quality human scores не собирались; один annotator проверил лишь perturbation validity en→fr: `n=31/26/19/40` для tense/lexical/conjunction/pronoun (Appendix A.6). | Отрицательный результат: ни одна текущая метрика не ловит document coherence надёжно; reference-free COMETKiwi/MetricX-QE к `w=9` едва около chance, LLM scorers деградируют, лучший компромисс ≈3 предложения. Style/register и deep coreference не покрыты. |
|
|
||||||
| **TRANSGRAPH source-grounded cohesion probe** ([Pham et al., EACL 2026](https://aclanthology.org/anthology-files/pdf/eacl/2026.eacl-long.75.pdf), §3.3.5) | English source + candidate; Gemini-2.5-Flash ставит tags только source pronouns/coreferents и conjunctions, затем отмечает корректность target realization; полный reference для score не нужен | ACL 60/60: 5 technical talks, 6 en→de/fr/ja/pt/ru/zh directions; avg 84.2 sentences/1 746 tokens, max 101/2 031. Spot-check — только docs 111/410, без числа tags, annotators и IAA: coreference annotation `97.2/98.8%`, evaluation `100/100%`; conjunction annotation `98/100%`, evaluation `93.9/98.4%`. | Новый reference-free LLM probe для English-source pronoun coreference/conjunction внутри system paper, не отдельно meta-validated metric; human-quality correlation нет. На zh→en не проверен: нужна валидация Chinese source tagging/prompts. Терминология и произвольные entity names этим probe не оцениваются. |
|
|
||||||
| **mStyleDistance** ([Qiu et al., Findings ACL 2025](https://aclanthology.org/2025.findings-acl.869/)) + character-quote verification ([Michel et al., LaTeCH-CLfL 2024](https://aclanthology.org/2024.latechclfl-1.15/)) | target-only quote aggregates с известным speaker; reference не нужен, но для preservation нужен baseline/profile, которого статьи не валидируют | mStyleDistance обучен на 9 языках; AV — Greek/Spanish/Dutch (avg ROC-AUC `.66`). Fictional Voices особенно релевантен English target: 28 English novels, 1 606 chapterwise queries; LUAR character-character AUC `.816`, но quote attribution `.536` против semantic `.551`. | Это style/distinguishability proxy, не human-correlated character voice fidelity. Ни одна работа не валидирует сохранение голоса **при переводе** или через сотни глав; именно это, а не отсутствие русского, остаётся пробелом. Локально ось уже есть в `research/15`; боевые `first_person`/`speech` пусты `0/49` (`experiments/23:4355`). |
|
|
||||||
| **CONSTORY-CHECKER / Consistency Error Density** ([Huang et al., Findings ACL 2026](https://aclanthology.org/2026.findings-acl.410.pdf)) | только целевая длинная история; o4-mini извлекает и попарно проверяет противоречащие цитаты по 5 dimensions/19 subtypes; external reference/canon не нужен | English fiction, **prompted** на 8–10k words; фактическая длина diagnostic отдельно не дана. Diagnostic: 200 stories, 1 000 injected errors от Qwen3-235B-A22B-Thinking; 2 professional webnovel writers выступали competing detectors против injected ground truth. Checker: precision `.884`, recall `.550`, F1 `.678`; character F1 `.742`, factual `.718`, narrative/style `.507`; union людей F1 `.374`. | Target-only internal-contradiction detector, валидированный на синтетически внедрённых, не естественных ошибках; human correlation нет. Он не доказывает adherence к source/canon и пропускает последовательный, но неверный перевод. English/Western fiction, одна judge model, не multi-chapter. В локальном корпусе работы не было. |
|
|
||||||
|
|
||||||
Два близких названия не надо ошибочно превращать в дополнительные canon-scores. [SEGALE
|
|
||||||
(Wang et al., EMNLP 2025)](https://aclanthology.org/2025.emnlp-main.1645.pdf) переносит COMET/MetricX
|
|
||||||
на неразмеченный поток произвольной длины через cross-lingual segmentation/alignment и допускает
|
|
||||||
reference-free QE. В book experiment модели переводили отдельные 1k/2k/4k/8k-token inputs,
|
|
||||||
нарезанные из одной zh→en книги; MetricX/null-alignment trends там не перепроверялись людьми.
|
|
||||||
Это полезный **транспорт оценки**, но не проверка межсегментной когерентности, сущностей, фактов или
|
|
||||||
голоса; основная validation — WMT24 en→de/en→es/ja→zh с synthetic 10% deletions/merges и
|
|
||||||
segment-level MQM, где annotators не просили учитывать discourse. Источник уже есть в `research/19`.
|
|
||||||
[S-VoCAL (Berthe-Pardo et al., LREC 2026)](https://aclanthology.org/2026.lrec-1.860/) действительно
|
|
||||||
имеет 952 character–book pairs из 192 English books и восемь voice-related attributes, но измеряет вывод age/gender/origin
|
|
||||||
для выбора **акустического** голоса аудиокниги, а не устойчивость речевого стиля персонажа в
|
|
||||||
переводе. Это book-wide static character-attribute inference benchmark, не voice/style/temporal
|
|
||||||
stability metric; концептуально он повторяет audiobook-passport donor из `research/15`. Поэтому оба
|
|
||||||
источника очерчивают инфраструктуру, но не закрывают искомый конструкт.
|
|
||||||
|
|
||||||
Отдельной family-wise multiplicity correction для перечисленных model/metric grids в просмотренных
|
|
||||||
Results не заявлено; там, где даны correlations/accuracy, они не превращались здесь в более широкий
|
|
||||||
клейм, чем конкретный corpus/task.
|
|
||||||
|
|
||||||
**Ответ на вопрос о reference-free.** Узкий прибор у нас уже есть: D50 считает соблюдение
|
|
||||||
подписанного term/name bank без полного эталона, но известный fullname-alias drift прошёл сквозь
|
|
||||||
него. После повторного поиска без ru-фильтра найден **набор частичных, пока не скомпонованных
|
|
||||||
диагностик**, а не готовый стек: D50/CoTERM проверяют заданный term canon; L-Anno — lexical sameness
|
|
||||||
на заранее размеченных обязательных pairs; TRANSGRAPH — две English-source discourse relations;
|
|
||||||
CONSTORY-CHECKER — target self-consistency; BWB — отдельные gold-аудиты на zh→en chapters. Эти
|
|
||||||
приборы имеют разные inputs, направления, домены и units и совместно на одной zh→en книге не
|
|
||||||
валидировались. LTCR и Semenov–Bojar без канона доказывают только **самосогласованность**.
|
|
||||||
|
|
||||||
Следовательно, на 31.08.2026 нет одной валидированной метрики «канон держится на сотнях глав» и
|
|
||||||
нельзя заявить, что перечисленные компоненты уже доказательно складываются. Есть эмпирические
|
|
||||||
части для отдельной проверки терминов, обязательного единообразия, некоторых source relations и
|
|
||||||
внутренних narrative contradictions. Самые слабые места — стабильно неверный относительно source
|
|
||||||
факт, межглавная identity/alias resolution и сохранение именно **речевого голоса персонажа при
|
|
||||||
переводе**: CONSTORY-CHECKER имеет narrative/style F1 `.507` только на injected internal shifts, а
|
|
||||||
не на сходстве с голосом китайского оригинала.
|
|
||||||
|
|
||||||
#### Контрольная сводка четырёх клеймов из запроса
|
|
||||||
|
|
||||||
| Клейм | Вердикт после исполнения | Насколько широко можно говорить |
|
|
||||||
|---|---|---|
|
|
||||||
| Бесплатные detectors по diversity/diminutives | **Частично.** ATD classifiers и structural translationese-панели валидированы; MTLD/diminutive signals проверены на одной en→uk книге. | Язык не обнуляет класс сигналов, но языково-зависимые features надо переопределять. Нет held-out detector для длинного современного LLM-литперевода; отдельный scalar не годится как machine label. |
|
|
||||||
| Source visibility переворачивает systems ranking | **Да, по Table 3–4 F6a:** один и тот же GPT-5.2 judge, те же pairs; все AI systems падают ровно на 5 ranks без source. | Одна en→uk книга, sentence pairs, self-judge, без significance test; не универсальный закон. |
|
|
||||||
| LLM чаще человека объявляет ошибкой human translation | **Да, F6b:** GLM `z=2.07, p=.038` для HT; одновременно judge реже ставит ошибки MT (`z=6.16, p<.001`). | Один GPT-5.2 judge, 6 текстов по 97–182 слова, en→nl/en→ca/ru→nl; без →ru и без книги. |
|
|
||||||
| Плохо отобранный context хуже пустого | **Да для injected distractors**, Loong §4.4/Figure 4; **нет** для наивного сравнения `w/o Tuning` vs `w/o Context` из-за confound. | Automatic metrics на News/WMT; точных figure-values/significance нет. Локально это уже прямой дубль `research/13,14`, поэтому не новая находка. |
|
|
||||||
|
|
||||||
## 3. Противоречия нашим выводам
|
|
||||||
|
|
||||||
### C1. Прямая внутренняя коллизия: цена diff в промте устарела относительно review-header
|
|
||||||
|
|
||||||
[`Жёсткий контур задания`](../../eval/dovodka/PROMPT-RESEARCH-HARNESS.md) пересказывает локальный
|
|
||||||
diff как «1.5–2 раза дороже». Первичный артефакт
|
|
||||||
[`experiments/19-editor-contract-q4b.md`](../experiments/19-editor-contract-q4b.md) в принятой
|
|
||||||
review-header даёт три реплики отношения diff/full: **2.913, 1.677, 2.468**, а позднейшая поправка
|
|
||||||
сужает взаимодействие до model×target: dspro **ru 2.83, en 0.67**. Команда проверки:
|
|
||||||
|
|
||||||
```bash
|
|
||||||
rg -n '2\.913|1\.677|2\.468|ru 2\.83|en 0\.67|1\.5–2' \
|
|
||||||
eval/dovodka/PROMPT-RESEARCH-HARNESS.md docs/experiments/19-editor-contract-q4b.md
|
|
||||||
```
|
|
||||||
|
|
||||||
Это не меняет локальный вердикт для боевой ru-клетки («full-regen остаётся»), но опровергает
|
|
||||||
упрощённую универсальную магнитуду и особенно важно рядом с F4: его «edit contract» нельзя считать
|
|
||||||
внешней репликацией нашего формата.
|
|
||||||
|
|
||||||
### C2. Внешний counter-signal к «feedback/point repair отклонены», но не опровержение
|
|
||||||
|
|
||||||
[`experiments/21-role-topology`](../experiments/21-role-topology.md) отклонил точечный ремонт,
|
|
||||||
обратную связку и routing на нашей прозе/нашем риге. Более близкий аналог — critic→full rewrite
|
|
||||||
`Z1` в [`experiments/23-editor-tier`](../experiments/23-editor-tier.md): ставка semantic
|
|
||||||
critic→fixer не подтверждена и схема оказалась самой дорогой среди проверенных, но exp23 ещё идёт,
|
|
||||||
а rank-order позиционно confounded. Внешний [F4-paper](https://aclanthology.org/2026.acl-industry.115.pdf)
|
|
||||||
получил рост two-stage evaluator→repair в 4/7 en→de и 6/7 en→zh COMET-сравнениях и регрессию
|
|
||||||
второго раунда в 6/7 en→de клеток (Tables 5, 4). Условия не изоморфны: F4 — e-commerce segments,
|
|
||||||
RAG из 135–184k TM, full-hypothesis output, automatic metrics, без significance. Поэтому закрытый
|
|
||||||
вывод exp21 не снят, а exp23 не ратифицирован; внешний результат лишь показывает, что направление
|
|
||||||
первого repair-step не является универсальным MT-законом.
|
|
||||||
|
|
||||||
### C3. «Архитектура улучшает качество» расщепляется по измеряемой оси
|
|
||||||
|
|
||||||
Закрытый [`exp21`](../experiments/21-role-topology.md) показывает преимущество
|
|
||||||
draft→whole-chapter rewriter по локальному прибору; exp23 здесь не используется как ратифицированная
|
|
||||||
улика. [F1](http://www.jbe-platform.com/deliver/fulltext/10.1075/target.25081.wan/target.25081.wan.pdf)
|
|
||||||
на той же модели показывает эффект другой
|
|
||||||
topology лишь по fluency (`r=.71` LCD–human), ноль по accuracy (`r=.02`) и одновременно
|
|
||||||
систематические additions. [F2](https://aclanthology.org/2026.acl-long.268.pdf) также находит
|
|
||||||
основной выигрыш refinement во fluency/style, а accuracy — слабой/неоднородной. Это не опровергает
|
|
||||||
локальную дельту, но противоречит её широкой трактовке как единого scalar «качества»: topology
|
|
||||||
может улучшать fluency без доказанного улучшения accuracy; fidelity-эффект неоднороден, а voice в
|
|
||||||
F1/F2 не измерен.
|
|
||||||
|
|
||||||
## 4. ЧЕГО НАЙТИ НЕ УДАЛОСЬ и ЧТО НЕ ПРОВЕРЕНО
|
|
||||||
|
|
||||||
1. **Нет matched-замера «список исполнимых правок vs полный переписанный текст» на литературе.**
|
|
||||||
F4 оказался ложным кандидатом: structured list выдаёт evaluator, но editor возвращает full
|
|
||||||
hypothesis. F2 тоже делает rewrite сегмента. Внешнего подтверждения/опровержения нашему
|
|
||||||
Q4b-формату не найдено.
|
|
||||||
2. **Нет human book-length сравнения topology.** F1 переводит главы, но судит 30 коротких отрывков;
|
|
||||||
F2 генерирует документы примерно по 2 048 слов, но human annotators судят contiguous chunks;
|
|
||||||
F3 имеет 12 глав классики, но только automatic curves; F6a покрывает корпус одной книги, но
|
|
||||||
сравнивает отдельные sentence pairs, не читает книгу/голос/когезию. Перенос «отрывок/глава →
|
|
||||||
1 500–2 300 глав» не проверен.
|
|
||||||
3. **Нет измеренной памяти через сотни глав.** Ни retention имён/обращений/голоса на поздних главах,
|
|
||||||
ни окупаемости whole-book pre-pass/series bible с человеческим судьёй не найдено. Loong —
|
|
||||||
ближайший прототип, но его literary human-eval и опубликованный код отсутствуют.
|
|
||||||
4. **Thinking: quality и cost одновременно не закрыты.** F5 измеряет quality кратких literary UCP,
|
|
||||||
но не reasoning tokens/деньги; Loong признаёт overhead без чисел. Локальный DRT даёт token
|
|
||||||
multiplier, однако новой литературной price–quality frontier после нашего среза не найдено.
|
|
||||||
5. **Pair-specific →ru calibration не найдена, но это не блокирует архитектурный вывод.** F2
|
|
||||||
включает en→ru, однако human Table 4 агрегирует семь направлений; F6b имеет ru→nl, не →ru.
|
|
||||||
Для проверки самих constructs данные zh→en/en→uk/en→ja засчитываются; отдельная пара нужна лишь
|
|
||||||
для калибровки языково-зависимых extractors, morphology и thresholds.
|
|
||||||
6. **Не найдены debates/jury топологии с книжным human-замером.** Selection/synthesis/debate уже
|
|
||||||
покрыты локально; свежего более сильного literary evidence дельта-фильтр не дал.
|
|
||||||
7. **Market/OSS-поиск не дал хронологической или измерительной дельты.** Три пропуска
|
|
||||||
`research/22` оказались старше его среза 24.07, а их механизмы повторяют уже известные слои:
|
|
||||||
Balint Taborski, 07.06.2026, [BookTranslate Copilot](https://www.booktranslate.ai/blog/towards-agentic-mtpe-translation-copilot)
|
|
||||||
заявляет Finalizer→Naturalizer→ThreadWeaver→reviewable edits; неподписанная
|
|
||||||
[BookFoundry company page](https://bookfoundry.ai/ai-book-translation/) с live-total stamp
|
|
||||||
17.07.2026 — book brief→chunk translation→native-voice rewrite; GitHub
|
|
||||||
[`OYcedar/novel-translator`](https://github.com/OYcedar/novel-translator) — stable IDs,
|
|
||||||
glossary, summary, resumability и guards (`main.py`, `prompts/novel_translation_system.md`,
|
|
||||||
`skills/novel-translator/SKILL.md`). Ни один не публикует comparative literary quality corpus,
|
|
||||||
пары, human judge и статистику. Поэтому отсутствие имён в `research/22` — omission старого
|
|
||||||
среза, не основание выдавать их за новую находку.
|
|
||||||
8. **Multiplicity часто отсутствует.** Она есть у F1 pairwise fluency/accuracy (Bonferroni) и у
|
|
||||||
F6b modality post-hoc (Holm–Bonferroni); не заявлена у F2 Table 4/трёх Table 5 tests, F3, F4,
|
|
||||||
F5 model×prompt grid и F6a rank reversal. Значимость там не достраивалась мной из процентов.
|
|
||||||
9. **Цена вызовов F1/F2/F3 не опубликована.** Поэтому число стадий не превращалось в выдуманный
|
|
||||||
COGS: F1 не даёт calls/tokens; F2 — токены/cost; F3 — overhead/call count в агрегате.
|
|
||||||
10. **Платных закрытых источников, несущих уникальную таблицу, в итог не включено.** HTML `print`
|
|
||||||
F1 отдавал 403 при финальной перепроверке; официальный publisher PDF открылся после redirect
|
|
||||||
с HTTP 200. Остальным несущим источникам доступны официальные PDF/HTML.
|
|
||||||
11. **Два claims первоисточников остались неподтверждёнными телом.** [Loong](https://arxiv.org/html/2605.30274)
|
|
||||||
пишет «code is released», но linked [repo](https://github.com/YutongWang1216/LoongDocMT) на
|
|
||||||
31.08 содержит только README. [F4](https://aclanthology.org/2026.acl-industry.115.pdf) abstract
|
|
||||||
заявляет agreement с human MQM/preferences, но в Methods/Results нет human-study/table. Это
|
|
||||||
source self-contradictions, не противоречия локальному выводу; claims выше не считаются measured.
|
|
||||||
12. **Не найден long-form literary machine-detector ни на одной подходящей паре.** RuATD
|
|
||||||
валидирует short-form ATD, RANLP-2021 — human translationese, а en→uk book study даёт сигналы,
|
|
||||||
но не classifier. Пробел — held-out accuracy, threshold и false-positive rate на длинных
|
|
||||||
переводах современных LLM, а не конкретно русский язык.
|
|
||||||
13. **Не найден единый reference-free canon score; найдены нескомпонованные частичные приборы.**
|
|
||||||
D50/CoTERM закрывают term-only canon, L-Anno — обязательность единообразия на gold subset,
|
|
||||||
TRANSGRAPH — две English-source relations, CONSTORY-CHECKER — внутренние contradictions, BWB —
|
|
||||||
дорогую gold-разметку четырёх discourse-осей. Не валидированы их совместное применение на одной
|
|
||||||
zh→en книге, межглавная identity/alias resolution и работа на сотнях глав.
|
|
||||||
14. **Не найден валидированный MT character-voice preservation score.** CONSTORY-CHECKER уже
|
|
||||||
распознаёт внутренние POV/tone/style shifts на English fiction (narrative/style F1 `.507`), а
|
|
||||||
style/authorship embeddings различают персонажей. Но ни один прибор не проверен как
|
|
||||||
source-character voice → translated-character voice; MetaDocEval также показывает размывание
|
|
||||||
общих document metrics на коротких окнах.
|
|
||||||
|
|
||||||
Отдельно исключён как дубль Wu, Aycock, Monz,
|
|
||||||
[*Please Translate Again*](https://arxiv.org/html/2506.04521): `research/15:158,272` уже содержит
|
|
||||||
его главную дельту (decomposition не помогает, первый простой refinement даёт основной выигрыш).
|
|
||||||
Повтор не стал находкой.
|
|
||||||
|
|
||||||
## 5. ЧТО Я НАПУТАЛ
|
|
||||||
|
|
||||||
Ниже журнал не косметических правок, а ошибок, которые могли изменить вывод.
|
|
||||||
|
|
||||||
| Ошибка до самопроверки | Класс | Как поймана | Что стало в отчёте |
|
|
||||||
|---|---|---|---|
|
|
||||||
| Сначала счёл `Please Translate Again` новой осью reasoning. | дубль | `rg -n -i '2506\.04521\|translate again' docs/research` нашёл `research/15:158,272`. | Источник вынесен в §4 как осознанно исключённый дубль. |
|
|
||||||
| Сначала счёл refinement-paper новой topology. | дубль/overclaim | Первичный grep смотрел `docs/research` и только `docs/experiments/README.md`. Полный `rg -l ... docs/research docs/experiments` нашёл **8 старых файлов**: `research/{03,11,14,17,18}` и `experiments/{09,12,23}`; эта запись была девятым местом. | F2 понижен до библиографической верификации/закрытия TODO; все delta-команды переведены на полный корпус и исключают оба параллельных 29-файла. |
|
|
||||||
| Записал Loong как однозначно 10-sentence segmentation. | внутреннее противоречие source | §4.1 задаёт `l=5`, Limitations — 10. | Число снято из описания topology; обе несовместимые величины и их секции названы явно. |
|
|
||||||
| Принял `w/o Tuning=75.4 < w/o Context=77.4` за доказательство «плохой context хуже пустого». | confounded arms | §4.3 меняет training/context policy одновременно; §4.4 отдельно инъецирует 30–50 чужих предложений и имеет baseline length 0. | Клейм опирается только на Figure 4; Table 3 прямо исключена как чистая проверка. Сам клейм отмечен дублем `research/13,14`. |
|
|
||||||
| Был готов назвать все translationese-признаки machine-detectors. | construct mismatch | RANLP-2021 обучен отличать **человеческие переводы** от оригинальной русской прозы; RuATD — другой target. | F7 разделяет ATD, translationese и stylistic compression; порогового long-form literary LLM detector не заявляет. |
|
|
||||||
| Использовал отсутствие русского как слишком сильный отрицательный фильтр. | неверная граница переноса | В контуре проекта zh→en — приоритетная пара; LTCR проверен на zh↔en, а BlonDe — прямо на zh→en webnovels. Для entity/term-consistency язык меняет инструменты извлечения, но не сам измеряемый конструкт. | F7/F8 и §4 переписаны: zh→en evidence засчитывается полностью; caveat оставлен только для morphology/NER/alignment/thresholds и действительно отсутствующей long-range validation. |
|
|
||||||
| Сначала исправил только формулировки, не перезапустив discovery без языкового фильтра. | неполная коррекция search scope | После прямого вопроса владельца выполнен новый primary-source поиск и полный дедуп по обоим деревьям. Он нашёл отсутствующие локально zh→en L-Anno, TRANSGRAPH cohesion probe и CONSTORY-CHECKER; BWB был локально известен, но не распознан мной как gold audit resource. | F8 переисследован: добавлены точные inputs, samples, human validation и границы; итог расширен от одних term monitors до нескольких частичных диагностик. |
|
|
||||||
| После пере-поиска преждевременно назвал несовместимые диагностики «составным измерительным стеком». | композиционный overclaim | Оба повторных reviewer-а независимо указали: L-Anno — reverse-origin news/gold subset; TRANSGRAPH — English-source technical probe; CONSTORY — target-only injected contradictions; BWB — reference benchmark и локальный дубль. Совместной zh→en book validation нет. | «Готовый стек» снят. F8 теперь говорит о нескомпонованных частичных приборах; уточнены direction/reference/validation, конфликт BWB `14 655` vs `15 095` и segment-only book experiment SEGALE. |
|
|
||||||
| Почти назвал LTCR/стилевые embeddings единым canon score. | consistency≠correctness / proxy≠validation | Формула LTCR даёт 100% стабильно неверной форме; mStyleDistance AV не валидирован на переводе; MetaDocEval показывает collapse с длиной. | F8 разделён на internal consistency, term-only correctness и unvalidated character-voice proxy; итог — единого прибора нет. |
|
|
||||||
| В первом ответе на вопрос о каноне сказал только «внешнего единого прибора нет» и пропустил наш D50. | тот же дефект неполного experiments-grep | Полный поиск `canon_gaps|effective consistency` поднял `experiments/23` §Д32.4/Д50: 375–548 пар и известный невидимый fullname drift. | D50 поставлен первой строкой F8: узкий reference-free monitor уже есть, но его собственный false negative запрещает называть его proof. |
|
|
||||||
| Сначала слишком грубо описал CoTERM как обязательно требующий полного перевода-эталона и перенёс `79` dev chapters BlonDe в test. | неточная граница reference-free / ошибка split | Повторный `evidence_audit`: CoTERM+ использует source terms и набор допустимых целевых терминов без полного sentence reference; Table 1 BlonDe печатает **80 test / 79 dev** chapters. | В F8 разведены CoTERM+, CoTERM− и полный framework; split и human-correlation BlonDe исправлены по таблице. |
|
|
||||||
| Сжал результат F7-grep до `research/12-*` и не перечислил `research/28`. | неточная запись дедупа | Финальный буквальный повтор той же команды дал 13 файлов: 11 research и 2 experiments; из семейства 12 — только consumer/taxonomies/ja/zh. | Реестр F7 заменён точным списком вывода, команда переключена с `-n` на согласованный с результатом `-l`. |
|
|
||||||
| По названию «edit contract» почти приравнял F4 к нашему diff. | construct mismatch | Полный PDF §3.4: editor outputs `new hypothesis` и `edit log`. | В F4 и §4 явно записано: это full output, matched diff-vs-full замера нет. |
|
|
||||||
| Перенёс из задания «diff 1.5–2× дороже». | stale summary / позднее противоречие | Review-header `experiments/19` первична: 2.913/1.677/2.468; позднее ru 2.83/en 0.67. | Исправлено и вынесено отдельным C1. |
|
|
||||||
| Был готов повторить F4 abstract про human MQM agreement/preferences. | abstract вместо таблицы | `find`/поиск `human` по 16-страничному PDF не нашёл human-study в Methods/Results. | Claim помечен неподтверждённым и не используется как measured evidence. |
|
|
||||||
| Принял фразу Loong «code is released» за наличие реализации. | claim/code mismatch | Открыто дерево linked GitHub: только README, implementation отсутствует. | F3 разделяет paper algorithm и фактически отсутствующий public code. |
|
|
||||||
| Счёл `Creativity Bias` целиком новой. | частичный дубль | grep нашёл ссылку и общий вывод в `research/18:326`. | F6b оставлен только ради отсутствующих локально точных modality/genre/human таблиц. |
|
|
||||||
| Почти выдал 12 глав *Journey to the West* за книжную проверку качества. | перенос/слабый judge | Table/Figure и Limitations Loong: известная классика, automatic metrics, без human eval. | В F3 это только preliminary stability evidence; в §4 book-length human gap остаётся открытым. |
|
|
||||||
| Title-only grep ошибочно объявил F1 полностью новой. | ложная дельта/дубль | Adversarial `delta_transfer_audit` нашёл DOI и «stylistic lift with occasional additions» в `research/17:243,287`. | F1 сужен до восстановленного full text, exact design/sample/effects; grep расширен DOI/авторами. |
|
|
||||||
| Назвал F2 human-оценку документной. | перенос единицы оценки | `delta_transfer_audit` проверил Appendix A.5: outputs document-level, annotators видели contiguous chunks. | В F2 и §4 разделены document generation и chunk-level human judgment. |
|
|
||||||
| Назвал F6a контролем «на целой книге». | перенос corpus→unit | `delta_transfer_audit` проверил Methods §4: corpus покрывает книгу, pairwise unit — два предложения. | F6a понижен до sentence-pair construct-control; voice/cohesion не приписываются. |
|
|
||||||
| Слил статус exp21–23 и выдал exp23 price/rank за готовый. | поздняя review-header | Adversarial-аудит поднял `experiments/README`: exp23 **ИДЁТ**, `--final` красный; D48.5 нашёл position confound. | §1 разделяет exp21/22/23; C2/C3 не используют exp23 как ратифицированный результат. |
|
|
||||||
| Сравнил F4 только с exp21 point repair. | неверный ближайший аналог | `delta_transfer_audit` нашёл более близкий exp23 `Z1` critic→full rewrite. | C2 сравнивает обе формы и явно помечает exp23 provisional. |
|
|
||||||
| Выдал три рыночных пропуска `research/22` за новинки после его среза. | хронологическая ложная дельта | Adversarial-аудит сопоставил даты BookTranslate/BookFoundry/OYcedar со срезом 24.07. | F7 удалён из находок; источники оставлены в §4 как старые omissions без quality baseline. |
|
|
||||||
| Приписал F1/F2 возможное ухудшение voice. | construct overclaim | Оба агента указали: voice не мерили; F1 accuracy равна, additions качественные. | C3 теперь говорит только о fluency без доказанного accuracy-gain; fidelity неоднородна, voice unmeasured. |
|
|
||||||
| В F5 смешал Task 1 comprehension с Task 2 translation. | task/judge conflation | `evidence_audit` развёл §3.1/§5.1 и Table 1/13. | Добавлены `n=299`, отдельные judges/пары и прямые thinking-сравнения Task 2 из Table 13. |
|
|
||||||
| Ссылка F1 `print` оказалась нестабильной (403). | URL verification | `evidence_audit` повторил запрос; затем `curl -s -I -L` publisher PDF дал redirect→200. | Все F1-ссылки заменены открывшимся publisher PDF; 403 записан в §4. |
|
|
||||||
| Delta-grep после создания файла находил сам отчёт. | невоспроизводимый артефакт | Повторный запуск вернул строки `29-…-codex.md` вместо ожидаемого Ø. | Во все команды добавлен `--glob '!29-harness-topology-survey-codex.md'`, результаты пересняты. |
|
|
||||||
|
|
||||||
### Исполнимая финальная сверка
|
|
||||||
|
|
||||||
Ссылки в F1–F8 и §4 были открыты по одной; числа сверены не с abstract, а с названными
|
|
||||||
Tables/Results/Methods. Механические проверки артефакта перед сдачей:
|
|
||||||
|
|
||||||
```bash
|
|
||||||
# ровно пять требуемых разделов верхнего уровня
|
|
||||||
rg -n '^## [1-5]\.' docs/research/29-harness-topology-survey-codex.md
|
|
||||||
# запрет placeholder и прескриптивного языка до самого технического блока; ожидается Ø
|
|
||||||
awk '/^### Исполнимая финальная сверка/{exit}{print}' \
|
|
||||||
docs/research/29-harness-topology-survey-codex.md | \
|
|
||||||
rg -n -i 'Заполняется|TBD|PLACEHOLDER|рекомендую внедрить|надо внедрить|нужно внедрить|следует внедрить|стоит внедрить|лучший выбор|robust.?рецепт'
|
|
||||||
# все внешние URL до этого технического блока (список для повторного открытия)
|
|
||||||
awk '/^### Исполнимая финальная сверка/{exit}{print}' \
|
|
||||||
docs/research/29-harness-topology-survey-codex.md | rg -o 'https?://[^ )]+' | sort -u
|
|
||||||
```
|
|
||||||
|
|
||||||
### Артефакт открытия ссылок
|
|
||||||
|
|
||||||
Проверено 31.08.2026; `200` означает, что открылось тело, а не только search result.
|
|
||||||
|
|
||||||
| URL | Фактический результат |
|
|
||||||
|---|---|
|
|
||||||
| [publisher PDF F1](http://www.jbe-platform.com/deliver/fulltext/10.1075/target.25081.wan/target.25081.wan.pdf) | `curl -s -I -L`: 301→200, `content-type: application/pdf`; прежний HTML `print` — 403. |
|
|
||||||
| [F2 ACL PDF](https://aclanthology.org/2026.acl-long.268.pdf) | 200; открыты §3, Tables 1, 3–7, Appendix A.5. |
|
|
||||||
| [F3 arXiv HTML](https://arxiv.org/html/2605.30274) | 200; открыты Algorithm 1, Tables 1–4/A.4. |
|
|
||||||
| [F3 GitHub](https://github.com/YutongWang1216/LoongDocMT) | 200; public tree содержал только README. |
|
|
||||||
| [F4 ACL PDF](https://aclanthology.org/2026.acl-industry.115.pdf) | 200; открыты §3.4, Tables 1–5, 8, 10. |
|
|
||||||
| [F5 ACL PDF](https://aclanthology.org/2026.findings-acl.2030.pdf) | 200; открыты §§3–5, Tables 1, 13. |
|
|
||||||
| [F5 GitHub](https://github.com/NL2G/Beyond-Reproduction) | 200; открыты root и `task2_ucp/` paths. |
|
|
||||||
| [F6a ACL PDF](https://aclanthology.org/2026.unlp-1.8.pdf) | 200; открыты Methods §4, Tables 2–4. |
|
|
||||||
| [F6b ACL PDF](https://aclanthology.org/2026.eamt-1.43.pdf) | 200; открыты Tables 4–5, 11–12. |
|
|
||||||
| [F6b GitHub](https://github.com/INCREC/Creativity_bias) | 200; открыты каталоги protocols/data/statistics. |
|
|
||||||
| [RuATD 2022](https://arxiv.org/html/2206.01583) | 200; открыты Tables 2–5 и §§4.4–5. |
|
|
||||||
| [Russian fiction translationese](https://aclanthology.org/2021.ranlp-1.84/) | 200; открыты Results и Appendix Table 2. |
|
|
||||||
| [LTCR](https://aclanthology.org/2021.emnlp-main.262/) | 200; открыты формула (1), Tables 1, 4, 7, 9. |
|
|
||||||
| [Semenov–Bojar](https://aclanthology.org/2022.wmt-1.41/) | 200; открыты algorithm, Tables 1–3, Limitations. |
|
|
||||||
| [CoTERM](https://aclanthology.org/2026.lrec-1.682/) | 200; открыты §§3, 4, 6–9, Tables 2, 5–6. |
|
|
||||||
| [BlonDe](https://aclanthology.org/2022.naacl-main.111/) | 200; открыты BWB/Table 1, formula, human study. |
|
|
||||||
| [L-Anno zh→en](https://aclanthology.org/2024.lrec-main.583.pdf) | 200; открыты §§2–3, Tables 1–6, Appendix A. |
|
|
||||||
| [BWB discourse protocol](https://aclanthology.org/2023.acl-long.435.pdf) | 200; открыты §§2–5, Tables 1–7, Appendix E; зафиксирован конфликт abstract `15 095` vs §3 `8 585+6 070=14 655`. |
|
|
||||||
| [TRANSGRAPH cohesion judge](https://aclanthology.org/anthology-files/pdf/eacl/2026.eacl-long.75.pdf) | 200; открыты §§3.1–3.3.5, Tables 2, 7, 9. |
|
|
||||||
| [CONSTORY-CHECKER](https://aclanthology.org/2026.findings-acl.410.pdf) | 200; открыты §§2–3, Tables 1–7, Limitations и prompts. |
|
|
||||||
| [SEGALE](https://aclanthology.org/2025.emnlp-main.1645.pdf) | 200; открыты §§3, 5–6, Tables 1–3, Figure 3 и Limitations. |
|
|
||||||
| [S-VoCAL](https://aclanthology.org/2026.lrec-1.860/) | 200; проверены task, 8 attributes, 952 character–book pairs и scope аудиокниг. |
|
|
||||||
| [MetaDocEval](https://aclanthology.org/2026.eamt-1.19/) | 200; открыты §§3, 5–7, Table 1/Figures. |
|
|
||||||
| [mStyleDistance](https://aclanthology.org/2025.findings-acl.869/) | 200; открыты language list, Tables 1–2, ru dataset appendix. |
|
|
||||||
| [Distinguishing Fictional Voices](https://aclanthology.org/2024.latechclfl-1.15/) | 200; открыты §3 and Table 2. |
|
|
||||||
| [BookTranslate](https://www.booktranslate.ai/blog/towards-agentic-mtpe-translation-copilot) | 200; author/date/topology проверены в body. |
|
|
||||||
| [BookFoundry](https://bookfoundry.ai/ai-book-translation/) | 200; неподписанная company page, stamp и topology проверены в body. |
|
|
||||||
| [OYcedar](https://github.com/OYcedar/novel-translator) | 200; root paths/README открыты. |
|
|
||||||
| [Please Translate Again](https://arxiv.org/html/2506.04521) | 200; удалён из находок как локальный дубль. |
|
|
||||||
|
|
||||||
### Артефакт adversarial-review
|
|
||||||
|
|
||||||
Одновременно работали **два** read-only reviewer-а, кроме основной сессии; модель обоим задана
|
|
||||||
явно: `gpt-5.6-sol`, reasoning `high`. `evidence_audit` проверял claimed/measured, tables, judges,
|
|
||||||
URLs и обязательную форму; `delta_transfer_audit` — дубли, short→book, поздние review-header и
|
|
||||||
переносимость. Оба запретили себе правки файлов и вернули нумерованные вердикты.
|
|
||||||
|
|
||||||
**Принято и исправлено:** скрытый дубль F1 в `research/17`; ACL-final F2 уже там же; chunk-level
|
|
||||||
human unit F2; sentence-pair unit F6a; смешение двух задач F5; нестабильная ссылка F1; неполные
|
|
||||||
judge/pair metadata F2–F4; source-vs-itself C4 перенесён из §3; обе ссылки добавлены C1–C3;
|
|
||||||
provisional/position-confounded статус exp23; ближайший локальный аналог F4; ложная рыночная
|
|
||||||
хронология F7; voice-overclaim C3; self-matching delta-grep и неисполняемая вторая F6-команда.
|
|
||||||
Каждая содержательная ошибка имеет отдельную строку в таблице выше.
|
|
||||||
|
|
||||||
**Принято частично:** reviewer предлагал удалить либо полностью демотировать F2 как дубль.
|
|
||||||
Архитектурный клейм демотирован, но запись сохранена, потому что она закрывает явный локальный TODO
|
|
||||||
о составе пар и добавляет exact human tables/границу chunk-level judging. Иных содержательных
|
|
||||||
замечаний не отклонено. Оба reviewer-а отдельно подтвердили пять разделов в нужном порядке,
|
|
||||||
transfer caveats, отсутствие рекомендации внедрения и корректность `n=102` F2/`6 из 7` F4.
|
|
||||||
|
|
||||||
Для отдельного вопроса №8 обоим reviewer-ам был независимо отправлен второй, одинаково
|
|
||||||
сформулированный запрос именно про **измеритель** канона, а не про память. `delta_transfer_audit`
|
|
||||||
повторил полный локальный поиск одновременно по `docs/research/*.md` и `docs/experiments/*.md` и
|
|
||||||
нашёл пропущенный D50 вместе с его false negative `古月方源 → «Гу Юэ Фан Юань»` вместо `Гуюэ`.
|
|
||||||
`evidence_audit` независимо пересчитал формулы, выборки и human-validation LTCR, CoTERM, BlonDe,
|
|
||||||
MetaDocEval, mStyleDistance и Fictional Voices. Приняты его поправки о term-only reference
|
|
||||||
CoTERM+, умеренных, а не универсально сильных корреляциях CoTERM, split **80 test / 79 dev**
|
|
||||||
BlonDe и крайне узкой ручной проверке perturbations MetaDocEval. Совместный отрицательный итог
|
|
||||||
обоих аудитов сохранён в F8: есть несколько частичных приборов, включая наш reference-free D50,
|
|
||||||
но ни один не валидирован как единая мера сохранения сущностей, терминов, фактов и голоса на
|
|
||||||
сотнях глав без полного эталонного перевода. Reviewer-ы файлов не изменяли.
|
|
||||||
|
|
||||||
После замечания владельца о допустимости zh→en выполнен новый discovery-pass без языкового
|
|
||||||
фильтра, а затем **оба** reviewer-а получили третий независимый запрос уже по новым источникам.
|
|
||||||
Они подтвердили числа L-Anno, TRANSGRAPH, CONSTORY-CHECKER, SEGALE и S-VoCAL, но независимо сняли
|
|
||||||
мою формулировку «составной измерительный стек». Приняты все их существенные поправки:
|
|
||||||
reverse-origin/reference-dependent construction L-Anno; только en→XX technical validation
|
|
||||||
TRANSGRAPH; target-only/injected-error nature CONSTORY; BWB как полный локальный дубль и gold
|
|
||||||
resource, а не canon scalar; SEGALE как segment wrapper, не межглавный book meter; S-VoCAL как
|
|
||||||
static TTS-attribute extraction. Дополнительно `evidence_audit` нашёл внутренний конфликт BWB:
|
|
||||||
abstract сообщает `15 095` mentions, тогда как §3 печатает `8 585+6 070=14 655`; в F8 оставлено
|
|
||||||
разложенное число и записано противоречие. Reviewer-ы файлов не изменяли.
|
|
||||||
File diff suppressed because it is too large
Load diff
Loading…
Add table
Reference in a new issue