Sync uniqueness-claim narrowing from D21.7 into strategic review TL;DR and verdict sections

This commit is contained in:
Claude (backend session) 2026-07-10 00:12:36 +03:00
parent 8643fdfe96
commit 85550d226a

View file

@ -8,7 +8,7 @@
## TL;DR — вердикт
**Архитектура end-to-end ЦЕЛА, и внешняя наука 2026 подтверждает её сильнее, чем можно было ожидать в момент принятия решений (0405.07).** Схема «doc-черновик → сегментный редактор с простым промптом → билингвальный судья» — это оптимум свежей систематики рефайнмента (arXiv:2605.13368) с одной несущей оговоркой: рефайнмент-оптимум статьи — С исходником, а наш редактор монолингвален (см. §4.2); чанковый пайплайн с гейтами узко бьёт длинноконтекстный монолит (arXiv:2606.26040); терминологическая инъекция подтверждена WMT25; выбор DeepSeek-draft для CJK-вебновелл подтверждён DITING; недоверие LLM-судьям — тремя независимыми линиями 2026. Детерминированному no-LLM горячему пути памяти и спойлер-окнам **аналогов не найдено ни в академии, ни на рынке** — это козырь по цене и предсказуемости, а не отставание. Инженерное исполнение — выше среднего (деньги атомарны, snapshot-дисциплина системна, ревью-каскады с мутационной проверкой фиксов).
**Архитектура end-to-end ЦЕЛА, и внешняя наука 2026 подтверждает её сильнее, чем можно было ожидать в момент принятия решений (0405.07).** Схема «doc-черновик → сегментный редактор с простым промптом → билингвальный судья» — это оптимум свежей систематики рефайнмента (arXiv:2605.13368) с одной несущей оговоркой: рефайнмент-оптимум статьи — С исходником, а наш редактор монолингвален (см. §4.2); чанковый пайплайн с гейтами узко бьёт длинноконтекстный монолит (arXiv:2606.26040); терминологическая инъекция подтверждена WMT25; выбор DeepSeek-draft для CJK-вебновелл подтверждён DITING; недоверие LLM-судьям — тремя независимыми линиями 2026. Детерминированному no-LLM горячему пути памяти и спойлер-окнам **аналогов не найдено ни в академии, ни на рынке** — это козырь по цене и предсказуемости, а не отставание. *[⚠ Сужено D21.7 по research/15 §5: словарный слой КАК ТАКОВОЙ — массовая практика фан-стека (GalTransl/SakuraLLM/LunaTranslator — взято как учебник); при скрининге (не FTO) не найдены: спойлер-окна since/until, scene-state/voice-exemplars в MT и формула «disposition-верификация + окна + бюджет + детерминизм» целиком.]* Инженерное исполнение — выше среднего (деньги атомарны, snapshot-дисциплина системна, ревью-каскады с мутационной проверкой фиксов).
**Но целостность замысла ≠ доказанность продукта.** Все главные ставки (ядро C0C3, моно-редактор, банк памяти, судья, 18+) сходятся в одну точку — пилот Ф2.5, — а **инструмент пилота сегодня дефектен** (эхо-контаминация memory_eval, структурно сломанная «слепота» exp04, отсутствие мощности/MDE, нарушение self-preference в панели судей — §4.5). Плюс шесть верифицированных продуктовых находок этого ревью: четыре precision/recall-дыры банка памяти, экономическая мина resume для онгоинга и выбывание DeepSeek из канала B по ToS (дефекты пилот-харнесса — сверх этих шести, см. §4.5; полная арифметика верификации — в приложении). Ни одна не опрокидывает архитектуру; несколько — меняют порядок работ до масштабирования.
@ -156,7 +156,7 @@
**Прямые ответы на четыре затравки пресс-теста мандата:**
- **Судья — bottleneck (Р10№1): ставка generate-then-select НЕустойчива как самостоятельная и устойчива только как гейтящаяся пилотом.** Наука-2026 ужесточила картину сверх Р10№1: судьи анти-коррелируют с читателями на литературе (LAIT), панель из 9 ≈ 2 эффективных голоса (2605.29800), одиночный вердикт нестабилен (13.6% флипов, 2606.13685), судья с хорошей средней корреляцией проваливает best-of-N (67% ничьих, 2603.12520), а единственный литературный замер selection-vs-refinement ставит селекцию на последнее место на гомогенных кандидатах (LitMT). Снятие C2/C3 при провале κ-валидации — легитимный и вероятный исход пилота; C1 — фаворит априори.
- **Детерминированный no-LLM горячий путь: ставка жива и уникальна** — механизм терминологической инъекции подтверждён (WMT25), шумный retrieval опасен (REAL-MT), аналогов детерминированного пути не найдено; go/no-go корректно гейтится memory-eval'ом пилота, который перед этим надо починить (§4.5).
- **Детерминированный no-LLM горячий путь: ставка жива и уникальна** — механизм терминологической инъекции подтверждён (WMT25), шумный retrieval опасен (REAL-MT), аналогов детерминированного пути не найдено *[сужено D21.7: не найдено при скрининге, не FTO — уникальна формула с disposition-верификацией/окнами/бюджетом; сам словарный слой — практика фан-стека; research/15 §5]*; go/no-go корректно гейтится memory-eval'ом пилота, который перед этим надо починить (§4.5).
- **Монолингвальный редактор D1: приемлемость для Фазы 1 — да, для продукта — недоказана и внешне оспорена** (§4.2); решает добавленный пилот-арм «моно vs билингв».
- **Нерешённое ядро C0C3: риск неверного выбора управляется правильно** (четыре конфига одного раннера, human-BWS пилот, C2 честно заблокирован в коде до механики) — при условии гетерогенных кандидатов для C2 и починки харнесса; иначе пилот предрешён.