diff --git a/docs/EXP14_BLIND_EVAL_PROMPT.md b/docs/EXP14_BLIND_EVAL_PROMPT.md new file mode 100644 index 0000000..41cf4ae --- /dev/null +++ b/docs/EXP14_BLIND_EVAL_PROMPT.md @@ -0,0 +1,53 @@ +# exp14 — анти-анкоринговый слепой промпт оценки перевода (для нулевых сессий) + +> Раздаётся свежим независимым сессиям (разные модели/семьи), чтобы оценить перевод zh→ru +> непредвзято. Материал — `/home/ubuntu/books/gu-zhenren/exp14/monitor/monitor14.md` (оригинал + +> 3 слепых финалиста V1/V2/V3, порядок меток по главам РАЗНЫЙ). **Ключ `_КЛЮЧ.json` оценщику НЕ давать.** +> Прогонять на ≥2 разных сессиях; ответы сводит полигон с детерм. KPI + span-судьями + личным рангом владельца. +> Провенанс первого прогона (ChatGPT + Claude) — `experiments/14-quality-empirics.md` §2Б.7. + +--- + +``` +Ты — независимый литературный редактор-эксперт, оцениваешь перевод художественной +прозы с китайского на русский. У тебя НЕТ контекста проекта — суди только по тексту. + +ЖЁСТКИЕ ПРАВИЛА (непредвзятость — обязательны): +1. НЕ читай никакие документы проекта, заметки, эксперименты, выводы, git-историю. + Твой единственный источник — материал (файл monitor14.md или текст, который дал оператор). +2. НЕ пытайся определить или назвать, какая система/модель/человек стоит за метками + V1/V2/V3. Не рассуждай об этом. Оценивай СЛЕПО. +3. «Правильного ответа» тебе никто не давал — формируй мнение с нуля, своим вкусом. +4. Не знаешь имя/реалию/термин — НЕ додумывай; помечай «нужна сверка», но не считай ошибкой. + +МАТЕРИАЛ: 3 главы. В каждой сверху китайский ОРИГИНАЛ, ниже — три перевода V1/V2/V3 +(порядок меток в каждой главе СВОЙ, не сквозной). + +ЗАДАЧА — по КАЖДОЙ главе оцени три перевода по двум независимым осям: + + A. РУССКАЯ ПРОЗА (читаешь как читатель, оригинал не нужен): + — Это живой русский литературный текст или машинный/построчный подстрочник? + — Абзацы: логические многопредложные ИЛИ рубленые «одна фраза = один абзац»? + — Диалоги: оформлены по-русски (тире, реплики с красной строки)? + — Естественность, ритм; есть ли канцелярит, кальки с китайского, корявые обороты? + + B. ВЕРНОСТЬ СМЫСЛУ (сверяя КАЖДЫЙ перевод с китайским оригиналом): + — Смысловые ошибки, ПЕРЕВЁРНУТЫЙ смысл (инверсии), выброшенные/выдуманные детали. + — Непонятые связи: местоимения, кто что сделал, отсылки, идиомы/чэнъюй. + — Ошибки в реалиях, именах, терминах, числах. + Для каждой находки дай КОНКРЕТНО: китайская фраза → как переведено → что не так. + +ФОРМАТ ОТВЕТА (строго): + Для каждой главы: + • Ось A: по 2–4 цитаты-примера на каждый перевод; ранг V?>V?>V? ; 1 фраза-вывод. + • Ось B: перечисли найденные смысловые ошибки со спанами (или «не нашёл»); + ранг V?>V?>V? по верности; отметь КАТАСТРОФЫ (перевёрнутый смысл/участник) отдельно. + • Бинарно: перешёл ли ЛУЧШИЙ из трёх планку «читается не хуже нормального + любительского/фанатского перевода»? да/нет + одна причина. + В конце — СВОДКА: + • общий ранг по прозе, общий ранг по верности (через все 3 главы); + • 3 главные слабости, которые надо чинить в первую очередь; + • есть ли вариант, который выигрывает ОБЕ оси, или это компромисс. + +Пиши по-русски, кратко и по делу, опирайся на цитаты, а не на общие слова. +``` diff --git a/docs/PROGRESS.md b/docs/PROGRESS.md index e97f49c..ab9a467 100644 --- a/docs/PROGRESS.md +++ b/docs/PROGRESS.md @@ -24,7 +24,7 @@ - **Fidelity re-gate (D34.3): пере-прогон НЕ чист** — средняя верность 88–94, но **13 катастроф + 21 инверсия редактуры на ~10 чанках** (ch10.1 both-judge fid 60); класс инверсий D34.3 подтверждён на хвосте → флаги на span-ревью, пере-прогон засчитан НЕ полностью. - **Ранжирование финалистов (гл.19/17/18): стиль F-disc(gpt-5.4)>A-2pass>P0 (робастно); holistic-верность P0>прочих — НО P0 несёт T1-катастрофу, панель её не поймала = ЛИТЕРАЛ-СМЕЩЕНИЕ судей** (урок exp12/мемо eval-aggregation) → доверять span-уровню, не holistic-скаляру. -**Слепой пакет владельцу готов:** `exp14/monitor/monitor14.md` (3 финалиста × 3 главы, нейтральные метки, ключ отдельно) — человеческий вердикт «лучше фана» (D30.7). **Near-term рекомендация** (ратификация оркестратора): дискурс-промпт + крупная edit-единица (дешевле И лучше) под omission-гард; селективная эскалация на gpt-5.4 (не grok/gemini) по смысл-риску; CJK-гард на deformat/grok; ~10 re-gate-флагов на ревью. Планка = 2 претензии (ИНТЕРИМ пре-скрин, НЕ пилот Ф2.5). Детали — `experiments/14-quality-empirics.md` §2/§2Б/§3. +**Слепой пакет владельцу готов:** `exp14/monitor/monitor14.md` (оригинал + 3 финалиста × 3 главы, нейтральные метки, ключ отдельно). **Внешняя слепая оценка (2 нулевые сессии ChatGPT+Claude, промпт `EXP14_BLIND_EVAL_PROMPT.md`) — §2Б.7:** 4-сигнальная сходимость (наш KPI+панель+2 внешних) — **P0(прод) худшая проза** (претензия-1 реальна, прод-специфична; рублёнка = рычаг промпта, не модели), **F-disc(gpt-5.4) лучший по прозе И верности** → подтверждает поправку «holistic-панель литерал-смещена, вернее F-disc». НОВОЕ: **разряды 甲/乙/丙 плывут** (обе сессии → D35.4c в приоритет); **A-2pass несёт катастрофу верности** (人上之人-инверсия, 2-й пасс дрейфует) → near-term = ОДИНАРНЫЙ дискурс-пасс, НЕ A-2pass. Лучший (F-disc) перешёл «лучше фана» у обеих. **Near-term рекомендация** (ратификация оркестратора): дискурс-промпт + крупная edit-единица (дешевле И лучше) под omission-гард; селективная эскалация на gpt-5.4 (не grok/gemini) по смысл-риску; CJK-гард на deformat/grok; ~10 re-gate-флагов на ревью. Планка = 2 претензии (ИНТЕРИМ пре-скрин, НЕ пилот Ф2.5). Детали — `experiments/14-quality-empirics.md` §2/§2Б/§3. ## Ресёрчер — рычаги качества (`research/18-quality-levers.md`), 2026-07-12 (D35.5, вход полигону) diff --git a/docs/experiments/14-quality-empirics.md b/docs/experiments/14-quality-empirics.md index f394a97..6436a68 100644 --- a/docs/experiments/14-quality-empirics.md +++ b/docs/experiments/14-quality-empirics.md @@ -307,11 +307,28 @@ ch17+ch13 × 800/1600/3200/whole (жадная упаковка; flash-draft→g | (2) кросс-граница | не доминирует в срезе | A-ref null; P1c связал (1 датапоинт) | не строить Ф2-память под слабый сигнал | | верность пере-прогона | **есть хвост порчи** | re-gate: 13 катастроф + 21 инверсия на ~10 чанках | ревью флагов + omission-гард на reflow-армы | +### 2Б.7. Внешняя слепая оценка (2 независимые нулевые сессии: ChatGPT + Claude) — корроборация + новое + +Владелец прогнал `monitor14.md` (оригинал + 3 слепых финалиста) через 2 независимые анти-анкоринговые сессии (промпт `docs/EXP14_BLIND_EVAL_PROMPT.md`; ключ им не выдавался). Декодировано (Fin-A=P0/Fin-B=A-2pass/Fin-C=F-disc): + +**Сходимость 4 сигналов (наш KPI + наша панель + ChatGPT + Claude):** +- **P0 (прод) — худшая проза во ВСЕХ 4** (KPI 1.91, панель 0.62, ChatGPT P0-последний 3/3, Claude 3/3). Претензия-1 реальна и прод-специфична; Claude: «рублёнка — рычаг промпта/постобработки, не модели» (= наш вывод). +- **F-disc (gpt-5.4) — лучший по прозе И по верности у ОБЕИХ внешних сессий** → **подтверждает поправку §2Б.3: наша holistic-панель ошибочно ставила P0 «вернее всех» (литерал-смещение); внешние голоса + span-трапы говорят — вернее F-disc.** Доверять span-уровню, не holistic-скаляру — корроборировано независимо. + +**Новое (внешние поймали, наши метрики — нет):** +- **Разряды 甲/乙/丙 (А/Б/В) ПЛЫВУТ** — обе сессии независимо (丙→«В» потом «Ц»; «цинская одарённость»-мусор). Трапы разряды не покрывали → **D35.4c апгрейд: «дешёвый бэклог» → подтверждённый читателем дефект, в приоритет.** +- **A-2pass несёт РИСК ВЕРНОСТИ:** ChatGPT нашёл катастрофу `人上之人`(«над людьми»)→«среди людей» (иерархия перевёрнута; спан-верифицировано — реально). 2-й reflow-пасс перефразирует → дрейф. ⇒ **near-term безопаснее ОДИНАРНЫЙ дискурс-пасс (P1a), не A-2pass.** +- **Битые склейки черновика** (F-disc гл.17) — дыра санитайзера даже во фронтире. + +**Расхождение (не подгоняю):** катастрофу A-2pass поймал только ChatGPT (Claude — «нет катастроф») → даже слепая панель имеет разброс на тонком; катастроф-скрин нужен ≥2 независимыми глазами (подтверждает мемо eval-aggregation). + +**Итог:** лучший конфиг (F-disc gpt-5.4+дискурс) перешёл «лучше фана» у обеих сессий и берёт обе оси, но это дорогой фронтир; дешёвый дискурс-промпт закрывает абзацы (прод-специфичную претензию-1); разряды 甲乙丙 — чинить. + ### 2Б.6. Пересмотренная near-term рекомендация (на ратификацию оркестратора) -1. **Абзацы (П1):** дискурс-reflow-промпт (Ван Цуй) + сдвиг edit-единицы к КРУПНОЙ (3200c/глава — дешевле И лучше по кривой). A-2pass даёт топ-KPI, но добавляет пасс — взвесить vs крупный чанк (крупный чанк даёт похожий лифт БЕЗ +пасса и ДЕШЕВЛЕ). **Оба под omission-гард** (reflow-армы просели по holistic-верности — следить за атомами). +1. **Абзацы (П1):** дискурс-reflow-промпт (Ван Цуй, ОДИНАРНЫЙ пасс) + сдвиг edit-единицы к КРУПНОЙ (3200c/глава — дешевле И лучше по кривой). **A-2pass даёт топ-KPI абзацев, НО внешняя оценка нашла у него катастрофу верности (人上之人-инверсия) — 2-й reflow-пасс дрейфует смысл → НЕ рекомендую A-2pass; одинарный дискурс безопаснее.** Всё под omission-гард (следить за атомами). 2. **Смысл (П2):** селективная эскалация редактора на **gpt-5.4 конкретно** по смысл-риску (двойное отрицание/chengyu/инверсия черновика). **grok и gemini НЕ заменяют** — оба ИНВЕРТИРУЮТ T1 (ре-тест gemini подтвердил), gemini ещё и COGS-враждебен. Не тотальный фронтир (портит абзацы у F-base, дорого). -3. **CJK-гард** обязателен на deformat (A-layout) и на grok-выходах (утечка 6). +3. **CJK-гард** обязателен на deformat (A-layout) и на grok-выходах (утечка 6). **Разряды 甲/乙/丙 → единая схема + принудительная сверка** (2 внешние сессии подтвердили плавающий рендер — D35.4c в приоритет). 4. **Пере-прогон:** ~10 re-gate-флагов на ревью до «засчитан». 5. **Слепые пакеты Ступени II** (`exp14/monitor/monitor14.md`) — владельцу на человеческий вердикт «лучше фана» (арбитр, D30.7).