Land external blind-eval corroboration: two zero sessions confirm F-disc is best on both prose and fidelity, flag floating grade glossary, and catch an A-2pass fidelity catastrophe that redirects near-term to single-pass discourse
This commit is contained in:
parent
73a45848db
commit
b59ca66b83
3 changed files with 73 additions and 3 deletions
53
docs/EXP14_BLIND_EVAL_PROMPT.md
Normal file
53
docs/EXP14_BLIND_EVAL_PROMPT.md
Normal file
|
|
@ -0,0 +1,53 @@
|
|||
# exp14 — анти-анкоринговый слепой промпт оценки перевода (для нулевых сессий)
|
||||
|
||||
> Раздаётся свежим независимым сессиям (разные модели/семьи), чтобы оценить перевод zh→ru
|
||||
> непредвзято. Материал — `/home/ubuntu/books/gu-zhenren/exp14/monitor/monitor14.md` (оригинал +
|
||||
> 3 слепых финалиста V1/V2/V3, порядок меток по главам РАЗНЫЙ). **Ключ `_КЛЮЧ.json` оценщику НЕ давать.**
|
||||
> Прогонять на ≥2 разных сессиях; ответы сводит полигон с детерм. KPI + span-судьями + личным рангом владельца.
|
||||
> Провенанс первого прогона (ChatGPT + Claude) — `experiments/14-quality-empirics.md` §2Б.7.
|
||||
|
||||
---
|
||||
|
||||
```
|
||||
Ты — независимый литературный редактор-эксперт, оцениваешь перевод художественной
|
||||
прозы с китайского на русский. У тебя НЕТ контекста проекта — суди только по тексту.
|
||||
|
||||
ЖЁСТКИЕ ПРАВИЛА (непредвзятость — обязательны):
|
||||
1. НЕ читай никакие документы проекта, заметки, эксперименты, выводы, git-историю.
|
||||
Твой единственный источник — материал (файл monitor14.md или текст, который дал оператор).
|
||||
2. НЕ пытайся определить или назвать, какая система/модель/человек стоит за метками
|
||||
V1/V2/V3. Не рассуждай об этом. Оценивай СЛЕПО.
|
||||
3. «Правильного ответа» тебе никто не давал — формируй мнение с нуля, своим вкусом.
|
||||
4. Не знаешь имя/реалию/термин — НЕ додумывай; помечай «нужна сверка», но не считай ошибкой.
|
||||
|
||||
МАТЕРИАЛ: 3 главы. В каждой сверху китайский ОРИГИНАЛ, ниже — три перевода V1/V2/V3
|
||||
(порядок меток в каждой главе СВОЙ, не сквозной).
|
||||
|
||||
ЗАДАЧА — по КАЖДОЙ главе оцени три перевода по двум независимым осям:
|
||||
|
||||
A. РУССКАЯ ПРОЗА (читаешь как читатель, оригинал не нужен):
|
||||
— Это живой русский литературный текст или машинный/построчный подстрочник?
|
||||
— Абзацы: логические многопредложные ИЛИ рубленые «одна фраза = один абзац»?
|
||||
— Диалоги: оформлены по-русски (тире, реплики с красной строки)?
|
||||
— Естественность, ритм; есть ли канцелярит, кальки с китайского, корявые обороты?
|
||||
|
||||
B. ВЕРНОСТЬ СМЫСЛУ (сверяя КАЖДЫЙ перевод с китайским оригиналом):
|
||||
— Смысловые ошибки, ПЕРЕВЁРНУТЫЙ смысл (инверсии), выброшенные/выдуманные детали.
|
||||
— Непонятые связи: местоимения, кто что сделал, отсылки, идиомы/чэнъюй.
|
||||
— Ошибки в реалиях, именах, терминах, числах.
|
||||
Для каждой находки дай КОНКРЕТНО: китайская фраза → как переведено → что не так.
|
||||
|
||||
ФОРМАТ ОТВЕТА (строго):
|
||||
Для каждой главы:
|
||||
• Ось A: по 2–4 цитаты-примера на каждый перевод; ранг V?>V?>V? ; 1 фраза-вывод.
|
||||
• Ось B: перечисли найденные смысловые ошибки со спанами (или «не нашёл»);
|
||||
ранг V?>V?>V? по верности; отметь КАТАСТРОФЫ (перевёрнутый смысл/участник) отдельно.
|
||||
• Бинарно: перешёл ли ЛУЧШИЙ из трёх планку «читается не хуже нормального
|
||||
любительского/фанатского перевода»? да/нет + одна причина.
|
||||
В конце — СВОДКА:
|
||||
• общий ранг по прозе, общий ранг по верности (через все 3 главы);
|
||||
• 3 главные слабости, которые надо чинить в первую очередь;
|
||||
• есть ли вариант, который выигрывает ОБЕ оси, или это компромисс.
|
||||
|
||||
Пиши по-русски, кратко и по делу, опирайся на цитаты, а не на общие слова.
|
||||
```
|
||||
|
|
@ -24,7 +24,7 @@
|
|||
- **Fidelity re-gate (D34.3): пере-прогон НЕ чист** — средняя верность 88–94, но **13 катастроф + 21 инверсия редактуры на ~10 чанках** (ch10.1 both-judge fid 60); класс инверсий D34.3 подтверждён на хвосте → флаги на span-ревью, пере-прогон засчитан НЕ полностью.
|
||||
- **Ранжирование финалистов (гл.19/17/18): стиль F-disc(gpt-5.4)>A-2pass>P0 (робастно); holistic-верность P0>прочих — НО P0 несёт T1-катастрофу, панель её не поймала = ЛИТЕРАЛ-СМЕЩЕНИЕ судей** (урок exp12/мемо eval-aggregation) → доверять span-уровню, не holistic-скаляру.
|
||||
|
||||
**Слепой пакет владельцу готов:** `exp14/monitor/monitor14.md` (3 финалиста × 3 главы, нейтральные метки, ключ отдельно) — человеческий вердикт «лучше фана» (D30.7). **Near-term рекомендация** (ратификация оркестратора): дискурс-промпт + крупная edit-единица (дешевле И лучше) под omission-гард; селективная эскалация на gpt-5.4 (не grok/gemini) по смысл-риску; CJK-гард на deformat/grok; ~10 re-gate-флагов на ревью. Планка = 2 претензии (ИНТЕРИМ пре-скрин, НЕ пилот Ф2.5). Детали — `experiments/14-quality-empirics.md` §2/§2Б/§3.
|
||||
**Слепой пакет владельцу готов:** `exp14/monitor/monitor14.md` (оригинал + 3 финалиста × 3 главы, нейтральные метки, ключ отдельно). **Внешняя слепая оценка (2 нулевые сессии ChatGPT+Claude, промпт `EXP14_BLIND_EVAL_PROMPT.md`) — §2Б.7:** 4-сигнальная сходимость (наш KPI+панель+2 внешних) — **P0(прод) худшая проза** (претензия-1 реальна, прод-специфична; рублёнка = рычаг промпта, не модели), **F-disc(gpt-5.4) лучший по прозе И верности** → подтверждает поправку «holistic-панель литерал-смещена, вернее F-disc». НОВОЕ: **разряды 甲/乙/丙 плывут** (обе сессии → D35.4c в приоритет); **A-2pass несёт катастрофу верности** (人上之人-инверсия, 2-й пасс дрейфует) → near-term = ОДИНАРНЫЙ дискурс-пасс, НЕ A-2pass. Лучший (F-disc) перешёл «лучше фана» у обеих. **Near-term рекомендация** (ратификация оркестратора): дискурс-промпт + крупная edit-единица (дешевле И лучше) под omission-гард; селективная эскалация на gpt-5.4 (не grok/gemini) по смысл-риску; CJK-гард на deformat/grok; ~10 re-gate-флагов на ревью. Планка = 2 претензии (ИНТЕРИМ пре-скрин, НЕ пилот Ф2.5). Детали — `experiments/14-quality-empirics.md` §2/§2Б/§3.
|
||||
|
||||
## Ресёрчер — рычаги качества (`research/18-quality-levers.md`), 2026-07-12 (D35.5, вход полигону)
|
||||
|
||||
|
|
|
|||
|
|
@ -307,11 +307,28 @@ ch17+ch13 × 800/1600/3200/whole (жадная упаковка; flash-draft→g
|
|||
| (2) кросс-граница | не доминирует в срезе | A-ref null; P1c связал (1 датапоинт) | не строить Ф2-память под слабый сигнал |
|
||||
| верность пере-прогона | **есть хвост порчи** | re-gate: 13 катастроф + 21 инверсия на ~10 чанках | ревью флагов + omission-гард на reflow-армы |
|
||||
|
||||
### 2Б.7. Внешняя слепая оценка (2 независимые нулевые сессии: ChatGPT + Claude) — корроборация + новое
|
||||
|
||||
Владелец прогнал `monitor14.md` (оригинал + 3 слепых финалиста) через 2 независимые анти-анкоринговые сессии (промпт `docs/EXP14_BLIND_EVAL_PROMPT.md`; ключ им не выдавался). Декодировано (Fin-A=P0/Fin-B=A-2pass/Fin-C=F-disc):
|
||||
|
||||
**Сходимость 4 сигналов (наш KPI + наша панель + ChatGPT + Claude):**
|
||||
- **P0 (прод) — худшая проза во ВСЕХ 4** (KPI 1.91, панель 0.62, ChatGPT P0-последний 3/3, Claude 3/3). Претензия-1 реальна и прод-специфична; Claude: «рублёнка — рычаг промпта/постобработки, не модели» (= наш вывод).
|
||||
- **F-disc (gpt-5.4) — лучший по прозе И по верности у ОБЕИХ внешних сессий** → **подтверждает поправку §2Б.3: наша holistic-панель ошибочно ставила P0 «вернее всех» (литерал-смещение); внешние голоса + span-трапы говорят — вернее F-disc.** Доверять span-уровню, не holistic-скаляру — корроборировано независимо.
|
||||
|
||||
**Новое (внешние поймали, наши метрики — нет):**
|
||||
- **Разряды 甲/乙/丙 (А/Б/В) ПЛЫВУТ** — обе сессии независимо (丙→«В» потом «Ц»; «цинская одарённость»-мусор). Трапы разряды не покрывали → **D35.4c апгрейд: «дешёвый бэклог» → подтверждённый читателем дефект, в приоритет.**
|
||||
- **A-2pass несёт РИСК ВЕРНОСТИ:** ChatGPT нашёл катастрофу `人上之人`(«над людьми»)→«среди людей» (иерархия перевёрнута; спан-верифицировано — реально). 2-й reflow-пасс перефразирует → дрейф. ⇒ **near-term безопаснее ОДИНАРНЫЙ дискурс-пасс (P1a), не A-2pass.**
|
||||
- **Битые склейки черновика** (F-disc гл.17) — дыра санитайзера даже во фронтире.
|
||||
|
||||
**Расхождение (не подгоняю):** катастрофу A-2pass поймал только ChatGPT (Claude — «нет катастроф») → даже слепая панель имеет разброс на тонком; катастроф-скрин нужен ≥2 независимыми глазами (подтверждает мемо eval-aggregation).
|
||||
|
||||
**Итог:** лучший конфиг (F-disc gpt-5.4+дискурс) перешёл «лучше фана» у обеих сессий и берёт обе оси, но это дорогой фронтир; дешёвый дискурс-промпт закрывает абзацы (прод-специфичную претензию-1); разряды 甲乙丙 — чинить.
|
||||
|
||||
### 2Б.6. Пересмотренная near-term рекомендация (на ратификацию оркестратора)
|
||||
|
||||
1. **Абзацы (П1):** дискурс-reflow-промпт (Ван Цуй) + сдвиг edit-единицы к КРУПНОЙ (3200c/глава — дешевле И лучше по кривой). A-2pass даёт топ-KPI, но добавляет пасс — взвесить vs крупный чанк (крупный чанк даёт похожий лифт БЕЗ +пасса и ДЕШЕВЛЕ). **Оба под omission-гард** (reflow-армы просели по holistic-верности — следить за атомами).
|
||||
1. **Абзацы (П1):** дискурс-reflow-промпт (Ван Цуй, ОДИНАРНЫЙ пасс) + сдвиг edit-единицы к КРУПНОЙ (3200c/глава — дешевле И лучше по кривой). **A-2pass даёт топ-KPI абзацев, НО внешняя оценка нашла у него катастрофу верности (人上之人-инверсия) — 2-й reflow-пасс дрейфует смысл → НЕ рекомендую A-2pass; одинарный дискурс безопаснее.** Всё под omission-гард (следить за атомами).
|
||||
2. **Смысл (П2):** селективная эскалация редактора на **gpt-5.4 конкретно** по смысл-риску (двойное отрицание/chengyu/инверсия черновика). **grok и gemini НЕ заменяют** — оба ИНВЕРТИРУЮТ T1 (ре-тест gemini подтвердил), gemini ещё и COGS-враждебен. Не тотальный фронтир (портит абзацы у F-base, дорого).
|
||||
3. **CJK-гард** обязателен на deformat (A-layout) и на grok-выходах (утечка 6).
|
||||
3. **CJK-гард** обязателен на deformat (A-layout) и на grok-выходах (утечка 6). **Разряды 甲/乙/丙 → единая схема + принудительная сверка** (2 внешние сессии подтвердили плавающий рендер — D35.4c в приоритет).
|
||||
4. **Пере-прогон:** ~10 re-gate-флагов на ревью до «засчитан».
|
||||
5. **Слепые пакеты Ступени II** (`exp14/monitor/monitor14.md`) — владельцу на человеческий вердикт «лучше фана» (арбитр, D30.7).
|
||||
|
||||
|
|
|
|||
Loading…
Add table
Reference in a new issue