textmachine/docs/experiments/04-editor-quality.md

68 lines
9.8 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

# Эксперимент 04. Качество редактора ru-стиля (бейк-офф)
Дата: 2026-07-04. Отвечает на вопрос бэкенда №2 (дефолт редактора для Фазы 1) и решение владельца заменить Anthropic. Скрипт: `eval/editor_bench.py`; сравнение: `eval/build_editor_artifact.py` → артефакт.
## Метод
Пайплайн как в продукте: **DeepSeek делает черновой перевод → редактор-кандидат полирует** его в живую художественную прозу (чек-лист Норы Галь: канцелярит, кальки, синтаксис), сохраняя смысл и все предложения. Каждый редактор получает **оригинал + черновик**.
- Кандидаты (дорогой тир, без Anthropic/OpenAI по решению владельца): **glm-4.6, kimi-k2.6, gemini-3.1-pro-preview, grok-4.3**.
- 4 фрагмента: Расёмон (ja), А-Кью (zh), Беги Мелос (ja), Машина времени (en — владелец судит и стиль, и верность напрямую).
- Для ja/zh — английский эталон смысла (владелец читает en/ru, не ja/zh) как якорь верности.
- **Оценка — человеческая, слепая** (A/B/C/D): худ. качество ru — единственная надёжная метрика человек, LLM-судьи расходятся с людьми (LAIT, research/03). Артефакт: слепые версии, ключ и цена скрыты до вынесения оценки.
## Объективные находки (не зависят от стиля)
Латентность и цена на один абзац (для роли, вызываемой на каждый чанк книги, — решающе):
| Редактор | Латентность | Особенность цены |
|---|---|---|
| **grok-4.3** | ~13 с | без «размышлений» — самый быстрый и дешёвый |
| **glm-4.6** | ~105 с | thinking off (иначе таймаут) |
| **gemini-3.1-pro** | ~6086 с | thinking **не отключить** (обязателен), нужен `max_tokens` ≥16k |
| **kimi-k2.6** | ~150 с | **~11 000 токенов «размышлений» на абзац** — биллятся как выход → самый дорогой |
**Вывод по цене:** Kimi как редактор экономически тяжёлый (11k reasoning-токенов × output-тариф на каждый чанк книги — это сотни тысяч токенов на том). Grok-4.3 — противоположный полюс (быстрый, без reasoning). Если человеческая оценка стиля не покажет явного превосходства Kimi, его цена его дисквалифицирует. Это входит в решение наравне со стилем.
## Провайдерские грабли, найденные по пути
Все — в [00-provider-quirks.md](00-provider-quirks.md): Kimi только `temp=1` + reasoning в `reasoning_content` (нужен бюджет ≥16k); Gemini 3.1 Pro обязательно-думающая; **DeepSeek «эхал» оригинал на zh-фрагменте Лу Синя «祝福»** (82% CJK, воспроизводимо 3/3) → пришлось сменить zh-фрагмент на А-Кью и добавить фолбэк-черновик (GLM) + детектор CJK-эха. Последнее — реальный класс дефекта для черновой стадии бэкенда (тихий отказ = оригинал вместо перевода).
## Оценка (слепая) — выполнена двумя фронтир-судьями
Артефакт: https://claude.ai/code/artifact/25394796-96f0-4f3f-b8d0-de000d415472. Владелец отдал слепую оценку **двум независимым судьям (GPT-фронтир + Opus 4.8)**, которые сверялись не только с английским якорем, но и с **каноническими русскими переводами** (Н. Фельдман — Расёмон, В. Рогов — А-Кью, С. Смоляков/канон — Мелос, К. Морозов — Машина времени) и оригиналами. Оба судьи **сошлись независимо** — высокая уверенность.
**Ключ слепой разметки:** A = grok-4.3, B = glm-4.6, C = gemini-3.1-pro, D = kimi-k2.6.
### Свод (оба судьи согласны)
| Ось | Ранжирование |
|---|---|
| **Стиль** (живость ru, без канцелярита/калек) | **C (gemini) > A (grok) > D (kimi) > B (glm)** |
| **Верность** (без потерь и отсебятины) | **A (grok) > C (gemini) > B (glm) > D (kimi)** |
| **Value** (качество / цена+скорость) | **A (grok) ≫ C (gemini) > B (glm) > D (kimi)** |
Ключевые наблюдения судей:
- **A = grok-4.3 — лучший value с огромным отрывом**: ранг-1 по верности, ранг-2 по стилю, при **самой низкой цене и в разы быстрее** думающих (~13 с, без reasoning). Оба судьи независимо назвали его лучшим выбором «одной модели на роль».
- **C = gemini-3.1-pro — лучшая проза**: сильнейший художественный русский, эталонно решает культурные узлы (каламбур заглавия 正传 у Лу Синя, глосса к имени А-гуй — и это **не отсебятина**, а ровно приём канонического Рогова). Иногда переусиливает/дописывает. Выбор, когда литературность важнее цены и текст потом вычитывает редактор.
- **B = glm-4.6 — слабейший**: площе всех, кальки, пара опечаток, при этом ~105 с. Плохой value.
- **D = kimi-k2.6 — худший value**: дороже и медленнее всех (~150 с, ~11k reasoning-токенов/абзац), а по верности — последний (чаще всех подменяет детали). Лишние «размышления» точность не купили. Колоритен на Дадзае, но нестабилен.
### Рекомендация дефолта редактора (Фаза 1)
1. **Дефолт: `grok-4.3`** — лучший баланс качество/цена, надёжен по смыслу «из коробки». Закрывает вопрос бэкенда №2.
2. **Премиум-эскалация: `gemini-3.1-pro`** — на дорогих книгах / по сигналу судьи, где нужна максимальная проза и есть человеческая вычитка.
3. **GLM-4.6 — снять с роли дефолтного редактора** (был допущением Р4 «редактор = GLM», эмпирически слабейший). NB: тестировали glm-4.6; при появлении GLM-5 можно перемерить.
4. **Kimi — из кандидатов в редакторы убрать** (цена+скорость+риск верности).
**Следствие для архитектуры (→ оркестратору):** правка Р4 — редактор ru-стиля по умолчанию `grok-4.3`, премиум `gemini-3.1-pro`; GLM/Kimi не дефолт. Нюанс контуров: grok/gemini — Западный/прямых-ключей контур; в ru-BYOK экономика иная, но по качеству+цене grok-4.3 выигрывает и дёшев. Полигон архитектурные доки не редактирует — решение вносит оркестратор.
### Оговорки
- **Короткие фрагменты** (по одному отрывку) — срез, не приговор моделям в целом; полный выбор ядра пайплайна — пилот Фазы 2.5 (задача 4).
- Судьи поймали реальный дефект данных: версия C (Gemini) на «Мелосе» была **обрезана** (бюджет 8k при обязательном thinking) — **исправлено** после оценки (перегенерирована с 16k, артефакт обновлён); вывод по «Мелосу» (лидер A) от этого не меняется.
- «Якорь ≠ эталон»: оба судьи отметили места, где английский якорь сам упрощает оригинал (напр. оттенок «жалостливо усмехнуться» у Дадзая) — подтверждает методическое следствие ниже.
## Методическое следствие (важно для пилота, задача 4)
Владелец читает только **en и ru**. Прямая человеческая оценка **верности** доступна лишь на en→ru и на русской стороне; для zh/ja→ru нужен английский эталон-якорь (или метрики+глоссарий). Заложить в протокол пилота: не строить человеческую оценку верности на языках, которых судья не читает.