From 9792285e76a0fb9f6cb522b3de98bd87c8654ba2 Mon Sep 17 00:00:00 2001 From: "Claude (backend session)" Date: Sun, 5 Jul 2026 21:07:39 +0300 Subject: [PATCH] =?UTF-8?q?Correct=20exp04's=20'grok=20without=20reasoning?= =?UTF-8?q?'=20characterization=20=E2=80=94=20grok-4.3=20defaults=20to=20l?= =?UTF-8?q?ow=20reasoning=20(~13s),=20production=20editor=20sets=20reasoni?= =?UTF-8?q?ng=5Feffort:none=20for=200=20tokens;=20ranking=20unchanged?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit --- docs/experiments/04-editor-quality.md | 4 ++-- 1 file changed, 2 insertions(+), 2 deletions(-) diff --git a/docs/experiments/04-editor-quality.md b/docs/experiments/04-editor-quality.md index 0d23790..507ba7b 100644 --- a/docs/experiments/04-editor-quality.md +++ b/docs/experiments/04-editor-quality.md @@ -22,7 +22,7 @@ | **gemini-3.1-pro** | ~60–86 с | thinking **не отключить** (обязателен), нужен `max_tokens` ≥16k | | **kimi-k2.6** | ~150 с | **~11 000 токенов «размышлений» на абзац** — биллятся как выход → самый дорогой | -**Вывод по цене:** Kimi как редактор экономически тяжёлый (11k reasoning-токенов × output-тариф на каждый чанк книги — это сотни тысяч токенов на том). Grok-4.3 — противоположный полюс (быстрый, без reasoning). Если человеческая оценка стиля не покажет явного превосходства Kimi, его цена его дисквалифицирует. Это входит в решение наравне со стилем. +**Вывод по цене:** Kimi как редактор экономически тяжёлый (11k reasoning-токенов × output-тариф на каждый чанк книги — это сотни тысяч токенов на том). Grok-4.3 — противоположный полюс (быстрый: ~13с на **дефолтном `low`-reasoning**, не многословный думатель как Kimi; в проде редактор шлёт `reasoning_effort:"none"` → 0 reasoning-токенов — см. эксп.08/00-quirks). Если человеческая оценка стиля не покажет явного превосходства Kimi, его цена его дисквалифицирует. Это входит в решение наравне со стилем. ## Провайдерские грабли, найденные по пути @@ -43,7 +43,7 @@ | **Value** (качество / цена+скорость) | **A (grok) ≫ C (gemini) > B (glm) > D (kimi)** | Ключевые наблюдения судей: -- **A = grok-4.3 — лучший value с огромным отрывом**: ранг-1 по верности, ранг-2 по стилю, при **самой низкой цене и в разы быстрее** думающих (~13 с, без reasoning). Оба судьи независимо назвали его лучшим выбором «одной модели на роль». +- **A = grok-4.3 — лучший value с огромным отрывом**: ранг-1 по верности, ранг-2 по стилю, при **самой низкой цене и в разы быстрее** многословных думателей (~13 с на дефолтном `low`; в проде `reasoning_effort:"none"` → 0 reasoning-токенов, ещё дешевле). Оба судьи независимо назвали его лучшим выбором «одной модели на роль». - **C = gemini-3.1-pro — лучшая проза**: сильнейший художественный русский, эталонно решает культурные узлы (каламбур заглавия 正传 у Лу Синя, глосса к имени А-гуй — и это **не отсебятина**, а ровно приём канонического Рогова). Иногда переусиливает/дописывает. Выбор, когда литературность важнее цены и текст потом вычитывает редактор. - **B = glm-4.6 — слабейший**: площе всех, кальки, пара опечаток, при этом ~105 с. Плохой value. - **D = kimi-k2.6 — худший value**: дороже и медленнее всех (~150 с, ~11k reasoning-токенов/абзац), а по верности — последний (чаще всех подменяет детали). Лишние «размышления» точность не купили. Колоритен на Дадзае, но нестабилен.