Correct exp04's 'grok without reasoning' characterization — grok-4.3 defaults to low reasoning (~13s), production editor sets reasoning_effort:none for 0 tokens; ranking unchanged

This commit is contained in:
Claude (backend session) 2026-07-05 21:07:39 +03:00
parent f4e7124c4b
commit 9792285e76

View file

@ -22,7 +22,7 @@
| **gemini-3.1-pro** | ~6086 с | thinking **не отключить** (обязателен), нужен `max_tokens` ≥16k |
| **kimi-k2.6** | ~150 с | **~11 000 токенов «размышлений» на абзац** — биллятся как выход → самый дорогой |
**Вывод по цене:** Kimi как редактор экономически тяжёлый (11k reasoning-токенов × output-тариф на каждый чанк книги — это сотни тысяч токенов на том). Grok-4.3 — противоположный полюс (быстрый, без reasoning). Если человеческая оценка стиля не покажет явного превосходства Kimi, его цена его дисквалифицирует. Это входит в решение наравне со стилем.
**Вывод по цене:** Kimi как редактор экономически тяжёлый (11k reasoning-токенов × output-тариф на каждый чанк книги — это сотни тысяч токенов на том). Grok-4.3 — противоположный полюс (быстрый: ~13с на **дефолтном `low`-reasoning**, не многословный думатель как Kimi; в проде редактор шлёт `reasoning_effort:"none"` → 0 reasoning-токенов — см. эксп.08/00-quirks). Если человеческая оценка стиля не покажет явного превосходства Kimi, его цена его дисквалифицирует. Это входит в решение наравне со стилем.
## Провайдерские грабли, найденные по пути
@ -43,7 +43,7 @@
| **Value** (качество / цена+скорость) | **A (grok) ≫ C (gemini) > B (glm) > D (kimi)** |
Ключевые наблюдения судей:
- **A = grok-4.3 — лучший value с огромным отрывом**: ранг-1 по верности, ранг-2 по стилю, при **самой низкой цене и в разы быстрее** думающих (~13 с, без reasoning). Оба судьи независимо назвали его лучшим выбором «одной модели на роль».
- **A = grok-4.3 — лучший value с огромным отрывом**: ранг-1 по верности, ранг-2 по стилю, при **самой низкой цене и в разы быстрее** многословных думателей (~13 с на дефолтном `low`; в проде `reasoning_effort:"none"` → 0 reasoning-токенов, ещё дешевле). Оба судьи независимо назвали его лучшим выбором «одной модели на роль».
- **C = gemini-3.1-pro — лучшая проза**: сильнейший художественный русский, эталонно решает культурные узлы (каламбур заглавия 正传 у Лу Синя, глосса к имени А-гуй — и это **не отсебятина**, а ровно приём канонического Рогова). Иногда переусиливает/дописывает. Выбор, когда литературность важнее цены и текст потом вычитывает редактор.
- **B = glm-4.6 — слабейший**: площе всех, кальки, пара опечаток, при этом ~105 с. Плохой value.
- **D = kimi-k2.6 — худший value**: дороже и медленнее всех (~150 с, ~11k reasoning-токенов/абзац), а по верности — последний (чаще всех подменяет детали). Лишние «размышления» точность не купили. Колоритен на Дадзае, но нестабилен.