Correct exp04's 'grok without reasoning' characterization — grok-4.3 defaults to low reasoning (~13s), production editor sets reasoning_effort:none for 0 tokens; ranking unchanged
This commit is contained in:
parent
f4e7124c4b
commit
9792285e76
1 changed files with 2 additions and 2 deletions
|
|
@ -22,7 +22,7 @@
|
|||
| **gemini-3.1-pro** | ~60–86 с | thinking **не отключить** (обязателен), нужен `max_tokens` ≥16k |
|
||||
| **kimi-k2.6** | ~150 с | **~11 000 токенов «размышлений» на абзац** — биллятся как выход → самый дорогой |
|
||||
|
||||
**Вывод по цене:** Kimi как редактор экономически тяжёлый (11k reasoning-токенов × output-тариф на каждый чанк книги — это сотни тысяч токенов на том). Grok-4.3 — противоположный полюс (быстрый, без reasoning). Если человеческая оценка стиля не покажет явного превосходства Kimi, его цена его дисквалифицирует. Это входит в решение наравне со стилем.
|
||||
**Вывод по цене:** Kimi как редактор экономически тяжёлый (11k reasoning-токенов × output-тариф на каждый чанк книги — это сотни тысяч токенов на том). Grok-4.3 — противоположный полюс (быстрый: ~13с на **дефолтном `low`-reasoning**, не многословный думатель как Kimi; в проде редактор шлёт `reasoning_effort:"none"` → 0 reasoning-токенов — см. эксп.08/00-quirks). Если человеческая оценка стиля не покажет явного превосходства Kimi, его цена его дисквалифицирует. Это входит в решение наравне со стилем.
|
||||
|
||||
## Провайдерские грабли, найденные по пути
|
||||
|
||||
|
|
@ -43,7 +43,7 @@
|
|||
| **Value** (качество / цена+скорость) | **A (grok) ≫ C (gemini) > B (glm) > D (kimi)** |
|
||||
|
||||
Ключевые наблюдения судей:
|
||||
- **A = grok-4.3 — лучший value с огромным отрывом**: ранг-1 по верности, ранг-2 по стилю, при **самой низкой цене и в разы быстрее** думающих (~13 с, без reasoning). Оба судьи независимо назвали его лучшим выбором «одной модели на роль».
|
||||
- **A = grok-4.3 — лучший value с огромным отрывом**: ранг-1 по верности, ранг-2 по стилю, при **самой низкой цене и в разы быстрее** многословных думателей (~13 с на дефолтном `low`; в проде `reasoning_effort:"none"` → 0 reasoning-токенов, ещё дешевле). Оба судьи независимо назвали его лучшим выбором «одной модели на роль».
|
||||
- **C = gemini-3.1-pro — лучшая проза**: сильнейший художественный русский, эталонно решает культурные узлы (каламбур заглавия 正传 у Лу Синя, глосса к имени А-гуй — и это **не отсебятина**, а ровно приём канонического Рогова). Иногда переусиливает/дописывает. Выбор, когда литературность важнее цены и текст потом вычитывает редактор.
|
||||
- **B = glm-4.6 — слабейший**: площе всех, кальки, пара опечаток, при этом ~105 с. Плохой value.
|
||||
- **D = kimi-k2.6 — худший value**: дороже и медленнее всех (~150 с, ~11k reasoning-токенов/абзац), а по верности — последний (чаще всех подменяет детали). Лишние «размышления» точность не купили. Колоритен на Дадзае, но нестабилен.
|
||||
|
|
|
|||
Loading…
Add table
Reference in a new issue