textmachine/docs/research/04-api-providers.md

33 KiB
Raw Permalink Blame History

LLM API провайдеры для художественного перевода (zh/ja/en/ru): цены, качество, цензура

SUPERSEDED ЧАСТИЧНО (обновлено ревизией D31, 12.07.2026). Рекомендации ролей устарели: редактор — БИЛИНГВ, кандидат glm-5-билингв (D30.1); grok reasoning-off из редакторов СНЯТ как no-op (exp12); gemini — премиум-эскалация только за санитайзером (течёт преамбулой 6/6 — D30.3); переводчик deepseek — интерим до бейк-оффа exp13 (D30.6). Anthropic удалён; grok-4.1-fast ретайрнут. Канал B: переводчик-дефолт Mistral (policy 11.06.2026), эскалация grok reasoning-ON (⚠ не на архаичном Хане — D22.5), DeepSeek для explicit ЗАПРЕЩЁН его ToS — D14.1; судья эротики — только Grok (Gemini fail-closed — D22.6). Ключ xAI един, С data-sharing, off перед продом (D27). Актуальные цены — ../experiments/08-cost-model-v2.md (читать через D30.4) + backend/configs/models.yaml; квирки — ../experiments/00-provider-quirks.md; стек — D-лог (карта актуальности сверху).

Дата исследования: 2026-07-04. Все цены проверены на официальных страницах прайсинга на эту дату (исключения помечены). Валюта — USD за 1M токенов, формат «input / output».

TL;DR

  1. Ценовой разрыв — до 500×: deepseek-v4-flash стоит $0.14/$0.28, GPT-5.5-pro — $30/$180. Для «рабочей лошадки» перевода реальные кандидаты — DeepSeek V4 Flash, Grok 4.1 Fast ($0.20/$0.50), Qwen3.7-Plus ($0.40/$1.60), MiniMax M3 ($0.30/$1.20), GLM-4.7 ($0.60/$2.20).
  2. Batch API даёт 50% почти у всех: OpenAI, Anthropic, Google, xAI, Mistral, Alibaba. У DeepSeek batch-API нет — вместо этого тарификация по времени суток (с середины июля 2026 у V4 вводится надбавка ×2 в пиковые часы по Пекину, а не скидка).
  3. Prompt caching — главный рычаг экономии для перевода книг (глоссарий + память повторяются в каждом запросе): у DeepSeek cache hit = $0.0028 (98%), у OpenAI 90%, у Anthropic чтение 0.1× (запись 1.25×), у Kimi 80%, у xAI 84%.
  4. Качество перевода: на WMT25 лучшая система в целом — Gemini 2.5 Pro (топ-кластер в 14/15 языковых пар); в июне 2026 общую арену LMArena возглавляет Claude Opus 4.8. Для китайского языка лидируют сами китайские модели: DeepSeek V4 Pro > GLM-5.1 > Kimi K2.6 ≈ GLM-5 > Qwen3.5.
  5. Цензура: самый пермиссивный для 18+ художественного текста — xAI (публичный ориентир Маска: «разрешено то, что разрешено в фильме с рейтингом R»). OpenAI заморозил «adult mode» в марте 2026. Anthropic и Google — категорический запрет sexually explicit. Китайские провайдеры — слабый фильтр эротики, но политическая цензура, зашитая в веса (DeepSeek R1 отказывает по ~85% «чувствительных» тем КНР).
  6. OpenRouter не добавляет наценку на токены (комиссия 5.5% берётся при пополнении баланса) и даёт фолбэк между провайдерами — разумный дефолт для мультипровайдерного пайплайна и доступа к «пермиссивным» хостерам open-weights моделей.
  7. DeepSeek не публикует жёстких rate limits (динамический троттлинг; для V4 — лимиты конкурентности 500/2500 соединений), у OpenAI/Anthropic/Google — тарифные tier'ы; надёжность одиночного китайского провайдера ниже, чем у западной тройки — нужен фолбэк.
  8. Рекомендуемый стек TextMachine: черновик — deepseek-v4-flash / grok-4.1-fast; редактор — GLM-5 / Kimi K2.6 / Claude Sonnet 5 (интро-цена $2/$10 до 31.08.2026); судья — Gemini 3.1 Pro или Claude Opus 4.8 через Batch (50%); жёсткий контент — Grok (API) + open-weights фолбэк через OpenRouter.

1. Сводная таблица цен (USD / 1M токенов, 04.07.2026)

Провайдер Модель Input Cached input Output Контекст Примечание
DeepSeek deepseek-v4-flash $0.14 $0.0028 $0.28 1M (вывод до 384K) thinking-режим включаем; legacy deepseek-chat/deepseek-reasoner отключат 24.07.2026
DeepSeek deepseek-v4-pro $0.435 $0.003625 $0.87 1M цена «со скидкой», продлевалась (не проверено, докуда)
Qwen (DashScope intl, Сингапур) qwen3.7-max $2.50 ~$0.25 (не проверено) $7.50 thinking/non-thinking
Qwen qwen3.7-plus $0.40 (≤256K) / $1.20 (>256K) есть $1.60 1M free-квота 1M токенов на 90 дней
Qwen qwen3.6-flash $0.25 (≤256K) есть $1.50 1M batch 50%
OpenAI gpt-5.5 $5.00 $0.50 $30.00 флагман
OpenAI gpt-5.4 $2.50 $0.25 $15.00
OpenAI gpt-5.4-mini $0.75 $0.075 $4.50
OpenAI gpt-5.4-nano $0.20 $0.02 $1.25
OpenAI gpt-5.5-pro $30.00 $180.00 судья-класс, дорого
Anthropic Claude Opus 4.8 $5.00 0.1× чтение $25.00 1M
Anthropic Claude Sonnet 5 $3.00 (интро $2.00 до 31.08.2026) 0.1× $15.00 (интро $10.00) 1M новый токенизатор: ~+30% токенов на тот же текст vs Sonnet 4.6
Anthropic Claude Haiku 4.5 $1.00 0.1× $5.00 200K
Google Gemini 3.1 Pro Preview $2.00 (≤200K) / $4.00 есть $12.00 / $18.00 лучший «судья» по цене/качеству
Google Gemini 3.5 Flash $1.50 $0.15 (+$1.00/1M/час хранение) $9.00 «Flash» подорожал
Google Gemini 3.1 Flash-Lite $0.25 есть $1.50
Google Gemini 2.5 Flash / Flash-Lite / Pro $0.30 / $0.10 / $1.25 есть $2.50 / $0.40 / $10.00 прошлое поколение, всё ещё в прайсе
xAI grok-4.3 $1.25 $0.20 $2.50 1M флагман, цена снижена на 58% от launch
xAI grok-4.1-fast $0.20 $0.05 $0.50 2M бюджетный тир (агрегаторы; на docs.x.ai в основном списке не отображён — проверить в консоли)
Mistral Mistral Large 3 $0.50 $1.50 дешевле, чем Medium 3.5
Mistral Mistral Medium 3.5 $1.50 $7.50
Mistral Mistral Small 4 $0.15 $0.60 open-weights
Moonshot/Kimi kimi-k2.7-code $0.95 $0.19 $4.00 ($8.00 high-speed) platform.kimi.ai (бывш. moonshot.ai)
Moonshot/Kimi kimi-k2.6 $0.95 $0.16 $4.00 262K
Zhipu (Z.ai) GLM-5.2 / 5.1 $1.40 $0.26 $4.40
Zhipu GLM-5 $1.00 $0.20 $3.20
Zhipu GLM-4.7 $0.60 $0.11 $2.20 GLM-4.7-Flash — бесплатно; FlashX $0.07/$0.40
Zhipu GLM-4.5-Air $0.20 $0.03 $1.10
MiniMax MiniMax-M3 $0.30 (≤512K) $0.06 чтение $1.20 >512K дороже ×2 priority-tier ×1.5
MiniMax MiniMax-M2.7 $0.30 $0.06 чтение / $0.375 запись $1.20 ~197K (M2.5) M2.5 legacy — те же ставки

Примечание: OpenAI добавляет +10% за региональные data-residency эндпоинты для моделей, вышедших после 05.03.2026.

2. Скидки: batch, кэширование, время суток

Batch API (асинхронно, обычно до 24 ч):

  • OpenAI — 50%; отдельно есть Flex processing с теми же ставками, что batch, но в синхронном API (медленнее/с вытеснением).
  • Anthropic — 50% (Message Batches, до 100K запросов на батч, результаты хранятся 29 дней). Batch сочетается с prompt caching.
  • Google Gemini — 50% на все основные модели.
  • xAI — 50% (по данным агрегаторов; official docs проверить в консоли — не проверено на первоисточнике).
  • Mistral — 50%.
  • Alibaba Model Studio — batch = 50% от realtime-цены (нельзя комбинировать с context cache).
  • DeepSeek, Zhipu, Moonshot, MiniMax — batch-API в публичном прайсе нет.

Prompt caching (критично для TextMachine — системный промпт + глоссарий + память книги повторяются в каждом вызове):

Провайдер Экономия на cache hit Механика
DeepSeek 98% ($0.14 → $0.0028) автоматический, ничего настраивать не надо
OpenAI 90% автоматический, префикс ≥1024 токенов
Anthropic чтение 0.1×, запись 1.25× (5 мин TTL) или 2× (1 час) явные cache_control-брейкпоинты; окупается со 2-го запроса
Google напр. $1.50 → $0.15 (90%) explicit caching + плата за хранение $1.00/1M токенов/час
xAI 84% ($1.25 → $0.20) автоматический
Moonshot/Kimi 80…83% ($0.95 → $0.160.19) автоматический cache hit
Zhipu ~81% ($1.40 → $0.26) cached input
MiniMax чтение 80% ($0.30 → $0.06), запись $0.375 явное кэширование

Время суток (DeepSeek): исторические off-peak скидки 5075% (16:3000:30 UTC) действовали для V3/R1. Для V4 модель инвертирована: по сообщениям от 03.07.2026, с середины июля ставки V4 удваиваются в пиковые часы (9:0012:00 и 14:0018:00 по Пекину, т.е. 01:0004:00 и 06:0010:00 UTC). Т.е. текущий прайс — фактически «внепиковый», а планирование массовых прогонов на ночные часы Пекина остаётся выгодным. (Официальная страница прайсинга изменение пока не отражает — отслеживать.)

3. OpenRouter как агрегатор

  • Наценки на токены нет: «pay the same rate as you would directly with the provider». Комиссия берётся при пополнении: 5.5% (мин. $0.80) через Stripe, 5% в крипте (USDC).
  • BYOK (свои ключи провайдеров через OpenRouter): первые 1M запросов/мес бесплатно, дальше 5% от стоимости.
  • Зачем использовать: единый API и биллинг на ~всех провайдеров из таблицы; автоматический фолбэк между хостерами одной модели (выше аптайм); доступ к open-weights моделям у «пермиссивных» хостеров (важно для 18+ контента — политика контента определяется хостером, а не OpenRouter); быстрые A/B-эксперименты моделей без множества аккаунтов.
  • Минусы: +55.5% к себестоимости; ещё одна точка отказа; для прайваси-чувствительных данных — дополнительный посредник; кэширование провайдера работает не везде одинаково.
  • Вердикт для TextMachine: держать прямые ключи для 23 основных провайдеров (DeepSeek, Anthropic/Google), OpenRouter — для «длинного хвоста» моделей и незацензуренных фолбэков.

4. Качество перевода zh/ja/ru

WMT25 (General MT, «Findings», ACL 2025): оценивались 60 систем, из них 24 — LLM/онлайн-переводчики; задача — перевод целых документов, оценка людьми (ESA/MQM). Лучшая система в целом — Gemini 2.5 Pro (топ-кластер в 14 из 15 языковых пар). Лучшая constrained-система — Shy-hunyuan-MT (Tencent). Ключевой вывод организаторов: универсального победителя нет, лидер зависит от направления и домена — для продукта обязателен собственный пилот на своих текстах. WMT25 отражает поколение моделей 2025 года; свежих полных WMT-результатов по поколению 2026 ещё нет.

Общие арены (июнь 2026): LMArena Overall — Claude Opus 4.8 (~1510 Elo), затем GPT-5.5 Pro, Gemini 3.1 Pro Preview, Claude Opus 4.7, GPT-5.5. Это прокси «литературности» и следования стилю, не перевода как такового.

Китайский (zh): китайские модели системно сильнее западных дешёвых аналогов. Chinese-leaderboard BenchLM (июнь 2026): DeepSeek V4 Pro — 87, GLM-5.1 — 83, Kimi K2.6 и GLM-5 — 81, Qwen3.5-397B — 79. Практический вывод: для направления zh→ru/en черновик на DeepSeek/GLM/Qwen почти наверняка не уступит западным моделям при цене в 520 раз ниже; но для политически чувствительных текстов см. раздел 5.

Японский (ja): основной независимый бенчмарк — Nejumi LLM Leaderboard 4 (Weights & Biases Japan, >40 моделей, включая коммерческие API) и Swallow LLM Leaderboard; в топах — коммерческие API OpenAI/Anthropic/Google (конкретное распределение по версии 4 — не проверено, нужно снять актуальный срез с wandb.ai). Из дешёвых моделей традиционно сильны в ja Qwen (обучается на большом CJK-корпусе) и Gemini Flash-линейка; специализированных публичных данных «дешёвые модели × литературный японский» нет — это аргумент за собственный мини-бенчмарк на ранобэ-фрагментах.

Русский (ru): независимые оценки — MERA (21 задача, AI Alliance), LLM Arena (llmarena.ru) — краудсорсинговый Elo для русского, и академический POLLUX. Среди open-weights для русского выделяют линейку Qwen3 (Qwen3-235B/14B). Все западные флагманы (GPT-5.x, Claude, Gemini) в русском сильны; главная проблема дешёвых моделей в ru — канцелярит и кальки с английского, что лечится редактором-проходом, а не выбором черновой модели.

Вывод по качеству: пары zh↔ru и ja↔ru — «двойной хвост»: мало моделей одинаково сильны в обоих языках. Схема «черновик китайской моделью (сильный zh) → редактор с сильным ru (Claude/GPT/Gemini) → судья-флагман» соответствует и бенчмаркам, и экономике.

5. Цензура и политика контента (18+/насилие в художественном тексте)

Провайдер Эротика (fiction, взрослые) Насилие/жесть в fiction Политика Риск для TextMachine
xAI Наиболее пермиссивен: ориентир «R-rated movie» (заявление Маска, 12.03.2026). AUP запрещает депикции реальных людей в сексуальном контексте и CSAM ОК нет полит. цензуры Регуляторная турбулентность: расследования в 12+ юрисдикциях (в осн. про image-gen), политика может ужесточиться
OpenAI «Adult mode» для верифицированных взрослых заморожен бессрочно (март 2026). Explicit erotica в API остаётся запрещённой; «mature themes» без графики допустимы по Model Spec (18.12.2025) умеренно ОК с лит. контекстом нет Средний: жёсткие сцены секса режутся; насилие обычно проходит
Anthropic Категорический запрет sexually explicit; обходов нет, повторные попытки → бан аккаунта насилие в лит. контексте в целом допустимо нет Не использовать для 18+ сцен; отличен для «чистых» проходов редактора/судьи
Google Prohibited Use Policy запрещает porn/erotic; автоматический мониторинг API. Safety settings (вкл. BLOCK_NONE) снимают фильтры по harassment/violence, но AUP остаётся с настройками safety — терпимо нет Как Anthropic: редактор/судья для не-18+ фрагментов
DeepSeek / китайские (Qwen, GLM, Kimi, MiniMax) Формально ToS запрещают, на практике фильтрация эротики слабая (не проверено систематически) обычно ОК Политическая цензура: DeepSeek R1 отказывает по ~85% тем, чувствительных для КНР (Тяньаньмэнь, Тайвань, Синьцзян, критика руководства); цензура частично зашита в веса (исследование R1dacted), у API — доп. фильтр поверх. Аналогичные требования CAC распространяются на все китайские API Высокий для переводов исторических/политических романов с китайскими реалиями; для «безобидных» жанров — низкий
Mistral Модерация — отдельный опциональный Moderation API (9 категорий, 11 языков, включая ru/zh/ja); сами completion-модели фильтруют мягко, официальной позиции «erotica запрещена» уровня Anthropic нет (не проверено) ОК нет Запасной вариант средней силы; open-weights (Small) можно хостить самим

Практические следствия:

  1. Перевод жёстких сцен (секс, графическое насилие): основной канал — xAI API; фолбэк — open-weights модели (Qwen, GLM-4.x, Mistral Small, DeepSeek-дистилляты) через пермиссивных хостеров OpenRouter или локально. Роутер контента в пайплайне должен классифицировать фрагменты и направлять «горячие» куски на пермиссивный канал, остальное — на дешёвый/качественный.
  2. Политическая цензура — зеркальная проблема: для zh-новелл с историческими/политическими сюжетами китайские API могут молча искажать или отказывать; выявляется только сравнением с некитайской моделью. Для таких книг черновик стоит делать на Qwen/GLM open-weights (без API-фильтра, но с учётом того, что часть цензуры в весах) либо на западной модели.
  3. Отказ провайдера — не всегда ошибка пайплайна: нужно ловить refusal-маркеры (у Anthropic — stop_reason: "refusal") и автоматически перенаправлять фрагмент.

6. Rate limits и надёжность

  • DeepSeek: фиксированных RPM/TPM нет — динамический троттлинг по нагрузке сервера и истории аккаунта; для V4 задокументированы лимиты конкурентности: ~500 одновременных соединений (v4-pro) и ~2500 (v4-flash) на аккаунт. В пики (день по Пекину) выше латентность и шанс 429 → массовые прогоны планировать на 16:3000:30 UTC.
  • OpenAI / Anthropic / Google: tier-системы, лимиты растут с историей платежей; для батч-перевода книг лимиты нижних tier'ов обычно достаточны, т.к. Batch API имеет отдельные (более щедрые) квоты. У Anthropic Batch — до 100K запросов/256 MB на батч.
  • Zhipu/Moonshot/MiniMax intl: публичные лимиты скромнее и документация тоньше; закладывать ретраи и фолбэк на второго провайдера.
  • OpenRouter повышает эффективный аптайм фолбэком между хостерами; для критического SLA — прямые ключи минимум к двум независимым провайдерам.
  • Общее: пайплайн должен быть асинхронным с очередью, экспоненциальными ретраями на 429/5xx и чекпоинтами по главам — тогда ни один из лимитов выше не является блокером.

7. Рекомендуемый набор моделей для TextMachine

Роль Основная Альтернативы Цена (in/out) Обоснование
Черновой переводчик (рабочая лошадка) deepseek-v4-flash grok-4.1-fast; qwen3.7-plus; MiniMax-M3; GLM-4.7 $0.14/$0.28 Почти бесплатно; сильный zh; кэш 98% на глоссарий/память; 1M контекст
Редактор (средний тир) GLM-5 или Kimi K2.6 для zh-исходников; Claude Sonnet 5 для финального ru-стиля gpt-5.4-mini; Gemini 3.1 Flash-Lite; Mistral Large 3 $1/$3.2; $0.95/$4; $2/$10 (интро) Sonnet 5 по интро-цене до 31.08.2026 — редкое окно «Opus-качество за полцены»; batch 50% сверху
Судья / арбитр качества Gemini 3.1 Pro Preview (batch) Claude Opus 4.8 (batch); GPT-5.5 $2/$12 → $1/$6 в batch Линия Gemini Pro — лучший результат WMT25; вызывается редко (спорные фрагменты, выборочный контроль глав)
Консультант поп-культуры / языковой аналитик qwen3.7-max (chinese realia), gpt-5.4-mini (общий) Kimi K2.7 Дешёвые вызовы с коротким выводом
Незацензуренный канал (18+/жесть) grok-4.3 / grok-4.1-fast open-weights (Qwen3, GLM-4.x, Mistral Small 4) через OpenRouter или локально $1.25/$2.50; $0.20/$0.50 Единственный крупный API с явно допущенным R-rated контентом

Оценка себестоимости (роман ~700K токенов исходника, ~1M токенов вывода на проход): черновик на v4-flash ≈ $0.40.6; редактор на GLM-5 ≈ $45, на Sonnet 5 batch (интро) ≈ $67; судья на Gemini 3.1 Pro batch по 20% объёма ≈ $23. Итого полный трёхролевой прогон книги — порядка $715, что оставляет очень высокую маржу при любой разумной цене продукта. Без кэширования глоссария/памяти input-часть вырастает в разы — кэш обязателен с первой версии.

Выводы для TextMachine

  1. Строить мультипровайдерную абстракцию сразу (она в Go-кодовой базе уже начата — расширять): цены и линейки за полгода сменились полностью (DeepSeek V3→V4, GPT-5→5.5, Gemini 2.5→3.5, Grok 4→4.3). Конфиг моделей — данные, не код; прайс — в конфиг с датой проверки.
  2. Кэширование промптов — архитектурное требование: системный промпт, глоссарий и банк памяти книги должны образовывать стабильный префикс запроса (без временных меток и пер-запросных ID), иначе теряется 8098% экономии. У Anthropic — явные брейкпоинты, у DeepSeek/OpenAI/xAI — автоматика.
  3. Batch-режим для несрочных проходов: черновик и массовые прогоны судьи гнать через Batch (50%) у OpenAI/Anthropic/Google/xAI; для DeepSeek — планировщик на внепиковые часы Пекина (и следить за вводом peak-надбавки ×2 с середины июля 2026).
  4. Роутер контента по «горячести» фрагмента — обязательный компонент: классификатор (дешёвая модель) помечает 18+/жёсткие сцены и направляет их на Grok/open-weights, остальное — на дешёвый канал. Ловить refusal-маркеры и делать авто-перенаправление.
  5. Для zh-исходников с политикой — не полагаться на китайские API: цензура частично в весах, частично в API-фильтре; иметь тест «переведи чувствительный абзац» в приёмке моделей.
  6. Собственный мини-бенчмарк художественного перевода (по 1020 фрагментов ранобэ/вебновелл на пару zh→ru, ja→ru, en→ru с оценкой судьёй + человеком) важнее публичных лидербордов: WMT25 сам констатирует, что лидер зависит от направления и домена, а литературный домен в публичных бенчмарках почти не представлен.
  7. Окно возможности: интро-цена Claude Sonnet 5 ($2/$10) действует до 31.08.2026 — успеть откалибровать роль «редактора» на ней и замерить, оправдывает ли полная цена ($3/$15) разницу с GLM-5/Kimi.
  8. С себестоимостью полного прогона книги ~$715 главные статьи расходов продукта — не токены, а повторные итерации и человеческая правка; значит, оптимизировать надо число проходов (умный роутинг «какие абзацы достойны судьи»), а не цену черновой модели.

Источники