textmachine/docs/research/11-gap-2.md

42 KiB
Raw Blame History

11. Gap-2: 18+ маршрутизация — де-юре и де-факто политики провайдеров (июль 2026)

Цель: разрешить противоречие doc 04 ↔ doc 08 по OpenAI, дать проверенный срез enforcement-практики по всем провайдерам и зафиксировать двухканальную маршрутизацию NSFW для MVP. Все даты и статусы проверены поиском на 04.07.2026; непроверенное помечено.

⟶ ЧАСТИЧНО ПЕРЕОПРЕДЕЛЕНО (2026-07-05). Роутинг вокруг «избегания Anthropic-аккаунтов» неактуален — Anthropic выброшен из стека целиком (Р4/D3, c7f8a95). Двухканальная модель A/B и срез enforcement-политик провайдеров остаются справочником.

TL;DR

  1. Противоречие разрешено в пользу doc 04: OpenAI «adult mode» так и не запустился — анонс 14.10.2025, перенос с декабря на Q1 2026, перенос 0607.03.2026, бессрочная заморозка 26.03.2026 (FT/TechCrunch). Doc 08 неверно трактовал Model Spec 18.12.2025: там erotica осталась в «restricted»-категории с формулировкой «we're exploring» — это декларация намерения, а не разрешение. Маршрутизировать NSFW-генерацию на OpenAI нельзя.
  2. Однако в Model Spec есть transformation exception: перевод/парафраз/анализ предоставленного пользователем sensitive-контента прямо разрешён («translating, paraphrasing, summarizing, classifying…»). Де-юре перевод чужой эротики у OpenAI легальнее, чем её генерация; де-факто GPT-5.x всё равно часто отказывает (жалобы разработчиков в т.ч. на отказ переводить документальное насилие).
  3. xAI — единственный крупный API, где текстовая эротика с вымышленными взрослыми прямо не запрещена AUP и де-факто генерируется. «R-rated» Маска (12.03.2026) относился к Grok Imagine (картинки), но текстовый канал ещё пермиссивнее; enforcement-кейсов по тексту не найдено. Основной канал NSFW для MVP.
  4. Anthropic — категорический запрет + эскалация warning → restriction → ban; отказ вшит в веса. Один email = одна Console-организация, области действия бана Anthropic не документирует → NSFW-чанки не должны попадать в Anthropic-аккаунт вообще, классификатор до роутинга обязателен.
  5. DeepSeek: де-юре ToS прямо запрещает pornographic content («e.g., sexual chatbots»), де-факто официальный API — массовый рабочий канал NSFW-ролеплея экосистемы JanitorAI (гайды 20252026 используют ключи platform.deepseek.com как норму); задокументированных банов за NSFW не найдено. Годен как fallback, но не как единственный канал.
  6. Qwen (Alibaba Model Studio) — единственный из рассмотренных с недокументируемым жёстким внешним фильтром: ошибка data_inspection_failed блокирует вход/выход, отключить нельзя → риск «молчаливых» потерь текста. GLM-4.6 сообщество считает фактически нецензурированным для NSFW, GLM-4.7 «подхватил safety-привычки». MiniMax M2 (Her) — RP-тюн с «fewer content restrictions».
  7. OpenRouter не модерирует сам — ToS перекладывает политику на провайдера модели; открытые веса у пермиссивных хостеров (Chutes, Venice «uncensored», Featherless) — рабочий NSFW-канал №2 и изоляционный слой: бан-риск концентрируется у хостера, а не на наших прямых аккаунтах.
  8. Судейство NSFW решаемо: у Gemini API дефолтный порог фильтров для моделей 2.5/3 — Off (кроме неотключаемого child-safety), т.е. judge-роль на 18+ тексте технически работает; CometKiwi — локальная регрессионная модель без механизма отказа (но её надёжность на литературном/эротическом домене не валидирована). Claude в judge-роли на explicit-фрагментах использовать нельзя.

1. OpenAI: разрешение противоречия doc 04 ↔ doc 08

Хронология (проверена):

Дата Событие Источник
14.10.2025 Altman анонсирует erotica для верифицированных взрослых «в декабре» The Conversation, Futurism
18.12.2025 Model Spec: erotica/gore остаются «restricted» — «should not generate… except in scientific, historical, news, artistic or other appropriate contexts»; про API — «we're exploring how to let developers and users generate erotica and gore in age-appropriate contexts through the API and ChatGPT so long as our usage policies are met» Model Spec 2025-12-18
янв. 2026 Запущен age-prediction в ChatGPT (поведенческие сигналы, Persona-верификация) — не для API justainews (обзор, май 2026)
0607.03.2026 Официальный перенос adult mode («higher priority work») Axios, TechCrunch
26.03.2026 Бессрочная пауза после давления сотрудников и инвесторов (риски зависимости, несовершеннолетние, модерация) TechCrunch, Thurrott

Вердикт по противоречию. Doc 08 прочитал Model Spec 18.12.2025 как «разрешение erotica с декабря 2025» — это ошибка: спек лишь заявил намерение («exploring») и сохранил erotica в restricted-категории с условием соблюдения Usage Policies, которые изменены не были. Реальное разрешение должно было прийти вместе с adult mode, который не запустился и заморожен 26.03.2026. Doc 04 корректен. На июль 2026: explicit erotica через OpenAI API де-юре не разрешена, программы age-verification для API-клиентов не существует (age-prediction — только ChatGPT-продукт).

Де-факто. GPT-5.2+ отказывает реже на «mature themes» (system card GPT-5.2 фиксирует снижение отказов на sexualized text), но explicit-сцены стабильно режутся; в dev-форуме — жалобы на отказ даже переводить документальные описания насилия и на «watered down» ответы через API с оплатой токенов (community thread, system card 5.2 PDF).

Важная лазейка де-юре — transformation exception. Model Spec прямо разрешает «translating, paraphrasing, summarizing, classifying» sensitive-контента, предоставленного пользователем, даже если генерировать такой контент нельзя; запрещено лишь «достраивать» недостающие части и работать с prohibited-контентом (несовершеннолетние — всегда) (Model Spec). Для TextMachine это значит: перевод пользовательской эротики у OpenAI юридически защитимее, чем генерация, но де-факто модель исполняет исключение нестабильно (не проверено систематически — нужен внутренний бенчмарк отказов).

Баны. Задокументированных кейсов бана API-аккаунтов именно за эротику не найдено; механизм — деактивация за повторные нарушения Usage Policies (Help Center). Прогон NSFW-входа через Moderation endpoint сам по себе не наказывается (dev-форум).

2. xAI (Grok)

  • Де-юре: AUP (в силе с 02.01.2025) запрещает порнографические изображения реальных лиц и любую сексуализацию несовершеннолетних; текстовая эротика с вымышленными взрослыми персонажами не запрещена (AUP; текст пересказан по независимым обзорам — сама страница отдаёт 403 ботам).
  • «R-rated»-ориентир Маска (12.03.2026) сформулирован про Grok Imagine (изображения): «If it's allowed in an R-rated movie, it's allowed in Grok Imagine» (atlascloud обзор). Для текста ограничений ещё меньше.
  • Де-факто: обзоры начала 2026 фиксируют, что Grok 4.20 с «verified adult mode» пишет explicit-эротику и mature fiction широкого спектра; жёсткие границы — несовершеннолетние (в любом фрейминге), реальный вред, дипфейки реальных людей; повторные попытки обхода → ограничения аккаунта (picassoia, aiinsightsnews, arsturn). Кейсов бана API-клиентов за текстовую эротику не найдено (не проверено — отсутствие кейсов ≠ отсутствие риска).
  • Enforcement-контекст: январь 2026 — скандал с сексуализированными изображениями реальных людей/детей → ужесточение image-канала (09.01 платный доступ, 14.01 crackdown на real-person контент), регуляторные расследования в ряде юрисдикций. Текстовый канал ужесточения не затронули (по доступным источникам).
  • Риск-профиль: политика волатильна и персоналистична (зависит от решений Маска); регуляторное давление сфокусировано на изображениях. Для текстового перевода 18+ на сегодня — самый безопасный крупный API.

3. Anthropic: риск для SFW-ролей

  • Де-юре: Usage Policy — «Do Not Generate Sexually Explicit Content», без исключений для фикшена; апдейты политики 2026 года смягчения не внесли (anthropic.com/news/usage-policy-update, проверено поиском по обновлениям 2026).
  • Де-факто: отказ вшит в веса (Constitutional AI), джейлбрейки «flag accounts faster than straightforward requests»; enforcement эскалационный: soft refusal → warning → temporary restriction → permanent ban, порог не публикуется (Sudowrite, 26.05.2026). Официальный процесс: Safeguards-team мониторинг, предупреждения и апелляции через usersafety@anthropic.com (Help Center, Transparency Hub).
  • Изоляция: один email = одна Console-организация (можно быть приглашённым в чужие); ключи скоупятся на Workspace (Workspaces). Область действия бана (workspace/org/юрлицо) не документирована → консервативное допущение: бан минимум на уровне организации, с риском каскада на связанные аккаунты (не проверено).
  • Практический вывод: редактор/судья на Claude должны быть архитектурно отрезаны от NSFW-потока. Классификатор до роутинга + refusal-детектор после — обязательны. Если очень нужен Claude на «тёплых» (не explicit) фрагментах — гонять их через OpenRouter: исторически существовали официальные «self-moderated» варианты Claude без прокси-модерации OpenRouter (анонс, пример endpoint); наличие self-moderated вариантов у текущих Claude 4.x/Opus 4.8 — не проверено. Это переносит модерационный слой, но не отменяет отказы модели и AUP.

4. Китайские API: DeepSeek, Qwen, GLM, MiniMax

DeepSeek.

  • Де-юре: ToS запрещает «generate, express or promote content that is pornographic, obscene, or sexually explicit (e.g., sexual chatbots)»; меры — от предупреждения до закрытия аккаунта, запрета повторной регистрации и передачи данных органам (Terms of Use).
  • Де-факто: официальный API (platform.deepseek.com) — стандартный канал NSFW-ролеплея экосистемы JanitorAI: гайды 20252026 описывают подключение официального ключа как рутину, «$5 хватает на тысячи длинных сообщений», фильтрация сексуального текста на уровне API-слоя не наблюдается (chat-deep.ai guide, aiinsightsnews guide, 28.03.2026, help.janitorai.com proxy guide). Отказы — модельного уровня, преодолеваются промптом. Задокументированных банов за NSFW не найдено; страшилки «accounts get flagged fast» встречаются только в SEO-статьях конкурентов-сервисов (flirton, dreamgenоба промо-материалы, низкая доказательность).
  • Константа: политическая цензура (≈85% отказов по чувствительным для КНР темам, частично в весах) — риск для исторических/политических текстов, не для эротики (Wired razбор, NDSS-статья о цензуре китайских LLM-сервисов).

Qwen (Alibaba Model Studio, intl).

  • Единственный в списке с обязательным внешним инспекционным фильтром: ошибка data_inspection_failed («Input or output data may contain inappropriate content») блокирует запрос целиком; официальная рекомендация — «modify the input and retry», отключение не предусмотрено (Error codes). Для перевода это означает не только отказы, но и риск обрывов/вырезаний на границах фильтра. Сообщество отмечает, что Qwen3.5 зацензурен сильнее Qwen2.5 (не проверено систематически). Открытые веса Qwen — другое дело (см. §5).

GLM (Zhipu / z.ai).

  • GLM-4.6 сообщество NSFW-чатов называло «fan favorite for being uncensored»; GLM-4.7 «подхватил safety-привычки» (самоцензурные вставки в RP), guardrails ослабевают с ростом контекста (Indie Hackers обзор GLM-4.7). Жёсткого внешнего фильтра уровня Qwen на z.ai API в источниках не зафиксировано (не проверено первоисточником).

MiniMax.

  • M2 (Her) — специализированный RP-тюн (Role-Play Bench #1, 200K контекст) с «fewer content restrictions», MiniMax владеет companion-приложением Talkie — бизнес-модель сама по себе NSFW-толерантна (shiori.ai обзор). Систематических данных по фильтрации API нет (не проверено).

Данмэй/BL-специфика. Внутрикитайская цензура danmei жёсткая на уровне платформ (Jinjiang и др.) и медиа (запрет BL-экранизаций с 2021) (tandfonline), но свидетельств того, что API-модели DeepSeek/GLM отказывают именно на гей-контенте как таковом (без explicit), не найдено; риск концентрируется на explicit-сценах + политических вкраплениях. Обязателен тест-набор danmei-фрагментов в приёмке (см. Выводы).

5. OpenRouter и хостеры open-weights

  • Де-юре: ToS OpenRouter не содержит собственного запрета NSFW — пользователь обязан соблюдать «Terms of Service for the Model or Provider you are using»; модерация делегирована провайдерам (Terms).
  • Наценки на токены нет; политика контента определяется хостером конкретного endpoint'а. Пермиссивные хостеры: Chutes (главный дешёвый хост DeepSeek/GLM-весов, куда мигрировала JanitorAI-аудитория; подписка ~$3/мес — help.janitorai.com), Venice (официальное партнёрство с OpenRouter, модель venice/uncensored позиционируется как «private, uncensored» — venice.ai блог, endpoint), Featherless, NothingIsReal (Celeste 12B — NSFW-тюн Mistral Nemo).
  • Красноречивый факт: топ коллекции OpenRouter «Roleplay» — DeepSeek V4 Flash / V3.2 / V4 Pro ($0.09/$0.18 за 1M у Flash) — RP-трафик (значительная доля NSFW) массово идёт через открытые веса DeepSeek у сторонних хостеров без видимого enforcement (коллекция).
  • Функция для TextMachine: (а) fallback-пул нецензурированных endpoint'ов одной кнопкой; (б) изоляция — прямые аккаунты xAI/DeepSeek/Anthropic не светятся, договорные отношения с хостером у OpenRouter; (в) риск: OpenRouter оставляет за собой право блокировать входы, нарушающие ToS провайдера.

6. Оценка качества NSFW-переводов (judge-роль и метрики)

  • Gemini API — рабочий judge для 18+ текста: настройки безопасности имеют уровень OFF, и для моделей Gemini 2.5/3 дефолтный порог — Off; неотключаем только child-safety-слой; оговорка «applications that use less restrictive safety settings may be subject to review» (Safety settings). Сообщество подтверждает работоспособность Gemini на NSFW RP через пресеты (Grokipedia/SillyTavern). Де-юре Prohibited Use Policy Google запрещает porn «for … sexual gratification», но с исключениями «educational, documentary, scientific, or artistic» (policy) — оценка качества перевода художественного текста аргументируемо попадает в исключение. Прецедент риска: майский (2025) инцидент, когда обновление Gemini 2.5 Pro Preview игнорировало настройки разработчиков — фильтры могут «вернуться» без предупреждения.
  • GPT как judge: transformation/analysis exception покрывает «classifying»/анализ пользовательского sensitive-контента (см. §1) — судейство формально разрешённый режим; де-факто на самых жёстких фрагментах возможны отказы (не проверено систематически).
  • Claude как judge на explicit — не использовать: категорический запрет + риск флага аккаунта, на котором живут SFW-роли.
  • CometKiwi/COMET: reference-free QE — это локальная регрессионная модель на XLM-R, механизма отказа у неё нет (CometKiwi paper) — «откажется оценивать» невозможно технически. Реальная проблема иная: обучена на WMT-данных (новостной/общий домен), надёжность на литературном тексте спорна — свежие работы фиксируют ограничения COMET-семейства на художественном переводе (Fluency and Faithfulness…, 2026); на эротической лексике ru не валидирована вовсе (не проверено — нужен свой замер корреляции с человеком).
  • Локальный judge: SORRY-Bench показывает, что файнтюн 7B-модели даёт качество оценки уровня GPT-4 в safety-задачах (arXiv:2406.14598) — локальная Qwen3.5-9B как NSFW-judge-fallback реалистична; учитывать нестабильность LLM-судей между категориями харма (arXiv:2605.31381).

7. Сводная таблица

Провайдер Что реально проходит в API (де-факто) Де-юре Риск бана Ключевые источники
xAI (Grok 4.x) Explicit-эротика с вымышленными взрослыми, жёсткие сцены; блок: несовершеннолетние, реальные лица, real-harm Текстовая эротика не запрещена AUP Низкий (текст); волатильность политики; enforcement-кейсов по тексту нет AUP, atlascloud, picassoia
OpenAI (GPT-5.x) Mature themes — да; explicit-сцены — отказ (реже в 5.2+); перевод sensitive-контента — нестабильно Erotica restricted; adult mode заморожен 26.03.2026; transformation exception для перевода Средний (деактивация за повторные нарушения; кейсов по эротике не найдено) TechCrunch, Model Spec
Anthropic (Claude) Explicit — категорический отказ (в весах); насилие в лит. контексте — ок Полный запрет sexually explicit Высокий при повторных попытках: warning → restriction → ban; скоуп бана не документирован Sudowrite, Safeguards
Google (Gemini) С safety OFF (дефолт для 2.5/3) проходит много NSFW; child-safety-слой неотключаем; фильтры могут вернуться апдейтом Запрет porn с исключением «artistic» Средний («review» приложений с ослабленными фильтрами) Safety settings, Use policy
DeepSeek (офиц. API) Эротика де-факто проходит (массовая практика JanitorAI); политические темы — жёсткий отказ ToS прямо запрещает pornographic («sexual chatbots») Низкий наблюдаемый / средний формальный (право закрыть аккаунт + сообщить органам); банов за NSFW не задокументировано ToS, JanitorAI-гайды
Qwen (Model Studio) Внешний фильтр data_inspection_failed на вход и выход, неотключаем → отказы и риск вырезаний Запрет + обязательная инспекция Средний; главный риск — не бан, а молчаливая порча перевода Error codes
GLM (z.ai) GLM-4.6 — почти без цензуры (консенсус RP-сообщества); GLM-4.7 — эпизодические safety-вставки ToS формально запрещает (не проверено детально) Низкий наблюдаемый Indie Hackers
MiniMax M2 (Her) — RP-тюн, «fewer content restrictions» (не проверено систематически) Не оценён shiori.ai
OpenRouter (Chutes/Venice/Featherless) Открытые веса DeepSeek/GLM/Mistral-тюнов — без модерации хостера; venice/uncensored — заявленно без фильтров ToS делегирует политику хостеру Минимальный для наших аккаунтов (риск у хостера) Terms, Venice
Локальные abliterated (Qwen3.5, Mistral Nemo) Всё, что угодно; качество = «черновик» Нулевой doc 06

8. Рекомендация: двухканальная маршрутизация с fallback для MVP

Классификатор «горячести» (локальная Qwen3.5-4B/9B, шкала 03): 0 — чистый; 1 — тёплый (romance, поцелуи, ненатуралистичное насилие); 2 — explicit секс / жёсткое насилие; 3 — то, что запрещено везде (несовершеннолетние в сексуальном контексте, real-person porn) → не переводится, помечается пользователю.

Канал A (уровень 01, ~8595% книги): DeepSeek V4 Flash (черновик) → GLM/Kimi/Sonnet (редактор; Claude получает только 01) → судья Gemini 3.x batch. Уровень 1 в Claude допустим, но с refusal-детектором и автопереносом чанка в канал B при отказе.

Канал B (уровень 2, ~515% книги), цепочка fallback:

  1. Grok 4.1-fast / 4.3 (прямой xAI-аккаунт, выделенный только под это) — основной: единственный крупный API с де-юре допустимой текстовой эротикой.
  2. OpenRouter → открытые веса (DeepSeek V4 у Chutes; GLM-4.6; Mistral-Nemo-тюны; venice/uncensored) — при отказе/деградации Grok; риск на хостере.
  3. DeepSeek официальный API — дёшево и де-факто работает, но формальный ToS-риск: использовать как третью, а не первую линию, чтобы не концентрировать NSFW-трафик на аккаунте, где идёт основной SFW-объём (или завести отдельный DeepSeek-аккаунт под NSFW).
  4. Локальная abliterated Qwen3.5-9B/35B-A3B — терминальный fallback, всегда доступен.

Судья NSFW: Gemini 3.x с safety OFF (де-факто работает, «artistic»-исключение в политике) → fallback Grok-судья → fallback локальный 9B-судья + CometKiwi как непрерывная неотказывающая метрика (после собственной валидации на 18+ корпусе). Claude в судьи NSFW не назначать никогда.

Гигиена аккаунтов: (1) отдельные организации/биллинг под каждый канал; (2) Anthropic-организация — стерильная (только уровень 01, refusal-мониторинг); (3) весь NSFW-трафик западных строгих провайдеров — ноль по построению, а не по надежде на фильтр; (4) детектор «молчаливых вырезаний» (сверка длины/покрытия предложений вход↔выход) обязателен для Qwen-подобных фильтров и вообще любого канала.

Выводы для TextMachine

  1. Обещание продукта «18+ перевод» держится на xAI + open-weights, а не на OpenAI. Из маркетинга и архитектуры убрать все допущения об OpenAI adult mode: заморожен бессрочно (26.03.2026), к API никогда не применялся. Doc 08 §4.2 и вывод «маршрутизация NSFW на OpenAI (после верификации)» — исправить.
  2. Двухканальный роутер с классификатором до API-вызова — не оптимизация, а условие выживания аккаунтов: у Anthropic enforcement эскалационный и непрозрачный, скоуп бана неизвестен, а на аккаунте живут SFW-роли всей системы.
  3. Уровень 3 (несовершеннолетние в сексуальном контексте) — жёсткий продуктовый отказ на всех каналах, включая локальный: это единственная категория, запрещённая везде, включая xAI и Venice, и единственная с уголовными последствиями для самого сервиса.
  4. Перевод ≠ генерация — юридический козырь: transformation exception OpenAI прямо легитимизирует перевод пользовательского sensitive-контента; аналогичную логику («обработка предоставленного пользователем текста, гарантии прав и совершеннолетия персонажей — на пользователе») зашить в собственные ToS.
  5. Собственный refusal/excision-бенчмарк (50100 фрагментов: эротика ru/zh/ja, данмэй, жёсткие сцены) — прогонять при каждой смене версии модели: GLM-4.6→4.7 показал, что пермиссивность теряется одним релизом; у Gemini фильтры возвращались апдейтом молча.
  6. Мониторинг четырёх событий с триггером пересмотра роутинга: (а) разморозка OpenAI adult mode; (б) ужесточение текстового канала xAI (регуляторы уже в теме из-за картинок); (в) появление/исчезновение self-moderated Claude-endpoint'ов на OpenRouter; (г) введение внешнего фильтра у DeepSeek/GLM по образцу Qwen.
  7. Данмэй-сегмент: риск китайских API — не «гей-контент как таковой», а explicit-сцены и политические реалии; но приёмочный тест на BL-корпусе обязателен, т.к. систематических данных нет. Для РФ-дистрибуции риски по данмэй лежат в плоскости закона о «пропаганде», а не провайдеров (см. doc 08).

Открытые вопросы

  • Фактическая частота отказов/вырезаний DeepSeek V4, GLM-4.7, MiniMax M2 именно на переводе (не генерации) эротики zh→ru — систематических данных нет, нужен внутренний бенчмарк.
  • Скоуп бана Anthropic (организация vs юрлицо vs связанные аккаунты) — не документирован.
  • Существуют ли self-moderated варианты текущих Claude 4.x на OpenRouter.
  • Устойчивость «artistic»-аргумента Google при review приложения с safety OFF на массовом 18+ трафике.
  • Корреляция CometKiwi с человеческой оценкой на литературном 18+ корпусе ru.

Источники