Ratify D22 accepting both packages with register caveat, 18+ judge revision, L3 pre-screen task, and D15.2 v3.1 amendments; sync status docs, archive prompts
This commit is contained in:
parent
3551997292
commit
a96248f14b
13 changed files with 44 additions and 26 deletions
|
|
@ -14,7 +14,7 @@ Go-бэкенд издательского художественного пер
|
|||
|
||||
## Источники истины (по убыванию)
|
||||
|
||||
1. **`docs/architecture/05-decisions-log.md` (D1–D21)** — ратифицированный контракт; при конфликте с любым другим доком побеждает он.
|
||||
1. **`docs/architecture/05-decisions-log.md` (D1–D22)** — ратифицированный контракт; при конфликте с любым другим доком побеждает он.
|
||||
2. `docs/architecture/07-strategic-review.md` — стратегический аудит 09.07 (вердикт, риски, курс-коррекции).
|
||||
3. `docs/experiments/00-provider-quirks.md` — wire-квирки провайдеров (читать ПЕРЕД правкой адаптеров/вызовами провайдеров).
|
||||
4. `docs/architecture/01-decisions.md` (Р1–Р10), `02-mvp-plan.md` (фазы v3), `04-unhappy-paths.md`, `06-memory-risk-registry.md`.
|
||||
|
|
@ -39,4 +39,4 @@ Go-бэкенд издательского художественного пер
|
|||
|
||||
## Текущее состояние (2026-07-09)
|
||||
|
||||
Фаза 0 ✅; машинерия Ф1 построена и дополнена пакетами №1–2 обеих сессий (память v2 + фиксы D16, `tmctl status`+redrive, reasoning-буфер, GB18030-ingest, 4 дешёвых стиль-флаггера; пилот-харнесс починен; exp10 — violence-рука канала B). Все пакеты залендены после внешнего ревью; research/15 «Голос и состояние» принят (D21). **Приёмочная книга Ф1 = 蛊真人 zh→ru (D18)**: полный текст на стенде `/home/ubuntu/books/gu-zhenren/guzhenren-gb18030.txt` (GB18030; текст и производные ВНЕ git); violence-18+ закрыт из неё же; остаток D14.4 — erotica-срез (полигон-сессия в работе). До приёмки: финализация сида (gender=hidden), бэкенд-пакет №3 (fix-лист D20.4, D15.2 v3 — реализация после этих правок, D3-цепочка), приёмочная сессия (glm-5-редактор допустим — D20.3). Решающая точка — пилот Ф2.5 (блокер — чистый xAI-ключ). Ключи: DEEPSEEK, ZAI, KIMI, OPENAI, GEMINI, XAI, MISTRAL. Стенд: WSL2, GTX 1070 8GB (прокси-грабли: localhost из-под прокси даёт 403 — no-proxy транспорт для local).
|
||||
Фаза 0 ✅; машинерия Ф1 построена (бэкенд-пакеты №1–3: память v2+D16, status/redrive, GB18030-ingest, стиль-флаггеры, спека D15.2 v3, цепочка D3/канал B, additive_total-биллинг Gemini; полигон-пакеты №1–3: пилот-харнесс, exp10 violence, exp11 erotica). **D14.4 закрыт — все critical сняты (D22)**; сид финализирован. **Приёмочная книга Ф1 = 蛊真人 zh→ru (D18)**: полный текст на стенде `/home/ubuntu/books/gu-zhenren/guzhenren-gb18030.txt` (GB18030; текст и производные ВНЕ git); **приёмка разблокирована** — осталась приёмочная сессия (glm-5-редактор допустим — D20.3; `escalation.budget_usd>0` — D22.11). Очередь: приёмка → бэкенд-№4 рефакторинг → внешняя GPT-критика (промты выданы). Реализация D15.2 — после v3.1-правок (D22.2). Решающая точка — пилот Ф2.5 (блокер — чистый xAI-ключ). Ключи: DEEPSEEK, ZAI, KIMI, OPENAI, GEMINI, XAI, MISTRAL. Стенд: WSL2, GTX 1070 8GB (прокси-грабли: localhost из-под прокси даёт 403 — no-proxy транспорт для local).
|
||||
|
|
|
|||
|
|
@ -1,6 +1,6 @@
|
|||
# backend/ — Go-бэкенд TextMachine
|
||||
|
||||
Зона сессии «Бэкенд». Контракт — `docs/architecture/05-decisions-log.md` (D1–D21); контракты Фазы 0 — `03-implementation-notes.md`; квирки провайдеров — `docs/experiments/00-provider-quirks.md`. **`.env` не читать.**
|
||||
Зона сессии «Бэкенд». Контракт — `docs/architecture/05-decisions-log.md` (D1–D22); контракты Фазы 0 — `03-implementation-notes.md`; квирки провайдеров — `docs/experiments/00-provider-quirks.md`. **`.env` не читать.**
|
||||
|
||||
## Карта пакетов
|
||||
|
||||
|
|
|
|||
|
|
@ -1,7 +1,5 @@
|
|||
# Промт: бэкенд-сессия — пакет №4: код-хелс ревью + точечный рефакторинг (2026-07-10)
|
||||
|
||||
Скопируй в новую сессию Claude Code в `/home/ubuntu/projects/textmachine`. **Предусловие старта: чистое дерево** — пакет №3 залендён оркестратором (сверь `git status`; если в `backend/` чужие незакоммиченные правки — стоп, пинг владельцу).
|
||||
|
||||
---
|
||||
|
||||
## Кто ты и рамка владельца
|
||||
|
|
|
|||
|
|
@ -1,7 +1,5 @@
|
|||
# Промт: внешняя критика «восхождение» — GPT-5.6 (2026-07-10)
|
||||
|
||||
Для сессии GPT-5.6 с доступом к репозиторию `/home/ubuntu/projects/textmachine` (read-only). ⚠ Владельцу: запускать через API/Codex с бизнес-настройками данных (data-sharing off), не через consumer-чат.
|
||||
|
||||
---
|
||||
|
||||
## Кто ты и зачем
|
||||
|
|
|
|||
|
|
@ -1,10 +1,10 @@
|
|||
# Журнал прогресса
|
||||
|
||||
> **⟶ ТЕКУЩЕЕ СОСТОЯНИЕ** (обновляемый блок; на 2026-07-09, ночь). **Источник истины по РЕШЕНИЯМ — `architecture/05-decisions-log.md` (D1–D21); этот файл — ЖУРНАЛ, не спека.**
|
||||
> - **Фаза:** 0 ✅; машинерия Ф1 построена и дополнена пакетами №1–2 обеих сессий (память v2 + D16-фиксы, `tmctl status`+redrive, reasoning-буфер, GB18030-ingest с CJK-сплитом глав, 4 дешёвых стиль-флаггера; пилот-харнесс починен: эхо-контроль/fidelity/M0–M3/Go-синк; exp10 — violence-рука канала B). Все пакеты залендены после внешнего ревью; **research/15 «Голос и состояние» принят и ратифицирован (D21)**. **Приёмка Ф1 = 蛊真人 zh→ru (D18)**; до неё: финализация сида (gender=hidden 白凝冰 — полигон), бэкенд-пакет №3 (fix-лист D20.4 + D15.2 v3 + D3-цепочка — промт выдан), приёмочная сессия (glm-5-редактор допустим — D20.3). Решающая точка — пилот Ф2.5 (блокеры: чистый xAI-ключ, корпус 25–35 глав, аннотаторы ≥3). Параллельно в работе: полигон-erotica (закрытие D14.4).
|
||||
> - **Стек:** черновик DeepSeek V4 Flash (thinking ON — эхо-мина) · редактор **grok-4.3** `reasoning_effort:none` (дефолт grok = `low`; D1-монолингв оспорен — решает пилот-арм D13.1/D17) · судья/апекс Gemini 3.1 Pro (mandatory thinking) · эскалация A: DeepSeek V4 Pro → GLM-5.1 → Gemini (заводка цепочки — пакет №3) · **канал B (18+) v2 по D19.1: переводчик Mistral · эскалация grok-4.3 reasoning-ON · abliterated-скрининг · судьи Grok+Gemini** (DeepSeek в explicit запрещён ToS — D14.1). Anthropic выброшен, OpenAI оставлен. 7 ключей (+MISTRAL).
|
||||
> - **Экономика:** `experiments/08-cost-model-v2.md` (~$0.69 ранобэ / ~$10.94 вебновелла-500) — заменяет старые пороги $0.6 / $5 / $30. ⚠ Resume: любой `--resnapshot` = переоплата книги — онгоинг гейтится D15.2 (реализация после v3-правок, пакет №3); exp08 v3 (annotator/voice-строки) заказан D21.8.
|
||||
> - **Ждём от владельца:** чистый xAI-ключ без data-sharing (блокер пилота, не приёмки — D20.3) · ja-erotica книга в `/home/ubuntu/books/` (остаток D14.4) · провенанс двух внешних 12-*-доков · решение по юр-пакету.
|
||||
> **⟶ ТЕКУЩЕЕ СОСТОЯНИЕ** (обновляемый блок; на 2026-07-10). **Источник истины по РЕШЕНИЯМ — `architecture/05-decisions-log.md` (D1–D22); этот файл — ЖУРНАЛ, не спека.**
|
||||
> - **Фаза:** 0 ✅; машинерия Ф1 построена (пакеты №1–3 бэкенда: память v2+D16, status/redrive, GB18030-ingest, стиль-флаггеры, D15.2-спека v3, цепочка D3/канал B в конфиге, additive_total-биллинг Gemini; пакеты №1–3 полигона: пилот-харнесс, exp10 violence, **exp11 erotica — D14.4 ЗАКРЫТ, все critical сняты**; сид 蛊真人 финализирован). Все пакеты залендены после внешнего ревью; research/15 принят (D21), пакеты №3 ратифицированы (D22). **Приёмка Ф1 = 蛊真人 zh→ru (D18) РАЗБЛОКИРОВАНА** — остался промт приёмочной сессии (glm-5-редактор допустим D20.3; `escalation.budget_usd>0` обязателен — D22.11). Очередь: приёмка → бэкенд-№4 рефакторинг (промт выдан) → GPT-восхождение (промт выдан); порядок приёмка↔рефакторинг — за владельцем. Реализация D15.2 — после v3.1-правок (D22.2). Решающая точка — пилот Ф2.5 (блокеры: чистый xAI-ключ, корпус 25–35 глав, аннотаторы ≥3, проба судьи-дублёра 18+ — D22.6).
|
||||
> - **Стек:** черновик DeepSeek V4 Flash (thinking ON — эхо-мина; temperature там wire-no-op) · редактор **grok-4.3** `reasoning_effort:none` (D1-монолингв оспорен — решает пилот-арм D13.1/D17) · судья/апекс Gemini 3.1 Pro (**wire-слаг `-preview`**; mandatory thinking; биллинг `additive_total` — D22.3) · эскалация A: DeepSeek V4 Pro → GLM-5.1 → Gemini-preview (заведена, пакет №3) · **канал B (18+): переводчик Mistral (18/18 чист вкл. эротику) · эскалация grok-4.3 reasoning-ON (⚠ НЕ на архаичных zh — register-оговорка D22.5) · abliterated-скрининг · судьи: эротика — Grok (дублёр гейтится пробой D22.6), violence/SFW — Grok+Gemini** (DeepSeek в explicit запрещён ToS — D14.1). Anthropic выброшен, OpenAI оставлен. 7 ключей.
|
||||
> - **Экономика:** `experiments/08-cost-model-v2.md` (~$0.69 ранобэ / ~$10.94 вебновелла-500). ⚠ Resume: любой `--resnapshot` = переоплата книги — онгоинг гейтится D15.2 (v3.1 → реализация); exp08 v3 (annotator/voice-строки) заказан D21.8. Gemini-недоучёт 146×/вызов закрыт additive_total (D22.3).
|
||||
> - **Ждём от владельца:** чистый xAI-ключ без data-sharing (блокер пилота, не приёмки — D20.3) · провенанс двух внешних 12-*-доков · решение по юр-пакету · порядок «приёмка ↔ рефакторинг».
|
||||
> - Записи ниже — хронология; РАННИЕ (день-0, 04.07) содержат устаревшие цифры/решения (COGS $2–4, BYOK, Anthropic-Sonnet), переопределённые позже — см. блок выше и 05-decisions-log.
|
||||
|
||||
## 2026-07-04 — Старт проекта (MVP-сессия)
|
||||
|
|
@ -102,6 +102,14 @@
|
|||
- **Оценка влияния на бэкенд (оркестратор):** read-model уже есть (chunk_status/паспорта/вердикты — D12 строил `--json` «для CI/IDE»); новая работа мала и read-only: персист/экспорт якорей чанков, `annotations.json`, сборка перевода с политикой красных чанков, возможно дешёвый флаггер абзацной парности. Контрактно-опасен один кусок — **human_override** (пост-правка человека против redrive/resume/TM — пересечение со snapshot-дисциплиной, думать вместе с D15.2). Веб-сервер/SSE НЕ строим (Ф3, D12-caution в силе). Кандидат-скоуп бэкенд-пакета №4 — после ресёрча.
|
||||
- **Выдан промт** [`READER_IDE_RESEARCH_SESSION_PROMPT.md`](READER_IDE_RESEARCH_SESSION_PROMPT.md) → `research/16-reader-ide-alignment.md`: прайор-арт HITL-редактуры (CAT/Mantra/фан-стек/PE-исследования), якорение (гипотеза «чанк/абзац, страницы виртуальны»), визуализация доверия, контракт бэкенд→фронт; $0-проба парности абзацев на сохранённых выходах. Живые LLM-вызовы: $0.
|
||||
|
||||
### 2026-07-10 — Приёмка пакетов «бэкенд №3» и «полигон-erotica» + D22 (оркестратор)
|
||||
|
||||
- **Внешнее ревью обоих пакетов** (8 ревьюеров, всё исполнением: go test/race + 11 мутаций в scratchpad-копии; exp11 пересчитан из сырья поштучно независимой репликой классификатора — 15/15 ячеек и все судейские числа сошлись; Fisher-статистика клеймов; цены по вендор-страницам). **Оба ACCEPT_WITH_FIXES → залендены (e1fcee4, 3551997), ратифицирован D22.**
|
||||
- **Топ-находки ревью:** (1) спека v3 на оси SourceLang/TargetLang была СЛАБЕЕ текущей защиты (исполненный stale-hit) → два обязательных v3.1-амендмента до реализации; (2) дублёра-судью 18+ ратифицировать нельзя (gpt-5-mini не мерен; D13.3-коллизия: grok-эскалированные 18+ чанки без померенного судьи) → проба-гейт; (3) register-клейм сужен до «архаика ломает МИТИГАЦИЮ reasoning-ON» (p=0.008 vs совр. zh; «регистр» = гипотеза до контрольных ячеек); (4) кодовая ветка content-filter полигона мертва на фактическом составном wire-формате (счёт отчёта верен через ручной finish_reason); (5) ja/en-fidelity сняты под zh-рамкой судейского промпта — индикатив; (6) полигон случайно стёр заголовок чужой записи в журнале — восстановлен; правило transient-прогонов в чужой зоне кодифицировано (D22.10).
|
||||
- **D3-текст исправлен** (`gemini-3.1-pro-preview`; голый слаг 404 — квирк 04.07, синк живых доков perl-grep'ом); цена Mistral $0.5/$1.5 закрыта тройной сходимостью; квирк-строки (register-оговорка, additive_total) дописаны.
|
||||
- **Промты выданы (по заданию владельца):** [`GPT_EXTERNAL_ASCENT_PROMPT.md`](GPT_EXTERNAL_ASCENT_PROMPT.md) (внешняя критика GPT-5.6, анти-якорный трёхфазный протокол) и [`BACKEND_SESSION_PROMPT_REFACTOR.md`](BACKEND_SESSION_PROMPT_REFACTOR.md) (пакет №4: код-хелс + golden-гард детерминизма). Закрытые промты №3/erotica — в архив.
|
||||
- **Приёмка Ф1 разблокирована полностью** (D22.11): следующий деливерабл оркестратора — промт приёмочной сессии.
|
||||
|
||||
## Бэкенд
|
||||
|
||||
### 2026-07-04 — Сессия 1: шаг 0 (перевалидация) завершён
|
||||
|
|
|
|||
|
|
@ -11,12 +11,12 @@
|
|||
|
||||
## Структура
|
||||
|
||||
- `architecture/` — синтез. **Источник истины по решениям — [`05-decisions-log.md`](architecture/05-decisions-log.md) (D1–D21); при конфликте с любым доком он выше.**
|
||||
- `architecture/` — синтез. **Источник истины по решениям — [`05-decisions-log.md`](architecture/05-decisions-log.md) (D1–D22); при конфликте с любым доком он выше.**
|
||||
- `01-decisions.md` — принципы Р1–Р10; `02-mvp-plan.md` — фазы и приёмка (v3, 09.07); `03-implementation-notes.md` — контракты Фазы 0; `04-unhappy-paths.md` — ~70 режимов отказа → механизм; `06-memory-risk-registry.md` — реестр рисков банка памяти; **[`07-strategic-review.md`](architecture/07-strategic-review.md) — стратегический аудит (09.07): вердикт end-to-end, топ-риски, курс-коррекции**; `components.puml`/`pipeline.puml` — диаграммы v3 (владелец смотрит PlantUML-расширением VS Code; вручную НЕ рендерить).
|
||||
- `experiments/` — эмпирика «Полигона»: `00-provider-quirks` (читать перед любым вызовом провайдера), `01-token-calibration`, `02-refusal-benchmark`, `03-local-stand`, `04-editor-quality`, `06-local-extraction`, `07-coverage-precision`, `08-cost-model-v2` (актуальная денежная модель), `09-pilot-protocol` (пилот Ф2.5 + поправки D13), `10-explicit-benchmark` (18+ violence-рука канала B; erotica-расширение в работе).
|
||||
- `experiments/` — эмпирика «Полигона»: `00-provider-quirks` (читать перед любым вызовом провайдера), `01-token-calibration`, `02-refusal-benchmark`, `03-local-stand`, `04-editor-quality`, `06-local-extraction`, `07-coverage-precision`, `08-cost-model-v2` (актуальная денежная модель), `09-pilot-protocol` (пилот Ф2.5 + поправки D13), `10-explicit-benchmark` (18+ violence-рука канала B), `11-erotica-benchmark` (erotica по трём парам/регистрам — закрытие D14.4, D22).
|
||||
- `research/` — фактура исследований 04–05.07: `01–10` базовые, `11-gap-*` добор критиком, `12-*` режимы отказа/отзывы/таксономии (+ два внешних материала с провенанс-шапками), `13` валидация памяти, `14` адаптивная память, `15` голос и состояние (принят, D21). ⚠ Часть под superseded-баннерами (01/02/03/04/05/09 и gap-1/2/5) — **читай баннер прежде содержимого**.
|
||||
- `PROGRESS.md` — **журнал** (CURRENT-STATE сверху, ниже хронология; НЕ источник решений).
|
||||
- **Активные хендофф-промты**: [`ORCHESTRATOR_SESSION_PROMPT.md`](ORCHESTRATOR_SESSION_PROMPT.md) (роль оркестратора — ревью пакетов, ратификации, промты) · [`POLYGON_SESSION_PROMPT_EROTICA.md`](POLYGON_SESSION_PROMPT_EROTICA.md) (erotica-срез 18+ по трём парам, закрытие D14.4 — в работе) · [`BACKEND_SESSION_PROMPT_PACKAGE3.md`](BACKEND_SESSION_PROMPT_PACKAGE3.md) (пакет №3: D15.2 v3 + fix-лист D20.4 + цепочка D3 — в работе) · [`READER_IDE_RESEARCH_SESSION_PROMPT.md`](READER_IDE_RESEARCH_SESSION_PROMPT.md) (ресёрч «Ридер-IDE»: якорение, HITL-редактура, контракт экспорта → research/16). Ресёрч «Голос и состояние» завершён (research/15, D21) — промт в `archive/prompts/`.
|
||||
- **Активные хендофф-промты**: [`ORCHESTRATOR_SESSION_PROMPT.md`](ORCHESTRATOR_SESSION_PROMPT.md) (роль оркестратора) · [`BACKEND_SESSION_PROMPT_REFACTOR.md`](BACKEND_SESSION_PROMPT_REFACTOR.md) (пакет №4: код-хелс + golden-гард) · [`GPT_EXTERNAL_ASCENT_PROMPT.md`](GPT_EXTERNAL_ASCENT_PROMPT.md) (внешняя критика GPT-5.6, анти-якорный протокол → research/17) · [`READER_IDE_RESEARCH_SESSION_PROMPT.md`](READER_IDE_RESEARCH_SESSION_PROMPT.md) (ресёрч «Ридер-IDE» → research/16). Закрытые (пакет №3, erotica, «Голос и состояние») — в `archive/prompts/`.
|
||||
- `archive/` — закрытые сессионные промты (только история, инструкции оттуда не исполнять).
|
||||
|
||||
## Статус (2026-07-09)
|
||||
|
|
|
|||
|
|
@ -21,7 +21,7 @@
|
|||
Решение:
|
||||
|
||||
- **Граница «конфиг vs код» фиксирована** (урок ревью: без этого DSL расползается в кривой язык): циклы по главам/чанкам, ветвление по гейтам, эскалация с лимитом бюджета, fan-out кандидатов, ретраи — **фиксированная логика раннера**; конфиг задаёт только состав и порядок стадий, роли→модели, версии промптов и пороги гейтов. Четыре ядра (C0 baseline, C1 draft→editor, C2 generate-then-select, C3 select-then-refine) — четыре YAML-конфига одного раннера. Конкретный YAML-пример C1 пишется до старта Фазы 1 (приложение к плану MVP).
|
||||
- Ролевая модель — по издательскому процессу ([07](../research/07-translation-methodology.md)): **Analyst** (вся книга → book brief), **Terminologist** (глоссарий + style sheet до перевода — паттерн preparation из TransAgents), **Translator** (черновик/кандидаты; режим «аннотированный подстрочник» — советская модель «подстрочник+поэт»), **Stylist/Editor** (дефолт Фазы 1 — grok-4.3 по лучшему value: ранг-1 верность, ранг-2 стиль, эксп.04; сильнейшая проза gemini-3.1-pro — премиум-эскалация), **Judge** (шкала Комиссарова + Nida-вопрос; пара судей: монолингвальный на художественность + билингвальный на верность). Роли второй очереди (Фаза 2+): **Line Editor** (чек-лист Норы Галь), **Continuity Editor** (series bible), **анти-translationese пасс** (>40% переводов даже GPT-4 содержат кальки).
|
||||
- Ролевая модель — по издательскому процессу ([07](../research/07-translation-methodology.md)): **Analyst** (вся книга → book brief), **Terminologist** (глоссарий + style sheet до перевода — паттерн preparation из TransAgents), **Translator** (черновик/кандидаты; режим «аннотированный подстрочник» — советская модель «подстрочник+поэт»), **Stylist/Editor** (дефолт Фазы 1 — grok-4.3 по лучшему value: ранг-1 верность, ранг-2 стиль, эксп.04; сильнейшая проза gemini-3.1-pro-preview — премиум-эскалация), **Judge** (шкала Комиссарова + Nida-вопрос; пара судей: монолингвальный на художественность + билингвальный на верность). Роли второй очереди (Фаза 2+): **Line Editor** (чек-лист Норы Галь), **Continuity Editor** (series bible), **анти-translationese пасс** (>40% переводов даже GPT-4 содержат кальки).
|
||||
- Пункты брифа, по которым решение принято явно: **консультант поп-культуры / языковой аналитик** (бриф п.2; прототип — CRAT arXiv:2410.21067) и **tool-calling / переводческие тулзы** (п.32; в vojo tool-calling нет) — вне скоупа MVP, кандидаты Фазы 3; **webfetch за культурным контекстом** (п.16) — post-MVP, только по явному сигналу «незнакомый термин» и с подтверждением через глоссарий (риск многозначности, о котором предупреждал сам бриф).
|
||||
- У каждого пасса **узкий мандат** (запрет менять чужую зону) и диффы вместо полной перегенерации.
|
||||
- Приоритет силы моделей: **редактор > черновик** (вывод arXiv:2605.13368 — refinement проецирует текст в распределение редактора).
|
||||
|
|
@ -53,8 +53,8 @@
|
|||
| Роль | Основная модель | Альтернативы/эскалация |
|
||||
|---|---|---|
|
||||
| Черновик | DeepSeek V4 Flash ($0.14/$0.28; cache-hit input $0.0028; лучший zh-токенизатор) | GPT-5 nano ($0.05/$0.40), Qwen-Flash. ⚠ эксп.04: DeepSeek «эхал» оригинал на высоко-CJK фрагменте (82% CJK, 3/3) → тихий отказ = оригинал вместо перевода; ловит CJK-гейт + фолбэк-черновик |
|
||||
| **Редактор (ru-стиль) — эмпирический дефолт (эксп.04)** | **grok-4.3** (слепой бейк-офф, 2 фронтир-судьи: ранг-1 верность, ранг-2 стиль, самый дешёвый+быстрый ~13с без reasoning) | премиум-эскалация **gemini-3.1-pro** (лучшая проза, дорогая/медленная, иногда дописывает). GLM/Kimi сняты с дефолта (GLM-4.6 слабейший — перемерить при GLM-5; Kimi худший value: ~11k reasoning-ток./абзац). *Провизорно: LLM-судьи на коротких фрагментах; финал — человеческий пилот Ф2.5* |
|
||||
| Эскалация канал A (по сигналу гейта) | DeepSeek V4 Pro → GLM-5.1 → gemini-3.1-pro (апекс) | нативный Gemini-адаптер для safety-судьи — Ф2 |
|
||||
| **Редактор (ru-стиль) — эмпирический дефолт (эксп.04)** | **grok-4.3** (слепой бейк-офф, 2 фронтир-судьи: ранг-1 верность, ранг-2 стиль, самый дешёвый+быстрый ~13с без reasoning) | премиум-эскалация **gemini-3.1-pro-preview** (лучшая проза, дорогая/медленная, иногда дописывает). GLM/Kimi сняты с дефолта (GLM-4.6 слабейший — перемерить при GLM-5; Kimi худший value: ~11k reasoning-ток./абзац). *Провизорно: LLM-судьи на коротких фрагментах; финал — человеческий пилот Ф2.5* |
|
||||
| Эскалация канал A (по сигналу гейта) | DeepSeek V4 Pro → GLM-5.1 → gemini-3.1-pro-preview (апекс) | нативный Gemini-адаптер для safety-судьи — Ф2 |
|
||||
| Судья | Gemini 3.1 Pro (для явного safety-контроля — нативный API, Ф2) | GPT-5 mini — second-opinion судья чужого семейства; **Grok 4.3 — судья 18+** (не отказывается оценивать explicit, в отличие от Gemini/Claude); локальный POLLUX-judge-7B — бесплатный гейт |
|
||||
| Эмбеддинги/скрининг/экстракция терминов | локально: bge-m3, Qwen3.5-9B | Qwen3-Embedding-0.6B |
|
||||
| 18+ (канал B) | **Grok 4.3** ($1.25/$2.50 — средний тир, самый пермиссивный крупный API) + DeepSeek офиц. + локальная abliterated Qwen3.5 | open-weights через OpenRouter (Chutes/Venice). ⚠ Grok 4.1 Fast (дешёвый тир) retired 15.05.2026 — слаги редиректят на grok-4.3; сам xAI НЕ выведен. reasoning xAI **аддитивный** → канал B с thinking OFF (EstimateUSD не резервирует reasoning). Промо xAI $150 за data-sharing — брать на выделенный NSFW/eval-аккаунт (PD/тест-корпус), НЕ на продакшн клиентских книг |
|
||||
|
|
|
|||
|
|
@ -87,14 +87,14 @@ grok-4.3 теперь дефолт-редактор → **каждый чанк
|
|||
|
||||
## D3. Эскалация. ✅+
|
||||
|
||||
**Решение:** канал A — DeepSeek V4 Pro → GLM-5.1 → апекс Gemini 3.1 Pro; канал B (18+) — **Grok 4.3 основной пермиссивный тир** + DeepSeek офиц. + локальная abliterated. Sonnet удалён (Anthropic — дорого); OpenAI остаётся (ключ есть) — GPT-5 nano альт черновика, GPT-5 mini кандидат в редакторы/second-opinion судьи.
|
||||
**Решение:** канал A — DeepSeek V4 Pro → GLM-5.1 → апекс Gemini 3.1 Pro (wire-слаг ТОЛЬКО `gemini-3.1-pro-preview`, голый → 404 — испр. оркестратором по пингу пакета №3/D22; квирк ратифицирован 04.07, см. преамбулу D8–D11); канал B (18+) — **Grok 4.3 основной пермиссивный тир** + DeepSeek офиц. + локальная abliterated. Sonnet удалён (Anthropic — дорого); OpenAI остаётся (ключ есть) — GPT-5 nano альт черновика, GPT-5 mini кандидат в редакторы/second-opinion судьи.
|
||||
|
||||
**Правка по xAI (04.07, вопрос владельца — xAI НЕ выведен):** ретайрнулся только дешёвый Grok 4.1 Fast; сам провайдер жив, ключ есть. grok-4.3 ($1.25/$2.50) — средний тир, не «дорогой крайний». Роли Grok: (а) **переводчик канала B** (самый пермиссивный крупный API — стандарт R-rated); (б) **судья/QA 18+ контента** — не отказывается оценивать explicit, в отличие от Gemini (нужен нативный safety-off) и Claude (отказ). Ограничения: reasoning xAI **аддитивный** → канал B с thinking OFF, а think-ON на Grok — только после reasoning-буфера в `EstimateUSD` (D6.2). Промо xAI **$150 за data-sharing**: брать на выделенный NSFW/eval-аккаунт для PD/тест-корпуса и refusal/18+-бенчмарка (разблокирует висящую 18+ часть эксп.02) — но **не гнать через data-sharing реальные/конфиденциальные клиентские книги** (конфликт с ToS-гарантией и zero-retention режимом B2B, research/08).
|
||||
|
||||
**Правка редактора (04.07, эксп.04 полигона — бейк-офф): дефолт-редактор Фазы 1 = `grok-4.3`.** Слепой бейк-офф glm-4.6 / kimi-k2.6 / gemini-3.1-pro / grok-4.3 на 4 фрагментах (2 фронтир-судьи, сверка с каноническими ru-переводами, согласие независимо): **grok-4.3** — ранг-1 верность, ранг-2 стиль, самый дешёвый+быстрый (~13с без reasoning) → лучший value «одной модели на роль». **gemini-3.1-pro** — лучшая проза → премиум-эскалация редактора. **GLM-4.6 слабейший** (опровергает допущение Р4 «редактор=GLM»; перемерить при GLM-5), **Kimi худший value** (~11k reasoning-ток./абзац, ранг-последний по верности) → оба сняты с дефолта редактора. Это **закрывает вопрос бэкенда №2** (дефолт редактора). Оговорка: LLM-судьи на коротких фрагментах — провизорный дефолт Фазы 1; **эксп.04 кормил редактор БИЛИНГВАЛЬНО (исходник+черновик), а боевой редактор D1 — МОНОЯЗЫЧНЫЙ (только черновик) → рейтинг grok на моноредактуре строго не перенесён (exp08 §Ограничения, Quality-transfer риск), проверяется в пилоте**; финальный выбор редактора/ядра — человеческий пилот Ф2.5. Р4 обновлён. Следствие: grok-4.3 стал центральной моделью (редактор SFW + канал B + судья 18+) — гигиена аккаунтов xAI на три использования (Р4), редактор с thinking OFF через ЯВНЫЙ `reasoning_effort:none` (дефолт grok = `low`; ledger чист).
|
||||
**Правка редактора (04.07, эксп.04 полигона — бейк-офф): дефолт-редактор Фазы 1 = `grok-4.3`.** Слепой бейк-офф glm-4.6 / kimi-k2.6 / gemini-3.1-pro / grok-4.3 на 4 фрагментах (2 фронтир-судьи, сверка с каноническими ru-переводами, согласие независимо): **grok-4.3** — ранг-1 верность, ранг-2 стиль, самый дешёвый+быстрый (~13с без reasoning) → лучший value «одной модели на роль». **gemini-3.1-pro-preview** — лучшая проза → премиум-эскалация редактора. **GLM-4.6 слабейший** (опровергает допущение Р4 «редактор=GLM»; перемерить при GLM-5), **Kimi худший value** (~11k reasoning-ток./абзац, ранг-последний по верности) → оба сняты с дефолта редактора. Это **закрывает вопрос бэкенда №2** (дефолт редактора). Оговорка: LLM-судьи на коротких фрагментах — провизорный дефолт Фазы 1; **эксп.04 кормил редактор БИЛИНГВАЛЬНО (исходник+черновик), а боевой редактор D1 — МОНОЯЗЫЧНЫЙ (только черновик) → рейтинг grok на моноредактуре строго не перенесён (exp08 §Ограничения, Quality-transfer риск), проверяется в пилоте**; финальный выбор редактора/ядра — человеческий пилот Ф2.5. Р4 обновлён. Следствие: grok-4.3 стал центральной моделью (редактор SFW + канал B + судья 18+) — гигиена аккаунтов xAI на три использования (Р4), редактор с thinking OFF через ЯВНЫЙ `reasoning_effort:none` (дефолт grok = `low`; ledger чист).
|
||||
|
||||
**Уточнения панели (обязательны):**
|
||||
1. **Часть моделей ОТСУТСТВУЕТ в конфиге (частично закрыто на 05.07).** Заведены с тех пор: `grok-4.3` + провайдер `xai` (commit 636919c); `deepseek-v4-pro` подтверждён живьём и по цене ($0.435/$0.87). Ещё НЕ заведены: провайдеры `gemini`/`openai`, модели `deepseek-v4-pro`/`glm-5.1`/`gemini-3.1-pro` в `models.yaml`; цепочки эскалации всё ещё `[kimi-k2.6]`-заглушки; редактор всё ещё `glm-5`. Задача бэкенда (см. промт консолидации): завести недостающие провайдеры+модели+цены и заменить заглушки цепочкой D3.
|
||||
1. **Часть моделей ОТСУТСТВУЕТ в конфиге (частично закрыто на 05.07).** Заведены с тех пор: `grok-4.3` + провайдер `xai` (commit 636919c); `deepseek-v4-pro` подтверждён живьём и по цене ($0.435/$0.87). Ещё НЕ заведены: провайдеры `gemini`/`openai`, модели `deepseek-v4-pro`/`glm-5.1`/`gemini-3.1-pro-preview` в `models.yaml`; цепочки эскалации всё ещё `[kimi-k2.6]`-заглушки; редактор всё ещё `glm-5`. Задача бэкенда (см. промт консолидации): завести недостающие провайдеры+модели+цены и заменить заглушки цепочкой D3.
|
||||
- **ПОПРАВКА (принял корректировку бэкенда): «без новых адаптеров» было оптимистично.** Провайдеры OpenAI-совместимы по эндпоинту, но не по телу запроса: текущий `openAIRequest` всегда шлёт `temperature` + `max_tokens`, а Kimi требует `temperature: 1` (иначе 400), gpt-5-mini — `max_completion_tokens` без temperature + `reasoning_effort: minimal`, Gemini 3.1 Pro — обязательный thinking (`thinking_budget: 0` → 400). Это **не строчка в yaml, а per-model capability-слой** в адаптере, и он нужен **раньше D3**: Kimi — уже альтернативный редактор Р4, edit-стадия на temp 0.4 даст 400 на первом вызове. → Capability-слой — фундаментальный элемент Фазы 1. Форма (согласована с принципом «модели/цены только в конфиге», Р4): каждая модель в `models.yaml` декларирует возможности — `budget_field: max_tokens|max_completion_tokens`, `temperature: send|omit|locked:1`, `reasoning_control: none|extra_body_disable|effort_minimal|mandatory`; адаптер строит тело запроса по ним. `experiments/00-provider-quirks.md` — эталонная таблица квирков.
|
||||
2. **Премиум-бюджет $5/$30 УСТАРЕЛ** — выведен из калибровки на Sonnet $3/$15. Апекс теперь Gemini 3.1 Pro ($2/$12 ≤200k) с **обязательным thinking** (reasoning биллится как output $12/M — тот же класс недоучёта, что сжёг vojo 30–44%). Плюс `batch −50%` к inline-эскалации неприменим (последовательна из-за STM), только к судье/QA. Плюс Gemini = и апекс, и судья → эскалированный чанк платит Gemini дважды (перевод+ре-джадж), оба с форсированным reasoning. **Полигону: пересчитать бюджет на фактическом Sonnet-free стеке с reasoning-as-output, batch только на судью.** До пересчёта — $-потолок конфигурируемый (D-эконом ниже), дефолты $5/$30 держим как консервативную заглушку.
|
||||
|
||||
|
|
@ -258,6 +258,22 @@ D1 остаётся дефолтом Фазы 1 (менять конфигура
|
|||
|
||||
Сопутствующее: сырые артефакты проб продублированы оркестратором в `/home/ubuntu/books/gu-zhenren/research15-probes/` (вне git; scratchpad /tmp волатилен); статус-доки (CURRENT-STATE, README, CLAUDE.md, quirks editor-строка по D19.1) — синхронизированы отдельным коммитом.
|
||||
|
||||
## D22. Приёмка пакетов «бэкенд №3» и «полигон-erotica» + развязки 18+/эха/L3 (10.07, оркестратор). ✅
|
||||
|
||||
Внешнее ревью обоих пакетов (8 ревьюеров, всё исполнением: go build/vet/test -race + 11 мутационных ревертов в scratchpad-копии; пересчёт exp11 из сырья поштучно независимой репликой классификатора; Fisher-статистика на клеймах; вендор-цены по официальным страницам с датами). Вердикты: **оба ACCEPT_WITH_FIXES, залендены (e1fcee4, 3551997)**; микро-дефекты журнала исправлены оркестратором (заголовок пакета-2 восстановлен; счёт диффа бэкенда 20 файлов +860/−143).
|
||||
|
||||
1. **D14.4 ЗАКРЫТ — последний critical проекта.** 18+ эмпирика полна: violence (exp10) + erotica по трём парам/регистрам (exp11). Mistral-дефолт канала B подтверждён 18/18 на классике/вебновелле/романе; 0 content-отказов у всех переводчиков (0/18×5 армов).
|
||||
2. **Спека D15.2: v3 принята с двумя ОБЯЗАТЕЛЬНЫМИ амендментами (v3.1) до реализации.** (а) `Book.SourceLang/TargetLang` → verdictSnapshotID: ревью сконструировало и ИСПОЛНИЛО stale-hit, который v3 пропускает (языки — вердикт-входы вне рендера: cjk-гейт/coverage-коридоры; `editor.md` не рендерит `{{target_lang}}` → content_hash их не ловит; на этой оси v3 была СЛАБЕЕ текущего snapshotID, клейм «нет ре-открытия stale-serve» опровергнут); правило §4 переформулировать: судьбу обязано получить ЛЮБОЕ brief-поле, потребляемое вне рендера. (б) cache_ttl-противоречие: `Context.CacheTTL` демотировать до advisory (wire-инертен — не доходит ни до одного клиента) либо честно признать полную переоплату; `prov.CacheTTL` — в маппинг §4. Плюс до реализации: axis-sensitivity-тест RequestHash (флип role/stage меняет хеш — сейчас мутация «удалить role» выживает весь сьют); абзац «паритетные не-цели» в §8 (classify-Source для editor-строк; Retries/Escal.BudgetUSD вне хешей; транспорт); line-refs обновить. Отклонение YoPolicy/StyleAllowlist → verdictSnapshotID (консервативнее подсказки D20.1c, цена $0) — **ратифицировано**. Узкий клейм §3.3 (guard ⊇ stageSnap ∪ wire-поля) подтверждён поле-за-полем.
|
||||
3. **Деньги Gemini: `reasoning: additive_total` РАТИФИЦИРОВАН** — закрыт недоучёт 146×/вызов (thinking только в `total_tokens`; settle деривит total−prompt−completion; mutation-hardened; кэш не задваивается). Условия до заводки Gemini-стадии в прод: $0.01-проба «thinking ⊆ max_tokens» на 3.1-pro-preview (резерв для additive_total сознательно 0 — допущение проверено только на 2.5-flash; пробой потолка ограничен одним вызовом), негативный кейс деривации (total<prompt+completion — мутация гарда сейчас выживает), квирк-строка в exp00. Экспозиция Ф1 нулевая (gemini не на wire-пути дефолт-конфига).
|
||||
4. **D3-текст исправлен:** апекс = `gemini-3.1-pro-preview` (голый → 404; квирк был ратифицирован 04.07 — синк живых доков по grep-списку ревью выполнен). **Цена Mistral $0.5/$1.5 (Large 3) закрыта** тройной сходимостью: полигон (зеркала) + бэкенд (/pricing/api) + ревью (вендор-страница); $2/$6 = legacy Large 2 (ретайр 31.05.2026). Вопрос №3 бэкенда закрыт.
|
||||
5. **D19.1 — register-оговорка (амендмент):** «reasoning-ON снимает эхо grok» подтверждено для СОВРЕМЕННОЙ прозы (совр. zh-вебновелла 0/10 exp10; совр. ja 1/6; en 0/6), но на архаичной плотно-ханьской (金瓶梅, минский байхуа, упрощ. графика) НЕ спасает: **4/6 verbatim при reasoning_tokens 349–847** (vs совр. zh p=0.008; vs ja p=0.12 — не значимо; ON vs OFF на архаике неразличимы p=0.28; для OFF регистр-эффекта нет p=0.79). «Регистр входа» как общий закон — рабочая гипотеза до контрольных ячеек (дешёвый PD-контроль: совр.-zh-эротика + violence-пассажи 水滸傳 — полигону, не срочно). Следствия: echo-гейт обязателен на ВСЕХ конфигурациях включая reasoning-ON (D19.2 подтверждён); эскалация на grok-ON — НЕ лекарство от эха на архаичных zh (echo-rate хопа ~2/3 — жжёт бюджет на почти гарантированный ре-флаг); для приёмочной 蛊真人 (совр. вебновелла) D19.1 в силе. Квирк-строка дописана.
|
||||
6. **Судьи 18+ (сужение exp10/D19.1):** формула «судьи 18+ = Grok+Gemini, замена не нужна» **ОТМЕНЕНА для эротики**: Gemini fail-closed на графичной эротике (8× `PROHIBITED_CONTENT` wire-verified; фильтр неконфигурируем — native API не спасёт; на violence/SFW Gemini остаётся). **Grok — первичный судья эротики для НЕ-grok переводов.** Дублёр НЕ ратифицирован: gpt-5-mini на эротике не мерен (и ушёл с прайс-страницы), а D13.3-коллизия оставляет grok-эскалированные 18+ чанки вовсе без померенного судьи → **проба-гейт (полигону, центы, материал уже в eval/data):** gpt-5-mini + минимум один не-Google/не-xAI кандидат (mistral-судья для grok-выходов; kimi/glm после ToS-чека) на 18 Mistral- и 13 чистых grok-ON-переводах; пре-регистрировать refusal-rate и agreement.
|
||||
7. **L3-скрин РАТИФИЦИРОВАН как задача (рамка, не дизайн).** Ключевой факт exp11: отказ провайдера — НЕ сигнал уровня (0/18 на L2-explicit; DeepSeek переводит против собственного ToS) → пре-скрин — не «глубина обороны», а единственная автоматическая линия L3 (сегодня линию держит только ручная дисциплина корпуса/сида). Рамка: (а) per-chunk скрин на ingest для `adult:true` книг ДО любого wire-вызова (детерминированный лексикон-префильтр + локальный классификатор); (б) чек перед эскалационным хопом; (в) fail-closed: неэскалируемый терминальный флаг + человек, redrive только с явным ack; (г) НЕ реализовывать без спеки+метрики приёмки классификатора (FN-rate на размеченной пробе; методику сидируют minor-marker-скрины corpus_build; закрывает дыру стратревью §4.6/§9.12). Спека — бэкенд-пакет после рефакторинга; ОБЯЗАТЕЛЕН до первой erotica-книги в проде (приёмку 蛊真人 не блокирует). Настройка «переводить L3» — отклонена владельцем 10.07.
|
||||
8. **Fix-лист полигону (пакет №4):** (а) major: матчер content-filter подстрокой + самотест на составной `'content_filter: PROHIBITED_CONTENT'` (сейчас 8/8 отказов лежат `behaviour='empty'` — латентная мина классификации); (б) major: параметризовать язык/жанр судейского промпта `explicit_judges.py` (ja/en-fidelity сняты под zh-рамкой — переснять при переиспользовании); (в) мигрировать судью `memory_eval.py` (инлайн 2.5-flash EOL 16.10 + двойной `extra_body` + нет 404-ретрая — ружьё на стене пилота); (г) U+FF70 из kana-корзины + parity-кейс с ー; (д) append-only провенанс: ретраи — отдельным файлом/superseded-полем, error-записи не удалять; (е) judge-raw без `[:600]` или оговорка; (ж) проба судьи-дублёра (п.6) + fidelity-хвост P4 (висит) + wire-аудит пре-шаг temp-свипа (D21.9) + контрольные ячейки регистра (п.5, не срочно).
|
||||
9. **Fix-лист бэкенду (в реализационный пакет D15.2, попутно):** v3.1-амендменты (п.2); CLI-тест проводки `redrive --resnapshot` (хедлайн-фикс без покрытия — мутация `_ = resnapshot` выживает); axis-тест RequestHash; негативный кейс additive_total; комментарии `models.yaml` «native Gemini для судьи 18+ — Ф2» устарели против exp11 (поправить при следующем касании); опц. smoke-тест LoadModels на боевом yaml.
|
||||
10. **Кодифицировано:** transient-прогоны в ЧУЖОЙ зоне — только в копии вне рабочего дерева (полигон гонял go test в живом backend/ при чужих незакоммиченных правках — обошлось, но впредь запрещено).
|
||||
11. **Приёмка Ф1 разблокирована полностью:** сид финализирован (白凝冰 gender=hidden, 49 записей чисто — воспроизведено ревью боевым loader'ом), цепочка D3/escalate_to заведены, деньги Gemini честны, D14.4 закрыт. Приёмочная сессия ОБЯЗАНА выставить `escalation.budget_usd>0` (иначе echo-эскалация черновика D18 не стреляет). Очередь предложена: приёмка → бэкенд-№4 (рефакторинг, промт выдан) → GPT-восхождение (промт выдан); порядок приёмка↔рефакторинг — за владельцем.
|
||||
|
||||
## Сопутствующие правки доков (оркестратор, 09.07)
|
||||
|
||||
`02-mvp-plan.md` → v3 (мёртвые пороги/интерим-18+/фазовые списки синхронизированы с D-логом); обе `*.puml` → v3 (убраны Opus/BYOK/«≤2×», дорисованы ре-гейт эскалации, три класса отказов D12, человек в петле, фазовые пометки); superseded-баннеры на `research/01, 02, 03, 04, 09`; провенанс-шапки на `research/12-architecture-as-antipattern.md` и `12-common-failures.md` (происхождение не зафиксировано — до уточнения владельцем числа оттуда не абсорбировать как факты); закрытые промты → `docs/archive/prompts/`; онбординг: корневой `CLAUDE.md` + `backend/README.md` + `eval/README.md`.
|
||||
|
|
|
|||
|
|
@ -41,7 +41,7 @@
|
|||
|
||||
**Код `backend/` (~9k строк + ~5k тестов).** Фаза 0 закрыта приёмкой на живых ключах; машинерия Фазы 1 в основном построена и **глубже буквы замысла**: чанкер v4 (sentence-pack, quote-depth, lossless-тайлинг, fuzz-тесты), ingest txt/epub с ruby-захватом и spine-reconciliation, disposition-классификатор (12 flag_reasons, refusal/echo ДО length — усечённый отказ не превращается в платный ретрай, `disposition.go:165-209`), coverage-гейт (порт Python-оракула бит-в-бит вплоть до U+001C-1F, `coverage.go:70-72`), single-hop эскалация с ре-гейтом и издержко-гардами (`runner.go:938-971`), банк памяти v2 (нормализация NFKC/trad2simp/kana/ignorables, Aho-Corasick, спойлер-hard-reject, трёхсторонний disposition, decl-aware post-check, D1-инъекция dst-констрейнтов в редактора), capability-слой с fail-fast эхо-миной DeepSeek (`models.go:288-333`), деньги с at-most-once-подходом (F3 — честно незакрытый техдолг). Клеймы журнала выборочно перепроверены кодом — **сходятся** (монолингвальный editor.md без `{{text}}`, editor-pinned структурно, C2 честно заблокирован `CheckRunnable`).
|
||||
|
||||
**Не построено** (и не заявлялось построенным): Analyst/Terminologist/Judge, механика C2 (fan-out/селекция), NSFW-классификатор 0–3, резюме/series-bible, экспорт txt/epub/TMX, HTTP API, `tmctl status`/redrive, F3-идемпотентность, batch, streaming, нативный Gemini. Конфиг отстаёт от D3 (известный лаг, помечен интеримом): нет провайдеров gemini/openai, моделей v4-pro/glm-5.1/gemini-3.1-pro, `budget_usd:0`, `permissive` не проставлен ни одному провайдеру → **канал B сейчас неконфигурируем даже формально** (`pipeline.go:246-251` fail-closed).
|
||||
**Не построено** (и не заявлялось построенным): Analyst/Terminologist/Judge, механика C2 (fan-out/селекция), NSFW-классификатор 0–3, резюме/series-bible, экспорт txt/epub/TMX, HTTP API, `tmctl status`/redrive, F3-идемпотентность, batch, streaming, нативный Gemini. Конфиг отстаёт от D3 (известный лаг, помечен интеримом): нет провайдеров gemini/openai, моделей v4-pro/glm-5.1/gemini-3.1-pro-preview, `budget_usd:0`, `permissive` не проставлен ни одному провайдеру → **канал B сейчас неконфигурируем даже формально** (`pipeline.go:246-251` fail-closed).
|
||||
|
||||
**Полигон `eval/`.** 9 экспериментов; сильнейшие — exp06 (156 health-верифицированных записей, детерминированные метрики) и exp07 (0 FP/57, Go↔Python паритет — перепроверен прогоном тестов этим ревью). Пилот-харнесс (declmetric + memory_eval) — валидный скаффолд, но не решающий инструмент (§4.5).
|
||||
|
||||
|
|
|
|||
|
|
@ -1,7 +1,5 @@
|
|||
# Промт: бэкенд-сессия — пакет №3: D15.2 v3 + fix-лист D20.4 + заводка цепочки D3 (2026-07-09)
|
||||
|
||||
Скопируй в новую сессию Claude Code в `/home/ubuntu/projects/textmachine`.
|
||||
|
||||
---
|
||||
|
||||
## Кто ты и где ты
|
||||
|
|
@ -141,7 +141,7 @@
|
|||
## 7-bis. Моно-редактор бейк-офф (F8 — доп-рука, из caveat эксп.08:92)
|
||||
|
||||
**Зачем:** эксп.04 выбрал grok-4.3 редактором, кормя его **билингвально** (исходник+черновик), но боевой редактор D1 — **моноязычный**; рейтинг grok на моноредактуре **строго не перенесён**, а слепота exp04 была структурно сломана (D13.5-сноска exp04) → выбор ПРОВИЗОРЕН. Отдельная рука — валидировать выбор редактора на РЕАЛЬНОЙ моноязычной задаче:
|
||||
- **grok-4.3 моно-редактура** (вход = только русский черновик + глоссарий-констрейнты, БЕЗ исходника) vs кандидаты (gemini-3.1-pro, gpt-5-mini, glm-5) на той же моно-задаче;
|
||||
- **grok-4.3 моно-редактура** (вход = только русский черновик + глоссарий-констрейнты, БЕЗ исходника) vs кандидаты (gemini-3.1-pro-preview, gpt-5-mini, glm-5) на той же моно-задаче;
|
||||
- крест с think-ON/OFF (§7); метрика — BWS-стиль (§4) + консистентность (§6) + верность через сверку с эталоном;
|
||||
- **вход в решение:** держится ли ранг grok-редактора при переходе билингв→моно; если нет — перевыбрать редактора Ф1.
|
||||
- **Инструмент слепоты починен:** `eval/build_editor_artifact.py` теперь рандомизирует метки ПО ФРАГМЕНТУ (соль в ключе) и пишет ключ+цену в ОТДЕЛЬНЫЙ файл (`--key`), не публикуемый до оценки.
|
||||
|
|
|
|||
|
|
@ -33,7 +33,7 @@
|
|||
|---|---|---|---|
|
||||
| deepseek-v4-flash (черновик) | **есть** (top-5) | принят | нет (никогда) |
|
||||
| grok-4.3 (редактор) | **нет** (200, поле пустое) | **отказ HTTP 400** | нет |
|
||||
| gemini-3.1-pro (премиум) | **нет** — HTTP 400 «Unknown name logprobs» | отказ 400 | нет |
|
||||
| gemini-3.1-pro-preview (премиум) | **нет** — HTTP 400 «Unknown name logprobs» | отказ 400 | нет |
|
||||
| gpt-5-mini | **нет** — **HTTP 403 «not allowed to request logprobs»** | отказ 400 | нет |
|
||||
|
||||
Читается так:
|
||||
|
|
|
|||
Loading…
Add table
Reference in a new issue