textmachine/docs/archive/prompts/PARALLEL_SESSION_PROMPT.md

23 lines
5.3 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

# Промт для параллельной сессии («Полигон»)
Скопируй текст ниже в новую сессию Claude Code, открытую в этом же каталоге (`/home/ubuntu/projects/textmachine`). Трек не пересекается с основной сессией (она делает Go-бэкенд в `backend/`): полигон живёт в `eval/` и `docs/experiments/`.
---
Ты работаешь над проектом TextMachine — AI-перевод крупных художественных текстов (ранобэ/вебновеллы, zh/ja/en/ru) мультиагентным пайплайном. Контекст проекта: прочитай `docs/README.md`, `docs/architecture/01-decisions.md` и `docs/architecture/02-mvp-plan.md` (исследовательская база — `docs/research/`, читай по мере надобности). Основная сессия параллельно пишет Go-бэкенд в `backend/`его НЕ трогай.
Твоя роль — **испытательный полигон**: эмпирическая валидация допущений, на которых стоит архитектура. Рабочие каталоги: скрипты и утилиты — `eval/` (Python), результаты и выводы — `docs/experiments/NN-*.md` (на русском, с методикой и цифрами), сырые данные — `eval/data/` (в .gitignore, если появится git). Прогресс фиксируй в `docs/PROGRESS.md` (секция «Полигон»), не переписывая чужие записи.
Задачи в порядке приоритета (каждая = отдельный документ в docs/experiments/):
1. **Токен-калькулятор на реальных текстах.** Возьми 35 глав реальных вебновелл/ранобэ (zh, ja, en) и их русские переводы (попроси меня подложить файлы в `eval/data/samples/`, либо возьми public-domain тексты для калибровки). Замерь фактическую токенизацию (tiktoken, токенизаторы DeepSeek/Qwen с HuggingFace) для входа и русского выхода. Сверь с допущениями `docs/research/09-cost-model.md` (zh ~0.650.75 ток./иероглиф, ru ~1.62 ток./слово) и пересчитай COGS-таблицу, если расхождение >15%.
2. **Refusal/excision-бенчмарк 18+ (черновик корпуса).** Собери структуру бенчмарка из `docs/research/11-gap-2.md`: 50100 фрагментов по категориям (эротика zh/ja/ru, данмэй, жёсткие сцены, уровень-3-контроль который обязан отклоняться). Напиши прогонный скрипт `eval/refusal_bench.py` (провайдеры конфигурируются, ключи из env). Если я дам API-ключи — прогони DeepSeek/Qwen/Grok и задокументируй фактические отказы и молчаливые вырезания (сверка покрытия предложений).
3. **Локальный стенд.** На моей машине GPU 8GB VRAM + 32GB RAM, ollama установлена. Проверь фактические скорости и качество кандидатов из `docs/research/06-local-models.md`: Qwen3.5-9B (+abliterated вариант), Qwen3.6-35B-A3B через llama.cpp `--n-cpu-moe`, эмбеддинги bge-m3. Замерь tok/s, VRAM/RAM, и субъективное качество ja→ru/zh→ru на 23 фрагментах против DeepSeek API. Вывод: годится ли локалка на роли скрининга/экстракции/18+.
4. **Пилотный корпус для выбора ядра пайплайна** (подготовка к пилоту из Р2 `01-decisions.md`): отбери 2535 глав zh/ja/en→ru c приватными эталонами (я подложу лицензионные издания; GuoFeng V2 — только как dev, лицензия non-commercial). Спроектируй протокол BWS-сравнений + панель LLM-судей (методика LAIT/JP-TL-Bench из `docs/research/11-gap-3.md`), напиши харнесс `eval/pilot/`.
5. **Мини-бенчмарк эмбеддингов** (bge-m3 vs Qwen3-Embedding-0.6B vs LaBSE) на задаче «найти релевантные записи глоссария/резюме для чанка» — открытый вопрос из `docs/research/05-memory-glossary.md`.
Правила: всё, что требует моих ключей/файлов — сначала подготовь скрипт и попроси меня; фиксируй версии моделей и даты; каждое расхождение с research-доками — отдельным разделом «Расхождение» с пингом в PROGRESS.md. Не редактируй `docs/research/*` и `docs/architecture/*` — только добавляй в `docs/experiments/`.