textmachine/docs/prompts/done/PARALLEL_SESSION_PROMPT.md

5.3 KiB
Raw Blame History

Промт для параллельной сессии («Полигон»)

Скопируй текст ниже в новую сессию Claude Code, открытую в этом же каталоге (/home/ubuntu/projects/textmachine). Трек не пересекается с основной сессией (она делает Go-бэкенд в backend/): полигон живёт в eval/ и docs/experiments/.


Ты работаешь над проектом TextMachine — AI-перевод крупных художественных текстов (ранобэ/вебновеллы, zh/ja/en/ru) мультиагентным пайплайном. Контекст проекта: прочитай docs/README.md, docs/architecture/01-decisions.md и docs/architecture/02-mvp-plan.md (исследовательская база — docs/research/, читай по мере надобности). Основная сессия параллельно пишет Go-бэкенд в backend/его НЕ трогай.

Твоя роль — испытательный полигон: эмпирическая валидация допущений, на которых стоит архитектура. Рабочие каталоги: скрипты и утилиты — eval/ (Python), результаты и выводы — docs/experiments/NN-*.md (на русском, с методикой и цифрами), сырые данные — eval/data/ (в .gitignore, если появится git). Прогресс фиксируй в docs/PROGRESS.md (секция «Полигон»), не переписывая чужие записи.

Задачи в порядке приоритета (каждая = отдельный документ в docs/experiments/):

  1. Токен-калькулятор на реальных текстах. Возьми 35 глав реальных вебновелл/ранобэ (zh, ja, en) и их русские переводы (попроси меня подложить файлы в eval/data/samples/, либо возьми public-domain тексты для калибровки). Замерь фактическую токенизацию (tiktoken, токенизаторы DeepSeek/Qwen с HuggingFace) для входа и русского выхода. Сверь с допущениями docs/research/09-cost-model.md (zh ~0.650.75 ток./иероглиф, ru ~1.62 ток./слово) и пересчитай COGS-таблицу, если расхождение >15%.

  2. Refusal/excision-бенчмарк 18+ (черновик корпуса). Собери структуру бенчмарка из docs/research/11-gap-2.md: 50100 фрагментов по категориям (эротика zh/ja/ru, данмэй, жёсткие сцены, уровень-3-контроль который обязан отклоняться). Напиши прогонный скрипт eval/refusal_bench.py (провайдеры конфигурируются, ключи из env). Если я дам API-ключи — прогони DeepSeek/Qwen/Grok и задокументируй фактические отказы и молчаливые вырезания (сверка покрытия предложений).

  3. Локальный стенд. На моей машине GPU 8GB VRAM + 32GB RAM, ollama установлена. Проверь фактические скорости и качество кандидатов из docs/research/06-local-models.md: Qwen3.5-9B (+abliterated вариант), Qwen3.6-35B-A3B через llama.cpp --n-cpu-moe, эмбеддинги bge-m3. Замерь tok/s, VRAM/RAM, и субъективное качество ja→ru/zh→ru на 23 фрагментах против DeepSeek API. Вывод: годится ли локалка на роли скрининга/экстракции/18+.

  4. Пилотный корпус для выбора ядра пайплайна (подготовка к пилоту из Р2 01-decisions.md): отбери 2535 глав zh/ja/en→ru c приватными эталонами (я подложу лицензионные издания; GuoFeng V2 — только как dev, лицензия non-commercial). Спроектируй протокол BWS-сравнений + панель LLM-судей (методика LAIT/JP-TL-Bench из docs/research/11-gap-3.md), напиши харнесс eval/pilot/.

  5. Мини-бенчмарк эмбеддингов (bge-m3 vs Qwen3-Embedding-0.6B vs LaBSE) на задаче «найти релевантные записи глоссария/резюме для чанка» — открытый вопрос из docs/research/05-memory-glossary.md.

Правила: всё, что требует моих ключей/файлов — сначала подготовь скрипт и попроси меня; фиксируй версии моделей и даты; каждое расхождение с research-доками — отдельным разделом «Расхождение» с пингом в PROGRESS.md. Не редактируй docs/research/* и docs/architecture/* — только добавляй в docs/experiments/.