5.3 KiB
Промт для параллельной сессии («Полигон»)
Скопируй текст ниже в новую сессию Claude Code, открытую в этом же каталоге (/home/ubuntu/projects/textmachine). Трек не пересекается с основной сессией (она делает Go-бэкенд в backend/): полигон живёт в eval/ и docs/experiments/.
Ты работаешь над проектом TextMachine — AI-перевод крупных художественных текстов (ранобэ/вебновеллы, zh/ja/en/ru) мультиагентным пайплайном. Контекст проекта: прочитай docs/README.md, docs/architecture/01-decisions.md и docs/architecture/02-mvp-plan.md (исследовательская база — docs/research/, читай по мере надобности). Основная сессия параллельно пишет Go-бэкенд в backend/ — его НЕ трогай.
Твоя роль — испытательный полигон: эмпирическая валидация допущений, на которых стоит архитектура. Рабочие каталоги: скрипты и утилиты — eval/ (Python), результаты и выводы — docs/experiments/NN-*.md (на русском, с методикой и цифрами), сырые данные — eval/data/ (в .gitignore, если появится git). Прогресс фиксируй в docs/PROGRESS.md (секция «Полигон»), не переписывая чужие записи.
Задачи в порядке приоритета (каждая = отдельный документ в docs/experiments/):
-
Токен-калькулятор на реальных текстах. Возьми 3–5 глав реальных вебновелл/ранобэ (zh, ja, en) и их русские переводы (попроси меня подложить файлы в
eval/data/samples/, либо возьми public-domain тексты для калибровки). Замерь фактическую токенизацию (tiktoken, токенизаторы DeepSeek/Qwen с HuggingFace) для входа и русского выхода. Сверь с допущениямиdocs/research/09-cost-model.md(zh ~0.65–0.75 ток./иероглиф, ru ~1.6–2 ток./слово) и пересчитай COGS-таблицу, если расхождение >15%. -
Refusal/excision-бенчмарк 18+ (черновик корпуса). Собери структуру бенчмарка из
docs/research/11-gap-2.md: 50–100 фрагментов по категориям (эротика zh/ja/ru, данмэй, жёсткие сцены, уровень-3-контроль который обязан отклоняться). Напиши прогонный скриптeval/refusal_bench.py(провайдеры конфигурируются, ключи из env). Если я дам API-ключи — прогони DeepSeek/Qwen/Grok и задокументируй фактические отказы и молчаливые вырезания (сверка покрытия предложений). -
Локальный стенд. На моей машине GPU 8GB VRAM + 32GB RAM, ollama установлена. Проверь фактические скорости и качество кандидатов из
docs/research/06-local-models.md: Qwen3.5-9B (+abliterated вариант), Qwen3.6-35B-A3B через llama.cpp--n-cpu-moe, эмбеддинги bge-m3. Замерь tok/s, VRAM/RAM, и субъективное качество ja→ru/zh→ru на 2–3 фрагментах против DeepSeek API. Вывод: годится ли локалка на роли скрининга/экстракции/18+. -
Пилотный корпус для выбора ядра пайплайна (подготовка к пилоту из Р2
01-decisions.md): отбери 25–35 глав zh/ja/en→ru c приватными эталонами (я подложу лицензионные издания; GuoFeng V2 — только как dev, лицензия non-commercial). Спроектируй протокол BWS-сравнений + панель LLM-судей (методика LAIT/JP-TL-Bench изdocs/research/11-gap-3.md), напиши харнессeval/pilot/. -
Мини-бенчмарк эмбеддингов (bge-m3 vs Qwen3-Embedding-0.6B vs LaBSE) на задаче «найти релевантные записи глоссария/резюме для чанка» — открытый вопрос из
docs/research/05-memory-glossary.md.
Правила: всё, что требует моих ключей/файлов — сначала подготовь скрипт и попроси меня; фиксируй версии моделей и даты; каждое расхождение с research-доками — отдельным разделом «Расхождение» с пингом в PROGRESS.md. Не редактируй docs/research/* и docs/architecture/* — только добавляй в docs/experiments/.