23 lines
5.3 KiB
Markdown
23 lines
5.3 KiB
Markdown
# Промт для параллельной сессии («Полигон»)
|
||
|
||
Скопируй текст ниже в новую сессию Claude Code, открытую в этом же каталоге (`/home/ubuntu/projects/textmachine`). Трек не пересекается с основной сессией (она делает Go-бэкенд в `backend/`): полигон живёт в `eval/` и `docs/experiments/`.
|
||
|
||
---
|
||
|
||
Ты работаешь над проектом TextMachine — AI-перевод крупных художественных текстов (ранобэ/вебновеллы, zh/ja/en/ru) мультиагентным пайплайном. Контекст проекта: прочитай `docs/README.md`, `docs/architecture/01-decisions.md` и `docs/architecture/02-mvp-plan.md` (исследовательская база — `docs/research/`, читай по мере надобности). Основная сессия параллельно пишет Go-бэкенд в `backend/` — его НЕ трогай.
|
||
|
||
Твоя роль — **испытательный полигон**: эмпирическая валидация допущений, на которых стоит архитектура. Рабочие каталоги: скрипты и утилиты — `eval/` (Python), результаты и выводы — `docs/experiments/NN-*.md` (на русском, с методикой и цифрами), сырые данные — `eval/data/` (в .gitignore, если появится git). Прогресс фиксируй в `docs/PROGRESS.md` (секция «Полигон»), не переписывая чужие записи.
|
||
|
||
Задачи в порядке приоритета (каждая = отдельный документ в docs/experiments/):
|
||
|
||
1. **Токен-калькулятор на реальных текстах.** Возьми 3–5 глав реальных вебновелл/ранобэ (zh, ja, en) и их русские переводы (попроси меня подложить файлы в `eval/data/samples/`, либо возьми public-domain тексты для калибровки). Замерь фактическую токенизацию (tiktoken, токенизаторы DeepSeek/Qwen с HuggingFace) для входа и русского выхода. Сверь с допущениями `docs/research/09-cost-model.md` (zh ~0.65–0.75 ток./иероглиф, ru ~1.6–2 ток./слово) и пересчитай COGS-таблицу, если расхождение >15%.
|
||
|
||
2. **Refusal/excision-бенчмарк 18+ (черновик корпуса).** Собери структуру бенчмарка из `docs/research/11-gap-2.md`: 50–100 фрагментов по категориям (эротика zh/ja/ru, данмэй, жёсткие сцены, уровень-3-контроль который обязан отклоняться). Напиши прогонный скрипт `eval/refusal_bench.py` (провайдеры конфигурируются, ключи из env). Если я дам API-ключи — прогони DeepSeek/Qwen/Grok и задокументируй фактические отказы и молчаливые вырезания (сверка покрытия предложений).
|
||
|
||
3. **Локальный стенд.** На моей машине GPU 8GB VRAM + 32GB RAM, ollama установлена. Проверь фактические скорости и качество кандидатов из `docs/research/06-local-models.md`: Qwen3.5-9B (+abliterated вариант), Qwen3.6-35B-A3B через llama.cpp `--n-cpu-moe`, эмбеддинги bge-m3. Замерь tok/s, VRAM/RAM, и субъективное качество ja→ru/zh→ru на 2–3 фрагментах против DeepSeek API. Вывод: годится ли локалка на роли скрининга/экстракции/18+.
|
||
|
||
4. **Пилотный корпус для выбора ядра пайплайна** (подготовка к пилоту из Р2 `01-decisions.md`): отбери 25–35 глав zh/ja/en→ru c приватными эталонами (я подложу лицензионные издания; GuoFeng V2 — только как dev, лицензия non-commercial). Спроектируй протокол BWS-сравнений + панель LLM-судей (методика LAIT/JP-TL-Bench из `docs/research/11-gap-3.md`), напиши харнесс `eval/pilot/`.
|
||
|
||
5. **Мини-бенчмарк эмбеддингов** (bge-m3 vs Qwen3-Embedding-0.6B vs LaBSE) на задаче «найти релевантные записи глоссария/резюме для чанка» — открытый вопрос из `docs/research/05-memory-glossary.md`.
|
||
|
||
Правила: всё, что требует моих ключей/файлов — сначала подготовь скрипт и попроси меня; фиксируй версии моделей и даты; каждое расхождение с research-доками — отдельным разделом «Расхождение» с пингом в PROGRESS.md. Не редактируй `docs/research/*` и `docs/architecture/*` — только добавляй в `docs/experiments/`.
|