textmachine/docs/research/26-anthropic-guidance-digest.md

38 lines
9.9 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

# 26. Официальные рекомендации Anthropic — выжимка и карта применимости к проекту
**Оркестратор №15, 09.08.2026.** Веб-ресёрч по слову владельца: три агента по официальным источникам (platform.claude.com/docs · anthropic.com/engineering · Academy/Skilljar · github.com/anthropics/*), 86 рекомендаций с URL-грунтовкой; несущее внесено сюда, каждая строка несёт первоисточник. **Статус: принят D39.121** — нормы живут в промте оркестратора и CLAUDE.md, этот файл — фактура и карта применимости.
## §1. Что прямо отвечает на наш инцидент «объявила сделанным несделанное»
1. **Ground progress claims** (модельная страница Fable 5): сниппет «Before reporting progress, audit each claim against a tool result from this session. Only report work you can point to evidence for; if something is not yet verified, say so explicitly» — по замерам Anthropic «nearly eliminated fabricated status reports». → Стандартным блоком в хендофф-промты рабочих сессий. [platform.claude.com/docs/.../prompting-claude-fable-5]
2. **«Проверь последний абзац перед завершением»** — если он план/обещание, сделай работу сейчас. → Туда же. [та же страница]
3. **Состояние — структурированно, нарратив — прозой**: task/test-статусы в JSON («model is less likely to inappropriately change or overwrite JSON files compared to Markdown»); «only mark passing after careful testing». Наш инцидент случился ровно в прозе. → Реестр находок/диспозиций сессии = структурированный файл со статусом на ID; статус меняется только с уликой. [claude-4-best-practices; engineering/effective-harnesses-for-long-running-agents]
4. **Лестница гейтов завершения**: чек в промте → evaluator после каждого хода → детерминированный Stop-hook (не даёт завершиться, пока чек-скрипт не прошёл) → свежий субагент. «Правила каждый-раз-без-исключений — в хуки, не в текст». → Скрипт-чек «у каждой находки есть диспозиция» как гейт сдачи тяжёлого пака. [code.claude.com/docs/en/best-practices; курс Claude Code in Action]
5. **Obstacle reporting обязательным полем** контракта субагента («что НЕ удалось / не сделано» — required, не свободный текст). → В схемы всех панелей оркестратора. [курс Introduction to Subagents]
6. **Компакция**: инструкцией в CLAUDE.md сохранять при компакции список изменённых файлов, незакрытые находки и обязательства — авто-компакция = правдоподобный механизм потери диспозиций. [code.claude.com/docs/en/best-practices]
7. **Стартовый блок каждой следующей сессии**: «прочитай журнал + git log + прогони базовый чек ДО новой работы». [effective-harnesses]
## §2. Что мы уже делаем — независимая конвергенция (валидация, действий не требует)
«Заявление=команда» = «show evidence rather than asserting success» · author≠reviewer свежим контекстом = «fresh-context verifiers outperform self-critique» · приёмка execute-first = «grade the final state, not the path; отчёт = транскрипт, ему не верят» · пропорциональность = «simplest solution first, agents only when needed» · эхо-протокол = «golden rule: покажи промт коллеге без контекста» · онбординг-блок п.1а = «давать мотивацию инструкций» · онбординг-диета = «lean CLAUDE.md: for each line — would removing this cause mistakes?» · «один носитель на факт» = JIT-retrieval/указатели вместо копий · лестница грейдеров ($0-гейты → судья → владелец) = code→model→human · наши хендоффы = «objective + output format + tools + boundaries» из чек-листа делегирования · counts.py/хуки = «advisory text vs deterministic hooks».
## §3. Шорт-лист к перениманию (сверх §1; всё дёшево)
1. **Рамки ревьюеру против оверфлага**: «flag only gaps that affect correctness or the stated requirements, treat the rest as optional» — в панельные промты (наш D37-урок оверфлага судьи, теперь формулой). [code.claude.com best-practices]
2. **Интервальная верификация в длинных сессиях**: субагент-чек по интервалам, не только на финале. [prompting-claude-fable-5]
3. **Структура промпта судьи**: рубрика отдельно · рассуждение принудительно ДО вердикта · вердикт в выделенном машинно-извлекаемом теге — чек-лист аудита Ф2-судьи полигона. [cookbooks/building_evals]
4. **Порядок элементов ролевых промптов движка**: длинные данные (банк/сид/глоссарий) — ДО ссылающихся инструкций, задание и формат — в конец; «сначала процитируй релевантное» для длинных документов. → Аудит 10-prompt-architecture при следующем касании. [prompt-eng-interactive-tutorial гл.9; long-context tips]
5. **Запрет порчи тестов дословно**: «It is unacceptable to remove or edit tests…» — одна строка в кодовые хендоффы (сейчас запрет неявный). [effective-harnesses]
6. **«После двух неудачных поправок — не лечить, а перезапускать»** со свежим промтом, вобравшим урок; свежее окно часто лучше компакции. [best-practices; claude-4-best-practices]
7. **Evaluator-optimizer детали**: ревьюеру явный запрет «решать за автора»; трёхуровневый вердикт (PASS/NEEDS_IMPROVEMENT/FAIL) со стоп-условием; в ретрай передавать предыдущую попытку+фидбек. [cookbooks/patterns/evaluator_optimizer]
8. **Диагностика по транскриптам**: скармливать транскрипты прогонов отдельной сессии для починки промтов/харнесса (усиление author≠reviewer). [writing-tools-for-agents]
9. **Ре-аудит промтов под новые модели** (старые прескриптивные инструкции деградируют качество новых моделей); prefill assistant-хода на новейших Claude больше не поддерживается — для наших СЕССИОННЫХ промтов, движка не касается (пайплайн не на Claude). [claude-4-best-practices]
10. **Формулировки из опубликованных системных промтов claude.ai** как стилистический эталон verify-before-claim: «драфт — это НЕ выполнение действия». [platform.claude.com/docs/en/release-notes/system-prompts]
## §4. Ответ на вопрос владельца про «сайт promts md»
Отдельной живой Prompt Library у Anthropic больше НЕТ — её URL редиректят на «Prompting best practices» (проверено 09.08.2026). Живые официальные «.md-источники»: **github.com/anthropics/skills** (формат SKILL.md: YAML-шапка «когда применять» + markdown-тело — готовый образец для наших ролевых/хендофф-промтов) · вся дока платформы доступна как .md через `platform.claude.com/docs/llms.txt` (553 страницы — удобно сессиям для машинного чтения) · **github.com/anthropics/claude-cookbooks** (бывший anthropic-cookbook; паттерны агентов, evals, метапромпт) · опубликованные системные промты claude.ai.
## §5. Что НЕ перенимать
promptfoo-миграция (наш полигон глубже этой лестницы; Go-стек, свои судьи) · orchestrator-workers как код (у нас он реализован процессом оркестратор-сессия→хендоффы) · метапромпт как прод-механизм (только генератор черновиков пар-данных, строго через полигон-eval) · lock-файлы задач (нужны только при двух сессиях в ОДНОЙ зоне — у нас зонная развязка).