textmachine/docs/research/26-anthropic-guidance-digest.md

9.9 KiB
Raw Blame History

26. Официальные рекомендации Anthropic — выжимка и карта применимости к проекту

Оркестратор №15, 09.08.2026. Веб-ресёрч по слову владельца: три агента по официальным источникам (platform.claude.com/docs · anthropic.com/engineering · Academy/Skilljar · github.com/anthropics/*), 86 рекомендаций с URL-грунтовкой; несущее внесено сюда, каждая строка несёт первоисточник. Статус: принят D39.121 — нормы живут в промте оркестратора и CLAUDE.md, этот файл — фактура и карта применимости.

§1. Что прямо отвечает на наш инцидент «объявила сделанным несделанное»

  1. Ground progress claims (модельная страница Fable 5): сниппет «Before reporting progress, audit each claim against a tool result from this session. Only report work you can point to evidence for; if something is not yet verified, say so explicitly» — по замерам Anthropic «nearly eliminated fabricated status reports». → Стандартным блоком в хендофф-промты рабочих сессий. [platform.claude.com/docs/.../prompting-claude-fable-5]
  2. «Проверь последний абзац перед завершением» — если он план/обещание, сделай работу сейчас. → Туда же. [та же страница]
  3. Состояние — структурированно, нарратив — прозой: task/test-статусы в JSON («model is less likely to inappropriately change or overwrite JSON files compared to Markdown»); «only mark passing after careful testing». Наш инцидент случился ровно в прозе. → Реестр находок/диспозиций сессии = структурированный файл со статусом на ID; статус меняется только с уликой. [claude-4-best-practices; engineering/effective-harnesses-for-long-running-agents]
  4. Лестница гейтов завершения: чек в промте → evaluator после каждого хода → детерминированный Stop-hook (не даёт завершиться, пока чек-скрипт не прошёл) → свежий субагент. «Правила каждый-раз-без-исключений — в хуки, не в текст». → Скрипт-чек «у каждой находки есть диспозиция» как гейт сдачи тяжёлого пака. [code.claude.com/docs/en/best-practices; курс Claude Code in Action]
  5. Obstacle reporting обязательным полем контракта субагента («что НЕ удалось / не сделано» — required, не свободный текст). → В схемы всех панелей оркестратора. [курс Introduction to Subagents]
  6. Компакция: инструкцией в CLAUDE.md сохранять при компакции список изменённых файлов, незакрытые находки и обязательства — авто-компакция = правдоподобный механизм потери диспозиций. [code.claude.com/docs/en/best-practices]
  7. Стартовый блок каждой следующей сессии: «прочитай журнал + git log + прогони базовый чек ДО новой работы». [effective-harnesses]

§2. Что мы уже делаем — независимая конвергенция (валидация, действий не требует)

«Заявление=команда» = «show evidence rather than asserting success» · author≠reviewer свежим контекстом = «fresh-context verifiers outperform self-critique» · приёмка execute-first = «grade the final state, not the path; отчёт = транскрипт, ему не верят» · пропорциональность = «simplest solution first, agents only when needed» · эхо-протокол = «golden rule: покажи промт коллеге без контекста» · онбординг-блок п.1а = «давать мотивацию инструкций» · онбординг-диета = «lean CLAUDE.md: for each line — would removing this cause mistakes?» · «один носитель на факт» = JIT-retrieval/указатели вместо копий · лестница грейдеров ($0-гейты → судья → владелец) = code→model→human · наши хендоффы = «objective + output format + tools + boundaries» из чек-листа делегирования · counts.py/хуки = «advisory text vs deterministic hooks».

§3. Шорт-лист к перениманию (сверх §1; всё дёшево)

  1. Рамки ревьюеру против оверфлага: «flag only gaps that affect correctness or the stated requirements, treat the rest as optional» — в панельные промты (наш D37-урок оверфлага судьи, теперь формулой). [code.claude.com best-practices]
  2. Интервальная верификация в длинных сессиях: субагент-чек по интервалам, не только на финале. [prompting-claude-fable-5]
  3. Структура промпта судьи: рубрика отдельно · рассуждение принудительно ДО вердикта · вердикт в выделенном машинно-извлекаемом теге — чек-лист аудита Ф2-судьи полигона. [cookbooks/building_evals]
  4. Порядок элементов ролевых промптов движка: длинные данные (банк/сид/глоссарий) — ДО ссылающихся инструкций, задание и формат — в конец; «сначала процитируй релевантное» для длинных документов. → Аудит 10-prompt-architecture при следующем касании. [prompt-eng-interactive-tutorial гл.9; long-context tips]
  5. Запрет порчи тестов дословно: «It is unacceptable to remove or edit tests…» — одна строка в кодовые хендоффы (сейчас запрет неявный). [effective-harnesses]
  6. «После двух неудачных поправок — не лечить, а перезапускать» со свежим промтом, вобравшим урок; свежее окно часто лучше компакции. [best-practices; claude-4-best-practices]
  7. Evaluator-optimizer детали: ревьюеру явный запрет «решать за автора»; трёхуровневый вердикт (PASS/NEEDS_IMPROVEMENT/FAIL) со стоп-условием; в ретрай передавать предыдущую попытку+фидбек. [cookbooks/patterns/evaluator_optimizer]
  8. Диагностика по транскриптам: скармливать транскрипты прогонов отдельной сессии для починки промтов/харнесса (усиление author≠reviewer). [writing-tools-for-agents]
  9. Ре-аудит промтов под новые модели (старые прескриптивные инструкции деградируют качество новых моделей); prefill assistant-хода на новейших Claude больше не поддерживается — для наших СЕССИОННЫХ промтов, движка не касается (пайплайн не на Claude). [claude-4-best-practices]
  10. Формулировки из опубликованных системных промтов claude.ai как стилистический эталон verify-before-claim: «драфт — это НЕ выполнение действия». [platform.claude.com/docs/en/release-notes/system-prompts]

§4. Ответ на вопрос владельца про «сайт promts md»

Отдельной живой Prompt Library у Anthropic больше НЕТ — её URL редиректят на «Prompting best practices» (проверено 09.08.2026). Живые официальные «.md-источники»: github.com/anthropics/skills (формат SKILL.md: YAML-шапка «когда применять» + markdown-тело — готовый образец для наших ролевых/хендофф-промтов) · вся дока платформы доступна как .md через platform.claude.com/docs/llms.txt (553 страницы — удобно сессиям для машинного чтения) · github.com/anthropics/claude-cookbooks (бывший anthropic-cookbook; паттерны агентов, evals, метапромпт) · опубликованные системные промты claude.ai.

§5. Что НЕ перенимать

promptfoo-миграция (наш полигон глубже этой лестницы; Go-стек, свои судьи) · orchestrator-workers как код (у нас он реализован процессом оркестратор-сессия→хендоффы) · метапромпт как прод-механизм (только генератор черновиков пар-данных, строго через полигон-eval) · lock-файлы задач (нужны только при двух сессиях в ОДНОЙ зоне — у нас зонная развязка).