books/judging/ja6-sol/ORCHESTRATOR.md
2026-08-20 03:54:54 +03:00

6.6 KiB
Raw Permalink Blame History

Sol-оркестратору: судейство ЯПОНСКОЙ НОГИ H-4 (проход ja6)

Ты раскладываешь готовые судейские задания по своим агентам. Ничего не готовишь сам и ничего не считаешь — всё уже собрано, задания и промты лежат файлами.

Что сделать

В каталоге /home/ubuntu/books/judging/ja6-sol/prompts лежат 5 промтов сессий:

  • p1-session-01.md
  • p1-session-02.md
  • p1-session-03.md
  • p2-session-01.md
  • p2-session-02.md

Запусти по одному агенту на каждый промт, 5 агентов. Каждому дай ровно одну инструкцию:

Прочитай файл /home/ubuntu/books/judging/ja6-sol/prompts/<имя>.md и выполни ровно то, что в нём написано, ничего сверх.

Промт внутри содержит список назначенных заданий, правила оценки и путь, куда писать ответ. Больше агенту знать ничего не нужно.

Жёсткие требования (нарушение обесценивает замер)

  1. Один агент — один промт. Не объединяй сессии и не дроби их. Состав сессии — часть прибора.

  2. ⚠⚠ Наборы p1 и p2 — РАЗНЫМ агентам, и это здесь важнее всего. Это две половины шумового пола: в p1 лежит одна генерация боевого редактора, в p2 — вторая генерация ТОГО ЖЕ редактора. Из разницы их оценок и строится порог различимости всего прохода. Судья, увидевший обе половины, порог обесценивает целиком — в паке 23 такой дефект занизил его на 19%, а на проходе tier половина пола вообще совпала с боевым армом, и контроль оказался пуст. Если все задания уйдут одному агенту, замер пропадает, и пере-снять его будет нечем.

  3. Агент открывает ТОЛЬКО перечисленные в его промте задания и пишет ТОЛЬКО по путям, указанным ВНУТРИ заданий. Ему нельзя искать что-либо ещё на диске — ни разметку, ни сырьё, ни код, ни задания других сессий; нельзя делать сетевые вызовы; нельзя сравнивать варианты между собой, ранжировать их и применять diff/difflib/cmp. Ключ соответствия меток и армов лежит ВНЕ рабочего каталога и агенту не выдаётся намеренно. Заглянет — сессия аннулируется целиком.

  4. Не правь промты и задания. Если что-то выглядит ошибкой — скажи владельцу, но не исправляй: обвязка сверена гейтом паритета с обвязкой второго семейства, и правка на твоей стороне делает семейства несравнимыми.

  5. Не досуживай и не переоценивай. Не справился с частью — так и скажи, сколько выполнено. Частичный возврат честнее выдуманного и засчитывается.

  6. Агент НЕ запускает своих агентов. Сессия — это ОДИН агент, читающий свои задания. Дочерние агенты ломают состав сессии, зарегистрированный до запуска; на прошлом прогоне это уже случилось, и сессию пришлось аннулировать целиком.

Что это за замер и почему спрашивают вас

Гипотеза владельца H-4: перевес deepseek-v4-pro в роли редактора — свойство пары zh→ru, и на другой паре порядок редакторов может смениться. На японском до этой недели был куплен один редактор, сравнивать было не с чем; теперь их два. Вопрос ровно один: меняется ли порядок.

Ваше семейство здесь полноправно: ни один арм панели не из OpenAI (deepseek-v4-pro, glm-5, deepseek-v4-flash). На соседнем проходе tier конфликт был — там судился gpt-5.6-terra, то есть выход вашей же семьи, и показания пришлось снять именно поэтому.

Первое семейство (агенты Claude) эту панель уже отсудило, все контроли зелёные. Вы — второе мнение о ЕГО судействе и его слепоте, а не первый свидетель.

Как считается результат

eval/.venv/bin/python eval/dovodka/ja6.py --score-sol

Тот же счётчик, которым посчитано первое семейство: сам отбракует ответы без цитат, проверит пойманный декой и напечатает число принятых единиц.

Что этот замер может и чего не может — сказано ДО прогона

Ось объявлена РАЗВЕДОЧНОЙ до денег: 9 единиц, MDE 2.90 против цели 2.00. Несущего вывода она не даст ни при каком исходе. Маржевый декой (контроль чувствительности) сажается лишь на 5 единиц из 9 — на этой книге регексы посадок находят мало мест, расширенный список проверен и не помогает. Значит право сказать «редакторы равны» подпёрто здесь слабее, чем на других осях.