6.6 KiB
Sol-оркестратору: судейство ЯПОНСКОЙ НОГИ H-4 (проход ja6)
Ты раскладываешь готовые судейские задания по своим агентам. Ничего не готовишь сам и ничего не считаешь — всё уже собрано, задания и промты лежат файлами.
Что сделать
В каталоге /home/ubuntu/books/judging/ja6-sol/prompts лежат 5 промтов сессий:
p1-session-01.mdp1-session-02.mdp1-session-03.mdp2-session-01.mdp2-session-02.md
Запусти по одному агенту на каждый промт, 5 агентов. Каждому дай ровно одну инструкцию:
Прочитай файл
/home/ubuntu/books/judging/ja6-sol/prompts/<имя>.mdи выполни ровно то, что в нём написано, ничего сверх.
Промт внутри содержит список назначенных заданий, правила оценки и путь, куда писать ответ. Больше агенту знать ничего не нужно.
Жёсткие требования (нарушение обесценивает замер)
-
Один агент — один промт. Не объединяй сессии и не дроби их. Состав сессии — часть прибора.
-
⚠⚠ Наборы
p1иp2— РАЗНЫМ агентам, и это здесь важнее всего. Это две половины шумового пола: вp1лежит одна генерация боевого редактора, вp2— вторая генерация ТОГО ЖЕ редактора. Из разницы их оценок и строится порог различимости всего прохода. Судья, увидевший обе половины, порог обесценивает целиком — в паке 23 такой дефект занизил его на 19%, а на проходеtierполовина пола вообще совпала с боевым армом, и контроль оказался пуст. Если все задания уйдут одному агенту, замер пропадает, и пере-снять его будет нечем. -
Агент открывает ТОЛЬКО перечисленные в его промте задания и пишет ТОЛЬКО по путям, указанным ВНУТРИ заданий. Ему нельзя искать что-либо ещё на диске — ни разметку, ни сырьё, ни код, ни задания других сессий; нельзя делать сетевые вызовы; нельзя сравнивать варианты между собой, ранжировать их и применять
diff/difflib/cmp. Ключ соответствия меток и армов лежит ВНЕ рабочего каталога и агенту не выдаётся намеренно. Заглянет — сессия аннулируется целиком. -
Не правь промты и задания. Если что-то выглядит ошибкой — скажи владельцу, но не исправляй: обвязка сверена гейтом паритета с обвязкой второго семейства, и правка на твоей стороне делает семейства несравнимыми.
-
Не досуживай и не переоценивай. Не справился с частью — так и скажи, сколько выполнено. Частичный возврат честнее выдуманного и засчитывается.
-
Агент НЕ запускает своих агентов. Сессия — это ОДИН агент, читающий свои задания. Дочерние агенты ломают состав сессии, зарегистрированный до запуска; на прошлом прогоне это уже случилось, и сессию пришлось аннулировать целиком.
Что это за замер и почему спрашивают вас
Гипотеза владельца H-4: перевес deepseek-v4-pro в роли редактора — свойство пары zh→ru, и на
другой паре порядок редакторов может смениться. На японском до этой недели был куплен один
редактор, сравнивать было не с чем; теперь их два. Вопрос ровно один: меняется ли порядок.
Ваше семейство здесь полноправно: ни один арм панели не из OpenAI (deepseek-v4-pro, glm-5,
deepseek-v4-flash). На соседнем проходе tier конфликт был — там судился gpt-5.6-terra, то
есть выход вашей же семьи, и показания пришлось снять именно поэтому.
Первое семейство (агенты Claude) эту панель уже отсудило, все контроли зелёные. Вы — второе мнение о ЕГО судействе и его слепоте, а не первый свидетель.
Как считается результат
eval/.venv/bin/python eval/dovodka/ja6.py --score-sol
Тот же счётчик, которым посчитано первое семейство: сам отбракует ответы без цитат, проверит пойманный декой и напечатает число принятых единиц.
Что этот замер может и чего не может — сказано ДО прогона
Ось объявлена РАЗВЕДОЧНОЙ до денег: 9 единиц, MDE 2.90 против цели 2.00. Несущего вывода она не даст ни при каком исходе. Маржевый декой (контроль чувствительности) сажается лишь на 5 единиц из 9 — на этой книге регексы посадок находят мало мест, расширенный список проверен и не помогает. Значит право сказать «редакторы равны» подпёрто здесь слабее, чем на других осях.