# 20. Роль редактора в пайплайне: что он покупает и можно ли купить это дешевле **Полигон-сессия 05.08.2026.** Продолжение эксп-19 по расширенной санкции владельца: «не понимаю, какую роль занимает редактор… если редактору приходится переписывать весь текст, то в чём смысл чернового перевода… как выстроить эксп, чтоб понять, как добьёмся максимальной эффективности и дешевизны». Зона: `eval/editor_harness/` + этот файл + пинг в `docs/PROGRESS.md`. Потолок $2.00 (поднимался дважды, оба раза объявлено ДО прогона — §1.3). > **РЕВЬЮ-ШАПКА ПРИЁМКИ (оркестратор №15, D39.108, 06.08) — ПРИНЯТ С ОГОВОРКАМИ.** Санкция пересмотра постановки и подъёмы потолка подтверждены владельцем 06.08; эксп шёл БЕЗ пре-рег-фриза (единственный из трёх) — принят как exploratory под расширенной санкцией. **Оговорки и поправки приёмки:** (1) **решающий замер §5.2 НЕ персистирован** — вердикты Claude-судьи существуют только в транскрипте сессии; таблица §5.2 и позиционная проверка 10:8 имеют статус «СО СЛОВ СЕССИИ». Направление «на боевой паре второй проход отрицателен» держит персистированный второй судья (§5.3: dp один проход 2:0 среди устойчивых, знак совпал у всех трёх моделей); величина — не держится ничем. (2) §3.1: цена раунда починки (-fix вызовы) не входила в цену `diff-harness` — с ней строка lu/ON 0.887→**1.082** (знак переворачивается), lu/OFF 1.011→1.059, gl/ON 0.858→0.909: «дифф дороже — свойство только deepseek» ослаблен до «у luna — паритет/чуть дороже». Колонка «×к full» — медиана отношений, не отношение медиан (у dp 3.54 тем способом); «правок/вызов» — ops_total с двойным счётом переподанных операций. (3) §5.5: парсер судьи молча выбросил валидный голос jx-lu-w3-d — устойчивость: верность 8/12 = 67%, полнота 3/4 = 75%, чистота 4/5 = 80%, общий 15/23 = 65%; победители (русский 10:2, общий 8:7) не двигаются. (4) ИТОГ: «вся сессия $2.1793» включает $0.107335 сырья ПРЕДЫДУЩЕЙ сессии (research/24); фактическая цена 18+19+20 = **$2.0720**. (5) §3.3: locate/repair у luna = 4.53×, не «×5»; «в 5–6 раз» относится к dp. (6) §5.6: вердикт «боевой гейт этого не поймает» ОПРОВЕРГНУТ исполнением боевого Go-кода — санитайзер (detectCJKLeak, класс вердикт-гейта D30.3, включён в c1) флагает все 6 утёкших финалов и вырезает утечку из экспорта; реальная дыра — сноска-примечание без слова-заголовка («[1] …») мимо детектора примечаний + условность тройки isFinal (строка 46). (7) §6 п.2 (пинг о банкноте): наблюдения верны, вердикт «тихо выключен» — нет: блока в боевом `translator.md` не было никогда, канал жив ратифицированным путём D39.42 п.4 (ран-локальный конфиг книги — им и собраны 56/128); реальный дефект — декларация «+банкнота» в CURRENT-STATE при shipping-конфиге без канала (строка 140). (8) §5.4 мерил разброс только dp-судьи на dp-материале в прямой ориентации — порог экстраполирован; дисперсия Claude-судьи не мерена (сам отчёт это фиксирует). **Роль редактора измерена и оказалась узкой.** В бейк-оффе «перевод с нуля против редактуры черновика» (24 пары, чужая модель-судья, зеркальная раскладка) второй проход доказанно выигрывает ОДНУ ось из шести — русскую прозу (10:2 при 80% устойчивости). Верность — ничья 4:4, общий вердикт — ничья 8:7. Это совпадает с ратифицированным замыслом D32.1(г): «ось решения для черновика — верность, не стиль; стиль редактор переписывает». ⇒ схема не сломана, но и не даёт того, что ей часто приписывают. **Цену редакторского вызова держит ПОИСК, а не правка.** Три независимых замера сходятся: арм «только найди, ничего не чини» стоит 2.14× от полного переписывания; починка по УКАЗАННОМУ месту дешевле поиска в 5–6 раз; сужение мандата режет число правок вдвое, а размышление не режет вовсе. **Точечная починка по флагу работает и стоит копейки:** 12/12 дефектов снято на обеих проверенных моделях, 7/8 восстановлено строго, по **$0.000173** за починку у `gpt-5.6-luna` — в 6 раз дешевле, чем переписать тот же кусок. Это механизм, который есть у конкурентов (AiNiee `ProofreadTask.py:250`, LinguaGacha) и которого у нас нет: `research/22:176` фиксирует «у нас НЕТ — флагаем, не чиним». **РЕШАЮЩИЙ ЗАМЕР: гипотеза «мандат в промпте заменяет второй проход» ОПРОВЕРГНУТА.** Механический показатель её обещал — один проход транслятора с дословным блоком дискурс-перевёрстки даёт ту же сборку абзацев, что связка (у `deepseek-v4-pro` 6 против 6). Но слепой суд 18 окон показал, что число абзацев было ПРОКСИ, а не качеством: русский язык 3:12 и вёрстка 5:10 в пользу связки. Позиционная проверка пройдена — предвзятости нет. ⚠ Перекрёстная проверка чужой моделью (§5.3) дала вдвое меньшую величину (русский 6:4, общий 5:4), а замер разброса судьи (§5.4) показал, что такая разница лежит ВНУТРИ его шума ⇒ перекрёстная проверка §5.2 не подтверждает и не опровергает. Крупные перевесы §5.2 кратно больше шума и устояли, но собственная дисперсия Claude-судьи НЕ мерена. **И главное — ответ ЗАВИСИТ ОТ МОДЕЛИ и переворачивается.** У `glm-5` второй проход отрабатывает как обещано (общий 5:1, вёрстка 6:0 — чистый свип). У **`deepseek-v4-pro`, который стоит редактором в `pipeline-c1.yaml` СЕЙЧАС, второй проход ВРЕДИТ**: один проход берёт общий вердикт 5:1 и верность 5:1, а обе целевые оси — ровно 3:3, то есть переписывание черновика не купило ничего и при этом ломало фактуру (сорванные шкалы процентов, потерянные реалии `蛊虫`/`家老`). ⇒ «нужен ли редактор» — не свойство архитектуры, а свойство пары «модель × роль», и на боевой паре ответ отрицательный. **Отозвано из эксп-19 дважды.** (1) Вывод «дифф дороже full-regen» сужен до одной модели И одного целевого языка: у `deepseek-v4-pro` отношение 2.83 на русской цели и **0.67 на английской** (§3.4). (2) Объяснение, которым эксп-19 снял арм E («виновато обеднённое зеркало промпта»), ОПРОВЕРГНУТО репликацией с выверенным по проводу зеркалом — эффект 6.7× сохранился. Исходная формулировка: При включённом мышлении у всех отношение дифф/full: `glm-5` 0.86 · `grok-4.3` 0.66 · `gpt-5.6-luna` 0.89 · и `deepseek-v4-pro` **2.83**. Это свойство конкретной модели, а не думающих моделей как класса, и не артефакт выключенного мышления. **⛔ ГЛАВНАЯ ОГОВОРКА, обесценивающая часть выводов ЭТОГО ЖЕ отчёта.** Разброс судьи измерен (§5.4): на ИДЕНТИЧНОМ входе три повтора единогласны лишь в 56% клеток, а на несущих осях — русский язык и общий вердикт — в **33%**. ⇒ судейская методика не разрешает разницу меньше ~2:1. Числа перекрёстной проверки (§5.3) лежат внутри этого шума и понижены до «не разрешает». Крупные перевесы §5.2 шумом не объясняются, но собственная дисперсия Claude-судьи НЕ мерена. Порядок работ был неверным: инструмент надо было померить ДО того, как им мерить. **Деньги:** эксп-20 $1.2285 при потолке $2.00; вся сессия (18+19+20) $2.1793. --- ## §1. Дизайн ### 1.1 Что было не так с эксп-19 Эксп-19 спрашивал «какая форма контракта лучше» и сравнивал дифф с full-regen. Рамка неверна по двум причинам, обе вскрыты этой сессией: 1. **Полное переписывание — это и есть ратифицированная работа редактора** (D32.1г, `research/11-gap-3.md:10`: «финальный стиль задаёт МОДЕЛЬ-РЕДАКТОР»). Дифф физически не может её делать: кальки и канцелярит — дефект РАСПРЕДЕЛЁННЫЙ, он в каждом втором предложении, и якорь на него не ставится. Спан-инструмент чинит ЛОКАЛИЗОВАННОЕ. 2. **Дифф испытывался не в том слоте.** Его место — не замена прозаического прохода, а починка того, что уже нашли детерминированные гейты. ### 1.2 Контракты (все на одном материале: 6 окон, те же черновики, тот же блок закона) | Контракт | Что делает | Промпт | |---|---|---| | `full` | переписывает черновик целиком | боевой `zh-ru/editor.md`, FEWSHOT дропнут как в проде | | `diff-strict` | точечные правки, уникальность якоря с первого раза | `editor_contract/prompts/editor-diff.md` (эксп-19) | | `diff-harness` | то же, но **с правом на ошибку и раундом починки** — копия харнеса | `prompts/editor-diff-harness.md` | | `locate` | ТОЛЬКО находит дефекты, ничего не чинит и не форматирует | `prompts/editor-locate.md` | | `direct` | переводит исходник с нуля, черновика нет | боевой `zh-ru/translator.md` | | `direct-reflow` | то же + ДОСЛОВНЫЙ блок перевёрстки из `editor.md` | `prompts/translator-reflow.md` (собран скриптом из двух боевых) | | `repair` | чинит ОДНО указанное предложение по названному типу ошибки | `prompts/repair.md` | `diff-harness` скопирован с настоящих харнесов, а не сочинён: opencode `tool/edit.txt` («Found multiple matches… provide a larger string»), gemini-cli `tools/edit.ts` + `llm-edit-fixer.ts` (отдельный дешёвый LLM чинит промахнувшийся якорь). Ключевое отличие от эксп-19 — у модели НЕТ обязанности гарантировать уникальность якоря заранее. ### 1.3 Девиации, объявленные до прогонов - Потолок поднимался дважды: $0.60 → $1.00 (добавлен арм с включённым мышлением, чтобы сравнение моделей не смешивало модель с режимом) → $2.00 (на $1.00 проекционный гард заблокировал РЕШАЮЩИЙ арм `direct-reflow`). Оба раза объявлено владельцу ДО запуска. - `translator-reflow.md` собран СКРИПТОМ из двух боевых промптов, а не написан руками — чтобы блок перевёрстки совпадал с редакторским дословно и расхождение нельзя было внести опечаткой. - Гардрейл соблюдён: у DeepSeek мышление не гасится ни при каких условиях (эхо-мина); риг на попытку падает намеренно, это проверяется самотестом. --- ## §2. Селф-ревью рига: шесть дефектов, пойманных ДО и ВО ВРЕМЯ прогонов Требование владельца — проверять код на адекватность до запуска. Поймано: | № | Дефект | Когда | Последствие, если бы прошёл | |---|---|---|---| | 1 | неверный эндпоинт `glm-5` (`open.bigmodel.cn` вместо `api.z.ai`) | до трат | прогон упал бы | | 2 | раунд починки читал `ApplyResult.details` как словари, а это список строк | до трат | главная фича арма умерла бы на первом отказе | | 3 | мой модуль `probe` затенялся одноимённым из `editor_contract` | до трат | импортировался чужой файл | | 4 | **арм `full` уехал с блоком `---FEWSHOT---`**, который в проде дропается | В ХОДЕ прогона | база сравнения была не боевым контрактом; 7 вызовов удалены и пересняты | | 5 | `nothink` выставлялся только для механизма `disable`, а grok/luna используют `effort_none` | на первом вызове | grok/luna ехали бы с ВКЛЮЧЁННЫМ мышлением под видом выключенного | | 6 | у 4 посадок из 12 эталон `fix_rx` совпадал с испорченным предложением ДО починки | до трат | бездействие модели засчиталось бы как успех | Плюс два расхождения, уравненных до прогона: user-сообщения армов `direct` и `direct-reflow` отличались одним переносом строки; метрика `reasoning_chars` СЛЕПА для OpenAI-семейства (провайдер не возвращает текст размышления, только счётчик) — для этих моделей считается `reasoning_tokens`. --- ## §3. Экономика: что именно стоит денег ### 3.1 Отношение дифф/full по моделям и режимам (медианы 6 окон) | Модель | режим | `full` | `diff-harness` | × к full | правок/вызов | |---|---|---|---|---|---| | `deepseek-v4-pro` | мышление НЕСЪЁМНО | $0.001316 | $0.004661 | **2.83** | 2.5 | | `glm-5` | OFF | $0.003837 | $0.002368 | 0.64 | 4.5 | | `glm-5` | ON | $0.028886 | $0.025068 | 0.86 | 4.8 | | `grok-4.3` | OFF | $0.004142 | $0.002445 | 0.60 | 0.5 | | `grok-4.3` | ON | $0.004185 | $0.002674 | 0.66 | 1.8 | | `gpt-5.6-luna` | OFF | $0.001122 | $0.001096 | 1.01 | 16.0 | | `gpt-5.6-luna` | ON | $0.001592 | $0.001643 | 0.89 | 9.7 | ⇒ «дифф дороже» — свойство `deepseek-v4-pro`, а не режима и не класса моделей. Побочно: `glm-5` с мышлением стоит в 7.5× больше и как редактор экономически неприемлем. ⚠ Цену за вызов нельзя сравнивать между моделями без поправки на объём работы: `grok` дёшев потому, что делает 0.5 правки на вызов (почти везде «менять нечего»), а `luna` — 16. ### 3.2 Из чего состоит выход (медианы, `deepseek-v4-pro`) | контракт | размышление, зн. | видимый текст, зн. | доля размышления | |---|---|---|---| | `full` | 2 523 | 1 838 | 58% | | `diff-strict` | 12 570 | 434 | 97% | | `diff-harness` | 12 326 | 426 | 97% | | `locate` (только найти) | 8 062 | 584 | 93% | **Копия харнеса не помогла:** 2.83 против 2.87 у строгого контракта, размышление то же. Право на ошибку и раунд починки против несъёмного мышления бессильны — раундов починки не потребовалось ни одного, якоря попадали с первого раза во всех 12 вызовах. ### 3.3 Поиск дороже починки в 5–6 раз | | `deepseek-v4-pro` | `gpt-5.6-luna` | |---|---|---| | починка по флагу | $0.000625 | **$0.000173** | | «только найти» | ×6 дороже починки | ×5 дороже | | переписать весь кусок | ×2 дороже | ×6 дороже | | дефект снят | **12/12** | **12/12** | | восстановлен строго | 7/8 | 7/8 | Обе модели чинят одинаково при разнице цены в 3.7× ⇒ на этой задаче дорогая модель не покупает ничего. ⚠ Арм меряет починку при ИДЕАЛЬНОЙ детекции; гейта на «несуществующее слово» и на смысловую инверсию у нас нет, поэтому это ВЕРХНЯЯ ГРАНИЦА схемы, а не её цена в проде. ### 3.4 АНГЛИЙСКАЯ ЦЕЛЬ: знак переворачивается от смены языка Тот же материал, те же контракты, английские черновики (`fp-draft-E*`, 0 кириллицы) и зеркала промптов, **выверенные по проводу**: системный промпт ru 3071 зн. против en 3195 (отношение 1.04), дифф 2104 против 2172 (1.03), locate 1314 против 1347 (1.03); черновики 1840 против 2068 зн. То есть конфаунд эксп-19 (обеднённое en-зеркало без блока перевёрстки) здесь устранён. | модель | цель | `full` | `diff-harness` | × к full | `locate` × к full | правок | |---|---|---|---|---|---|---| | `deepseek-v4-pro` | ru | $0.001316 | $0.004661 | **2.83** | **2.14** | 2.5 | | `deepseek-v4-pro` | **en** | $0.004356 | $0.003015 | **0.67** | **0.94** | 1.7 | | `gpt-5.6-luna` | ru | $0.001122 | $0.001096 | 1.01 | 0.72 | 16.0 | | `gpt-5.6-luna` | en | $0.000851 | $0.000616 | 0.74 | 0.66 | 9.3 | **На одной и той же модели знак переворачивается от смены целевого языка: 2.83 → 0.67.** Причина видна в проводе — размышление `deepseek-v4-pro` при переписывании: | цель | вход | выход | размышление | видимый текст | |---|---|---|---|---| | ru | 2232 ток. | 1466 ток. | 2 523 зн. | 1 838 зн. | | **en** | 1596 ток. | **4529 ток.** | **16 989 зн.** | 2 008 зн. | **⚠ САМО-ОПРОВЕРЖЕНИЕ.** Эксп-19 намерил ровно это отношение 6.7× и **списал его на обеднённое зеркало промпта** (§6.5 отчёта 19: «прорежение асимметрично именно по контрактам»). С выверенным зеркалом эффект сохранился ⇒ **та причина была неверной**. Отзыв вердикта арма E остаётся в силе (арм действительно был неконтролируем), но его ОБЪЯСНЕНИЕ опровергнуто лучше контролируемой репликацией. Правильная формулировка: `deepseek-v4-pro` тратит на редактуру в английскую цель в 6.7× больше обдумывания, чем в русскую, и это свойство пары «модель × целевой язык». **Побочно:** утечка исходника у `gpt-5.6-luna` при английской цели практически исчезает — 1 знак против 19 (`full`) и 16 (`diff`) на русской. Микро-утечка тоже язык-зависима. ⇒ Ни «дифф дороже», ни «поиск дорог» не являются свойствами контракта. Оба — свойства тройки **контракт × модель × целевой язык**, и любое обобщение через эту тройку эмпирически ложно. --- ## §4. Что редактор реально меняет в тексте | | совпало знаков с черновиком | слов дожило | абзацев было → стало | |---|---|---|---| | `full` (`deepseek-v4-pro`) | 81% | **65%** | 13 → **6** | | `full` (`glm-5`) | 89% | 83% | 13 → 8 | | `diff-harness` (обе) | 98–99% | **98%** | 13 → 12–13 | Полное переписывание меняет треть слов и вдвое схлопывает абзацы; дифф трогает 2%. Это объясняет судейский счёт по русскому языку без всякой мистики. --- ## §5. Слепое судейство ### 5.1 Методика и её исправления Первый раунд судейства был методически дефектен, и дефект найден вопросом владельца («какой смысл давать 24 агентам одно и то же, если это одна модель?»). Пакеты были разные — 24 сравнения, а не 24 повтора, — но судья один, значит систематическая ошибка общая и от числа агентов не убывает. Симптом: **позиция «А» победила 18 раз из 24**, а редактура — 12/12 в позиции А против 6/12 в Б. Исправления, внесённые во второй и третий раунды: 1. **зеркальная раскладка** — каждый пакет судится дважды, с переставленными А и Б; 2. **чужая модель-судья** (`deepseek-v4-pro` через тот же провод, что и эксперимент); 3. **раскладка расцеплена с армом** — у каждой модели свой сдвиг чётности, иначе позиция и арм коррелируют по набору (дефект первого раунда); 4. **вёрстка вынесена в отдельную ось** — раньше тонула внутри «русского языка»; 5. **чистота вывода — отдельная ось**, потому что `luna` роняет иероглифы в русский текст; 6. судьям сказано, что слияние построчных абзацев — ТРЕБОВАНИЕ, а не вольность: в первом раунде они штрафовали за исполнение мандата, которого не видели. ### 5.2 РЕШАЮЩИЙ ЗАМЕР: один проход с мандатом перевёрстки против связки (18 окон) **Гипотеза сессии ОПРОВЕРГНУТА.** Я ожидал, что мандат абзацной сборки в промпте транслятора сделает второй проход ненужным — механический показатель это обещал (у `deepseek-v4-pro` 6 абзацев против 6 у связки). Слепой суд показал обратное: **число абзацев было прокси, а не качеством**. | ось (арм-победы: 1 проход / 2 прохода / ничья) | dp | gl | lu | ВСЕГО n=18 | |---|---|---|---|---| | верность | **5**/1/0 | 1/**5**/0 | 0/**4**/2 | 6 / **10** / 2 | | русский язык | 3/3/0 | 0/**4**/2 | 0/**5**/1 | 3 / **12** / 3 | | абзацная вёрстка | 3/3/0 | 0/**6**/0 | **2**/1/3 | 5 / **10** / 3 | | глоссарий | 1/1/4 | **3**/0/3 | 0/1/5 | **4** / 2 / 12 | | **ОБЩИЙ** | **5**/1/0 | 1/**5**/0 | 1/**5**/0 | 7 / **11** / 0 | **Проверка позиции пройдена — предвзятости НЕТ.** Общий счёт по позициям 10:8 (симметричен, p≈0.8); у КАЖДОЙ из трёх моделей её победитель побеждает в обеих позициях. Это первый раунд судейства в сессии, методически чистый: расцепление раскладки с армом сработало. **Разложение по моделям переворачивает вывод для боевой конфигурации:** - **`deepseek-v4-pro` — второй проход ВРЕДИТ.** Один проход берёт общий вердикт 5:1 и верность 5:1; русский и вёрстка ровно 3:3. Переписывание черновика НЕ купило ни одной целевой оси, зато ломало фактуру: сорванные шкалы процентов (`四成八分` → «сорок восемь десятых» = 480%), потерянные реалии (`蛊虫` → «насекомых», `家老` → «Наставник»), ломаная грамматика («не хватило бы на то, как их тратил»). **Это модель, которая стоит редактором в `pipeline-c1.yaml` сейчас.** - **`glm-5` — второй проход даёт максимум и именно там, где обещал:** 5:1 общий, 4:0 русский, **6:0 вёрстка** (единственный чистый свип в наборе, обе позиции, p=0.031). Встречно один проход у glm нестабилен: в одном окне 9 непереведённых иероглифов и генеративный залипон. - **`gpt-5.6-luna` — связка берёт язык и верность, но НЕ вёрстку** (1:2 при 3 ничьих). У модели арм-НЕзависимый дефект чистоты: иероглифы в теле русского текста у ОБЕИХ версий. ⇒ **Ответ на «нужен ли редактор» зависит от модели и переворачивается.** Это не свойство архитектуры и не свойство контракта. Для `glm-5` второй проход оправдан; для `deepseek-v4-pro` он отрицателен по общему вердикту. ### 5.3 ПЕРЕКРЁСТНАЯ ПРОВЕРКА решающего арма: чужая модель + зеркальная раскладка (18 пар) Те же 18 пакетов пересужены `deepseek-v4-pro` в ДВУХ раскладках. Вердикт засчитывается только если при перестановке А/Б побеждает тот же ТЕКСТ. | ось | устойчивость | чужой судья | Claude (§5.2) | |---|---|---|---| | русский язык | 10/12 = **83%** | связка **6 : 4** | связка 12 : 3 | | общий вердикт | 9/15 = 60% | связка **5 : 4** | связка 11 : 7 | | верность | 3/7 = 43% | сигнала нет | связка 10 : 6 | **Что подтвердилось:** модель-зависимость. По общему вердикту среди устойчивых — `deepseek-v4-pro` **один проход 2:0**, `glm-5` связка 2:1, `gpt-5.6-luna` связка 3:1. Знак совпадает с Claude у всех трёх моделей, то есть вывод «на боевой паре второй проход отрицателен» держат ДВА разных судьи. **Что НЕ подтвердилось в заявленной величине:** преимущество связки по русскому языку вдвое слабее (6:4 против 12:3), общий вердикт сходится к ничьей (5:4), а верность у чужого судьи не даёт сигнала вовсе (43% устойчивости = уровень монетки). ⇒ **Корректная формулировка:** второй проход даёт преимущество по русской прозе — направление подтверждено двумя судьями, но ВЕЛИЧИНА судья-зависима и на независимом судье близка к порогу различимости. Числа §5.2 читать как верхнюю оценку, §5.3 — как нижнюю. ⚠ Чужой судья заметно шумнее: устойчивых сравнений 15 из 18 по общему вердикту против практически всех у Claude, а по глоссарию и полноте устойчивых нет вовсе (сплошные ничьи). Разброс судьи на ПОВТОРЕ одной клетки не мерен ни разу — это остаётся открытым. ### 5.4 ⛔ РАЗРЕШАЮЩАЯ СПОСОБНОСТЬ СУДЬИ: разница меньше 2:1 сигналом не является Последняя дыра методики закрыта замером, и он обесценивает ЧАСТЬ собственных выводов отчёта. Те же пакеты, та же ориентация, **три независимых голоса `deepseek-v4-pro` на идентичном входе**: | ось | клеток | единогласно | доля | |---|---|---|---| | **общий вердикт** | 6 | 2 | **33%** | | **русский язык** | 6 | 2 | **33%** | | верность | 6 | 2 | 33% | | глоссарий | 6 | 4 | 67% | | полнота | 6 | 5 | 83% | | чистота | 6 | 5 | 83% | | **ИТОГО** | 36 | 20 | **56%** | По общему вердикту судья меняет СОБСТВЕННЫЙ ответ между повторами в **4 клетках из 6** (единогласны только w2 и w3). ⇒ **Разница между армами, меньшая этого разброса, сигналом считаться не может.** **Что это отменяет:** - Числа §5.3 (чужой судья: русский 6:4, общий 5:4) лежат ВНУТРИ шума ⇒ понижаются с «подтверждает направление» до **«не разрешает»**. Перекрёстная проверка не подтвердила и не опровергла §5.2 — она оказалась слепа к разнице такого размера. - Скачок устойчивости 45% → 68% между частичными (11 пар) и полными (24 пары) данными §5.3 объясняется не малой выборкой, а нестабильностью инструмента. **Что устояло:** крупные перевесы Claude в §5.2 (русский 3:12, вёрстка gl 6:0, dp общий 5:1) кратно больше замеренного разброса, поэтому шумом не объясняются. ⚠ Но **собственная дисперсия Claude-судьи НЕ мерена** — этот замер сделан на `deepseek-v4-pro`. Переносить его на Claude без замера нельзя, и §5.2 остаётся утверждением с неизмеренной погрешностью. **Норматив на будущее (главный методический вывод сессии):** односудейный однопроходный вердикт на этой задаче — не измерение. Прежде чем сравнивать армы, надо померить разброс судьи на повторе и объявить порог различимости; всё, что меньше порога, печатать как «не разрешено», а не как результат. ### 5.5 Устойчивость вердиктов к перевороту раскладки (бейк-офф, 24 пары) | ось | устойчивость | кто выигрывает там, где устойчиво | |---|---|---| | русский язык | 80% | **редактура 10 : 2** | | верность | 73% | ничья 4 : 4 | | общий вердикт | 68% | ничья 8 : 7 | | чистота | 100% | редактура 3 : 1 | | полнота | 100% | редактура 2 : 1 | **Вывод «редактура бьёт прямой перевод 18:6» ОТОЗВАН** — у независимой модели с зеркальной раскладкой это 8:7, ничья. Уцелела одна ось: русский язык. ### 5.6 Утечка исходника в выход | модель | окон с утечкой (из 6), `full` / `diff` | ханьцзы всего, `full` / `diff` | |---|---|---| | `deepseek-v4-pro` | 0 / 0 | 0 / 0 | | `glm-5` | 0 / 1 | 0 / 2 | | `grok-4.3` | 0 / 1 | 0 / 2 | | **`gpt-5.6-luna`** | **3 / 3** | **19 / 16** | `luna` роняет иероглифы в русскую прозу в половине окон и в ОБОИХ контрактах ⇒ это свойство модели, а не контракта. Максимальная доля 0.49%. **Боевой гейт этого не поймает:** `disposition.go` держит `cjkEchoThreshold = 0.15`, то есть ловит сплошное эхо, а микро-утечка («сделать его 本命蛊») проходит насквозь. Вход для бэкенда. --- ## §6. Что это даёт архитектуре Складывается конфигурация, которую стоит проверять как целое: 1. **Один проход сильной моделью с мандатом перевёрстки** вместо двух. Абзацная сборка достигается промптом (§ИТОГ), а `exp14:239` независимо показывает, что силой модели она НЕ достигается («сильнее модель сама по себе абзацы не чинит»). 2. **Банкноты остаются на этом проходе.** У черновика два продукта, и второй — блок банкнот, WHAT-канал банка памяти: майнер находит термины в ИСХОДНИКЕ, а переводческая волна предлагает для них ПЕРЕВОДЫ (`mining.go:85`). Подтверждено по базе холодного прогона: разделитель `⟦TM-BANK-v1⟧` в **56 из 128** черновиковых ответов, у стадии терминологии — 0. ⚠ **Пинг бэкенду:** боевой `prompts/zh-ru/translator.md` блока банкнот НЕ содержит, отдельный `translator-banknote.md` ни одним конфигом не выбирается (`prompt_override` в `pipeline-c1.yaml` не задан). Похоже на тихо выключённый канал — проверить. 3. **Гейты флагают, точечная починка чинит** — за $0.0002 вместо $0.0011 за переписывание. Это и есть механизм конкурентов, которого у нас нет. **Чего эти данные НЕ позволяют утверждать.** Доля дефектов, которую гейты видят САМИ, не измерена (гейта на выдуманное слово и на смысловую инверсию нет). Разброс судьи на повторе одной клетки не мерен ни разу. Английская сторона посчитана по цене и формату, но не судилась. n=6 окон на модель. --- ## §7. Как ставить такие эксперименты (мета-вывод сессии) **0. Сначала померить ИНСТРУМЕНТ, потом им мерить.** Главный урок сессии: судья на этой задаче единогласен на идентичном входе лишь в 56% клеток и в 33% — на несущих осях (§5.4). Всё судейство трёх раундов ставилось БЕЗ этого знания, и часть выводов пришлось понизить задним числом. Порядок обязан быть обратным: замер разброса судьи → объявленный порог различимости → только потом сравнение армов. 1. **Не «инструмент А против инструмента Б», а «класс дефекта → самый дешёвый достаточный механизм»**, включая $0. Локализованные дефекты (термин, число, полярность) чинятся спаном; распределённые (кальки) — только переписыванием; механические (вёрстка) — промптом или кодом. 2. **Любое утверждение о качестве обязано пройти зеркальную раскладку и второго судью другой модели.** Односудейный замер с фиксированной раскладкой дал 18:6 там, где на деле 8:7. 3. **Ревью посылки — ДО прогона, инструментом, а не глазами.** Из шести дефектов рига четыре пойманы до трат; два оставшихся стоили пере-съёмки семи вызовов и первого прогона grok. 4. **Проверять, что параметр не только УШЁЛ на провод, но и ПОДЕЙСТВОВАЛ.** Эксп-19 проверил первое и не проверил второе — через эту дыру проехала посылка целого арма.