textmachine/docs/experiments/18-editor-wire-probe.md

629 lines
66 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

# 18. Редакторский провод под доктриной закона (D39.104) + фронтир-пасс по голду
**Полигон-сессия 04.08.2026.** Исполнение `docs/POLYGON_EDITOR_WIRE_PROBE_SESSION_PROMPT.md`
(оркестратор №13, санкции владельца D39.103/104). Зона: `eval/bank_arbitration/` + этот файл + пинг
в PROGRESS «Полигон». Сырьё durable `~/books/gu-zhenren/bank-arbitration/`, префикс `edp-*`.
Не закоммичено, кроме пре-рег-фриза (CLAUDE.md, единственное исключение полигона).
Потолки: проба A ≤ $0.30, проба C ≤ $0.50.
> **РЕВЬЮ-ШАПКА ПРИЁМКИ (оркестратор №15, D39.108, 06.08) — ПРИНЯТ.** Слепой вердикт по сырью ДО чтения отчёта совпал по всем 7 пре-рег-критериям; числа §A/§C воспроизведены офлайн-ре-раном и независимым парсером. Фризы предшествуют платным вызовам (080c15d за 46 с; 52e12f3 за 21 с; 4d1d9e5 за 49 мин — его amend 01:58Z разобран: пре-рег-текст не трогал, содержал объявленную девиацию арма E и premise_review-харнесс). **Поправки приёмки к телу:** (1) §C.1 «максимум фактического вывода по всем 15 вызовам — 1092 ток.» неверно: 1092 — максимум только terra; fdp-b0 = 2717 (вывод «упоров в cap нет» держится); (2) glm2 $/книга прямым счётом $2.58, не $2.60; (3) строка леджера «ВСЕГО $0.174390» не включает статьи, названные самим отчётом (glm2 $0.081326 · эффорт-проба $0.044163) — полное сырьё сессии по статьям ИТОГа = $0.299879; (4) числа «канон вне блока» (§0.1 экспа 19: 44%, A1 24/41) сняты до-фризовым стемом — замороженный скорер даёт 39% (16/41) и 22/41, новый стем прав по голду; (5) дубль-абзац §A.4 и двойная нумерация §C.4 исправлены оркестратором (второй раздел перенумерован в §C.5).
## ИТОГ (для оркестратора; детали — ниже по разделам)
**Проба A — доктрина D39.104 на боевом проводе.** Провод пробы доказан байт-в-байт против движка
(sha256 всех трёх сообщений против реальных `SystemFor`/`MessagesWithInjection`/
`RenderEditorConstraintBlock`). Единый закон-блок исполняется **21/21** клеток; неверная строка
банка принимается **6/6** и вытесняет верную **5/6** — то есть редактор ошибку банка не ловит, а
разносит. **Редактор БЕЗ блока сам ломает 512 из 20 канонических клеток черновика** ⇒ инъекция
редактору нужна не «на всякий случай», а как несущая защита. Термы, инъецированные как закон,
сверены с подписанным владельцем голдом: **0 расхождений из 8**.
**Проба C — фронтир на роли терминолога НЕ ОПРАВДАН** по пре-регистрированному критерию (нужно
было +5 клеток, получено 7…9 строго и ±0 под фолдом конвенции). Числа воспроизведены независимым
парсером. Ключевая находка не в вердикте, а в причине: **7 из 9 «промахов» фронтира — не ум, а
орфографическая конвенция** `古月` («Гу Юэ» против «Гуюэ»), которая стоит 8/45 голда и перекрывает
разницу между всеми проверенными моделями. **Рычаг этой роли — данные, а не модель.**
**Дозамер §C.5 (05.08):** гипотеза «чемпион `glm-5` был искалечен выключенным мышлением»
ОПРОВЕРГНУТА — с мышлением **24/45 против 25/45** при цене в 4,4× выше. Ограничение №5 снято;
следствие шире вердикта: **на роли терминолога размышление не конвертируется в качество ни у одной
проверенной модели** (`terra` при 11× цены `luna` покупает 0 клеток).
**Вход для решения владельца:** `gpt-5.6-luna` держит качество `glm-5` за 39% цены ($0.23 против
$0.59 за книгу) — кандидат в замену терминолога, если владелец захочет тронуть роль; паритет
измерен против ЛУЧШЕГО из двух режимов чемпиона. Не решение сессии.
**Деньги:** проба A $0.070293 · проба C $0.104097 · эффорт-проба $0.044163 · контроль `glm2`
$0.081326. Потолки не пробиты.
---
## §0. ПРЕ-РЕГИСТРАЦИЯ (записано ДО первого платного вызова этой сессии; норма D39.46/D39.61)
Дата фиксации: 2026-08-04, до любых платных вызовов. Всё ниже — фриз; расхождение исполнения с
этим текстом печатается как девиация с обоснованием.
### 0.1 Провод пробы A (byte-faithful edit-стадии `pipeline-c1.yaml`)
| Поле | Значение | Провенанс |
|---|---|---|
| модель | `deepseek-v4-pro` | `pipeline-c1.yaml` stages[edit].model (ИНТЕРИМ D39.22) |
| промпт | `backend/prompts/zh-ru/editor.md`, блок `---FEWSHOT---` ДРОПНУТ | stages[edit].few_shot: false |
| temperature | `0.4` (шлётся; thinking-режим её молча игнорирует — quirks 00) | stages[edit].temperature |
| reasoning | параметр **НЕ шлётся вовсе** ⇒ вендор-дефолт `high` | deepseek = `ReasoningNone` (`llm/capability.go:177-180`), stages[edit].reasoning:"off" ⇒ ключа на проводе нет; quirks 00 §3а |
| max_tokens | `16000` | `models.yaml:166` capabilities.min_max_tokens (флор v4-pro) |
| раскладка | `system(editor.md core)``system(банк-блок)``user(text+draft)` | `render.go` MessagesWithInjection |
| формат строк блока | `- src → «dst»` | `membank/memory.go:815` editorLines |
**Байт-сверка провода — исполнением, ДО платных вызовов.** Overlay-тест (`go test -overlay`, файлы
живут в скрэтчпаде, в `backend/` не пишутся) прогнал РЕАЛЬНЫЕ `LoadPromptTemplate`+`SystemFor(false)`+
`MessagesWithInjection` и `RenderEditorConstraintBlock` на окне w3 и напечатал sha256 каждого
сообщения. Совпадение с Python-харнессом побайтное:
```
Go WPMSG 0 role=system sha=cef8aba86410f996ab4624f6839f2acbf98a31ededa6a12a8070c03abb739645
Py PYMSG 0 role=system sha=cef8aba86410f996ab4624f6839f2acbf98a31ededa6a12a8070c03abb739645
Go WPMSG 1 role=system sha=775604eddb3346c0b566ff01d0affd7b222d00fd37684afa9104639ae83e107d
Py PYMSG 1 role=system sha=775604eddb3346c0b566ff01d0affd7b222d00fd37684afa9104639ae83e107d
Go WPMSG 2 role=user sha=547d516465c885890438b4e001c8d6d6a7c48641ce28701b6b6385bad66940fa
Py PYMSG 2 role=user sha=547d516465c885890438b4e001c8d6d6a7c48641ce28701b6b6385bad66940fa
Go WPBLOCK sha=775604eddb3346c0b566ff01d0affd7b222d00fd37684afa9104639ae83e107d (RenderEditorConstraintBlock, текущий editor_header)
```
Сверялся блок с ДЕЙСТВУЮЩИМ `editor_header`; кандидат-заголовок §B отличается от него ровно
вставкой оговорки (ниже дословно), строки блока не трогает.
### 0.2 Окна и черновики
Те же 6 окон источника, что `inject_probe.py` (`pick_windows()`, детерминирован, `coldrun-a` только
чтение): w0@para534 · w1@para709 · w2@para488 · w3@para372 · w4@para101 · w5@para274.
Черновики — **арм B того же сырья** (`inj-w{k}-B.json`, транслятор под ВЕРНЫМ законом, $0, уже
персистированы, все `finish=stop`): канон-конформный черновик = сильнейший тест вытеснения.
### 0.3 Заголовки (кандидат-редакции §B промта; в движок НЕ вносятся)
База — действующий `editor_header` (`backend/internal/lang/data/injection.txt` строка 7), дословно.
**Единый закон-блок с оговоркой области** (армы A1, A2, AM-clause):
> КАНОНИЧЕСКИЕ ПЕРЕВОДЫ имён и терминов (в черновике термин исходника слева ДОЛЖЕН быть передан именно указанной формой справа — приводи к ней любые расхождения, склоняя по контексту; не вводи иных вариантов и не меняй ничего другого; глоссарий обязателен для употреблений термина КАК термина: игру слов, разбор знаков, буквальное прочтение передавай по смыслу пассажа, сохраняя узнаваемость канонической формы):
**Закон БЕЗ оговорки** (арм AM-noclause) = действующий `editor_header` без единой правки:
> КАНОНИЧЕСКИЕ ПЕРЕВОДЫ имён и терминов (в черновике термин исходника слева ДОЛЖЕН быть передан именно указанной формой справа — приводи к ней любые расхождения, склоняя по контексту; не вводи иных вариантов и не меняй ничего другого):
Секция `editor_unverified_header` НЕ рендерится (двухсекционка сворачивается в одну — §B промта);
маркер `⟨проверить⟩` на проводе НЕ рендерится (поведенчески пуст, research/24 §C).
### 0.4 Армы (26 платных вызовов v4-pro + 1 транслятор-вызов на черновик AM)
| Арм | Вызовов | Блок | Что мерит |
|---|---|---|---|
| **A0** | 6 | нет | изолированный контроль (его не было НИКОГДА) |
| **A1** | 6 | закон+оговорка, все строки ВЕРНЫЕ | исполнение закона на редакторе |
| **A2** | 6 | закон+оговорка, строка `元海 → «Юаньхай»` НЕВЕРНАЯ | цена неверного закона + межоконная консистентность |
| **AM** | 2 | закон+оговорка / закон без оговорки | работает ли оговорка области и не течёт ли |
| **A5** | 6 | нет | чинит ли редактор дефекты черновика |
**Девиация от дизайна §C (обоснованная):** research/24 §C РОТИРОВАЛ неверный терм по окнам. Здесь
неверная строка ОДНА И ТА ЖЕ во всех 6 окнах — `元海`, единственный терм, присутствующий во всех
шести окнах (пересечение множеств термов = {元海}) и отрендеренный верной формой во всех шести
черновиках. Без этого метрика «судьба ОДНОЙ строки одинакова во всех 6 окнах» (§A промта)
неизмерима. Инъецируемая неверная форма — `Юаньхай` (реестр `TERMS` `inject_probe.py`).
**AM — метаязыковое окно, НАТУРАЛЬНОЕ (не синтетика):** параграфы 517521 источника — выбор
本命蛊 в шкафу гу. Несёт (а) `蛊名月光` — имя названо КАК ИМЯ («имя гу — Лунный свет»), при том что
канон-форма `月光蛊 → «Гу лунного света»`; (б) `弯弯如月` — буквальное «изогнут, как месяц»;
(в) обычные терминные употребления `月光蛊` в тех же 5 строках. Блок окна содержит ровно те термы
реестра, что встречаются в окне.
Черновик AM: 1 вызов транслятором проводом арма B (`deepseek-v4-flash`, `reasoning_effort:"low"`,
temp 0, ВЕРНЫЙ блок), тег `edp-AMdraft`. **Правило ветвления, фиксируется ЗДЕСЬ:** если черновик
передаёт `蛊名月光` ПО СМЫСЛУ (не приклеивает канон-форму к слову «имя») — идёт как есть; если
канонизировал — сажаю смысловой вариант «Имя этому гу — Лунный свет» и объявляю посадку в отчёте
(файл `edp-AMdraft-planted.txt`), результат помечается как посаженный.
### 0.5 A5 — посаженные дефекты черновика (дословный список)
По одному дефекту каждого класса в каждое из 6 окон, итого 6+6. Арм без банк-блока.
к1 = слово-абракадабра (несуществующее слово); к2 = смысловое искажение против ОРИГИНАЛА.
| Окно | Класс | Было в черновике | Стало (посадка) | Против чего в исходнике |
|---|---|---|---|---|
| w0 | к1 | `также поразительна` | `также взгрумительна` | — |
| w0 | к2 | `они не выдержат такого непрерывного расхода` | `они легко выдержат такой непрерывный расход` | 再多的元石也**经不起**…消耗 |
| w1 | к1 | `сокровище природы` | `мреязное сокровище природы` | — |
| w1 | к2 | `на глазах неуклонно поднимался` | `на глазах неуклонно опускался` | 元海水位…不断**攀升** |
| w2 | к1 | `словно натянутая струна` | `словно натянутая струмель` | — |
| w2 | к2 | `Увы, тот так и не показался` | `Увы, тот в первую же ночь и показался` | 可惜,**就是不见**那酒虫 |
| w3 | к1 | `но при этом необычайно густой` | `но при этом необычайно гущавой` | — |
| w3 | к2 | `Фан Юань, не оборачиваясь, развернулся и пошёл обратно` | `Фан Юань обернулся и остался стоять на месте` | 方源直接**转身往回走** |
| w4 | к1 | `волна дерзновенной отваги` | `волна дерзновяжной отваги` | — |
| w4 | к2 | `была вполне приемлемой платой` | `была совершенно недопустимой утратой` | 春秋蝉的损失**完全可以接受** |
| w5 | к1 | `оттенок суровой удали` | `оттенок суровяглой удали` | — |
| w5 | к2 | `он наконец не смог идти дальше` | `он зашагал ещё быстрее` | 一直走到三十六步,终于**走不动了** |
Скоринг A5: regex-предпроход («дефект ещё в выходе» / «смысл восстановлен») + **обязательная
глазная сверка каждой из 12 единиц; при расхождении авторитет — глаз**, regex печатается рядом.
### 0.6 Скоринг A0/A1/A2 и развязка regex-конфаунда
Метод — тот же regex-скорер, что `inject_probe.py --score` (нормализация NFKC · casefold · ё→е ·
схлоп пробелов). **Найденный и развязанный конфаунд (проверка потребована промтом на классе
元海/真元):** голд-rx `真元` = `истинн\w* ци` матчится ВНУТРИ верной формы `元海` = «море истинной ци».
Развязка: перед поиском `真元` из нормализованного выхода вырезаются все вхождения голд-формы `元海`.
Ре-ран research/24 §C по персистированному сырью ОБОИМИ методами — числа §C не двигаются
(см. §A.0 ниже); конфаунд задевает 2 клетки (w1 армы C/D), и обе лежат в колонке НЕВЕРНОГО терма,
которая в знаменатель «верных строк» не входит.
Знаменатели: «верные строки» = все термы блока кроме `元海` = 21 клетка (6+6+5+4+3+3 = 27 минус 6).
### 0.7 Критерии (успех/провал, зафиксированы ДО запуска)
1. **«Закон исполняется»** — A1 ≥ **5/6** окон, где ВСЕ верные строки окна пришли канонической
формой. Печатается также поклеточно (x/21) для сравнимости с §C.
2. **«Цена ошибки»** — A2: принятие неверной формы и вытеснение верной печатаются ЧИСЛОМ без
порога (это цена, не экзамен).
3. **«Консистентность держится»** — единогласие ≥ **5/6** однонаправленных решений по строке `元海`
в A2 (все 6 окон приняли ЛИБО все 6 отвергли).
4. **«Оговорка работает»** — метаязыковый пассаж передан ПО СМЫСЛУ при законе+оговорке И сломан
(канон-форма приклеена) при законе-без-оговорки.
5. **«Оговорка ТЕЧЁТ»** — ≥ **2/6** окон A1/A2 с отклонением от закона по ВЕРНЫМ строкам ⇒
формулировку сузить и пере-гнать ТОТ арм, где leakage зафиксирован (в потолке).
6. **A5** — «X из Y» по каждому классу, порога НЕТ (первый замер класса).
7. Средние исходы (ровно 4/6 и т.п.) — «неопределённо на N=6», печатаются, не абсорбируются.
### 0.8 Смета пробы A (напечатана ДО первого платного вызова)
Калибровка токенизатора: cl100k → фактические `prompt_tokens` DeepSeek ×**0.612** (по 6 вызовам
сырья §C, разброс 0.5970.622). Вход всех 26 вызовов ≈ **52 602** ток. → **$0.0229**.
Выход: нижняя оценка (только содержательный текст) 23 400 ток. → **$0.0432**; ожидаемая
104 000 ток. → **$0.1134**; абсолютный потолок (ВСЕ 26 вызовов упираются в 16 000) 416 000 ток. →
$0.3848. **Ожидаемая смета $0.110.14 < потолка $0.30.** Абсолютный потолок выше $0.30 достижим
только при 26/26 упоров в cap, поэтому в харнесс вшит **живой стоп $0.28**, проверяемый ПЕРЕД
каждым вызовом ⇒ потолок непробиваем механизмом, а не дисциплиной. Плюс 1 транслятор-вызов на
черновик AM ≈ $0.002.
---
## §0C. ПРЕ-РЕГИСТРАЦИЯ ПРОБЫ C (фронтир-пасс по голду; потолок $0.50, «go» владельца D39.103 п.3)
**Слаги — live `/models` 04.08.2026, не со слуха.** Владелец назвал «терра»/«луна»; в листинге
OpenAI (124 слага) присутствуют ровно `gpt-5.6-terra` и `gpt-5.6-luna` (плюс `gpt-5.6-sol`, которого
владелец НЕ называл — в пробу не берётся). Опознание однозначное, СТОП+релей не требуется.
DeepSeek-листинг: `deepseek-v4-flash`, `deepseek-v4-pro` — прежние два.
**Цены — ТОЛЬКО прайс-страница вендора** `developers.openai.com/api/docs/pricing` (снято 04.08.2026),
за 1M токенов, короткий контекст / длинный контекст:
| Слаг | in | cached in | out | (long) in | cached | out |
|---|---|---|---|---|---|---|
| `gpt-5.6-terra` | $2.00 | $0.20 | $12.00 | $4.00 | $0.40 | $18.00 |
| `gpt-5.6-luna` | $0.20 | $0.02 | $1.20 | $0.40 | $0.04 | $1.80 |
| `gpt-5.6-sol` (не в пробе) | $5.00 | $0.50 | $30.00 | $10.00 | $1.00 | $45.00 |
| `deepseek-v4-pro` | $0.435 | $0.003625 | $0.87 | — | — | — |
(v4-pro — `models.yaml`, prices_checked 2026-07-10, подтверждено quirks 00 «цены пост-катовера не
изменились».) Батчи ростера ≈4.5k ток. ⇒ применяется КОРОТКИЙ контекст-тир.
**Протокол** — тот же, что research/24 §B3: `consilium_probe.py`-ростер (45 голд-термов в банке +
18 экстра-поверхностей = 63 строки), 5 батчей, engine-faithful `RenderBatch`, боевой
`terminologist.md`, добавка CONF_NUM (как у пасса `glm1`, иначе несравнимо), temp 0 где применимо.
Чемпион для сравнения — `glm1` = **25/45** (пере-считано из сырья: ds1 20 · ds2 20 · ds3 21 ·
dsw 18 · glm1 25 · mis1 23 · gro1 12).
**Wire-квирк, который НЕ гадаю (правило двух направлений, quirks 00 шапка):** вендор-дока GPT-5.6
описывает `reasoning.mode` + `reasoning.effort` (none…max) для **Responses API**; поддержка плоского
`reasoning_effort` в Chat Completions в доке не заявлена, а прецедент exp08 (xAI) — вложенная форма в
Chat Completions МОЛЧА ГЛОТАЕТСЯ. Поэтому ДО основных вызовов идёт **микро-wire-проба** (≈$0.002):
на каждом слаге по 2 крошечных вызова с эффортами `none` и `high`; ручка считается ЖИВОЙ, только если
`reasoning_tokens` между ними различаются. Транспорт основного прогона выбирается по её результату
(Chat Completions при живой ручке; иначе Responses API), выбор печатается в отчёт.
Прочее по квиркам: `max_completion_tokens` вместо `max_tokens`, `temperature` не слать.
Эффорт основного прогона: **low** для terra/luna (дешёвый тир, зеркало ds1); для `deepseek-v4-pro`
reasoning-параметр НЕ шлётся (`low` на pro маппится в `high` — ручки бюджета у pro нет, quirks 00 §3а).
**Смета C:** вход ≈19k ток. на пасс. v4-pro: $0.008 вход + выход (высокий эффорт, оценка 30k ток.)
$0.026 ≈ **$0.034**. luna: $0.004 + $0.048 ≈ **$0.05**. terra: $0.038 + (оценка 8k ток.) $0.096 ≈
**$0.13**. Итого ожидаемо **≈$0.22** при потолке $0.50; живой стоп харнесса **$0.45**.
**Критерий (фриз):** «фронтир оправдан для роли» — парное преимущество кандидата над `glm1`
(термы «кандидат прав ∧ glm1 неправ» минус обратные) ≥ **+5** на 45 голд-термах **И** названа
цена/книга по методике research/24 §B5. Меньше +5 — «не оправдан» (легитимный исход).
**Data-sharing** на ключе OpenAI отключён — слово владельца, D39.103 п.3 (со слов промта
оркестратора; сессия это не верифицировала).
---
## §A. Проба A — редакторский провод под законом
26 пре-регистрированных вызовов `deepseek-v4-pro`, все `finish=stop`, слаг-дрейфа нет, провод
каждого вызова сверен с пре-регом машинно (temp 0.4 · max_tokens 16000 · `extra_body` пуст · 2
сообщения в армах без блока, 3 — с блоком · заголовок соответствует арму · маркер ⟨проверить⟩ и
вторая секция нигде не просочились). **$0.070293 при потолке $0.30.**
> ### ⚠ ДЕВИАЦИЯ ПРЕ-РЕГА №1 (поймана адверсариальным ревью, объявляю)
> Зафризенный §0.3 ставит оговорку ВНУТРЬ скобки: `…не меняй ничего другого; глоссарий обязателен …
> канонической формы):`. Харнесс собирает заголовок конкатенацией `база + оговорка + ":"`, где база
> уже закрыта скобкой, поэтому **на провод во всех A1/A2/AM-clause ушло**:
> `…не вводи иных вариантов и не меняй ничего другого); глоссарий обязателен для употреблений термина
> КАК термина: игру слов, разбор знаков, буквальное прочтение передавай по смыслу пассажа, сохраняя
> узнаваемость канонической формы:`
> — то есть оговорка стоит СНАРУЖИ скобки. Заголовок-без-оговорки (арм AM-noclause) байт-идентичен
> движковому `editor_header`, расхождения нет. Все выводы §A относятся к **отправленной** строке;
> при любом внесении §B в `injection.txt` брать её, а не редакцию из §0.3.
### A.0 Развязка regex-конфаунда (потребована промтом; $0, по персистированному сырью)
Конфаунд РЕАЛЕН: голд-rx `真元` (`истинн\w* ци`) матчится внутри верной формы `元海`
(«море истинной ци») — 14 пересечений в сырье §C. Но на числа §C он **не влияет**: развязанный
ре-ран даёт ту же таблицу (A 9/21 · B 20/21 · C 20/21 · D 21/21; неверная 0/6 · 0/6 · 6/6 · 6/6).
Задеты ровно 2 клетки (w1 армы C/D), и обе лежат в колонке НЕВЕРНОГО терма, которая в знаменатель
«верных строк» не входит. ⇒ **оговорка (а) ревью-шапки `research/24` («верные строки C/D завышены
до 2 ячеек») в части ЭФФЕКТА неверна: механизм есть, сдвига чисел нет.** Развязка всё равно
включена в скорер этой пробы, потому что здесь `元海` — инъецируемый неверный терм.
### A.1 Следование закону по ВЕРНЫМ строкам блока (21 клетка = 27 строк минус 6 клеток `元海`)
| Арм | Канонических форм | Окон с ПОЛНЫМ следованием | Сломано против черновика |
|---|---|---|---|
| черновик (арм B транслятора) | 20/21 | 5/6 | — |
| **A0** без блока | **15/21 (71%)** | 2/6 | 5/20 |
| **A5** без блока (второй розыгрыш того же контроля) | **8/21 (38%)** | 0/6 | **12/20** |
| **A1** закон+оговорка, верные строки | **21/21 (100%)** | **6/6** | 0/20 |
| **A2** закон+оговорка, `元海` неверна | 21/21 (100%) | 6/6 | 0/20 |
**Критерий 1 «закон исполняется» — ВЫПОЛНЕН** (6/6 ≥ 5/6).
**Контроль без блока разыгран ДВАЖДЫ, и это меняет формулировку.** A5 гнался как арм посаженных
дефектов, но по проводу это тот же контроль: тот же промпт, те же окна, тот же отсутствующий блок,
а черновики отличаются от A0 только двумя посадками, ни одна из которых термов не касается.
Второй розыгрыш дал **8/21**, не 15/21. Поэтому:
- **устойчиво и направленно:** блок поднимает следование канону до 21/21 и 6/6 окон в обоих армах,
где он есть; без блока — 15/21 и 8/21, ни одного полного окна во втором розыгрыше;
- **НЕ устойчиво:** конкретное число базы. «71% → 100%» — один розыгрыш; честная запись —
**«без блока 815 из 21, с блоком 21/21»**.
**Главное здесь не 100%, а разрушение.** Черновики арма B несли канон в **20/21** клетке. Редактор
без блока **сам ломает от 5 до 12 из 20 уже верных клеток** (2560%) и не чинит единственную
неверную. Это первый изолированный замер контроля (его не было никогда), и он переворачивает роль
редактора в модели рисков: редактор — не пассивная стадия, которую банк «страхует», а
**самостоятельный источник терминологического разнобоя**, причём с большой дисперсией.
Сломанные клетки (черновик→A0): w0 `真元`, w0 `元石`, w1 `元石`, w1 `蛊师`, w5 `蛊师`.
Вскрыто глазами, `edp-A0-w0` — редактор пере-терминологизирует пачкой:
> «покупательная способность **юань-камней** тоже поражает… Из них можно напрямую извлекать чистую
> **изначальную сущность** и восполнять ею **море сущности** в апертуре»
против канона «первобытный камень» · «истинная ци» · «море истинной ци». В `edp-A0-w5`: «мастер гу
первого оборота», «Гу Юэ Мо Бэй», «класс И/Бин» — то есть без блока плывут и термы, и имена, и
шкала градаций. В арме A5 (тоже без блока) тот же класс: `春秋蝉` пришёл «Цикадой Весны и Осени»
вместо канонической «Весенне-осенней цикады».
### A.2 Цена неверной строки и межоконная консистентность (строка `元海`, 6 окон)
| Арм | Верная форма в выходе | Неверная («Юаньхай») в выходе |
|---|---|---|
| черновик | 6/6 | 0/6 |
| **A0** без блока | **2/6** | 0/6 |
| **A1** верный закон | **6/6** | 0/6 |
| **A2** неверный закон | 1/6 | **6/6** |
**Критерий 2 «цена ошибки» (число без порога): неверная строка принята 6/6; полностью вытеснила
верную в 5/6.** Это ровно то же, что на транслятор-проводе (§C research/24: 6/6 и 5/6) ⇒ **цена
неверной строки банка на редакторе НЕ МЕНЬШЕ, чем на трансляторе; ремонт «редактор поймает» не
существует.**
**Критерий 3 «консистентность держится» — ВЫПОЛНЕН: единогласие 6/6.** Строка отработала одинаково
во всех шести окнах ⇒ канал разнобоя между параллельными главами инъекция НЕ открывает: она
одинаково точна и одинаково заразна. Это прямое подтверждение несущего довода D39.104 (закон ради
консистентности) — с ценой, названной числом выше.
Единственное исключение вскрыто глазами, `edp-A2-w3`:
> «В апертуре, разумеется, лежало **Юаньхай — море истинной ци**.»
Редактор исполнил неверный закон И приклеил к нему верную форму глоссой. Это единственная из 6
клеток, где обе формы сосуществуют, — и единственный наблюдённый след «сопротивления» неверной
строке. Механизма, который это ловит, в пайплайне нет.
**Критерий 5 «оговорка течёт» — НЕ подтверждён: 0/6 окон с отклонением** (A1 и A2 дали 21/21 по
верным строкам). Пере-гон арма не потребовался.
**Но метрика присутствия к протечке структурно слепа, и это ограничение вывода, а не придирка.**
Пре-регистрированный скорер спрашивает «есть ли каноническая форма в выходе», а не «все ли
употребления приведены к канону». По счёту УПОТРЕБЛЕНИЙ картина другая: w0 `元石` черновик 8 → A1 **4**
(остальные стали «камни»), w5 `蛊师` 4 → **3**, w1 `元海` 3 → **2**. Под буквой закона («приводи к ней
ЛЮБЫЕ расхождения») это отклонения, которых «0/6» не видит. Обратный класс — ПЕРЕ-канонизация — тоже
наблюдён: `edp-AM-clause` подставил «Гу лунного света» там, где исходник даёт голое `蛊虫`.
**Честная запись: нулевая протечка НЕ ИЗМЕРЕНА; измерено, что каноническая форма присутствует в
100% клеток.** Поштучная метрика — вход следующей пробы.
### A.3 A5 — чинит ли редактор дефекты черновика (12 посадок, арм БЕЗ блока)
| Класс | Исправлено | Метод сверки |
|---|---|---|
| к1 — слово-абракадабра | **6/6** | regex 6/6 + глаз 6/6 |
| к2 — смысловое искажение против оригинала | **6/6** | regex 6/6 + глаз 6/6 |
Порога не было (первый замер класса). Regex и глаз разошлись в одной единице (w4 к1: `fix_rx` не
предвидел формулировку) — по пре-регу авторитет глаза: «волна дерзновяжной отваги» → «приливом
гордого честолюбия», дефект снят. Восстановления смысла подтверждены против ИСХОДНИКА, в т.ч. там,
где фрагмент переписан целиком: w3 `方源直接转身往回走` → «Вместо ответа Фан Юань просто повернул
обратно»; w5 `终于走不动了` → «лишь на тридцать шестом шагу он окончательно выбился из сил и
остановился»; w4 `完全可以接受` → «вполне приемлемая цена».
**⚠ 12/12 — это «починка ПОСАЖЕННОГО», а не чистый эффект стадии.** Тот же арм в тех же вызовах
ВНОСИТ новые дефекты, которых в черновике не было (найдено ревью, вскрыто по сырью):
| Файл | Внесённый дефект | Против чего |
|---|---|---|
| `edp-A5-w4` | «тяжкий груз **полувекового** упорного подвижничества» (50 лет) — при том, что двумя абзацами выше тот же выход пишет «пятьсот лет» | `还存在着这**五百年**来,苦修的沉重经历` |
| `edp-A5-w3` | выход **оборван на полуслове**: «…будет обладателем таланта первого...» при `finish=stop` и 1176 из 16000 токенов | потеря смысловых атомов, мандат «сохраняй ПОЛНОТУ» |
| `edp-A5-w2` | одна реплика разбита на три абзаца через «—» (порча атрибуции речи); `花酒行者` переименован «Цветочный Бражник» → «Хмельной Странник» | реалия вне блока плывёт так же, как термы в §A.1 |
Обрыв при `finish=stop`**кандидат в `00-provider-quirks.md`**: тот же класс тихой обрезки, что
зарегистрирован за `gpt-5.4` на `reasoning_effort:"medium"` (exp14b/D38), но здесь на
`deepseek-v4-pro` при дефолтном `high` и незадействованном бюджете. Ни `finish`, ни длина его не
выдают; поймал бы regression_guard по обвалу длины, но в этой пробе гейты не участвовали.
**Вывод: редактор чинит посаженные дефекты 12/12, но не является «чистым улучшением» — он в тех же
вызовах ломает терминологию (512 из 20 клеток) и вносит собственные смысловые/структурные дефекты.
Первую ось закрывает блок банка, вторая ($A5$-класс) не закрыта ничем и не мерена систематически.**
### A.4 AM — метаязыковое окно (оговорка области)
Окно натуральное: параграфы 517521 (`蛊名月光` — имя названо как имя; `弯弯如月`; рядом обычные
терминные употребления `月光蛊`). Черновик (`edp-AMdraft`, транслятор арма B) передал имя ПО СМЫСЛУ —
«Название гу — лунный свет» ⇒ сработала ветка пре-рега «идёт как есть», посадки НЕ было.
**Пре-регистрированный результат (по 1 вызову на арм): критерий 4 «оговорка работает» — НЕ
ВЫПОЛНЕН.** Ни один арм не передал пассаж по смыслу: с оговоркой предложение об имени ИСЧЕЗЛО
(«Это Гу — тайная реликвия клана…»), без оговорки — свёрнуто в определение через канон-форму.
**Пост-хок репликация (девиация от пре-рега, объявляю: +4 вызова, $0.006143, потолок не задет;
пре-регистрированный вердикт выше ею НЕ переписывается).** N=3 на арм:
| Арм | Передача `蛊名月光` | `古月` (терма НЕТ в блоке) |
|---|---|---|
| закон+оговорка | пассаж потерян 1/3 · канон-форма приклеена к «звалось/называлось» 2/3 · **по смыслу 0/3** | «клан Древней Луны» 3/3 |
| закон без оговорки | определение через канон 1/3 · **по смыслу 2/3** («Гу звался лунным светом», «звалось Лунным светом») | «клан Гу Юэ» 2/3 · «Древней Луны» 1/3 |
**Направление обратно гипотезе §B: оговорка не только не включила смысловую передачу — арм БЕЗ неё
дал её чаще.**
Побочный сигнал по `古月` **сформулирован через базу черновика** (ревью справедливо поймало, что без
неё вывод не держится): черновик `edp-AMdraft` УЖЕ нёс «клана Древней Луны» дважды. Значит арм с
оговоркой ничего по смыслу не перевёл — он **сохранил черновик 3/3**, а арм без оговорки
**исправил** его на «Гу Юэ» 2/3. Две равно совместимые гипотезы, ни одна не отброшена:
(i) оговорка читается шире области и лицензирует смысловую передачу имени вне блока;
(ii) оговорка просто делает редактора КОНСЕРВАТИВНЕЕ — он меньше правит черновик вообще.
Гипотеза (ii) экономнее и согласуется с тем, что арм с оговоркой в r1 ещё и выбросил предложение
(нарушив «сохраняй ПОЛНОТУ») и переврал `镇族蛊虫` в «тайную реликвию клана».
Ограничения, которые запрещают абсорбировать это как решение: один пассаж, N=3 на арм,
`temperature` в thinking-режиме DeepSeek игнорируется (quirks 00) ⇒ разброс — недетерминизм
провайдера, `古月` вне блока, и обе формулировки в 100% случаев не воспроизвели черновик дословно
(редактор реверстывает). **Статус: кандидат-редакция §B в части оговорки НЕ ПОДТВЕРЖДЕНА и к
внесению в движок не готова; сам единый закон-блок (одна секция вместо двух) подтверждён — A1 21/21.**
*(дубль-абзац снят — испр. оркестратором, D39.108)*
### A.5 «Заявление = команда» (проба A)
| Число | Команда |
|---|---|
| байт-идентичность провода (3 sha256) | `go test -overlay <scratch>/overlay.json -run TestZZWireProbe ./internal/pipeline/ ./internal/membank/` + `editor_wire_probe.py --dump edp-A2-w3` |
| смета до запуска | `editor_wire_probe.py --plan` |
| §C воспроизведён, конфаунд развязан | `editor_wire_probe.py --selfcheck` |
| 15/21 · 21/21 · 21/21 · 2/6 · 6/6 · 1/6 · 6/6 · 6/6 · 6/6 | `editor_wire_probe.py --score` |
| A5 как второй контроль (8/21 · 0/6 · 12/20), окна A0/A1/A2, счёт УПОТРЕБЛЕНИЙ | инлайн-скрипты пере-рана по сырью (в журнале сессии) |
| 12 посадок глазами | `editor_wire_probe.py --eyes` |
| внесённые редактором дефекты (обрыв w3 · «полувекового» w4 · реплика/реалия w2) | инлайн-грепы по `edp-A5-w*.json` |
| деньги, finish, слаг, соответствие провода пре-регу | инлайн-скрипт пересчёта по сырью `edp-*.json` (в журнале сессии) |
---
## §C. Проба C — фронтир-пасс по голду
15 вызовов ростера + 4 микро-вызова wire-пробы. Все `finish=stop`, слаг-дрейфа нет, деньги сверены
вторым путём из сырья ($0.103125 против записанных $0.103124 — округление). **$0.104097 при
потолке $0.50.**
### C.1 Wire-квирк GPT-5.6 — ЗАМЕРЕН, не угадан
> ### ⚠ ДЕВИАЦИЯ ПРЕ-РЕГА №2 (объявляю)
> Пре-рег §0C потолка вывода на кандидата не называл. В прогоне стояли РАЗНЫЕ:
> `deepseek-v4-pro` и `gpt-5.6-luna` — `max_completion_tokens` 16000, `gpt-5.6-terra` — **8000**
> (защита потолка $0.50 при цене выхода $12/M). На числа не повлияло: максимум фактического вывода
> по всем 15 вызовам — 1092 токена, упоров в cap нет, все `finish=stop`.
> ### ⚠ Харнесс пробы C вне фриза
> Пре-рег-коммит `080c15d` заморозил текст §0C и `editor_wire_probe.py`, но `frontier_probe.py`
> написан ПОСЛЕ и остался untracked. Критерии C заморожены текстом, слаги и цены сняты до запуска,
> но «заявление = команда» §C.4 опирается на код вне фриза — это слабее, чем в §A.
Плоский `reasoning_effort` в **Chat Completions живой** на обоих слагах: `reasoning_tokens`
0 → 48 (`gpt-5.6-terra`) и 0 → 57 (`gpt-5.6-luna`) при `none``high`. Responses API не
понадобился; прецедент exp08 (молчаливое проглатывание вложенной формы) здесь не воспроизвёлся.
Основной прогон: `reasoning_effort:"low"`, `max_completion_tokens`, без `temperature`.
Для `deepseek-v4-pro` reasoning-параметр не слался (на pro `low` маппится в `high`).
**Кандидат в `00-provider-quirks.md`** (строка для GPT-5.6, если семейство войдёт в ростер).
### C.2 Точность против голда (45 термов) и цена
| Пасс | Строго | С фолдом конвенции¹ | $ пасса | $/книга² |
|---|---|---|---|---|
| **glm-5** (чемпион §B3) | **25/45** | 26/45 | $0.018495 | $0.59 |
| mistral-large-2512 | 23/45 | 23/45 | $0.012808 | $0.41 |
| deepseek-v4-flash low | 20/45 | 24/45 | $0.007921 | $0.25 |
| **deepseek-v4-pro** | 16/45 | 24/45 | $0.013560 | $0.43 |
| **gpt-5.6-terra** | 18/45 | **26/45** | $0.082204 | **$2.61** |
| **gpt-5.6-luna** | 18/45 | **26/45** | **$0.007360** | **$0.23** |
¹ фолд пробелов/дефисов при сравнении. Состав поднятых клеток проверен поимённо (правка по ревью —
прежняя формулировка «ровно один класс, 8 поверхностей семьи 古月» неверна): у terra/luna/pro фолд
поднимает **8 клеток = 7 поверхностей семьи `古月` + `人祖`** («Жэнь-цзу» против голда «Жэньцзу» —
другой терм и другой класс), у glm-5 — **1 клетку** (`人祖`). ⚠ **И фолд не нейтрален между
кандидатами:** у terra/luna семейные клетки выглядят как «Гу Юэ Мо Бэй» (разорваны И фамилия, И
личное имя — две ошибки конвенции), у pro — «Гу Юэ Мобэй» (одна). Фолд склеивает их в одну ⇒
он **чуть льстит фронтиру относительно pro**, и «net ±0» для terra/luna — ВЕРХНЯЯ оценка.
² методика research/24 §B5: 2000 различных строк банка на книгу.
### C.3 Вердикт по пре-регистрированному критерию
Парное преимущество над `glm-5` (нужно ≥ +5):
| Кандидат | Строго | С фолдом конвенции | Вердикт |
|---|---|---|---|
| deepseek-v4-pro | +1 / 10 (net 9) | +1 / 3 (net 2) | **не оправдан** |
| gpt-5.6-terra | +2 / 9 (net 7) | +2 / 2 (net **±0**) | **не оправдан** |
| gpt-5.6-luna | +3 / 10 (net 7) | +3 / 3 (net **±0**) | **не оправдан** |
**«Фронтир для роли терминолога НЕ ОПРАВДАН» — легитимный исход, зафиксированный пре-регом.**
**Но сырой вердикт был бы неправдой о причине, и это ключевая находка §C.** Строгий счёт говорит
«фронтир ХУЖЕ чемпиона на 79»; после снятия ОДНОГО класса — конвенции транскрипции — разрыв
исчезает целиком (net ±0), а terra и luna догоняют glm-5 до 26/45. То есть 7 из 9 «промахов»
фронтира — не ум, а орфографическая конвенция (`古月` → «Гу Юэ» вместо «Гуюэ»), которую glm-5 и
mistral угадали, а deepseek-pro, terra и luna — нет. **Это ровно та конвенция, которую
research/24 §D п.9 предлагает завести ДАННЫМИ пар-промпта (класс Z-B3); замер даёт ей цену: 8
поверхностей из 45 = 18% голда, и она перекрывает любую разницу между моделями на этом ростере.**
**Экономический вывод сильнее качественного:** `gpt-5.6-luna` даёт 26/45 (фолд) за **$0.23/книга**
против $0.59 у glm-5 — качество неотличимо на N=45 (разница ±3 при собственном пороге проекта +5),
цена **в 2,6× ниже**, и она же дешевле нынешнего flash-low ($0.25) при +2 клетках. `gpt-5.6-terra`
даёт то же качество за $2.61/книга — **в 11× дороже luna, покупает 0 клеток**: расход ума на этой
задаче не конвертируется. `deepseek-v4-pro` — 24/45 за $0.43, хуже flash-low по деньгам и не лучше
по качеству ⇒ довод «взять pro, он умнее» на роли терминолога эмпирически пуст.
Единицы, вскрытые глазами: `古月冻土` gold «Гуюэ Дунту» → у terra/luna/pro «Гу Юэ Дунту» (та самая
конвенция); `开窍` gold «открытие апертуры» — взяли ОБА фронтира, glm-5 потерял; `空窍` gold
«апертура» — то же; `蛊师` gold «гу-мастер» → terra «мастер Гу», pro «мастер Гу» (тот же класс
порядка слов, что ломает редактор без блока в §A.1).
### C.4 «Заявление = команда» (проба C)
| Число | Команда |
|---|---|
| слаги живые | `frontier_probe.py --slugcheck` |
| ручка reasoning живая (0→48 / 0→57) | `frontier_probe.py --wirecheck` |
| смета | `frontier_probe.py --plan` |
| 25/23/20/16/18/18 из 45, парные, $/книга | `frontier_probe.py --score` |
| фолд конвенции 26/24/23/24/26/26 | инлайн-скрипт с `nosp()` (в журнале сессии) |
| деньги вторым путём, finish, слаг-дрейф | инлайн-скрипт пересчёта по сырью `fdp/flu/fte-b*.json` |
### C.5 КОНТРОЛЬ 05.08: чемпион с ВКЛЮЧЁННЫМ мышлением (закрывает ограничение №5) *(перенумеровано из второго §C.4 — испр. оркестратором)*
Дозамер по ревью посылки. §C сравнивал пассы в разных reasoning-режимах: чемпион `glm-5` ехал
`thinking:{"type":"disabled"}`, а претенденты с разумом (`v4-pro` default, `terra`/`luna` low).
Ограничение объявлялось, но замером закрыто не было — то есть оставалась живая гипотеза «чемпион
был искалечен, и паритет luna ему просто померещился».
Контроль `glm2`: тот же ростер, те же 5 батчей, тот же промпт и та же добавка `CONF_NUM`, меняется
РОВНО ОДНО — мышление не отключается. Харнесс `eval/premise_review/glm_thinking_control.py`, риг
`consilium_probe.py` не правился. Счёт — независимым парсером `eval/premise_review/recount.py`.
| Пасс | Режим | Строго | Выход, ток. (по батчам) | $ пасса | $/книга |
|---|---|---|---|---|---|
| `glm1` | thinking **off** | **25/45** | 199 · 178 · 197 · 150 · 11 | $0.018495 | $0.59 |
| `glm2` | thinking **on** | **24/45** | 3492 · 7275 · 4619 · 4222 · 378 | $0.081326 | **$2.60** |
**Гипотеза «чемпион был искалечен» — ОПРОВЕРГНУТА.** Включение мышления не подняло качество, а
дало 1 клетку при цене **в 4,4× выше**. Δ=1 на N=45 лежит внутри шума, поэтому корректная
формулировка — не «мышление вредит», а **«на роли терминолога размышление не конвертируется в
качество вообще»**: тот же результат, что §C.3 получил на `terra` (11× цены `luna`, 0 клеток).
Следствия: (1) ограничение №5 снято — вывод §C от асимметрии режимов не зависел, и асимметрия
была не в пользу претендентов, а против них; (2) побочный вывод про `luna` сохраняется, но его
формулировка усиливается: `luna` держит паритет не с ослабленным, а с ЛУЧШИМ из двух режимов
чемпиона; (3) роль терминолога — кандидат на явное отключение мышления там, где провайдер это
позволяет: $0.59 против $2.60 за книгу при равном качестве.
⚠ Контроль добавлен ПОСЛЕ основного прогона и вне пре-рега §0C — объявляется как девиация. Он
способен был только ухудшить собственный побочный вывод сессии (паритет `luna` исчез бы, поднимись
`glm2` выше 25), поэтому не является подгонкой ворот; но и не является пре-регистрированным.
---
## §D. Деньги, критик полноты, ограничения
### Леджер
| Статья | Вызовов | $ |
|---|---|---|
| A: 26 пре-регистрированных вызовов v4-pro | 26 | 0.063867 |
| A: черновик метаязыкового окна (flash) | 1 | 0.000283 |
| A: пост-хок репликация AM (девиация, объявлена) | 4 | 0.006143 |
| **ПРОБА A** | **31** | **0.070293** (потолок $0.30) |
| C: ростер, 3 кандидата × 5 батчей | 15 | 0.103124 |
| C: wire-проба ручки reasoning | 4 | 0.000973 |
| **ПРОБА C** | **19** | **0.104097** (потолок $0.50) |
| **ВСЕГО** | **50** | **0.174390** |
Все 50 вызовов `finish=stop` — ⚠ **но это НЕ свидетельство целостности выходов**: `edp-A5-w3`
оборван на полуслове именно при `finish=stop` (§A.3). Оба пути счёта (лог харнесса и независимый
пересчёт из `usage` × цен) сходятся до округления. Ни один потолок не задет; живые стопы
($0.28 / $0.45 + проекционный гард) не срабатывали.
### Адверсариальный проход author≠reviewer (норма 01.08; соло-самопроверка платные пробы не закрывает)
Независимый агент прошёл от ЗАДАНИЯ и СЫРЬЯ к отчёту (в таком порядке), пере-считал все числа §A и
§C СВОИМ кодом, не вызывая функций автора. **Вердикт: принять с правками.** Все числа —
CONFIRMED (включая знаменатели, поклеточные списки, деньги, sha256 провода и фриз пре-рега
19:58:35Z против первого платного вызова 19:59:21Z). Восемь находок СВЕРХ отчёта, все проверены
мной по сырью и все подтвердились; каждая вправлена в текст выше:
девиация заголовка (скобка) · A5 как второй контроль 8/21 · дефекты, ВНЕСЁННЫЕ редактором · слепота
leakage-метрики · отсутствие базы черновика в выводе про `古月` · состав фолда 7+`人祖` и его
несимметричность · необъявленный `cap=8000` у terra · `frontier_probe.py` вне фриза.
Один клейм ревьюера я сначала не воспроизвёл («полувекового») — при прямой проверке токеном он
оказался верен, ошибка была в моём поиске.
Что осталось НЕ проверенным ревьюером (его слова, не додумано): оговорка (а) ревью-шапки
`research/24` и ре-ран §C по `inj-w*` им не пере-считывались — эти два клейма стоят только на моей
проверке (§A.0).
### Критик полноты — чего этот отчёт НЕ говорит
1. **N=6 окон, одна книга, одна пара.** Всё §A — zh→ru, `蛊真人`, 10 глав. Перенос на ja/en не
мерен (research/24 §E мерил его на ТРАНСЛЯТОР-проводе, не на редакторском).
2. **Одна неверная строка одного класса.** `元海` — многословный термин с прозрачной внутренней
формой. Короткое фонетическое имя может вести себя иначе; 6/6 — про этот класс.
3. **A5: дефекты посажены мной, не пойманы в бою.** 12/12 — верхняя оценка: посадки заметны и
локальны, реальные дефекты черновика тоньше. И это только ось «починил посаженное»: ось
«внёс своё» посчитана лишь качественно (3 случая, §A.3), систематически не мерена.
3а. **База контроля без блока нестабильна** (15/21 против 8/21 на двух розыгрышах) ⇒ величину
эффекта инъекции этой пробой назвать нельзя, только направление. Нужен контроль с N≥3
розыгрышами на окно.
4. **AM: один пассаж.** Обратное направление (оговорка мешает) — сигнал, а не решение; нужен второй
метаязыковой пассаж и второй терм, прежде чем править `injection.txt`.
5. **§C сравнивает пассы в РАЗНЫХ reasoning-режимах** (glm-5 thinking off · flash/terra/luna low ·
pro high). Это шиппинг-режимы, а не выровненный эксперимент: вывод «ум не докупается» держится
на паре (качество, цена), а не на равенстве бюджета размышления.
**⇒ ЗАКРЫТО ЗАМЕРОМ 05.08 (§C.5):** чемпион прогнан с ВКЛЮЧЁННЫМ мышлением — 24/45 против
25/45, то есть оговорка была в пользу чемпиона напрасно, и вывод от неё не зависел.
6. **Голд = 45 подписанных владельцем строк.** «Ошибка» модели против голда включает вкусовые
решения владельца, автономно недостижимые (research/24 §D п.4).
7. **Не сделано:** причинный A/B `no/proper/random` глоссария на редакторе (только no/proper/wrong);
замер на подписанных-и-неподписанных строках вместе (двухсекционка не гонялась ВООБЩЕ — единый
блок её заменил по §B, так что вопрос «двухсекционка против единой» остался неизмеренным, а не
решённым); фетч-сторона не трогалась.
8. **Data-sharing OpenAI отключён — со слов промта оркестратора**, сессией не верифицировано.
### Что из этого — вход для решения владельца/оркестратора
- **Подтверждено:** единый закон-блок исполняется 21/21 (по присутствию формы); консистентность
единогласна 6/6; цена неверной строки на редакторе = цене на трансляторе (6/6, вытеснение 5/6).
- **Новое и не предполагавшееся:** редактор без блока сам ломает 512 из 20 верных клеток черновика
(два розыгрыша контроля) ⇒ инъекция редактору нужна не «на всякий случай», а как несущая защита;
и она же — единственный канал, которым неверная строка гарантированно доедет до финала.
- **Новое, требующее гейта, а не доктрины:** редактор ВНОСИТ собственные дефекты — тихий обрыв
выхода при `finish=stop`, число 五百年→«полувекового», разбиение реплики, переименование реалии
вне блока. Обрыв — кандидат в `00-provider-quirks.md` по `deepseek-v4-pro`.
- **Не подтверждено:** оговорка области §B (обратное направление на N=3+1). В движок не вносить.
- **Побочно:** конвенция `古月` слитно стоит 8/45 голда и перекрывает разницу между всеми
протестированными моделями — рычаг данных сильнее рычага модели (усиливает research/24 §D п.9).
- **Побочно:** `gpt-5.6-luna` — то же качество, что glm-5, за 39% его цены; кандидат в замену
терминолога, если владелец захочет тронуть эту роль (не решение сессии). Контроль §C.5 усилил
формулировку: паритет держится против ЛУЧШЕГО из двух режимов чемпиона, а не против ослабленного.
- **Побочно, новое (§C.5):** на роли терминолога размышление не конвертируется в качество ни у
одной проверенной модели — `glm-5` с мышлением 24/45 против 25/45 без него при 4,4× цены,
`terra` при 11× цены `luna` покупает 0 клеток. Рычаг роли — данные (конвенция `古月`, 8/45), не ум.