diff --git a/docs/PROGRESS.md b/docs/PROGRESS.md index 65326c8c..0c4d3e4b 100644 --- a/docs/PROGRESS.md +++ b/docs/PROGRESS.md @@ -596,7 +596,8 @@ ## Полигон -**📌 29.08 · ФАЗА Д — ОБА ГЛАВНЫХ ВОПРОСА ВЛАДЕЛЬЦА ЗАКРЫТЫ, ВОПРОС 0 ОСТАЁТСЯ ОТКРЫТЫМ. Сессия $0, ни одного платного вызова.** +**📌 29.08 · ФАЗА Д — НА ОБА ГЛАВНЫХ ВОПРОСА ВЛАДЕЛЬЦА ОТВЕЧЕНО, ВОПРОС 0 ОСТАЁТСЯ ОТКРЫТЫМ. Сессия $0, ни одного платного вызова.** +⚠ **«Отвечено», а не «закрыто», и разница существенная:** на Вопрос 2 ответ дан в форме СЛАБЕЕ, чем звучит сам вопрос — минимакс не проверен (худший ВОЗМОЖНЫЙ жилец не искался), вендоро-независимость архитектуры НЕ проверена (буфер двухвендорен: черновик делает DeepSeek). Первая редакция этой шапки писала «ЗАКРЫТЫ», хотя буллеты под ней несли оговорки — поправлено адверсариальной приёмкой. Отчёт — `docs/experiments/23-editor-tier.md`, секции **Д35–Д38**. Агент-сессий 154 → **186 из 200**. Деньги не тронуты: резерв пака $1.2634 из $18.30 как был. * **Шаг 4 плана 22.08 ЗАКРЫТ** (Д36) — последнее незакрытое условие §7, которое можно было закрыть бесплатно. Дуэль «ролевой промт против его отсутствия» на 16 уже купленных карантинных клетках, панель из 5 армов с ГРУБЫМ ДЕКОЕМ (`ZD`), 16 читателей `fable-5`. **Промт различим: +1.50 места при пороге 1.13, знаковый p=0.0213, 13 глав из 16 в одну сторону** — ровно порог, объявленный пре-регом ДО чисел. ⇒ у прибора ЕСТЬ разрешение на промт-инженерном материале, и **всё, что фаза назвала неразличимым, меньше, чем ВЕСЬ ролевой промт**. diff --git a/docs/experiments/00-provider-quirks.md b/docs/experiments/00-provider-quirks.md index 356e2065..34393df8 100644 --- a/docs/experiments/00-provider-quirks.md +++ b/docs/experiments/00-provider-quirks.md @@ -154,7 +154,7 @@ ## Контент-фильтры / safety -- ⛔⛔ **Gemini, ДВА СИСТЕМНЫХ СООБЩЕНИЯ = ПРОМТ ТЕРЯЕТСЯ МОЛЧА (полигон 22.08, живая проба `eval/dovodka/proba_gemini.py`).** **СТРУКТУРНЫЙ ФАКТ ВЕНДОРА** (`ai.google.dev/api/generate-content`, страница помечена 2026-08-17, снято 2026-08-28): в нативном `GenerateContentRequest` поле `systemInstruction` — ОДИН `object (Content)` (в той же таблице `contents[]` и `tools[]` несут суффикс повторяемого поля), а `Content.role` документирован как «Must be either 'user' or 'model'» ⇒ второму системному ХОДУ в нативном запросе места нет. ⚠ **ПОПРАВКИ ПИНГА №19 (28.08, D39.164), внесены 29.08 — прежняя редакция была сильнее источника в трёх местах.** (а) ~~«слой ФИЗИЧЕСКИ не может пронести больше одного системного»~~ — это про НАТИВНЫЙ запрос; **что делает с двумя системными OpenAI-совместимый ШИМ, вендор не документирует НИГДЕ** (раздел «Current limitations» молчит и в живой странице, и в снимке Wayback 2026-08-21). (б) ~~«уход на нативный API проблемы НЕ решает»~~ верен по сути, но НЕ по причине: `Content.parts[]` — ПОВТОРЯЕМОЕ поле, и вендорская заметка на `systemInstruction` гласит «Only text should be used in parts and content in each part will be in a separate paragraph» ⇒ нативный API МОЖЕТ нести N системных текстов как N частей ОДНОГО `Content`; склеивать всё равно пришлось бы, но «физически не может» — неправда. (в) форум Google — **НЕ вендорский источник**: тред `discuss.ai.google.dev/t/86097` (30.05.2025) — два поста, оба от НЕ-сотрудников, ответа Google нет; ссылаться на него наравне с замером нельзя. При двух и более системных лишние выбрасываются без ошибки. ⛔ **УСТАНОВЛЕНО 29.08: ВЫЖИВАЕТ ПОСЛЕДНЕЕ СИСТЕМНОЕ, ВЫБРАСЫВАЕТСЯ ПЕРВОЕ** (полигон, Д35.3 отчёта 23; $0, детерминированно, на 16 уже купленных клетках). Доказательство арифметическое: у арма `RE` первое системное (ролевой промт) **побайтно одинаково на всех 16 главах**, второе (глоссарий) — **разное** (255–404 знака, термины из текста главы); разность `RE.prompt_tokens − RQ.prompt_tokens` равна **2436 РОВНО на каждой из 16 глав, sd = 0.00** ⇒ выброшено сообщение ПОСТОЯННОГО размера, а таково только первое; будь выброшены оба, разность росла бы вместе с глоссарием. Побочно: `prompt_tokens` карантинных клеток коррелируют с длиной глоссария +0.52 и с длиной исходника +0.04 — глоссарий внутри них физически есть. ~~⚠ КАКОЕ именно выживает — НЕ УСТАНОВЛЕНО~~ — вопрос ЗАКРЫТ этим замером; прежняя интерпретация «не выжило НИ ОДНО» неверна: она сравнила 535 токенов с «размером одного user-сообщения» НА ГЛАЗ, а при шкале 0.324 ток/знак русского глоссарий в 300 знаков весит ~100 токенов и в такой оценке теряется. ⚠ Форум Google (`discuss.ai.google.dev/t/86097`) говорит то же самое, но он **не источник** (не-сотрудники, ответа Google нет) — здесь он лишь СОВПАДАЕТ с замером, а не подпирает его. ⚠⚠ **ГРАНИЦА КЛЕЙМА, названная пингом №19 и подтверждённая здесь:** замер снят на `gemini-3.1-flash-lite` и на клетках, купленных 21.08.2026. Слой у `gemini-3.1-pro-preview` (тот, что стоит в цепочке эскалации) ТОТ ЖЕ, но слаг другой — клейм переносится на него как ПРАВДОПОДОБНЫЙ, не как замеренный. Для решения это безразлично: движок склеивает системные сам. Документированного вендором ограничения в разделе «Current limitations» НЕТ. Замер на одном и том же системном тексте в 7970 знаков: ОДНИМ сообщением → `prompt_tokens` 2994 и маркерная инструкция ИСПОЛНЕНА; ДВУМЯ → **535 токенов (это размер одного user-сообщения) и инструкция НЕ исполнена**. Ответ приходит с `finish=stop` и выглядит правильным переводом — отказа нет, есть тихая потеря инструкции, невидимая всем гейтам годности. ⚠ Так были куплены 16 клеток арма `RE` (промт-роль на gemini): они переведены ВООБЩЕ БЕЗ ИНСТРУКЦИИ, и вердикт о переносимости из них был бы ложным. Лечение: склеивать системные в одно ДЛЯ ЭТОГО ВЕНДОРА (`rol.ONE_SYSTEM`/`fit_msgs`) — общая склейка сменила бы форму запроса у всех моделей и рассогласовала бы уже купленные клетки. ⚠ Проверено, что у `deepseek-v4-pro`, `gpt-5.6-luna`, `glm-5` и `grok-4.3` два системных доезжают целиком. +- ⛔⛔ **Gemini, ДВА СИСТЕМНЫХ СООБЩЕНИЯ = ПРОМТ ТЕРЯЕТСЯ МОЛЧА (полигон 22.08, живая проба `eval/dovodka/proba_gemini.py`).** **СТРУКТУРНЫЙ ФАКТ ВЕНДОРА** (`ai.google.dev/api/generate-content`, страница помечена 2026-08-17, снято 2026-08-28): в нативном `GenerateContentRequest` поле `systemInstruction` — ОДИН `object (Content)` (в той же таблице `contents[]` и `tools[]` несут суффикс повторяемого поля), а `Content.role` документирован как «Must be either 'user' or 'model'» ⇒ второму системному ХОДУ в нативном запросе места нет. ⚠ **ПОПРАВКИ ПИНГА №19 (28.08, D39.164), внесены 29.08 — прежняя редакция была сильнее источника в трёх местах.** (а) ~~«слой ФИЗИЧЕСКИ не может пронести больше одного системного»~~ — это про НАТИВНЫЙ запрос; **что делает с двумя системными OpenAI-совместимый ШИМ, вендор не документирует НИГДЕ** (раздел «Current limitations» молчит и в живой странице, и в снимке Wayback 2026-08-21). (б) ~~«уход на нативный API проблемы НЕ решает»~~ верен по сути, но НЕ по причине: `Content.parts[]` — ПОВТОРЯЕМОЕ поле, и вендорская заметка на `systemInstruction` гласит «Only text should be used in parts and content in each part will be in a separate paragraph» ⇒ нативный API МОЖЕТ нести N системных текстов как N частей ОДНОГО `Content`; склеивать всё равно пришлось бы, но «физически не может» — неправда. (в) форум Google — **НЕ вендорский источник**: тред `discuss.ai.google.dev/t/86097` (30.05.2025) — два поста, оба от НЕ-сотрудников, ответа Google нет; ссылаться на него наравне с замером нельзя. При двух и более системных лишние выбрасываются без ошибки. ⛔ **УСТАНОВЛЕНО 29.08: ВЫЖИВАЕТ ПОСЛЕДНЕЕ СИСТЕМНОЕ, ВЫБРАСЫВАЕТСЯ ПЕРВОЕ** (полигон, Д35.3 отчёта 23; $0, детерминированно, на 16 уже купленных клетках). Доказательство арифметическое: у арма `RE` первое системное (ролевой промт) **побайтно одинаково на всех 16 главах**, второе (глоссарий) — **разное** (255–404 знака, термины из текста главы); разность `RE.prompt_tokens − RQ.prompt_tokens` равна **2436 РОВНО на каждой из 16 глав, sd = 0.00** ⇒ выброшено сообщение ПОСТОЯННОГО размера, а таково только первое; будь выброшены оба, разность росла бы вместе с глоссарием. Побочно: `prompt_tokens` карантинных клеток коррелируют с длиной глоссария +0.52 и с длиной исходника +0.04 — глоссарий внутри них физически есть. ~~⚠ КАКОЕ именно выживает — НЕ УСТАНОВЛЕНО~~ — вопрос ЗАКРЫТ этим замером; прежняя интерпретация «не выжило НИ ОДНО» неверна: она сравнила 535 токенов с «размером одного user-сообщения» НА ГЛАЗ, а при шкале 0.324 ток/знак русского глоссарий в 300 знаков весит ~100 токенов и в такой оценке теряется. ⚠ Форум Google (`discuss.ai.google.dev/t/86097`) говорит то же самое, но он **не источник** (не-сотрудники, ответа Google нет) — здесь он лишь СОВПАДАЕТ с замером, а не подпирает его. ⚠⚠ **ГРАНИЦА КЛЕЙМА, названная пингом №19 и подтверждённая здесь:** замер снят на `gemini-3.1-flash-lite` и на клетках, купленных 21.08.2026. Слой у `gemini-3.1-pro-preview` (тот, что стоит в цепочке эскалации) ТОТ ЖЕ, но слаг другой — клейм переносится на него как ПРАВДОПОДОБНЫЙ, не как замеренный. Для решения это безразлично: движок склеивает системные сам. Документированного вендором ограничения в разделе «Current limitations» НЕТ. Замер на одном и том же системном тексте в 7970 знаков: ОДНИМ сообщением → `prompt_tokens` 2994 и маркерная инструкция ИСПОЛНЕНА; ДВУМЯ → **535 токенов** ~~(это размер одного user-сообщения)~~ **и инструкция НЕ исполнена** — ⚠ оценка «размер одного user-сообщения» СНЯТА: 535 = user + глоссарий, см. закрытие вопроса выше. Ответ приходит с `finish=stop` и выглядит правильным переводом — отказа нет, есть тихая потеря инструкции, невидимая всем гейтам годности. ⚠ Так были куплены 16 клеток арма `RE` (промт-роль на gemini): ~~они переведены ВООБЩЕ БЕЗ ИНСТРУКЦИИ~~ — **уточнено 29.08 тем же замером, что закрыл вопрос выше: они переведены БЕЗ РОЛЕВОГО ПРОМТА, но С ГЛОССАРИЕМ** (до модели доехали ~130 токенов канонных форм из 2 566). Вердикт о переносимости из них был бы ложным в обоих чтениях; но арм, собранный из этих клеток, называется «без ролевого промта», а не «без инструкции» — иначе класс «банк» читается неверно. Лечение: склеивать системные в одно ДЛЯ ЭТОГО ВЕНДОРА (`rol.ONE_SYSTEM`/`fit_msgs`) — общая склейка сменила бы форму запроса у всех моделей и рассогласовала бы уже купленные клетки. ⚠ Проверено, что у `deepseek-v4-pro`, `gpt-5.6-luna`, `glm-5` и `grok-4.3` два системных доезжают целиком. - ⛔⛔ **ТОТ ЖЕ ДЕФЕКТ ЖИВЁТ В ДВИЖКЕ, А НЕ ТОЛЬКО В ПОЛИГОНЕ (аудит 22.08).** `backend/internal/pipeline/render.go:256-258`=`Content: injection` штатно строит ВТОРОЕ системное сообщение — инъекцию банка памяти (глоссарий/STM), `backend/internal/llm/httpllm.go:517-522`=`SystemMessagesSingle` копирует сообщения дословно, склейки под Gemini нет нигде, а `gemini-3.1-pro-preview` стоит в ратифицированной цепочке эскалации во ВСЕХ арм-конфигах (`pipeline-c1.yaml:129`, `pipeline-arm-glm.yaml:61`, `pipeline-arm-deepseek-pro.yaml:62`, `pipeline-arm-mistral.yaml:61`). ⇒ **любой эскалационный хоп на Gemini при непустой инъекции ТИХО терял текст.** Оговорка D22.3 «экспозиция Ф1 нулевая» держалась только на том, что до Gemini в дефолте не доходят. ✅ **ДЕФЕКТ ДВИЖКА ЗАКРЫТ 28.08 лендингом `7d0c6f2`** — проверено кодом 29.08, а не пересказано: у провайдера `gemini` объявлено `system_messages: single` (`backend/configs/models.yaml:137`=`system_messages: single`), адаптер склеивает ВЕДУЩИЙ system-ран в одно сообщение и падает громко на системном ходе после не-системного (`backend/internal/llm/httpllm.go:528`=`func toOpenAIMessages`), инвариант запинен тестом (`backend/internal/llm/systemmessages_test.go:78`=`TestSystemMessagesSingleCarriesTheInjection`). ⇒ строки выше про движок — ИСТОРИЯ, а не открытый долг. ⛔ **НО ЦЕНА ДЕФЕКТА ДО ПОЧИНКИ ОЦЕНИВАЛАСЬ НЕВЕРНО, и это правится здесь (полигон 29.08, Д35.3).** По установленному выше правилу выживает ПОСЛЕДНЕЕ системное, а `render.go:247-258`=`Role: "system"` кладёт первым **сам промт стадии**, вторым — инъекцию банка. ⇒ до 28.08 хоп в Gemini терял **не глоссарий, а ВЕСЬ ПРОМТ СТАДИИ**, оставляя глоссарий: модель получала список канонных форм и текст — без единого слова о том, что с ними делать. Ровно так выглядят 16 клеток `RE` полигона: перевод есть, `finish=stop`, русский, правильной длины, инструкции за ним нет. **Тихая потеря промта не отличима от нормального ответа ничем, кроме счётчика входных токенов.** ⇒ решение «склеивать самим» было единственно верным и при неизвестном тогда чтении квирка; а любой ИСТОРИЧЕСКИЙ вывод, снятый на Gemini-хопе до 28.08, надо читать как «стадия работала без своего промта». ⚠ Класс в проекте уже был решён рядом: `backend/internal/llm/provider_anthropic.go:169-179`=`wire.System = append` сворачивает ведущий system-префикс в одно поле и падает громко на system посреди диалога — просто не обобщён на Gemini. **Зона бэкенда, пинг оркестратору отправлен.** diff --git a/docs/experiments/23-editor-tier.md b/docs/experiments/23-editor-tier.md index 09d3bd34..179b1d60 100644 --- a/docs/experiments/23-editor-tier.md +++ b/docs/experiments/23-editor-tier.md @@ -3778,7 +3778,7 @@ ZF ТО ЖЕ САМОЕ, вторая генерация (16–20.08) эф | `glm-5` (думание ВЫКЛ) | однопроходка | **различимо хуже** | 1.00 / 3.20 | | `grok-4.3` | однопроходка · черновик | **различимо хуже** (порогом да, знаковым p=0.09) | 1.25 / 2.50 | | `glm-4.7` | черновик | ничья в шестёрке черновиков | 0.60 / 2.20 | -| `gpt-5.6-luna` | **только черновик** | ничья в шестёрке; **дешевле всех**; в дорогой роли НЕ мерен | 0.20 / 1.20 | +| `gpt-5.6-luna` | ~~**только черновик**~~ **и однопроходка** | ничья в шестёрке; **дешевле всех**; ~~в дорогой роли НЕ мерен~~ ⛔ **СТРОКА ПРОТУХЛА:** 16 клеток `RL` куплены и отсужены, результат — «прибор не решил» (Д31, Д33.8) | 0.20 / 1.20 | | `gemini-3.1-flash-lite` | **только черновик** | ничья в шестёрке; в дорогой роли НЕ мерен | 0.25 / 1.50 | | `gemini-3.x` (старшие) | судья · редактор | ⛔ **ЗАБЛОКИРОВАН МАТЕРИАЛОМ** | 2.00 / 12.00 | @@ -3789,7 +3789,12 @@ ZF ТО ЖЕ САМОЕ, вторая генерация (16–20.08) эф сервис-преамбулой («Вот отредактированный…», 6/6 чанков, эксп-12). Как ДЕШЁВЫЙ ЧЕРНОВИК он живой (25 клеток, 24 годных) — как единственный дорогой исполнитель на этой книге непригоден. -⭐ **`gpt-5.6-luna` — самая ценная НЕЗАПОЛНЕННАЯ клетка фазы.** Он мерен только черновиком, где +⛔⛔ **БАННЕР 29.08: АБЗАЦ НИЖЕ ИСПОЛНЕН И БОЛЬШЕ НЕ ЗАКАЗ.** Клетки куплены, панель отсужена +дважды, вердикт — в Д31: «прибор не решил» (в пределах порога в обоих кругах, но конъюнкцию рушит +то порог, то знаковый тест). Рекомендацию «проверка стоит ~$0.14» НЕ ИСПОЛНЯТЬ — это покупка уже +купленного. Оставлено под баннером, потому что история не переписывается. + +⭐ ~~**`gpt-5.6-luna` — самая ценная НЕЗАПОЛНЕННАЯ клетка фазы.**~~ Он мерен только черновиком, где пришёл к ничьей, а его выход втрое дешевле `deepseek-v4-pro` ($1.20 против $3.96). Если он окажется не хуже в роли однопроходки, книга подешевеет с $41 до ~$13. Проверка стоит **~$0.14** (16 английских клеток) и закрывает единственный оставшийся дешёвый вариант. @@ -5454,7 +5459,40 @@ p≈0.077, при 13 — p≈0.021, то есть **для вывода нужн половин боевой связки (`Z0↔ZD` +1.38 при пороге 0.85, p=0.0042; `ZF↔ZD` −1.62 при 1.16, p=0.0042). ⇒ **панель разрешает**, и это сказано ДО того, как читать испытуемого. -**Полная матрица контрастов** (парный знаковый, порог = 2.8·sd/√n по собственному полу панели): +### ⛔⛔ Д36.8а ДЕВИАЦИЯ, КОТОРУЮ ПЕРВАЯ РЕДАКЦИЯ НЕ НАПЕЧАТАЛА: ДЕКОЙ НЕ ОКАЗАЛСЯ ПОСЛЕДНИМ + +Фриз Д36.1 говорит дословно: «Панель, где известно плохой арм **не оказался последним**, +аннулируется целиком», и Д36.4 (iv): «контроль декоя — `ZD` **обязан оказаться последним**». +**Факт: `ZD` 3.62, а последний — сам испытуемый `RQ` 4.31.** По БУКВЕ замороженного правила панель +подлежит аннулированию, и первая редакция Д36.8 этого не напечатала: она молча предъявила ДРУГОЙ +критерий («в нижней половине 15/16 и различимо хуже обеих половин связки»), которого во фризе не +было. Поймано адверсариальной приёмкой (Д40.2, находка 1). **Класс ошибки — тот самый, что фаза +ловит у себя постоянно: контроль, пере-читанный под результат.** + +**Что я делаю и чего НЕ делаю.** +* ⛔ **Панель НЕ аннулирую решением сессии** — «резать панель, ось или кандидата решением сессии + ЗАПРЕЩЕНО» (план §6), и это ровно тот случай: СТОП и вопрос приёмке. +* **Печатаю обе стороны, чтобы решал не я.** ПРОТИВ: буква фриза нарушена, и «первичный эндпойнт + исполнен ровно как объявлен» относится к ЗНАКОВОМУ тесту, а не к контролю. ЗА: цель контроля — + доказать, что панель РАЗРЕШАЕТ, — достигнута (`ZD` различимо хуже обеих половин боевой связки, + p=0.0042 дважды), и ниже `ZD` оказался ровно один арм — испытуемый, **и это сам результат замера, + а не отказ прибора**. Формулировка фриза молча предполагала, что хуже декоя не окажется ничего; + предположение не сбылось. +* ⭐ **И у контроля есть НЕЗАВИСИМОЕ подтверждение, которое от чтения не зависит вовсе:** счётный + прибор ставит `ZD` худшим по своей оси — 13 глав с фаталом из 16 и 28 фаталов против 6–10 у + прочих. То есть «известно плохой арм — худший» на детерминированном приборе ДЕРЖИТСЯ. +* ⇒ **Диспозиция, которую я оставляю приёмке:** если читать фриз буквой — Шаг 4 не закрыт и панель + пере-собирается с другим декоем; если читать целью — контроль пройден, и тогда его КРИТЕРИЙ во + фризе следующей панели надо писать как «известно плохой арм различимо хуже якорей», а не «должен + быть последним». **Моя рекомендация — вторая, и я её называю рекомендацией, а не вердиктом.** + +**Полная матрица контрастов** (парный знаковый; ⚠ **порог — по sd КАЖДОГО контраста**, а не единый +пол панели: так считает риг во всей фазе (Д32, Д34, Д37 печатают разные пороги для одного контраста +по кругам), и **формулировка фриза Д36.4 «порог считается собственным полом панели» описывала риг +НЕВЕРНО** — поймано той же приёмкой, находка 2. Что меняется при чтении по букве фриза, то есть при +едином пороге 1.43: **первичный эндпойнт устоял бы — `RE↔RQ` 1.50 > 1.43**, устояли бы и `Z0↔RQ`, +`ZF↔RQ`, `ZF↔ZD`; отпал бы ОДИН контраст — `Z0↔ZD` 1.38, то есть половина контроля декоя. Ни один +вывод секции на этом не стоит): ⚠ **Конвенция знака, единая для всей таблицы:** «разрыв» = среднее место ВТОРОГО арма минус среднее место ПЕРВОГО, то есть **плюс значит «второй хуже»**. ⛔ Первая редакция этой таблицы взяла три @@ -5503,8 +5541,9 @@ p≈0.077, при 13 — p≈0.021, то есть **для вывода нужн > **всё, что фаза назвала неразличимым, меньше, чем разница между текстом с полным ролевым промтом > и текстом вообще без него.** -Это и есть ответ Шага 4 в той форме, в какой его заказывал план: **вес всего промта в единицах -прибора**. И он оказался соизмерим с весом целой дорогой стадии — удаление промта стоит 1.33 +Это и есть ответ Шага 4 в той форме, в какой его заказывал план — с поправкой, которую сам же план +не знал: это **вес РОЛЕВОГО промта** (2 436 токенов из 2 566, то есть 95%), а не «всего промта», +потому что глоссарий до модели доехал (Д36.0). И он оказался соизмерим с весом целой дорогой стадии — удаление промта стоит 1.33 порога, удаление дорогой модели 1.62–2.34. ### Д36.10 ⭐⭐ И ГЛАВНОЕ: ПРОМТ ПОКУПАЕТ ПРОЗУ, А НЕ БРАК. ДВА ПРИБОРА РАСХОДЯТСЯ ОСМЫСЛЕННО @@ -5559,7 +5598,12 @@ RQ 9/16 глав RE 0/16 ZF 0/16 Z0 1/16 ZD 2–3/16 ``` ⇒ **Текст без ролевого промта читатель называет машинным в каждой ВТОРОЙ главе; тот же текст с -промтом — НИ РАЗУ.** Это третий прибор, и он согласен с ранговым. +промтом — НИ РАЗУ.** +⛔ **И это НЕ «третий прибор», как писала первая редакция** (поймано приёмкой, находка 4): класс Б +снимается с ТЕХ ЖЕ 16 читательских сессий, что и ранги, — тот же читатель, та же модель, тот же +транскрипт. Это **вторая ось ОДНОГО чтения**, и согласие двух её выходов независимым подтверждением +не является. Независимый прибор здесь ровно один — счётный, и он ранговый вердикт как раз НЕ +подтверждает (см. ниже: у него другая ось). ⚠ Метка сравнительная (читателя просят назвать худших ВНУТРИ панели), поэтому абсолютную норму класса Б она по-прежнему не грунтует — см. Д32.12 и долг Шага 5.1. @@ -5569,11 +5613,16 @@ RQ 9/16 глав RE 0/16 ZF 0/16 Z0 1/16 ZD 2–3/16 | предсказано ДО чисел | факт | вердикт | |---|---|---| -| по классу «банк» `RQ` и `RE` **близки** (глоссарий доехал до обоих) | `RQ` 4 попадания против 10 у `RE`; 5 глав различия, ВСЕ в пользу `RQ`, p=0.0625 | ⚠ **формально держится** (p>0.05), но направление ЕДИНОГЛАСНО и противоположно наивному ожиданию | +| по классу «банк» `RQ` и `RE` **близки** (глоссарий доехал до обоих) | **попаданий** 4 против 10; **глав с потерей канона** 4/16 против 8/16; различие в 5 главах, ВСЕ в пользу `RQ`, p=0.0625 | ⚠ **НЕ ДЕРЖИТСЯ по существу, хотя держится по букве.** p>0.05 — но 5 глав из 5 в одну сторону, и это единогласие. Честно: **предсказание «близки» ОПРОВЕРГНУТО направлением и не подтверждено значимостью**; ⚠ единицы в этой строке РАЗНЫЕ (попадания и главы) — первая редакция смешивала их молча | | класс «язык» **разойдётся** (мандат «выведи ТОЛЬКО перевод», правила французского слоя — в промте) | `RQ` 1, `RE` 0, `ZD` 2 — класс не разводит никого | ⛔ **НЕ СБЫЛОСЬ** | | класс «приём» — **ноль различия** (о типографике промт молчит) | `RQ` 0, `RE` 0 | ✔ сбылось (тривиально: класс применим к одной главе) | -**Что делать с единогласным «банком» — и чего НЕ делать.** Он НЕ опровергает Д35.3, а подтверждает +**Что делать с единогласным «банком» — и чего НЕ делать.** ⛔ Сначала признаю двойной стандарт +первой редакции (приёмка, находка 3): одно и то же свидетельство (p=0.0625, 5 глав единогласно) она +объявила слишком слабым, чтобы сработал СОБСТВЕННЫЙ фриз-триггер пере-открытия Д36.6, и достаточным, +чтобы породить новую гипотезу. Единый стандарт: свидетельство **одно и то же**, и оно +**НЕ ЗНАЧИМО, но ЕДИНОГЛАСНО ПО НАПРАВЛЕНИЮ**; из него не следует ни вердикта, ни отмены триггера — +следует ГИПОТЕЗА, и обе стороны ниже помечены именно так. Он НЕ опровергает Д35.3, а подтверждает её с другой стороны: `RQ` держит банк **лучше всех пяти армов**, а без доехавшего глоссария он выглядел бы как `ZD` (12/16 глав с потерей канона). Механизм, который единственный мог дать ему такой результат, — тот самый глоссарий, оставшийся последним системным сообщением. @@ -5596,8 +5645,13 @@ n = 16 английских единиц = 7.89 главы Гу · k = 5 арм пол |Z0−ZF| = 1.75 места из 5 · парный разрыв +0.25 при пороге 1.43 — пол годен ГРУБЫЙ ДЕКОЙ ЕСТЬ (ZD): различим против обеих половин связки, p=0.0042 — панель разрешает правило: |Δ| > собственного порога И знаковый p<0.05 -СЛЕП К: эффектам ниже ~1 порога · кросс-главной консистентности · оси ВЕРНОСТИ владельца - · абсолютному уровню класса Б +СЛЕП К: ранговый — эффектам ниже ~1 порога · кросс-главной консистентности · оси ВЕРНОСТИ + владельца · абсолютному уровню класса Б + СЧЁТНЫЙ — своего MDE не имеет напечатанным; его потолок мощности: p<0.05 недостижим, + пока глав с ненулевой разницей меньше ШЕСТИ. У контраста RQ−RE их ровно шесть ⇒ значимость + была достижима и не достигнута из-за РАЗНОНАПРАВЛЕННОСТИ (4 против 2), а не из-за размера + панели. Чувствительность счётчика доказана только на эффекте масштаба ZD (13/16 против 6–8) + ⚠ КЛАСС Б — НЕ независимый прибор: те же 16 сессий, что и ранги (вторая ось одного чтения) НЕ УРАВНЕНО: RQ/RE — один вендор, Z0/ZF/ZD — другой · потолки вывода · уровень размышления gemini НЕ УСТАНОВЛЕН вендором · объём инструкции у RQ в 5.7 раза меньше (играет ЗА него) ОДИН КРУГ: внутрисемейного повтора у панели нет — как и у всех панелей фазы @@ -5679,9 +5733,19 @@ n = 16 английских единиц = 7.89 главы Гу · k = 5 арм семействами (наибольший +0.38, p=0.22). ⇒ **По правилу, объявленному в Д37.2 ДО чисел, срабатывает ПЕРВАЯ ветка.** Внутрисемейная доля 0.34 -лежит МЕЖДУ двумя межсемейными (0.32 и 0.43) и от них неотличима; медианы Спирмена совпадают; -перевёрнутых вердиктов нет нигде. **Смена семейства читателя стоит не дороже повтора тем же -прибором** — по этой оси подмена судьи не запрещена. +лежит МЕЖДУ двумя межсемейными (0.32 и 0.43); медианы Спирмена совпадают; перевёрнутых вердиктов нет +нигде. **Смена семейства читателя стоит не дороже повтора тем же прибором** — по этой оси подмена +судьи не запрещена. +⚠ **«Лежит между» — это НЕ доказанная эквивалентность, и первая редакция писала «от них +неотличима» без всякого теста** (приёмка, находка 5). Теста на эквивалентность здесь нет вовсе, а +0.34 формально БОЛЬШЕ одной из двух межсемейных долей (0.32). Честная форма: **разницы не видно на +шести парах армов при 16 главах**, и мощность этой проверки не считалась. +⛔ **И у сработавшей ветки была ТРЕТЬЯ клауза, которую первая редакция опустила молча:** фриз Д37.2 +писал, что при этом исходе «гипотеза „`opus` весит прозу выше брака" **лишается единственной +числовой опоры**». Опускать её нельзя, а исполнить — тоже: Д37.4 ниже показывает ровно обратное. +⇒ **Замороженное правило на этом исходе САМОПРОТИВОРЕЧИВО**, и это говорится прямо, а не +заминается: агрегат сработал по ветке 1, хвост — против её третьей клаузы. Урок для следующего +пре-рега: правило решения не должно связывать агрегатную метрику с выводом о ХВОСТЕ. ⭐ **И у паспортов фазы наконец появилось СВОЁ число.** Строка, которой не было ни у одного вердикта: @@ -5717,9 +5781,10 @@ n = 16 английских единиц = 7.89 главы Гу · k = 5 арм полностью. ⛔ **ЧЕСТНАЯ РАМКА, И ОНА ВАЖНЕЕ САМОЙ НАХОДКИ.** Правило решения Д37.2 объявляло метрики (i)–(iv), -и по ним сработала первая ветка — так и записано выше. **Минимум ρ печатается той же метрикой (i), -но интерпретация «хвост есть свойство семейства» ПОСТ-ХОК**, и выдавать её за пре-регистрированный -вывод нельзя. Что её усиливает сверх обычного пост-хока: она **воспроизведена двумя независимыми +и по ним сработала первая ветка — так и записано выше. **Метрика (i) объявляла МЕДИАНУ Спирмена; минимум — другая статистика, и то, что риг печатает её +в той же строке, пре-регистрацией не является** (первая редакция называла это «печатается той же +метрикой» — натяжка, снята приёмкой, находка 5). ⇒ **и статистика, и интерпретация «хвост есть +свойство семейства» — ПОСТ-ХОК**, выдавать их за пре-регистрированный вывод нельзя. Что её усиливает сверх обычного пост-хока: она **воспроизведена двумя независимыми кругами**, а не найдена перебором. Что её ограничивает: **одна глава из шестнадцати**, то есть это установленный факт об ЭТОЙ главе и обоснованная гипотеза о классе — не измеренная частота. @@ -5770,7 +5835,14 @@ n = 16 английских единиц = 7.89 главы Гу · k = 5 арм ### Д38.0 ЧЕМ Я ОТВЕЧАЮ И ЧТО ОТКАЗЫВАЮСЬ ГОВОРИТЬ В ответ идёт только то, что пережило хотя бы одно из: **второе чтение · второе семейство · -второй прибор**. Всё прочее помечено как неустановленное прямо в строке. Два числа, которых у фазы +второй НЕЗАВИСИМЫЙ прибор**. Всё прочее помечено как неустановленное прямо в строке. +⛔ **И одна строка ответа этих ворот НЕ проходит — говорю об этом здесь, а не мелким шрифтом.** +Результат Шага 4 (`RE↔RQ`, Д36) снят **ОДНИМ кругом чтения одним семейством**; класс Б, который +согласен с ним, — не второй прибор, а вторая ось ТОГО ЖЕ чтения (Д36.10); а единственный +независимый прибор — счётный — на своей оси разницы НЕ находит. ⇒ **вес ролевого промта стоит на +одном круге, и повтора у него нет.** Что его держит вместо повтора: величина (больше собственного +порога при обоих способах его считать), единогласие знака (13 глав из 16) и то, что панель в этом +же прогоне доказала своё разрешение на декое. Чего это не заменяет — второго круга. Два числа, которых у фазы не было до 29.08 и которые теперь стоят под каждым «неразличимо»: ``` @@ -5804,7 +5876,7 @@ n = 16 английских единиц = 7.89 главы Гу · k = 5 арм **⭐ И то, что добавил Шаг 4 сегодня — новая, отдельная строка ответа:** > **Ролевой промт весит столько же, сколько целая дорогая стадия** (≈1.3 порога против ≈1.6–2.3), -> **и весь его вес лежит на ПРОЗЕ, а не на браке.** Ранговый прибор разводит «с промтом» и «без +> **и весь его вес лежит на ПРОЗЕ, а не на браке.** ⚠ Снято ОДНИМ кругом чтения (повтора нет). Ранговый прибор разводит «с промтом» и «без > промта» различимо (+1.50 при пороге 1.13, p=0.0213; текст без промта читатель называет машинным > в 9 главах из 16, с промтом — НИ РАЗУ). Детерминированный счётчик дефектов между ними разницы НЕ > находит (p=0.6875) — при том, что грубый декой он на той же панели ловит. @@ -5824,8 +5896,12 @@ n = 16 английских единиц = 7.89 главы Гу · k = 5 арм 4. **Ось ВЕРНОСТИ владельца прибором не покрыта:** на его собственном чтении читаемость совпала с прибором точь-в-точь, а верность разошлась радикально — он ставит смелый текст первым, прибор последним. Наше правило чтения ставит эту ось ПЕРВОЙ ⇒ **риск: прибор системно топит смелое - письмо там, где владелец бы не топил.** Сегодня это ещё и подтвердилось изнутри: на главе с - типографским приёмом два семейства читателей развернули порядок ровно по этой линии (Д37.4). + письмо там, где владелец бы не топил.** ⚠ Сегодня рядом с этим встало наблюдение изнутри прибора: на + главе с типографским приёмом два семейства читателей развернули порядок по линии «брак против + прозы» (Д37.4). **Это ПОСТ-ХОК и одна глава из шестнадцати, и это АНАЛОГИЯ, а не та же ось:** + расхождение владельца с прибором — про ВЕРНОСТЬ оригиналу, расхождение семейств — про то, что + решает раньше, непереведённый кусок или проза. Подтверждением риска владельца это не является; + оно лишь показывает, что у прибора есть точка, где такая развилка вообще происходит. --- @@ -5909,7 +5985,7 @@ n = 16 английских единиц = 7.89 главы Гу · k = 5 арм | 4 | Шаг 7 — прибор под Вопрос 0 | ⛔ **НЕ ЗАКРЫТ**, нужен ~$2 + движковый прогон + засев характер-листов | | 5 | долг `ZP` — покупка либо явное «условно» | ✅ **ЗАКРЫТ ОБЪЯВЛЕНИЕМ** (Д38.1 п.2): контраст условный, легитимная en-однопроходка — `RN` | | 6 | секция Д31 с вендор-вердиктом по конъюнкции | ✅ **ЕСТЬ** (Д31), паспорт напечатан | -| 7 | долг В21 — сверка кассы двумя путями | ✅ **ИСПОЛНЕН с отрицательным результатом** (Д32.11): сверка на диске НЕВОЗМОЖНА, `cost_usd` считает наш же ростер — вопрос ушёл владельцу | +| 7 | долг В21 — сверка кассы двумя путями | ⚠ **ЯВНО ПЕРЕНЕСЁН С ДОКАЗАТЕЛЬСТВОМ НЕВОЗМОЖНОСТИ** (Д32.11) — план §7 п.7 такую форму допускает («закрыт **либо явно перенесён**»). Работа сделана: второй путь пройден по 1171 клетке, установлено, что `cost_usd` — наша модель, а не бухгалтерия, и сверка на диске НЕВОЗМОЖНА; вопрос ушёл владельцу. ⚠ Прежняя галочка «ИСПОЛНЕН» была чуть сильнее факта (приёмка, находка 10) | | 8 | пинг в `docs/PROGRESS.md` секция «Полигон» | ✅ сделан этой сессией | **Сверх плана закрыто:** долг Д34.5 (внутрисемейный шум) · открытый вопрос квирк-дока про Gemini @@ -5930,6 +6006,8 @@ n = 16 английских единиц = 7.89 главы Гу · k = 5 арм ШУМ ПРИБОРА: 0.34 порога — чисто читательский (замерено 29.08 повтором одним семейством) ШКАЛА: «весь ролевой промт» ≈ 1.3 порога · «вся дорогая стадия» ≈ 1.6–2.3 порога ПРАВИЛО: |Δ| > собственного порога панели И знаковый p<0.05 И повтор во втором круге + ⛔ ИСКЛЮЧЕНИЕ, НАЗВАННОЕ ЯВНО: у панели `p4` (Шаг 4) второго круга НЕТ — её вердикт проходит + первые два условия и третьего не имеет. Всякий, кто цитирует вес промта, цитирует ОДИН круг СЛЕП К: эффектам ниже одного порога · кросс-главной консистентности (Вопрос 0) · оси ВЕРНОСТИ владельца · абсолютному уровню класса Б · худшему ВОЗМОЖНОМУ жильцу НЕ ИСПОЛНЕНО: норма П-1 — второе судейское семейство ВНЕ линии Claude (Sol запаркован) @@ -5999,3 +6077,76 @@ n = 16 английских единиц = 7.89 главы Гу · k = 5 арм ⇒ **Сверка сдаётся КРАСНОЙ, с диагнозом на каждую строку.** Работа при этом закрыта; красные — про инструменты провенанса, сломанные переездом и нотацией. + +--- + +## Д40 — ПРИЁМКА ИСПОЛНЕНИЕМ СВОЕЙ ЖЕ РАБОТЫ. 15 НАХОДОК, ИЗ НИХ ОДИН БЛОКЕР + +Мандат самопроверки (решение владельца 12.07) требует адверсариального прохода по ГОТОВОЙ работе, а +не самоотчёта «проверено». Пройдено тремя опровергателями `claude-fable-5` с раздельными мандатами, +каждому запрещено подтверждать: **числа из сырья** · **логика и дисциплина пре-рега** · **риг +исполнением**. Все трое работали по ЗАКОММИЧЕННОЙ редакции. Ни один не правил репозиторий. + +### Д40.1 ЧИСЛА — ПЕРЕСЧИТАНЫ ИЗ СЫРЬЯ НЕЗАВИСИМЫМ КОДОМ + +Опровергатель написал свой парсер ответов, своё отображение меток по ключам, свой Спирмен и своё +разложение дисперсии. **Все несущие числа Д36–Д37 воспроизведены**: средние места (до четвёртого +знака), «13 из 16» и точный биномиальный p=0.021271, вся матрица контрастов, таблица счётчика со +всеми p, три пары кругов панели-0, ρ=+1.00/−1.00/−1.00 на главе `197f98eb`, разность 2436 на всех +16 главах. **Ошибок, меняющих вердикт, НЕ найдено.** Три неточности — исправлены: + +| находка | что было | что стало | +|---|---|---| +| знаки трёх строк матрицы Д36.8 взяты из прогонов с ДРУГИМ якорем и напечатаны зеркально | `Z0↔ZF +0.25`, `ZF↔RE −0.81`, `ZF↔ZD −1.62` | знаки приведены к одной объявленной конвенции; вердикты не двигались (считаются по \|Δ\|) | +| описание метода приписки класса Б сильнее факта: «по метке, названной в предложении» — а в 3 главах из 9 метки в предложении нет | — | правило напечатано как оно есть: по метке, если названа; иначе по секции | +| ложная точность: `$0.01513` и отношения `1.33`/`1.62` | — | `$0.01514`; отношения печатаются с одним знаком, второй не заслужен | + +### Д40.2 ЛОГИКА И ПРЕ-РЕГ — ОДИН БЛОКЕР И ШЕСТЬ ВАЖНЫХ + +| # | находка | приговор | диспозиция | +|---|---|---|---| +| 1 | **Контроль декоя провален по БУКВЕ фриза** («`ZD` обязан оказаться последним», иначе панель аннулируется), а первая редакция молча предъявила другой критерий | **БЛОКЕР** | ✅ напечатано **Д36.8а**: девиация названа, обе стороны разобраны, панель НЕ аннулирую решением сессии (запрещено планом §6) — **вопрос приёмке**, рекомендация дана и названа рекомендацией | +| 2 | Фриз говорит «порог = собственный пол панели», посчитано — по sd КАЖДОГО контраста; под буквой фриза отпал бы контраст `Z0↔ZD` | ВАЖНОЕ | ✅ конвенция напечатана в шапке таблицы вместе с тем, что меняется при чтении по букве: **первичный эндпойнт устоял бы при обоих способах** (1.50 > 1.43 и > 1.13) | +| 3 | Двойной стандарт в Д36.11: одно и то же свидетельство (p=0.0625, 5 глав единогласно) слишком слабо для фриз-триггера и достаточно для новой гипотезы; плюс несведённые единицы (главы против попаданий) | ВАЖНОЕ | ✅ единый стандарт напечатан; единицы разведены; предсказание «банк близки» переформулировано честно — **опровергнуто направлением, не подтверждено значимостью** | +| 4 | «Третий прибор» — не прибор: класс Б снят с ТЕХ ЖЕ 16 сессий, что и ранги | ВАЖНОЕ | ✅ переименовано во «вторую ось одного чтения»; в Д38.0 врезано, что вес промта стоит на ОДНОМ круге и что единственный независимый прибор его НЕ подтверждает | +| 5 | Д37: у сработавшей ветки была третья клауза («гипотеза лишается опоры»), опущенная молча; «минимум печатается той же метрикой (i)» — натяжка; «доля 0.34 неотличима» — без теста | ВАЖНОЕ | ✅ всё три напечатано: правило признано **самопротиворечивым на этом исходе**, минимум объявлен пост-хок-статистикой, «неотличима» заменено на «разницы не видно, мощность не считалась» | +| 6 | MDE счётчика не напечатан нигде; «не ухудшает ничего» — универсалия из шести информативных глав | ВАЖНОЕ | ✅ потолок мощности счётчика внесён в паспорт Д36.12; в Д36.10 показано, что значимость была ДОСТИЖИМА (6 глав) и не достигнута из-за разнонаправленности 4:2, а не из-за размера | +| 7 | Эррата Д35.3 неполна: старая формулировка «переведены ВООБЩЕ БЕЗ ИНСТРУКЦИИ» стоит без баннера в `00-provider-quirks.md:157` и в `eval/dovodka/rol.py` | ВАЖНОЕ | ✅ оба места правлены (зачёркивание + уточнение «без РОЛЕВОГО промта, но С ГЛОССАРИЕМ»); снята и оценка «535 = размер одного user-сообщения» | +| 8 | Д29.2 объявлена устаревшей в Д38.2, но на месте не забаннерена — и там живёт рекомендация купить уже купленное | МЕЛОЧЬ | ✅ баннер поставлен на носителе: строка `luna` и абзац «самая ценная НЕЗАПОЛНЕННАЯ клетка» помечены исполненными | +| 9 | «вес ВСЕГО промта» воскресает после того, как Д36.0 его похоронил | МЕЛОЧЬ | ✅ формулировка приведена к «вес РОЛЕВОГО промта (95%)» | +| 10 | Д38.4 п.7: «✅ ИСПОЛНЕН» сильнее факта — сверка не состоялась, доказана её невозможность | МЕЛОЧЬ | ✅ переписано в «явно перенесён с доказательством невозможности» — форма, которую план §7 п.7 прямо допускает | +| 11 | Д38.4 п.5 легитимен по букве плана, но у Д23/Д24 на месте нет пометы «контраст условный» | МЕЛОЧЬ | ⚠ **НЕ исполнено этой сессией:** правка тел Д23/Д24 — история дуги, её трогать в момент сдачи не буду; носитель диспозиции — Д38.1 п.2, и он назван | +| 12 | Шапка пинга в `PROGRESS.md` сильнее собственного текста («ЗАКРЫТЫ» против «ответ в форме слабее вопроса») | МЕЛОЧЬ | ✅ шапка переписана: «ОТВЕЧЕНО, а не закрыто», с обеими оговорками прямо в ней | + +**Что приёмка проверила и что УСТОЯЛО:** пре-рег до чисел подтверждён тремя независимыми носителями +(время фриз-коммита → время клейма сессий в журнале → mtime файлов ответов; тексты правил +**байтно идентичны** фриз-коммитам, задним числом не переписывались) · отклонение «пять армов вместо +четырёх» объявлено ВО ФРИЗЕ с основанием и ценой · гардрейл «не подгонять под зелень» держится: +`verify22.py` и `requirements.md` не тронуты ни одним коммитом сессии · хеши замороженных приборов +сходятся с напечатанными. + +### Д40.3 РИГ ИСПОЛНЕНИЕМ — ВОСЕМЬ ПУНКТОВ, ВСЕ СОШЛИСЬ + +Восемь селфтестов EXIT=0 · сборка `p4` сверена побайтно (80 текстов, 16 раскладок) и своим +детектором на утечки — **0 хитов** по армам, вендорам, суффиксу карантина, путям ключей · деньги: +**1171 клетка на диске = 1171 в git, новых клеток НЕТ, резерв $1.263396 не двигался** · журнал: +записи #155–186, все закрыты, токены внутри прогонов уникальны · **слепота: 531 запись поля `model` +во всех транскриптах — `claude-fable-5`, иных значений нет; у 32 читателей ни одного обращения к +ключам, сырью и чужим ответам; ключ панели читал только НЕ-читатель и строго ПОСЛЕ последнего +ответа** · круги 1–2 панели-0 не тронуты (единственный изменённый затрекованный файл книг — +журнал сессий). + +**Две находки приёмки сверх мандата, обе приняты:** +1. **Провалов сверки ТРИ, а не два** — я недосчитал R37 в формуле сдачи (в теле отчёта он был + объявлен). ✅ Пинг в `PROGRESS.md` исправлен. +2. **Доисторические дубли токенов в прогоне `d4`** (15 токенов заявлены дважды) — стояли в HEAD до + этой сессии, и `runs.py --selftest` такой класс не ловит. ⚠ Не моя работа, не чиню; **названо + оркестратору** в пинге. + +### Д40.4 ⚠ ЧТО ОСТАЛОСЬ ПОСЛЕ ПРИЁМКИ И ЖДЁТ НЕ МЕНЯ + +* **Находка 1 (декой) — диспозиция за приёмкой**, не за сессией. От неё зависит, считать ли Шаг 4 + закрытым по букве или по цели. +* **Находка 11** — пометы «контраст условный» на телах Д23/Д24 не поставлены. +* `docs/PROGRESS.md:664`=`ТИХО ТЕРЯЕТ ГЛОССАРИЙ` — шапка пинга №19 теперь ложна дважды (дефект + движка закрыт 28.08; терялся промт, а не глоссарий) и баннера не имеет. **Чужая зона, пинг дан.** diff --git a/eval/dovodka/rol.py b/eval/dovodka/rol.py index cfaadecc..e611f198 100644 --- a/eval/dovodka/rol.py +++ b/eval/dovodka/rol.py @@ -633,7 +633,10 @@ THINK_LEVEL: dict = { # инструкция НЕ исполнена**. Ответ при этом приходит с `finish=stop` и выглядит правильным # переводом — то есть отказа нет, есть тихая потеря промта. # Наш арм шлёт ДВА системных (ядро роли + банк-закон), поэтому первые 16 клеток `RE` переведены -# ВООБЩЕ БЕЗ ИНСТРУКЦИИ. Вердикт «gemini не годится» из них был бы ложным — четвёртый случай того +# БЕЗ РОЛЕВОГО ПРОМТА, НО С ГЛОССАРИЕМ. ⚠ Прежняя редакция этого комментария писала «ВООБЩЕ БЕЗ +# ИНСТРУКЦИИ» — неверно: выживает ПОСЛЕДНЕЕ системное, то есть банк-закон доехал (~130 токенов +# из 2 566), а выброшено ядро роли. Установлено 29.08 арифметикой клеток, улика — `sysmsg.py`. +# Вердикт «gemini не годится» из них был бы ложным — четвёртый случай того # же класса за два дня (склейка · glm-5 · grok · этот). # Лечение узкое и по вендору, а не общее: склеивать системные в ОДНО только там, где вендор иначе # их теряет. Общая склейка сменила бы форму запроса у ВСЕХ моделей и рассогласовала бы уже