Complete Gemini test with proper max_tokens: gemini-3.1-pro also inverts the double-negation trap, so only gpt-5.4 of three frontier families fixes within-chunk comprehension
This commit is contained in:
parent
a19107479d
commit
73a45848db
2 changed files with 8 additions and 8 deletions
|
|
@ -19,7 +19,7 @@
|
|||
- **Претензия 2 кросс-граница = НЕ доминирует в срезе.** T5/T6 локально самодостаточны; ±1-reference (A-ref) дал байт-идентичный выход (чинить нечего); whole-chapter (P1c) единственный явно связал антецедент (1 датапоинт).
|
||||
|
||||
**ПАРТИЯ 2 ВЫПОЛНЕНА (по запросу владельца добавлены Gemini+Grok фронтир-редакторы — честный тест в €2.3; итог обеих партий ≈$8.5 across 6 ключей, каждый под лимитом).** Ключевые УТОЧНЕНИЯ:
|
||||
- **T1-«capability floor» — MODEL-SPECIFIC, не общий фронтир (поправка партии-1 n=1):** gpt-5.4 чинит инверсию двойного отрицания, а **grok-4.3 (фронтир, reasoning-ON) её НЕ чинит — инвертирует как дешёвый glm** (заякорился на черновике; мини-проба grok на СВЕЖЕМ предложении верна → провал именно в РЕДАКТОРСКОЙ задаче). Gemini-редактор ИНКОНКЛЮЗИВЕН (mandatory-thinking съел max_tokens=8000 → обрыв finish=length; урок: Gemini-editor нужен ≥16–20k ток × $12/M = COGS-враждебно; €2.3 исчерпан). grok-4.5 — регион-лок (403, оба ключа). ⇒ смысл (П2) чинит **gpt-5.4 конкретно**, не «любой фронтир».
|
||||
- **T1-«capability floor» — MODEL-SPECIFIC, не общий фронтир (поправка партии-1 n=1):** gpt-5.4 чинит инверсию двойного отрицания, а **grok-4.3 (фронтир, reasoning-ON) её НЕ чинит — инвертирует как дешёвый glm** (заякорился на черновике; мини-проба grok на СВЕЖЕМ предложении верна → провал именно в РЕДАКТОРСКОЙ задаче). **gemini-3.1-pro тоже ИНВЕРТИРУЕТ** (первый батч был мис-конфигом max_tokens=8000 → обрыв; прицельный ре-тест с max_tokens=20000 на T1/T2 дал полные выходы: «не знал ни один человек» + «всё изменилось» = инверсия+сплющивание; плюс COGS-урок: Gemini-editor ≥16–20k×$12/M ×10 к glm/grok; итог €2.21, в лимите). grok-4.5 — регион-лок (403, оба ключа). ⇒ **из 3 фронтир-семей ТОЛЬКО gpt-5.4 чинит смысл-ловушку** — П2 чинит gpt-5.4 конкретно, не «любой фронтир».
|
||||
- **Абзацы (П1): grok-disc ЛУЧШИЙ (mean 4.22)** но CJK+провал T1; A-2pass 3.33; **кривая нарезки: крупнее чанк = ДЕШЕВЛЕ выходных токенов И лучше абзацы, 0 ретраев** (оптимум 3200c/глава) → поддержка `edit=крупная единица` (D35.7) по COGS И качеству.
|
||||
- **Fidelity re-gate (D34.3): пере-прогон НЕ чист** — средняя верность 88–94, но **13 катастроф + 21 инверсия редактуры на ~10 чанках** (ch10.1 both-judge fid 60); класс инверсий D34.3 подтверждён на хвосте → флаги на span-ревью, пере-прогон засчитан НЕ полностью.
|
||||
- **Ранжирование финалистов (гл.19/17/18): стиль F-disc(gpt-5.4)>A-2pass>P0 (робастно); holistic-верность P0>прочих — НО P0 несёт T1-катастрофу, панель её не поймала = ЛИТЕРАЛ-СМЕЩЕНИЕ судей** (урок exp12/мемо eval-aggregation) → доверять span-уровню, не holistic-скаляру.
|
||||
|
|
|
|||
|
|
@ -253,7 +253,7 @@ usage→$: `(in·pin + (comp + reason)·pout)/1e6`; `reason`= из `completion`
|
|||
|
||||
## 2Б. ПАРТИЯ 2 — 3-семейный фронтир + fidelity re-gate + ранжирование финалистов + кривая нарезки
|
||||
|
||||
> Трата партии 2: Gemini $2.20 (≈€2.0, на границе €2.3 — больше не тратил), Kimi +$2.7, OpenAI +$0.9, ZAI +$0.14, XAI $0.15, DeepSeek $0.02. **Итог обеих партий ≈ $8.5** across 6 ключей (каждый под лимитом). grok-4.5 — региональный лок (`403 not available in your region`, ОБА ключа, не бюджет); тестим доступный grok-4.3.
|
||||
> Трата партии 2: Gemini $2.39 (≈€2.21, вкл. прицельный ре-тест T1/T2 — в лимите €2.3), Kimi +$2.7, OpenAI +$0.9, ZAI +$0.14, XAI $0.15, DeepSeek $0.02. **Итог обеих партий ≈ $8.5** across 6 ключей (каждый под лимитом). grok-4.5 — региональный лок (`403 not available in your region`, ОБА ключа, не бюджет); тестим доступный grok-4.3.
|
||||
|
||||
### 2Б.1. Capability floor — MODEL-SPECIFIC, не общий фронтир (ключевая поправка партии 1)
|
||||
|
||||
|
|
@ -264,11 +264,11 @@ usage→$: `(in·pin + (comp + reason)·pout)/1e6`; `reason`= из `completion`
|
|||
| glm-5 (дешёвый) P0/P1a/A-2pass | ✗ **инверсия** (все промпты) | 1.91→3.33 | 0.47→0.19 | 2 | ~1.0 |
|
||||
| **gpt-5.4** F-base/F-disc | **✓ чинит** (оба промпта) | 1.58 / 2.45 | 0.58 / 0.37 | 0 | ~1.02 |
|
||||
| **grok-4.3 ON** X-base/X-disc | ✗ **инверсия** (оба! якорится на черновике) | 1.74 / **4.22** | 0.50 / 0.26 | 2 / 6 | ~0.97 |
|
||||
| gemini-3.1-pro G-base/G-disc | **инконклюзивно** (обрыв) | 1.52 / 1.95 | 0.60 / 0.53 | ≤1 | **0.65–0.76 ⚠** |
|
||||
| **gemini-3.1-pro** G-disc (ре-тест) | ✗ **инверсия** (T1) + сплющивание (T2) | — | — | 0 | ~1.0 |
|
||||
|
||||
- **T1 «capability floor» — НЕ универсален: gpt-5.4 чинит инверсию черновика, а grok-4.3 (фронтир, reasoning-ON) её НЕ чинит — инвертирует так же, как дешёвый glm.** Grok-редактор заякорился на ошибке черновика (мини-проба grok на СВЕЖЕМ предложении `他没有一个不知道的` дала верно → провал именно в РЕДАКТОРСКОЙ задаче «поймай ошибку черновика»). ⇒ **это не «любой фронтир чинит», а СПЕЦИФИЧЕСКАЯ компетенция gpt-5.4** (ловить двойное отрицание/инверсию черновика). Партия 1 (n=1 фронтир) это переобобщила — партия 2 поправила.
|
||||
- **T1 «capability floor» — MODEL-SPECIFIC: из ТРЁХ фронтир-семей ТОЛЬКО gpt-5.4 чинит инверсию двойного отрицания; grok-4.3 И gemini-3.1-pro её ИНВЕРТИРУЮТ** — как дешёвый glm. Grok-редактор заякорился на ошибке черновика (мини-проба grok на СВЕЖЕМ предложении `他没有一个不知道的` дала верно → провал именно в РЕДАКТОРСКОЙ задаче «поймай ошибку черновика»). ⇒ **это не «любой фронтир чинит», а СПЕЦИФИЧЕСКАЯ компетенция gpt-5.4** (2 из 3 фронтиров проваливают). Партия 1 (n=1 фронтир) это переобобщила — партия 2 (3 семьи) прочно поправила.
|
||||
- **grok-4.3 + дискурс (X-disc) — ЛУЧШИЕ абзацы из всех (mean 4.22)**, но CJK-утечка 6 и провал T1. Профиль: отличная переверстка, слабое понимание.
|
||||
- **gemini-3.1-pro как редактор — ИНКОНКЛЮЗИВНО (харнес-дефект + COGS):** mandatory-thinking съел `max_tokens=8000` → `finish=length`, выход обрезан (comp 317–646 ток, len/P0 0.65–0.76 = потеря контента). Честный урок: **Gemini-редактору нужен `max_tokens`≥16–20k, а при $12/M (thinking биллится как output) это ~$0.15–0.25/вызов — COGS-враждебно** (×10 к glm/grok, ×2–3 к gpt-5.4). €2.3 исчерпан на обрезанных вызовах → Gemini-качество не оценено (мой мис-конфиг max_tokens; вписано в урок).
|
||||
- **gemini-3.1-pro как редактор:** первый прогон (G-base/G-disc, `max_tokens=8000`) — мис-конфиг: mandatory-thinking съел бюджет → `finish=length`, обрыв (comp 317–646, len/P0 0.65–0.76). **Прицельный ре-тест с `max_tokens=20000`** (ch7.0/ch8.1, полные выходы `finish=stop`): T1 → «не знал ни один человек» = **ИНВЕРСИЯ**, T2 → «всё изменилось» = **сплющивание**. Т.е. Gemini НЕ лучше дешёвого на смысл-ловушках. **Плюс COGS-урок: Gemini-редактору нужен `max_tokens`≥16–20k × $12/M (thinking=output) = ~$0.10–0.12/вызов, ×10 к glm/grok** — COGS-враждебно И не качественнее. Итог Gemini-ключа $2.39 (€2.21, в лимите €2.3).
|
||||
|
||||
### 2Б.2. Fidelity re-gate (D34.3) — пере-прогон НЕ чист
|
||||
|
||||
|
|
@ -303,19 +303,19 @@ ch17+ch13 × 800/1600/3200/whole (жадная упаковка; flash-draft→g
|
|||
| Претензия | Потолок | Уточнённое доказательство | Ход |
|
||||
|---|---|---|---|
|
||||
| (1) абзацы | **ПРОМПТ + РАЗМЕР** (активация) | дискурс-промпт (P1a/F-disc/X-disc) + 2-пасс (A-2pass 3.33) + крупный чанк (кривая) двигают KPI; grok-disc лучший (4.22); фронтир-модель НЕ нужна | катить дискурс-промпт + крупная edit-единица; A-2pass если COGS позволит |
|
||||
| (2) внутри-чанк смысл | **MODEL-SPECIFIC** (gpt-5.4), не общий floor | gpt-5.4 чинит T1; glm-5 И grok-4.3 инвертируют; gemini инконклюзивно | селективная эскалация на **gpt-5.4** по смысл-риску (grok НЕ годится — тоже инвертирует) |
|
||||
| (2) внутри-чанк смысл | **MODEL-SPECIFIC** (только gpt-5.4), не общий floor | gpt-5.4 чинит T1; glm-5, grok-4.3 И gemini-3.1-pro — ИНВЕРТИРУЮТ (2 из 3 фронтиров провалили) | селективная эскалация на **gpt-5.4** по смысл-риску (grok/gemini НЕ годятся — инвертируют) |
|
||||
| (2) кросс-граница | не доминирует в срезе | A-ref null; P1c связал (1 датапоинт) | не строить Ф2-память под слабый сигнал |
|
||||
| верность пере-прогона | **есть хвост порчи** | re-gate: 13 катастроф + 21 инверсия на ~10 чанках | ревью флагов + omission-гард на reflow-армы |
|
||||
|
||||
### 2Б.6. Пересмотренная near-term рекомендация (на ратификацию оркестратора)
|
||||
|
||||
1. **Абзацы (П1):** дискурс-reflow-промпт (Ван Цуй) + сдвиг edit-единицы к КРУПНОЙ (3200c/глава — дешевле И лучше по кривой). A-2pass даёт топ-KPI, но добавляет пасс — взвесить vs крупный чанк (крупный чанк даёт похожий лифт БЕЗ +пасса и ДЕШЕВЛЕ). **Оба под omission-гард** (reflow-армы просели по holistic-верности — следить за атомами).
|
||||
2. **Смысл (П2):** селективная эскалация редактора на **gpt-5.4 конкретно** по смысл-риску (двойное отрицание/chengyu/инверсия черновика). **grok и gemini НЕ заменяют** (grok инвертирует, gemini COGS-враждебен/инконклюзивен). Не тотальный фронтир (портит абзацы у F-base, дорого).
|
||||
2. **Смысл (П2):** селективная эскалация редактора на **gpt-5.4 конкретно** по смысл-риску (двойное отрицание/chengyu/инверсия черновика). **grok и gemini НЕ заменяют** — оба ИНВЕРТИРУЮТ T1 (ре-тест gemini подтвердил), gemini ещё и COGS-враждебен. Не тотальный фронтир (портит абзацы у F-base, дорого).
|
||||
3. **CJK-гард** обязателен на deformat (A-layout) и на grok-выходах (утечка 6).
|
||||
4. **Пере-прогон:** ~10 re-gate-флагов на ревью до «засчитан».
|
||||
5. **Слепые пакеты Ступени II** (`exp14/monitor/monitor14.md`) — владельцу на человеческий вердикт «лучше фана» (арбитр, D30.7).
|
||||
|
||||
**Оговорки (методика-guard):** trap-набор мал (6, prev-boundary, без катафоры); T1 — детерм.-чистый, но 1 конструкция; holistic-fidelity судьи литерал-смещены (доверять спанам); gemini недооценён (мис-конфиг max_tokens, €2.3 исчерпан); кривая — 2 главы/0 ретраев; ИНТЕРИМ пре-скрин (D35), НЕ пилот Ф2.5. Смену дефолта ратифицирует ОРКЕСТРАТОР.
|
||||
**Оговорки (методика-guard):** trap-набор мал (6, prev-boundary, без катафоры); T1 — детерм.-чистый, но 1 конструкция; holistic-fidelity судьи литерал-смещены (доверять спанам); gemini полный батч был мис-конфигом max_tokens, но T1/T2 ре-тестнуты корректно (инвертирует); кривая — 2 главы/0 ретраев; ИНТЕРИМ пре-скрин (D35), НЕ пилот Ф2.5. Смену дефолта ратифицирует ОРКЕСТРАТОР.
|
||||
|
||||
## 3. Fidelity re-gate (D34.3) — свод в §2Б.2
|
||||
|
||||
|
|
|
|||
Loading…
Add table
Reference in a new issue