63 lines
9.3 KiB
Markdown
63 lines
9.3 KiB
Markdown
# Эксперимент 06. Экстракция терминов: локаль vs облако (write-path банка памяти)
|
||
|
||
Дата: 2026-07-04. Закрывает дыру **G1** реестра рисков (`architecture/06`: «качество популяции глоссария не измерено»). Скрипт: `eval/extract_bench.py`; сырьё: `eval/data/extract_bench/results.json`.
|
||
|
||
**Зачем.** Горячий путь банка памяти модель НЕ использует (детерминированный матч). Локаль касается банка в 2 точках: эмбеддинги (exp там же → bge-m3) и **экстракция кандидатов в глоссарий из сырого текста** (bootstrap write-path). Полигон exp03 мерил локаль как ПЕРЕВОДЧИКА (вердикт: не годится). Экстракция — другая, более лёгкая задача; здесь меряем её отдельно и **верифицированно**.
|
||
|
||
**Метод (в ответ на «сделай нормально, не обрывочно»):**
|
||
- **13 моделей:** 6 локальных (`qwen3-abliterated:8b/9b`, `qwen3:8b`, `qwen3-vojo`, `ruadapt-qwen3:8b`, `qwen3-abliterated:30b-a3b`) + 7 облачных (`deepseek-v4-flash`, `grok-4.20-non-reasoning`, `glm-4.5-air`, `kimi-k2.6`, `gemini-2.5-flash`, `gpt-5-mini`, + `deepseek-nothink` как дешёвый вариант без reasoning).
|
||
- **12 кейсов, 3 языка, эдж-кейсы:** zh (имена+реалии 送灶/祝福/秀才, алиас 王癞胡=王胡), ja (羅生門/朱雀大路, **западные имена через катакану** メロス→Мелос / セリヌンティウス→Селинунтий, буддийское 禅智内供 по эталону Стругацкого), en (Джон Картер/Конан/Филби — эдж на транскрипцию). Gold — сущности + канонический RU (accept-регэксп: Палладий/Поливанов/устоявшиеся).
|
||
- **Запросы — через рабочий `refusal_bench.call_provider` + канонический `providers.json`** (квирки уже верны: deepseek thinking-ON+`max_tokens 8000` — иначе reasoning съедает бюджет и `content` пуст; kimi temp=1/24k; gpt-5-mini `max_completion_tokens`+no-temp; gemini/glm thinking-off). Управление thinking у DeepSeek — `extra_body={"thinking":{"type":"..."}}` (офиц. доки, см. `00-provider-quirks`).
|
||
- **Каждый ответ верифицируется на здоровость** (пустой/echo/http/unparseable → ретрай с бо́льшим бюджетом → явный `HEALTH=failed`, **НЕ** засчитывается как recall 0 — урок прошлого обрывочного прогона). Метрики детерминированные, без судьи.
|
||
|
||
## Результаты
|
||
|
||
Агрегат по `health==ok` (recall = спот сущностей; render = доля найденных с каноническим RU; halluc = извлечённое, чего нет в тексте):
|
||
|
||
| Модель | тип | recall | render | halluc | n | сек | ok/all |
|
||
|---|---|---|---|---|---|---|---|
|
||
| qwen3-abliterated:8b | local | 0.98 | 0.48 | 0.0 | 3.9 | 5.1 | 12/12 |
|
||
| qwen3.5-abliterated:9b | local | 1.00 | 0.54 | 0.0 | 3.2 | 6.6 | 12/12 |
|
||
| qwen3:8b | local | 0.98 | 0.49 | 0.0 | 3.8 | 4.9 | 12/12 |
|
||
| qwen3-vojo | local | 0.98 | 0.51 | 0.0 | 3.4 | 3.4 | 12/12 |
|
||
| qwen3-abliterated:30b-a3b | local | 0.91 | 0.55 | 0.0 | 3.1 | 13.5 | 12/12 |
|
||
| ruadapt-qwen3:8b | local | 1.00 | 0.72 | 0.07 | 3.6 | 3.7 | **5/12** |
|
||
| **deepseek-v4-flash** | cloud | 0.97 | 0.85 | 0.0 | 3.3 | 8.9 | 12/12 |
|
||
| grok-4.20-non-reasoning | cloud | 0.98 | 0.69 | 0.0 | 3.2 | **1.1** | 12/12 |
|
||
| glm-4.5-air | cloud | 0.98 | 0.68 | 0.0 | 3.2 | 1.9 | 12/12 |
|
||
| **kimi-k2.6** | cloud | 1.00 | **0.96** | 0.0 | 3.5 | 38.2 | 12/12 |
|
||
| **gemini-2.5-flash** | cloud | 0.97 | 0.92 | 0.0 | 3.4 | **1.4** | 12/12 |
|
||
| gpt-5-mini | cloud | 0.95 | 0.67 | 0.0 | 4.4 | 2.5 | 12/12 |
|
||
| deepseek-nothink | cloud | 0.98 | 0.58 | 0.0 | 3.5 | 1.6 | 12/12 |
|
||
|
||
**Ключевая разбивка — render по языку** (пул из 5 локальных dense/MoE vs топ-3 облака deepseek/kimi/gemini):
|
||
|
||
| Группа | zh | ja | en |
|
||
|---|---|---|---|
|
||
| **локаль (пул)** | **0.26** | 0.53 | 0.82 |
|
||
| облако-топ | 0.75 | 0.98 | 1.00 |
|
||
|
||
Recall по языку у всех ~0.95–1.0 (спот не зависит от языка).
|
||
|
||
## Выводы (верифицированные)
|
||
|
||
1. **СПОТ сущностей — решённая задача для ВСЕХ, локаль включительно** (recall 0.95–1.0 на zh/ja/en). Кандидат-споттинг write-path можно гнать на дешёвой локальной 8b. Даже 0 галлюцинаций (кроме ruadapt).
|
||
2. **РЕНДЕР канонического RU — вот где разрыв, и он с крутым ЯЗЫКОВЫМ градиентом у локали:** en 0.82 (западные имена локаль транскрибирует нормально — Джон Картер/Конан), ja 0.53 (средне), **zh 0.26 (локаль проваливается)**. Облако-топ сильно везде (zh 0.75, ja 0.98, en 1.0).
|
||
3. **Провалы локали на zh — это прямая нонконформность стандарту Палладия** (реестр **B6**, эмпирически подтверждён): 阿Q→«Ах-Чу», 赵太爷→«Тяо Тай-Я», 祥林嫂→«Сяньлинсяо», 送灶→«Сув-цзя», 祝福→«Бэ-цзю», 羅生門→«Ро-сёмон», 朱雀大路→«Чжу-сюкэ-дайро» — фонетический мусор вместо Палладий-канона («А-кью», «Чжао»). Локаль не знает системы транскрипции zh→ru; это не «плохой перевод», а систематически неверная по стандарту транслитерация.
|
||
4. **Бо́льшая локаль НЕ помогает:** 30b-a3b render 0.55 ≈ 8b (0.48–0.55), но в 3–4× медленнее (13.5с vs 3–5с) и recall даже ниже (0.91). Для спота брать дешёвую 8b, не 30b.
|
||
5. **deepseek: thinking ПОМОГАЕТ рендеру** (0.85 с thinking vs 0.58 без) — reasoning вытаскивает канон реалий (согласуется с exp03). Но thinking-off deepseek на экстракции **здоров** (12/12, echo бьёт перевод, не JSON-вывод) — просто рендерит хуже (≈уровень локали).
|
||
6. **Лучший рендер-value — gemini-2.5-flash** (render 0.92 за 1.4с); kimi лучший по качеству (0.96), но 38с/дорого; deepseek-think 0.85/8.9с. grok/glm/gpt-5-mini слабее по рендеру (0.67–0.69).
|
||
7. **ruadapt-qwen3 — ненадёжен** (5/12 health, единственный с галлюцинациями) — как и предупреждал exp03 «понимание разрушено ru-адаптацией».
|
||
|
||
## Следствие для дизайна (write-path, уточняет Р4/G1)
|
||
|
||
Экстракцию разбить на две подзадачи, и разбивка **язык-зависима**:
|
||
- **(а) СПОТ кандидатов-спанов — локальная 8b** (recall ~0.98 на всех языках, дёшево/быстро, 0 галлюцинаций). Это дешёвый пре-пасс NER.
|
||
- **(б) РЕНДЕР dst — зависит от языка источника:** для **zh — обязательно облако/человек + детерминированная таблица Палладия** (локаль даёт мусор 0.26; даже облако лишь 0.75 — часть zh→ru реалий не имеет единого канона, нужен словарь B6); для **ja — облако** (локаль 0.53); для **en/западных имён — локаль потянет** (0.82), облако для надёжности. Рендер-модель по value — gemini-2.5-flash.
|
||
- Промоушен `auto→approved` — с человеком/судьёй (G1), особенно на zh, где даже сильная модель не гарантирует Палладий.
|
||
|
||
## Ограничения
|
||
|
||
12 кейсов (умеренно, не сотни), 1 прогон на ячейку (temp низкая), gold-render = мой набор accept-регэкспов канона (для спорных реалий — 送灶/洛中 — канон нестрогий, render занижен честно). Render — объективно более трудная для авто-оценки ось, чем recall; человеческая сверка на выборке усилит. Но языковой град**иент (zh≪ja≪en у локали) устойчив и с этим N.
|
||
|
||
Провенанс: `eval/extract_bench.py` (переиспользует `refusal_bench.call_provider` + `providers.json`), `results.json` с per-кейс `records`. Реальные PD-тексты `eval/data/samples`.
|