diff --git a/eval/dovodka/rol.py b/eval/dovodka/rol.py index 112f2650..be83003e 100644 --- a/eval/dovodka/rol.py +++ b/eval/dovodka/rol.py @@ -129,6 +129,7 @@ ARMS = {"RN": ("deepseek-v4-pro", 1), "RN2": ("deepseek-v4-pro", 2), "RG": ("glm-5", 1), "RGT": ("glm-5", 1), "RK": ("grok-4.3", 1), "RKT": ("grok-4.3", 1), # RKT — клетка блокера Б6, не куплена "RL": ("gpt-5.6-luna", 1), "RE": ("gemini-3.1-flash-lite", 1), "RET": ("gemini-3.1-flash-lite", 1), + "REL": ("gemini-3.1-flash-lite", 1), # ступень `low` — сопоставима с grok-дефолтом "RA": ("deepseek-v4-pro", 1), # тот же промт, ВОССТАНОВЛЕННЫЕ абзацы исходника "RC": ("deepseek-v4-pro", 1), # промт МИНУС рамка оценки, см. CUT "RB": ("deepseek-v4-pro", 1)} # рамка оценки ПЕРЕВЁРНУТА: брак = чужой язык @@ -468,7 +469,8 @@ THINK_LEVEL: dict = { # `reasoning_tokens` у Gemini ВСЕГДА 0 по построению слоя — считать надо # `total − prompt − completion`. Прежний комментарий «замерено, 0 ток.» # читал ровно то поле, которое наш же бюллетень объявил всегда нулевым. - "RET": "budget", # он же с размышлением: у Gemini своя ручка `thinking_budget`, не `effort` + "RET": "high", # он же на ВЕРХНЕЙ ступени + "REL": "low", # он же на `low` — та же ступень, что вендор-дефолт grok, для сопоставимости } @@ -509,7 +511,7 @@ def call_kwargs(model: str, msgs: list[dict], arm: str = "") -> dict: if lvl in (None, "off"): return kw eb = dict(kw.get("extra_body") or {}) - if lvl == "budget": + if lvl == "budget": # исторический режим, не используется: вендор принимает плоский effort # ⚠ У Gemini уровень задаётся БЮДЖЕТОМ, а не словом: `thinking_budget` в google-секции # (квирк-бюллетень :54). `-1` — динамический бюджет, то есть «думай сколько нужно». # ⛔ ПОПРАВКА 22.08 ПОСЛЕ СВЕРКИ С ВЕНДОР-ДОКОЙ. Прежний комментарий здесь утверждал, что