Skip to content

Свежий прогон 2026-07-03: полный грид + курируемый двуязычный отчёт - #3

Merged
gistrec merged 2 commits into
mainfrom
results-2026-07-03
Jul 3, 2026
Merged

Свежий прогон 2026-07-03: полный грид + курируемый двуязычный отчёт#3
gistrec merged 2 commits into
mainfrom
results-2026-07-03

Conversation

@gistrec

@gistrec gistrec commented Jul 3, 2026

Copy link
Copy Markdown
Contributor
Прогон

  - Полный грид: 432 прогона (16×9×3), 0 ошибок, ≈ $18.42, коммит f29dce9, судьи Claude/GPT/GLM.
  - Новый скоринг впервые развёл модели (в прошлый раз почти все упирались в 5.0) — появилось реальное расслоение по Tools Use и Edge Cases.

  Топ-3 (Pareto-фронт «качество/цена»)

  ┌──────────────────────────┬───────┬──────────┬─────────────┬──────────────────────────────────────────────────────────────┐
  │           LLM            │ Score │ Cost/ans │ Score per $ │                          чем берёт                           │
  ├──────────────────────────┼───────┼──────────┼─────────────┼──────────────────────────────────────────────────────────────┤
  │ GLM-4.6 (без thinking)   │  4.62 │   $0.003 │        1657 │ дёшево до неприличия, качество почти как у топ-Claude        │
  ├──────────────────────────┼───────┼──────────┼─────────────┼──────────────────────────────────────────────────────────────┤
  │ GPT-4.1                  │  4.93 │   $0.013 │         378 │ сюрприз: Accuracy 5.0, Tools 4.96 — почти Opus, в 6× дешевле │
  ├──────────────────────────┼───────┼──────────┼─────────────┼──────────────────────────────────────────────────────────────┤
  │ Opus 4.8 (adaptive/high) │  4.96 │   $0.081 │          62 │ потолок качества, но в 27× дороже GLM                        │
  └──────────────────────────┴───────┴──────────┴─────────────┴──────────────────────────────────────────────────────────────┘

  Что проверил вручную (аномалии → реальны, не артефакты)

  - Sonnet (прод!) просел на краевых кейсах (Edge ~3.3): на пустом срезе выдумывает причины, на неясном вопросе не уточняет, а вываливает отчёт и лезет в тулы. 2 из 3 судей ловят — настоящая слабость, а
  не шум скоринга. Это главный практический сигнал: прод сейчас на Sonnet.
  - GPT-4.1 Accuracy 5.0 — честно: CPC считает верно, CPA не выдумывает. Старое «4.0 не считает CPA» было недооценкой прежнего скоринга.
  - Побочно: thinking вредит GLM-4.6 (4.62→3.84), GPT-5 нестабилен по тулам (medium лучший из GPT-5), GLM-5 не лучше GLM-4.6.

gistrec added 2 commits July 3, 2026 16:34
- results/2026-07-03/results.{ru,en}.md — 432 прогона (16×9×3), 0 ошибок, ≈$18, на
  исправленном скоринге (коммит f29dce9). Топ-3 (Pareto): GLM-4.6 (без thinking) — лучший
  "качество/цена", GPT-4.1 — неожиданно силён и дёшев, Opus 4.8 (adaptive/high) — потолок качества.
- Ключевой сигнал: Sonnet (текущий прод) проседает на краевых кейсах (Edge ~3.3 — выдумывает
  причины на пустом срезе, не уточняет неясный вопрос). Проверено вручную по сырым ответам.
- README x2: 'последний прогон' → 2026-07-03 с кратким итогом.
- runs.jsonl (сырьё) остаётся локально (.gitignore).
…2026-07-03

- runs.jsonl теперь под VCS для fixed-режима (фейк-кабинет, приватных данных нет; ~230 КБ в паке) —
  делает отчёт самодостаточным (--report-from) и сохраняет невоспроизводимый платный прогон.
- .gitignore: предупреждение, что live-прогоны с данными реального кабинета коммитить нельзя.
- README x2: формулировки про хранение runs.jsonl приведены в соответствие.
- Добавлен results/2026-07-03/runs.jsonl (432 записи, 1.4 МБ).
@gistrec
gistrec merged commit 8ea121c into main Jul 3, 2026
1 check passed
@gistrec
gistrec deleted the results-2026-07-03 branch July 3, 2026 15:27
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

1 participant