Skip to content

agentbench: 改为接标准基准的薄入口(HumanEval / SWE-bench) - #70

Merged
miaobyte merged 1 commit into
masterfrom
feat/agentbench-standard-suites
Sep 14, 2026
Merged

miaobyte merged 1 commit into
masterfrom
feat/agentbench-standard-suites

Conversation

@miaobyte

Copy link
Copy Markdown
Contributor

变更

agentbench 不再自带题目,改为调用业界两套标准基准(Codex / Claude 评测同款),把 byteseek 当作被测 agent 接进去。

新增

  • agentbench/bench —— bash 入口(exec 到 BENCH_HOME 的 venv)
  • agentbench/bench.py(368 行)—— 题库 → agent → predictions → 官方评测
    • suite:humaneval | humaneval+ | swebench-verified | swebench-lite
    • agent:gold(题库自带答案,验管道)| byteseek(驱动 byteseek 代码脑)
    • 退出码:0 通过 / 1 未通过 / 2 前置条件不满足(缺题库、缺 docker、byteseek 不可用)/ 3 参数错误

删除

  • 自出的 0010 难度题库(64 个 .question/.answer 对)

修改

  • agentbench/README.md 重写:新定位、命令、suite 说明

说明

本 PR 不含工作区里另一处改动(tests/selftest.kv 的删除)—— 该文件仍是 make test 与 CI selftest job 的入口,删除会让 CI 必挂且 Makefile/CI 未同步。已从本次提交撤回,另行讨论。

🤖 Generated with Claude Code

不再自带题目。agentbench 现在是调用业界两套标准基准(Codex / Claude
评测同款)的入口,把 byteseek 当作被测 agent 接进去:

- 新增 bench(bash 入口,exec 到 BENCH_HOME 的 venv)
- 新增 bench.py:题库 → agent → predictions → 官方评测
  suite: humaneval | humaneval+ | swebench-verified | swebench-lite
  agent: gold(题库自带答案,验管道)| byteseek
  退出码:0 通过 / 1 未通过 / 2 前置条件不满足 / 3 参数错误
- 删除自出的 00–10 难度题库(64 个 .question/.answer 对)
- README 重写:新定位、命令、suite 说明

Co-Authored-By: Claude Code <noreply@anthropic.com>
@miaobyte
miaobyte merged commit 0cdf525 into master Sep 14, 2026
0 of 2 checks passed
@miaobyte
miaobyte deleted the feat/agentbench-standard-suites branch September 14, 2026 03:45
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

1 participant