Skip to content

Latest commit

 

History

5 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

llm-benchmark

独立的 LLM 模型评测系统,支持:

  • YAML 测试套件管理
  • 多模型生成对比
  • 同模型多供应商并行对比(按 provider + model 维度独立测试)
  • 多评委交叉评分
  • SSE 实时过程流
  • JSON + Markdown 报告输出
  • 盲评导出(按分类匿名导出 Markdown / PDF)

目录结构

  • server/ NestJS 后端
  • client/ React + Vite 前端
  • server/test-suites/ 测试套件 YAML
  • server/test-reports/ 输出报告

快速开始

  1. 安装依赖
npm install
  1. 配置环境变量
cp server/.env.example server/.env
# 填好 MODEL_TEST_AICODEMIRROR_KEY / MODEL_TEST_CURSORART_KEY / GOOGLE_GEMINI_API_KEY
  1. 启动开发模式
npm run dev
  • 前端默认: http://localhost:5173
  • 后端默认: http://localhost:3100

API

  • GET /api/model-test/suites
  • GET /api/model-test/suites/:suiteName
  • POST /api/model-test/run (SSE)
  • GET /api/model-test/reports
  • GET /api/model-test/reports/:reportId
  • GET /api/model-test/reports/:reportId/blind-export?format=markdown|pdf&category=可选分类

POST /api/model-test/run 支持:

  • executionMode=serial:同一测试用例内模型按顺序执行(模型并发固定为 1)
  • executionMode=parallel:同一测试用例内模型并发执行(并发度受 modelConcurrency 控制)
  • evalConcurrency:评委评分并发度

报告输出

每次测试会写入:

  • server/test-reports/{report-id}-{suite-key}.json
  • server/test-reports/{report-id}-{suite-key}.md

盲评导出接口会返回下载文件(不落盘):

  • Markdown:匿名作品 + 盲评记录表
  • PDF:匿名作品排版文档(适合发给评委盲评)

About

No description, website, or topics provided.

Resources

Stars

1 star

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages