独立的 LLM 模型评测系统,支持:
- YAML 测试套件管理
- 多模型生成对比
- 同模型多供应商并行对比(按
provider + model维度独立测试) - 多评委交叉评分
- SSE 实时过程流
- JSON + Markdown 报告输出
- 盲评导出(按分类匿名导出 Markdown / PDF)
server/NestJS 后端client/React + Vite 前端server/test-suites/测试套件 YAMLserver/test-reports/输出报告
- 安装依赖
npm install- 配置环境变量
cp server/.env.example server/.env
# 填好 MODEL_TEST_AICODEMIRROR_KEY / MODEL_TEST_CURSORART_KEY / GOOGLE_GEMINI_API_KEY- 启动开发模式
npm run dev- 前端默认:
http://localhost:5173 - 后端默认:
http://localhost:3100
GET /api/model-test/suitesGET /api/model-test/suites/:suiteNamePOST /api/model-test/run(SSE)GET /api/model-test/reportsGET /api/model-test/reports/:reportIdGET /api/model-test/reports/:reportId/blind-export?format=markdown|pdf&category=可选分类
POST /api/model-test/run 支持:
executionMode=serial:同一测试用例内模型按顺序执行(模型并发固定为 1)executionMode=parallel:同一测试用例内模型并发执行(并发度受modelConcurrency控制)evalConcurrency:评委评分并发度
每次测试会写入:
server/test-reports/{report-id}-{suite-key}.jsonserver/test-reports/{report-id}-{suite-key}.md
盲评导出接口会返回下载文件(不落盘):
- Markdown:匿名作品 + 盲评记录表
- PDF:匿名作品排版文档(适合发给评委盲评)