为 Agent 造模型:面向工具调用任务的 数据合成 → 微调(QLoRA/GRPO) → 部署(vLLM) → 评测 全链路。 服务对象是我自己的两个 Agent 项目(PaperRAG、WeatherFlow), 目标是证明:在我的工具集上,自己微调的 4B 模型比通用大模型更准、更便宜、更快。
状态:M1/M2/M4/M5/M6 已有可运行产物,当前处于端到端联调与收口阶段 · 规划背景见 PROJECT_PLAN.md(v2.0)· 定位决策见 ADR-001
应用层 PaperRAG (RAG·12节点流水线) WeatherFlow (Agent·四层记忆·HITL)
\ /
评测层 统一评测方法论(golden cases · AST 匹配 · ECE · NDCG)
|
模型层 Keel:为 Agent 造模型
数据合成(16个自有工具schema) → SFT(QLoRA) → GRPO(stretch)
→ vLLM+AWQ 部署(压测+成本报告) → 评测门禁
|
设施层 Keel Gateway (Java 21·瘦身版:SSE转发/鉴权/限流/降级路由)
原理层 mini-infer (纯 PyTorch 手写 Qwen3-0.6B 推理·与 HF 对齐)
keel/
├── PROJECT_PLAN.md # 总规划(v2.0)
├── docs/
│ ├── adr/ # 架构决策记录(ADR-001 定位与数据策略)
│ ├── notes/ # LLM 理论学习笔记(转化为 interview-qa)
│ ├── m6-architecture.md # M6 深读:三层路由 · 网关内部 · 工具执行层
│ └── m6-cheatsheet.md # 面试速记一页
├── mini-infer/ # M1 纯 PyTorch 推理引擎
├── tuning/ # M2 数据合成 + LLaMA-Factory 配置 + GRPO
│ ├── schemas/ # 16 个工具 schema 资产(从两个 Agent 项目提取)
│ └── data/ # 导出/脱敏/合成脚本(真实数据不入库)
├── evals/ # M5 工具调用评测:AST 匹配器 + 评测集
│ └── cases/ # held-out 评测 case(JSONL)
├── serving/ # M3 vLLM 部署与 benchmark
├── gateway/ # M4 Java 最小网关
├── agent/ # M6 Agent 运行时(编排层 + CLI + 薄 Web UI)
└── deploy/ # M6 组合运行基础设施(默认 Redis;standalone 提供空 MySQL/Qdrant)
P0 立项(06-11) → P1 mini-infer(≤7d) → P2 微调(2w) → P3 vLLM+报告(1w) → ★ 07-12 起开始投递 → P3.5 GRPO / P4 网关 / P5 闭环物料(与面试并行)→ 08-09 收口