================================================================================ AgenticRL DeepScaler 数学 Agent 训练 — 完整深度诊断报告 模型: Qwen2.5-7B-Instruct | 数据: 540条(deepscaler_math_01) | 服务器: 7.246.80.84 五轮调参 (R1-R5) | 15层诊断体系 | 轨迹+指标双重验证
R1(基线) → R2(稳定化) → R3(崩塌) → R4(最优) → R5(验证实验)
核心问题: 7B 模型能否通过 RL 调参在 DeepScaler 数学任务上达到 avg_reward >= 0.8?
答案: 不能。R4 取得 avg=0.551, 正确率 42.2%, 是七轮调参的天花板。 但是: R4 best single=0.797 证明 7B 有能力触及 0.8, 差距来自 49.5% 的零分轨迹。
关键非直觉发现:
- pg_clipfrac 在所有轮次均低于 0.5% (健康范围 5-30%) — PPO clip 从未激活 -> GRPO 框架下 advantage 归一化可能使 clip 机制不触发, 不是 lr 太低
- Agent 步数受 temp+steps 联合控制, 而非单纯 steps 设置 -> R1(5步,temp=1.0): 54.8% 单步 | R4(7步,temp=0.9): 19.4% 单步
- R3 崩塌在轨迹层表现为 "工具使用从 83% 归零 + 步数从 2.0 降至 1.0" -> KL 数值只是表象, 行为的退化才是本质
lr 5e-07 5e-07 1e-06 5e-07 7.5e-07 epochs 1 3 4 5 6 batch_size 16 32 32 32 32 kl_coef 0.001 0.003 0.003 0.005 0.005 agent_steps 5 5 7 7 7 generations 2 4 4 4 4 temperature 1.0 1.0 0.8 0.9 1.0 entropy_coeff 0.001 0.001 0.001 0.001 0.003 mini_batch 2 4 4 4 4
R1->R2: batch翻倍+gen翻倍 -> 稳定性提升(std -38%) + 多步推理比例从45%升至75% R2->R3: lr翻倍+steps加2+temp降 -> Ep1前半最强(0.562) -> s25起KL崩溃 -> 工具归零 R3->R4: lr回退+kl加固至0.005, 保留steps=7+temp=0.9 -> 首个5-epoch无崩溃 R4->R5: lr温和提至7.5e-7+entropy_coeff=0.003 -> 验证lr上限 -> 确认5e-7最优
================================================================================ 三、L1+L2: Score 与 Reward 趋势 (目标达成度)
avg_score 0.4216 0.4902 0.3861 0.5507 ~0.52 max_score 0.7825 0.6937 0.7292 0.7973 ~0.73 std 0.1594 0.0982 0.1670 0.1071 -- score_trend UP UP DOWN UP UP epoch_sequence 0.422 0.42/0.52 0.48/0.47 0.45/0.53 0.41/0.51 /0.54 /0.23/0.27 /0.57/0.60 /0.57/0.55 /0.60
关键发现:
- score 与 reward 在所有轮次一致 (无 KL 压制信号), kl_coef 设置均合理
- R3 trend=DOWN 是唯一标记崩塌的轮次 (E0=0.48 -> E2=0.23)
- R4 是唯一实现 5 个 epoch 单调递增的轮次 (0.454->0.532->0.572->0.602->0.600)
- R5 E2 曾几乎追平 R4(-0.5%), 但 E3 后分差拉大, 追赶失败
================================================================================ 四、L11+L13: 正确率 & Reward 区分度 (本质效果指标)
轨迹数 992 5888 6272 9728 8704 correct% 34.98% 37.43% 32.17% 42.19% 39.67% 正向信号% 35.0% 37.4% 32.2% 42.2% 39.7% 零分轨迹% 59.7% 53.9% 63.1% 49.5% 52.5% 负向惩罚% 5.3% 8.6% 4.7% 8.3% 7.9% 唯一值数 9 12 13 13 9 max_score 1.33(恒定) 1.33(恒定) 1.33(恒定) 1.33(恒定) 1.33(恒定)
正确率 Epoch 趋势: R1: 35.0% (单epoch) R2: 32.3% -> 39.0% -> 40.7% (+8.4pp) R3: 36.2% -> 43.4% -> 23.2% -> 26.4% (崩塌: +7.2pp -> -20.2pp!) R4: 36.3% -> 40.6% -> 43.3% -> 45.8% -> 44.8% (+9.5pp, 单调) R5: 30.8% -> 39.0% -> 40.5% -> 43.4% -> 44.8% -> 39.5% (E5 回落)
关键发现:
- R4 正确率 42.2% 是最高, 仍有一半以上轨迹零分 -> 正确率天花板约 45%
- 零分轨迹占比 49-63% 在所有轮次 -> 540条数据对 7B 难度偏大
- Reward 有 9-13 个唯一值, 区分度充足, 不是 reward 设计问题
- 正确率趋势与 score 趋势完全一致, cross-validate 了指标体系
- R5 E5 正确率从 44.8% 回落到 39.5% -> entropy 衰减导致探索枯竭
================================================================================ 五、L12: 轨迹行为诊断 (Agent 实际表现)
平均步数 1.56 2.00 1.54 2.02 1.78 1-step% 54.8% 25.3% 57.0% 19.4% 34.3% 2-step% 37.8% 58.1% 35.6% 66.1% 56.9% 3+step% 7.4% 16.6% 7.4% 14.5% 8.8% 工具使用率 45.2% 74.7% 43.0% 80.6% 65.7%
Reward 组合 (Answer x Tool): Answer+Tool OnlyAnswer OnlyTool Neither R1 21.4% 13.6% 23.8% 41.2% R2 32.7% 4.7% 42.0% 20.6% R3 20.1% 12.1% 22.9% 44.9% <- 崩塌后最差 R4 37.9% 4.3% 42.8% 15.0% <- 最优 R5 31.9% 7.8% 33.8% 26.5%
R3 崩塌的轨迹层表现 (Ep0->Ep3): Ep0: steps=1.73, tool=53.5%, correct=36.2% Ep1: steps=2.02, tool=83.4%, correct=43.4% <- 巅峰 Ep2: steps=1.42, tool=38.5%, correct=23.2% <- KL开始攀升 Ep3: steps=1.00, tool= 0.1%, correct=26.4% <- 工具归零, 纯随机输出
关键发现:
- R4 在四个行为指标上全面最优: 最高多步率(80.6%), 最低单步率(19.4%), 最高工具使用(80.6%), 最低 "Neither" 率(15.0%)
- R1 和 R3 共享高单步率(>50%), R3 是因为崩塌, R1 是因为 1 epoch 不足+gen=2
- 工具使用率与正确率高度正相关 — 使用工具的轨迹正确率远高于纯文本
- OnlyTool=42.8% (R4): 工具虽然执行了但答案仍错 — 工具执行质量是瓶颈
- agent_steps=7 的利用率仅 ~2/7 (28%), 多步引导空间巨大
================================================================================ 六、L4: PPO 更新强度 — 被忽视的核心问题
pg_clipfrac 0.15% 0.27% 0.40% 0.26% 0.38% (健康: 5-30%) ---- 所有轮次远低于任何健康标准 ---- pg_clipfrac_lo 0.00% 0.01% 0.02% 0.00% -- ppo_kl 0.00013 0.00049 0.00275 0.00040 -- avg_kl 0.0123 0.0212 0.0961 0.0333 -- max_kl 0.0436 0.0378 0.2670 0.0786 ~0.10 grad_norm 4.9 9.9 9.1 6.2 -- lr 5.0e-07 5.0e-07 1.0e-06 5.0e-07 7.5e-07
核心诊断: 五轮 pg_clipfrac 全部低于 0.5%, 而 PPO 的健康范围是 5-30%。 这不是 lr 不够高的问题 — R5 的 lr 提高 50% 后 clipfrac 仅从 0.26% 升至 0.38%。
可能的根本原因: a) GRPO 使用 std-normalized advantage -> 组内归一化后 advantage 范围压缩 -> PPO 的 ratio 偏离不会触发 clip 边界 b) clip_ratio 默认值(0.2)在 GRPO 场景下可能偏大, 需要更激进的设置 c) 或者: GRPO 场景下 pg_clipfrac 本就应低, 这是正常的
但这引出一个更重要的问题: 既然 PPO clip 从未激活, 那梯度更新完全依赖 GRPO advantage + KL penalty。 这意味着: - lr 的作用被 KL penalty 和 advantage 量级共同限制 - 过度提高 lr (R3) 会让 KL 先于 clipfrac 失控 - R4 的弹簧机制实质是 kl_coef 在发挥 PPO clip 本该承担的作用
R3 的 KL 崩塌数据: s21: kl=0.036 (健康) -> s25: kl=0.058 (突破0.05) -> s32: kl=0.109 -> s35: kl=0.149 -> s37: kl=0.189 同时 score: 0.636 -> 0.729 -> 0.050 -> 0.125 -> 0.203 KL 从 0.036 到 0.189 的 5.3 倍增长发生在 16 步内 (约 1.5h)
R4 的弹簧机制: s37: kl=0.052 -> s38: kl=0.032 (1 步回落) — 第一次弹簧 s56: kl=0.051 -> s57: kl=0.038 (1 步回落) — 第二次弹簧 R4 全程 kl 峰值 0.079, 远低于 R3 的 0.267
================================================================================ 七、L6: Entropy — 限制更多 Epoch 的瓶颈
entropy_start 0.224 0.219 0.181 0.192 0.211 entropy_end 0.194 0.162 0.310 0.110 0.112 entropy_change -13.1% -26.2% +71.4% -42.9% -- entropy_min 0.138 0.137 0.100 0.103 0.112
关键发现:
- R3 entropy +71.4% 是"崩塌式随机": 策略不再做有意义的推理, 随机输出
- R4 entropy -42.9%: 收敛速度过快。E4 时 entropy 降至 0.10, 与 score 不再上升 (0.602->0.600) 的时间点重合 -> entropy 衰减是更多 epoch 无效的主因
- R5 entropy_coeff=0.003 将最低点从 0.103(R4) 提升到 0.112(R5), 边际有效
- 多轮规律: 每多 1 个 epoch, entropy 额外衰减约 8-10% -> 在 entropy_coeff=0.001 下, 5 个 epoch 是安全上限
================================================================================ 八、L7+L8: 工程指标 (截断 & 吞吐)
response_clip 3.79% 0.80% 11.20% 0.95% -- prompt_clip 6.25% 3.12% 3.12% 3.12% -- aborted% 0% 0% 0% 0% -- gen_time% 89% 82% 79% 82% -- avg_step(s) 180 300 263 297 -- total_h 1.6 4.0 3.7 6.4 --
关键发现:
- R3 response_clip=11.2% 是崩塌的后果, 非原因 (模型输出畸形长文本后被截断)
- prompt_clip=6.25%(R1) 说明少量 prompt 超 2048 tokens -> 增大至 2560
- Generation 占 80-90% 训练时间, 是唯一瓶颈; reward 计算零耗时
- gen=4 将 gen% 从 89% 降到 82%, 因为更新更频繁分摊了生成成本
================================================================================ 九、L3+L9: 辅助指标 (Advantage & 显存)
- advantage range 1.4-3.0 在所有轮次充足, GRPO 组内对比始终有效
- 显存 52-56GB 稳定, 无 OOM 风险 (batch=32, gen=4 在 8 NPU 内安全)
batch: 16->32 R1->R2 +0.069 (+16.3%) 稳定性大幅提升 gen: 2->4 R1->R2 (与batch联合) GRPO组内对比增强 epochs: 1->3->4->5 R1->R4 +0.129 (+30.6%) 最重要增益来源 kl_coef: 0.001->0.003 R1->R2 KL从0.044降至0.038 基础安全 kl_coef: 0.003->0.005 R3->R4 KL从0.267降至0.079 弹簧机制关键 steps: 5->7 R2->R4 +0.060 (+12.3%) 多步推理+工具使用 temp: 1.0->0.9 R3->R4 (与steps联合) 平衡探索/利用 lr: 5e-7->1e-6 R2->R3 -0.104 (-21.3%) 过度激进 lr: 5e-7->7.5e-7 R4->R5 -0.031 (-5.6%) 验证上限
最大正贡献: epochs (从 1->5, +0.129), batch+gen (从 16/2->32/4, +0.069) 最大负贡献: lr=1e-6 (R3崩塌, -0.104) 最优组合: R4 (所有正贡献保留, 唯一负贡献排除)
L1 Score/Reward 趋势 ✓ L2 KL 压制 (score vs reward) ✓ score≈reward, 无压制 L3 GRPO 组内差异 ✓ advantage range 充足 L4 PPO 更新强度 ✓ pg_clipfrac 五轮 < 0.5% (关键发现) L5 Critic 性能 N/A GRPO 无 critic L6 Entropy & 探索 ✓ R4 -42.9% 是更多 epoch 的瓶颈 L7 输出截断 ✓ R3 clip 是崩塌症状, 非原因 L8 吞吐 & 时序 ✓ gen=82% 瓶颈 L9 显存 ✓ 52-56GB 稳定 L10 Validation ∅ 框架未启用 (建议后续开启) L11 Reward 设计 ✓ 区分度充足, 零分占比是瓶颈 L12 轨迹异常 ✓ 工具归零(R3), 单步为主(R1/R3) L13 数据难度 ✓ 49%零分, 中等偏难 L14 速查表 ✓ 见下方 L15 推荐排查顺序 ✓ 全覆盖
覆盖 13/15 (87%), 缺失 2 层: L5(GRPO无critic,合理), L10(框架未启用)
================================================================================ 十二、L14: 问题→调参动作速查表 (基于五轮实验验证)
score低+波动大(std>0.15) batch太小 R1->R2 batch32 std-38% reward零分占比>50% 数据难度高 所有轮均存在 需SFT/更大模型 KL突然突破0.05且持续攀升 lr过高 R3 lr=1e-6 崩溃 KL短暂超0.05后1步回落 弹簧机制正常 R4 kl=0.005 安全 entropy骤降>40% 探索枯竭 R4 E5 score停滞 加entropy_coeff 1-step>50% agent过早停止 R1/R3 降temp/增steps 工具使用率<50% 工具注册或引导不足 R1/R3 增steps+gen clipfrac<1% (全轮) GRPO下clip不触发 待验证 可能正常 epoch间提升<3% plateau R2 Ep1->Ep2 加epochs或lr score max>0.7但avg<0.5 少数成功多数失败 R4 SFT warmup
================================================================================ 十三、最终建议:突破 7B 天花板的三条路径
路径A (保守): 延续 R4, 扩展训练 参数: R4 + epochs=8 + entropy_coeff=0.002 + max_response=1536 预期: avg=0.57-0.59, 正确率 44-46% 风险: 低, 但边际收益递减 (R4 E4->E5 已经 +0.000)
路径B (模型): 换 14B 模型 + R4 参数 预期: 基础正确率 +10-15pp -> avg=0.65-0.72 风险: gen_time x2-3, 单步 ~600s, 5 epoch ~13h
路径C (数据): 扩充数据 + SFT warmup 数据扩充至 2000+ 条 + SFT 提升 RL 起点正确率 预期: 零分轨迹从 50% 降至 30% -> avg=0.65-0.70 风险: 需要 SFT 基础设施
推荐: B+C 组合 (14B + 数据扩充 + SFT) 预期 avg=0.72-0.78, 接近 0.8 目标 五轮调参已充分证明: 纯 RL 参数优化在 7B 上的天花板是 avg≈0.55