目标:使用 Relax 框架跑通一次完整的强化学习后训练流程,完成不少于 10 个 training step,并提交实验报告与训练曲线。
本任务面向初次使用 Relax 的同学,重点是走通主链路、理解框架结构、形成可复现记录,完成本次任务可以领取小红书"薯队长"玩偶。
完成后,你应能说明这条主链路:
启动脚本 → 参数解析 → Controller 编排 → Rollout 生成 → Reward 计算 → GRPO 更新 → 指标记录
| 项目 |
配置 |
| 模型 |
Qwen3-0.6B |
| 训练集 |
GSM8K |
| 算法 |
GRPO |
| 硬件 |
1× GPU |
| 预计耗时 |
~0.5 天,无需改代码 |
脚本文件地址:https://github.com/redai-infra/community
快速开始
git clone https://github.com/redai-infra/Relax.git
git clone https://github.com/redai-infra/community.git
# 脚本依赖 Relax 目录结构(自解析根目录),需 cp 到 Relax/examples/ 下再跑
mkdir -p Relax/examples/beginner-task
cp community/contributor-program/2026-cohort-1/run-qwen3-0.6B-1xgpu-grpo.sh \
Relax/examples/beginner-task/
cd Relax
export MODEL_DIR=/your/model # 存放 Qwen3-0.6B 的目录
export DATA_DIR=/your/data # 存放 gsm8k/ 的目录
bash examples/beginner-task/run-qwen3-0.6B-1xgpu-grpo.sh
镜像参考:Relax Docker Image List · redai-infra/Relax · Discussion #30
准备数据
模型
hf download Qwen/Qwen3-0.6B --local-dir $MODEL_DIR/Qwen3-0.6B
GSM8K 训练集
hf download openai/gsm8k \
--repo-type dataset \
--local-dir $DATA_DIR/gsm8k
下载后即为 parquet 格式。脚本首次运行时会自动预处理(把 answer 字段的 CoT 剥掉,只保留 #### 后的最终答案),生成 main/train_clean.parquet 并使用之,无需手动转换。
训练流程
启动脚本
→ 参数解析(Megatron-LM CLI)
→ Controller 编排服务
→ Rollout 生成(SGLang)
→ Reward 计算(math rm-type,提取 \boxed{})
→ GRPO 优势估计 + 策略更新
→ 指标记录(ClearML)
四、提交材料(训练日志+实验报告)
📬 提交地址: https://f.wps.cn/g/8L0KsIhg/
1、训练日志
(附上训练过程日志文件)
2、实验报告(PDF 格式)
压缩包命名:北京大学+计算机科学与技术+张三.zip
1. 基本信息
| 项目 |
填写内容 |
| 学校 / 专业 / 姓名 |
<填写> |
| 完成日期 |
<YYYY-MM-DD> |
| 代码分支 / commit id |
<填写> |
| GPU 型号与数量 |
<填写> |
| Python / CUDA / 镜像版本 |
<填写> |
2. 任务详情
| 项目 |
填写内容 |
| 模型 |
Qwen3-0.6B |
| 数据集 |
GSM8K |
| 算法 |
GRPO |
| 实际训练步数 |
<填写> |
| 总耗时 |
<填写> |
| 日志 / 输出目录 |
<填写> |
| 主要参数调整 |
<未调整,或写明参数和值> |
完整启动命令:
3. 曲线图
3.1 Reward 曲线
插入 reward_curve.png,并注明指标名、数据来源
3.2 Loss 曲线
插入 loss_curve.png,并注明指标名、数据来源
3.3 其他曲线(可选)
插入 KL、grad norm、response length 等曲线
4. 遇到的问题与解决方案
| 问题现象 / 报错 |
原因分析 |
解决方案 |
如何确认已解决 |
| <填写> |
<填写> |
<填写> |
<填写> |
如未遇到明显报错,请记录一个实际排查过的风险点,例如显存不足、模型或数据路径错误、Ray 启动失败、reward 未写入日志。
5. 总结
用 3~5 句话说明:任务是否完成、最终 step、对训练主链路的理解,以及如果继续训练会优先调整什么。
目标:使用 Relax 框架跑通一次完整的强化学习后训练流程,完成不少于 10 个 training step,并提交实验报告与训练曲线。
本任务面向初次使用 Relax 的同学,重点是走通主链路、理解框架结构、形成可复现记录,完成本次任务可以领取小红书"薯队长"玩偶。
完成后,你应能说明这条主链路:
启动脚本 → 参数解析 → Controller 编排 → Rollout 生成 → Reward 计算 → GRPO 更新 → 指标记录
脚本文件地址:https://github.com/redai-infra/community
快速开始
镜像参考:Relax Docker Image List · redai-infra/Relax · Discussion #30
准备数据
模型
hf download Qwen/Qwen3-0.6B --local-dir $MODEL_DIR/Qwen3-0.6BGSM8K 训练集
hf download openai/gsm8k \ --repo-type dataset \ --local-dir $DATA_DIR/gsm8k下载后即为 parquet 格式。脚本首次运行时会自动预处理(把
answer字段的 CoT 剥掉,只保留####后的最终答案),生成main/train_clean.parquet并使用之,无需手动转换。训练流程
四、提交材料(训练日志+实验报告)
📬 提交地址: https://f.wps.cn/g/8L0KsIhg/
1、训练日志
(附上训练过程日志文件)
2、实验报告(PDF 格式)
压缩包命名:
北京大学+计算机科学与技术+张三.zip1. 基本信息
2. 任务详情
完整启动命令:
# 粘贴本次实际使用的完整命令3. 曲线图
3.1 Reward 曲线
插入 reward_curve.png,并注明指标名、数据来源
3.2 Loss 曲线
插入 loss_curve.png,并注明指标名、数据来源
3.3 其他曲线(可选)
插入 KL、grad norm、response length 等曲线
4. 遇到的问题与解决方案
5. 总结
用 3~5 句话说明:任务是否完成、最终 step、对训练主链路的理解,以及如果继续训练会优先调整什么。