🚀 We're Hiring!! | 加入我们! #9
Yangruipis
announced in
Announcements
Replies: 0 comments
Sign up for free
to join this conversation on GitHub.
Already have an account?
Sign in to comment
Uh oh!
There was an error while loading. Please reload this page.
Uh oh!
There was an error while loading. Please reload this page.
📕 小红书 AI 平台团队(AI Infra Team at Xiaohongshu) 招人啦!
岗位1:小红书 · 大模型强化学习训练引擎研发工程师(练习生)
🛠️ 工作职责
Agentic RL 训练框架研发 ⚡
参与开发现代 Agentic RL 训练框架,支撑复杂环境下长程任务的稳定训练;
多模态 RL 算法流程适配 🤖
参与百 B 以上多模态强化学习算法流程适配(如 DAPO 等),各领域任务的 RL 正确性验证;
并行策略实验与调优 🔬
实验并调优不同并行策略(Tensor / ZeRO / FSDP / Pipeline Parallelism)在超大规模模型上的最佳配置组合;
性能瓶颈诊断与优化 🔍
协助定位分析分布式训练中的关键性能瓶颈(如 GPU 利用率低、显存瓶颈、网络通信阻塞、I/O 延迟等),设计并实施优化方案进行验证;
训练引擎核心特性研发 🧩
参与研发 / 优化训练引擎的关键特性,如大规模集群下的稳定断点续训、高性能异步 Rollout 机制、以及高性能算子(Kernel)的集成与优化。
✅ 任职资格
🌟 加分项
岗位2:小红书 · 全模态长程 Agentic RL 框架顶尖实习生
🛠️ 工作职责
长程 Agentic RL 核心算法研究 🧠
聚焦全模态 Agent(GUI 操作、代码生成、网页导航)在长程交互任务中的 RL 算法研究,解决跨越数百至数千步复杂任务下,传统强化学习仅依赖终态奖励导致信用分配路径过长、梯度信号衰减、策略优化难以收敛的核心挑战;
层次化时间抽象信用分配机制设计 🔬
研究并设计层次化时间抽象(Hierarchical Temporal Abstraction)信用分配机制,缓解长程任务中 flat policy 的优化不稳定问题,提升 Agent 在超长 horizon 任务下的策略学习效率;
跨模态可验证奖励机制研究 🎯
设计并验证跨模态可验证奖励(Cross-modal Verifiable Reward)机制,有效抑制 Reward Hacking 对 RL 训练过程的干扰,推动全模态长程 Agentic RL 的稳定收敛;
主流基准评测与方法验证 📊
在 WebArena、SWE-bench 等主流评测基准上系统性地验证算法方法的有效性,持续迭代优化模型表现;
业务落地与开源引擎集成 🚀
将研究成果应用于公司内社区生态 Agent 基座、AI 跨模态深度搜索等核心业务场景,并集成至自研开源强化学习引擎 Relax,提升业界技术影响力。
✅ 任职资格
🌟 加分项
All reactions