Agentic RL 高级研究员

云筑信息科技(成都)有限公司
20000-40000元/月*14月
公开招聘岗位库社招深度学习

云筑信息科技(成都)有限公司,正在招聘「Agentic RL 高级研究员」,工作地点 成都市-高新区,薪资 20000-40000元/月*14月,学历 博士,经验 1-3年。该岗位来自公开招聘岗位库,金饭碗 已核验岗位状态为招聘中。发布时间:2026-07-27。

岗位名称
Agentic RL 高级研究员
招聘企业
云筑信息科技(成都)有限公司
岗位薪资
20000-40000元/月*14月
工作城市
成都市-高新区
学历要求
博士
工作经验
1-3年
招聘人数
1 人
岗位类型
社招
岗位来源
公开招聘岗位库
查看完整岗位信息并投递

Agentic RL 高级研究员 的岗位职责是什么?

一、岗位职责 1. 负责面向智能体场景的 Agentic RL 训练研发工作,包括多轮工具调用、任务规划、环境交互、轨迹采样、奖励建模与策略优化等方向。 2. 参与构建 Agent 训练数据体系,包括任务数据设计、工具调用轨迹生成、偏好数据构建、过程监督数据与评测集建设。 3. 负责强化学习训练流程研发,基于 PPO、GRPO、DPO、Rejection Sampling 等方法开展模型优化与效果验证。 4. 参与建设 Agentic RL 虚拟运行环境,支持搜索、代码执行、文档处理、知识库检索、业务系统调用等复杂任务训练。 5. 负责奖励函数设计与优化,包括结果奖励、过程奖励、格式奖励、工具调用奖励、安全合规奖励等。 6. 跟踪国内外大模型后训练、Agent RL、多轮工具调用、Reasoning Model 等前沿技术进展,并推动技术落地。 7. 参与大模型训练框架研发与优化,支持基于 verl、slime、OpenRLHF、Ray、vLLM 等框架的训练实验和工程化部署。 二、任职要求 1. 博士学历,计算机、人工智能、软件工程、自动化、数学、电子信息等相关专业优先。 2. 熟悉大语言模型训练、后训练或强化学习相关技术,理解 SFT、RLHF、RLAIF、PPO、GRPO、DPO 等方法原理。 3. 具备 Agent、Tool Calling、Function Calling、多轮推理、任务规划、代码智能体或搜索增强智能体相关研发经验。 4. 熟悉 DeepSpeed、Megatron、Ray、vLLM 、SGlang等训练与推理框架中的一种或多种。 5. 具备较强的算法实现能力和工程落地能力,能够独立完成训练实验设计、问题定位、效果分析和优化迭代。 6. 具备良好的论文阅读能力,能够快速复现和改进前沿论文中的方法。 7. 具备良好的沟通协作能力,能够与算法、工程、产品和业务团队协同推进项目落地。 三、加分项 1. 有大模型强化学习训练、Agentic RL、代码模型训练、数学推理模型训练经验者优先。 2. 熟悉 verl、slime、OpenRLHF、TRL 等开源训练框架者优先。 3. 有大规模分布式训练、GPU/NPU 集群训练、推理加速或训练稳定性优化经验者优先。

应聘 Agentic RL 高级研究员 需要什么条件?

学历要求:博士;工作经验:1-3年。具体要求以企业岗位详情为准。

Agentic RL 高级研究员 的薪资待遇如何?

该岗位薪资为 20000-40000元/月*14月。薪资信息由招聘企业提供 金饭碗。

这个岗位在哪里上班?

工作地点为成都市-高新区。具体办公地点以企业最终安排为准。

Agentic RL 高级研究员 还在招聘吗?

截至本页面最后更新,该岗位在公开招聘岗位库中显示为招聘中状态。

如何投递 Agentic RL 高级研究员?

可在金饭碗站内查看完整岗位信息并提交应聘意向,无需跳转外部网站。