关于我们我们致力于构建下一代 Agent Foundation Model,探索大模型从“回答问题”迈向“自主完成复杂任务”的能力边界。团队聚焦于 Code Agent、Long
-Horizon Agent、Multi
-Agent、Memory、Reasoning 与 Reinforcement Learning 等方向,研发具备自主规划、工具使用、环境交互、自我修正和长期任务执行能力的新一代智能体系统。如果你希望参与最前沿 Agent 技术研发,并亲手推动 Agent Intelligence 的能力演进,我们期待你的加入。基本信息
工作地点 北京
·五道口实习待遇:1000~2000 元 / 天免费三餐 + 夜宵交通补贴实习周期:连续实习 6 个月以上(硬性要求)每周到岗 4 天及以上工作职责Agent 能力建设与优化参与 Agent 全生命周期研发,推动模型在真实复杂任务中的能力提升,包括:长程复杂任务数据合成构建面向 Agent 的高质量训练数据设计多步推理、多轮交互、复杂工具调用与长程任务场景探索自动化数据合成与数据迭代机制支持代码仓库级任务、复杂软件工程任务与开放环境任务的数据构建Reward Engineering基于编译结果、单元测试、静态分析、运行日志与环境反馈构建奖励机制设计稠密与稀疏奖励信号提升 Agent 在复杂任务中的学习效率与泛化能力Agent 强化学习训练探索 PPO、GRPO、DPO、RLVR 等算法在 Agent 场景中的应用构建 Agent Post
-Training Pipeline提升模型的规划能力、工具使用能力与任务完成能力Agent Environment 优化设计并优化 Agent 训练与评测环境构建支持 Tool Use、CLI、Code Execution、Browser Interaction 等场景的 Agent Harness提升 Agent 在真实环境中的稳定性、鲁棒性与执行效率Long
-Horizon Reasoning优化模型在复杂任务中的长期规划能力提升任务拆解、状态跟踪与动态决策能力解决跨步骤依赖与长程目标达成问题Multi
-Agent 系统探索研究协作式 Agent 框架探索 Agent 间通信、角色分工与协同决策机制提升复杂任务场景下的整体解决能力Memory 系统研发探索长期记忆与工作记忆机制研究 Context Management、Memory Retrieval 与 Experience Replay提升 Agent 在长期交互任务中的信息利用效率
任职要求必备条件计算机、人工智能、数学等相关专业在读能保证连续 6 个月以上实习时间扎实的机器学习与深度学习基础熟练掌握 Python 与 PyTorch熟悉 Linux 开发环境具备良好的工程实现能力与问题分析能力优先考虑满足以下任意一项:有强化学习相关研究或项目经验熟悉 LLM Post
-Training(SFT、RLHF、DPO、GRPO 等)熟悉 Agent、Tool Use 或 Code Agent 相关工作熟悉 DeepSpeed、Megatron、vLLM 等训练或推理框架熟悉数据合成、自动评测或 Agent Environment 构建长期深度使用 Claude Code、Codex 等 AI Coding Agent
加分项在 Agent、Reasoning、RL、LLM 等方向有深入研究在 NeurIPS、ICLR、ICML、ACL、EMNLP 等顶级会议发表相关论文曾参与头部大模型团队相关研发工作具备开源项目核心贡献经历对Agentic RL, Multi
-Agent等前沿方向有实践经验你将获得深度参与下一代 Agent Foundation Model 研发接触业界最前沿的 Code Agent 与 Long
-Horizon Agent 技术参与从数据、环境、奖励、训练到评测的完整 Agent 技术栈建设与顶尖研究员和工程师合作开展前沿探索优秀成果有机会直接影响核心基座模型能力,并产出高水平研究成果联系:邮箱:qyun02@iquestlab.com