内推原文
NO.4ca6d9岗位标签:评测集建设
·LLM
-as
-a
-Judge
·合成数据
·主动学习
·数据挖掘
·实习生 | 具身智能
·大模型
·AI Agent
·陪伴机器人松延动力 AI 算法及交互中心,负责面向消费级机器人的具身交互 Agent 系统(统一语音与多模态感知、理解、记忆、对话、决策与任务执行的实时交互中枢)。本实习岗围绕评测体系与数据闭环开展课题,可获得贯穿全中心各技术线的视角。团队从 0 组建,直接向中心负责人汇报。 实习生与正式员工承担同一批课题,由中心负责人与资深工程师共同带教,优秀者可留任。课题方向(不限于)
1.评测集建设:设计并标注中文家庭场景评测集,含记忆、人设、安全维度
2.LLM
-judge 的可信边界:量化模型评判与人工评测的相关性,给出可替代维度与校准方法
3.自动化回归:搭建评测 pipeline,让每次模型迭代自动出报告
4.合成数据的有效性:冷启动期合成对话的增益曲线,合成比例到多少开始失效
5.主动学习与数据选择:标注预算有限时,从海量真机数据中筛选高价值样本的策略
6.Badcase 挖掘:从真机数据中聚类挖掘高频问题,产出归因报告
任职要求
1.计算机 / 语言学 / 统计相关在校生
2.Python 数据处理熟练;用过 LLM 做自动评测者优先
3.每周到岗 ≥4 天,实习期 ≥6 个月
4.工作细致有条理,能定义清晰的标注规范