内推原文
NO.a0a33b岗位标签:多模态大模型
·Omni
·语音识别
·语音合成
·应答对象判定
·模型评测
·实习生 | 具身智能
·大模型
·AI Agent
·陪伴机器人松延动力 AI 算法及交互中心,负责面向消费级机器人的具身交互 Agent 系统(统一语音与多模态感知、理解、记忆、对话、决策与任务执行的实时交互中枢)。本实习岗围绕语音识别、语音合成与 Omni 模型开展课题,提供算力支持与真实场景数据。团队从 0 组建,直接向中心负责人汇报。 实习生与正式员工承担同一批课题,由中心负责人与资深工程师共同带教,优秀者可留任。课题方向(不限于)
1.Omni 评测:在中文家庭陪伴场景下系统评测开源 Omni 模型,产出选型报告
2.儿童与老人语音的识别适配:低资源条件下的领域适配方法,量化对字错率的增益
3.音色与情感的可控合成:小样本音色定制、情感与韵律控制,评估可控性与自然度的权衡
4.应答对象判定:多人在场时判断哪句话是对机器人说的,可结合声纹与视觉线索
5.语音指令跟随:语音输入下的指令跟随能力评估与提升实验
6.视觉指代消解:多模态指代(「这个」「那边那个」)的小规模实验
任职要求
1.计算机 / 人工智能相关在校生,硕博优先
2.有多模态或语音模型的训练 / 微调经验(课程项目或复现亦可)
3.熟悉 PyTorch + HuggingFace 生态,能独立跑通训练与评测
4.每周到岗 ≥4 天,实习期 ≥6 个月