内推原文
NO.e863cc岗位标签:语音信号处理
·唤醒词
·声纹识别
·视听融合定位
·语音增强
·端侧 NPU
·实习生 | 具身智能
·大模型
·AI Agent
·陪伴机器人松延动力 AI 算法及交互中心,负责面向消费级机器人的具身交互 Agent 系统(统一语音与多模态感知、理解、记忆、对话、决策与任务执行的实时交互中枢)。本实习岗围绕语音前端算法与端侧落地开展课题,可接触真机声学回采数据。团队从 0 组建,直接向中心负责人汇报。 实习生与正式员工承担同一批课题,由中心负责人与资深工程师共同带教,优秀者可留任。课题方向(不限于)
1.自噪声抑制:用电机 / 关节状态做条件的自噪声抑制实验,评估对识别率的增益
2.视听融合的说话人定位:将麦阵 DOA 与视觉人脸位置融合,在多人场景下定位当前说话人,量化相比纯音频 DOA 的角度误差与鲁棒性增益
3.家庭成员声纹注册与识别:小样本注册、儿童声纹随年龄的漂移、跨会话稳定性,为记忆系统的身份判定提供支撑
4.神经前端端侧化:轻量前端网的量化与 NPU 部署,做精度
-延迟
-功耗曲线
5.弱网下的语音链路鲁棒性:丢包补偿与抖动缓冲策略对识别率与尾延迟的影响,寻找家庭网络环境下的最优配置
6.误唤醒挖掘:从真机回采数据中挖掘 badcase,做误唤醒归因与阈值优化
任职要求
1.电子信息 / 计算机 / 声学相关在校生,硕博优先
2.掌握基本音频信号处理,能用 PyTorch 训练语音模型
3.每周到岗 ≥4 天,实习期 ≥6 个月
4.愿意投入时间进行大量真实录音的听测与分析