内推原文
NO.6bfcbc岗位标签:推理优化
·量化
·投机解码
·Prompt Cache
·CUDA
·端侧部署
·实习生 | 具身智能
·大模型
·AI Agent
·陪伴机器人松延动力 AI 算法及交互中心,负责面向消费级机器人的具身交互 Agent 系统(统一语音与多模态感知、理解、记忆、对话、决策与任务执行的实时交互中枢)。本实习岗围绕推理加速、成本优化与端侧部署开展课题,可接触真实线上负载与成本数据。团队从 0 组建,直接向中心负责人汇报。 实习生与正式员工承担同一批课题,由中心负责人与资深工程师共同带教,优秀者可留任。课题方向(不限于)
1.小模型路由:什么样的请求可以不上大模型,做意图分流策略与收益评估
2.Prompt cache 命中率优化:人设与记忆在 prompt 中的排布策略,量化其对首 token 时延与单轮成本的影响
3.量化消融:不同量化方案在语音 / 对话场景下的精度
-延迟
-成本三方消融
4.投机解码:用小模型起草、大模型验证,测量真实对话负载下的加速比与接受率
5.批处理调度的成本曲线:不同批处理与调度策略下 GPU 利用率、p95 时延与单位 token 成本的关系
6.端侧算子适配:把一个前端或小模型完整搬到 NPU 上,产出踩坑文档
任职要求
1.计算机 / 电子相关在校生,硕博优先
2.熟悉 PyTorch,了解推理引擎基本原理;写过 CUDA 或做过端侧部署更好
3.每周到岗 ≥4 天,实习期 ≥6 个月
4.对性能与成本优化有持续兴趣