内推原文
NO.1f6227# 加入阿里云灵骏智算团队,一起打造 AI 时代的智算大脑!
## 岗位:AI Infra 工程师
-计算方向
-工作城市:北京、杭州
-招聘对象:2026 年 11 月
-2027 年 10 月毕业的本科/硕士/博士应届毕业生
-简历投递:guimin.hgm@alibaba
-inc.com
## 团队使命:让 AI 算力像水电一样高效、稳定、普惠
我们是阿里云弹性计算—灵骏智算集群管理团队,负责构建支撑通义千问等超大规模 AI 模型训练和推理的智算基础设施。
我们打造的是:
-数十万级 GPU 规模的超大规模异构算力集群
-面向大模型训练与推理的高可用、高效率、全自动的算力调度与管理系统
-基于 AI Agent 能力,扩展多领域 Skills,构造新一代智能算力运维系统
-面向客户的 AI
-Native 智能平台 REIN,通过 Agent 驾驭 GPU 算力,实现训推一体的任务提交、智能编排、推理部署、性能优化、故障自愈
##
岗位职责你将参与构建灵骏智算集群的"大脑"系统
作为后端开发工程师,你将深入参与灵骏核心监管控系统的建设,涵盖以下方向:
1.建设灵骏监管控系统核心能力: 构建自动化、智能化的集群管理平台,持续提升客户在云上使用灵骏产品的易用性与智能化水平。
2.打造智算集群全栈管理体系: 主导或参与智算集群库存管理与节点生命周期管理、高效节点调度与资源编排系统、性能分析、故障自动发现与自愈系统、面向租户的一站式运维能力(可观测性、诊断、自助服务)等。
3.构建异构算力统一调度系统: 设计并实现面向 GPU、DPU、PPU 等异构芯片的统一资源抽象与调度框架,持续提升集群资源利用率,降低单位算力成本。
4.打造 AI
-Native 智能平台 REIN: 参与构建面向灵骏算力客户的 AI
-Native 平台,通过 Agent 驾驭 GPU 算力,提供训推一体的任务提交与智能编排、推理部署、性能优化、故障自愈、智能运维能力,使算法团队无需 Infra 团队即可高效使用整个 GPU 算力资源。
5.基于 AI 构造智能运维能力,保障系统高可用与稳定性: 基于 AI 能力建设管控系统自身高可用体系,提升管控组件故障自动定位与恢复能力,提升 SLA 保障体系,确保业务持续可用。
6.前沿技术探索与创新落地: 跟进 AI 智算、云原生、智能运维(AIOps)、AI Agent 等前沿技术趋势,结合真实业务场景进行技术预研与工程落地。
## 职位要求
我们寻找热爱技术、追求极致的系统构建者,期待你具备以下条件:
1.本科及以上学历,计算机、软件工程、人工智能等相关专业背景
2.编程基本功扎实,熟练掌握 Golang / Java / Python / C++ 中至少一种语言
3.扎实掌握数据结构、算法、操作系统、网络、数据库等基础知识
4.具备优秀程序员的基本素养和编码规范意识
5.对分布式系统、高并发、高可用架构有基本理解
加分项
● 有 Kubernetes、云原生、容器化相关开发经验
● 对 AI Agent、LLM 应用开发有实践经验或浓厚兴趣
● 有分布式资源调度、GPU 集群管理相关项目经验
● 在开源社区有贡献或参与经历
● 有 AI Infra 或智算平台相关实习经验
## 投递方式
想要投递的同学,简历命名 "学校+学历(博士/硕士/本科)+姓名+岗位" 发送至邮箱:guimin.hgm@alibaba
-inc.com
或者扫描内推二维码※ 修改:
·hgm 于 Aug 11 10:00:04 2026 修改本文
·[FROM:
59.8
2.5
9.*]※ 来源:
·北邮人论坛 http://bbs.byr.cn
·[FROM:
59.8
2.5
9.*]