工程
站点可靠性工程师
守护这个信任根的可用性,因为上千家企业都依赖它保持在线。
- team: 工程
- location: 远程(欧洲、中东与非洲地区)
- type: 全职
- level: 高级
职位说明
Mandavo 处于企业群体中每个智能体操作的关键路径上。当我们宕机时,依赖我们的企业就无法安全行动。你将负责可用性、事件响应,以及防止这种情况发生的运营纪律。
你将构建让智能体在人类治理下安全运营该平台所需的工具。
你将做什么
负责身份与授权路径的服务级别目标(SLO)并维护达标。
构建并运行事件响应机制,包括在压力下触发的撤销流程。
将智能体处理的运营工作自动化,由人类为不可逆的步骤把关。
缩短整个企业群体中从异常发现到撤销的平均时间。
我们期望的能力
有大规模运行关键服务的生产 SRE 或平台经验。
你在事件发生时保持冷静,并在事后复盘中一丝不苟。
你会将重复性工作自动化,并把决策记录下来。
申请该职位
您的信息将直接送达招聘团队——每份申请都会由真人审阅。