ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

AI 运维岗:从 GPU 排障到推理平台面试

2026/10/1 14:18:32 拓冰建站 浏览量
AI 运维岗:从 GPU 排障到推理平台面试 文章目录AI 运维岗:从 GPU 排障到推理平台面试一、AI 运维岗到底是什么岗:三个价位段二、同一份 dmesg,处置方向可能完全相反要点一:按 PCI 地址聚类,而不是按时间排序要点二:Xid 63 的累计次数才是换卡的先行指标要点三:报修不是喊"卡坏了"三、12 道面试题,按三层难度拆3.1 基础层:验证你摸过卡3.2 进阶层:验证你的定位链路3.3 资深层:验证你会算账四、从云运维转 AI 运维:90 天路径第 1-2 周:把 GPU 从"黑盒硬件"变成"你能观测的组件"第 3-5 周:把 Xid 表背下来,把拓扑画出来第 6-8 周:K8s 上的 GPU 调度第 9-12 周:推理平台与成本小结AI 运维岗:从 GPU 排障到推理平台面试先讲一个真事。有团队在内部平台上用 4 张 A100 80GB 部署 Qwen3-32B,vLLM 0.17.0,并发 10,最大上下文 30K。部署完成,显存占用约 0.85(每卡约 68GB),推理速度符合预期,压测也过了。然后它每跑 2-3 天就崩一次。重启之后又完全正常。最开始所有人都往软件方向查——显存泄漏?并发太高?vLLM 的 bug?查了一周没结论。最后是dmesg | tail -50揭的底:一张卡在悄悄地坏。这个故事是这篇文章的起点。因为它一次性暴露了 AI 运维岗和传统运维岗最本质的差别:故障不在你的可控层,而现象全在你的可见层。一、AI 运维岗到底是什么岗:三个价位段先把"AI 运维"这个词拆开。目前公开招聘市场上,它至少分成三个价位段,工作内容差别很大。价位段真实在招样本实际工作重心高:算力平台 / 集群运维南京·GPU 集群运维·20-30K×13薪·3-5年深圳·AI 基础设施运维·2-3万×13薪·1-3年集群容量规划、GPU 资源池化与调度、多机多卡性能调优、推理平台运维