最近和几位大厂Infra团队的Leader交流,大家有一个强烈的共识:今年AI Infra的跳槽,已经过了“盲目追逐Title和薪资”的草莽阶段。
随着大模型进入深水区,高层人员流动频繁、团队重组加剧。Infra人的职业选择,本质上是在选择 “算力分配的优先级” 和 “技术路线的确定性”。
今天从猎头的视角,严谨地拆解一下当前AI Infra人才看机会的深层契机,以及评估新Offer的核心维度。
📌 Part 1:出现这三个“组织与技术”信号,建议启动看机会
很多Infra同学对技术瓶颈很敏感,但往往忽略了组织架构变动带来的隐性风险。
🔹 1. 高层流动导致技术路线频繁“翻烧饼”Infra最忌讳方向摇摆。如果团队高层频繁变动,导致技术路线在开源框架(如vLLM/SGLang/TRT-LLM)之间反复横跳,或者在“全自研”与“拥抱开源”之间左右互搏。这不仅会消耗团队精力,更会导致你的技术积累无法形成复利。
🔹 2. 算力获取优先级降级,沦为“边缘试错”万卡集群是Infra的练兵场。如果你所在的业务线在公司的战略优先级下降,导致算力调度只能“捡漏”,或者长期只能在百卡规模下做Mock测试,你的系统级调优能力(如大规模RDMA网络通信、千卡级容错设计)将迅速退化。
🔹 3. 陷入“伪Infra”泥潭,沦为业务胶水层如果日常工作变成了写Python调度脚本、配环境、做数据清洗,或者仅仅是在开源框架上改改配置参数,从未深入过CUDA Kernel、显存管理(PagedAttention底层)或底层通信库(NCCL)。这种“调包侠”在当前的降本增效周期中,可替代性极高。
⚖️ Part 2:评估新机会的3个严谨维度(避坑指南)
面试是双向选择,评估一个Infra岗位是否值得去,不要只看JD,要深挖以下三个底层逻辑:
💡 维度一:考察“算力底座”的真实性与网络拓扑不要只听“我们要建万卡集群”的宏大叙事。严谨的做法是追问:
- 算力独占性:是物理独占集群,还是与训练/其他业务混部?(混部带来的资源抢占和隔离问题,是极大的工程挑战)。
- 网络与存储:是纯InfiniBand,还是RoCEv2?KV Cache的跨节点迁移是否有高性能的分布式存储支撑?(没有好网络,PD分离就是伪命题)。
💡 维度二:Infra团队在公司的“生态位”
- 成本中心 vs 核心引擎:Infra团队是纯被动接需求的“支撑部门”(出了线上故障先背锅),还是能参与模型设计、与算法团队进行“算子与模型联合优化”的核心引擎?
- 业务绑定深度:Infra的价值必须通过核心业务(如搜索、推荐、Agent)的DAU和营收来体现。脱离核心业务流的Infra,在裁员时往往首当其冲。
💡 维度三:技术Leader的背景与团队稳定性Infra是一个极度依赖“踩坑经验”的领域。Leader是否有过完整的万卡集群从0到1建设经验?是否有过处理大规模线上雪崩的实战经验?这决定了团队未来一年的技术下限。
🛠️ Part 3:高阶Infra面试,Tech Lead到底在考察什么?
到了资深/专家级别,面试不再是默写八股文,而是考察System Design(系统设计)与 Trade-off(权衡)的能力。
✅ 从“单点极致”到“全局权衡”不要只谈“我把某个Kernel的吞吐提升了20%”。高阶面试官更看重:在显存受限、网络带宽瓶颈、长尾请求(Corner Case)交织的复杂线上环境中,你如何做系统级的Trade-off?(例如:PD分离架构下,如何权衡Prefill节点的GPU利用率与Decode节点的响应延迟?)
✅ 对底层系统的“敬畏心”与兜底能力大模型推理的线上环境极其脆弱。你是否具备从 应用层(Router) ➡️ 框架层(执行图) ➡️ 系统层(RDMA/NCCL) ➡️ 硬件层(GPU Util/显存带宽) 的全链路Profiling与故障定位能力?在面临GPU掉卡、网络抖动时,你的MTTR(平均恢复时间)能做到多少?
✅ 开源视野与社区贡献在框架高度内卷的今天,是否给vLLM/SGLang/DeepSeek等主流社区提交过核心PR?这不仅是技术实力的背书,更代表你具备追踪全球最前沿技术演进的视野。