**猎头职位 | 北京 · 某头部科技公司,核心AI团队扩招**
职位一:大模型技术商务(Data & API Sourcing BD)
工作地点:北京
我们寻找怎样的人?
你不是传统销售,也不是纯技术岗——你是懂大模型数据价值、能独立开拓上游供应渠道的复合型商务。公司大模型训练需要海量文本、图书语料及各类API能力,你要做的是从0到1搭建供应商资源池,并主导从接洽、验证到签约的全流程。
核心职责
- 自主挖掘并维护数据、API等上游供应渠道,动态更新供应商资源库,不依赖现成名单;
- 寻找大模型训练语料(文本、图书等)供应商,独立完成接洽、抽样验证、质量评估、谈判与签约;
- 覆盖LLM API全生态(一手模型厂商、聚合/中转商、云托管、开源托管及周边API如向量库、Embedding、语音、多模态等),持续挖掘新厂家与低成本优质渠道;
- 独立判断数据是否值得买、API厂商是否可用,给出明确结论与依据;
- 主导价格、授权、SLA等条款谈判,控制成本并推动合作落地。
任职要求
- 数据判断力:买语料时能评估数据质量(清洗程度、OCR准确度、去重真实增量)、领域稀缺性与可交付性;会设计抽样验证,不被精选样本误导,能给出“值不值得买、值多少钱”的清晰结论;
- API生态熟悉度:熟悉LLM API供给生态,主动挖掘新厂商,通过小成本POC实测筛选出稳定、高性价比的服务;
- 技术理解:了解大模型训练/推理流程,理解数据在预训练、SFT、RAG中的作用,能看懂API文档及延迟、吞吐、价格、上下文长度等指标;
- 开拓与谈判:能自己搜资源、建联系、推进度,cold outreach能力强,谈判功底扎实。
加分项
- 有LLM数据采购或API选型实操经验;
- 技术背景转商务,或商务背景懂技术;
- 中英双语,能直接对接海外供应商;
- 了解数据合规法规(版权、隐私、跨境数据等)。
---
职位二:大模型爬虫逆向工程师
工作地点:北京
团队背景:大模型自研团队,专注预训练与多源数据采集
你将解决什么问题?
大模型训练需要海量、高质量、多维度的数据,常规爬虫无法满足。你需要结合大模型应用需求,设计高效智能的爬虫系统,并具备逆向工程硬实力,突破各类反爬限制,为模型训练稳定输送“燃料”。
核心职责
- 结合大模型场景,设计并优化多源数据采集系统,突破技术限制实现稳定高效获取;
- 承担Web/APP逆向工程任务,完成复杂定向采集;
- 针对模型预处理要求,优化爬虫输出格式与质量,提升数据对训练/推理的适用性;
- 自动化处理反爬机制变化,快速提供灵活应对方案;
- 与模型研发团队紧密配合,确保采集数据有效支持训练与应用;
- 跟进最新反爬技术与反制策略,持续优化爬虫架构。
任职要求
- 本科及以上,计算机、AI、网络安全等相关专业;
- 3年以上爬虫开发及逆向经验,有大模型/AI相关爬虫应用经验者优先;
- 精通Python或其他语言,熟悉Scrapy、Selenium、Playwright等框架;
- 熟悉大模型训练和数据处理流程,能根据模型需求调整抓取策略;
- 熟悉HTTP/HTTPS及接口抓取,能高效提取和清洗复杂数据;
- 具备出色的问题分析与解决能力,能应对复杂反爬挑战。
加分项
- 有大规模数据抓取经验,特别是针对大模型训练数据的采集优化;
- 熟悉数据加密/解密技术,能破解复杂加密算法;
- 具备AI或大模型技术背景,能理解和支撑模型数据需求。
---
职位三:AI基础设施研发工程师(Sandbox / 容器化)
工作地点:北京
方向:大规模强化学习训练基础设施
为什么要加入我们?
大模型Agent和代码能力训练正进入大规模RL阶段,我们需要稳定、安全、可扩展的任务执行环境。你将参与设计和实现sandbox执行系统、容器调度平台、训练任务环境及隔离资源管理,为大规模Agent任务、代码执行和RL训练提供底层infra支撑。
核心职责
- 建设面向RL训练的sandbox执行环境,支持代码运行、工具调用、浏览器自动化、文件操作、网络访问控制等;
- 基于Docker/Kubernetes构建大规模容器化任务运行平台,支持高并发、多租户、可观测、可恢复的训练任务;
- 参与RL训练infra的scaling,包括任务分发、资源调度、环境复用、状态隔离、失败恢复、日志采集与性能优化;
- 建设安全隔离机制(权限控制、系统调用限制、网络隔离、资源限额),降低模型生成代码和Agent调用带来的安全风险;
- 与模型训练、Agent框架、数据及评测团队协作,将业务需求转化为稳定可用的执行环境;
- 分析大规模训练中的系统瓶颈,持续优化调度效率、资源利用率和环境稳定性;
- 参与内部平台工具建设:任务管理、监控、日志查询、调试、指标看板、自动化运维。
任职要求
- 熟悉Linux系统、进程模型、文件系统、网络、权限控制及资源隔离;
- 熟悉Docker、containerd、Kubernetes,有生产环境使用或平台建设经验;
- 理解sandbox/隔离执行环境核心问题(安全边界、资源限制、网络隔离、文件系统隔离、进程生命周期);
- 熟悉Go/Python/Rust/JS/Shell中至少一种,能独立开发infra工具或平台服务;
- 具备分布式系统与基础设施工程意识,理解任务调度、队列、服务发现、监控告警、日志系统、故障恢复等;
- 对大模型训练、Agent执行环境、代码运行平台或RL训练基础设施有浓厚兴趣;
- 良好的问题定位能力,能在复杂系统中分析性能、稳定性及资源利用率问题。
加分项
- 有大规模Kubernetes集群、在线执行平台、CI/CD、Serverless、判题系统、代码沙箱或浏览器自动化平台建设经验;
- 熟悉Linux namespace、cgroup、seccomp、AppArmor、SELinux、Firecracker、gVisor、Kata Containers等隔离技术;
- 有高并发任务调度、批处理、工作流引擎、训练平台或MLOps平台经验;
- 熟悉GPU/CPU混合资源调度、分布式训练、Ray、Slurm、Argo Workflows、Volcano、KubeRay等;
- 熟悉可观测性体系(Prometheus、Grafana、OpenTelemetry、Loki、ELK等);
- 有安全工程经验,理解不可信代码执行、权限收敛、沙箱逃逸风险及多租户隔离;
- 有大模型Agent、代码执行环境、RL训练平台或评测平台相关经验者优先。
---
以上职位均为紧急需求,流程快,反馈迅速。
若您或身边朋友匹配,欢迎直接投递简历至 zkt.0327@163.com,或微信联系顾问Penny。 (邮件标题请注明应聘职位+姓名,合适者24h内回复)
*所有信息严格保密,仅用于招聘流程。*