北京聆心智能科技有限公司——大模型推理优化工程师

北京聆心智能科技有限公司近日在BOSS直聘平台发布了一则招聘信息,岗位为大模型推理优化工程师,工作地点位于北京,学历要求硕士,薪资区间定在30-50K,信息发布日期为2026年9月3日。从岗位名称判断,该职位主要围绕大模型部署后的推理速度、显存占用、服务吞吐量做工程层面的优化,属于大模型从实验室走向产品化过程中比较关键的技术环节。
招聘信息中没有列出具体的职责细项,但结合行业内同类岗位的通行做法,推理优化工程师日常接触的内容通常集中在几个方向:对训练好的模型做剪枝、量化、蒸馏等压缩处理;针对特定硬件(如英伟达A100/H系列或国产算力卡)调整算子与内核;设计KV Cache、continuous batching等推理服务策略;以及配合上层业务压低单次请求的延迟和成本。企业方要求硕士学历,大概率是希望候选人在计算机体系结构、操作系统、并行计算或机器学习任一方向有扎实的理论底子,同时能熟练使用C++或CUDA编程,对PyTorch等框架的底层实现不陌生。
这个岗位明确要求硕士,且日常工作涉及CUDA编程、算子调整这些底层东西,没系统学过计算机体系结构的话,直接转难度很大。不过如果你有Python和机器学习基础,可以从量化、蒸馏这些模型压缩方向入手,再补C++和CUDA,周期大概半年到一年。招聘方的核心诉求是能动手改代码,不是光会调参。
查看完整问答 →薪资方面,30-50K在北京的大模型算法类岗位中属于中等偏上水平,月薪之外通常还有年终奖和期权激励。这类岗位的成长路径比较清晰,往上走可以做资深推理架构师,负责整个推理平台的搭建,也可以横向转做MLSys(机器学习系统)方向的研究。目前国内大模型创业公司普遍把推理成本视为商业化的命脉,懂工程优化的人才是各家争抢的对象,职业稳定性相对较好。
除了聆心智能,北京近期还有几家企业在招类似岗位,可以作为投递时的备选:
· 零一万物(北京):大模型推理引擎开发工程师,硕士及以上,25-50K·15薪,侧重vLLM/SGLang二次开发与多卡通信优化。
· 面壁智能(北京):端侧大模型推理优化工程师,本科及以上,30-55K,专注手机/嵌入式设备的模型轻量化与NPU适配。
· 智谱AI(北京):高性能计算工程师(推理方向),硕士优先,28-45K,涉及大规模集群下的推理任务调度与资源利用率提升。
北京AI岗位市场趋势
从BOSS直聘等平台的数据来看,2026年三季度北京AI岗位的供给量仍在增长,但结构发生了变化。纯算法岗(如大模型预训练、SFT微调)的竞争已相当激烈,不少企业把学历门槛抬高到博士,而推理优化、训推一体平台开发这类偏工程的岗位,硕士学历反而更容易进入面试环节。企业端普遍意识到,模型能力再强,部署成本降不下来就难以形成商业闭环,因此愿意为懂硬件、懂底层、能动手改代码的人开出更高预算。
从招聘信息看,纯算法岗学历卷到博士,而推理优化硕士就能进面试,说明这类偏工程的岗位人才缺口更大。企业现在卡在部署成本上,愿意为懂底层优化的工程师开高薪。就业市场看重的是你能直接解决推理速度、显存占用这些实际问题,这类技能在国产算力适配、端侧部署上也能复用,路子比纯调参宽。
查看完整问答 →另一个趋势是,中小型AI公司开始倾向于招聘“一专多能”的工程师,希望候选人既能做推理优化,也能兼顾部分训练框架的维护工作。纯调参型选手的生存空间在收窄,具备系统级视野的候选人议价能力更强。对于正在观望的求职者来说,除了盯住大厂,不妨多留意那些有具体落地场景的创业公司,它们的岗位要求往往更务实,成长速度也更快。