运维 / SRE → 大模型部署方向转行指南
经验直接标价的部分
大模型把"算力服务化"的复杂度抬了一个量级:GPU 成本、显存碎片、批处理吞吐、冷启动延迟——每一条都是运维熟悉的语义场换了个对象。
- 容量规划 → 显存估算(参数量 × 精度 + KV Cache 占用)→ 7B 模型需要多少显存类考题;
- 性能调优 → 吞吐/延迟权衡(Continuous Batching、Prefix Caching)→ LLM 推理优化专题;
- 交付体系 → vLLM/SGLang/TensorRT-LLM 选型与部署 → 推理框架专题;
- 可观测性 → Token 成本监控、Agent 生产监控 → Agent 可观测性专题(蓝海且对口)。
补什么
- LLM 基础概念⭐题——面试不能只会 Ops 不懂模型;
- Python 基本读写能力(部署脚本、配置即代码生态);
- 上手一条模型训练与推理路线按序走完;
- 建议精读 MCP 与工具系统的企业级部署相关考点——私有化部署场景是运维转岗的高发地带。
项目建议
搭一个单机 LLM 推理服务完整方案:Ollama 或 vLLM 起服务 + Nginx 反代 + 限流 + 成本/延迟监控大盘 + 故障演练记录。运维同学做这类项目又快又稳,面试时就是降维打击。