model serving
概念词 📚 基础词库 · 存量热词模型推理服务
🔍 Google 联想 10 📄 arxiv 893 篇 📅 首次出现 2026-08-28
🧠 model serving 是什么
模型推理服务(model serving)指将训练好的模型部署上线、管理 GPU 资源并以 API 形式对外提供推理能力的过程,核心指标是吞吐量、首 token 延迟与时延。
大模型推理受显存与带宽瓶颈约束,催生了专用推理框架:2023 年 UC Berkeley 团队的 vLLM 提出 PagedAttention,把 KV 缓存像操作系统分页一样管理,吞吐量提升数倍并成为开源部署的事实标准;SGLang、TGI、TensorRT-LLM 等框架并存竞争。
服务化工程还包括量化、连续批处理、前缀缓存、扩缩容与安全网关,推理成本是大模型应用最大的开销项,serving 因此成为降本增效的主战场。
🔥 为什么现在火
"推理成本决定商业模型"成为行业共识,serving 基础设施成为创业与开源热点;开源框架让企业可用消费级 GPU 自建推理服务,推动私有化部署普及。
📄 证据链(交叉验证)
- ▸arXiv 论文《Efficient Memory Management for Large Language Model Serving with PagedAttention》(vLLM)
- ▸vLLM 官方文档
🔍 搜索形态
what is model serving model serving vs inference
model serving 常见问题 FAQ
serving 和训练有什么区别?+
训练更新权重、消耗大量算力;serving 固定权重只做前向推理,更吃显存带宽与延迟优化。
为什么 vLLM 这么快?+
核心是 PagedAttention 显存管理加上连续批处理,大幅提高显存利用率和吞吐量。
与 model serving 相关的搜索
人们搜索 model serving 时,还会关心这些问题:
- 模型推理服务 是什么
- 什么是 模型推理服务
- 模型推理服务 是什么意思
- 模型推理服务 原理
- 模型推理服务 有什么用
- 模型推理服务 应用场景
- 模型推理服务 为什么火
- 模型推理服务 2026