dongdonglog
AI Infra 系列 · 第四章 推理引擎 (上):为什么 LLM 一次只蹦一个 token,vLLM 和 SGLang 到底差在哪
原创
关注作者
腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
dongdonglog
社区首页
>
专栏
>
AI Infra 系列 · 第四章 推理引擎 (上):为什么 LLM 一次只蹦一个 token,vLLM 和 SGLang 到底差在哪
AI Infra 系列 · 第四章 推理引擎 (上):为什么 LLM 一次只蹦一个 token,vLLM 和 SGLang 到底差在哪
dongdonglog
关注
发布于 2026-08-26 11:52:41
发布于 2026-08-26 11:52:41
80
0
举报
概述
训练是流水线,推理是单行道。一个 70B 模型在 GPU 上生成一个 token 要几十毫秒,用户感知就是"一个字一个字往外蹦"。这篇讲清楚 LLM 推理为什么天生慢、现代引擎(vLLM/SGLang/TensorRT-LLM)靠什么把它压回来,以及 2026 年三个引擎到底怎么选。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系
cloudcommunity@tencent.com
删除。
算法
自动推理
大模型部署
ruby on rails
机器学习
#AI infra
#AI
#大模型运维
#AI 推理
#AI 算法
问题归档
专栏文章
快讯文章归档
关键词归档
开发者手册归档
开发者手册 Section 归档