首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >AI Infra 系列 · 第四章 推理引擎 (上):为什么 LLM 一次只蹦一个 token,vLLM 和 SGLang 到底差在哪

AI Infra 系列 · 第四章 推理引擎 (上):为什么 LLM 一次只蹦一个 token,vLLM 和 SGLang 到底差在哪

作者头像
dongdonglog
发布2026-08-26 11:52:41
发布2026-08-26 11:52:41
800
举报
概述
训练是流水线,推理是单行道。一个 70B 模型在 GPU 上生成一个 token 要几十毫秒,用户感知就是"一个字一个字往外蹦"。这篇讲清楚 LLM 推理为什么天生慢、现代引擎(vLLM/SGLang/TensorRT-LLM)靠什么把它压回来,以及 2026 年三个引擎到底怎么选。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档