首页
学习
活动
专区
圈层
工具
发布
首页标签自动推理

#自动推理

AI Infra 系列 · 第四章 推理引擎 (下):投机解码、量化、KV 池化、MoE 并行,一张卡当两张用

dongdonglog

decode 慢的根源是串行:一次只能生成一个 token,每步都要把全部权重搬一遍。

9820

AI Infra 系列 · 第四章 推理引擎 (上):为什么 LLM 一次只蹦一个 token,vLLM 和 SGLang 到底差在哪

dongdonglog

推理是单行道:用户的问题(prompt)先整体算一遍(这叫 prefill),然后一次只能生成一个 token(这叫 decode)。生成第 2 个 token...

19920

AI Infra 系列 · 第三章 存储层(下):训练慢别改学习率,先看 DataLoader

dongdonglog

调优不当的输入管道可能浪费 50% 的 GPU 时间,而算法优化通常只给几个百分点

23720

AI Infra 系列 · 第三章 存储层(上):GPU 饿着不是算法问题,是账单问题

dongdonglog

一个 72 卡的 NVIDIA NVL72 机柜,如果每张 GPU 需要 200 MB/s 的训练数据才不闲着,整个机柜需要 14 到 20 GB/s 的聚合存...

23120

AI Infra 系列 · 第二章(下):推理侧 KV 传输——NIXL 如何搬运 prefill 到 decode

dongdonglog

第一章第五节讲过,2026 年推理系统最明确的一条主线,是分离式 Prefill/Decode——把 prefill 和 decode 拆到不同的 GPU 池,...

13420

推理缺口视角下企业隐秘入侵链路与反钓鱼闭环防御技术研究

芦笛

中国互联网络信息中心 | 工程师 (已认证)

针对 Security Boulevard 2026 年 7 月发布的《The Reasoning Gap: Your Organization’s Secre...

10800

《模型量化实战:从 FP16 到 INT4,如何在精度损失 ~1% 的情况下提速 300%?》

七条猫

根因通常不是"量化算法不行",而是你把它当成"压缩 zip"用了——以为把权重从 16bit→4bit 就结束了。

23310

GraphRAG实践:企业知识库从文本检索到知识图谱推理的架构升级路径

网渡科技

随着大语言模型(Large Language Model,LLM)进入企业应用阶段,传统知识库面临新的挑战:

26510

AI大模型进阶系列(05) 上下文如何优化 | 大模型推理成本账

拉丁解牛说技术

上一篇把大模型拆到了 next token prediction 这一层,顺带提过 token、KV Cache、上下文窗口几个词,这篇把它们真正算清楚。

56210

重磅观察:AI 推理调度进入精细化阶段,队列、批处理和弹性伸缩成为降本新方向

用户12583401

过去,很多 AI 应用的推理方式比较简单。用户请求进入系统后,应用直接调用模型接口,等待模型返回结果,然后展示给用户。

20300

论文解读:DeepSeek DSpark 在真实高并发推理服务中,如何保证 Token 生成又好又快?

七牛开发者

刚刚过去的周末,DeepSeek 发布了一篇关于推理加速的新论文:《DSpark: Confidence-Scheduled Speculative Decod...

22410

利用多向因果结构对字符串图进行快速自动推理

CreateAMind

Fast Automated Reasoning over String Diagrams using

20800

硬核实战:2.15 倍推理提速!揭秘 LLM 小批量解码的隐形致命坑

山野大叔

在LLM部署中,小批量连续解码(Batch Decode) 是线上服务、对话场景最主流的形态。长期以来,业内有一个普遍看法:

13910

“注意力流追踪”技术如何揭示大模型推理路径的形成过程——全方位解构“思维链”在神经网络中的真实运作轨迹

jack.yang

文末有超值福利!如果你觉得本文对你有启发,请务必点赞、收藏、评论“666”并转发给你的朋友。你的每一个互动,都是对我持续创作深度内容的最大支持!关注我,获取更多...

32320

AAAI聚焦提示工程与推理技术

用户11764306

今年,人工智能促进协会年度人工智能会议(AAAI)收到了约9000篇论文投稿,因此需要相应规模的项目委员会,由两位项目主席和四位副项目主席共同负责。

20210

AAAI聚焦:提示工程与AI推理技术前沿

用户11764306

"提示工程"指的是致力于从大型生成模型中提取准确、一致且公平的输出。这些模型,如文本到图像合成器或大型语言模型(LLMs),在海量文本语料库上训练,编码了大量关...

19610

软件验证技术革新者获ACM院士殊荣

用户11764306

某机构学者Ranjit Jhala因其在软件验证领域的终身贡献,被美国计算机协会(ACM)授予2021年度ACM会士荣誉称号。作为加州大学圣地亚哥分校计算机科学...

14310

每日十亿次SMT查询:云规模下的自动推理实践

用户11764306

在今年的计算机辅助验证(CAV)会议上,某机构的Neha Rungta发表了主题演讲,她认为某机构的创新“开启了自动推理的黄金时代”。某机构的科学家和工程师正在...

23610
领券