首页
学习
活动
专区
圈层
工具
发布

#gpu

从“能用”到“好用”:我们在腾讯云TKE上优化AI推理服务的三个实战复盘

科技酱

过去两年,我们团队在腾讯云容器服务(TKE)上陆续上线了四个AI推理业务,涵盖智能客服、代码补全、文档摘要和图像生成。踩过的坑比跑通的demo多得多,很多优化方...

6510

AI Agent高频调用场景下,GPU原生数据库如何消除PCIe搬运瓶颈

数据库小学妹

上个月刷到WAIC 2026的消息,一条很炸眼。星环科技发布了全球首款商业化GPU原生认知数据库。官方口径:TPC-DS基准测试比主流开源数据库快70倍。同场演...

12710

AI Infra 系列 · 第二章(下):推理侧 KV 传输——NIXL 如何搬运 prefill 到 decode

dongdonglog

第一章第五节讲过,2026 年推理系统最明确的一条主线,是分离式 Prefill/Decode——把 prefill 和 decode 拆到不同的 GPU 池,...

11720

AI Infra 系列 · 第二章(上):训练侧通信——NCCL 如何让 GPU 别等数据

dongdonglog

一块 Blackwell 几秒钟能算完的矩阵,如果梯度同步要走一条又慢又绕的路,整张卡就得停下来干等。在我们第一章里 Meta 那份研究说,集群看着 100% ...

28920

TKE GPU 利用率优化:qGPU 共享与智能调度实战

hollyx

摘要: GPU 算力成本高昂但多数企业实际利用率仅在 5% 至 15% 之间。本文介绍基于腾讯云容器服务 TKE 的 qGPU 共享、TACO 推理加速与智能调...

14310

一家SaaS公司花17亿买GPU,这笔账算得过来吗?

爱分析ifenxi1

今年5月20日,迈富时完成了一笔不太起眼的新股认购,募资净额约5亿港元,认购价40.54港元。

4900

qGPU 共享技术详解:让昂贵的 GPU 资源利用率翻倍

hollyx

TKE 开发了 gpu-exporter 组件,用于获取 GPU 相关 Pod/容器维度的监控指标,包括 GPU 卡利用率、Pod/容器 GPU 资源利用率以及...

12710

纯前端 AI 视频编辑器的性能难题:WebGPU、Worker 与多轨时间线实践

用户5557817

传统的视频编辑软件往往依赖桌面客户端和本地原生运行时。随着 WebCodecs、WebGPU、WebAssembly 和 IndexedDB 等浏览器能力逐渐成...

14010

绿电赋能算力,算电协同重构能源新生态

文慧的科技江湖8676

核心载体:微电网、零碳园区、虚拟电厂、绿电管理平台业务本质:管住电的「发、储、配、售、调、消」

21100

企业GPU监控实战:从手动排查到统一算力运维

运维行者

随着人工智能、大模型训练、视频渲染和高性能计算(HPC)的快速发展,GPU 已逐渐成为企业 IT 基础设施中最重要的计算资源之一。从 AI 模型训练到数据分析,...

17910

CUDA 护城河崩了 !Claude独自跑通AMD新GPU

Amusi

一句话,一个周末,Claude直接把自家最前沿的模型跑在了一台全新的AMD MI355X机架上!

35610

多模型推理GPU利用率优化:队列感知路由与动态批处理实战指南

聚搜云-JuSouYun

部署多种模型共享 GPU 集群时,运维团队常看到的不是算力不足,而是算力浪费——一部分 GPU 持续跑在 80% 以上利用率,另一部分却在 30%-50% 之间...

18010

ollama v0.32.4 发布:Laguna 登陆 Apple GPU,Qwen3 MoE 解码修复与 Agent 技能权限全面升级

福大大架构师每日一题

ollama v0.32.4 已正式发布。本次版本围绕 Apple GPU 推理支持、投机解码草稿模型量化、Qwen3 MoE 解码兼容性和性能优化,以及 Ag...

12510

1.2 训练算力:GPU集群利用率

华夏之光永存

痛点:​ 训练集群 MFU(Model FLOPs Utilization)约 45%-55%,低于头部厂商(65%+)。

18410

WAIC 2026观察:数据库正在被AI“重写”——从GPU原生数据库到可信数据库大会的三个信号

这个DBA有点耶

7月的上海,WAIC 2026世界人工智能大会办了整整一周。展览面积首次突破10万平方米,1100多家企业带来3000多项展品。作为一个野生DBA,逛了一圈下来...

22710

2026 AI算力集群存储实战:从RAID底层原理到NVMe数据流全解析:从底层原理到企业级实战的终极指南

jack.yang

在人工智能、大数据分析与云计算主导的今天,算力(GPU/TPU)往往占据了技术讨论的聚光灯。然而,如果没有高效、可靠且高性能的存储子系统作为支撑,再强大的算力也...

23520

3360亿晶体管!英伟达Rubin GPU细节首曝:智能体AI性能提升10倍

芯智讯

7月22日消息,在GTC 2026正式发布之后,英伟达(NVIDIA)近日首次完整公开了Rubin AI GPU架构的技术细节。作为下一代AI数据中心平台的核心...

29910

Sim4Life V9.6 的 GAF 算法:用格林函数把 NEURON 压到千分之一算力,临床 SCS 规划终于跑得动了

深圳浦实

深圳浦实信息技术有限公司 | 销售经理 (已认证)

Sim4Life V9.6 于 2026 年 6 月 4 日正式发布。新版本攻克了神经刺激建模领域长期存在的计算瓶颈,同时完成平台整体优化,大幅提升工作流运行速...

3500
领券