首页
学习
活动
专区
圈层
工具
发布
首页标签人工智能

#人工智能

人工智能是指通过普通计算机程序的手段实现的人类智能技术

Nemotron 3.5 Lightning 对本地智能体架构意味着什么?

Cursor 做代码托管,Origin行吗?

资深工程师如何训练AI时代的权衡力?

AI Agent干活时,一天怎么规划?

AI Agent干活时,你的一天怎么排?

用AI后程序员是在退化吗?

AI Agent 生产落地为何大规模回滚?

用AI后程序员是在退化吗?

换Harness比换模型更赚?

Harness拉满:模型只值30%?

V4涨价却开源Harness?

Flash半价到期:基模在套谁?

高并发短请求和长序列生成混跑时,推理服务的 KV Cache 与调度器该怎么设计才能互不拖后腿?

紫风十五年服务端架构专家,用高可用承载亿级流量,用高性能支撑毫秒级响应。为业务增长提供坚实的技术底座。
这个场景的核心矛盾是短请求对延迟敏感、长请求对吞吐敏感,混在一个调度队列必然互相干扰。方案A+C组合最务实:7B模型水平扩展多实例,每实例收紧max_seq_len,浅队列快速失败保p99;70B单独部署,深队列削峰保吞吐。优先级抢占不可取——抢占一次就丢KV重新prefill,短请求持续涌入会让长序列永远做不完。KV池必须按模型隔离,7B和70B显存占用差一个数量级,共池就是长序列挤爆短请求。prefix cache只在同模型内复用,跨模型KV不通用,不值得为此增加复杂度。网关层按请求类型路由,各自独立背压,互不影响。... 展开详请

现在智能问数有没有不需要大量维护工作的方案?

如何节省token?

怎么看待用Skills蒸馏员工?

请问,我的体验版的workbuddy积分余额,为什么莫名其妙的减少和增加?

ai时代,工作方式有了什么变化?

Jack20Never give up,than you will be successful
维度 纯人工时代 AI时代 个人能力 执行能力(手艺) 决策与指挥能力(判断) 组织重心 稳定的“金字塔”中层 扁平的“哑铃型”两端(专家+人机协同执行层) 协作对象 人与人 人与人、人与AI Agent(混编) 管理者角色 管人、协调 设计人机协作流程、编排智能体[cite:3] 核心竞争力 流程效率 响应速度与判断质量 ... 展开详请

不知道怎么解决前端图片显示问题?

如果 RTX5090D v2 被禁售,国内的高端显卡市场将迎来怎样的“断层”?玩家和创作者该如何应对?

领券