Agent 评测不能只看“最终回答对不对”,而要同时评估:是否正确理解任务、规划是否合理、工具是否正确调用、环境状态是否真正改变、失败时是否恢复、安全边界是否守...
LLM RAG Agent 三类场景的评估工具对比,按“工具→定位→核心能力→适用场景”结构化呈现。
HAR(HTTP Archive),是W3C事实标准的HTTP会话存档文件,本质是JSON格式,完整记录一次会话下全部HTTP/HTTPS请求与响应全量数据。
在深入拆解 Medusa 技术之前,我们先铺垫一个业界主流的大模型提速方案"投机解码"。相信看过前文的朋友都清楚,投机解码核心是Draft-Target 双模型...
做本地大模型部署调试这段时间,直观感受真的是一山更比一山高。最开始落地医疗场景AI项目,我一直用的是ChatGLM3-6B,日常的语义对话、简单信息解读都很流畅...
在这一过程中,模型训练完成只是应用链路的起点,如何实现模型服务化部署、计算任务管理、运行状态监控以及结果分析,成为算法工程化落地过程中需要重点解决的问题。
本地私有化部署ChatGLM系列模型是比较普遍的落地场景,实际过程中也必定会碰到一个硬性资源瓶颈:一张24G的 RTX4090 显卡,原生框架只能串行加载Cha...
一份 SKILL.md,配上脚本、工具声明和领域知识,就能让 Agent 获得一项相对完整的能力:代码审查、依赖升级、数据分析、发布计划、故障排查、测试执行……
但随着模型类型增多、使用人员扩大,仅依靠人工确认或直接发布的方式,容易出现: 模型上线缺少统一审核节点;发布申请信息不完整;模型变更过程难以追踪;审核结果缺少记...
中国互联网络信息中心 | 工程师 (已认证)
针对 2026 年 7 月 McAfee 与 KnowBe4 披露的新型网络威胁,本文系统研究开源视觉语言模型(VLM)基于社交平台公开旅游照片实现无元数据地理...
过去,很多团队更关注模型能不能训练出来、指标是否足够高、能不能部署到线上。但当模型真正进入生产环境后,新的问题会持续出现。
生成式大语言模型(LLM)普遍存在事实幻觉缺陷,模型会自主生成不存在、符合语义逻辑的域名地址。攻击者利用该稳定幻觉特征,提前注册此类虚构域名并部署仿冒站点实施钓...
2026 年,AI 应用不再只依赖单一模型。一个真实系统里,可能同时使用大语言模型、Embedding 模型、图像模型、语音模型和本地小模型。不同模型有不同价格...
五渠道、三阵营、一张表。从如何选到如何配,本文是 WorkBuddy 模型体系的完整索引。