暂无搜索历史
当你的 ITOps Agent 输出一份完美的 Markdown 分析报告,却选错了 restart 命令、漏掉了关键日志,或者在错误的主机上执行操作——传统的...
AI Agent 是“黑盒”,缺乏可观测性就无法定位性能瓶颈与成本失控。OpenTelemetry 的 GenAI/Agent 语义规范正在成为行业标准,通过 ...
TL;DR:在 ITOps 场景中,多 Agent 的价值不在于数量,而在于专业化、隔离、并行、仲裁四种能力。并行取证远优于串行长链,可大幅降低延迟;仲裁层必须...
面向 ITOps Agent Platform 系列第 12 篇。构建第一个真正的 Ops Agent,用职责分离的结构避免"一个 prompt 干所有事"。 ...
LLM 输出一段自然语言“我建议你运行 xxx”没有任何工程价值。真正的价值在于:输出可被程序消费的结构化指令,并触发强类型的工具调用。
TL;DR:Incident RAG 的核心价值在于复用企业私有运维知识,让 AI 基于历史 incident、runbook、postmortem 做诊断,而...
在传统运维体系中,最值钱的资产往往不在文档里,而在资深工程师的脑子里。一位工作十年的 SRE 遇到“容器不健康”时,会本能地执行一串动作:先看负载、再看日志、确...
TL;DR:证据驱动的 RCA 让 AI 诊断从"猜"走向"证",通过区分 fact hypothesis inference / recommendati...
TL;DR: 异常检测应采用「确定性算法打底 + LLM 语义补位」的漏斗式分层架构:Level 1 静态阈值处理 CPU、内存等硬边界;Level 2 统计方...
在 AIOps 根因分析(RCA)中,Topology 不只是用来“看清架构”的可视化工具,更是把诊断从“相关性猜测”推进到“因果推理”的骨架:它把服务、主机、...
面向 ITOps Agent Platform 系列第 5 篇。从“告警平台”升级为“事件平台”。
面向 ITOps Agent Platform 系列第 4 篇。设计统一 Alert/Event 数据模型与状态机,为下游降噪、关联、调查打好地基。
Codex 的魅力之一是"跨领域不设限"。这一课我们跳出"只会写后端脚本"的舒适区,看看它如何帮你触碰三个完全不同的端:小程序、iOS、硬件。
系列走到最后一课。这课不教新功能,而是帮你把前面 19 课的积累"收口":学会复用、避开踩坑、看清边界,并给自己一条可持续的学习路径。
很多团队把"接入一个 LLM API"当成了 AIOps。结果是:机器人会聊天,但告警还是告警、故障还是人工排查。
面向 ITOps Agent Platform 系列第 2 篇。先学"什么叫系统健康",再学 AI 如何判断系统健康。
单打独斗的 Codex 已经很能打,但真正的生产力爆发,来自让多个 AI、多个分支协同作战。这一课进入进阶区,三种玩法各有各的狠活。
真正的成长来自"完整地做完一个项目"。这一课我们不演示花哨功能,而是扎扎实实用 Codex 从零搭建一个文件数据清洗工具,跑通"需求分析 → 代码生成 → Bu...
前面的能力都铺垫好了,从这一课开始真正"上战场"。我们挑两个无论在哪一行都通用的商业场景——客户跟进和行业研究,看看 Codex 如何把日常工作变成自动化流水线...
当 ChatGPT 在 2022 年底进入公众视野时,关于 AI 的讨论迅速从技术圈蔓延到全社会。此后几年,既有人把它想象成无所不能的超级智能,也有人将其贬为毫...
暂未填写公司和职称