暂无搜索历史
这期的「周一上线」,Agent 继续往更长的任务和更具体的工作里走。SWE-2 开始压缩 Agent 的无效探索,Muse 会自己在后台持续工作,DeepSee...
一版 Prompt 即使能把任务做对 80%,剩下的问题仍可能让 Agent 变得很难用。Warp 的内部代码审查 Agent 就遇到了这个问题。手动修改 Pr...
论文绘图时,每次换一组实验,就要重新调整配色、字体、图例、坐标轴、网格和版式。看到其他论文里合适的图表形式时,想借鉴它来展示自己的数据,通常还得自己拆结构、调参...
昨天 DeepSeek V4.1 Flash 发布后,我们想来做个测评,但是鹈鹕骑车、放烟花之类的测试 case 太常见了,现有代码仓库又比较敏感。所以,思前想...
摘要:从调试、事件契约、生命周期和 Session 协议出发,讨论 dsh 这套设计的适用边界,以及其中可以独立复用的设计方法。
上一期「Agent 小知识|存得下不等于想得起:Agent 跨会话记忆的工程设计与对账机制」讲完 Memory,我们留下了一个问题:当一次任务产生的过程信息已经...
摘要:替换两个底层 Provider,文件、Bash、PTY 和 LSP 一起迁到远端。
模型完成一次点击,只推进了任务中的一步。动作执行后,界面状态随之变化,模型需要看到新的界面,才能继续判断下一步该做什么。于是,多步 Computer Use 实...
摘要:提前预测下一层 KV 访问范围,优化稀疏选择与数据预取。 在长上下文推理中,稀疏注意力可以让每个 Query 只访问一部分重要 KV,从而减少注意力计算...
上周字节跳动 Seed 团队联合新加坡科技设计大学、佐治亚理工等机构发布了 HarnessDev,研究一个和 Agent 工程相关的问题:LLM 能不能自己创建...
摘要:一些简单的使用 Tips GPT-6 Astra 发布之后,OpenAI 同步更新了一份模型使用指南。在这份指南中,官方给出了一些使用指南:任务怎么交代、...
这期的「周一上线」,一边是新模型和 Agent 工具继续往长任务、电脑操作和自主研究上推进,一边是 AI 圈的大交易和基础设施问题也没闲着。
让 Codex 做出一版像样的 UI 并不难,麻烦的是每次换一个新任务,很多设计要求又得重新写一遍。
前几期,我们更多是在告诉 Codex“要做什么”。至于哪些设计不能改、哪些事实不用重新调查、遇到信息缺口时该停在哪里、做到什么程度才算完成,这些规则一直作为实践...
上一篇拆 Agent Loop 时,我们看到一次 Turn 会被拆成多个 Step。用户的消息会先进入 Session,模型生成的内容也会持续地写入 Sessi...
上一期我们讲了 Skill Agent 小知识 | Skill 的设计与生命周期:从工具接口到能力模块。一套做事方法被封装以后,Agent 可以在需要时发现、加...
本文基于 @deepseek-ai/dsh 0.1.1-rc.2(npm latest 标签),对应仓库标签 dsh-v0.1.1-rc.2,commit b1...
Embedding 模型从文本扩展到图片、视频和视觉文档之后,训练需要处理的数据类型和任务也变得更加复杂。如何把不同模态、不同任务的数据组织进同一套训练体系,并...
围绕让 Agent 根据执行轨迹自动修改 Skill,近期已经出现了一批相似思路的方法:先执行任务,分析成功与失败轨迹,再生成 Skill 修改,并通过验证集决...
Coding Agent 的代码写得越来越好之后,开发者还要花时间学习软件工程基础吗?吴恩达就这个问题更新了他的 AI Engineering Skills M...
暂未填写公司和职称
暂未填写个人简介
暂未填写技能专长
暂未填写学校和专业
暂未填写个人网址
暂未填写所在城市