GPT-6 发布以后,我看了很久它的参数和 Benchmark。
但我最后发现,这一代最值得关注的,其实不是模型又聪明了多少。真正重要的是,OpenAI 正在让它越来越像一个能自己完成工作的 Agent。
看屏幕、操作网页、写代码、测试软件、做 Excel、做 PPT、查资料,甚至自己判断任务有没有完成。
总的来说,就是更重视“操作”,更像一个真正的 Agent。
1. 从回答问题,到真正开始操作
以前的大模型,更像是一个回答问题的助手。
你问它问题,它给你答案;你让它写代码,它给你代码。
但 GPT-6 这次给我的感觉是,它更想往“真正干活”这个方向走。
不是只告诉你怎么做,而是自己去操作、自己去执行、自己判断下一步要干什么。
这也是我觉得 GPT-6 最值得关注的一个变化。
2. 关于记忆
AI Coding 最大的问题,其实不是不会写代码。
而是项目一大、时间一长,它就开始忘东西、跑偏、重复踩坑。
前面刚排查过的问题,后面可能又重新来一遍;之前已经说过的要求,做着做着也可能忘了。
所以 GPT-6 / Codex 的长任务、工作记忆、跨上下文能力,我还是比较期待的。
到底能做到什么程度,还是要实际用过以后再看。
3. 从“给材料”,到“给目标”
以前你想让 AI 帮你整理周报,可能需要把每天的日报都发给它,然后让它整理。
以后可能不用这么麻烦。
你直接告诉它:
去看我这几天都干了什么,把相关数据找出来,再补充一些行业资料,最后帮我做一份 PPT。
以前很多事情需要人自己准备材料、整理数据,再一步一步交给 AI。
以后可能只需要告诉它最终目标。
中间的步骤,让 Agent 自己完成。
4. 不再只是搭工作流
我觉得 Agent 真正有价值的地方,不是某一个能力有多强,而是能不能把不同软件、不同步骤串成一个完整工作流。
以前想实现这些能力,经常需要自己搭工作流。
数据从哪里来,什么时候执行,调用哪个 API,生成什么内容,最后发到哪里,这些都要提前设计好。
以后这些事情,可能越来越多地直接交给大模型。
你告诉它要做什么,它自己判断中间需要哪些步骤、哪些工具。
这和以前那种固定工作流,还是有很大区别的。
5. 权限越大,安全越重要
但 Agent 权限越来越大以后,安全也会越来越重要。
当它开始拥有文件、邮件、数据库、浏览器、脚本这些权限以后,问题就不只是“回答错了怎么办”。
而是:
它会不会删错文件?
会不会发错邮件?
会不会改错数据库?
会不会执行一些本来不应该执行的操作?
Agent 的能力越强,给它开放的权限越多,安全问题就越值得重视。
所以以后衡量一个 Agent 好不好用,我觉得不只是看它能干多少活。
还要看,你敢不敢真的把权限交给它。
Agent 已经在走来
总的来说,GPT-6 给我的感觉,不只是模型能力又往前走了一步。
更明显的变化是,大模型越来越重视“执行”。
以前是聊天、回答问题。
后来是写代码、调用工具。
现在开始越来越像真正的 Agent。
当然,这个过程不会一下子完成。
但 Agent 已经在走来了。
不是一次性到来,而是那个进度条,已经开始往前拖了。