
6月23号,北京,火山引擎FORCE原动力大会。
台上站着一个叫洪定坤的人。字节跳动技术副总裁,TRAE的负责人,在字节研发体系里属于最高那一档。
他扔了两个数字出来。
过去半年,他团队的代码贡献率超过90%。十行代码里有九行是AI写的。
人均需求吞吐率,提升了60%。
第一眼看,60%,不错啊。
再一想,不对。
AI写代码比人快十倍都不止,90%的代码都是AI出的,效率提升应该翻好几番才对。怎么只有1.6倍?
洪定坤自己说得很直白,这个数字不代表AI Coding搞得很好了,恰恰是越用越知道坑在哪。

image
说完这组数据,他当场做了一个实验。
三个主流Coding模型,三种Agent框架,三三得九,九种组合。每种组合拿同一个中等难度的需求跑一百遍,总共九百次。
需求是豆包即将上线的视频编辑预览功能,不算特别难,也不算简单。
好消息是,九种组合功能正确率全部超过80%。不管你用哪个模型配哪个框架,跑五次至少四次功能是对的。
坏消息在后面。
他把结果按UI易用性、交互逻辑、性能、可维护性、兼容性这几个维度拆开一看,所有组合的得分掉到了40到60分之间。
功能正确率八十多分,一到能不能交付就掉到不及格线附近。
而且九百次跑下来,每一次出的问题都不一样,随机性极强。
AI有时候会过度设计,一个特别简单的功能给你抽象好几层。防御性编程、异常处理经常不管。单看一块代码没毛病,放回整体链路里未必是最优解。
能跑和能上线之间,隔着一整套软件工程。
这个Gap不是洪定坤一个人在说。
2025年7月,一个叫METR的非营利机构做了一项可能是AI Coding领域最严格的对照实验。
他们找了16位资深开源项目维护者,平均每人维护的仓库有2.2万颗星、上百万行代码。每人列出自己仓库里真实的待办事项,总共246个bug修复和功能需求。然后随机分配,一半任务可以用AI,一半不行。

METR实验结果对比
结果炸了。
用AI那组,完成时间反而慢了19%。
更绝的是,开发者自己觉得快了24%,哪怕实际慢了,他们仍然相信自己快了20%。
自己觉得自己快了四分之一,实际上慢了五分之一。中间差了四十多个百分点。
METR用的是当时最前沿的工具,Cursor Pro配上Claude 3.5和3.7 Sonnet。开发者每小时拿150美元报酬,不存在动机问题。
这个实验在开发者圈子里引发了巨大震动。
2026年2月,METR更新了数据,样本放大了,结果好看了些,变成慢4%左右,统计上已经算不上显著。他们自己也承认,2026年初的AI工具确实有提升。
但最有意思的是后续。30%到50%的受邀开发者直接拒绝在没有AI的条件下干活,对照组凑不齐人了。METR只能宣布重新设计整套实验方法。
这件事本身就说明问题。
Opsera今年发布了一份覆盖25万开发者、60多家企业的行业基准报告,数据量很大。
报告显示,AI工具在全行业的渗透率已经到90%。行业平均ROI大概在2.5到3.5倍,注意,是2.5到3.5倍,不是厂商天天吹的那个10倍。
还有一组数据跟洪定坤说的是同一件事。
AI生成代码提交到合并这一步确实快了,快了将近六成。但代码审查环节的等待时间,是普通PR的4.6倍。安全漏洞多了15%到18%。
写得更快了,审得更慢了,漏洞更多了。
有人打了个比方,挺形象的。想象一条高速公路,AI把四车道拓宽到了八车道,车确实跑得更快了,但收费站还是那一个窗口。车到了收费站全堵上了,端到端的通行时间没怎么变。
AI加速了写代码这段路,代码审查、测试、安全扫描这些收费站没有同步扩容。代码量反而因为生成太快而膨胀了,收费站前面排的队更长了。
洪定坤在台上讲了一个真实的故事。
一个产品经理跑来找他,展示了一个自己用AI搞出来的功能。页面能看,流程也能跑。
产品经理问,你看这个能用吧,直接给我代码仓库权限,我自己提交上线不就行了。
洪定坤跟团队认真看了那段代码。能跑,没问题,但性能不够好,扩展性没考虑,权限和安全也有隐患。
这个故事太典型了。
AI让每个人都能把想法变成代码了,这本身有价值。但写出来的代码跟能上线的代码之间,隔着一整套软件工程。
代码生产门槛降低了,但企业业务系统的复杂度、规范性、安全性要求没有降低。
非专业角色产出的AI代码,只能实现基础功能,无法适配企业统一的架构规范和交付标准。

image
有意思的是,洪定坤讲这些的同一场大会,字节在讲一个完全不同的故事。
火山引擎总裁谭待在主论坛上甩出豆包大模型2.1 Pro,日均Token调用量突破180万亿,两年涨了1500倍。他给了一个判断叫生产级质变点,意思是模型能力跨过了一条线,真能进企业生产环境了。
字节CEO梁汝波也录了视频,说今年的年度关键词是勇攀高峰。
180万亿Token,1500倍增长,质变点,勇攀高峰。
隔了不到一个小时,洪定坤上台了。同一个舞台,同一群观众,他说的是那个Gap是真实存在的,AI Coding还在探索期,远远没形成固定范式。
两个叙事搁一块,乍一看像在打架。但认真看,也确实不是。
谭待讲模型能力的供给侧,模型确实更强了,用的人确实更多了。洪定坤讲企业落地的需求侧,模型够好了,用起来了,可从AI能写代码到AI能帮企业交付软件,中间还有一大截路。
一个在说门槛已经过了,一个在说过了门槛之后的路才刚开始。
去年这个时候,洪定坤在这个舞台上做了另一件事。他自己用TRAE花了三天搞了一个英语学习App,85%的代码是AI生成的,演讲的调性是兴奋的、展示性的。
一年过去了,代码贡献率从85%推到了90%,Token消耗量涨了50倍,他反而开始讲挑战、痛点、失真了。
这个转变本身很有意思。一年前是AI能写代码太棒了,现在是写代码只是开始。乐观还在,只是往前踩了一步。
洪定坤给了一个很明确的回答,在基建。
他用了一个词,Harness。这个词在AI Coding圈今年高频出现。
字面意思是马的缰绳、马鞍、套具。模型是马,Harness是让你骑上去、控制方向的那一套东西。马跑得再快,没这一套,你骑不上去,也拐不了弯。
洪定坤特别强调了一件事,Harness不等于Agent框架。他觉得这个坑很多团队都会踩,一提Harness就想着设计Agent框架,是单智能体还是多智能体,角色怎么分,工具怎么配。
这些当然重要,可在真实业务里,真正决定AI能不能落地的,是更底层的几样东西。
上下文工程,你给AI的信息够不够准。架构约束,代码规范、依赖规则有没有明明白白告诉AI。团队的知识沉淀,过去踩过的坑有没有存进AI能读到的地方。技术债的梳理,老系统里埋了哪些雷,AI是不知道的。
这些事看不见,不性感,没人会在发布会上拿出来讲,可它们是底座。
前面那个实验,裸跑的结果已经看了。加上Harness基建之后,同样的九种组合全部往上提。正确率从80%提到了90%左右,涨了但不夸张。
真正飙起来的是可交付性,从40到60分普遍拉到了80分左右。从不及格到能用,就差了这层基建。
这不是洪定坤一个人这么说。
LangChain做过类似实验,他们的Coding Agent在Terminal Bench 2.0评测上,只换Harness,模型完全不动,得分从52.8%跳到了66.5%,排名从30名外冲进前五。
同一个模型,换个套法,十几个点的差距就出来了。
Faros AI今年5月出了一篇文章,把AI编程的发展切成了三个阶段。
2022到2023年,是Prompt Engineering,研究怎么跟AI说话。2024到2025年,是Context Engineering,研究给AI看什么。2026年,进入Harness Engineering,研究怎么搭一整套系统让AI在里面可靠地转。
OpenAI Codex团队说的也是一回事,软件工程团队的首要工作是设计环境、明确意图、构建反馈循环,让AI能在里面可靠地干活。

image
洪定坤在台上分享了两个具体方向。
第一个叫原型驱动开发。
过去的做法是产品经理写需求文档,设计师画图,技术做方案,最后才写代码。所有讨论围着一个文档、一张图转。问题是文档上看着合理的东西,做出来经常是两回事。
AI改变了一件事,做原型的成本变得极低。以前做个能点的原型可能要几天,现在跟AI聊几轮就出来了。
他举了个实战例子。大会前四天,他觉得TRAE的用户问题反馈功能做得不行。传统做法是填表单,问题类型、描述、截图、联系方式一项一项填完再发送。
他跟团队讨论,能不能把反馈融进对话流程里。想法有了之后,先用AI搞了一版原型,很糙,大概要等二三十秒,可它是真东西,能点能用。
团队围着这个原型讨论,一下发现了文档阶段根本想不到的问题。为什么生成完还要用户自己点开,能不能做成多轮对话,能不能自动打标签。
讨论完,几个小时就搞出了第二版原型,功能比第一版完善了一大截。
从产生想法到功能上线,整个流程只用了四天。
第二个方向叫系统化的AI Development。
AI应该像齿轮一样嵌进软件开发的每一道工序里。先由AI把需求拆成一个个小活,然后写代码,写完自己打开浏览器跑一遍,看到问题自己改,改完再跑,来回几轮,确认没问题了自动把代码交上去。
交完之后AI自己再查一遍,这块逻辑有没有坑,有没有漏掉的情况,测试够不够。查完了标出来,工程师看一眼,没问题就上线。
从需求到上线,AI参与了每一步,不是只参与了写代码那一步。
洪定坤最后透露了几个数字。
TRAE日均Token消耗量同比去年暴涨50倍,到了5.6万亿。用户群也在变,越来越多非工程师背景的人在用TRAE干日常的活。他们最近推出了TRAE Work,专门面向非技术用户。
从AI写代码,到AI做软件工程,到AI走进所有人的工作流。这条路,刚走到第二步。
去年洪定坤在这个舞台上用了三天做了一个App,证明了AI能写代码。
今年他用1.6倍效率提升这个不那么漂亮的数字,加上一场3乘3乘100的实验,讲了一个更真实的故事。
知道自己在哪,比假装已经到了有价值得多。
AI已经能写出90%的代码了,剩下那10%,叫软件工程。
注意,是工程。