首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >洪定坤,90%的代码是AI写的,效率只涨了60%,字节最懂AI的人说了句大实话

洪定坤,90%的代码是AI写的,效率只涨了60%,字节最懂AI的人说了句大实话

作者头像
不惑
发布2026-07-10 21:19:34
发布2026-07-10 21:19:34
3970
举报

6月23号,北京,火山引擎FORCE原动力大会。

台上站着一个叫洪定坤的人。字节跳动技术副总裁,TRAE的负责人,在字节研发体系里属于最高那一档。

他扔了两个数字出来。

过去半年,他团队的代码贡献率超过90%。十行代码里有九行是AI写的。

人均需求吞吐率,提升了60%。

第一眼看,60%,不错啊。

再一想,不对。

AI写代码比人快十倍都不止,90%的代码都是AI出的,效率提升应该翻好几番才对。怎么只有1.6倍?

洪定坤自己说得很直白,这个数字不代表AI Coding搞得很好了,恰恰是越用越知道坑在哪。

image
image

image

一个让整个行业沉默的实验

说完这组数据,他当场做了一个实验。

三个主流Coding模型,三种Agent框架,三三得九,九种组合。每种组合拿同一个中等难度的需求跑一百遍,总共九百次。

需求是豆包即将上线的视频编辑预览功能,不算特别难,也不算简单。

好消息是,九种组合功能正确率全部超过80%。不管你用哪个模型配哪个框架,跑五次至少四次功能是对的。

坏消息在后面。

他把结果按UI易用性、交互逻辑、性能、可维护性、兼容性这几个维度拆开一看,所有组合的得分掉到了40到60分之间。

功能正确率八十多分,一到能不能交付就掉到不及格线附近。

而且九百次跑下来,每一次出的问题都不一样,随机性极强。

AI有时候会过度设计,一个特别简单的功能给你抽象好几层。防御性编程、异常处理经常不管。单看一块代码没毛病,放回整体链路里未必是最优解。

能跑和能上线之间,隔着一整套软件工程。

全球最严实验的惊人结论

这个Gap不是洪定坤一个人在说。

2025年7月,一个叫METR的非营利机构做了一项可能是AI Coding领域最严格的对照实验。

他们找了16位资深开源项目维护者,平均每人维护的仓库有2.2万颗星、上百万行代码。每人列出自己仓库里真实的待办事项,总共246个bug修复和功能需求。然后随机分配,一半任务可以用AI,一半不行。

METR实验结果对比
METR实验结果对比

METR实验结果对比

结果炸了。

用AI那组,完成时间反而慢了19%。

更绝的是,开发者自己觉得快了24%,哪怕实际慢了,他们仍然相信自己快了20%。

自己觉得自己快了四分之一,实际上慢了五分之一。中间差了四十多个百分点。

METR用的是当时最前沿的工具,Cursor Pro配上Claude 3.5和3.7 Sonnet。开发者每小时拿150美元报酬,不存在动机问题。

这个实验在开发者圈子里引发了巨大震动。

2026年2月,METR更新了数据,样本放大了,结果好看了些,变成慢4%左右,统计上已经算不上显著。他们自己也承认,2026年初的AI工具确实有提升。

但最有意思的是后续。30%到50%的受邀开发者直接拒绝在没有AI的条件下干活,对照组凑不齐人了。METR只能宣布重新设计整套实验方法。

这件事本身就说明问题。

写得更快了,审得更慢了

Opsera今年发布了一份覆盖25万开发者、60多家企业的行业基准报告,数据量很大。

报告显示,AI工具在全行业的渗透率已经到90%。行业平均ROI大概在2.5到3.5倍,注意,是2.5到3.5倍,不是厂商天天吹的那个10倍。

还有一组数据跟洪定坤说的是同一件事。

AI生成代码提交到合并这一步确实快了,快了将近六成。但代码审查环节的等待时间,是普通PR的4.6倍。安全漏洞多了15%到18%。

写得更快了,审得更慢了,漏洞更多了。

有人打了个比方,挺形象的。想象一条高速公路,AI把四车道拓宽到了八车道,车确实跑得更快了,但收费站还是那一个窗口。车到了收费站全堵上了,端到端的通行时间没怎么变。

AI加速了写代码这段路,代码审查、测试、安全扫描这些收费站没有同步扩容。代码量反而因为生成太快而膨胀了,收费站前面排的队更长了。

Vibe Coding的幻觉

洪定坤在台上讲了一个真实的故事。

一个产品经理跑来找他,展示了一个自己用AI搞出来的功能。页面能看,流程也能跑。

产品经理问,你看这个能用吧,直接给我代码仓库权限,我自己提交上线不就行了。

洪定坤跟团队认真看了那段代码。能跑,没问题,但性能不够好,扩展性没考虑,权限和安全也有隐患。

这个故事太典型了。

AI让每个人都能把想法变成代码了,这本身有价值。但写出来的代码跟能上线的代码之间,隔着一整套软件工程。

代码生产门槛降低了,但企业业务系统的复杂度、规范性、安全性要求没有降低。

非专业角色产出的AI代码,只能实现基础功能,无法适配企业统一的架构规范和交付标准。

image
image

image

真正的战场在基建

有意思的是,洪定坤讲这些的同一场大会,字节在讲一个完全不同的故事。

火山引擎总裁谭待在主论坛上甩出豆包大模型2.1 Pro,日均Token调用量突破180万亿,两年涨了1500倍。他给了一个判断叫生产级质变点,意思是模型能力跨过了一条线,真能进企业生产环境了。

字节CEO梁汝波也录了视频,说今年的年度关键词是勇攀高峰。

180万亿Token,1500倍增长,质变点,勇攀高峰。

隔了不到一个小时,洪定坤上台了。同一个舞台,同一群观众,他说的是那个Gap是真实存在的,AI Coding还在探索期,远远没形成固定范式。

两个叙事搁一块,乍一看像在打架。但认真看,也确实不是。

谭待讲模型能力的供给侧,模型确实更强了,用的人确实更多了。洪定坤讲企业落地的需求侧,模型够好了,用起来了,可从AI能写代码到AI能帮企业交付软件,中间还有一大截路。

一个在说门槛已经过了,一个在说过了门槛之后的路才刚开始。

去年这个时候,洪定坤在这个舞台上做了另一件事。他自己用TRAE花了三天搞了一个英语学习App,85%的代码是AI生成的,演讲的调性是兴奋的、展示性的。

一年过去了,代码贡献率从85%推到了90%,Token消耗量涨了50倍,他反而开始讲挑战、痛点、失真了。

这个转变本身很有意思。一年前是AI能写代码太棒了,现在是写代码只是开始。乐观还在,只是往前踩了一步。

Harness,2026年最关键的一个词

洪定坤给了一个很明确的回答,在基建。

他用了一个词,Harness。这个词在AI Coding圈今年高频出现。

字面意思是马的缰绳、马鞍、套具。模型是马,Harness是让你骑上去、控制方向的那一套东西。马跑得再快,没这一套,你骑不上去,也拐不了弯。

洪定坤特别强调了一件事,Harness不等于Agent框架。他觉得这个坑很多团队都会踩,一提Harness就想着设计Agent框架,是单智能体还是多智能体,角色怎么分,工具怎么配。

这些当然重要,可在真实业务里,真正决定AI能不能落地的,是更底层的几样东西。

上下文工程,你给AI的信息够不够准。架构约束,代码规范、依赖规则有没有明明白白告诉AI。团队的知识沉淀,过去踩过的坑有没有存进AI能读到的地方。技术债的梳理,老系统里埋了哪些雷,AI是不知道的。

这些事看不见,不性感,没人会在发布会上拿出来讲,可它们是底座。

前面那个实验,裸跑的结果已经看了。加上Harness基建之后,同样的九种组合全部往上提。正确率从80%提到了90%左右,涨了但不夸张。

真正飙起来的是可交付性,从40到60分普遍拉到了80分左右。从不及格到能用,就差了这层基建。

这不是洪定坤一个人这么说。

LangChain做过类似实验,他们的Coding Agent在Terminal Bench 2.0评测上,只换Harness,模型完全不动,得分从52.8%跳到了66.5%,排名从30名外冲进前五。

同一个模型,换个套法,十几个点的差距就出来了。

Faros AI今年5月出了一篇文章,把AI编程的发展切成了三个阶段。

2022到2023年,是Prompt Engineering,研究怎么跟AI说话。2024到2025年,是Context Engineering,研究给AI看什么。2026年,进入Harness Engineering,研究怎么搭一整套系统让AI在里面可靠地转。

OpenAI Codex团队说的也是一回事,软件工程团队的首要工作是设计环境、明确意图、构建反馈循环,让AI能在里面可靠地干活。

image
image

image

从原型驱动到系统化AI研发

洪定坤在台上分享了两个具体方向。

第一个叫原型驱动开发。

过去的做法是产品经理写需求文档,设计师画图,技术做方案,最后才写代码。所有讨论围着一个文档、一张图转。问题是文档上看着合理的东西,做出来经常是两回事。

AI改变了一件事,做原型的成本变得极低。以前做个能点的原型可能要几天,现在跟AI聊几轮就出来了。

他举了个实战例子。大会前四天,他觉得TRAE的用户问题反馈功能做得不行。传统做法是填表单,问题类型、描述、截图、联系方式一项一项填完再发送。

他跟团队讨论,能不能把反馈融进对话流程里。想法有了之后,先用AI搞了一版原型,很糙,大概要等二三十秒,可它是真东西,能点能用。

团队围着这个原型讨论,一下发现了文档阶段根本想不到的问题。为什么生成完还要用户自己点开,能不能做成多轮对话,能不能自动打标签。

讨论完,几个小时就搞出了第二版原型,功能比第一版完善了一大截。

从产生想法到功能上线,整个流程只用了四天。

第二个方向叫系统化的AI Development。

AI应该像齿轮一样嵌进软件开发的每一道工序里。先由AI把需求拆成一个个小活,然后写代码,写完自己打开浏览器跑一遍,看到问题自己改,改完再跑,来回几轮,确认没问题了自动把代码交上去。

交完之后AI自己再查一遍,这块逻辑有没有坑,有没有漏掉的情况,测试够不够。查完了标出来,工程师看一眼,没问题就上线。

从需求到上线,AI参与了每一步,不是只参与了写代码那一步。

AI已经能写出90%的代码了,剩下那10%叫软件工程

洪定坤最后透露了几个数字。

TRAE日均Token消耗量同比去年暴涨50倍,到了5.6万亿。用户群也在变,越来越多非工程师背景的人在用TRAE干日常的活。他们最近推出了TRAE Work,专门面向非技术用户。

从AI写代码,到AI做软件工程,到AI走进所有人的工作流。这条路,刚走到第二步。

去年洪定坤在这个舞台上用了三天做了一个App,证明了AI能写代码。

今年他用1.6倍效率提升这个不那么漂亮的数字,加上一场3乘3乘100的实验,讲了一个更真实的故事。

知道自己在哪,比假装已经到了有价值得多。

AI已经能写出90%的代码了,剩下那10%,叫软件工程。

注意,是工程。

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-06-30,如有侵权请联系 cloudcommunity@tencent.com 删除
目录
  • 一个让整个行业沉默的实验
  • 全球最严实验的惊人结论
  • 写得更快了,审得更慢了
  • Vibe Coding的幻觉
  • 真正的战场在基建
  • Harness,2026年最关键的一个词
  • 从原型驱动到系统化AI研发
  • AI已经能写出90%的代码了,剩下那10%叫软件工程
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档