AI代码过剩后,给代码“冲厕所”的公司贵了十倍 ai代码率降低 ai代码量减少方法
创始人
2026-08-18 12:52:39
0



经常拿AI写代码的人都知道,写出能跑的程序不难,但你稍不留神,文件就莫名大了好几倍。

我曾经心血来潮让AI帮我写个网站,虽然用几句话就生成了,但打眼一看,它硬生生给我写了两千多行屎山。

在AI编程普及之前,写代码是最耗时的事情,但AI现在太厉害了,以前需要几个小时甚至几天才能完成的代码,现在分分钟就能整出来。

但问题是,代码是堆起来了,那些屎里淘金的脏活也堆了起来。

AI可以一分钟写出几百行代码,但公司不可能因为它勉强能跑,就把这些代码直接扔给几百万用户。

一家给AI生成的代码“冲厕所”的公司,因此贵了近十倍。

8月12日,据TechCrunch报道,为GitHub Actions提供持续集成(Continuous Integration,CI)基础设施的Blacksmith完成4500万美元B轮融资,估值达到5.5亿美元。而不到一年前,它的估值还只有约6000万美元。



Blacksmith没有发明更聪明的AI,也不负责帮程序员写代码。它做的是AI把代码写出来以后剩下的事情:跑测试、做构建,确认这些AI生成的代码,到底能不能安全地进入真正的软件。

让它身价暴涨的不是测试本身,是那些需要处理的代码,正在变得越来越多。

01

AI写的代码,人类已经看不过来了

Blacksmith很早就发现,代码变得有点太多了。

2025年9月,公司在宣布A轮融资时披露,过去一年,在排除开发者人数增长的影响后,其现有客户运行的持续集成任务量,平均每个季度增长60%。

Blacksmith把这种变化归因于AI编程工具的爆发——毕竟人一天只有24个小时,能够生产的代码有限,后面的测试、构建和代码审查自然也有一个上限。

但Coding Agent的爆发改变了这个局面。

现在的多数编程Agent都可以读取代码库、修改多个文件、运行测试,再把结果交给人类,而不只是帮程序员补几行代码。更为重要的是,Agent不仅不需要下班,不需要睡觉,还可以调度多个Subagent,把一个复杂任务拆开,同时处理多个不同工作。

于是,代码生产开始摆脱“有多少程序员,就有多少双手”的限制,从手工作坊迈向工业时代。

Claude Code负责人Boris Cherny的工作方式,已经有点像一座小型代码工厂。

今年6月,Boris Cherny在Fortune Brainstorm Tech大会上说,自己已经8个月没有手写过一行代码。

取而代之的是,他开始管理一支越来越庞大的Agent队伍。Boris表示,大会当天早上,他同时管理着“几百个”Agent;有些时候,这个数字会变成几千,甚至几万个。



这种变化到底能把代码生产推到什么程度,OpenAI也做过一个颇为极端的实验。

2025年8月底,OpenAI一个最初只有3名工程师的团队,从一个空白代码库开始,用Codex开发一款内部软件。

规则很简单:人类不直接写代码,应用逻辑、测试、CI配置、文档、可观测性和内部工具,全部由Codex生成。

五个月后,这个代码库已经膨胀到约100万行,期间完成了约1500个代码合并请求(Pull Request,PR)。OpenAI估算,同样的工作,如果全部由人类手写代码,大约需要十倍的时间。



有意思的是,OpenAI称,他们经常看到单次Codex任务连续工作超过6个小时,很多时候,人已经睡了,Agent还在继续干活。

代码生产的上限,就这样开始脱离人类的工作时间。

但很快,新的问题出现了:代码写得太快,人开始看不过来了。

OpenAI在这次实验中直接写道:随着代码吞吐量增加,他们遇到的新瓶颈变成了“人类QA能力”。

因为不管Agent能写多少代码,人类的时间和精力毕竟是有限的。

这个团队每周五都要拿出整整一天,专门清理所谓的“AI slop”,也就是AI写出的那些屎山代码。它们通常来自Agent在快速生成代码时带来的副作用:比如重复或错误的实现模式、不一致的代码风格,以及在系统中不断累积的技术债。

但很快,这事儿也有点干不过来了。

于是OpenAI又把“擦屁股”的工作交给了Agent:让后台Codex任务定期扫描代码库,发现问题,自动提交重构PR。甚至连大量代码Review,也开始交给Agent之间互相检查,人类只在需要判断的时候介入。

也就是说,AI开始同时出现在生产线两端:一边疯狂生产代码,另一边帮人寻找这些代码里的问题。

但中间那些必须实际跑完的测试、构建和CI任务,并没有消失。

Blacksmith写了一句很直白的话:如果每一次代码修改仍然需要一个小时才能测试完,那么一个比人类快100倍的Coding Agent,也没有太大意义。

AI没有消灭软件开发的瓶颈。

它只是把瓶颈,从“这个代码到底怎么写”,推到了“这么多代码到底怎么验”。

02

AI代码过剩后,给代码“冲厕所”的公司贵了十倍

要理解Blacksmith为什么能在不到一年的时间里从6000万美元涨到5.5亿美元,得先弄清楚这家公司的主要业务。

一段代码从程序员手里写出来,到真正出现在用户手机或者电脑上,中间还有很长一段路。

比如你给一个购物网站增加了新的支付按钮,代码写完以后,首先得确认它能不能正常编译;然后跑一遍自动测试,看看按钮能不能用;再跑更多测试,确认这次修改没有顺手把登录、购物车或者退款功能搞坏。

这些事情通常会被组织成一套自动流水线:程序员每提交一次代码,机器就自动把代码拉下来,重新构建软件、运行测试、检查结果。发现问题就打回去,全部通过以后,代码才有资格继续往下走。

而这个流水线,就叫作持续集成(Continuous Integration,CI)。

GitHub自己的GitHub Actions,就是最常见的CI工具之一。

而Blacksmith真正做的,是这套流水线下面的“执行层”。

GitHub Actions负责规定“要跑哪些测试、按什么顺序跑”,Blacksmith则提供真正执行这些任务的计算环境。

换句话说,Blacksmith并不帮你写测试规则,而是提供机器,把构建、测试和部署这些任务真正跑完。

它最初的卖点也很直接:让GitHub Actions跑得更快、更便宜。

按照Blacksmith的说法,它使用高单核性能CPU、本地缓存和NVMe存储来运行这些任务,大部分CI任务速度可以达到GitHub托管服务器的约2倍;一些Docker构建在缓存生效后可以获得更大的加速。对于开发者来说,迁移可能只需要修改一行GitHub Actions配置。



Blacksmith创始人后来形容,CI本质上就是“开发者的管道工程”。他们甚至开玩笑说,想让CI“至少这一次变得性感一点”。

但AI编程恰好把它最不起眼的地方,变成了优势:过去程序员一天提交几次代码,CI就跑几次;现在Agent可以持续改代码、反复尝试,还能并行调用Subagent,每一次修改都会触发新一轮构建、测试和验证。

Blacksmith在A轮融资时就提到,随着AI代码生成工具的发展,代码数量的快速增加正在把CI推向新的瓶颈。为此,Blacksmith没有简单依赖通用云计算资源,而是针对CI任务优化自己的硬件和软件栈,提供更快的执行速度、更高的并发能力,以及更适合测试流程的计算环境。

AI越会写代码,Blacksmith需要跑的机器反而越多,这门过去藏在软件开发后台的“脏活”,就这样被AI放大了。

2025年9月,Blacksmith已经服务约800家组织;不到一年后,这个数字增长到5000多家。

公司的员工数量从约10人增加到30人左右,年化收入则从1000万美元进入“数千万美元”区间,据TechCrunch报道,一些最大的客户每年在Blacksmith上的支出已经超过100万美元。

今天的Blacksmith,已经不满足于只做一个更快的CI执行层,它也开始把AI能力往上叠。

比如Codesmith可以读取代码仓库、修改代码并创建PR,也可以根据CI失败信息辅助定位和修复问题;Test Analytics负责整理测试失败信息;Testboxes则会给Agent临时创建一个虚拟测试环境,让它把刚改完的代码真正跑一遍,如果失败,结果再返回给Agent继续修改。



一条新的软件生产线开始出现:Agent写代码,Blacksmith跑测试;测试失败,AI总结问题;Codesmith修改代码,再扔回Testbox重新测试。

于是,代码生产和代码验证,都开始变得越来越自动化、Agent化。

但这里有一个关键区别。

AI可以自己找Bug、改代码,但最后那句“这段代码真的能用”,不能靠它自己说,必须真跑一遍。

而只要真的运行,就会消耗真实的计算资源。模型可以把写代码的边际成本不断压低,但服务器不会因为代码是AI写的就少跑一次测试,量大再凑个满减。

Blacksmith赚的,本质上是这最后一笔省不掉的钱。

03

AI写代码的终点,是一个更大的验收产业

事实上,过去一年,几乎所有主流AI公司都开始往代码生产线的后半段走。

Codex刚推出时,OpenAI还专门提醒用户:即使Agent已经可以自己修改代码、运行测试,在真正集成和执行之前,AI生成的代码仍然需要人工Review和验证。

但很快,Codex自己也开始做Review。2025年9月,OpenAI披露,Codex已经Review了公司内部绝大多数PR,每天可以发现数百个问题,很多问题甚至在人类开始Review之前就被找出来。

Anthropic也在做类似的事情。

Claude Code在今年3月加入了自动安全审查能力,可以直接检查PR里的SQL注入、跨站脚本攻击(XSS)、身份验证漏洞、不安全的数据处理和依赖漏洞,并通过GitHub Actions自动运行。

但Anthropic同时强调,这套功能并不能取代既有的安全流程和人工Review。



GitHub的动作更加直接。今年7月GitHub Code Quality正式上线时,GitHub在官方公告里甚至用了这样一句话:“AI accelerates code output, and Code Quality helps teams ship code they trust.”

AI正在加速代码产出,而Code Quality负责帮助团队交付“可以信任的代码”。



这套产品会在PR阶段检查代码的可靠性和可维护性问题,并结合Copilot Autofix给出修复建议。GitHub披露,其内部团队会在代码合并前解决67.3%的Code Quality问题。

过去几年,AI编程最激烈的竞争发生在代码生成端:谁能写得更快,谁能处理更大的代码库,谁能完成更复杂的任务。

但当代码真的开始过剩,下一场竞争已经悄悄往后移动。测试、持续集成、代码Review、安全检查,这些过去散落在软件开发流程里的环节,正在被重新拉到台前。

这甚至形成了一种和很多“AI替代软件”的故事完全相反的关系:模型越强,代码生成的成本越低;代码生成的成本越低,代码产量越大;代码产量越大,后面的测试、Review和安全审查需求反而越多。

但Blacksmith和这些AI公司的位置又不太一样。

如果说Code Review是在给AI生成的代码“擦屁股”,Blacksmith做的,就是给AI生成的那些代码“冲厕所”。

OpenAI、Anthropic和GitHub正在争谁更会Review代码,而Blacksmith押注的,是这些判断最终都绕不开的一层基础设施。

Coding Agent可以换,但验证基础设施不能省。不管代码是Codex写的、Claude Code写的,还是人写的;也不管最后是谁负责Review,只要想知道这段代码到底能不能跑,测试就必须真正执行。

这也是Blacksmith最早选择自建CI基础设施的原因,它没有简单地在AWS等公有云上租机器,而是针对编译、构建和测试这些CI任务,自己优化CPU、存储、缓存和虚拟机调度。

Blacksmith可以往上做Agent和测试环境,但它最难替代的资产,仍然是下面那层让所有代码真正跑起来的CI基础设施。

换句话说,别人争的是谁更会看代码,Blacksmith赚的是代码最后必须跑一遍的钱。

相关内容

热门资讯

光伏设备板块拉升,迈为股份涨超... 8月18日,光伏设备板块午后拉升,迈为股份涨超10%,捷佳伟创、聚和材料、拉普拉斯、华民股份、TCL...
A股诞生新纪录!频准激光上市首... 8月18日,年内最贵新股频准激光(688826.SH)登陆科创板,首日高开488%,随后一路高走。截...
行长定调:要的是“经得起周期检... 本报(chinatimes.net.cn)记者刘佳 北京报道“今年上半年平安银行经营业绩稳健,改革成...
西咸文旅集团被指挪用上亿元棚改... 澎湃新闻记者 祝文博 西咸国际文化教育园棚改二期项目,陕七建施工完成约60%后于2024年9月停工。...
世界精度最高百米级射电望远镜完... 8月18日,坐落于新疆昌吉州奇台县的110米口径射电望远镜项目,天线座架三层结构顺利完成合拢,标志着...
港龙中国地产:1-7月共实现合... 8月18日,港龙中国地产在港交所公告,公司及其附属公司,连同其合营公司和联营公司由2026年1月至7...
Coherent开始向客户送样... 8月18日,据报道,美国光电材料公司Coherent宣布,已开始向头部AI半导体合作伙伴提供300毫...
远东股份“AIDC用全合成光纤... 8月18日,远东智慧能源股份有限公司AIDC用全合成光纤预制棒制造项目主体顺利封顶。远东股份在高端光...
停牌!惠州上市公司华阳集团实控... 8月18日,惠州市华阳集团股份有限公司发布公告,公司股票(证券简称:华阳集团;证券代码:002906...
AI代码过剩后,给代码“冲厕所... 经常拿AI写代码的人都知道,写出能跑的程序不难,但你稍不留神,文件就莫名大了好几倍。我曾经心血来潮让...