测试阿里、火山、腾讯三家编程模型在相同任务上的表现。腾讯模型相对较好但仍有功能缺失,阿里和火山模型均存在严重bug,核心功能无法使用。三者开发计划粗糙,代码质量低下,浪费大量时间与精力。
先说说一个有点郁闷的发现。
阿里、火山、腾讯,三家大厂,各自拿出了看家的编程模型。结果呢?看起来都像模像样,动起手来全拉了。
长期稳定更新的攒劲资源: >>>点此立即查看<<<

本来标题想写成《全TM辣鸡,浪费生命》,后来想想——算了,成长了。先给GLM5道个歉,如果说它是“若至”,那这三家就是“滞涨”。当然,这些大厂也没在我面前吹过牛逼,只是实打实浪费了一天一夜的时间。
就开头骂一句,后面好好写。让各位看看这三家在编程领域的真实水平。
今天不谈基准,基准毫无意义。测试场景,直接参考《Claude Opus4.6 实战记录,欢迎对标和超越!》那一篇。文章一万字左右,先讲测试环境,再看测试结果,分享过程,分析bug,最后比一下速度和tokens消耗。
先说测试环境和对象。
测试工具是Claude Code,通过CCSwitch切换。使用的模型分别是:
qwen3.5-plusDoubao-Seed-2.0-Codetc-code-latest选择原则很简单——它们自家最新的模型,或者最新的编程模型。测试基于同一个Base项目,用同样的工具、同样的提示词。不同文件夹下面是不同模型升级后的项目。
所有测试跑完了,先看结果。用同样的命令启动。
这是Base项目,没改之前,角色管理长这样:
然后看看修改完成之后什么样。评判标准还是那三条:首先看能不能用,然后看好不好用,最后看全不全面。
打开网页,逐一验证。
阿里:
能正常启动,但角色管理布局有点崩,也没看到头像区域。点击编辑或添加角色——直接崩了。先不管错误是什么,反正就错了。核心功能的第一步,不可用。
火山:
启动正常,布局正常,能看到一个头像区域(机器人图标填充)。点击编辑或添加角色——也直接崩了,而且错误跟阿里一模一样。要不是用端口号区分,我都以为启动了同一个服务。显然没法用。
腾讯:
启动正常,显示基本正常,头像用小人占位。点击添加或编辑——居然有一个正常的!现在标准确实很低,能正常点开这个页面就很开心了。
更意外的是,腾讯的模型还考虑到了头像占位。但是,这个系统还是不太能用:角色编辑和添加里无法拉取角色列表和模型,角色成了空壳,群聊完全搞不起来。
没法用,谈不上好用。
没法用,谈不上全不全面。
下面是最初的提示词,所有模型都用这一段开始:
目前群聊接力的时候可以选择平台管理中的模型,也可以对这些模型预先配置系统提示词和角色提示词,这样已经可以通过系统提示词来个性化聊天了。但是通过平台配置里面绑定角色比较有局限性——这样一个平台就只能是一个角色。我希望换另外一种设置:**角色里面选模型**,然后群聊开始的时候,我可以直接选平台,也可以直接选角色。角色的管理还是在系统设置的“角色管理”中进行。为了实现上面的需求,角色功能需要升级:- 除了可以设置提示词之外,还得能**选择平台和模型**- 另外还能**设置头像**- 如果设置了头像,群聊的时候就显示自定义头像;如果没有设置头像,就用对应模型平台的 logo 作为头像我的需求大概是这样。说说你的这个需求的理解,不急着写代码
来看看它们的回复。
单看这一轮的回答,个个都像高手,说得头头是道。
阿里:对需求的理解确实没太大问题。还查看了代码结构,提出了改动方案,并问了很多问题。前期细节拉满——先不说问题是否精准,至少它在努力提问、确认细节。说实话,看到这里,感觉它能把这事儿干成。接下来就根据方案开始干活了。
火山:理解也没毛病,提出了三个问题,虽然问题不够精准,但至少提了。回答完问题之后,它也开干了。
腾讯:理解同样没毛病,提出了4个问题。第一个问题非常犀利,也是最后它能去掉冗余的关键。后面几个问题问到点了,但从提问方式来看,对这个业务理解还不够深入。回答之后,它又问了另外三个更实际的问题,比如模型从哪里来(我说了从平台来)。可惜最后开发完成,它没把平台列表显示出来,也就选不了模型了。
三个模型的理解部分都问题不大,可能是我已经把需求说得很清楚了。差别主要在于阅读原有代码之后的理解和提问。这部分不够精准和全面。
上面列的都是理解和提问部分。其实有一个重要的环节没有贴出来——完整的开发计划。这部分非常关键,细节决定成败。开始写代码之前,一定要完整理解项目,制定详细计划。它们做得都不好,计划很短,大概一到两屏,只有Opus 4.6的五分之一不到。Opus 4.6写了10个章节,细节极其丰富,所以最后一次通过,没有任何运行错误和逻辑bug。
胜负不在战时,而在战前。从上面的设计方案,基本就知道结果了。虽然第一轮都像模像样,但第二轮已经露出底裤,第三轮就是全部裸奔了。
下面深入分析,它们到底写了个啥。重点看需求完成度、代码质量问题,以及为什么点击创建功能出错。
阿里百炼
需求完成度:…
存在的问题:…
创建出错原因:创建角色(POST)时API路由忽略了新增字段,这是最核心的bug!
火山
需求完成度:…
存在的问题:…
创建出错原因:由于创建时就没有保存新增字段,编辑时加载的表单数据是空的,形成恶性循环。
腾讯
需求完成度:…
存在的问题:…
从上面的review来看,基本上都有一个或多个严重bug。看来它们写的不是代码,是bug。以后不比谁厉害,比谁的bug多。谁干好,已经没什么好比了——半斤八两。
下面来看看能比的——使用时间和tokens消耗情况。
测试的同时也记录了时间。
阿里:从开发完成到开始安装依赖包,大约消耗26分钟。测试时间大概在下午5点。
火山:从开发完成到开始安装依赖包,大约消耗14分钟。测试时间大概在晚上11点多。
腾讯:构建完成到可以测试,消耗30分钟。测试时间在凌晨零点多。
测到腾讯已经半夜了,直接导致失眠。从测试来看,火山明显快很多,腾讯和阿里比较慢。最早测方舟套餐时,写个博客都要很久,现在速度似乎提上来了。腾讯和阿里可能还在提升产能,速度不太行。当然,也可能受时间段和高峰期影响,仅供参考。
除了时间,也留意了消耗情况。
阿里:消耗了9%,用量按调用次数算。
火山:消耗了33%,似乎不是按次数算。后期消耗增长极快,估计是上下文变大了,tokens消耗很快。但相对而言,开发速度也很快。
腾讯:消耗了6.8%,统计方式和阿里一致,按次数计算。
从用量来说,火山消耗最快,估计5小时配额用不了多久。阿里和腾讯按次数算,比较耐用,即便入门款基本也用不完。
为了测试它们的实力,干到半夜,后来躺在床上一直睡不着。
看它们写代码,真的一个头两个大。一个月花40或200,是找它们写代码的,不是写bug的;是找它们干活的,不是给它们擦屁股的;是找它们节省时间的,不是浪费时间的。
最后反思一下:考不好,可能题太难了?写代码不好,可能是打开方式不对?
Base代码已经发出来了,有兴趣的可以git下来玩一玩。
侠游戏发布此文仅为了传递信息,不代表侠游戏网站认同其观点或证实其描述