首页 > AI教程 >MiMo2.5Pro《江湖百晓生》测试过程与结果

MiMo2.5Pro《江湖百晓生》测试过程与结果

来源:互联网 2026-07-15 18:44:17

MiMo2.5Pro在《江湖百晓生》测试中前期计划详细但执行不力:网页布局混乱,数据偷懒仅录21人,耗6400万Tokens效果远逊Opus4.7和Gemini3.5,虎头蛇尾,底蕴不足。

MiMo 的 16 亿 Tokens 眼看就要到期了,赶在最后一刻紧急加测了一波。结果嘛……只能说,虎头蛇尾,虚有其表,表现不佳。

先给大家看一张图:

长期稳定更新的攒劲资源: >>>点此立即查看<<<

MiMo2.5Pro《江湖百晓生》测试过程与结果

就这么一个网页,烧掉了 16 亿 Tokens 中的 4%,换算下来大约是 6400 万。同样的题目,放到 Opus4.7 和 Gemini3.5 面前,完全就是被吊打的状态。

Opus4.7 的效果:

MiMo2.5Pro《江湖百晓生》测试过程与结果

Gemini3.5 的效果:

MiMo2.5Pro《江湖百晓生》测试过程与结果

结果展示完了,咱们来扒一扒细节。这是 AI 实战开发测试《江湖百晓生》系列的第二篇。主题很明确:开发一个以金庸、古龙为背景的武侠百科,涵盖主要人物、兵器、武功等内容。下面,我会把开发工具和过程完整展示出来,好好体验一下 MiMo 在实际场景中的真实表现。

开发工具

现在基本已经放弃了 CCSwitch,转而使用自研的 JCode 搭配 Claude Code。配置好之后,打开 JCode,直接双击图标就能启动 CC:

MiMo2.5Pro《江湖百晓生》测试过程与结果

不用再到终端里敲 Claude 命令,也不用 cd 到指定路径,更不用手动配置环境变量和改配置文件。只需通过软件的添加功能:

MiMo2.5Pro《江湖百晓生》测试过程与结果

填好 API Key 和正确的 Base URL 就行。工具内置了小米的 Base URL,但由于小米的默认接入点和 Token Plan 的接入点不同,使用 Token Plan 套餐时需要按截图调整;如果是按量计费的 API,则无需修改。配好之后,一劳永逸。双击图标启动,选个文件夹,直接开干。

开发过程

为 MiMo 单独建一个测试文件夹:

MiMo2.5Pro《江湖百晓生》测试过程与结果

通过 JCode 快速启动 CC,这时就能在 CC 中调用 MiMo 的 Token Plan 了。把需求告诉它——这个需求和测试 Gemini3.5 Flash 时完全一样。核心需求如下:

MiMo2.5Pro《江湖百晓生》测试过程与结果

需求粘贴上去,回车,开始干活:

MiMo2.5Pro《江湖百晓生》测试过程与结果

小米 MiMo 开头的气势确实不错。先是来了一句:“这是一个庞大的任务,我先了解情况,然后制定详细计划。”接着就开始让我选技术栈。首推的是 HTML/CSS/JS 路线,因为之前测 Gemini 时选了 React,所以这次也选它。

它给了四种方案,覆盖面挺全,基本就是这几类。然后进入下一步:

MiMo2.5Pro《江湖百晓生》测试过程与结果

第二步是展现风格,看起来相当不错:

1. 古风卷轴/竹简——模拟古代卷轴展开效果,翻页阅读
2. 江湖地图——门派分布以地图形式展现人物关系
3. 武侠卡片/图鉴——类似游戏图鉴,卡片式收集展示
4. 综合门户/百科全书——类似维基百科的结构化知识库

这几个候选项确实超预期,连风格都考虑得这么周全,一时还真不知道选哪个好。既然这样,就选默认的“古风卷轴”吧。

继续下一步:

MiMo2.5Pro《江湖百晓生》测试过程与结果

这一步决定数据深度,给了三个选项。本来就是来消耗 Tokens 的,自然数据越多越好,果断选了“3. 尽量全面”。

再下一步:

MiMo2.5Pro《江湖百晓生》测试过程与结果

执行方式也有三种选择:先看计划、直接开始、分阶段推进。那肯定是先看计划再说。

全部选定后,进入计划环节:

MiMo2.5Pro《江湖百晓生》测试过程与结果

仔细浏览了具体计划内容:

MiMo2.5Pro《江湖百晓生》测试过程与结果

计划做得相当不错,很详细。既然都这么周全了,我也就不多嘴,直接让它按计划执行。

到这里为止,给人的感觉确实很厉害。这个 Ask 和 Plan 环节,专业度拉满。

然而……一顿操作猛如虎,结果却是这样的:

MiMo2.5Pro《江湖百晓生》测试过程与结果

生成的网页布局完全混乱,内外边距、间距、位置,全都不对。评价一个模型的前端能力和思考能力,第一眼就看布局和构思。布局清晰,说明业务逻辑理清了,前端技术也到位了。但眼前这个前端表现,已经没什么好说的了。这种布局一旦出现,后续调整非常困难,因为它根本理解不了空间感。

再看看数据:

MiMo2.5Pro《江湖百晓生》测试过程与结果

要求是越全面越好,结果一看:总共收录了 21 个人物、23 部小说、10 件兵器、13 门功夫、10 个门派。这个规模,一部小说都不止这么多内容。很明显,在抓取数据时偷懒了。

“AI 偷懒程度”其实是一个很重要的技术指标。Claude 和 OpenAI 发布新模型时,都会强调模型能独立运行几十个小时——他们真正想表达的不是时间长,而是自主连续工作的能力。复杂问题,本来就该花时间去解决。现在它们都推出了 /goal 命令,可以设定一个可验证的目标,让模型自己循环跑到完成为止。

MiMo 给我的感觉是:计划做得很好,像个样子,但执行的时候比较拉胯,偷懒也很明显。Gemini3.5 Flash 完成这个任务时,数据抓取也偷懒了,但人家前端优秀啊,表现非常亮眼,基本业务逻辑也梳理得清清楚楚。

MiMo 刚上线那会儿,我用了好几个例子测试,当时没发现大问题,似乎表现不错。但现在看来,那些例子很可能已经被优化训练过了。最近测的两个例子,表现非常拉胯——一个是《掌门日记》,一个是《江湖百晓生》。这两个例子其实是专门为它量身定制的。第一个用来测试它与 DeepSeek 的差距,结果页面出错,直接被吊打;第二个,也就是今天这个,原本是为消耗 16 亿 Tokens 而设计的,最后 Tokens 消耗了不少,结果却非常不理想。

在我第二次要求下,它终于补全了大量数据,总共消耗了 16 亿中的 4%。但页面问题依然不好解决。

MiMo2.5Pro《江湖百晓生》测试过程与结果

本来想让它改一下,但不知道什么原因,提示模型不存在了。前面几轮对话都正常,这个需求一提出来,突然就说模型不存在。重新开了一个全新对话,同样的配置又能正常使用。看同一个对话的 Recap 也是正常的,估计又遇到了某个 BUG。算了,不改了。说实话,第一个版本如果出来就没法看,后续也就没有改的必要了,改的意义不大。

总的感受是:小米这个大模型“新秀”,底蕴还是差了一些,做的更多是表面功夫。在特定领域或许能优化到中档水平,但非常不全面,很容易遇到瓶颈。因此,这个模型不太适合深入使用,只能做一些通用、基础的任务。

同样的问题测试了很多模型,大家可以直接对比感受一下。

侠游戏发布此文仅为了传递信息,不代表侠游戏网站认同其观点或证实其描述

热游推荐

更多
湘ICP备14008430号-1 湘公网安备 43070302000280号
All Rights Reserved
本站为非盈利网站,不接受任何广告。本站所有软件,都由网友
上传,如有侵犯你的版权,请发邮件给xiayx666@163.com
抵制不良色情、反动、暴力游戏。注意自我保护,谨防受骗上当。
适度游戏益脑,沉迷游戏伤身。合理安排时间,享受健康生活。