小米发布MiMo-V2.5-ProUltraSpeed模式,在通用GPU上实现1000tokens/s生成速度,定价为标准版3倍但输出速度提升约10倍。该模式仅限API,申请制开放两周(2026年6月9日至23日),资源有限,审核优先有真实业务需求者。
先说说几个关键点:大模型的生成速度,一直是制约落地的瓶颈。尤其是万亿参数级别的模型,想在通用GPU上跑出上千的token数,过去想都不敢想。但就在昨天,小米MiMo联合TileRT放了个大招——MiMo-V2.5-Pro的UltraSpeed模式,直接在通用GPU上把生成速度干到了1000 tokens/s。

▲ 10秒,做一个贪吃蛇小游戏
长期稳定更新的攒劲资源: >>>点此立即查看<<<
这个速度有多夸张?做个类比:以前你等模型生成一段代码可能要十几秒,现在眨个眼的工夫就出来了。根据官方演示,10秒就能生成一个贪吃蛇小游戏。这背后是模型与系统的极致协同设计(Codesign),不是简单的堆算力。
同步上线的还有MiMo-V2.5-Pro-UltraSpeed API,定价策略也很有意思——3倍的价格,换来约10倍的输出速度提升。这账算下来其实很划算,尤其对于对响应速度有严苛要求的场景。不过要注意,这个模式仅支持API体验,不支持Token Plan。
作为参考,标准版MiMo-V2.5-Pro的定价是:每百万tokens输入0.025元(缓存命中)或3元(未命中缓存),输出6元。而UltraSpeed版本的具体单价官方没有直接公布,但按照3倍基准推算,大概输出每百万tokens要18元左右。考虑到速度翻了10倍,单位时间内的产出成本反而更低了。

▲ 1分钟,复刻一个macOS系统
不过,好东西总是稀缺的。由于高速推理资源供给有限,本次UltraSpeed API采取申请制限时开放,窗口期只有两周:2026年6月9日至6月23日23:59。而且资源确实紧张,提交申请后不保证审核时效性,也不保证通过率——小米会优先审核有真实业务需求的企业和专业开发者。
通过审核的用户可以获得限时免费的Chat体验,但为了保障资源公平使用,规则也比较明确:每个账号每天最多成功进入队列10次;单次会话时长上限30分钟;如果会话空闲超过5分钟,系统会自动释放资源。简单说,就是得抓紧用,别占着茅坑不拉屎。
总的来说,这次UltraSpeed的发布,意味着万亿参数模型在通用GPU上的实时推理进入了一个新阶段。1000 tokens/s这个数字,不只是个噱头,它让很多之前因为速度不敢落地的应用变得可行。后续就看申请开放后,实际用户能跑出什么样的效果了。
侠游戏发布此文仅为了传递信息,不代表侠游戏网站认同其观点或证实其描述