法国人工智能公司MistralAI发布了两款新模型:基于Mamba架构的代码生成模型CodestralMamba7B,支持256K令牌上下文,推理速度快且已开源;专为数学推理和科学发现设计的Mathstral7B,在数学推理任务中表现优异。两款模型均通过Apache2.0许可证发布。
法国AI公司Mistral AI近日发布了两款新模型:面向程序员和开发者的代码生成模型Codestral Mamba 7B,以及专为数学推理和科学发现设计的Mathstral 7B。这两款模型在各自领域展现出明显优势。
Codestral Mamba 7B的核心卖点是推理速度快、上下文处理能力强。它基于去年由其他研究人员提出的Mamba架构设计,该架构旨在简化Transformer模型的注意力机制,从而提升效率。即使在处理长文本输入时,响应时间依然保持在可接受范围。具体参数上,它能处理多达256,000个token的输入,容量是GPT-4o的两倍。根据Mistral AI自测,在HumanEval等基准测试中,它的表现明显优于CodeLlama 7B、CodeGemma-1.1 7B和DeepSeek等开源竞品。该模型通过Apache 2.0许可证开源,开发人员可直接从GitHub和HuggingFace下载、修改并部署。
长期稳定更新的攒劲资源: >>>点此立即查看<<<

▲(图源:Mistral AI)
值得注意的是,代码生成和编码助手赛道竞争已相当激烈。从GitHub Copilot到Amazon CodeWhisperer再到Codenium,各家都在争抢用户。Mistral AI选择此时推出Codestral Mamba,显然希望占据开源代码生成模型的重要位置。此前CodeLlama 70B和DeepSeek Coder 33B已被其早期版本超越,新架构加持的7B版本能拉开多大差距,值得持续关注。
从技术路线看,Codestral Mamba 7B的架构升级是关键。与熟悉的Transformer架构不同,Mamba架构通过简化注意力机制提升效率。这意味着基于Mamba的模型在处理长文本输入时,推理速度保持稳定,不会出现token堆积后的性能衰减——这对需要处理大量代码文件的本地开发场景是刚性需求。
目前,包括AI21在内的公司已基于Mamba架构推出模型,这一方向正受到更多关注。Mistral AI表示,该模型将在其la Plateforme API上免费使用,开发者可零门槛上手实验。
第二个模型Mathstral 7B任务明确:数学推理和科学发现。它基于Project Numina开发,拥有32K的上下文窗口,同样通过Apache 2.0许可证发布。Mistral AI声称,在所有专为数学推理设计的模型中,它表现最好,随着推理时间计算资源增加,能在基准上获得“明显更好的结果”。

▲(图源:Mistral AI)
更关键的是,它在“微调”能力上做了针对性优化——用户不仅可拿来即用,还能针对特定方向进行二次训练。Mistral AI在博客中直言:“Mathstral是另一个例子,展示了当为特定目的构建模型时,能够实现出色的性能——这也是我们在la Plateforme中积极推广的开发理念。”
用户可通过Mistral AI的la Plateforme或HuggingFace直接访问该模型。
从产业视角看,Mistral AI此次布局透露出两个关键信号。第一,AI工具正加速向专业化方向发展,不再是“一个模型通吃所有”,而是针对代码、数学等特定场景打造极致性能。第二,开源AI的参与感在增强。通过发布Codestral Mamba 7B和Mathstral 7B,Mistral AI正用更透明、更协作的方式参与竞争——这与OpenAI和Anthropic的封闭路线形成鲜明对比。
这家公司刚在B轮融资中筹集6.4亿美元,估值接近60亿美元,背后站着微软和IBM等科技巨头。从商业层面看,Mistral AI已不仅是一个实验室项目,而是真正具备分发能力的AI公司。这些新模型是否会进一步推动开源大模型的迭代速度,很快就能看到答案。
侠游戏发布此文仅为了传递信息,不代表侠游戏网站认同其观点或证实其描述