OpenAI、谷歌、Anthropic、百度48小时内发布GPT-5、Gemini3.0、Claude5和文心5.0;DeepSeekV4Flash登顶斯坦福HELM全项并开源;OpenAIAgentAPI公测,MetaAgent装机量破千万。各厂商在能力、隐私、本地化等维度激烈竞争。
封面
这周的AI行业不是“卷”,是直接掀桌子。
长期稳定更新的攒劲资源: >>>点此立即查看<<<
6月6日到7日,48小时内,OpenAI、谷歌、Anthropic、百度四家先后发布了新一代大模型。再加上DeepSeek登顶斯坦福HELM、OpenAI的Agent API正式公测、Meta的Agent框架装机破千万——写稿的时候手都在抖,信息量太大了。
按时间线来,一条一条拆。
6月6日,OpenAI正式发布了GPT-5 Preview。The Verge第一时间报道。
这次不是“挤牙膏”——GPT-5相比GPT-4.5的提升是肉眼可见的:
同一天(6月6日),Anthropic也没闲着。Ars Technica报道,Claude 5正式亮相。
数据层面,MMLU-Pro达到了98.3%——这已经接近人类专家水平了。但更值得关注的不是分数,而是架构层面的变化:
“Constitutional Self-Correction”(宪法自我纠正)是Claude 5的核心新机制。简单说,模型在生成输出的过程中会实时自我检查,判断是否符合预设的价值准则,并在推理阶段主动纠正偏差。
这意味着什么?之前AI的“对齐”主要靠训练阶段(RLHF、Constitutional AI训练),生成阶段基本是“开盲盒”。Claude 5把这个检查移到了推理过程中——相当于给模型装了一个实时的“道德编译器”。
6月6日还有一个重磅:DeepSeek V4 Flash,登顶斯坦福HELM基准测试全部项目第一名。
不只是“某项第一”,是全项第一。包括安全(Safety)和编码(Code)两个维度都拿到了A评级——这在HELM历史上非常罕见。同时权重已经在HuggingFace上开源。
注意这个时间点:就在OpenAI和Anthropic发布新模型的同一天,DeepSeek用开源模型拿下了全球最权威的行业基准榜首。
6月7日,Google AI Blog正式发布了Gemini 3.0。
几个关键点:
同样是6月7日,百度发布了文心一言5.0。澎湃新闻报道。
核心参数:
百度这步棋的战略意图很明确:全球大模型的竞争不是“谁更强”的单一维度竞争,而是“谁更懂本地市场”的多维度竞争。英文市场GPT-5和Claude 5占据主导,中文市场文心5.0试图用语言和文化的深度理解建立壁垒。
6月7日,The Information报道,OpenAI的Agent API正式进入公测。
这不是普通的API调用。核心能力:
这个价格很有意思。如果Agent执行一个10步的任务,成本只要3美分。相比“每次调用都走完整模型推理”的传统模式,按步计费极大地降低了Agent类应用的使用门槛。
6月6日,VentureBeat报道:Meta的AI Agent框架全球开发者安装量突破1000万。
同时Meta宣布设立5亿美元Agent生态基金,专门投资基于Meta Agent框架构建的应用和工具。
1000万开发者是什么概念?这已经超过了当年React Native早期的增长速度。Meta走的是“开源框架+开发者生态”的路线——不自己卷模型,而是让开发者用它的框架去卷应用。
这个周末的信息太多,试着提炼几条主线:
1. 大模型的“三国杀”进入新阶段。 GPT-5、Gemini 3.0、Claude 5、文心5.0在48小时内同时亮牌——这不是巧合,这是行业竞争白热化的标志。每家都在用不同的路线(能力、隐私、安全、本地化)争夺用户。
2. Agent正在成为AI的下一个主战场。 OpenAI的Agent API公测、Meta的千万开发者+5亿基金——两大巨头在同一天押注Agent赛道。这不是巧合。2026年下半年,Agent应用的爆发可能是AI行业最值得关注的主线。
3. 开源的力量不容忽视。 DeepSeek V4 Flash登顶HELM全项第一并开源权重,说明开源模型和闭源模型的差距正在快速缩小。当开源模型在性能上追平甚至超越闭源,商业模式的格局会被彻底改写。
4. 中文大模型的竞争进入硬核阶段。 百度文心5.0的1.2万亿MoE是一个信号——国内厂商不再满足于“跟随”,而是试图在中文这个足够大的市场上建立自己的主导地位。
这周的AI行业,像看了一场四部曲的首映马拉松。下周还有WWDC 2026和苹果的AI布局——已经开始期待了。
侠游戏发布此文仅为了传递信息,不代表侠游戏网站认同其观点或证实其描述