国内大模型竞争白热化,智谱GLM-4.7在综合能力上取得开源SOTA,MiniMax M2.1在代码美学上发力,百度文心则在文本能力上快速迭代追赶。模型实测成为评估性能的关键手段。

模型动态

GLM-4.7发布并完成实测,在编程、Agent和长上下文能力上均有显著提升。

事件:智谱AI发布开源模型GLM-4.7。 实测结论:在硅基骑手Agent测试中表现高效,长上下文(200K)召回率达95%,编程能力达到开源模型SOTA水平。 问题:API速度不稳定。

MiniMax发布M2.1模型,前端美学表现突出。

事件:MiniMax发布商业大模型M2.1。 核心亮点:代码能力大幅增强,前端代码生成的美学效果显著提升。

文心ERNIE-5.0-Preview-1203在LMArena文本榜国内登顶。

事件:百度文心大模型更新版本。 核心内容:新版本在LMArena文本领域排行榜位列国内第一,主要进步在创意写作和高难度指令遵循。