GLM-4.7发布并完成实测,在编程、Agent和长上下文能力上均有显著提升。
事件:智谱AI发布开源模型GLM-4.7。 实测结论:在硅基骑手Agent测试中表现高效,长上下文(200K)召回率达95%,编程能力达到开源模型SOTA水平。 问题:API速度不稳定。
国内大模型竞争白热化,智谱GLM-4.7在综合能力上取得开源SOTA,MiniMax M2.1在代码美学上发力,百度文心则在文本能力上快速迭代追赶。模型实测成为评估性能的关键手段。