智谱AI发布了一款在代码能力上表现卓越的30B级别开源模型,成为该级别的新SOTA,但发布初期面临算力瓶颈。同时,最新的基准测试揭示了前沿模型在不同任务类型上的能力分化,代码能力成为新的关键竞争维度。

模型动态

智谱AI发布开源模型GLM-4.7-Flash。

模型规格:30B-A3B参数的MoE架构,激活参数约3B,MIT许可证开源。 性能亮点:在多项测试中表现突出,代码能力(SWE-bench 59.2%)远超同级别模型,支持200K长上下文。 发布影响:模型发布后因使用量过大导致官方API响应缓慢,出现拥堵。

LMArena发布最新模型实测排名。

测试维度:对比了模型在文本(Text Arena)和代码(Code Arena)任务中的表现差异。 关键发现:Claude 4.5 Opus Thinking在代码任务中排名第一;Grok 4.1在代码任务中排名大幅下滑,而MiniMax M2.1等模型排名显著上升。