SWE-Bench最新测试显示MiniMax-M2成为开源模型新王者,DeepSeek-V3.2和GLM-4.6紧随其后。
细节1:MiniMax-M2在SWE-Bench verified测试中得分最高,长任务处理能力突出。 细节2:DeepSeek-V3.2 reasoning版本性价比极高,GLM-4.6则在速度、价格和性能上表现均衡。
开源模型在代码能力上持续进步,MiniMax-M2在特定基准测试中领先,但整体与顶级闭源模型仍有差距。机器人领域出现新的商业化应用案例。