Code Arena重新定义AI编程评估标准,从静态测试转向实时应用构建。微博以极低成本开源高性能数学模型,显示开源模型性价比优势。MiniMax即将发布专门针对Agent场景的新模型,显示行业向专业化方向发展。

模型动态

Code Arena发布新一代AI编程评估平台

产品定位:实时编程评估平台,测试模型规划、调试和构建真实Web应用能力 支持模型:Claude、GPT-5、GLM-4.6、Gemini等前沿模型 评估方式:开发者社区投票决定"前沿AI编程"标准,非静态基准测试[1][2][3]

微博AI发布开源数学模型VibeThinker-1.5B

基于Qwen2.5-Math-1.5B微调,AIME25数学测试超越DeepSeek-R1 训练成本仅7800美元,目前需本地部署测试

MiniMax明日发布专为Agent和代码生成设计的M2模型

北京时间11月14日上午9点举行技术对话 将深入探讨架构、性能权衡等技术细节