开源模型领域持续创新,DeepSeek在数学推理领域取得突破性进展,Unsloth的技术进步让强化学习微调门槛大幅降低,Qwen团队的多模态布局值得关注。

模型动态

Qwen团队正在准备下一代模型,将重点发展多模态原生训练和视觉任务数据扩展。

DeepSeek发布数学专用模型DeepSeek-Math-V2

基于DeepSeek-V3.2架构,IMO 2025达到83.3%准确率 ProofBench-Basic得分99%碾压其他模型 性能达到IMO金牌水平,可在美国与韩国之间排名第3

Unsloth发布FP8 GRPO微调教程

与PyTorch合作使FP8 RL推理速度提升1.4倍 微调显存减少60%,上下文长度延长12倍 Qwen3-1.7B的FP8 GRPO仅需5GB显存,消费级GPU可运行