DeepSeek DeepSeek发布数学专用模型DeepSeek-Math-V2 基于DeepSeek-V3.2架构,IMO 2025达到83.3%准确率 ProofBench-Basic得分99%碾压其他模型 性能达到IMO金牌水平,可在美国与韩国之间排名第3
Qwen Unsloth发布FP8 GRPO微调教程 与PyTorch合作使FP8 RL推理速度提升1.4倍 微调显存减少60%,上下文长度延长12倍 Qwen3-1.7B的FP8 GRPO仅需5GB显存,消费级GPU可运行