阶跃星辰通过创新的推理架构,在小参数模型上实现了超越大模型的性能,展示了“测试时计算扩展”的价值。同时,GLM-4.7-Flash的量化部署问题得到解决,有助于其更广泛的本地应用。

模型动态

阶跃星辰发布10B多模态模型Step3-VL-10B,性能超越大体积模型。

核心方法:采用PaCoRe(并行协调推理)技术,通过16路并行探索提升复杂任务性能。 实测成绩:在AIME 2025数学竞赛中得分94.43,超越Qwen3-VL-Thinking和Gemini 2.5 Pro。 代价:计算量约为16倍,汇总阶段需要128K上下文长度,适合高精度竞赛场景。

GLM-4.7-Flash量化版本发布,并提供了解决重复输出问题的方案。

问题:本地运行GGUF量化版时出现内容重复。 解决方案:需使用llama.cpp的dry-multiplier参数(而非repeat-penalty)来抑制重复,并给出了推荐参数。 量化选择:Unsloth提供了19种量化格式,推荐UD-Q5_K_M以平衡体积与质量。