Qwen3-Max 正式版发布。根据实测,相比之前的 ThinkingPreview 版,正式版在多个方面有显著提升:1. 编程能力:鞭炮连锁爆炸测试从完全无法完成到效果不错;大象牙膏测试的锥形瓶建模改善明显;陀飞轮机芯建模从无法完成到顺利建模;Python杯子倒水的粒子弹性和碰撞检测问题已修复。2. 美学能力:能用文字描述还原 p5.js 现代艺术作品,但空间理解能力仍有不足。3. Agent能力:在60K上下文内表现优秀,预估可达SOTA水平,但超过60K后性能会急剧下降,可能出现任务循环或遗忘工具的问题。4. 召回能力:接近70%,但出现上下文越短召回反而越差的奇怪现象。总结:正式版提升肉眼可见,但空间理解、Agent长上下文能力和召回机制仍需打磨。
[13]