阿里通义千问发布全新旗舰推理模型 Qwen3-Max-Thinking。
核心特性:具备自适应工具调用能力,可智能使用搜索、记忆和代码解释器;采用测试时扩展技术,通过多轮自我反思提升推理能力。 性能表现:在19个主要基准测试中创下SOTA记录,包括在AIME 25和HMMT 25上获得满分,并在HLE基准上超越Gemini 3 Pro。 可用性:现已通过阿里云百炼API和QwenChat提供。
阿里通义千问在推理模型上取得重大突破,新模型在多项基准测试中达到顶尖水平,强化了其开源模型领导地位。MiniMax则从模型层转向产品层,推出桌面端智能体,旨在降低Agent设计门槛,推动AI应用普及。