本期重点聚焦GLM-5.3-FlashQwen3.8-Flash两款高性价比开放模型:前者以低价和代码能力进入竞技场前列,后者则提前展示Qwen4架构方向。企业侧,Google Cloud补充了面向Agent的成本控制与容量管理能力。

模型动态

GLM-5.3-Flash正式发布,320B模型采用MIT许可

Z.ai发布GLM-5.3-Flash,320B-A18B、原生多模态、支持100万Token上下文,并以MIT协议开放权重。此前该模型代号为Ox Alpha,可运行于中国AI芯片。博客:https://t.co/tzOmB7gdZP[1]

GLM-5.3-Flash以低价进入Code Arena开源模型前二

GLM-5.3-Flash在WebDev Code Arena早期AutoEval中排名约第5、开源模型第2,得分1634。API价格为【输入$0.15、输出$0.50/百万Token】,但最终排名仍待实时投票确认。[2][3][3][4]

Qwen3.8-Flash开放权重,作为Qwen4架构早期预览

Qwen发布Qwen3.8-Flash,采用125B参数、6B激活的多模态MoE,并开放Qwen3.8-Flash-Next权重。模型原生支持262K上下文,可扩展至1M,生产API计划定价为输入$0.16、输出$0.47/百万Token。博客:https://t.co/M5hYypFLgJ[5][5][6][6]

Qwen3.8-Flash引入稀疏注意力与N-gram嵌入

Qwen3.8-Flash-Next采用GDN+QSA混合注意力、门控残差、N-gram嵌入和Muon优化器,探索Qwen4架构。官方称其训练成本仅为前代1/9,并在多项编码与办公基准上领先。[5][7][8]

Qwen3.8-Flash-Next在百万Token上下文下显著提速

1M上下文下,QSA注意力内核预填充最多快7.6倍、解码快4.9倍;结合90%前缀缓存,预填充吞吐量达到Qwen3.7-Plus的【8.6倍】。项目已获vLLM和SGLang首日支持。[9][9][10][11][12][11]

产品工具

Google Cloud推出面向Agent的灵活计费与动态容量管理

Google Cloud新增AI Agent【灵活计费、成本控制与动态容量管理】能力,帮助企业监控用量、设置预算并调度资源,面向大规模生产部署。详情:https://cloud.google.com/blog/products/ai-machine-learning/flexible-billing-and-cost-controls-for-agents-on-google-cloud/[13][14]