本期重点关注:华为开源OpenPangu-2.0-Flash92B MoE模型,微软突然下架FastContext模型,以及Anthropic大规模【封杀浙江杭州IP】引发热议。此外,NVIDIA发布Qwen3.6-27B-NVFP4量化版、SGLang DSpark实测数据亮眼、GLM-5.3征集视觉需求等动态也值得关注。

模型动态

华为开源OpenPangu-2.0-Flash,92B参数支持512K上下文

华为正式开源OpenPangu-2.0-Flash,总参数量92B,激活6B,支持512K上下文。后续还有505B的Pro版本即将发布。项目地址:https://github.com/ascend-tribe/openPangu-2.0-Flash[1][2]

微软从全网下架FastContext模型,原因不明

微软已从Hugging Face和GitHub等平台下架FastContext模型,未公布原因。该模型此前受关注,下架影响开发者使用和研究。[5]

NVIDIA发布Qwen3.6-27B-NVFP4官方量化版

NVIDIA基于Qwen3.6-27B发布NVFP44bit量化版本,专为推理优化设计,适合本地部署和边缘计算场景。模型已上传Hugging Face。[6]

智谱唐杰为GLM-5.3征集意见,评论区齐呼增强视觉能力

智谱唐杰公开征集GLM-5.3新模型功能意见,评论区几乎全是要求提升视觉能力。该反馈对新模型规划有直接参考价值。[9]

产品工具

Anthropic大规模封杀浙江和杭州IP,疑因阿里数据蒸馏事件

据用户反馈,Anthropic封杀了大量浙江和杭州IP,封杀邮件还附带追踪器确认位置,申诉无效。起因是Anthropic指控阿里通过25000+账号进行2880万次交互蒸馏Claude数据[3][4]

SGLang DSpark实测数据:加速比1.81倍,TPOT低至2.9ms

SGLang的DSpark推测解码PR放出实测数据:1K长度prompt下加速比1.81倍,8卡B200达297 token/s,TPOT仅2.9-5.2ms。单并发提升最大,8并发后降为1.2-1.3倍。[7]

行业资讯

体验具身智能数据采集:给机器人打工一天的真实记录

作者亲历具身智能数据采集工作,记录为机器人提供训练数据的真实场景,反映行业用工模式和从业者体验,引发对AI产业链底层的思考。[8]

中国信通院发布AI Infra运维领域首个评测基准,覆盖5款国产芯片

中国信通院发布AI Infra运维首个评测基准,覆盖5款国产芯片,为运维从业者提供选型和评估参考,推动行业标准化。[10]