本期关注本地AI工具与部署实践:浏览器适配检测、模型管理平台和实战基准集中出现;千问办公首月用户突破3000万

模型动态

Qwen 3.8 27B升级呈现明显质量成本权衡

oMLX测试中质量分由81.1升至87.7,但耗时约增【5倍】;单项测试称常识能力接近GPT-5 Pro。[6][7]

Neon Ladder用可运行游戏评测本地LLM栈

Neon Ladder以模型能否完成并运行游戏评分,关注【端到端开发能力】及静态基准遗漏的失败模式。[9]

产品工具

千问办公上线首月用户突破3000万

千问办公首月用户突破3000万,企业用户占比过半。数据显示其企业办公渗透迅速。[1]

Claude Code新增差异面板与缓存诊断

Claude Code v2.1.260新增差异面板及缓存未命中提示。更新:https://github.com/anthropics/claude-code/releases/tag/v2.1.260[2]

两款开源工具降低本地模型部署门槛

browser-llm-fit预检浏览器模型适配性;Quartermaster可自动识别模型并配置运行环境。[3][4]

Codex增加GPT-6 Astra API配置并修正Fast层级说明

Codex支持经API配置GPT-6 Astra;Fast层级说明修正为2倍速度但增加用量。https://github.com/openai/codex/releases/tag/rust-v0.153.2[10][11]

技巧教程

从零用GRPO后训练Qwen 3.5-2B

作者公开GRPO笔记本与视频,用于后训练Qwen 3.5-2B,兼顾准确率和推理效率。[5]

Spark-2.5-4B在8GB Jetson上实现边缘运行

社区以4-bit量化8GB Jetson Orin Nano运行Spark-2.5-4B,并支持128K上下文。[8]