本期速报亮点:全新多语言开源模型Apertus-v1.5登场,Apple M5矩阵乘法核心优化技巧让推理提速1.4倍,【金山办公】和pi-dispatch等新Agent/工具实用性强。

模型动态

开源模型Apertus-v1.5发布,70B/8B多语言多模态

Swiss AI发布Apertus-v1.5系列(70B/8B),宣称完全开放透明,支持多语言多模态,适合本地部署和可复现研究。项目地址:https://www.reddit.com/r/LocalLLaMA/comments/1v539p8/swissaiapertusv15_70b8b/[1]

产品工具

金山办公发布新Agent,可处理10万字长内容直接交活

金山办公Agent支持处理10万字长内容,直接交付任务,显著降低长文档AI应用门槛。[3]

pi-dispatch填补pi coding agent缺失功能,容器化服务

pi-dispatch为pi coding agent补充队列、容器隔离和费用控制,支持CLI/cron/GitHub三种触发方式,方便部署为服务。项目地址:https://t.co/8t2zqEVF0C[4]

Zvec 0.6.0发布,新增Group-By搜索INT4召回提升50+点

Zvec 0.6.0新增Group-By搜索支持per-group Top-K,随机旋转使INT4召回提升超50点且QPS不变,FTS支持34+语言。[5]

技巧教程

RTX 5060 Ti实测:运行Qwen3.5 35B A3B达55 tok/s

用户通过扩展garlic在RTX 5060 Ti上运行Qwen3.5 35B A3B(float8),实测速度达55 tok/s,为本地推理配置提供参考。[7]

Codex安装Skill调用Grok和Kimi,多模型评估更可信

分享一个Codex Skill,可同时调用GrokKimi评估大模型输出结果,提升可信度。安装命令:npx skills add joeseesun/qiaomu-model-cli,开源地址见评论。[8]

硬件动态

Apple M5矩阵乘法核心未充分利用,手动优化可提速1.4倍

开发者发现Apple M5芯片的matmul核心尚未完全发挥,通过手动实现w8a8核可将推理速度提升【1.4倍】,对本地推理优化有重要参考价值。[2]

行业资讯

李飞飞学生发起具身人类数据标准,光轮智能参与

由李飞飞学生发起的具身人类数据标准项目启动,光轮智能作为唯一中国企业参与,推动行业数据标准化。[6]