本期聚焦【本地推理加速】与【通用游戏智能体】:FreeToken实测约100 tokens/s,DeepMind将SIMA 2拓展至EVE Online。

模型动态

AntLing发布Ling-3.0-Flash推测解码草稿模型

新模型面向Ling-3.0-Flash,可用于推测解码加速。目前尚无GGUF版本,本地部署生态仍待完善。[2]

产品工具

FreeToken开源项目加速本地大模型推理

项目已发布论文与代码。RTX 5080运行Qwen3.6-35B-A3约达100 tokens/s,尚待独立复现。[1]

技巧教程

社区尝试用KV cache blending降低预填充开销

用户分别缓存提示片段,再通过KV缓存拼接减少完整预填充成本。方案仍属个人实验,兼容性待验证。[3]

硬件动态

硅羽科技将机器人智能系统部署至飞行平台

方案融合机器人智能无人机,目标是替代人员进入危险作业现场,体现具身智能的特种作业落地方向。[5]

行业资讯

DeepMind以SIMA 2探索复杂游戏中的通用智能体

SIMA 2将游戏智能体研究从Atari扩展至EVE Online,重点探索视觉交互与长期规划能力。[4]

社区质疑Artificial Analysis综合评分有效性

帖子结合Qwen测试结果质疑“Intelligence”指标,认为综合评分难反映真实能力,提醒避免单一基准决策。[6]