本期重点包括Kimi K2.7 Code推出高速模式,Qwen3.6-27B在单卡3090上实现38.6 tok/s性能突破,以及Agentic Detection视觉模型、智谱Zcode客户端等新工具。

模型动态

Qwen3.6-27B在单RTX 3090上达38.6 tok/s,KV缓存仅72 MiB

社区实测Qwen3.6-27B在单RTX 3090上生成速度38.6 tok/s,KV缓存仅需72 MiB,VRAM占用大幅降低,是本地部署的显著提升。[2]

Gemma-4基于QAT的GGUF量化发布,精度更高

Reddit用户发布基于QATGemma-4模型GGUF量化文件,声称相比传统方案精度损失更小,为本地部署提供新选择。[7]

产品工具

Kimi K2.7 Code推出高速模式,速度可达260 tok/s

Kimi发布K2.7 Code【高速模式】,编码任务速度提升6倍,达约180 tok/s,短上下文任务达260 tok/s。已向Kimi Code Beta、API及商业用户开放。[1]

Agentic Detection视觉模型:一句话描述即可精确圈出目标

@小互 介绍Agentic Detection视觉检测模型,无需预训练,输入图片和文字描述即可画框标注目标,支持物理推理(如定位起火点、空车位)。[3]

智谱发布Zcode客户端,类似Codex,免费使用GLM 5.2

智谱推出Zcode客户端,支持Windows/Mac/Linux,注册即用GLM 5.2模型。功能类似Codex,提供编程协作。[4]

技巧教程

LLM API请求前挤掉浪费token,省钱不影响回答质量

Geek分享技巧:在LLM API请求发出前自动剔除冗余token,可节省费用且不影响质量。工具链接:https://t.co/0z8NRJzw4H[8]

硬件动态

宇树机器人宣布将登顶钦博拉索,展示极限能力

宇树机器人宣布挑战登顶钦博拉索(厄瓜多尔最高峰),展示机器人在极端地形下的能力,未透露技术细节。[6]

行业资讯

观点:Prompt Engineering将演变为Loop Engineering

文章提出未来AI开发将从Prompt Engineering转向Loop Engineering,核心是设计Agent循环而非编写提示词,对从业者有前瞻指导。[5]