本期聚焦Gemini 3.7 Flash工具接入本地模型量化实测;DeepSeek Harness教程、Agent框架及AI硬件也有新进展。

模型动态

Nemotron量化版单卡批处理吞吐提升约4.5倍

Nemotron 3.5 LightningW4A16可装入RTX 3090,批量16吞吐约【提升4.5倍】。[6]

产品工具

llm-gemini 0.33扩展Gemini模型支持

llm-gemini 0.33新增Gemini 3.7 Flash及多款嵌入模型支持。[1]

Mistral平台开始托管GLM-5.2

Mistral开始托管竞品GLM-5.2,定价低于自家旗舰模型。[3]

System 0xF0发布零依赖Agent协调框架

System 0xF0提供Agent注册、共享状态与广播信号,并原生支持/llms.txt[8]

X开源推荐算法并测试账号限流查询工具

X开源“为你推荐”算法,并灰测限流标签查询及数据下载功能。[9]

技巧教程

DeepSeek Harness新增两万字入门教程

DeepSeek Harness新增2万字实操教程:https://juejin.cn/post/7673390412729614390[2]

社区展示低显存运行Qwen模型的新实测

社区在6GB显存运行Qwen 30B MoE达30 tokens/s;1-bit大模型占约508GB内存[4][5]

硬件动态

Orange Pi推出高内存AI迷你主机

Orange Pi AI Station配备176 TOPS NPU与最高96GB内存,面向边缘AI推理。[7]