本期重点是【GLM-5.3正式开源权重】及Gemini Omni 1.1 Flash视频生成能力更新;同时,AI基础设施投资、GPU工具采用率和本地模型部署实践持续升温。

模型动态

GLM-5.3正式开放权重,面向智能体编程与网络防御

Z.ai开放GLM-5.3权重,支持下载、运行与定制,主打智能体编程和网络防御。权重:https://t.co/v1IbWMXxg4[1][2]

Gemini Omni 1.1 Flash上线,强化可控视频生成

Google DeepMind推出Gemini Omni 1.1 Flash,提升视频生成的【可控性】、迭代速度和成片质量,已接入Flow与Runway。[3][4]

产品工具

NVIDIA Warp累计下载量突破1000万

NVIDIA宣布Warp下载量破千万,该Python GPU工具覆盖物理仿真与工程计算,机器人开发者生态持续扩大。[8]

Cloudflare推出BotBase,帮助网站识别AI代理

Cloudflare发布BotBase for Operators,支持登记和识别机器人、AI代理,并分析自动化流量。https://blog.cloudflare.com/botbase-for-operators/[9]

技巧教程

LlamaIndex分享静态嵌入检索提效方案

LlamaIndex探索逐Token MaxSim、适配器训练与蒸馏,改善【静态嵌入】的准确率与吞吐权衡,适用于RAG检索优化。[10]

社区实测Qwen3.8-Flash可在消费级显卡低门槛运行

用户通过量化、llama.cpp mmap与CPU内存分层,在12GB至16GB显存设备上运行Qwen3.8-Flash,最高约400 tokens/s。https://www.reddit.com/r/LocalLLaMA/comments/1w0na2z/qwen38flashnext_udiq4_xs_on_2x_rtx_3060_7800x3d/[11][12][13]

行业资讯

a16z设立11亿美元Machine Age基金押注AI基础设施

a16z推出【11亿美元基金】,投资芯片、内存、网络、电力、软件及机器人等【AI基础设施】领域。[5][6][7]