本期重点关注Qwen-Audio-3.0上线、有声世界模型进展,以及本地模型生态和Agent落地中的新实践。人形机器人也展示了驾驶、乒乓球等全身智能能力。

模型动态

Qwen-Audio-3.0系列语音模型正式上线千问AI平台

Qwen-Audio-3.0覆盖语音识别、合成和实时交互,支持API调用与Token Plan。[1]

世界模型实现24FPS画面与48kHz立体声实时生成

新世界模型支持【音视频统一生成】,可实时输出24FPS画面和48kHz立体声,项目即将【完全开源】。项目链接:https://www.qbitai.com/2026/08/474334.html[2]

产品工具

范式PhanRouter上线智谱GLM-5.3并开放调用

PhanRouter已接入GLM-5.3,开发者可即时调用,新增模型接入渠道。详情:https://www.qbitai.com/2026/08/474361.html[3]

llama.cpp合并Ling 3.0本地运行支持

llama.cpp新增Ling Tiny 8B、Ling Flash 124B等模型支持,降低本地部署门槛。详情:https://www.reddit.com/r/LocalLLaMA/comments/1vqmxpy/ling_30_support_merged_into_llamacpp/[8]

技巧教程

用户实测Omarchy:面向Agent的Linux系统安装流程

用户在闲置笔记本上用BalenaEtcher写入ISO并安装Omarchy,该系统强调Agent优先。详情:https://x.com/vista8/status/2089289607745884189[7]

本地模型评测应补充完整运行环境证据

社区建议记录【量化格式、后端、上下文、并发、设备】等信息,避免只凭截图比较本地模型性能。详情:https://www.reddit.com/r/LocalLLaMA/comments/1vqjkbi/when_a_qwen_38_local_benchmark_looks_good_what/[9]

硬件动态

人形机器人展示卡丁车驾驶与完整乒乓球比赛

两组Demo分别测试机器人驾驶操控双臂协调,展示全身智能进展,但稳定性仍待验证。详情:https://www.qbitai.com/2026/08/474537.html[4][5]

行业资讯

真实工作场景中的Agent成功率仍被质疑

观点认为Agent在金融、法律等真实流程中成功率偏低,通用榜单难以反映落地效果,应建设业务评测集。详情:https://mp.weixin.qq.com/s?__biz=MzIyMzA5NjEyMA==&mid=2647685310&idx=1&sn=a62263bd647f948b3d7a9492337fd137[6]