本期最大热点是GPT-Live全面推送,全双工语音+实时UI+调用GPT-5.5。另外混元3蚂蚁灵波LingBot-Vision实测表现惊艳,世界模型权重开源推动交互式生成,多个实用工具发布。

模型动态

混元3 正式版实测:300B 参数 Agent 能力突出

混元3300B 参数下展现超高 Agent 能力,极具性价比,可用作 Agent 驱动模型。前端任务表现不错,后端能力有提升空间。[5]

蚂蚁灵波 LingBot-Vision 实测:1B 参数越级打平 7B DINOv3

LingBot-Vision仅 1B 参数,空间几何和边界感知极强,适合具身智能视觉主干。支持硬件级深度补全(识别透明/反光物体),30 系显卡可本地运行。[6]

交互式世界模型权重开源,单 GPU 实时 720p60 渲染

14B 和 1.3B 版本的世界模型权重发布,支持单消费级 GPU 实时720p60渲染,可用键盘鼠标交互控制场景,推动可交互 AI 视觉生成。项目地址:https://www.reddit.com/r/LocalLLaMA/comments/1ur4va7/interactive_world_model_weights_just_landed_14b/[7]

产品工具

GPT-Live 向所有付费用户全面推送,免费用户陆续开放

OpenAI 宣布GPT-Live已向 Go/Plus/Pro 用户全面推送,免费用户逐步开放。支持全双工语音、可打断追问,能实时调用GPT-5.5推理并生成实时 UI 界面展示天气/股票等信息。[1][1][2][3]

Claude Code 新增 /checkup 系统体检命令

运行/checkup可自动清理未用技能/MCP、去重 CLAUDE.md、拆分根配置、关闭慢速钩子、更新版本等,所有更改前均会确认,安全可控。[4]

MTPLX V2 让 MacBook Pro 运行 Qwen 3.6 27B 达 82 TPS

MTPLX V2 通过 Turbo Mode 和自定义量化内核,在 MacBook Pro 上实现82 TPS推理速度,大幅提升 MLX 模型本地部署效率。[8]

audio.cpp 更新支持 4 个 ASR 模型,C++ 推理速度碾压 Python

audio.cpp 新增支持 Nemotron、Higgs Audio、VibeVoice、Hviske 四个 ASR 模型,原生 C++/GGML 流式推理,速度比 Python 快【1.07-2.41倍】,327 秒音频仅需 2.17 秒。[9]

技巧教程

Hugging Face 发布极简智能体教程,手把手创建 coding agent

Hugging Face 推出从零创建自己 coding agent 的入门教程,适合学习 Agent 开发的初学者。项目地址:https://t.co/7nBeX7B2DE[10]