3D生成、语音交互、智能体进化是当前竞争焦点。李飞飞团队入局3D生成领域,谷歌强化语音自然度,百度全面布局企业级AI应用。开源模型微调工具持续丰富,终端AI工具生态逐步完善。

模型动态

李飞飞World Labs发布3D世界模型Marble公测

支持文本、图像、视频、3D布局生成完整3D世界 可交互编辑、扩展与组合,导出多种格式 目前服务不稳定,实测效果与演示有差距

Google Gemini Live语音功能重大更新

支持实时调节语速,对听障用户更友好 新增多种趣味口音(美式牛仔音、伦敦腔等) 增强模拟面试、语言练习、沉浸式讲故事能力[1][2]

通义实验室发布两款Qwen图像编辑LoRA

Apply Texture LoRA:为任意对象应用纹理 Anishift-LoRA:将动物转化为人类头像 均基于Qwen-Image-Edit-2509模型

InferenceNet发布论文聚类可视化工具

处理1亿篇科学论文,成本仅10万美元 使用定制模型Aella-Qwen3-14B和Aella-Nemotron-12B 提供论文关系发现和结构化摘要查看

产品工具

百度世界大会发布多项AI产品

自进化AI智能体Famou:基于进化算法,现仅邀请使用 百度搜索70%结果采用富媒体格式,AI搜索能力开放API 数字人技术拓展至美国、东南亚,无代码平台MeDo全球发布

行业资讯

Kimi-CLI支持Windows平台

可在cmd中直接使用,支持基础命令和grep 目前功能较为基础,适合简单场景