本期速报聚焦于Google DeepMind重磅推出的Project Genie实验性世界模型,它能够从文本提示实时生成无限交互世界,标志着生成式AI在沉浸式内容创作的前沿探索。同时,Qwen3-ASR作为业界首个开源流式语音识别模型发布,以及Anthropic关于AI辅助编程影响技能掌握的研究,也引发了广泛关注。

模型动态

Google DeepMind推出Project Genie实验性世界模型

Google DeepMind正式推出Project Genie,这是一个实验性研究原型,被认为是目前最先进的世界模型。它能够仅从简单的文本或视觉提示,实时创建、编辑和探索动态、交互式的虚拟世界。该项目现已面向美国地区的Google AI Ultra订阅用户(18岁以上)开放访问,旨在研究沉浸式用户体验并探索未来方向。项目介绍:https://deepmind.google/blog/project-genie-experimenting-with-infinite-interactive-worlds/[1][2][3][4][5][6][7][8][9][10][11][12]

Qwen团队开源业界首个流式LLM语音识别模型Qwen3-ASR

Qwen团队发布Qwen3-ASR,这是业界首个支持原生流式传输的开源大语言模型语音识别系统。该模型专为处理混乱的真实世界音频设计,并已集成到mlx-audio v0.3.1中,具备生产就绪能力。项目地址:https://x.com/Alibaba_Qwen/status/2016900512478875991[13][14]

产品工具

Google为Gemini 3 Flash推出Agentic Vision新功能

Google Gemini AppGemini 3 Flash模型推出了名为Agentic Vision的新能力。该功能通过规划、缩放和推理等新方式分析图像,旨在更准确、一致地读取图像中的精细细节(如序列号或图表文本)。该功能正在向Gemini应用用户推出,用户可在模型下拉菜单中选择“思考”模式来使用。[15][16][17]

行业资讯

Anthropic研究揭示AI辅助编程对技能掌握的潜在负面影响

Anthropic发布了一项关于AI辅助编程对软件工程师技能掌握影响的实验研究。研究发现,使用AI编码工具可能会【降低技能掌握度】,但具体效果取决于使用方式。这项研究对如何设计促进学习的AI产品以及制定相关职场政策具有更广泛的意义。论文链接:https://t.co/V06Q83Luhv[18][19][20]

多家机构发布前沿AI研究成果

多家研究机构发布重要成果:斯坦福SAIL与ETH合作的研究表明,使用丰富反馈的强化学习(如SDPO方法)在困难任务上显著优于标量奖励。微软研究团队在CACM发表论文,探讨【智能体网络】如何构建开放、去中心化的智能体经济。此外,Google推出了基因组学AI模型AlphaGenome,并开放了相关权重。[21][22][23][24][25]