本期重点关注【AI视频生成】领域巨额融资与人形机器人自主能力突破,同时谷歌发布多模态嵌入模型并开设AI科普空间。

模型动态

谷歌发布首个原生多模态嵌入模型Gemini Embedding 2

谷歌正式发布Gemini Embedding 2,这是其首个【原生多模态】嵌入模型。该模型旨在统一处理文本、图像等多种模态信息,提升AI对跨模态内容的理解能力。[3]

产品工具

Browser Use推出/crawl端点API,可一键爬取整个网站

智能体工具Browser Use推出新的/crawl端点API,允许用户一键爬取整个网站内容,并输出HTML、Markdown或JSON格式。这大大简化了网页数据采集流程。[5]

技巧教程

用户分享与AI共同阅读思考的心得,反驳“AI让脑子退化”论

用户分享与AI共同阅读书籍并讨论的体验,认为这是“最有趣的娱乐活动之一”。他反驳了“AI让脑子退化”的观点,强调关键在于正确的使用方法[10]

硬件动态

Figure 03机器人展示完全自主整理客厅能力

人形机器人Figure 03展示了能完全自主整理客厅的能力,包括拾取物品、分类和归位。这标志着人形机器人在复杂家庭环境中的自主任务执行取得重要进展。[2]

行业资讯

爱诗科技完成3亿美元C轮融资,聚焦实时交互视频生成

AI视频生成公司【爱诗科技】完成3亿美元C轮融资,由鼎晖领投。融资将重点用于发展实时交互视频生成技术,标志着该领域获得重要资本关注。[1]

Yann LeCun离开Meta后创办AMI Labs,获超10亿美元种子轮融资

AI先驱Yann LeCun离开Meta后创办AMI Labs,并获得高达10.3亿美元的种子轮融资。公司目标是开发不依赖大语言模型的世界模型,用于机器人、工业控制等现实世界应用。[4]

Google DeepMind伦敦新大楼命名Platform 37,并开设AI科普空间

Google DeepMind将其伦敦新大楼命名为Platform 37,致敬AlphaGo的里程碑。同时宣布将开设面向公众的The AI Exchange,作为AI展览和教育空间,旨在促进AI科普。[6][7][8][9]