本期重点集中在【代理式视频理解】、Fable 5.1和【多模态世界模型】等模型进展,同时出现了面向阅读、视觉推理与企业预测的新工具。

模型动态

Gemini推出代理式视频理解能力

Gemini可联合分析字幕、音频和画面,动态采样关键帧,部分场景【减少88% token】。已通过API、AI Studio等提供。[1][2][3][4][5][6]

Fable 5.1登陆多平台并开启智能体评测

Fable 5.1进入Agent Arena、Cursor、Devin和AWS,覆盖代码与长流程任务;Devin称成本降低54%,CursorBench达73.4%。[7][8][9][10][7]

World Labs发布Atlas世界模型

Atlas支持从单张图像重建大规模场景,并依据文本、图像和摄像机路径生成最长约一分钟视频,强化【像素级摄像机控制】。[11][12]

产品工具

DeepSeek V4 Flash在Fireworks加入原生视觉

Fireworks上线具备原生视觉的DeepSeek V4 Flash,支持无服务器与优先级部署,输入输出价格为每百万token 0.22/0.66美元。[13][14]

Google Workspace推出Google Pics图像工具

Google Pics基于Nano Banana模型,提供Workspace内的图像生成与编辑能力,推动多模态创作进入办公场景。https://blog.google/products-and-platforms/products/workspace/google-pics/[16]

BigQuery推出TabFM企业预测分析功能

TabFM可直接在BigQuery内完成流失预测、购买意向和欺诈评分,减少传统机器学习的训练、调参与部署流程。https://cloud.google.com/blog/products/data-analytics/tabfm-adds-predictive-ml-to-bigquery/[17]

技巧教程

Obsidian开源AI EPUB阅读器支持多模型协作

新项目将Obsidian改造成中文EPUB AI阅读器,支持本地Codex、Claude、Grok CLI及DeepSeek、GLM、Kimi。开源地址见评论区。[15]

行业资讯

NVIDIA与CrowdStrike测试AI安全防御智能体

系统自动生成并修复检测规则,在8个未知攻击上识别全部攻击;优化管线将平均回测检测率从16.5%提升至41.9%[18][19][20]