本期重点关注Anthropic MHS标准Gemini Omni 1.1 Flash发布:前者探索AI智能体安全操作物理设备,后者在视频生成竞技场取得领先。与此同时,Agent基础设施、表格解析和推理效率也出现实用更新。

模型动态

Gemini Omni 1.1 Flash登顶文本生成视频榜

Gemini Omni 1.1 Flash获文本生成视频【第一】、图生视频第二,并支持Veo控制、4K放大及首尾帧控制。详情:https://deepmind.google/blog/gemini-omni-1-1-flash-lets-you-build-with-more-control/[8][9][10][11][8]

Grok-4.6在Agent Arena代码任务表现提升

Grok-4.6在Agent Arena总体排名第15,代码排名第12,用户确认成功率提升15%。单任务中位成本为1.12美元,接近Claude Opus 4.6。[12]

产品工具

Google Cloud推出面向常驻智能体的Cloud Run实例

Cloud Run instances支持低成本运行长期、带状态的个人AI智能体,适用于OpenClaw和Hermes等工作负载。产品地址:https://cloud.google.com/blog/products/serverless/introducing-cloud-run-instances/[13]

LlamaParse加入原生智能体表格抽取

LlamaParse可处理超大表格、不规则结构及跨工作表关联,减少PDF式扁平化造成的上下文丢失。该能力面向企业文档解析与Agent检索场景。[14]

Vercel团队推出面向AI智能体的vgpu.sh

vgpu.sh是面向AI智能体的【WebGPU创意开发工具】,支持智能体生成并迭代GPU图形应用。项目详情:https://x.com/rauchg/status/2093019310725951683[16]

行业资讯

Anthropic启动Model Hardware Standard研究预览

MHS将设备集成从数周缩短至数小时或数分钟,并提供发现与安全操作接口。早期测试覆盖药物发现、成像和量子计算,计划未来【开源】。[1][2][1][3][4][5][6][7][4]

Prefix Sliding尝试降低长推理轨迹成本

Prefix Sliding通过选择性遗忘前缀,降低长推理轨迹中的注意力内存与计算开销。方法面向高效测试时扩展,完整实验效果仍待核验。[15]