本期重点关注AI编程代理从聊天走向持久化项目协作,以及【多模态检索】和推理基础设施的生产化进展。开源模型方面,Hy4与DeepSeek在真实任务和Web开发评测中持续逼近闭源模型。

模型动态

Nemotron 3 Embed 8B登顶Q2D-Web检索评测

NVIDIA称Nemotron 3 Embed 8B在Q2D-Web综合nDCG@10中排名第一,评测覆盖1.9亿篇网页、10种语言。来源:https://x.com/NVIDIAAI/status/2098167118806372669[4]

Hy4 preview在Agent Arena开源模型中排名第二

Hy4 preview在1.45万余次真实代理任务中位列开源模型第二,成本约为Kimi K3 Max的32%,并进入Agent Arena性价比前沿。来源:https://x.com/arena/status/2098116858180509843[8]

产品工具

Cursor推出Projects,支持持久化多代理协作

Cursor发布Projects,将聊天升级为持久化工作线程,支持代理管理任务、调用子代理并共享记忆与产物。来源:https://x.com/cursor_ai/status/2098162488013455784[1][2]

Cognition推出可通过电话指挥的Devin Voice

Cognition发布Devin Voice,用户可通过语音或电话式交互指挥AI软件工程师完成开发任务,扩展编程代理的交互形态。来源:https://x.com/cognition/status/2098142686486356185[3]

Amazon Bedrock支持Marengo 3.0多模态搜索

Amazon Bedrock Knowledge Bases接入Marengo Embed 3.0,支持视频和图像语义检索,扩展多模态RAG应用。项目说明:https://aws.amazon.com/blogs/machine-learning/video-and-image-search-in-amazon-bedrock-knowledge-base-using-marengo-3-0/[5]

Vercel Sandbox覆盖全部计算区域

Vercel Sandbox现已覆盖【所有计算区域】,支持项目默认区域和故障转移区域,有助于降低代理延迟并满足数据驻留需求。来源:https://x.com/rauchg/status/2098158541932794222[7]

Fireworks开放GLM-5.3专用训练服务

Fireworks宣布GLM-5.3可通过Dedicated Training API和Managed Training训练,面向复杂编码与长周期代理任务。来源:https://x.com/FireworksAI_HQ/status/2098148084643774712[9]

技巧教程

SageMaker推出前缀感知路由降低LLM延迟

AWS介绍【前缀感知路由】,通过识别固定上下文并复用缓存,降低RAG和多轮对话的推理延迟。教程:https://aws.amazon.com/blogs/machine-learning/reduce-llm-latency-with-prefix-aware-routing-on-amazon-sagemaker-inference/[6]