Gemini / Google Google DeepMind 发布 Gemini 3.1 Pro 模型,推理能力大幅提升 新模型在ARC-AGI-2基准上得分77.1%,是上一代的两倍多。在Text Arena中排名第一,代码能力与Claude Opus 4.5相当。开发者现可通过Google AI Studio和API访问。[1][2][3][4][5][6][7][8][9][10]
Gemini Google 展示 Gemini 3.1 Pro 构建城市规划和空间站仪表盘应用 官方演示了用Gemini 3.1 Pro处理复杂地形、模拟交通以生成城市规划可视化,以及连接公共API构建实时空间站轨道跟踪仪表盘。项目展示了模型在复杂任务中的实际应用能力。[11][12]
ElevenLabs 推出 ElevenAgents Experiments 功能,支持 A/B 测试语音代理 新功能允许开发者运行受控A/B测试,衡量不同提示结构、工作流逻辑、声音和个性对【语音代理性能】的影响,以数据驱动方式优化真实世界表现。[13]
Langchain LangChain 发布 LangSmith for Startups 计划,提供免费信用额度 针对早期初创公司推出扶持计划,提供10,000美元LangSmith信用额度、技术交流、社区网络和产品曝光机会。旨在帮助初创团队更快迭代AI应用。申请地址:https://www.langchain.com/startups[14]
lmarena.ai 新增开源模型 Trinity Large 供评测 由美国实验室Arcee.ai开发的【开源模型Trinity Large】现已加入Text Arena,用户可提交提示词测试其性能。[17]
Langchain LangChain 分享 LangSmith Agent Builder 中利用记忆优化代理的三种方法 通过【告诉代理记住有效做法】、使用【技能】提供专门上下文、直接编辑指令等方式,利用记忆提升代理性能。详细指南:https://blog.langchain.com/how-to-use-memory-in-agent-builder/[15]
a16z 发布生成式媒体报告,指出视频模型迭代速度惊人 报告显示Seedance 1.0在2025年6月登顶,而Seedance 2.0预览版已大幅超越前代。Kling、Grok等也在快速跟进。报告全文:https://www.a16z.news/p/the-state-of-generative-media-2026[16]