本期焦点是OpenAI正式发布Codex桌面应用,定位为AI代理的指挥中心。同时,Kimi K2.5在Code Arena评测中成为【排名第一的开源模型】,展现了强劲的代码能力。

模型动态

Kimi K2.5登顶Code Arena开源模型榜首

在Code Arena的智能体编码评估中,Kimi K2.5超越GLM-4.7,成为【排名第一的开源模型】,总体排名第五,与顶级专有模型表现相当。[6][6]

产品工具

OpenAI正式发布Codex桌面应用

OpenAI推出CodexmacOS桌面应用,定位为构建AI代理的指挥中心。支持多代理并行工作、创建可复用技能和设置自动化任务。Windows版本即将推出。[1][2][3][4][5][4][1][3]

ElevenLabs语音模型Eleven v3结束Alpha测试

ElevenLabs宣布其语音模型Eleven v3结束Alpha测试,正式开放商业使用。新版本提高了稳定性和准确性,在数字和符号上的错误减少了68%。[11][12]

Runway展示AI视频生成高效工作流

Runway展示其AI视频生成工作流,从单张草图开始,结合Nano Banana ProGen-4.5模型,可在数小时内完成从概念到广告影片的制作。[15]

技巧教程

GitHub发布最大化Copilot智能体能力指南

GitHub博客发布指南,指导开发者如何【最大化GitHub Copilot】的智能体能力,以应对现代工程中跨文件、跨时间演进的复杂性。博客链接:https://github.blog/ai-and-ml/github-copilot/how-to-maximize-github-copilots-agentic-capabilities/[13]

行业资讯

Google DeepMind更新Kaggle Game Arena基准测试

Google DeepMind为Kaggle Game Arena新增狼人杀、扑克和象棋挑战,旨在测试AI在现实世界情境下的沟通与决策能力。Gemini 3模型在象棋榜上领先。博客链接:https://blog.google/innovation-and-ai/models-and-research/google-deepmind/kaggle-game-arena-updates/[7][8][9][10]

Databricks提出改进LLM评估的新方法MemAlign

Databricks介绍MemAlign方法,利用人类反馈和可扩展记忆来构建更好的LLM评判者,旨在解决智能体评估的规模化挑战。博客链接:https://www.databricks.com/blog/memalign-building-better-llm-judges-human-feedback-scalable-memory[14]