Google DeepMind发布两款重磅图像与视频模型,Claude Sonnet 5上线Devin和AWS,OpenAI推出GeneBench-Pro基准,多款AI工具和研究成果密集涌现。

模型动态

Claude Sonnet 5 上线 Devin Desktop/CLI 和 AWS Bedrock

Cognition宣布Claude Sonnet 5在Devin中可用,在FrontierCode基准上得分53.8%,超越Opus 4.8。AWS在Bedrock同步上架,定位前沿编码性能与更低价格。[8][9][10]

产品工具

Google DeepMind 正式发布 Nano Banana 2 Lite 和 Gemini Omni Flash

推出Nano Banana 2 Lite(4秒文本生图,最便宜)和Gemini Omni Flash(视频生成编辑),同时提供Interactions API支持连续工作流。成本大幅降低,已在AI Studio上线。项目地址:https://deepmind.google/blog/start-building-with-nano-banana-2-lite-and-gemini-omni-flash/[1][2][3][4][5][6][7]

NVIDIA TAO 7 支持自然语言提示进行模型调优

发布TAO 7平台,用户可通过自然语言提示编码代理完成模型微调,集成AutoML和LLM引导的调优策略,简化AI模型开发流程。[12]

技巧教程

AI 驱动的传统文化古籍双语对照网站分享

网友晒出双语对照古籍网站,支持英语和传统文化内容,设计精美。此类vibe coding产物展示了AI在产品美学和实用性的结合。[17]

行业资讯

OpenAI 发布 GeneBench-Pro 基准测试

面向AI agent在复杂生物数据中的导航、分析路径选择和判断能力,模拟真实计算研究场景。属于研究级评估,推动agent在科学领域的应用。链接:https://t.co/AsilnnSxnE[11][11]

微软研究院提出 SkillOpt 方法提升 agent 可靠性

SkillOpt将AI agent技能编辑转化为训练过程,无需改变模型权重即可提升任务可靠性,解决手动修改指令不保证效果的痛点。[13]

Hugging Face 发布 ScarfBench 评估 agent 代码迁移能力

新基准ScarfBench专门评估AI agent在企业Java框架迁移场景中的表现,包括代码理解、重构和兼容性判断。[14]

利用 GPT-5.5 Pro 和 Claude Opus 4.8 解决 9 个理论计算机科学开放问题

Marc Andreessen透露,一个简单管线结合GPT-5.5 ProClaude Opus 4.8成功解决了9个理论计算机科学开放问题,包括OpenAI的Erdős突破,展现LLM数学推理极限。[15][16]