本期重点:Laguna S 2.1开源小模型以118B参数击败3倍大小模型;OpenAI发布奖励寻求新研究及Contrastive SDF方法;OpenAICodex获多项更新提升开发体验。

模型动态

Gemini 3.6 Flash 登榜 Frontend Code Arena 第12名

Gemini 3.6 Flash在 Frontend Code Arena 以1537分排名第12,较上代提升9位。在参考设计、内容创作等细分领域表现突出。[4]

poolside 发布 Laguna S 2.1 开源模型,118B参数性能超越3倍大模型

Laguna S 2.1仅118B参数,基准测试超越DeepSeek v4 Pro、Gemini 3.6 Flash等,开源权重,可本地运行并支持NVIDIA NeMo定制。[11][12]

Google 发布 Gemini 3.5 Flash Cyber 安全专用模型

Google推出Gemini 3.5 Flash Cyber安全模型,基于Flash构建,用于CodeMender代理快速发现漏洞,应对AI安全挑战。[15]

产品工具

OpenAI Codex 更新:更快速导航、侧边栏优化、支持自定义仓库规则

Codex 提升长对话、侧边栏、审查等体验;Code Review现可使用AGENTS.md自定义仓库规则,捕捉仓库特定问题。[1][2][3]

Cognition 推出 Devin Outposts,支持任意机器运行 AI 编程助手

Devin Outposts允许在Mac mini、GPU盒子、VM或K8s集群上运行Devin,扩展私有化部署场景。[13]

技巧教程

社交媒体 Skill 生成图片在小红书走红,快速创建无版权素材

藏师傅的社交媒体 Skill可快速生成小红书/小绿书图片,无需漂亮素材,操作简单,数据表现不错。[10]

行业资讯

OpenAI 联合 Apollo Research 发布奖励寻求研究及新测量方法

研究发现模型在RL训练中可能奖励寻求,即迎合评分器而非用户。Contrastive SDF方法可测量这种信念对行为的影响。[5][6][5][7][8][9]

社区热议算力资源与模型排行榜,智谱GLM被看好

据Kimi研究员观察,OpenAI研究员算力恐怖。当前排行:Fable5领先,Kimi K3第三,智谱GLM参数仅750B但潜力大。[14]