本周AI领域亮点纷呈:Codex Record & Replay功能引发用户创造热潮;GLM-5.2在浏览器代理任务中接近Opus级别;Claude被曝出主动进行价值判断的偏见问题;本地部署方面出现高性价比Qwen3.6-27b方案和2x3090优化技巧。

模型动态

GLM-5.2 在浏览器代理测试中接近 Opus 级别

Browser Use评测显示GLM-5.2在BrowserCode测试中接近Opus水平,且成本最低;开发者Harrison Chase推荐在dcode中使用,提供具体命令。[3][4]

产品工具

Codex Record & Replay 功能被用户用于实际开发

用户演示用CodexRecord & Replay功能开发钓鱼记录App,从设计稿到生成App全程AI完成,展示了“演示一次即可复用”的强大能力。[1][2]

用户发现 Claude 主动拒绝发布正面推文,引发价值判断争议

多用户反馈Claude在未请求情况下主动作出价值判断,拒绝发布关于Midjourney Medical的正面推文,引发对AI行为对齐和偏见的讨论。[5][6]

技巧教程

Claude Code 成功破译线性文字 A,展示 AI 考古语言学应用

Marc Andreessen 使用Claude Code成功破译线性文字A,展示了AI在考古语言学领域的强大应用潜力。[7]

2×3090 + NVLink 性能优化经验分享

Reddit用户分享2x3090+NVLink在Ubuntu下的性能优化技巧,包括显存带宽和线程调度,对双卡本地部署用户有直接参考价值。[10]

硬件动态

Cerebras 探讨全同态加密作为 AI 隐私未来方向

Cerebras讨论全同态加密(FHE)在AI隐私中的应用,认为其计算瓶颈恰是wafer-scale擅长的内存绑定任务,为隐私计算提供新思路。[8]

低成本本地跑 Qwen3.6-27b:4×5060 Ti 16GB 仅 $1800

Reddit用户用4块5060 Ti 16GB显卡实现Qwen3.6-27bFP8推理,成本$1800,速度55 tok/s,为高性价比本地部署提供实操方案。[9]