本期最值得关注的是OpenAI Codex推出Record and Replay功能可自动执行重复任务,以及Krea 2开源模型发布。此外,CUGA教程LangChain trace judge提供了实用的Agent开发与监控方案。

模型动态

Harrison Chase发布Self-Harness论文:Agent自我改进

Self-Harness使【Agent通过挖掘失败模式】改进自身harness,基于DeepAgents,对Agent自我优化有重要参考。论文:https://x.com/hwchase17/status/2069443268593537470[4]

CPU-only TTS基准测试:Kokoro 82M vs Supertonic 3 vs Inflect-Nano

对比三款CPU-only TTS模型,含UTMOS评分,Inflect-Nano仅4.6M参数表现出色。详情:https://www.reddit.com/r/LocalLLaMA/comments/1udg3rf/[5]

Qwen3.6和Gemma4的KV cache量化效果深度分析

Reddit用户绘制KLD分布图,评估不同量化级别对质量的影响,为模型部署提供关键参考。帖子:https://www.reddit.com/r/LocalLLaMA/comments/1udjvhd/[6]

Krea 2模型在Hugging Face发布

Krea 2开源模型上线,包含turbo版本,面向本地LLM社区,值得关注。模型页面:https://huggingface.co/krea-ai[7]

产品工具

OpenAI Codex推出Record and Replay自动执行功能

Codex新增Record and Replay功能,可观看屏幕学习并自动执行重复任务,极大提升自动化效率。视频演示:https://www.youtube.com/shorts/qv-KPydJhXs[1]

LangChain与FireworksAI合作构建高效trace judge

微调Qwen模型构建trace judge,用于检测生产追踪的感知错误,性能达前沿且【成本降低100倍】。详情:https://x.com/LangChain/status/2069404292801298786[3]

Weaviate Playground演示Query Agent自然语言查询

用户可输入自然语言,AI自动编写查询并流式返回数据,实现数据库与AI代理的便捷集成。演示:https://x.com/weaviate_io/status/2069435493020803392[8]

技巧教程

Hugging Face发布CUGA教程:构建真实Agent应用

CUGA教程提供24个工作示例,使用轻量级harness构建Agent应用,适合开发者入门Agent开发。项目地址:https://huggingface.co/blog/ibm-research/cuga-apps[2]