本期重点集中在【本地推理加速】、智能体安全控制与【Agent训练基础设施】。社区还分享了具象的【Codex改造工具】案例及DeepSeek V4 Flash本地部署经验。

模型动态

DFlash 2在真实编码任务中实现最高4.68倍推测解码加速

llama.cpp实测DFlash 2在100个编码提示上加速【2.26倍】,叠加n-gram草稿器达【4.68倍】。详情:https://www.reddit.com/r/LocalLLaMA/comments/1vvncyh/i_benchmark_dflash_2_pr_build_in_llamacpp_on_qwen/[1]

产品工具

Claude Code发布v2.1.240版本

Claude Code发布v2.1.240,本次更新主要聚焦错误修复与可靠性改进。版本地址:https://github.com/anthropics/claude-code/releases/tag/v2.1.240[2]

DelveRL开源肉鸽游戏,专为训练游戏智能体设计

DelveRL同时支持人类游玩结构化API接入,可作为强化学习和游戏Agent的实验环境。项目详情:https://www.reddit.com/r/MachineLearning/comments/1vvii1j/i_built_an_opensource_roguelike_specifically_for/[3]

自主Bot引入LLM审查与人工审批机制提升运行安全

Bot可由LLM自动审查每项操作,异常时请求人工批准,并支持自定义允许或拒绝规则。可靠性仍取决于审查模型与规则执行。[5]

技巧教程

开发者用Codex将TRAE AI passport改造成背单词工具

通过【Type-C连接电脑】让Codex直接修改TRAЕ AI passport,新增中文显示和发音,实测【可玩性较好】。详情:https://x.com/vista8/status/2091210866410897886[6]

社区分享DeepSeek V4 Flash量化模型本地部署配置

128GB内存和约60GB显存、PCIe较差的设备上运行DeepSeek V4 Flash 0731量化版,并获得可接受速度。详情:https://www.reddit.com/r/LocalLLaMA/comments/1vvrcx5/3_experiments_running_dsv4flash_0731_q4_quants_on/[7]

行业资讯

研究称评估分辨率会改变类脑学习规则结论

预印本发现,评估分辨率显著影响V1表征中【最类脑学习规则】的判断,提醒研究者重视评估方法偏差。论文与代码见:https://www.reddit.com/r/MachineLearning/comments/1vvdxvt/the_evaluation_resolution_has_been_shown_to_have/[4]

Arena与Poolside讨论Laguna的长时程Agent训练方法

Poolside分享Laguna训练经验:结合预训练、后训练与25万条长时程轨迹,并用人工、Agent和证据标注评审优化训练循环。[8]