本期重点聚焦【AI视频专业交付】、办公产品整合本地Agent部署。同时,ToMoE架构转换和DeepSeek Harness规模化实践为模型推理与工程落地提供了新参考。

模型动态

ToMoE提出将稠密模型转换为混合专家架构

ToMoE通过【动态结构化剪枝】把稠密大模型转换为MoE,目标是降低推理计算与内存开销。论文:https://www.reddit.com/r/LocalLLaMA/comments/1vx3img/paper_tomoe_converting_dense_large_language/[4]

TielCoder量化版在社区编码测试中表现突出

社区称22GB四比特量化TielCoder接近Opus 4.6中等配置,并在MoE编码模型中兼顾【速度与正确性】。测试:https://www.reddit.com/r/LocalLLaMA/comments/1vx33zj/tielcoders_22_gb_4bit_quant_matches_opus46_medium/[6]

产品工具

Runway推出Ruby,将生成视频转换为专业制作格式

Runway的Ruby可将任意模型生成内容转换为16位EXR、ProRes、HEVC等交付格式,打通AI视频后期流程。详情:https://x.com/runwayml/status/2091872521318814183[1]

AWS推出AI元数据自动修正与统一方案

AWS介绍利用AI自动完成元数据纠错标准化,缓解数据规模增长带来的治理瓶颈,面向数据工程和AI应用建设。详情:https://aws.amazon.com/blogs/machine-learning/ai-powered-metadata-correction-and-harmonization/[7]

技巧教程

腾讯总结DeepSeek Harness规模化运行中的工程踩坑

腾讯复盘Harness在Agent生产部署中的【耗时】、Token成本、失败定位与轨迹观测问题,并介绍日志服务解决方案。文章:https://mp.weixin.qq.com/s?__biz=MjM5ODYwMjI2MA==&mid=2649803822&idx=1&sn=82b4c1b6735d5757e5e0a3288312c73e[3]

实测12GB显存运行本地Agent编码工作流

社区展示在12GB显存设备上运行量化Qwen 3.8 27B,并接入Hermes Agent与OpenCode完成本地编码。详情:https://www.reddit.com/r/LocalLLaMA/comments/1vx2pk7/real_local_agentic_coding_on_a_12gb_vram_budget/[5]

行业资讯

字节整合TRAE与扣子,统一纳入豆包工作体系

字节将TRAE扣子团队并入豆包,计划推出统一办公品牌豆包工作;TRAE IDE与CLI继续发展为编程产品线。详情:https://x.com/xiaohu/status/2091806178728636491[2]