本期重点关注Agent模型实测与【企业级AI基础设施】进展:GLM-5.3-Flash在真实任务竞技场中以较低成本提升开源模型竞争力,Fireworks则开放模型专门化训练与强化学习平台。

模型动态

GLM-5.3-Flash进入Agent Arena并刷新性价比前沿

GLM-5.3-Flash基于9000+次真实Agent会话排名开源模型第4,单任务中位成本仅0.12美元,净提升4.6%。详情:https://x.com/arena/status/2094440382440611935[1]

产品工具

Fireworks开放Training API与Fireworks Lab用于模型专门化训练

Fireworks将Training APIFireworks Lab向企业开放,支持针对组织需求进行模型专门化训练,服务定制化AI部署。https://x.com/FireworksAI_HQ/status/2094448443548975596[3]

Fireworks推出面向大规模强化学习的一体化平台

Fireworks宣传新平台打通【训练、采样、服务、再训练】流程,并针对RL场景优化吞吐与权重同步。https://x.com/FireworksAI_HQ/status/2094448449362301322[4][5]

技巧教程

实测总结Qwen小模型Agent与代码任务的推理配置

实测推荐Qwen3.8-27B-UD-Q4_K_XL运行Agent时将reasoning_effort设为low,代码任务调至medium/high;Mac用户优先使用MLX。https://x.com/karminski3/status/2094341123124985991[2]

社区实测单张RTX 6000 Pro运行Qwen3.8-Next-Flash

用户报告通过优化后的SGLang在单张RTX 6000 Pro上实现最高240 tokens/s,展示本地推理吞吐与GPU利用率优化空间。https://www.reddit.com/r/LocalLLaMA/comments/1w39ojn/qwen38nextflash_up_to_240ts_on_single_rtx_6000_pro/[8]

行业资讯

Cloudflare发布Adaptive Intelligence应对复杂机器人攻击

Cloudflare推出Adaptive Intelligence,通过提高专业化机器人攻击成本,针对商业化攻击服务与复杂自动化威胁强化防护。https://blog.cloudflare.com/introducing-adaptive-intelligence/[6]

滑动窗口注意力结合attention sinks降低长上下文成本

一篇论文提出用【滑动窗口注意力】结合attention sinks替代二次复杂度注意力,且无需后训练,或可降低长上下文推理内存。https://www.reddit.com/r/LocalLLaMA/comments/1w3eznk/slidingwindow_beats_linear_attention/[7]