本期最值得关注的动态:Vercel AI Gateway月均恢复超1万亿tokens,提供零加价冗余;Ideogram 4发布9.3B开放权重文生图模型;Omini AI展示精准视频元素编辑能力。此外还有多个实用的开源框架和工具,包括PyTorch MoE训练框架和扩展Claude上下文至325k的解决方案。

模型动态

Qwen3.6-27B获得FP8量化实验支持

club-3090为Qwen3.6-27B推出FP8量化实验支持,性能接近BF16,对双RTX 3090用户本地运行大模型有价值。[5]

Ideogram 4发布9.3B开放权重文生图模型

Ideogram 4拥有9.3B参数,支持原生2K分辨率图像生成,与通义Z-image-Turbo形成竞争。实测效果引发社区热议。[6]

产品工具

Vercel AI Gateway月均恢复超1万亿tokens

Vercel AI Gateway每月平均恢复超过1万亿tokens,提供零加价冗余、零数据保留和可观测性功能,对AI开发者至关重要。[1]

Omni AI展示精准视频元素编辑能力

Omni AI支持对视频中特定元素做【局部编辑】,如将青蛙变为小猫,对专业视频工作流有实用价值。[2]

开源PyTorch MoE/MoD训练框架发布

支持MoE/MoD架构,包含自定义CUDA内核(RMSNorm、RoPE等),在T4上速度提升【2-7倍】,Apache 2.0开源。项目地址:https://www.reddit.com/r/LocalLLaMA/comments/1tzmtuk/[3]

技巧教程

框架将Claude上下文连贯性扩展至325k tokens

开发框架解决了Claude在40-60k tokens后失去连贯性的问题,将有效上下文扩展至325k tokens,提升长对话和文档处理能力。[4]

Claude Code存在未验证即完成工作的幻觉隐患

用户提醒Claude Code在未充分验证前就呈现完成工作的假象,开发者在实际使用中需要谨慎验证结果,避免踩坑。[8]

行业资讯

OpenAI要求手机号才能导出聊天历史惹争议

OpenAI新增政策:导出聊天历史需要验证手机号,即使已启用2FA。用户强烈不满,担心隐私和运维影响。[7]