英伟达开源模型为学术界注入新资源,谷歌Gemini的图像编辑功能大幅提升产品易用性。同时,模型架构(Bolmo)与图像生成技术(Z-Image)均在底层探索与产品应用层面取得进展,行业持续处于快速迭代与创新中。

模型动态

英伟达发布新开源模型Nemotron-3-Nano-30B-A3B

模型特点:结合Mamba-2与Transformer的MoE模型,数学能力突出,AIME25测试达89.1分。 对比优势:在数学能力上略超Qwen3-30B-A3B,并开源了完整的预训练与后训练数据集。 价值判断:为研究社区提供了高质量、可复现的模型与数据,是重要的学术资源。

新模型架构探索:Bolmo-8B采用UTF-8字节作为基本单位

技术特点:抛弃传统分词器,直接处理UTF-8字节序列,通过内置编解码器压缩为“潜在token”。 优势与局限:能精准处理字符级任务(如字母计数),但面临序列更长、显存压力大、其他任务表现不突出等挑战。 价值判断:一次有趣的技术探索,挑战了Tokenizer的固有范式,但其实际收益与泛化能力有待验证。

通义实验室更新图像生成模型Z-Image

更新内容:增加了更多控制模块、Inpaint(局部重绘)模式,并提升了细节生成质量。 价值判断:增强了模型的可控性与生成效果,是AI图像生成工具的一次实质性迭代。

行业资讯

谷歌Gemini推出图片圈选编辑新功能

功能描述:用户可在Gemini中上传图片后,直接圈选不同区域并配文描述修改要求,实现精细化图像编辑。 价值判断:显著降低了AI图像编辑的操作门槛,提升了交互直观性与创作效率。