Gemma Google Gemma 4 12B 开源模型详细架构发布,可在笔记本本地运行 采用Unified无编码器架构,直接处理文字/图像/音频/视频四种输入,16GB显存可跑,4-bit量化低至8GB,支持256K上下文和140+语言,内置Thinking模式与Function Calling。同时mistral.rs推理引擎已支持该模型的多模态、Agentic和MTP集成。[1][2]
NVIDIA NVIDIA 发布 Nemotron-3-Ultra-550B 超大开源模型 采用LatentMoE架构,55B活跃参数,支持1M上下文窗口和多Token预测,是当前最大开源模型之一,需大量GPU。项目地址:https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16[3]
胡彦斌 AI 开发 APP 上线,展示低代码应用潜力 歌手胡彦斌推出的AI开发APP码上飞正式上架,完成度极高,展示了AI降低应用开发门槛的趋势。开发者可快速构建应用,对想体验AI编程的用户有参考价值。[4]
Transformer 多种注意力机制实现代码仓库开源 GitHub仓库汇集了各种Transformer注意力机制的实现,可用于SLM实验和视觉编码器。对研究者和实践者具有参考价值。项目地址:https://www.reddit.com/r/MachineLearning/comments/1twhhnq/[7]
MiniMax MiniMax M3 实测:强规划能力适合 Agent 框架,需注意约束编排 用户测试显示,M3在复杂前端、后端Agentic Coding中表现出色,规划能力极强,但复杂需求需迭代,prompt编排需精细,建议搭配plan模式Agent框架使用,可单次推理达64k token。[5]
Cerebras Cerebras 谈推理新芯片范式:共置内存避免昂贵数据传输 Cerebras引用《The Hardware Lottery》作者观点,认为推理需求正在推动新的芯片范式——将内存与计算共置,可大幅减少昂贵的内存传输成本,这是晶圆级芯片设计的核心优势。[9]
互联网机器人流量首次超过人类,占比57.5% Cloudflare Radar数据显示,过去一周全球HTML请求中57.5%来自机器人,人类仅占42.5%。JSON格式流量占33.1%排第一,互联网主体已从“人看网页”转向【机器对机器通信】。[6]
HuggingFace Hugging Face 发布 Nemotron 预训练的任务种子合成 Q&A 方法 博客介绍了Task-Seeded Synthetic Q&A Generation方法,为数据合成和预训练研究提供了新思路,对提升模型训练数据质量有重要参考价值。链接:https://huggingface.co/blog/nvidia/task-seeded-sdg[8]