今日速览:谷歌发布Gemma 4技术报告,NVIDIA推出Nemotron-Puzzle-75B新模型;政策端传来北京拟限制海外访问中国AI模型消息,同时中国AI模型因成本优势在美国公司中受欢迎;DeepSeek招聘被华为天才少年吐槽引发热议;研究方面HOLA架构实现极低KV缓存突破;工具方面Koder浏览器UI编码工具发布;百度庆祝模型下载破百万

模型动态

谷歌发布Gemma 4技术报告

谷歌正式发布Gemma 4技术报告,详述新一代轻量级模型架构与训练细节,面向开源社区,推动边缘设备部署。报告链接:https://www.reddit.com/r/LocalLLaMA/comments/1uprjf3/gemma_4_technical_report/[1]

NVIDIA发布Nemotron-Labs-3-Puzzle-75B模型

NVIDIA推出Nemotron-Labs-3-Puzzle-75B模型,采用压缩框架提升推理效率,在保留75B参数容量的同时实现更优性能。模型地址:https://huggingface.co/nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-BF16[2]

HOLA架构实现极低KV缓存,线性注意力取得突破

最新研究HOLA架构在保持极低KV缓存(几乎不需要)的同时,实现了更好的困惑度,推动【线性注意力】模型走向实用。论文讨论:https://www.reddit.com/r/LocalLLaMA/comments/1uprm6c/going_full_linear_or_nearly_there_almost_no_kv/[6]

百度旗下模型下载量突破百万,将推多语言与128k上下文版本

百度官方宣布旗下某紧凑型模型下载量突破1M,团队正在根据社区反馈推进【多语言】和128k上下文版本。来源:https://x.com/Baidu_Inc/status/2074434666392916368[8]

产品工具

Koder发布浏览器UI编码工具,支持代码生成与计算机使用

新工具Koder提供基于浏览器的UI harness,支持代码生成和计算机使用,适合开发者快速上手。项目链接:https://www.reddit.com/r/LocalLLaMA/comments/1upqbqz/koder_browser_ui_based_harness_for_coding_and/[7]

行业资讯

北京拟限制海外访问中国顶级AI模型

据路透社报道,北京正在考虑限制海外访问中国顶级AI模型,此举可能影响全球AI开源生态与合作格局。来源:https://www.reddit.com/r/LocalLLaMA/comments/1uprmso/beijing_is_looking_at_curbing_overseas_access_to/[3]

中国AI模型因成本优势在美国公司中受欢迎

随着OpenAI、Anthropic等热门模型成本飙升,越来越多的美国公司开始转向中国AI模型,如Qwen、DeepSeek等,以降低部署开支。来源:https://www.reddit.com/r/LocalLLaMA/comments/1upsezw/chinese_ai_models_are_gaining_ground_with_us/[4]

DeepSeek招聘被华为天才少年公开吐槽面试不专业

一位前【华为天才少年】在社交平台公开吐槽DeepSeek面试过程“面到最不专业”,引发对AI公司招聘流程的讨论。[5]