本期热点包括Kimi K3本地部署实测达到20 tok/s、Google推出Gemini蒸馏服务、DeepSeek V4 Flash在AMD上突破32 tok/s,以及多款实用工具和教程发布。

模型动态

Muse Spark 1.1重塑成本-性能Pareto前沿,打破Vision Arena记录

Meta的Muse Spark 1.1在Document和Vision Arena中大幅提升排名,Vision得分1283,重新定义了成本与性能的平衡点。[8][9]

产品工具

用户实测用80张5090跑Kimi K3,速度达20 tok/s

开发者用80张RTX 5090部署Kimi K3,推理速度约20 tok/s,表明该模型已可在本地集群运行。链接:https://x.com/op7418/status/2082061698790437437[1]

Google推出Gemini蒸馏服务,支持将大模型知识蒸馏到小模型

Google发布Gemini蒸馏服务Beta,允许用户利用Gemini大模型蒸馏出更小、更高效的模型,降低部署成本。链接:https://www.reddit.com/r/LocalLLaMA/comments/1v911as/gemini_distillation_service/[4]

Agent Mini:约3k行Python的本地优先AI agent框架

开源项目Agent Mini发布,代码仅约3000行,本地优先、易于阅读和扩展,适合开发者快速理解和定制AI agent。项目地址:https://www.reddit.com/r/MachineLearning/comments/1v9131l/agent_mini_a_minimal_localfirst_ai_agent_you_can/[6]

技巧教程

Hugging Face推出Training Agents 3直播:用强化学习训练本地agent

Hugging Face举办《Training Agents 3》直播,讲解如何用强化学习训练本地/开放权重的agent,适合开发者进阶学习。链接:https://x.com/huggingface/status/2082122787880333596[2][2]

Weaviate发布教程:用Gemini嵌入检索音频内容

Weaviate推出笔记本示例,展示如何用Gemini Embedding 2直接嵌入并检索音频文件,无需先转文字,实用音频RAG教程。链接:https://x.com/weaviate_io/status/2082118911776948673[3]

llama.cpp添加DSpark推测解码PR,可进一步提升推理速度

llama.cpp新增DSpark推测解码PR,通过投机解码加速推理,对本地部署用户是重要性能优化更新。链接:https://www.reddit.com/r/LocalLLaMA/comments/1v8w91b/spec_add_dspark_speculative_decoding_by_wjinxu/[7]

硬件动态

DeepSeek V4 Flash在AMD Ryzen AI MAX+ 395上达32 tok/s

DeepSeek V4 Flash在AMD Ryzen AI MAX+ 395处理器上实现高达32 tok/s的推理速度,成为本地大模型推理性能新标杆。链接:https://www.reddit.com/r/LocalLLaMA/comments/1v9100b/deepseek_v4_flash_up_to_32_toks_on_amd_ryzen_ai/[5]