Muse Spark 1.1重塑成本-性能Pareto前沿,打破Vision Arena记录 Meta的Muse Spark 1.1在Document和Vision Arena中大幅提升排名,Vision得分1283,重新定义了成本与性能的平衡点。[8][9]
Kimi 用户实测用80张5090跑Kimi K3,速度达20 tok/s 开发者用80张RTX 5090部署Kimi K3,推理速度约20 tok/s,表明该模型已可在本地集群运行。链接:https://x.com/op7418/status/2082061698790437437[1]
Gemini Google推出Gemini蒸馏服务,支持将大模型知识蒸馏到小模型 Google发布Gemini蒸馏服务Beta,允许用户利用Gemini大模型蒸馏出更小、更高效的模型,降低部署成本。链接:https://www.reddit.com/r/LocalLLaMA/comments/1v911as/gemini_distillation_service/[4]
Agent Mini:约3k行Python的本地优先AI agent框架 开源项目Agent Mini发布,代码仅约3000行,本地优先、易于阅读和扩展,适合开发者快速理解和定制AI agent。项目地址:https://www.reddit.com/r/MachineLearning/comments/1v9131l/agent_mini_a_minimal_localfirst_ai_agent_you_can/[6]
HuggingFace Hugging Face推出Training Agents 3直播:用强化学习训练本地agent Hugging Face举办《Training Agents 3》直播,讲解如何用强化学习训练本地/开放权重的agent,适合开发者进阶学习。链接:https://x.com/huggingface/status/2082122787880333596[2][2]
Gemini Weaviate发布教程:用Gemini嵌入检索音频内容 Weaviate推出笔记本示例,展示如何用Gemini Embedding 2直接嵌入并检索音频文件,无需先转文字,实用音频RAG教程。链接:https://x.com/weaviate_io/status/2082118911776948673[3]
Meta llama.cpp添加DSpark推测解码PR,可进一步提升推理速度 llama.cpp新增DSpark推测解码PR,通过投机解码加速推理,对本地部署用户是重要性能优化更新。链接:https://www.reddit.com/r/LocalLLaMA/comments/1v8w91b/spec_add_dspark_speculative_decoding_by_wjinxu/[7]
DeepSeek DeepSeek V4 Flash在AMD Ryzen AI MAX+ 395上达32 tok/s DeepSeek V4 Flash在AMD Ryzen AI MAX+ 395处理器上实现高达32 tok/s的推理速度,成为本地大模型推理性能新标杆。链接:https://www.reddit.com/r/LocalLLaMA/comments/1v9100b/deepseek_v4_flash_up_to_32_toks_on_amd_ryzen_ai/[5]