本期重点关注小米MiMo V2.5模型发布、本地VLM基准测试结果,以及多个实用工具如Harbor v0.5.0Aionforge Memory。此外,Google推出vibe coding官方课程,社区分享Deepseek本地运行经验。

模型动态

小米发布MiMo V2.5模型,推理速度达1000-3000tps

小米推出MiMo V2.5,使用DFlash & Persistent kernel实现高速推理,并承诺即将开源。对AI从业者具有重要价值。[1]

2026年6月本地VLM基准测试结果发布

Reddit社区发布最新本地VLM基准测试,系统比较各模型性能,为选择本地视觉模型提供参考。[2]

产品工具

Harbor v0.5.0发布:一键启动多种本地推理后端

Harbor v0.5.0支持【一键启动】MLX、OMLX、llama.cpp等后端,自动连接Open WebUI等前端,简化本地部署。[3]

Aionforge Memory:基于Rust的Agent长期记忆层

推出Aionforge Memory,支持事件、事实、技能等多类型存储与检索,为Agent提供持久记忆能力。项目地址:https://www.reddit.com/r/LocalLLaMA/comments/1u5oyzl/aionforge_memory_long_term_agent_memory/[4]

技巧教程

Google推出5天Vibe Coding Kaggle课程,Zara Zhang分享演讲

Google推出5天Kaggle课程教授用自然语言构建Agent系统;同时Zara Zhang分享45分钟vibe coding演讲,涵盖产品构思与交互技巧。课程注册:https://t.co/0rbBE7cjmv[5][6]

Mac M3 Max成功运行Deepseek 4 flash

M3 Max 96GBMac上成功运行Deepseek 4 flash,并分享具体SSD流式参数设置方法。[8]

社区分享基于Qwen3.5的实时语音聊天机器人构建经验

用户构建基于Qwen3.5-397B、Whisper等的实时语音聊天机器人,支持中断和上下文保持,提供实用参考。[9]

硬件动态

双DGX Spark运行Deepseek V4 Flash基准测试

公布双DGX Spark运行Deepseek V4 Flash的详细测试结果:单节点40tk/s,聚合350 tk/s。[7]