Qwen Qwen3.8-Flash-Next实现手机与多GPU本地运行 社区称该模型在4张R9700上达80至120 tokens/s,并在中端安卓手机上以约3.5 tokens/s运行80GB量化模型。https://www.reddit.com/r/LocalLLaMA/comments/1w2my8q/qwen38flashnext_turns_4xr9700_into_a_local_ai/[3][4]
HFlow评测开放权重视觉语言模型处理第一视角数据 研究者使用HFlow和Egocentric-10k,统一提示词对比开放权重VLM与Gemini 2.5 Flash,关注手部可见性和主动操作识别。https://www.reddit.com/r/LocalLLaMA/comments/1w2r6v8/we_used_hflow_to_evaluate_the_latest_open_weights/[5]
KernelAI展示iPhone 16本地处理52页文档 KernelAI在iPhone 16上运行Arctic Embed与Bonsai 8B,完成52页文档抽取,展示移动端本地文档理解能力。https://www.reddit.com/r/LocalLLaMA/comments/1w2qe1t/demo_of_local_document_extraction_52_pages_using/[6]
OpenAI Codex发布rust-v0.152.0-alpha.4 Codex发布rust-v0.152.0-alpha.4版本更新,属于近期连续迭代的一部分。版本地址:https://github.com/openai/codex/releases/tag/rust-v0.152.0-alpha.4[7]
Meta LocalLLaMA用户寻找OpenWork替代方案 用户希望用自有API密钥运行类似Claude CoWork的工作流,并反馈OpenWork存在连接失败和订阅提示,反映自托管Agent的稳定性需求。https://www.reddit.com/r/LocalLLaMA/comments/1w2o21p/alternative_to_openwork/[8]