本期重点关注本地AI工具Agent评测进展:LifeOS降低个人智能体部署门槛,社区也在补足代码与网络安全能力的评测体系。

产品工具

Vercel AI Gateway接入MiniMax H3与H3 Max

Vercel AI Gateway新增MiniMax H3/H3 Max调用支持,并提供限时五折优惠,方便开发者接入视频生成模型。详情:https://x.com/rauchg/status/2094205032501776734[1]

LifeOS 0.3.0支持12GB显存端到端运行

LifeOS 0.3.0发布,成为可在12GB显存设备端到端运行的自托管个人组织工具,主要通过对话完成管理任务。详情:https://www.reddit.com/r/LocalLLaMA/comments/1w2tz9d/v030_of_lifeos_out_end_to_end_runnable_on_12gb/[2]

技巧教程

社区分享Qwen模型在llama.cpp中的双GPU分配方法

实践者分享使用--override-tensor--tensor-split调整Qwen模型张量分配的方法,适合llama.cpp多GPU部署。详情:https://www.reddit.com/r/LocalLLaMA/comments/1w2wre0/calculate_overridetensor_for_llamacpp_using_qwen/[6]

ninfer与vLLM在RTX 5090上的Qwen部署对比

社区比较ninfervLLM运行Qwen 3.8 27B的体验,重点关注NVFP4量化与超长上下文支持。详情:https://www.reddit.com/r/LocalLLaMA/comments/1w2pk15/which_is_better_ninfer_vs_vllm_for_qwen_38_27b_on/[7]

Qwen 3.8 Developer角色适配多种代码代理工具

社区讨论Qwen 3.8的Developer角色如何配合Codex、OpenCode和llama.cpp使用,可为代码智能体配置提供经验参考。详情:https://www.reddit.com/r/LocalLLaMA/comments/1w2sg6d/qwen_38_developer_role/[8]

硬件动态

NVIDIA DGX Station将数据中心级性能带到桌面

NVIDIA DGX Station主打【桌面级数据中心性能】,显存带宽约7.1TB/s,或为小型团队本地部署提供新硬件选择。详情:https://www.reddit.com/r/LocalLLaMA/comments/1w2q1ug/nvidia_dgx_station_delivering_datacenterclass/[3]

行业资讯

社区汇总编程基准并提出Agentic Coding Index

作者汇总SWE-bench Pro、Terminal-Bench等基准,提出Agentic Coding Index衡量代码代理能力与参数效率,但指标仍待验证。详情:https://www.reddit.com/r/LocalLLaMA/comments/1w2v97w/i_collected_every_single_llm_coding_benchmark_and/[4]

社区筹建大模型渗透测试能力基准

社区计划建立【LLM渗透测试基准】,认为CyberGym等现有评测覆盖不足;当前仍是提案,关注【AI智能体网络安全】能力。详情:https://www.reddit.com/r/LocalLLaMA/comments/1w2wdeq/which_llm_is_actually_best_at_pentesting_benchmark_to_find_out/[5]