本期焦点集中在Qwen 3.6的本地部署优化与Claude Skills版本兼容性问题,多位开发者分享了极限设备上的成功实践和实用工具。

产品工具

GitHub项目可让Claude转为受约束的工程师模式

推荐项目andrej-karpathy-skills,通过一个CLAUDE.md文件能使Claude从随性编码转为受约束的工程师,提升代码质量。项目地址:https://github.com/andrej-karpathy-skills[3]

torch-nvenc-compress发布:利用NVENC降低PCIe带宽压力

开源库torch-nvenc-compress利用GPU的NVENC编码单元作为PCIe带宽倍增器,实测在GEMM+编码任务中达到理论最大并行重叠的67%。项目地址:https://github.com/torch-nvenc-compress[4]

LM Studio开始支持并行API请求

社区发现LM Studio已开始支持并行API请求,对本地部署和多路推理场景有实用价值,具体实现版本待确认。[5]

技巧教程

开发者分享RTX 3090上运行Qwen 3.6全量上下文技巧

详细讲解如何在RTX 3090上以完整262K上下文运行Qwen 3.6 35B MoE,包含量化和缓存策略。出处:https://redd.it/1t2zfv0[1]

6GB显存老笔记本成功运行Qwen 3.6 35B MoE

在5年前的6GB显存笔记本上成功运行Qwen 3.6 35B MoE,速度达到约23 tokens/s,展示了极限优化成果。出处:https://redd.it/1t2zapy[2]

用户提醒:为Claude Opus 4.6编写的Skills在4.7中失效

有用户发现为Opus 4.6编写的30个Skills在4.7版本中无法工作,担忧6月15日4.6下线后受影响,对依赖特定版本的开发者有警示价值。[6]

硬件动态

开发者计划用10万美元构建本地LLM服务器

有开发者计划投入10万美元预算构建本地LLM服务器,目标是运行最佳的智能体编码模型,涉及硬件选型与目标规划。[8]

行业资讯

Deepfake巴菲特视频现身,高管警告真实网络威胁

一段Deepfake巴菲特视频出现在伯克希尔会议上,高管警告这是真实【网络威胁】,展示了AI安全领域的实际风险案例。[7]