DeepSeek DeepSeek V4系列正式发布:1.6万亿参数、MIT许可证、百万上下文 DeepSeek V4正式发布,包含V4 Pro与V4 Flash版本,支持百万上下文,MIT许可证,性价比突出。已在LM Studio等平台获得支持。[1]
张量积注意力(TPA)论文提出,旨在降低长上下文推理内存开销 新论文提出张量积注意力(TPA),通过张量分解降低推理时KV缓存的内存开销,旨在支持更长序列建模。论文链接:https://www.reddit.com/r/LocalLLaMA/comments/1svsdk2/tensor_product_attention_is_all_you_need/[9]
AutoMuon:一行代码将Muon优化器替换AdamW 开源Python包AutoMuon发布,可作为AdamW的即插即用替代品,适用于任意PyTorch训练流程。项目地址:https://www.reddit.com/r/LocalLLaMA/comments/1svw9s1/introducing_automuon_a_one_line_drop_in_for_adamw/[3][4]
Claude 将14本商业书籍转化为Claude Code技能,根据问题自动触发 开发者将14本商业书籍转化为【Claude Code技能】,可【根据问题自动触发】相关知识,解决模型仅了解表面内容的问题。[5]
Claude Claude Code Action安全加固:针对提示注入CVE的YAML配置方案 针对2026年4月披露的Claude Code Action提示注入CVE,提供了具体的YAML安全加固方案,对开发者有重要参考价值。[7]