llama.cpp扩展MoE融合以加速Speculative Decoding
llama.cpp提交PR,将MoE融合扩展至Speculative Decoding,目标提升不同草稿宽度下的MTP推理速度。https://www.reddit.com/r/LocalLLaMA/comments/1w3bh6f/cuda_extend_moe_fusion_to_specdec_earlier_moe_glu/[6]
本期重点集中在【AI视频交互】、本地推理优化与AI产品落地:MiniMax继续探索可持续互动视频,llama.cpp和社区则推进MoE推理效率提升。