GLM-Air在llama.cpp中启用MTP提升推理速度
GLM-Air现可在llama.cpp启用多令牌预测(MTP)。模型采用106B MoE架构,仅激活约12B参数。https://www.reddit.com/r/LocalLLaMA/comments/1vwhj0l/you_can_now_use_mtp_in_glmair/[4]
本期重点关注Codex语音编程的无障碍工作流,以及本地模型推理在MTP、量化和遗留系统维护中的新进展。与此同时,Codex正快速扩展至【法律、销售、招聘等非科技行业】。