社区讨论训练约94亿参数稠密模型
开发者计划训练约9.4B稠密模型,引入Engram、AttnRes及RoPE/NoPE分层设计,目前仍在征集社区需求,尚未正式发布。详情:https://www.reddit.com/r/LocalLLaMA/comments/1wezm58/is_there_still_strong_interest_in_a_dense_9b_model/[6]
本期重点关注DeepSeek语音对话灰度测试、Cognition巨额融资以及【优必选人形机器人量产】。此外,社区曝出huggingface_hub遥测争议,本地模型开发者需留意隐私与供应链风险。