开发者从零训练250M模型并压缩至60MB
开发者用300亿Token训练250M参数模型,量化后仅约60MB,可在普通CPU运行。详情:https://www.reddit.com/r/MachineLearning/comments/1vv2nkh/i_developed_my_own_quantized_llm_from_scratch/[4]
本期重点集中在本地推理优化与AI工具更新:llama.cpp、Gemini CLI和Codex均有版本进展,社区还分享了多卡部署与极低体积模型实践。