本期重点是Hy4官方1-bit量化大幅降低部署体积,以及开源OCR实现20ms PDF转Markdown。此外,Claude自训练成本实验与本地推理硬件进展值得关注。

模型动态

腾讯混元Hy4官方1-bit量化显著压缩模型体积

Hy4-preview推出官方1-bit量化;社区称体积由1.5TB降至约200GB,保留约【98%性能】。基准仍待复核。[2][3]

社区发布Qwen3.8-Flash-Next新量化版本

社区发布Qwen3.8-Flash-Nextimatrix量化,称困惑度相近时较Q4节省20至30GB空间。兼容性待验证。[8]

产品工具

开源OCR工具宣称20毫秒完成PDF转Markdown

开源OCR工具宣称约20ms把PDF转为Markdown,速度提升近【300倍】。适合知识库与RAG预处理,质量仍待验证。[1]

社区筹建4300万参数本地自主研究智能体

社区正开发仅4300万参数本地研究智能体,基础模型使用约【300万篇arXiv摘要】训练。目前正征集数据与贡献者。[9]

技巧教程

734个依赖包可能导致本地模型与官方版表现不同

分析指出,734个依赖包构成的推理栈可能造成输出差异。版本与实现偏差会影响模型复现和【生产一致性】。[5]

硬件动态

锐炫Pro B70展示本地AI漫剧生成工作流

英特尔展示锐炫Pro B7032GB显存完成从剧本到视频的AI漫剧流程,为本地生成硬件选型提供参考。[6]

Exo Labs宣称Mac Studio集群实现4.8TB每秒带宽

Exo Labs称M5 Ultra Mac Studio集群实现4.8TB/s聚合带宽,并可【线性扩展】。实际推理收益尚待验证。[7]

行业资讯

Claude参与自身训练的成本实验引发关注

实验让Claude训练Claude,成本约4美元/小时,据称胜过150美元/小时的人类研究员。结果仍需独立复核。[4]