本期重点包括OvisOCR2轻量文档解析模型发布、Colibri流式技术降低显存门槛、Seedream 5.0 Pro精细图像编辑能力展示,以及Codex产品迭代。同时微软CEO提出企业AI“反向信息悖论”,社区热议20GB VRAM下模型选型。

模型动态

OvisOCR2发布:0.8B参数本地文档解析模型

端到端OCR模型OvisOCR2仅0.8B参数,可将文档页面直接转换为结构化Markdown,为本地文档解析提供轻量级方案。链接:https://www.reddit.com/r/LocalLLaMA/comments/1uv88co/ovisocr2_a_promising_08b_local_document_parser/[1]

产品工具

Codex快速迭代,弱化Work与Codex区别

Codex正在弱化Work和Codex的区别,下一步预计优化ChatGPT交互,同时Codex生成的产品介绍视频效果清晰。[4][5]

Seedream 5.0 Pro精细图像编辑能力展示

Seedream 5.0 Pro支持精准的图像局部编辑,区域颜色完美融合不溢出,结合模型与产品交互能力。教程详细讲解了在Lumion中的玩法。链接:https://x.com/op7418/status/2076605296416530647[6]

技巧教程

开发者成功在Godot中直接运行Gemma 4模型

仅使用GDScriptVulkan计算着色器,在Godot游戏引擎中直接运行Gemma 4,展示了本地AI部署的创新实践。链接:https://www.reddit.com/r/LocalLLaMA/comments/1uv66by/i_got_gemma_4_running_directly_inside_godot_using/[3]

社区经验:20GB VRAM下Qwen3.6 35B A3B模型选型讨论

用户在20GB VRAM+64GB DDR5配置下讨论Qwen3.6 35B A3B是否仍是最优选择,为本地部署硬件选型提供参考。链接:https://www.reddit.com/r/LocalLLaMA/comments/1uv7cf5/20gb_vram_64gb_ddr5_qwen36_35b_a3b_still_the_best/[9]

硬件动态

Colibri流式技术移植Hy3,10GB VRAM即可运行

Colibri流式技术被移植到Hy3模型,使模型可在10GB VRAM上运行,大幅降低硬件门槛,推动本地AI应用普及。链接:https://www.reddit.com/r/LocalLLaMA/comments/1uv8orn/colibri_streaming_for_hy3_run_hy3_on_10gb_vram/[2]

行业资讯

微软CEO纳德拉提出企业AI“反向信息悖论”

企业支付费用调用AI的同时也献出内部知识,纳德拉称这是“为智能支付两次”,第二笔成本难以量化但包含企业核心经验。[7]

提示工程论文“Verbalized Sampling”被ICML接收

论文提出通过简单提示修改即可提升LLM采样多样性,已被ICML接收,具有实用价值。链接:https://www.reddit.com/r/MachineLearning/comments/1uv1xb3/promptengineering_paper_accepted_to_icml_r/[8]