社区热议Fable 5越狱事件和出口管制,同时Qwable-v1蒸馏开源权重发布,对开源模型发展意义重大。vLLM新增Qwen3+流式解析器修复关键问题,HalBench基准测试显示Qwen3.6Gemma4表现突出。

模型动态

从Claude Fable 5蒸馏的开源模型Qwable-v1发布

Reddit发布Qwable-v1,从因出口管制暂停的顶级模型Claude Fable 5中蒸馏出开源权重,对社区研究和复现前沿能力意义重大。[1]

HalBench测试29个开源模型,Qwen3.6和Gemma4表现突出

HalBench发布针对谄媚和幻觉的基准测试,在29个开源模型中Qwen3.6Gemma4表现远超其参数规模,为模型选择提供参考。[6]

Nex2 mini Phase Twin:16GB内存运行30B模型

新模型Nex2 mini Phase Twin发布,仅需16GB内存即可运行30B参数,针对Intel A770等低显存显卡优化,适合本地部署。[7]

产品工具

vLLM新增Qwen3+流式解析器,修复关键问题

vLLM在nightly版本中新增Qwen3+流式解析器,解决了中途停止和工具调用失败问题,对使用Qwen3进行Agent开发的用户是重要更新。[5]

Browser Use v4展示GeoGuessr地理定位能力

Browser Use v4在GeoGuessr场景中通过分析3D视图和环境线索精确判断位置,展示了智能体在图像推理和定位方面的显著进步。体验地址:https://t.co/zCAgZoIxwM[8][9]

OpenAI发布Codex开发者插件

OpenAI Developers推出Codex插件,帮助开发者设置API密钥、查找文档和调试,提升基于OpenAI工具的开发效率。[10]

技巧教程

阿里云实践:Harness工程化框架提升AI稳定性

阿里云开发者分享通过Harness框架进行AI Coding工程化实践,提供分层结构、评测方法和踩坑经验,对提升【AI工作流稳定性】有实用价值。[11]

行业资讯

Simon Willison评论Fable越狱事件,质疑出口管制合理性

Simon Willison指出Fable越狱本质只是'修复代码',对因此关闭模型和出口管制表示失望。引用The Atlantic报道Anthropic与白宫合作,持续引发安全与管制讨论。[2][3][4]