本期关注NeMo Switchyard开源模型路由与【Anthropic风险报告】。开放模型生态显示小模型仍主导实际使用。

模型动态

Qwen3.8-27B单张RTX 5090达到每秒206 Token

SGLang首日适配Qwen3.8-27B,单张RTX 5090实测约206 tok/s,展示本地高吞吐潜力。[6][6]

产品工具

NVIDIA开源NeMo Switchyard模型路由库

NeMo Switchyard可为Agent不同步骤【动态选模型】。复杂推理与高频任务可分流处理。[1]

行业资讯

Anthropic发布第二份模型风险报告

报告披露系统风险及应对准备度,属于Responsible Scaling Policy。链接:https://t.co/NgWnDmXZD3[2][2]

Anthropic解释Claude文本水印实施方式

文本水印用于遵守欧盟AI法案,不增加隐藏字符、Token或费用。链接:https://t.co/G76iUOJ7Hu[3][3]

开放模型报告显示小模型仍主导实际使用

Hugging Face称小模型主导真实使用,Qwen领跑本地推理,Agent增长明显。链接:https://t.co/u2DgvjEKkH[4][5][5]