本期重点关注飞书团队Agent落地真实协作场景,以及字节级模型蒸馏10万原子模拟等研究进展。本地推理生态同时出现【11倍性能差距】与服务商透明度争议。

模型动态

Meta研究探索蒸馏突破字节级模型性能上限

Meta研究提出字节级模型蒸馏方法,称可突破现有性能上限。对小模型训练与低成本部署有参考价值。https://www.qbitai.com/2026/09/489337.html[2]

Atria Dawn Preview面向科研与复杂Agent任务

Atria Dawn通过可验证经验管线从成功和失败中学习,并绑定Agent Harness。团队称其可离线预测天气。https://x.com/xiaohu/status/2099793077531721803[6]

产品工具

飞书与豆包推出面向企业群聊的团队共享Agent

豆包工作伙伴支持名称、人设和组织身份。用户已用其检索视频、验证钓点并生成导航地图。https://mp.weixin.qq.com/s?__biz=MzIyMzA5NjEyMA==&mid=2647686286&idx=1&sn=c5c59de969cfb02c537a88c272d7aadf[3][4][5]

jinfer为JVM提供无需Python的开源AI推理引擎

jinfer面向JVM开源,支持聊天、视觉、转写、Embedding、重排和TTS,且不依赖Python或ONNX。https://www.reddit.com/r/LocalLLaMA/comments/1wgu62z/jinfer_an_opensource_ai_inference_engine_for_the/[7]

硬件动态

相同GB300工作负载因推理引擎产生11倍性能差异

社区测试显示,相同GB300与工作负载下,服务引擎可带来【11倍】差异,软件栈显著影响吞吐和能效。https://www.reddit.com/r/LocalLLaMA/comments/1wgxuiw/same_gb300_same_workload_the_serving_engine_moved/[8]

行业资讯

分子之心用单张GPU模拟10万原子级化学反应

分子之心称单张GPU可模拟10万原子反应,兼顾规模、精度与速度。或提升药物研发效率。https://www.qbitai.com/2026/09/489381.html[1]

CrofAI被指隐瞒模型路由并高价转售推理服务

CrofAI被指包装OpenRouter、路由至更小模型并加价最高【20倍】,争议后清空线上服务。https://www.reddit.com/r/LocalLLaMA/comments/1wgwe4n/crofai_cheapest_inference_provider_in_the_world/[9]

国内上半年上线微短剧中超七成为AI生成

数据显示国内上半年上线36.7万部微短剧,其中超74%由AI生成,平均每天新增逾1500部。https://x.com/vista8/status/2099766839039713569[10]