OpenAI OpenAI预告具备关键网络安全能力的Astra模型 OpenAI预告发布Astra,其网络安全能力达到Preparedness Framework的【Critical阈值】,并同步披露安全评估与防护措施。详情:https://t.co/OrrTgdU90K[1][1]
Zhipu GLM Coding Plan一周年为订阅用户发放额度重置卡 GLM Coding Plan迎来一周年,现有订阅用户可领取Reset Card,同时补充每周和5小时额度。个人版:https://t.co/TGZjzCwjo9;团队版:https://t.co/jiXCgh9HUR[2]
MiniMax MiniMax基于H3推出开放实时交互视频基线 MiniMax展示基于vLLM-Omni、FastH3和英伟达硬件的实时视频方案,相关组件全部公开,推动【交互式视频】进一步改进。详情:https://x.com/MiniMax_AI/status/2094926136333787512[3][4]
Devin Fusion用不同模型分工降低代码代理成本 Cognition推出Devin Fusion,让前沿模型负责规划、低成本模型负责执行;其编码任务超过95% Token为缓存,Fable 5.1缓存价格降至四分之一。[5][6]
Databricks分享一小时定位百万美元AI代理浪费的方法 Databricks案例显示,通过代理使用监控与成本分析,团队一小时发现并消除每年约100万美元的浪费,适合大规模部署AI Agent的团队参考。详情:https://www.databricks.com/blog/how-we-eliminated-1-million-year-wasted-ai-agent-spend-one-hour[7]
BenchMIRT追问大模型基准测试究竟测量了什么 Hugging Face发布BenchMIRT,研究LLM基准的测量对象、有效性与可解释性,帮助读者更准确理解模型排名。项目地址:https://huggingface.co/blog/allenai/benchmirt[8]