本期主要关注Cloudflare Monetization Gateway产品发布和贾扬清从英伟达离职人物动态,另有Token成本治理实用教程和多个AI开发工具更新。

产品工具

Cloudflare推出Monetization Gateway,支持通过x402协议收费

Cloudflare发布Monetization Gateway,通过HTTP x402协议对AI模型等资源实现即时计费,简化付费API部署。链接:https://blog.cloudflare.com/monetization-gateway/[1]

LangSmith助Pendoio捕获60% Agent失败案例

Pendoio利用LangSmith监控AI Agent,每天自动检测并捕获60%的失败,在用户发现前处理,展现Agent可靠性实践。[4]

LangChain正式集成GLM 5.2模型

LangChain宣布支持GLM 5.2,开发者可通过dcode或API快速搭建应用,丰富了LangChain的模型生态。[5]

Weaviate推出交互式搜索算法对比演示

Weaviate构建可交互演示,帮助开发者直观理解关键词搜索、【向量搜索】和混合搜索的区别,教育性工具。[8]

技巧教程

腾讯工程师分享Token成本治理全流程经验

腾讯工程师从Token浪费问题出发,提出系统化治理策略,涵盖可见性、优化方法等,帮助AI团队降本增效。链接见原文。[3]

使用eve.dev和Sanity构建内容Agent的实践指南

Guillermo Rauch分享用eve.dev+Sanity构建内容Agent,可自动更新文档和网站,推荐从可部署的Agent开始。[6]

行业资讯

贾扬清从英伟达离职,此前领导Lepton AI收购

创业邦报道,贾扬清已从英伟达离职,他曾创办的Lepton AI团队(20人)被英伟达收购。该事件影响AI基础设施领域。链接:https://mp.weixin.qq.com/s?__biz=MjM5OTAzMjc4MA==&mid=2650881078&idx=1&sn=a7d0bdc855e0682421ee3e45a5959dd2[2]

Google Cloud发布多节点KV缓存卸载方案提升LLM推理

Google Cloud介绍利用GKEManaged Lustre进行多节点KV缓存卸载,大幅扩展LLM推理规模,适合大规模部署。链接:https://cloud.google.com/blog/topics/developers-practitioners/scaling-llm-inference-multi-node-kv-cache-offloading-with-gke-managed-lustre/[7]