Meta发布开源音频分割模型SAM Audio
功能:可像图像抠图一样,从复杂音频中分割提取特定声音元素(如人声、乐器、噪音)。 应用:一键提取歌曲人声、过滤视频噪音、去除播客杂音,无需专业知识。 特点:支持文本、视觉、时间三种提示方式,模型已开源。[1]
Meta将“分割一切”的能力从图像扩展到音频,有望大幅简化音频处理工作流。Google和飞书均在强化AI与办公场景的深度集成,前者侧重个人邮件与日程管理,后者主打企业级知识挖掘与内容生成。KAT-Coder-Pro的发布则体现了代码模型领域的快速迭代。