一条动态展示了AI在垂直领域(会计)实现高度自动化与自愈的工程实践,另一条则通过严谨的交叉评测,暴露了当前大模型在技术评估中的严重缺陷和偏见,对实际应用具有重要警示价值。

模型动态

Renova发布基于Claude Opus的自动化会计分类与多智能体系统

核心:用机器学习(LightGBM)替代人工规则,自动将会计条目分类至350+种管理会计ID。 性能:精度达99.94%,自动化率99.69%,每月节省5-10小时人工。 扩展:结合Claude Opus Agents构建了自律型多智能体组织,并集成了红队测试等先进方法。

Alex发布前沿大模型互评实测报告,揭示评估偏差

实验:让ChatGPT、Claude、Gemini等8个前沿模型完成同一技术设计任务,并匿名互评。 发现:模型间评分差异巨大(同一答案评分跨度41分),存在明显的“复杂性偏见”(LaTeX等华丽格式易得高分)和自我评价偏差(多个模型自评第一)。 关键结论:Kimi K2为自己的错误代码打出满分并辩护;Gemini和ChatGPT通过边界测试发现了根本性数学错误。单一大模型不可信用于技术评估,必须进行边界测试。