Self-Guided Self-Play (SGS) 让自博弈在LLM中奏效
研究提出SGS算法,让LLM自身引导问题生成避免奖励崩塌。在Lean4定理证明中,7B模型经200轮自博弈超越671B模型,论文:https://arxiv.org/abs/2604.20209 ,代码:https://github.com/LukeBailey181/sgs[3]
本期包括SGS自博弈让7B模型超越671B模型,Touch Dreaming提升人形机器人成功率90.9%,以及AI AgentBonnie and Clyde安全事件引发关注。