DeepSWE新基准发布,评估前沿模型代码编写能力
发布DeepSWE基准测试,评估前沿模型代码能力。具有【无污染、高多样性】特点,为代码生成研究提供重要参考。详情:https://www.reddit.com/r/MachineLearning/comments/1ue0hlp/deepswe_new_benchmark_looking_at_how_well_todays/[8]
本期重点:Claude Code获权威认可称为LLM第三次变革,阿里开源Open Code Review一周获5k Star,同时物理AI在货运领域实现商业闭环、仙工智能IPO等事件凸显行业加速落地。