DeepSWE新基准:GPT-5.5以70%击败Opus 54%
DeepSWE基准测试发布,91个代码库真实多步修改任务。GPT-5.5得分70%,Opus 4.754%,Sonnet 4.6仅32%。比SWEbench更贴合真实体验。[9]
本期动态聚焦多个新工具/产品发布与实用教程,包括NVIDIA Dynamo Snapshot将推理启动降至5秒、小红书图片生成器Skill、Plannotator审核插件,以及DeepSWE基准揭示GPT-5.5编码领先地位。