最严苛编程基准ProgramBench发布:Opus 4.5仅获3%分,多数模型挂零
ProgramBench由Meta、斯坦福、哈佛联合推出,要求AI仅凭二进制文件和文档从零重写程序,禁止反编译或联网。Claude Opus 4.7在“接近完成”指标上仅获3%,GPT-5和Gemini系列全挂零,覆盖FFmpeg、SQLite等大项目。官网:https://t.co/So4An5dmot[1]
本期AI速报聚焦ProgramBench编程基准揭示顶尖模型得分极低,CloakBrowser开源项目挑战主流反爬检测,以及ElevenLabsAI语音代理助力车企实现约8%的转化提升。