Anthropic开源其性能工程招聘考题,Claude Opus 4.5已能击败多数人类。
事件:Anthropic在工程博客中公开了其用于招聘的、难度极高的性能优化考题。 实测:Claude Opus 4.5模型在该考题上的最佳成绩为1487(运行周期),已能击败大多数人类候选人。 挑战:Anthropic鼓励开发者挑战该成绩,若优于模型且不作弊,可将代码和简历发送至其招聘邮箱。
Anthropic通过开源考题展示了其模型(Claude Opus 4.5)在特定工程任务上已接近甚至超越人类平均水平,并以此作为招聘噱头。Gemini推出教育辅助功能,深化其工具属性。智谱AI持续高密度发布模型,显示其技术迭代速度。社区层面,实用Prompt资源的分享依然活跃。