Grok 4.20 Beta 在竞技场评测中表现优异
根据Arena评测,Grok 4.20 Beta Reasoning在文本竞技场总榜排名第7,与GPT-5.4-high持平。在代码竞技场的智能体网页开发任务中,其表现与DeepSeek-v3.2和Qwen3.5-122b-a10b相当。[6]
本期AI行业速报聚焦智能体平台的集中发布与升级,包括LangChain与NVIDIA合作推出企业级平台,以及OpenAI Codex的子代理功能全面可用。同时,Grok 4.20 Beta在评测中表现亮眼,Mistral也发布了新模型。