xAI的首个视频模型Grok-Imagine-Video在Video Arena评测中首次亮相即取得优异成绩。该模型在图像到视频竞技场(Image-to-Video Arena)中排名第3,在文本到视频竞技场(Text-to-Video Arena)中排名第4,表现接近排名第一的Google DeepMind Veo 3.1和OpenAI Sora 2 Pro模型。Grok-Imagine-Video具备文本到视频和图像到视频生成能力,支持原生音频生成,视频时长最长可达15秒。
[6][7][8]