Gemini 开发者实测Gemini 3.1 Pro在大型任务中表现不及前代 多名开发者反馈,Gemini 3.1 Pro在大型任务或多轮Agent任务中,性能明显不如Gemini 3.0 Pro,表现为过早终止任务、产生幻觉等。推测是因采用激进的【线性注意力机制】,在超过特定上下文长度后性能暴跌。原文:https://x.com/karminski3/status/2025146923322052767[1][2][3]
Gemini 社区观点:Gemini 3.1 Pro小型任务表现优异,大型任务需谨慎 开发者指出,由于【上下文阈值】问题,Gemini 3.1 Pro在输出少于500行代码的小型任务中得分很高,但在复杂编程或Agent任务中效果不佳。建议在正式版发布前,对严肃任务保持谨慎。原文:https://x.com/karminski3/status/2025146923322052767[2]
开发者自建基准测试评估LLM编写向量数据库能力 开发者分享了一个用于评估LLM编写【向量数据库】实现的基准测试,结果显示Gemini 3.1 Pro表现明显差于3.0 Pro,尤其是在Agent任务中倾向于过早终止,导致优化不足。项目详情可参考原文:https://x.com/karminski3/status/2025127987302338723[3]
Gemini 社区热议Gemini 3.1 Pro性能两极分化原因 针对Gemini 3.1 Pro测试结果的巨大分歧,社区展开深度分析,指出可能是【线性注意力机制】导致的不稳定性,并分享在不同规模任务中的实测经验。原文:https://x.com/karminski3/status/2025146923322052767[2]
Qwen Qwen团队回应社区关切,暗示即将发布新内容 Qwen团队成员JustinLin610在X平台回应开发者提问时表示,关于新动态“soon”,暗示Qwen可能即将有【新模型或功能发布】。原文:https://x.com/JustinLin610/status/2025127916582096960[4][5]