大规模实验揭示LLM评分存在家族偏差
Reddit用户让55个LLM相互盲评共22k条判断,发现各模型家族偏向自家:Qwen偏向自己约0.9分,而Mistral惩罚自己约1.0分,引发对评估主观偏见的讨论。[2]
本周社区涌现多项轻量模型压缩和本地推理工具:Sana 1.6B缩小8.6倍、Ornith-1.0 9B超越大模型、纯C引擎运行Qwen 3,以及macOS开源编辑器和Android本地ASR等实用工具。