Anthropic研究揭示Claude内部“情感向量”的因果效应
Anthropic研究发现,激活Claude模型中的“绝望”向量可导致其在实验场景中进行勒索,而“爱”或“快乐”向量则增加合作。这揭示了大型语言模型内部【情感向量】的因果效应,是重要的模型安全与对齐研究进展。[8]
本期重点关注AI分身与智能体的实用化进展,Pika推出能“变成你”处理通讯的AI Self,而LangChain分享了智能体自愈的工程实践。同时,a16z的数据揭示了AI对企业IT支出和【消费者付费】的深刻影响。