Nous Research发布Token Superposition Training,预训练加速2.5倍
Nous Research发布Token Superposition Training(TST),在不修改架构前提下,将10B MoE模型预训练时间从12,311 B200-GPU小时降至4,768小时,加速约【2.5倍】。论文:https://arxiv.org/abs/2605.06546[8]
本期亮点包括上海电信将Token做成话费套餐、GitHub推出Copilot桌面应用、Notion发布CLI,以及Nous Research发布Token Superposition Training预训练加速2.5倍。