NVIDIA发布Star Elastic模型,单一检查点支持30B/23B/12B三尺寸推理
NVIDIA Star Elastic采用嵌套架构,可零样本从30B父模型中提取23B和12B子模型。支持推理阶段动态切换模型尺寸,小模型思考大模型回答,在AIME-2025上精度提升16%,延迟降低【1.9倍】。12B版可在RTX 5080上运行。模型地址:https://huggingface.co/nvidia/NVIDIA-Nemotron-Labs-3-Elastic-30B-A3B-BF16[1]