Nemotron 3.5 Lightning 采用 31.6B 总参数、3.6B 激活参数的 MoE 架构,并提供 1M token 上下文。公开信息还显示它面向 RTX PC、DGX Spark 和 Jetson 等本地设备,强调约 670 tokens/秒的输出速度。实际做本地智能体时,模型能力、首字延迟、长上下文内存占用、工具调用稳定性和部署成本往往需要一起权衡。大家会如何设计一套可复现的选型测试?哪些任务适合交给这种小激活参数模型,哪些任务仍应路由给更大的云端模型?
相似问题