동차 Beating 모니터링에 따르면, 엔비디아가 오픈소스 모델 Nemotron 3.5 Lightning을 출시했으며, 이는 장시간 실행되는 에이전트의 '실행 작업'을 전담하도록 설계되었습니다. 모델의 총 파라미터는 300억 개이며, 각 토큰은 30억 개만 활성화되어 주로 도구 호출, 결과 검사, 하위 에이전트 스케줄링 등 고빈도 작업을 담당합니다.
엔비디아의 접근 방식은 에이전트 분업을 더 철저히 하는 것입니다. 복잡한 계획은 Nemotron 3 Ultra와 같은 대형 모델에 맡기고, 대량의 반복 실행은 Lightning에 맡깁니다. 공식 발표에 따르면, 출력 속도는 동급 모델 대비 최대 4배 빠릅니다. PinchBench에서 Lightning의 정확도는 86%에 달하며, 정확도가 유사한 수준에서 1만 개 작업을 완료하는 속도는 Qwen3.6 35B보다 30% 빠릅니다.
모델은 MoE 아키텍처를 채택했으며, Agent Harness에 특화된 훈련을 거쳤고, 멀티 토큰 예측 및 추측 디코딩을 추가했습니다. 공식적으로 BF16 및 NVFP4 가중치를 제공하며, RTX 5090, DGX Spark 등 로컬 디바이스에서 실행할 수 있고, llama.cpp, Ollama, LM Studio, Unsloth도 지원합니다.
또한 맞춤화 가능성을 강조합니다. 엔비디아는 가중치, 일부 훈련 데이터 및 훈련 레시피를 공개하여, 기업이 코드, 보안, 법률 등 작업에 대해 추가 훈련을 진행할 수 있습니다. 공식 데모 사례에서 Lightning은 후속 훈련 후 여러 전문 작업에서 뚜렷한 성능 향상을 보였습니다.