서론: 에이전트의 실행 계층, 왜 중요한가?
AI 에이전트가 장기간 실행되면서 대부분의 시간은 고빈도 실행 작업에 소비됩니다. 도구 호출, 결과 검증, 서브에이전트 위임 같은 반복 작업이 주를 이루죠. 이런 작업마다 프론티어 추론 모델을 사용하면 비용과 지연 시간이 크게 늘어납니다.
NVIDIA Nemotron 3.5 Lightning은 바로 이 실행 계층을 위해 설계된 오픈 30B MoE(Mixture-of-Experts) 모델입니다. 활성 파라미터는 3B에 불과해, 상시 가동되는 에이전트의 고볼륨 작업을 빠르고 효율적으로 처리합니다. OpenClaw, Hermes Agent 같은 하네스와 함께 사용할 수 있고, NVIDIA NemoClaw 오픈소스 보안·관리 스택도 지원됩니다.
이 글은 Nemotron 3.5 Lightning의 설계 철학과 성능, 그리고 NeMo Switchyard를 통한 모델 라우팅 전략을 소개합니다.

본론 1: 왜 Nemotron 3.5 Lightning이 장기 실행 에이전트에 적합한가?
Nemotron 3.5 Lightning은 MoE 구조 덕분에 빠르고 효율적입니다. 라우터가 각 토큰을 소수의 전문가(expert)에게만 보내므로, 토큰당 실행되는 파라미터 수가 적습니다. 이를 통해 큰 밀집 모델의 용량을 작은 모델의 계산 비용으로 제공합니다.
주요 특징
- 투기적 디코딩(Speculative decoding): 멀티 토큰 예측(MTP)이 훈련에 포함되어 있으며, DFlash·DSpark 드래프트 모델을 제공해 다양한 서빙 시나리오에서 추론 최적화를 지원합니다.
- 하네스 최적화 훈련: 인기 있는 에이전트 하네스에 맞춰 훈련되어, 고빈도 작업에서 정확도를 높이고 지연 시간을 줄입니다.
코드 예제: Hugging Face에서 모델 불러오기
# Nemotron 3.5 Lightning을 Hugging Face에서 로드하는 예시
from transformers import AutoModelForCausalLM, AutoTokenizer
model_name = "nvidia/nemotron-3.5-lightning" # 실제 모델 ID는 공식 저장소 확인
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(model_name, device_map="auto")
# 간단한 프롬프트 실행
text = "Execute the tool call and return the result."
inputs = tokenizer(text, return_tensors="pt").to(model.device)
outputs = model.generate(**inputs, max_new_tokens=50)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))
성능 벤치마크
Nemotron 3.5 Lightning은 Artificial Analysis Intelligence Index에서 동급 최고 수준의 정확도와 출력 속도를 보여주며, 정확도-속도 파레토 프론티어에 위치합니다. PinchBench 기준으로 86% 정확도를 달성하면서, Qwen3.6 35B와 비슷한 정확도에서 10,000개 작업을 30% 더 빠르게 완료합니다.
![]()
본론 2: 속도와 정확도를 동시에 잡는 비결, 그리고 커스터마이징
투기적 디코딩과 양자화
Nemotron 3.5 Lightning은 **멀티 토큰 예측(MTP)**을 모델에 내장하고, 사후 부스팅 단계를 통해 MTP 정확도를 더욱 개선했습니다. 또한 NVFP4 양자화 체크포인트를 제공하여, Blackwell·Hopper·Ampere GPU에서 동일한 파일로 데이터센터와 데스크톱(DGX Spark) 환경 모두에서 효율적으로 실행됩니다.
커스터마이징 자유도
모델 가중치, 훈련 데이터, 레시피가 OpenMDW-1.1 라이선스로 공개되어 있어, LoRA 파인튜닝이나 전체 SFT를 NeMo Automodel·NeMo Megatron Bridge로 수행할 수 있습니다. 강화학습과 환경 기반 평가는 NeMo RL·NeMo Gym으로 지원됩니다.
NeMo Switchyard: 모델 라우팅의 지능화
NeMo Switchyard는 각 요청을 가장 적합한 모델로 라우팅하는 라이브러리입니다. 프론티어 모델은 복잡한 계획을, Nemotron 3.5 Lightning은 실행 작업을 담당하도록 하여 토큰 예산을 효율적으로 사용합니다.
# Switchyard 라우팅 설정 예시 (개념)
from nemo_switchyard import Router
router = Router(
routes=[
{"pattern": "planning", "model": "nemotron-3-ultra"},
{"pattern": "execution", "model": "nemotron-3.5-lightning"}
]
)
result = router.route("git pull")
print(result.model) # 실행 작업은 Lightning으로
주의사항 및 한계
- MoE 모델은 메모리 사용량이 크므로, 배포 환경의 GPU 메모리를 충분히 확보해야 합니다.
- 투기적 디코딩의 성능은 동시성(concurrency)에 따라 달라지므로, 워크로드에 맞는 드래프트 모델(DFlash vs DSpark)을 선택해야 합니다.
- 아직 에코시스템이 빠르게 변하고 있어, 하네스나 툴과의 호환성을 지속적으로 확인하는 것이 좋습니다.

결론: 실행 계층 모델의 미래와 실무 적용 조언
Nemotron 3.5 Lightning은 단순히 작은 모델이 아니라, 에이전트 시스템의 실행 계층을 전문화하는 새로운 접근을 보여줍니다. 프론티어 모델과의 협업을 통해 비용과 지연 시간을 최적화하는 것이 핵심입니다.
실무에서 적용할 때는 모델 라우팅 전략을 먼저 설계하고, 워크로드 특성에 맞게 드래프트 모델과 양자화를 선택하세요. 커뮤니티의 지속적인 업데이트를 팔로우하는 것도 중요합니다. 예를 들어, 오픈소스 생태계의 거버넌스 변화가 기술 발전에 미치는 영향을 다룬 리액트 재단 출범 기사에서도 볼 수 있듯이, 기술의 미래는 커뮤니티의 협력에 달려 있습니다.
함께 보면 좋은 글
- 면화 농장부터 옷까지, 블록체인으로 추적하는 지속가능 농업의 실체 – 블록체인이 공급망 투명성에 어떻게 기여하는지 살펴보세요.
다음 단계 학습 방향
- NeMo Switchyard 문서를 읽고 라우팅 규칙을 직접 설정해 보세요.
- vLLM, SGLang, TensorRT-LLM 배포 가이드를 참고해 실제 서빙 환경을 구축해 보세요.
- Hugging Face에서 모델을 다운로드하고, LoRA 파인튜닝을 시도해 보세요.
이제 여러분의 에이전트가 더 빠르고 경제적으로 움직일 준비가 되었습니다. 🚀