はじめに:エージェントの実行層の重要性

AIエージェントが長期稼働する際、その時間の大半は高頻度な実行タスクに費やされます。ツール呼び出し、結果検証、サブエージェントへの委任といった反復作業が中心です。これらのタスク毎にフロンティア推論モデルを使用すると、コストとレイテンシが大幅に増加します。

NVIDIA Nemotron 3.5 Lightningは、この実行層のために設計されたオープンな30B MoE(Mixture-of-Experts)モデルです。アクティブパラメータはわずか3Bで、常時稼働するエージェントの高ボリュームタスクを高速かつ効率的に処理します。OpenClawやHermes Agentなどのハーネスと組み合わせて使用でき、NVIDIA NemoClawオープンソースのセキュリティ・管理スタックもサポートされています。

本記事では、Nemotron 3.5 Lightningの設計思想と性能、そしてNeMo Switchyardによるモデルルーティング戦略を解説します。

NVIDIA Nemotron 3.5 Lightning model architecture with MoE router and 3B active parameters Dev Environment Setup

本論1:なぜNemotron 3.5 Lightningが長期稼働エージェントに適しているのか

Nemotron 3.5 LightningはMoE構造により高速かつ効率的です。ルーターが各トークンを少数のエキスパートにのみ送信するため、トークンごとに実行されるパラメータ数が少なくて済みます。これにより、大きな稠密モデルの容量を、小さなモデルの計算コストで提供できます。

主な特徴

  • 投機的デコーディング(Speculative decoding): マルチトークン予測(MTP)がトレーニングに組み込まれており、DFlash・DSparkドラフトモデルを提供し、多様なサービングシナリオで推論最適化をサポートします。
  • ハーネス最適化トレーニング: 人気のエージェントハーネス向けにトレーニングされ、高頻度タスクの精度を高め、レイテンシを削減します。

コード例:Hugging Faceでモデルをロード

# Nemotron 3.5 LightningをHugging Faceからロードする例
from transformers import AutoModelForCausalLM, AutoTokenizer

model_name = "nvidia/nemotron-3.5-lightning"  # 実際のモデルIDは公式リポジトリを確認
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(model_name, device_map="auto")

# 簡単なプロンプト実行
text = "Execute the tool call and return the result."
inputs = tokenizer(text, return_tensors="pt").to(model.device)
outputs = model.generate(**inputs, max_new_tokens=50)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))

性能ベンチマーク

Nemotron 3.5 LightningはArtificial Analysis Intelligence Indexにおいて、同クラス最高レベルの精度と出力速度を実現し、精度-速度のパレートフロンティアに位置します。PinchBenchでは86%の精度を達成し、Qwen3.6 35Bと同等の精度で10,000タスクを30%高速に完了します。

Developer deploying Nemotron 3.5 Lightning on DGX Spark for local AI agent execution Programming Illustration

本論2:速度と精度を両立させる秘訣、そしてカスタマイズ

投機的デコーディングと量子化

Nemotron 3.5 Lightningは**マルチトークン予測(MTP)**をモデルに組み込み、事後ブースティングフェーズでMTP精度をさらに向上させています。また、NVFP4量子化チェックポイントを提供し、Blackwell・Hopper・Ampere GPUで同一ファイルをデータセンターとデスクトップ(DGX Spark)の両方で効率的に実行できます。

カスタマイズの自由度

モデルウェイト、トレーニングデータ、レシピがOpenMDW-1.1ライセンスで公開されており、LoRAファインチューニングやフルSFTをNeMo Automodel・NeMo Megatron Bridgeで実行できます。強化学習と環境ベースの評価はNeMo RL・NeMo Gymでサポートされています。

NeMo Switchyard:モデルルーティングの知能化

NeMo Switchyardは、各リクエストを最適なモデルにルーティングするライブラリです。フロンティアモデルは複雑な計画を、Nemotron 3.5 Lightningは実行タスクを担当することで、トークン予算を効率的に使用します。

# Switchyardルーティング設定例(概念)
from nemo_switchyard import Router

router = Router(
    routes=[
        {"pattern": "planning", "model": "nemotron-3-ultra"},
        {"pattern": "execution", "model": "nemotron-3.5-lightning"}
    ]
)
result = router.route("git pull")
print(result.model)  # 実行タスクはLightningへ

注意点と制限

  • MoEモデルはメモリ使用量が大きいため、デプロイ環境のGPUメモリを十分に確保してください。
  • 投機的デコーディングの性能は同時実行数(concurrency)に依存するため、ワークロードに合ったドラフトモデル(DFlash vs DSpark)を選択してください。
  • エコシステムは急速に変化しているため、ハーネスやツールとの互換性を継続的に確認することをお勧めします。

NeMo Switchyard dashboard routing tasks between frontier and execution models Developer Related Image

まとめ:実行層モデルの未来と実務適用のアドバイス

Nemotron 3.5 Lightningは、単なる小型モデルではなく、エージェントシステムの実行層を専門化する新しいアプローチを示しています。フロンティアモデルとの協業により、コストとレイテンシを最適化することが重要です。

実務で適用する際は、モデルルーティング戦略を最初に設計し、ワークロード特性に合わせてドラフトモデルと量子化を選択してください。コミュニティの継続的なアップデートをフォローすることも重要です。例えば、オープンソースエコシステムのガバナンス変化が技術発展に与える影響を扱ったReact財団設立記事からもわかるように、技術の未来はコミュニティの協力にかかっています。

関連記事

次の学習ステップ

  • NeMo Switchyardのドキュメントを読み、ルーティングルールを自分で設定してみてください。
  • vLLM、SGLang、TensorRT-LLMのデプロイガイドを参考に、実際のサービング環境を構築してみてください。
  • Hugging Faceでモデルをダウンロードし、LoRAファインチューニングを試してみてください。

これで、あなたのエージェントがより速く、より経済的に動く準備が整いました。

本コンテンツは、信頼性の高い情報源をもとにAIツールを活用して作成され、編集者によるレビューを経て公開されています。専門家によるアドバイスの代替となるものではありません。