Stage | Context Parallelism
-- | --
Stage 5 | 2-way
Stage 6 | 16-way
3.2.1 Preference Optimization
모델 선호도(preference)와 품질(quality)을 동시에 학습하기 위해
MPO (Mixed Preference Optimization) 를 사용한다.
MPO는 두 가지 손실 함수를 결합한다.
Preference Loss
DPO (Direct Preference Optimization)
Quality Loss
BCO (Binary Classifier Optimization)
데이터 생성
비전 태스크에 대해 여러 후보 응답을 생성한 후:
-
정답 → Positive
-
오답 → Negative
로 분류한다.
3.2.2 Text RL
텍스트 전용 RL 단계에서는:
한다.
목표:
-
일반적인 추론 능력 향상
-
RLHF / RLVR 적용
Drift 방지
멀티모달 학습 과정에서 표현 공간이 변하는 것을 막기 위해
LM 입력 임베딩은 고정(freeze)한다.
3.2.3 Image RL
멀티모달 RL의 첫 단계이다.
비전 추론 능력을 향상시키기 위해 Outcome-Based RL을 수행한다.
학습 데이터
차트 / 문서 추론
약 28K
STEM 문제
약 19K
게임 및 퍼즐
약 12K
Visual QA
약 8K
GUI Grounding
약 7K
스크린샷 클릭 좌표 예측.
보상 함수
보상은 0~1 범위의 점수이다.
사용되는 검증기:
-
String Match
-
MathRuler
-
Multiple Choice
-
GUI Coordinate
Format Reward
다음 형식을 선호한다.
<think>
...
</think>
\boxed{answer}
Pass-Rate Filtering
초기 모델에서
Pass Rate < 0.8
인 문제만 유지한다.
너무 쉬운 문제는 제거한다.
3.2.4 Omni RL
논문에서 가장 중요한 RL 단계이다.
목표:
사이의 통합 추론 능력 강화.
데이터 규모
약 120K 프롬프트
113개 하위 데이터셋
데이터 구성
Omni RL
17.6K
오디오가 포함된 비디오.
Video RL
8.5K
공간/시간/인과 추론.
Image RL
32K
Audio RL
4.2K
ASR
3.8K
ASR 보상
음성 인식 능력을 유지하기 위해
Reward = 1 − WER
를 사용한다.
WER은 텍스트 정규화 후 계산된다.
난이도 필터링
기본 모델의 Pass Rate가:
인 문제만 사용한다.
Audio QA는 더 엄격하게:
범위를 사용한다.
검증 방식 비중
유형 | 비중
-- | --
Multiple Choice | 34%
String Matching | 31%
Math Verification | 26%
GUI Grounding | 6%
ASR Evaluation | 3%
RL 알고리즘
논문에서는
GSPO (Group Sequence Policy Optimization)
의 수정 버전을 사용한다.
멀티모달 최적화
생성 단계에서:
-
멀티모달 중복 제거(deduplication)
-
Tensor Parallelism
-
Expert Parallelism
-
Context Parallelism
을 활용하여 학습 효율을 높였다.
핵심 요약
Nemotron 3 Nano Omni의 RL 파이프라인은
Text RL → Image RL → Omni RL → Text RL
순으로 진행되며,
특히 Omni RL 단계에서 약 12만 개의 이미지·비디오·오디오·텍스트 추론 문제를 GSPO 기반 RL로 학습하여 멀티모달 추론 능력을 크게 향상시킨 것이 가장 중요한 특징이다.
3.2.2. Text-RL
During text-only RL, we only train the LM parameters of the model via multi-environment
RLVR/RLHF for improving general capabilities. We reuse the RL data and infrastructure from
the post-training of Nemotron 3 Nano and Super (NVIDIA et al., 2025b, 2026). As part of our
staged multi-modal training, during text-only RL stages we additionally freeze the LM input token embedding parameters to mitigate representational drift between multi-modal stages.
3.2.5. RL Training Details
Training is conducted on NVIDIA B200 and H100 GPU cluster using a Ray-based distributed
training framework built on NeMo-RL (NVIDIA, 2025). The global batch size is set to 4,096 with
16 rollouts for each prompt and a micro-batch size of 1. We apply an adapted version of Group
Sequence Policy Optimization (GSPO) (Zheng et al., 2025; Shao et al., 2024) as the RL training
algorithm.
4. 실험 (Experiments)
4.1~4.4절에서는 모델의 비전, 오디오, 텍스트 추론 능력을 평가한다. 또한:
-
4.6절: Efficient Video Sampling(EVS)의 효율성 분석
-
4.7~4.8절: 양자화(Quantization)가 정확도와 추론 효율에 미치는 영향 분석
을 수행한다.
비전·오디오 평가는 VLMEvalKit + vLLM, 텍스트 평가는 NeMo-Skills 프레임워크를 사용하였다.
4.1 비전 평가 (Visual Evaluations)
평가 분야는 다음과 같다.
1. STEM 추론
2. 문서 이해 / OCR / 차트
-
MMLongBench-Doc
-
OCRBench
-
OCRBench-V2
-
ChartQA
-
DocVQA
-
InfoVQA
-
OCR-Reasoning
-
CharXiv
3. Visual Grounding 및 공간 추론
-
TreeBench
-
CV-Bench
-
RefCOCO
4. GUI 이해
-
ScreenSpot
-
ScreenSpot-v2
-
ScreenSpot-Pro
-
OSWorld
5. 비디오 이해
결과
Nemotron 3 Nano Omni는 이전 모델인 Nemotron Nano V2 VL을 거의 모든 항목에서 크게 앞섰으며, 일부 분야에서는 Qwen3-Omni보다도 우수한 성능을 보였다.
대표적인 성능:
벤치마크 | Nemotron 3 Nano Omni
-- | --
MMMU | 75.6
MathVista-Mini | 82.8
MMLongBench-Doc | 57.5
OCRBench | 86.6
ChartQA | 90.3
DocVQA | 95.6
ScreenSpot | 89.3
ScreenSpot-v2 | 92.8
VideoMME | 72.2
약 7.5배 향상.
단일 스트림 성능
Nemotron 3 Nano Omni:
비교:
-
Qwen3-Omni: 175~210 tok/s
-
Nemotron Nano V2 VL: 250 tok/s
즉:
-
Qwen3-Omni 대비 2.4~2.9배
-
Nemotron Nano V2 VL 대비 2배
빠르다.
대규모 서비스
단일 B200 기준:
달성.
동일 인터랙티브 목표에서:
-
Qwen3-Omni 대비 9배 높은 비디오 처리량
-
Qwen3-Omni 대비 7.5배 높은 문서 처리량
-
Nemotron Nano V2 VL 대비 3배 높은 처리량
을 제공한다.
5. 결론 (Conclusion)
Nemotron 3 Nano Omni는 Nemotron 계열 최초의 네이티브 오디오 지원 옴니모달 모델이다.
핵심 기술은:
-
Nemotron 3 Nano 30B-A3B MoE 백본
-
C-RADIOv4-H 비전 인코더
-
Parakeet-TDT 오디오 인코더
-
Dynamic Resolution
-
Conv3D 비디오 압축
-
256K 컨텍스트
이다.
결과적으로:
-
문서 이해
-
GUI 에이전트
-
장시간 오디오·비디오 이해
-
음성 비서
영역에서 최고 수준의 성능을 달성했으며, 동시에 토큰 압축 기술을 통해 경쟁 모델 대비 훨씬 낮은 지연 시간과 높은 처리량을 제공한다.
또한 BF16, FP8, FP4 모델과 대규모 데이터셋 및 코드를 공개하여 오픈 멀티모달 연구 생태계 확장을 목표로 하고 있다.
Abstract
multimodal series and the first to natively support audio inputs alongside text, images, and
video. Nemotron 3 Nano Omni delivers consistent accuracy improvements over its predecessor,
Nemotron Nano V2 VL, across all modalities, enabled by advances in architecture, training
data and recipes. In particular, Nemotron 3 delivers leading results in real-world document
understanding, long audio-video comprehension, and agentic computer use. Built on the highly
efficient Nemotron 3 Nano 30B-A3B backbone, Nemotron 3 Nano Omni further incorporates
innovative multimodal token-reduction techniques to deliver substantially lower inference
latency and higher throughput than other models of similar size
Introduction
augmented with the C-RADIOv4-H1 (Ranzinger et al., 2026; Heinrich et al., 2025) vision encoder and the Parakeet-TDT-0.6B-v22(Xu et al., 2023; Rekesh et al., 2023; Sekoyan et al., 2025) audio encoder.
In addition, Nemotron 3 Nano Omni incorporates innovative multimodal token-reduction techniques that substantially reduce inference latency and increase throughput, enabling efficient deployment without sacrificing model quality.
with the Nemotron 3 Nano 30B-A3B Mixture-of-Experts (MoE) hybrid backbone, enabling
more efficient processing of long multimodal sequences and higher inference throughput.
to text, images, and video.
dynamic resolution strategy that better preserves native aspect ratios.
video, achieving a 2×reduction in temporal tokens.
tokens, improving performance on long-context multimodal reasoning tasks.
Training an omni-modal MoE model introduces challenges in modality alignment, training stability, and data balancing across heterogeneous sources.
We are also releasing part of our training datasets, pipelines, and code:
• Nemotron-Image-Training-v3: A collection of∼6.9 million training samples.
• Examples of data generation pipelines
• Training code on Megatron-Bridge
• NeMo RL guide for Nemotron 3 Nano Omni
2. Model Architecture
본 모델은 인코더(Encoder) – 프로젝터(Projector) – 디코더(Decoder) 구조를 따른다. Nemotron 3 Nano Omni는 Nemotron 3 Nano 30B-A3B 언어 모델을 중심으로, 비전 및 오디오 전용 인코더를 MLP 프로젝터를 통해 연결한 구조로 설계되었다.
언어 모델(LLM): Nemotron 3 Nano 30B-A3B
비전 인코더: C-RADIOv4-H
오디오 인코더: Parakeet-TDT-0.6B-v2
이미지 처리
Nemotron Nano V2 VL에서 사용하던 타일링(tiling) 방식을 제거하고, 이미지의 원본 종횡비를 유지하는 동적 해상도(dynamic resolution) 방식을 채택했다.
각 이미지는:
이는 정사각형 이미지 기준으로:
해상도에 해당한다.
또한 언어 모델에 전달하기 전에 4배 다운샘플링(pixel shuffle) 을 수행하여 토큰 수를 줄인다.
Each image is decomposed into a variable number of 16 ×16 patches, with the total number of
visual tokens per image constrained between 1,024 and 13,312. This equates to an image size of
512 ×512 and 1840 ×1840, respectively, for square images. Prior to projection, we apply a pixel
shuffle operation with 4×downsampling to reduce the token count presented to the language model.
비디오 처리
비디오의 경우 Conv3D 기반 패치 임베더를 사용한다.
2개의 프레임을 1개로 압축 비디오 토큰 수 50% 감소 효과를 얻는다.
오디오 처리
오디오는 다음과 같이 처리된다.
결과적으로:
이 가능하다.
오디오 길이 지원
오디오는:
으로 처리된다.
학습 시:
길이의 오디오를 사용했으며, 256K 컨텍스트를 활용하면 5시간 이상의 오디오 입력도 수용 가능하다.
멀티모달 입력 처리
비디오와 오디오가 동시에 존재하는 경우:
을 시간 순서대로(interleaving) 배치한다.
이를 통해 영상과 음성을 함께 고려하는 공동 시간 추론(joint temporal reasoning) 이 가능해진다.
3. Training Recipe & Datasets
옴니모달 추론 모델은 서로 다른 인코더들을 사용하기 때문에 학습이 어렵다.
이를 해결하기 위해 저자들은:
의 2단계 학습 전략을 사용하였다.
SFT 단계
총 7단계(Stage 0~6) 로 구성된다.
목표는:
이다.
Stage 0: 비전 프로젝터 워밍업
학습 대상:
데이터:
포함 작업:
등.
Stage 1: Vision SFT (16K)
학습 대상:
동시 학습.
주요 개선점:
고품질 텍스트 데이터 사용
기존 Nemotron Nano V2 VL의 텍스트 데이터 대신
를 사용.
데이터 재주석
Qwen3-VL 계열 모델로 노이즈 데이터를 재주석.
추론 과정(CoT) 강화
다음 모델들의 Chain-of-Thought 활용:
도메인 확장
추가 영역:
최종 데이터 규모:
Stage 2: 오디오 프로젝터 워밍업
Stage 0의 오디오 버전이다.
학습:
고정:
데이터:
Stage 3: 오디오 인코더 학습
학습:
고정:
데이터:
총:
Stage 4: Joint Omni SFT (16K)
처음으로 모든 모달리티를 함께 학습한다.
학습 대상:
전체 모델 파라미터.
데이터 구성:
규모:
Stage 5: Joint Omni SFT (48K)
컨텍스트를:
로 확대한다.
특징:
규모:
Stage 6: Ultra-Long Context (256K)
최종 컨텍스트 길이:
으로 확장한다.
주요 목표:
강화.
학습 데이터:
등의 장문 문서.
특히:
에 대한 이해 능력을 향상시킨다.
이 단계에서는:
를 고정하고 장문 텍스트와 문서 이해에 집중한다.
전체 SFT 규모 요약
즉, Nemotron 3 Nano Omni는 "Vision → Audio → Omni → Long Context" 순서로 능력을 단계적으로 쌓아 올리는 커리큘럼 학습 방식을 사용하며, 최종적으로 약 4억 3천만 개 샘플, 4,669억 토큰 규모의 SFT 데이터로 학습되었다.
학습 세부사항 (Training Details)
모든 SFT 단계는 Megatron 프레임워크(Shoeybi et al., 2019), Transformer Engine, 그리고 Megatron Energon 데이터로더를 사용하여 학습되었다. 학습은 단계에 따라 NVIDIA H100 GPU 32~128 노드 규모에서 수행되었다.
학습 효율을 높이기 위해 다음과 같은 병렬화 기법을 사용하였다.
또한 모든 단계는:
을 활용하여 GPU 활용률을 극대화하였다.
메모리 최적화
긴 시퀀리를 GPU 메모리에 수용하기 위해 다양한 재계산(recomputation) 기법을 적용했다.
LLM 백본
다음 연산은 필요 시 다시 계산한다.
Vision Encoder
32개 레이어 전체에 대해 Block-Level Recomputation 적용.
Audio Encoder
Stage 4부터 활성화 재계산 적용.
Vision / Audio Projector
Stage 5 이후 활성화 재계산 적용.
Context Parallelism
초장문 컨텍스트 처리를 위해 후반 단계에서는 Context Parallelism(CP)을 사용하였다.
3.2.1 Preference Optimization
모델 선호도(preference)와 품질(quality)을 동시에 학습하기 위해
MPO (Mixed Preference Optimization) 를 사용한다.
MPO는 두 가지 손실 함수를 결합한다.
Preference Loss
DPO (Direct Preference Optimization)
Quality Loss
BCO (Binary Classifier Optimization)
데이터 생성
비전 태스크에 대해 여러 후보 응답을 생성한 후:
로 분류한다.
3.2.2 Text RL
텍스트 전용 RL 단계에서는:
한다.
목표:
Drift 방지
멀티모달 학습 과정에서 표현 공간이 변하는 것을 막기 위해
LM 입력 임베딩은 고정(freeze)한다.
3.2.3 Image RL
멀티모달 RL의 첫 단계이다.
비전 추론 능력을 향상시키기 위해 Outcome-Based RL을 수행한다.
학습 데이터
차트 / 문서 추론
약 28K
STEM 문제
약 19K
게임 및 퍼즐
약 12K
Visual QA
약 8K
GUI Grounding
약 7K
스크린샷 클릭 좌표 예측.
보상 함수
보상은 0~1 범위의 점수이다.
사용되는 검증기:
Format Reward
다음 형식을 선호한다.
Pass-Rate Filtering
초기 모델에서
Pass Rate < 0.8
인 문제만 유지한다.
너무 쉬운 문제는 제거한다.
3.2.4 Omni RL
논문에서 가장 중요한 RL 단계이다.
목표:
사이의 통합 추론 능력 강화.
데이터 규모
약 120K 프롬프트
113개 하위 데이터셋
데이터 구성
Omni RL
17.6K
오디오가 포함된 비디오.
Video RL
8.5K
공간/시간/인과 추론.
Image RL
32K
Audio RL
4.2K
ASR
3.8K
ASR 보상
음성 인식 능력을 유지하기 위해
Reward = 1 − WER
를 사용한다.
WER은 텍스트 정규화 후 계산된다.
난이도 필터링
기본 모델의 Pass Rate가:
인 문제만 사용한다.
Audio QA는 더 엄격하게:
범위를 사용한다.
검증 방식 비중
RL 알고리즘
논문에서는
GSPO (Group Sequence Policy Optimization)
의 수정 버전을 사용한다.
멀티모달 최적화
생성 단계에서:
을 활용하여 학습 효율을 높였다.
핵심 요약
Nemotron 3 Nano Omni의 RL 파이프라인은
Text RL → Image RL → Omni RL → Text RL
순으로 진행되며,
특히 Omni RL 단계에서 약 12만 개의 이미지·비디오·오디오·텍스트 추론 문제를 GSPO 기반 RL로 학습하여 멀티모달 추론 능력을 크게 향상시킨 것이 가장 중요한 특징이다.
3.2.2. Text-RL
During text-only RL, we only train the LM parameters of the model via multi-environment
RLVR/RLHF for improving general capabilities. We reuse the RL data and infrastructure from
the post-training of Nemotron 3 Nano and Super (NVIDIA et al., 2025b, 2026). As part of our
staged multi-modal training, during text-only RL stages we additionally freeze the LM input token embedding parameters to mitigate representational drift between multi-modal stages.
3.2.5. RL Training Details
Training is conducted on NVIDIA B200 and H100 GPU cluster using a Ray-based distributed
training framework built on NeMo-RL (NVIDIA, 2025). The global batch size is set to 4,096 with
16 rollouts for each prompt and a micro-batch size of 1. We apply an adapted version of Group
Sequence Policy Optimization (GSPO) (Zheng et al., 2025; Shao et al., 2024) as the RL training
algorithm.
4. 실험 (Experiments)
4.1~4.4절에서는 모델의 비전, 오디오, 텍스트 추론 능력을 평가한다. 또한:
을 수행한다.
비전·오디오 평가는 VLMEvalKit + vLLM, 텍스트 평가는 NeMo-Skills 프레임워크를 사용하였다.
4.1 비전 평가 (Visual Evaluations)
평가 분야는 다음과 같다.
1. STEM 추론
2. 문서 이해 / OCR / 차트
3. Visual Grounding 및 공간 추론
4. GUI 이해
5. 비디오 이해
결과
Nemotron 3 Nano Omni는 이전 모델인 Nemotron Nano V2 VL을 거의 모든 항목에서 크게 앞섰으며, 일부 분야에서는 Qwen3-Omni보다도 우수한 성능을 보였다.
대표적인 성능:
약 7.5배 향상.
단일 스트림 성능
Nemotron 3 Nano Omni:
비교:
즉:
빠르다.
대규모 서비스
단일 B200 기준:
달성.
동일 인터랙티브 목표에서:
을 제공한다.
5. 결론 (Conclusion)
Nemotron 3 Nano Omni는 Nemotron 계열 최초의 네이티브 오디오 지원 옴니모달 모델이다.
핵심 기술은:
이다.
결과적으로:
영역에서 최고 수준의 성능을 달성했으며, 동시에 토큰 압축 기술을 통해 경쟁 모델 대비 훨씬 낮은 지연 시간과 높은 처리량을 제공한다.
또한 BF16, FP8, FP4 모델과 대규모 데이터셋 및 코드를 공개하여 오픈 멀티모달 연구 생태계 확장을 목표로 하고 있다.