Skip to content

Nemotron 3 Nano Omni: Efficient and Open Multimodal Intelligence #54

Description

@eagle705

Abstract

  • We introduce Nemotron 3 Nano Omni, the latest model in the Nemotron
    multimodal series and the first to natively support audio inputs alongside text, images, and
    video. Nemotron 3 Nano Omni delivers consistent accuracy improvements over its predecessor,
    Nemotron Nano V2 VL, across all modalities, enabled by advances in architecture, training
    data and recipes. In particular, Nemotron 3 delivers leading results in real-world document
    understanding, long audio-video comprehension, and agentic computer use. Built on the highly
    efficient Nemotron 3 Nano 30B-A3B backbone, Nemotron 3 Nano Omni further incorporates
    innovative multimodal token-reduction techniques to deliver substantially lower inference
    latency and higher throughput than other models of similar size

Introduction

  • augmented with the C-RADIOv4-H1 (Ranzinger et al., 2026; Heinrich et al., 2025) vision encoder and the Parakeet-TDT-0.6B-v22(Xu et al., 2023; Rekesh et al., 2023; Sekoyan et al., 2025) audio encoder.

  • In addition, Nemotron 3 Nano Omni incorporates innovative multimodal token-reduction techniques that substantially reduce inference latency and increase throughput, enabling efficient deployment without sacrificing model quality.

    1. Improved LLM Backbone. We replace the dense Nemotron Nano V2 12B hybrid backbone
      with the Nemotron 3 Nano 30B-A3B Mixture-of-Experts (MoE) hybrid backbone, enabling
      more efficient processing of long multimodal sequences and higher inference throughput.
    1. Native Audio Support. We extend the model to natively support audio inputs in addition
      to text, images, and video.
    1. Dynamic Image Resolution. We replace the tiling-based image processing approach with a
      dynamic resolution strategy that better preserves native aspect ratios
      .
    1. Temporal Video Compression. We introduce Conv3D-based temporal compression for
      video, achieving a 2×reduction in temporal tokens.
    1. Extended Context Length. We increase the maximum context length from 128K to 256K
      tokens, improving performance on long-context multimodal reasoning tasks.
  • Training an omni-modal MoE model introduces challenges in modality alignment, training stability, and data balancing across heterogeneous sources.

    • To preserve the strong text reasoning capabilities of the base LLM while improving multimodal performacne, we adopt a multi-stage training strategy that progressively introduces new modalities and scales context length. This staged approach mitigates catastrophic forgetting and stabilizes cross-modal alignment during training.
  • We are also releasing part of our training datasets, pipelines, and code:
    • Nemotron-Image-Training-v3: A collection of∼6.9 million training samples.
    • Examples of data generation pipelines
    • Training code on Megatron-Bridge
    • NeMo RL guide for Nemotron 3 Nano Omni

2. Model Architecture

Image

본 모델은 인코더(Encoder) – 프로젝터(Projector) – 디코더(Decoder) 구조를 따른다. Nemotron 3 Nano Omni는 Nemotron 3 Nano 30B-A3B 언어 모델을 중심으로, 비전 및 오디오 전용 인코더를 MLP 프로젝터를 통해 연결한 구조로 설계되었다.

언어 모델(LLM): Nemotron 3 Nano 30B-A3B
비전 인코더: C-RADIOv4-H
오디오 인코더: Parakeet-TDT-0.6B-v2

이미지 처리

Nemotron Nano V2 VL에서 사용하던 타일링(tiling) 방식을 제거하고, 이미지의 원본 종횡비를 유지하는 동적 해상도(dynamic resolution) 방식을 채택했다.

각 이미지는:

  • 16×16 패치로 분해, 이미지당 토큰 수는 1,024~13,312개로 제한된다.
    이는 정사각형 이미지 기준으로:
  • 최소 512×512
  • 최대 1840×1840
    해상도에 해당한다.

또한 언어 모델에 전달하기 전에 4배 다운샘플링(pixel shuffle) 을 수행하여 토큰 수를 줄인다.
Each image is decomposed into a variable number of 16 ×16 patches, with the total number of
visual tokens per image constrained between 1,024 and 13,312. This equates to an image size of
512 ×512 and 1840 ×1840, respectively, for square images. Prior to projection, we apply a pixel
shuffle operation with 4×downsampling to reduce the token count presented to the language model.

비디오 처리

비디오의 경우 Conv3D 기반 패치 임베더를 사용한다.

2개의 프레임을 1개로 압축 비디오 토큰 수 50% 감소 효과를 얻는다.

오디오 처리

오디오는 다음과 같이 처리된다.

  • 16kHz 모노로 리샘플링
  • Parakeet-TDT-0.6B-v2 FastConformer 인코더 사용
  • 10ms hop size의 Log-Mel Spectrogram 생성
  • Stride-2 Convolution 3개 적용

결과적으로:

  • 시간축 약 8배 압축
  • 초당 약 12.5개 토큰 생성
  • 토큰당 약 80ms 정보 표현
    이 가능하다.

오디오 길이 지원

오디오는:

  • 30초 단위 클립으로 분할
  • 클립당 약 375 토큰
    으로 처리된다.

학습 시:

  • 최소 0.5초
  • 최대 20분
    길이의 오디오를 사용했으며, 256K 컨텍스트를 활용하면 5시간 이상의 오디오 입력도 수용 가능하다.

멀티모달 입력 처리

비디오와 오디오가 동시에 존재하는 경우:

  • 시각 토큰
  • 오디오 토큰
    을 시간 순서대로(interleaving) 배치한다.
    이를 통해 영상과 음성을 함께 고려하는 공동 시간 추론(joint temporal reasoning) 이 가능해진다.

3. Training Recipe & Datasets

Image

옴니모달 추론 모델은 서로 다른 인코더들을 사용하기 때문에 학습이 어렵다.

이를 해결하기 위해 저자들은:

  1. SFT(Supervised Fine-Tuning)
  2. RL(Reinforcement Learning)

의 2단계 학습 전략을 사용하였다.


SFT 단계

7단계(Stage 0~6) 로 구성된다.

목표는:

  • 모달리티 정렬(alignment)
  • 멀티모달 지시 수행 능력 향상
  • 컨텍스트 길이 확장
  • Catastrophic Forgetting 방지

이다.


Stage 0: 비전 프로젝터 워밍업

학습 대상:

  • Vision MLP Projector만 학습
  • LLM 및 비전 인코더는 고정

데이터:

  • 약 935만 샘플
  • 약 155억 토큰

포함 작업:

  • 이미지 캡셔닝
  • OCR
  • 문서 이해
  • GUI 이해
  • VQA

등.


Stage 1: Vision SFT (16K)

학습 대상:

  • Vision Encoder
  • LLM

동시 학습.

주요 개선점:

고품질 텍스트 데이터 사용

기존 Nemotron Nano V2 VL의 텍스트 데이터 대신

  • Nemotron 3 Nano 30B-A3B SFT 데이터

를 사용.

데이터 재주석

Qwen3-VL 계열 모델로 노이즈 데이터를 재주석.

추론 과정(CoT) 강화

다음 모델들의 Chain-of-Thought 활용:

  • Qwen3-VL
  • Qwen3.5
  • Kimi-K2.5

도메인 확장

추가 영역:

  • GUI 이해
  • Visual Grounding
  • 차트
  • 문서 이해
  • 비디오 이해
  • 다국어

최종 데이터 규모:

  • 8,630만 샘플
  • 2,148억 토큰


Stage 2: 오디오 프로젝터 워밍업

Stage 0의 오디오 버전이다.

학습:

  • Audio Projector만 학습

고정:

  • LLM
  • Vision Encoder
  • Audio Encoder

데이터:

  • Granary v1.1 ASR
  • 5,920만 샘플
  • 114억 토큰


Stage 3: 오디오 인코더 학습

학습:

  • Audio Encoder
  • Audio Projector

고정:

  • LLM
  • Vision Encoder

데이터:

종류 | 토큰 -- | -- ASR | 22.8B Sound Understanding | 24.5B Music Understanding | 43.5B Speech Understanding | 9.6B

총:

  • 2.42억 샘플
  • 1005억 토큰


Stage 4: Joint Omni SFT (16K)

처음으로 모든 모달리티를 함께 학습한다.

학습 대상:

  • LLM
  • Vision Encoder
  • Audio Encoder
  • 모든 Projector

전체 모델 파라미터.

데이터 구성:

  • Vision
  • Text
  • Safety
  • Video
  • Audio
  • Audio+Video(Omni)

규모:

  • 3,050만 샘플
  • 573억 토큰


Stage 5: Joint Omni SFT (48K)

컨텍스트를:

  • 16K → 49,152

로 확대한다.

특징:

  • 긴 비디오 비중 증가
  • 긴 오디오-비디오 데이터 증가
  • Reasoning 데이터 강화

규모:

  • 608만 샘플
  • 335억 토큰


Stage 6: Ultra-Long Context (256K)

최종 컨텍스트 길이:

  • 262,144 토큰

으로 확장한다.

주요 목표:

  • 초장문 문서 이해
  • 장문 추론

강화.

학습 데이터:

  • 논문
  • 재무 보고서
  • 프레젠테이션

등의 장문 문서.

특히:

  • 10~100페이지 이상의 문서
  • 차트
  • 복합 문서

에 대한 이해 능력을 향상시킨다.

이 단계에서는:

  • Audio Encoder
  • Audio Projector

를 고정하고 장문 텍스트와 문서 이해에 집중한다.


전체 SFT 규모 요약

Stage 샘플 수 토큰 수
Stage 0 9.35M 15.5B
Stage 1 86.3M 214.8B
Stage 2 59.2M 11.4B
Stage 3 242.0M 100.5B
Stage 4 30.5M 57.3B
Stage 5 6.08M 33.5B
Stage 6 623K 34.0B
총합 434.1M 466.9B

즉, Nemotron 3 Nano Omni는 "Vision → Audio → Omni → Long Context" 순서로 능력을 단계적으로 쌓아 올리는 커리큘럼 학습 방식을 사용하며, 최종적으로 약 4억 3천만 개 샘플, 4,669억 토큰 규모의 SFT 데이터로 학습되었다.

Image

학습 세부사항 (Training Details)

모든 SFT 단계는 Megatron 프레임워크(Shoeybi et al., 2019), Transformer Engine, 그리고 Megatron Energon 데이터로더를 사용하여 학습되었다. 학습은 단계에 따라 NVIDIA H100 GPU 32~128 노드 규모에서 수행되었다.

학습 효율을 높이기 위해 다음과 같은 병렬화 기법을 사용하였다.

  • Tensor Parallelism(TP): 2-way
  • Expert Parallelism(EP): 32-way
  • Sequence Parallelism

또한 모든 단계는:

  • BF16 Mixed Precision
  • Online Sequence Packing
  • Balanced Greedy Knapsack Algorithm

을 활용하여 GPU 활용률을 극대화하였다.


메모리 최적화

긴 시퀀리를 GPU 메모리에 수용하기 위해 다양한 재계산(recomputation) 기법을 적용했다.

LLM 백본

다음 연산은 필요 시 다시 계산한다.

  • Attention
  • MLP
  • LayerNorm
  • MoE 활성값

Vision Encoder

32개 레이어 전체에 대해 Block-Level Recomputation 적용.

Audio Encoder

Stage 4부터 활성화 재계산 적용.

Vision / Audio Projector

Stage 5 이후 활성화 재계산 적용.


Context Parallelism

초장문 컨텍스트 처리를 위해 후반 단계에서는 Context Parallelism(CP)을 사용하였다.

Stage | Context Parallelism -- | -- Stage 5 | 2-way Stage 6 | 16-way

3.2.1 Preference Optimization

모델 선호도(preference)와 품질(quality)을 동시에 학습하기 위해

MPO (Mixed Preference Optimization) 를 사용한다.

MPO는 두 가지 손실 함수를 결합한다.

Preference Loss

DPO (Direct Preference Optimization)

Quality Loss

BCO (Binary Classifier Optimization)


데이터 생성

비전 태스크에 대해 여러 후보 응답을 생성한 후:

  • 정답 → Positive
  • 오답 → Negative

로 분류한다.


3.2.2 Text RL

텍스트 전용 RL 단계에서는:

  • LM 파라미터만 학습

한다.

목표:

  • 일반적인 추론 능력 향상
  • RLHF / RLVR 적용


Drift 방지

멀티모달 학습 과정에서 표현 공간이 변하는 것을 막기 위해

LM 입력 임베딩은 고정(freeze)한다.


3.2.3 Image RL

멀티모달 RL의 첫 단계이다.

비전 추론 능력을 향상시키기 위해 Outcome-Based RL을 수행한다.


학습 데이터

차트 / 문서 추론

약 28K

  • 차트
  • 인포그래픽
  • 문서

STEM 문제

약 19K

  • 기하
  • 대수
  • 함수

게임 및 퍼즐

약 12K

Visual QA

약 8K

GUI Grounding

약 7K

  • 모바일
  • 데스크톱

스크린샷 클릭 좌표 예측.


보상 함수

보상은 0~1 범위의 점수이다.

사용되는 검증기:

  • String Match
  • MathRuler
  • Multiple Choice
  • GUI Coordinate


Format Reward

다음 형식을 선호한다.

<think>
...
</think>

\boxed{answer}


Pass-Rate Filtering

초기 모델에서

Pass Rate < 0.8

인 문제만 유지한다.

너무 쉬운 문제는 제거한다.


3.2.4 Omni RL

논문에서 가장 중요한 RL 단계이다.

목표:

  • 이미지
  • 비디오
  • 오디오

사이의 통합 추론 능력 강화.


데이터 규모

약 120K 프롬프트

113개 하위 데이터셋


데이터 구성

Omni RL

17.6K

오디오가 포함된 비디오.

Video RL

8.5K

공간/시간/인과 추론.

Image RL

32K

  • OCR
  • 차트
  • GUI
  • 게임

Audio RL

4.2K

ASR

3.8K


ASR 보상

음성 인식 능력을 유지하기 위해

Reward = 1 − WER

를 사용한다.

WER은 텍스트 정규화 후 계산된다.


난이도 필터링

기본 모델의 Pass Rate가:

  • 0.1 ~ 0.9

인 문제만 사용한다.

Audio QA는 더 엄격하게:

  • 0.3 ~ 0.7

범위를 사용한다.


검증 방식 비중

유형 | 비중 -- | -- Multiple Choice | 34% String Matching | 31% Math Verification | 26% GUI Grounding | 6% ASR Evaluation | 3%


RL 알고리즘

논문에서는

GSPO (Group Sequence Policy Optimization)

의 수정 버전을 사용한다.


멀티모달 최적화

생성 단계에서:

  • 멀티모달 중복 제거(deduplication)
  • Tensor Parallelism
  • Expert Parallelism
  • Context Parallelism

을 활용하여 학습 효율을 높였다.


핵심 요약

Nemotron 3 Nano Omni의 RL 파이프라인은

Text RL → Image RL → Omni RL → Text RL

순으로 진행되며,

특히 Omni RL 단계에서 약 12만 개의 이미지·비디오·오디오·텍스트 추론 문제를 GSPO 기반 RL로 학습하여 멀티모달 추론 능력을 크게 향상시킨 것이 가장 중요한 특징이다.

3.2.2. Text-RL
During text-only RL, we only train the LM parameters of the model via multi-environment
RLVR/RLHF for improving general capabilities. We reuse the RL data and infrastructure from
the post-training of Nemotron 3 Nano and Super (NVIDIA et al., 2025b, 2026). As part of our
staged multi-modal training, during text-only RL stages we additionally freeze the LM input token embedding parameters to mitigate representational drift between multi-modal stages.

3.2.5. RL Training Details
Training is conducted on NVIDIA B200 and H100 GPU cluster using a Ray-based distributed
training framework built on NeMo-RL (NVIDIA, 2025). The global batch size is set to 4,096 with
16 rollouts for each prompt and a micro-batch size of 1. We apply an adapted version of Group
Sequence Policy Optimization (GSPO) (Zheng et al., 2025; Shao et al., 2024) as the RL training
algorithm.

4. 실험 (Experiments)

4.1~4.4절에서는 모델의 비전, 오디오, 텍스트 추론 능력을 평가한다. 또한:

  • 4.6절: Efficient Video Sampling(EVS)의 효율성 분석
  • 4.7~4.8절: 양자화(Quantization)가 정확도와 추론 효율에 미치는 영향 분석

을 수행한다.

비전·오디오 평가는 VLMEvalKit + vLLM, 텍스트 평가는 NeMo-Skills 프레임워크를 사용하였다.


4.1 비전 평가 (Visual Evaluations)

평가 분야는 다음과 같다.

1. STEM 추론

  • MMMU
  • MathVista-Mini

2. 문서 이해 / OCR / 차트

  • MMLongBench-Doc
  • OCRBench
  • OCRBench-V2
  • ChartQA
  • DocVQA
  • InfoVQA
  • OCR-Reasoning
  • CharXiv

3. Visual Grounding 및 공간 추론

  • TreeBench
  • CV-Bench
  • RefCOCO

4. GUI 이해

  • ScreenSpot
  • ScreenSpot-v2
  • ScreenSpot-Pro
  • OSWorld

5. 비디오 이해

  • Video-MME

결과

Nemotron 3 Nano Omni는 이전 모델인 Nemotron Nano V2 VL을 거의 모든 항목에서 크게 앞섰으며, 일부 분야에서는 Qwen3-Omni보다도 우수한 성능을 보였다.

대표적인 성능:

벤치마크 | Nemotron 3 Nano Omni -- | -- MMMU | 75.6 MathVista-Mini | 82.8 MMLongBench-Doc | 57.5 OCRBench | 86.6 ChartQA | 90.3 DocVQA | 95.6 ScreenSpot | 89.3 ScreenSpot-v2 | 92.8 VideoMME | 72.2

7.5배 향상.


단일 스트림 성능

Nemotron 3 Nano Omni:

  • 500+ output tokens/s

비교:

  • Qwen3-Omni: 175~210 tok/s
  • Nemotron Nano V2 VL: 250 tok/s

즉:

  • Qwen3-Omni 대비 2.4~2.9배
  • Nemotron Nano V2 VL 대비 2배

빠르다.


대규모 서비스

단일 B200 기준:

  • 최대 5000 tok/s

달성.

동일 인터랙티브 목표에서:

  • Qwen3-Omni 대비 9배 높은 비디오 처리량
  • Qwen3-Omni 대비 7.5배 높은 문서 처리량
  • Nemotron Nano V2 VL 대비 3배 높은 처리량

을 제공한다.


5. 결론 (Conclusion)

Nemotron 3 Nano Omni는 Nemotron 계열 최초의 네이티브 오디오 지원 옴니모달 모델이다.

핵심 기술은:

  • Nemotron 3 Nano 30B-A3B MoE 백본
  • C-RADIOv4-H 비전 인코더
  • Parakeet-TDT 오디오 인코더
  • Dynamic Resolution
  • Conv3D 비디오 압축
  • 256K 컨텍스트

이다.

결과적으로:

  • 문서 이해
  • GUI 에이전트
  • 장시간 오디오·비디오 이해
  • 음성 비서

영역에서 최고 수준의 성능을 달성했으며, 동시에 토큰 압축 기술을 통해 경쟁 모델 대비 훨씬 낮은 지연 시간과 높은 처리량을 제공한다.

또한 BF16, FP8, FP4 모델과 대규모 데이터셋 및 코드를 공개하여 오픈 멀티모달 연구 생태계 확장을 목표로 하고 있다.

Metadata

Metadata

Assignees

Labels

No labels
No labels

Projects

No projects

Milestone

No milestone

Relationships

None yet

Development

No branches or pull requests

Issue actions