Authors
Mike Ranzinger* Greg Heinrich* Collin McCarthy Jan Kautz Andrew Tao
Bryan Catanzaro Pavlo Molchanov
Abstract
By leveraging multi-teacher distillation, agglomerative vision backbones provide a unified student model that
retains and improves the distinct capabilities of multiple teachers.
본 기술 보고서에서는 C-RADIO 모델 계열의 최신 버전인 C-RADIOv4를 소개한다. 이 모델은 AM-RADIO/RADIOv2.5를 기반으로 설계되었으며, 동일한 계산 복잡도(computational complexity)에서 주요 다운스트림 작업 성능을 크게 향상시켰다.
이번에 공개하는 모델은 다음 두 가지이다.
C-RADIOv4-SO400M (412M 파라미터)
C-RADIOv4-H (631M 파라미터)
두 모델 모두 다음과 같이 업데이트된 교사 모델 세트를 사용하여 학습되었다.
SigLIP2
DINOv3
SAM3
핵심 성능 향상과 SAM3 모방을 통해 얻은 새로운 기능 외에도, C-RADIOv4 계열은 다음과 같은 개선 사항을 제공한다.
임의 해상도(any-resolution) 지원 강화
고해상도에서 효율성을 크게 향상시키는 ViTDet 모드 재도입
사용이 자유로운(permissive) 라이선스 제공
- 설명 (Description)
AM-RADIO [17]는 Agglomerative Foundation Model이라는 개념을 도입했다. 이는 여러 이질적인(heterogeneous) 모델들의 특징 표현(feature representation)을 증류하여 새로운 기반 모델(foundation model)을 만드는 방법이다.
초기 버전에서는 다음 모델들을 핵심 교사 모델로 사용했다.
DFN CLIP [11]
DINOv2 [8]
SAM [13]
또한 멀티 해상도 학습(multi-resolution training)을 도입하였다.
구체적으로는,
DFN CLIP과 DINOv2는 낮은 해상도에서 증류
SAM은 더 높은 해상도에서 증류
하도록 학습하였다.
그러나 이 과정에서 우리는 "모드 스위칭(mode switching)" 현상을 발견했다.
학생 모델이 학습 손실을 최소화하기 위해 해상도에 따라 표현 방식을 바꾸게 되며, 그 결과 추론 시 사용되는 해상도에 따라 모델의 행동이 매우 불안정해지는 문제가 발생했다.
이후 연구들에서는 다음과 같은 발전이 있었다.
PHI-S [16]
강력한 Agglomerative 모델을 학습시키기 위해서는
교사 모델 분포 균형(teacher distribution balancing)
이 중요하다는 사실을 발견했다.
RADIOv2.5 [12]
모든 교사 모델을 두 해상도 모두에서 학습시키면
모드 스위칭 문제를 해결할 수 있다는 것을 확인했다.
FeatSharp [18]
DFN CLIP이나 SigLIP 같은 고정 해상도 모델에 대해
일반적인 bilinear interpolation보다 우수한 업샘플링 방법을 제안했다.
원래 AM-RADIO에서 제시했던 핵심 주장 중 하나는 다음과 같다.
더 좋은 교사 모델은 더 좋은 학생 모델을 만든다.
이 경향은 여전히 유지되고 있다.
RADIOv2.5 이후 등장한 최신 모델들은 다음과 같다.
SigLIP2 [21]
현재 최첨단(text-image) 비전-언어 인코더
DINOv3 [19]
자기지도학습(SSL)과 Dense Representation 성능을 크게 향상시킨 모델
강력한 Dense Perception 능력을 제공한다.
SAM3 [6]
SAM의 후속 버전으로, 컴퓨터 비전 문제 해결에 상당한 진전을 이루었다.
이러한 배경에 따라 C-RADIOv4에서는 핵심 교사 세트를 다음과 같이 업그레이드하였다.
SigLIP2
DINOv3
SAM3
이를 통해 얻은 이점은 다음과 같다.
DINOv3로부터
향상된 의미론적 분할(Semantic Segmentation) 능력
SigLIP2로부터
향상된 텍스트-이미지 정렬(Text Alignment)
SAM3로부터
SAM3를 교사 모델로 사용하는 것이 선택한 벤치마크에서 직접적인 성능 향상을 보여주지는 않지만,
다음과 같은 장점이 있다.
SAM3의 비전 인코더를 C-RADIOv4로 대체 가능
RADSeg [3] 같은 Agglomerative 모델 기반 응용 활용 가능
단순히 교사 모델을 업데이트하는 것에 그치지 않고,
우리는 모델의 범용성(versatility)을 더욱 강화하였다.
주요 개선 사항은 다음과 같다.
- 향상된 Any-Resolution 지원
입력 해상도 제약을 더욱 줄임
- ViTDet 모드 재도입
Transformer 블록 대부분을
Windowed Attention
방식으로 동작시킬 수 있다.
이로 인해 고해상도 이미지에서 추론 속도가 크게 향상된다.
(논문 Figure 9 참조)
- 방법론 업데이트 (Method Updates)
Agglomerative 모델은 여러 비전 기반 모델로부터 증류를 수행한다.
RADIO 계열에서는 증류가 다음 두 종류의 표현에 대해 수행된다.
Dense Feature Space
Summary Token
본 절에서는 RADIOv2.5 이후 C-RADIOv4에서 새롭게 도입된 기술적 변경 사항을 설명한다.
2.1 업데이트된 교사 모델
C-RADIOv4에서 사용하는 교사 모델은 다음과 같다.
SigLIP2-g-384 [21]
DINOv3-7B [19]
SAM3 [6]
계산 비용(computational demand)을 줄이기 위해 ...
교사 모델 변경
이번 릴리스에서는 DFN CLIP [11] 지원을 제거하고, 대신 **SigLIP2 [21]**를 채택했다.
그 이유는 다음과 같다.
SigLIP2가 더 널리 사용되고 있음
예: Qwen3-VL [4]
두 모델의 표현(representation)과 활용 분야(application domain)가 매우 유사함
여기서 DVT [23]는 비전 모델의 출력을 다음과 같이 분해할 수 있다고 설명한다.
ViT(x)≈f(x)+g(E
pos
)+h(x,E
pos
)
여기서
f(x): 입력 이미지에 의존하는 의미 정보(semantic information)
g(E
pos
): 데이터와 무관한 고정 편향(data-invariant bias)
h(x,E
pos
): 의미 정보와 위치 정보가 얽힌(entangled) 잔차 성분
우리는 FeatSharp [18]에서도 동일한 종류의 노이즈 패턴을 발견했다.
특히 SigLIP2에서는 출력 feature map 가장자리에 다음과 같은 현상이 나타난다.
경계 부분에 "구멍(hole)" 형태의 아티팩트
또한
SAM
ViTDet [14]의 윈도우 경계에서 강한 아티팩트를 생성한다.
DINOv3-H+
상대적으로 큰 크기의 고진폭(high-magnitude) 노이즈 패치가 자주 나타난다.
이러한 문제를 그대로 두면 학생 모델은
MLP Adapter 단계에서 노이즈를 그대로 모방하게 되고
결국 Backbone Feature 자체에도 노이즈가 스며들게 된다.
이를 방지하기 위해 우리는
Shift Equivariance
기반의 두 가지 손실(loss) 기법을 도입했다.
이 방법은 학생 모델이 교사와 비교되는 패치의 정확한 위치를 알 수 없도록 만들어,
고정 위치 노이즈를 학습하는 것을 방지한다.
Figure 2에서는 이러한 아티팩트를 시각화하였다.
주로 균일한 이미지 영역에서
비정상적으로 높은 에너지를 가진 표현(high-energy representation)
형태로 나타난다.
2.2 확률적 해상도(Stochastic Resolutions)
RADIOv2.5에서는 두 개의 고정 해상도만 사용했지만,
C-RADIOv4는 학습 시 다음 해상도들 중 하나를 랜덤 샘플링한다.
저해상도 그룹
{128,192,224,256,384,432}
고해상도 그룹
{512,768,1024,1152}
이를 통해
- 더욱 부드러운 해상도 스케일링 곡선
해상도가 변해도 성능 변화가 자연스러워짐
- 저해상도 성능 향상
낮은 해상도에서도 품질이 크게 개선됨
SigLIP2 처리 방식
고해상도 학습 시
입력: 384px
출력: 1152px
으로 만들기 위해
FeatSharp [18]의 3배 업샘플링을 사용한다.
저해상도 그룹에서는 원본 출력을 그대로 사용한다.
SAM3 처리 방식
SAM3는 입력 크기가
1152×1152
로 고정되어 있기 때문에,
RADIOv2.5에서 제안한
Mosaic Augmentation
기법을 그대로 사용한다.
Figure 3, 4는 RADIO 계열의 멀티 해상도 지원이 어떻게 발전해 왔는지를 보여준다.
Figure 4에서는
DINOv2
DINOv3
와의 비교도 제공한다.
(이들 역시 멀티 해상도를 지원)
Table 2 결과에 따르면
C-RADIOv4는 Semantic Segmentation에서 해상도가 증가해도 매우 안정적이다.
심지어
학습 시 보지 못한 더 높은 해상도
에서도 강건한 성능을 유지한다.
특히
C-RADIOv4-H는 DINOv3-7B보다 약 10배 적은 파라미터 수를 사용하면서도 매우 경쟁력 있는 성능을 보인다.
2.3 Shift Equivariance
PHI-S [16] 이후 특징(feature) 손실은 다음 형태를 사용해 왔다.
Z
1
i
∑
(x−
y
^
)
2
여기서
y
^
: PHI-S 정규화가 적용된 교사 특징
x: 학생 모델의 예측
Z: 정규화 상수
하지만 이 방식에는 문제가 있다.
학생 모델이
유용한 의미 정보뿐 아니라
교사 모델에 존재하는 고정 패턴 노이즈(fixed-pattern noise)
까지 학습하게 된다.
DVT [23] 연구는 거의 모든 비전 파운데이션 모델이 이러한 노이즈를 갖고 있음을 보여주었다.
즉 학생 모델은
"이미지 내용"이 아니라
"특정 위치에서 항상 나타나는 특징"
까지 흉내 내게 된다.
2.3.1 Shift Equivariant Loss
학생 모델이 입력 의미와 무관한 특징을 모방하지 않도록 하기 위해,
특정 이미지에 대해
학생 모델 입력 crop
각 교사 모델 입력 crop
을 랜덤하게 이동(shift)시킨다.
중요한 점은
학생과 교사 사이의 shift가 다름
교사들끼리도 서로 다른 shift 사용
이라는 점이다.
우리는
F
S→T
라는 공간 변환 함수를 유지하여,
학생 특징을 교사 특징과 정렬한다.
Shift는 patch 크기 단위로 수행되어
불필요한 interpolation 효과를 최소화한다.
새로운 손실 함수는 다음과 같다.
L
spatial
(x,
y
^
)=
∣Ω∣
1
∑
u∈Ω
(F
S→T
[x]
u
−
y
^
u
)
2
여기서
Ω: 학생과 교사가 공통으로 관찰한 위치 집합
x: 학생 특징
y
^
: PHI-S 정규화된 교사 특징
이다.
2.3.2 Shift Equivariant MESA
MESA [9]는 분류 모델 학습에서 매우 중요한 기법이다.
목표는
입력에 작은 변화가 생겨도 출력이 크게 흔들리지 않는(flat) 파라미터 영역
으로 모델을 수렴시키는 것이다.
이를 통해 일반화 성능이 향상된다.
C-RADIOv4에서는 고정 패턴 노이즈를 더욱 억제하기 위해
MESA를 확장하였다.
기존 MESA는
학생 모델
EMA(Exponential Moving Average) 학생 모델
사이의 출력을 맞춘다.
하지만 여기서는 추가로
학생 모델
EMA 모델
에 서로 다른 crop을 적용한다.
그리고
F
S→
S
~
변환을 이용해 두 출력을 정렬한 후 학습한다.
즉,
"같은 위치의 특징을 맞추는 것"이 아니라
"입력 위치가 달라져도 동일한 의미 표현을 유지하도록 학습"
시키는 방식이다.
이는 결과적으로 위치 기반 노이즈 학습을 더욱 강하게 억제한다.
Shift Equivariant MESA 손실
MESA 손실은 다음과 같이 정의된다.
L
mesa
(x,
x
~
)=
∣Ω∣
1
∑
u∈Ω
(F
S→
S
~
[LN(x)]
u
−LN(
x
~
)
u
)
2
여기서
LN: 학습 가능한 affine 파라미터를 제거한 Layer Normalization
S
~
: EMA 학생 모델이 보는 crop
x
~
: EMA 학생 모델의 출력
을 의미한다.
즉, 서로 다른 crop을 본 학생 모델과 EMA 학생 모델이 동일한 의미 표현을 생성하도록 학습시키는 것이다.
2.4 DAMP
모델의 강건성(robustness)을 더욱 향상시키기 위해
**DAMP [20]**를 사용한다.
DAMP는 학습 과정에서 모델 가중치(weight)에
곱셈형 노이즈(multiplicative noise)
를 추가하는 기법이다.
직관적으로는
특정 가중치에 과도하게 의존하지 않도록 만들고
작은 파라미터 변화에도 안정적인 표현을 학습하도록 유도한다.
결과적으로
일반화 성능 향상
과적합 감소
해상도 변화 및 입력 변화에 대한 강건성 증가
효과를 기대할 수 있다.
2.5 Balanced Summary Loss
PHI-S [16]에서는 연구의 핵심이
각 교사 모델의 Spatial Feature Distribution을 정규화하는 것이었다.
목적은
큰 활성값(activation)을 가진 교사가 손실을 지배하지 못하게 하는 것이었다.
하지만 당시에는
Summary Feature
(예: CLS Token, Global Representation)
에 대해서는 특별한 처리가 없었다.
그 이유는 Summary Feature가
Cosine Similarity
로 학습되었기 때문이다.
Cosine Similarity는 본질적으로 정규화되어 있다.
cos(θ)=
∣∣x∣∣∣∣y∣∣
x⋅y
따라서 특징 벡터의 크기(norm)는 무시된다.
그러나 후속 연구에서 중요한 문제가 발견되었다.
Summary Feature는
크기(magnitude)는 정규화되지만
방향(direction)의 분포는 정규화되지 않는다.
만약 각 교사의 특징 벡터가
단위 초구(unit hypersphere)
위에 균등하게 분포한다면 문제가 없을 것이다.
하지만 실제로는 그렇지 않았다.
관측 결과,
각 교사의 특징 벡터는
전체 초구에 퍼져 있지 않고
특정 방향을 중심으로 한
원뿔(cone) 형태의 영역
안에 집중되는 경향이 있었다.
예를 들면
Teacher A
좁은 원뿔
방향 분산 작음
특징이 특정 방향에 몰림
Teacher B
넓은 원뿔
방향 분산 큼
특징이 더 넓게 퍼짐
문제는
원뿔 반경(radius)이 큰 교사일수록
Cosine Similarity 손실값이 더 크게 발생한다는 점이다.
즉,
교사마다 실제 중요도가 같은데도
방향 분산이 큰 교사가 학습을 더 강하게 지배하게 된다.
논문 저자들은 이것을
PHI-S에서 발견했던
Spatial Feature Distribution 불균형 문제의
Summary Feature 버전으로 보고 있다.
즉,
Spatial Feature → activation 크기 불균형
Summary Feature → 방향 분산 불균형
이라는 새로운 문제를 발견했고,
이를 해결하기 위해 이후에 Balanced Summary Loss를 도입한다.
(다음 문단에서 구체적인 수식이 이어짐)
Table 3: 주요 교사 모델의 Summary Token 각도 분산(Angular Dispersion)
모델 | Disp(Θy\Theta_yΘy)
-- | --
SigLIP2-g-384 | 0.694
DINOv3-H+ | 2.120
DINOv3-7B | 2.186
Balanced Summary Loss
반경(radius)이 작은 원뿔(cone)을 가진 교사보다,
반경이 큰 원뿔을 가진 교사가 더 큰 손실(loss)을 생성하게 된다.
하지만 실제로 중요한 것은
학생과 교사 사이의 단순한 각도(angle)가 아니다.
중요한 것은
다른 모든 임베딩들에 대해 상대적으로 어떤 각도를 갖는가
이다.
이 문제를 해결하기 위해
C-RADIOv4에서는 더 이상 Cosine Distance를 Summary Loss로 사용하지 않는다.
대신 다음과 같은 정규화된 Angular Loss를 사용한다.
Cosine Similarity
cos(x,y)=xTy∥x∥∥y∥\cos(x,y)=\frac{x^Ty}{\|x\|\|y\|}cos(x,y)=∥x∥∥y∥xTy
두 벡터 사이의 각도
Θ(x,y)=arccos(cos(x,y))\Theta(x,y)=\arccos(\cos(x,y))Θ(x,y)=arccos(cos(x,y))
교사 특징의 평균 방향
μy=E[y]∥E[y]∥\mu_y=\frac{E[y]}{\|E[y]\|}μy=∥E[y]∥E[y]
Angular Dispersion
Disp(Θy)=E[Θ(y,μy)2]Disp(\Theta_y)=E\left[\Theta(y,\mu_y)^2\right]Disp(Θy)=E[Θ(y,μy)2]
최종 Angular Loss
Langle(x,y)=Θ(x,y)2Disp(Θy)L_{angle}(x,y)=\frac{\Theta(x,y)^2}{Disp(\Theta_y)}Langle(x,y)=Disp(Θy)Θ(x,y)2
여기서
-
xxx: 학생 모델의 예측
-
yyy: 교사 모델의 예측
-
μy\mu_yμy: 교사 특징들의 평균 방향(mean direction)
-
Disp(Θy)Disp(\Theta_y)Disp(Θy): 교사 특징들의 각도 분산(angular dispersion)
을 의미한다.
직관적 설명
논문 저자들이 발견한 핵심 문제는 다음과 같다.
Cosine Similarity는 벡터 크기(norm)는 제거하지만,
교사마다 표현 공간의 "퍼짐 정도"는 다르다.
예를 들어,
SigLIP2
-
특징들이 특정 방향 주변에 밀집
-
좁은 cone 형성
-
Angular Dispersion 작음
DINOv3
-
특징들이 훨씬 넓게 퍼짐
-
넓은 cone 형성
-
Angular Dispersion 큼
실제 측정 결과:
모델 | Angular Dispersion
-- | --
SigLIP2 | 0.694
DINOv3-H+ | 2.120
DINOv3-7B | 2.186
즉 DINOv3의 분산이 SigLIP2보다 약 3배 크다.
왜 문제가 되는가?
기존 Cosine Loss에서는
분산이 큰 교사가 더 큰 손실을 만들어낸다.
결과적으로
DINOv3 loss >> SigLIP2 loss
가 되어,
학생 모델이
DINOv3만 열심히 따라함
SigLIP2는 상대적으로 무시됨
상태가 된다.
이는 Agglomerative Model의 목표와 정반대이다.
원래는
SigLIP2의 Text Alignment
+
DINOv3의 Dense Representation
+
SAM3의 Segmentation 능력
을 모두 흡수해야 한다.
따라서 C-RADIOv4는
각 교사의 손실을 해당 교사의 Angular Dispersion으로 나누어 정규화한다.
즉
분산이 큰 교사 → loss 축소
분산이 작은 교사 → loss 확대
가 되어,
교사 간 균형이 맞춰진다.
핵심 아이디어 한 줄 요약
PHI-S가 Spatial Feature Activation 분포를 정규화했다면,
C-RADIOv4의 Balanced Summary Loss는 Summary Embedding의 방향 분포(Angular Dispersion)를 정규화하여 여러 교사가 손실을 공평하게 기여하도록 만든 것이다.
- 결과 (Results)
3.1 평가 지표 (Metrics)
Figure 3에서는
RADIOv2.5
C-RADIOv2
C-RADIOv3
C-RADIOv4
의 ImageNet-1K Zero-shot Accuracy를 비교한다.
주목할 점은
RADIOv2.5와 C-RADIOv2는
SigLIP2 정렬(aligned) 헤드가 존재하지 않기 때문에
평가 시 DFN CLIP 헤드를 사용했다는 것이다.
일반적으로
DFN CLIP은 학생 모델이 모방하기 쉬운 교사 모델이다.
그 결과
C-RADIOv4 이전까지는
RADIOv2.5의 Zero-shot 성능을 완전히 따라잡지 못했다.
그러나 모든 C-RADIO 모델은
입력 해상도가 증가할수록 성능이 향상되는
강한 Resolution Scaling 특성
을 보여준다.
특히 C-RADIOv4는
이전 세대 대비
저해상도(low resolution)에서의 분류 성능을 크게 향상시켰다.
최고 성능은
1024px 해상도
에서 달성되었으며,
이미지 비율(aspect ratio)을 유지하는 리사이징을 사용했다.
Figure 3
ImageNet-1K Zero-shot Accuracy vs Input Resolution
입력 해상도에 따른 Zero-shot 정확도 변화
핵심 관찰:
모든 RADIO 계열 모델은 해상도가 올라갈수록 성능 향상
C-RADIOv4가 저해상도에서 가장 큰 개선
고해상도에서도 최고 성능 달성
ImageNet-1K k-NN Accuracy
Figure 4
ImageNet-1K kNN Accuracy vs Input Resolution
비교 모델:
RADIOv2.5-H
C-RADIOv3-H
C-RADIOv4-H
DINOv2-g-reg
DINOv3-H+
DINOv3-7B
k-NN 분류는
DINOv2와 기존 RADIO 논문들에서 사용했던 평가 방식이다.
이 평가에서는
백본 특징(feature)의 품질 자체를 비교할 수 있다.
즉,
Zero-shot
= 이미지 ↔ 텍스트 정렬 능력 포함
k-NN
= 순수 시각 표현 품질 평가
라고 볼 수 있다.
DINOv3의 발전
Figure 4 결과에 따르면
DINOv3는 DINOv2보다
k-NN 성능이 크게 향상되었다.
하지만 흥미로운 현상이 발견된다.
DINOv3의 성능 향상은
주로
192px ~ 256px
부근에 집중되어 있다.
그리고 해상도를 계속 높이면
오히려 성능이 감소한다.
즉,
DINOv3
저해상도 → 강함
고해상도 → 성능 감소
라는 패턴을 보인다.
RADIO 계열
반면 RADIO 계열은
해상도가 증가할수록 지속적으로 성능이 향상된다.
특히
C-RADIO 계열은 RADIOv2.5 대비
큰 폭의 개선을 보여준다.
그리고
C-RADIOv4는
대체로 C-RADIOv3보다 조금 더 우수하다.
C-RADIOv3에 대한 해석
흥미로운 점은
C-RADIOv3가 Zero-shot 평가에서는 상대적으로 약했지만
k-NN 평가에서는 상당히 강하다는 것이다.
이는
C-RADIOv3의 문제점이
전체 표현력이 부족한 것
이 아니라
SigLIP2를 정확히 모방하는 것
에 있었을 가능성을 시사한다.
즉
비전 표현 자체는 좋음
SigLIP2 스타일의 텍스트 정렬이 부족함
이라는 의미다.
C-RADIOv4는
이 문제를 개선하여
Zero-shot
k-NN
두 평가 모두에서 향상된 성능을 보인다.
의외의 결과
매우 흥미롭게도
DINOv3-H+
가
DINOv3-7B
보다 더 높은 k-NN 정확도를 보인다.
보통은
더 큰 모델 → 더 좋은 성능
을 기대하지만,
k-NN 관점에서는
H+ 모델이 더 우수한 표현을 학습한 것으로 나타난다.
가장 중요한 결과
논문 저자들이 강조하는 핵심은 다음이다.
256px 이상의 해상도부터는 C-RADIOv4-H가 DINOv3를 따라잡거나 능가한다.
즉,
DINOv3-7B
≈ 수십억 파라미터 규모 SSL 모델
C-RADIOv4-H
≈ 631M 파라미터
임에도 불구하고
고해상도 환경에서는
C-RADIOv4-H가 동등하거나 더 나은 특징 표현을 제공한다.
핵심 요약
C-RADIOv4는 저해상도 Zero-shot 성능을 크게 개선했다.
해상도가 증가할수록 성능이 꾸준히 상승한다.
DINOv3는 192~256px 부근에서 최적이며 고해상도에서 성능이 감소한다.
C-RADIOv4-H는 256px 이상부터 DINOv3-H+/7B를 따라잡거나 능가한다.
C-RADIOv3의 약점은 표현력 부족이 아니라 SigLIP2 정렬(alignment) 문제였음을 시사한다.
3.2 SAM3
이전 버전의 RADIO는 SAM(Segment Anything Model) [13] 어댑터를 지원했다.
이를 통해 RADIO가 SAM의 비전 인코더를 대체하고,
SAM의 Decoder
SAM의 Memory Stack
은 그대로 유지한 채 segmentation을 수행할 수 있었다.
이 기능은 RADSeg [3] 같은 연구에서 매우 효과적으로 활용되었다.
RADSeg는
SAM 헤드를 이용해 segmentation mask를 정제(refinement)하고
Open-Vocabulary Semantic Segmentation 분야에서 새로운 SOTA를 달성했다.
C-RADIOv4와 SAM3
C-RADIOv4에서는 지원 대상을
SAM → SAM3
로 업그레이드하였다.
즉,
SAM3에서도 비전 인코더를 C-RADIOv4로 교체할 수 있다.
저자들은 이를 위한 코드도 공개했다.
https://github.com/mranzinger/sam3-radio
Figure 6, Figure 7에서는
RADIO가 SAM3의 비전 인코더를 성공적으로 대체하는 모습을 보여준다.
실험은
SAM3 공식 데모 이미지
저자들이 준비한 이미지
두 경우 모두 수행되었다.
결과적으로
RADIO는 SAM3의 Perception Encoder를 거의 문제없이 대체할 수 있었다.
SA-Co/Gold 인스턴스 분할 성능
Table 5에서는
SA-Co/Gold [6] 인스턴스 분할 벤치마크 결과를 보고한다.
저자들은
C-RADIOv4가 전체 2위 성능을 기록했다고 설명한다.
다만 SAM3의 비전 인코더를 완벽하게 대체하지는 못한다.
자연 이미지 영역
다음 데이터셋에서는
RADIO와 SAM3의 성능 차이가 상대적으로 작다.
metaclip_nps
sa1b_nps
이들은 대부분 자연 이미지(natural image)로 구성되어 있다.
어려운 도메인
반면 다음 데이터셋에서는
격차가 훨씬 커진다.
fg_sports_equipment
wiki_common
이는 현재 RADIO가
SAM3의 표현 공간을 완벽하게 모방하지 못함을 의미한다.
저자들은
SAM3를 더욱 잘 모방하는 것은 앞으로의 중요한 연구 방향이다.
라고 언급한다.
ViTDet 모드
C-RADIOv4는 ViTDet [14] 모드를 지원한다.
모델은 두 가지 방식으로 동작할 수 있다.
- Global Attention
모든 토큰이 서로를 참조
Attention Complexity
≈ O(T²)
2. ViTDet Mode
대부분 Window Attention
일부 Layer만 Global Attention
모델 생성 시
vitdet_window_size
파라미터로 제어 가능하다.
SAM3 구조
SAM3는
ViT-L+ 기반 구조를 사용한다.
구성:
Global Layer 4개
나머지는 24×24 Window Attention
C-RADIOv4
더 유연하다.
지원 Window 크기:
6×6
~
32×32
단,
다음 조건은 만족해야 한다.
window_size × patch_size
가
입력 해상도를 정확히 나누어야 한다.
Window 크기와 성능
작은 Window는
Self-Attention의 이차 비용(quadratic cost)을 줄인다.
따라서
작은 Window
→ 더 빠름
하지만
작은 Window
→ 품질 약간 감소 가능
이라는 trade-off가 존재한다.
A100 추론 속도
Figure 9는
A100 GPU에서의 단일 이미지 추론 시간을 보여준다.
SO400M 모델
Window Size ≤ 12
인 경우
SAM3 인코더보다 빠르다.
H 모델
Window Size = 8
이면
SAM3와 거의 비슷한 속도를 달성한다.
Figure 5
256px ~ 4096px 해상도에서
ViTDet 사용 여부에 따른 지연 시간을 측정했다.
흥미로운 점은
ViTDet를 사용해도
이론적 복잡도는 여전히
O(T
2
)
이다.
왜냐하면
4개의 Layer는 여전히 Global Attention을 사용하기 때문이다.
그러나 실제로는
복잡도 앞의 상수 계수(growth factor)가 크게 감소하여
고해상도에서 매우 큰 속도 향상을 제공한다.
흥미로운 사례: "person" 쿼리
SAM3 GitHub에는
Issue #253 이 존재한다.
문제:
Text Prompt = "person"
을 입력하면
SAM3 데모가 정상 동작하지 않는다.
저자들도 동일한 문제를 재현했다.
하지만
C-RADIOv4를 비전 백본으로 사용하면
"person"
쿼리가 정상 동작한다.
(Figure 8)
다음 두 경우 모두 성공했다.
Global Attention
ViTDet Window Size = 8
이는
RADIO와 SAM3의 표현 공간(representation space) 차이가
해당 쿼리에서 임계값(thresholding) 효과를 일으킨 것으로 보인다고 저자들은 추측한다.
즉,
약간 다른 feature distribution 덕분에
"person" 탐지가 활성화된 것으로 해석된다.
- 결론 (Conclusion)
C-RADIOv4는 다음 두 가지 요인 덕분에
이전 세대 대비 큰 성능 향상을 달성했다.
- 더 강력한 교사 모델
특히
DINOv3
의 발전
- 향상된 증류 알고리즘
Shift Equivariant Loss
Shift Equivariant MESA
DAMP
Balanced Summary Loss
등
이번 릴리스의 특징은
새로운
SO400M (412M 파라미터)
모델을 포함한다는 점이다.
SO400M은
종종 ViT-H급 모델과 경쟁 가능한 성능을 제공하면서도
비용은 훨씬 낮다.
또한
C-RADIOv4는
SAM3의 비전 인코더를 성공적으로 대체할 수 있으며,
특히
SO400M + ViTDet (window ≤ 12)
설정에서는
SAM3의 ViT-L+ Perception Encoder보다 더 빠르다.
RADIO의 실제 활용 사례
이전 RADIO 모델들은 이미 다양한 분야에 활용되고 있다.
Vision-Language Models
Nemotron Nano V2 VL [15]
자율주행
Autonomous Vehicles
로보틱스
Robotics
OCR 문서 분석
OCR Document Parsing [7]
Open-Vocabulary Segmentation
RADSeg [3]
기타 연구 [2]
최종 메시지
C-RADIOv4는
DINOv3
+
SigLIP2
+
SAM3
의 능력을 하나의 모델로 통합하면서,
Any-resolution 지원
SAM3 백본 대체
ViTDet 기반 고속 추론
상업적 사용 가능 라이선스
까지 제공한다.
저자들은 이 모델이 학계와 산업계 모두에서 폭넓게 활용되기를 기대한다고 결론짓고 있다.
한 줄 요약
C-RADIOv4는 DINOv3·SigLIP2·SAM3를 하나의 412M~631M 규모 모델에 압축한 Agglomerative Vision Foundation Model로, 고해상도 성능·멀티해상도 지원·SAM3 호환성·추론 효율성을 동시에 크게 향상시킨 최신 RADIO 계열 모델이다.
Authors
Mike Ranzinger* Greg Heinrich* Collin McCarthy Jan Kautz Andrew Tao
Bryan Catanzaro Pavlo Molchanov
Abstract
By leveraging multi-teacher distillation, agglomerative vision backbones provide a unified student model that
retains and improves the distinct capabilities of multiple teachers.
본 기술 보고서에서는 C-RADIO 모델 계열의 최신 버전인 C-RADIOv4를 소개한다. 이 모델은 AM-RADIO/RADIOv2.5를 기반으로 설계되었으며, 동일한 계산 복잡도(computational complexity)에서 주요 다운스트림 작업 성능을 크게 향상시켰다.
이번에 공개하는 모델은 다음 두 가지이다.
C-RADIOv4-SO400M (412M 파라미터)
C-RADIOv4-H (631M 파라미터)
두 모델 모두 다음과 같이 업데이트된 교사 모델 세트를 사용하여 학습되었다.
SigLIP2
DINOv3
SAM3
핵심 성능 향상과 SAM3 모방을 통해 얻은 새로운 기능 외에도, C-RADIOv4 계열은 다음과 같은 개선 사항을 제공한다.
임의 해상도(any-resolution) 지원 강화
고해상도에서 효율성을 크게 향상시키는 ViTDet 모드 재도입
사용이 자유로운(permissive) 라이선스 제공
AM-RADIO [17]는 Agglomerative Foundation Model이라는 개념을 도입했다. 이는 여러 이질적인(heterogeneous) 모델들의 특징 표현(feature representation)을 증류하여 새로운 기반 모델(foundation model)을 만드는 방법이다.
초기 버전에서는 다음 모델들을 핵심 교사 모델로 사용했다.
DFN CLIP [11]
DINOv2 [8]
SAM [13]
또한 멀티 해상도 학습(multi-resolution training)을 도입하였다.
구체적으로는,
DFN CLIP과 DINOv2는 낮은 해상도에서 증류
SAM은 더 높은 해상도에서 증류
하도록 학습하였다.
그러나 이 과정에서 우리는 "모드 스위칭(mode switching)" 현상을 발견했다.
학생 모델이 학습 손실을 최소화하기 위해 해상도에 따라 표현 방식을 바꾸게 되며, 그 결과 추론 시 사용되는 해상도에 따라 모델의 행동이 매우 불안정해지는 문제가 발생했다.
이후 연구들에서는 다음과 같은 발전이 있었다.
PHI-S [16]
강력한 Agglomerative 모델을 학습시키기 위해서는
교사 모델 분포 균형(teacher distribution balancing)
이 중요하다는 사실을 발견했다.
RADIOv2.5 [12]
모든 교사 모델을 두 해상도 모두에서 학습시키면
모드 스위칭 문제를 해결할 수 있다는 것을 확인했다.
FeatSharp [18]
DFN CLIP이나 SigLIP 같은 고정 해상도 모델에 대해
일반적인 bilinear interpolation보다 우수한 업샘플링 방법을 제안했다.
원래 AM-RADIO에서 제시했던 핵심 주장 중 하나는 다음과 같다.
더 좋은 교사 모델은 더 좋은 학생 모델을 만든다.
이 경향은 여전히 유지되고 있다.
RADIOv2.5 이후 등장한 최신 모델들은 다음과 같다.
SigLIP2 [21]
현재 최첨단(text-image) 비전-언어 인코더
DINOv3 [19]
자기지도학습(SSL)과 Dense Representation 성능을 크게 향상시킨 모델
강력한 Dense Perception 능력을 제공한다.
SAM3 [6]
SAM의 후속 버전으로, 컴퓨터 비전 문제 해결에 상당한 진전을 이루었다.
이러한 배경에 따라 C-RADIOv4에서는 핵심 교사 세트를 다음과 같이 업그레이드하였다.
SigLIP2
DINOv3
SAM3
이를 통해 얻은 이점은 다음과 같다.
DINOv3로부터
향상된 의미론적 분할(Semantic Segmentation) 능력
SigLIP2로부터
향상된 텍스트-이미지 정렬(Text Alignment)
SAM3로부터
SAM3를 교사 모델로 사용하는 것이 선택한 벤치마크에서 직접적인 성능 향상을 보여주지는 않지만,
다음과 같은 장점이 있다.
SAM3의 비전 인코더를 C-RADIOv4로 대체 가능
RADSeg [3] 같은 Agglomerative 모델 기반 응용 활용 가능
단순히 교사 모델을 업데이트하는 것에 그치지 않고,
우리는 모델의 범용성(versatility)을 더욱 강화하였다.
주요 개선 사항은 다음과 같다.
입력 해상도 제약을 더욱 줄임
Transformer 블록 대부분을
Windowed Attention
방식으로 동작시킬 수 있다.
이로 인해 고해상도 이미지에서 추론 속도가 크게 향상된다.
(논문 Figure 9 참조)
Agglomerative 모델은 여러 비전 기반 모델로부터 증류를 수행한다.
RADIO 계열에서는 증류가 다음 두 종류의 표현에 대해 수행된다.
Dense Feature Space
Summary Token
본 절에서는 RADIOv2.5 이후 C-RADIOv4에서 새롭게 도입된 기술적 변경 사항을 설명한다.
2.1 업데이트된 교사 모델
C-RADIOv4에서 사용하는 교사 모델은 다음과 같다.
SigLIP2-g-384 [21]
DINOv3-7B [19]
SAM3 [6]
계산 비용(computational demand)을 줄이기 위해 ...
교사 모델 변경
이번 릴리스에서는 DFN CLIP [11] 지원을 제거하고, 대신 **SigLIP2 [21]**를 채택했다.
그 이유는 다음과 같다.
SigLIP2가 더 널리 사용되고 있음
예: Qwen3-VL [4]
두 모델의 표현(representation)과 활용 분야(application domain)가 매우 유사함
여기서 DVT [23]는 비전 모델의 출력을 다음과 같이 분해할 수 있다고 설명한다.
ViT(x)≈f(x)+g(E
pos
)+h(x,E
pos
)
여기서
f(x): 입력 이미지에 의존하는 의미 정보(semantic information)
g(E
pos
): 데이터와 무관한 고정 편향(data-invariant bias)
h(x,E
pos
): 의미 정보와 위치 정보가 얽힌(entangled) 잔차 성분
우리는 FeatSharp [18]에서도 동일한 종류의 노이즈 패턴을 발견했다.
특히 SigLIP2에서는 출력 feature map 가장자리에 다음과 같은 현상이 나타난다.
경계 부분에 "구멍(hole)" 형태의 아티팩트
또한
SAM
ViTDet [14]의 윈도우 경계에서 강한 아티팩트를 생성한다.
DINOv3-H+
상대적으로 큰 크기의 고진폭(high-magnitude) 노이즈 패치가 자주 나타난다.
이러한 문제를 그대로 두면 학생 모델은
MLP Adapter 단계에서 노이즈를 그대로 모방하게 되고
결국 Backbone Feature 자체에도 노이즈가 스며들게 된다.
이를 방지하기 위해 우리는
Shift Equivariance
기반의 두 가지 손실(loss) 기법을 도입했다.
이 방법은 학생 모델이 교사와 비교되는 패치의 정확한 위치를 알 수 없도록 만들어,
고정 위치 노이즈를 학습하는 것을 방지한다.
Figure 2에서는 이러한 아티팩트를 시각화하였다.
주로 균일한 이미지 영역에서
비정상적으로 높은 에너지를 가진 표현(high-energy representation)
형태로 나타난다.
2.2 확률적 해상도(Stochastic Resolutions)
RADIOv2.5에서는 두 개의 고정 해상도만 사용했지만,
C-RADIOv4는 학습 시 다음 해상도들 중 하나를 랜덤 샘플링한다.
저해상도 그룹
{128,192,224,256,384,432}
고해상도 그룹
{512,768,1024,1152}
이를 통해
해상도가 변해도 성능 변화가 자연스러워짐
낮은 해상도에서도 품질이 크게 개선됨
SigLIP2 처리 방식
고해상도 학습 시
입력: 384px
출력: 1152px
으로 만들기 위해
FeatSharp [18]의 3배 업샘플링을 사용한다.
저해상도 그룹에서는 원본 출력을 그대로 사용한다.
SAM3 처리 방식
SAM3는 입력 크기가
1152×1152
로 고정되어 있기 때문에,
RADIOv2.5에서 제안한
Mosaic Augmentation
기법을 그대로 사용한다.
Figure 3, 4는 RADIO 계열의 멀티 해상도 지원이 어떻게 발전해 왔는지를 보여준다.
Figure 4에서는
DINOv2
DINOv3
와의 비교도 제공한다.
(이들 역시 멀티 해상도를 지원)
Table 2 결과에 따르면
C-RADIOv4는 Semantic Segmentation에서 해상도가 증가해도 매우 안정적이다.
심지어
학습 시 보지 못한 더 높은 해상도
에서도 강건한 성능을 유지한다.
특히
C-RADIOv4-H는 DINOv3-7B보다 약 10배 적은 파라미터 수를 사용하면서도 매우 경쟁력 있는 성능을 보인다.
2.3 Shift Equivariance
PHI-S [16] 이후 특징(feature) 손실은 다음 형태를 사용해 왔다.
Z
1
i
∑
(x−
y
^
)
2
여기서
y
^
: PHI-S 정규화가 적용된 교사 특징
x: 학생 모델의 예측
Z: 정규화 상수
하지만 이 방식에는 문제가 있다.
학생 모델이
유용한 의미 정보뿐 아니라
교사 모델에 존재하는 고정 패턴 노이즈(fixed-pattern noise)
까지 학습하게 된다.
DVT [23] 연구는 거의 모든 비전 파운데이션 모델이 이러한 노이즈를 갖고 있음을 보여주었다.
즉 학생 모델은
"이미지 내용"이 아니라
"특정 위치에서 항상 나타나는 특징"
까지 흉내 내게 된다.
2.3.1 Shift Equivariant Loss
학생 모델이 입력 의미와 무관한 특징을 모방하지 않도록 하기 위해,
특정 이미지에 대해
학생 모델 입력 crop
각 교사 모델 입력 crop
을 랜덤하게 이동(shift)시킨다.
중요한 점은
학생과 교사 사이의 shift가 다름
교사들끼리도 서로 다른 shift 사용
이라는 점이다.
우리는
F
S→T
라는 공간 변환 함수를 유지하여,
학생 특징을 교사 특징과 정렬한다.
Shift는 patch 크기 단위로 수행되어
불필요한 interpolation 효과를 최소화한다.
새로운 손실 함수는 다음과 같다.
L
spatial
(x,
y
^
)=
∣Ω∣
1
∑
u∈Ω
(F
S→T
[x]
u
−
y
^
u
)
2
여기서
Ω: 학생과 교사가 공통으로 관찰한 위치 집합
x: 학생 특징
y
^
: PHI-S 정규화된 교사 특징
이다.
2.3.2 Shift Equivariant MESA
MESA [9]는 분류 모델 학습에서 매우 중요한 기법이다.
목표는
입력에 작은 변화가 생겨도 출력이 크게 흔들리지 않는(flat) 파라미터 영역
으로 모델을 수렴시키는 것이다.
이를 통해 일반화 성능이 향상된다.
C-RADIOv4에서는 고정 패턴 노이즈를 더욱 억제하기 위해
MESA를 확장하였다.
기존 MESA는
학생 모델
EMA(Exponential Moving Average) 학생 모델
사이의 출력을 맞춘다.
하지만 여기서는 추가로
학생 모델
EMA 모델
에 서로 다른 crop을 적용한다.
그리고
F
S→
S
~
변환을 이용해 두 출력을 정렬한 후 학습한다.
즉,
"같은 위치의 특징을 맞추는 것"이 아니라
"입력 위치가 달라져도 동일한 의미 표현을 유지하도록 학습"
시키는 방식이다.
이는 결과적으로 위치 기반 노이즈 학습을 더욱 강하게 억제한다.
Shift Equivariant MESA 손실
MESA 손실은 다음과 같이 정의된다.
L
mesa
(x,
x
~
)=
∣Ω∣
1
∑
u∈Ω
(F
S→
S
~
[LN(x)]
u
−LN(
x
~
)
u
)
2
여기서
LN: 학습 가능한 affine 파라미터를 제거한 Layer Normalization
S
~
: EMA 학생 모델이 보는 crop
x
~
: EMA 학생 모델의 출력
을 의미한다.
즉, 서로 다른 crop을 본 학생 모델과 EMA 학생 모델이 동일한 의미 표현을 생성하도록 학습시키는 것이다.
2.4 DAMP
모델의 강건성(robustness)을 더욱 향상시키기 위해
**DAMP [20]**를 사용한다.
DAMP는 학습 과정에서 모델 가중치(weight)에
곱셈형 노이즈(multiplicative noise)
를 추가하는 기법이다.
직관적으로는
특정 가중치에 과도하게 의존하지 않도록 만들고
작은 파라미터 변화에도 안정적인 표현을 학습하도록 유도한다.
결과적으로
일반화 성능 향상
과적합 감소
해상도 변화 및 입력 변화에 대한 강건성 증가
효과를 기대할 수 있다.
2.5 Balanced Summary Loss
PHI-S [16]에서는 연구의 핵심이
각 교사 모델의 Spatial Feature Distribution을 정규화하는 것이었다.
목적은
큰 활성값(activation)을 가진 교사가 손실을 지배하지 못하게 하는 것이었다.
하지만 당시에는
Summary Feature
(예: CLS Token, Global Representation)
에 대해서는 특별한 처리가 없었다.
그 이유는 Summary Feature가
Cosine Similarity
로 학습되었기 때문이다.
Cosine Similarity는 본질적으로 정규화되어 있다.
cos(θ)=
∣∣x∣∣∣∣y∣∣
x⋅y
따라서 특징 벡터의 크기(norm)는 무시된다.
그러나 후속 연구에서 중요한 문제가 발견되었다.
Summary Feature는
크기(magnitude)는 정규화되지만
방향(direction)의 분포는 정규화되지 않는다.
만약 각 교사의 특징 벡터가
단위 초구(unit hypersphere)
위에 균등하게 분포한다면 문제가 없을 것이다.
하지만 실제로는 그렇지 않았다.
관측 결과,
각 교사의 특징 벡터는
전체 초구에 퍼져 있지 않고
특정 방향을 중심으로 한
원뿔(cone) 형태의 영역
안에 집중되는 경향이 있었다.
예를 들면
Teacher A
좁은 원뿔
방향 분산 작음
특징이 특정 방향에 몰림
Teacher B
넓은 원뿔
방향 분산 큼
특징이 더 넓게 퍼짐
문제는
원뿔 반경(radius)이 큰 교사일수록
Cosine Similarity 손실값이 더 크게 발생한다는 점이다.
즉,
교사마다 실제 중요도가 같은데도
방향 분산이 큰 교사가 학습을 더 강하게 지배하게 된다.
논문 저자들은 이것을
PHI-S에서 발견했던
Spatial Feature Distribution 불균형 문제의
Summary Feature 버전으로 보고 있다.
즉,
Spatial Feature → activation 크기 불균형
Summary Feature → 방향 분산 불균형
이라는 새로운 문제를 발견했고,
이를 해결하기 위해 이후에 Balanced Summary Loss를 도입한다.
(다음 문단에서 구체적인 수식이 이어짐)
Table 3: 주요 교사 모델의 Summary Token 각도 분산(Angular Dispersion)
Balanced Summary Loss
반경(radius)이 작은 원뿔(cone)을 가진 교사보다,
반경이 큰 원뿔을 가진 교사가 더 큰 손실(loss)을 생성하게 된다.
하지만 실제로 중요한 것은
학생과 교사 사이의 단순한 각도(angle)가 아니다.
중요한 것은
다른 모든 임베딩들에 대해 상대적으로 어떤 각도를 갖는가
이다.
이 문제를 해결하기 위해
C-RADIOv4에서는 더 이상 Cosine Distance를 Summary Loss로 사용하지 않는다.
대신 다음과 같은 정규화된 Angular Loss를 사용한다.
Cosine Similarity
cos(x,y)=xTy∥x∥∥y∥\cos(x,y)=\frac{x^Ty}{\|x\|\|y\|}cos(x,y)=∥x∥∥y∥xTy
두 벡터 사이의 각도
Θ(x,y)=arccos(cos(x,y))\Theta(x,y)=\arccos(\cos(x,y))Θ(x,y)=arccos(cos(x,y))
교사 특징의 평균 방향
μy=E[y]∥E[y]∥\mu_y=\frac{E[y]}{\|E[y]\|}μy=∥E[y]∥E[y]
Angular Dispersion
Disp(Θy)=E[Θ(y,μy)2]Disp(\Theta_y)=E\left[\Theta(y,\mu_y)^2\right]Disp(Θy)=E[Θ(y,μy)2]
최종 Angular Loss
Langle(x,y)=Θ(x,y)2Disp(Θy)L_{angle}(x,y)=\frac{\Theta(x,y)^2}{Disp(\Theta_y)}Langle(x,y)=Disp(Θy)Θ(x,y)2
여기서
을 의미한다.
직관적 설명
논문 저자들이 발견한 핵심 문제는 다음과 같다.
Cosine Similarity는 벡터 크기(norm)는 제거하지만,
교사마다 표현 공간의 "퍼짐 정도"는 다르다.
예를 들어,
SigLIP2
DINOv3
실제 측정 결과:
즉 DINOv3의 분산이 SigLIP2보다 약 3배 크다.
왜 문제가 되는가?
기존 Cosine Loss에서는
분산이 큰 교사가 더 큰 손실을 만들어낸다.
결과적으로
가 되어,
학생 모델이
상태가 된다.
이는 Agglomerative Model의 목표와 정반대이다.
원래는
을 모두 흡수해야 한다.
따라서 C-RADIOv4는
각 교사의 손실을 해당 교사의 Angular Dispersion으로 나누어 정규화한다.
즉
가 되어,
교사 간 균형이 맞춰진다.
핵심 아이디어 한 줄 요약
PHI-S가 Spatial Feature Activation 분포를 정규화했다면,
C-RADIOv4의 Balanced Summary Loss는 Summary Embedding의 방향 분포(Angular Dispersion)를 정규화하여 여러 교사가 손실을 공평하게 기여하도록 만든 것이다.
3.1 평가 지표 (Metrics)
Figure 3에서는
RADIOv2.5
C-RADIOv2
C-RADIOv3
C-RADIOv4
의 ImageNet-1K Zero-shot Accuracy를 비교한다.
주목할 점은
RADIOv2.5와 C-RADIOv2는
SigLIP2 정렬(aligned) 헤드가 존재하지 않기 때문에
평가 시 DFN CLIP 헤드를 사용했다는 것이다.
일반적으로
DFN CLIP은 학생 모델이 모방하기 쉬운 교사 모델이다.
그 결과
C-RADIOv4 이전까지는
RADIOv2.5의 Zero-shot 성능을 완전히 따라잡지 못했다.
그러나 모든 C-RADIO 모델은
입력 해상도가 증가할수록 성능이 향상되는
강한 Resolution Scaling 특성
을 보여준다.
특히 C-RADIOv4는
이전 세대 대비
저해상도(low resolution)에서의 분류 성능을 크게 향상시켰다.
최고 성능은
1024px 해상도
에서 달성되었으며,
이미지 비율(aspect ratio)을 유지하는 리사이징을 사용했다.
Figure 3
ImageNet-1K Zero-shot Accuracy vs Input Resolution
입력 해상도에 따른 Zero-shot 정확도 변화
핵심 관찰:
모든 RADIO 계열 모델은 해상도가 올라갈수록 성능 향상
C-RADIOv4가 저해상도에서 가장 큰 개선
고해상도에서도 최고 성능 달성
ImageNet-1K k-NN Accuracy
Figure 4
ImageNet-1K kNN Accuracy vs Input Resolution
비교 모델:
RADIOv2.5-H
C-RADIOv3-H
C-RADIOv4-H
DINOv2-g-reg
DINOv3-H+
DINOv3-7B
k-NN 분류는
DINOv2와 기존 RADIO 논문들에서 사용했던 평가 방식이다.
이 평가에서는
백본 특징(feature)의 품질 자체를 비교할 수 있다.
즉,
Zero-shot
= 이미지 ↔ 텍스트 정렬 능력 포함
k-NN
= 순수 시각 표현 품질 평가
라고 볼 수 있다.
DINOv3의 발전
Figure 4 결과에 따르면
DINOv3는 DINOv2보다
k-NN 성능이 크게 향상되었다.
하지만 흥미로운 현상이 발견된다.
DINOv3의 성능 향상은
주로
192px ~ 256px
부근에 집중되어 있다.
그리고 해상도를 계속 높이면
오히려 성능이 감소한다.
즉,
DINOv3
저해상도 → 강함
고해상도 → 성능 감소
라는 패턴을 보인다.
RADIO 계열
반면 RADIO 계열은
해상도가 증가할수록 지속적으로 성능이 향상된다.
특히
C-RADIO 계열은 RADIOv2.5 대비
큰 폭의 개선을 보여준다.
그리고
C-RADIOv4는
대체로 C-RADIOv3보다 조금 더 우수하다.
C-RADIOv3에 대한 해석
흥미로운 점은
C-RADIOv3가 Zero-shot 평가에서는 상대적으로 약했지만
k-NN 평가에서는 상당히 강하다는 것이다.
이는
C-RADIOv3의 문제점이
전체 표현력이 부족한 것
이 아니라
SigLIP2를 정확히 모방하는 것
에 있었을 가능성을 시사한다.
즉
비전 표현 자체는 좋음
SigLIP2 스타일의 텍스트 정렬이 부족함
이라는 의미다.
C-RADIOv4는
이 문제를 개선하여
Zero-shot
k-NN
두 평가 모두에서 향상된 성능을 보인다.
의외의 결과
매우 흥미롭게도
DINOv3-H+
가
DINOv3-7B
보다 더 높은 k-NN 정확도를 보인다.
보통은
더 큰 모델 → 더 좋은 성능
을 기대하지만,
k-NN 관점에서는
H+ 모델이 더 우수한 표현을 학습한 것으로 나타난다.
가장 중요한 결과
논문 저자들이 강조하는 핵심은 다음이다.
256px 이상의 해상도부터는 C-RADIOv4-H가 DINOv3를 따라잡거나 능가한다.
즉,
DINOv3-7B
≈ 수십억 파라미터 규모 SSL 모델
C-RADIOv4-H
≈ 631M 파라미터
임에도 불구하고
고해상도 환경에서는
C-RADIOv4-H가 동등하거나 더 나은 특징 표현을 제공한다.
핵심 요약
C-RADIOv4는 저해상도 Zero-shot 성능을 크게 개선했다.
해상도가 증가할수록 성능이 꾸준히 상승한다.
DINOv3는 192~256px 부근에서 최적이며 고해상도에서 성능이 감소한다.
C-RADIOv4-H는 256px 이상부터 DINOv3-H+/7B를 따라잡거나 능가한다.
C-RADIOv3의 약점은 표현력 부족이 아니라 SigLIP2 정렬(alignment) 문제였음을 시사한다.
3.2 SAM3
이전 버전의 RADIO는 SAM(Segment Anything Model) [13] 어댑터를 지원했다.
이를 통해 RADIO가 SAM의 비전 인코더를 대체하고,
SAM의 Decoder
SAM의 Memory Stack
은 그대로 유지한 채 segmentation을 수행할 수 있었다.
이 기능은 RADSeg [3] 같은 연구에서 매우 효과적으로 활용되었다.
RADSeg는
SAM 헤드를 이용해 segmentation mask를 정제(refinement)하고
Open-Vocabulary Semantic Segmentation 분야에서 새로운 SOTA를 달성했다.
C-RADIOv4와 SAM3
C-RADIOv4에서는 지원 대상을
SAM → SAM3
로 업그레이드하였다.
즉,
SAM3에서도 비전 인코더를 C-RADIOv4로 교체할 수 있다.
저자들은 이를 위한 코드도 공개했다.
https://github.com/mranzinger/sam3-radio
Figure 6, Figure 7에서는
RADIO가 SAM3의 비전 인코더를 성공적으로 대체하는 모습을 보여준다.
실험은
SAM3 공식 데모 이미지
저자들이 준비한 이미지
두 경우 모두 수행되었다.
결과적으로
RADIO는 SAM3의 Perception Encoder를 거의 문제없이 대체할 수 있었다.
SA-Co/Gold 인스턴스 분할 성능
Table 5에서는
SA-Co/Gold [6] 인스턴스 분할 벤치마크 결과를 보고한다.
저자들은
C-RADIOv4가 전체 2위 성능을 기록했다고 설명한다.
다만 SAM3의 비전 인코더를 완벽하게 대체하지는 못한다.
자연 이미지 영역
다음 데이터셋에서는
RADIO와 SAM3의 성능 차이가 상대적으로 작다.
metaclip_nps
sa1b_nps
이들은 대부분 자연 이미지(natural image)로 구성되어 있다.
어려운 도메인
반면 다음 데이터셋에서는
격차가 훨씬 커진다.
fg_sports_equipment
wiki_common
이는 현재 RADIO가
SAM3의 표현 공간을 완벽하게 모방하지 못함을 의미한다.
저자들은
SAM3를 더욱 잘 모방하는 것은 앞으로의 중요한 연구 방향이다.
라고 언급한다.
ViTDet 모드
C-RADIOv4는 ViTDet [14] 모드를 지원한다.
모델은 두 가지 방식으로 동작할 수 있다.
모든 토큰이 서로를 참조
Attention Complexity
≈ O(T²)
2. ViTDet Mode
대부분 Window Attention
일부 Layer만 Global Attention
모델 생성 시
vitdet_window_size
파라미터로 제어 가능하다.
SAM3 구조
SAM3는
ViT-L+ 기반 구조를 사용한다.
구성:
Global Layer 4개
나머지는 24×24 Window Attention
C-RADIOv4
더 유연하다.
지원 Window 크기:
6×6
~
32×32
단,
다음 조건은 만족해야 한다.
window_size × patch_size
가
입력 해상도를 정확히 나누어야 한다.
Window 크기와 성능
작은 Window는
Self-Attention의 이차 비용(quadratic cost)을 줄인다.
따라서
작은 Window
→ 더 빠름
하지만
작은 Window
→ 품질 약간 감소 가능
이라는 trade-off가 존재한다.
A100 추론 속도
Figure 9는
A100 GPU에서의 단일 이미지 추론 시간을 보여준다.
SO400M 모델
Window Size ≤ 12
인 경우
SAM3 인코더보다 빠르다.
H 모델
Window Size = 8
이면
SAM3와 거의 비슷한 속도를 달성한다.
Figure 5
256px ~ 4096px 해상도에서
ViTDet 사용 여부에 따른 지연 시간을 측정했다.
흥미로운 점은
ViTDet를 사용해도
이론적 복잡도는 여전히
O(T
2
)
이다.
왜냐하면
4개의 Layer는 여전히 Global Attention을 사용하기 때문이다.
그러나 실제로는
복잡도 앞의 상수 계수(growth factor)가 크게 감소하여
고해상도에서 매우 큰 속도 향상을 제공한다.
흥미로운 사례: "person" 쿼리
SAM3 GitHub에는
Issue #253 이 존재한다.
문제:
Text Prompt = "person"
을 입력하면
SAM3 데모가 정상 동작하지 않는다.
저자들도 동일한 문제를 재현했다.
하지만
C-RADIOv4를 비전 백본으로 사용하면
"person"
쿼리가 정상 동작한다.
(Figure 8)
다음 두 경우 모두 성공했다.
Global Attention
ViTDet Window Size = 8
이는
RADIO와 SAM3의 표현 공간(representation space) 차이가
해당 쿼리에서 임계값(thresholding) 효과를 일으킨 것으로 보인다고 저자들은 추측한다.
즉,
약간 다른 feature distribution 덕분에
"person" 탐지가 활성화된 것으로 해석된다.
C-RADIOv4는 다음 두 가지 요인 덕분에
이전 세대 대비 큰 성능 향상을 달성했다.
특히
DINOv3
의 발전
Shift Equivariant Loss
Shift Equivariant MESA
DAMP
Balanced Summary Loss
등
이번 릴리스의 특징은
새로운
SO400M (412M 파라미터)
모델을 포함한다는 점이다.
SO400M은
종종 ViT-H급 모델과 경쟁 가능한 성능을 제공하면서도
비용은 훨씬 낮다.
또한
C-RADIOv4는
SAM3의 비전 인코더를 성공적으로 대체할 수 있으며,
특히
SO400M + ViTDet (window ≤ 12)
설정에서는
SAM3의 ViT-L+ Perception Encoder보다 더 빠르다.
RADIO의 실제 활용 사례
이전 RADIO 모델들은 이미 다양한 분야에 활용되고 있다.
Vision-Language Models
Nemotron Nano V2 VL [15]
자율주행
Autonomous Vehicles
로보틱스
Robotics
OCR 문서 분석
OCR Document Parsing [7]
Open-Vocabulary Segmentation
RADSeg [3]
기타 연구 [2]
최종 메시지
C-RADIOv4는
DINOv3
+
SigLIP2
+
SAM3
의 능력을 하나의 모델로 통합하면서,
Any-resolution 지원
SAM3 백본 대체
ViTDet 기반 고속 추론
상업적 사용 가능 라이선스
까지 제공한다.
저자들은 이 모델이 학계와 산업계 모두에서 폭넓게 활용되기를 기대한다고 결론짓고 있다.
한 줄 요약
C-RADIOv4는 DINOv3·SigLIP2·SAM3를 하나의 412M~631M 규모 모델에 압축한 Agglomerative Vision Foundation Model로, 고해상도 성능·멀티해상도 지원·SAM3 호환성·추론 효율성을 동시에 크게 향상시킨 최신 RADIO 계열 모델이다.