fusion-embedding-2-2b-preview v0.1
First release of generation 2: modality-gated deep adapters inside the frozen backbone.
fusion-embedding-2 keeps generation 1's frozen stack (byte-frozen Qwen3-VL-Embedding-2B base, frozen Qwen2.5-Omni audio tower, the 16.4M connector) and adds a bottleneck adapter to each of the 28 frozen decoder layers, hard-gated to audio inputs: 44.2M adapter parameters that never execute on text, image, or video, whose outputs remain bit-for-bit those of the released base, verified after every training run.
Highlights
- AudioCaps audio-to-text R@10 0.743, text-to-audio 0.775; Clotho zero-shot t2a 0.482; VGGSound audio-text 0.665/0.681 — the family's best text-to-audio results on every benchmark at release.
- Emergent audio-to-image retrieval preserved and strengthened at the pretraining stage (R@10 0.443, zero paired audio-visual data).
- Trained in hours on a single GPU; adapters warm-start from the generation-1 recipe.
Weights and model card: https://huggingface.co/EximiusLabs/fusion-embedding-2-2b-preview (revision tag v0.1-preview). Loadable in mteb via mteb.get_model("EximiusLabs/fusion-embedding-2-2b-preview").