Skip to content

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

15 Commits
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

ThinkOmni

A Reasoning-Driven Omni-Modal LLM Framework for Audio Forgery Detection and Localization

Project Page Code Models FACoT

ThinkOmni is a reasoning-driven omni-modal large language model for unified audio forgery reasoning, spoofing detection, and temporal manipulation localization. It combines semantic, acoustic, and spectral-visual evidence to make forensic predictions more explicit and transferable across datasets.

ThinkOmni framework

Highlights

  • ThinkOmni jointly produces an inspectable forensic rationale, a three-class authenticity prediction, and one or more manipulated time intervals.
  • FACoT contains 100K samples with structured reasoning annotations grounded in semantic inconsistencies, acoustic artifacts, and temporal manipulation patterns.
  • FMIL progressively aligns semantic, acoustic, and spectral-visual representations while reducing interference between modalities.
  • FCML balances reasoning, detection, and localization objectives with role-aware token weighting and adaptive boundary supervision.
  • ThinkOmni reaches 93.70% / 93.72% average intra-dataset ACC / F1 and 80.74% / 85.15% average cross-dataset ACC / F1. For localization, it achieves 88.05% intra-dataset mAP and 74.67% cross-dataset mAP.

Release Status

The project page is available now. Paper, code, checkpoints, FACoT annotations, and inference examples are being prepared for public release.

Resource Status
Project page Available
Paper and supplementary material Coming soon
Training and inference code Coming soon
Model checkpoints Coming soon
FACoT annotations Coming soon

Citation

@misc{xu2026thinkomni,
  title  = {ThinkOmni: A Reasoning-Driven Omni-Modal LLM Framework for Audio Forgery Detection and Localization},
  author = {Yuxiong Xu and Kaiqing Lin and Bin Li and Haodong Li and Sheng Li},
  year   = {2026}
}

Acknowledgements

ThinkOmni is built on Qwen2.5-Omni, Wav2Vec2 XLS-R, and ms-swift. We thank the authors of these projects and the public audio-forensics benchmarks used in FACoT.

About

ThinkOmni: A Reasoning-Driven Omni-Modal LLM Framework for Audio Forgery Detection and Localization

Resources

Stars

Watchers

Forks

Releases

Packages

Contributors

Languages