Skip to content

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

1 Commit
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

Vision-Language AI System

Description

A multi-modal AI system that understands images and generates captions or answers questions using CLIP/BLIP, an LLM, and OpenCV.

Features

  • Image captioning
  • Image question-answering
  • Gradio web interface

Installation

pip install -r requirements.txt

Run

python app.py

About

A multi-modal AI system that understands images and generates captions or answers questions using CLIP/BLIP, an LLM, and OpenCV.

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages