MP4 video dosyalarını OpenAI Whisper ile otomatik olarak transkript eden ve çıktıyı zaman damgalı PDF + TXT olarak kaydeden bir Python aracıdır.
- 🎬 MP4 video dosyalarını otomatik transkript etme
- ⏱️ Zaman damgalı çıktı (
[HH:MM:SS --> HH:MM:SS] metin) - 📄 PDF ve TXT formatında kaydetme
- 🌐 Otomatik dil algılama (100+ dil desteği)
- 🤖 5 farklı model boyutu seçeneği (tiny → large)
- ⚡ GPU (CUDA) desteği — varsa otomatik kullanır
- Python 3.8+
- FFmpeg (ses/video işleme için)
Eğer bilgisayarınızda daha önce hiçbir şey kurulu değilse, aşağıdaki adımları sırasıyla takip edin:
Sisteminizde Python yüklü olmalıdır. Yüklü değilse:
- python.org/downloads adresine gidin.
- Python 3.8 veya daha yeni bir sürümü indirin.
- Kurulum sırasında "Add Python 3.x to PATH" (Python'u PATH'e ekle) kutucuğunu kesinlikle işaretleyin, ardından "Install Now" diyerek kurun.
Proje klasörünün içine girin (Bu README.md dosyasının olduğu klasör).
Klasör içindeyken boş bir yere Shift tuşuna basılı tutarak sağ tıklayın ve "PowerShell penceresini burada aç" (veya Windows 11'de sağ tıklayıp "Terminal'de aç") seçeneğini seçin. Alternatif olarak, klasördeyken adres çubuğuna cmd yazıp Enter'a basarak Komut İstemini (Terminal) açabilirsiniz.
Açılan siyah ekranda (terminalde) şu komutu çalıştırın:
pip install -r requirements.txtNot: Bu komut
openai-whisper,fpdf2,torchgibi tüm gerekli paketleri otomatik kuracaktır.
FFmpeg, ses ve video işleme için gereklidir. Sisteminizde yüklü değilse:
Windows (PowerShell ile otomatik indirme):
Başlat menüsüne sağ tıklayıp Windows PowerShell'i açın ve şu komutları sırasıyla kopyalayıp yapıştırıp Enter'a basın:
Invoke-WebRequest -Uri "https://www.gyan.dev/ffmpeg/builds/ffmpeg-release-essentials.zip" -OutFile "$env:TEMP\ffmpeg.zip"
Expand-Archive -Path "$env:TEMP\ffmpeg.zip" -DestinationPath "C:\ffmpeg" -ForceNot: Script,
C:\ffmpegaltındaki FFmpeg'i otomatik olarak görecek ve kullanacaktır. Ekstra bir ayar yapmanıza gerek yoktur.
GPU (Ekran Kartı) kullanmak transkript işlemini 5-10 kat hızlandırır. NVIDIA ekran kartınız varsa ve requirements.txt ile gelen standart torch sürümü GPU'nuzu görmezse aşağıdaki adımları izleyin:
Adım 1 — NVIDIA sürücüsünü ve CUDA versiyonunu kontrol et: Terminal veya CMD'de şu komutu çalıştırın:
nvidia-smi(Sağ üst köşede CUDA Version: 12.x veya 11.x şeklinde bir versiyon yazar. Bunu not alın.)
Eğer sistemde daha önceden kurulu PyTorch varsa ve CUDA destekli değilse, aşağıdaki komutla kaldırıp tekrar kurmanın gerekebilir: Adım 2 — Mevcut PyTorch'u kaldır (Eğer varsa):
pip uninstall torch torchvision torchaudio -yAdım 3 — Ekran kartınıza (CUDA) uygun PyTorch sürümünü kurun: Terminalde, sisteminizdeki CUDA sürümüne göre aşağıdaki komutlardan uygun olanı çalıştırın:
| Sistemdeki CUDA Versiyonu | Çalıştırılacak Komut |
|---|---|
| 12.1 veya 12.4 | pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu121 |
| 11.8 | pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu118 |
Adım 4 — GPU'nun algılandığını doğrula:
python -c "import torch; print(torch.cuda.is_available()); print(torch.cuda.get_device_name(0) if torch.cuda.is_available() else 'Bulunamadi')"True ve Ekran Kartı modeliniz (Örn: RTX 3060) yazıyorsa kurulum başarıyla tamamlanmıştır.
Not:
nvidia-smikomutu çalışmıyor veya hata veriyorsa nvidia.com/drivers adresinden ekran kartı sürücünüzü güncelleyin.
MP4 dosyanızı script ile aynı dizine koyun ve çalıştırın:
python transcribe.pyDizindeki ilk MP4 dosyasını otomatik bulur ve transkript eder.
python transcribe.py toplanti.mp4| Parametre | Varsayılan | Açıklama |
|---|---|---|
video |
(otomatik) | MP4 dosya yolu |
--model |
small |
Whisper modeli: tiny, base, small, medium, large |
--language |
(otomatik) | Dil kodu: tr, en, de, fr vb. |
--output |
(otomatik) | Çıktı PDF dosya adı |
# Türkçe video, medium model ile
python transcribe.py video.mp4 --model medium --language tr
# İngilizce video, large model ile, özel çıktı adı
python transcribe.py meeting.mp4 --model large --language en --output meeting_notes.pdf
# Otomatik dil algılama ile
python transcribe.py conference.mp4 --model smallScript çalıştıktan sonra iki dosya oluşturulur:
<video_adı>_transcript.pdf— Zaman damgalı transkript (PDF)<video_adı>_transcript.txt— Zaman damgalı transkript (TXT)
[00:00:00 --> 00:00:05] Merhaba, bugünkü toplantımıza hoş geldiniz.
[00:00:05 --> 00:00:12] İlk olarak proje durumunu değerlendireceğiz.
[00:00:12 --> 00:00:18] Ardından gelecek hafta için planlarımızı konuşacağız.
| Model | Boyut | Hız | Doğruluk | VRAM |
|---|---|---|---|---|
tiny |
39 MB | ⚡ Çok hızlı | ★★☆☆☆ | ~1 GB |
base |
74 MB | ⚡ Hızlı | ★★★☆☆ | ~1 GB |
small |
461 MB | 🔄 Orta | ★★★★☆ | ~2 GB |
medium |
1.5 GB | 🐢 Yavaş | ★★★★★ | ~5 GB |
large |
2.9 GB | 🐌 Çok yavaş | ★★★★★ | ~10 GB |
İpucu: GPU yoksa
tinyveyabasemodeli önerilir. GPU varsa en iyi sonuç içinmediumveyalargekullanın.
- İlk çalıştırmada Whisper modeli indirilecektir (internet bağlantısı gerekli)
- Uzun videolarda işlem süresi artabilir
- GPU (CUDA) varsa otomatik olarak kullanılır, yoksa CPU ile çalışır
- Çalışma esnasında konsolda
🖥️ Kullanılan cihaz: CUDAveyaCPUyazar