v0.0.2 - Semantic Transcript Search
✨ New Features
Semantic Transcript Search
Search YouTube video transcripts using natural language queries!
New MCP Tools:
warmup_semantic_search- Pre-load embedding model (~270MB) to avoid timeout on first searchsemantic_search_transcripts- Search transcripts with auto-indexingindex_channel_transcripts- Optional bulk pre-warming for faster searches
Example
# Search Vimjoyer's channel for NixOS topics
results = await semantic_search_transcripts(
query="how to configure garbage collection",
channel_ids=["UCuAXFkgsw1L7xaCfnd5JJOw"],
)
# Returns timestamped URLs for direct playback
print(results["results"][0]["timestamp_url"])
# https://www.youtube.com/watch?v=DnA4xNTrrqY&t=231🔧 Technical Details
- Embeddings: Nomic Embed Text v1.5 with Matryoshka dimensionality (512 dims)
- Vector Store: ChromaDB with optimized HNSW settings
- Chunking: Token-based (256 tokens) with timestamp preservation
- Tests: 343 passing (was 178)
📦 Installation
pip install yt-api-mcp==0.0.2
# Or with uvx
uvx yt-api-mcp stdioFull Changelog
See CHANGELOG.md