v0.1.0
v0.1.0 — First release
- Diagnose vLLM inefficiencies in seconds
- Detects:
• Under-batching
• KV cache pressure
• Low prefix cache reuse - Supports snapshot + duration analysis
Quick start:
./profile diagnose --url http://localhost:8000/metrics --duration 5m