inference-aiops v0.1.0
Governed GPU inference ops over vLLM + Ray Serve/Jobs — 30 MCP tools. Flagship diagnose_latency_spike correlates queue depth + KV pressure + prefix locality. Prometheus-native. Vendored governance harness; scale-down/scale-to-zero/drain/undeploy/hot-swap gated by dry-run + double-confirm. Preview / mock-only.