background
Communicate with customers and collect AI gateway requirements, which need to support the integration of Prometheus.
Metrics only need to be provided in DP, and prometheus on the client side will actively capture DP metrics.
Competitive Research
LiteLLM supports integrating Prometheus and supports various metrics: https://docs.litellm.ai/docs/proxy/prometheus
Metrics list
Usage & Billing
| Metric Name |
Type |
Description |
Labels |
litellm_spend_metric |
Counter |
Total cost |
end_user, hashed_api_key, api_key_alias, model, team, team_alias, user |
litellm_total_tokens_metric |
Counter |
input + output tokens |
end_user, hashed_api_key, api_key_alias, requested_model, team, team_alias, user, model |
litellm_input_tokens_metric |
Counter |
input tokens |
Same as above |
litellm_output_tokens_metric |
Counter |
output tokens |
Same as above |
litellm_requests_metric |
Counter |
Total requests by endpoint |
end_user, hashed_api_key, api_key_alias, model, team, team_alias, user, user_email |
Budget & Limits
| Metric name |
Description |
litellm_team_max_budget_metric |
Team maximum budget |
litellm_remaining_team_budget_metric |
Team remaining budget |
litellm_team_budget_remaining_hours_metric |
Team budget reset remaining hours |
litellm_api_key_max_budget_metric |
API Key maximum budget |
litellm_remaining_api_key_budget_metric |
API Key remaining budget |
litellm_api_key_budget_remaining_hours_metric |
API Key budget reset remaining hours |
litellm_remaining_api_key_requests_for_model |
The remaining number of API Key requests for a specific model (requires setting rpm limit) |
litellm_remaining_api_key_tokens_for_model |
API Key number of remaining tokens for a specific model (tpm limit needs to be set) |
LLM Provider (deployment level)
| Metric name |
Description |
litellm_deployment_success_responses |
Number of successful LLM API calls |
litellm_deployment_failure_responses |
Number of failed LLM API calls |
litellm_deployment_total_requests |
Total LLM API calls |
litellm_remaining_requests_metric |
x-ratelimit-remaining-requests |
litellm_remaining_tokens_metric |
x-ratelimit-remaining-tokens |
litellm_deployment_state |
Deployment status (0=healthy, 1=partial failure, 2=complete failure) |
litellm_deployment_latency_per_output_token |
Latency per output token |
litellm_deployment_cooled_down |
Number of times cooled (fuse) |
litellm_deployment_successful_fallbacks |
Number of successful fallbacks |
litellm_deployment_failed_fallbacks |
Number of failed fallbacks |
Delay
| Metric name |
Type |
Description |
litellm_request_total_latency_metric |
Histogram |
Request total latency (to Proxy) |
litellm_overhead_latency_metric |
Histogram |
LiteLLM's own processing overhead |
litellm_llm_api_latency_metric |
Histogram |
Pure LLM API call latency |
litellm_llm_api_time_to_first_token_metric |
Histogram |
TTFT (streaming only) |
Proxy Level
| Metric name |
Description |
litellm_proxy_total_requests_metric |
Total number of client requests |
litellm_proxy_failed_requests_metric |
Number of client failed requests |
litellm_in_flight_requests |
Current number of in-flight requests (Gauge) |
litellm_callback_logging_failures_metric |
Number of write failures to downstream callbacks (such as S3, Langfuse) |
System health (need to enable prometheus_system)
| Metric name |
Description |
litellm_redis_latency |
Redis call latency (Histogram) |
litellm_redis_fails |
Number of Redis failures |
litellm_self_latency |
LiteLLM API successful call latency (Histogram) |
litellm_pod_lock_manager_size |
Obtain DB write lock Pod |
litellm_in_memory_daily_spend_update_queue_size |
Daily consumption update queue size in memory |
litellm_redis_daily_spend_update_queue_size |
Redis daily consumption update queue size |
litellm_in_memory_spend_update_queue_size |
Memory aggregate consumption queue |
litellm_redis_spend_update_queue_size |
Redis aggregate consumption queue |
background
Communicate with customers and collect AI gateway requirements, which need to support the integration of Prometheus.
Metrics only need to be provided in DP, and prometheus on the client side will actively capture DP metrics.
Competitive Research
LiteLLM supports integrating Prometheus and supports various metrics: https://docs.litellm.ai/docs/proxy/prometheus
Metrics list
Usage & Billing
litellm_spend_metricend_user,hashed_api_key,api_key_alias,model,team,team_alias,userlitellm_total_tokens_metricend_user,hashed_api_key,api_key_alias,requested_model,team,team_alias,user,modellitellm_input_tokens_metriclitellm_output_tokens_metriclitellm_requests_metricend_user,hashed_api_key,api_key_alias,model,team,team_alias,user,user_emailBudget & Limits
litellm_team_max_budget_metriclitellm_remaining_team_budget_metriclitellm_team_budget_remaining_hours_metriclitellm_api_key_max_budget_metriclitellm_remaining_api_key_budget_metriclitellm_api_key_budget_remaining_hours_metriclitellm_remaining_api_key_requests_for_modellitellm_remaining_api_key_tokens_for_modelLLM Provider (deployment level)
litellm_deployment_success_responseslitellm_deployment_failure_responseslitellm_deployment_total_requestslitellm_remaining_requests_metricx-ratelimit-remaining-requestslitellm_remaining_tokens_metricx-ratelimit-remaining-tokenslitellm_deployment_statelitellm_deployment_latency_per_output_tokenlitellm_deployment_cooled_downlitellm_deployment_successful_fallbackslitellm_deployment_failed_fallbacksDelay
litellm_request_total_latency_metriclitellm_overhead_latency_metriclitellm_llm_api_latency_metriclitellm_llm_api_time_to_first_token_metricProxy Level
litellm_proxy_total_requests_metriclitellm_proxy_failed_requests_metriclitellm_in_flight_requestslitellm_callback_logging_failures_metricSystem health (need to enable
prometheus_system)litellm_redis_latencylitellm_redis_failslitellm_self_latencylitellm_pod_lock_manager_sizelitellm_in_memory_daily_spend_update_queue_sizelitellm_redis_daily_spend_update_queue_sizelitellm_in_memory_spend_update_queue_sizelitellm_redis_spend_update_queue_size