LiteLLM Proxy 完全指南:Python 100+ 模型统一网关,OpenAI 兼容 + 智能路由零改动接入
一句话总结:LiteLLM Proxy 是 Python 生态的统一网关(
litellm/proxy),把 100+ LLM(OpenAI、Claude、Gemini、DeepSeek、Groq、Bedrock、Vertex 等)收敛为一个 OpenAI 兼容端点,支持负载均衡、熔断重试、预算限流与可观测,Python 团队零改动接入。
为什么选 LiteLLM?
- 100+ 模型覆盖:一套
model命名即可调 OpenAI、Anthropic、Google、DeepSeek、Groq、AWS Bedrock、Azure、Vertex 等。 - OpenAI 兼容:
POST /v1/chat/completions完全兼容,openaiSDK 仅改base_url。 - 智能路由:权重、延迟、剩余配额、成本四维路由,自动熔断故障提供商。
- 预算与限流:按 Key / 团队 / 模型三级预算,RPM/TPM 精细限流。
- 可观测:Prometheus + Langfuse + 日志三件套,延迟与成本一图看全。
快速开始
pip install litellm
# 配置 litellm_config.yaml
model_list:
- model_name: gpt-4o-mini
litellm_params:
model: gpt-4o-mini
api_key: os.environ/OPENAI_API_KEY
- model_name: deepseek-chat
litellm_params:
model: deepseek/deepseek-chat
api_key: os.environ/DEEPSEEK_API_KEY
- model_name: gemini-flash
litellm_params:
model: gemini/gemini-2.0-flash
api_key: os.environ/GEMINI_API_KEY
litellm_settings:
num_retries: 3
request_timeout: 30
litellm proxy --config litellm_config.yaml --port 4000
客户端零改动:
from openai import OpenAI
client = OpenAI(base_url="http://localhost:4000/v1", api_key="sk-litellm")
resp = client.chat.completions.create(model="deepseek-chat", messages=[{"role":"user","content":"hello"}])
统一调用实战
负载均衡与熔断
router_settings: routing_strategy: latency-based 按延迟自动选最快;故障自动熔断 60s 后重试,避免雪崩。
预算限流
为每个团队 Key 设 max_budget: 10($10),超额自动 429,适合把免费额度优先、付费兜底做成策略。
回退策略
fallbacks:
- gpt-4o-mini: [deepseek-chat, gemini-flash]
主模型 429/5xx 自动降级到免费模型,保障可用性。
与 OneAPI / Portkey 对比
| 方案 | 语言 | 模型数 | 亮点 | 适合 |
|---|---|---|---|---|
| LiteLLM Proxy | Python | 100+ | Python 原生、与 OpenAI SDK 深度集成 | Python 团队 |
| OneAPI Gateway | Go 单二进制 | 10+ | 零依赖、托盘、可卖算力 | 自托管 + 变现 |
| Portkey Gateway | Node/Go | 250+ | Guardrails、缓存、企业治理 | 企业级 |
选型:Python 团队选 LiteLLM;要单二进制与卖算力选 OneAPI;要企业治理选 Portkey。
最佳实践
- 免费优先路由:把
deepseek-chat:free/gemini-flash权重调高,付费模型作 fallback。 - 超时统一:上游 30s、流式 120s,与 OneAPI 保持一致。
- 可观测:接 Prometheus + Grafana,监控 p95 延迟与成本。
总结
- 想 Python 零改动:LiteLLM Proxy 一行改
base_url,100+ 模型即插即用。 - 想智能路由:延迟/成本/配额三维自动选最优。
- 想与 OneAPI 联动:LiteLLM 上游可填 OneAPI
http://localhost:3000/v1,双层网关叠加治理。
下一篇:Portkey AI Gateway 完全指南(250+ 模型企业级网关,缓存 + Guardrails + 可观测)。
🚀 立即开始:免费 API 一键调用
想要无需逐一注册、统一鉴权调用以上全部免费模型?Apishare.cc 提供统一 API Key,一个 Key 调用 100+ 模型,免费模型零成本直连。
👉 立即注册 Apishare.cc → 获取你的统一 API Key
📊 想看更多免费模型排行?查看 2026年9月 免费 LLM API 综合实力榜单 →
免费 API 聚合平台说明
本文涉及的模型均由 APIShare 免费 API 聚合平台 统一接入,一份 Key 调用全站模型。
- 完整模型目录:APIShare 免费 API 目录
- 注册即送免费额度:注册领取 API Key