← 返回文章列表
统一调用API

LiteLLM Proxy 完全指南:Python 100+ 模型统一网关,OpenAI 兼容 + 智能路由零改动接入

LiteLLM Proxy 完全指南:Python 100+ 模型统一网关,OpenAI 兼容 + 智能路由零改动接入

一句话总结:LiteLLM Proxy 是 Python 生态的统一网关(litellm/proxy),把 100+ LLM(OpenAI、Claude、Gemini、DeepSeek、Groq、Bedrock、Vertex 等)收敛为一个 OpenAI 兼容端点,支持负载均衡、熔断重试、预算限流与可观测,Python 团队零改动接入。

为什么选 LiteLLM?

  • 100+ 模型覆盖:一套 model 命名即可调 OpenAI、Anthropic、Google、DeepSeek、Groq、AWS Bedrock、Azure、Vertex 等。
  • OpenAI 兼容:POST /v1/chat/completions 完全兼容,openai SDK 仅改 base_url。
  • 智能路由:权重、延迟、剩余配额、成本四维路由,自动熔断故障提供商。
  • 预算与限流:按 Key / 团队 / 模型三级预算,RPM/TPM 精细限流。
  • 可观测:Prometheus + Langfuse + 日志三件套,延迟与成本一图看全。

快速开始

pip install litellm
# 配置 litellm_config.yaml
model_list:
  - model_name: gpt-4o-mini
    litellm_params:
      model: gpt-4o-mini
      api_key: os.environ/OPENAI_API_KEY
  - model_name: deepseek-chat
    litellm_params:
      model: deepseek/deepseek-chat
      api_key: os.environ/DEEPSEEK_API_KEY
  - model_name: gemini-flash
    litellm_params:
      model: gemini/gemini-2.0-flash
      api_key: os.environ/GEMINI_API_KEY

litellm_settings:
  num_retries: 3
  request_timeout: 30

litellm proxy --config litellm_config.yaml --port 4000

客户端零改动:

from openai import OpenAI
client = OpenAI(base_url="http://localhost:4000/v1", api_key="sk-litellm")
resp = client.chat.completions.create(model="deepseek-chat", messages=[{"role":"user","content":"hello"}])

统一调用实战

负载均衡与熔断

router_settings: routing_strategy: latency-based 按延迟自动选最快;故障自动熔断 60s 后重试,避免雪崩。

预算限流

为每个团队 Key 设 max_budget: 10($10),超额自动 429,适合把免费额度优先、付费兜底做成策略。

回退策略

fallbacks:
  - gpt-4o-mini: [deepseek-chat, gemini-flash]

主模型 429/5xx 自动降级到免费模型,保障可用性。

与 OneAPI / Portkey 对比

方案 语言 模型数 亮点 适合
LiteLLM Proxy Python 100+ Python 原生、与 OpenAI SDK 深度集成 Python 团队
OneAPI Gateway Go 单二进制 10+ 零依赖、托盘、可卖算力 自托管 + 变现
Portkey Gateway Node/Go 250+ Guardrails、缓存、企业治理 企业级

选型:Python 团队选 LiteLLM;要单二进制与卖算力选 OneAPI;要企业治理选 Portkey。

最佳实践

  • 免费优先路由:把 deepseek-chat:free / gemini-flash 权重调高,付费模型作 fallback。
  • 超时统一:上游 30s、流式 120s,与 OneAPI 保持一致。
  • 可观测:接 Prometheus + Grafana,监控 p95 延迟与成本。

总结

  • 想 Python 零改动:LiteLLM Proxy 一行改 base_url,100+ 模型即插即用。
  • 想智能路由:延迟/成本/配额三维自动选最优。
  • 想与 OneAPI 联动:LiteLLM 上游可填 OneAPI http://localhost:3000/v1,双层网关叠加治理。

下一篇:Portkey AI Gateway 完全指南(250+ 模型企业级网关,缓存 + Guardrails + 可观测)。


🚀 立即开始:免费 API 一键调用

想要无需逐一注册、统一鉴权调用以上全部免费模型?Apishare.cc 提供统一 API Key,一个 Key 调用 100+ 模型,免费模型零成本直连。

👉 立即注册 Apishare.cc → 获取你的统一 API Key

📊 想看更多免费模型排行?查看 2026年9月 免费 LLM API 综合实力榜单 →


免费 API 聚合平台说明

本文涉及的模型均由 APIShare 免费 API 聚合平台 统一接入,一份 Key 调用全站模型。

相关文章

Cherry Studio 完全指南:桌面端 300+ 模型统一调用,本地知识库 + MCP 工具链零成本跑通Lobe Chat 完全指南:Web 端插件化统一调用,团队知识库与可视化工作流零代码跑通Open WebUI 完全指南:本地 Ollama + 云端免费 API 同池,隐私优先的统一调用Portkey AI Gateway 完全指南:250+ 模型企业级统一调用,缓存 + Guardrails + 可观测一站式NextChat 完全指南:轻量 Web 统一调用,一键切模型 + prompt 市场零门槛上手

想立即用上免费 LLM API?

APIShare 聚合全球免费 AI 接口,注册即送额度。