🔌 Universal Gateway & Proxy for 100+ LLMs

什么是 LiteLLM(大模型万能网关)?

告别为每个大模型写一套恶心 SDK 的苦日子!用统一的 OpenAI 标准格式调用 Claude、Gemini、Bedrock、Ollama 等 100+ 模型,自带秒级故障切换与记账控费

传统原生直连 (各家 SDK 各说各话)
💥🍝 满地适配器·意大利面条式代码

OpenAI 叫 messages,Anthropic 叫 prompt,AWS Bedrock 还要拼复杂的 JSON 负载;代码里充斥着大量的 if/else。一旦某家 429 限流或 500 宕机,线上业务直接瞬间瘫痪报错

多家 SDK: 参数各异 · 错误码千奇百怪 🤯 ❌ 单点故障 · 无法自动降级 · 账单各处散落失控 换个模型需要重构几千行胶水代码
❌ 参数协议四分五裂 ❌ 遇故障无法自动容灾 ❌ 无法统一度量 Token 成本
VS
LiteLLM (统一格式·万能调度网关)
🔌🌐 万能变频转换器·同传翻译与记账总管

天下大模型,皆归 OpenAI 标准! 你的业务只认标准的输入与输出格式;LiteLLM 在毫秒级内将其转译为任意模型协议。自带多渠道轮询负载均衡、秒级容灾 Fallback,团队消费实时精准控费

业务代码 ➔ 统一 OpenAI 格式 ➔ LiteLLM 网关 🌐 ✔ 自动分流 Claude/GPT/Bedrock/Ollama · 自动无缝故障降级 ⚡ 统一虚拟 API Key · 毫秒级流式响应 · 成本精确到美分
✅ 100+ 模型 100% 统一格式 ✅ 秒级 Fallback 自动容灾降级 💰 虚拟 Key 与部门预算管控
💡

5岁核心顿悟:为什么现代 AI 架构师离不开 LiteLLM?

像出国旅行时的“万能变频插头 + 金牌同声传译 + 随身记账管家” 🔌🌐
• 全球有 100 多个大模型提供商(OpenAI、Anthropic Claude、AWS Bedrock、Google VertexAI、本地 Ollama),每个插孔形状和电压都不同,讲的方言也各不相同;
LiteLLM 挡在前面:你只要把标准的插头插进 LiteLLM,无论后端接的是美国插座还是日本插座,它都能自动转接;如果 OpenAI 插座突然停电,它能在 10 毫秒内帮你悄悄拔下插头、插进备用的 Claude 或 Azure 插座,你的应用丝毫不受影响,还能顺便告诉你这一趟花了多少美分!

LiteLLM 统治大模型中枢的三大王牌

格式归一、零感容灾降级与企业级多租户风控

📐

1. I/O 格式大一统 (Universal Format)

所有大模型均采用 {"role": "user", "content": "..."} 规范输入,流式输出(Streaming)与工具调用(Function/Tool Calling)全部标准化归一,切换底层模型只需改一个字符串!

🛡️

2. 跨提供商智能 Fallback 容灾

配置高可用兜底链:gpt-4o ➔ claude-3-5-sonnet ➔ azure/gpt-4o ➔ ollama/llama3。当主模型遭遇 429 限流或超时断连时,网关在毫秒内无缝自动重试备用线路

💳

3. 虚拟 Key 与精确成本/预算看门狗

企业不用把真实的底层 API Key 发给每个员工。LiteLLM 可生成虚拟 Key,设定“团队 A 每月上限 $500,限速 60 RPM”,花超即停,每个请求的 Token 消耗与美元花销清清楚楚。

🚀 LiteLLM 的两大经典形态

无论你是个人开发脚本,还是跨国企业的微服务中枢,都能优雅适配:

📦 1. Python SDK 嵌入式模式

pip install litellm。在代码里直接 from litellm import completion。就像使用官方 openai 库一样,但 model 参数可以写 "claude-3-5-sonnet""bedrock/anthropic.claude-v2"

🏢 2. LiteLLM Proxy Server(独立代理网关)

用 Docker 启动独立常驻服务,对外暴露标准的 /v1/chat/completions 端口。任何第三方前端(Open WebUI、LangChain、AutoGPT、手机端客户端)只需将 Base URL 指向它即可享受集中控费与高可用调度!

🎮 交互模拟器:体验 LiteLLM 的真实调度与故障降级

模拟真实生产环境下的调用请求,观察网关如何完成格式转换、容灾与财务记账: