什么是 LiteLLM(大模型万能网关)?
告别为每个大模型写一套恶心 SDK 的苦日子!用统一的 OpenAI 标准格式调用 Claude、Gemini、Bedrock、Ollama 等 100+ 模型,自带秒级故障切换与记账控费!
OpenAI 叫 messages,Anthropic 叫 prompt,AWS Bedrock 还要拼复杂的 JSON 负载;代码里充斥着大量的 if/else。一旦某家 429 限流或 500 宕机,线上业务直接瞬间瘫痪报错!
天下大模型,皆归 OpenAI 标准! 你的业务只认标准的输入与输出格式;LiteLLM 在毫秒级内将其转译为任意模型协议。自带多渠道轮询负载均衡、秒级容灾 Fallback,团队消费实时精准控费!
LiteLLM 统治大模型中枢的三大王牌
格式归一、零感容灾降级与企业级多租户风控
1. I/O 格式大一统 (Universal Format)
所有大模型均采用 {"role": "user", "content": "..."} 规范输入,流式输出(Streaming)与工具调用(Function/Tool Calling)全部标准化归一,切换底层模型只需改一个字符串!
2. 跨提供商智能 Fallback 容灾
配置高可用兜底链:gpt-4o ➔ claude-3-5-sonnet ➔ azure/gpt-4o ➔ ollama/llama3。当主模型遭遇 429 限流或超时断连时,网关在毫秒内无缝自动重试备用线路。
3. 虚拟 Key 与精确成本/预算看门狗
企业不用把真实的底层 API Key 发给每个员工。LiteLLM 可生成虚拟 Key,设定“团队 A 每月上限 $500,限速 60 RPM”,花超即停,每个请求的 Token 消耗与美元花销清清楚楚。
🚀 LiteLLM 的两大经典形态
无论你是个人开发脚本,还是跨国企业的微服务中枢,都能优雅适配:
pip install litellm。在代码里直接 from litellm import completion。就像使用官方 openai 库一样,但 model 参数可以写 "claude-3-5-sonnet" 或 "bedrock/anthropic.claude-v2"。
用 Docker 启动独立常驻服务,对外暴露标准的 /v1/chat/completions 端口。任何第三方前端(Open WebUI、LangChain、AutoGPT、手机端客户端)只需将 Base URL 指向它即可享受集中控费与高可用调度!
🎮 交互模拟器:体验 LiteLLM 的真实调度与故障降级
模拟真实生产环境下的调用请求,观察网关如何完成格式转换、容灾与财务记账: