零基础上手LiteLLM:用统一API调用50+大模型的最简方案
教程导读
你有没有遇到过这种烦恼:项目里同时用了OpenAI的GPT-4、Anthropic的Claude和Google的Gemini,结果要维护三套不同的API调用代码?

LiteLLM就是为这个场景而生的。它提供了一个统一的接口,让你用同一套代码调用50多个大模型提供商,包括OpenAI、Anthropic、Google、DeepSeek、阿里通义千问等。
本教程将带你从零开始,在10分钟内完成LiteLLM的安装和基本配置。
第一步:安装LiteLLM
pip install litellm就这么简单。LiteLLM是一个纯Python库,不需要额外的系统依赖。
第二步:配置API密钥
在终端设置环境变量:
# 设置你使用的模型提供商的API密钥
export OPENAI_API_KEY="sk-your-openai-key"
export ANTHROPIC_API_KEY="sk-ant-your-anthropic-key"
export DEEPSEEK_API_KEY="sk-your-deepseek-key"也可以写入 `~/.bashrc` 或 `.env` 文件持久化保存。
第三步:第一次调用
用OpenAI风格的格式调用任意模型:
from litellm import completion
# 调用OpenAI
response = completion(
model="gpt-5.5",
messages=[{"content": "Hello, world!", "role": "user"}]
)
print(response.choices[0].message.content)
# 调用Claude — 格式完全相同!
response = completion(
model="claude-sonnet-5-20260630",
messages=[{"content": "Hello, world!", "role": "user"}]
)
print(response.choices[0].message.content)**核心优势**:切换模型只需修改 `model` 参数,其他代码完全不变。
第四步:一个请求测试多个模型
LiteLLM最酷的功能之一是「批量测试」——一次请求同时发给多个模型,方便对比输出质量:
from litellm import completion
models = ["gpt-5.5", "claude-sonnet-5-20260630", "deepseek/deepseek-chat"]
prompt = "用100字解释什么是机器学习"
for model in models:
response = completion(model=model, messages=[{"content": prompt, "role": "user"}])
print(f"\n--- {model} ---")
print(response.choices[0].message.content)第五步:配置成本和速率控制
LiteLLM内置了成本追踪和速率限制功能,这对生产环境尤其重要:
from litellm import completion
import litellm
# 设置全局预算上限(美元)
litellm.budget_manager.total_budget = 10.0
# 查看每次调用的成本
response = completion(
model="gpt-5.5",
messages=[{"content": "Hi", "role": "user"}]
)
print(f"本次调用成本: ${litellm.cost(response):.6f}")进阶:搭建自己的API网关
如果团队多人共用,可以用LiteLLM的Proxy模式搭建一个中央API网关:
# 安装Proxy依赖
pip install 'litellm[proxy]'
# 启动代理服务器
litellm --model gpt-5.5 --model claude-sonnet-5-20260630启动后,团队成员只需将API地址指向 `http://localhost:4000`,就能通过统一端点访问所有模型,你的API Key也只需在一个地方管理。
常见问题
Q: LiteLLM支持流式输出吗?
A: 完全支持。只需加 `stream=True` 参数即可。
Q: 免费模型能用吗?
A: 支持Ollama本地模型、HuggingFace推理端点,以及各提供商的免费tier。
Q: 性能损耗大吗?
A: LiteLLM是一个薄封装层,额外延迟通常不超过50ms,对绝大多数场景可以忽略。
**核心思路**:LiteLLM的价值不在于它做了什么新东西,而在于它**消除了重复劳动**——写一遍代码,换任何模型都只需要改一个字符串。
与同类方案对比
市面上实现多模型统一调用的方案主要有三种:LiteLLM属于轻量级SDK方案,适合直接集成到现有Python项目中;One API和FastGPT Proxy属于独立部署的网关方案,适合作为团队共用的API入口;LangChain和Semantic Kernel属于重量级框架方案,提供了完整的工作流编排能力,但学习成本也最高。
如果你只需要一个「翻译器」——把OpenAI格式的请求翻译成各厂商的原生格式,LiteLLM是三者中最简单也最轻量的选择。它的代码库不到5MB,依赖关系干净,非常适合嵌入到已有的微服务或函数计算环境中。
对于需要更高并发和可观测性的生产环境,推荐将LiteLLM的Proxy模式与Prometheus和Grafana搭配使用,形成完整的模型调用监控面板——每个模型的调用量、延迟分布、成本趋势一目了然。
🔥 关注LC智趣厅,每周为你带来实用的AI开发技巧
👇 关注不错过,每天三分钟,AI世界尽在掌握
— END —
LC 智趣厅 · 科技与生活的交点
ihygg.cn
