零基础上手LiteLLM:用统一API调用50+大模型的最简方案

教程导读

你有没有遇到过这种烦恼:项目里同时用了OpenAI的GPT-4、Anthropic的Claude和Google的Gemini,结果要维护三套不同的API调用代码?

零基础上手LiteLLM:用统一API调用50+大模型的最简方案封面

LiteLLM就是为这个场景而生的。它提供了一个统一的接口,让你用同一套代码调用50多个大模型提供商,包括OpenAI、Anthropic、Google、DeepSeek、阿里通义千问等。

本教程将带你从零开始,在10分钟内完成LiteLLM的安装和基本配置。

第一步:安装LiteLLM

pip install litellm

就这么简单。LiteLLM是一个纯Python库,不需要额外的系统依赖。

第二步:配置API密钥

在终端设置环境变量:

# 设置你使用的模型提供商的API密钥
export OPENAI_API_KEY="sk-your-openai-key"
export ANTHROPIC_API_KEY="sk-ant-your-anthropic-key"
export DEEPSEEK_API_KEY="sk-your-deepseek-key"

也可以写入 `~/.bashrc` 或 `.env` 文件持久化保存。

第三步:第一次调用

用OpenAI风格的格式调用任意模型:

from litellm import completion

# 调用OpenAI
response = completion(
    model="gpt-5.5",
    messages=[{"content": "Hello, world!", "role": "user"}]
)
print(response.choices[0].message.content)

# 调用Claude — 格式完全相同!
response = completion(
    model="claude-sonnet-5-20260630",
    messages=[{"content": "Hello, world!", "role": "user"}]
)
print(response.choices[0].message.content)

**核心优势**:切换模型只需修改 `model` 参数,其他代码完全不变。

第四步:一个请求测试多个模型

LiteLLM最酷的功能之一是「批量测试」——一次请求同时发给多个模型,方便对比输出质量:

from litellm import completion

models = ["gpt-5.5", "claude-sonnet-5-20260630", "deepseek/deepseek-chat"]
prompt = "用100字解释什么是机器学习"

for model in models:
    response = completion(model=model, messages=[{"content": prompt, "role": "user"}])
    print(f"\n--- {model} ---")
    print(response.choices[0].message.content)

第五步:配置成本和速率控制

LiteLLM内置了成本追踪和速率限制功能,这对生产环境尤其重要:

from litellm import completion
import litellm

# 设置全局预算上限(美元)
litellm.budget_manager.total_budget = 10.0

# 查看每次调用的成本
response = completion(
    model="gpt-5.5",
    messages=[{"content": "Hi", "role": "user"}]
)
print(f"本次调用成本: ${litellm.cost(response):.6f}")

进阶:搭建自己的API网关

如果团队多人共用,可以用LiteLLM的Proxy模式搭建一个中央API网关:

# 安装Proxy依赖
pip install 'litellm[proxy]'

# 启动代理服务器
litellm --model gpt-5.5 --model claude-sonnet-5-20260630

启动后,团队成员只需将API地址指向 `http://localhost:4000`,就能通过统一端点访问所有模型,你的API Key也只需在一个地方管理。

常见问题

Q: LiteLLM支持流式输出吗?

A: 完全支持。只需加 `stream=True` 参数即可。

Q: 免费模型能用吗?

A: 支持Ollama本地模型、HuggingFace推理端点,以及各提供商的免费tier。

Q: 性能损耗大吗?

A: LiteLLM是一个薄封装层,额外延迟通常不超过50ms,对绝大多数场景可以忽略。

**核心思路**:LiteLLM的价值不在于它做了什么新东西,而在于它**消除了重复劳动**——写一遍代码,换任何模型都只需要改一个字符串。

与同类方案对比

市面上实现多模型统一调用的方案主要有三种:LiteLLM属于轻量级SDK方案,适合直接集成到现有Python项目中;One API和FastGPT Proxy属于独立部署的网关方案,适合作为团队共用的API入口;LangChain和Semantic Kernel属于重量级框架方案,提供了完整的工作流编排能力,但学习成本也最高。

如果你只需要一个「翻译器」——把OpenAI格式的请求翻译成各厂商的原生格式,LiteLLM是三者中最简单也最轻量的选择。它的代码库不到5MB,依赖关系干净,非常适合嵌入到已有的微服务或函数计算环境中。

对于需要更高并发和可观测性的生产环境,推荐将LiteLLM的Proxy模式与Prometheus和Grafana搭配使用,形成完整的模型调用监控面板——每个模型的调用量、延迟分布、成本趋势一目了然。

🔥 关注LC智趣厅,每周为你带来实用的AI开发技巧

👇 关注不错过,每天三分钟,AI世界尽在掌握


— END —
LC 智趣厅 · 科技与生活的交点
ihygg.cn

滚动至顶部
微信公众号:LC智趣厅

扫码关注微信公众号
LC智趣厅